
可提示背景移除与自动 Inpaint 蒙版:原理与三条上手路线
本周同一天有两款新产品发布,都指向同一件事:按指令移除背景,而不是信任一键按钮。Feyn 推出了 MultiMatte——一个可以用文字"瞄准"的背景移除模型:你说出要保留的物体,它裁掉其余一切。Hugging Face 发布了 Workflow1111,把 AUTOMATIC1111 的经典管线重建到一块画布上,其中包括一条从检测器自动生成 inpaint 蒙版的管线——你不再需要手绘蒙版。
可提示背景移除(promptable background removal)的意思是:用一段文字提示来指挥抠图——"保留这只狗"、"只留下这只运动鞋"——而不是接受自动分割模型认定的"主体"。这件事很重要,因为自动工具靠猜,提示词消除了猜测。本文讲清楚底层到底变了什么(binary mask 与 alpha matte 的区别),然后走一遍今天就能用的三条路线:浏览器里的 prompt 优先编辑器、几行 Python 代码跑起来的可提示抠图模型、以及面向 inpainting 的"检测器生成蒙版"管线。
从一键抠图到可提示抠图
大多数人熟悉的背景移除工具——Adobe Firefly 以及各类照片编辑器里的同类功能——都是一键模式:上传、点击、得到模型认定的显著主体的抠图。主体明确时这很方便;主体不明确时就没用。照片里沙发上有只狗,而你想要的是沙发?一键工具留给你的是狗。
可提示模型把方向反过来。它不再预测"主体是什么",而是把你的话和画面里的内容做匹配。这场变化背后的技术是 Meta 的 SAM 3(2025),Feyn 称之为概念可提示检测器(concept-promptable detector):给它一个短语,它会为每个匹配的物体返回蒙版。Feyn 团队报告,即使不做任何微调,概念名称本身就有帮助——在他们的 DIS-VD 基准上,说出真实物体名称让原生 SAM 3 的 S-measure 提高了 0.150,零训练成本就换来大幅提升。
"说清要保留什么"也是最值得迁移到日常工具里的技巧:一句"保持主体完全不变"和完全不写指令,做出来的是两种结果。
Binary mask 与 alpha matte:为什么头发总把抠图毁掉
MultiMatte 里还有一处更安静但值得理解的变化,它能解释为什么你的抠图历史上总显得"剪出来的"。
SAM 3 这类分割模型返回的是 binary mask(二值蒙版):每个像素被判定为物体内部(1)或外部(0)。对硬边缘很有效——汽车、马克杯。对模糊边界就失效了:头发、毛发、烟雾、失焦的屏幕、半透明的纱——这些东西没有"内"和"外",只有可见度的连续衰减。
**alpha matte(透明度蒙版)**把布尔值换成每个像素的连续不透明度。边缘上一缕头发可以拿到 40% 的不透明度,抠图合成到新背景上时,就和原场景看起来一样自然。代价是 matting 是更难的预测问题。
MultiMatte 是 Feyn 把 SAM 3 的提示跟随能力迁移到 alpha matting 上的成果。用 LoRA 微调,他们只更新了模型 8.6 亿参数中的 1949 万——占总权重的 2.27%——同时保留了文本对齐能力。报告的高精度分割基准 DIS-VD 成绩:SAM 3 为 0.667 S-measure,MultiMatte 为 0.901。团队报告在其列出的全部十二个基准拆分上都有提升,而且增益最大的恰好是二值蒙版最吃力的高分辨率、细结构图像。

Feyn 的 MultiMatte 演示:同一张图,用不同提示瞄准不同目标。来源:usefeyn.com。
Feyn 的 MultiMatte 演示:同一张图,用不同提示瞄准不同目标("the dog"、"the dog bowl"、"the jeans")。来源:usefeyn.com。
今天就能用的三条路线
| 路线 | 上手成本 | 控制力 | 适合 |
|---|---|---|---|
| Prompt 优先编辑器(浏览器) | 零——注册登录即可 | 可编辑提示词 + 精心设计的默认提示 | 快速抠图、产品图、一次性任务 |
| 可提示 matting 模型(代码) | pip install nobg + Python |
完整:概念提示、原始 matte 输出 | 批处理、应用集成、研究 |
| 检测器生成蒙版管线 | 复制一个 HF Space | 结构化:检测 → 蒙版 → inpaint | 移除或重绘完整物体 |
路线一:浏览器里的 prompt 优先编辑器
如果什么都不想装,尝试可提示抠图的最快方式是直接暴露提示词的工具。SketchTo 的在线抠图就是这样工作的:上传图片,工具用图像编辑模型(nano-banana,每次生成 2 积分)执行一条可编辑的提示词。它的默认提示词值得读一遍,因为模式全在里面:
仅移除这张图片的背景。保持主体完全不变,边缘清晰精确。保持主体的所有细节、颜色和质量。
三条指令各干各的活:范围("仅背景")、保护("保持主体不变")、边缘质量("清晰精确的边缘")。你可以改任何一条——想保留沙发,就把"主体"换成"沙发"。
文档写明的流程:登录,上传图片,如果默认提示词对不上你的目标就修改它,生成,然后预览并下载。生成消耗 2 积分,新账号自带 4 个免费积分,所以你可以在付费之前先体验 prompt 优先和一键模式的差别。如果任务超出抠图范围,同样的 prompt 优先模式覆盖了相邻需求——AI 移除画面元素擦除物体并重建其背后的内容,AI 背景更换把移除后的背景换成新场景。

路线二:代码里的可提示 matting 模型
需要 matting 级别的细节质量或批量吞吐时,可以直接跑 MultiMatte。Feyn 团队通过 nobg 库发布它,微调好的适配器已合并进发布权重:
from nobg import AutoModel, AutoProcessor
model = AutoModel.from_pretrained("feyninc/multimatte")
processor = AutoProcessor.from_pretrained("feyninc/multimatte")
# 通用默认提示——不指定概念。
cutout = model.predict(processor, "photo.jpg")
cutout.save("output.png")
# 说出要保留的概念。
cutout = model.predict(processor, "photo.jpg", "the dog")
predict 返回 RGBA 抠图;想要原始 matte 本身时传 return_type="tensor",比如要以完全的控制力合成到自定义背景上。概念参数是可选的,但按 Feyn 团队自己的数字,它在微调后的模型上仍然有效(DIS-VD 上 +0.036 S-measure)——即使模型已经可提示,点名目标依然有帮助。
当普通抠图工具总是吃掉发丝、玻璃、绒毛这些细节,或者你有很多图要按同一条"保留 X"规则处理时,选这条路。
路线三:面向 inpainting 的检测器生成蒙版管线
背景移除和 inpainting 共享同一个依赖:一张标明"在哪里动手"的蒙版。经典 Stable Diffusion Web UI AUTOMATIC1111 一直要求你手绘这张蒙版。
Workflow1111——Hugging Face 用 Gradio Workflow 重建的 A1111——改为自动生成。检测到 inpaint 蒙版管线先在图上跑一个 DETR 目标检测器;按博文里的例子,它在一张街景照片中找到六个物体(三个人、一只狗、一辆自行车、一辆汽车)。然后工作流分成两条分支:一条把检测框画在原图上,另一条把它们转换成蒙版,供下游的 inpainting 管线使用。值得注意的是,只有检测调用离开本机——画框和蒙版生成都用 Pillow 和 NumPy 在本地完成。
同一块画布也用另一扇门处理背景移除:BRIA RMBG-2.0 作为一个 Space 节点运行,而且每个输出节点同时是 REST 端点(共九个),也暴露为 MCP 工具——检测生成蒙版这类步骤可以从 Agent 或脚本调用,不必打开界面。

Hugging Face 上的 Workflow1111 画布:十一条 AUTOMATIC1111 风格管线重建为 73 个节点。来源:huggingface.co。
Hugging Face 上的 Workflow1111 画布:十一条 AUTOMATIC1111 风格管线重建为 73 个 Gradio Workflow 节点,包含检测生成 inpaint 蒙版和背景移除。来源:huggingface.co。
自动 inpaint 蒙版改变了什么
手绘蒙版有两个失败模式:慢,且不可复现——同一区域描两遍,得到两张不同的蒙版。检测器生成的蒙版两个都解决了:点一个物体类别,每次都得到像素级精确的框或蒙版,然后让 inpainting 重建框内内容(或者重建被移除物体背后该有的东西)。
诚实的局限:检测驱动的蒙版只认识独立的、可命名的物体。DETR 类检测器找得到狗和自行车,但隔离不出一缕特定的头发或一片影子。模糊或局部目标还是要回到 matting(路线二)或手动绘制。现在很多管线遵循的实际顺序是:整物体自动检测和生成蒙版,检测器叫不出名字的部分退回 matte 或手绘。
可以迁移的提示词模式
三条路线里,有效的提示词共享同一套结构。以下模式直接来自各工具文档写明的默认提示词,是可以放心套用的起点而不是口口相传的经验:
- 说清保留什么,而不是移除什么。"保留沙发"好过"别移除沙发"。正向目标才给模型可匹配的东西。
- 明确保护主体。"保持主体完全不变——细节、颜色、质量"能防住那些悄悄重绘"保留物"的模型。
- 对边缘行为提出要求。"边缘清晰精确"或"自然光线"为抠图最容易失败的边界区域设定预期。
- **移除并重建类任务,要求无缝。**SketchTo 的移除工具文档写明了这个模式:"移除应看起来自然,无缝重建背景"。
该选哪条路?
- 临时一张图,不想配环境 → prompt 优先编辑器(路线一)。读一遍默认提示词,改掉目标名词,生成。
- 细节总被毁掉 → MultiMatte 这类 matting 模型(路线二)。alpha matte 就是为头发和毛边问题而存在的。
- 要在已有图里移除或重绘完整物体 → 检测器生成蒙版管线(路线三)。自动蒙版、可复现结果、可脚本调用的端点。
一条对三条路线都成立的提醒:以上都是来源和线上工具页面记录在案的行为,不是我们跑过的评测——引用的数字归各自作者所有,具体输出因图而异。无论选哪条路,把抠图用到任何地方之前,先放大检查边缘。
可提示背景移除是整个品类的方向:更少信任模型的猜测,更多告诉它你想要什么。一键按钮没有错——它只是不再唯一。现在,你可以直接说出要保留什么。
分享
SketchTo 团队
专注 AI 工具、图像处理和创意工作流的技术写作者。
相关文章

用 DeepSeek V4.1-Flash 看图反推提示词:新手入门指南
DeepSeek V4.1-Flash 原生支持视觉理解。本文按官方文档讲透看图反推提示词的 API 流程:三种传图方式、可改用的模板、真实价格与限制,以及提示词写好之后的用法。

iPhone Duo 草图转 AI 图片:从 7.6 英寸大屏手绘到成品渲染
iPhone Duo 展开后的 7.6 英寸内屏是 iPhone 历史上最大的绘图面积。这篇实战指南讲清楚怎么把大屏手绘草图变成可用的 AI 成品图——苹果自带的图像魔杖能做什么,什么时候该用可调风格、可选模型的草图转渲染工具。

AI 商品摄影提示词实测:换背景,标签文字保得住吗?
我们在 SketchTo 的 AI 背景更换工具里,用一个带标签的茶叶罐实测了两条商品摄影 AI 提示词:完整提示词原文、真实输出对比,以及 60 秒成品检查清单——也如实说明单次测试的局限。