
FLUX 3 多图参考生成:最多 10 张参考图合成一个场景
FLUX 3 Image 现在最多接受 10 张参考图,配合一段提示词,就能渲染出人物、产品和风格保持一致的单个场景。每张上传的图片会获得一个 token——ref_image_0、ref_image_1 依次编号——提示词通过引用这些 token 来描述场景,布局交由模型决定。如果你想亲自控制构图,FLUX 3 Image 还支持边界框(bounding box)元素表,把每个元素固定在画布的指定位置。
这项能力已于 2026 年 10 月 1 日在 Black Forest Labs 的 API 和 Playground 上线,并同步登陆 OpenRouter——这是 BFL 于 2026 年 7 月 23 日发布的 FLUX 3 家族的第三个组成部分。还要澄清一个发布以来的流行说法:接受多张参考图并不是新能力。FLUX.2 早已支持同时引用最多 10 张图片。FLUX 3 Image 真正带来的是空间控制——边界框、原生 4K 输出,以及对智能体友好的结构:编辑只触碰你点名的框。
核心要点
- FLUX 3 Image 将 1–10 张参考图与一段提示词结合;API 要求每张参考图介于 256×256 像素和 16 MP 之间。
- 参考图按添加顺序获得
ref_image_Ntoken,在一段提示词中引用;不提供边界框时,模型自行决定位置和大小。 - 边界框使用 0–1000 网格,格式为
[top, left, bottom, right],以 JSON 元素表的形式附在提示词末尾。 - 多图参考输入本身随 FLUX.2 落地;FLUX 3 Image 的新增点是显式布局控制、4K 渲染,以及"框外像素保持不动"的按框编辑。
- 按分辨率计费,每张图 $0.041 到 $0.607 不等,API 与 Playground 同价。
FLUX 3 Image 在 FLUX 3 家族中的位置
FLUX 3 不只是一个图像模型。Black Forest Labs 于 2026 年 7 月 23 日发布它时,定位为同时学习图像、视频和音频的多模态基础模型,并分批推出:FLUX 3 Video 最先进入早期访问,FLUX 3 Action(面向机器人领域、70 亿参数开源权重动作模型)于 9 月 23 日发布,而负责生成和编辑图片的 FLUX 3 Image 则在 2026 年 10 月 1 日正式可用——当天它出现在 OpenRouter 上,与 BFL 自家的 Playground 和 API 同步。
在家族内部,FLUX 3 Image 承担两项工作:从文本生成新图像,以及把现有图片作为参考进行编辑或合成。两项工作共用同一个端点 POST https://api.bfl.ai/v1/flux-3-image,其中只有 prompt 字段是必填的。
多图参考合成的运作方式
images 参数接受 1 到 10 张参考图,可以是 URL 或 base64 字符串,每张介于 256×256 像素和 16 MP 之间。参考图按添加顺序获得 token,从 ref_image_0 开始。
提示词随后在一句话里完成两件事:描述场景并引用各个 token。官方文档给出的模式类似:
Portrait in Times Square with ref_image_0, ref_image_1, ref_image_2,
ref_image_3, ref_image_4 and ref_image_5.
A house for the chickens from ref_image_0: ref_image_1 walls...
(提示词引用 token 时使用英文原文即可,无需翻译 token 本身。)
不提供边界框时,FLUX 3 自行决定每张参考图的位置和大小。aspect_ratio 参数默认为 auto,保持第一张参考图的形状而不是默认正方形——当第一张图定义了你想要的画幅时,这一点很有用。

Black Forest Labs 官方文档中的 FLUX 3 Image 端点参数(2026 年 10 月 3 日访问)。
需要控制位置时:边界框
纯 token 引用胜在快捷,但构图由模型说了算。FLUX 3 Image 给出的答案是元素表:在提示词中用 <id> 为每个元素命名,再附上一个 JSON 数组说明各元素的位置。
每个边界框都是 0–1000 网格上的 [top, left, bottom, right],与输出分辨率无关——[0, 0, 500, 500] 就是左上四分之一区域。生成提示词由描述和元素表组成:
Minimalist graphic illustration featuring a black silhouette of a person
<silhouette_1> centered against a solid, vibrant chartreuse background
<background_1>.
[{"id": "background_1", "bbox": [0, 0, 1000, 1000], "desc": "A flat field
of neon yellow-green with a subtle paper texture."},
{"id": "silhouette_1", "bbox": [150, 150, 850, 850], "desc": "A black
silhouette of a person in mid-stride."}]
编辑行增加两个字段:from 指明参考图(如 ref_image_0),src_bbox 说明元素当前位置,tgt_bbox 说明目标位置。两个框保持一致,元素原地不动;改写 tgt_bbox 即移动;把 from 和 src_bbox 设为 null 则在框内生成新内容;把 tgt_bbox 设为 null 则移除元素,并用背后的内容补全。
有两个官方文档行为直接影响预期。其一,"boxes guide placement; they are not clipping masks"——边界框引导位置,不是裁剪蒙版,内容可以略微越出边框。其二,提示词上采样器(prompt upsampler)会把你的简短请求扩写成模型训练时所用的稠密描述,但你画的框会原样传给模型。BFL 还说明,被编辑框之外的像素通常保持完全一致——这正是多轮编辑能保持画面稳定的原因。

BFL 边界框文档中的元素表格式(2026 年 10 月 3 日访问)。
真正的新东西:FLUX 3 Image 对比 FLUX.2 与 FLUX.1 Kontext
"10 张参考图"是标题里的数字,所以值得把版本脉络说清楚:
| FLUX.1 Kontext(旧代) | FLUX.2 | FLUX 3 Image | |
|---|---|---|---|
| 参考图数量 | 一张 input_image |
同时最多 10 张 | images 传 1–10 张 |
| 单张参考限制 | — | — | 256×256 像素至 16 MP |
| 空间控制 | 识别输入图中的标注框 | JSON 控制、姿态引导 | 元素表,0–1000 网格上的 [top, left, bottom, right] 边界框 |
| 最大输出 | — | 约 4 MP | 4k 档(约 16 MP,原生 4K) |
| 编辑模型 | 整图指令式编辑 | 多参考编辑 | 按框编辑;未触碰像素通常不变 |
BFL 自己的文档已在引导 FLUX.1 Kontext 用户转向新模型,并把 FLUX.2 描述为引入多参考支持、输出最高 4MP 的那一步。也就是说,如果你在 2025 年底就想用多张参考图合成场景,FLUX.2 已经能做到这一步。FLUX 3 Image 的增量在于控制力和规模:为每个元素提供显式布局框、最高约 16 MP 的分辨率、默认开启的 grounding 选项(生成前可查询网页和图片搜索),以及一套为程序化构图智能体设计的结构——命名元素、框原样传递、按框编辑。
纯参考还是边界框:怎么选
两种模式解决不同的问题,官方文档也支持在同一次请求中混用:
- **纯多图参考(只引用 token)**适合构图灵活的一致性任务:把
ref_image_0里的人物放进新场景、穿上ref_image_1的服装,或融合多张风格参考。你描述场景,模型负责布局。 - 元素表适合位置本身就是需求的任务:标题必须落在上三分之一的海报、商品必须出现在特定区域的产品图、每个格子内容固定的分格版面。BFL 演示的典型生产场景包括环绕照片排版的文字、拼贴画、杂志版式,以及每个元素都有固定位置的复杂场景。
- 混合请求把参考图当作元素来源:在行的
from字段引用ref_image_0,再用tgt_bbox放置该元素。
费用与使用渠道
FLUX 3 Image 按张计费、按分辨率定价:768×768 为 $0.041,约 1 MP 为 $0.048,约 4 MP 为 $0.100,4k 档(约 16 MP)为 $0.607。一个 API 积分等于 $0.01,Playground 与 API 同价。每次请求的响应会包含本次计算出的费用,任务报告 Ready 后,结果有一小时下载窗口。
目前的入口是 BFL 的 Playground 和 API,以及聚合平台——OpenRouter 在发布当天(2026 年 10 月 1 日)就列出了 FLUX 3 并标注了 10 图参考能力。想自建部署的企业可以购买 FLUX 3 Image 的商业权重许可;BFL 公布的发布计划还包含开放 FLUX 3 多模态骨干的开放权重("FLUX 3 Dev")——截至 2026 年 10 月初,这是计划,不是已发布的下载。

bfl.ai 上的 FLUX 3 Image 官方模型页面(2026 年 10 月 3 日访问)。
值得了解的限制
- 每张参考图至少 256×256 像素、最多 16 MP;参考图数量上限 10 张。
- 边界框引导位置但不裁剪:元素不会在边框处被硬切。
- "被编辑框之外的像素通常保持一致"是 BFL 的文档表述,不是合同保证——关键编辑请自行检查。
- BFL 围绕 FLUX 3 家族的质量结论来自其早期访问期间自发布的初步评估。独立的实测结论还需要时间。
- 生成结果须在完成后一小时内下载。
结语
FLUX 3 Image 把多图参考合成从"发一堆图碰运气"变成了结构化请求:token 引用保一致性,元素表控位置,按框编辑不动画面其余部分。多图参考输入本身由 FLUX.2 带来;这里的新东西是布局控制、4K 输出,以及为程序化构图而设计的 API 形态。对跨场景保持角色一致、把产品放进新环境、或做固定构图的版面设计来说,文档化的工作流一目了然——费用从草稿分辨率每张约 4 美分到 4K 每张 60 美分不等。
分享
SketchTo 团队
专注 AI 工具、图像处理和创意工作流的技术写作者。


