FLUX 3 多图参考生成:最多 10 张参考图合成一个场景

FLUX 3 多图参考生成:最多 10 张参考图合成一个场景

SketchTo 团队2026年10月3日7 分钟阅读

FLUX 3 Image 现在最多接受 10 张参考图,配合一段提示词,就能渲染出人物、产品和风格保持一致的单个场景。每张上传的图片会获得一个 token——ref_image_0、ref_image_1 依次编号——提示词通过引用这些 token 来描述场景,布局交由模型决定。如果你想亲自控制构图,FLUX 3 Image 还支持边界框(bounding box)元素表,把每个元素固定在画布的指定位置。

这项能力已于 2026 年 10 月 1 日在 Black Forest Labs 的 API 和 Playground 上线,并同步登陆 OpenRouter——这是 BFL 于 2026 年 7 月 23 日发布的 FLUX 3 家族的第三个组成部分。还要澄清一个发布以来的流行说法:接受多张参考图并不是新能力。FLUX.2 早已支持同时引用最多 10 张图片。FLUX 3 Image 真正带来的是空间控制——边界框、原生 4K 输出,以及对智能体友好的结构:编辑只触碰你点名的框。

核心要点

  • FLUX 3 Image 将 1–10 张参考图与一段提示词结合;API 要求每张参考图介于 256×256 像素和 16 MP 之间。
  • 参考图按添加顺序获得 ref_image_N token,在一段提示词中引用;不提供边界框时,模型自行决定位置和大小。
  • 边界框使用 0–1000 网格,格式为 [top, left, bottom, right],以 JSON 元素表的形式附在提示词末尾。
  • 多图参考输入本身随 FLUX.2 落地;FLUX 3 Image 的新增点是显式布局控制、4K 渲染,以及"框外像素保持不动"的按框编辑。
  • 按分辨率计费,每张图 $0.041 到 $0.607 不等,API 与 Playground 同价。

FLUX 3 Image 在 FLUX 3 家族中的位置

FLUX 3 不只是一个图像模型。Black Forest Labs 于 2026 年 7 月 23 日发布它时,定位为同时学习图像、视频和音频的多模态基础模型,并分批推出:FLUX 3 Video 最先进入早期访问,FLUX 3 Action(面向机器人领域、70 亿参数开源权重动作模型)于 9 月 23 日发布,而负责生成和编辑图片的 FLUX 3 Image 则在 2026 年 10 月 1 日正式可用——当天它出现在 OpenRouter 上,与 BFL 自家的 Playground 和 API 同步。

在家族内部,FLUX 3 Image 承担两项工作:从文本生成新图像,以及把现有图片作为参考进行编辑或合成。两项工作共用同一个端点 POST https://api.bfl.ai/v1/flux-3-image,其中只有 prompt 字段是必填的。

多图参考合成的运作方式

images 参数接受 1 到 10 张参考图,可以是 URL 或 base64 字符串,每张介于 256×256 像素和 16 MP 之间。参考图按添加顺序获得 token,从 ref_image_0 开始。

提示词随后在一句话里完成两件事:描述场景并引用各个 token。官方文档给出的模式类似:

Portrait in Times Square with ref_image_0, ref_image_1, ref_image_2,
ref_image_3, ref_image_4 and ref_image_5.
A house for the chickens from ref_image_0: ref_image_1 walls...

(提示词引用 token 时使用英文原文即可,无需翻译 token 本身。)

不提供边界框时,FLUX 3 自行决定每张参考图的位置和大小。aspect_ratio 参数默认为 auto,保持第一张参考图的形状而不是默认正方形——当第一张图定义了你想要的画幅时,这一点很有用。

FLUX 3 Image 官方文档的 API 参数表,其中 images 参数支持 1 到 10 张参考图。

Black Forest Labs 官方文档中的 FLUX 3 Image 端点参数(2026 年 10 月 3 日访问)。

需要控制位置时:边界框

纯 token 引用胜在快捷,但构图由模型说了算。FLUX 3 Image 给出的答案是元素表:在提示词中用 <id> 为每个元素命名,再附上一个 JSON 数组说明各元素的位置。

每个边界框都是 0–1000 网格上的 [top, left, bottom, right],与输出分辨率无关——[0, 0, 500, 500] 就是左上四分之一区域。生成提示词由描述和元素表组成:

Minimalist graphic illustration featuring a black silhouette of a person
<silhouette_1> centered against a solid, vibrant chartreuse background
<background_1>.

[{"id": "background_1", "bbox": [0, 0, 1000, 1000], "desc": "A flat field
of neon yellow-green with a subtle paper texture."},
 {"id": "silhouette_1", "bbox": [150, 150, 850, 850], "desc": "A black
silhouette of a person in mid-stride."}]

编辑行增加两个字段:from 指明参考图(如 ref_image_0),src_bbox 说明元素当前位置,tgt_bbox 说明目标位置。两个框保持一致,元素原地不动;改写 tgt_bbox 即移动;把 from 和 src_bbox 设为 null 则在框内生成新内容;把 tgt_bbox 设为 null 则移除元素,并用背后的内容补全。

有两个官方文档行为直接影响预期。其一,"boxes guide placement; they are not clipping masks"——边界框引导位置,不是裁剪蒙版,内容可以略微越出边框。其二,提示词上采样器(prompt upsampler)会把你的简短请求扩写成模型训练时所用的稠密描述,但你画的框会原样传给模型。BFL 还说明,被编辑框之外的像素通常保持完全一致——这正是多轮编辑能保持画面稳定的原因。

FLUX 3 Image 官方边界框文档,展示 0–1000 网格上的元素表格式。

BFL 边界框文档中的元素表格式(2026 年 10 月 3 日访问)。

真正的新东西:FLUX 3 Image 对比 FLUX.2 与 FLUX.1 Kontext

"10 张参考图"是标题里的数字,所以值得把版本脉络说清楚:

FLUX.1 Kontext(旧代) FLUX.2 FLUX 3 Image
参考图数量 一张 input_image 同时最多 10 张 images 传 1–10 张
单张参考限制 — — 256×256 像素至 16 MP
空间控制 识别输入图中的标注框 JSON 控制、姿态引导 元素表,0–1000 网格上的 [top, left, bottom, right] 边界框
最大输出 — 约 4 MP 4k 档(约 16 MP,原生 4K)
编辑模型 整图指令式编辑 多参考编辑 按框编辑;未触碰像素通常不变

BFL 自己的文档已在引导 FLUX.1 Kontext 用户转向新模型,并把 FLUX.2 描述为引入多参考支持、输出最高 4MP 的那一步。也就是说,如果你在 2025 年底就想用多张参考图合成场景,FLUX.2 已经能做到这一步。FLUX 3 Image 的增量在于控制力和规模:为每个元素提供显式布局框、最高约 16 MP 的分辨率、默认开启的 grounding 选项(生成前可查询网页和图片搜索),以及一套为程序化构图智能体设计的结构——命名元素、框原样传递、按框编辑。

纯参考还是边界框:怎么选

两种模式解决不同的问题,官方文档也支持在同一次请求中混用:

  • **纯多图参考(只引用 token)**适合构图灵活的一致性任务:把 ref_image_0 里的人物放进新场景、穿上 ref_image_1 的服装,或融合多张风格参考。你描述场景,模型负责布局。
  • 元素表适合位置本身就是需求的任务:标题必须落在上三分之一的海报、商品必须出现在特定区域的产品图、每个格子内容固定的分格版面。BFL 演示的典型生产场景包括环绕照片排版的文字、拼贴画、杂志版式,以及每个元素都有固定位置的复杂场景。
  • 混合请求把参考图当作元素来源:在行的 from 字段引用 ref_image_0,再用 tgt_bbox 放置该元素。

费用与使用渠道

FLUX 3 Image 按张计费、按分辨率定价:768×768 为 $0.041,约 1 MP 为 $0.048,约 4 MP 为 $0.100,4k 档(约 16 MP)为 $0.607。一个 API 积分等于 $0.01,Playground 与 API 同价。每次请求的响应会包含本次计算出的费用,任务报告 Ready 后,结果有一小时下载窗口。

目前的入口是 BFL 的 Playground 和 API,以及聚合平台——OpenRouter 在发布当天(2026 年 10 月 1 日)就列出了 FLUX 3 并标注了 10 图参考能力。想自建部署的企业可以购买 FLUX 3 Image 的商业权重许可;BFL 公布的发布计划还包含开放 FLUX 3 多模态骨干的开放权重("FLUX 3 Dev")——截至 2026 年 10 月初,这是计划,不是已发布的下载。

Black Forest Labs 官方 FLUX 3 Image 模型页面,展示多图参考特性说明。

bfl.ai 上的 FLUX 3 Image 官方模型页面(2026 年 10 月 3 日访问)。

值得了解的限制

  • 每张参考图至少 256×256 像素、最多 16 MP;参考图数量上限 10 张。
  • 边界框引导位置但不裁剪:元素不会在边框处被硬切。
  • "被编辑框之外的像素通常保持一致"是 BFL 的文档表述,不是合同保证——关键编辑请自行检查。
  • BFL 围绕 FLUX 3 家族的质量结论来自其早期访问期间自发布的初步评估。独立的实测结论还需要时间。
  • 生成结果须在完成后一小时内下载。

结语

FLUX 3 Image 把多图参考合成从"发一堆图碰运气"变成了结构化请求:token 引用保一致性,元素表控位置,按框编辑不动画面其余部分。多图参考输入本身由 FLUX.2 带来;这里的新东西是布局控制、4K 输出,以及为程序化构图而设计的 API 形态。对跨场景保持角色一致、把产品放进新环境、或做固定构图的版面设计来说,文档化的工作流一目了然——费用从草稿分辨率每张约 4 美分到 4K 每张 60 美分不等。

用 AI 转换你的图片

将草图变成精美图片、移除背景、换脸等等——全部由 AI 驱动。

免费试用 Sketch To

分享

S团

SketchTo 团队

专注 AI 工具、图像处理和创意工作流的技术写作者。

相关文章