用 DeepSeek V4.1-Flash 看图反推提示词:新手入门指南

用 DeepSeek V4.1-Flash 看图反推提示词:新手入门指南

SketchTo 团队2026年9月12日7 分钟阅读

你手里有一张照片、一张截图,或者一张旧草图,想让它变成更好的 AI 图。然后你打开了提示词输入框,卡住了:到底要写什么,才能把"这张图"要回来?

现在有一条绕过空白输入框的直接路径。2026 年 9 月 10 日,DeepSeek 发布了 V4.1-Flash——新模型架构系列里尺寸最小的模型,也是 deepseek-flash 这一代里首个具备原生视觉能力的模型。你可以把图片发给它,让它替你写提示词。随着 API 价格降到每百万输入 tokens 约 1–2 元,这套"看图反推提示词"的流程跑一次的成本不到一分钱。

本指南讲清楚四件事:这个模型到底提供了什么、如何通过 API 传入图片、一个可以直接改用的反推提示词模板、实际花多少钱——以及写好的提示词接下来该去哪,比如 SketchTo 的 Sketch to Render 工具,它用草图加提示词渲染出成图。

DeepSeek V4.1-Flash 到底是什么

官方更新日志(2026-09-10)的说法,DeepSeek-V4.1-Flash 是基于 DeepSeek 新架构系列构建的最小尺寸模型。官方对新架构的描述是:能力上限更高、推理速度更快、吞吐更大,并且可以扩展到更大的参数模型。

对"看图写提示词"这件事真正要紧的几点:

  • 原生视觉。 V4.1-Flash 开箱即懂图片。价格页把图像理解列为 deepseek-flash 的支持能力——同时明确标注更大的 deepseek-v4-pro 不支持。
  • 1M tokens 上下文,最大输出 384K。 长对话、多张参考图都装得下。
  • 便宜,还有闲时半价。 输入价格按时段为每百万 tokens 1–2 元(下文有明细)。首日就上线该模型的 SiliconFlow 给出了可对照的美元价格:闲时输入 $0.15/M、输出 $0.60/M。
  • 开放权重。 SiliconFlow 说明该模型采用 MIT 许可,Hugging Face 上也已存在 deepseek-ai/DeepSeek-V4.1-Flash 仓库。SiliconFlow 还提到它是 552B 参数的 MoE,prefill 阶段激活参数约 8B。

动手之前先记住一个命名细节:API 的模型名是 deepseek-flash。旧名称 deepseek-v4-flashdeepseek-v4-flash-vision-exp 目前仍可调用,但对应模型已下线——DeepSeek 会把这些请求路由到 V4.1-Flash。新代码请直接使用 deepseek-flash

为什么视觉模型能替你写提示词

"反推提示词"听起来像玄学,其实是一个带格式要求的看图描述任务。视觉语言模型看一张图,能说出它看到了什么:主体、姿态、构图、色彩倾向、光线方向、艺术风格,甚至图里的文字。而提示词,正是同样的信息——只是换成图像模型习惯的压缩写法。

有两个相近但产出不同的任务值得分开:

  1. 反推提示词(图片 → 生成提示词)。 给模型一张图,要一段能从零生成相似画面的提示词。这是经典的 "image to prompt" 用法。
  2. 改图指令提示词(图片 + 意图 → 编辑指令)。 你手里有图,也知道自己想改什么——换背景、换风格、保留人脸——需要把这句话说成图像编辑模型听得懂的样子。DeepSeek 官方文档写明模型可以"描述图片、识别截图中的文字",这正好是改图任务需要的那层感知能力。

第二个任务被低估了。现在的图像工具大多接受"原图 + 指令",而翻车的原因几乎都是指令太模糊。一个真正看过你这张图的 VLM,能把指令锚定在画面里真实存在的东西上。

文档流程:把图片传给 deepseek-flash

以下内容以官方文档为依据——流程照着 DeepSeek 图像理解指南 走,并非本人实测跑分。API 兼容 OpenAI 格式:content 从字符串换成数组,文本块和图片块混排。

示意图:向 deepseek-flash API 传图的三条路径——base64 内联、公网 URL、Files API 文件引用,最终都到达同一个对话补全端点

传图有三种方式:

方式 做法 限制
Base64 内联 data: URL 直接嵌进请求 计入 48 MiB 请求体上限
公网 URL 传一个 https:// 链接 单图最大 32 MiB,60 秒内完成下载
Files API 上传一次,之后用 file_id 引用 最大 64 MiB;适合复用同一张图

本地文件最常用的是 base64 方式:

import base64
from openai import OpenAI

client = OpenAI(
    api_key="<DeepSeek API Key>",
    base_url="https://api.deepseek.com",
)

with open("reference.jpg", "rb") as f:
    b64 = base64.b64encode(f.read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "把这张图描述成一条图像生成提示词。"},
                {"type": "image_url",
                 "image_url": {"url": f"data:image/jpeg;base64,{b64}"}},
            ],
        }
    ],
)
print(response.choices[0].message.content)

跑之前,三个文档里的细节值得知道:

  • 图片只能放在 user 消息里。 放进 systemassistant 消息会直接返回 400 错误。
  • detail 字段控制预处理。 detail: "low" 会把图缩放到 512×512——不需要精细细节时更快更省。highoriginalauto 都保留原图。
  • 图片 tokens 有上限。 每张图会被缩放到约 1300×1300,最多计 1,024 tokens——800×600 和 5000×5000 花的图上成本一样。做一次完整的看图分析,按下面的价格远不到一毛钱。

支持的格式是 JPEG、PNG、GIF、WebP,按文件实际内容判断。批量场景下,Files API 可以避免重复上传同一张参考图;单个请求最多可以带 600 张图。

一个可以改用的反推提示词模板

下面的模板是起点,不是经过验证的基准——本指南没有做画质评测,把输出当成待迭代的草稿,而不是成品提示词。结构跟着图像模型解析提示词的顺序走:先主体,再构图,再风格,最后技术参数。

你是 AI 图像生成的提示词工程师。
看这张图,写出一条能生成相似画面的提示词。

按这个顺序覆盖:
1. 主体:主要对象、姿态、表情——用具体名词,先不加形容词
2. 构图:景别(特写 / 中景 / 远景)、机位角度、主体位置
3. 环境:背景、场景、时段
4. 光线与色彩:光的方向、对比度、主色调
5. 风格:媒介与艺术风格(如水彩、产品摄影、动漫赛璐璐)
6. 技术参数:推测的宽高比、细节程度、需要保留的画面文字

规则:
- 一段话,120 字以内,逗号分隔短语。
- 不猜测看不见的东西;看不清的位置标 [待确认]。
- 结尾加一行"改动建议",列出用户最可能想改的两处。

结尾那行"改动建议"正是衔接改图工作流的关键:这两条会变成你在图像编辑工具里配合原图使用的指令。可以调整的变量:目标工具偏爱长提示词就放宽字数;已经确定想要媒介风格就替换风格清单。

如果你的目标是一条直接的改图指令,把任务句换成:"写一条只改 [目标] 的编辑指令,保持主体的身份、姿态和构图不变。" 模糊的改图指令是毁图的第一大原因——看过这张图的模型,能说清哪些东西必须保持原样。

从提示词到渲染:把产出用起来

提示词是中间产物,它需要图像工具才能变成图。对草图类工作,顺畅的闭环是:

  1. 把粗略的想法画成草图,或截一张图。
  2. 用上面的模板把图发给 deepseek-flash,拿回一段结构化描述加改动建议。
  3. 把提示词和原图一起交给图像工具。

这一步正好可以用 SketchTo 的 Sketch to Render 工具:上传你的草图,工具会把草图和你的提示词配在一起,再选一个风格预设——可选风格包括游戏概念、室内设计、照片写实、建筑外观等——模型选择器里有 Nano Banana、FLUX 2、GPT Image 2、Seedream 等模型,每个模型的积分消耗在生成前就标明。

SketchTo 的 Sketch to Render 工具页:草图上传区、风格预设,以及标明各模型积分消耗的模型选择器

VLM 写的提示词负责“描述”,渲染工具负责“成图”。如果你常遇到提示词跑偏、布局不受控的问题,站内的 草图控图教程 讲了草图如何约束构图--这是纯文字提示词做不到的。

实际花多少钱

价格来自 DeepSeek 价格页(高峰时段为北京时间周一至周五 9:00–12:00、14:00–18:00;其余时段为闲时,价格减半):

DeepSeek 官方价格页:deepseek-flash 的 token 价格与图像理解能力行

来源:DeepSeek API 官方文档价格页(2026 年 9 月 12 日访问)

Token 类型 闲时 高峰
输入(缓存命中) ¥0.02 / 百万 ¥0.04 / 百万
输入(缓存未命中) ¥1.00 / 百万 ¥2.00 / 百万
输出 ¥4.00 / 百万 ¥8.00 / 百万

一次典型的看图反推——一张图(≤1,024 图像 tokens)加约 200 tokens 的指令,生成约 300 tokens 的提示词——双向各只有几百 tokens。就算按高峰价,花的也是千分之一分级别的钱;这也是它和更早的视觉 API 之间的实际差别——以前随手反推一张图根本不划算。思考模式默认开启;对这种边界清晰的描述任务,按文档先用非思考模式更省。参考价:SiliconFlow 托管版闲时为输入 $0.15/M、输出 $0.60/M。

文档还写明:deepseek-flash 支持 2,500 并发(deepseek-v4-pro 是 500),批量处理一个文件夹的参考图可行——不过一张一张来,才有让提示词越写越好的迭代空间。

这篇指南的证据边界

把预期说诚实:上面的流程依据 DeepSeek 官方文档写成,不是实测评测。DeepSeek 公布的基准分数(GPQA Diamond 90.9、Terminal-Bench 2.1 90.6、视觉类如 BabyVision 89.6)是厂商自报;552B MoE 和 KV 缓存的数据来自 SiliconFlow 的发布说明。这些数字都不能告诉你模板对你的图好不好用——这一步,你花一杯咖啡不到的钱、用一个下午就能自己验证。

结论

看图反推提示词,过去靠对着图片眯眼猜风格词。现在有了便宜的原生视觉模型,闭环变成了:把图发给 deepseek-flash,拿回一段带改动建议的结构化描述,再把这段提示词连同原图一起交给任意一个图像工具收尾。对草图和粗略概念,把这条提示词配上传工具 Sketch to Render 一起用,"我有个想法"到"我拿到了这张图"之间就只剩几分钟。

本文的价格、限制和模型行为依据截至 2026 年 9 月 12 日的 DeepSeek 官方文档;API 细节可能变化,动手前请核对官方文档。

用 AI 转换你的图片

将草图变成精美图片、移除背景、换脸等等——全部由 AI 驱动。

免费试用 Sketch To

分享

S团

SketchTo 团队

专注 AI 工具、图像处理和创意工作流的技术写作者。

相关文章