Grok 4.6 不是图像生成模型:61 分对 AI 作图的人意味着什么

Grok 4.6 不是图像生成模型:61 分对 AI 作图的人意味着什么

SketchTo 团队2026年8月13日6 分钟阅读

Grok 4.6 不是一个新的图像生成模型。它是一个前沿推理模型,能"看"图片并返回文字,而官方公告里说的"视觉与交互工作",指的是规划和搭建视觉项目,而不是生成更精细的像素。如果你用 AI 做图,这次发布改变的是你工作里的"思考层",而不是"出图层"。这篇文章把已发布的事实、61 分到底测了什么、以及你在下一次生成前真正该核对的点拆开讲清楚。

核心要点

  • Grok 4.6 是推理模型:文本和图像输入、文本输出,支持函数调用与结构化输出。图像生成是 Grok 的另一个产品线,不是 Grok 4.6 发布时的能力。
  • "视觉与交互工作"指的是应用与界面搭建:官方称它在这类项目上的首版表现比 Grok 4.5 更强。这是厂商自己的观察,不是独立验证的保证。
  • 61 分是智能体知识工作的分数:它是一套综合指数,不是画质评测,说明的是模型如何推理、如何在长任务里持续工作。
  • 真正改变的是你的核对习惯:确认你付费的图像工具到底由哪个模型驱动、确认它的实时成本披露,只有成本账算得过来,才把 Grok 4.6 用在规划或流程推理上。

一句话讲清 Grok 4.6 是什么

SpaceXAI(原 xAI)于 2026 年 8 月 12 日发布 Grok 4.6,与 Cursor 联合官宣,可通过 xAI API、Grok Build、Cursor、OpenRouter、Vercel 和 Cloudflare 使用。模型接受文本和 JPEG/PNG 图像输入并返回文本,支持函数调用和结构化输出,保持 50 万 token 的上下文窗口。API 定价从每百万输入 token 2 美元、每百万输出 token 6 美元起,缓存输入为每百万 0.50 美元;当提示达到 20 万输入 token 时费率翻倍,还有一个速度更快的变体,价格是标准版的两倍。

对做图的人来说,这份资料的关键在于它划清了 Grok 4.6 能做什么、不能做什么:它能读取并推理你上传的图片,但发布时不能通过这个模型的 API 生成图片。

公告里的"视觉与交互工作"到底指什么

官方措辞很明确:Grok 4.6"在 Grok 4.5 的基础上,特别聚焦于长时运行的智能体,以及更有野心的交互式与视觉工作"。具体到 SpaceXAI 的描述,是把一个产品想法变成应用的结构与视觉语言、实现核心交互、再经过多轮反馈不断打磨,且首版表现比 Grok 4.5 更强。

双栏示意:图像理解输入图片输出文字,图像生成输入文字输出图片

把它理解成"设计与搭建":生成界面布局、确立视觉方向、迭代交互。它不是"Grok 现在能生成图片了"。官方模型文档明确写道:图像、音频、视频能力由专门的模型与 API 提供,而 Grok 4.6 负责"除此之外的一切"。如果你用的是 Grok 的消费级图像工具,那是一个独立的图像生成产品,不是 Grok 4.6 这个推理模型。

在据此规划工作流之前还有一个提醒:"首版更强"是发布材料里的厂商观察,还没有作为"图像设计能力"被独立评测过,而且消费级 Grok 应用也不是这次发布的落地界面。

61 分测了什么、没测什么

61 分来自 Artificial Analysis 智能指数(AAII),它是由九项围绕推理、智能体知识工作与工具使用构成的综合指数。Artificial Analysis 在高推理强度下测得 Grok 4.6 为 61 分,比 Grok 4.5 高 5 分,与最大努力档的 GPT-5.6 Sol 持平,落后于 Claude Opus 5(63)和 Claude Fable 5(62)。

概念示意:AAII 指数衡量推理与知识工作,而非画质

真正值得看的是智能体任务上的表现:Grok 4.6 在 GDPval-AA v2 上拿到 1753 的 Elo,τ³-Banking 得分 50.7%,Terminal-Bench v2.1 得分 88.4%。在长周期 AA-Briefcase 任务里,它平均用约 53 轮、5 亿输入 token 完成,而 Claude Opus 5 平均约 103 轮、20 亿输入 token。Artificial Analysis 测得每项智能指数任务约 0.84 美元,高于 Grok 4.5 的 0.36 美元——也就是说,这轮智力提升有一部分是用"更啰嗦的输出"换来的。

Artificial Analysis 关于 Grok 4.6 基准与分析的报道标题

来源:Artificial Analysis——Grok 4.6 基准与分析(2026 年 8 月 13 日访问)

而这个分数不是:它不是画质分数,不是审美排名,也不证明某个模型"出图更好"。官方对比表本身就喜忧参半——Grok 4.6 在部分指标领先,对手在另一些指标领先,而且厂商注明第三方数据采用各家自报或公开的最好成绩。对做图的人来说,61 分最有用的地方是帮你理解"推理与规划层",而不是把它当成换图像工具的理由。

对 AI 作图的人,真正改变的是什么

1. 不要因为一个推理模型发布就换图像工具

前沿推理模型 ≠ 新的图像生成器。如果你用的工具没有更换底层模型,这次发布对你出图的结果没有任何改变。在假设之前,先查工具自己的文档和模型标注。

2. 如果你用 Grok 的图像工具,先确认自己在哪个产品上

Grok 的图像生成和 Grok 4.6 是两回事。围绕"Grok 4.6 image generation"的搜索结果确实混乱,区别也真实存在:4.6 读取图片并推理,Imagine 那类图像工具负责生成。先确认你真正在付费使用哪个界面。

3. 把 Grok 4.6 用在图片的"上游思考"

更强的推理模型能帮上做图的,是上游环节:起草提示词与 brief、规划一批任务、整理素材、研究风格、梳理修图流程。这些是文本与推理任务,正是 AAII 测的东西。把它当作流程辅助,而不是画质承诺。

4. 如果你搭流程,按"单任务成本"算账,别只看单价

2/6 美元的头条单价看着便宜,但长上下文请求在 20 万输入 token 时价格翻倍,而 Artificial Analysis 实测其指数任务约 0.84 美元一项——是 Grok 4.5 的 0.36 美元两倍多。对于要在图片、提示词和历史记录之间来回发送的自动化图像流程,真正该看的是每次跑完的总成本。

5. 核对你所付费图像工具的真实模型与实时成本

这是这次发布让人更该养成的习惯:搞清楚工具背后到底是哪个模型、当前一次生成要多少钱、结果存在哪里。SketchTo 的工具页会在生成前展示真实模型与实时积分成本,产出结果也能在私有 History 里找回——这就是这种做法的具体例子。SketchTo 目前并未接入 Grok 4.6,所以请把这次发布当作背景信息,而不是 SketchTo 的新功能。

6. 盯住官方文档和模型卡

发布之后,可用性、定价和推理选项可能很快变化。在把工作流或预算押给 Grok 4.6 之前,先查官方 SpaceXAI 文档公告

结论

对用 AI 做图的人来说,Grok 4.6 改变的是推理与规划层,不是出图层。它能分析图片、帮你搭建视觉项目、以有竞争力的价格跨长任务推理——但它不是图像生成模型,它的 61 分衡量的是智能体知识工作,不是画质。把核对的习惯保持住:确认工具背后的模型、生成前确认实时成本,把基准分数当背景,而不是当成换工具的命令。

用 AI 转换你的图片

将草图变成精美图片、移除背景、换脸等等——全部由 AI 驱动。

免费试用 Sketch To

分享

S团

SketchTo 团队

专注 AI 工具、图像处理和创意工作流的技术写作者。

相关文章