AI 生成界面的两条路:界面世界模型与草图转代码

AI 生成界面的两条路:界面世界模型与草图转代码

SketchTo 团队2026年9月2日8 分钟阅读

本周有两桩发布,把 AI 界面的走向指向了相反的方向。8 月 31 日,Runway 推出 Solaris:一个逐帧生成整个界面的模型——图像本身就是交互层,底下没有代码。一天后,World Labs 发布 Atlas,再次印证世界模型正在加速。与此同时,另一条成熟的路线仍在持续进化:AI 界面生成中的"草图/截图转代码",把草图、截图或一句话变成可编辑、可版本化、可上线的代码。

设计师和开发者该走哪条路?诚实的答案是:这两条路通向不同的终点。世界模型路线产出"体验"——可以探索、可以演示的活的视觉界面;代码路线产出"系统"——能在生产环境运行、经得起维护、能与你已有系统集成的软件。本文用同一组标准比较两条路线,最后给出一个按项目(而不是按热点周期)做选择的决策框架。

Solaris 到底是什么

Solaris 是 Runway 全新 Interface World Models(界面世界模型)系列的第一个模型,它的定位比跑分数字更值得关注。它不用组件和代码"搭"界面,而是"渲染"界面——你点击、拖拽、输入时,每一帧都在实时合成,界面因此能对你的操作持续响应。视觉与行为之间没有中间表示:模型直接逐像素生成界面

底层上,Runway 把 Gen-4.5 视频模型改造出两种新能力:理解交互(点击和拖拽成为下一帧的条件信号)、实时运行(自回归出帧加上蒸馏后的少步去噪)。前面还有一个 LLM 决定界面该如何演化,世界模型负责把这个决定以交互级速度渲染出来,视觉质量保持在 720p。

示意图:传统“设计转代码”流水线与世界模型直接渲染界面帧的对比

Runway 自己公布的测试结果,让"生成界面"与"编码界面"的对比非常直观。在其截图重建测试中,最先进的多模态 LLM(包括 Claude Fable 5)随着界面视觉复杂度上升,重建保真度持续下降——测试覆盖 30 个界面,用 SSIM 和 DINOv3 特征度量。在随后一项 250 人、近 7,500 组两两对比的用户研究中(对照对象是用 Claude Opus 5 编码实现的界面),61% 对 24% 的参与者认为 Solaris 更好地执行了指定交互,71% 对 21% 认为它在场景中表现得更自然。这些是 Runway 官方公告里的数字,并非独立复现——但方向已经清晰到可以据此规划。

图像即交互层:真实的优势,真实的边界

生成式界面给你的,恰恰是编码界面最难伪装的东西。场景是活的:反光随光线变化,物体对操作有反应,同一次拖拽可以产生不同但都合理的结局。交互是开放式的,不局限于开发者预先想到的范围——Runway 的演示里有在虚拟商店拿起衣服试穿,也有把食材拖进碗里"搭"一份沙拉。而且因为界面是持续生成的,它还能充当计算机操作智能体的动态训练环境,Runway 也明确把这列为第二个用途。

边界同样来自结构本身,Runway 自己也列了出来:

  • 文字。 稳定、可读的文字仍然是视频生成最难的问题之一——而界面恰恰比几乎任何视觉领域都更依赖文字。
  • 可信度。 对教学或商业体验来说,一个看起来很对的错误答案比没有答案更糟。目前 Solaris 主要靠起始帧来"锚定"场景。
  • 长会话。 长时间、开放式交互中的连贯性仍是开放研究问题。
  • 无障碍与集成。 生成的界面还得能对接读屏器、无障碍 API 和软件栈的其他部分——合成的像素帧目前不存在这些接口。

还有第五条边界,Runway 没有列,因为它不是缺陷而是前提:生成的图像层不是软件资产。你没法在编辑器里打开它,没法在 pull request 里 diff 它,没法复用它的组件,也没法交给另一个团队去扩展。会话结束,留下的是印象,不是代码库拥有的资产。

代码路线:"可运行"能买到什么

第二条路线是多数在职设计师和开发者已经接触过的:描述或画出一个界面,AI 界面生成工具返回可编辑的代码——React 组件、Tailwind 类名、设计令牌。Flowstep 于 2026 年 5 月 6 日以 Product Hunt 当日第 3 名上线,定位是"把想法变成可编辑 UI 的 AI 设计工程师",是这波 AI design engineer 浪潮里最显眼的例子之一;v0 一类的生成器则是更普遍的形态。交付物是代码,这一点改变了一切。

反直觉的地方在于:Runway 批评的那种"有损翻译",恰恰是代码路线可上线的原因。当界面被表达为代码,它的行为就是显式且确定的。文字是真实文字,读屏器可以解析。状态、数据绑定、API 集成都是声明出来的,不是逐帧"脑补"的。界面可以被版本化、评审、测试、复用。Runway 的重建基准恰好展示了这笔交换:视觉设计经由语言转译,复杂度越高损失越多——但它保住了生产软件离不开的那件事,一份在会话结束后依然存在的行为规格。

一个有用的说法:代码对视觉是有损通道,对行为是保真通道。世界模型正好反过来——对视觉瞬间保真,对行为是推测。两者都没有错,只是对"能用"的定义做了不同的优化。

世界模型的势能与务实的中间路线

Atlas 在同一周发布,说明这个领域跑得有多快。World Labs 把 Atlas 描述为一个全模态(omni)世界模型,从零开始预训练,原生处理文本、图像、视频和 3D,具备相机可控生成、空间重建等能力,未来将驱动 Marble 的新版本。你不需要记住这些 3D 细节;信号只有一个:世界模型刚刚从研究玩具变成了独立实验室背靠背的重磅发布。按年而不是按十年的尺度,这类方式生成的界面会变得更便宜、更持久、更连贯。

在两个极端之间,业界其实已经在交付一条中间路线。正如 Gus Iwanaga 在 The End of the Static Screen 中论证的:意图驱动的软件通过声明式 UI、受控的组件契约和清晰的信息架构来适应用户——在被治理的结构内做生成式变化。值得记住这个版本,因为它是今天唯一能扛住生产环境考验的"动态界面":结构是编码的、可审计的,AI 负责填充变化的部分。

两条路线怎么选:一个决策框架

把两条路线放进同一组标准,选择基本会自动浮现:

标准 世界模型界面(Solaris) 代码路线(草图/截图 → 代码)
产出物 一段活的视觉会话 可编辑、可部署的代码
交互手感 开放式、贴近场景直觉 确定、预先定义
文字保真 公认短板(Runway 自述) 精确
生产集成 尚无(无障碍、API 均为开放问题) 正是它的核心价值
可维护性 留下印象,不留资产 版本、评审、复用

接下来,把路线对准工作类型:

流程图:体验类工作走世界模型界面路线,系统类工作走生成代码路线

  • 探索一个概念(氛围、空间感、还说不清的产品体验):走世界模型路线。Solaris 式的一场会话传达体验的能力,线框图比不了。
  • 向利益相关者演示一种体验:走世界模型路线,把它当作活的原型。评判标准是可视化效果,不是软件质量。
  • 做一个产品:走代码路线。你从原型里学到的一切,最终都要落成可以上线的组件和行为。
  • 长期维护软件:只有代码路线。生成的图像在这里根本不存在。

经验法则:如果交付物是一种"感觉",就生成界面;如果交付物是一套"系统",就生成代码。多数真实项目两者按顺序都需要——于是问题变成:草图与任何一条路线之间,站着的是什么。

可视化这一环:两条路线共同的起点

注意两条路线消费的东西是一样的:一个视觉想法。Solaris 需要起始帧;代码生成器需要草图、截图或规格。把粗糙的草图变成忠实、拿得出手的图像,在流水线里是一份独立的工作——这恰好是我们最熟悉的环节,所以先做利益披露:SketchTo 做的就是这个。

我们的草图转渲染工具接受草图上传,按可选风格返回照片级渲染——照片写实、室内设计、游戏概念、技术图、3D 等等——并可在多个模型间选择,积分成本明码标价(例如 Nano Banana 2 积分、Seedream 4.5 4 积分)。这里要把边界说清楚:草图转渲染的产出是图像,不是可运行代码。它不会替你把产品做出来。它压缩的是从"餐巾纸草图"到"可用于提案、迭代或向下游传递"的图像之间的距离——下游可以是设计评审、客户,也可以是代码生成器的输入框。想看真实工具上渲染这一环怎么跑,我们的推理优先的 AI 图像工作流有完整走查。

SketchTo 草图转渲染工具页面,可见上传区、渲染风格与模型选项

来源:sketchto.com/tool/sketch-to-render,2026 年 9 月 2 日访问。

结论

Solaris 和它的后继者是真正的新事物:一个被渲染而非被编程的界面,对你的任何操作做开放式响应。草图转代码和它的 AI 设计工程师同类是真正的好用:行为被规格化的界面,随时可以进入生产。这场比较的结论和开头是同一句话——先想清楚你要拿回什么。如果你要的是一种可以去探索、去卖的体验,世界模型路线现在就值得投入。如果你要的是明天就能跑的软件,就生成代码,并把那些生成图像——包括从你自己的草图出发的那张——当作"想清楚该做什么"的最快方式。随着世界模型成熟,这条边界会模糊;那是预测,不是今天的产品。

用 AI 转换你的图片

将草图变成精美图片、移除背景、换脸等等——全部由 AI 驱动。

免费试用 Sketch To

分享

S团

SketchTo 团队

专注 AI 工具、图像处理和创意工作流的技术写作者。

相关文章