AREX Feed Article
Runway 官宣首个 Interface World Model Solaris:无代码逐帧实时生成可交互界面
8 月 31 日 16:31 UTC(北京时间 9 月 1 日 0:31),Runway 企业认证账号 @runwayml 发布公告,公开 Solaris,官方称这是其首个界面世界模型(Interface World Model)。称它是一种“新的操作系统”:无代码、逐帧、实时生成可交互界面,并开放早期访问申请。
Runway 声称 Solaris 在生成新界面时,结构相似性与信息保持两个指标上超过前沿大语言模型(LLM);这些均为公司自报口径,未经独立评测。公告附带演示视频,并指向同日发布的。发布后数小时内,推文获 1,800 余次点赞、190 余次转发、160 余条引用和约 28.6 万次观看。
界面不再翻译成代码,整帧画面就是应用
博客的核心论点是“转译损耗”:今天所有软件都要把视觉设计翻译成中间表示(代码)才能运行,行为必须预先定义,交付的软件是“可能交互空间的有损压缩”;转译还牺牲视觉保真度。Solaris 把渲染与交互交给同一个世界模型,去掉中间表示,“整个画面就是界面”。
Runway 列出三项新能力。完全视觉化:在虚拟服装店里,用户以自己一张照片为参照,从衣架上拿起衬衫拖到身上试穿。活的:画面持续渲染而非等待下一次操作,反光随光照变化,物体被拖动时自然响应。开放结局:同一起始帧可以支持完全不同的行为,官方举例一张手的 X 光片,同样的拖拽动作会产生两种不同的响应。
交互不再依赖预设菜单。“重新定义鼠标”是官方给出的机制:点击场景中的猫,之后的点击会把猫的毛色与纹理应用到你所触碰的任何物体上;点击一幅画,你可能会开始用它的风格作画。行为由自然语言提示定义,而不是预先编程。
三个工程关卡:半秒延迟、长程连贯、成本
官方称交互感大约在 0.5 秒延迟处消失,而视频扩散模型生成一段片段需要几秒到几分钟。
Solaris 基于 Gen-4.5 视频生成模型改造,延续 GWM-1 的路线,分三步实现实时:先让模型自回归逐帧生成,每帧只依赖此前帧;再把多步去噪蒸馏到几步;最后让快速模型用自己的输出训练,保证长时间交互中的视觉质量。
架构上推理与渲染分离:一个语言模型理解用户请求、决定当前场景应修改还是切换、定义行为并生成提示;世界模型负责逐帧渲染。用户点击、拖拽、键入都作为下一帧的生成条件。因为模型只看到已经发生的交互,它由此学会动作与视觉结果之间的对应,无需显式编程。
官方还称,让 Solaris 实时化的同一套工作,使其运行成本比标准视频扩散模型低几个数量级,成本曲线仍在改善;视觉质量目标为 720p。
评测:250 人、近 7,500 次两两对比
推文里的性能声称,对应博客中的两层评测。重建基准让包括 Claude Fable 5 在内的前沿多模态语言模型从单张截图重建界面,覆盖 30 个界面样本,用 SSIM(结构相似性)和 DINOv3 特征匹配衡量信息保持。
Runway 的结论是:所有语言模型都会在重建中丢失信息,界面视觉越复杂损失越大,自然图像受影响最严重。
第二层是直接对比。Solaris 与 Claude Opus 5 用代码实现的界面从同一张图片出发,接受相同的交互请求;250 名参与者对 30 个交互示例做出近 7,500 次两两判断。指令遵循上,Solaris 以 61% 对 24% 胜出,13% 判为持平;行为自然度上以 71% 对 21% 胜出,6% 持平。
Runway 指出,自然度差距比指令遵循更说明问题:代码界面能复现被要求的改动,但把交互当作对界面的孤立更新;世界模型理解物体、材质与环境的物理行为,交互在场景内保持连贯。这套评测由 Runway 自己设计执行,用户研究测量的是主观偏好。
从 GWM-1 到 Solaris:Runway 的世界模型路线
Solaris 不是 Runway 第一个世界模型。2025 年 12 月 11 日,Runway ,自称“通用世界模型”:基于 Gen-4.5 的自回归模型,逐帧生成、实时运行,可用相机位姿、机器人指令、音频控制,分为 GWM Worlds、GWM Avatars、GWM Robotics 三个变体,分别面向可探索环境、对话角色和机器人操作。
Solaris 沿用了这条路径,把视频生成机制从物理世界转向界面本身。官方还给出一个训练用途:目前最强的大语言模型在预订酒店、订购杂货等计算机操作(computer use)任务上仍然吃力,因为它们学的是训练时见过的固定布局,换一个酒店网站就失效。Solaris 可以生成不断变化、从未出现过的布局,让智能体(agent)在动态环境中训练。
“魔法”与“过于乐观”:社区的两极反应
发布后数小时,引用推文迅速出现两极评价。Hugging Face 联合创始人 Thomas Wolf 评论称,未来会是“超快的实时扩散模型界面,加上超快的 LLM 预测下一状态”,“我们在可预测性上失去的,会在适应性上以 100 倍拿回来”。Lux Capital 联合创始人兼合伙人 Josh Wolfe 转发称“疯狂。魔法”,并把 Runway 称作“Lux 系公司”。
Runway 工程师 Kamil Sindi 表态:“很快,你看到的每一个像素都将由模型生成。Solaris 是我们迈向那个未来的第一步。”The Agent Company 则写道:“这不是 vibe coding(氛围编程),因为根本没有代码。图像就是应用。”
质疑同样直接。前 DeepMind 成员、曾参与 Project Astra 的 Charlie Deck(现任职 Reflection AI)把 Solaris 比作“应用版的 Genie”,预计它会“和今天其他世界模型一样受短视和金鱼记忆之苦”,但承认“这是一个引人注目的先例”。
曾任职 Google 与 Zynga、参与创建 jQuery UI 的产品工程师 Paul Bakaus 写道:“这很酷,但旁白乐观得离谱。它不会取代对稳定用户界面的需求。这些可爱的演示严重误解了 UI 设计,甚至是在贬低它。”
创意总监 Dara Chaw 则质疑评测设计本身:“Runway 真的拿一个视频模型和一个基于文本的 LLM 做公开调查,比较哪个看起来更好?HTML 对视频?”
官方承认的未解问题:文字、信任与长会话
Runway 在博客中列出了明确限制。稳定可读的文字仍是视频生成最难的问题之一,而界面几乎最依赖文字;官方给出的路径是混合系统,由图像模型在短暂停顿期渲染文字密集的视图,完全实时的文字生成仍是开放挑战。
信任方面,官方写道“一个有说服力的错误答案比没有答案更糟”,目前模型靠用户提供的起始帧锚定场景,用更丰富的已验证上下文做条件生成是活跃研究方向。
长会话的视觉与语义连贯、屏幕阅读器与无障碍 API 的兼容,也都在未完成清单上。Solaris 目前不公开可用,官方称正与关键合作伙伴推进公开发布,仅开放早期访问申请。这套 61% 与 71% 的自报数字能否兑现,要等第一批早期访问用户的实际会话。
参考链接
- _