Runway把代码干掉了!首个界面世界模型,UI自己长出来

浏览15次 点赞0次 收藏0次

就在刚刚,Runway正式发布首个「界面世界模型」——Solaris!

Solaris是一种「全新操作系统」,不用一行代码,实时、逐帧地生成交互式界面。

只需点一下、拖一下,它便根据当前画面和操作,生成了下一帧。


而且,它还非常能打,盲测中,生成的UI效果直接碾压Claude Opus 5。

Runway联创Cristóbal Valenzuela第一时间,为「界面世界模型」下了定义——

未来,视频是通用界面。

最终,所有UI都将变成聊天和手势输入,聊天和视频输出。

Solaris,只是迈向这一愿景的第一步。

最重要的是,它还为训练Agent提供了一种全新途径,轻轻松松就能生成动态环境。


今天起,软件界面,正在迎来一次底层改写。

淘汰代码

让UI自己「长」出来

过去的几十年里,从早期的终端到Linux再到macOS,每个OS都在遵循同一个底层逻辑:

设计出一个界面,把它翻译成代码(HTML/CSS/JavaScript),然后才能运行。

但这种「代码翻译」,是有损压缩的。在这个翻译过程中,交互的丰富度被迫做出了妥协:

  • 视觉保真度下降:为了让界面响应迅速,复杂的光影和物理动态往往被简化。

  • 交互空间被锁死:软件在发布前,其交互行为(点击哪里、触发什么)就已经被硬编码固定。

也就是说,一旦设计被简化为代码,界面虽然响应变快了,却失去了原始设计的丰富细节。

每一次交互、每一个按钮的反馈,都提前写好了代码。

软件在交到用户手里的那一刻,它的可能性就被「冻结」了。


为此,Runway提出一个大胆的设想:把视频模型,直接塞进操作系统。

「界面世界模型」首发之作Solaris,去掉了中间代码层,把「渲染画面」和「响应操作」合成一件事。

三大核心能力

有了Solaris,软件交互不再是死板的菜单和按钮,直接带来了三大前所未有的革命性体验。

  • 完全视觉化(Entirely Visual):所见即所得的终极形态

传统的界面下隐藏着复杂的代码逻辑,但Solaris的界面是一层纯粹的图像。

想象一下,你正在逛一个虚拟服装店,试衣间本身就是「交互界面」:

上传一张照片作为参考,从衣架上拿下一件衬衫,直接拖到自己身上试穿即可。一切自然得,就像在现实世界中一样。


  • 活的界面(It is Alive):跟随个人意图实时演进

界面是连续实时渲染的,它时刻都在「进化」。

它的光影和倒影会随着环境自然变化,物体也会对一个人的操作做出符合物理规律的响应。

「把桌子挪开让我看看效果」或者「把沙发换个颜色」,一句话就能实现。




即使是同一个起始画面:一只手的X光片,Solaris对同样的拖拽操作也可能产生两种完全不同的响应

  • 无边界(Open-ended):告别下拉菜单

传统的界面,只能完成程序员「预设」好的动作。

而Solaris打破了这种工作流,它由底层的「世界模型」驱动,能根据操作在实时场景中给出全新反应。

做一份沙拉?不需要在菜单里疯狂打钩,直接把食材拖进屏幕里的碗中,AI就会自然响应。


幕后揭秘

实时交互,如何做到的?

数字UI界面,一直靠两套系统撑着。

一套「知道东西」,搜索引擎、AI 助手,懂你的问题,却只给静态答案;另一套「实时响应」,网页里的 JavaScript、游戏引擎,画面会动、能交互。

界面世界模型要求二者合一:既懂你的意图,又能围着这个意图连续画出一个能交互的世界。

但想要同时做到这两点,需要攻克以下三大工程难题:

一是速度。交互一旦有超过半秒的延迟,人就感觉不到「交互」了。视频扩散模型生成一小段要几秒甚至几分钟,做内容够用,做界面太慢。

二是连贯,生成视频历来最难稳住的,就是一致性。三是成本,每一帧都需现生成,对运行成本提出了高要求。

为了做到实时交互,官博揭秘了Solaris背后的技术原理——

它建立在Runway的Gen-4.5视频模型之上,并延续了GWM-1世界模型的路线。


Solaris将用户的输入(点击、拖拽、打字)作为生成下一帧的「条件」。

在训练过程中,模型观察并学习了海量的「交互-视觉结果」因果关系。

因此,即使没有预先编程,AI也知道当一个元素被点击或拖拽时,它的物理形态和视觉反馈应该发生怎样的变化。

Runway还将Solaris改造为极速实时引擎,一共有层——

第一层是「自回归生成」。Solaris根据已经出现的帧逐帧向后生成,只依赖历史状态,新动作可以及时进入生成链路。

第二层是「蒸馏」。把扩散模型原本数十步的去噪过程压缩到少量步骤,让更快的学生模型逼近原模型输出,把速度推到可交互区间。

第三层是「用模型自身的输出继续训练」。

自回归系统运行越久,细小误差越容易累积,导致物体变形或布局漂移。让快速模型适应自己的生成分布,可以减轻这种偏移,提升长序列稳定性。


而且,Solaris是一个「双脑系统」。

LLM负责推理——理解用户请求,决定场景该如何演进;Solaris负责渲染。生成这个行为在视觉上应该如何呈现。

两者结合,完美分离了「推理」和「渲染」。

碾压Claude,降维打击传统UI

把界面翻译成代码,到底会丢失多少信息?

为此,Runway做了一系列硬核测试,第一组测试要求多模态大模型根据截图重建网页,覆盖30种界面。


重建保真度随视觉复杂度的提升而变化。即使多模态语言模型持续改进,重建质量仍会随着视觉复杂度的增加而持续下降,这揭示了界面经由语言转译时所损失的信息。

结果发现,随着视觉复杂度的增加,即便大模型再强(包括Fable 5),重建质量也会断崖式下降。

自然图像中的丰富视觉细节,根本无法用语言和代码精准表达。




而在真正的动态交互盲测中,Solaris更是上演了「降维打击」。

第二组测试,直接比较Solaris与Claude Opus 5生成的代码界面。在250名参与者、近7500次两两对比的盲测中:

  • 指令遵循率:Solaris以61%的胜率,绝对碾压了代码界面的24%。

  • 自然流畅度:Solaris更是以71%对21%取得压倒性优势。


给到的两组横评中,可以看到Solaris生成交互效果的丝滑度。



当然,官方也承认了,Solaris还是有短板,包括生成清晰文字、幻觉、长程连贯性等。

APP消失?全新交互界面诞生

Solaris首秀,展示了一个极其清晰的未来:App这个概念,可能要消失了。

如今,我们做一件事,针对不同的任务需下载不同的App。

但在「界面世界模型」的框架下,软件不再是静态的预设目录,一个新型交互界面就此诞生。

不论是电商购物、阅读新闻还是预定餐厅,系统将直接根据你的上下文和意图,实时「长」出一个最适合你当下需求的操作界面。

不仅如此,所有人获取信息、知识的方式,也将发生颠覆性的变革。

想要了解不同物质的化学燃烧反应,LLM只会给一段几乎让人「无感」的文字/图片/视频。

Solaris直接可以实时交互,直观对比铜、钢丝棉、镁的燃烧现象。

正如Runway所言,界面生成将会沿着图像和视频生成的轨迹发展:变得更快、更连贯、更有能力。

Solaris只是第一步。

当代码彻底消失,界面自己「长」出来的那一天,人机交互规则将被彻底重写。

参考资料:

https://runwayml.com/news/research/introducing-solaris

编辑:桃子

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯