最近 World Model 这个方向好像一下子热起来了,前两天看了下 World Labs 的 Atlas 和 Runway 的 Solaris ,感觉两家的思路还挺不一样。
Atlas 是 World Labs 9 月 1 日刚发布的 omni world model ,主要做 Spatial Intelligence 。它比较有意思的一点是,不只是单纯的视频生成模型,而是把 text 、image 、video 、camera pose 、depth 等信息放到同一个 3D spatial context 里处理。
所以它既可以做 camera-controlled video ,也能做 3D reconstruction 和空间模拟。比如输入几张图片后,可以重建场景,然后指定新的相机位置和运动轨迹去生成画面。官方目前展示的视频最高能到 1440p 、1 分钟左右,还可以输出 point cloud 、Gaussian splat 之类的 3D 数据。
我找资料的时候看到有个页面把 Atlas 的几个能力整理得比较直观: https://worldmodelatlas.org/
另外一个是 Runway 最近发布的 Solaris 。
Solaris 的方向更特别,Runway 把它定义成 Interface World Model 。传统网页或者 App ,本质上还是开发者提前写好页面、组件和交互逻辑,用户点击之后切换到预先设计好的状态。
Solaris 想做的是另一件事:界面本身由模型实时生成。用户点击、拖拽或者输入以后,模型直接根据当前画面和操作生成下一帧 UI ,而不是调用一个提前写好的页面。
所以它更像是在尝试“生成软件”而不是单纯生成图片或者视频。如果以后延迟、稳定性和成本能解决,感觉 UI 的形态可能真的会发生比较大的变化。
这边有个页面整理了一些 Solaris 的 Demo 和原理: https://runwaysolaris.com/
两个放一起看还挺有意思。Atlas 更偏真实世界、3D 空间和物理环境,Solaris 则是把 World Model 的思路用到了数字界面。
感觉现在大家说的 World Model ,已经不只是“生成一个可探索的 3D 世界”这么简单了。