文/VR 陀螺
9月28日,AMD宣布收购李飞飞参与创办的世界模型公司World Labs,交易全部以股票完成,估值约82亿美元。交易预计在监管等条件满足后,于2026年底前完成。
一家成立仅两年多的AI公司,为什么能够让一家芯片巨头拿出82亿美元?答案可能隐藏在AI正在发生的一次变化中。
过去两年,AI在文字、图片和视频生成上的进步很快,但真实环境并不是一组彼此独立的画面。物体存在于空间中,彼此拥有位置和结构关系;用户推开一扇门、拿起一个杯子或者向前移动,环境还会持续发生变化。
World Labs所提出的 “空间智能”,核心目标正是让AI深度理解现实世界里物体、空间与用户之间的关联关系。而XR设备,天然会成为世界模型从“生成空间” 迈向 “进入空间”的关键硬件入口。
AMD为什么要买一家“造世界”的公司?
World Labs一直是AI领域融资能力较强的创业公司。2024年成立之初,公司获得约2.3亿美元融资;今年2月,公司又完成10亿美元新一轮融资,AMD、NVIDIA、Autodesk等企业参与其中。此前,AMD已经与World Labs围绕GPU上的模型训练和推理优化展开合作。
AMD对World Labs的兴趣落在计算平台上。AMD在公告中提到,AI进一步进入推理、机器人、模拟和Physical AI等方向,计算需求随之变化。纳入World Labs后,AMD可以把模型研究与芯片、软件和系统开发放在一起,更早参与新模型的计算需求定义。
李飞飞也解释过,World Labs若想扩大模型规模和应用范围,需要更加接近硬件。缺少针对性的硬件投入,会限制模型效率和规模,也会影响AI向空间和物理世界延伸。
这背后是AI计算对象的变化。大语言模型主要处理Token,世界模型还要处理图像、视频、3D几何、空间状态和物理变化。模型需要判断镜头转过去以后有什么、物体移动后处于什么位置,以及用户的行为会怎样改变环境。芯片厂商因此开始更早进入模型能力定义环节。
中国一级市场也在快速跟进。睿兽分析发布的报告显示,今年1至7月,中国一级市场世界模型相关概念发生105起获投事件,累计融资666亿元。同期报告也提醒,技术路线尚未收敛,市场热度走在技术成熟度前面。
生成视频与生成空间,世界模型的两条技术路径
目前世界模型已经形成两条较有代表性的技术方向。
第一条路线强调实时生成画面。Google DeepMind发布的Genie 3可以根据文字描述实时生成可探索环境。用户向前移动或改变方向,模型会继续预测接下来应该看到的画面,并在数分钟内维持环境一致性。与Sora、Veo等视频模型相比,Genie 3的环境由用户操作推进,没有固定时间轴。
第二条路线强调生成可编辑的3D空间。World Labs去年发布的Marble可以根据文本、图片和视频生成具有空间一致性的3D世界,并导出Gaussian Splat、三角网格和碰撞网格,继续进入其他3D工作流。其Spark渲染器可以把这些场景运行在桌面、移动设备和VR头显上。
今年9月,World Labs又公布了Atlas。它同时处理文本、图片、视频和3D信息,并将这些内容放进统一的空间上下文。Atlas覆盖生成世界、空间重建和时空模拟,可以从少量图片恢复真实环境,也可以根据视频理解空间变化。
World Labs还提出过“3D as code”。代码已经成为人和机器描述软件逻辑的接口,3D也可能成为人与AI描述空间的接口。模型输出的可编辑结构可以继续交给游戏引擎、物理引擎和机器人系统使用。
这两条路线关注的都是同一个问题:AI能否生成一个可以被用户进入、探索和交互的空间。它们也把世界模型与XR拉得越来越近。
世界模型开始进入XR生产链,PICO可能会成为第一个吃螃蟹的人
对XR行业来说,“世界”就是内容本身。
过去,XR内容是开发者先把世界做好,再把用户放进去。场景在哪里、道路通向哪里、物体怎样摆放,以及大部分交互规则,都需要提前设定。
世界模型会改变其中一部分流程。用户提供一张图片、一段视频或一句自然语言,模型先建立基础空间;用户进入后,模型再根据行动继续扩展环境。现实空间也可以先被扫描和重建,随后改变风格、补充内容或生成新的场景。对于MR,模型了解现实空间结构后,生成内容可以与墙壁、桌面和用户位置建立关系。
另一项变化是内容不必在用户进入前全部完成。传统VR游戏的地图、任务和环境变化大多提前制作。当模型可以根据玩家行为持续生成环境时,同一套基础内容就能出现更多变化,新的区域可以动态延伸,不同玩家面对的空间也可能不同。XR长期讨论的内容供给不足,或许会因此获得新的解法。
字节跳动可能正在尝试把模型、内容和硬件串在一起。据彭博社此前报道,字节正在研发一款基于Seedance的实时空间视频模型,张一鸣亲自协调跨部门团队、AI资源和算力投入,模型最快可能在今年10月亮相。它要创造可以根据用户行为变化的交互式虚拟世界,可用于直播、短剧和游戏等场景。
值得注意的是,在世界模型之外,PICO也已经开始把AI引入空间内容的开发流程。
9月,PICO正式推出PICO CLI 0.5.0。这是一套专门面向AI开发的命令行工具,同时也是PICO Space Pro和PICO OS 6新的空间应用开发入口。开发者可以直接使用自然语言描述需求,由AI Agent完成工程创建、代码编写、构建、调试和模拟器运行。系统还能够读取运行效果和错误信息,再自动修改代码,形成“开发—运行—检查—修复”的循环。目前PICO CLI已经支持PICO Spatial SDK、Unity SDK以及SpatialML等开发框架。
PICO CLI本身并不是世界模型,但它反映出另一项正在同时发生的变化:AI不仅开始生成3D资产和空间,也在进入XR应用的开发过程。过去需要开发者配置SDK、编写程序、搭建场景和反复调试的部分工作,正在被自然语言和AI Agent重新封装。
从这一角度来看,字节正在形成一条颇为特殊的技术链路:上游有Seedance以及正在研发的实时空间视频模型,中间有PICO OS 6、Spatial Engine和AI辅助开发工具,下游则有PICO Space Pro这样的XR硬件。
这里还有一个值得继续观察的时间点。今年8月24日,PICO宣布将原定9月2日发布的PICO Space Pro推迟至第四季度。官方表示,产品软硬件已经达到较高完成度,但团队在最后阶段决定对软件体验进行重大升级,因此发布时间指向第四季度。
虽然目前没有公开证据证明Space Pro延期与这款模型存在直接关系,但当字节的空间生成模型、PICO OS 6、AI空间开发工具以及Space Pro同时在今年下半年加速推进。一个问题已经提前留下:字节正在研发的“可交互虚拟世界”,未来会不会首先出现在自己的XR平台上?
这概率很大,毕竟PICO此前曾通过《轻世界》尝试过用户创造虚拟世界的产品形态。如果字节的空间生成能力最终进入PICO,它可能不是简单增加一个AI功能,而是让《轻世界》当年没有完成的“人人创造虚拟世界”,以AIGC的方式重新出现。
落地XR 场景的难点并不少
世界模型距离替代游戏引擎和3D开发流程还有很远。视觉效果容易展示,真正可以运行的世界还需要解决几项基础问题。
第一是空间一致性。用户佩戴头显移动后,转身回到原位,桌子仍要在那里,门要维持打开状态,地上的物品不能消失。Genie 3目前能够维持数分钟的一致性,游戏、社交和空间应用可能需要持续数小时,甚至长期保存世界状态。
第二是物理与交互。生成椅子的画面并不困难,但用户要坐上去,系统必须知道椅子的结构、碰撞范围和承重关系。用户拿起杯子时,模型还要理解杯子是否为空、液体如何运动,以及杯子碰到桌面后的结果。这些能力需要模拟器参与。
第三是实时性和算力。XR对延迟非常敏感。传统游戏引擎能够稳定提供高帧率,原因在于大部分资产和规则已经提前完成。用户每次移动都要求大模型重新推理环境时,模型规模、推理成本和时延都会直接影响产品体验。AMD关注World Labs,也与这项工作量有关。未来的世界模型需要同时处理高分辨率画面、3D结构、物理状态和实时交互,计算需求与大语言模型存在明显差异。
第四是开发者的可控性。游戏和影视内容不能完全随机,创作者需要控制视觉风格、故事节奏、关卡结构和玩家体验。模型既要提供足够强的生成能力,也要服从开发者的设计。
更现实的方案是让世界模型与传统引擎配合。AI负责生成和理解空间,游戏引擎继续处理稳定规则、确定状态和高实时性任务,Gaussian Splat、Mesh、碰撞体等结构化3D信息连接两套系统。
World Labs提出的“3D as code”也采用了类似思路。模型生成世界,状态管理、物理、碰撞和同步仍由传统系统完成。
写在最后
AI生成的对象还在增加。文字、图片、视频和3D资产之后,空间成为新的目标。
XR设备过去主要运行开发者提前制作的内容。当空间可以被AI实时生成、重建和改变时,VR、MR和空间计算设备也会获得新的内容来源。用户进入的将是一个持续变化的世界。
AMD以82亿美元收购World Labs,说明芯片厂商已经开始为下一代计算需求下注。世界模型进入XR生产体系还需要时间,但它显然已经打开了一条新的路径。