财联社
财经通讯社
打开APP
数百亿热钱涌入世界模型,智源王仲远:世界模型是未来,但现在谈现金流还早|连线创始人
①王仲远把世界模型的现状比作深度学习的2012年;
                ②第一条稳定现金流,可能最早出现在工业仿真和影视游戏两条线交织的地带。

《科创板日报》9月18日讯(记者 李明明)2026年以来的AI圈,没有哪条赛道比世界模型更拥挤。

2月,AI教母李飞飞创立的World Labs完成10亿美元融资;一个月后,图灵奖得主杨立昆离开Meta创办的AMI Labs,以10.3亿美元种子轮刷新欧洲AI创业史纪录。

国内的热钱更猛:极佳视界三个月内连续完成三轮融资、吸金约35亿元,千寻智能开年融了45亿元;英伟达推出号称全球首个全开源物理AI全能模型的Cosmos 3,小鹏在CVPR上亮出世界模型技术图谱,吉利发布WAM世界行为模型。

据《科创板日报》不完全统计,前7个月国内相关融资超666亿元,超50家企业获投。

但一位头部VC合伙人对融资热潮泼了冷水,严格按照预训练标准筛选,真正在做世界模型的创业公司,最多不过3-5家。多数项目只是把融资书上的赛道名称,从仿真、3D、视频生成换成了世界模型。李飞飞今年6月更直言:世界模型是当今AI领域最重要、也最被滥用的术语之一。

喧嚣之中,智源研究院是个特殊的存在——它不是公司,不进行融资,却发布了研发中的悟界·Physis-v0.1,定位为全球首个通用世界基座模型。

近日,《科创板日报》记者在北京专访了智源研究院院长王仲远。他表示,VLA是当下,世界模型是未来。并判断,第一条稳定现金流,可能最早出现在工业仿真和影视游戏两条线交织的地带。

现在谈稳定现金流,还有点早

世界模型最清晰的付费方是谁?自动驾驶、机器人、游戏影视、仿真训练、工业数字孪生——这是几乎所有从业者都会被问到的问题。

“说实话,现在谈世界模型有稳定现金流,还有点早。”王仲远的回答没有任何修饰。

他把几条线拆开来看:自动驾驶和工业数字孪生对物理真实性的要求最高,付费意愿也最强,但世界模型目前的能力,还不足以满足它们核心环节的需求;游戏和影视是相对宽容的场景,对幻觉的容忍度更高,有可能最先看到付费案例,但更多是作为辅助工具存在;机器人领域,本质上还是要先把硬件、数据、模型这个循环悖论解开——具身能力不足,限制了真机数据的采集;数据稀缺导致模型能力弱、落地难,于是能力更加无法提升。

王仲远的判断是:第一条稳定现金流,可能最早出现在工业仿真和影视游戏两条线交织的地带——比如用世界模型做合成数据、做预演评估。

这个判断的另一面,是他对行业现状的警惕。演示很强、收入很弱,是今年世界模型公司的通病。怎么区分”能签合同的世界模型“和”能发论文的世界模型“?

“核心区别就一条:它能不能在真实场景里稳定地、可预期地工作。”王仲远说,很多demo看起来很漂亮,但那是选了最好的case。

他给出一个自认为最不会骗人的指标:闭环成功率。把世界模型作为策略评估器,接一个policy进来,它在模型里成功执行的概率,跟它在真机上执行的概率,是不是高度一致。“如果这个指标对不上,说再多都没用。”

猪在天上飞:被误用的世界模型

世界模型并不是新概念。

1943年,心理学家Kenneth Craik就提出,人的心智通过运行现实的小尺度模型来推理;上世纪九十年代它被引入计算机科学,2018年David Ha的《World Models》让它重新成为显学。真正把它推上风口的,是2024年春节横空出世的Sora——OpenAI用World Simulator介绍这个视频生成模型,概念从此彻底泛化。

“一群猪能在天上和飞机一起飞吗?现实世界不行,但视频生成模型可以。”王仲远反复强调一句话:视频生成不等于世界模型。视频生成模型的训练数据里有大量科幻电影,目标从来不是还原物理规律——物体凭空消失、违背重力,在内容创作里是想象力,放到物理世界里就是错误。要是世界基座模型无法区分真实和虚幻,进入物理世界真正干活,就会产生重大风险。他半开玩笑地说,机器人装上这种大脑,可能会误认为自己是钢铁侠。

他还有一个更朴素的反问:每个人闭上眼睛都能对未来做简单预测,但没人能在脑子里生成高精度画面。人类的世界模型从来不是渲染器,机器为什么必须是?

在王仲远看来,当下被冠以世界模型的路线大致有四条:以语言为中心的多模态理解模型、以像素为中心的视频生成模型、以三维结构为中心的空间智能模型、以视觉表征为中心的JEPA系列模型、——距离真正面向物理世界的基座模型,都还有很大距离。

有意思的是,过往在许多人的认知中并没有将基于大语言模型所构建的VLM、VLA归结为世界模型技术路线之一,但近期GPT-6 Astra的发布,在预训练中以语言为中心、融入具身数据,实现对具身模型的降维打击,一定程度再次证明了其对技术的预判性。

不过,真正面向物理世界的基座模型,仍需同时处理语言、动作、视觉、触觉等多重要素,因此智源也在尝试走第五条路,将所有模态压缩进统一的潜空间,再由不同解码器还原成文本、视觉或动作。他承认这是一场押注,“可能是错的,过两年结果会验证”。

这背后是一个更大的判断:大语言模型的核心是预测下一个词,世界模型的核心应该是预测下一个物理状态。一瓶水和一瓶咖啡放在桌子旁边,跌落时产生的物理状态完全不同,人类一看就知道。世界模型要补的,就是这块人类与生俱来、机器完全缺失的常识。

世界模型在他这里也不只是模拟器:不是生成数据,而是基于未来可能的状态做出当下最优的决策,有点像《奇异博士》,能预测各种不同的未来,基于当下状态选择最优的结果。大语言模型已经在文案、编程上造就了巨头,但物理世界才是真实的人类社会生产生活环境——这个空间和产值的上限,是非常巨大的。

VLA是当下,世界模型是未来

谈到世界模型,绕不开具身智能。王仲远的概括很干脆:VLA是当下,世界模型是未来。

王仲远不否认VLA的价值——特定场景、特定任务,采集特定数据就能完成,工厂里分拣、打包已经在真实流水线上干活。但局限同样清晰:模型偏大,响应速度满足不了真实物理世界的动作频率;更根本的是,解决不了泛化、长程和空间物理规律的理解推理。“整个具身大模型的发展,可以类比大模型在GPT-3之前的探索期。”

所以他给行业开的药方是沿途下蛋:一边在相对封闭的工业场景落地——工厂环境固定、枯燥、能规避伤人风险,会是最快规模化的场景——一边在落地过程中持续采集数据,反哺基座模型训练。“我们不能等到数据完全Ready,再来探索技术路径。”

当下的世界模型确实还没到GPT时代,因为数据非常缺乏。这是王仲远对行业瓶颈最直接的表述。

文本数据语义清晰、易于获取,物理世界的3D、4D数据却极度稀缺、散成孤岛。但他认为视频数据是被低估的富矿——最容易海量获得、又真实反映物理世界,它里面的有价值信息,现在的技术还没充分挖掘出来。

他讲了一个观察很久的例子:一个两岁的小女孩,父母从没教过她拆糖果、串蓝莓,但她天天刷短视频,看着视频里的小姐姐吃,自己学会了把五颗蓝莓串在一根牙签上——通过视频学习技能,再通过实践反复尝试直到成功。“这就是强化学习的本质。从第一性原理看,海量视频数据的价值还远没有兑现。”

算力上他相对乐观:悟界Emu3.5已验证了与大语言模型同架构可以Scale Up,算力基础设施、训练框架、工具链大都可以复用;Physis模型的潜空间学习本质上要求极致压缩,算力需求反而可控。对更远的未来他留了个口子:人脑只有10到20瓦功耗,吃的是蔬菜,却能训练出极强的世界模型——更经济有效的路径,并非没有可能。

没有公认Benchmark的行业

世界模型目前没有公认的评测体系。现有评测大多以视频生成为核心,刷榜成风,他笑言,定义都不明确的时候,你甚至能刷到世界模型榜单第一这样的文章。为此,智源团队提出了W0到W5的分级体系,类似自动驾驶的L0到L5:从生成逼真视频,到响应动作,到理解物理后果,再到跨领域泛化。

他特别点出动作因果的可溯性——给一个action,模型能不能正确预测物理后果。智源会做第三方评测的探索,“但这需要跟学界、业界一起推动,不是一家能独立完成的”。

自动驾驶重监管、机器人重硬件、游戏重内容周期,资源押在哪个可商业验证的场景?王仲远绕开了问题本身:“我们作为新型研发机构,不会像创业公司那样押注某一个商业场景。我们做的是公共底座——把通用的物理理解能力训出来,通过不同的decoder对接不同场景。不押具体场景,但全力押通用的物理基座能力。”

不押什么,同样明白:不做已经被VLA跑通、已证明能商业闭环的事——那是企业该做的。他打了个比方:把M款模型和N款硬件的适配从M×N简化到M+N,让生态里的每家都能在上面生长。

智源行为世界模型创新中心负责人叫陈博远,今年22岁,北大元培学院本科生,国际顶会ACL最佳论文得主。这个团队正在做的Physis-v0.1,以预测下一物理状态为核心,版本号只敢定到0.1。

王仲远不讳言它的早期,他把世界模型的现状比作深度学习的2012年:神经网络刚兴起,只能解决具体场景的具体任务,走到ChatGPT用了整整十年。“但现在演化速度更快,可能三年五年就有足够的数据累积。技术是先行的,早于产品,早于系统。”

被问到中美差距——大语言模型时代的通行说法是六到十二个月——王仲远的回答很干脆:“世界模型方向上没有差距。这绝对是世界上最前沿的方向,我们有机会站在同一起跑线。”

赛道里的热钱还在涌进来,标签还在被抢贴,但一个清醒的判断正在浮出水面:现在所有的热闹,都还只是序章。真正的世界模型,距离我们依然遥远。

科创板最新动态
财联社声明:文章内容仅供参考,不构成投资建议。投资者据此操作,风险自担。
商务合作
热门解锁
相关阅读
评论
发送
复制
取消
垃圾广告
政治激进内容
色情低俗内容
取消