①算力“拼系统”时代,超节点、超集群已成主流方案,且已收获下游积极反应,曙光8000集群上线首周需求爆满;
②华东首座国产TPU千卡智算集群已落成,二期规划今年9月上线投产;
③多位产业人士关心Token性价比,而降Token成本是一项系统工程。
财联社7月20日讯 (记者 王彦琳)在AIGC领域,AI生成的图文视频已足够逼真,下一步还能做什么?在2026世界人工智能大会(WAIC)现场,财联社记者观察到,AI正突破“生成画面”的边界,开始学习理解物理世界的动态逻辑。
在模型侧,众多厂商正在涌入这一赛道,昆仑万维(300418.SZ)董事长方汉在接受财联社等媒体采访时表示,几乎所有的文生视频厂商都在布局世界模型,其背后逻辑在于,训练视频模型的技术基座可以延伸至世界模型方向。
多家AI厂商释放明确信号:下一站,让AI走出屏幕,与物理世界实时交互,在真实场景中解决实际问题。
物理AI企业开辟AIGC战线
财联社记者观察到,本届WAIC上,多家物理AI厂商及AI基础设施公司,将触角伸向AIGC领域,内容场景因受众广泛,正成为模型能力的“试验场”。
极佳视界展示了全栈世界模型产品矩阵,包括一粟YiSu、DriveDreamer、GigaWorld、GigaWorld-Policy等产品矩阵,覆盖内容创作、驾驶仿真到具身智能。
极佳视界内容业务负责人陈宏在接受财联社记者采访时表示,就内容生成而言,世界模型有几大特点:一是对真实物理规律的还原度更高。训练数据大量来源于真实物理世界交互数据,模型更懂现实世界运行逻辑。像爆炸、粒子、流体这类传统AI视频极易穿帮的画面元素,用世界模型生成会更加真实自然。
二是支持实时交互式内容生成,常规视频生成工具需要用户输入提示词后等待成片,相当于单次生成、被动接收结果;而世界模型支持全程实时反馈、实时调整、实时渲染,不用等待成片。
三是对3D空间的理解能力更强,现有视频模型受架构限制,很难精准还原真实三维空间逻辑,世界模型依托真实物理数据训练,能解决空间透视、物体位置、景深错乱等问题。
用平面图或视频一键生成3D虚拟片场,打造“赛博横店”,群核科技(00068.HK)AI视频创作智能体LuxReal接入自研世界模型SpatialGen,侧重空间重建生成,解决以往视频生成中镜头穿帮、空间错乱问题。
群核科技相关负责人向财联社记者介绍,传统2D视频生成模型好比“化妆师”,负责优化画面视觉美感;3D世界模型则等同于场记+导演,把控空间逻辑、杜绝穿帮,保障画面可控性。视频智能体同时接入两套能力,协同完成创作。
底层空间技术的通用性,可以向外辐射多个行业场景。群核科技还面向各行业开发者推出空间智能开放平台AHOLO,提供三维场景生成、实景重建能力,为游戏、文旅等从业者提供专业资产制作能力。
AI基础设施厂商范式智能(06682.HK)则推出一站式AI影视制作工作流平台PhanthyMovie,展示了AI如何贯穿创意生成、内容制作和后期编辑的全流程,进一步释放内容生产效率。此外,范式智能在展台首次对外亮相了搭载跨平台通用具身Agent框架PhanthyMotus 的机器人,为参会者提供实景互动演示,展现机器类人感知、自主决策与智能执行能力。
世界模型,AI时代下一个技术基座?
“过去两年AI的核心命题是生成——生成文字、图像、视频、音乐。而从今年开始,AI的核心命题转向理解与交互,让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动。”方汉在昆仑万维WAIC专场论坛上表示,世界模型是实现这一跨越的关键技术底座。
他预判,第一,世界模型将走出屏幕,进入物理世界;第二,游戏行业将率先被重构,未来三到五年,世界模型将成为游戏行业的基础设施,彻底刷新内容生产方式;第三,AI音乐、AI视频等工具将从技术试验变成大众创作工具,促进 AIGC深层发展。
当视频生成模型能力接近、技术路线走向收敛,竞争维度正在迁移,视频模型不止于内容生成,更可以成为理解物理世界的“大脑”。
本届WAIC上,昆仑万维宣布升级核心模型,推出Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型,全面覆盖世界模型、AIGC创作等前沿赛道。其中,Matrix-Game 3.5聚焦可交互世界模型技术,实现了Patch级别的记忆注入与系统级性能优化,5B模型在720p分辨率下可实现单卡20FPS实时生成,具备1分钟记忆能力。
方汉认为,训练视频、游戏生成模型所需的算力集群、海量数据清洗能力,和世界模型高度相通,传统视频生成厂商可依托规模化数据能力快速迭代模型;文本大模型规模化红利已经逐步见顶,但音乐、视频、游戏生成模型仍处在红利期,持续扩大数据规模就能稳定提升效果;单纯做应用层产品风险较高,企业核心竞争力仍要放在底层模型研发,即便布局应用,也要打造模型无法轻易复刻、难以通过训练覆盖的独有数据与业务流程。
整体来看,昆仑万维此次发布的模型组合拳,意在将以往的模型基础和能力从数字世界拓展到物理世界,实现文字、视频、音乐、游戏以及具身智能领域的全面布局。
生数科技在此次WAIC上展示了三条清晰的产品线,分别是实时交互模型Vidu S1,世界生成模型Vidu,以及面向具身智能机器人的世界动作模型Motubrain,形成从理解到行动的完整布局。
生数科技创始人、清华大学人工智能研究院副院长朱军表示,视频生成、实时交互与机器人行动,并非彼此割裂的技术方向,而是通用世界模型从理解、预测到行动的连续演进。
“世界模型有机会成为支撑AI完成更多复杂任务的下一代底层基础设施。”陈宏对记者表示,成熟的世界模型具备通用理解能力,未来世界模型迭代完善后,机器人能够像人类一样观测环境、预判后续动作,无需针对每个物体、每项任务单独训练。机器人会依托世界模型积累的海量世界认知,自主感知环境、规划操作逻辑,实现真正通用智能。
技术走向真实场景
游戏行业一直是AIGC技术落地和商业化的前沿阵地。有趣的是,相关技术也赋能物理AI进化,让AI走出屏幕,在真实场景中“干活”。
财联社记者在网易旗下具身智能品牌“网易灵动”展台看到,一座颇具游戏感的智能座舱的显示大屏实时播放露天矿山上挖掘机的作业实况。通过脚踏板和移动手柄,就能远程操控千里之外的挖掘机作业。据悉,网易灵动已推出挖掘机、装载机两大主力产品,目前已经落地内蒙古、新疆、四川、甘肃等地的百余个项目中。
而这两款工业机器人背后,大量运用了网易在游戏领域沉淀的AI技术。例如在《逆水寒》、《永劫无间》等游戏中研发的3D虚拟技术,原本用于捏脸、人机交互,如今落地到工程机械领域,用于搭建矿山、搅拌站的三维虚拟作业场景,在虚拟3D环境中完成挖掘、装载等任务的模型预训练与问题排查,大幅降低线下真机调试成本。
“早期我们在游戏研发中积累了整套AI能力与仿真环境技术,其中强化学习、仿真系统底层技术框架具备通用性。过去这类技术用于优化画面、提升游戏体验,现在我们直接迁移到工程机械智能化体系搭建中。”该负责人对财联社记者表示。
她进一步透露,该套方案交付企业后,模型、配套算力全部端侧部署,整体算力分层调度:场地侧负责批量预训练与数据调度,车载端独立承担实时环境感知、决策、路径规划、设备控制。
从技术路线来看,2026年被业界视为端侧AI规模化落地元年。财联社记者获悉,在本届WAIC上,北京智源人工智能研究院联合端侧实验室发布《端侧智能2026——规模化落地元年》报告。报告指出,2026年端侧智能正从概念验证迈向规模落地,产业化拐点已然到来。
面壁智能同步发布两款端侧大模型产品:仅20亿参数的MiniCPM5-2B端侧文本大模型,在综合知识、数学推理、代码、指令遵循和智能体能力上均做到同尺寸领先,已落地手机、汽车、具身智能、航天等多元终端;VLA具身模型,以通用智能为起点,让机器人能够直接处理普适、长程、流水线式任务。
“人工智能发展到今天,很像早期的移动互联网,技术在快速发展,要跟千行百业去做结合,市场非常广阔,我们希望能够找到真正有价值的产业、场景、落地⽅式,让整个产业更快受益。”面壁智能CEO李大海在接受财联社等媒体采访时表示。