财联社
财经通讯社
打开APP
“四肢”练熟了,“大脑”还饿着,具身智能千万小时数据缺口怎么填?|WRC观察
Play
语音播报
00:00
/
00:00
00:00
语音播报由AI生成
①为具身智能构建数据底座,已是产业规模化落地的当务之急。
                ②财联社记者在WRC现场采访了解到,面对海量数据缺口,行业正从多个方向突围,一是通过人类示范提供“教科书”,二是利用仿真打造“练兵场”。

财联社8月21日讯(记者郭松峤)“机器人本质上由AI驱动,而AI的发展高度依赖数据。有多少数据,尤其是有多少高质量数据,就有多少AI能力。”在2026世界机器人大会(简称WRC)上,宇树科技创始人、董事长王兴兴分享了人形机器人产业的发展方向。

目前,宇树科技正在加大机器人数据采集和模型训练投入。一方面,利用海量真人数据和互联网数据进行预训练;另一方面,通过真实机器人运行数据,让机器人进一步适应物理世界。

财联社记者WRC现场采访也了解到,具身智能从实验室的“炫技”走向工厂与家庭的“实干”,机器人的“四肢”已渐趋灵活,但其“大脑”仍严重缺乏理解物理世界的大规模训练数据。

今年大会上,与会企业不约而同地将焦点指向了同一个命题——为具身智能构建数据底座,已是产业规模化落地的当务之急。

在本届WRC上,京东云具身智能数据生态能力展台正式亮相,优必选等公司也已落地规模化数据采集中心。光轮智能在大会期间发布全球首个十万小时级全模态人类行为开源数据集。

“行业对数据的需求增幅达百倍乃至千倍”

业界普遍认为,2026年是具身智能从样机走向量产的关键年份。

致同发布《【致同咨询行业洞察】具身智能机器人行业研究》报告指出,随着头部产品在宝马、比亚迪等产线开展常态化实训,人形机器人正加速跨越从“实验室样机”到“产线生产力”的鸿沟。

但《报告》同时提示,这一进程具有明显的时间窗口属性,真实世界数据的采集效率与仿真到现实的迁移成功率,均可能对产业路径产生扰动。

事实上,数据缺口之大超乎想象。

光轮智能联合创始人兼总裁杨海波在接受财联社记者采访时表示,2026年是具身智能数据规模化的元年。行业对数据的需求正从去年的几百、几千小时,跃升到今年的上百万小时,增幅达百倍乃至千倍。

他进一步解释,不同于拥有互联网数十年文本积累的大语言模型,具身智能面对的是非结构化的物理世界,需要采集视觉、力觉、触觉等多维度交互信息。

记者了解到,目前行业共识是,实现可用的具身智能至少需要千万小时量级的多模态数据,而当前全球有效积累尚不足需求的5%。

如果说“量”的匮乏是显性危机,那么“质”的获取则更有难度。

墨奇智能联合创始人兼CTO黄青虬在接受财联社等媒体采访时指出,当前数据采集设备普遍面临精度与便携性的博弈:若要定位精度极高、动作捕捉精准,设备往往笨重不便携;若追求便携,捕捉精度又难以保证。

行业突围

财联社记者在WRC现场采访了解到,面对海量数据缺口,行业正从多个方向突围,一是通过人类示范提供“教科书”,二是利用仿真打造“练兵场”。

光轮智能在大会期间发布了全球首个十万小时级全模态人类行为开源数据集EgoSuite-Open100K。该数据集覆盖128类场景与超1.5万项任务,采用头、腕双视角采集精细操作与全身位姿信息。

杨海波对记者表示,当前具身智能迫切需要高质量、多样性、大规模的数据供给,而行业在采集口径、标注规范、数据格式和时序组织上存在差异,不同设备产生的数据难以组合复用。EgoSuite—Open100K的开放,旨在让更多开发者以统一、可复用的数据基础开展模型研究,构建开放繁荣的机器人持续学习生态。

在开放生态建设方面,光轮智能推出5年100亿具身智能数据共建计划,杨海波介绍了三项工作。一是开放数据标准:统一不同采集设备的数据模态、标注、时序、格式和质量标准,让数据具备跨设备、跨任务和跨模型复用的基础。二是评测驱动的数据闭环:从模型失败中定位数据需求,定向生成和补采数据,再通过基准评测持续检验模型提升。三是数据与模型协同设计:共同优化仿真数据、第一视角人类数据、遥操作数据与评测数据等的组合方式。

优必选则展示了另一条技术路线——自研全栈式技术体系。其自主研发的基座大模型Thinker,以“小参数、高性能、全开源”突破行业技术瓶颈,重点突破两大核心能力:一是机器人第一视角下的场景认知与任务规划能力,二是支撑物理交互的精准感知与空间理解能力。

聚焦高端科研工业赛道的源络科技同样值得关注。现场Monte02机器人完整展示长序列移液、微孔板自主转运、移液枪吸头装退等一系列标准化实验操作。

据了解,源络科技依托此前在国家级平台的落地实践,持续探索具身智能在自主实验室场景的落地应用,创新形成“白天人工精细操作、夜间机器人自主补位”的人机协同工作模式,有效提升科研设备利用率与实验室整体运转效率,让机器人深度扎根工业与科研实景场景。

源络科技工作人员对记者介绍,物理原生模型,能够让机器人自主识别实验的上一步、预判下一步,识别周边物体摆放位置,梳理整套实验流程,真正像人一样自主做实验。

具身智能数据采集技术的应用有哪些趋势?一位展商告诉记者,当前具身智能数据采集正从“单一路径依赖”走向“混合增强”。头部玩家普遍采用“仿真预训练+真实数据微调+遥操作兜底”的融合策略。同时,数据采集正从“人教机器”向“机器自主探索”演进,自监督学习和世界模型的引入,正在降低对人工标注的依赖。

普渡机器人具身智能产品线总经理吴翔对财联社记者表示,普渡已经通过规模化商业部署积累大量真实运行数据。截至目前,每年产生超过5000万小时真实运行数据,年导航数据3650万小时,年操作数据1580万小时。

“随着公司业务的持续增长和场景的不断拓展,每一台新增部署的机器人都意味着一个新的真实场景数据源。业务增长越快,新场景越多,数据回流越快,PuduFM的进化就越快,飞轮就转得越快。”吴翔表示。

致同报告强调,国家层面持续推进高质量数据集建设,叠加大模型在多模态感知领域的突破,使得机器人“看懂”世界的能力呈指数级增长。但需要看到,这一进程具有明显的时间窗口属性:真实世界数据的采集效率、Sim-to-Real(仿真到现实)的迁移成功率,均可能对产业路径产生扰动。率先搭建私有高质量数据飞轮的企业,将抢占通用具身智能能力涌现的先发优势。

大金融
财联社声明:文章内容仅供参考,不构成投资建议。投资者据此操作,风险自担。
商务合作
热门解锁
相关阅读
评论
发送
复制
取消
垃圾广告
政治激进内容
色情低俗内容
取消