返回新闻列表
17天前363

“数据饥荒”——具身智能面临的训练数据瓶颈

A
AI技术控

大语言模型时代有一句话叫“数据是新的石油”。到了具身智能时代,这句话需要改一改——数据不仅是石油,更是“稀缺的稀土”。具身智能(Embodied AI)指的是能在物理世界中感知、决策、行动的智能体,包括人形机器人、服务机器人、机械臂等。这类AI的训练数据和LLM有本质区别:LLM可以从互联网上爬取海量文本,但具身智能需要的是物理交互数据——机器人抓取杯子时的力回馈数据、行走时的平衡数据、避障时的路径数据——这些数据互联网上根本没有。

数据从哪来?三种采集路线各有短板

当前主流的数据采集方式有三种,但每种都面临瓶颈:

路线一:遥操作采集。人类通过VR设备或力反馈手套远程操控机器人执行任务,同时记录所有传感器数据。这是目前质量最高的数据来源,但效率极低——一个熟练操作员一天只能采集几十组有效操作数据。银河通用、智元机器人、达闼等公司都在做遥操作采集,但规模化仍然困难。

路线二:仿真数据生成。在Isaac Sim、Mujoco等仿真环境中自动生成大量数据。优势是量大管饱,单次生成可达百万级。但Sim2Real(仿真到真实)的迁移仍然存在鸿沟——仿真中的物理规律和真实世界总有差距,模型在仿真中表现完美,到了真实环境中可能会“水土不服”。

路线三:自主数据收集。机器人在实际环境中运行,从中采集数据。这需要机器人已经具备一定的能力,存在“先有鸡还是先有蛋”的问题。

数据饥荒的具体表现

第一,多样性不足。一个机器人抓取杯子的动作,在仿真中可以有1000种变形,但真实世界中的杯子有不同材质(陶瓷、玻璃、塑料)、不同形状(高脚杯、马克杯、保温杯)、不同状态(空的、半满的、满的),还有光照变化、背景干扰等。采集覆盖所有这些情况的数据,成本是天文数字。

第二,标注难度大。与自动驾驶的3D框标注不同,具身智能需要标注的是动作链——机器人每一步应该做什么,手部姿态应该是什么角度,施加多大的力。这种标注维度远远超出传统数据标注的范畴,目前甚至没有成熟的标注工具。

第三,数据采集成本高。一台人形机器人的价格在数十万到上百万元,搭配的遥操作设备(如力反馈手套、动捕服)也是天价。训练一个可落地的具身智能模型,需要数千甚至上万小时的交互数据,成本难以估量。

对标注行业的机会

数据饥荒意味着巨大的市场机会。2026年IDC报告显示,具身智能数据采集和标注的市场规模预计在2028年突破50亿美元,年复合增长率超过80%。

对于数据标注行业,具身智能意味着新的业务增长点:动作链标注(Action Chain Annotation)、物理交互标注(Physical Interaction Annotation)、仿真场景构建(Simulation Scene Building)等新工种正在涌现。率先进入这个赛道的公司,有可能在下一轮竞争中占据先发优势。

当然,门槛也很高——这要求标注公司不仅有图像/点云标注能力,还要懂机器人学、懂物理仿真。对于传统的2D标注公司来说,转型具身智能数据服务的难度不亚于重新创业。但机遇从来只属于敢于跨越门槛的人。

评论 (0)

登录 后即可评论

暂无评论,快来抢沙发~