具身智能的“数据焦虑症”,有治了?
在具身智能的产业链条上,有一个环节悄悄地火了。
1小时前
来源:中国电子报、电子信息产业网 姬晓婷  

在具身智能的产业链条上,有一个环节悄悄地火了。

近期,记者从多家做世界模型和数据采集业务的企业了解到,用于具身智能模型训练的数据采集设备正处于供不应求的状态。“我们的产品出货之前就被订走了。”某数据采集手套供应商告诉记者。

数据采集设备的爆火,映射出当前行业面临的关键卡点——尽管现有具身智能模型仍不够好,但训练模型的数据不够用了。

模型“吃不饱”

模型要可靠,需要大量高质量数据的积累。

大语言模型的更新迭代,靠的是取自互联网的、数量难以估量的训练数据。2019年,OpenAI训练GPT-2用了约800万网页、40GB文本;到GPT-3时,训练数据已从Common Crawl的45TB原始数据中过滤出570GB语料,规模跃升至约3000亿token。2023年Meta的LLaMA-1用了1.4万亿token,2024年的LLaMA-3已达15万亿。

国产模型的路径同样如此:阿里通义千问从2023年首发的约3万亿token,到2025年Qwen3的36万亿token,两年涨了十二倍。

短短四年多,主流模型的训练数据量跃升了几十倍。快速扩张的训练数据规模,是大语言模型能够实现有效且快速的迭代优化的重要条件。

更关键的是,这些用于训练大语言模型的数据,获取难度和成本极低。互联网上的文本——原始语料几乎是免费的。2008年成立的非营利组织Common Crawl持续抓取全网公开网页并免费开放。

但与大语言模型相比,具身智能模型所需的训练数据维度更多,其获取难度也更大。

大语言模型处理的对象,本质上是一串离散符号。无论输入的是一段代码、一篇论文还是一句对话,最终都会被切分成token,排成一条一维的序列。模型要学的规律也相对单纯:给定前面的token,预测下一个token。更关键的是,这个监督信号不需要任何人额外提供——文本自己就是自己的标签。互联网上任何一段文字,天然包含着可供学习的因果。

具身智能机器人独立完成玩具复原任务

但具身智能面对的,是完全不同性质的东西。

机器人每执行一个动作,需要同时处理一条多模态的时序数据流:摄像头拍下的RGB图像与深度信息、关节的角度与角速度、末端的位姿与受力、指尖触觉阵列传回的压力分布,有时还要叠加自然语言的任务指令。这些数据不仅模态各异、采样频率不同,还必须在同一个时间基准上严格对齐——视觉看到的那一帧,必须对应上触觉感受到的那一次挤压,对应上电机输出的那一组力矩。任何一路信号错位几毫秒,这条数据就可能沦为噪声。

这意味着具身智能模型的训练,也需要包含关节角度、指尖触觉阵列压力分布、手指位置等在内的复合型数据。而这些数据,并不躺在互联网上,而是需要通过专门的团队完成采集。

中兴通讯副总裁、人形机器人产品总经理崔卓在采访中直言,缺数据是当前行业面临的共性问题,但缺的不是一般的数据,而是高质量数据,也就是能够逼近工业级准确度的数据。

实采?仿真?

用于具身智能模型训练的高质量数据从哪里来?

实采是最朴素的方式:采集员佩戴或遥控专业设备,完成规定动作。但成本高、难以复用是这种数据采集方式面临的最普遍问题。根据中国机电一体化技术应用协会于7月发布的《2026中国具身智能产业发展报告》,传统遥操数据采集的成本约为每有效数据条10~50元,训练一个基本可用的机器人操作策略通常需要数万到数十万条数据。成本高、效率低便成了采集具身智能模型训练所需数据面临的最大挑战。

为了快速弥补模型训练数据不足的问题,产业界给出了采用仿真数据完成训练的解决路径。但仿真数据能用多少、怎么用,产业界有着不同的判断。

国内某企业展示采用IMU方案的数据采集手套

在崔卓看来,用于模型训练的数据中真实数据和仿真数据的比例可以达到约1:9。也就是说,在数据集中,约80%到90%的数据可以来自于仿真。崔卓表示,仿真数据可以生成现实中不好模拟的场景(如处理着火现场等),且能够助力团队极大地缩短机器人在现实场景中完成任务的前期训练时长。诸如插网线、插硬盘这样的任务,以前需要6到9个月部署,现在在通用模型的基础上做强化训练,只要在产线上训练半个小时,便能达到预定效果。

但对于仿真数据的使用,千觉机器人创始人、首席科学家马道林则给出了不同的观点。他给出了一个反直觉的观察:仿真在预训练阶段很方便,但一旦进入大规模训练,效率和成本并不比无本体采集这一类方式更高效。

所谓无本体采集,是指不依赖完整机器人本体、由人手持设备直接操作采集的数据。它的优势马道林概括为两点:数据足够真实,场景铺得开。他甚至提到:“仿真中搭建一个逼真场景的效率有时候比真实的高,有的时候其实还不如真实采集来的高。”

还有其他良方?

马道林指出,在实采真实数据和低成本规模化的仿真数据之间,还有一个中间地带——“数据增强”。简单说,就是替换实采数据中的部分内容,让一条原始样本衍生出几十条变体。

最常见的做法是在视觉层做变换:在实采操作视频的基础上调亮度、对比度、色温,给画面替换不同的背景,从干净的白墙换成杂乱的车间、从日光灯换成自然光。更进一步,还可以对机器人抓取的物体进行抠除与重排——把红色杯子换成蓝色茶杯,把杯子从画面左侧挪到右侧,或者在画面中增加一个无关的干扰物。一条“抓红色杯子”的原始数据,由此衍生出“抓蓝色茶杯”“在有干扰物的情况下抓杯子”等变体,迫使模型去学“抓”这个动作的本质,而不是记住“红色杯子在画面中央”这个特定模式。

人形机器人模拟流水线工作

视角变换和物理参数扰动,则是更高阶的数据增强手段。视角变换,是用3D重建技术将实采的多视角视频重建出3D模型,再从任意新视角渲染训练数据,一条正面拍摄的操作数据可以生成侧面、顶部甚至斜后方的画面。物理参数扰动最难做——在仿真环境中加载从真实数据重建的3D场景,扰动质量、摩擦系数、弹性模量等参数,让“抓杯子”变成“抓更重的杯子”“抓更滑的杯子”。但这层增强的扰动范围极难控制:偏离真实太多,数据反而会误导模型;偏离太少,又起不到泛化作用。

数据增强的价值,可以从三个维度来理解。其一,它大幅降低了单条训练数据的获取成本——一条真实样本“繁殖”成几十条,分摊了采集费用。其二,它补齐了纯仿真数据“不够真”的短板——数据增强的素材底子是真实采集的,变换只是在真实底子上做有限扰动,与真实世界之间的差距比纯仿真小得多。其三,它能系统性地制造模型没见过的“边缘情况”——人不可能把所有光照条件、背景杂物、物体位姿都采一遍,但数据增强可以。

行业实际在用的具身智能模型训练数据,更像是一份“鸡尾酒”配方。也就是把无本体采集数据、真机采集数据、仿真数据、按比例混合。在此基础上,数据增强使每一条实采数据撑起更大的训练体量,在总预算不变的情况下,优化效率、提升成本。

最新文章
1
具身智能的“数据焦虑症”,有治了?
2
除菌新国标元年:冰箱健康竞争进入可验证时代
3
长鑫宣布LPDDR6首发小米18 Fold,量产节奏与国际巨头同步
4
七部门发文推动商品消费扩容升级至60万亿元,涵盖家电行业
5
传统空调代理商突围:在价格战与AI浪潮中寻找出路
6
9 月新品潮来袭:荣耀 Magic9、MagicPad4、手表 6 Pro 扎堆登场
7
机身更薄,电池更大 三星超轻薄机型S27 Edge有望回归
8
iOS 27“iPhone接力”曝光:两台iPhone可共用同一手机号自由切换
9
存储成本暴涨近400%!iPhone 18 Pro系列预计涨价10%-20%
10
289元起!小米手环11开启预约:首发澎湃OS 4、对苹果生态用户友好
11
厨电小家电半年报承压,AI不是万能解药
12
宇树科技上市后的下一程:让机器人自我进化
13
全球出货量第一、率先规模盈利,宇树科技登陆A股锚定具身智能产业坐标
14
2026快手光合大会AIGC分论坛:四项专属政策激励优质AIGC内容创作
15
快手H.266/VVC视频解码核心专利获中国专利银奖
16
2026快手新知创谈会落地武汉,与优质泛知识创作者共话运营方法论
17
2026快手光合创作者大会:深耕多元特色生态,让好内容、好作者获得确定性成长
18
赋能作者多元变现,加码机构长效深耕,快手内容商业生态创造更多新机遇
19
用普通LED“冒充”Mini LED?全球电视一哥这次有点被动
20
你会第一时间升级iOS 27吗?你的机型是什么?
关于我们

微信扫一扫,加关注

商务合作
  • QQ:61149512