具身智能的数据墙:采得到,更要采得准
实验室里 89% 能完成的抓取任务,放到真实住家环境,完成率只剩 12%。
这不是某家的个别事故,而是具身智能整个行业都要面对的现实。2026 年 WAIC 把人形机器人称作「部署态元年」,会场里最热闹的展区就是它们。可热度归热度,从实验室 Demo 到真实量产,中间隔着的不是算法突破,而是数据——真实世界里、带着力觉与触觉、能复现千百种家庭与工厂场景的那一类数据。缺了它,再聪明的「大脑」也只是一具不会干活的身体。
机器人卡住的,是仿真到现实的那道缝
具身智能的训练长期依赖仿真。在虚拟环境里,一个抓取任务的成功率能到 89.4%;可一旦换到真实家庭,这个数字会掉到 12%。这中间的落差,行话叫 sim-to-real gap——仿真世界是理想化的:光线恒定、地面平整、杯子永远摆在正中间;真实世界却处处是扰动,物体可能歪着、反光、被别的东西挡住一半,被碰倒后还会引发连锁反应,更别说人手一推一挡带来的不确定性。仿真教会机器人「该怎么做」,却没教会它「世界会怎么反推回来」。
更麻烦的是量级。行业估算,把一个通用机器人真正训好,需要的真实交互数据在千亿小时的量级,而今天全行业攒下来的真实数据大约只有 50 万小时。这道缝,不是靠堆算法能填上的。
数据采集的「不可能三角」
质量、规模、成本,这三件事在真实数据采集里几乎无法同时达标,从业者管它叫「不可能三角」。高质量的真机数据要靠人戴着设备一遍遍遥操作演示,成本高、采集慢;仿真数据可以无限生成,却始终带着迁移误差;互联网视频量大又免费,偏偏缺了触觉和力觉这个物理闭环。
正因为此,2026 年行业出现了一批「数据工厂」,打法各有侧重。京东与宇树以自有本体做真实场景采集;大晓开源了 200 个任务、1700 万帧的 L5 级数据集,试图把真实家庭变成机器人的训练场;灵初智能走得更激进——用自研外骨骼手套把采集成本压到传统真机方案的十分之一、精度做到亚毫米级,2026 年要把人类操作数据的采集量级拉到百万小时;智元在上海投建了 4000 平方米的数据工厂,复刻五大真实场景,近百台机器人日均产出 3 万到 5 万条轨迹,累计已超百万条。这正是「数据工厂」最直白的样貌。
但这里有个前提值得留意:今天的「数据工厂」大多在补「规模」与「成本」这一侧,真正稀缺的是数据质量——视觉、触觉、力觉与本体感觉是否在同一条时间轴上精确对齐,失败案例是否被刻意采集,数据分布是否覆盖了模型的薄弱环节。方向已经清楚了:与其先造更聪明的「大脑」,不如先把数据这道关过好——既要采得到,更要采得准。
急着上市的机器人,账还没算进真实场景
资本比技术跑得更快。宇树科技冲刺「人形机器人第 一股」,8 月 5 日确定发行价、8 月 10 日启动打新,初始市值约 420 亿元,2025 年已在全球出货超 5500 台、市占率 32.1% 居首;行业测算 2026 年中国人形机器人出货量有望突破 10 万台。看上去,量产元年是真的到了。
但同一批公司的账还有另一面:相当一部分收入仍来自科研教育等非工业场景,而不是真实的产线或家庭。机器人卖去的地方,和它真正要解题的地方,还不完全是一回事。也不是没有真干活的——Figure 的 Helix-03 已实现超 30 小时连续作业分拣,智元 2026 年 3 月累计下线 1 万台——只是规模还小,离「进千家万户」差着的正是那道数据墙。
不断松动的数据墙
这道墙,其实已经开始松动。过去半年,在真实数据上发力的,不只有模型公司。
最直观的是适配变快。谷歌 DeepMind 7 月底发布的 Gemini Robotics 2,把控制从桌面夹爪扩到人身全身,一个新本体适配只需数小时,而不是过去的数月。几家公司接连把真实数据开源出来,单家就有百万小时级的规模。
比堆量更关键的,是有人开始专攻「质量」。际数科技把测绘的误差分析搬进机器人数据,在智驾领域已把客户的可用数据比例从 10%–20% 抬到 70%–80%,两个人加一套智能体顶得过三百人标注队。它 2026 年切进具身智能,逻辑很朴素:家庭对人机交互包容度最高,每一次人类纠正都是高价值数据。当合格率本身能单独计价,数据墙就从「采不够」转向了「采得准」。
这些动作背后是一条正在成形的正向飞轮:部署越多,真实数据回流越多,模型迭代越快,能落地的场景也越广。机构测算,中国人形机器人出货有望从 2026 年的约 5 万台增至 2030 年的 44.6 万台,市场规模从 20 亿美元走到 150 亿美元。行业正在从「讲概念」切到「看订单」。
作为一门刚起步的产业,具身智能离真正稳定地走进工厂和家庭还有距离,但这恰恰是可期待的地方。当真实数据像水电一样在机器人之间流起来,今天展台上拧灯泡、扎垃圾袋的演示,才会变成明天产线上和客厅里那双稳定的手。今年撞上的这道墙,将会成为它为下一阶段打的地基。