数码影音频道 频道

国产具身智能公开实测创纪录,1小时分拣1816件包裹、效率超海外标杆45%

“AI摘要”

国产具身智能企业自变量机器人在直播实测中,以双臂加标准夹爪方案实现1816件/小时物流分拣效率,较海外标杆提升超45%,硬件成本下降约70%,准确率达98%。实测模拟真实仓储随机包裹与姿态,考验模型泛化能力。其核心是WALL-B世界统一模型,从底层融合多模态感知与动作,实现临场决策。该路径显示模型能力可替代硬件堆叠,推动具身智能规模化落地。

国产具身智能企业自变量机器人昨日(8月12日)举行了一场「夹爪方案挑战1248件/小时物流分拣」公开直播实测,双机械臂加标准夹爪的机器人连续作业1小时,分拣效率达到1816件/小时,较海外标杆企业此前公开的1248件/小时平均效率提升超过45%,全程无人工接管、无固定脚本。

这场实测最具冲击力的地方在于硬件方案:仅凭双臂加标准夹爪,既没有搭载五指灵巧手,也没有依赖人形本体,硬件成本较对手的人形机器人加灵巧手方案下降约70%,分拣准确率仍达到98%的行业前沿水平。以更低成本跑出更高效率,正在成为国产具身智能规模化落地的一条新路径。

实测工况:随机包裹与随机姿态拉满难度

与海外标杆此前直播测试中以规整标准包裹为主、抓取条件相对可控不同,这次直播直接复刻了真实仓储现场最棘手的变量:传送带上的包裹完全随机混合,纸盒、快递软袋、圆柱形快件乃至泡沫封装的生鲜件同时出现,形态、重量和尺寸差异明显;所有包裹均保持随机姿态摆放,没有刻意摆正,还原了人工投放后的真实状态。

图:机器人通过机械臂搬运货物,展示分拣作业场景

这意味着固定点位和预设轨迹基本派不上用场,机器人必须根据不断变化的情况实时完成识别、判断、规划和抓取,成为对具身智能模型泛化能力的一次直接检验。直播中可以看到,面对同一条传送带上的包裹,夹爪几乎没有重复执行同一套搬运动作:重量较轻、形态规整的包裹直接抓取搬运;较大较重的箱体切换双臂协同;夹取条件不理想的箱体则从侧面逐步推移,在保证效率的同时降低包裹受损风险。

「面单整理」环节更考验临场应变

分拣过程中的「面单整理」环节,把这种随机应变能力体现得更加明显。小件包裹借助惯性快速翻转提高效率;重量更大的包裹分步骤缓慢调整,避免受力过猛导致偏移;衣物类软包这类易变形物体,夹爪会先通过拨动、展开等动作让包裹恢复平整,再寻找并校准面单位置。

看似简单的一次翻面,背后实际包含了对物体材质、重量和形变特性的判断,以及对应的动作规划与力度控制。整场直播连续作业期间没有出现故障停机,机器人一边感知、一边决策、一边调整动作,最终把成绩定格在1816件/小时。

模型大脑:WALL-B世界统一模型撑起临场决策

真正支撑这套朴素硬件跑出高分的,是藏在机器人背后的具身智能「大脑」——全球首个基于世界统一模型(WUM)架构的具身智能大模型WALL-B。过去几年具身智能行业最主流的技术路线是VLA架构,把视觉、语言和动作连起来,但VLA擅长照着指令执行,却很难真正理解复杂物理世界,模块之间数据来回传递还会产生损耗。

WALL-B选择了一条更底层的融合路径:从底层打通视觉、听觉、语言、触觉与动作,让感知、理解和执行在同一个网络中协同完成。基于原生多模态能力,机器人能快速识别包裹的形状、姿态和位置;基于对物理规律的理解,还能提前预测不同动作可能带来的结果——直播中遇到两个包裹叠在一起的突发情况,机器人判断出直接抓取并不适合,临时调整策略先分离再逐个分拣;基于零样本泛化能力,面对此前没见过的纸箱、软袋或异形件,也能调用已有物理认知和操作经验临场组合出新的处理策略。

行业启示:模型能力替代硬件堆叠

对具身智能来说,硬件形态一直存在取舍。人形本体、五指灵巧手等方案自由度更高、能覆盖更多复杂动作,但也带来更高的硬件成本、更复杂的维护要求和更长的部署周期。这场实测展示的是另一条路径:随着模型承担更多环境理解、任务规划和动作决策任务,机器人未必需要依靠不断增加硬件复杂度来解决问题。

双机械臂搭配工业标准夹爪,省去了利用率相对较低的人形结构和复杂末端执行器,减少了精密关节校准、硬件维护等额外成本,还能直接适配现有物流分拣工位,无需大规模改造即可快速部署。作为国内较早采用端到端路线研发通用具身智能大模型的公司之一,自变量机器人此前已把WALL-B带进真实家庭环境训练,让机器人在一次次真实交互中积累经验,这次从家庭走向工业物流,同一套模型能力正在跨越差异巨大的应用环境。

随着预训练具身模型持续演进,机器人或许无需围绕每个场景单独开发,而是依靠不断增强的模型能力持续理解新环境、学习新任务。由模型能力驱动泛化、走向规模化落地,这条中国具身智能路径正在被更多真实场景验证。

0
相关文章