1816件/时,超美国Figure AI 45%效率:自变量夹爪如何让物流分拣进入“脑力”时代

作者:智涵      时间: 2026-08-18      浏览数:7527


dd094f3535174654a9c0a494988738f2.png

分析师/智涵

校对/Tina
策划/Eason

2026年8月12日,中国某物流产线,一场持续一小时的直播没有预兆地引爆了行业。

传送带上,形状、大小、材质完全随机的真实包裹源源不断地涌来。没有筛选,没有预处理——纸箱、泡沫箱、圆筒状快递、柔软衣物包裹混杂在一起,摆放姿态和面单位置毫无规律。两台机械臂搭载标准夹爪,在全程无人工干预的情况下连续分拣。一个小时,1816件,超过美国具身智能企业Figure AI此前公开展示的每小时1248件,提升约45.4%,准确率超过98%。而硬件成本仅为对方的三分之一。

这不是实验室里的极限测试。这是一条真实的物流产线,处理的是真实的、随机的、未被筛选过的包裹。这也不是一场单纯的效率竞赛。当Figure AI用搭载16个自由度、集成触觉传感器的昂贵五指灵巧手在仓库里分拣标准纸箱时,自变量用成本不到三分之一的夹爪,在更复杂、更混乱的真实产线上,干得更快、更稳、更便宜。

更值得关注的是两者截然不同的技术路线。相比“人形机器人+五指灵巧手”的复杂硬件方案,自变量使用更加简洁的双机械臂和夹爪,硬件成本降低约70%,同时能够处理更加随机、复杂的真实包裹。

驱动简洁硬件完成更复杂的任务,背后关键在于更聪明的“具身大脑”。自变量展示的不仅是物流分拣效率的突破,更是国产具身智能企业面对美国企业的路径超越——凭借具身模型能力的提升,打破美国企业“以硬件复杂度决定性能上限”的惯性,为具身智能应用探索出一条可规模化复制的产业路径。

01
三重壁垒:物流分拣为什么
难倒最聪明的机器人


物流分拣,外行看是抓取与搬运,内行看是另一回事。

Figure AI那场持续200小时的全球直播,让世界看到了一台人形机器人可以在仓库里连续工作。但很少有人追问一个更具体的问题:它到底在分拣什么样的包裹?答案藏在直播的细节里——软包仅颜色不同,大小厚薄几乎一致,纸盒也只有两种标准规格。包裹整齐地排列在传送带上,等待机器人翻面、扫码、投放。

这当然是一项了不起的工程成就。但真实物流产线的难度,远远超出这场直播所呈现的“标准答案”。

第一个难点,来自包裹本身。在真实的物流线上,你永远不知道下一个包裹长什么样。纸箱、快递软袋、衣物包裹——大小、重量、材质、形状,每一件都不一样。泡沫箱、圆筒状快递、不规则的软包,这些在Figure直播中几乎从未出现的“异形件”,恰恰是真实产线的日常。

第二个难点,来自流程本身的随机性。机器人不仅需要抓起包裹,还要判断面单位置,把它调整到能够被扫码识别。Figure的直播假设的是“单面扫”模式——把包裹翻过来,让条形码朝下。但中国物流产线普遍采用“五面扫”,只要条码不朝下就能识别。这意味着机器人的判断逻辑完全不同。

更麻烦的是异形件。圆筒状快递上了分拣小车可能翻滚卡住,泡沫箱稳定性差无法进入下一环节。这些包裹必须被单独挑出来。直播中,工作人员故意把一个毛绒玩具放上传送带——这个玩具在机器人的物流任务中从未出现过。面对这一突发情况,机器人首先要识别出它是什么,再据此推理该如何处理。但可以看到,机器人依旧快速且准确地完成了识别,并将其归入异形件类别。

第三个难点,来自真实环境本身。南方物流中心夏季室温最高可达46℃~47℃,这对任何电子设备的稳定性都是极限考验。不同物流中心的空间布局、光线条件、设备型号千差万别,新老设备混用更是常态。分拣员还需要识别破损、漏液等异常件——这些在直播中均未出现。

Figure AI用200小时证明了一件事:在高度标准化的测试环境中,人形机器人可以连续工作。但它没有证明另一件事:在真实的、无序的、随机的物流产线上,它能不能同样可靠?而今天自变量机器人直播证明了这件事。

02
三条路线:行业的不同选择


面对上述三重挑战,具身智能行业正在分化出三条截然不同的路线。

第一条路线是“硬件堆叠”——以复杂换能力。Figure AI是这条路径的典型代表。人形双足构型、16个自由度的五指灵巧手、集成触觉传感器可感知低至3克的微小受力。这条路线的信仰是:让机器人无限逼近人类的身体能力,用硬件复杂度换取操作的精细度。代价同样清晰——单台BOM成本约8.5万美元以上,灵巧手作为最贵组件占整机BOM的14%-18%。一台机器人售价预计3万美元起,对于需要规模化部署的物流行业,这个数字意味着漫长的投资回报周期。

第二条路线是“轮式+夹爪”——以务实求落地。高盛在2026年5月调研了14家中国机器人企业后明确指出:“多数企业现阶段优先采用轮式底盘搭配二至三指夹持器方案,可覆盖70%-90%工业应用。”这条路线承认一个现实:在2026年这个时间节点上,与其追求“像人”的终极形态,不如用最少的硬件解决最真实的问题。

第三条路线是“模型定义硬件”——以简驭繁。自变量是这条路径的代表。不依赖不断堆叠硬件能力,而是提升基础模型能力,让机器人学会利用更简单的硬件完成任务。自变量此次采用的标准夹爪,结构简单、零部件少、稳定性高、维护更容易。“换这个夹爪,就跟F1赛车换轮胎一样,几分钟以内就能完成切换。”双机械臂可直接嵌入现有分拣工位,无需大规模改造产线——整个架子一体化设计,30分钟就能完成一台机器的产线适配。

a90ff048eb6f1c93346a453ca308ff02.png

三条路线,三种判断。一条押注硬件的极致,相信“像人才能替代人”;一条押注场景的务实,相信“能用才是硬道理”;一条押注模型的进化,相信“聪明的大脑可以驾驭简单的身体”。自变量用8月12日的直播证明:第三条路线不仅可行,而且正在以更低的成本、更高的效率超越第一条路线。

03
三个维度:自变量如何实现
对Figure AI的全面超越


这场超越不是口号。把两家在真实产线上的表现摊开来看,差距落在三个具体的地方。

效率上,单台3.5倍。Figure 03在200小时内累计分拣249560件包裹,平均每小时1248件。自变量创造了一小时分拣1816件包裹,成功率98%的纪录,效率相比 Figure AI提升45%以上。

成本上,下降70%。Figure 03单台BOM成本约8.5万美元。自变量方案的整体成本相比Figure的人形机器人加灵巧手方案,下降了70%以上。差距的源头在硬件结构上——一个灵巧手拥有16个自由度,每个关节都需要精密电机、传感器和控制系统。而一个标准夹爪,结构简单到"坏了直接换"。灵巧手占人形机器人整机BOM的14%-18%,是拖累整机量产的第一瓶颈。

场景上,异形件vs标准件。这是最本质的差异。Figure的直播中包裹规格高度统一,软包仅颜色不同,大小厚薄几乎一致,纸盒也只有两种标准规格。而自变量处理的是真实物流产线的随机来料——标准纸箱与泡沫箱、圆筒、软包等异形件混杂。机器人不仅要分拣标准件,还要自主识别异形件并推入异形槽。一个处理"标准答案",一个处理"意外"——这才是真实产线与实验室的本质区别。

效率更高、成本更低、场景更复杂——自变量用一套更简洁的硬件,在真实产线上跑出了更漂亮的数据。但问题也随之而来:一台没有灵巧手的机器人,凭什么能做到这些?

答案是:它有一个更聪明的“大脑”。

04
一个大脑:WALL-B如何让简单硬件
完成复杂任务


硬件只是身体,大脑才是灵魂。支撑这套技术路线的核心,是自变量自主研发的世界统一模型WALL-B。

与Figure AI采用的Helix VLA架构不同,WALL-B走了一条完全不同的路。VLA的本质是三个独立模块的拼接——视觉模块识别物体、语言模块理解指令、动作模块生成轨迹,数据在模块之间逐级传递,每经过一次边界就发生一次损耗和延迟。

而WALL-B基于世界统一模型架构,将视觉、语言、触觉、动作、物理预测等所有能力放在同一个神经网络中从零开始联合训练,实现了“多模态进、多模态出”的原生融合。就像苹果M1芯片的统一内存架构让CPU和GPU共享同一块数据池、消除了搬运损耗一样,WALL-B消除的是模块之间的信息壁垒。

image.png

这一架构带来的核心能力,可以归结为两个关键特征:

理解物理世界。 WALL-B能够让机器人感知并预测重力、惯性、摩擦力等基本物理规律。面对一个陌生包裹,机器人能判断它能否直接夹取、推动后是否滑动、翻转时是否掉落,应该用单臂还是双臂。这些判断不是依靠工程师预设的规则,而是来自模型对物理世界的原生理解。直播中有一个片段,一个包裹卡在传送带边缘,机器人先处理了另一个,再回头把它“救”回来——“这个过程都是通过模型已经有的认知能力去处理的,不是提前编程好的。”

更值得注意的是,WALL-B的能力并非针对物流场景专项训练而来,而主要来自预训练阶段形成的通用物理理解。这意味着机器人进入新的场景时,不必从零学习,而是基于已有的能力快速适应。整个感知决策执行的闭环只需要几十毫秒——三个摄像头实时将图像输入模型,模型直接输出每个关节的角度,预测下一秒的动作。机器人采用异步执行机制,执行上一个动作的同时已经在推理下一步。

与世界交互并自我进化。 在真实任务中,机器人持续经历“观察环境—选择动作—预测结果—执行验证”的闭环,不断积累和优化有效策略。直播中那些让观众眼前一亮的处理方式——轻质小件直接夹取、重箱侧面推移、软包先摊平再调整——并非工程师逐一教授,而是机器人在实际分拣过程中自己摸索出来的。在部署阶段,团队还会采集困难案例做在线强化学习,让模型在真实产线上越用越好。

这种“边干边学”的能力,让WALL-B区别于市面上几乎所有机器人模型。大多数机器人任务失败后就地停止、返回错误代码,无法从失败中学习。WALL-B会在失败后调整策略再次尝试,成功后把经验沉淀到模型参数中。机器人不需要工程师重新训练、不需要人工注入数据,在真实环境中完成自我迭代。

硬件是身体,大脑是灵魂——而WALL-B这颗大脑的特别之处在于,它并不是只为“分拣”这一件事而生。事实上,在走进物流产线之前,它已经在另一个完全不同的场景里证明过自己了。

05
两种验证:从家庭到物流,
同一个大脑跑通两个极端场景


如果说物流分拣验证的是效率的上限,那么家庭服务验证的就是泛化的边界。

今年4月,自变量与58到家达成合作,推出机器人上门家政服务。搭载WALL-B的机器人进入真实家庭,与保洁员协同完成清洁、收纳等任务——这是全球首个“机器人进家庭”的大规模应用。同一时期,自变量与国内头部物流企业展开合作,将分拣方案部署到真实产线,实现常态化、规模化运行。

两个场景,两张考卷。

家庭考验的是泛化能力——每一户的户型不同、家具摆放不同、物品位置不同,任务本身也是开放式的。机器人面对的是从未见过的环境,需要在不预设条件的前提下理解任务、自主决策。物流考验的是效率能力——包裹源源不断地涌来,每一件都不一样,但每一件都要在极短时间内被准确处理。两个场景,一个要求“什么都能应付”,一个要求“什么都要快准稳”。

image.png

有意思的是,驱动机器人完成这两类任务的,是同一个WALL-B模型。从家庭服务到工业分拣,WALL-B完成了一次跨场景的迁移和复用。这种迁移能力,正是通用具身模型区别于“专用设备”的核心标志。

这对产业化的意义很直接:如果机器人每进入一个新场景都要重新训练一套模型、重新编写大量规则,那就还是传统自动化的逻辑,谈不上规模化。当同一个“具身大脑”能够复用已有的物理理解和任务能力,落地才可能从“做一个项目”变成“铺一个行业”。

家庭和物流,两个场景各自走通,验证的其实是同一件事——通用具身模型正在成为一种可复用的底层能力。当两个截然不同的场景都能用同一个大脑跑通,规模化落地的路径就已经清晰了一半。

06
结语:务实者先上岸


回看8月12日这场直播,它真正的意义不在于“1816件/小时”这个数字本身。数字可以被刷新,但数字背后关于技术路线、关于成本结构、关于商业化节奏的判断,才是真正值得被记住的东西。

当前的具身行业正在经历一场从"秀肌肉"到"干粗活"的范式转换,自变量的1小时直播,是一场真实的产线验收。

有人押注硬件堆叠——人形本体、五指灵巧手、16个自由度,每一个关节都在诉说技术的极限。

有人押注模型能力——标准夹爪、双臂构型、三个摄像头,用最少、最便宜的硬件,解决最真实的问题。

两条路径,没有对错,只有快慢。但通往商业化的路上,有一个朴素的判断标准:谁能用更低的成本、更高的效率、更可靠的方式,解决客户最真实的问题?

最终能抵达彼岸的,不一定是硬件最复杂的,而是看得最透、学得最快、扎得最深的。

当行业还在争论"像不像人"的时候,自变量已经在回答"能不能干活"。这场直播验证的,不仅仅是一条技术路线的可行性,更是国产具身智能在通往商业化道路上一个值得被记住的节点。


北京第一新声信息咨询有限公司 版权所有(C)2024 京ICP备2024089855号-1

第一新声商务经理 Sherry
Tel:18910717116

第一新声商务经理 Sherry
Tel:18910717116

第一新声研究客服 Kim小严

第一新声编辑客服 Tina

第一新声运营经理 孟小新