博客 报亭 音乐
我的阅读

    零样本干活!Figure 机器人走进 30 个陌生家庭,整理客厅、折毛巾、铺床

    钛媒体 2026-09-18 15:08
    ⏎ 返回 ⭢阅读原文

    (本文作者为 AGI-Signal、智客ZhiKer,钛媒体经授权发布)

    人形机器人真正走向家庭,难点或许从来不是“会不会做家务”,而是换一个家庭之后,它还能不能继续做。

    9月17日,美国人形机器人公司Figure发布了Helix 2.5,将其称为Figure 构建的最先进的神经网络。这一次,Figure把测试场景从熟悉的实验室搬到了30个此前没有见过的家庭,让机器人直接面对不同的房间布局、家具和物品,并完成整理客厅、折叠毛巾和铺床三项任务。

    Figure披露,在这30个家庭的测试中,机器人没有提前采集环境数据,也没有针对这些家庭进行微调。最终,经过其人类行为数据集Index预训练的模型,在零样本测试中的完整任务成功率达到56%;作为对照,从零开始训练、其他条件保持一致的模型,成功率只有9%。

    这组数据背后,Figure真正想展示的并不是机器人又学会了几个家务动作,而是机器人能否把从过去数据中学到的能力,迁移到一个此前从未见过的真实环境中。

    这也是Helix 2.5此次发布最值得关注的地方。

    Figure把机器人带进30个陌生家庭

    过去几年,人形机器人最常见的能力展示,是在一个相对可控的环境中完成一系列预先设计好的任务。机器人能够走路、抓取、搬运,也可以折衣服、整理物品甚至操作厨房设备,但这些演示背后往往有一个容易被忽略的前提,机器人已经对所在环境进行了充分训练。

    现实中的家庭显然不是这样。

    同样是一张床,不同家庭的床垫高度、床架结构和房间空间都可能不同;同样是一条毛巾,大小、厚度和材质也存在差异。对于人类来说,这些变化并不会改变我们对铺床或者折毛巾这件事情的基本理解,但对机器人而言,每一种变化都可能意味着一个新的训练变量。

    Figure选择的三个看起来并不复杂场景:整理客厅、叠毛巾和铺床

    难点在于,Figure并没有把测试条件设置得很规整。客厅里的玩具和小型物品,形状、大小、硬度和材质各不相同;毛巾有不同的尺寸、颜色、厚度和纹理;床铺则使用了不同材质、重量和颜色的床罩、被子和枕头。

    不仅物体不同,环境也不同。每个家庭都有自己的家具、地面、灯光和操作空间,床的高度、床架结构和离地间隙也存在差异。甚至物品一开始怎么摆放,Figure也没有进行统一控制:玩具被随意扔在地板、沙发和桌子上,毛巾被随手丢在桌面,被子和枕头则被故意弄乱。

    也就是说,Figure测试的并不是“机器人能不能把一条固定毛巾叠起来”,而是换一条没见过的毛巾、换一个没见过的桌面,它还能不能完成同一个动作。整理客厅也是如此,机器人需要先在陌生房间里找到13至15件物品,再从不同位置将它们收进篮子;铺床则要求机器人围绕床移动、放置枕头,并整理和拉紧床罩。

    这些任务共同的特点是,它们并不存在一套完全固定的动作路径,同时考验视觉感知、移动、抓取、双手协同以及全身控制能力,Figure将这种能力称为whole-body intelligence,即全身智能

    目前大多数关于机器人泛化能力的研究都是在围绕机器构建的环境中进行的。桌面机械臂的工作空间是固定的;轮式机器人需要足够的开放空间来容纳和转弯。而家庭环境则不具备这样的条件。人形机器人必须在家庭环境中移动,调整身体位置,才能观察、够到并操作其他外形尺寸的机器人无法进入的狭小、杂乱空间中的物体。

    Figure公布的结果是,Helix 2.5在30个陌生家庭中,三个任务的完整任务成功率达到56%。作为对比,从零开始训练、没有经过Index预训练的模型,成功率只有9%。Figure称,使用Index进行预训练后,模型的零样本任务成功率提高了6倍以上。

    据报道,Helix 2.5 是首个在家庭环境中,面对从未接触过的物体,零次尝试就实现这一目标的系统。

    这组数据当然还不足以说明人形机器人已经真正实现了“开箱即用”。30个家庭、3类任务仍然是一个有限的测试范围,而且这些任务主要集中在家庭环境。但从实验设计来看,Figure这次试图回答的问题已经发生了变化,机器人不只是要学会某项技能,还要学会把技能带到一个没见过的地方。

    如果一个模型只能在训练过的房间里整理玩具,那么它更像一个经过高度优化的自动化系统;如果它进入一个从未见过的家庭,面对不同的家具和物体依然能够完成相同任务,那么机器人基础模型的价值才真正开始显现。

    Helix 2.5此次发布,Figure显然更希望外界关注后一个问题。

    让机器人学习“人类怎么做事”

    Helix 2.5之所以能够在陌生环境中表现出一定的泛化能力,背后还有一个重要变化,Figure开始把人类行为数据放到了机器人预训练的核心位置。

    今年8月,Figure推出了名为 Index 的数据平台,并将其定义为全球规模的人类行为数据集。按照Figure此前公布的信息,Index已经覆盖108个国家,拥有超过4.4万名周活跃数据贡献者,累计上传超过1600万段视频,数据来源覆盖家庭、餐厅、物流、工厂和办公室等真实环境。

    与传统机器人数据集不同,Index并不是单纯记录“机器人完成某个任务”的数据,而是先大量收集人类在物理世界中的行为,再让机器人从这些“人类经验”中进行基础预训练。

    这背后的逻辑并不难理解。一个人第一次走进陌生的房间,并不需要提前接受“这个房间应该怎么走”的专门训练。看到桌子、椅子、床和地面之后,人类已经拥有足够多的生活经验,可以根据具体环境决定下一步怎么行动。即使没有见过这张床,人也知道怎样铺床;即使没有见过这条毛巾,也知道怎样把它折起来。

    Figure希望机器人也能够获得类似的经验。因此,Helix 2.5从随机初始化开始,完全使用Index进行预训练;之后再通过任务数据,让同一个基础模型分别适配整理客厅、折叠毛巾和铺床三个任务。

    这实际上改变了过去机器人训练的一种常见思路。传统的机器人学习往往围绕具体任务展开,想让机器人学会叠毛巾,就采集大量叠毛巾的数据;想让它学会整理房间,就继续采集整理房间的数据。这样做能够快速提升特定任务的表现,但当机器人换到另一个环境,或者遇到没有见过的物体时,往往又需要补充新的数据。

    Figure希望把这件事情前移。在具体学习“叠毛巾”之前,机器人先通过大量人类行为数据,学习人类如何观察环境、移动身体、操作物体以及完成连续动作。这样,当任务发生变化时,模型不需要从零开始理解整个物理世界,而只需要在已经形成的基础能力上进行适应。

    Figure此次的对照实验,正是为了验证Index在其中发挥了多大作用。Figure在 Index 数据集的嵌套子集上训练了四个模型,预训练数据规模扩大到原来的8倍,机器人动作预测的loss随着数据增加持续下降,并且呈现出较为稳定的变化趋势。Figure据此提出了所谓的“human-to-humanoid robot transfer scaling law”,试图证明人类经验向机器人能力的迁移,也可能存在类似大模型训练中的规模效应。

    这并不能说明人类数据已经解决了机器人泛化问题,但至少说明了一件事情,对于机器人基础模型而言,大规模的人类行为数据可能不仅是训练数据的一种补充,而正在成为模型获得通用能力的重要来源。

    具身智能可能进入另一场竞争

    如果只看机器人完成铺床、折毛巾这些任务,Helix 2.5并没有改变行业的基本认知。真正值得关注的是Figure正在尝试建立的这套训练方法。

    过去几年,大模型行业已经反复验证了一个逻辑,当数据、算力和模型规模达到一定程度之后,模型能力可以通过持续扩大训练规模获得提升。Figure现在正在尝试把类似的方法引入机器人领域。

    这件事情如果未来得到更多实验验证,影响可能比一次机器人Demo更大。

    它意味着,具身智能公司未来的竞争不一定只是“谁的机器人动作更多”,而可能越来越像大模型公司之间的竞争,谁能够获得更大规模、更丰富、更真实的训练数据,谁能够把这些数据转化成更强的基础模型。

    这也是为什么Figure近期一直在扩大Index。

    对于机器人而言,真正稀缺的数据不是某个机器人在标准实验室里重复完成1000次同样的动作,而是大量不同的人,在不同家庭、不同工厂、不同工作环境里完成各种各样任务时留下的行为轨迹。环境越丰富,人的行为方式越多样,机器人接触到的物理世界变化就越充分。

    如果这些数据能够持续进入模型训练,就可能形成一个类似大模型行业的数据飞轮,更多真实世界数据训练出更强的模型,更强的模型进入更多真实场景,又能够产生更多数据。这或许也是Figure愿意持续投入巨额算力的原因。

    Figure此前曾表示,未来12个月将投入超过10亿美元用于数据和算力。在Helix 2.5发布时,公司又披露已经承诺投入35亿美元算力用于Helix训练,如果 Helix 2.5 的发展可以作为参考,那么更多的数据和计算资源应该能够直接转化为机器人进入新家之前就能学习到的更多物理世界信息,进而行成“人类数据—基础模型—机器人”的训练体系。

    Figure Helix 2.5正在尝试给出的一个新的解法。(本文首发钛媒体APP,作者 | AGI-Signal,编辑|郭虹妘)

    更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App