博客 报亭 音乐
我的阅读

    机器人打球刷屏的真相:眼睛是借的,大脑是“假”的

    虎嗅网 2026-09-16 18:12
    ⏎ 返回 ⭢阅读原文

    今年,打球几乎成了机器人展示“自主能力”的热门项目。

    球高速飞过来,机器人自己移动、挥拍、回球,有的甚至能和真人连续对打几十拍、上百拍。

    这样的画面很容易让人以为:过去只会走路、翻跟头、搬东西的机器人,终于开始拥有处理动态世界的“大脑”。

    但实际上,这类Demo,用三个词,可以精简概括本质:“瞎子”、“木偶”和“假大脑”。没有遥控器,就等于机器人自己干活了吗?

    有些本该由机器人大脑自己完成的“看见世界、判断物体怎么运动”的工作,被场地外一整套高精度设备提前做掉了。

    也就是相当于用一整套上百万元级的外部设备,临时给机器人装了一个“假大脑”和几十双“眼睛”。

    这也像是用一套“巨型设备”在做遥操:机器人自己其实没看见什么,外部系统已经把关键位置告诉它了,“球到你跟前了,打吧”——

    场地提前测量、相机提前标定,球涂上反光物质后被高频、高精度地追踪,再交给上层程序计算球什么时候会到、球拍应该到哪里。

    这和人打球的逻辑并不是一回事。

    人不会先把球场做一遍毫米级标定,而是用自己的视觉观察对手动作、球速和方向,在不完全准确的信息下不断预估下一步。

    但这不意味着机器人什么都没做到。

    它拿到位置和击球目标以后,仍然要在很短时间内控制身体跨步、调整姿态、保持平衡、挥拍和连续回球,这说明今天机器人的“小脑”和全身运动控制已经取得了明显进展。

    问题只是:“小脑”很强,不等于“大脑”已经自主。

    这个判断来自林知远(化名)

    过去两年,不少自动驾驶人才转向具身智能。林知远是其中的典型。

    他曾任百度自动驾驶资深工程师、萝卜快跑创始成员,完整经历约十年工程化周期。

    如今转向具身智能,关注模型如何通过端侧推理、监督、校验和恢复,真正进入物理世界长期工作,并实现机器人大脑“自进化”。

    这也是为什么,他看机器人打球,关注的并不是“能连续打多少拍”,而是另一件事:

    机器人的感知、判断、执行和结果反馈,到底有多少真正发生在机器人自己的闭环里?

    沿着这个问题往下追,会发现今天谈“机器人大脑自主”,至少还要跨过三道门槛。

    会打球,不等于真正自主

    1、没有人遥控,不等于机器人自己干完了活

    今天很多机器人Demo已经“没人拿遥控器”。

    但“没有人实时操纵”和“机器人大脑自己完成任务”,是两套标准。

    前一种自主,只要求整个系统可以自动运行;

    后一种自主则要求机器人依靠可以随身部署的感知和计算能力,自己观察环境、理解任务、生成行动,并确认行动之后的现实结果。

    打球Demo把两者的差别暴露得很清楚。

    运动控制是真的,全系统自动运行也是真的;但“机器人自己看见球并理解球的运动”这件事,并没有完整、独立地发生在机器人身上。

    林知远把它类比成自动驾驶里的高精地图。

    高精地图曾经非常有效,因为很多道路信息可以提前测量好,再交给车辆使用;但自动驾驶真正走向开放道路以后,行业逐渐发现,依靠一个提前整理好的世界,和让汽车自己理解不断变化的世界,并不是同一道题。

    机器人的问题也是如此。

    如果一项能力必须依赖提前标定好的房间、固定机位和特殊反光标志才能存在,那么真正值得追问的是:

    撤掉这些专门为演示搭出的条件之后,它还能剩下多少能力。

    2、一个漂亮Demo,可能让团队白跑半年

    林知远并不反对Demo。

    在技术发展的早期,一次漂亮的展示本身有价值:它能让外界第一次看到某种能力存在,帮助团队获得关注、资金和下一步研发资源。

    科研项目把一个极难的问题拆开,先解决运动控制、再逐步补齐感知。

    但今天AI研发和过去有一个明显的不同:能力提升更加依赖真实反馈。

    如果一套演示做完以后,既无法进入真实任务,也不能持续产生真实的结果、失败和纠偏数据,那么这个Demo和下一轮能力增长之间的联系就会越来越弱。

    林知远说得很直接:“你总不能在现实世界中架这么一套东西,在你每一个摆弄的物件上涂上反光物质。”

    如果团队长期为了这种效果投入,甚至可能“跑偏三个月、六个月”,最后大家自己都知道,“我们在做一个trick(套路)”。

    所以,Demo真正的分界线,不是够不够“漂亮”,而是:

    这次成功,有没有缩短下一次进入真实世界的距离。

    真正的自主要能证明,这种能力离开展台、固定布景,进入陌生环境之后,仍然可以存在。

    但即使有一天,机器人真的能依靠自己看清球,问题也只解决了一半。

    因为:看见了,不代表它知道自己有没有做对。

    模型更聪明,不等于“大脑就完整”

    1、最危险的失败,是机器人已经错了,却自己不知道

    真实任务里的失败,比“抓没抓住”复杂得多。

    比如一个机器人接到任务,把杯子拿到桌上。

    它完成抓取、移动和放置,每一个动作都做了,但杯子歪了,水正在往外漏。这显然不能算真正完成。

    生产现场里的情况更明显。

    油漆刷完,不等于刷均匀;巡检走完,不代表异常都发现;一个包含十步的任务,即使每一步看起来都“差不多对”,也可能因为前面一点误差不断累积,到最后完全偏离真正目标。

    林知远认为,长程任务中最危险的一种失败是:机器人已经偏离目标,但自己不知道。

    这使机器人大脑的职责不能只停留在“生成下一个动作”,它还要继续判断动作是否做多、结果是否合格,继续执行会不会产生更大问题。

    一旦发现问题,还要在重试、局部修正、重新规划、降级执行和人工介入之间作出选择。

    林知远说:

    “它知道它不行了,或者它知道它失败了。”

    这也意味着,机器人向人求助,并不天然代表“不自主”。

    一个系统如果已经走到能力边界,却仍然不知道应该停下来,反而是更危险的不成熟。

    2、模型会合并,但责任不能一起消失

    今天具身智能里一个很热的争论:

    当VLA、世界模型和端到端模型越来越强,未来是不是只需要一个足够大的模型,机器人里今天所有的分层、监督和安全系统都会消失?

    他并不否定模型融合,相反,他在自动驾驶里已经经历过一遍类似的过程。

    过去十年,自动驾驶从大量独立模块逐渐被越来越统一的模型吸收。

    但模块数量减少之后,原来承担的状态检查、安全校验、故障处理并没有凭空消失,只是换了技术形式,有些变成规则,有些变成服务,有些继续由人机系统承担。

    所以他说:

    模型边界会不断合并,责任边界不会消失。

    端到端讨论的是模型内部如何计算;闭环系统讨论的是机器人如何对现实结果负责。

    未来用户不关心某项能力最终是否写在模型里,但真正工作的机器人不能出现:模型更聪明,却无法判断“这件事已经做错了”。

    3、大模型可以慢慢想,现实世界不会停下来等

    更现实的一层问题是时间。

    当物体正在滑落、机械臂即将发生碰撞时,现实世界不会停下来几秒钟,等一个更大的模型慢慢思考。

    所以,未来真正的“大小脑”问题,不是最终会不会把小模型全部吃掉,而是:

    什么能力需要慢而强,什么能力必须快而确定,以及两者的经验怎么重新汇合。

    4、自动驾驶十年的另一个教训:别在错误的表达上死磕

    不要过早相信今天的技术表达已经是终局。

    过去十年里,自动驾驶几乎每隔两三年都会经历一次明显的范式变化。

    高精地图、环境感知、空间表达都不断变化,很多真正推动行业前进的突破,并不是在原来的模型上再多堆一点能力,而是重新定义输入、输出和对世界的表达方式。

    所以他看今天的VLA,也没有把它当作已经定型的终极架构。

    他对当前部分VLA最直观的感受是:

    “慢。”

    即使使用很强的算力,也还是不那么“聪明”。

    因此他认为现在的VLA很可能还是一种“中间状态”。

    其中真正更没有定型的,是最后一个字母——Action(动作)。

    他认为,今天最自然的数据表达,不一定就是最后的表达。未来如果执行器、材料和控制方式变化,动作表达本身也可能被重新定义。

    世界模型也是类似逻辑。

    他并不否认世界模型长期可能参与更直接的动作控制,但在现阶段,他更看重它在世界预测、仿真、训练数据生成和策略验证中的作用,甚至认为它未来可能还是一种更高级的“仿真器”。

    所以今天急着讨论“VLA还是世界模型谁会赢”,可能仍然太早。

    真正应该观察的是:

    哪一种新架构,最终能够让机器人更快、更稳定,也更容易进入下一个真实场景。

    一次成功,不等于生产力

    1、别看成功率,先看它到底能替人多久

    如果不看模型参数、发布会和Demo,只允许留下一个指标来判断机器人是不是正在变成真实生产力,他会选:

    真实任务连续替代人的时间。

    也就是在一个真正有价值、有明确结果标准的任务中,机器人究竟能连续把人替代多久。

    这个指标把任务价值、运行稳定性、异常恢复、人工介入和最终结果绑在了一起,比一次动作成功率或者一段挑选后的演示视频,都更难“做漂亮”。

    更重要的是,一旦机器人真正进入生产,它就获得了一种实验室里很难买到的数据:真实反馈。

    他说得很形象:“有人给你反馈,告诉它变笨了;有人告诉你实话。”

    实验室里,可以由研究者定义什么叫成功;生产现场却不会。

    漆刷得不均匀,巡检漏掉一个问题,都会产生真实的工作结果和影响。

    所以真实生产不只是商业验证,它同时还是一套天然的评测和数据系统。

    现实世界真正珍贵的,不只是数据,而是有人愿意告诉机器人“你错了”。

    2、机器人过了60分,拼的还是数据,只是标准变了

    行业里常说:60分以前靠模型和数据,60分以后主要靠工程。

    他不完全认同。

    他认为,机器人到了60分以后依然是数据竞争,只是对数据类型和品质的要求变了。

    60分以前,只要机器人“基本能work”,偶发异常还可以容忍;但一旦进入生产,标准会更加具体且严格。

    这意味着数据需要带上任务结果、失败发生的位置、失败原因、恢复策略和最终结果。

    而“失败四次,第五次终于成功”,也不能直接被叫作“自进化”。

    他认为,真正的学习还要经过时间序列验证、跨场景迁移、跨本体迁移,以及能力退化和回滚测试。

    一个已经会刷马桶的机器人,如果只需要补少量数据就能去刷油漆,这才开始说明它获得的是一种可以迁移的能力。

    所以,一条经验里,开始要包含结果、失败和纠偏。

    3、机器人没有汽车那种“用户边用边采”的数据红利

    汽车卖出去以后,数以百万计的用户每天在真实道路上开,本身就是一个巨大的数据生产网络;

    但很少有人愿意花20万元买一台机器人,再长期免费替机器人公司生产训练数据。

    如果每进入一个新场景,都重新进行大量真机采集,成本很难形成规模效应。

    因此他更看好另一条路径:先通过基础模型和仿真形成一部分能力,再把机器人送进真实场景验证,哪里出现sim-to-real差距、哪里失败,就针对性补哪里的数据。

    4、机器人最早的机会,可能藏在自动化留下的“非标死角”

    如果机器人今天还做不到能干,它应该先去哪?

    他不认为最容易切进去的是已经自动化的先进产线。

    一条成熟工厂本来运行得很好,让一个尚不成熟的机器人进去测试,意味着效率损失、安全风险和现场人员配合,很多时候机器人团队甚至需要付费,工厂才愿意开放场景。

    “机器人现在去一条成熟产线,很可能首先是‘去添乱的’。”

    相比之下,地下管网、密闭空间、船舱喷漆和焊接这些不那么“性感”的场景,反而具备更好的早期条件:

    人本来就不愿意进去,危险和健康风险较高,任务有明确价值,结果能被验收。

    船舱喷漆就是一个典型例子。

    一块平整钢板,传统机械臂早已可以刷得很好;真正几十年没有完全解决的,是船体成型以后,里面不断变化的隔板、折角、犄角旮旯和不同船型,机械臂没有固定位置,也无法每一次都精确配准。

    他把传统自动化形容成:“瞎的。”

    它脑子里存着几个固定点,到一个点完成一个动作,但它并不真正理解哪里可以通行、哪里应该作业,以及今天这个环境和昨天有什么不同。

    而这一轮具身智能真正想补的,就是:

    从“按照固定坐标重复动作”,变成“环境变了,依然能把任务做完”。

    因此,第一批真正形成生产力的具身场景,反而可能来自传统自动化几十年没有解决掉的那些“非标死角”。

    5、机器人大脑最终只有两道题:越做越久,越换越便宜

    机器人大脑的竞争,是不是正在从“完成一次任务”,走向“知道什么时候失败、怎么恢复、什么时候求助”?

    他的回答是:“这是一个方面。”

    另一半,是迁移。

    在他的判断里,机器人大脑至少有两条坐标轴。

    一条是时间轴:一次成功能不能变成长期可靠,失败能不能被发现,发生问题以后能不能恢复并继续工作。

    另一条是空间轴:离开原来的任务、环境甚至本体以后,这套能力还能留下多少,又需要重新补多少数据和工程投入。

    只解决前者,一家公司可能把一个项目磨得极其稳定,但换一家工厂又重新开始;只解决后者,一个模型也可能什么都会一点,却没有一个任务真正能长期工作。

    所以,一套真正有平台能力的机器人大脑,最后其实只需要回答两个很难作弊的问题:

    • 它能不能越做越久?
    • 它能不能越换越便宜?

    回头再看那些会打球的机器人,漂亮的击球当然值得惊叹,它至少说明机器人的“小脑”和全身运动控制已经进步很快。

    但“大脑自主”是一道更难的题。机器人不仅要完成动作,还要知道动作有没有真正产生正确结果,并且把今天的一次成功,变成明天可以长期运行、换一个地方仍然有用的能力。

    所以,机器人大脑真正的分水岭,并不是:“它会不会做一个漂亮动作。”

    而是:它能不能对自己做出的结果负责,并把一次成功变成长期、可迁移的能力。

    从“会表演”,到真正“会工作”,差的正是这一层。

    机器人大脑未来到底怎么发展?

    下周二晚7点,虎嗅 AI 100 闭门会,追问:世界模型上位,谁将掌控具身智能的大脑?

    400亿融资、超七成押世界模型。

    创业、模型、资本、学术视角的四位专家同台,聊清楚:

    机器大脑怎样才算真“上岗”,哪些技术是真突破,今天的高估值如何兑现。

     想看更前沿的一面,下图扫码报名。

    本文图片来自AI生成。

    本内容来源于网络,观点仅代表作者本人,不代表虎嗅立场。
    如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。

    End



    文章原文