MIT 科技评论:人形机器人的 AI 突破短期内难以改变日常生活
AI breakthroughs in robotics won’t change your life any time soon
MIT Technology Review 与 Aventine 合作发文指出,尽管 Musk、黄仁勋等人对人形机器人前景乐观,机器人研究者普遍认为现有 AI 方法难以支撑通用机器人。
本文是《MIT 科技评论》与 Aventine 合作完成的报道。Aventine 是一家非营利研究基金会,致力于创作和支持有关科技与科学如何改变我们生活方式的内容。
一个外形像人的机器人——白色机身、黑色头部和躯干——频频出现在视频画面中。也许你见过它跳舞、传递爆米花、把垃圾扔进垃圾桶、吸尘,或按下微波炉的按钮。又或许你看到它在分发水瓶时向后摔倒,或费劲地熨一件衬衫。
这就是 特斯拉的 Optimus,一款由 AI 驱动的人形机器人。该公司 CEO 埃隆·马斯克相信它将“不仅仅是特斯拉有史以来最大的产品,而且很可能是有史以来最大的产品”,将先在工厂车间工作,之后进入我们的家庭。他在 7 月对股东表示,Optimus 最终“将具备人类乃至超越人类的灵巧性”。马斯克认为,Optimus 机器人几乎可以自动化所有人类劳动——从搬运金属板材到折叠衣物——而每台价格低至 20,000 美元。今年 1 月,他在瑞士达沃斯世界经济论坛年会上发表讲话时预测,这类机器人最早可在 2027 年底向公众发售。
马斯克并非唯一一个对此充满热情的人。硅谷风险投资公司 Andreessen Horowitz 的联合创始人兼普通合伙人马克·安德森曾表示,机器人技术可能成为“地球历史上最大的产业”。今年 1 月,英伟达 CEO 黄仁勋表示,人形机器人将在今年达到人类水平的能力。据摩根士丹利称,到 2050 年,“外形和行为都像人类”的机器人数量可能接近 10 亿,创造一个价值超过 5 万亿美元的市场。

SIPA VIA AP IMAGES
这类宣言在很大程度上源于这样一种信念:支撑 OpenAI 的 ChatGPT 和 Anthropic 的 Claude 等工具的 AI 进步,也将让新一代机器人能够像聊天机器人模仿人类语言那样模仿人类的动作。但许多机器人学研究者对此持怀疑态度,他们认为这种假设低估了以下挑战:要让一种建立在语言和图像之上的智能去掌控物理世界的无限变化。“那些制造人形机器人的公司——绝对没有一家——知道如何让这些机器人聪明到真正有用,”常被称为 AI 教父之一的 Yann LeCun 在 1 月达沃斯会议的另一场活动上说道。
研究者还指出,把外形模仿人类的人形机器人与所谓能够学习并执行多种任务的通用型机器混为一谈,这种倾向具有误导性。“制造一个看起来像人的机器人非常容易,”Agility Robotics 联合创始人兼首席机器人官、俄勒冈州立大学机器人学教授 Jonathan Hurst 解释道,“但要制造一台在动态或物理行为上像人的机器,难度要大得多。”
这些紧张关系——关于全能人形机器人究竟是近在咫尺还是遥不可及,以及当前形式的 AI 是否足以完善它们——正在全国各地的机器人实验室里上演,而对时间表的炒作正掩盖着艰难却意义重大的进展。
大约十年前,一系列突破引发了生成式 AI 革命,把人们长久以来想象的人工智能可能性变成了现实。机器人专家——尽管他们对这一时刻究竟何时到来看法不一——相信,一场同样具有变革性的革命也可能在机器人领域发生,这场革命将赋予机器早已无法企及的物理直觉与流畅性。随着机器人领域的进展缓慢推进,问题在于:推动 AI 进步的同一套方法和工具是否足以实现这一目标,还是需要一条全新的路径。
机器人遇见先进 AI
要见识当今最聪明的机器人“大脑”之一,不妨看看 Google DeepMind 用一台名为 ALOHA 2 的设备能做什么,ALOHA 2 是“A Low-cost Open-source Hardware System for Bimanual Teleoperation”(低成本开源双手遥操作硬件系统)的缩写。
关于通用机器人是否必须采用类人的形态,机器人专家长期以来争论不休:支持者认为类人形态有助于机器人融入现有的世界,反对者则认为不值得为此费工夫。ALOHA 2 体现了后一种思路。它的外观并不起眼,只是一对机械臂、几个夹爪和两个摄像头。但尽管看似简单,它却是 Google DeepMind 研究人员的工作主力,他们在各个实验室中用它在自己的各种实验室里测试其最先进的机器人 AI 系统 Gemini Robotics。
在 Gemini Robotics 的控制下,ALOHA 2 更像是一个通用机器人,也就是说,它可以基于训练过的示例执行任意数量的任务。让它收拾午餐盒,正如一段演示视频所示,它可以用两个钳形夹爪小心地把一片白面包放进 Ziploc 密封袋并封好,再把一串葡萄放进 Tupperware 保鲜盒并扣上盖子,然后小心地把这些物品放进午餐盒,最后拉上拉链。
这顿午餐并不怎么样。但机器人能够完成这件事,这一事实本身相比哪怕三年前所能做到的,都是一个客观的进步。
这在很大程度上要归功于 AI 及其对所谓“机器人策略”的影响。机器人策略控制着通用机器人如何评估和理解周围环境、规划如何在其中移动,然后正确执行任务。
从历史上看,这些策略基于工程师硬编码到机器人软件中的规则——成千上万行代码,决定着机器人在数百项任务中每一毫米的动作。过去几年发生的变化——也是对通用机器人持乐观态度的主要原因——是机器人策略正被交给先进的 AI 系统,而不再被编码进机器人的软件。这最初发生在 VLM(视觉语言模型)上。这类模型类似于大型语言模型,但它们的训练数据不仅包括文字,还包括图像。给一个 VLM 看一张咖啡泼洒的照片,让它找工具清理污渍,它就能识别出附近的一块抹布。这种即时的情境理解能力,在几年前机器人策略还是硬编码的时代是不存在的。
接下来是视觉-语言-动作模型,它们使机器人能够评估其所处的环境并在其中采取行动。这些模型通过增加另一个组件来实现这一点:运动指令。VLA 的训练数据是一系列与执行给定任务相关的图像或视频,以及关于机械臂如何移动来执行该任务的相关数据。这些运动数据通常通过遥操作收集,即由人类使用遥控器引导机器人完成某个动作。这种训练使 AI 学会如何在给定任务中指挥机器人移动和操作。把一台由 VLA 驱动的机器人放在书桌前,告诉它“合上笔记本电脑”或“把耳机线收好”,它会观察场景、识别相关物体、规划执行请求的方法,然后挥动机械臂开始行动——至少在它以前见过这个任务被完成过的情况下如此。
Gemini Robotics 模型就是一个 VLA,它通过大量展示各种不同动作的人类演示视频(累计数小时)进行训练。因此,它能够执行相对复杂的任务,比如用厨房夹子夹起荷兰豆、折纸,或者准备一顿简单的午餐。这令人印象深刻,但存在一个明显的局限:就目前而言,如果一台由 VLA 控制的机器人被要求执行超出其训练集的任务,它很可能会失败。
“从所有任务的空间来看,一个真正的通用策略应该能够完成这个谱系中的所有事情,”伦敦帝国理工学院的机器人学教授 Edward Johns 说。不过,如今的 Gemini Robotics 模型只能“这里做几件事,那里做几件事”。
对真正通用性的追求
那么,我们如何让机器人能够做更多的事情?通常的答案可能并不令人意外:用更多的数据训练它们。
按照这种思路,更多的数据等于更多的示例,而更多的示例等于更强的通用性。例如,Google DeepMind 希望汇集“尽可能多的数据”,该公司机器人部门的前技术负责人、目前正在开发自己的 AI 机器人项目的 Pannag Sanketi 如是说。但数据从哪里来?大语言模型的训练受益于海量的现有文本。而机器人却没有一个与之对应的高质量物理演示数据池可供训练。研究人员有几种方法来弥补这一点,但都有缺陷。一种是雇用大量人员来创建和收集遥操作数据(成本高昂且耗时)。另一种是利用人类执行各种活动视频来训练 VLA(由此得到的数据质量较差)。还有一种是在现实世界中部署机器人,并利用从这些经历中收集的数据来进一步改进 AI 模型(机器人在实验室之外既不安全也不可靠)。Sanketi 认为,一种利用来自所有这些来源的数据的“多管齐下”的方法是最有可能的前进道路。
但“仅靠训练数据就是答案”这一信念远非普遍共识。Agility 的 Hurst 将其描述为“一个从根本上就有缺陷的前提”。
问题在于,现实世界中的任务复杂度会迅速爆炸。比如说,如果你想泡一杯咖啡,就会有无数变量:没有两个厨房是完全相同的;咖啡机的工作方式各不相同;不同的杯子需要不同的握法;咖啡粉、热水和牛奶都需要以不同的方式处理。即使是这个简单的任务,也需要理解一份不断变化的可能性清单。Hurst 认为,要通过 VLA 实现通用性,就需要“对机器人可能做的一切事情拥有完整的数据覆盖”。换句话说,就是一个几乎无限的训练数据池。
LeCun 对这整个路线不屑一顾。他在达沃斯表示:“在语言领域取得成功的 [AI] 方法,不适用于高维、连续、嘈杂的数据”——而这类数据在机器人领域随处可见。“你必须使用别的东西。”
“别的东西”的主要候选者就是所谓的世界模型——一种较少依赖文本、而是基于视频、三维扫描和传感器数据的组合进行训练的 AI,旨在预测现实世界中行动的结果。其目标是构建出拥有足够精确的现实内部表征的模型,能够捕捉物理世界实际的运作方式——物体如何移动、碰撞、坠落和变形。如果机器人专家能够在足够逼真、贴近现实物理规律的模拟中训练机器,开发将变得更快、更便宜、更安全,从而减少对真实世界测试的需求。更具变革性的是,配备了世界模型的机器人可以对其周围环境进行推理,而不仅仅是对其作出反应,帮助它们在采取行动之前预判其后果。
英伟达和 谷歌等公司正在研发这项技术,投资人的资金也正涌入备受瞩目的初创公司。由斯坦福大学 AI 研究者李飞飞联合创立的 World Labs 在 2 月份融资了 10 亿美元,并于 9 月底以 82 亿美元被 AMD 收购。由 LeCun(曾任 Meta 首席 AI 科学家)联合创立的 AMI Labs 也在 3 月份融资了 10 亿美元。然而他们自己也承认,现在仍处于早期阶段。去年年底,李飞飞将该领域描述为“刚刚起步”,并补充说“基础方法仍在建立之中”。她在 6 月的 Substack 上描述了艰巨的挑战。目前,世界模型还是一个前景广阔的研究领域,而非通往通用机器人的捷径,但我们已经开始看到它们所能取得成就的些许曙光。
其中一个缩影来自去年 4 月在旧金山一家机器人实验室发生的一次虽小但可能意义重大的飞跃。
一项突破?
在旧金山教会区的中心地带,初创公司 Physical Intelligence——或者说它喜欢被称作 PI(即 π)——专注于开发一种通用大脑,理论上可以将任何机器人变成通才。该公司在训练机器人 AI 模型时采取无所不包的方式,最近观察到了配备世界模型的机器人大脑可能具备何种能力的一丝迹象。
2024 年,PI 公布了其首个通用机器人系统的细节,名为 π0,这是一款 VLA 模型,PI 声称它是“迄今最强大、最灵巧的通用机器人策略”。该模型最初在通过遥操作收集的 10,000 小时专有人类演示数据以及若干开源机器人数据集上训练。2025 年春季发布的版本 π0.5 在更多样的数据集上训练,包括来自网络的带标注图像,使其更具通用性。2025 年秋季的更新 π0.6 为模型加入了强化学习。
每次更新都为模型性能带来了重要提升,将其能力范围从缓慢地叠衣服,扩展到在新环境中收纳物品,再到以更高成功率完成折叠纸箱之类的任务。随后在 2026 年 4 月,π0.7 似乎让 PI 跃入了新天地。这一版本使用了一个功能较弱的世界模型,用于生成执行某项任务所需步骤的图像。当机器人执行任务时,这个“轻量级”模型会向它提供下一步该做什么的快照。
该公司声称,该模型展现出了组合泛化的初步迹象——这一术语指的是 AI 系统通过重新组合训练数据中学到的技能,来执行从未接触过的任务的能力。其中一项测试是让模型“把一个红薯放进空气炸锅”——这是它此前从未遇到过的任务。在一段演示视频中,这台机器先折腾了一会儿,几次起步失败,最终做出了还算不错的尝试,尽管并未完全完成任务。
加州大学伯克利分校教授、PI 联合创始人 Sergey Levine 对此潜力感到兴奋:“这实际上是我们第一次令人信服地看到那种组合泛化——我们基本上可以让模型去执行那些我们没有专门为其收集数据并进行训练的任务,而它确实能做出一次还过得去的尝试。”
这一成功让团队好奇模型是如何实现这一壮举的。经过一番挖掘,他们在训练材料中发现了隐匿其中的相关带标注遥操作数据片段,其中包括两段人类操作员使用机器人将空气炸锅篮推入炸锅的示例。这些零星的数据可能就足以让 π0.7 几乎完成用空气炸锅烤红薯的任务。
目前,π0.7 的泛化能力究竟有多令人印象深刻仍不明朗。不过,考虑到该模型接触空气炸锅相关数据的短暂程度,它让我们得以一窥当前前沿研究能把机器人带到多远。
“70% 的成功率就等于不能用”
你可能已经察觉到一种脱节:实验室里机器人蹒跚学步式的缓慢进展——“看!它把一个红薯放进空气炸锅了!”——与许多演示和视频中展现的那种令人眼花缭乱、栩栩如生的灵活身手形成了鲜明对比,视频中机器人无所不能,从在舞台上跳舞到礼貌地端上饮品。这类演示往往没有清楚地揭示一个关键事实:在许多情况下,机器人是由人类控制的,或者其动作是经过精心编排的。(例如,2025 年 3 月与 Nvidia CEO 黄仁勋同台的那台机器人,看似在回应他的指令并跟在他身后,实际上是由其制造商所说的“幕后提线人”远程遥控的。)
就目前而言,完全自主的运动规划——让机器人知道自己该去哪里,尤其是在建筑工地或陌生住宅这类全新而混乱的环境中——在很大程度上仍是一个未解的难题。更大的挑战——尽管两者常常相关——在于让机器人承担更大、更模糊的工作,即包含多个任务、并需要决定如何完成以及以何种顺序完成的任务。这就好比一台能把盘子放进微波炉的机器人,与一台能成功响应“做晚饭”这一指令、翻查冰箱、切配食材并开火烹饪的机器人之间的差别。Google DeepMind 对类似目标所做的最佳尝试——让它的机器人巡视厨房,并把制作蘑菇烩饭所需的所有食材装进篮子——迄今为止都以失败告终。
更棘手的是,一台实用的机器人必须基本上每次都做对。波士顿动力创始人 Marc Raibert 表示,对于 VLA,“当结果从 50% 的成功率提升到 70% 时,人们会非常兴奋。但 70% 的成功率就等于不能用,对吧?”

AP IMAGES, SHUTTERSTOCK, 1X, AGILITY ROBOTICS, GOOGLE DEEPMIND
目前正在真实场景中接受测试的少数人形机器人,只能在严格控制的环境中执行极为有限的任务。它们远非通才。据 Agility 公司称,其数百台机器人已部署在 GXO Logistics、Amazon 和舍弗勒旗下设施的试点中。但 Hurst 表示,就目前而言,这些机器人的目标是搬运箱子和周转箱等简单任务。即便如此,他补充说,开发出安全到足以让物流公司考虑使用的机器人,也花了数年时间。至于 Elon Musk,他在 2025 年 5 月声称,到年底将有“数千台”他的 Optimus 机器人在特斯拉工厂工作,但今年 1 月他表示,公司只有“一些 Tesla Optimus 机器人在工厂里执行简单任务”。
虽然人形机器人已开始进入工厂车间,但要跳到家户场景中则更加困难。现在,如果你愿意的话,你可以预订 1X Neo 家用机器人,预计将于今年晚些时候交付。售价 20,000 美元,它承诺承担“家里那些无聊而琐碎的事务”——收拾餐具、应门、整理客厅——“好让你专注于真正重要的事情”。其设想是让这台身高五英尺六英寸的机器人有一天能自主完成所有这些任务,但目前它做大多数事情仍需要远程人类操作员的辅助。(是的,人类操作员需要获得许可才能通过机器人的摄像头查看你的家中情况。)当被问及完全自主的机器人还需多久才能胜任家务时,Hurst 说:“如果非要我给出一个数字,我认为还要 10 年,机器人才能在……人们家中真正做有用的事。”
到那时,这些机器人很可能是中国制造的,因为中国在生产方面已远远领先于西方。据市场情报公司 Omdia 和中国机器人公司宇树(Unitree)称,2025 年出货的约 15,000 台人形机器人中,有近 90% 由中国公司制造。去年出货人形机器人数量超过任何其他公司的宇树,其生产的一款机型 价格不到 6,000 美元。如此亲民的价格或许能大大提升机器人对消费者的吸引力,不过该公司 预计 其机器将率先应用于工业场景。(顺便一提,如果你想知道是谁在购买这些中国机器人,美联社近日报道 称,订单主要来自企业实验室、学术实验室和国有企业。)
我们曾经历过这一切
制造人形机器人的梦想由来已久:早在 1495 年,达芬奇就绘制过一款由缆绳和滑轮控制的机械骑士的设计图。整个 20 世纪,科幻狂想中的机器来了又去。

GETTY IMAGES
西屋电气那台七英尺高、装在双腿上的“箱子”——Elektro——于 1939 年亮相纽约世界博览会,还会 抽烟。1973 年由日本早稻田大学制造的 WABOT-1 是第一台全尺寸可编程人形机器人。本田于 2000 年发布的 ASIMO,大概是第一台多少证明了自己能干事情的此类机器——它至少能在一定程度上爬楼梯、识别人脸并自主穿行于空间之中。但该机器人在 2018 年被停产,因为它的能力始终无法在演示水平之外取得足够进展,难以真正实用。
所有这些在当时都是令人印象深刻——甚至令人瞠目结舌——的工程壮举。但它们都无法在真实世界中自如行动。今天的机器人,即便拥有先进 AI 的变革性力量,依然面临同样的根本性挑战。
来源:MIT Technology Review · AI · technologyreview.com