跳到正文
Latent Space· Richard MacManus·· 5 小时前AI 评分53

Standard Bots 谈工业机器人 AI:定向数据比数据量更重要,推理坚持本地部署

Building AI for Reliable Execution: Lessons From Industrial Robotics

AI 导读

Latent Space 访谈 Standard Bots CEO Evan Beard 与 AI 负责人 Leif Jentoft,介绍这家刚完成 2 亿美元 C 轮融资、估值 10 亿美元的工业机器人公司如何构建 AI 栈,客户包括 NASA、Amazon 和 Lockheed Martin。

正文 · AI 翻译

提到机器人与 AI,你首先想到的可能还是 Figure 的 AI 驱动机器和 1X 的 NEO 家用机器人这样的全尺寸人形机器人。这些或许代表着未来,但在 2026 年,更重要的恐怕是工业机器人——它们通常不是人形的。

Standard Bots自称是“美国最大的 AI 原生工业机器人制造商”。它最近在由 General Catalyst 和专注机器人领域的基金 RoboStrategy 领投的 C 轮融资中,筹集了 2 亿美元,估值达 10 亿美元。其客户包括 NASA、亚马逊和洛克希德·马丁。

我们与联合创始人兼 CEO Evan Beard以及 AI 负责人 Leif Jentoft进行了交流,以进一步了解 Standard Bots 的 AI 技术栈及其模型的运作方式。

先介绍一下背景:Standard Bots 的工业机械臂是为机床上下料、焊接和装配等任务而设计的。下面是 Jentoft 的一个简短演示:

据 Beard 介绍,Standard Bots 拥有一个共享基础模型,客户可以通过演示和微调来适配它。Jentoft 补充说,Standard Bots 运行着一系列模型,包括一个用于机床上下料的零样本感知系统。

Beard 表示,其最大的模型参数量在几十亿的低段——按前沿实验室的标准来看并不算大。

“我们相信数据质量远比原始数量重要,”Jentoft 说,“我们专注于从有针对性的数据中获取最大价值,而不是追求尽可能大的数据集。”(这与 Jev 创作者 Diogo Almeida 的“最苦涩的教训”不谋而合,他最近告诉我们,正确的任务和正确的数据可能比算力更重要。)

“我们的市场渠道让我们能独特地获取最高价值的数据,”他补充道,“原位干预只需几十个样本就能修复一个边缘情况。”

使用 ClickFind 设置零件识别。

Beard 指出,Standard Bots专注于短时程任务,以满足生产对节拍时间和可靠性的要求。对于工作流中不需要学习行为的部分,公司采用传统编程方式。

Beard 说,模型训练在云端进行,但推理在本地运行。

我问 Jentoft,在一个典型的机器人例程中,学习模型负责什么,工作流的哪些部分使用传统编程?

他以其面向高混合制造业的机床上下料解决方案为例。

“我们构建了一个零样本系统,让用户可以告诉机器人在给定任务中要寻找哪些零件。模型负责感知——定位和识别零件——而传统编程则负责运动以及围绕它的单元逻辑。”

下面是机床上下料的演示:

“我们这项任务的骨干网络在超过十亿张图像上训练,这让机器人能够区分光照条件、材料类型,以及物体与其背景,”Jentoft 说。

今年四月,我们曾邀请 Applied Intuition 做客播客,讨论 “物理 AI” 及其与屏幕上的 AI 的区别。其中一个收获是,物理 AI 不仅受模型智能的限制:难点在于把模型部署到真实硬件上,还要满足安全性、延迟、功耗、成本和可靠性等约束条件。

但对 Standard Bots 来说,这也可能是一种优势,因为它控制着从软件到硬件的“全栈”。Jentoft 指出,它掌控着机械臂、末端执行器、控制系统和 AI。

“这让我们能够协同优化模型和控制策略,”他说。“尽管其他地方有各种说法,但如今没有任何模型是真正与硬件无关的,而把底层控制与高层功能协同优化,对性能和迭代速度都是重大优势。”

Skild 是一家致力于构建“通用机器人智能”的公司,可能会对“与硬件无关”这一说法有异议——它的目标正是实现 跨硬件的泛化能力。

Beard 曾提到,推理是在本地完成的,这对其核心客户——工厂——尤为重要。

“对于工厂——也就是我们目前工作的大部分内容,而且我们在那里看到了巨大的机会——这就是一个必须在本地进行推理的场景,”他说。

一个智能体正在构建机器看护例程。

在机器看护任务中,模型负责识别零件,而传统编程负责运动控制。Jentoft 还描述了模型如何生成动作并输入机器人的控制系统。

“腕部摄像头和其他传感器通过内部千兆以太网向系统输入原始像素和信号,走内部布线,因此不会有线缆缠绕,”他解释道。“边缘端 GPU 处理这些数据,生成动作块,再流式传输到底层控制。”

他重申,推理是有意选择在本地运行的。

“为机器人技术使用云计算在运维上极其困难——大多数工厂和仓库没有可靠的互联网连接,对移动机器人来说更是如此。正常运行时间对客户接受度至关重要,所以我们把整个闭环保持在本地。”

Standard Bots 在可能的地方使用仿真,但 Beard 表示,一些生产任务——包括涉及液体、吸附或切割柔性材料的任务——在当前的仿真器中难以复现。

真实世界的示范是学习过程的另一部分。下面是一个使用手持触控设备教机器人的演示:

那么它是如何应对机器人任务中的失败的?这些类型的经验会回流到模型中吗?

“我们会从部署中采集失败信号和人工纠正,至于如何使用这些数据,取决于客户,”Jentoft 回答道。

他指出,公司的许多国防客户“部署在与外界隔离的环境中,什么数据都不会传回”。但对于没有隔离部署的客户,“车队学习能为他们自己的应用带来足够大的好处,因此我们通常不会遇到关于贡献数据以换取性能提升的抵制。”

Standard Bots 已经扩展了其平台,让外部开发者也能使用。通过 StandardOS,它提供了 一套 API 和 SDK。

据 Beard 介绍,开发者可以使用 Standard Bots 的 API,利用其技术栈中所需的任意部分来构建机器人应用,包括自带模型。他列举了 NVIDIA Cosmos——一个面向物理 AI 的开放全模态世界模型家族——作为例子(3 版于 5 月下旬发布)。

如今,这需要开发者自己编写集成代码。但 Standard Bots 计划让数据收集、模型训练以及将模型部署到其机器人上变得更容易。

借助 NVIDIA 软件的 AI 机器人学习工作流;图源:Standard Bots。

Standard Bots 并不是机器人领域最耀眼的公司,但它已被部署于 NASA、Amazon、Lockheed Martin 等机构的工业自动化场景。

对于 AI 工程师来说,最有价值的经验或许在于 Standard Bots 如何让 AI 适配特定的工作。它保持模型职责的聚焦,并利用来自真实部署的纠错反馈来修复边缘情况。当然,你也可以把同样的方法应用到软件智能体上。

正如 Jentoft 所说——这也是 Jev 最近带来的一条经验——关键在于“从有针对性的数据中获取最大价值,而不是一味追求尽可能大的数据集。”

来源:Latent Space · latent.space