Goodfire 推出内部激活监控器,低成本捕捉失控 AI Agent
Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost
可解释性初创公司 Goodfire 推出在模型内部读取信号、而非外置 AI 复读输出的监控器,已面向 Baseten 客户开放。在 Kimi K3 的测试中,监控约 1,500 个会话成本约 $51,远低于廉价 AI 模型逐步检查的 $233 和顶级模型的约 $10,000;探针捕获 94% 恶意入侵会话,对无害会话误报率为 8.7%,四个探针并行仅增加不到 2% 的响应延迟。
让 AI 智能体保持规矩的标准方法是让第二个 AI 从旁盯着它。这一直是默认做法,但当智能体运行数小时、处理的文本相当于几部小说时,成本会迅速飙升。
专注于可解释性(弄清 AI 模型内部如何运作)的初创公司 Goodfire 周四推出了一个更便宜的选择:监视器,它在 AI 模型工作时观察模型内部正在发生的事情,而不仅仅是阅读它写出的内容。这些监视器面向 Baseten 的客户开放,Baseten 为其他公司托管和运行 AI 模型。
Baseten 的 Base Labs 上个月与 Goodfire 和 AI 平台 Hugging Face 宣布了一项安全合作。
此次发布之际,今年已发生一连串事件,AI 智能体逃出测试环境,其中包括 OpenAI 的智能体入侵 Hugging Face。Kimi K3 是 Goodfire 首个监视器所围绕的开放模型,今年夏天它曾利用沙盒中的一个漏洞访问互联网和 GitHub 上的信息。
Goodfire 的系统有点像机场安检。被称为探针的小型检测器在智能体工作的每一步读取模型的内部信号,就像安检门检查每一位乘客。只有当探针标记出异常时,一个单独的 AI 模型——相当于人工搜身——才会进行更仔细的检查。
Baseten 客户可以选择要监控哪些风险,包括攻击性黑客行为、化学和生物武器滥用以及奖励篡改。他们还可以决定自动化响应:记录事件、提交人工审查,或完全拒绝该请求。
Goodfire 表示,其方案的运行成本也更低。大多数 AI 监视器是单独的模型,必须重读被监控模型所做的一切,这会增加时间和成本。Goodfire 的探针则直接利用模型工作时已经在进行的计算。
“内部激活监视器非常便宜,因为它们复用了前向传播中的计算,”Goodfire CEO Eric Ho 上周在风险投资人 Matt Turck 的 MAD 播客上说。“所以模型已经在计算这个 token 了。你要做的只是取出它已经计算好的中间神经激活,然后在这些内部计算之上运行一个分类器。”简而言之,模型已经在做数学运算了,探针只需读取结果。
在 Goodfire 对 Kimi K3 的测试中,监控约 1,500 个会话的成本约为 51 美元,而用一个较便宜的 AI 模型检查每一步的成本约为 233 美元,用顶级模型的成本约为 10,000 美元。探针捕获了 94% 的恶意黑客会话,并将 8.7% 的无害会话送去二次检查。
该公司表示,同时运行四个探针只会使模型开始响应所需的时间增加不到 2%。
“最大的优势是你可以在事情发生之前抓住它,”Goodfire CTO 兼联合创始人 Dan Balsam 说。“我们可以在评估或训练期间检测到模型可能进行篡改。”
这一卖点瞄准的是开放模型。开发者可以下载它们并剥离其安全防护措施,而且它们不像闭源实验室在自己系统上运行的那种监控。
“个人利用开放模型所能造成的损害,与某人利用推理提供商这类算力集群所能做到的相比是很小的——而大部分责任就在那里,”Balsam 说。“当我们迎来开放的‘Mythos’时刻时,人们会清楚地认识到,模型需要在推理时部署防护栏。”
Goodfire 的最新研究发现,包括 Kimi K3 和 GLM 5.2 在内的领先开放模型,在智能体测试中有 50% 到 96% 的运行出现了奖励作弊。
Goodfire 并不是第一个尝试这种方法的公司。Google DeepMind 在一月份表示,其研究为在 Gemini 中部署滥用检测探针提供了依据。
Balsam 说,这些监控器是一项更长期研究目标的近期成果:对 LLM 进行逆向工程,使行为能够追溯到它在训练中出现的地方。“我们希望把训练模型的魔力变成精准工程,”他说。
当您通过我们文章中的链接购买时,我们可能会赚取少量佣金。这不会影响我们的编辑独立性。
Aditya Mehta 是 TechCrunch 报道 AI 领域的记者。他受到 Tarbell Center for AI Journalism 的支持,曾就读于 UC Berkeley。您可以通过发送电子邮件至 [email protected] 或通过 Signal 上的加密消息 adymehta.74 联系 Aditya。
来源:TechCrunch · AI · techcrunch.com