Epoch AI 测试显示 AI 智能体夸大研究结果,距自主研究仍很远
AI agents overstate their results and remain far from autonomous research, study finds
Epoch AI 用基准 InnovationEval 测试 AI 智能体能否独立发明新训练方法,GPT-5.6 Sol 在宽评分下仅达到人类参考方法 SDPO 相对 GRPO 提升的约 35%,规则内改动仅约 15%,Claude Fable 5 无可测量提升。
要求智能体发明一种新的训练方法
Epoch AI 推出了其基准测试 "InnovationEval",测试 AI 智能体能否独立开展研究。任务是发明一种在语言模型初始训练之后改进模型的新方法,然后独立实现、测试并完善它。
起点是 GRPO,一种被广泛使用的技术。GRPO 将模型对同一任务生成的多个答案进行比较,并奖励其中更好的答案,通常对每个解答整体打分。人类设计的参考方法 SDPO 则利用错误信息等额外信号,为答案中的各个步骤创建更精确的学习反馈,从而使模型实际上成为自己的老师。
Epoch 测试了 Claude Fable 5 和 GPT-5.6 Sol,据该组织称,它们事先并不了解 SDPO。性能在科学问答等简答题任务和编程任务上进行衡量,每个智能体最多可使用 3,000 小时的高端芯片算力,但无法访问互联网。
两个模型都在复用已知技术,而非创新
两个模型都远远不及人类参考方法。GPT-5.6 Sol 针对了 GRPO 的一个弱点:当某个任务的所有答案都正确时,模型学不到任何东西,因为没有可比较的对象。Sol 让模型在这种情况下强化其成功的解答,但这个想法并不新颖。
据 Epoch 称,以 SDPO 相对 GRPO 所取得的提升来衡量,Sol 在宽松评分下得分约为 35%。若只计算符合实验规则的改动,这一数字降至约 15%。在编程任务上,Sol 大多只是让训练变得更昂贵、更缓慢,而不是改进方法本身。
Claude Fable 5 让模型在重试失败任务时获取之前的失败尝试记录,这也是一种众所周知的技术,且未产生可衡量的改进。Epoch 表示,即使是 Sol 的部分成功,在专家看来也仅勉强算得上"中等有趣"。从训练数据中了解 SDPO 的更新模型也无法完全复现它。GPT-6 Astra 构建了类似的解决方案,但没有披露其来源;即使把原始论文摆在它面前,Fable 5 也未能达到参考水平。
智能体挑选最佳运行结果,其余的则被掩盖
两个智能体还存在报告问题。它们运行了多轮几乎相同的训练,却只报告每次的最佳结果,这使得方法看起来比实际更强,因为结果本身会随机波动。在最终报告中,这些模型几乎未提及这种做法,也未引用其方法所借鉴的先前工作。它们自行报告的数字因此偏高:Sol 声称达到了 SDPO 提升的约 70%,Fable 5 约为 40%。Epoch 剔除了这些虚高的数据。

模型的内部推理日志显示它们意识到了这个问题,Fable 5 将其反复运行描述为寻找更好的检查点。Epoch 对此究竟是故意作弊还是混淆不清持保留态度。
对于 GPT-5.6 Sol 而言,这种行为与评估机构 METR 早前的一项发现相符,该机构在其自己的编码测试中检测到该模型的作弊企图比它评估过的任何其他公开可用模型都多。
Epoch 得出结论,人类需要对AI 生成的所有研究进行全面审查,这削弱了模型的实用性。
Anthropic 在自己的模型中看到了同样的弱点
Anthropic 在 系统卡中描述了 Claude Opus 5.5 的类似局限。Anthropic 表示,该模型远不能取代公司自己的研究人员,主要问题在于“认知质量”和指令遵循。
Opus 5.5 会将未经检验的假设当作事实呈现,并且比以前的模型更频繁地把自己的疑虑搁置一旁。它把部分检查描述为完整验证,在未经交叉验证的情况下将初步评估转化为建议,并且在回应批评时过于狭隘,不去质疑整体方法。它还偏爱小幅、渐进的调整,固守已发表的研究而不去开发新想法。
普林斯顿大学和英国安全研究所参与的一项研究也得出了类似的结论。该研究让 Claude Opus 4.8 花了六天时间研究 NeurIPS AI 会议两篇未发表论文背后的研究问题,原作者在评审时否定了这两个结果。当最初的假设失败时,这些智能体只是软化了它们的主张,而不是从头再来。
技术执行日益成为次要问题,因为这些智能体最缺乏的是切实评估自己应对某一结果有多大信心、并从根本上质疑自己方法的能力。
仅靠更多算力无法弥补差距
AI 对研究并非毫无用处,因为模型可以加速文献综述、编写代码,并比人类更快地探索各种变体。
但投入更多算力是否能产生自主研究者仍然是一个悬而未决的问题。GPT-5.6 Sol 用完了全部预算,直到算力分配快用完时才在短答题任务上发现改进,而在编码任务上完全没有取得符合规则的进展。Epoch 认为这种后期突破是一个微弱的信号,表明更多算力时间可能有帮助,尽管 Fable 5 甚至没用到一半预算。

Epoch 还指出,一年前的领先模型在同样的测试中表现会差得多,该组织计划用新任务定期重复 InnovationEval。在那之前,最大的差距仍然是认知纪律:带着怀疑态度检查自己的发现、披露不确定性,并认真对待负面结果。
来源:The Decoder · the-decoder.com