跳到正文
The Decoder· Matthias Bastian·· 4 小时前AI 评分68

研究显示 AI 智能体团队消耗大量 token 但质量提升微乎其微

AI agent teams waste massive tokens for barely measurable quality gains, research finds

AI 导读

Vals AI 在 Vibe Code Bench 上测试 GPT-6 Sol 和 Claude Opus 5.5 的单智能体与团队表现,团队成本是单智能体的 1.8x 至 5.1x,四组对比中仅 GPT-6 Sol 在 medium 推理档提高 7.3 分且具统计显著性。

正文 · AI 翻译

跳转到内容

Matthias Bastian

2026年10月11日

Image description

研究发现:AI 智能体团队带来的效果提升几乎可以忽略不计。

评测公司 Vals AI 在"Vibe Code Bench"上以单智能体和团队两种形式测试了 GPT-6 Sol 和 Claude Opus 5.5,涵盖两个推理级别:中等推理和最大推理。团队的成本是单智能体的 1.8 倍到 5.1 倍。

在团队与单智能体的 四项对比中,只有一项显示出统计上的显著提升:GPT-6 Sol 在中等推理下,团队得分高出 7.3 分。在最大推理下,团队模式对 Sol 和 Opus 5.5 都没有带来实际优势。结果表明,在大多数情况下,智能体团队的额外成本并不值得,尤其是当模型已经在全力计算时。

Vals AI 的基准测试展示了 Vibe Code Bench 上的每个应用成本与得分的关系。箭头从各模型在相同推理级别下的单智能体指向其团队。团队成本高得多,但得分几乎没有提升。| 图片:Vals AI[

Anthropic 在 其对 Opus 5.5 的两项自有测试中发现,随着增加更多智能体,质量提升不断缩小。更大的团队能更快达到给定的性能水平,但从 10 个智能体增加到 100 个,24 小时后得分仅略有提高。在单独的 ProgramBench 测试中,速度提升伴随着更高的 token 消耗。

使用 Opus 5.5 的任务 1 个智能体 10 个智能体 30 个智能体 100 个智能体
知识库 0.53 0.70 0.71 0.74
Lean 定理证明 0.39 0.66 0.66 0.68

Fable 5.1 在上述 Lean 定理证明任务中超过 10 个智能体后展现出更强的质量提升,但在所有测试中的得分仍低于 Opus 5.5。在知识库任务中,当智能体从 30 个扩展到 100 个时,Fable 的得分反而略有下降。

更多智能体买来的是速度,而不是更好的产出

OpenAI 研究员 Noam Brown 在 Dwarkesh Podcast 上确认,多智能体系统主要买来的是速度,而非更高的质量。4 个智能体解决任务的速度翻倍,但成本也翻倍。在 16 个智能体时,这一规律依然成立,但效率略有下降。

他表示,这种效果在很大程度上取决于任务本身。网络研究和数学可以很好地并行化,但写小说不行。用 1 万个智能体写一部小说,和用 1 万人写一样毫无意义。Brown 承认,扩展到非常多的智能体在很大程度上仍未被探索,因为成本实在太高。

OpenAI 开发者 Eric Provencher 最近正是出于这个原因警告不要 使用智能体集群。他认为这很可能是浪费钱,因为智能体之间的协调会失效。他称之为"协调税"。

无炒作的 AI 新闻 – 由人工精选

订阅 THE DECODER,享受无广告阅读、每周 AI 新闻通讯、每年六期的独家"AI Radar"前沿报告、完整存档访问权限以及评论区的访问权限。

立即订阅

  • 完整访问 THE DECODER 上的所有文章
  • 无广告
  • 参与评论和社区讨论
  • 每周通过邮件获取 AI 新闻回顾
  • 每年 6 期:"AI Radar"——深入探讨最重要的 AI 话题
  • 每日 AI 新闻,始终紧跟最新动态
  • 我们长达十年的完整存档
  • 由拥有 10 余年 AI 经验的团队报道

来源:The Decoder · the-decoder.com