研究显示 AI 智能体团队消耗大量 token 但质量提升微乎其微
AI agent teams waste massive tokens for barely measurable quality gains, research finds
Vals AI 在 Vibe Code Bench 上测试 GPT-6 Sol 和 Claude Opus 5.5 的单智能体与团队表现,团队成本是单智能体的 1.8x 至 5.1x,四组对比中仅 GPT-6 Sol 在 medium 推理档提高 7.3 分且具统计显著性。
2026年10月11日
研究发现:AI 智能体团队带来的效果提升几乎可以忽略不计。
评测公司 Vals AI 在"Vibe Code Bench"上以单智能体和团队两种形式测试了 GPT-6 Sol 和 Claude Opus 5.5,涵盖两个推理级别:中等推理和最大推理。团队的成本是单智能体的 1.8 倍到 5.1 倍。
在团队与单智能体的 四项对比中,只有一项显示出统计上的显著提升:GPT-6 Sol 在中等推理下,团队得分高出 7.3 分。在最大推理下,团队模式对 Sol 和 Opus 5.5 都没有带来实际优势。结果表明,在大多数情况下,智能体团队的额外成本并不值得,尤其是当模型已经在全力计算时。

Anthropic 在 其对 Opus 5.5 的两项自有测试中发现,随着增加更多智能体,质量提升不断缩小。更大的团队能更快达到给定的性能水平,但从 10 个智能体增加到 100 个,24 小时后得分仅略有提高。在单独的 ProgramBench 测试中,速度提升伴随着更高的 token 消耗。
| 使用 Opus 5.5 的任务 | 1 个智能体 | 10 个智能体 | 30 个智能体 | 100 个智能体 |
|---|---|---|---|---|
| 知识库 | 0.53 | 0.70 | 0.71 | 0.74 |
| Lean 定理证明 | 0.39 | 0.66 | 0.66 | 0.68 |
Fable 5.1 在上述 Lean 定理证明任务中超过 10 个智能体后展现出更强的质量提升,但在所有测试中的得分仍低于 Opus 5.5。在知识库任务中,当智能体从 30 个扩展到 100 个时,Fable 的得分反而略有下降。
更多智能体买来的是速度,而不是更好的产出
OpenAI 研究员 Noam Brown 在 Dwarkesh Podcast 上确认,多智能体系统主要买来的是速度,而非更高的质量。4 个智能体解决任务的速度翻倍,但成本也翻倍。在 16 个智能体时,这一规律依然成立,但效率略有下降。
他表示,这种效果在很大程度上取决于任务本身。网络研究和数学可以很好地并行化,但写小说不行。用 1 万个智能体写一部小说,和用 1 万人写一样毫无意义。Brown 承认,扩展到非常多的智能体在很大程度上仍未被探索,因为成本实在太高。
OpenAI 开发者 Eric Provencher 最近正是出于这个原因警告不要 使用智能体集群。他认为这很可能是浪费钱,因为智能体之间的协调会失效。他称之为"协调税"。
无炒作的 AI 新闻 – 由人工精选
订阅 THE DECODER,享受无广告阅读、每周 AI 新闻通讯、每年六期的独家"AI Radar"前沿报告、完整存档访问权限以及评论区的访问权限。
- 完整访问 THE DECODER 上的所有文章
- 无广告
- 参与评论和社区讨论
- 每周通过邮件获取 AI 新闻回顾
- 每年 6 期:"AI Radar"——深入探讨最重要的 AI 话题
- 每日 AI 新闻,始终紧跟最新动态
- 我们长达十年的完整存档
- 由拥有 10 余年 AI 经验的团队报道
来源:The Decoder · the-decoder.com