评测来源官方评测
Terminal-Bench 4 · 系统参考
Harbor / Terminal-Bench / 编程 · 保留模型搭配不同 Agent 在终端任务中的原始成绩,供交叉核对。
在 AI风向 中仅供参考
证据预算不计分
上游数据时间10/07 07:19
最近成功同步10/07 14:05
它测什么,怎么测
固定 Terminal-Bench 4.0,分别保留模型、Agent 版本、推理档位和运行次数;不把不同工具系统解释为统一模型条件。
如何使用这份证据
原始成绩参考:锁定官方提交清单与数据版本后自动采集,逐条保留不同系统配置,不选模型代表分。只供交叉核对,不进入综合或编程排名。
评测成绩
下列为模型搭配不同 Agent 的系统成绩,运行条件不同,仅供参考。每项最多展示 30 条配置,匿名测试型号不展示。
| 原榜名次 | 原榜型号 | 原始成绩 | 运行配置 |
|---|---|---|---|
| 1 | claude-opus-5-5Anthropic | 64.8% | Claude Code 2.1.284 · max 推理 |
| 2 | claude-sonnet-5-5anthropic | 61.8% | Claude Code 2.1.284 · max 推理 |
| 3 | gpt-6.1-solopenai | 58.2% | Codex 0.159.0 · max 推理 |
| 4 | claude-fable-5-1Anthropic | 57.9% | Claude Code 2.1.257 · max 推理 |
| 5 | claude-opus-5Anthropic | 51.8% | Claude Code 2.1.231 · max 推理 |
| 6 | gpt-6-solOpenAI | 49.4% | Codex 0.159.0 · max 推理 |
| 7 | claude-fable-5Anthropic | 44.5% | Claude Code 2.1.231 · max 推理 |
| 8 | glm-5.3Z.ai | 41.8% | Claude Code 2.1.207 · max 推理 |
| 9 | gpt-5.6-solOpenAI | 37.3% | Codex 0.149.1 · max 推理 |
| 10 | glm-5.3-flashZ.ai | 35.8% | Claude Code 2.1.285 · 来源未报告推理档位 |
| 11 | qwen3.8-max-0902Alibaba | 27.0% | Claude Code 2.1.285 · max 推理 |
| 12 | claude-opus-4-8Anthropic | 23.6% | Claude Code 2.1.231 · max 推理 |
| 13 | gpt-5.6-terraOpenAI | 21.5% | Codex 0.149.1 · max 推理 |
| 14 | grok-4.6xAI | 20.3% | Grok Build 1.0.5 · 来源未报告推理档位 |
| 15 | gemini-3.8-flashGoogle | 19.1% | mini-SWE-agent 2.4.6 · high 推理 |
| 16 | gpt-5.6-lunaOpenAI | 17.3% | Codex 0.149.1 · max 推理 |
| 17 | gpt-6-lunaOpenAI | 16.4% | Codex 0.159.0 · max 推理 |
| 18 | muse-spark-1.3Meta | 14.6% | Muse Code 1.4.1 · xhigh 推理 |
| 19 | claude-sonnet-5Anthropic | 12.4% | Claude Code 2.1.231 · max 推理 |
| 19 | grok-4.5xAI | 12.4% | Grok Build 1.0.5 · 来源未报告推理档位 |
| 21 | gemini-3.7-flashGoogle | 11.2% | mini-SWE-agent 2.4.6 · high 推理 |
评测局限与数据署名
不同模型使用 Claude Code、Codex、GrokBuild 或 mini-SWE 等不同工具;AA v4.3 已含 Terminal-Bench v4,不得再次计入综合票权。
数据许可:Apache 2.0 · 官方 harbor-framework/terminal-bench 仓库内的成绩提交;保留署名、协议与修改说明。
成绩由 Harbor / Terminal-Bench 发布,原始分数与 AI风向 共识分使用不同尺度,不能直接相加。