GitHub 发布开源基准 ReviewBench 用于评测 AI 代码审查
GitHub 发布开源离线基准 ReviewBench,用于评测 AI 代码审查智能体。基准基于 1.039 亿 GitHub pull request 的分布建模。
GitHub 发布开源离线基准 ReviewBench,用于评测 AI 代码审查智能体。基准基于 1.039 亿 GitHub pull request 的分布建模。
Simon Willison 用“在火星上乱穿马路的穿渔网袜犰狳”SVG 生成提示词测试 Mistral Large 4,并与 claude-opus-5.5、gpt-6.1-sol 和 gemini-3.8-flash 的输出进行对比,各模型均使用默认推理级别。
一项基准测试了本地 `Qwen3.8-27B-Q4_K_M.gguf` 模型能否只用英文单词表达正整数加法的精确结果,共 5,070 个关闭推理的用例及 169 个开启推理的对照用例。关闭推理时数值准确率仅 23.57%,其中 1-3 位数运算达 97.04%,10-13 位数降至 6.44%,格式合规率 96.17%;开启推理后在 169 次尝试中答对 167 次。
Microsoft 与 Hugging Face 发布 ThinkingBox 智能体沙箱和 ThinkingBox-Bench 基准,507 个有状态业务工作流、每任务运行 20 次,用可执行检查评测终端数据库状态与副作用,现已通过 OpenEnv 在 Hugging Face 开放。
推荐理由:原文用可执行的后端状态检查区分了表面成功与真实结果,还给出各模型一致性与成本数据,对评估智能体有直接参考。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,Agent Arena 排名第 5,比 GPT-6 Sol 便宜 39% 且得分高 1.52 分,比 Astra 便宜 81%。
Mercor 的研究让 12 名平均经验 5 年半的持证会计师完成 APEX Accounting Benchmark 的简化任务,结果显示当今 AI 模型的速度、准确率和成本均优于会计师,而 18 个月前最佳模型得分还低于会计师约 37% 的平均水平。
OpenAI 推出 MentalHealthBench,这是一个由专家参与构建的评测基准,用于评估 AI 在真实心理健康对话中给出回复的有效性与安全性。
英国 AI 安全研究所(AISI)开始使用 EvalEval 的基础设施公开分享评测结果,包括 HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro、Terminal-Bench 2.0 五个基准及 Cyber CTFs、The Last Ones 两项网络评测的验证结果。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览提交中首次亮相,Qwen3-VL 上吞吐量最高达 GB300 NVL72 的 3.7x,DeepSeek-R1 上达 2.5x。
Hugging Face 推出 BenchMIRT,一种基于多维 IRT 的方法,可在单条 prompt 层面审计 LLM benchmark 实际测量的能力。
Voice Arena 与 Hugging Face 为 Open ASR Leaderboard 发布 Monsoon 四个评测集,覆盖印度英语与印地语,印地语是该多语言榜单首个非欧洲语言。
推荐理由:原文给出 Monsoon 评测集的划分结构、说话人覆盖与区域分析示例,读者可借此理解聚合 WER 之外的模型差异来源。
DiG-bench(Discovery in Games)发布,这是一个包含 70 款游戏的基准,用于测试 AI 通过探索自主发现隐藏规则的能力,21 款游戏已公开。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型对连通性、封闭、顺序、分离和绳结等拓扑概念的推理与规划能力。测试显示,模型在静态图像识别上表现明显好于交互式规划任务,且两者均远低于人类水平,错误多出在规划阶段丢失结构关系或提出违反物理约束的动作。该基准旨在为机器人和交互环境中的智能体研究提供受控诊断工具。
Hume 发布 Real World VoiceEQ 基准,评估语音 AI 交互的人性化质量,覆盖 ASR、TTS、S2S 和语音理解,评测 40 多个主流闭源与开源语音模型、15+ 维度和 60 多项指标。
Hugging Face 推出开源基准 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评测 AI 智能体在企业级 Java 跨框架迁移任务上的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三个生态。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,支持交叉发布评测结果并回链完整 EEE 记录。
Google Research 在论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究 AI 评测中每条数据标注数与标注条目数的权衡,并开源了基于真实数据集的模拟器。