跳到正文
The Decoder· Matthias Bastian·· 3 小时前精选AI 评分76

Anthropic 发布 Claude Haiku 5.5,均价降约 75% 并下调 Sonnet 5.5 缓存读取价格

Claude Haiku 5.5 arrives with massive price cuts proving the AI pricing arms race is far from over

AI 导读

Anthropic 发布 Claude Haiku 5.5,均价较 Haiku 4.5 降约 75%,10 万 token 以内的提示词降价最高达 90%,并首次在 Haiku 级模型中提供可调推理等级。

推荐理由

原文整理了 Haiku 5.5 的降价幅度、关键基准数据和可调推理等级,可据此对比它与 GPT-6 Luna 及 Sonnet 5.5 的定位差异。

正文 · AI 翻译

Anthropic 发布了 Claude Haiku 5.5,这是该公司迄今最快、最实惠的小型模型。基准测试结果显示,其性能较前代有大幅跃升,同时 Anthropic 也下调了 Sonnet 5.5 的价格。

据 Anthropic 介绍,Haiku 5.5 专为摘要、数据库查询、分类和实时客服等大批量、成本敏感的任务而设计。平均而言,该模型的成本比 Haiku 4.5 低约 75%。对于提示词不超过 100,000 token 的请求——Anthropic 称这类请求约占此前所有 Haiku 请求的 90%——价格最多可下降 90%。超过 100,000 token 的提示词则要花费五倍的价格。

每 100 万 token 的价格 Haiku 5.5(提示词 100k 以内 / 以上) Haiku 4.5 Sonnet 5.5
缓存读取 $0.01 / $0.05 $0.10 $0.10
缓存写入 $0.125 / $0.625 $1.25 $2.50
输入 token $0.10 / $0.50 $1.00 $2.00
输出 token $0.50 / $2.50 $5.00 $10.00

Anthropic 指出,Haiku 5.5 使用了更新的分词器,每项任务消耗的 token 会比前代略多。同样的情况也发生在 Opus 4.x 模型上,仅分词器的改变就使 token 用量增加了约 30%。因此实际节省可能低于每 token 价格所暗示的幅度。

基准测试显示较 Haiku 4.5 大幅跃升

Haiku 5.5 在知识基准 GDPval-AA v2.1 上得分为 1,620,是前代 735 分的两倍多。在 Humanity's Last Exam 上,它在无工具的情况下达到 45.9%,有工具时达到 57.4%,而前代分别为 10.2% 和 18.7%。

提升最大的是计算机使用,即模型自主操作计算机。由于计算机使用会消耗大量 token,像 Haiku 5.5 这样便宜又快速的模型是天然的选择。它在 OSWorld-2.1 上的得分为 72.4%,而前代为 15.7%。在智能体编码基准 Terminal-Bench 4.0 上,它达到 39.2%,而 Haiku 4.5 得分为零。

Anthropic 还将 OpenAI 的廉价模型 GPT-6 Luna 列为对比对象,Haiku 5.5 在所有测试类别中均领先。不过,Sonnet 5.5 的参考分数表明,Haiku 5.5 仍远落后于 Anthropic 的更大模型。

Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
知识工作 / GDPval-AA v2.1 1,620 735 1,437 1,840
知识工作 / AA-Briefcase v1.1 1,578 614 1,336 1824
计算机使用 / OSWorld 2.1 72.4%(离线子集) 15.7%(离线子集) 48.9%(离线子集) 83.9%(离线子集)
多学科推理 / Humanity's Last Exam 45.9%(无工具) 10.2%(无工具) — 56.9%(无工具)
57.4%(有工具) 18.7%(有工具) — 64.5%(有工具)
智能体编码 / Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
智能体编码 / FrontierCode 1.1 (Main) 46.4% — 42.4% 52.1%(Xhigh)
视觉推理 / Chartography 46.4%(无工具) 6.4%(无工具) 29.1%(无工具) 61.6%(无工具)

首个 Haiku 模型让用户可以用成本换性能

Haiku 5.5 是首个具有可调推理级别的 Haiku 级模型,让用户可以在成本与质量之间取得平衡。Anthropic 表示,该模型最适合压缩、摘要或子智能体工作等范围狭窄的任务。对于复杂的智能体编码,Sonnet 5.5 和 Opus 5.5 仍是更好的选择。

网络安全防护措施比前代更严格,但与 Sonnet 5.5 相比允许更广泛的防御性任务,部分原因是该模型整体能力较弱。渗透测试仍被禁止。需求更广泛的组织可以申请 Anthropic 的生命科学与网络安全验证计划。

Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。

Sonnet 5.5 也降价了,Anthropic 还发放 API 额度

在推出 Haiku 的同时,Anthropic 将 Sonnet 5.5 的缓存读取成本降低了 50%,从每百万 token 0.20 美元降至 0.10 美元。该公司表示,这应能将大多数智能体任务的成本降低约 20%。此举几乎可以肯定是对 OpenAI 新的 GPT-6.1 系列的回应,表明 AI 价格战正以前所未有的激烈程度展开。

Anthropic 还推出了每月 API 额度。Max-5x 订阅者可获得 100 美元,Max-20x 订阅者可获得 200 美元,Team 订阅者每月最多可获得 500 美元。用户可以通过 API 花费这些额度来试用各种工具、应用和智能体。

该公司还在更新其 Python 和 TypeScript SDK,为 计算机使用和浏览器使用添加了测试版支持。

AI News Without the Hype – Curated by Humans

订阅 THE DECODER,享受无广告阅读、每周 AI 新闻通讯、每年六期的独家 "AI Radar" 前沿报告、完整档案访问权限以及评论区的访问权限。

来源:The Decoder · the-decoder.com