Anthropic 发布 Claude Haiku 5.5,同价下 Intelligence Index 得分 43 超 GPT-6 Luna
[AINews] Claude Haiku 5.5 — better than GPT-6 Luna at the same pricing
Anthropic 发布 Claude Haiku 5.5,是约一年来首个 Haiku 级更新,Artificial Analysis Intelligence Index 得分 43,超 GPT-6 Luna(38)与 GLM-5.3 Flash(42)。
汇编了第三方评测与实际价格细节,读者可以据此权衡小模型在低成本 Agent 工作流中的真实性价比。
距离 Anthropic 发布 Haiku 4.5已经过去大约一年,随着 Sonnet、Opus 和 Fable 相继更新到 5.5,它似乎有点被遗忘了,尤其是 OpenAI 在发布 Astra 和 Sol 6 的同时推出了 Luna 6。
好吧,它来了,这是一次值得欢迎的更新。更多信息见下方的摘要。
Artificial Analysis@ArtificialAnlys
2026年10月6日至10月7日的 AI 新闻。我们查看了 12 个 subreddit、544 个 Twitter 账号,没有查看更多 Discord。AINews 的网站可让你搜索所有过往期刊。提醒一下,AINews 现在是 Latent Space 的一个栏目。你可以选择加入/退出邮件频率!
头条新闻:Anthropic 发布 Claude Haiku 5.5
Anthropic 发布了 Claude Haiku 5.5,这是约一年来的首次 Haiku 档位更新。其定价与 OpenAI 的 GPT-6 Luna 持平,且 Anthropic 在同一天下调了 Sonnet 5.5 及其订阅计划的价格。
发布前的信号。 @scaling01 在官方公布前发帖说“祝大家 Haiku 5.5 日快乐”。@kimmonismus 称该模型已出现在一个 Claude Code 更新中,并预测定价将“与 Luna 持平”。随后他在官方发布前贴出了定价(@kimmonismus),并在上线时予以确认(@kimmonismus)。
正式发布。 @claudeai 和 @AnthropicAI 称其为“我们发布过的最便宜、最快、能力最强的小模型”,运行成本平均比 Haiku 4.5 低约 75%。
可用性与预期用途。 它已在 Claude Platform 和 Claude Code 上线(@ClaudeDevs)。Anthropic 将其定位为与 Opus 5.5 或 Sonnet 5.5 搭配的子智能体,用于高并发、成本敏感的工作,如摘要、压缩和数据库查询。@mikeyk 将这种分工描述为“Opus 负责深度思考,Haiku 负责高并发工作”。
分级定价(@ClaudeDevs):
提示词长度输入 / 输出(每 1M token)缓存读取(每 1M)低于 100K token$0.10 / $0.50$0.01超过 100K token$0.50 / $2.50$0.05
Sonnet 5.5 降价。 缓存读取价格从每 1M token $0.20 减半至 $0.10。Anthropic 表示,这使得 Sonnet 5.5 在大多数长时间运行或智能体工作中的成本降低约 20%(@claudeai)。
订阅者 API 额度。 Claude Platform 的月度 API 额度现已随 Max 5x($100)、Max 20x($200)和 Team(最高 $500,共享池)一同提供。它们可用于任何模型,包括 Haiku 5.5,并可在第三方框架中使用(@ClaudeDevs)。
当日 SDK 更新。 计算机使用与浏览器使用工具集现已内置到 Python 和 TypeScript 版 Claude SDK 中。SDK 负责运行动作循环,并将点击和按键发送给来自 browser_use、Browserbase、E2B 或 Daytona 的驱动程序,开发者无需再自己编写该循环(@ClaudeDevs,快速入门)。
合作伙伴首日即上线:
Cursor:@cursor_ai 称在较短请求上“比 Haiku 4.5 少 10 倍”,并发布了 CursorBench 对比数据(@cursor_ai)。
VS Code 中的 GitHub Copilot:@code 报告称它“在许多编码任务上媲美 Claude Sonnet 5,同时使用的 token 和步骤更少。”
Devin:@cognition 报告在 FrontierCode 1.1 上取得 58.4%,领先 Sonnet 5,而每个任务的成本约为其八分之一,并推荐它作为 Fusion 中由 Opus 5.5 主导下的“副手”。
Arena:已加入 Agent Arena、Code Arena WebDev、Text、Document 和 Vision,分数待出(@arena)。
OpenDocRouter:同日加入(详情见下文)。
@ArtificialAnlys 发布了最详细的第三方数据(各评测细分,对比页面)。
智能指数:43(最大努力档),比上一代 Haiku 高出 26 分。
略高于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)。
与 Kimi K3(44)相当,后者是一个 2.8T 参数的开放权重模型。
落后于最大努力档的 Claude Sonnet 5.5(56)13 分。
新控制项。 这是首款配备 Anthropic 努力档设置和自适应思考的 Haiku。
Token 用量是主要注意事项。
在最大努力档下,每个 Index 任务约使用 162k 输出 token,约为最大努力档 GPT-6 Luna(约 50k)的 3 倍。
从 xhigh 提升到 max 增加 2 分,代价是约 1.8 倍的 token。
在相同分数下它仍然更加冗长:Haiku 5.5 在 high 努力档得 38 分,使用约 55k token,而 Luna 在 max 档得 38 分使用约 50k。在更低努力档设置下差距进一步扩大。
成本数字为暂定值。 Artificial Analysis 尚未对超过 100K token 后 5 倍的价格阶梯进行建模。每任务成本数字将随后发布。
AA-Briefcase(私有智能体知识工作评测):1578 Elo。领先于 Kimi K3 和 GLM-5.3,与最大努力档的 Muse Spark 1.3 相当。
Terminal-Bench 4.0:33%,Haiku 4.5 为 0%。
与 GLM-5.3 Flash 持平。
领先于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)。
知识与幻觉(AA-Omniscience):
模型准确率幻觉率Haiku 5.536%40%Gemini 3.8 Flash55%55%GPT-6 Luna44%77%
Haiku 准确率较低的部分原因在于它更愿意承认自己不知道。
AutomationBench-AA:35%,而 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。一个预发布阶段的安全 bug 导致该模型过度拒绝。Anthropic 正在修复,Artificial Analysis 将重新运行该评测,预计分数会上升。
规格:
1M token 上下文,Haiku 4.5 为 200k。
文本和图像输入,文本输出。
5 分钟缓存写入成本为每 1M token $0.125(超过 100K 为 $0.625)。
@ShayneRedford 总结了 Anthropic 报告的提升:
OSWorld(计算机使用):15% → 72%。
TerminalBench:0% → 39%。这与 Artificial Analysis 在 Terminal-Bench 4.0 上独立测得的 33% 有所不同。
知识工作与推理方面提升 10–50%。
在上述大多数项目上超过 Luna。
1M 上下文,最大输出 token 约为 12k。
@alexalbert__(Anthropic)强调 Haiku 4.5 于 2025 年 10 月 15 日发布,因此对比时间跨度不到一年。
@TheRundownAI 报道称,它“在多项基准测试中”击败了 GPT-6 Luna。
文档解析(独立测试,基于 ParseBench):
@LoganMarkewich:总体与 Luna 接近,表格处理略好,图表理解稍差。
@jerryjliu0:每 1,000 页约 1.2 美元。就价格而言,表格和阅读顺序处理不错;图表、语义格式和边界框方面较弱。
轶事评价:
@simonw 撰写了定价笔记并运行了他的 pelican-on-a-bicycle 测试。他说它比 Haiku 4.5 “好太多了”,而后者价格是其 10 倍(对比)。
@AI_Screening 称 Haiku 5.5 在一个 Three.js 斑马模拟上“完胜”Luna(单次提示,非系统性测试)。
看好
@kimmonismus:“远胜 GPT-6-Luna,接近 Sonnet 5.5……便宜又聪明。”
@theo 喜欢其阶梯定价:在 100K token 以内收取五分之一的价格“让人非常清楚这个模型的用途”。他还发现,看到 Anthropic 的模型“在成本/智能图表上如此靠左”令人印象深刻(@theo),并在直播中介绍了这次发布(@theo)。
@draecomino:“Haiku 以最大努力运行时表现如前沿模型。”
@kipperrii 认为,既然小而便宜的模型现在能做“一大堆有用的事情”,它们就更重要了。
@scaling01(“便宜得很”)以及后来(@scaling01):“5.5 系列模型看起来不错。”
@NotTomBrown(“小而强大”)和 @edwinarbus 都来自 Anthropic 一方,发布了庆祝性的言论。
竞争定位
这次发布被普遍解读为瞄准 OpenAI 的 GPT-6 Luna:“rip gpt 6 luna”(@dejavucoder)、“是时候收拾 Luna 了”(@scaling01)。
@kimmonismus 将 Sonnet 缓存读取价格的削减解读为 Anthropic 在向 OpenAI 施压。关于 API 额度,他补充道:“OpenAI:该你了”(@kimmonismus)。
@teortaxesTex 表示 Anthropic 现在拥有“所有实验室中最深的产品线”(Haiku/Sonnet/Opus/Fable 加上 Mythos),而 OpenAI 是 Luna/Sol/Astra。他仍然认为 Anthropic “对产品没那么在意”,他将此视为该公司在 2026 年期间有多少余裕的体现。
ThursdAI 的 @altryne 质疑了中间档位:“当 Opus 还很贵的时候,Sonnet 才有意义。”该节目计划介绍 Haiku 5.5(@thursdai_pod)。
注意事项(主要来自数据本身,而非高调批评者)
标称价格可能夸大了实际节省。
重度 token 使用(最大努力下约为 Luna 的 3 倍)抵消了部分单 token 折扣。
超过 100K token 的提示需支付 5 倍价格,这对长上下文智能体循环影响很大。
这两个效应很可能解释了为什么 Cursor 的“短请求便宜 10 倍”与 Anthropic 的“平均便宜 75%”存在差异。
事实性记忆弱于 Gemini 3.8 Flash 和 Luna。
过度拒绝的 bug目前拖累了自动化评分。
尚未进行基准测试:Arena 评分尚未出炉,独立的每任务成本数据也需等待分级定价支持。
自 2025 年 10 月起,Haiku 4.5 一直是 Anthropic 的小模型。此后,OpenAI 的 GPT-6 Luna、Gemini 3.8 Flash、GLM-5.3 Flash 和 DeepSeek V4.1 Flash 在低成本端展开竞争。
Haiku 5.5 的标价与 Luna 完全一致,还增加了努力程度控制和 1M 上下文。
它被明确定位为多模型智能体框架中的廉价执行者:Claude Code 子智能体、Devin Fusion、Copilot 子智能体,以及压缩或摘要步骤。
Anthropic 同时推出了 Sonnet 缓存读取降价和订阅 API 额度,这是对智能体经济学的协同发力。此举正值围绕 token 账单的更广泛讨论之际(见下文 @theo)。
OpenAI 的 722 份数学手稿:规模、效率与余波
来源:Latent Space · latent.space

