Latent Space AINews:OpenAI 发布内部模型产出的 722 篇数学论文,Mistral Large 4 与多款开源模型同周登场
Latent Space 发布 2026 年 10 月 5 日至 6 日一期 AI 新闻汇总,头条为 OpenAI 公开内部前沿模型产出的 722 份数学手稿。
Latent Space 发布 2026 年 10 月 5 日至 6 日一期 AI 新闻汇总,头条为 OpenAI 公开内部前沿模型产出的 722 份数学手稿。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,Agent Arena 排名第 5,比 GPT-6 Sol 便宜 39% 且得分高 1.52 分,比 Astra 便宜 81%。
Google DeepMind 发布 Gemini 4 Argon,主打编码、企业知识工作与网络防御,在 19 项基准中 13 项排名第一,输出上限从 64K 提升至 1M token,定价 $4/$20(限时五折 $2/$10),目前仅向 Fairwind 项目的政府用户和可信网络防御者开放。
Google 发布 Gemini 4 Argon,是其七个多月来首个前沿模型, introductory 定价为每百万输入 token $2、输出 $10,缓存输入约 95% 折扣。
Anthropic 发布评估称,智谱开源权重模型 GLM-5.3 在 ExploitBench 上 410 次尝试中 50 次成功构建可用漏洞利用,接近仅向部分防御者开放的 Claude Mythos Preview 的 56 次;在基于 OSS-Fuzz 的内部二进制利用基准上分别为 4% 和 6%。
Latent Space 发布 9 月 24 至 25 日的 AINews 周报,主题称 Claude Opus 5.5 发布后社区反馈积极,尤其在纯代码生成解说视频方面接管了时间线。
Anthropic 发布 Claude Sonnet 5.5,官方称速度快 30% 以上,多数工作成本最高降 30%,价格与 Sonnet 5 持平但基准全面占优。作者实测其编码表现接近 Opus 5.5,并指出它成为 claude.ai 免费层所用模型,使 Anthropic 免费方案强于使用 Luna 5.6 的 ChatGPT 免费层;官方重申 Haiku 5.5 将在未来几周内推出。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock(通过 Global CRIS global. inference profile)和北美的 Claude Platform on AWS 开放使用。
推荐理由:AWS 官方说明 Claude Sonnet 5.5 在 Bedrock 的可用性、与 Opus 5.5 的分工建议和上手方法,便于评估是否纳入现有工作流。
Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30% 且每任务便宜 40%,token 定价从 $5/$25 降至 $4/$20,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:原文汇总了 Opus 5.5 的定价、评测与争议细节,包括第三方拆解显示 40% 降价在 max effort 下并不成立。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。
推荐理由:作者实测了三家新模型并整理完整价格表,读者可以据此比较新一轮降价幅度和各档模型的实际表现。