Reflection 发布 501B 开放权重模型 Beam,主打低算力编码与推理
Reflection 宣布首款免费开放模型 Beam,总参数 501B、每 token 激活 23B(MoE),面向编码、逻辑推理和智能体任务。据 Reflection 称,Beam 在高难推理任务上以少三到四倍的算力匹配 GLM 5.2,编码与智能体基准接近 Qwen3.8-Max,但原始性能仍不及 Kimi K3 等更强开源模型。
Reflection 宣布首款免费开放模型 Beam,总参数 501B、每 token 激活 23B(MoE),面向编码、逻辑推理和智能体任务。据 Reflection 称,Beam 在高难推理任务上以少三到四倍的算力匹配 GLM 5.2,编码与智能体基准接近 Qwen3.8-Max,但原始性能仍不及 Kimi K3 等更强开源模型。
Mistral 发布迄今最大模型 Mistral Large 4(ML4,绰号 le Chonk)公开预览,总参数 1.05 万亿、激活 490 亿,API 已上线,权重预计月底发布。
美国初创公司 Reflection AI 正式发布其首个前沿开源权重模型 Beam,称其在高级推理基准上与 Z.ai 的 GLM-5.2 表现相当,推理计算用量少 3-4x。
Mistral 发布 Mistral Large 4(ML4)公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,权重将于本月底开放下载。
推荐理由:官方发布了参数规模、基准分数、训练基础设施和权重开放时间表,读者可据此评估它在开源阵营中的实际位置。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,Agent Arena 排名第 5,比 GPT-6 Sol 便宜 39% 且得分高 1.52 分,比 Astra 便宜 81%。
Google 发布新模型 Gemini 4 Argon,称其擅长网络安全、编码与研究,可自主发现、验证并修复关键软件漏洞。该模型经防御性网络安全任务专项训练,目前仅通过 Fairwind 安全计划向部分网络安全合作伙伴开放;Google 引用 Vals 的模型指数称其在多项基准上领先 OpenAI GPT-6 Astra 与 Anthropic 的 Fable 和 Opus。
Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识和网络安全防御等复杂工作流中表现前沿。
Google 宣布新模型 Gemini 4 Argon,称其在编码、知识工作和网络安全上性能行业领先,但目前仍处有限测试阶段,普通用户暂不能使用。Google 内部已在大量使用:Argon 借助全集群遥测数据帮助节省 300 TiB 数据中心内存,其智能体已将包括 Fuchsia OS Zircon 内核超 80 万行在内的 C/C++ 代码迁移到 Rust。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,定价为每百万输入 token $2、输出 token $10,缓存输入 95% 折扣。
推荐理由:官方博客给出定价、1M 输出 token 上限、基准分数和内部迁移案例,读者可以据此判断它在编程与安全防御上的实际定位。
OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作场景,智能水平接近 Astra,API 输入和输出 token 价格为 Astra 标准价的五分之一。
推荐理由:原文给出了 GPT-6.1 Sol 的定位和价格对比,读者可以据此评估它相对 Astra 的成本优势。
Latent Space 发布 9 月 24 至 25 日的 AINews 周报,主题称 Claude Opus 5.5 发布后社区反馈积极,尤其在纯代码生成解说视频方面接管了时间线。
Anthropic 发布 Claude Sonnet 5.5,官方称速度快 30% 以上,多数工作成本最高降 30%,价格与 Sonnet 5 持平但基准全面占优。作者实测其编码表现接近 Opus 5.5,并指出它成为 claude.ai 免费层所用模型,使 Anthropic 免费方案强于使用 Luna 5.6 的 ChatGPT 免费层;官方重申 Haiku 5.5 将在未来几周内推出。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock(通过 Global CRIS global. inference profile)和北美的 Claude Platform on AWS 开放使用。
推荐理由:AWS 官方说明 Claude Sonnet 5.5 在 Bedrock 的可用性、与 Opus 5.5 的分工建议和上手方法,便于评估是否纳入现有工作流。
Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30% 且每任务便宜 40%,token 定价从 $5/$25 降至 $4/$20,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:原文汇总了 Opus 5.5 的定价、评测与争议细节,包括第三方拆解显示 40% 降价在 max effort 下并不成立。
Latent Space 播客对话 TypeSafe AI CEO Diogo Almeida,讨论其新发布的 Jev 模型及发布视频约 38M 次观看的热度。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
推荐理由:官方给出两个变体的基准数字、定价和实际应用案例,读者可以据此评估在编码与安全场景中的替换成本。
IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密解码器模型,基于 Granite 4.1 基座(从头在约 15T token 上预训练,五阶段策略将上下文扩展至 512K),经 SFT 与多阶段 GRPO 强化学习后训练,全部以 Apache 2.0 许可开源。
推荐理由:官方完整披露从预训练、SFT 到多阶段 GRPO 和智能体 RL 的训练细节,可迁移到类似模型的构建流程。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和 Agent 的主力模型,距 Gemini 3.6 Flash 仅三周。
推荐理由:官方公告给出了多个基准分数和半价定价细节,读者可以据此评估是否切换到 3.7 Flash。
Meta 今日发布 30B 参数多模态开源模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地部署的隐私场景与编码、文档分析、个人助理等智能体用途。
推荐理由:原文给出架构细节、Agent 基准对比和各推理栈的 day-0 用法,读者可据此评估本地多模态部署的选择。
Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上输出 token 用量比 3.5 Flash 减少 17%,定价 $1.50/1M 输入、$7.50/1M 输出,DeepSWE 49% vs 37%、OSWorld-Verified 83.0% vs 78.4%。
推荐理由:官方原文给出三款新模型的具体价格、token 效率与多项基准数字,并说明各模型面向的部署场景。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证和修补漏洞。
Google DeepMind 发布 Gemini 3.5 模型系列,首先推出 3.5 Flash,定位智能体与编码,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上超过 Gemini 3.1 Pro,输出速度为其他前沿模型的 4 倍。
推荐理由:官方公布了 3.5 Flash 的基准成绩、开放渠道和 Pro 后续计划,读者可以据此评估它在智能体与编码场景的取舍。
Mistral 发布首个面向 Lean 4 的开源代码智能体 Leanstral-120B-A6B(6B 激活参数),权重采用 Apache 2.0 许可,可通过 Mistral Vibe 和 labs-leanstral-2603 免费 API 端点使用。
Mistral AI 发布开源编码模型家族 Devstral 2,包含 123B 的 Devstral 2(modified MIT 许可)和 24B 的 Devstral Small 2(Apache 2.0),两者均支持 256K 上下文窗口,分别在 SWE-bench Verified 上取得 72.2% 和 68.0%。
推荐理由:官方公布了两个尺寸编码模型的开源协议、SWE-bench Verified 成绩、API 定价和硬件要求,可据此评估本地或端侧部署的可行性。
Mistral AI 发布 Codestral 25.08 代码补全模型,并提供包含 Codestral Embed、Devstral 和 Mistral Code IDE 插件的企业编码栈。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:官方给出了两个新模型的 SWE-Bench Verified 成绩、定价和许可方式,开发者可以据此评估代码智能体选型。
Mistral AI 与 All Hands AI 合作推出面向软件工程任务的智能体大语言模型 Devstral,以 Apache 2.0 许可开源发布。
推荐理由:官方发布了模型权重和 API 定价,并给出 SWE-Bench Verified 的具体成绩与部署门槛,读者可以据此评估本地或企业编码场景的适配性。
Mistral AI 发布 Mistral Medium 3,定位 SOTA 性能、成本降低 8 倍的新级别模型。基准上达到或超过 Claude Sonnet 3.7 的 90%,定价为 $0.4 输入 / $2 输出每 M token,超越 Llama 4 Maverick 和 Cohere Command A,可在 4 张 GPU 以上环境自部署。
推荐理由:官方给出与 Claude Sonnet 3.7 的基准对比、定价和部署门槛,读者可据此评估企业落地的性价比。