Reflection 发布 501B 开放权重模型 Beam,主打低算力编码与推理
Reflection 宣布首款免费开放模型 Beam,总参数 501B、每 token 激活 23B(MoE),面向编码、逻辑推理和智能体任务。据 Reflection 称,Beam 在高难推理任务上以少三到四倍的算力匹配 GLM 5.2,编码与智能体基准接近 Qwen3.8-Max,但原始性能仍不及 Kimi K3 等更强开源模型。
Reflection 宣布首款免费开放模型 Beam,总参数 501B、每 token 激活 23B(MoE),面向编码、逻辑推理和智能体任务。据 Reflection 称,Beam 在高难推理任务上以少三到四倍的算力匹配 GLM 5.2,编码与智能体基准接近 Qwen3.8-Max,但原始性能仍不及 Kimi K3 等更强开源模型。
Mistral 发布迄今最大模型 Mistral Large 4(ML4,绰号 le Chonk)公开预览,总参数 1.05 万亿、激活 490 亿,API 已上线,权重预计月底发布。
Google 发布开源嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为向量,参数量 740M,Google 称其在多模态嵌入基准上超越体量两倍的竞品。
美国初创公司 Reflection AI 正式发布其首个前沿开源权重模型 Beam,称其在高级推理基准上与 Z.ai 的 GLM-5.2 表现相当,推理计算用量少 3-4x。
Mistral AI 发布 1 万亿参数的多模态大模型 Mistral Large 4,暂只能通过公开 guardrail endpoint 访问,计划在安全测试完成后三周内开放权重。该模型仅用 4000 块 Nvidia GPU 训练,优化用例包括网络安全、金融和芯片设计,公司上月以 210 亿欧元估值完成由 Samsung 领投的 D 轮融资。
Mistral 发布 Mistral Large 4 预览版,总参数 1 万亿、激活参数 49B,用自有 3,800 张 NVIDIA Grace Blackwell GPU 训练,已可通过 Mistral API 使用,承诺本月底开源权重。
Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。
Musubi 于周二发布面向实时内容审核的轻量级决策模型 PolicyLM-1.7B,以开放权重开源。该模型可将英文撰写的内容政策应用于消息,耗时低于 50 毫秒,成本和速度接近多数社交平台使用的 AI 分类器,且政策变更时无需重新训练。决策模型因 9 月 TypeSafe AI 发布 Jev 而成为热门方向,OpenAI 和 Amazon 也随后推出了竞品。
Mistral 发布 Mistral Large 4(ML4)公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,权重将于本月底开放下载。
推荐理由:官方发布了参数规模、基准分数、训练基础设施和权重开放时间表,读者可据此评估它在开源阵营中的实际位置。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数,采用 Apache 2.0 许可,将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:官方给出了参数量、内存占用和基准得分等具体指标,可帮助读者评估它是否适合端侧检索场景。
OpenAI 发布722篇数学手稿,覆盖372个结果族,据 AGMAI 称包含对"数百"个开放问题的解答,成果由一个未发布的前沿模型产生。手稿发布在 GitHub 仓库并附论文修订与引用协议,还包括模型推理摘要、算力估算,OpenAI 称平均每个结果相当于 ChatGPT Pro 三小时的思考量。
推荐理由:报道给出722篇手稿的规模、问题数量和算力估算,读者可据此了解这批数学成果的实际内容与学界争议。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,Agent Arena 排名第 5,比 GPT-6 Sol 便宜 39% 且得分高 1.52 分,比 Astra 便宜 81%。
Microsoft AI 发布实时语音转写模型 MAI-Transcribe-2-Streaming,称其在 Artificial Analysis 准确率排名第一,支持 60 种语言,首批部分结果延迟仅 100 多毫秒,年底前每小时音频定价 $0.54。
Ideogram 发布新模型 Ideogram 4.5,宣称只修改用户指定的图像区域,其余部分保持不变,解决多次编辑后出现伪影的问题。模型提供四档质量、每张 0.8 至 22 美分,原生 2K 分辨率,已在 Ideogram 平台和 API 上线,合作伙伴包括 Picsart、Runway、Pika 和 Leonardo AI,官方称开源权重版本即将推出。
AWS 发布开源决策模型 Strands Decider 2B,灵感来自 TypeSafe 的 Jev,用于在预设选项间快速低成本地做出选择并给出置信度。
Google DeepMind 发布 Gemini 4 Argon,主打编码、企业知识工作与网络防御,在 19 项基准中 13 项排名第一,输出上限从 64K 提升至 1M token,定价 $4/$20(限时五折 $2/$10),目前仅向 Fairwind 项目的政府用户和可信网络防御者开放。
Google 发布新模型 Gemini 4 Argon,称其擅长网络安全、编码与研究,可自主发现、验证并修复关键软件漏洞。该模型经防御性网络安全任务专项训练,目前仅通过 Fairwind 安全计划向部分网络安全合作伙伴开放;Google 引用 Vals 的模型指数称其在多项基准上领先 OpenAI GPT-6 Astra 与 Anthropic 的 Fable 和 Opus。
Google 发布 Gemini 4 Argon,是其七个多月来首个前沿模型, introductory 定价为每百万输入 token $2、输出 $10,缓存输入约 95% 折扣。
Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识和网络安全防御等复杂工作流中表现前沿。
Google 宣布新模型 Gemini 4 Argon,称其在编码、知识工作和网络安全上性能行业领先,但目前仍处有限测试阶段,普通用户暂不能使用。Google 内部已在大量使用:Argon 借助全集群遥测数据帮助节省 300 TiB 数据中心内存,其智能体已将包括 Fuchsia OS Zircon 内核超 80 万行在内的 C/C++ 代码迁移到 Rust。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,定价为每百万输入 token $2、输出 token $10,缓存输入 95% 折扣。
推荐理由:官方博客给出定价、1M 输出 token 上限、基准分数和内部迁移案例,读者可以据此判断它在编程与安全防御上的实际定位。
GPT 6.1 Sol 以约五分之一的价格提供接近 Astra 的智能水平。
NVIDIA 发布开源表格基础模型 Kumo Tabular,现已上架 Hugging Face。给定带标签的表格,模型在单次前向传播中直接预测新行标签,无需训练、调参或特征工程,支持分类和回归,基于 Transformer 并采用列、行和 in-context 注意力,完全在人工生成的表格上预训练。
推荐理由:官方介绍了无需训练微调的表格基础模型的架构、预训练配方和四项基准表现,读者可评估它能否替代传统梯度提升树工作流。
OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作场景,智能水平接近 Astra,API 输入和输出 token 价格为 Astra 标准价的五分之一。
推荐理由:原文给出了 GPT-6.1 Sol 的定位和价格对比,读者可以据此评估它相对 Astra 的成本优势。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上可用,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四档推理力度。
推荐理由:原文给出 Bedrock 上的接入方式、推理档位配置和成本权衡,读者可直接据此规划调用与费用。
Anthropic 发布 Claude Sonnet 5.5,官方称速度快 30% 以上,多数工作成本最高降 30%,价格与 Sonnet 5 持平但基准全面占优。作者实测其编码表现接近 Opus 5.5,并指出它成为 claude.ai 免费层所用模型,使 Anthropic 免费方案强于使用 Luna 5.6 的 ChatGPT 免费层;官方重申 Haiku 5.5 将在未来几周内推出。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock(通过 Global CRIS global. inference profile)和北美的 Claude Platform on AWS 开放使用。
推荐理由:AWS 官方说明 Claude Sonnet 5.5 在 Bedrock 的可用性、与 Opus 5.5 的分工建议和上手方法,便于评估是否纳入现有工作流。
H Company 发布 Holo4 智能体系列,含 27B dense 和 35B-A3B MoE 两个规格,同时推出基于 Nemotron 3 Nano Omni 的 Holotron4 Nano。
推荐理由:官方发布通用计算机使用智能体系列,给出多接口适配设计、OSWorld 2.0 分数对比和开源轨迹,读者可评估开源 Agent 的新选择。
Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30% 且每任务便宜 40%,token 定价从 $5/$25 降至 $4/$20,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:原文汇总了 Opus 5.5 的定价、评测与争议细节,包括第三方拆解显示 40% 降价在 max effort 下并不成立。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。
推荐理由:作者实测了三家新模型并整理完整价格表,读者可以据此比较新一轮降价幅度和各档模型的实际表现。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,将前沿智能带入日常工作,两款模型在能力与成本之间提供不同平衡。
推荐理由:官方发布两条产品线定位信息,读者可据此了解两个新模型在能力与成本上的不同取舍。
Xiaomi 发布原生全模态的 MiMo-V2.6 系列,其中 MiMo-V2.6-Pro 为 1.02T 总参数、42B 激活参数,MIT 许可证开源,以 Intelligence Index 46 分登顶 Artificial Analysis 开放权重模型榜首。
TypeSafe AI 上周发布新类别模型 Jev,称为 System One 模型,接受文本输入但输出浮点数形式的分类、是/否判断、评分和置信度。Jev 只对输入收费,价格为 $0.042 per million tokens,低于 GPT-5 Nano 的 $0.05/million,支持并行评估多个问题,适合分类、排序和搜索重排等任务。
Microsoft Research 的逆合成模型 RetroChimera 在期刊 Nature 发表,并开源了实现与权重。该模型组合基于 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 两个子模型,用学习到的重排序策略融合各自预测,覆盖常见与罕见反应类型。
V7 使用 GPT-5.6 Luna 后成本降低 78%,同时准确率得到提升。它还能将企业分散的文件转化为智能体可用的上下文,用于完成带来源链接的复杂工作。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,分别面向规模化性价比和高复杂度多步推理任务。
推荐理由:官方给出了两条产品线的能力分工和多项基准数字,可帮助读者判断语音智能体场景下的选型取舍。
OpenAI 在 API 中推出 GPT-Live-1,带来自然的全双工语音对话能力。该模型还提供更强的指令遵循、自定义音色和电话(telephony)支持。
推荐理由:官方公告列出全双工语音、自定义音色和电话支持等能力,读者可据此评估语音应用的接入选项。
OpenAI 发布 GPT-6 Astra,定位为面向商业的最强模型,具备高级推理和计算机使用能力,写作与设计判断也更强。
推荐理由:官方发布了面向商业场景的新模型,提到推理、计算机操作和写作设计判断,读者可据此评估其在工作流中的定位。
Google DeepMind 和 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评估是其最先进、最准确的全球天气 AI 模型。
推荐理由:官方发布了新模型的关键指标与开放方式,读者可以据此评估分辨率提升和降水精度对实际用例的影响。
H Company 发布 NeoMME,一个 260M 与 800M 两种规格的多语言多模态编码器,用单个双向 Transformer 同时处理文本 token 和 32×32 图像 patch,以掩码离散扩散目标从零训练,不依赖预训练视觉塔或因果语言模型。