Latent Space AINews:OpenAI 发布内部模型产出的 722 篇数学论文,Mistral Large 4 与多款开源模型同周登场
Latent Space 发布 2026 年 10 月 5 日至 6 日一期 AI 新闻汇总,头条为 OpenAI 公开内部前沿模型产出的 722 份数学手稿。
Latent Space 发布 2026 年 10 月 5 日至 6 日一期 AI 新闻汇总,头条为 OpenAI 公开内部前沿模型产出的 722 份数学手稿。
Google 发布图像生成与编辑模型 Nano Banana 2.1,接替 2026 年 2 月发布的 Nano Banana 2,价格约降一半,1K 图像从 6.70 美分降至 3.36 美分,4K 从 15.10 降至 7.56 美分。
Google 发布开源嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为向量,参数量 740M,Google 称其在多模态嵌入基准上超越体量两倍的竞品。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数,采用 Apache 2.0 许可,将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:官方给出了参数量、内存占用和基准得分等具体指标,可帮助读者评估它是否适合端侧检索场景。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,Agent Arena 排名第 5,比 GPT-6 Sol 便宜 39% 且得分高 1.52 分,比 Astra 便宜 81%。
Google DeepMind 发布 Gemini 4 Argon,主打编码、企业知识工作与网络防御,在 19 项基准中 13 项排名第一,输出上限从 64K 提升至 1M token,定价 $4/$20(限时五折 $2/$10),目前仅向 Fairwind 项目的政府用户和可信网络防御者开放。
Google 发布新模型 Gemini 4 Argon,称其擅长网络安全、编码与研究,可自主发现、验证并修复关键软件漏洞。该模型经防御性网络安全任务专项训练,目前仅通过 Fairwind 安全计划向部分网络安全合作伙伴开放;Google 引用 Vals 的模型指数称其在多项基准上领先 OpenAI GPT-6 Astra 与 Anthropic 的 Fable 和 Opus。
Google 发布 Gemini 4 Argon,是其七个多月来首个前沿模型, introductory 定价为每百万输入 token $2、输出 $10,缓存输入约 95% 折扣。
Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识和网络安全防御等复杂工作流中表现前沿。
Google 宣布新模型 Gemini 4 Argon,称其在编码、知识工作和网络安全上性能行业领先,但目前仍处有限测试阶段,普通用户暂不能使用。Google 内部已在大量使用:Argon 借助全集群遥测数据帮助节省 300 TiB 数据中心内存,其智能体已将包括 Fuchsia OS Zircon 内核超 80 万行在内的 C/C++ 代码迁移到 Rust。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,定价为每百万输入 token $2、输出 token $10,缓存输入 95% 折扣。
推荐理由:官方博客给出定价、1M 输出 token 上限、基准分数和内部迁移案例,读者可以据此判断它在编程与安全防御上的实际定位。
Latent Space 发布 9 月 24 至 25 日的 AINews 周报,主题称 Claude Opus 5.5 发布后社区反馈积极,尤其在纯代码生成解说视频方面接管了时间线。
Google DeepMind 于 9 月 23 日发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词在超过 100 种语言中自定义角色声音、从 30 秒音频样本复刻声音、逐行指导表演节奏与方言变化,并原生支持双说话人场景生成。
推荐理由:官方公告给出了两款 TTS 模型的能力细节、基准成绩和开放渠道,读者可以据此判断语音创作工作流的变化。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,分别面向规模化性价比和高复杂度多步推理任务。
推荐理由:官方给出了两条产品线的能力分工和多项基准数字,可帮助读者判断语音智能体场景下的选型取舍。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
推荐理由:官方给出两个变体的基准数字、定价和实际应用案例,读者可以据此评估在编码与安全场景中的替换成本。
Google Research 发布时间序列基础模型 TimesFM-3,参数量 330M,在超 1 万亿时间点的真实与合成语料上预训练,首次原生支持零样本多变量预测。
Google 推出自监督基础模型 GlucoFM,采用双流设计将缓慢血糖基线趋势与短期偏离分开处理。在四个队列、七项临床预测任务共 14 项评估中,其平均 PR-AUC 比最强基线 CGM 基线从 54.7 提升至 58.8,在全部糖尿病风险和 beta 细胞功能障碍评估中领先,并在餐后血糖响应预测上取得最低 MAE。
Google DeepMind 发布 Gemini 3.5 Transcribe,定位为更精准、支持智能交互的实时语音转写模型。模型可将原始音频直接转为格式化文本,自动清除口头语和自我纠正,支持自定义词表、超过 85 种语言、最多三名说话人区分,并可通过 function calling 调用其他 Gemini 模型。
推荐理由:官方公布了模型在噪声环境、自定义词表和多说话人场景的能力细节与 API 入口,读者可据此评估语音转写工作流能否迁移。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和 Agent 的主力模型,距 Gemini 3.6 Flash 仅三周。
推荐理由:官方公告给出了多个基准分数和半价定价细节,读者可以据此评估是否切换到 3.7 Flash。
Google DeepMind 发布大规模多语言手语转文本(SL2T)翻译模型,为聋人和听障用户带来新的手语输入功能,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文,后续将扩展更多设备和语言。
推荐理由:原文给出模型训练规模、基准分数和隐私设计等具体细节,读者可以了解手语翻译落地的真实技术路线。
Google Research 推出基于 Gemini 和 Project Astra 的 AMIE (Video),可进行实时同步临床视频问诊,感知非语言线索并引导虚拟体格检查。
推荐理由:原文给出架构设计、评测规模和与 PCP 对比的量化结果,还坦承模拟场景等局限,可帮助读者理解音视频临床 AI 的实际边界。
Google DeepMind 发布 Nature 论文并开源 WeatherNext 2、WeatherNext Cyclones 和 WeatherNext 2-mini 模型,单个 AI 模型可同时预测热带气旋的路径、强度和风结构,相比此前模型平均多出约 24 小时提前量,相当于过去 20 年气象进步约十年的水平。
推荐理由:Google 公布了模型在气旋预报上多出约一天提前量的细节,并同步开源代码与权重,研究者可以直接复现或改进。
Google DeepMind 发布 Gemini Robotics 2,包含 VLA 模型、Gemini Robotics ER 2 具身推理模型和可本地运行的 On-Device 2 三个模型,实现人形机器人全身控制、灵巧操作和多机器人协作。
推荐理由:官方发布说明了三个模型分工、适配新机器人的数据成本和安全基准,读者可以对照判断机器人AI的落地路径。
Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上输出 token 用量比 3.5 Flash 减少 17%,定价 $1.50/1M 输入、$7.50/1M 输出,DeepSWE 49% vs 37%、OSWorld-Verified 83.0% vs 78.4%。
推荐理由:官方原文给出三款新模型的具体价格、token 效率与多项基准数字,并说明各模型面向的部署场景。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证和修补漏洞。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为家族中最快最省的图像模型。
推荐理由:原文给出两款模型的速度、价格与可用入口,还说明了各自定位和 API 限制,便于开发者评估是否替换现有工作流。
Google Research 推出面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习(ICL)问题,无需手动训练、超参数调优和特征工程即可在单次前向传播中生成预测。
推荐理由:原文说明了 TabFM 的架构设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其相对传统调参流程的取舍。
Google DeepMind 发布开源实验模型 DiffusionGemma,基于文本扩散方法生成整块文本,在专用 GPU 上推理速度最高达 4x(单张 NVIDIA H100 超 1000 tokens/秒,RTX 5090 超 700 tokens/秒)。
推荐理由:官方明确了 4x 提速的具体硬件数字和输出质量取舍,读者可以据此判断它适不适合本地低并发场景。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言自动检测的近实时语音转语音翻译,连续生成保留说话者语调、节奏和音高的译文,全程仅落后说话者几秒。
推荐理由:官方公告给出了模型能力、开放入口和各产品落地细节,读者可以据此判断它对实时语音翻译工作流的改变。
Google DeepMind 发布 Gemma 4 12B,一款统一、无编码器的多模态模型,视觉和音频输入直接进入 LLM backbone,定位介于 E4B 与 26B MoE 之间。
推荐理由:原文给出无编码器架构、16GB 内存可跑和 Apache 2.0 开源等具体变化,读者可据此评估端侧部署选择。
Google DeepMind 推出 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并通过自然语言多轮编辑,支持角色一致性和物理表现。
推荐理由:官方首次介绍 Omni 家族,说明了对话式改视频、多输入组合和物理表现的具体能力边界。
Google DeepMind 发布 Gemini 3.5 模型系列,首先推出 3.5 Flash,定位智能体与编码,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上超过 Gemini 3.1 Pro,输出速度为其他前沿模型的 4 倍。
推荐理由:官方公布了 3.5 Flash 的基准成绩、开放渠道和 Pro 后续计划,读者可以据此评估它在智能体与编码场景的取舍。
Google DeepMind 发布 Gemini Robotics-ER 1.6,相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 在指点、计数、成功检测等空间与物理推理能力上显著提升。