Google DeepMind 发布 Gemini 3.7 Flash,编码与 Agent 能力提升且降价一半
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和 Agent 的主力模型,距 Gemini 3.6 Flash 仅三周。
推荐理由:官方公告给出了多个基准分数和半价定价细节,读者可以据此评估是否切换到 3.7 Flash。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和 Agent 的主力模型,距 Gemini 3.6 Flash 仅三周。
推荐理由:官方公告给出了多个基准分数和半价定价细节,读者可以据此评估是否切换到 3.7 Flash。
Google DeepMind 发布大规模多语言手语转文本(SL2T)翻译模型,为聋人和听障用户带来新的手语输入功能,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文,后续将扩展更多设备和语言。
推荐理由:原文给出模型训练规模、基准分数和隐私设计等具体细节,读者可以了解手语翻译落地的真实技术路线。
Google Research 推出基于 Gemini 和 Project Astra 的 AMIE (Video),可进行实时同步临床视频问诊,感知非语言线索并引导虚拟体格检查。
推荐理由:原文给出架构设计、评测规模和与 PCP 对比的量化结果,还坦承模拟场景等局限,可帮助读者理解音视频临床 AI 的实际边界。
Meta 今日发布 30B 参数多模态开源模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地部署的隐私场景与编码、文档分析、个人助理等智能体用途。
推荐理由:原文给出架构细节、Agent 基准对比和各推理栈的 day-0 用法,读者可据此评估本地多模态部署的选择。
Google DeepMind 发布 Nature 论文并开源 WeatherNext 2、WeatherNext Cyclones 和 WeatherNext 2-mini 模型,单个 AI 模型可同时预测热带气旋的路径、强度和风结构,相比此前模型平均多出约 24 小时提前量,相当于过去 20 年气象进步约十年的水平。
推荐理由:Google 公布了模型在气旋预报上多出约一天提前量的细节,并同步开源代码与权重,研究者可以直接复现或改进。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层具身推理模型,可编排 VLA 模型等底层控制接口并调用 Google Search 等工具。
推荐理由:官方给出了进度分类、时刻定位等具体基准数字和多机器人协作演示,读者可据此评估这款具身推理模型在真实机器人编排中的可用性。
Google DeepMind 发布 Gemini Robotics 2,包含 VLA 模型、Gemini Robotics ER 2 具身推理模型和可本地运行的 On-Device 2 三个模型,实现人形机器人全身控制、灵巧操作和多机器人协作。
推荐理由:官方发布说明了三个模型分工、适配新机器人的数据成本和安全基准,读者可以对照判断机器人AI的落地路径。
Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上输出 token 用量比 3.5 Flash 减少 17%,定价 $1.50/1M 输入、$7.50/1M 输出,DeepSWE 49% vs 37%、OSWorld-Verified 83.0% vs 78.4%。
推荐理由:官方原文给出三款新模型的具体价格、token 效率与多项基准数字,并说明各模型面向的部署场景。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数约 1T(975B,激活 41B 的 MoE),原生接收图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token,包含 BF16 和 NVFP4 权重。
推荐理由:官方博客给出架构细节、各档位 VRAM 需求和部署配置,读者可以据此评估多模态部署成本与选型。
Mistral 发布 Apache-2.0 开源模型 Leanstral 1.5,119B 总参数、6B 激活参数,通过 mid-training、监督微调和 CISPO 强化学习训练。
推荐理由:官方披露了完整训练流程、基准数字和真实代码验证案例,读者可以据此评估形式化验证模型在数学证明和开源查错上的实用程度。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为家族中最快最省的图像模型。
推荐理由:原文给出两款模型的速度、价格与可用入口,还说明了各自定位和 API 限制,便于开发者评估是否替换现有工作流。
Google Research 推出面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习(ICL)问题,无需手动训练、超参数调优和特征工程即可在单次前向传播中生成预测。
推荐理由:原文说明了 TabFM 的架构设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其相对传统调参流程的取舍。
Mistral 发布 OCR 4 文档解析模型,在提取文本之外返回边界框、类型化块分类和逐词置信度分数,支持 170 种语言、10 个语言组,可通过单个容器完全自托管。
推荐理由:原文来自 Mistral 官方,给出 OCR 4 的结构化输出、多语言支持和自托管选项,还披露了基准评分局限,可作选型参考。
Google DeepMind 发布开源实验模型 DiffusionGemma,基于文本扩散方法生成整块文本,在专用 GPU 上推理速度最高达 4x(单张 NVIDIA H100 超 1000 tokens/秒,RTX 5090 超 700 tokens/秒)。
推荐理由:官方明确了 4x 提速的具体硬件数字和输出质量取舍,读者可以据此判断它适不适合本地低并发场景。
Google DeepMind 发布 Gemma 4 12B,一款统一、无编码器的多模态模型,视觉和音频输入直接进入 LLM backbone,定位介于 E4B 与 26B MoE 之间。
推荐理由:原文给出无编码器架构、16GB 内存可跑和 Apache 2.0 开源等具体变化,读者可据此评估端侧部署选择。
Mistral 发布 128B 开源权重旗舰模型 Mistral Medium 3.5(公开预览),融合指令跟随、推理与编码,256k 上下文窗口,SWE-Bench Verified 得分 77.6%,API 定价为每百万输入 token $1.5、输出 token $7.5。
推荐理由:原文给出模型规格、评测分数、定价和开放权重入口,可据此评估它在自托管和异步编码场景的适用性。
Google DeepMind 推出 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并通过自然语言多轮编辑,支持角色一致性和物理表现。
推荐理由:官方首次介绍 Omni 家族,说明了对话式改视频、多输入组合和物理表现的具体能力边界。
Google DeepMind 发布 Gemini 3.5 模型系列,首先推出 3.5 Flash,定位智能体与编码,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上超过 Gemini 3.1 Pro,输出速度为其他前沿模型的 4 倍。
推荐理由:官方公布了 3.5 Flash 的基准成绩、开放渠道和 Pro 后续计划,读者可以据此评估它在智能体与编码场景的取舍。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,在 Artificial Analysis TTS 排行榜上获得 Elo 1,211 分,支持 70+ 语言和原生多说话人对话。
推荐理由:官方介绍了 audio tags 和 AI Studio 场景控制等新能力,读者可以了解 TTS 语音表达控制的实际用法。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语等 9 种语言,定位低延迟语音生成。模型在人工评测中自然度超过 ElevenLabs Flash v2.5,与 ElevenLabs v3 质量相当;10 秒样本加 500 字符的模型延迟为 70ms,RTF 约 9.7x。
推荐理由:原文给出延迟、价格、人评对比和开源许可等关键细节,方便读者评估它在语音 Agent 场景中的可用性。