Google DeepMind 联合多家机构发起最高 1000 万美元多智能体 AI 安全研究资助
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA,并由 Google.org 支持,发起总额最高 $10M 的多智能体 AI 安全研究资助计划,面向全球研究者。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA,并由 Google.org 支持,发起总额最高 $10M 的多智能体 AI 安全研究资助计划,面向全球研究者。
Google DeepMind 发布 Gemma 4 12B,一款统一、无编码器的多模态模型,视觉和音频输入直接进入 LLM backbone,定位介于 E4B 与 26B MoE 之间。
推荐理由:原文给出无编码器架构、16GB 内存可跑和 Apache 2.0 开源等具体变化,读者可据此评估端侧部署选择。
Google Research 在 I/O 2026 上宣布 Gemini for Science,一套与 Google Cloud、Google DeepMind 和 Google Labs 合作打造的实验性科学工具集。
Mistral 在 AI Now Summit 2026 上推出面向工业工程的 AI 全栈方案,并与 Airbus、BMW、ASML 达成合作,覆盖设计、仿真与生产,同时保障数据主权。其智能体产品 Vibe 升级为统一 Agent,可处理长时程多步骤工作,包括深度研究、编码到合并 PR。位于法国 Les Ulis 的 10 MW 推理数据中心计划于 2026 年第三季度启用。
Mistral 发布统一 AI 智能体 Vibe,Le Chat 全面升级为 Vibe,原有计划、历史和设置自动迁移。Work Mode 面向长程多步任务,覆盖企业知识搜索、数据分析、文档草稿和定时任务;Code Mode 支持远程编码会话、并行运行和沙箱隔离,并推出 VS Code 扩展和更新版 CLI。
推荐理由:官方完整公布 Vibe 的 Work 与 Code 双模式、定价和入口,读者可据此评估它对日常工作流和编码流程的影响。
Mistral AI 发布开源框架 Search Toolkit 公共预览版,用于为 AI 应用搭建生产级搜索管线,将摄取、检索和评估统一到一个共享接口的框架中。
推荐理由:原文给出模块构成、评估指标和企业案例细节,可以判断它是否适合替换现有检索基础设施。
Mistral 发布 128B 开源权重旗舰模型 Mistral Medium 3.5(公开预览),融合指令跟随、推理与编码,256k 上下文窗口,SWE-Bench Verified 得分 77.6%,API 定价为每百万输入 token $1.5、输出 token $7.5。
推荐理由:原文给出模型规格、评测分数、定价和开放权重入口,可据此评估它在自托管和异步编码场景的适用性。
Mistral 发布 Studio 的 Connectors 公开预览,内置连接器与自定义 MCP 均可通过 API/SDK 用于所有模型和 agent 调用。新功能包括直接工具调用、human-in-the-loop 审批流和连接器的程序化管理,连接器集中注册后可在 LeChat 和 AI Studio 中复用,便于对接 CRM、知识库等企业系统。
Google DeepMind 发布 Gemini for Science,在 Google Labs 推出三个实验原型:基于 Co-Scientist 的 Hypothesis Generation。
爱丁堡大学 bioengineer Filippo Menolascina 用 Co-Scientist 研究代谢功能障碍相关脂肪性肝炎(MASH),从海量文献中筛选候选联合疗法。针对药物 resmetirom 为何只对部分 MASH 患者有效这一问题,系统提出 NLRP3 炎性小体是连接炎症与代谢的分子桥梁的假设,该假设后来经实验验证,有望推动双重靶向疗法。
Google DeepMind 发布 Gemini 3.5 模型系列,首先推出 3.5 Flash,定位智能体与编码,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上超过 Gemini 3.1 Pro,输出速度为其他前沿模型的 4 倍。
推荐理由:官方公布了 3.5 Flash 的基准成绩、开放渠道和 Pro 后续计划,读者可以据此评估它在智能体与编码场景的取舍。
Google DeepMind 在 Nature 发布基于 Gemini 的多智能体系统 Co-Scientist,通过生成、辩论和演化假设来加速科学研究,并通过实验性工具 Hypothesis Generation 向个人研究者开放,数周内开始推出,可在 labs.google/science 注册。
推荐理由:官方同时给出系统架构、已有实验结果和开放注册入口,读者可以据此评估它对科研工作流的适用性。
Berkeley AI Research 发布关于自适应并行推理的研究综述,探讨让推理模型自主决定何时分解任务、并行生成多少线程并协调它们的思路。
Google DeepMind 发布 AlphaEvolve 一年来影响力汇总,该 Gemini 驱动的编码智能体已从试点扩展到科研与商业多领域。
推荐理由:官方汇总了 AlphaEvolve 一年来在科研和商业场景的具体结果与数字,可了解这类算法发现智能体落地的真实范围。
Jack Clark 在 Import AI 455 中判断,2028 年底前出现无人参与的自动化 AI 研发(模型自主训练自己的后继版本)的概率超过 60%,2027 年为 30%。
Google Research 介绍其 2025 年 9 月发布的 Empirical Research Assistance(ERA)在四个科研领域的实际应用进展。
Mistral AI 发布 Workflows 公开预览版,定位为企业 AI 编排层,提供持久执行、可观测性、容错和 human-in-the-loop 审批,ASML、ABANCA、CMA-CGM、France Travail、La Banque Postale 等客户已在用其自动化关键流程。
Google Research 发布 ICLR 论文 ReasoningBank,提出从智能体的成功与失败经验中蒸馏高层推理记忆的框架,区别于只记录轨迹或仅总结成功流程的 Synapse 和 AWM。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 合作,帮助企业规模化采用前沿 AI。
Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,让长时序规划更实用。其核心改进包括三点:把轨迹提升到虚拟状态使优化在时间上并行、在状态迭代中直接加入随机性以支持探索、重塑梯度避免穿过高维视觉模型的脆弱"状态-输入"梯度。
Google Research 发布 ConvApparel 数据集,包含超过 4,000 段、近 15,000 轮的人类-AI 多轮对话,用于量化 LLM 用户模拟器的“真实感差距”。
Google Research 推出两个学术智能体框架:PaperVizAgent(前称 PaperBanana)用于从论文文本生成可发表的学术插图,ScholarPeer 则自动生成基于文献、包含摘要与优缺点的评审报告。
Mistral AI 发布 Spaces CLI,用于项目脚手架、开发环境搭建、配置生成和部署到 staging,从内部工具演化而来,同时服务人类开发者和编码 Agent。
Google 推出 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与 web 端 XR Blocks 框架,通过专门系统提示词和代码模板,将自然语言直接转化为可运行的 Android XR 应用,全程不到 60 秒。
Google Research 在 Check Up 活动上介绍多项医疗 AI 进展:与 Fitbit 合作的个性化健康研究(Personal Health Agent)。
Mistral AI 发布 Forge,供企业基于内部文档、代码库和业务数据训练前沿级模型,使模型理解内部术语、工作流程与合规要求。Forge 支持预训练、后训练和强化学习,兼容 dense 与 MoE 架构及多模态输入,并内置数据管道与 Mistral AI 训练方法,支持持续评估与迭代。ASML、Ericsson、欧洲航天局等机构已与 Mistral AI 合作训练专有模型。
Mistral AI 发布 Mistral Small 4,是首个将 Magistral 推理、Pixtral 多模态、Devstral 智能体编码能力统一到单一模型的小型模型,采用 Apache 2.0 许可开源。
推荐理由:官方发布正文给出了完整的架构参数、基准对比和部署要求,读者可据此评估其替代多模型组合的可行性。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展前瞻性单中心可行性研究,让 AMIE 在 100 名成人患者的初级诊疗就诊前采集病史,由医生通过视频实时监督。
推荐理由:原文公布了 AMIE 在真实初级诊疗环境中的前瞻性可行性研究数据和安全性结果,读者可据此了解医疗对话 AI 走向临床的证据现状。
Mistral AI 构建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试并在 CI/CD 流水线中无人值守运行。智能体基于 Mistral 开源编码助手 Vibe,通过仓库级 AGENTS.md、按文件类型划分的技能文件和 RuboCop、SimpleCov 自定义工具实现。
Mistral 发布 Mistral Vibe 2.0,升级其终端原生编码智能体,由 Devstral 2 模型家族驱动。新功能包括自定义 subagents、执行前多选项澄清、斜杠命令加载技能、统一 Agent 模式和自动更新。
推荐理由:原文给出 Vibe 2.0 的功能明细、订阅方案和 Devstral 2 API 定价,读者可以据此评估是否切换自己的编码工作流。
Mistral AI 发布开源编码模型家族 Devstral 2,包含 123B 的 Devstral 2(modified MIT 许可)和 24B 的 Devstral Small 2(Apache 2.0),两者均支持 256K 上下文窗口,分别在 SWE-bench Verified 上取得 72.2% 和 68.0%。
推荐理由:官方公布了两个尺寸编码模型的开源协议、SWE-bench Verified 成绩、API 定价和硬件要求,可据此评估本地或端侧部署的可行性。
Berkeley AI Research 提出一种基于分而治之(divide and conquer)的 off-policy RL 价值学习算法,不再使用时间差分(TD)学习,后者因 Bellman 递归误差累积难以扩展到长时程任务。
Mistral 推出 Mistral AI Studio,一个面向企业的生产级 AI 平台,将 Mistral 自有大规模系统的基础设施打包给企业使用。
Mistral AI 发布 Codestral 25.08 代码补全模型,并提供包含 Codestral Embed、Devstral 和 Mistral Code IDE 插件的企业编码栈。
Mistral AI 为 Le Chat 推出一批新功能:预览版 Deep Research 可生成带引用的结构化研究报告,语音模式由新模型 Voxtral 驱动,Think 模式由推理模型 Magistral 驱动并支持句中切换语言,Projects 可将对话分组管理并保留工具设置,还与 Black Forest Labs 合作提供图像创建与编辑。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:官方给出了两个新模型的 SWE-Bench Verified 成绩、定价和许可方式,开发者可以据此评估代码智能体选型。
Mistral 发布新的 Agents API,将语言模型与内置连接器、跨会话持久记忆和 Agent 编排能力结合,作为 Chat Completion API 的补充。
推荐理由:官方介绍了内置连接器、有状态会话和 Agent 编排等具体能力,并给出 SimpleQA 对比数据,便于评估企业级 Agent 开发的可用性。
Mistral AI 与 All Hands AI 合作推出面向软件工程任务的智能体大语言模型 Devstral,以 Apache 2.0 许可开源发布。
推荐理由:官方发布了模型权重和 API 定价,并给出 SWE-Bench Verified 的具体成绩与部署门槛,读者可以据此评估本地或企业编码场景的适配性。
Mistral AI 推出企业级 AI 助手 Le Chat Enterprise,由全新 Mistral Medium 3 模型驱动,功能将在未来两周内陆续上线。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,可自动将会议记录转为 PRD 和可执行开发工单。该工作流由 PRDAgent 和 TicketCreationAgent 两个组件构成,均由 Mistral Large 2 驱动,可自动在 Linear、Jira 等项目管理工具中创建结构化工单。完整实现已通过 Google Colab notebook 提供。