Google 发布 AMIE (Video),实现实时音视频临床问诊
Google Research 推出基于 Gemini 和 Project Astra 的 AMIE (Video),可进行实时同步临床视频问诊,感知非语言线索并引导虚拟体格检查。
推荐理由:原文给出架构设计、评测规模和与 PCP 对比的量化结果,还坦承模拟场景等局限,可帮助读者理解音视频临床 AI 的实际边界。
Google Research 推出基于 Gemini 和 Project Astra 的 AMIE (Video),可进行实时同步临床视频问诊,感知非语言线索并引导虚拟体格检查。
推荐理由:原文给出架构设计、评测规模和与 PCP 对比的量化结果,还坦承模拟场景等局限,可帮助读者理解音视频临床 AI 的实际边界。
Google DeepMind 发布 Nature 论文并开源 WeatherNext 2、WeatherNext Cyclones 和 WeatherNext 2-mini 模型,单个 AI 模型可同时预测热带气旋的路径、强度和风结构,相比此前模型平均多出约 24 小时提前量,相当于过去 20 年气象进步约十年的水平。
推荐理由:Google 公布了模型在气旋预报上多出约一天提前量的细节,并同步开源代码与权重,研究者可以直接复现或改进。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究人员构建出可自我维持的 AI 原型蠕虫病毒,利用被盗 GPU 在本地运行开源权重 LLM 进行推理并自我复制,漏洞检测成功率约 80%、利用成功率约 53%、自我复制成功率 88%,整体攻击成功率约 37%。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布原生构建证据链的自主科研原型 Science One Framework 和自动化评估协议 CoE Audit。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层具身推理模型,可编排 VLA 模型等底层控制接口并调用 Google Search 等工具。
推荐理由:官方给出了进度分类、时刻定位等具体基准数字和多机器人协作演示,读者可据此评估这款具身推理模型在真实机器人编排中的可用性。
Google DeepMind 推出最新音乐生成模型 Lyria 3.5,即日起在 Google Flow Music 中可用。模型在音乐性、歌词和人声质量上均有提升:可生成更自然复杂的旋律结构,歌词更贴合提示词并具结构感知,人声更具表现力且发音更准确。此外用户可更方便地控制输出音乐的节奏与时长。
Google DeepMind 发布 Gemini Robotics 2,包含 VLA 模型、Gemini Robotics ER 2 具身推理模型和可本地运行的 On-Device 2 三个模型,实现人形机器人全身控制、灵巧操作和多机器人协作。
推荐理由:官方发布说明了三个模型分工、适配新机器人的数据成本和安全基准,读者可以对照判断机器人AI的落地路径。
Google Research 发布 SymptomAI 研究论文,用五个基于 Gemini Flash 2.0 的对话原型智能体对 13,917 名参与者做端到端症状问诊和鉴别诊断(DDx),用于研究基准测试。
推荐理由:基于 13,917 人的随机真实人群研究,给出了 SymptomAI 鉴别诊断相对临床医生基线的表现和可迁移的问诊策略比较。
Google Research 在 Nature 发表基于强化学习的量子纠错控制框架,让智能体利用错误检测事件持续调节数千个控制参数,在计算进行中对抗漂移。在 Willow 超导处理器上注入人为漂移的实验中,RL 控制使逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元的 AI tokens 和云资源,支持美国能源部 Genesis Mission。
Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上输出 token 用量比 3.5 Flash 减少 17%,定价 $1.50/1M 输入、$7.50/1M 输出,DeepSWE 49% vs 37%、OSWorld-Verified 83.0% vs 78.4%。
推荐理由:官方原文给出三款新模型的具体价格、token 效率与多项基准数字,并说明各模型面向的部署场景。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证和修补漏洞。
Google DeepMind 与 Isomorphic Labs 发布联合生物韧性方案,目标是防止模型被滥用,并让政府和科学家利用 AI 提升疫情应对能力。
Google Research 在 ICLR 2026 发表的论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》指出。
Google DeepMind 与 Atal Innovation Mission 合作推出 Gemini 驱动的网页应用 ATL Saathi 的试点,为 Tinkering Lab 教师提供 24/7 规划与培训助手,首期覆盖 100 所试点学校。
Google Research 发布 SensorFM,一种直接从无标注可穿戴数据预训练的 Large Sensor Foundation Model,训练数据来自 500 万名同意参与研究的用户、超一万亿分钟的多模态传感器信号,覆盖 100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
Google Research 在 Nature Cities 发表大规模真实世界研究,通过修改 Google Maps 算法在 10 个美国城市引导少于 2% 的行程绕开拥堵路段,实验持续六个月并采用城市级 switchback 设计。
Google DeepMind 与 A24 宣布建立首个此类的研究型合作,将前沿 AI 研究实验室与电影公司配对,帮助艺术家开发新的工作流程与技术。双方将围绕多个项目开展长期研发协作,A24 的电影创作者可参与塑造新技术,Google DeepMind 则获得一线艺术家的反馈指导。此外,Google 已对 A24 进行投资,合作的具体目标和技术产出将随时间演进。
Google Research 发布覆盖 50+ 城市、9 个国家的建筑级屋顶反照率数据集,通过新的 Heat Resilience Earth Engine App 开放访问,帮助城市规划者实施冷屋顶方案。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为家族中最快最省的图像模型。
推荐理由:原文给出两款模型的速度、价格与可用入口,还说明了各自定位和 API 限制,便于开发者评估是否替换现有工作流。
Google Research 推出面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习(ICL)问题,无需手动训练、超参数调优和特征工程即可在单次前向传播中生成预测。
推荐理由:原文说明了 TabFM 的架构设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其相对传统调参流程的取舍。
Google Research 宣布将 Multi-Token Prediction(MTP)改造方案应用于已部署的 Gemini Nano v3 模型,已推送到 Pixel 9 和 10 系列。
Google Research 在 CIDR 发表的线性弹性缓存(linear elastic caching)方法,把页面逐出建模为 ski rental 问题,用轻量级决策树模型为缓存页预测 TTL,动态调整缓存大小。在 Spanner 生产环境中,相比固定大小缓存,内存占用降低 15.5%,cache miss 仅增加 5.5%,TCO 降低约 5%,对实际 I/O 成本影响仅 0.5%。
Google Research 在 COLM 2026 发表的论文发现,开启链式推理能让 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 召回关闭推理时几乎无法答对的简单单跳事实。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:原文说明 computer use 从独立模型转为内置进 Gemini 3.5 Flash,并给出 API 入口和企业级防护选项,便于评估自动化场景。
Import AI 第 462 期汇总多项内容:牛津大学、英国 AISI、斯坦福等机构的研究通过 4 项实验、6923 人的 18978 段对话,发现 AI(最强的为 Opus 4.1 和 Opus 4.6)在文本说服上稳定超越专家人类,募集真实捐款时比职业募捐者高 10.8 个百分点;当限制 AI 以人类速度和篇幅输出时,优势降至不显著。
Google DeepMind 与英国政府合作,基于 Gemini 开发一款 AI 规划原型工具,目标是帮助规划官员将住宅规划申请的决策时间缩短 50%。该工具正与 Barnet、Camden 和 Dorset 等地方规划部门共同开发,可整合数据、识别相关政策、总结反馈意见并起草评估报告,但官员仍是最终决策者。
Google 发布基于 Farmscapes 2020 的矢量化数据集,将英格兰超过 130,000 km² 高分辨率栅格地图转化为可操作的树篱、石墙与树丛清单,帮助土地所有者在不妨碍粮食安全的情况下扩展森林栖息地。
Google DeepMind 发布 AI Control Roadmap,在传统对齐和沙箱、prompt injection 防御之上增加系统级安全层,将内部智能体视为潜在未对齐的“内部威胁”,基于 MITRE ATT&CK 构建威胁建模框架,用可信 AI 监督员检测和拦截有害行为,并以覆盖度、召回率和响应时间衡量效果。
Google 发布两项皮肤 AI 研究,其中发表于 JAMA Dermatology 的 2345 人调查显示,AI 辅助组识别病症的准确率达 23%,约为对照搜索组(8%)的近三倍,但判断就医等下一步行动的能力未显著提升。
Google Research 在 AISTATS 2026 上提出 Regularized f-Divergence Kernel Tests,用于更敏感、灵活地审计机器遗忘(machine unlearning)。
Google DeepMind 发布开源实验模型 DiffusionGemma,基于文本扩散方法生成整块文本,在专用 GPU 上推理速度最高达 4x(单张 NVIDIA H100 超 1000 tokens/秒,RTX 5090 超 700 tokens/秒)。
推荐理由:官方明确了 4x 提速的具体硬件数字和输出质量取舍,读者可以据此判断它适不适合本地低并发场景。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA,并由 Google.org 支持,发起总额最高 $10M 的多智能体 AI 安全研究资助计划,面向全球研究者。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言自动检测的近实时语音转语音翻译,连续生成保留说话者语调、节奏和音高的译文,全程仅落后说话者几秒。
推荐理由:官方公告给出了模型能力、开放入口和各产品落地细节,读者可以据此判断它对实时语音翻译工作流的改变。
Google DeepMind 发布 Gemma 4 12B,一款统一、无编码器的多模态模型,视觉和音频输入直接进入 LLM backbone,定位介于 E4B 与 26B MoE 之间。
推荐理由:原文给出无编码器架构、16GB 内存可跑和 Apache 2.0 开源等具体变化,读者可据此评估端侧部署选择。
Google DeepMind 推出面向欧洲早期机器人初创公司的加速器项目 Google DeepMind Accelerator: Robotics,首批从全欧选出 15 家公司。
Google DeepMind 公布在塞拉利昂开展的一项预注册试验结果,学生使用 Guided Learning 八周后数学成绩较对照组提升 +0.258 个标准差,约相当于 1.2 到 1.7 年的典型学习进度;教师把 Gemini 融入约一半课程达到 12 小时目标的班级进步更高,约 1.8 到 2.5 年。
推荐理由:Google DeepMind 公布塞拉利昂预注册试验的教学细节与量化结果,并开放教师培训指南与 RCT playbook,读者可了解可复制的研究做法。
伦敦国王学院、复旦大学和 The Alan Turing Institute 发布 SocioHack 基准,含 72 个沙盒社会环境,测试 LLM 经 RL 训练后在真实规则体系中钻空子的能力,RL 让 LLM 以 61.25% recall 和 90.85% precision 重新发现历史上被修补的漏洞。
Google 在 Gemini Enterprise Agent Platform 推出由 Agentic RAG 驱动的 Cross-Corpus Retrieval,现已提供公共预览。
Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后前置摄像头拍摄的面部视频,通过深度学习在后台估计心率与每日静息心率(RHR)。
推荐理由:研究覆盖近700名不同肤色参与者并在真实生活场景验证,读者可以了解手机摄像头被动测心率的准确度数据与开放数据入口。