Microsoft Research 扩大 Skala 开放范围,加速迈向预测性 DFT
Microsoft Research 发布 Skala 1.1,其训练数据是上一版本的 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 个排名第一,加权平均误差为 2.8 kcal/mol,且计算成本相当于 meta-GGA 泛函。Skala 现已登陆 CP2K,并正在集成至 Psi4、FHI-aims、ORCA 和 VASP,同时推出跟踪各版本计算性能的动态基准。
Microsoft Research 发布 Skala 1.1,其训练数据是上一版本的 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 个排名第一,加权平均误差为 2.8 kcal/mol,且计算成本相当于 meta-GGA 泛函。Skala 现已登陆 CP2K,并正在集成至 Psi4、FHI-aims、ORCA 和 VASP,同时推出跟踪各版本计算性能的动态基准。
Google Research 提出 PhotoScan,一种从标准 2D 手机照片估计体脂率、Android-to-Gynoid 脂肪比和内脏-皮下脂肪比的深度学习框架,用于预测胰岛素抵抗。
Hugging Face 的 OlmoEarth Studio 现在支持计算并导出开源 OlmoEarth 基础模型的嵌入向量,以 Cloud-Optimized GeoTIFF(COG)格式输出。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型对连通性、封闭、顺序、分离和绳结等拓扑概念的推理与规划能力。测试显示,模型在静态图像识别上表现明显好于交互式规划任务,且两者均远低于人类水平,错误多出在规划阶段丢失结构关系或提出违反物理约束的动作。该基准旨在为机器人和交互环境中的智能体研究提供受控诊断工具。
Google DeepMind 发布大规模多语言手语转文本(SL2T)翻译模型,为聋人和听障用户带来新的手语输入功能,率先在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文,后续将扩展更多设备和语言。
推荐理由:原文给出模型训练规模、基准分数和隐私设计等具体细节,读者可以了解手语翻译落地的真实技术路线。
Google Research 推出基于 Gemini 和 Project Astra 的 AMIE (Video),可进行实时同步临床视频问诊,感知非语言线索并引导虚拟体格检查。
推荐理由:原文给出架构设计、评测规模和与 PCP 对比的量化结果,还坦承模拟场景等局限,可帮助读者理解音视频临床 AI 的实际边界。
Microsoft Research 推出研究模型 CARE-X,一个统一胸部 X 光 VLM,基于 SigLIP2-so400M 与 Phi-4-mini-instruct(3.8B),通过辅助头联合训练提供报告生成与带置信度的结构化预测,并用 DAPO 强化学习对齐临床奖励。
Meta 今日发布 30B 参数多模态开源模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地部署的隐私场景与编码、文档分析、个人助理等智能体用途。
推荐理由:原文给出架构细节、Agent 基准对比和各推理栈的 day-0 用法,读者可据此评估本地多模态部署的选择。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层具身推理模型,可编排 VLA 模型等底层控制接口并调用 Google Search 等工具。
推荐理由:官方给出了进度分类、时刻定位等具体基准数字和多机器人协作演示,读者可据此评估这款具身推理模型在真实机器人编排中的可用性。
Google DeepMind 推出最新音乐生成模型 Lyria 3.5,即日起在 Google Flow Music 中可用。模型在音乐性、歌词和人声质量上均有提升:可生成更自然复杂的旋律结构,歌词更贴合提示词并具结构感知,人声更具表现力且发音更准确。此外用户可更方便地控制输出音乐的节奏与时长。
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 分超越更新的 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),验证了领域专业化的优势。该模型通过监督微调对齐巴西葡萄牙语的词汇与文档结构,再用 DPO 抑制重复或不连贯输出,实现最低退化率。文章指出,生成式 OCR 的可靠性取决于参数如何集中分配于单一领域,而非更大架构。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数约 1T(975B,激活 41B 的 MoE),原生接收图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token,包含 BF16 和 NVFP4 权重。
推荐理由:官方博客给出架构细节、各档位 VRAM 需求和部署配置,读者可以据此评估多模态部署成本与选型。
Google DeepMind 与 Atal Innovation Mission 合作推出 Gemini 驱动的网页应用 ATL Saathi 的试点,为 Tinkering Lab 教师提供 24/7 规划与培训助手,首期覆盖 100 所试点学校。
Google DeepMind 与 A24 宣布建立首个此类的研究型合作,将前沿 AI 研究实验室与电影公司配对,帮助艺术家开发新的工作流程与技术。双方将围绕多个项目开展长期研发协作,A24 的电影创作者可参与塑造新技术,Google DeepMind 则获得一线艺术家的反馈指导。此外,Google 已对 A24 进行投资,合作的具体目标和技术产出将随时间演进。
Google Research 发布覆盖 50+ 城市、9 个国家的建筑级屋顶反照率数据集,通过新的 Heat Resilience Earth Engine App 开放访问,帮助城市规划者实施冷屋顶方案。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为家族中最快最省的图像模型。
推荐理由:原文给出两款模型的速度、价格与可用入口,还说明了各自定位和 API 限制,便于开发者评估是否替换现有工作流。
Mistral 发布 OCR 4 文档解析模型,在提取文本之外返回边界框、类型化块分类和逐词置信度分数,支持 170 种语言、10 个语言组,可通过单个容器完全自托管。
推荐理由:原文来自 Mistral 官方,给出 OCR 4 的结构化输出、多语言支持和自托管选项,还披露了基准评分局限,可作选型参考。
Google 发布两项皮肤 AI 研究,其中发表于 JAMA Dermatology 的 2345 人调查显示,AI 辅助组识别病症的准确率达 23%,约为对照搜索组(8%)的近三倍,但判断就医等下一步行动的能力未显著提升。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言自动检测的近实时语音转语音翻译,连续生成保留说话者语调、节奏和音高的译文,全程仅落后说话者几秒。
推荐理由:官方公告给出了模型能力、开放入口和各产品落地细节,读者可以据此判断它对实时语音翻译工作流的改变。
Google DeepMind 发布 Gemma 4 12B,一款统一、无编码器的多模态模型,视觉和音频输入直接进入 LLM backbone,定位介于 E4B 与 26B MoE 之间。
推荐理由:原文给出无编码器架构、16GB 内存可跑和 Apache 2.0 开源等具体变化,读者可据此评估端侧部署选择。
Mistral 将 Emmi AI 收入麾下,推出面向工程领域的 physics AI 基础模型。传统 CFD/FEM 仿真每个设计变体需数小时到数周,physics AI 可在单 GPU 上秒级前向推理预测物理场,但不取代第一性原理求解器。该能力已用于 ASML、Airbus、Safran、Siemens Energy 等合作伙伴,覆盖产品设计、工装工艺设计加速与实时数字孪生。
Google DeepMind 在亚太地区推出首期 Accelerator 加速器计划,主题为“AI for the Planet”。该计划为期三个月,面向区域内的初创公司、研究团队和非营利组织,帮助其利用前沿 AI 解决自然、气候、农业和能源等领域的环境问题。入选机构将获得专家指导和将前沿 AI 与科学 AI 模型集成到项目中的支持,计划以新加坡的线下 bootcamp 启动,现已开放报名。
Google DeepMind 在 Project Genie 中推出 Street View grounding 新能力,可基于美国真实地点结合“Ocean World”“B&W film”等风格生成可交互世界,技术来自 Maps Imagery Grounding。
Google DeepMind 推出 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并通过自然语言多轮编辑,支持角色一致性和物理表现。
推荐理由:官方首次介绍 Omni 家族,说明了对话式改视频、多输入组合和物理表现的具体能力边界。
Google 于 5 月 19 日宣布扩展内容透明与验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud。
推荐理由:原文梳理了 SynthID 水印、C2PA Content Credentials 验证在 Search、Gemini、Chrome、Pixel 的扩展路径和落地节奏,可据此了解内容溯源工具的现状。
Google DeepMind 宣布在新加坡启动 National Partnerships for AI 新合作项目,聚焦医疗、科研与教育。合作包括与公共医疗集团探索 AI co-clinician“三方照护”、用 AlphaFold 加速疫情研究、为视障跑者开发 Gemma 驱动的跑步助手,并向从小学到初级学院的所有教师提供 Gemini for Education。
Google DeepMind 的 AI 气象模型 WeatherNext 提前 5 天、以 80% 置信度预测出飓风 Melissa 将以 Category 5 强度登陆牙买加,3 天前置信度升至接近 100%。
Google DeepMind 发布 Gemini 3.5 模型系列,首先推出 3.5 Flash,定位智能体与编码,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上超过 Gemini 3.1 Pro,输出速度为其他前沿模型的 4 倍。
推荐理由:官方公布了 3.5 Flash 的基准成绩、开放渠道和 Pro 后续计划,读者可以据此评估它在智能体与编码场景的取舍。
Google Research 阐述其开放科学实践:十年间开源的 DeepVariant、Neuroglancer、NeuralGCM、SpeciesNet 及 HAI-DEF(含 MedGemma)等工具与数据集,已服务全球超 250,000 名研究者和开发者。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生监督下辅助医患双方的医疗 AI。
推荐理由:官方给出多组临床评测数字和双智能体安全架构,读者可以据此了解 AI 协诊助手的能力边界与实际定位。
Google Research 介绍其 2025 年 9 月发布的 Empirical Research Assistance(ERA)在四个科研领域的实际应用进展。
Google Research 提出 MoGen 神经元形态生成模型,基于 PointInfinity 点云 flow matching,用 1,795 条经人工验证的小鼠轴突训练生成合成神经形状,扩充 PATHFINDER 重建模型训练数据。
Google Research 与纽约大学合作推出研究实验 Vantage,通过生成式 AI 在模拟环境中创建多方对话,评估高中生和大学生的批判性思维、协作等 future-ready 技能。
Google DeepMind 发布 Gemini Robotics-ER 1.6,相比 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 在指点、计数、成功检测等空间与物理推理能力上显著提升。
Google 推出 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与 web 端 XR Blocks 框架,通过专门系统提示词和代码模板,将自然语言直接转化为可运行的 Android XR 应用,全程不到 60 秒。
Google Research 在 Earth AI 计划下推出自监督框架 S2Vec,为建成环境学习通用嵌入向量。该框架用 S2 Geometry 将地表划分为多分辨率单元,把建筑、道路等特征栅格化为多层图像,再用 masked autoencoding 无需人工标注地学习位置特征。
Google Research 在 Check Up 活动上介绍多项医疗 AI 进展:与 Fitbit 合作的个性化健康研究(Personal Health Agent)。
Mistral AI 发布 Mistral Small 4,是首个将 Magistral 推理、Pixtral 多模态、Devstral 智能体编码能力统一到单一模型的小型模型,采用 Apache 2.0 许可开源。
推荐理由:官方发布正文给出了完整的架构参数、基准对比和部署要求,读者可据此评估其替代多模型组合的可行性。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,计划与 NVIDIA 联合开发开源前沿模型,结合其模型架构和全栈 AI 平台与 NVIDIA 的算力、开发工具和合成数据生成管线。
Google 宣布在 Flood Hub 上推出城市山洪预报,可提前 24 小时预测城市山洪风险。模型基于 LSTM 架构,用 Gemini 从新闻报告中提取历史山洪事件的 Groundsource 数据集进行训练,仅依赖全球气象产品,以 20x20 公里分辨率覆盖人口密度大于每平方公里 100 人的城市地区。
推荐理由:原文给出模型方法、覆盖范围和与 NWS 对比的精度数据,读者可以据此了解城市山洪预报的可行路径。