Google Research 发布 PhotoScan:用智能手机照片估算身体成分并预测胰岛素抵抗
Google Research 提出 PhotoScan,一种从标准 2D 手机照片估计体脂率、Android-to-Gynoid 脂肪比和内脏-皮下脂肪比的深度学习框架,用于预测胰岛素抵抗。
Google Research 提出 PhotoScan,一种从标准 2D 手机照片估计体脂率、Android-to-Gynoid 脂肪比和内脏-皮下脂肪比的深度学习框架,用于预测胰岛素抵抗。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型对连通性、封闭、顺序、分离和绳结等拓扑概念的推理与规划能力。测试显示,模型在静态图像识别上表现明显好于交互式规划任务,且两者均远低于人类水平,错误多出在规划阶段丢失结构关系或提出违反物理约束的动作。该基准旨在为机器人和交互环境中的智能体研究提供受控诊断工具。
Google Research 发布 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务)和知识画像框架,评估 13 个 LLM 后发现前沿模型 95–98% 的事实已编码,但仍有 26–34% 无法直接召回,开启 thinking 后仍有 11–12% 失败。
Hugging Face 发布论文,通过缓存 teacher 的 top-100 logits 实现 offline 蒸馏,并引入 fused chunked KL 损失,避免生成全词表×序列长度的矩阵。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布原生构建证据链的自主科研原型 Science One Framework 和自动化评估协议 CoE Audit。
研究者将 Berkeley Sky Lab 的演化式内核搜索框架 K-Search 扩展出 MLX 后端,通过结构化 CUDA 到 MLX 翻译层把数十年的 NVIDIA 内核优化知识迁移到 Apple Silicon。
Epoch 与 METR 发布 MirrorCode 基准,测试 AI 仅凭 CLI 访问重新实现完整软件的能力,25 个目标程序中 17 个有至少一次满分运行,Claude Opus 4.7 用 14 小时、251 美元推理成本完成了人类估需 2-17 周的任务。
Berkeley AI Research 提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为智能体的工作上下文,并引入 belief grading 监督摘要内容。在 CollabBench 协作编程测试中,ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,峰值上下文 token 长度也显著低于全上下文设置。
Google Research 发布 SymptomAI 研究论文,用五个基于 Gemini Flash 2.0 的对话原型智能体对 13,917 名参与者做端到端症状问诊和鉴别诊断(DDx),用于研究基准测试。
推荐理由:基于 13,917 人的随机真实人群研究,给出了 SymptomAI 鉴别诊断相对临床医生基线的表现和可迁移的问诊策略比较。
Google Research 在 Nature 发表基于强化学习的量子纠错控制框架,让智能体利用错误检测事件持续调节数千个控制参数,在计算进行中对抗漂移。在 Willow 超导处理器上注入人为漂移的实验中,RL 控制使逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%。
Google Research 在 ICLR 2026 发表的论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》指出。
Hume 发布 Real World VoiceEQ 基准,评估语音 AI 交互的人性化质量,覆盖 ASR、TTS、S2S 和语音理解,评测 40 多个主流闭源与开源语音模型、15+ 维度和 60 多项指标。
Google Research 发布 SensorFM,一种直接从无标注可穿戴数据预训练的 Large Sensor Foundation Model,训练数据来自 500 万名同意参与研究的用户、超一万亿分钟的多模态传感器信号,覆盖 100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
Google Research 在 Nature Cities 发表大规模真实世界研究,通过修改 Google Maps 算法在 10 个美国城市引导少于 2% 的行程绕开拥堵路段,实验持续六个月并采用城市级 switchback 设计。
Jack Clark 在 Import AI 第 464 期汇总:Fable 在 KernelBench-Mega 上以 CUDA 写出 18.71X 加速的 megakernel。
Hugging Face 推出开源基准 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评测 AI 智能体在企业级 Java 跨框架迁移任务上的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三个生态。
Google Research 在 CIDR 发表的线性弹性缓存(linear elastic caching)方法,把页面逐出建模为 ski rental 问题,用轻量级决策树模型为缓存页预测 TTL,动态调整缓存大小。在 Spanner 生产环境中,相比固定大小缓存,内存占用降低 15.5%,cache miss 仅增加 5.5%,TCO 降低约 5%,对实际 I/O 成本影响仅 0.5%。
Google Research 在 COLM 2026 发表的论文发现,开启链式推理能让 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 召回关闭推理时几乎无法答对的简单单跳事实。
Import AI 第 462 期汇总多项内容:牛津大学、英国 AISI、斯坦福等机构的研究通过 4 项实验、6923 人的 18978 段对话,发现 AI(最强的为 Opus 4.1 和 Opus 4.6)在文本说服上稳定超越专家人类,募集真实捐款时比职业募捐者高 10.8 个百分点;当限制 AI 以人类速度和篇幅输出时,优势降至不显著。
Google 发布两项皮肤 AI 研究,其中发表于 JAMA Dermatology 的 2345 人调查显示,AI 辅助组识别病症的准确率达 23%,约为对照搜索组(8%)的近三倍,但判断就医等下一步行动的能力未显著提升。
Google Research 在 AISTATS 2026 上提出 Regularized f-Divergence Kernel Tests,用于更敏感、灵活地审计机器遗忘(machine unlearning)。
Google DeepMind 公布在塞拉利昂开展的一项预注册试验结果,学生使用 Guided Learning 八周后数学成绩较对照组提升 +0.258 个标准差,约相当于 1.2 到 1.7 年的典型学习进度;教师把 Gemini 融入约一半课程达到 12 小时目标的班级进步更高,约 1.8 到 2.5 年。
推荐理由:Google DeepMind 公布塞拉利昂预注册试验的教学细节与量化结果,并开放教师培训指南与 RCT playbook,读者可了解可复制的研究做法。
Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后前置摄像头拍摄的面部视频,通过深度学习在后台估计心率与每日静息心率(RHR)。
推荐理由:研究覆盖近700名不同肤色参与者并在真实生活场景验证,读者可以了解手机摄像头被动测心率的准确度数据与开放数据入口。
Import AI 第 459 期报道:弗吉尼亚大学、Anthropic 与加拿大银行研究者估计美国 AI 经济 2025 年名义规模约 $250 billion,质量调整后实际产出年增速约 2,600%,但因单价下降和推理占比高而难以在 GDP 中体现。英国 AI Security Institute 撰文指出用 AI 监督训练过程来自动化对齐研究并非万能方案,实际比预想更难。
SentinelOne 研究员拆解了约 20 多年前的病毒 fast16.sys,它通过篡改高精度计算软件(如 LS-DYNA 970、PKPM、MOHID)在内存中的计算结果,可能被用于武器研发相关的破坏,类似《三体》中的智子干扰。
Stanford 医学院遗传学家 Gary Peltz 团队在 Advanced Science 发表研究,用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选可重定位治疗肝纤维化的候选药。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将大模型训练拆分为异步通信的计算“孤岛”,隔离硬件故障并大幅降低带宽需求。
Google Research 发布 ICLR 论文 ReasoningBank,提出从智能体的成功与失败经验中蒸馏高层推理记忆的框架,区别于只记录轨迹或仅总结成功流程的 Synapse 和 AWM。
Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,让长时序规划更实用。其核心改进包括三点:把轨迹提升到虚拟状态使优化在时间上并行、在状态迭代中直接加入随机性以支持探索、重塑梯度避免穿过高维视觉模型的脆弱"状态-输入"梯度。
Google Research 在 TMLR 发表论文,推出推理优先的合成数据生成框架 Simula,以机制设计思路将数据生成拆解为全局多样性、局部多样性、复杂化和双评论员质量检查四个可控轴,无需种子数据。
Google Research 提出 MoGen 神经元形态生成模型,基于 PointInfinity 点云 flow matching,用 1,795 条经人工验证的小鼠轴突训练生成合成神经形状,扩充 PATHFINDER 重建模型训练数据。
Google Research 发布 ConvApparel 数据集,包含超过 4,000 段、近 15,000 轮的人类-AI 多轮对话,用于量化 LLM 用户模拟器的“真实感差距”。
Google Research 提出一个评估 25 个 LLM 行为倾向与人类对齐程度的框架,将标准化心理问卷改编为情境判断测试(SJT),并由 550 名参与者提供人类偏好分布。
Google Research 在论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究 AI 评测中每条数据标注数与标注条目数的权衡,并开源了基于真实数据集的模拟器。
Google Quantum AI 发布白皮书,更新了破解 256 位椭圆曲线离散对数问题(ECDLP-256)的量子资源估算,两条电路分别使用不到 1,200 个逻辑量子比特加 9,000 万个 Toffoli 门和不到 1,450 个逻辑量子比特加 7,000 万个 Toffoli 门,物理量子比特需求较此前降低约 20 倍。
推荐理由:Google 白皮书给出破解 ECDLP-256 更低的量子资源估算和零知识证明披露方式,加密社区可据此评估向 PQC 迁移的紧迫性。
Google Research 推出 TurboQuant 压缩算法(将发表于 ICLR 2026),通过结合 Quantized Johnson-Lindenstrauss(QJL)和 PolarQuant(将发表于 AISTATS 2026)实现零内存开销的向量压缩,可在不损失精度的情况下压缩模型和 KV cache。
Google Research 在 Earth AI 计划下推出自监督框架 S2Vec,为建成环境学习通用嵌入向量。该框架用 S2 Geometry 将地表划分为多分辨率单元,把建筑、道路等特征栅格化为多层图像,再用 masked autoencoding 无需人工标注地学习位置特征。
Google Research 与英国 NHS 合作的 AIMS 研究在 Nature Cancer 发表两篇论文,评估 AI 乳腺癌检测系统。
推荐理由:原文给出两篇 Nature Cancer 研究的具体结果和数字,读者可以据此了解 AI 在乳腺筛查双读流程中的实际表现与局限。
Google Research 与 Cornell、Harvard 合作在 PNAS 发表论文,让 12 位高温超导领域专家出 67 道题、盲评 6 个 LLM 的回答。
Berkeley AI Research 提出 SPEX 和 ProxySPEX 两种算法,利用稀疏性、低度性和层级性等结构假设,把消融归因中的交互发现问题转化为稀疏恢复问题,可识别驱动 LLM 输出的关键交互。