Hugging Face 发布 ScarfBench:评测 AI 智能体的企业级 Java 框架迁移能力
Hugging Face 推出开源基准 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评测 AI 智能体在企业级 Java 跨框架迁移任务上的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三个生态。
Hugging Face 推出开源基准 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评测 AI 智能体在企业级 Java 跨框架迁移任务上的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三个生态。
Dharma AI 撰文解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》。
Google Research 宣布将 Multi-Token Prediction(MTP)改造方案应用于已部署的 Gemini Nano v3 模型,已推送到 Pixel 9 和 10 系列。
Google Research 在 CIDR 发表的线性弹性缓存(linear elastic caching)方法,把页面逐出建模为 ski rental 问题,用轻量级决策树模型为缓存页预测 TTL,动态调整缓存大小。在 Spanner 生产环境中,相比固定大小缓存,内存占用降低 15.5%,cache miss 仅增加 5.5%,TCO 降低约 5%,对实际 I/O 成本影响仅 0.5%。
Google Research 在 COLM 2026 发表的论文发现,开启链式推理能让 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 召回关闭推理时几乎无法答对的简单单跳事实。
Google 发布两项皮肤 AI 研究,其中发表于 JAMA Dermatology 的 2345 人调查显示,AI 辅助组识别病症的准确率达 23%,约为对照搜索组(8%)的近三倍,但判断就医等下一步行动的能力未显著提升。
Google Research 在 AISTATS 2026 上提出 Regularized f-Divergence Kernel Tests,用于更敏感、灵活地审计机器遗忘(machine unlearning)。
Google DeepMind 公布在塞拉利昂开展的一项预注册试验结果,学生使用 Guided Learning 八周后数学成绩较对照组提升 +0.258 个标准差,约相当于 1.2 到 1.7 年的典型学习进度;教师把 Gemini 融入约一半课程达到 12 小时目标的班级进步更高,约 1.8 到 2.5 年。
推荐理由:Google DeepMind 公布塞拉利昂预注册试验的教学细节与量化结果,并开放教师培训指南与 RCT playbook,读者可了解可复制的研究做法。
Google 在 Nature 发表 PHRM 研究系统,利用人脸解锁后前置摄像头拍摄的面部视频,通过深度学习在后台估计心率与每日静息心率(RHR)。
推荐理由:研究覆盖近700名不同肤色参与者并在真实生活场景验证,读者可以了解手机摄像头被动测心率的准确度数据与开放数据入口。
Google DeepMind 的 Co-Scientist 正在连接 MIT 机械工程师 Ritu Raman 与 Boston Children's Hospital 化学生物学家 Ryan Flynn 的实验室,共同研究 ALS。
Stanford 医学院遗传学家 Gary Peltz 团队在 Advanced Science 发表研究,用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选可重定位治疗肝纤维化的候选药。
Google Research 介绍其 2025 年 9 月发布的 Empirical Research Assistance(ERA)在四个科研领域的实际应用进展。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将大模型训练拆分为异步通信的计算“孤岛”,隔离硬件故障并大幅降低带宽需求。
Google Research 发布 ICLR 论文 ReasoningBank,提出从智能体的成功与失败经验中蒸馏高层推理记忆的框架,区别于只记录轨迹或仅总结成功流程的 Synapse 和 AWM。
Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,让长时序规划更实用。其核心改进包括三点:把轨迹提升到虚拟状态使优化在时间上并行、在状态迭代中直接加入随机性以支持探索、重塑梯度避免穿过高维视觉模型的脆弱"状态-输入"梯度。
Google Research 在 TMLR 发表论文,推出推理优先的合成数据生成框架 Simula,以机制设计思路将数据生成拆解为全局多样性、局部多样性、复杂化和双评论员质量检查四个可控轴,无需种子数据。
Google Research 提出 MoGen 神经元形态生成模型,基于 PointInfinity 点云 flow matching,用 1,795 条经人工验证的小鼠轴突训练生成合成神经形状,扩充 PATHFINDER 重建模型训练数据。
Google Research 发布 ConvApparel 数据集,包含超过 4,000 段、近 15,000 轮的人类-AI 多轮对话,用于量化 LLM 用户模拟器的“真实感差距”。
Google Research 提出一个评估 25 个 LLM 行为倾向与人类对齐程度的框架,将标准化心理问卷改编为情境判断测试(SJT),并由 550 名参与者提供人类偏好分布。
Google Research 在论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究 AI 评测中每条数据标注数与标注条目数的权衡,并开源了基于真实数据集的模拟器。
Google Quantum AI 发布白皮书,更新了破解 256 位椭圆曲线离散对数问题(ECDLP-256)的量子资源估算,两条电路分别使用不到 1,200 个逻辑量子比特加 9,000 万个 Toffoli 门和不到 1,450 个逻辑量子比特加 7,000 万个 Toffoli 门,物理量子比特需求较此前降低约 20 倍。
推荐理由:Google 白皮书给出破解 ECDLP-256 更低的量子资源估算和零知识证明披露方式,加密社区可据此评估向 PQC 迁移的紧迫性。
Google Research 推出 TurboQuant 压缩算法(将发表于 ICLR 2026),通过结合 Quantized Johnson-Lindenstrauss(QJL)和 PolarQuant(将发表于 AISTATS 2026)实现零内存开销的向量压缩,可在不损失精度的情况下压缩模型和 KV cache。
Google Research 在 Earth AI 计划下推出自监督框架 S2Vec,为建成环境学习通用嵌入向量。该框架用 S2 Geometry 将地表划分为多分辨率单元,把建筑、道路等特征栅格化为多层图像,再用 masked autoencoding 无需人工标注地学习位置特征。
Google Research 与英国 NHS 合作的 AIMS 研究在 Nature Cancer 发表两篇论文,评估 AI 乳腺癌检测系统。
推荐理由:原文给出两篇 Nature Cancer 研究的具体结果和数字,读者可以据此了解 AI 在乳腺筛查双读流程中的实际表现与局限。
Google Research 与 Cornell、Harvard 合作在 PNAS 发表论文,让 12 位高温超导领域专家出 67 道题、盲评 6 个 LLM 的回答。
Berkeley AI Research 提出 SPEX 和 ProxySPEX 两种算法,利用稀疏性、低度性和层级性等结构假设,把消融归因中的交互发现问题转化为稀疏恢复问题,可识别驱动 LLM 输出的关键交互。
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报道中提取结构化灾害记录,构建覆盖 150 多个国家、2000 年至今的 260 万条城市山洪事件开放数据集。
推荐理由:原文给出了用 Gemini 从新闻中提取灾害数据的完整方法和验证数字,读者可以据此评估其研究价值。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展前瞻性单中心可行性研究,让 AMIE 在 100 名成人患者的初级诊疗就诊前采集病史,由医生通过视频实时监督。
推荐理由:原文公布了 AMIE 在真实初级诊疗环境中的前瞻性可行性研究数据和安全性结果,读者可据此了解医疗对话 AI 走向临床的证据现状。
Berkeley AI Research 在 NeurIPS 2025 论文中提出直接基于信息内容评估和优化成像系统的框架,用互信息指标统一分辨率、噪声等因素。该方法仅需噪声测量数据和噪声模型即可估计信息量,并提供真实信息的上界。在彩色摄影、射电天文、无透镜成像和显微成像四个领域,该指标能预测解码器性能,优化结果匹配 SOTA 端到端方法,同时内存、计算量更低且无需任务专用解码器。
Berkeley AI Research 提出一种基于分而治之(divide and conquer)的 off-policy RL 价值学习算法,不再使用时间差分(TD)学习,后者因 Bellman 递归误差累积难以扩展到长时程任务。
Berkeley AI Research 提出 word2vec 学习过程的定量理论:在若干温和近似下,其学习问题可归约为无加权最小二乘矩阵分解,梯度流动力学有闭式解,最终嵌入等价于对目标矩阵 M* 做 PCA。
Mistral AI 联合 Carbone 4 与法国 ADEME 完成其称业内首个 AI 模型全生命周期环境影响分析(LCA)。
推荐理由:原文给出 Mistral Large 2 训练与推理的环境足迹实测数据,为模型环境影响评估提供了具体参考方法。