Google Research 用高温超导问题测试六个 LLM 的专家级回答能力
Google Research 与 Cornell、Harvard 合作在 PNAS 发表论文,让 12 位高温超导领域专家出 67 道题、盲评 6 个 LLM 的回答。
Google Research 与 Cornell、Harvard 合作在 PNAS 发表论文,让 12 位高温超导领域专家出 67 道题、盲评 6 个 LLM 的回答。
Berkeley AI Research 提出 SPEX 和 ProxySPEX 两种算法,利用稀疏性、低度性和层级性等结构假设,把消融归因中的交互发现问题转化为稀疏恢复问题,可识别驱动 LLM 输出的关键交互。
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报道中提取结构化灾害记录,构建覆盖 150 多个国家、2000 年至今的 260 万条城市山洪事件开放数据集。
推荐理由:原文给出了用 Gemini 从新闻中提取灾害数据的完整方法和验证数字,读者可以据此评估其研究价值。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展前瞻性单中心可行性研究,让 AMIE 在 100 名成人患者的初级诊疗就诊前采集病史,由医生通过视频实时监督。
推荐理由:原文公布了 AMIE 在真实初级诊疗环境中的前瞻性可行性研究数据和安全性结果,读者可据此了解医疗对话 AI 走向临床的证据现状。
Berkeley AI Research 在 NeurIPS 2025 论文中提出直接基于信息内容评估和优化成像系统的框架,用互信息指标统一分辨率、噪声等因素。该方法仅需噪声测量数据和噪声模型即可估计信息量,并提供真实信息的上界。在彩色摄影、射电天文、无透镜成像和显微成像四个领域,该指标能预测解码器性能,优化结果匹配 SOTA 端到端方法,同时内存、计算量更低且无需任务专用解码器。
Berkeley AI Research 提出一种基于分而治之(divide and conquer)的 off-policy RL 价值学习算法,不再使用时间差分(TD)学习,后者因 Bellman 递归误差累积难以扩展到长时程任务。
Berkeley AI Research 提出 word2vec 学习过程的定量理论:在若干温和近似下,其学习问题可归约为无加权最小二乘矩阵分解,梯度流动力学有闭式解,最终嵌入等价于对目标矩阵 M* 做 PCA。
Mistral AI 联合 Carbone 4 与法国 ADEME 完成其称业内首个 AI 模型全生命周期环境影响分析(LCA)。
推荐理由:原文给出 Mistral Large 2 训练与推理的环境足迹实测数据,为模型环境影响评估提供了具体参考方法。