PhAI Labs 联合斯坦福等团队推出 JEPA-Anything,将 JEPA 扩展为跨物理到生物的通用世界模型
PhAI Labs 牵头、联合斯坦福、牛津和普林斯顿的研究团队发布 JEPA-Anything,将 Yann LeCun 提出的 JEPA 架构扩展为可跨七个领域工作的通用世界模型。
PhAI Labs 牵头、联合斯坦福、牛津和普林斯顿的研究团队发布 JEPA-Anything,将 Yann LeCun 提出的 JEPA 架构扩展为可跨七个领域工作的通用世界模型。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上分享 Lean 证明形式化和研究细节。
推荐理由:OpenAI 公布内部前沿模型在数学未解问题上的结果,并开源 Lean 证明形式化,读者可查看研究细节。
Google 发布 CAPS 研讨会报告,汇聚 50 多位学界与业界领袖,探讨自主智能体的隐私与安全挑战。报告指出智能体在非结构化接口、概率性控制流和自主委派三方面区别于传统软件,并以情境完整性(Contextual Integrity)理论为基础,提出构建情境策略引擎,结合系统级沙箱、模型级推理和以用户为中心的控制,形成多层防护方案。
MIT Technology Review 基于 300 位数据、AI 及技术高管的调研报告指出,知识匮乏是 AI 智能体项目难以落地的主要原因,平均仅 34% 的 agentic AI 项目进入生产环境。
Mercor 的研究让 12 名平均经验 5 年半的持证会计师完成 APEX Accounting Benchmark 的简化任务,结果显示当今 AI 模型的速度、准确率和成本均优于会计师,而 18 个月前最佳模型得分还低于会计师约 37% 的平均水平。
TechCrunch 报道 Graphite 的新研究:对比 ChatGPT 发布前的 10,000 篇人类文章和各模型重写版本,找出 13,000 个在 AI 文本中出现频率至少高 2 倍的短语。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出名为 Ataraxos 的 AI,以 15 胜 1 负 4 平击败被认为是史上最强 Stratego 棋手的 Pim Niemeijer,训练仅用 16 块 GPU 和几千美元。Stratego 是大量信息隐藏且博弈时间尺度很长的不完全信息游戏,此前连 DeepMind 也未能造出稳定击败人类顶尖玩家的机器。
研究团队开发的 Ataraxos 在三周的对局中以 85% 有效胜率击败了四届世界冠军、公认史上最强的 Stratego 棋手 Niemeijer,并在 2025 世界锦标赛表演赛中赢下 40 局中的 38 局。
推荐理由:原文对比了 Ataraxos 与 DeepNash 的训练成本和方法细节,读者可以了解不完美信息博弈研究的最新进展。
OpenAI 披露一次针对其模型推理内容的蒸馏窃取行动,7 月 24 至 25 日出现超过 4000 名用户发起的 16000 次请求,涉及超过 15000 个关联账户,OpenAI 称已于 7 月 28 日全部关闭,并将核心团伙与 Moonshot AI(Kimi 模型的开发公司)相关人员联系起来,同时说明这些是未遂提取。
Google DeepMind 团队发表论文,提出蛋白质水印方案 SynthIDBio,可在不破坏蛋白功能的前提下为 AI 设计的蛋白序列加入水印。该系统基于 SynthID 技术,集成到流行的蛋白设计工具 ProteinMPNN 中,在逐个放置氨基酸时只在保持功能可行的位置引入与水印一致的氨基酸。
Google Research 推出 Diffusion Controller 框架,将去噪过程重构为连续控制问题,用轻量“转向阻尼”网络在不动主模型权重的情况下引导图像生成。基于 Stable Diffusion v1.4 的实验中,其完全解锁版本在 Human Preference Score(HPS-v2)评测下对基线达到 90% 胜率,并支持对闭源模型做黑盒/灰盒控制。
Hugging Face 团队提出 ProvenanceGuard,一个针对 MCP Agent 的来源感知事实性验证层,可在生成后检查每条论断的支持来源是否与答案声明或暗示的来源一致,识别"跨来源混淆"问题。
Import AI 第 474 期报道三则内容:Michael Levin 发表论文,提出心智与大脑的关系如同数学模式与物理结果,心智是来自“柏拉图空间”的非物理模式,身体只是其进入物理世界的接口,并以 xenobots、anthrobots 等实验为佐证。此外本期还讨论了机器人学正在准备迎来类似 LLM 的时刻但仍缺一个通用算法,以及智谱启动外部 RSI(递归自我改进)循环的进展。
慕尼黑 CESifo 经济学研究者 Robert Fairlie 和 Jane Wu 的新工作论文指出,无论绝对还是相对水平,都没有证据表明应届大学毕业生出现显著、大范围的岗位替代或招聘缩减。
Google Research 发布 AI 视频联合导演研究,构建了基于 Gemini 和 Veo 的多智能体编排层,包含 Co-Director、CANVAS、A²RD 和 VQQA 四个框架,将长视频生成转化为全局优化与世界状态跟踪问题。
Microsoft Research 的研究显示,仅依赖机器人机载 GPU 运行物理 AI 推理会限制性能、续航和可扩展性,将推理卸载到边缘或云端 GPU 可显著改善。
Microsoft Research 的逆合成模型 RetroChimera 在期刊 Nature 发表,并开源了实现与权重。该模型组合基于 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 两个子模型,用学习到的重排序策略融合各自预测,覆盖常见与罕见反应类型。
OpenAI 经济研究新报告分析了劳动者如何超越传统职业角色使用 AI,以及哪些新的活动成为其工作中的常规部分。报告揭示了 AI 在实际工作中的使用模式。
Google Research 提出 Retrieve-for-Train 框架,用离线 RL 发现奖励对齐的 query fan-out 并蒸馏为监督信号,绕过 LLM 逐 token 的链式推理延迟。
IBM Research 在 ALTK-Evolve 中推出 Consistency Analyzer 和一致性指南,针对 Agent 同一任务多次运行结果不稳定的问题。
推荐理由:原文给出可复用的 Pass^k 指标和一致性诊断方法,读者可据此评估并改善自己 Agent 的复现稳定性。
Google Research 在 ACL 2026 提出 ToolGrad,一种“答案优先”的工具调用数据集生成方法:先构建真实工具调用链,再用文本“梯度”迭代提出、执行、选择和更新 API 工作流。
OpenAI 分享了一个针对 Navier–Stokes 千禧年大奖难题的 AI 生成解法,内容包括一份解题文章和一个 Lean 形式化证明。材料来自 OpenAI 官方公告,feed 未提供完整正文,具体证明内容和方法细节以原文链接为准。
推荐理由:官方公开了 AI 生成的 Navier–Stokes 千禧年难题解法,并附带 Lean 形式化证明,读者可以据此关注 AI 在数学证明方向的实际产出。
Google Research 研究了多基因风险评分(PRS)从 UK Biobank 欧洲人群向 Biobank Japan 约 20 万日本个体迁移的表现,覆盖 BMI、血压、HDL、LDL、血糖等 8 项临床 traits,比较了 elastic net、meta-analysis 和 PRS-CSx 三种方法。
Google Research 与 HHMI Janelia、MRC 分子生物学实验室、剑桥大学等合作在 Cell 发表雄性果蝇脑及中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:原文给出连接组规模、AI 重建方法和开源查看入口,读者可以据此了解当前连接组学的能力边界和可用资源。
Hugging Face 推出 BenchMIRT,一种基于多维 IRT 的方法,可在单条 prompt 层面审计 LLM benchmark 实际测量的能力。
Google 与 NASA JPL 合作推出 MAPL-EMIT,一个基于 EMIT 高光谱数据的深度学习框架,用于自动检测、量化甲烷羽流并定位排放源。该框架采用 Swin-S vision transformer,在专家标注羽流上达到 84% 的召回率,训练使用了 360 万个合成甲烷羽流。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可从自然语言查询出发自主执行数据发现、清洗、特征工程、模型训练与评估的完整地理空间预测流程,将此前需数周人工数据工程的工作缩短到几分钟。
Google DeepMind 推出据称全球首个针对专有前沿模型的双盲评估,将外部评测限制在密码学安全的隔离环境中,防止模型提前看到测试题造成基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,用机密基准测试一个 Gemini Flash Lite 模型,以提升评估的可信度和完整性。
Google 推出自监督基础模型 GlucoFM,采用双流设计将缓慢血糖基线趋势与短期偏离分开处理。在四个队列、七项临床预测任务共 14 项评估中,其平均 PR-AUC 比最强基线 CGM 基线从 54.7 提升至 58.8,在全部糖尿病风险和 beta 细胞功能障碍评估中领先,并在餐后血糖响应预测上取得最低 MAE。
Google 在 CHI 2026 发表研究原型 AgentHands,让 AI 智能体在 Android XR 等沉浸式环境中生成与语音同步的手势,延续 Project Astra 与 Gemini 3.1 Flash Live 的方向。
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 结构压缩至 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复后的 bfloat16 检查点蒸馏。
Import AI 第 470 期:METR 研究发现 AI 对网络安全发现带来显著加速,对数学略有贡献,但对 AI 研究算法优化尚无可测加速。多所大学团队提出 SPADE 框架,通过自博弈协同进化环境合成与智能体能力,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线高 5.3。本期还介绍 Hawkeye,用于构建更好的 GPU kernel。
Google Research 推出 Biomarker Discovery Framework,一个多智能体系统,将候选生物标志物优先排序结构化为人类监督下的迭代研究流程,结合假设生成、统计分析、模型训练与对抗性验证。在三个队列共 9,279 人次观测中,该系统自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢类候选标志物,并构建了睡眠时长变异性等新型复合特征。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将聚合匿名化的到访流动模式融入语言模型的地点表示,捕捉 POI 的时间活动节奏。
Hugging Face 发布研究,用一致性分歧探针、数字静默检索和拼写切换三类测试,评估 11 个开源 ASR 模型的基准优化(benchmaxxing)行为。
推荐理由:原文用三类探针量化语音识别中的基准优化现象,并给出模型名单、比例数据与可复用的检测脚本,读来能帮助避开仅看 WER 的选型误区。
SK hynix 联合 UVA、UIUC、NTU、MIT、延世大学研究者在《Nature Electronics》发表 co-packaged optics(CPO)技术路线图,通讯作者为 SK hynix AI Infra Team Lead Seunghoon Hong 和 UVA 教授 Kyusang Lee。
IBM Research 团队基于 ALTK-Evolve 在 AppWorld 的 585 个多步任务上测试八种模型后发现,智能体记忆该给多少取决于模型能力。
DiG-bench(Discovery in Games)发布,这是一个包含 70 款游戏的基准,用于测试 AI 通过探索自主发现隐藏规则的能力,21 款游戏已公开。
Google Research 提出 PhotoScan,一种从标准 2D 手机照片估计体脂率、Android-to-Gynoid 脂肪比和内脏-皮下脂肪比的深度学习框架,用于预测胰岛素抵抗。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型对连通性、封闭、顺序、分离和绳结等拓扑概念的推理与规划能力。测试显示,模型在静态图像识别上表现明显好于交互式规划任务,且两者均远低于人类水平,错误多出在规划阶段丢失结构关系或提出违反物理约束的动作。该基准旨在为机器人和交互环境中的智能体研究提供受控诊断工具。