跳到正文

#论文/研究

今日 2 条
今天10月7日周三
  1. Google Research47

    Google 发布智能体隐私与安全研讨会报告:以情境完整性视角探讨开放性难题

    Google 发布 CAPS 研讨会报告,汇聚 50 多位学界与业界领袖,探讨自主智能体的隐私与安全挑战。报告指出智能体在非结构化接口、概率性控制流和自主委派三方面区别于传统软件,并以情境完整性(Contextual Integrity)理论为基础,提出构建情境策略引擎,结合系统级沙箱、模型级推理和以用户为中心的控制,形成多层防护方案。

9月30日周三
  1. Google Research38

    Google Research 提出 Diffusion Controller 框架,统一并简化 AI 图像生成控制

    Google Research 推出 Diffusion Controller 框架,将去噪过程重构为连续控制问题,用轻量“转向阻尼”网络在不动主模型权重的情况下引导图像生成。基于 Stable Diffusion v1.4 的实验中,其完全解锁版本在 Human Preference Score(HPS-v2)评测下对基线达到 90% 胜率,并支持对闭源模型做黑盒/灰盒控制。

9月29日周二
9月25日周五
9月24日周四
9月21日周一
9月16日周三
9月11日周五
9月8日周二
  1. OpenAI News81

    OpenAI 分享 Navier–Stokes 千禧年难题的 AI 生成解法

    OpenAI 分享了一个针对 Navier–Stokes 千禧年大奖难题的 AI 生成解法,内容包括一份解题文章和一个 Lean 形式化证明。材料来自 OpenAI 官方公告,feed 未提供完整正文,具体证明内容和方法细节以原文链接为准。

    推荐理由:官方公开了 AI 生成的 Navier–Stokes 千禧年难题解法,并附带 Lean 形式化证明,读者可以据此关注 AI 在数学证明方向的实际产出。

9月4日周五
  1. Google Research62

    Google Research 与 HHMI Janelia 发布雄性果蝇完整脑连接组图谱

    Google Research 与 HHMI Janelia、MRC 分子生物学实验室、剑桥大学等合作在 Cell 发表雄性果蝇脑及中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。

    推荐理由:原文给出连接组规模、AI 重建方法和开源查看入口,读者可以据此了解当前连接组学的能力边界和可用资源。

9月2日周三
8月28日周五
8月27日周四
  1. Google DeepMind54

    Google DeepMind 试点首个面向前沿模型的 double-blind AI 评估

    Google DeepMind 推出据称全球首个针对专有前沿模型的双盲评估,将外部评测限制在密码学安全的隔离环境中,防止模型提前看到测试题造成基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,用机密基准测试一个 Gemini Flash Lite 模型,以提升评估的可信度和完整性。

  2. Google Research47

    Google 发布 GlucoFM:面向连续血糖监测的基础模型

    Google 推出自监督基础模型 GlucoFM,采用双流设计将缓慢血糖基线趋势与短期偏离分开处理。在四个队列、七项临床预测任务共 14 项评估中,其平均 PR-AUC 比最强基线 CGM 基线从 54.7 提升至 58.8,在全部糖尿病风险和 beta 细胞功能障碍评估中领先,并在餐后血糖响应预测上取得最低 MAE。

8月26日周三
8月25日周二
8月22日周六
  1. Google Research50

    Google Research 推出 Biomarker Discovery Framework:从可穿戴设备数据中优先排序候选生物标志物

    Google Research 推出 Biomarker Discovery Framework,一个多智能体系统,将候选生物标志物优先排序结构化为人类监督下的迭代研究流程,结合假设生成、统计分析、模型训练与对抗性验证。在三个队列共 9,279 人次观测中,该系统自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢类候选标志物,并构建了睡眠时长变异性等新型复合特征。

8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究量化语音识别模型的基准优化行为,高分模型会复现错误基准文本

    Hugging Face 发布研究,用一致性分歧探针、数字静默检索和拼写切换三类测试,评估 11 个开源 ASR 模型的基准优化(benchmaxxing)行为。

    推荐理由:原文用三类探针量化语音识别中的基准优化现象,并给出模型名单、比例数据与可复用的检测脚本,读来能帮助避开仅看 WER 的选型误区。

8月20日周四
8月19日周三
8月17日周一
8月13日周四
  1. Microsoft Research44

    Microsoft Research 推出 MindTopo 基准,测试多模态模型的拓扑空间推理能力

    Microsoft Research 推出 MindTopo 基准,评估多模态大模型对连通性、封闭、顺序、分离和绳结等拓扑概念的推理与规划能力。测试显示,模型在静态图像识别上表现明显好于交互式规划任务,且两者均远低于人类水平,错误多出在规划阶段丢失结构关系或提出违反物理约束的动作。该基准旨在为机器人和交互环境中的智能体研究提供受控诊断工具。

8月12日周三
8月10日周一
8月4日周二
  1. Microsoft Research73

    Microsoft Research 开源 Orchard 框架,Orchard-SWE 以约 3B 激活参数达 SWE-bench Verified 69.7%

    Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实 harness 内端到端训练。

    推荐理由:微软开源了可复用的智能体环境层,并给出三个小模型训练配方,读者可以了解小模型在真实任务上的可达水平。

7月31日周五
7月29日周三
7月26日周日
  1. Berkeley AI Research46

    教 LLM 更新信念状态以实现高效长程交互:Berkeley AI Research 提出 ABBEL 框架

    Berkeley AI Research 提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为智能体的工作上下文,并引入 belief grading 监督摘要内容。在 CollabBench 协作编程测试中,ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,峰值上下文 token 长度也显著低于全上下文设置。

7月23日周四
  1. Google Research64

    Google Research 发布 SymptomAI 研究:对话式 AI 日常症状评估

    Google Research 发布 SymptomAI 研究论文,用五个基于 Gemini Flash 2.0 的对话原型智能体对 13,917 名参与者做端到端症状问诊和鉴别诊断(DDx),用于研究基准测试。

    推荐理由:基于 13,917 人的随机真实人群研究,给出了 SymptomAI 鉴别诊断相对临床医生基线的表现和可迁移的问诊策略比较。

  2. Google Research49

    Google Research 如何让量子计算机从错误中学习

    Google Research 在 Nature 发表基于强化学习的量子纠错控制框架,让智能体利用错误检测事件持续调节数千个控制参数,在计算进行中对抗漂移。在 Willow 超导处理器上注入人为漂移的实验中,RL 控制使逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%。

7月16日周四
7月9日周四
7月8日周三