跳到正文

#Agent

今日 2 条
今天10月7日周三
  1. Google Research47

    Google 发布智能体隐私与安全研讨会报告:以情境完整性视角探讨开放性难题

    Google 发布 CAPS 研讨会报告,汇聚 50 多位学界与业界领袖,探讨自主智能体的隐私与安全挑战。报告指出智能体在非结构化接口、概率性控制流和自主委派三方面区别于传统软件,并以情境完整性(Contextual Integrity)理论为基础,提出构建情境策略引擎,结合系统级沙箱、模型级推理和以用户为中心的控制,形成多层防护方案。

10月4日周日
  1. Hugging Face Blog69

    Microsoft ThinkingBox 登陆 Hugging Face,以后端状态评测智能体真实可靠性

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体沙箱和 ThinkingBox-Bench 基准,507 个有状态业务工作流、每任务运行 20 次,用可执行检查评测终端数据库状态与副作用,现已通过 OpenEnv 在 Hugging Face 开放。

    推荐理由:原文用可执行的后端状态检查区分了表面成功与真实结果,还给出各模型一致性与成本数据,对评估智能体有直接参考。

10月2日周五
10月1日周四
  1. The Decoder77

    AI 击败 Stratego 史上最强人类棋手,Ataraxos 以不到 8000 美元算力突破不完美信息博弈

    研究团队开发的 Ataraxos 在三周的对局中以 85% 有效胜率击败了四届世界冠军、公认史上最强的 Stratego 棋手 Niemeijer,并在 2025 世界锦标赛表演赛中赢下 40 局中的 38 局。

    推荐理由:原文对比了 Ataraxos 与 DeepNash 的训练成本和方法细节,读者可以了解不完美信息博弈研究的最新进展。

9月29日周二
9月25日周五
9月16日周三
9月11日周五
8月28日周五
8月26日周三
8月22日周六
  1. Google Research50

    Google Research 推出 Biomarker Discovery Framework:从可穿戴设备数据中优先排序候选生物标志物

    Google Research 推出 Biomarker Discovery Framework,一个多智能体系统,将候选生物标志物优先排序结构化为人类监督下的迭代研究流程,结合假设生成、统计分析、模型训练与对抗性验证。在三个队列共 9,279 人次观测中,该系统自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢类候选标志物,并构建了睡眠时长变异性等新型复合特征。

8月19日周三
8月17日周一
7月31日周五
7月27日周一
7月26日周日
  1. Berkeley AI Research46

    教 LLM 更新信念状态以实现高效长程交互:Berkeley AI Research 提出 ABBEL 框架

    Berkeley AI Research 提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为智能体的工作上下文,并引入 belief grading 监督摘要内容。在 CollabBench 协作编程测试中,ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,峰值上下文 token 长度也显著低于全上下文设置。

7月1日周三
4月22日周三
4月20日周一
4月9日周四
3月12日周四
  1. Google Research72

    Google AMIE 完成真实门诊前瞻性可行性研究,与 BIDMC 合作验证对话式诊断 AI 安全性

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展前瞻性单中心可行性研究,让 AMIE 在 100 名成人患者的初级诊疗就诊前采集病史,由医生通过视频实时监督。

    推荐理由:原文公布了 AMIE 在真实初级诊疗环境中的前瞻性可行性研究数据和安全性结果,读者可据此了解医疗对话 AI 走向临床的证据现状。

11月1日周六