Google 发布智能体隐私与安全研讨会报告:以情境完整性视角探讨开放性难题
Google 发布 CAPS 研讨会报告,汇聚 50 多位学界与业界领袖,探讨自主智能体的隐私与安全挑战。报告指出智能体在非结构化接口、概率性控制流和自主委派三方面区别于传统软件,并以情境完整性(Contextual Integrity)理论为基础,提出构建情境策略引擎,结合系统级沙箱、模型级推理和以用户为中心的控制,形成多层防护方案。
Google 发布 CAPS 研讨会报告,汇聚 50 多位学界与业界领袖,探讨自主智能体的隐私与安全挑战。报告指出智能体在非结构化接口、概率性控制流和自主委派三方面区别于传统软件,并以情境完整性(Contextual Integrity)理论为基础,提出构建情境策略引擎,结合系统级沙箱、模型级推理和以用户为中心的控制,形成多层防护方案。
Anthropic Frontier Red Team 在 100 道内部 Binary Exploitation 基准随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。早期模型如 Claude Opus 4.6 和 GLM-5.2 则无一成功,作者认为一个有意义的门槛已被跨过。
Hugging Face 团队提出 ProvenanceGuard,一个针对 MCP Agent 的来源感知事实性验证层,可在生成后检查每条论断的支持来源是否与答案声明或暗示的来源一致,识别"跨来源混淆"问题。
OpenAI 推出 MentalHealthBench,这是一个由专家参与构建的评测基准,用于评估 AI 在真实心理健康对话中给出回复的有效性与安全性。
英国 AI 安全研究所(AISI)开始使用 EvalEval 的基础设施公开分享评测结果,包括 HealthBench、FrontierMath、Humanity's Last Exam、SWE-Bench Pro、Terminal-Bench 2.0 五个基准及 Cyber CTFs、The Last Ones 两项网络评测的验证结果。
Epoch 与 METR 发布 MirrorCode 基准,测试 AI 仅凭 CLI 访问重新实现完整软件的能力,25 个目标程序中 17 个有至少一次满分运行,Claude Opus 4.7 用 14 小时、251 美元推理成本完成了人类估需 2-17 周的任务。
Google Research 在 AISTATS 2026 上提出 Regularized f-Divergence Kernel Tests,用于更敏感、灵活地审计机器遗忘(machine unlearning)。
Import AI 第 459 期报道:弗吉尼亚大学、Anthropic 与加拿大银行研究者估计美国 AI 经济 2025 年名义规模约 $250 billion,质量调整后实际产出年增速约 2,600%,但因单价下降和推理占比高而难以在 GDP 中体现。英国 AI Security Institute 撰文指出用 AI 监督训练过程来自动化对齐研究并非万能方案,实际比预想更难。
SentinelOne 研究员拆解了约 20 多年前的病毒 fast16.sys,它通过篡改高精度计算软件(如 LS-DYNA 970、PKPM、MOHID)在内存中的计算结果,可能被用于武器研发相关的破坏,类似《三体》中的智子干扰。
Google Research 提出一个评估 25 个 LLM 行为倾向与人类对齐程度的框架,将标准化心理问卷改编为情境判断测试(SJT),并由 550 名参与者提供人类偏好分布。
Google Quantum AI 发布白皮书,更新了破解 256 位椭圆曲线离散对数问题(ECDLP-256)的量子资源估算,两条电路分别使用不到 1,200 个逻辑量子比特加 9,000 万个 Toffoli 门和不到 1,450 个逻辑量子比特加 7,000 万个 Toffoli 门,物理量子比特需求较此前降低约 20 倍。
推荐理由:Google 白皮书给出破解 ECDLP-256 更低的量子资源估算和零知识证明披露方式,加密社区可据此评估向 PQC 迁移的紧迫性。
Berkeley AI Research 提出 SPEX 和 ProxySPEX 两种算法,利用稀疏性、低度性和层级性等结构假设,把消融归因中的交互发现问题转化为稀疏恢复问题,可识别驱动 LLM 输出的关键交互。