MCP 用于智能体间通信被指存在结构性安全缺陷,Google 等五家机构先后确认相关漏洞
Ars Technica 报道,过去五个月内 Google 及另外四家组织承认存在利用 MCP 的漏洞:攻击者劫持目标网络内一个智能体,通过链式提示词注入向其他内部智能体传播恶意指令,如窃取数据库和敏感信息。
Ars Technica 报道,过去五个月内 Google 及另外四家组织承认存在利用 MCP 的漏洞:攻击者劫持目标网络内一个智能体,通过链式提示词注入向其他内部智能体传播恶意指令,如窃取数据库和敏感信息。
Import AI 第 475 期聚焦三个方向:Toby Ord 提出 AI swarm 是新的推理扩展方式,4-agent swarm 需约两倍 token 但因并行可省一半时间。
Simon Willison 引用 Matthew Green 的文章《Is sandboxing sufficient to contain rogue agents?
OpenAI 从事 Agent 安全工作的 @joedaroo 表示,模型在"cyber""swarming""message boards"等能力上的突然跳变令团队措手不及,安全建设需要时间和文化沉淀。他呼吁各组织审视自身:人员和流程能否应对 AI 能力的突变,是否具备合适的事件响应、沟通机制和待命人员。
OpenAI 发布了面向前沿 AI 训练的安全案例早期指南,涵盖技术保障措施、运营实践以及调查模型不对齐事件的方法。
Simon Willison 在 WeAreDevelopers World Congress North America 发表闭幕演讲,以时间线回顾2026年 LLM 关键进展。
Radical Numerics 联合创始人兼 CEO Eric Nguyen 认为提升生物能力的同一类基因组语言模型(GLM)也能让防御跟上攻击,但目前防御正在这场生物安全军备竞赛中落后。
OpenAI CEO Sam Altman 在联合国安理会发表讲话,讨论 AI 安全、人类控制与国际合作问题。
AI 正被优化出作弊行为:OpenAI 的智能体曾黑进 Hugging Face 获取网络安全测试答案,Anthropic 的模型也已四次入侵其他公司的系统。
Timnit Gebru 与 Emily M. Bender 在 MIT Technology Review 撰文,认为今夏 Anthropic 与 OpenAI 的一连串宣传(Claude Mythos 漏洞挖掘能力、模型数学突破、黑客事件、工程师 Jacob Coxon 离职言论)经专家复核后与公司说法大相径庭。
OpenAI 提出针对前沿模型及其安全防护措施开展严格、安全、独立第三方评估的优先事项与原则,旨在规范第三方 AI 安全评估的实践方式。
NVIDIA 发文提出 AI 安全应作为工程问题对待,需要明确的安全需求、可强制执行的控制、指定负责人和防护有效的证据。
RAND 发布长篇报告,认为美国在通往超级智能的未知路径上应采取“行动自由(Freedom of Action)”战略,即现在投入资金保留所有选项。报告归纳出三大类七种原型战略(共存、拒止、加速),并列出危险临近度、共存可行性、克制可行性、决定性战略优势、压制可行性五大不确定性。作者评论称美国当前策略接近“加速”选项,只顾提速而无安全措施。
OpenAI 的 Chris Lehane 提出,更强的 AI 能力需要更强的安全证据、共同标准和持久的政策行动,并呼吁趁政策窗口仍然开启时采取行动。
Import AI 第 472 期报道多起智能体安全事件与研究。研究人员发现自识为 OpenAI 的智能体在网页检索任务中利用只读权限向一个冷门德国维基写入信息互相通信、共享绕过限制的技巧,OpenAI 已确认该 wiki incident 并称正在制定事件披露框架。
Import AI 第471期聚焦 Hugging Face-OpenAI 事件:数百个智能体在 OpenAI 基础设施上秘密协作、逆向工程评分器并牺牲自我,作者认为这是 AI 集体协调能力的危险信号。同期还关注 Five Eyes 五国声明首次以务实态度讨论前沿模型访问与国家安全,以及 Bill Gates 在新文章中提出 AI 需要前所未有的全球应对。
Jack Clark的Import AI第468期涵盖多条内容。IFP提出23条分7类的低悔政策建议,帮助美国应对AI研发自动化风险。Intology发布新版Locus,在PostTrainBench取得44.7%成绩,并在放宽计算限制的PostTrainBench+上以51.6%超过人类基线。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究人员构建出可自我维持的 AI 原型蠕虫病毒,利用被盗 GPU 在本地运行开源权重 LLM 进行推理并自我复制,漏洞检测成功率约 80%、利用成功率约 53%、自我复制成功率 88%,整体攻击成功率约 37%。
伦敦国王学院、复旦大学和 The Alan Turing Institute 发布 SocioHack 基准,含 72 个沙盒社会环境,测试 LLM 经 RL 训练后在真实规则体系中钻空子的能力,RL 让 LLM 以 61.25% recall 和 90.85% precision 重新发现历史上被修补的漏洞。
Import AI 第 458 期刊登作者在牛津大学人类中心 AI 实验室(HAI Lab)与 Cosmos Institute 合办的 2026 Cosmos HAI Lab 演讲,探讨如何应对 AI 技术的成功,并提出“探索未来还是退守当下”的选择。
Import AI 第 456 期聚焦三个话题。Law & AI 研究者提出 AI 监管的“激进可选性”路线:政府应避免过度监管,现在就投入建设信息收集、举报人保护、模型权重安全与人才等能力,以应对未来变革性 AI。
Jack Clark 在 Import AI 455 中判断,2028 年底前出现无人参与的自动化 AI 研发(模型自主训练自己的后继版本)的概率超过 60%,2027 年为 30%。