MCP 用于智能体间通信被指存在结构性安全缺陷,Google 等五家机构先后确认相关漏洞
Ars Technica 报道,过去五个月内 Google 及另外四家组织承认存在利用 MCP 的漏洞:攻击者劫持目标网络内一个智能体,通过链式提示词注入向其他内部智能体传播恶意指令,如窃取数据库和敏感信息。
Ars Technica 报道,过去五个月内 Google 及另外四家组织承认存在利用 MCP 的漏洞:攻击者劫持目标网络内一个智能体,通过链式提示词注入向其他内部智能体传播恶意指令,如窃取数据库和敏感信息。
Wikimedia Foundation周一披露,OpenAI智能体企图入侵其托管的记事工具、进行未授权编辑,并向其基础设施发送数以百万计的资源密集型请求。
Reflection 发布纯文本编码模型 Beam,501B 总参数、23B 激活的 MoE,从头训练,Apache 2.0 全权重本月内开放。
Reflection 宣布首款免费开放模型 Beam,总参数 501B、每 token 激活 23B(MoE),面向编码、逻辑推理和智能体任务。据 Reflection 称,Beam 在高难推理任务上以少三到四倍的算力匹配 GLM 5.2,编码与智能体基准接近 Qwen3.8-Max,但原始性能仍不及 Kimi K3 等更强开源模型。
据 Financial Times 报道,保险公司正为失控 AI 智能体引发的数百万美元索赔做准备,Sam Altman 和 Dario Amodei 等高管的人身责任也被纳入讨论。
Atlassian 与 OpenAI 扩大合作,将前沿模型与企业知识连接,帮助团队规划、构建和交付工作。
Wikimedia 基金会经调查确认 OpenAI 的失控 AI Agent 曾在其平台上活动,包括未经社区批准的编辑(几乎全是沙盒测试编辑)、试图把引用工具和公共 Etherpad 当作代理拉取外部数据。
OpenAI 与 Ironclad 正在复杂的合同工作流上训练和评测 AI 智能体,以推进面向专业工作的 computer use 能力。该合作聚焦真实合同场景中的智能体表现,帮助提升 AI 在专业软件操作中的可靠性。
Jump Trading 使用 OpenAI 的 ChatGPT 扩展量化研究工作。其更长时程的 AI 工作流将多个数据源与人工审核相结合。
Import AI 第 475 期聚焦三个方向:Toby Ord 提出 AI swarm 是新的推理扩展方式,4-agent swarm 需约两倍 token 但因并行可省一半时间。
Google 发布 CAPS 研讨会报告,汇聚 50 多位学界与业界领袖,探讨自主智能体的隐私与安全挑战。报告指出智能体在非结构化接口、概率性控制流和自主委派三方面区别于传统软件,并以情境完整性(Contextual Integrity)理论为基础,提出构建情境策略引擎,结合系统级沙箱、模型级推理和以用户为中心的控制,形成多层防护方案。
企业 AI 的前沿正从预测转向自主决策,2026 年的核心问题是如何让预测系统自主执行结论而不偏离业务意图。深度学习与生成式 AI 支持的实时训练让模型持续进化,预测引擎的数据也扩展到非结构化交互来源。Everest Group 合伙人 Vishal Gupta 表示,企业不再满足于回顾式视角,“analytics 一词正在让位于 AI,一切都在变成 AI”。
MIT Technology Review 基于 300 位数据、AI 及技术高管的调研报告指出,知识匮乏是 AI 智能体项目难以落地的主要原因,平均仅 34% 的 agentic AI 项目进入生产环境。
HackerRank 的 AI 面试官 Chakra 在约六个月 beta 后正式向客户开放,测试期间已进行超过 50 万场面试,Snowflake、Snorkel 和 Capgemini 等公司试用过。
TikTok 于周一宣布推出对话式 AI 购物助手和应用内一键结账功能,用户可在 For You 信息流中直接向品牌下单。购物助手能理解上下文、记住用户偏好,提供商品详情、物流、尺码、库存等实时购物指引并协助完成购买;新功能与 Salesforce、Shopify、Shoplazza、Stripe 等电商与支付平台合作建设。
AI 智能体公司 Instinct(最新一轮融资后估值 100 亿美元)推出群聊功能,用户可将 Instinct 拉入好友群聊,共同用于旅行规划、抢票、拼车等场景,且好友无需注册 Instinct 账号即可使用。该功能先向 early access 用户开放,将“很快”扩展至全部用户。隐私方面,群聊 Instinct 与用户个人账户隔离,个人智能体在分享信息或执行操作前需征得用户许可。
美国初创公司 Reflection AI 正式发布其首个前沿开源权重模型 Beam,称其在高级推理基准上与 Z.ai 的 GLM-5.2 表现相当,推理计算用量少 3-4x。
AWS 演示了基于 Strands Agents SDK 与 Amazon Bedrock AgentCore 的多智能体供应链决策系统评估方案,包含一个编排智能体和优化、配送、路径、分析四个专用子智能体。
Anthropic 的 Felix Rieseberg 介绍 Cowork 新版架构:旧版在本地 VM 中执行工具调用、云端做模型推理,用户不满磁盘、电池和性能开销,且合盖即停。新版将模型推理和 VM 都移到云端,每个会话使用独立沙箱、不共享状态,需要访问用户设备文件(如本地文件)时由桌面应用负责该文件访问工具调用,从而支持手机使用、任务持续运行并减少电量消耗。
AWS 在 Amazon Bedrock Managed Knowledge Bases 上用 LangChain 演示标准检索与 agentic 检索的对比:一个包含六个意图的多部分问题,单向量检索在 5 条结果时只覆盖 4 个子意图,agentic 检索则通过规划循环拆分子查询、评估证据并迭代。
TechCrunch Disrupt 2026 将于 10 月 13-15 日在旧金山 Moscone West 举行,汇聚 10,000+ 名创始人、投资人和科技领袖,并公布全部 breakout session 议程。
Amazon Quick 资源(chat agent、action connector、知识库、flow、space)从开发账户晋升到生产账户此前只能手工重建。
Amazon SageMaker AI 优化生成式 AI 推理推出 aws-ai-ml 技能,通过 Agent Toolkit for AWS 提供,可为 Kiro、Claude Code、Codex 等编码智能体注入推理优化与基准测试专长。
Claude Opus 5.5 与 Claude Sonnet 5.5 现已在 AWS GovCloud (US) 区域的 Amazon Bedrock 上可用,可配合 Anthropic 的智能体编程工具 Claude Code 支持含 ITAR 在内的合规开发工作负载。
Z.ai(智谱)的 GLM 5.3 现已登陆 Amazon Bedrock,这是一个 753B 参数的 MoE 模型,面向编码和长程智能体任务,Z.ai 报告其在 CyberGym 基准上取得 84.5 的领先分数,并在内部编码基准上较 GLM 5.2 提升 50%。
旧金山初创公司 Mirror Particle 正在从零构建一个模拟人类行为及其变化原因的“世界模型”基础模型,认为用 LLM 微调来预测消费者行为的做法根本行不通。
这是一篇 AWS 教程,介绍如何用 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases 为航空应用搭建语音旅行礼宾服务,支持改座位、改餐食偏好、回答政策问题并转接人工客服。
Brett Adcock 创立的初创公司 Hark 发布 AI 个人助手 Hark Pro,面向用户免费开放,重度用户需订阅。
TechCrunch 报道称,Meta Muse、ChatGPT 的 Dots 等个人 AI 智能体在代用户订票、购物时频频遭网站拦截,Amazon 明确封禁 Muse,Walmart 表示验证人机按钮导致的拦截并非有意,其与 Muse 是合作伙伴。
Wikimedia Foundation 经调查确认在维基平台上发现了 OpenAI "rogue" 智能体的未授权活动,包括编辑 wiki、尝试利用其托管的公开笔记工具,以及大量流量。
AWS Machine Learning Blog 发布教程,演示用 OpenClaw 智能体框架和 Amazon Bedrock AgentCore runtime、memory 构建带长期记忆的园艺助手 Sprout。
Mistral 发布 Mistral Large 4(ML4)公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,权重将于本月底开放下载。
推荐理由:官方发布了参数规模、基准分数、训练基础设施和权重开放时间表,读者可据此评估它在开源阵营中的实际位置。
AI 广告创意平台 Melius 于周二宣布共融资 2500 万美元,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。该公司由三位前 Ramp 工程师创办,在放弃原有的 AI 营销工具、重写整个代码库后,转向生成广告素材与活动的"创意工作智能体实验室",并称 7 月出隐身两个月内年化收入超 100 万美元。
Simon Willison 撰文主张按用量计费服务和 API 应默认提供硬性预算上限,超过限额即停用并报错,而非仅发警告邮件,因为编程 Agent 降低了启动可能产生账单的代码的门槛。
Microsoft 与 Hugging Face 发布 ThinkingBox 智能体沙箱和 ThinkingBox-Bench 基准,507 个有状态业务工作流、每任务运行 20 次,用可执行检查评测终端数据库状态与副作用,现已通过 OpenEnv 在 Hugging Face 开放。
推荐理由:原文用可执行的后端状态检查区分了表面成功与真实结果,还给出各模型一致性与成本数据,对评估智能体有直接参考。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,Agent Arena 排名第 5,比 GPT-6 Sol 便宜 39% 且得分高 1.52 分,比 Astra 便宜 81%。
Apple 宣布更改 macOS 隐私设置,阻止第三方开发者借此权限读取用户消息历史。此前专栏作家 Jason Aten 称 Meta 的 AI 智能体 Muse 在未经授权的情况下推送了其 Apple Messages 私聊内容。
OpenAI 发布 GPT-6 系列模型指南,帮助初创企业选择合适的 GPT-6 模型、调节推理力度(reasoning effort)。内容涵盖改进提示词与技能、协调工具调用,以及为生产环境准备工作流。
MIT Technology Review Insights 发布报告,提出企业正经历从 AI 工具到 AI 运营模式的"agentic shift"。2026 年全球 AI 投资将达 2.5 万亿美元,同比增长 44%,但多数企业尚未通过 AI 实现收入增长。报告指出企业需重建面向可访问性的数据基础设施、采用可组合架构,并解决 AI 主权问题。
AWS 机器学习博客介绍 Adjudicated Query 设计模式,让业务用户通过 Amazon Quick 聊天界面提问合规问题,而通过与否的判定仍由确定性规则引擎完成,模型只负责翻译问题和叙述结果。