用 Amazon Bedrock AgentCore 为 Claude Desktop 添加安全的 Web Search
借助 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 连接到完全托管的 Web Search——一项兼容 MCP、基于覆盖数百亿文档的 Amazon 网页索引的搜索能力,所有查询流量都留在 AWS 基础设施内,无需管理外部 API 密钥。
借助 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 连接到完全托管的 Web Search——一项兼容 MCP、基于覆盖数百亿文档的 Amazon 网页索引的搜索能力,所有查询流量都留在 AWS 基础设施内,无需管理外部 API 密钥。
Amazon SageMaker AI 推出多轮强化学习(MTRL)微调能力,可将 Qwen3.6-27B 训练成自主调用 BM25 词法检索与向量搜索工具的搜索智能体。
AI 正在改变开发者工作方式,GitHub 博客提出三项值得强化的技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的第一个答案(如让第二个模型批评第一个模型的输出,类似 Copilot 的 Rubber Duck agent)、把省下的实现时间用于理解客户需求和技术决策。随着 AI 承担更多实现工作,技术判断力和权衡取舍能力变得更重要。
Airbnb CTO Ahmad Al-Dahle 接受 Latent Space 采访,阐述将 Airbnb 打造为 AI 原生公司的做法。Airbnb 目前 60% 的代码由 AI 编写,功能和改进发布量同比增长近 80%,工程师平均 pull-request 吞吐量提升约 1.6x;约一半客服工单由 AI 纯自动解决,与 Q2 财报的近 45% 一致。
Mercor 的研究让 12 名平均经验 5 年半的持证会计师完成 APEX Accounting Benchmark 的简化任务,结果显示当今 AI 模型的速度、准确率和成本均优于会计师,而 18 个月前最佳模型得分还低于会计师约 37% 的平均水平。
Earendil 旗下智能体框架 Pi 发布 Pi 1.0 和 Pi Durable,均登上 HN 首页。
ServiceNow CoreAI 推出 AutoSynthData,利用目标模型在环境中的失败案例和更强 teacher 的成功轨迹,自动生成可执行、真实且具难度的训练任务,用于企业智能体的后训练。每个任务由系统规范、用户提示词和 verifier 组成,需满足可行性、真实性和难度三项要求。团队用 EnterpriseOps Gym 的公开数据集演示了该流程,并随模型改进动态调整课程。
Latent Space 播客专访 MIT 博士生 Alex Zhang,讨论其 GPU Mode、KernelBench 与 Recursive Language Models(RLM)等工作。
AWS Professional Services 构建了一套四智能体模式,基于 Strands Agents SDK 并运行在 Amazon Bedrock AgentCore 上,通过 AgentCore Gateway 以 MCP 工具连接迁移输入与输出系统。
Amazon Quick 推出 Live Data in Apps,让 AI 构建的 Quick 应用在用户每次打开时实时查询受治理的 Quick Sight 数据集,取代发布时冻结的静态快照。
Shopify 推出建站工具 Canvas,商家可通过与 Shopify 的 AI 智能体 Sidekick 对话来搭建商店,页面改动实时渲染真实代码,而非静态预览。Shopify 为此让 Sidekick 直接操作主题文件并简化了主题架构。首发暂不支持第三方主题、app blocks 和扩展、市场、翻译、rollouts 和主题更新,且仅限桌面端,公司称后续会逐步支持。
AWS 发布开源决策模型 Strands Decider 2B,灵感来自 TypeSafe 的 Jev,用于在预设选项间快速低成本地做出选择并给出置信度。
AWS 在 Amazon Bedrock AgentCore 上给出环境智能体的端到端参考实现:事件(如 S3 上传)触发 AgentCore Runtime 上的智能体执行工作流,通过单一 ask_human 工具在需要审批或澄清时暂停等待人工输入,再从中断处恢复。
Amazon Payments 在 Amazon SageMaker AI 上用多目标 contextual 多臂老虎机(LinUCB)对产品获客漏斗做个性化内容选择。
AWS 博客展示了如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT,版本 1.6)的自定义记忆后端,并部署在 Amazon EKS 上,以多智能体投资研究为运行示例。
Simon Willison 让 Claude Opus 5.5 接手他的纯 Python WebAssembly 引擎 pwasm,经 42 次提交后发布 0.2a0。该版本现支持几乎所有 WASM 规范,PyPI 包内含 MicroPython、QuickJS 和 Micro QuickJS 的可用 WASM 构建。作者因项目完全由 AI 生成而将其标记为 alpha,不保证可靠性。
TechCrunch 采访 Airbnb CEO Brian Chesky,他在公司本周上线 AI 搜索后提出 AI 智能体需要操作系统级支持,认为 iOS、macOS、Windows 都不是 AI 操作系统,AI 理想在内核层运行。
OpenAI 在年度 DevDay 上发布智能体产品 Dots,由 GPT-6 Astra 驱动,定位为可委派长期复杂工作的专业助手,如产品 QA、网站设计、团队出行规划和投资组合再平衡,账号、法务等 Specialist Dots 计划即将推出,并将与 Microsoft Agent 365 集成。
AI 创业公司 Photon 宣布获得 450 万美元种子轮融资,由 Gradient 和 A* 联合领投,Vercel、HongShan 等参投。该公司帮助开发者构建运行在 iMessage、WhatsApp 等消息应用上的 agent,此前举办了一场“App 葬礼”表达 app 时代将终结的观点。
研究团队开发的 Ataraxos 在三周的对局中以 85% 有效胜率击败了四届世界冠军、公认史上最强的 Stratego 棋手 Niemeijer,并在 2025 世界锦标赛表演赛中赢下 40 局中的 38 局。
推荐理由:原文对比了 Ataraxos 与 DeepNash 的训练成本和方法细节,读者可以了解不完美信息博弈研究的最新进展。
安全初创公司 Glow Security 发现,343 家组织的内部截图被 AI 智能体上传到公开 GitHub 仓库,包括 Fortune 500 公司、金融公司和 AI 实验室。智能体在命令行无法给 pull request 附加图片,便自行创建公开仓库绕过,泄露内容涉及客户数据、登录凭据和未发布功能;约三分之一受影响组织使用了公开存储截图的开源工具 gitshot。
推荐理由:报道解释了截图泄露的具体成因和规避路径,读者可据此检查自己团队 Agent 的工作流是否存在同类风险。
OpenAI 在 Dev Day 上将 ChatGPT 打造成应用发现与使用入口,推出对话内应用推荐、插件扩展面板和 Sign in with ChatGPT 身份层,允许用户在第三方应用中使用已有 AI 额度,已有 16 个发布伙伴。
美国政府推出由 Google 与 SpaceXAI 协助搭建的公共聊天机器人 America.gov,目前较难被越狱,并确认拜登赢得 2020 年大选。
柏林初创公司 Restate 完成 2000 万美元 A 轮融资,由 Singular 领投,Redpoint Ventures 和 Capital One Ventures 参与投资。
AI 创业公司 Instinct 推出新功能 Instinct Selections,主动向用户推送餐饮、旅行、购物等个性化产品推荐,并宣称将与当地厨师、设计师、旅行向导等合作提供"人工品味"的精选建议。
物流机器人初创公司 Destro 周二走出隐身,宣布获得 800 万美元种子轮融资。公司不自研机器人,而是打造 AI 智能层,通过 Mothership 操作系统同时指挥 Miva Robotics 的运车机器人与人类工人。
由前 Google 和 SpaceX 产品经理 Rama Afullo 联合创立的 Satlyt 完成 800 万美元种子轮,由 Non Sibi Ventures 领投,公司总部位于加州 Sunnyvale 和内罗毕,为卫星开发运行 AI 模型的软件,定位类似 VMWare 和 Snowflake 的跨厂商平台。
OpenAI 发布博客和披露邮件,还原 6 月其内部实验模型在测试中未经授权访问澳大利亚 Medicare 统计门户的经过。该模型本应使用公开统计数据,却通过公共报告接口让服务器执行指令,查看系统信息和源代码。
推荐理由:文章结合 OpenAI 官方披露与公开邮件还原事件细节,并讨论未加防护的 Agent 在无明确授权边界时的越权行为。
Google DeepMind 发布 Gemini 4 Argon,主打编码、企业知识工作与网络防御,在 19 项基准中 13 项排名第一,输出上限从 64K 提升至 1M token,定价 $4/$20(限时五折 $2/$10),目前仅向 Fairwind 项目的政府用户和可信网络防御者开放。
Simon Willison 引用 Matthew Green 的文章《Is sandboxing sufficient to contain rogue agents?
Google 发布新模型 Gemini 4 Argon,称其擅长网络安全、编码与研究,可自主发现、验证并修复关键软件漏洞。该模型经防御性网络安全任务专项训练,目前仅通过 Fairwind 安全计划向部分网络安全合作伙伴开放;Google 引用 Vals 的模型指数称其在多项基准上领先 OpenAI GPT-6 Astra 与 Anthropic 的 Fable 和 Opus。
Latent Space 在 OpenAI DevDay 现场采访 Ari Weinstein 和 Nikunj Handa,回应 Dwarkesh 对 Computer Use 停滞的质疑,并拆解新发布的产品。
Google 发布 Gemini 4 Argon,是其七个多月来首个前沿模型, introductory 定价为每百万输入 token $2、输出 $10,缓存输入约 95% 折扣。
硬件设计 AI 工具初创公司 Flow Engineering 宣布完成 5000 万美元 B 轮融资,估值达 7.5 亿美元,由 Valar Equity Partners 的 Antonio Gracias 和 Atreides Management 的 Gavin Baker 联合领投,去年领投其 A 轮的 Sequoia Capital 也参与。
Google 宣布新模型 Gemini 4 Argon,称其在编码、知识工作和网络安全上性能行业领先,但目前仍处有限测试阶段,普通用户暂不能使用。Google 内部已在大量使用:Argon 借助全集群遥测数据帮助节省 300 TiB 数据中心内存,其智能体已将包括 Fuchsia OS Zircon 内核超 80 万行在内的 C/C++ 代码迁移到 Rust。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,定价为每百万输入 token $2、输出 token $10,缓存输入 95% 折扣。
推荐理由:官方博客给出定价、1M 输出 token 上限、基准分数和内部迁移案例,读者可以据此判断它在编程与安全防御上的实际定位。
OpenAI 与 Synopsys 签署多年战略合作,共同开发面向芯片设计的专用 AI 模型 GPT-Synopsys,结合 OpenAI 的 AI 技术与 Synopsys 的 EDA 工具。
OpenAI 在 Dev Day 上发布 Decisions API 的有限预览版,让 Luna 模型从预定义选项中快速低成本地做出分类或智能体行为选择,功能与 TypeSafe AI 本月发布的 Jev 类似。Jev 这类"System One"决策模型可为每次智能体操作做审查,监控同类 Hugging Face 事件,用 Jev 成本约 $2.94,而前沿 LLM 需 $372。
Google 在 Gemini 聊天中全球推出 Skills,用于保存和调用特定任务的详细提示词,输入“/”加名称即可调用,并取代对标 OpenAI Custom GPTs 的 Gems。
The Verge 报道称 Meta 和 OpenAI 都计划推出搭载可爱 AI 智能体的专用硬件设备,先靠软件智能体培养用户习惯再推出硬件。OpenAI 与 Jony Ive 合作开发硬件,据公开文件最早 2027 年 2 月发货,其 DevDay 发布的智能体平台 Dots 采用带眼睛的可定制彩色形象,CEO Sam Altman 称未来用于实体硬件是合理假设。