用 Amazon Bedrock AgentCore Evaluations 评估多智能体系统的可解释性与实用性
AWS 演示了基于 Strands Agents SDK 与 Amazon Bedrock AgentCore 的多智能体供应链决策系统评估方案,包含一个编排智能体和优化、配送、路径、分析四个专用子智能体。
AWS 演示了基于 Strands Agents SDK 与 Amazon Bedrock AgentCore 的多智能体供应链决策系统评估方案,包含一个编排智能体和优化、配送、路径、分析四个专用子智能体。
Amazon Quick 的控制台和 update-user API 不支持直接从 Admin 或 Author 降级到 Reader,会报 “You cannot downgrade a user role” 错误。
AWS 在 Amazon Bedrock Managed Knowledge Bases 上用 LangChain 演示标准检索与 agentic 检索的对比:一个包含六个意图的多部分问题,单向量检索在 5 条结果时只覆盖 4 个子意图,agentic 检索则通过规划循环拆分子查询、评估证据并迭代。
Simon Willison 用“在火星上乱穿马路的穿渔网袜犰狳”SVG 生成提示词测试 Mistral Large 4,并与 claude-opus-5.5、gpt-6.1-sol 和 gemini-3.8-flash 的输出进行对比,各模型均使用默认推理级别。
Claude Opus 5.5 与 Claude Sonnet 5.5 现已在 AWS GovCloud (US) 区域的 Amazon Bedrock 上可用,可配合 Anthropic 的智能体编程工具 Claude Code 支持含 ITAR 在内的合规开发工作负载。
Simon Willison 在 TIL 中演示如何用 Parseable 存储和查询 Datasette 的 OpenTelemetry traces。Parseable 是一款新 observability 工具,提供 AGPL 开源的 Rust 实现(单个约 180MB 二进制文件)、Enterprise 版和云托管选项。
这是一篇 AWS 教程,介绍如何用 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases 为航空应用搭建语音旅行礼宾服务,支持改座位、改餐食偏好、回答政策问题并转接人工客服。
AWS 介绍如何通过 SageMaker Unified Studio 管理 Amazon SageMaker HyperPod 集群,在让 ML 团队从项目工作区启动训练和微调任务的同时保持治理控制。
AWS Machine Learning Blog 发布教程,演示用 OpenClaw 智能体框架和 Amazon Bedrock AgentCore runtime、memory 构建带长期记忆的园艺助手 Sprout。
OpenAI 发布 GPT-6 系列模型指南,帮助初创企业选择合适的 GPT-6 模型、调节推理力度(reasoning effort)。内容涵盖改进提示词与技能、协调工具调用,以及为生产环境准备工作流。
AWS 机器学习博客介绍 Adjudicated Query 设计模式,让业务用户通过 Amazon Quick 聊天界面提问合规问题,而通过与否的判定仍由确定性规则引擎完成,模型只负责翻译问题和叙述结果。
借助 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 连接到完全托管的 Web Search——一项兼容 MCP、基于覆盖数百亿文档的 Amazon 网页索引的搜索能力,所有查询流量都留在 AWS 基础设施内,无需管理外部 API 密钥。
AI 正在改变开发者工作方式,GitHub 博客提出三项值得强化的技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的第一个答案(如让第二个模型批评第一个模型的输出,类似 Copilot 的 Rubber Duck agent)、把省下的实现时间用于理解客户需求和技术决策。随着 AI 承担更多实现工作,技术判断力和权衡取舍能力变得更重要。
ServiceNow CoreAI 推出 AutoSynthData,利用目标模型在环境中的失败案例和更强 teacher 的成功轨迹,自动生成可执行、真实且具难度的训练任务,用于企业智能体的后训练。每个任务由系统规范、用户提示词和 verifier 组成,需满足可行性、真实性和难度三项要求。团队用 EnterpriseOps Gym 的公开数据集演示了该流程,并随模型改进动态调整课程。
AWS Professional Services 构建了一套四智能体模式,基于 Strands Agents SDK 并运行在 Amazon Bedrock AgentCore 上,通过 AgentCore Gateway 以 MCP 工具连接迁移输入与输出系统。
AWS Machine Learning Blog 发布 Claude Platform on AWS(CPonAWS)多环境访问的完整实现指南:在专用 AI Services 账户中部署订阅。
AWS 在 Amazon Bedrock AgentCore 上给出环境智能体的端到端参考实现:事件(如 S3 上传)触发 AgentCore Runtime 上的智能体执行工作流,通过单一 ask_human 工具在需要审批或澄清时暂停等待人工输入,再从中断处恢复。
Amazon Payments 在 Amazon SageMaker AI 上用多目标 contextual 多臂老虎机(LinUCB)对产品获客漏斗做个性化内容选择。
AWS 博客展示了如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT,版本 1.6)的自定义记忆后端,并部署在 Amazon EKS 上,以多智能体投资研究为运行示例。
AWS 在 Machine Learning Blog 发布教程,演示用 Amazon Bedrock Knowledge Bases 在 Amazon S3 索引保险理赔文档,通过 AgenticRetrieveStream API 实现自然语言提问、多轮对话、元数据过滤和引用返回。
AWS Machine Learning Blog 发布实操教程,用 AgentCore Runtime Instances 构建由作曲、交付、合规三个智能体组成的音乐制作流水线,在 g6.xlarge 上以相同 runtimeSessionId 将三个智能体协同定位到同一 GPU 实例。
推荐理由:AWS 官方教程给出三智能体共享 GPU 实例协作的完整代码和实测数据,方法可迁移到其他长时多智能体工作流。
AWS 发布 Amazon Quick 提示词工程基础教程,讲解如何通过结构化提示词让平台的 AI 功能更准确地响应自然语言请求。文章介绍核心原则——明确性、提供业务上下文、用示例示范输出格式,并给出适用于各组件的 CRISPE 通用提示词框架(含 Context、Role、Intent、Steps 等要素)。
这篇 AWS 指南逐个讲解 Amazon Quick 各组件的提示词写法。Quick Research 需明确目标、受众与关注领域,可从 Quick Index。
AWS Machine Learning Blog 发布教程,介绍用 Amazon Bedrock AgentCore 上的 Claude Sonnet 4.6 提取与 Claude Haiku 4.5 独立校验,再由 Amazon Textract 仲裁签名分歧,把合同 PDF 转为结构化数据的平台架构。
AWS 在 SageMaker AI 上通过 vLLM-Omni Deep Learning Container 部署 Qwen3-TTS,实现双向流式语音输出,可在完整生成前提前播放语音。
AWS 机器学习博客教程展示在 Amazon SageMaker AI 上用同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 做图像条件视频生成。
AWS 展示了基于 Amazon Nova Act 与 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代基于 DOM 选择器的传统脚本,降低 UI 变动导致的维护成本。
AWS 通过外置 adapter ID 到 AWS Systems Manager Parameter Store,实现 Amazon Textract adapter 跨账户生命周期管理,将生产环境 adapter 更新从数小时或数天的协调缩短到几秒,且零停机、无需重新部署应用。
Simon Willison 在 WeAreDevelopers World Congress North America 演讲收尾环节,用三张鸮鹦鹉照片和一段提示词让 Claude Opus 5.5 生成了 HTML5 canvas 像素艺术动画 Kākāpō Party,画面中有至少 20 只鸮鹦鹉随音乐跳跃、伴随彩带和气球效果。
GitHub 官方教程介绍如何在 GitHub Copilot app 中用 canvases 搭建自定义工作流:在 agent 会话中运行 /create-canvas 技能,用自然语言描述工作流、用户可做的操作和 agent 可做的操作,agent 即生成看板、清单、仪表盘等界面并在右侧面板打开。
推荐理由:教程给出 /create-canvas 的三要素写法和双向协作机制,读者可以照着把自己的工作流变成可复用的画布。
AWS 提出基于 Amazon EKS、EFA 和 DeepEP 的架构,用于加速 MoE 模型的大规模强化学习后训练,吞吐量提升 40%。该方案针对 RLHF、PPO、GRPO 等工作负载,解决 rollout 生成与策略训练的资源平衡、跨数百个加速器的高吞吐通信,以及 Expert Parallelism 带来的动态 all-to-all token 路由通信开销等问题。
AWS 展示了如何在 SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。基于 VisGym SFT checkpoint,使用 GRPO 后训练将 64 个固定迷宫评测集的解题率从 43.75% 提升到 95% 以上。
AWS 团队发文详解 NarrateAI 在 Amazon Bedrock 上实现生产级 LLM 质量保障的五项技术:自适应流水线路由、跨账号多模型容灾、实时流式评估、复合评估框架和数据准确性校验。
AWS Solutions Architect 撰文演示通过 Amazon SageMaker JumpStart 部署 Qwen3-TTS-12Hz-1.7B-Base 到实时推理端点,用几秒参考音频克隆说话人声音而无需重训模型。
Datacor 将 Amazon Quick Sight 集成到其 TrackAbout 解决方案中,为工业气体与焊接分销商提供自助式租赁数据分析,无需提交 IT 工单或等待数天甚至数周的自定义报表。
GitHub Security Lab 的 Antonio Morales 发布 Fuzzing Taskflow,一个基于 Taskflow Agent 构建的 C/C++ 项目自主模糊测试管线,只需指定 GitHub 仓库即可自动识别入口点、分析构建系统、编写 harness、运行 AFL++ 并分诊崩溃。
推荐理由:作者亲述自动化模糊测试管线的设计,读者可以了解 LLM 智能体如何接管覆盖率分析和崩溃分诊等人工环节。
GitHub Copilot app 团队重建了 Pull Request 视图,使其能流畅打开一个含 2,200 个文件、超过一百万变更行和 400 多条行内评论的开源 PR。
推荐理由:作者以第一手视角拆解了超大 PR 渲染的双几何架构和自动化测量方法,思路对处理大规模动态内容界面有借鉴意义。
通过可交互示例演示 shadow DOM 的样式封装、继承、slots、parts 及 JavaScript 访问,展示 shadow roots 如何创建带私有样式表的隔离 DOM 树,并以受控方式与页面 DOM 交互。该讲解页面由 Fable 5.1 Medium 根据提示词生成。
MIT Technology Review 详述其15个月调查的方法论,构建了首个覆盖边境监控塔附近死亡案例的综合地图,共分析近4000个案例。
GitHub 作者 Stephen Toub 撰文介绍团队借助 GitHub Copilot 应用与 CLI,把 Copilot agent runtime 从 TypeScript/Node.js 完全重写为 832,378 行生产 Rust,AI 智能体完成了大部分代码,共落成 128 个 pull request,原需一两人年的项目仅由一名开发者在数月内完成。
推荐理由:作者亲历整场迁移,给出代码量、发布节奏与缓存命中率等一手数据,读者可以借此评估智能体主导大型重写的可行路径。