在 SageMaker AI 上用 vLLM-Omni 构建实时语音应用 – Part 1
AWS 在 SageMaker AI 上通过 vLLM-Omni Deep Learning Container 部署 Qwen3-TTS,实现双向流式语音输出,可在完整生成前提前播放语音。
AWS 在 SageMaker AI 上通过 vLLM-Omni Deep Learning Container 部署 Qwen3-TTS,实现双向流式语音输出,可在完整生成前提前播放语音。
AWS 展示了基于 Amazon Nova Act 与 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代基于 DOM 选择器的传统脚本,降低 UI 变动导致的维护成本。
H Company 发布 Holo4 智能体系列,含 27B dense 和 35B-A3B MoE 两个规格,同时推出基于 Nemotron 3 Nano Omni 的 Holotron4 Nano。
推荐理由:官方发布通用计算机使用智能体系列,给出多接口适配设计、OSWorld 2.0 分数对比和开源轨迹,读者可评估开源 Agent 的新选择。
Hugging Face 宣布 Hub 新增 RL Environments 支持,环境以带 rl-environment 标签的数据集仓库形式存在,无新仓库类型、注册表或注册流程。
GitHub 官方教程介绍如何在 GitHub Copilot app 中用 canvases 搭建自定义工作流:在 agent 会话中运行 /create-canvas 技能,用自然语言描述工作流、用户可做的操作和 agent 可做的操作,agent 即生成看板、清单、仪表盘等界面并在右侧面板打开。
推荐理由:教程给出 /create-canvas 的三要素写法和双向协作机制,读者可以照着把自己的工作流变成可复用的画布。
AWS 展示了如何在 SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。基于 VisGym SFT checkpoint,使用 GRPO 后训练将 64 个固定迷宫评测集的解题率从 43.75% 提升到 95% 以上。
AWS 团队发文详解 NarrateAI 在 Amazon Bedrock 上实现生产级 LLM 质量保障的五项技术:自适应流水线路由、跨账号多模型容灾、实时流式评估、复合评估框架和数据准确性校验。
Wayfair 使用 OpenAI 模型改进电商客服支持与商品目录准确性,自动化工单分类,并大规模增强数百万条商品属性。
GitHub Copilot 作者认为聊天不是与 AI 协作的最佳界面,介绍了 GitHub Copilot app 中的 canvas 功能,它是可双向与 agent 通信的全栈小应用,可调用第三方 API 并在本地执行代码。
Google Research 发布 AI 视频联合导演研究,构建了基于 Gemini 和 Veo 的多智能体编排层,包含 Co-Director、CANVAS、A²RD 和 VQQA 四个框架,将长视频生成转化为全局优化与世界状态跟踪问题。
GitHub Security Lab 的 Antonio Morales 发布 Fuzzing Taskflow,一个基于 Taskflow Agent 构建的 C/C++ 项目自主模糊测试管线,只需指定 GitHub 仓库即可自动识别入口点、分析构建系统、编写 harness、运行 AFL++ 并分诊崩溃。
推荐理由:作者亲述自动化模糊测试管线的设计,读者可以了解 LLM 智能体如何接管覆盖率分析和崩溃分诊等人工环节。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近乎实时的视频生成与语音结合,为 Gemini 的对话式 AI 提供动态视觉形象,具备精确唇形同步、自然表情和流畅轮次切换。
Ringg 使用 GPT-5.6 构建支持语音、聊天、WhatsApp 和网页渠道的多语言 AI 智能体,可解决多达 65% 的客户来电。相比 GPT-4.1,成本降低 90%。
NVIDIA 于 9 月 22-23 日在新加坡 Raffles City Convention Centre 举办 AI Day Singapore,与伙伴展示东南亚地区的 AI 进展。
AMD 发布“Advanced Insights”视频,讲解 Zen 架构如何为 Agentic AI 时代演进。正文仅附 AMD 品牌资产下载条款,未提供架构演进的具体技术细节或数据。
NVIDIA 于加拿大多伦多 ROSCon 大会发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速开源软件包,新增智能体工作流以帮助开发者和 AI 智能体协同构建机器人应用。
NVIDIA 发文提出 AI 安全应作为工程问题对待,需要明确的安全需求、可强制执行的控制、指定负责人和防护有效的证据。
NVIDIA 在纽约气候周展示了五家将 AI 融入清洁能源项目的公司。ThinkLabs AI 用数字孪生把 Southern California Edison 的电网互联评估时间从 30-45 天缩短到两分钟。
GitHub Podcast 逐条拆解五个常见 AI 热门观点。核心结论:AI 生成代码仍需按风险分级审查;Skills 与 MCP 解决不同问题,MCP 提供工具与数据访问标准,Skills 以 Markdown 打包团队流程与最佳实践,两者互补;RAG 未死,检索让模型更接近答案,可与 agent、MCP、Skills 同一工作流共存。
律所 Cooley 基于 ChatGPT Work 构建了 GO Public,将 AI 能力引入 IPO 流程。该工具帮助律师更早发现问题,把专业判断集中在最关键之处。
GitHub 作者 Stephen Toub 撰文介绍团队借助 GitHub Copilot 应用与 CLI,把 Copilot agent runtime 从 TypeScript/Node.js 完全重写为 832,378 行生产 Rust,AI 智能体完成了大部分代码,共落成 128 个 pull request,原需一两人年的项目仅由一名开发者在数月内完成。
推荐理由:作者亲历整场迁移,给出代码量、发布节奏与缓存命中率等一手数据,读者可以借此评估智能体主导大型重写的可行路径。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,分别面向规模化性价比和高复杂度多步推理任务。
推荐理由:官方给出了两条产品线的能力分工和多项基准数字,可帮助读者判断语音智能体场景下的选型取舍。
IBM Research 在 ALTK-Evolve 中推出 Consistency Analyzer 和一致性指南,针对 Agent 同一任务多次运行结果不稳定的问题。
推荐理由:原文给出可复用的 Pass^k 指标和一致性诊断方法,读者可据此评估并改善自己 Agent 的复现稳定性。
Fyxer 基于 OpenAI 模型,结合微调、记忆和真实用户反馈,打造 AI 高管助理。它能整理收件箱,并以每位用户的语气起草邮件,从而赢得用户信任。
Perplexity 已信任 GPT-6 Astra 处理端到端系统,包括撰写沟通内容、修改软件和监控生产系统。相比使用早期模型时,Perplexity 现在的人工检查频率大幅降低。
GitHub 日本和韩国市场营销负责人 Tomoko Tanaka 撰文介绍,她没有写代码,而是把活动运营 runbook 交给 GitHub Copilot。
Cognition 的 Devin 引入 GPT-6 Astra 来改进软件测试并验证其可用性。该组合旨在帮助工程师减少代码审查量、交付更多成果。
Google Research 在 ACL 2026 提出 ToolGrad,一种“答案优先”的工具调用数据集生成方法:先构建真实工具调用链,再用文本“梯度”迭代提出、执行、选择和更新 API 工作流。
GitHub Copilot app 新增内置 diff、终端和浏览器三个面板,让你在不离开应用的情况下审查智能体代码改动、运行命令并预览效果。diff 面板以绿红高亮显示增删行,可接受更改、留言或让 Copilot 修改;终端面板支持运行 npm run dev 等脚本并开启多个窗口;浏览器面板通过 Pick & Polish 工具选中元素并配合智能体调整。
Hugging Face 发布 Workflow1111,将 AUTOMATIC1111 的主要功能重建为单个 Gradio Workflow 画布,包含 11 条媒体管线、73 个节点,覆盖文生图、hi-res fix、图生图、prompt 矩阵、VLM 反推、检测生成 inpaint 蒙版、ControlNet 风格预处理器、背景去除、PNG Info 和图生视频。
OpenAI 发布 Agents API,这是一个托管服务,用于构建和上线云端智能体。该 API 由 Codex harness 驱动,提供编排、长时间运行会话和工具使用能力。
推荐理由:原文点出该 API 由 Codex harness 驱动,支持长时间会话和工具调用,可据此了解 OpenAI 托管智能体的产品形态。
Mistral AI 帮助一家欧洲能源运营商把 40,000 行 Fortran 77 储层模拟器代码迁移到 C++,并复盘了方法。
一位 MIT 研究者使用 GPT-5.6 Sol 搭配 Codex,自主运行量子计算实验、分析结果并校准 qubit。
GitHub 在 GitHub Copilot CLI 推出 Project HydraFusion 研究预览,通过运行时多模型编排,按任务在 Single、Cascade、Critique 三种执行模式中选择,并调用跨供应商模型完成起草、审查、修订或升级。
推荐理由:原文给出三套执行模式、具体基准对比和开放步骤,读者可以据此评估多模型编排对自己编码工作流的成本与质量影响。
GitHub Copilot app 支持并行运行多个 AI 智能体会话,各会话基于独立 Git worktree 隔离运行,互不干扰且保留各自上下文。用户可在 sessions 视图中追踪进度,随时切换会话而无需重新说明背景。文中以 tailspin-toys 仓库为例,演示了同时执行新增功能、无障碍审查和运行测试三项任务。
Hugging Face 发布开源工具 funes,把本机已有的智能体会话记录建为可检索记忆,支持 Claude Code、Codex、pi 和 Hermes。它本地完成嵌入和重排,无需账号即可使用,也可绑定到私有的 Hugging Face 数据集跨机器同步。在 handoff-vs-recall 基准上,recall 比写交接文档分别便宜 8x 和 4x。
推荐理由:Hugging Face 官方开源的记忆层工具,给出了安装方式和基准对比,读者可以评估它能否复用现有编码智能体的会话记录。
Google 发布 Fairwind Program,面向政府机构、Google Cloud 客户和网络安全伙伴提供主动网络防御能力,首批接入 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具,可自主查找、验证并修复漏洞,在数分钟内生成可部署补丁。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
推荐理由:官方给出两个变体的基准数字、定价和实际应用案例,读者可以据此评估在编码与安全场景中的替换成本。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可从自然语言查询出发自主执行数据发现、清洗、特征工程、模型训练与评估的完整地理空间预测流程,将此前需数周人工数据工程的工作缩短到几分钟。
Google 在 CHI 2026 发表研究原型 AgentHands,让 AI 智能体在 Android XR 等沉浸式环境中生成与语音同步的手势,延续 Project Astra 与 Gemini 3.1 Flash Live 的方向。