Amazon Bedrock 在印度推出 Claude 模型本地推理
Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5 现已通过 Amazon Bedrock 在印度区域开放。
Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5 现已通过 Amazon Bedrock 在印度区域开放。
Amazon Bedrock 现已通过 bedrock-runtime 端点支持 Claude 模型的区域内推理:首尔区域提供 Claude Opus 5 和 Claude Sonnet 5,新加坡区域提供 Claude Sonnet 5。
SK hynix 在 AI Infrastructure Insight 系列第三部分指出,电力供应与散热管理已成为 AI 数据中心从设计初期就必须考虑的核心需求。
AWS 发布 Amazon Quick 提示词工程基础教程,讲解如何通过结构化提示词让平台的 AI 功能更准确地响应自然语言请求。文章介绍核心原则——明确性、提供业务上下文、用示例示范输出格式,并给出适用于各组件的 CRISPE 通用提示词框架(含 Context、Role、Intent、Steps 等要素)。
当 AI 从试点走向生产化,仅按 token 消耗付费可能使开支难以预测。企业应根据工作负载逐项评估自有容量与消费式采购的经济平衡点,在持续需求达到足够利用率时投资可控容量,并通过运营管理让容量保持高产,从而把 AI 从开支变为资产。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上可用,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四档推理力度。
推荐理由:原文给出 Bedrock 上的接入方式、推理档位配置和成本权衡,读者可直接据此规划调用与费用。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock(通过 Global CRIS global. inference profile)和北美的 Claude Platform on AWS 开放使用。
推荐理由:AWS 官方说明 Claude Sonnet 5.5 在 Bedrock 的可用性、与 Opus 5.5 的分工建议和上手方法,便于评估是否纳入现有工作流。
AWS 在 SageMaker AI 上通过 vLLM-Omni Deep Learning Container 部署 Qwen3-TTS,实现双向流式语音输出,可在完整生成前提前播放语音。
AWS 机器学习博客教程展示在 Amazon SageMaker AI 上用同一个 vLLM-Omni DLC 部署两个端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 做图像条件视频生成。
Mistral 在慕尼黑开设新中心,设立专注 Physics AI 和工业 AI 的研究团队。自 2026 年 5 月收购 Emmi AI 后,超过 30 名物理和工程 AI 研究人员加入,目前正与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI,并与 TUM 开展汽车空气动力学数字孪生研究。
AWS 展示了基于 Amazon Nova Act 与 Amazon Bedrock AgentCore 的智能体驱动合成监控方案,用自然语言动作替代基于 DOM 选择器的传统脚本,降低 UI 变动导致的维护成本。
AWS 通过外置 adapter ID 到 AWS Systems Manager Parameter Store,实现 Amazon Textract adapter 跨账户生命周期管理,将生产环境 adapter 更新从数小时或数天的协调缩短到几秒,且零停机、无需重新部署应用。
Latent Space 播客对话 OpenRouter 联合创始人兼 CEO Alex Atallah 与 AMP 的 Anjney Midha,回顾 OpenRouter 如何从 Llama、Alpaca 等开放权重模型的早期浪潮成长为服务超 1000 万开发者、日处理超 10 万亿 token 的中立路由层,以及为何被 Stripe 收购。
AWS 提出基于 Amazon EKS、EFA 和 DeepEP 的架构,用于加速 MoE 模型的大规模强化学习后训练,吞吐量提升 40%。该方案针对 RLHF、PPO、GRPO 等工作负载,解决 rollout 生成与策略训练的资源平衡、跨数百个加速器的高吞吐通信,以及 Expert Parallelism 带来的动态 all-to-all token 路由通信开销等问题。
AWS 展示了如何在 SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。基于 VisGym SFT checkpoint,使用 GRPO 后训练将 64 个固定迷宫评测集的解题率从 43.75% 提升到 95% 以上。
AWS 团队发文详解 NarrateAI 在 Amazon Bedrock 上实现生产级 LLM 质量保障的五项技术:自适应流水线路由、跨账号多模型容灾、实时流式评估、复合评估框架和数据准确性校验。
AWS Solutions Architect 撰文演示通过 Amazon SageMaker JumpStart 部署 Qwen3-TTS-12Hz-1.7B-Base 到实时推理端点,用几秒参考音频克隆说话人声音而无需重训模型。
Datacor 将 Amazon Quick Sight 集成到其 TrackAbout 解决方案中,为工业气体与焊接分销商提供自助式租赁数据分析,无需提交 IT 工单或等待数天甚至数周的自定义报表。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取更快推理,解码在设备端最高加速 3.13x、H100 上最高 2.66x,端到端分别为最高 2.62x 和 2.27x。
推荐理由:原文给出视觉语言模型的投机解码加速方案、具体倍数与内存开销,并覆盖 llama.cpp、MLX-VLM、SGLang 的接入方法。
GitHub Copilot app 团队重建了 Pull Request 视图,使其能流畅打开一个含 2,200 个文件、超过一百万变更行和 400 多条行内评论的开源 PR。
推荐理由:作者以第一手视角拆解了超大 PR 渲染的双几何架构和自动化测量方法,思路对处理大规模动态内容界面有借鉴意义。
Microsoft Research 的研究显示,仅依赖机器人机载 GPU 运行物理 AI 推理会限制性能、续航和可扩展性,将推理卸载到边缘或云端 GPU 可显著改善。
Google Private AI Compute 团队宣布为该平台加入私密的服务端持久记忆,使 AI 助手获得跨设备长期记忆,同时保持端侧处理级别的隐私标准。
OpenAI 介绍 GPT-6 在提示词缓存方面的改进,包括更高的缓存命中率、新的诊断工具、显式断点以及相关控制选项,用于降低延迟和成本。
Simon Willison 于 9 月 22 日发布了开源 CLI 工具 llm 的 0.36 版本。原文仅包含版本发布信息,未说明具体更新内容。
Cloudflare 宣布 Python Workers 正式全量可用,Python 成为 Cloudflare Developer Platform 的一等支持语言。
NVIDIA 推出 DSX Ready 认证计划,对符合 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品进行资格认证,首批涵盖电池储能系统(BESS)和冷却液分配单元(CDU)两个类别。
NVIDIA 阐述 Physical AI(自动驾驶汽车、人形机器人与工业机器人)规模化部署必须覆盖硬件、软件、AI 行为与运行环境各层的安全体系。ABI Research 预计到 2035 年 L3-L5 自动驾驶汽车保有量达 4900 万辆,Omdia 估计 2026-2035 年将部署约 6000 万台工业机器人。
埃及在 Grand Egyptian Museum 举行 AI 生态活动,NVIDIA 高管出席,埃及 NVIDIA Deep Learning Institute 学习者一年内增长逾十倍;Hassan Allam Utilities 与 A15 计划投资约 $400 million 建设新数据中心。
NVIDIA 发文提出 AI 安全应作为工程问题对待,需要明确的安全需求、可强制执行的控制、指定负责人和防护有效的证据。
NVIDIA 在纽约气候周展示了五家将 AI 融入清洁能源项目的公司。ThinkLabs AI 用数字孪生把 Southern California Edison 的电网互联评估时间从 30-45 天缩短到两分钟。
Hugging Face 发布 tokenizers v1 候选版,在 Apple M4 Max 上单线程编码比 v0.23 快 3 到 30 倍,八线程扩展达线性的 76%,且输出 token ID 完全一致。
推荐理由:官方详述 tokenizers v1 的性能优化手段和可复现基准,读者可以据此评估升级对训练与推理数据供给的实际收益。
SK hynix 参加于 9 月 15-17 日在美国圣克拉拉举办的 AI Infra Summit 2026,以“New Spectrum”为主题展示下一代 AI 内存方案,参会人数约 6,000 人、较上年翻倍。
GitHub 作者 Stephen Toub 撰文介绍团队借助 GitHub Copilot 应用与 CLI,把 Copilot agent runtime 从 TypeScript/Node.js 完全重写为 832,378 行生产 Rust,AI 智能体完成了大部分代码,共落成 128 个 pull request,原需一两人年的项目仅由一名开发者在数月内完成。
推荐理由:作者亲历整场迁移,给出代码量、发布节奏与缓存命中率等一手数据,读者可以借此评估智能体主导大型重写的可行路径。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览提交中首次亮相,Qwen3-VL 上吞吐量最高达 GB300 NVL72 的 3.7x,DeepSeek-R1 上达 2.5x。
Emerald AI、Google 与 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),推动数据中心根据电网状况动态调整用电。该联盟坚持技术中立、按性能衡量,将统一技术要求与性能指标,为做出可验证灵活性承诺的用户提供更快的并网通道。AEMA 汇聚 AI 平台、数据中心运营商、公用事业和电网运营商等全产业链成员,共同推进美国 AI 基础设施建设。
曼彻斯特大学与 NVIDIA Earth-2 团队合作,将 Earth-2 CorrDiff 生成式降尺度模型改用于空气污染预测,并加装了可直接利用空气质量观测数据的 Earth-2 StormCast。
GitHub 日本和韩国市场营销负责人 Tomoko Tanaka 撰文介绍,她没有写代码,而是把活动运营 runbook 交给 GitHub Copilot。
OpenAI 将 Habitat 从一个 Python 库演进为全球分布式存储平台,支撑超过 10 亿 ChatGPT 用户和每秒 22M 请求的在线存储需求。
Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成到 Cloudera 混合数据平台,支持企业在私有云、公有云、本地及完全隔离(air-gapped)环境中运行推理。企业还可在受控环境中用自有专有数据训练定制模型,并保留数据与产出的智能的所有权。此次合作面向主权 AI 需求,覆盖 Cloudera 平台上 30 EB 的客户管理数据。
Hugging Face 发布 Workflow1111,将 AUTOMATIC1111 的主要功能重建为单个 Gradio Workflow 画布,包含 11 条媒体管线、73 个节点,覆盖文生图、hi-res fix、图生图、prompt 矩阵、VLM 反推、检测生成 inpaint 蒙版、ControlNet 风格预处理器、背景去除、PNG Info 和图生视频。