AMD 与 Cerebras 合作推出超低延迟高吞吐 AI 推理解耦方案
AMD 与 Cerebras 于 2026 年 7 月 23 日在 Advancing AI 2026 上宣布技术合作,将 AMD Helios 机架级方案与 Cerebras Wafer-Scale Engine 整合为单一解耦推理工作流。
AMD 与 Cerebras 于 2026 年 7 月 23 日在 Advancing AI 2026 上宣布技术合作,将 AMD Helios 机架级方案与 Cerebras Wafer-Scale Engine 整合为单一解耦推理工作流。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku 的 SVDQuant 4-bit 扩散模型推理,通过新的 Nunchaku Lite 路径即可用 from_pretrained() 加载预量化 checkpoint,无需本地 CUDA 编译。
推荐理由:原文给出 W4A4 量化在 Diffusers 中原生加载后的实测延迟与显存数据,读者可据此评估消费级 GPU 跑大模型的可行路径。
Google Research 发布 SymptomAI 研究论文,用五个基于 Gemini Flash 2.0 的对话原型智能体对 13,917 名参与者做端到端症状问诊和鉴别诊断(DDx),用于研究基准测试。
推荐理由:基于 13,917 人的随机真实人群研究,给出了 SymptomAI 鉴别诊断相对临床医生基线的表现和可迁移的问诊策略比较。
Google Research 在 Nature 发表基于强化学习的量子纠错控制框架,让智能体利用错误检测事件持续调节数千个控制参数,在计算进行中对抗漂移。在 Willow 超导处理器上注入人为漂移的实验中,RL 控制使逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%。
Google 在 DOE Genesis Mission Summit 2026 上宣布投入 4000 万美元的 AI tokens 和云资源,支持美国能源部 Genesis Mission。
AMD 与 Anthropic 宣布战略合作,Anthropic 将在 AMD Helios 机架级方案中部署至多 2GW 的 AMD Instinct MI450 系列 GPU(含 MI455X,搭配 EPYC "Venice" CPU、Pensando 网络与 ROCm),首个 1GW 于 2027 年上半年开始部署。
推荐理由:官方公告给出了部署规模、时间表和股权投资金额,读者可以据此了解双方合作的完整结构。
Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上输出 token 用量比 3.5 Flash 减少 17%,定价 $1.50/1M 输入、$7.50/1M 输出,DeepSWE 49% vs 37%、OSWorld-Verified 83.0% vs 78.4%。
推荐理由:官方原文给出三款新模型的具体价格、token 效率与多项基准数字,并说明各模型面向的部署场景。
Pollen Robotics 在 Hugging Face 发布开源手持数据采集系统 Grabette,用手持夹爪加相机录制操作演示并自动转成 LeRobot 数据集,无需机器人或遥操作设备。
Arista Networks 发布面向 VeloCloud SD-WAN 的 AI 驱动边缘威胁管理(ETM),为企业分支提供一体化零信任安全,将多台独立设备整合为单一 SD-WAN 边缘平台。
AMD 宣布与 Microsoft 扩大长期战略合作,Microsoft 将在 Azure 上大规模部署 AMD Helios Rackscale Solution,用于前沿模型推理、自身 AI 客户及 Azure AI 服务。
推荐理由:官方公告给出合作的具体载体和产品构成,读者可以据此了解双方在 AI 基础设施层面的分工与落地节奏。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证和修补漏洞。
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 分超越更新的 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),验证了领域专业化的优势。该模型通过监督微调对齐巴西葡萄牙语的词汇与文档结构,再用 DPO 抑制重复或不连贯输出,实现最低退化率。文章指出,生成式 OCR 的可靠性取决于参数如何集中分配于单一领域,而非更大架构。
Google DeepMind 与 Isomorphic Labs 发布联合生物韧性方案,目标是防止模型被滥用,并让政府和科学家利用 AI 提升疫情应对能力。
Hugging Face 披露本周检测并处置了一次由自主 AI 智能体系统端到端驱动的生产基础设施入侵,攻击者通过恶意数据集利用两条代码执行路径获得处理节点权限,窃取部分内部数据集和多个服务凭证,经查超过 17,000 条攻击事件记录。
推荐理由:官方完整披露一次由自主智能体发起的入侵与处置过程,并给出防御方需要自托管开源模型做取证的实操教训。
Google Research 在 ICLR 2026 发表的论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》指出。
IBM Research 团队撰文指出,把模型路由当作分类问题在 Agent 系统里行不通,实际是成本、质量、延迟的多目标系统优化。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数约 1T(975B,激活 41B 的 MoE),原生接收图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token,包含 BF16 和 NVFP4 权重。
推荐理由:官方博客给出架构细节、各档位 VRAM 需求和部署配置,读者可以据此评估多模态部署成本与选型。
Hume 发布 Real World VoiceEQ 基准,评估语音 AI 交互的人性化质量,覆盖 ASR、TTS、S2S 和语音理解,评测 40 多个主流闭源与开源语音模型、15+ 维度和 60 多项指标。
Google DeepMind 与 Atal Innovation Mission 合作推出 Gemini 驱动的网页应用 ATL Saathi 的试点,为 Tinkering Lab 教师提供 24/7 规划与培训助手,首期覆盖 100 所试点学校。
Hugging Face 发布 Profiling in PyTorch 系列第三篇,在 NVIDIA A100 上用 profiler 对比朴素 attention、in-place 掩码、SDPA math/efficient/flash/cuDNN 六种实现的 trace。
推荐理由:原文用 profiler 实测六种 attention 实现的内核差异,读者可以学会从 trace 里读出 inplace 省一次拷贝、SDPA 各后端的真实代价。
Mistral 推出 Studio,为企业 Prompt 和 Skills 提供统一的系统记录,实现版本化、明确归属与可追溯。
Google Research 发布 SensorFM,一种直接从无标注可穿戴数据预训练的 Large Sensor Foundation Model,训练数据来自 500 万名同意参与研究的用户、超一万亿分钟的多模态传感器信号,覆盖 100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
Mistral 发布首个具身导航模型 Robostral Navigate,为 8B 参数、完全自研并基于仿真数据训练,仅用单个普通 RGB 相机、无 LiDAR 或深度传感器即可根据自然语言指令导航。
Hugging Face 宣布 vLLM 的 transformers modeling backend 现在对多种 LLM 架构达到与 vLLM 手写原生实现相同或更快的吞吐。
推荐理由:官方实测显示 transformers 后端在三种 Qwen3 配置上达到或超过 vLLM 原生吞吐,模型作者无需再写定制移植。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者在受支持的模型页点击 "Customize on SageMaker AI" 或 "Deploy on SageMaker AI" 即可直接进入 SageMaker Studio,模型已预加载、环境自动配置。
Google Research 在 Nature Cities 发表大规模真实世界研究,通过修改 Google Maps 算法在 10 个美国城市引导少于 2% 的行程绕开拥堵路段,实验持续六个月并采用城市级 switchback 设计。
Microsoft 在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face models on Foundry,提供每周更新、覆盖文本、视觉、音频与多模态的开源模型精选目录,可一键部署到 Managed Compute。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,随着推理价格每年下降 9x 到 900x(中位数约 50x),GPT-4 级能力成本已从 2023 年初的约 $30 per million tokens 降至 $1 以下。
SkyPilot 与 Hugging Face 联合发布 store: hf 存储后端,通过 hf:// URL 将 Hub 仓库或 Bucket 挂载进任意 SkyPilot 任务,只需现有 HF_TOKEN 即可在 20+ 云、Kubernetes 和本地集群读取数据。
推荐理由:原文给出免出口费存储与 SkyPilot 跨云挂载的具体配置和实测速度,读者可以据此评估跨云 GPU 训练的存储方案。
Hugging Face 官方博客宣布 LeRobot v0.6.0,核心是闭合机器人学习环路。新版本引入三个世界模型策略(VLA-JEPA、LingBot-VA、FastWAM)、一批新 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT),以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:官方发布说明完整列出模型、基准和工具链变化,读者可以据此评估新版本对机器人学习工作流的实际影响。
Arista Networks 宣布将于 8 月 4 日(周二)发布 2026 年第二季度财务业绩。原文正文因页面加载问题未能显示具体细节。
Hugging Face 详解 PRX 图像生成模型的数据管道:混合公开与内部数据集做预训练,用 VLM 重新生成长描述文本,再转成可流式训练语料。文本编码器已换为 Qwen3-VL 并改为训练时在线计算 text latents,吞吐仅损失约 3–4%。图像统一以 JPEG quality 92 编码,数据用 Lance 构建、以 MDS(Mosaic Streaming)流式供训练。
Hugging Face 官方博客总结 🤗 Kernels 项目过去几个月的重大更新。Hub 新增 kernel 仓库类型,可查看 kernel 支持的加速器。
Google DeepMind 与 A24 宣布建立首个此类的研究型合作,将前沿 AI 研究实验室与电影公司配对,帮助艺术家开发新的工作流程与技术。双方将围绕多个项目开展长期研发协作,A24 的电影创作者可参与塑造新技术,Google DeepMind 则获得一线艺术家的反馈指导。此外,Google 已对 A24 进行投资,合作的具体目标和技术产出将随时间演进。
Mistral 发布 Apache-2.0 开源模型 Leanstral 1.5,119B 总参数、6B 激活参数,通过 mid-training、监督微调和 CISPO 强化学习训练。
推荐理由:官方披露了完整训练流程、基准数字和真实代码验证案例,读者可以据此评估形式化验证模型在数学证明和开源查错上的实用程度。
Berkeley AI Research(BAIR)实验室发布 2026 届博士毕业生巡礼,介绍 Baifeng Shi、Charlie Snell、Hanlin Zhu 等毕业生在机器人与具身智能、LLM 推理与 test-time scaling、生成模型、AI 安全与人机交互、语音与医疗 AI 等方向的研究成果。
Hugging Face 与 Cerebras 联合展示了一套实时语音到语音架构:语音输入经 Nvidia 的 Parakeet 做语音识别,由 Cerebras 上运行的 Google DeepMind Gemma 4 31B 完成推理,再用 Alibaba 的 Qwen3TTS 合成语音输出。
推荐理由:原文给出完整的开源语音到语音技术栈和各层组件,开发者可以据此搭建或替换自己的实时语音 AI 流水线。
Hugging Face 推出开源基准 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评测 AI 智能体在企业级 Java 跨框架迁移任务上的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三个生态。
Google Research 发布覆盖 50+ 城市、9 个国家的建筑级屋顶反照率数据集,通过新的 Heat Resilience Earth Engine App 开放访问,帮助城市规划者实施冷屋顶方案。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为家族中最快最省的图像模型。
推荐理由:原文给出两款模型的速度、价格与可用入口,还说明了各自定位和 API 限制,便于开发者评估是否替换现有工作流。