NVIDIA 发布 Cosmos-H-Dreams 实时生成式手术机器人仿真器
NVIDIA 发布 Cosmos-H-Dreams,一个实时、动作条件驱动的手术机器人生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果、少步数的学生模型,并通过 FlashDreams 流式推理库在单张 NVIDIA RTX PRO 6000 上达到约 160 帧每秒的交互速度,支持人或策略以闭环方式控制。
NVIDIA 发布 Cosmos-H-Dreams,一个实时、动作条件驱动的手术机器人生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果、少步数的学生模型,并通过 FlashDreams 流式推理库在单张 NVIDIA RTX PRO 6000 上达到约 160 帧每秒的交互速度,支持人或策略以闭环方式控制。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku 的 SVDQuant 4-bit 扩散模型推理,通过新的 Nunchaku Lite 路径即可用 from_pretrained() 加载预量化 checkpoint,无需本地 CUDA 编译。
推荐理由:原文给出 W4A4 量化在 Diffusers 中原生加载后的实测延迟与显存数据,读者可据此评估消费级 GPU 跑大模型的可行路径。
Pollen Robotics 在 Hugging Face 发布开源手持数据采集系统 Grabette,用手持夹爪加相机录制操作演示并自动转成 LeRobot 数据集,无需机器人或遥操作设备。
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 分超越更新的 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),验证了领域专业化的优势。该模型通过监督微调对齐巴西葡萄牙语的词汇与文档结构,再用 DPO 抑制重复或不连贯输出,实现最低退化率。文章指出,生成式 OCR 的可靠性取决于参数如何集中分配于单一领域,而非更大架构。
Hugging Face 披露本周检测并处置了一次由自主 AI 智能体系统端到端驱动的生产基础设施入侵,攻击者通过恶意数据集利用两条代码执行路径获得处理节点权限,窃取部分内部数据集和多个服务凭证,经查超过 17,000 条攻击事件记录。
推荐理由:官方完整披露一次由自主智能体发起的入侵与处置过程,并给出防御方需要自托管开源模型做取证的实操教训。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数约 1T(975B,激活 41B 的 MoE),原生接收图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token,包含 BF16 和 NVFP4 权重。
推荐理由:官方博客给出架构细节、各档位 VRAM 需求和部署配置,读者可以据此评估多模态部署成本与选型。
Hugging Face 宣布 vLLM 的 transformers modeling backend 现在对多种 LLM 架构达到与 vLLM 手写原生实现相同或更快的吞吐。
推荐理由:官方实测显示 transformers 后端在三种 Qwen3 配置上达到或超过 vLLM 原生吞吐,模型作者无需再写定制移植。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者在受支持的模型页点击 "Customize on SageMaker AI" 或 "Deploy on SageMaker AI" 即可直接进入 SageMaker Studio,模型已预加载、环境自动配置。
Microsoft 在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face models on Foundry,提供每周更新、覆盖文本、视觉、音频与多模态的开源模型精选目录,可一键部署到 Managed Compute。
SkyPilot 与 Hugging Face 联合发布 store: hf 存储后端,通过 hf:// URL 将 Hub 仓库或 Bucket 挂载进任意 SkyPilot 任务,只需现有 HF_TOKEN 即可在 20+ 云、Kubernetes 和本地集群读取数据。
推荐理由:原文给出免出口费存储与 SkyPilot 跨云挂载的具体配置和实测速度,读者可以据此评估跨云 GPU 训练的存储方案。
Hugging Face 官方博客宣布 LeRobot v0.6.0,核心是闭合机器人学习环路。新版本引入三个世界模型策略(VLA-JEPA、LingBot-VA、FastWAM)、一批新 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT),以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:官方发布说明完整列出模型、基准和工具链变化,读者可以据此评估新版本对机器人学习工作流的实际影响。
Hugging Face 官方博客总结 🤗 Kernels 项目过去几个月的重大更新。Hub 新增 kernel 仓库类型,可查看 kernel 支持的加速器。
Berkeley AI Research(BAIR)实验室发布 2026 届博士毕业生巡礼,介绍 Baifeng Shi、Charlie Snell、Hanlin Zhu 等毕业生在机器人与具身智能、LLM 推理与 test-time scaling、生成模型、AI 安全与人机交互、语音与医疗 AI 等方向的研究成果。
Hugging Face 与 Cerebras 联合展示了一套实时语音到语音架构:语音输入经 Nvidia 的 Parakeet 做语音识别,由 Cerebras 上运行的 Google DeepMind Gemma 4 31B 完成推理,再用 Alibaba 的 Qwen3TTS 合成语音输出。
推荐理由:原文给出完整的开源语音到语音技术栈和各层组件,开发者可以据此搭建或替换自己的实时语音 AI 流水线。
Google Research 推出面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习(ICL)问题,无需手动训练、超参数调优和特征工程即可在单次前向传播中生成预测。
推荐理由:原文说明了 TabFM 的架构设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其相对传统调参流程的取舍。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,支持交叉发布评测结果并回链完整 EEE 记录。
Google DeepMind 发布开源实验模型 DiffusionGemma,基于文本扩散方法生成整块文本,在专用 GPU 上推理速度最高达 4x(单张 NVIDIA H100 超 1000 tokens/秒,RTX 5090 超 700 tokens/秒)。
推荐理由:官方明确了 4x 提速的具体硬件数字和输出质量取舍,读者可以据此判断它适不适合本地低并发场景。
Google DeepMind 发布 Gemma 4 12B,一款统一、无编码器的多模态模型,视觉和音频输入直接进入 LLM backbone,定位介于 E4B 与 26B MoE 之间。
推荐理由:原文给出无编码器架构、16GB 内存可跑和 Apache 2.0 开源等具体变化,读者可据此评估端侧部署选择。
Mistral AI 发布开源框架 Search Toolkit 公共预览版,用于为 AI 应用搭建生产级搜索管线,将摄取、检索和评估统一到一个共享接口的框架中。
推荐理由:原文给出模块构成、评估指标和企业案例细节,可以判断它是否适合替换现有检索基础设施。
Google Research 阐述其开放科学实践:十年间开源的 DeepVariant、Neuroglancer、NeuralGCM、SpeciesNet 及 HAI-DEF(含 MedGemma)等工具与数据集,已服务全球超 250,000 名研究者和开发者。
Google Research 发布 ICLR 论文 ReasoningBank,提出从智能体的成功与失败经验中蒸馏高层推理记忆的框架,区别于只记录轨迹或仅总结成功流程的 Synapse 和 AWM。
Google Research 提出 MoGen 神经元形态生成模型,基于 PointInfinity 点云 flow matching,用 1,795 条经人工验证的小鼠轴突训练生成合成神经形状,扩充 PATHFINDER 重建模型训练数据。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,参数量 4B,支持英语、法语、德语等 9 种语言,定位低延迟语音生成。模型在人工评测中自然度超过 ElevenLabs Flash v2.5,与 ElevenLabs v3 质量相当;10 秒样本加 500 字符的模型延迟为 70ms,RTF 约 9.7x。
推荐理由:原文给出延迟、价格、人评对比和开源许可等关键细节,方便读者评估它在语音 Agent 场景中的可用性。
Mistral AI 发布 Mistral Small 4,是首个将 Magistral 推理、Pixtral 多模态、Devstral 智能体编码能力统一到单一模型的小型模型,采用 Apache 2.0 许可开源。
推荐理由:官方发布正文给出了完整的架构参数、基准对比和部署要求,读者可据此评估其替代多模型组合的可行性。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,计划与 NVIDIA 联合开发开源前沿模型,结合其模型架构和全栈 AI 平台与 NVIDIA 的算力、开发工具和合成数据生成管线。
Mistral 发布首个面向 Lean 4 的开源代码智能体 Leanstral-120B-A6B(6B 激活参数),权重采用 Apache 2.0 许可,可通过 Mistral Vibe 和 labs-leanstral-2603 免费 API 端点使用。
Mistral AI 构建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试并在 CI/CD 流水线中无人值守运行。智能体基于 Mistral 开源编码助手 Vibe,通过仓库级 AGENTS.md、按文件类型划分的技能文件和 RuboCop、SimpleCov 自定义工具实现。
Mistral AI 发布开源编码模型家族 Devstral 2,包含 123B 的 Devstral 2(modified MIT 许可)和 24B 的 Devstral Small 2(Apache 2.0),两者均支持 256K 上下文窗口,分别在 SWE-bench Verified 上取得 72.2% 和 68.0%。
推荐理由:官方公布了两个尺寸编码模型的开源协议、SWE-bench Verified 成绩、API 定价和硬件要求,可据此评估本地或端侧部署的可行性。
Mistral 发布新一代模型系列 Mistral 3,包括 MoE 架构的 Mistral Large 3(41B 激活、675B 总参数)以及 3B、8B、14B 三个尺寸的 Ministral 3 模型,全部以 Apache 2.0 协议开源。
推荐理由:官方公告完整列出了模型规格、开源协议、部署方式与可用平台,读者可据此评估在自有环境落地的可行性。
Mistral AI 宣布与德国企业和机构达成长期战略合作:与 SAP 合作在 SAP AI Foundation 中集成其模型,为德国和欧洲提供全主权 AI 技术栈并共同开发面向复杂行业和行政机构的解决方案;与 Helsing 加速开发面向国防和安全实际应用的视觉-语言-动作模型。
Mistral 发布开源语音理解模型 Voxtral,含 24B 的 Voxtral Small 和 3B 的 Voxtral Mini,均采用 Apache 2.0 许可证并可通过其 API 调用,价格低至每分钟 $0.001。
推荐理由:官方公布了两个尺寸的开源语音理解模型、基准成绩和 API 价格,读者可据此评估其替代现有 ASR 方案的可行性。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:官方给出了两个新模型的 SWE-Bench Verified 成绩、定价和许可方式,开发者可以据此评估代码智能体选型。
Mistral AI 宣布推出 AI for Citizens 协作计划,帮助各国政府和公共机构战略性应用 AI、改造公共服务并保障数据主权。该计划基于开放、协作、选择与自主原则,提供从顶级模型到聊天和编程助手的产品组合,支持自托管、Mistral AI 及本地伙伴运营的 AI 数据中心或 SaaS/API 部署,并可定制模型联合训练与垂直化。
Mistral AI 发布其首个推理模型 Magistral,分开源的 Magistral Small(24B,Apache 2.0)与企业版 Magistral Medium 两个版本。
推荐理由:官方同时开源与商用双版本,给出 AIME2024 分数、开源许可和部署渠道,读者可据此评估选型。
Mistral AI 与 All Hands AI 合作推出面向软件工程任务的智能体大语言模型 Devstral,以 Apache 2.0 许可开源发布。
推荐理由:官方发布了模型权重和 API 定价,并给出 SWE-Bench Verified 的具体成绩与部署门槛,读者可以据此评估本地或企业编码场景的适配性。
Mistral AI 发布 Mistral Medium 3,定位 SOTA 性能、成本降低 8 倍的新级别模型。基准上达到或超过 Claude Sonnet 3.7 的 90%,定价为 $0.4 输入 / $2 输出每 M token,超越 Llama 4 Maverick 和 Cohere Command A,可在 4 张 GPU 以上环境自部署。
推荐理由:官方给出与 Claude Sonnet 3.7 的基准对比、定价和部署门槛,读者可据此评估企业落地的性价比。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上改进文本性能、增加多模态理解,上下文窗口扩至 128k tokens,推理速度达 150 tokens 每秒。
推荐理由:原文来自官方发布,给出基准对比、开源协议和硬件要求,读者可以据此评估它在轻量部署场景的可用性。