Google DeepMind 发布开源轻量多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数,采用 Apache 2.0 许可,将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:官方给出了参数量、内存占用和基准得分等具体指标,可帮助读者评估它是否适合端侧检索场景。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、740M 参数,采用 Apache 2.0 许可,将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:官方给出了参数量、内存占用和基准得分等具体指标,可帮助读者评估它是否适合端侧检索场景。
Microsoft 与 Hugging Face 发布 ThinkingBox 智能体沙箱和 ThinkingBox-Bench 基准,507 个有状态业务工作流、每任务运行 20 次,用可执行检查评测终端数据库状态与副作用,现已通过 OpenEnv 在 Hugging Face 开放。
推荐理由:原文用可执行的后端状态检查区分了表面成功与真实结果,还给出各模型一致性与成本数据,对评估智能体有直接参考。
Ai2 发布 Olmo-core 3,重新设计开源 MoE 训练系统,支持扩展到万亿参数规模。它从 FSDP 改为基于 DDP 的方案,47B 参数 MoE 在 8 块 NVIDIA B300 上吞吐达 52。
Hugging Face 推出 Open TTS Leaderboard,用 Qwen3 ASR 的 WER/CER、H200 上的 RTFx 和 TTFA 以及 WavLM 说话人相似度等客观指标评估开源 TTS 模型,把单模型评测时间从约两周缩短到数小时。
推荐理由:原文说明了用客观指标将 TTS 评测从数周缩到数小时的做法,以及主流竞技场对开源模型覆盖不足的结构性原因。
NVIDIA 发布开源表格基础模型 Kumo Tabular,现已上架 Hugging Face。给定带标签的表格,模型在单次前向传播中直接预测新行标签,无需训练、调参或特征工程,支持分类和回归,基于 Transformer 并采用列、行和 in-context 注意力,完全在人工生成的表格上预训练。
推荐理由:官方介绍了无需训练微调的表格基础模型的架构、预训练配方和四项基准表现,读者可评估它能否替代传统梯度提升树工作流。
Hugging Face 团队提出 ProvenanceGuard,一个针对 MCP Agent 的来源感知事实性验证层,可在生成后检查每条论断的支持来源是否与答案声明或暗示的来源一致,识别"跨来源混淆"问题。
Hugging Face 宣布 Hub 新增 RL Environments 支持,环境以带 rl-environment 标签的数据集仓库形式存在,无新仓库类型、注册表或注册流程。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下换取更快推理,解码在设备端最高加速 3.13x、H100 上最高 2.66x,端到端分别为最高 2.62x 和 2.27x。
推荐理由:原文给出视觉语言模型的投机解码加速方案、具体倍数与内存开销,并覆盖 llama.cpp、MLX-VLM、SGLang 的接入方法。
Hugging Face 宣布 transformers 支持加载 GGUF 模型,通过 from_pretrained 传入 gguf_file 即可在本机运行 Hub 上的量化检查点。
推荐理由:Hugging Face 官方给出 GGUF 在 transformers 中的用法和与 llama.cpp 的实测对比,读者可据此判断本地推理的可行路径。
oMLX 创造者与维护者 Jun Kim 加入 Hugging Face。oMLX 将从副业项目转变为获得全职维护和资金支持的项目,但继续保持 Apache 2.0 开源协议,仍由 Jun 领导。团队的重点之一是简化从 transformers 模型定义到参考 MLX 实现的转换流程,让新 transformers 模型更快在 MLX 上运行。
Hugging Face 发布 tokenizers v1 候选版,在 Apple M4 Max 上单线程编码比 v0.23 快 3 到 30 倍,八线程扩展达线性的 76%,且输出 token ID 完全一致。
推荐理由:官方详述 tokenizers v1 的性能优化手段和可复现基准,读者可以据此评估升级对训练与推理数据供给的实际收益。
Hugging Face 发布 Workflow1111,将 AUTOMATIC1111 的主要功能重建为单个 Gradio Workflow 画布,包含 11 条媒体管线、73 个节点,覆盖文生图、hi-res fix、图生图、prompt 矩阵、VLM 反推、检测生成 inpaint 蒙版、ControlNet 风格预处理器、背景去除、PNG Info 和图生视频。
Hugging Face 在 TRL v1.14 中让 AsyncGRPOTrainer 支持 LoRA 训练并仅同步几 MB 的适配器到 vLLM,借助 Storage Bucket 挂载在 trainer 与两个 vLLM replica 之间共享文件,配合一个负责加 auth 头、按 KV 前缀路由请求和广播适配器加载的代理,无需 NCCL 跨机通信。
H Company 发布 NeoMME,一个 260M 与 800M 两种规格的多语言多模态编码器,用单个双向 Transformer 同时处理文本 token 和 32×32 图像 patch,以掩码离散扩散目标从零训练,不依赖预训练视觉塔或因果语言模型。
Hugging Face 博客作者用 TRL 和 OpenEnv 开源复现 Surya Narreddi 的思路,训练 Qwen/Qwen3.5-35B-A3B 写 p5.brush 代码画水彩。
推荐理由:作者把训练配方、环境、参考池和模型全部开源,读者可以按一条命令复现整个流程并借鉴排查经验。
Hugging Face 博客发布教程,用 TRL 库以 GRPO 微调 LiquidAI/LFM2.5-350M 提升结构化输出合规性,仅约 500 样本、100 步训练即可在免费档 Colab 或 Kaggle GPU 上完成。
Hugging Face 发布开源工具 funes,把本机已有的智能体会话记录建为可检索记忆,支持 Claude Code、Codex、pi 和 Hermes。它本地完成嵌入和重排,无需账号即可使用,也可绑定到私有的 Hugging Face 数据集跨机器同步。在 handoff-vs-recall 基准上,recall 比写交接文档分别便宜 8x 和 4x。
推荐理由:Hugging Face 官方开源的记忆层工具,给出了安装方式和基准对比,读者可以评估它能否复用现有编码智能体的会话记录。
Hugging Face WebAI 团队发布 @huggingface/kernels 库,从 Hub 加载并运行 207 个经优化的 WebGPU 内核,采用 Apache-2.0 许可。
推荐理由:官方发布了 207 个 WebGPU 内核、JS 加载器和众测工具 Fleet,并给出与 ORT WebGPU 的实测对比数据。
Voice Arena 与 Hugging Face 为 Open ASR Leaderboard 发布 Monsoon 四个评测集,覆盖印度英语与印地语,印地语是该多语言榜单首个非欧洲语言。
推荐理由:原文给出 Monsoon 评测集的划分结构、说话人覆盖与区域分析示例,读者可借此理解聚合 WER 之外的模型差异来源。
Sentence Transformers v6.0 新增 MultiVectorEncoder 模型类型,这篇教程演示如何训练和微调 ColBERT 风格的多向量检索模型。
推荐理由:作者用实测数据支撑每个训练选择,读者能学到一条可在单卡上复现的多向量模型领域微调方法。
Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 应用流水线直接做成界面:用类型化节点描述步骤,提供拖拽画布,每个节点可运行、每个中间结果可见。
推荐理由:原文给出 gr.Workflow 的节点类型、REST API 与部署方式,并附多个可打开复制的 Space 示例,便于直接上手搭建 AI 流水线。
Hugging Face 撰文介绍如何用 Inference Endpoints、Jobs 和 Storage Buckets 为 Papers with Code 构建混合搜索引擎。
Hugging Face 发布研究,用一致性分歧探针、数字静默检索和拼写切换三类测试,评估 11 个开源 ASR 模型的基准优化(benchmaxxing)行为。
推荐理由:原文用三类探针量化语音识别中的基准优化现象,并给出模型名单、比例数据与可复用的检测脚本,读来能帮助避开仅看 WER 的选型误区。
LiquidAI 为 LFM2.5 系列的 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下加速推理,H100 上吞吐最高提升 3.18x,端侧最高 2.87x。
推荐理由:官方给出 DSpark 投机解码草稿模型的实测加速数据和 llama.cpp、SGLang 用法,端侧部署者可对照判断收益。
Hugging Face 官方博客宣布 Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,支持 ColBERT 式 late interaction 检索,任何 PyLate 和 Stanford-NLP ColBERT checkpoint 可直接加载,colpali-engine 模型也可用于视觉文档检索。
推荐理由:官方教程覆盖加载、评分、索引与压缩的完整链路,读者可以据此判断多向量检索是否值得引入自己的搜索栈。
Hugging Face 构建了一个约束感知 GPU 分配器,并在七个基准场景中与 FIFO 调度器对比。在相同硬件与相同负载下,GPU 利用率最多提升 33 个百分点(如 8 GPU 训练型负载从 53.6% 升至 87.0%),优先级加权产出在每个场景均上升,最高达 105%,平均 52%。核心改法是把实时推理需求按曲线逐时间步分配、批类任务按优先级跨整个调度周期放置,而非按到达顺序分配。
Hugging Face 发布覆盖 2026 年 1-8 月的开源模型生态报告,Hub 公开模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万。
推荐理由:报告用 Hub 下载、likes、衍生模型和 agent 流量数据梳理 2026 开源生态,读者可借此对比中美策略与生态位置差异。
Hugging Face 演示了 Strands Robots(AWS 开源 SDK)中的流式数据闭环:一个 Agent 用 LeRobot 格式录制机器人示范并同步到 Storage Buckets。
Hugging Face 主办的 ICML 2026 Open Reproductions 挑战中,1221 名社区成员用各自编码智能体在 19 天内发布 6816 份 Trackio logbook,复现 2226 篇论文(约占会议 34%),并用开源权重模型 GLM-5.2 逐条判定 35908 条主张。
推荐理由:官方复盘大规模复现挑战的结果数据,并给出人类在智能体科研审查中的角色判断,方法与结论可迁移到自己的研究流程。
Hugging Face 的 OlmoEarth Studio 现在支持计算并导出开源 OlmoEarth 基础模型的嵌入向量,以 Cloud-Optimized GeoTIFF(COG)格式输出。
Hugging Face 的 ALTK-Evolve 与 ACE 同为将智能体历史轨迹转化为可复用经验、推理时注入而无权重更新的代理记忆系统,两者都拒绝压缩经验,差异在交付方式。
Hugging Face 发布论文,通过缓存 teacher 的 top-100 logits 实现 offline 蒸馏,并引入 fused chunked KL 损失,避免生成全词表×序列长度的矩阵。
Meta 今日发布 30B 参数多模态开源模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地部署的隐私场景与编码、文档分析、个人助理等智能体用途。
推荐理由:原文给出架构细节、Agent 基准对比和各推理栈的 day-0 用法,读者可据此评估本地多模态部署的选择。
Baseten 正式成为 Hugging Face Hub 支持的 Inference Provider,首发支持对话与文本生成任务,可通过 Baseten 调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开源权重 LLM。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku 的 SVDQuant 4-bit 扩散模型推理,通过新的 Nunchaku Lite 路径即可用 from_pretrained() 加载预量化 checkpoint,无需本地 CUDA 编译。
推荐理由:原文给出 W4A4 量化在 Diffusers 中原生加载后的实测延迟与显存数据,读者可据此评估消费级 GPU 跑大模型的可行路径。
Pollen Robotics 在 Hugging Face 发布开源手持数据采集系统 Grabette,用手持夹爪加相机录制操作演示并自动转成 LeRobot 数据集,无需机器人或遥操作设备。
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 分超越更新的 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),验证了领域专业化的优势。该模型通过监督微调对齐巴西葡萄牙语的词汇与文档结构,再用 DPO 抑制重复或不连贯输出,实现最低退化率。文章指出,生成式 OCR 的可靠性取决于参数如何集中分配于单一领域,而非更大架构。
Hugging Face 披露本周检测并处置了一次由自主 AI 智能体系统端到端驱动的生产基础设施入侵,攻击者通过恶意数据集利用两条代码执行路径获得处理节点权限,窃取部分内部数据集和多个服务凭证,经查超过 17,000 条攻击事件记录。
推荐理由:官方完整披露一次由自主智能体发起的入侵与处置过程,并给出防御方需要自托管开源模型做取证的实操教训。
IBM Research 团队撰文指出,把模型路由当作分类问题在 Agent 系统里行不通,实际是成本、质量、延迟的多目标系统优化。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数约 1T(975B,激活 41B 的 MoE),原生接收图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token,包含 BF16 和 NVFP4 权重。
推荐理由:官方博客给出架构细节、各档位 VRAM 需求和部署配置,读者可以据此评估多模态部署成本与选型。