DharmaOCR 实测:新模型迭出,专业化优势依旧
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 分超越更新的 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),验证了领域专业化的优势。该模型通过监督微调对齐巴西葡萄牙语的词汇与文档结构,再用 DPO 抑制重复或不连贯输出,实现最低退化率。文章指出,生成式 OCR 的可靠性取决于参数如何集中分配于单一领域,而非更大架构。
DharmaOCR 在巴西葡萄牙语 OCR 基准上以 0.925 分超越更新的 Mistral OCR4(0.798)和 Unlimited-OCR(0.7587),验证了领域专业化的优势。该模型通过监督微调对齐巴西葡萄牙语的词汇与文档结构,再用 DPO 抑制重复或不连贯输出,实现最低退化率。文章指出,生成式 OCR 的可靠性取决于参数如何集中分配于单一领域,而非更大架构。
Hugging Face 披露本周检测并处置了一次由自主 AI 智能体系统端到端驱动的生产基础设施入侵,攻击者通过恶意数据集利用两条代码执行路径获得处理节点权限,窃取部分内部数据集和多个服务凭证,经查超过 17,000 条攻击事件记录。
推荐理由:官方完整披露一次由自主智能体发起的入侵与处置过程,并给出防御方需要自托管开源模型做取证的实操教训。
IBM Research 团队撰文指出,把模型路由当作分类问题在 Agent 系统里行不通,实际是成本、质量、延迟的多目标系统优化。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数约 1T(975B,激活 41B 的 MoE),原生接收图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token,包含 BF16 和 NVFP4 权重。
推荐理由:官方博客给出架构细节、各档位 VRAM 需求和部署配置,读者可以据此评估多模态部署成本与选型。
Hume 发布 Real World VoiceEQ 基准,评估语音 AI 交互的人性化质量,覆盖 ASR、TTS、S2S 和语音理解,评测 40 多个主流闭源与开源语音模型、15+ 维度和 60 多项指标。
Hugging Face 发布 Profiling in PyTorch 系列第三篇,在 NVIDIA A100 上用 profiler 对比朴素 attention、in-place 掩码、SDPA math/efficient/flash/cuDNN 六种实现的 trace。
推荐理由:原文用 profiler 实测六种 attention 实现的内核差异,读者可以学会从 trace 里读出 inplace 省一次拷贝、SDPA 各后端的真实代价。
Hugging Face 宣布 vLLM 的 transformers modeling backend 现在对多种 LLM 架构达到与 vLLM 手写原生实现相同或更快的吞吐。
推荐理由:官方实测显示 transformers 后端在三种 Qwen3 配置上达到或超过 vLLM 原生吞吐,模型作者无需再写定制移植。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者在受支持的模型页点击 "Customize on SageMaker AI" 或 "Deploy on SageMaker AI" 即可直接进入 SageMaker Studio,模型已预加载、环境自动配置。
Microsoft 在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face models on Foundry,提供每周更新、覆盖文本、视觉、音频与多模态的开源模型精选目录,可一键部署到 Managed Compute。
SkyPilot 与 Hugging Face 联合发布 store: hf 存储后端,通过 hf:// URL 将 Hub 仓库或 Bucket 挂载进任意 SkyPilot 任务,只需现有 HF_TOKEN 即可在 20+ 云、Kubernetes 和本地集群读取数据。
推荐理由:原文给出免出口费存储与 SkyPilot 跨云挂载的具体配置和实测速度,读者可以据此评估跨云 GPU 训练的存储方案。
Hugging Face 官方博客宣布 LeRobot v0.6.0,核心是闭合机器人学习环路。新版本引入三个世界模型策略(VLA-JEPA、LingBot-VA、FastWAM)、一批新 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT),以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:官方发布说明完整列出模型、基准和工具链变化,读者可以据此评估新版本对机器人学习工作流的实际影响。
Hugging Face 官方博客总结 🤗 Kernels 项目过去几个月的重大更新。Hub 新增 kernel 仓库类型,可查看 kernel 支持的加速器。
Hugging Face 与 Cerebras 联合展示了一套实时语音到语音架构:语音输入经 Nvidia 的 Parakeet 做语音识别,由 Cerebras 上运行的 Google DeepMind Gemma 4 31B 完成推理,再用 Alibaba 的 Qwen3TTS 合成语音输出。
推荐理由:原文给出完整的开源语音到语音技术栈和各层组件,开发者可以据此搭建或替换自己的实时语音 AI 流水线。
Hugging Face 推出开源基准 ScarfBench(Self-Contained Application Refactoring Benchmark),用于评测 AI 智能体在企业级 Java 跨框架迁移任务上的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三个生态。
Google Research 推出面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习(ICL)问题,无需手动训练、超参数调优和特征工程即可在单次前向传播中生成预测。
推荐理由:原文说明了 TabFM 的架构设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其相对传统调参流程的取舍。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,支持交叉发布评测结果并回链完整 EEE 记录。
Mistral AI 发布 Voxtral Transcribe 2,含 Voxtral Mini Transcribe V2 与 Voxtral Realtime 两款语音转写模型,支持 13 种语言、说话人分离和词级时间戳。
推荐理由:官方给出两款转录模型的延迟、错误率和价格数据,并开放 Realtime 权重,读者可据此对比现有语音方案。