Falcon-Emirati-7B:让 LLM 学会阿联酋方言、文化与细微语义
Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。
Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。
Ai2 开源基于 Qwen3-8B 的 AstaBrief 8B 模型和训练数据,该模型将研究问题与检索到的文献片段一次性生成带引文的报告,已在 Asta 的 Generate a report 功能中作为 Fast 模式与 Claude 驱动的 Thinking 模式并行提供。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放发布超过2800种病毒的蛋白质复合物预测3D结构,其中约30%的蛋白相互作用是科学界此前未记录的。
Microsoft Research 的逆合成模型 RetroChimera 在期刊 Nature 发表,并开源了实现与权重。该模型组合基于 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 两个子模型,用学习到的重排序策略融合各自预测,覆盖常见与罕见反应类型。
Hugging Face 发布 tokenizers v1 候选版,在 Apple M4 Max 上单线程编码比 v0.23 快 3 到 30 倍,八线程扩展达线性的 76%,且输出 token ID 完全一致。
推荐理由:官方详述 tokenizers v1 的性能优化手段和可复现基准,读者可以据此评估升级对训练与推理数据供给的实际收益。
Hugging Face 发布开源工具 funes,把本机已有的智能体会话记录建为可检索记忆,支持 Claude Code、Codex、pi 和 Hermes。它本地完成嵌入和重排,无需账号即可使用,也可绑定到私有的 Hugging Face 数据集跨机器同步。在 handoff-vs-recall 基准上,recall 比写交接文档分别便宜 8x 和 4x。
推荐理由:Hugging Face 官方开源的记忆层工具,给出了安装方式和基准对比,读者可以评估它能否复用现有编码智能体的会话记录。
Hugging Face 推出 BenchMIRT,一种基于多维 IRT 的方法,可在单条 prompt 层面审计 LLM benchmark 实际测量的能力。
Mistral 发布 Apache-2.0 开源模型 Leanstral 1.5,119B 总参数、6B 激活参数,通过 mid-training、监督微调和 CISPO 强化学习训练。
推荐理由:官方披露了完整训练流程、基准数字和真实代码验证案例,读者可以据此评估形式化验证模型在数学证明和开源查错上的实用程度。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象水文机构能把 AI 洪水预报整合进自己的工作流。
Google Research 阐述其开放科学实践:十年间开源的 DeepVariant、Neuroglancer、NeuralGCM、SpeciesNet 及 HAI-DEF(含 MedGemma)等工具与数据集,已服务全球超 250,000 名研究者和开发者。