Falcon-Emirati-7B:让 LLM 学会阿联酋方言、文化与细微语义
Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。
Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。
Musubi 于周二发布面向实时内容审核的轻量级决策模型 PolicyLM-1.7B,以开放权重开源。该模型可将英文撰写的内容政策应用于消息,耗时低于 50 毫秒,成本和速度接近多数社交平台使用的 AI 分类器,且政策变更时无需重新训练。决策模型因 9 月 TypeSafe AI 发布 Jev 而成为热门方向,OpenAI 和 Amazon 也随后推出了竞品。
Ai2 开源基于 Qwen3-8B 的 AstaBrief 8B 模型和训练数据,该模型将研究问题与检索到的文献片段一次性生成带引文的报告,已在 Asta 的 Generate a report 功能中作为 Fast 模式与 Claude 驱动的 Thinking 模式并行提供。
Microsoft Research 的逆合成模型 RetroChimera 在期刊 Nature 发表,并开源了实现与权重。该模型组合基于 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 两个子模型,用学习到的重排序策略融合各自预测,覆盖常见与罕见反应类型。
Mistral 发布 Apache-2.0 开源模型 Leanstral 1.5,119B 总参数、6B 激活参数,通过 mid-training、监督微调和 CISPO 强化学习训练。
推荐理由:官方披露了完整训练流程、基准数字和真实代码验证案例,读者可以据此评估形式化验证模型在数学证明和开源查错上的实用程度。