Falcon-Emirati-7B:让 LLM 学会阿联酋方言、文化与细微语义
Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。
Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。
电信运营商正基于开放模型构建 AI 战略,NVIDIA 最新《State of AI in Telecommunications》报告中 89% 的受访者认为开源模型和软件对其 AI 战略重要。
Ai2 开源基于 Qwen3-8B 的 AstaBrief 8B 模型和训练数据,该模型将研究问题与检索到的文献片段一次性生成带引文的报告,已在 Asta 的 Generate a report 功能中作为 Fast 模式与 Claude 驱动的 Thinking 模式并行提供。
Google 宣布推出基于可信执行环境(TEE)的下一代联邦学习系统,为数据匿名化提供可远程验证与审计的保障。访问策略发布到公开透明日志 Rekor,KMS 和数据处理二进制可由开源代码复现构建;加密训练数据仅在 TEE 内解密处理,工作负载操作者只能看到指标和差分隐私模型权重。
ServiceNow CoreAI 推出 AutoSynthData,利用目标模型在环境中的失败案例和更强 teacher 的成功轨迹,自动生成可执行、真实且具难度的训练任务,用于企业智能体的后训练。每个任务由系统规范、用户提示词和 verifier 组成,需满足可行性、真实性和难度三项要求。团队用 EnterpriseOps Gym 的公开数据集演示了该流程,并随模型改进动态调整课程。
NVIDIA AI 工厂的回报取决于三个相互关联的因素:收益能力、使用寿命和需求。据 SemiAnalysis AgentX 数据,NVIDIA Vera Rubin NVL72 比 GB300 NVL72 每兆瓦吞吐量高逾 30x,在 DeepSeek V4 Pro 模型上每百万 token 成本低至 45x。
SK hynix 于美国加州 Santa Clara 举行的 TSMC OIP 大会上展示下一代内存产品组合,并连续第二年获得 Partner of the Year 奖(3DFabric-HBM Integration 类别)。
AWS 提出基于 Amazon EKS、EFA 和 DeepEP 的架构,用于加速 MoE 模型的大规模强化学习后训练,吞吐量提升 40%。该方案针对 RLHF、PPO、GRPO 等工作负载,解决 rollout 生成与策略训练的资源平衡、跨数百个加速器的高吞吐通信,以及 Expert Parallelism 带来的动态 all-to-all token 路由通信开销等问题。
曼彻斯特大学与 NVIDIA Earth-2 团队合作,将 Earth-2 CorrDiff 生成式降尺度模型改用于空气污染预测,并加装了可直接利用空气质量观测数据的 Earth-2 StormCast。
Google Research 在 ACL 2026 提出 ToolGrad,一种“答案优先”的工具调用数据集生成方法:先构建真实工具调用链,再用文本“梯度”迭代提出、执行、选择和更新 API 工作流。
OpenAI 推出 ChatGPT Work 中的 Data agent,支持用自然语言连接公司数据、挖掘洞察并构建交互式仪表盘。该功能以 AI 方式帮助用户将数据投入实际使用。
Hugging Face 博客作者用 TRL 和 OpenEnv 开源复现 Surya Narreddi 的思路,训练 Qwen/Qwen3.5-35B-A3B 写 p5.brush 代码画水彩。
推荐理由:作者把训练配方、环境、参考池和模型全部开源,读者可以按一条命令复现整个流程并借鉴排查经验。
Hugging Face 博客发布教程,用 TRL 库以 GRPO 微调 LiquidAI/LFM2.5-350M 提升结构化输出合规性,仅约 500 样本、100 步训练即可在免费档 Colab 或 Kaggle GPU 上完成。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可从自然语言查询出发自主执行数据发现、清洗、特征工程、模型训练与评估的完整地理空间预测流程,将此前需数周人工数据工程的工作缩短到几分钟。
Google 推出自监督基础模型 GlucoFM,采用双流设计将缓慢血糖基线趋势与短期偏离分开处理。在四个队列、七项临床预测任务共 14 项评估中,其平均 PR-AUC 比最强基线 CGM 基线从 54.7 提升至 58.8,在全部糖尿病风险和 beta 细胞功能障碍评估中领先,并在餐后血糖响应预测上取得最低 MAE。
IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密解码器模型,基于 Granite 4.1 基座(从头在约 15T token 上预训练,五阶段策略将上下文扩展至 512K),经 SFT 与多阶段 GRPO 强化学习后训练,全部以 Apache 2.0 许可开源。
推荐理由:官方完整披露从预训练、SFT 到多阶段 GRPO 和智能体 RL 的训练细节,可迁移到类似模型的构建流程。
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 结构压缩至 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复后的 bfloat16 检查点蒸馏。
Hugging Face 发布论文,通过缓存 teacher 的 top-100 logits 实现 offline 蒸馏,并引入 fused chunked KL 损失,避免生成全词表×序列长度的矩阵。
Berkeley AI Research 提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为智能体的工作上下文,并引入 belief grading 监督摘要内容。在 CollabBench 协作编程测试中,ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,峰值上下文 token 长度也显著低于全上下文设置。
Google Research 发布 SensorFM,一种直接从无标注可穿戴数据预训练的 Large Sensor Foundation Model,训练数据来自 500 万名同意参与研究的用户、超一万亿分钟的多模态传感器信号,覆盖 100 多个国家和 20 多款 Fitbit 与 Pixel Watch 设备。
Hugging Face 详解 PRX 图像生成模型的数据管道:混合公开与内部数据集做预训练,用 VLM 重新生成长描述文本,再转成可流式训练语料。文本编码器已换为 Qwen3-VL 并改为训练时在线计算 text latents,吞吐仅损失约 3–4%。图像统一以 JPEG quality 92 编码,数据用 Lance 构建、以 MDS(Mosaic Streaming)流式供训练。
Dharma AI 撰文解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》。
Google 发布基于 Farmscapes 2020 的矢量化数据集,将英格兰超过 130,000 km² 高分辨率栅格地图转化为可操作的树篱、石墙与树丛清单,帮助土地所有者在不妨碍粮食安全的情况下扩展森林栖息地。
Google Research 在 AISTATS 2026 上提出 Regularized f-Divergence Kernel Tests,用于更敏感、灵活地审计机器遗忘(machine unlearning)。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象水文机构能把 AI 洪水预报整合进自己的工作流。
Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé 用 Google DeepMind 的 Co-Scientist 连接衰老生物学领域分散的研究发现,生成值得验证的假设。
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将大模型训练拆分为异步通信的计算“孤岛”,隔离硬件故障并大幅降低带宽需求。
Google Research 在 TMLR 发表论文,推出推理优先的合成数据生成框架 Simula,以机制设计思路将数据生成拆解为全局多样性、局部多样性、复杂化和双评论员质量检查四个可控轴,无需种子数据。
Google Research 发布 ConvApparel 数据集,包含超过 4,000 段、近 15,000 轮的人类-AI 多轮对话,用于量化 LLM 用户模拟器的“真实感差距”。
Google Research 在论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》中研究 AI 评测中每条数据标注数与标注条目数的权衡,并开源了基于真实数据集的模拟器。
Mistral AI 发布 Forge,供企业基于内部文档、代码库和业务数据训练前沿级模型,使模型理解内部术语、工作流程与合规要求。Forge 支持预训练、后训练和强化学习,兼容 dense 与 MoE 架构及多模态输入,并内置数据管道与 Mistral AI 训练方法,支持持续评估与迭代。ASML、Ericsson、欧洲航天局等机构已与 Mistral AI 合作训练专有模型。
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报道中提取结构化灾害记录,构建覆盖 150 多个国家、2000 年至今的 260 万条城市山洪事件开放数据集。
推荐理由:原文给出了用 Gemini 从新闻中提取灾害数据的完整方法和验证数字,读者可以据此评估其研究价值。
Berkeley AI Research 在 NeurIPS 2025 论文中提出直接基于信息内容评估和优化成像系统的框架,用互信息指标统一分辨率、噪声等因素。该方法仅需噪声测量数据和噪声模型即可估计信息量,并提供真实信息的上界。在彩色摄影、射电天文、无透镜成像和显微成像四个领域,该指标能预测解码器性能,优化结果匹配 SOTA 端到端方法,同时内存、计算量更低且无需任务专用解码器。
Berkeley AI Research 提出一种基于分而治之(divide and conquer)的 off-policy RL 价值学习算法,不再使用时间差分(TD)学习,后者因 Bellman 递归误差累积难以扩展到长时程任务。
Berkeley AI Research 提出 word2vec 学习过程的定量理论:在若干温和近似下,其学习问题可归约为无加权最小二乘矩阵分解,梯度流动力学有闭式解,最终嵌入等价于对目标矩阵 M* 做 PCA。