跳到正文

#数据/训练

今日 3 条
今天10月7日周三
  1. Hugging Face Blog43

    Falcon-Emirati-7B:让 LLM 学会阿联酋方言、文化与细微语义

    Hugging Face 联合发布方推出 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专门理解与生成阿联酋阿拉伯语方言。模型采用 Mamba 与 Transformer 注意力并行的混合架构,结合阿联酋方言网页数据、阿联酋文化的 MSA 数据和受词典与风格规则约束的合成数据进行训练,上下文窗口最高支持 128K/256K tokens。

10月2日周五
  1. Google Research51

    Google 发布基于 TEE 的下一代联邦学习系统,Gboard 已率先部署

    Google 宣布推出基于可信执行环境(TEE)的下一代联邦学习系统,为数据匿名化提供可远程验证与审计的保障。访问策略发布到公开透明日志 Rekor,KMS 和数据处理二进制可由开源代码复现构建;加密训练数据仅在 TEE 内解密处理,工作负载操作者只能看到指标和差分隐私模型权重。

  2. Hugging Face Blog39

    AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 推出 AutoSynthData,利用目标模型在环境中的失败案例和更强 teacher 的成功轨迹,自动生成可执行、真实且具难度的训练任务,用于企业智能体的后训练。每个任务由系统规范、用户提示词和 verifier 组成,需满足可行性、真实性和难度三项要求。团队用 EnterpriseOps Gym 的公开数据集演示了该流程,并随模型改进动态调整课程。

10月1日周四
  1. The Decoder78

    Meta 将 AI 数据中心归类为试验模型,2025 年省税 39 亿美元

    Meta 将 AI 数据中心归类为“试验模型”、Nvidia 芯片列为实验材料,借助联邦研发税收抵免在 2025 年省下 39 亿美元,高于前一年的 20 亿和 2023 年的 7 亿,成为上市公司中该抵免的最大受益者。

    推荐理由:原文给出具体免税金额变化和SEC风险披露,读者可据此了解AI基建投资如何借助1981年研发税收抵免变现。

9月28日周一
9月26日周六
  1. AWS Machine Learning Blog31

    AWS 如何基于 Amazon EKS、EFA 与 DeepEP 扩展 MoE 强化学习,吞吐提升 40%

    AWS 提出基于 Amazon EKS、EFA 和 DeepEP 的架构,用于加速 MoE 模型的大规模强化学习后训练,吞吐量提升 40%。该方案针对 RLHF、PPO、GRPO 等工作负载,解决 rollout 生成与策略训练的资源平衡、跨数百个加速器的高吞吐通信,以及 Expert Parallelism 带来的动态 all-to-all token 路由通信开销等问题。

9月24日周四
9月22日周二
9月16日周三
9月11日周五
9月10日周四
9月3日周四
8月28日周五
8月27日周四
  1. Google Research47

    Google 发布 GlucoFM:面向连续血糖监测的基础模型

    Google 推出自监督基础模型 GlucoFM,采用双流设计将缓慢血糖基线趋势与短期偏离分开处理。在四个队列、七项临床预测任务共 14 项评估中,其平均 PR-AUC 比最强基线 CGM 基线从 54.7 提升至 58.8,在全部糖尿病风险和 beta 细胞功能障碍评估中领先,并在餐后血糖响应预测上取得最低 MAE。

8月25日周二
  1. Hugging Face Blog61

    IBM 发布 Granite 4.2 推理模型家族,详解 15T token 预训练与多阶段 RL 训练管线

    IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密解码器模型,基于 Granite 4.1 基座(从头在约 15T token 上预训练,五阶段策略将上下文扩展至 512K),经 SFT 与多阶段 GRPO 强化学习后训练,全部以 Apache 2.0 许可开源。

    推荐理由:官方完整披露从预训练、SFT 到多阶段 GRPO 和智能体 RL 的训练细节,可迁移到类似模型的构建流程。

8月10日周一
7月26日周日
  1. Berkeley AI Research46

    教 LLM 更新信念状态以实现高效长程交互:Berkeley AI Research 提出 ABBEL 框架

    Berkeley AI Research 提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为智能体的工作上下文,并引入 belief grading 监督摘要内容。在 CollabBench 协作编程测试中,ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,峰值上下文 token 长度也显著低于全上下文设置。

7月9日周四
7月6日周一
  1. Hugging Face Blog47

    Hugging Face PRX 系列第四篇:我们的数据策略

    Hugging Face 详解 PRX 图像生成模型的数据管道:混合公开与内部数据集做预训练,用 VLM 重新生成长描述文本,再转成可流式训练语料。文本编码器已换为 Qwen3-VL 并改为训练时在线计算 text latents,吞吐仅损失约 3–4%。图像统一以 JPEG quality 92 编码,数据用 Lance 构建、以 MDS(Mosaic Streaming)流式供训练。

6月30日周二
6月17日周三
6月11日周四
6月4日周四
5月18日周一
5月16日周六
4月22日周三
4月16日周四
4月9日周四
4月1日周三
3月18日周三
  1. Mistral AI43

    Mistral AI 推出 Forge:帮企业用专有数据训练前沿级模型

    Mistral AI 发布 Forge,供企业基于内部文档、代码库和业务数据训练前沿级模型,使模型理解内部术语、工作流程与合规要求。Forge 支持预训练、后训练和强化学习,兼容 dense 与 MoE 架构及多模态输入,并内置数据管道与 Mistral AI 训练方法,支持持续评估与迭代。ASML、Ericsson、欧洲航天局等机构已与 Mistral AI 合作训练专有模型。

3月12日周四
  1. Google Research62

    Google 发布 Groundsource:用 Gemini 将新闻报道转化为 260 万条洪水历史数据

    Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报道中提取结构化灾害记录,构建覆盖 150 多个国家、2000 年至今的 260 万条城市山洪事件开放数据集。

    推荐理由:原文给出了用 Gemini 从新闻中提取灾害数据的完整方法和验证数字,读者可以据此评估其研究价值。

1月10日周六
  1. Berkeley AI Research45

    以信息量驱动成像系统设计:Berkeley AI Research 提出基于互信息的评估与优化框架(NeurIPS 2025)

    Berkeley AI Research 在 NeurIPS 2025 论文中提出直接基于信息内容评估和优化成像系统的框架,用互信息指标统一分辨率、噪声等因素。该方法仅需噪声测量数据和噪声模型即可估计信息量,并提供真实信息的上界。在彩色摄影、射电天文、无透镜成像和显微成像四个领域,该指标能预测解码器性能,优化结果匹配 SOTA 端到端方法,同时内存、计算量更低且无需任务专用解码器。

11月1日周六
9月1日周一