跳到正文

#推理

今日 2 条
今天10月7日周三
  1. Microsoft Research48

    Microsoft Research 播客:AI 会出什么错,失败教会我们什么

    Microsoft Research 播客中,partner research manager Jennifer Neville 与应用科学家 Chad Atalla 对谈,探讨评测如何推动 AI 系统突破性能边界以满足用户需求,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她分享了使用现有 AI 系统的实用建议,并强调当结果不符合预期时仔细检查数据的重要性。

9月30日周三
  1. AWS Machine Learning Blog69

    OpenAI GPT-6.1 Sol 在 Amazon Bedrock 正式上线

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用,聚焦智能体编码、计算机操作和专业工作负载的更强推理能力。据 OpenAI 称,其 DeepSWE v1.1 成绩与 GPT-6 Astra 相当且每任务成本约为五分之一,超过 GPT-6 Sol 最佳成绩 6.4 个百分点;在透明度、用户意图和显式限制评估中也优于 GPT-6 Sol。

    推荐理由:官方公告给出了与 GPT-6 Sol 和 GPT-6 Astra 的具体对比数据,可帮助读者评估其智能体工作场景的性价比。

9月29日周二
  1. Hugging Face Blog63

    NVIDIA 发布开源表格基础模型 Kumo Tabular,单次前向预测表格标签

    NVIDIA 发布开源表格基础模型 Kumo Tabular,现已上架 Hugging Face。给定带标签的表格,模型在单次前向传播中直接预测新行标签,无需训练、调参或特征工程,支持分类和回归,基于 Transformer 并采用列、行和 in-context 注意力,完全在人工生成的表格上预训练。

    推荐理由:官方介绍了无需训练微调的表格基础模型的架构、预训练配方和四项基准表现,读者可评估它能否替代传统梯度提升树工作流。

9月26日周六
9月16日周三
9月9日周三
9月8日周二
  1. OpenAI News81

    OpenAI 分享 Navier–Stokes 千禧年难题的 AI 生成解法

    OpenAI 分享了一个针对 Navier–Stokes 千禧年大奖难题的 AI 生成解法,内容包括一份解题文章和一个 Lean 形式化证明。材料来自 OpenAI 官方公告,feed 未提供完整正文,具体证明内容和方法细节以原文链接为准。

    推荐理由:官方公开了 AI 生成的 Navier–Stokes 千禧年难题解法,并附带 Lean 形式化证明,读者可以据此关注 AI 在数学证明方向的实际产出。

9月1日周二
8月25日周二
  1. Hugging Face Blog61

    IBM 发布 Granite 4.2 推理模型家族,详解 15T token 预训练与多阶段 RL 训练管线

    IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密解码器模型,基于 Granite 4.1 基座(从头在约 15T token 上预训练,五阶段策略将上下文扩展至 512K),经 SFT 与多阶段 GRPO 强化学习后训练,全部以 Apache 2.0 许可开源。

    推荐理由:官方完整披露从预训练、SFT 到多阶段 GRPO 和智能体 RL 的训练细节,可迁移到类似模型的构建流程。

8月12日周三
7月23日周四
  1. Google Research49

    Google Research 如何让量子计算机从错误中学习

    Google Research 在 Nature 发表基于强化学习的量子纠错控制框架,让智能体利用错误检测事件持续调节数千个控制参数,在计算进行中对抗漂移。在 Willow 超导处理器上注入人为漂移的实验中,RL 控制使逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%。

7月15日周三
  1. Hugging Face Blog80

    Thinking Machines 发布万亿参数开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数约 1T(975B,激活 41B 的 MoE),原生接收图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token,包含 BF16 和 NVFP4 权重。

    推荐理由:官方博客给出架构细节、各档位 VRAM 需求和部署配置,读者可以据此评估多模态部署成本与选型。

7月10日周五
  1. Hugging Face Blog61

    Hugging Face 发布 PyTorch Profiling 系列第三篇:用 profiler 拆解 attention 的六种实现

    Hugging Face 发布 Profiling in PyTorch 系列第三篇,在 NVIDIA A100 上用 profiler 对比朴素 attention、in-place 掩码、SDPA math/efficient/flash/cuDNN 六种实现的 trace。

    推荐理由:原文用 profiler 实测六种 attention 实现的内核差异,读者可以学会从 trace 里读出 inplace 省一次拷贝、SDPA 各后端的真实代价。

7月2日周四
  1. Mistral AI65

    Mistral 发布 Leanstral 1.5:119B 总参数 6B 激活,Apache-2.0 开源形式化验证模型

    Mistral 发布 Apache-2.0 开源模型 Leanstral 1.5,119B 总参数、6B 激活参数,通过 mid-training、监督微调和 CISPO 强化学习训练。

    推荐理由:官方披露了完整训练流程、基准数字和真实代码验证案例,读者可以据此评估形式化验证模型在数学证明和开源查错上的实用程度。

7月1日周三
6月25日周四
6月11日周四
  1. Google DeepMind70

    Google DeepMind 发布开源实验模型 DiffusionGemma,GPU 文本生成提速至 4x

    Google DeepMind 发布开源实验模型 DiffusionGemma,基于文本扩散方法生成整块文本,在专用 GPU 上推理速度最高达 4x(单张 NVIDIA H100 超 1000 tokens/秒,RTX 5090 超 700 tokens/秒)。

    推荐理由:官方明确了 4x 提速的具体硬件数字和输出质量取舍,读者可以据此判断它适不适合本地低并发场景。

5月29日周五
5月27日周三
5月8日周五
4月30日周四
4月20日周一
3月25日周三
3月17日周二
12月3日周三
  1. Mistral AI78

    Mistral 发布 Mistral 3 系列模型,含 Mistral Large 3 与 Ministral 3,均采用 Apache 2.0 开源

    Mistral 发布新一代模型系列 Mistral 3,包括 MoE 架构的 Mistral Large 3(41B 激活、675B 总参数)以及 3B、8B、14B 三个尺寸的 Ministral 3 模型,全部以 Apache 2.0 协议开源。

    推荐理由:官方公告完整列出了模型规格、开源协议、部署方式与可用平台,读者可据此评估在自有环境落地的可行性。

11月1日周六
9月1日周一
6月10日周二