跳到正文

#推理

今日 10 条
今天10月7日周三
  1. Microsoft Research48

    Microsoft Research 播客:AI 会出什么错,失败教会我们什么

    Microsoft Research 播客中,partner research manager Jennifer Neville 与应用科学家 Chad Atalla 对谈,探讨评测如何推动 AI 系统突破性能边界以满足用户需求,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她分享了使用现有 AI 系统的实用建议,并强调当结果不符合预期时仔细检查数据的重要性。

  2. The Verge · AI39

    AI 接管数学引发的种种争议

    过去一年,OpenAI、Anthropic 等 AI 实验室在多个长期悬而未决的数学问题上宣布突破,甚至包括一个著名的千禧年大奖难题。这些本该受到庆祝的成果却在数学界引发强烈反弹,OpenAI 表示将咨询顶尖数学家以避免重蹈覆辙,但能否兑现仍有待观察。

  3. The Verge · AI76

    OpenAI 发布722篇数学手稿,涵盖数百个开放问题解答

    OpenAI 发布722篇数学手稿,覆盖372个结果族,据 AGMAI 称包含对"数百"个开放问题的解答,成果由一个未发布的前沿模型产生。手稿发布在 GitHub 仓库并附论文修订与引用协议,还包括模型推理摘要、算力估算,OpenAI 称平均每个结果相当于 ChatGPT Pro 三小时的思考量。

    推荐理由:报道给出722篇手稿的规模、问题数量和算力估算,读者可据此了解这批数学成果的实际内容与学界争议。

10月5日周一
  1. Simon Willison33

    Qwen3.8 27B 用单词做加法基准测试

    一项基准测试了本地 `Qwen3.8-27B-Q4_K_M.gguf` 模型能否只用英文单词表达正整数加法的精确结果,共 5,070 个关闭推理的用例及 169 个开启推理的对照用例。关闭推理时数值准确率仅 23.57%,其中 1-3 位数运算达 97.04%,10-13 位数降至 6.44%,格式合规率 96.17%;开启推理后在 169 次尝试中答对 167 次。

10月2日周五
  1. Ars Technica · AI67

    AI 击败史上最强 Stratego 棋手 Pim Niemeijer,训练仅用 16 块 GPU

    卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出名为 Ataraxos 的 AI,以 15 胜 1 负 4 平击败被认为是史上最强 Stratego 棋手的 Pim Niemeijer,训练仅用 16 块 GPU 和几千美元。Stratego 是大量信息隐藏且博弈时间尺度很长的不完全信息游戏,此前连 DeepMind 也未能造出稳定击败人类顶尖玩家的机器。

10月1日周四
  1. The Decoder77

    AI 击败 Stratego 史上最强人类棋手,Ataraxos 以不到 8000 美元算力突破不完美信息博弈

    研究团队开发的 Ataraxos 在三周的对局中以 85% 有效胜率击败了四届世界冠军、公认史上最强的 Stratego 棋手 Niemeijer,并在 2025 世界锦标赛表演赛中赢下 40 局中的 38 局。

    推荐理由:原文对比了 Ataraxos 与 DeepNash 的训练成本和方法细节,读者可以了解不完美信息博弈研究的最新进展。

9月30日周三
  1. AWS Machine Learning Blog69

    OpenAI GPT-6.1 Sol 在 Amazon Bedrock 正式上线

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用,聚焦智能体编码、计算机操作和专业工作负载的更强推理能力。据 OpenAI 称,其 DeepSWE v1.1 成绩与 GPT-6 Astra 相当且每任务成本约为五分之一,超过 GPT-6 Sol 最佳成绩 6.4 个百分点;在透明度、用户意图和显式限制评估中也优于 GPT-6 Sol。

    推荐理由:官方公告给出了与 GPT-6 Sol 和 GPT-6 Astra 的具体对比数据,可帮助读者评估其智能体工作场景的性价比。

9月29日周二
  1. Hugging Face Blog63

    NVIDIA 发布开源表格基础模型 Kumo Tabular,单次前向预测表格标签

    NVIDIA 发布开源表格基础模型 Kumo Tabular,现已上架 Hugging Face。给定带标签的表格,模型在单次前向传播中直接预测新行标签,无需训练、调参或特征工程,支持分类和回归,基于 Transformer 并采用列、行和 in-context 注意力,完全在人工生成的表格上预训练。

    推荐理由:官方介绍了无需训练微调的表格基础模型的架构、预训练配方和四项基准表现,读者可评估它能否替代传统梯度提升树工作流。

9月26日周六
9月25日周五
9月23日周三
9月22日周二
9月16日周三
9月9日周三
9月8日周二
  1. OpenAI News81

    OpenAI 分享 Navier–Stokes 千禧年难题的 AI 生成解法

    OpenAI 分享了一个针对 Navier–Stokes 千禧年大奖难题的 AI 生成解法,内容包括一份解题文章和一个 Lean 形式化证明。材料来自 OpenAI 官方公告,feed 未提供完整正文,具体证明内容和方法细节以原文链接为准。

    推荐理由:官方公开了 AI 生成的 Navier–Stokes 千禧年难题解法,并附带 Lean 形式化证明,读者可以据此关注 AI 在数学证明方向的实际产出。

9月1日周二
8月25日周二
  1. Hugging Face Blog61

    IBM 发布 Granite 4.2 推理模型家族,详解 15T token 预训练与多阶段 RL 训练管线

    IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密解码器模型,基于 Granite 4.1 基座(从头在约 15T token 上预训练,五阶段策略将上下文扩展至 512K),经 SFT 与多阶段 GRPO 强化学习后训练,全部以 Apache 2.0 许可开源。

    推荐理由:官方完整披露从预训练、SFT 到多阶段 GRPO 和智能体 RL 的训练细节,可迁移到类似模型的构建流程。

8月24日周一
  1. Import AI47

    Import AI 470:机器不该有权利;用 SPADE 自动化环境生成;用 Hawkeye 构建更好的 GPU kernel

    Import AI 第 470 期:METR 研究发现 AI 对网络安全发现带来显著加速,对数学略有贡献,但对 AI 研究算法优化尚无可测加速。多所大学团队提出 SPADE 框架,通过自博弈协同进化环境合成与智能体能力,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线高 5.3。本期还介绍 Hawkeye,用于构建更好的 GPU kernel。

8月17日周一
8月12日周三
7月23日周四
  1. Google Research49

    Google Research 如何让量子计算机从错误中学习

    Google Research 在 Nature 发表基于强化学习的量子纠错控制框架,让智能体利用错误检测事件持续调节数千个控制参数,在计算进行中对抗漂移。在 Willow 超导处理器上注入人为漂移的实验中,RL 控制使逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%。

7月15日周三
  1. Hugging Face Blog80

    Thinking Machines 发布万亿参数开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数约 1T(975B,激活 41B 的 MoE),原生接收图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token,包含 BF16 和 NVFP4 权重。

    推荐理由:官方博客给出架构细节、各档位 VRAM 需求和部署配置,读者可以据此评估多模态部署成本与选型。