跳到正文

#推理

今日 2 条
今天10月7日周三
10月5日周一
  1. Simon Willison33

    Qwen3.8 27B 用单词做加法基准测试

    一项基准测试了本地 `Qwen3.8-27B-Q4_K_M.gguf` 模型能否只用英文单词表达正整数加法的精确结果,共 5,070 个关闭推理的用例及 169 个开启推理的对照用例。关闭推理时数值准确率仅 23.57%,其中 1-3 位数运算达 97.04%,10-13 位数降至 6.44%,格式合规率 96.17%;开启推理后在 169 次尝试中答对 167 次。

10月2日周五
  1. Ars Technica · AI67

    AI 击败史上最强 Stratego 棋手 Pim Niemeijer,训练仅用 16 块 GPU

    卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出名为 Ataraxos 的 AI,以 15 胜 1 负 4 平击败被认为是史上最强 Stratego 棋手的 Pim Niemeijer,训练仅用 16 块 GPU 和几千美元。Stratego 是大量信息隐藏且博弈时间尺度很长的不完全信息游戏,此前连 DeepMind 也未能造出稳定击败人类顶尖玩家的机器。

10月1日周四
  1. The Decoder77

    AI 击败 Stratego 史上最强人类棋手,Ataraxos 以不到 8000 美元算力突破不完美信息博弈

    研究团队开发的 Ataraxos 在三周的对局中以 85% 有效胜率击败了四届世界冠军、公认史上最强的 Stratego 棋手 Niemeijer,并在 2025 世界锦标赛表演赛中赢下 40 局中的 38 局。

    推荐理由:原文对比了 Ataraxos 与 DeepNash 的训练成本和方法细节,读者可以了解不完美信息博弈研究的最新进展。

9月8日周二
  1. OpenAI News81

    OpenAI 分享 Navier–Stokes 千禧年难题的 AI 生成解法

    OpenAI 分享了一个针对 Navier–Stokes 千禧年大奖难题的 AI 生成解法,内容包括一份解题文章和一个 Lean 形式化证明。材料来自 OpenAI 官方公告,feed 未提供完整正文,具体证明内容和方法细节以原文链接为准。

    推荐理由:官方公开了 AI 生成的 Navier–Stokes 千禧年难题解法,并附带 Lean 形式化证明,读者可以据此关注 AI 在数学证明方向的实际产出。

8月25日周二
8月17日周一
8月12日周三
7月23日周四
  1. Google Research49

    Google Research 如何让量子计算机从错误中学习

    Google Research 在 Nature 发表基于强化学习的量子纠错控制框架,让智能体利用错误检测事件持续调节数千个控制参数,在计算进行中对抗漂移。在 Willow 超导处理器上注入人为漂移的实验中,RL 控制使逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%。

6月25日周四
4月20日周一
3月25日周三
3月17日周二
11月1日周六
9月1日周一