Jake Boggan 谈 Barnette 猜想被 openai/math 解决的心情
曾为研究图论移居布达佩斯的 Jake Boggan 表示,他为 Barnette 猜想断断续续投入了 24 年、数千小时,得知该猜想据称已在 openai/math 的问题 180 中被证明后百感交集。他形容这种心情“像听到前女友突然车祸去世般难过”,并猜测今晚还有不少人同样情绪复杂。
曾为研究图论移居布达佩斯的 Jake Boggan 表示,他为 Barnette 猜想断断续续投入了 24 年、数千小时,得知该猜想据称已在 openai/math 的问题 180 中被证明后百感交集。他形容这种心情“像听到前女友突然车祸去世般难过”,并猜测今晚还有不少人同样情绪复杂。
PhAI Labs 牵头、联合斯坦福、牛津和普林斯顿的研究团队发布 JEPA-Anything,将 Yann LeCun 提出的 JEPA 架构扩展为可跨七个领域工作的通用世界模型。
Reflection 宣布首款免费开放模型 Beam,总参数 501B、每 token 激活 23B(MoE),面向编码、逻辑推理和智能体任务。据 Reflection 称,Beam 在高难推理任务上以少三到四倍的算力匹配 GLM 5.2,编码与智能体基准接近 Qwen3.8-Max,但原始性能仍不及 Kimi K3 等更强开源模型。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上分享 Lean 证明形式化和研究细节。
推荐理由:OpenAI 公布内部前沿模型在数学未解问题上的结果,并开源 Lean 证明形式化,读者可查看研究细节。
Microsoft Research 播客中,partner research manager Jennifer Neville 与应用科学家 Chad Atalla 对谈,探讨评测如何推动 AI 系统突破性能边界以满足用户需求,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她分享了使用现有 AI 系统的实用建议,并强调当结果不符合预期时仔细检查数据的重要性。
美国初创公司 Reflection AI 正式发布其首个前沿开源权重模型 Beam,称其在高级推理基准上与 Z.ai 的 GLM-5.2 表现相当,推理计算用量少 3-4x。
TechCrunch Disrupt 2026 将于 10 月 13-15 日在旧金山 Moscone West 举行,汇聚 10,000+ 名创始人、投资人和科技领袖,并公布全部 breakout session 议程。
Mistral 发布 Mistral Large 4 预览版,总参数 1 万亿、激活参数 49B,用自有 3,800 张 NVIDIA Grace Blackwell GPU 训练,已可通过 Mistral API 使用,承诺本月底开源权重。
过去一年,OpenAI、Anthropic 等 AI 实验室在多个长期悬而未决的数学问题上宣布突破,甚至包括一个著名的千禧年大奖难题。这些本该受到庆祝的成果却在数学界引发强烈反弹,OpenAI 表示将咨询顶尖数学家以避免重蹈覆辙,但能否兑现仍有待观察。
OpenAI 发布722篇数学手稿,覆盖372个结果族,据 AGMAI 称包含对"数百"个开放问题的解答,成果由一个未发布的前沿模型产生。手稿发布在 GitHub 仓库并附论文修订与引用协议,还包括模型推理摘要、算力估算,OpenAI 称平均每个结果相当于 ChatGPT Pro 三小时的思考量。
推荐理由:报道给出722篇手稿的规模、问题数量和算力估算,读者可据此了解这批数学成果的实际内容与学界争议。
一项基准测试了本地 `Qwen3.8-27B-Q4_K_M.gguf` 模型能否只用英文单词表达正整数加法的精确结果,共 5,070 个关闭推理的用例及 169 个开启推理的对照用例。关闭推理时数值准确率仅 23.57%,其中 1-3 位数运算达 97.04%,10-13 位数降至 6.44%,格式合规率 96.17%;开启推理后在 169 次尝试中答对 167 次。
DeepMind AlphaGo 团队前核心成员 Thore Graepel 撰文指出,大语言模型本质上仍是快速联想的 next-token 预测,其思维链并非独立推理机制,不具备科学意义上的推理。
Latent Space 播客专访 MIT 博士生 Alex Zhang,讨论其 GPU Mode、KernelBench 与 Recursive Language Models(RLM)等工作。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发出名为 Ataraxos 的 AI,以 15 胜 1 负 4 平击败被认为是史上最强 Stratego 棋手的 Pim Niemeijer,训练仅用 16 块 GPU 和几千美元。Stratego 是大量信息隐藏且博弈时间尺度很长的不完全信息游戏,此前连 DeepMind 也未能造出稳定击败人类顶尖玩家的机器。
研究团队开发的 Ataraxos 在三周的对局中以 85% 有效胜率击败了四届世界冠军、公认史上最强的 Stratego 棋手 Niemeijer,并在 2025 世界锦标赛表演赛中赢下 40 局中的 38 局。
推荐理由:原文对比了 Ataraxos 与 DeepNash 的训练成本和方法细节,读者可以了解不完美信息博弈研究的最新进展。
Google DeepMind 发布 Gemini 4 Argon,主打编码、企业知识工作与网络防御,在 19 项基准中 13 项排名第一,输出上限从 64K 提升至 1M token,定价 $4/$20(限时五折 $2/$10),目前仅向 Fairwind 项目的政府用户和可信网络防御者开放。
Google 发布 Gemini 4 Argon,是其七个多月来首个前沿模型, introductory 定价为每百万输入 token $2、输出 $10,缓存输入约 95% 折扣。
Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识和网络安全防御等复杂工作流中表现前沿。
CoreWeave 宣布其云平台正式提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网组网,Cognition 成为首家在其上运行生产负载的客户,实测 SWE-2 推理总 token 吞吐较 GB200 NVL72 提升最高 4.8x。
GPT-6.1 Sol 在 Amazon Bedrock 正式可用,聚焦智能体编码、计算机操作和专业工作负载的更强推理能力。据 OpenAI 称,其 DeepSWE v1.1 成绩与 GPT-6 Astra 相当且每任务成本约为五分之一,超过 GPT-6 Sol 最佳成绩 6.4 个百分点;在透明度、用户意图和显式限制评估中也优于 GPT-6 Sol。
推荐理由:官方公告给出了与 GPT-6 Sol 和 GPT-6 Astra 的具体对比数据,可帮助读者评估其智能体工作场景的性价比。
NVIDIA 发布开源表格基础模型 Kumo Tabular,现已上架 Hugging Face。给定带标签的表格,模型在单次前向传播中直接预测新行标签,无需训练、调参或特征工程,支持分类和回归,基于 Transformer 并采用列、行和 in-context 注意力,完全在人工生成的表格上预训练。
推荐理由:官方介绍了无需训练微调的表格基础模型的架构、预训练配方和四项基准表现,读者可评估它能否替代传统梯度提升树工作流。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上可用,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四档推理力度。
推荐理由:原文给出 Bedrock 上的接入方式、推理档位配置和成本权衡,读者可直接据此规划调用与费用。
AWS 展示了如何在 SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。基于 VisGym SFT checkpoint,使用 GRPO 后训练将 64 个固定迷宫评测集的解题率从 43.75% 提升到 95% 以上。
AWS 团队发文详解 NarrateAI 在 Amazon Bedrock 上实现生产级 LLM 质量保障的五项技术:自适应流水线路由、跨账号多模型容灾、实时流式评估、复合评估框架和数据准确性校验。
Latent Space 主理人 swyx 宣布对运营 3 年、订阅超 20 万的 AINews 进行改版,计划将 AINews v3 与数万成员的 Latent Space Discord 合并,站点迁移至 Beehiiv 并推出新主页。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。
推荐理由:作者实测了三家新模型并整理完整价格表,读者可以据此比较新一轮降价幅度和各档模型的实际表现。
Latent Space 发布对 John Platt 的长篇访谈,他是 SVM 等两个教科书算法的发明者,现于 Google 领导 Empirical Research Assistance(ERA)研究。
TypeSafe AI 上周发布新类别模型 Jev,称为 System One 模型,接受文本输入但输出浮点数形式的分类、是/否判断、评分和置信度。Jev 只对输入收费,价格为 $0.042 per million tokens,低于 GPT-5 Nano 的 $0.05/million,支持并行评估多个问题,适合分类、排序和搜索重排等任务。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览提交中首次亮相,Qwen3-VL 上吞吐量最高达 GB300 NVL72 的 3.7x,DeepSeek-R1 上达 2.5x。
OpenAI 发布 GPT-6 Astra,定位为面向商业的最强模型,具备高级推理和计算机使用能力,写作与设计判断也更强。
推荐理由:官方发布了面向商业场景的新模型,提到推理、计算机操作和写作设计判断,读者可据此评估其在工作流中的定位。
OpenAI 分享了一个针对 Navier–Stokes 千禧年大奖难题的 AI 生成解法,内容包括一份解题文章和一个 Lean 形式化证明。材料来自 OpenAI 官方公告,feed 未提供完整正文,具体证明内容和方法细节以原文链接为准。
推荐理由:官方公开了 AI 生成的 Navier–Stokes 千禧年难题解法,并附带 Lean 形式化证明,读者可以据此关注 AI 在数学证明方向的实际产出。
Google Research 发布时间序列基础模型 TimesFM-3,参数量 330M,在超 1 万亿时间点的真实与合成语料上预训练,首次原生支持零样本多变量预测。
IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密解码器模型,基于 Granite 4.1 基座(从头在约 15T token 上预训练,五阶段策略将上下文扩展至 512K),经 SFT 与多阶段 GRPO 强化学习后训练,全部以 Apache 2.0 许可开源。
推荐理由:官方完整披露从预训练、SFT 到多阶段 GRPO 和智能体 RL 的训练细节,可迁移到类似模型的构建流程。
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 结构压缩至 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复后的 bfloat16 检查点蒸馏。
Import AI 第 470 期:METR 研究发现 AI 对网络安全发现带来显著加速,对数学略有贡献,但对 AI 研究算法优化尚无可测加速。多所大学团队提出 SPADE 框架,通过自博弈协同进化环境合成与智能体能力,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线高 5.3。本期还介绍 Hawkeye,用于构建更好的 GPU kernel。
DiG-bench(Discovery in Games)发布,这是一个包含 70 款游戏的基准,用于测试 AI 通过探索自主发现隐藏规则的能力,21 款游戏已公开。
Google Research 发布 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务)和知识画像框架,评估 13 个 LLM 后发现前沿模型 95–98% 的事实已编码,但仍有 26–34% 无法直接召回,开启 thinking 后仍有 11–12% 失败。
Microsoft Research 推出研究模型 CARE-X,一个统一胸部 X 光 VLM,基于 SigLIP2-so400M 与 Phi-4-mini-instruct(3.8B),通过辅助头联合训练提供报告生成与带置信度的结构化预测,并用 DAPO 强化学习对齐临床奖励。
Google Research 在 Nature 发表基于强化学习的量子纠错控制框架,让智能体利用错误检测事件持续调节数千个控制参数,在计算进行中对抗漂移。在 Willow 超导处理器上注入人为漂移的实验中,RL 控制使逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数约 1T(975B,激活 41B 的 MoE),原生接收图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token,包含 BF16 和 NVFP4 权重。
推荐理由:官方博客给出架构细节、各档位 VRAM 需求和部署配置,读者可以据此评估多模态部署成本与选型。