OpenAI 公布内部前沿模型在数学开放问题上的进展
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上分享 Lean 证明形式化和研究细节。
推荐理由:OpenAI 公布内部前沿模型在数学未解问题上的结果,并开源 Lean 证明形式化,读者可查看研究细节。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上分享 Lean 证明形式化和研究细节。
推荐理由:OpenAI 公布内部前沿模型在数学未解问题上的结果,并开源 Lean 证明形式化,读者可查看研究细节。
Microsoft Research 播客中,partner research manager Jennifer Neville 与应用科学家 Chad Atalla 对谈,探讨评测如何推动 AI 系统突破性能边界以满足用户需求,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她分享了使用现有 AI 系统的实用建议,并强调当结果不符合预期时仔细检查数据的重要性。
CoreWeave 宣布其云平台正式提供 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网组网,Cognition 成为首家在其上运行生产负载的客户,实测 SWE-2 推理总 token 吞吐较 GB200 NVL72 提升最高 4.8x。
GPT-6.1 Sol 在 Amazon Bedrock 正式可用,聚焦智能体编码、计算机操作和专业工作负载的更强推理能力。据 OpenAI 称,其 DeepSWE v1.1 成绩与 GPT-6 Astra 相当且每任务成本约为五分之一,超过 GPT-6 Sol 最佳成绩 6.4 个百分点;在透明度、用户意图和显式限制评估中也优于 GPT-6 Sol。
推荐理由:官方公告给出了与 GPT-6 Sol 和 GPT-6 Astra 的具体对比数据,可帮助读者评估其智能体工作场景的性价比。
NVIDIA 发布开源表格基础模型 Kumo Tabular,现已上架 Hugging Face。给定带标签的表格,模型在单次前向传播中直接预测新行标签,无需训练、调参或特征工程,支持分类和回归,基于 Transformer 并采用列、行和 in-context 注意力,完全在人工生成的表格上预训练。
推荐理由:官方介绍了无需训练微调的表格基础模型的架构、预训练配方和四项基准表现,读者可评估它能否替代传统梯度提升树工作流。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上可用,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四档推理力度。
推荐理由:原文给出 Bedrock 上的接入方式、推理档位配置和成本权衡,读者可直接据此规划调用与费用。
AWS 展示了如何在 SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。基于 VisGym SFT checkpoint,使用 GRPO 后训练将 64 个固定迷宫评测集的解题率从 43.75% 提升到 95% 以上。
AWS 团队发文详解 NarrateAI 在 Amazon Bedrock 上实现生产级 LLM 质量保障的五项技术:自适应流水线路由、跨账号多模型容灾、实时流式评估、复合评估框架和数据准确性校验。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览提交中首次亮相,Qwen3-VL 上吞吐量最高达 GB300 NVL72 的 3.7x,DeepSeek-R1 上达 2.5x。
OpenAI 发布 GPT-6 Astra,定位为面向商业的最强模型,具备高级推理和计算机使用能力,写作与设计判断也更强。
推荐理由:官方发布了面向商业场景的新模型,提到推理、计算机操作和写作设计判断,读者可据此评估其在工作流中的定位。
OpenAI 分享了一个针对 Navier–Stokes 千禧年大奖难题的 AI 生成解法,内容包括一份解题文章和一个 Lean 形式化证明。材料来自 OpenAI 官方公告,feed 未提供完整正文,具体证明内容和方法细节以原文链接为准。
推荐理由:官方公开了 AI 生成的 Navier–Stokes 千禧年难题解法,并附带 Lean 形式化证明,读者可以据此关注 AI 在数学证明方向的实际产出。
Google Research 发布时间序列基础模型 TimesFM-3,参数量 330M,在超 1 万亿时间点的真实与合成语料上预训练,首次原生支持零样本多变量预测。
IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密解码器模型,基于 Granite 4.1 基座(从头在约 15T token 上预训练,五阶段策略将上下文扩展至 512K),经 SFT 与多阶段 GRPO 强化学习后训练,全部以 Apache 2.0 许可开源。
推荐理由:官方完整披露从预训练、SFT 到多阶段 GRPO 和智能体 RL 的训练细节,可迁移到类似模型的构建流程。
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 结构压缩至 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复后的 bfloat16 检查点蒸馏。
Google Research 发布 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务)和知识画像框架,评估 13 个 LLM 后发现前沿模型 95–98% 的事实已编码,但仍有 26–34% 无法直接召回,开启 thinking 后仍有 11–12% 失败。
Microsoft Research 推出研究模型 CARE-X,一个统一胸部 X 光 VLM,基于 SigLIP2-so400M 与 Phi-4-mini-instruct(3.8B),通过辅助头联合训练提供报告生成与带置信度的结构化预测,并用 DAPO 强化学习对齐临床奖励。
Google Research 在 Nature 发表基于强化学习的量子纠错控制框架,让智能体利用错误检测事件持续调节数千个控制参数,在计算进行中对抗漂移。在 Willow 超导处理器上注入人为漂移的实验中,RL 控制使逻辑稳定性提升 3.5 倍,并在专家校准基础上进一步将逻辑错误率降低 20%。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数约 1T(975B,激活 41B 的 MoE),原生接收图像、文本和音频输入,支持 1M 上下文,训练数据为 45 万亿 token,包含 BF16 和 NVFP4 权重。
推荐理由:官方博客给出架构细节、各档位 VRAM 需求和部署配置,读者可以据此评估多模态部署成本与选型。
Hugging Face 发布 Profiling in PyTorch 系列第三篇,在 NVIDIA A100 上用 profiler 对比朴素 attention、in-place 掩码、SDPA math/efficient/flash/cuDNN 六种实现的 trace。
推荐理由:原文用 profiler 实测六种 attention 实现的内核差异,读者可以学会从 trace 里读出 inplace 省一次拷贝、SDPA 各后端的真实代价。
Mistral 发布 Apache-2.0 开源模型 Leanstral 1.5,119B 总参数、6B 激活参数,通过 mid-training、监督微调和 CISPO 强化学习训练。
推荐理由:官方披露了完整训练流程、基准数字和真实代码验证案例,读者可以据此评估形式化验证模型在数学证明和开源查错上的实用程度。
Berkeley AI Research(BAIR)实验室发布 2026 届博士毕业生巡礼,介绍 Baifeng Shi、Charlie Snell、Hanlin Zhu 等毕业生在机器人与具身智能、LLM 推理与 test-time scaling、生成模型、AI 安全与人机交互、语音与医疗 AI 等方向的研究成果。
Google Research 在 COLM 2026 发表的论文发现,开启链式推理能让 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 召回关闭推理时几乎无法答对的简单单跳事实。
Google DeepMind 发布开源实验模型 DiffusionGemma,基于文本扩散方法生成整块文本,在专用 GPU 上推理速度最高达 4x(单张 NVIDIA H100 超 1000 tokens/秒,RTX 5090 超 700 tokens/秒)。
推荐理由:官方明确了 4x 提速的具体硬件数字和输出质量取舍,读者可以据此判断它适不适合本地低并发场景。
Google Research 在 I/O 2026 上宣布 Gemini for Science,一套与 Google Cloud、Google DeepMind 和 Google Labs 合作打造的实验性科学工具集。
Mistral 收购 Emmi AI,将物理 AI 定位于航空航天、汽车、半导体和能源等行业的工程研发,目标是让工程师更快构建下一代产品并在大规模运营中持续提升性能。
Berkeley AI Research 发布关于自适应并行推理的研究综述,探讨让推理模型自主决定何时分解任务、并行生成多少线程并协调它们的思路。
Google Research 介绍其 2025 年 9 月发布的 Empirical Research Assistance(ERA)在四个科研领域的实际应用进展。
Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,让长时序规划更实用。其核心改进包括三点:把轨迹提升到虚拟状态使优化在时间上并行、在状态迭代中直接加入随机性以支持探索、重塑梯度避免穿过高维视觉模型的脆弱"状态-输入"梯度。
Google Research 推出 TurboQuant 压缩算法(将发表于 ICLR 2026),通过结合 Quantized Johnson-Lindenstrauss(QJL)和 PolarQuant(将发表于 AISTATS 2026)实现零内存开销的向量压缩,可在不损失精度的情况下压缩模型和 KV cache。
Mistral AI 发布 Mistral Small 4,是首个将 Magistral 推理、Pixtral 多模态、Devstral 智能体编码能力统一到单一模型的小型模型,采用 Apache 2.0 许可开源。
推荐理由:官方发布正文给出了完整的架构参数、基准对比和部署要求,读者可据此评估其替代多模型组合的可行性。
Google Research 与 Cornell、Harvard 合作在 PNAS 发表论文,让 12 位高温超导领域专家出 67 道题、盲评 6 个 LLM 的回答。
Mistral 发布新一代模型系列 Mistral 3,包括 MoE 架构的 Mistral Large 3(41B 激活、675B 总参数)以及 3B、8B、14B 三个尺寸的 Ministral 3 模型,全部以 Apache 2.0 协议开源。
推荐理由:官方公告完整列出了模型规格、开源协议、部署方式与可用平台,读者可据此评估在自有环境落地的可行性。
Berkeley AI Research 提出一种基于分而治之(divide and conquer)的 off-policy RL 价值学习算法,不再使用时间差分(TD)学习,后者因 Bellman 递归误差累积难以扩展到长时程任务。
Berkeley AI Research 提出 word2vec 学习过程的定量理论:在若干温和近似下,其学习问题可归约为无加权最小二乘矩阵分解,梯度流动力学有闭式解,最终嵌入等价于对目标矩阵 M* 做 PCA。
Mistral AI 发布其首个推理模型 Magistral,分开源的 Magistral Small(24B,Apache 2.0)与企业版 Magistral Medium 两个版本。
推荐理由:官方同时开源与商用双版本,给出 AIME2024 分数、开源许可和部署渠道,读者可据此评估选型。