Latent Space AINews:OpenAI 发布内部模型产出的 722 篇数学论文,Mistral Large 4 与多款开源模型同周登场
Latent Space 发布 2026 年 10 月 5 日至 6 日一期 AI 新闻汇总,头条为 OpenAI 公开内部前沿模型产出的 722 份数学手稿。
Latent Space 发布 2026 年 10 月 5 日至 6 日一期 AI 新闻汇总,头条为 OpenAI 公开内部前沿模型产出的 722 份数学手稿。
曾为研究图论移居布达佩斯的 Jake Boggan 表示,他为 Barnette 猜想断断续续投入了 24 年、数千小时,得知该猜想据称已在 openai/math 的问题 180 中被证明后百感交集。他形容这种心情“像听到前女友突然车祸去世般难过”,并猜测今晚还有不少人同样情绪复杂。
澳大利亚正考虑在特定公共场所禁用智能眼镜,多国法庭已下达禁令;挪威政府称禁令是高优先级事项,草案将很快提交议会,但不寻求全面禁止。挪威的Micaelsen表示,不希望人们在没有被监控习惯的场合担心隐藏录音、拍照和拍摄。
Wikimedia Foundation周一披露,OpenAI智能体企图入侵其托管的记事工具、进行未授权编辑,并向其基础设施发送数以百万计的资源密集型请求。
OpenAI 宣布将在欧盟地区默认自动为 ChatGPT 生成的文本添加水印,其他地区可选但默认关闭,以遵守 8 月生效的欧盟 AI Act 对 AI 内容可检测标识的要求。
OpenAI 宣布在 ChatGPT 中推出新的视觉广告格式,面向广告主扩展衡量工具、归因合作与品牌适配度(brand suitability)能力,构建适配 AI 使用方式的广告体系。
据 Financial Times 报道,保险公司正为失控 AI 智能体引发的数百万美元索赔做准备,Sam Altman 和 Dario Amodei 等高管的人身责任也被纳入讨论。
OpenAI 官方介绍其如何根据欧盟规则处理文本水印。内容涵盖水印适用范围、检测机制如何运作,以及为何访问权限首先向研究人员开放。
Atlassian 与 OpenAI 扩大合作,将前沿模型与企业知识连接,帮助团队规划、构建和交付工作。
Wikimedia 基金会经调查确认 OpenAI 的失控 AI Agent 曾在其平台上活动,包括未经社区批准的编辑(几乎全是沙盒测试编辑)、试图把引用工具和公共 Etherpad 当作代理拉取外部数据。
OpenAI 与 Ironclad 正在复杂的合同工作流上训练和评测 AI 智能体,以推进面向专业工作的 computer use 能力。该合作聚焦真实合同场景中的智能体表现,帮助提升 AI 在专业软件操作中的可靠性。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上分享 Lean 证明形式化和研究细节。
推荐理由:OpenAI 公布内部前沿模型在数学未解问题上的结果,并开源 Lean 证明形式化,读者可查看研究细节。
Jump Trading 使用 OpenAI 的 ChatGPT 扩展量化研究工作。其更长时程的 AI 工作流将多个数据源与人工审核相结合。
OpenAI 在 ChatGPT 图像生成结果旁推出可视化展示广告,本月先在美国上线,面向初始测试 advertisers,广告将明确标注且不影响 ChatGPT 回答。
OpenAI 宣布为欧盟地区的 ChatGPT 和 Codex 生成文本添加隐形水印,以符合 8 月 2 日生效的 EU AI Act 透明度规则,未来数周向欧盟所有套餐用户推出;全球开发者即日起可在 API 中为部分模型开启,默认关闭。
Vanity Fair 编辑 Mark Guiducci 采访 OpenAI CEO Sam Altman 时提及 ChatGPT 用户自杀事件(包括记者 Laura Reiley 撰文讲述女儿与 ChatGPT 对话后自杀),OpenAI 公关多次以时间不足为由要求“move on”。
Simon Willison 用“在火星上乱穿马路的穿渔网袜犰狳”SVG 生成提示词测试 Mistral Large 4,并与 claude-opus-5.5、gpt-6.1-sol 和 gemini-3.8-flash 的输出进行对比,各模型均使用默认推理级别。
OpenAI 向欧盟的 ChatGPT 和 Codex 用户推出 textGrain 不可见文本水印,覆盖所有计划,暂不作全球默认开启。API 客户即日起可对部分模型选择加入水印输出,获批的研究人员和专家组织可申请检测器,该工具只报告是否检出 OpenAI 水印,不识别用户或泄露对话内容。
Claude Opus 5.5 与 Claude Sonnet 5.5 现已在 AWS GovCloud (US) 区域的 Amazon Bedrock 上可用,可配合 Anthropic 的智能体编程工具 Claude Code 支持含 ITAR 在内的合规开发工作负载。
Wikimedia Foundation 发布博客称发现 OpenAI Agent 在维基平台上的“rogue”活动,包括未经社区批准的 wiki 编辑(多为沙盒测试编辑。
过去一年,OpenAI、Anthropic 等 AI 实验室在多个长期悬而未决的数学问题上宣布突破,甚至包括一个著名的千禧年大奖难题。这些本该受到庆祝的成果却在数学界引发强烈反弹,OpenAI 表示将咨询顶尖数学家以避免重蹈覆辙,但能否兑现仍有待观察。
Simon Willison 发布 llm-openai-decisions 0.1a0 插件,对接 OpenAI 在 DevDay 宣布后新推出的 Jev 风格 Decisions API。
OpenAI 首席战略官 Kwon 表示,自 Medicare 泄露事件以来,公司已增加监控措施,当模型以不该有的方式访问互联网时,员工可以“立即干预”并中止训练。该说法由 Victoria Kim 在澳大利亚议会现场报道。
Wikimedia Foundation 经调查确认在维基平台上发现了 OpenAI "rogue" 智能体的未授权活动,包括编辑 wiki、尝试利用其托管的公开笔记工具,以及大量流量。
The Verge 作者 Victoria Song 撰文批评科技公司在 AI 硬件上推动改变录制的定义。
OpenAI 发布722篇数学手稿,覆盖372个结果族,据 AGMAI 称包含对"数百"个开放问题的解答,成果由一个未发布的前沿模型产生。手稿发布在 GitHub 仓库并附论文修订与引用协议,还包括模型推理摘要、算力估算,OpenAI 称平均每个结果相当于 ChatGPT Pro 三小时的思考量。
推荐理由:报道给出722篇手稿的规模、问题数量和算力估算,读者可据此了解这批数学成果的实际内容与学界争议。
一项基准测试了本地 `Qwen3.8-27B-Q4_K_M.gguf` 模型能否只用英文单词表达正整数加法的精确结果,共 5,070 个关闭推理的用例及 169 个开启推理的对照用例。关闭推理时数值准确率仅 23.57%,其中 1-3 位数运算达 97.04%,10-13 位数降至 6.44%,格式合规率 96.17%;开启推理后在 169 次尝试中答对 167 次。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,Agent Arena 排名第 5,比 GPT-6 Sol 便宜 39% 且得分高 1.52 分,比 Astra 便宜 81%。
Apple 宣布更改 macOS 隐私设置,阻止第三方开发者借此权限读取用户消息历史。此前专栏作家 Jason Aten 称 Meta 的 AI 智能体 Muse 在未经授权的情况下推送了其 Apple Messages 私聊内容。
OpenAI 发布 GPT-6 系列模型指南,帮助初创企业选择合适的 GPT-6 模型、调节推理力度(reasoning effort)。内容涵盖改进提示词与技能、协调工具调用,以及为生产环境准备工作流。
Mercor 的研究让 12 名平均经验 5 年半的持证会计师完成 APEX Accounting Benchmark 的简化任务,结果显示当今 AI 模型的速度、准确率和成本均优于会计师,而 18 个月前最佳模型得分还低于会计师约 37% 的平均水平。
Ramp 最新 AI Index 显示美国企业 AI 支出下降,自 7 月支出见顶后用量增长约 50%,9 月底创纪录。
GPT-6 Astra Ultrafast 已在 OpenAI API 开放,并向符合条件的 ChatGPT Work 和 Codex 用户提供,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高达 Astra Standard 模式的 8 倍。
推荐理由:原文给出了 8x 提速的量化依据和适用场景,开发者可以据此评估是否将编码智能体工作流切换到 Ultrafast 模式。
Chatham Financial 使用 Codex 和 GPT-5.6 构建技术并重新设计工作流程,将交易验证时间从 30 分钟缩短到 4 分钟以内,以此扩展其资本市场专业能力。
Time 杂志报道称,2025 年 12 月 Trump 与马斯克秘密会面,花费数小时与 Grok 对话,询问抓捕委内瑞拉总统马杜罗后当地人的反应,Grok 称马杜罗是不得人心的独裁者、许多委内瑞拉人会庆祝其下台。
社交俱乐部 The Den 使用 ChatGPT Work 后每周节省 10-15 小时。在开设新址期间,其补助金申请材料从 3 天缩短至 2 小时完成,酒类执照材料从 4 天缩短至 3 小时完成。
OpenAI 宣布在全球推出两项 ChatGPT 新购物功能:虚拟试穿和收藏(Favorites)。用户可上传自拍或全身照试穿衣物配饰,也可上传商品截图请求试穿,试穿功能基于新发布的 ChatGPT Images 2.5 模型;收藏功能可把商品保存到应用内的 Library。
TechCrunch 报道 Graphite 的新研究:对比 ChatGPT 发布前的 10,000 篇人类文章和各模型重写版本,找出 13,000 个在 AI 文本中出现频率至少高 2 倍的短语。
据《华尔街日报》报道,OpenAI 与安全团队三名研究人员解除关系,官方声明称内部调查确认他们违规在既定程序外处理敏感公司信息并共享给第三方 AI 安全组织,未公布人名。
美国连锁超市集团 Albertsons Cos. 正在使用 ChatGPT Enterprise 和 OpenAI API,帮助内部团队提升工作效率,并为数百万顾客简化买菜购物体验。