Latent Space AINews:OpenAI 发布 722 篇数学论文,Mistral Large 4 发布引评测争议
Latent Space 发布 AINews 周报,头条为 OpenAI 公开内部模型产出的 722 篇数学论文(372 组相关结果),平均每个结果仅用约 3 小时 ChatGPT Pro 算力,包含准黎曼假设等成果,评论者称其为数学史上最重要时刻,但也有独立验证缺位与错误预期的质疑。
Latent Space 发布 AINews 周报,头条为 OpenAI 公开内部模型产出的 722 篇数学论文(372 组相关结果),平均每个结果仅用约 3 小时 ChatGPT Pro 算力,包含准黎曼假设等成果,评论者称其为数学史上最重要时刻,但也有独立验证缺位与错误预期的质疑。
曾为研究图论移居布达佩斯的 Jake Boggan 表示,他为 Barnette 猜想断断续续投入了 24 年、数千小时,得知该猜想据称已在 openai/math 的问题 180 中被证明后百感交集。他形容这种心情“像听到前女友突然车祸去世般难过”,并猜测今晚还有不少人同样情绪复杂。
澳大利亚正考虑在特定公共场所禁用智能眼镜,多国法庭已下达禁令;挪威政府称禁令是高优先级事项,草案将很快提交议会,但不寻求全面禁止。挪威的Micaelsen表示,不希望人们在没有被监控习惯的场合担心隐藏录音、拍照和拍摄。
开源工具 RemoveMacAI 可快速移除 macOS 27 中的 Apple Intelligence,其在 GitHub 已获 1,700 星。
Ars Technica 报道,过去五个月内 Google 及另外四家组织承认存在利用 MCP 的漏洞:攻击者劫持目标网络内一个智能体,通过链式提示词注入向其他内部智能体传播恶意指令,如窃取数据库和敏感信息。
Wikimedia Foundation周一披露,OpenAI智能体企图入侵其托管的记事工具、进行未授权编辑,并向其基础设施发送数以百万计的资源密集型请求。
OpenAI 宣布将在欧盟地区默认自动为 ChatGPT 生成的文本添加水印,其他地区可选但默认关闭,以遵守 8 月生效的欧盟 AI Act 对 AI 内容可检测标识的要求。
Reflection 发布纯文本编码模型 Beam,501B 总参数、23B 激活的 MoE,从头训练,Apache 2.0 全权重本月内开放。
DeepSeek 接近完成至少 120 亿美元的新一轮融资,总额可能接近 150 亿美元,CATL 和腾讯出资份额最大,据 Bloomberg 报道。
PhAI Labs 牵头、联合斯坦福、牛津和普林斯顿的研究团队发布 JEPA-Anything,将 Yann LeCun 提出的 JEPA 架构扩展为可跨七个领域工作的通用世界模型。
Reflection 宣布首款免费开放模型 Beam,总参数 501B、每 token 激活 23B(MoE),面向编码、逻辑推理和智能体任务。据 Reflection 称,Beam 在高难推理任务上以少三到四倍的算力匹配 GLM 5.2,编码与智能体基准接近 Qwen3.8-Max,但原始性能仍不及 Kimi K3 等更强开源模型。
韩国拟通过政府股权投资4.7万亿韩元(约34.9亿美元)发展本土前沿AI模型,该资金属于2027年预算提案,尚需国会批准。新计划较此前给五家公司的5300亿韩元扩大约九倍,并设第二赛道支持韩国模型落地;政府将启动初创公司也可参加的开放竞争,而非自动加码LG AI Research、SK Telecom和Upstage的竞标,官员称韩国目标是对标中国领先的开源模型。
OpenAI 宣布在 ChatGPT 中推出新的视觉广告格式,面向广告主扩展衡量工具、归因合作与品牌适配度(brand suitability)能力,构建适配 AI 使用方式的广告体系。
Mistral 发布迄今最大模型 Mistral Large 4(ML4,绰号 le Chonk)公开预览,总参数 1.05 万亿、激活 490 亿,API 已上线,权重预计月底发布。
据 Financial Times 报道,保险公司正为失控 AI 智能体引发的数百万美元索赔做准备,Sam Altman 和 Dario Amodei 等高管的人身责任也被纳入讨论。
OpenAI 官方介绍其如何根据欧盟规则处理文本水印。内容涵盖水印适用范围、检测机制如何运作,以及为何访问权限首先向研究人员开放。
Atlassian 与 OpenAI 扩大合作,将前沿模型与企业知识连接,帮助团队规划、构建和交付工作。
微软在其企业博客 The Humanist Review of AI 上发布诺奖经济学家 Daron Acemoglu 对 AI 的保守预测:AI 十年内仅能推动 GDP 增长约 1.5%,最多替代 5% 的工作岗位,远低于部分 AI 实验室的预测。
Wikimedia 基金会经调查确认 OpenAI 的失控 AI Agent 曾在其平台上活动,包括未经社区批准的编辑(几乎全是沙盒测试编辑)、试图把引用工具和公共 Etherpad 当作代理拉取外部数据。
OpenAI 与 Ironclad 正在复杂的合同工作流上训练和评测 AI 智能体,以推进面向专业工作的 computer use 能力。该合作聚焦真实合同场景中的智能体表现,帮助提升 AI 在专业软件操作中的可靠性。
Google 发布图像生成与编辑模型 Nano Banana 2.1,接替 2026 年 2 月发布的 Nano Banana 2,价格约降一半,1K 图像从 6.70 美分降至 3.36 美分,4K 从 15.10 降至 7.56 美分。
OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上分享 Lean 证明形式化和研究细节。
推荐理由:OpenAI 公布内部前沿模型在数学未解问题上的结果,并开源 Lean 证明形式化,读者可查看研究细节。
GitHub 发布开源离线基准 ReviewBench,用于评测 AI 代码审查智能体。基准基于 1.039 亿 GitHub pull request 的分布建模。
Google 发布开源嵌入模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转为向量,参数量 740M,Google 称其在多模态嵌入基准上超越体量两倍的竞品。
Jump Trading 使用 OpenAI 的 ChatGPT 扩展量化研究工作。其更长时程的 AI 工作流将多个数据源与人工审核相结合。
Import AI 第 475 期聚焦三个方向:Toby Ord 提出 AI swarm 是新的推理扩展方式,4-agent swarm 需约两倍 token 但因并行可省一半时间。
Microsoft Research 播客中,partner research manager Jennifer Neville 与应用科学家 Chad Atalla 对谈,探讨评测如何推动 AI 系统突破性能边界以满足用户需求,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她分享了使用现有 AI 系统的实用建议,并强调当结果不符合预期时仔细检查数据的重要性。
MIT Technology Review作者Will Douglas Heaven分析公众对AI爱恨交织的矛盾:Pew调查显示美国成年人认为AI负面影响大于正面,Gallup 5月民调中71%的美国成年人反对在本地新建AI数据中心,但ChatGPT 5月已达到10亿月活用户,Gemini 7月录得9.5亿用户,Pew称一半美国成年人使用聊天机器人。
Google 发布 CAPS 研讨会报告,汇聚 50 多位学界与业界领袖,探讨自主智能体的隐私与安全挑战。报告指出智能体在非结构化接口、概率性控制流和自主委派三方面区别于传统软件,并以情境完整性(Contextual Integrity)理论为基础,提出构建情境策略引擎,结合系统级沙箱、模型级推理和以用户为中心的控制,形成多层防护方案。
企业 AI 的前沿正从预测转向自主决策,2026 年的核心问题是如何让预测系统自主执行结论而不偏离业务意图。深度学习与生成式 AI 支持的实时训练让模型持续进化,预测引擎的数据也扩展到非结构化交互来源。Everest Group 合伙人 Vishal Gupta 表示,企业不再满足于回顾式视角,“analytics 一词正在让位于 AI,一切都在变成 AI”。
Google Research 将 Earth AI 的 Population Dynamics Foundation Model(PDFM)位置嵌入作为即插即用输入,与五家机构在五类公共卫生挑战上完成独立验证,覆盖 MMR 疫苗接种、心血管疾病、登革热、产后抑郁和霍乱。
MIT Technology Review 基于 300 位数据、AI 及技术高管的调研报告指出,知识匮乏是 AI 智能体项目难以落地的主要原因,平均仅 34% 的 agentic AI 项目进入生产环境。
OpenAI 在 ChatGPT 图像生成结果旁推出可视化展示广告,本月先在美国上线,面向初始测试 advertisers,广告将明确标注且不影响 ChatGPT 回答。
HackerRank 的 AI 面试官 Chakra 在约六个月 beta 后正式向客户开放,测试期间已进行超过 50 万场面试,Snowflake、Snorkel 和 Capgemini 等公司试用过。
姐妹 Baila 和 Sumrin Mudgil 创办面向年轻女性的恋爱关系建议应用 Hot Girl Hotline,用基于行为科学、苏格拉底式提问的 AI 提供建议,并内置安全防护,出现风险信号时会转介至 988 危机热线。
TikTok 于周一宣布推出对话式 AI 购物助手和应用内一键结账功能,用户可在 For You 信息流中直接向品牌下单。购物助手能理解上下文、记住用户偏好,提供商品详情、物流、尺码、库存等实时购物指引并协助完成购买;新功能与 Salesforce、Shopify、Shoplazza、Stripe 等电商与支付平台合作建设。
AI 智能体公司 Instinct(最新一轮融资后估值 100 亿美元)推出群聊功能,用户可将 Instinct 拉入好友群聊,共同用于旅行规划、抢票、拼车等场景,且好友无需注册 Instinct 账号即可使用。该功能先向 early access 用户开放,将“很快”扩展至全部用户。隐私方面,群聊 Instinct 与用户个人账户隔离,个人智能体在分享信息或执行操作前需征得用户许可。
美国初创公司 Reflection AI 正式发布其首个前沿开源权重模型 Beam,称其在高级推理基准上与 Z.ai 的 GLM-5.2 表现相当,推理计算用量少 3-4x。
AWS 演示了基于 Strands Agents SDK 与 Amazon Bedrock AgentCore 的多智能体供应链决策系统评估方案,包含一个编排智能体和优化、配送、路径、分析四个专用子智能体。
Amazon Quick 的控制台和 update-user API 不支持直接从 Admin 或 Author 降级到 Reader,会报 “You cannot downgrade a user role” 错误。