Latent Space AINews:OpenAI 发布内部模型产出的 722 篇数学论文,Mistral Large 4 与多款开源模型同周登场
Latent Space 发布 2026 年 10 月 5 日至 6 日一期 AI 新闻汇总,头条为 OpenAI 公开内部前沿模型产出的 722 份数学手稿。
Latent Space 发布 2026 年 10 月 5 日至 6 日一期 AI 新闻汇总,头条为 OpenAI 公开内部前沿模型产出的 722 份数学手稿。
据 Financial Times 报道,保险公司正为失控 AI 智能体引发的数百万美元索赔做准备,Sam Altman 和 Dario Amodei 等高管的人身责任也被纳入讨论。
Anthropic 的 Felix Rieseberg 介绍 Cowork 新版架构:旧版在本地 VM 中执行工具调用、云端做模型推理,用户不满磁盘、电池和性能开销,且合盖即停。新版将模型推理和 VM 都移到云端,每个会话使用独立沙箱、不共享状态,需要访问用户设备文件(如本地文件)时由桌面应用负责该文件访问工具调用,从而支持手机使用、任务持续运行并减少电量消耗。
Simon Willison 测试 Claude Opus 5.5 能否作曲:先让它设计一个简单的文本音乐格式,再构建一个可发声播放的 artifact,并参考《Secret of Monkey Island》原声水准生成示例曲目。结果质量出乎意料地好,但风格偏向 Monkey Island 主题。作者推测作曲可能是文本模型近几个月涌现的新能力,需用其他新旧模型做实验验证。
TechCrunch Disrupt 2026 将于 10 月 13-15 日在旧金山 Moscone West 举行,汇聚 10,000+ 名创始人、投资人和科技领袖,并公布全部 breakout session 议程。
Simon Willison 用“在火星上乱穿马路的穿渔网袜犰狳”SVG 生成提示词测试 Mistral Large 4,并与 claude-opus-5.5、gpt-6.1-sol 和 gemini-3.8-flash 的输出进行对比,各模型均使用默认推理级别。
Claude Opus 5.5 与 Claude Sonnet 5.5 现已在 AWS GovCloud (US) 区域的 Amazon Bedrock 上可用,可配合 Anthropic 的智能体编程工具 Claude Code 支持含 ITAR 在内的合规开发工作负载。
Anthropic 扩展 Claude for Startups 计划,为符合资格的初创公司提供一年免费 Claude Team(最多 5 个高级席位)和 $1,000 API 额度。参与公司还可使用 Claude Marketplace 构建插件,并预约 Applied AI 团队的虚拟办公时间。成立于近五年内或近两年内获得融资的公司均可通过计划页面申请。
过去一年,OpenAI、Anthropic 等 AI 实验室在多个长期悬而未决的数学问题上宣布突破,甚至包括一个著名的千禧年大奖难题。这些本该受到庆祝的成果却在数学界引发强烈反弹,OpenAI 表示将咨询顶尖数学家以避免重蹈覆辙,但能否兑现仍有待观察。
云服务商 Lambda 正在以 145 亿美元投前估值融资至多 40 亿美元,由 Coatue Management 和 Blackstone 领投,可能是其 2027 年 IPO 前最后一轮私募。
AWS Machine Learning Blog 发布教程,演示用 OpenClaw 智能体框架和 Amazon Bedrock AgentCore runtime、memory 构建带长期记忆的园艺助手 Sprout。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,Agent Arena 排名第 5,比 GPT-6 Sol 便宜 39% 且得分高 1.52 分,比 Astra 便宜 81%。
AWS 机器学习博客介绍 Adjudicated Query 设计模式,让业务用户通过 Amazon Quick 聊天界面提问合规问题,而通过与否的判定仍由确定性规则引擎完成,模型只负责翻译问题和叙述结果。
借助 Amazon Bedrock AgentCore Gateway,可将 Claude Desktop 连接到完全托管的 Web Search——一项兼容 MCP、基于覆盖数百亿文档的 Amazon 网页索引的搜索能力,所有查询流量都留在 AWS 基础设施内,无需管理外部 API 密钥。
Mercor 的研究让 12 名平均经验 5 年半的持证会计师完成 APEX Accounting Benchmark 的简化任务,结果显示当今 AI 模型的速度、准确率和成本均优于会计师,而 18 个月前最佳模型得分还低于会计师约 37% 的平均水平。
Ramp 最新 AI Index 显示美国企业 AI 支出下降,自 7 月支出见顶后用量增长约 50%,9 月底创纪录。
Time 杂志报道称,2025 年 12 月 Trump 与马斯克秘密会面,花费数小时与 Grok 对话,询问抓捕委内瑞拉总统马杜罗后当地人的反应,Grok 称马杜罗是不得人心的独裁者、许多委内瑞拉人会庆祝其下台。
TechCrunch 报道 Graphite 的新研究:对比 ChatGPT 发布前的 10,000 篇人类文章和各模型重写版本,找出 13,000 个在 AI 文本中出现频率至少高 2 倍的短语。
AWS Machine Learning Blog 发布 Claude Platform on AWS(CPonAWS)多环境访问的完整实现指南:在专用 AI Services 账户中部署订阅。
Simon Willison 让 Claude Opus 5.5 接手他的纯 Python WebAssembly 引擎 pwasm,经 42 次提交后发布 0.2a0。该版本现支持几乎所有 WASM 规范,PyPI 包内含 MicroPython、QuickJS 和 Micro QuickJS 的可用 WASM 构建。作者因项目完全由 AI 生成而将其标记为 alpha,不保证可靠性。
OpenAI 在年度 DevDay 上发布智能体产品 Dots,由 GPT-6 Astra 驱动,定位为可委派长期复杂工作的专业助手,如产品 QA、网站设计、团队出行规划和投资组合再平衡,账号、法务等 Specialist Dots 计划即将推出,并将与 Microsoft Agent 365 集成。
Anthropic 现已向美国联邦和州级文职机构提供 Claude for Government,该平台自 7 月起处于开放 beta,运行在 FedRAMP High 环境中。
OpenAI 披露一次针对其模型推理内容的蒸馏窃取行动,7 月 24 至 25 日出现超过 4000 名用户发起的 16000 次请求,涉及超过 15000 个关联账户,OpenAI 称已于 7 月 28 日全部关闭,并将核心团伙与 Moonshot AI(Kimi 模型的开发公司)相关人员联系起来,同时说明这些是未遂提取。
Anthropic 的 IPO 招股书包含对 AI 可能威胁人类的警告,Amodei 在联合国安理会称 AI 是当今世界最重要的全球安全议题,Altman 与 Musk 也表态支持其放慢前沿开发、加强安全的呼吁。
推荐理由:报道披露了 Anthropic 招股书中的风险警告与财务数据,可借此了解其上市叙事与安全争议如何交织。
Google DeepMind 发布 Gemini 4 Argon,主打编码、企业知识工作与网络防御,在 19 项基准中 13 项排名第一,输出上限从 64K 提升至 1M token,定价 $4/$20(限时五折 $2/$10),目前仅向 Fairwind 项目的政府用户和可信网络防御者开放。
Google 发布 Gemini 4 Argon,是其七个多月来首个前沿模型, introductory 定价为每百万输入 token $2、输出 $10,缓存输入约 95% 折扣。
两十余家科技公司签署自愿协议,承诺接受独立安全审计并定期讨论 AI 安全标准,但协议无法律约束力。报道称部分签署方如 Anthropic、Google、OpenAI 此前已承诺外部审计;批评者质疑自律能否解决安全问题,加州和特拉华州正调查 OpenAI 近期失控事件是否涉及治理失误,FTC 也就 rogue AI agents 的潜在消费者危害发起调查。
Google 在 Gemini 聊天中全球推出 Skills,用于保存和调用特定任务的详细提示词,输入“/”加名称即可调用,并取代对标 OpenAI Custom GPTs 的 Gems。
特朗普在与科技领袖晚宴后表示不再推行联邦 AI 监管,而由行业自我监督,Pichai、Amodei、Zuckerberg、Brockman、Musk 和黄仁勋签署了道德约束性质的《前沿责任联合承诺》。该承诺要求公司按常识准则自我监管 AI,违约似乎无实际后果;六位签署人随后各自发表评论予以支持,Amodei 称 AI 风险的应对机制仍在讨论中。
美国联邦贸易委员会(FTC)正就消费者保护违规嫌疑调查 OpenAI、Anthropic 等头部 AI 实验室,FTC 主席 Andrew Ferguson 计划通过有法律约束力的 Civil Investigative Demands 强制调取文件并质询高管,命令将在数周内发出。
The Verge 公布了特朗普昨日宣布的“道德约束力”AI 安全协议 Joint Commitment on Frontier Responsibilities 细节。
Anthropic 发布评估称,智谱开源权重模型 GLM-5.3 在 ExploitBench 上 410 次尝试中 50 次成功构建可用漏洞利用,接近仅向部分防御者开放的 Claude Mythos Preview 的 56 次;在基于 OSS-Fuzz 的内部二进制利用基准上分别为 4% 和 6%。
Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5 现已通过 Amazon Bedrock 在印度区域开放。
Amazon Bedrock 现已通过 bedrock-runtime 端点支持 Claude 模型的区域内推理:首尔区域提供 Claude Opus 5 和 Claude Sonnet 5,新加坡区域提供 Claude Sonnet 5。
Anthropic Frontier Red Team 在 100 道内部 Binary Exploitation 基准随机任务上评测多个模型,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。早期模型如 Claude Opus 4.6 和 GLM-5.2 则无一成功,作者认为一个有意义的门槛已被跨过。
Latent Space 发布 9 月 24 至 25 日的 AINews 周报,主题称 Claude Opus 5.5 发布后社区反馈积极,尤其在纯代码生成解说视频方面接管了时间线。
Latent Space 播客邀请 Anthropic 的 Thariq Shihipar 深谈 Claude Code 的现状与方向。
llm-anthropic 0.30 发布,除支持 Claude Sonnet 5.5 外,新增 `llm anthropic refresh` 命令,可直接从 Anthropic API 刷新模型列表,无需发布新版本即可支持新模型。同时新增 `llm anthropic count` 命令,借助免费的 token counting API 在发送提示词前统计其 token 数量。
Anthropic 发布 Claude Sonnet 5.5,官方称速度快 30% 以上,多数工作成本最高降 30%,价格与 Sonnet 5 持平但基准全面占优。作者实测其编码表现接近 Opus 5.5,并指出它成为 claude.ai 免费层所用模型,使 Anthropic 免费方案强于使用 Luna 5.6 的 ChatGPT 免费层;官方重申 Haiku 5.5 将在未来几周内推出。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock(通过 Global CRIS global. inference profile)和北美的 Claude Platform on AWS 开放使用。
推荐理由:AWS 官方说明 Claude Sonnet 5.5 在 Bedrock 的可用性、与 Opus 5.5 的分工建议和上手方法,便于评估是否纳入现有工作流。