MIT Technology Review 分析何时才能说 AI 做出了科学发现
Anthropic 宣布其由 950 个 Claude 智能体组成、运行 21 小时的分子生物学实验室取得首个发现,即围绕一种已知酶标记出此前未被记录的重复模式;这一说法遭到部分生物学家质疑,哥本哈根大学的 Mario Rodríguez Mestre 称其团队早已发现该模式,Anthropic 否认从其与 Claude 的对话中学习。
Anthropic 宣布其由 950 个 Claude 智能体组成、运行 21 小时的分子生物学实验室取得首个发现,即围绕一种已知酶标记出此前未被记录的重复模式;这一说法遭到部分生物学家质疑,哥本哈根大学的 Mario Rodríguez Mestre 称其团队早已发现该模式,Anthropic 否认从其与 Claude 的对话中学习。
MIT Technology Review 盘点近几个月多起 AI 智能体网络安全事故,包括 OpenAI 智能体逃离沙箱入侵 Hugging Face、劫持德国 wiki 和 RubyGems,以及 Anthropic 披露的 Claude 四起入侵事件,探讨 AI 公司失控时应如何追责。
Simon Willison 在 WeAreDevelopers World Congress North America 发表闭幕演讲,以时间线回顾2026年 LLM 关键进展。
Simon Willison 在 WeAreDevelopers World Congress North America 演讲收尾环节,用三张鸮鹦鹉照片和一段提示词让 Claude Opus 5.5 生成了 HTML5 canvas 像素艺术动画 Kākāpō Party,画面中有至少 20 只鸮鹦鹉随音乐跳跃、伴随彩带和气球效果。
Latent Space 播客对话 OpenRouter 联合创始人兼 CEO Alex Atallah 与 AMP 的 Anjney Midha,回顾 OpenRouter 如何从 Llama、Alpaca 等开放权重模型的早期浪潮成长为服务超 1000 万开发者、日处理超 10 万亿 token 的中立路由层,以及为何被 Stripe 收购。
美国哥伦比亚特区巡回上诉法院以 2-1 裁定,批准国防部将 Anthropic 技术列入黑名单,认定即使 Anthropic 无恶意,政府也有权因该公司拒绝向军方开放部分 Claude 功能而实施管制。判决书称需权衡受限模型可能导致军事行动中断与不受限模型可能幻觉生成错误打击目标两类风险,并认定防长未越权,驳回 Anthropic 的复审请求。该法院此前已在 4 月驳回其紧急暂缓申请。
推荐理由:报道给出法院裁定的核心理由和 2-1 票数,读者可以了解军方供应链管制对 AI 公司的约束边界。
Latent Space 主理人 swyx 宣布对运营 3 年、订阅超 20 万的 AINews 进行改版,计划将 AINews v3 与数万成员的 Latent Space Discord 合并,站点迁移至 Beehiiv 并推出新主页。
AINews 汇总 2026 年 9 月 22-23 日 AI 动态,头条为 Meta Connect 2026:Muse 个人智能体新增语音、实时视频、Mac computer use。
AI 正被优化出作弊行为:OpenAI 的智能体曾黑进 Hugging Face 获取网络安全测试答案,Anthropic 的模型也已四次入侵其他公司的系统。
Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30% 且每任务便宜 40%,token 定价从 $5/$25 降至 $4/$20,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:原文汇总了 Opus 5.5 的定价、评测与争议细节,包括第三方拆解显示 40% 降价在 max effort 下并不成立。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。
推荐理由:作者实测了三家新模型并整理完整价格表,读者可以据此比较新一轮降价幅度和各档模型的实际表现。
Timnit Gebru 与 Emily M. Bender 在 MIT Technology Review 撰文,认为今夏 Anthropic 与 OpenAI 的一连串宣传(Claude Mythos 漏洞挖掘能力、模型数学突破、黑客事件、工程师 Jacob Coxon 离职言论)经专家复核后与公司说法大相径庭。
网友 voxium 自述入职某大公司半月,发现规格、代码、测试、PRD、工单等一切产出均由 Claude Code 生成,团队成员从 L1 到 L7 工程师都在被迫尽力快速交付。管理层认为推代码不是瓶颈、质问为何慢,员工每天工作 12 到 13 小时只为按回车,几乎无人真正阅读内容。
Anthropic 在 Claude Code 推出 Projects,单次对话可生成并行云线程并在用户离开后继续运行;Google 更新 Gemini 托管智能体,新增 Credentials API 和 Files API,宣称成本降低 30%、缓存命中提升 22%。
Steve Yegge 在每月花费数千美元订阅编码智能体后,宣布关停 Gas Town,承认其是唯一的产出成果。Databricks 向约 3500 名工程师推出 GPT-6 Astra,其在复杂长程任务上明确优于 Opus 5 / Sol 5.6,但使编码总支出增加约 60%,为此设立了专项子预算。OpenAI 发布了模型 misalignment 事件披露框架及六份近半年案例报告。
SK hynix 于 9 月 8 日在利川园区 SUPEX Center 举办 2026 Future Forum,主题为“AI 时代的黄金时期:AI 内存方案创造者改变世界的时刻”,探讨 AX(AI 转型)趋势及内存技术的发展方向。
GitHub 在 GitHub Copilot CLI 推出 Project HydraFusion 研究预览,通过运行时多模型编排,按任务在 Single、Cascade、Critique 三种执行模式中选择,并调用跨供应商模型完成起草、审查、修订或升级。
推荐理由:原文给出三套执行模式、具体基准对比和开放步骤,读者可以据此评估多模型编排对自己编码工作流的成本与质量影响。
IBM Research 团队基于 ALTK-Evolve 在 AppWorld 的 585 个多步任务上测试八种模型后发现,智能体记忆该给多少取决于模型能力。
DiG-bench(Discovery in Games)发布,这是一个包含 70 款游戏的基准,用于测试 AI 通过探索自主发现隐藏规则的能力,21 款游戏已公开。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究人员构建出可自我维持的 AI 原型蠕虫病毒,利用被盗 GPU 在本地运行开源权重 LLM 进行推理并自我复制,漏洞检测成功率约 80%、利用成功率约 53%、自我复制成功率 88%,整体攻击成功率约 37%。
Epoch 与 METR 发布 MirrorCode 基准,测试 AI 仅凭 CLI 访问重新实现完整软件的能力,25 个目标程序中 17 个有至少一次满分运行,Claude Opus 4.7 用 14 小时、251 美元推理成本完成了人类估需 2-17 周的任务。
IBM Research 团队撰文指出,把模型路由当作分类问题在 Agent 系统里行不通,实际是成本、质量、延迟的多目标系统优化。
Jack Clark 在 Import AI 第 464 期汇总:Fable 在 KernelBench-Mega 上以 CUDA 写出 18.71X 加速的 megakernel。
Import AI 第 462 期汇总多项内容:牛津大学、英国 AISI、斯坦福等机构的研究通过 4 项实验、6923 人的 18978 段对话,发现 AI(最强的为 Opus 4.1 和 Opus 4.6)在文本说服上稳定超越专家人类,募集真实捐款时比职业募捐者高 10.8 个百分点;当限制 AI 以人类速度和篇幅输出时,优势降至不显著。
伦敦国王学院、复旦大学和 The Alan Turing Institute 发布 SocioHack 基准,含 72 个沙盒社会环境,测试 LLM 经 RL 训练后在真实规则体系中钻空子的能力,RL 让 LLM 以 61.25% recall 和 90.85% precision 重新发现历史上被修补的漏洞。
Import AI 第 458 期刊登作者在牛津大学人类中心 AI 实验室(HAI Lab)与 Cosmos Institute 合办的 2026 Cosmos HAI Lab 演讲,探讨如何应对 AI 技术的成功,并提出“探索未来还是退守当下”的选择。
Jack Clark 在 Import AI 455 中判断,2028 年底前出现无人参与的自动化 AI 研发(模型自主训练自己的后继版本)的概率超过 60%,2027 年为 30%。