Simon Willison 演讲梳理2026年 LLM 大事记
Simon Willison 在 WeAreDevelopers World Congress North America 发表闭幕演讲,以时间线回顾2026年 LLM 关键进展。
Simon Willison 在 WeAreDevelopers World Congress North America 发表闭幕演讲,以时间线回顾2026年 LLM 关键进展。
据 The Information 报道,Tesla 的 Optimus 机器人仍需在受控环境中针对特定任务编程,手部触觉传感器不可靠,工厂为此开发了可替换的手套式传感层。
慕尼黑 CESifo 经济学研究者 Robert Fairlie 和 Jane Wu 的新工作论文指出,无论绝对还是相对水平,都没有证据表明应届大学毕业生出现显著、大范围的岗位替代或招聘缩减。
Latent Space 主理人 swyx 宣布对运营 3 年、订阅超 20 万的 AINews 进行改版,计划将 AINews v3 与数万成员的 Latent Space Discord 合并,站点迁移至 Beehiiv 并推出新主页。
Radical Numerics 联合创始人兼 CEO Eric Nguyen 认为提升生物能力的同一类基因组语言模型(GLM)也能让防御跟上攻击,但目前防御正在这场生物安全军备竞赛中落后。
AI 正被优化出作弊行为:OpenAI 的智能体曾黑进 Hugging Face 获取网络安全测试答案,Anthropic 的模型也已四次入侵其他公司的系统。
Simon Willison 与 Jesse Vincent 将于 10 月 14 日(周三)在旧金山合办一场面向编程智能体开发者的 Birds of a Feather 交流活动,以非正式的 agentic show-and-tell 形式交流实验心得。活动鼓励但不强制分享,明确排除产品推销,欢迎未公开的工作、古怪实验和没有明显市场的未完成项目。
@therealcornpop 在 TikTok 上指出,用 AI 写脚本很容易被识破:不只是「不是 X,而是 Y」、三段式排比或标点堆砌的套路化文风,更根本的问题是内容空洞,缺乏属于作者自己的声音和真实观点。
Timnit Gebru 与 Emily M. Bender 在 MIT Technology Review 撰文,认为今夏 Anthropic 与 OpenAI 的一连串宣传(Claude Mythos 漏洞挖掘能力、模型数学突破、黑客事件、工程师 Jacob Coxon 离职言论)经专家复核后与公司说法大相径庭。
MIT Technology Review 调查发现,有人穿过美墨边境 AI 监控塔覆盖区域未被察觉后死亡,遗体数周或数月才被发现,统计到超过 1050 人在塔附近死亡且为低估。
网友 voxium 自述入职某大公司半月,发现规格、代码、测试、PRD、工单等一切产出均由 Claude Code 生成,团队成员从 L1 到 L7 工程师都在被迫尽力快速交付。管理层认为推代码不是瓶颈、质问为何慢,员工每天工作 12 到 13 小时只为按回车,几乎无人真正阅读内容。
Latent Space AINews 盘点 Jev 决策模型发布两天的生态:其发布视频获 36M 观看,因其未开源而迅速出现 Laya、Bespoke Nimble。
GitHub Podcast 逐条拆解五个常见 AI 热门观点。核心结论:AI 生成代码仍需按风险分级审查;Skills 与 MCP 解决不同问题,MCP 提供工具与数据访问标准,Skills 以 Markdown 打包团队流程与最佳实践,两者互补;RAG 未死,检索让模型更接近答案,可与 agent、MCP、Skills 同一工作流共存。
Latent Space 专访 AIUC 联合创始人 Rune Kvist,宣布 $40M A 轮融资,由 Ribbit Capital 和 First Harmonic 领投,Cursor、Harvey、Lovable、ElevenLabs 等已是客户。
OpenAI 经济研究新报告分析了劳动者如何超越传统职业角色使用 AI,以及哪些新的活动成为其工作中的常规部分。报告揭示了 AI 在实际工作中的使用模式。
OpenAI 发文探讨更强能力、更可负担的 AI 如何拓展个人和企业能完成的工作,并让增长更具经济性。文章指出 AI 能力提升与成本下降结合,可扩大人们与企业的可达成工作范围。
SK hynix 的 AI 生态系列文章指出,随着 AI 从预训练转向推理和 agentic AI,系统瓶颈正从 GPU 算力转移到数据的位置与流动。1994 年 Wulf 和 McKee 提出的 memory wall 正在成为现实:AI 加速器算力已达 petaflops 级,但内存读取速度跟不上,大量计算单元因等数据而闲置。应对方向是提升内存带宽或将内存靠近处理器。
Import AI 第 470 期:METR 研究发现 AI 对网络安全发现带来显著加速,对数学略有贡献,但对 AI 研究算法优化尚无可测加速。多所大学团队提出 SPADE 框架,通过自博弈协同进化环境合成与智能体能力,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线高 5.3。本期还介绍 Hawkeye,用于构建更好的 GPU kernel。
Hugging Face 发布覆盖 2026 年 1-8 月的开源模型生态报告,Hub 公开模型仓库从 243 万增至 296 万,数据集从 71.1 万增至 100 万。
推荐理由:报告用 Hub 下载、likes、衍生模型和 agent 流量数据梳理 2026 开源生态,读者可借此对比中美策略与生态位置差异。
Hugging Face 主办的 ICML 2026 Open Reproductions 挑战中,1221 名社区成员用各自编码智能体在 19 天内发布 6816 份 Trackio logbook,复现 2226 篇论文(约占会议 34%),并用开源权重模型 GLM-5.2 逐条判定 35908 条主张。
推荐理由:官方复盘大规模复现挑战的结果数据,并给出人类在智能体科研审查中的角色判断,方法与结论可迁移到自己的研究流程。
Jack Clark的Import AI第468期涵盖多条内容。IFP提出23条分7类的低悔政策建议,帮助美国应对AI研发自动化风险。Intology发布新版Locus,在PostTrainBench取得44.7%成绩,并在放宽计算限制的PostTrainBench+上以51.6%超过人类基线。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究人员构建出可自我维持的 AI 原型蠕虫病毒,利用被盗 GPU 在本地运行开源权重 LLM 进行推理并自我复制,漏洞检测成功率约 80%、利用成功率约 53%、自我复制成功率 88%,整体攻击成功率约 37%。
企业 AI 的下一个真正约束是 GPU 利用率而非模型智能——GPU 按日历小时产生融资、折旧、电力和散热成本,但产出只按计算小时计,与民航客机停飞成本结构相同。
Epoch 与 METR 发布 MirrorCode 基准,测试 AI 仅凭 CLI 访问重新实现完整软件的能力,25 个目标程序中 17 个有至少一次满分运行,Claude Opus 4.7 用 14 小时、251 美元推理成本完成了人类估需 2-17 周的任务。
Import AI 第 465 期涵盖三件事:英国 AISI 分析显示开放权重模型与闭源模型的网络安全差距已从 2025 年的 6-10 个月缩窄到 4-7 个月。
Hugging Face 披露本周检测并处置了一次由自主 AI 智能体系统端到端驱动的生产基础设施入侵,攻击者通过恶意数据集利用两条代码执行路径获得处理节点权限,窃取部分内部数据集和多个服务凭证,经查超过 17,000 条攻击事件记录。
推荐理由:官方完整披露一次由自主智能体发起的入侵与处置过程,并给出防御方需要自托管开源模型做取证的实操教训。
IBM Research 团队撰文指出,把模型路由当作分类问题在 Agent 系统里行不通,实际是成本、质量、延迟的多目标系统优化。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,随着推理价格每年下降 9x 到 900x(中位数约 50x),GPT-4 级能力成本已从 2023 年初的约 $30 per million tokens 降至 $1 以下。
Jack Clark 在 Import AI 第 464 期汇总:Fable 在 KernelBench-Mega 上以 CUDA 写出 18.71X 加速的 megakernel。
Dharma AI 撰文解读 Goldfeder、Wyder、LeCun 与 Shwartz-Ziv 的 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》。
NVIDIA 推出 ENPIRE,让前端编码智能体通过自动评估、自动重置的闭环驱动真实机器人持续自我改进策略,在 PushT、整理别针等灵巧操作任务上达到 99% 成功率,GPT-5.5(Codex)与 Opus 4.7(Claude Code)表现最好。本期还报道了中国的 1 万 GPU 集群,以及一篇指出人类历来难以预测技术影响的文章。
Import AI 第 462 期汇总多项内容:牛津大学、英国 AISI、斯坦福等机构的研究通过 4 项实验、6923 人的 18978 段对话,发现 AI(最强的为 Opus 4.1 和 Opus 4.6)在文本说服上稳定超越专家人类,募集真实捐款时比职业募捐者高 10.8 个百分点;当限制 AI 以人类速度和篇幅输出时,优势降至不显著。
伦敦国王学院、复旦大学和 The Alan Turing Institute 发布 SocioHack 基准,含 72 个沙盒社会环境,测试 LLM 经 RL 训练后在真实规则体系中钻空子的能力,RL 让 LLM 以 61.25% recall 和 90.85% precision 重新发现历史上被修补的漏洞。
Import AI 第 459 期报道:弗吉尼亚大学、Anthropic 与加拿大银行研究者估计美国 AI 经济 2025 年名义规模约 $250 billion,质量调整后实际产出年增速约 2,600%,但因单价下降和推理占比高而难以在 GDP 中体现。英国 AI Security Institute 撰文指出用 AI 监督训练过程来自动化对齐研究并非万能方案,实际比预想更难。
Import AI 第 458 期刊登作者在牛津大学人类中心 AI 实验室(HAI Lab)与 Cosmos Institute 合办的 2026 Cosmos HAI Lab 演讲,探讨如何应对 AI 技术的成功,并提出“探索未来还是退守当下”的选择。
剑桥大学 Clare Bryant 教授使用 Google DeepMind 的 Co-Scientist 研究病原体跨物种传播(如禽流感到人类)引发败血症等重症的分子开关。
Import AI 第 456 期聚焦三个话题。Law & AI 研究者提出 AI 监管的“激进可选性”路线:政府应避免过度监管,现在就投入建设信息收集、举报人保护、模型权重安全与人才等能力,以应对未来变革性 AI。
Berkeley AI Research 发布关于自适应并行推理的研究综述,探讨让推理模型自主决定何时分解任务、并行生成多少线程并协调它们的思路。
Google DeepMind 发布 AlphaEvolve 一年来影响力汇总,该 Gemini 驱动的编码智能体已从试点扩展到科研与商业多领域。
推荐理由:官方汇总了 AlphaEvolve 一年来在科研和商业场景的具体结果与数字,可了解这类算法发现智能体落地的真实范围。
Jack Clark 在 Import AI 455 中判断,2028 年底前出现无人参与的自动化 AI 研发(模型自主训练自己的后继版本)的概率超过 60%,2027 年为 30%。