跳到正文

#编码

今日 9 条
9月24日周四
  1. GitHub Blog · AI & ML60

    GitHub Copilot app 如何渲染 2200 个文件、超百万行变更的超大 Pull Request

    GitHub Copilot app 团队重建了 Pull Request 视图,使其能流畅打开一个含 2,200 个文件、超过一百万变更行和 400 多条行内评论的开源 PR。

    推荐理由:作者以第一手视角拆解了超大 PR 渲染的双几何架构和自动化测量方法,思路对处理大规模动态内容界面有借鉴意义。

9月23日周三
  1. Latent Space84

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日跟进降价 50% 的 GPT-6 Sol 和 Luna

    Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30% 且每任务便宜 40%,token 定价从 $5/$25 降至 $4/$20,并成为 Claude Code 与 Claude 应用的默认模型。

    推荐理由:原文汇总了 Opus 5.5 的定价、评测与争议细节,包括第三方拆解显示 40% 降价在 max effort 下并不成立。

  2. Simon Willison22

    Simon Willison 将于 10 月 14 日在旧金山主持智能体工程 Birds of a Feather 交流夜

    Simon Willison 与 Jesse Vincent 将于 10 月 14 日(周三)在旧金山合办一场面向编程智能体开发者的 Birds of a Feather 交流活动,以非正式的 agentic show-and-tell 形式交流实验心得。活动鼓励但不强制分享,明确排除产品推销,欢迎未公开的工作、古怪实验和没有明显市场的未完成项目。

9月22日周二
9月21日周一
9月18日周五
  1. GitHub Blog · AI & ML42

    该不该读 AI 生成代码、RAG 死了吗、Skills 会取代 MCP 吗?——GitHub Podcast 逐条拆解热门 AI 观点

    GitHub Podcast 逐条拆解五个常见 AI 热门观点。核心结论:AI 生成代码仍需按风险分级审查;Skills 与 MCP 解决不同问题,MCP 提供工具与数据访问标准,Skills 以 Markdown 打包团队流程与最佳实践,两者互补;RAG 未死,检索让模型更接近答案,可与 agent、MCP、Skills 同一工作流共存。

9月17日周四
  1. Latent Space48

    AI 新闻的现实检验:Steve Yegge 关停 Gas Town,Databricks 使用 Astra 成本增加 60%

    Steve Yegge 在每月花费数千美元订阅编码智能体后,宣布关停 Gas Town,承认其是唯一的产出成果。Databricks 向约 3500 名工程师推出 GPT-6 Astra,其在复杂长程任务上明确优于 Opus 5 / Sol 5.6,但使编码总支出增加约 60%,为此设立了专项子预算。OpenAI 发布了模型 misalignment 事件披露框架及六份近半年案例报告。

  2. GitHub Blog · AI & ML77

    GitHub 用 Copilot 将 Copilot agent runtime 迁移到 83 万行 Rust

    GitHub 作者 Stephen Toub 撰文介绍团队借助 GitHub Copilot 应用与 CLI,把 Copilot agent runtime 从 TypeScript/Node.js 完全重写为 832,378 行生产 Rust,AI 智能体完成了大部分代码,共落成 128 个 pull request,原需一两人年的项目仅由一名开发者在数月内完成。

    推荐理由:作者亲历整场迁移,给出代码量、发布节奏与缓存命中率等一手数据,读者可以借此评估智能体主导大型重写的可行路径。

9月16日周三
9月14日周一
9月12日周六
9月11日周五
  1. GitHub Blog · AI & ML49

    GitHub Copilot app 新手指南:如何使用 diff、终端和浏览器面板

    GitHub Copilot app 新增内置 diff、终端和浏览器三个面板,让你在不离开应用的情况下审查智能体代码改动、运行命令并预览效果。diff 面板以绿红高亮显示增删行,可接受更改、留言或让 Copilot 修改;终端面板支持运行 npm run dev 等脚本并开启多个窗口;浏览器面板通过 Pick & Polish 工具选中元素并配合智能体调整。

9月9日周三
9月8日周二
9月5日周六
  1. GitHub Blog · AI & ML70

    GitHub 发布 Project HydraFusion 研究预览,用多模型编排降低 Copilot 编码成本

    GitHub 在 GitHub Copilot CLI 推出 Project HydraFusion 研究预览,通过运行时多模型编排,按任务在 Single、Cascade、Critique 三种执行模式中选择,并调用跨供应商模型完成起草、审查、修订或升级。

    推荐理由:原文给出三套执行模式、具体基准对比和开放步骤,读者可以据此评估多模型编排对自己编码工作流的成本与质量影响。

9月4日周五
  1. GitHub Blog · AI & ML48

    GitHub Copilot app 新手教程:如何同时运行多个 AI 智能体

    GitHub Copilot app 支持并行运行多个 AI 智能体会话,各会话基于独立 Git worktree 隔离运行,互不干扰且保留各自上下文。用户可在 sessions 视图中追踪进度,随时切换会话而无需重新说明背景。文中以 tailspin-toys 仓库为例,演示了同时执行新增功能、无障碍审查和运行测试三项任务。

9月3日周四
  1. Hugging Face Blog73

    Hugging Face 开源 funes,为 Claude Code 和 Codex 等编码智能体添加本地记忆层

    Hugging Face 发布开源工具 funes,把本机已有的智能体会话记录建为可检索记忆,支持 Claude Code、Codex、pi 和 Hermes。它本地完成嵌入和重排,无需账号即可使用,也可绑定到私有的 Hugging Face 数据集跨机器同步。在 handoff-vs-recall 基准上,recall 比写交接文档分别便宜 8x 和 4x。

    推荐理由:Hugging Face 官方开源的记忆层工具,给出了安装方式和基准对比,读者可以评估它能否复用现有编码智能体的会话记录。

8月25日周二
  1. Hugging Face Blog61

    IBM 发布 Granite 4.2 推理模型家族,详解 15T token 预训练与多阶段 RL 训练管线

    IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密解码器模型,基于 Granite 4.1 基座(从头在约 15T token 上预训练,五阶段策略将上下文扩展至 512K),经 SFT 与多阶段 GRPO 强化学习后训练,全部以 Apache 2.0 许可开源。

    推荐理由:官方完整披露从预训练、SFT 到多阶段 GRPO 和智能体 RL 的训练细节,可迁移到类似模型的构建流程。

8月24日周一
  1. Import AI47

    Import AI 470:机器不该有权利;用 SPADE 自动化环境生成;用 Hawkeye 构建更好的 GPU kernel

    Import AI 第 470 期:METR 研究发现 AI 对网络安全发现带来显著加速,对数学略有贡献,但对 AI 研究算法优化尚无可测加速。多所大学团队提出 SPADE 框架,通过自博弈协同进化环境合成与智能体能力,在 Qwen3-30B-A3B 上使游戏环境套件平均分达 58.3,较基线高 5.3。本期还介绍 Hawkeye,用于构建更好的 GPU kernel。

8月14日周五
8月10日周一
  1. Hugging Face Blog78

    Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景

    Meta 今日发布 30B 参数多模态开源模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地部署的隐私场景与编码、文档分析、个人助理等智能体用途。

    推荐理由:原文给出架构细节、Agent 基准对比和各推理栈的 day-0 用法,读者可据此评估本地多模态部署的选择。

8月4日周二
  1. Microsoft Research73

    Microsoft Research 开源 Orchard 框架,Orchard-SWE 以约 3B 激活参数达 SWE-bench Verified 69.7%

    Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实 harness 内端到端训练。

    推荐理由:微软开源了可复用的智能体环境层,并给出三个小模型训练配方,读者可以了解小模型在真实任务上的可达水平。

7月27日周一
7月26日周日
  1. Berkeley AI Research46

    教 LLM 更新信念状态以实现高效长程交互:Berkeley AI Research 提出 ABBEL 框架

    Berkeley AI Research 提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为智能体的工作上下文,并引入 belief grading 监督摘要内容。在 CollabBench 协作编程测试中,ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,峰值上下文 token 长度也显著低于全上下文设置。

7月21日周二
  1. Google DeepMind76

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

    Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上输出 token 用量比 3.5 Flash 减少 17%,定价 $1.50/1M 输入、$7.50/1M 输出,DeepSWE 49% vs 37%、OSWorld-Verified 83.0% vs 78.4%。

    推荐理由:官方原文给出三款新模型的具体价格、token 效率与多项基准数字,并说明各模型面向的部署场景。

7月17日周五
7月1日周三
5月29日周五
5月28日周四
  1. Mistral AI47

    Mistral 在 AI Now Summit 2026 发布工业工程 AI 方案、Vibe 智能体升级及 Les Ulis 数据中心

    Mistral 在 AI Now Summit 2026 上推出面向工业工程的 AI 全栈方案,并与 Airbus、BMW、ASML 达成合作,覆盖设计、仿真与生产,同时保障数据主权。其智能体产品 Vibe 升级为统一 Agent,可处理长时程多步骤工作,包括深度研究、编码到合并 PR。位于法国 Les Ulis 的 10 MW 推理数据中心计划于 2026 年第三季度启用。

  2. Mistral AI69

    Mistral 将 Le Chat 升级为统一智能体 Vibe,覆盖工作与编码

    Mistral 发布统一 AI 智能体 Vibe,Le Chat 全面升级为 Vibe,原有计划、历史和设置自动迁移。Work Mode 面向长程多步任务,覆盖企业知识搜索、数据分析、文档草稿和定时任务;Code Mode 支持远程编码会话、并行运行和沙箱隔离,并推出 VS Code 扩展和更新版 CLI。

    推荐理由:官方完整公布 Vibe 的 Work 与 Code 双模式、定价和入口,读者可据此评估它对日常工作流和编码流程的影响。

5月22日周五
  1. Mistral AI70

    Mistral 发布 Mistral Medium 3.5 开源权重模型,并在 Vibe 和 Le Chat 推出云端远程 Agent

    Mistral 发布 128B 开源权重旗舰模型 Mistral Medium 3.5(公开预览),融合指令跟随、推理与编码,256k 上下文窗口,SWE-Bench Verified 得分 77.6%,API 定价为每百万输入 token $1.5、输出 token $7.5。

    推荐理由:原文给出模型规格、评测分数、定价和开放权重入口,可据此评估它在自托管和异步编码场景的适用性。

5月20日周三
  1. Google Research62

    Google 发布 ERA 并通过 Gemini for Science 逐步开放 Computational Discovery

    Google 开发的 ERA 研究工具使用 Gemini 编写和优化科学代码,相关论文于今日发表于 Nature。ERA 通过树搜索考虑数千种方案,在基因组学、公共卫生、卫星图像、神经科学、时间序列预测和数学等基准上达到专家级表现。

    推荐理由:原文给出 ERA 在多个学科基准上的表现和八个应用案例,读者可据此了解 AI 辅助科学计算的实际落地方式。

5月16日周六
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,首先推出 3.5 Flash,定位智能体与编码,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上超过 Gemini 3.1 Pro,输出速度为其他前沿模型的 4 倍。

    推荐理由:官方公布了 3.5 Flash 的基准成绩、开放渠道和 Pro 后续计划,读者可以据此评估它在智能体与编码场景的取舍。