GitHub 发布开源基准 ReviewBench 用于评测 AI 代码审查
GitHub 发布开源离线基准 ReviewBench,用于评测 AI 代码审查智能体。基准基于 1.039 亿 GitHub pull request 的分布建模。
GitHub 发布开源离线基准 ReviewBench,用于评测 AI 代码审查智能体。基准基于 1.039 亿 GitHub pull request 的分布建模。
Claude Opus 5.5 与 Claude Sonnet 5.5 现已在 AWS GovCloud (US) 区域的 Amazon Bedrock 上可用,可配合 Anthropic 的智能体编程工具 Claude Code 支持含 ITAR 在内的合规开发工作负载。
Z.ai(智谱)的 GLM 5.3 现已登陆 Amazon Bedrock,这是一个 753B 参数的 MoE 模型,面向编码和长程智能体任务,Z.ai 报告其在 CyberGym 基准上取得 84.5 的领先分数,并在内部编码基准上较 GLM 5.2 提升 50%。
Mistral 发布 Mistral Large 4(ML4)公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,权重将于本月底开放下载。
推荐理由:官方发布了参数规模、基准分数、训练基础设施和权重开放时间表,读者可据此评估它在开源阵营中的实际位置。
OpenAI 发布 GPT-6 系列模型指南,帮助初创企业选择合适的 GPT-6 模型、调节推理力度(reasoning effort)。内容涵盖改进提示词与技能、协调工具调用,以及为生产环境准备工作流。
AI 正在改变开发者工作方式,GitHub 博客提出三项值得强化的技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的第一个答案(如让第二个模型批评第一个模型的输出,类似 Copilot 的 Rubber Duck agent)、把省下的实现时间用于理解客户需求和技术决策。随着 AI 承担更多实现工作,技术判断力和权衡取舍能力变得更重要。
Chatham Financial 使用 Codex 和 GPT-5.6 构建技术并重新设计工作流程,将交易验证时间从 30 分钟缩短到 4 分钟以内,以此扩展其资本市场专业能力。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,定价为每百万输入 token $2、输出 token $10,缓存输入 95% 折扣。
推荐理由:官方博客给出定价、1M 输出 token 上限、基准分数和内部迁移案例,读者可以据此判断它在编程与安全防御上的实际定位。
AMD 推出面向嵌入式开发全流程的智能体 AI 助手 AMD Ross™,覆盖架构设计、优化、调试、PCB 设计、原理图审查、软件与部署。它通过 MCP 服务器连接 AMD Embedded 工具,并内置 AMD Knowledge Base、专家编写的 agent skills 和可运行设计示例,支持自然语言查询文档、执行命令和自动化工作流。
GPT-6.1 Sol 在 Amazon Bedrock 正式可用,聚焦智能体编码、计算机操作和专业工作负载的更强推理能力。据 OpenAI 称,其 DeepSWE v1.1 成绩与 GPT-6 Astra 相当且每任务成本约为五分之一,超过 GPT-6 Sol 最佳成绩 6.4 个百分点;在透明度、用户意图和显式限制评估中也优于 GPT-6 Sol。
推荐理由:官方公告给出了与 GPT-6 Sol 和 GPT-6 Astra 的具体对比数据,可帮助读者评估其智能体工作场景的性价比。
OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作场景,智能水平接近 Astra,API 输入和输出 token 价格为 Astra 标准价的五分之一。
推荐理由:原文给出了 GPT-6.1 Sol 的定位和价格对比,读者可以据此评估它相对 Astra 的成本优势。
OpenAI DevDay 2026 发布超过 20 项公告,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全以及面向开发者的新工具。GPT-6 Astra 是本次大会的核心发布之一。这些更新面向构建者生态,通过 API 与工具形式提供。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上可用,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四档推理力度。
推荐理由:原文给出 Bedrock 上的接入方式、推理档位配置和成本权衡,读者可直接据此规划调用与费用。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock(通过 Global CRIS global. inference profile)和北美的 Claude Platform on AWS 开放使用。
推荐理由:AWS 官方说明 Claude Sonnet 5.5 在 Bedrock 的可用性、与 Opus 5.5 的分工建议和上手方法,便于评估是否纳入现有工作流。
OpenAI 正在征集使用 Codex 的开发者、研究者与创作者的真实故事,寻找下一批 Codex Originals 计划的参与者。用户可提交自己的故事和项目,入选者将展示用 Codex 完成的创造性成果。
Basis 实测中,GPT-6 Astra 完成 50 个标签页的税务工作簿的速度是 GPT-5.6 Sol 的 2 倍。其更强的用户意图理解能力让 Basis 在实际使用中更有信心。
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 构建和运营现代车队管理业务,效率大幅提升。借助这些工具,Proaction 的销售额增长了 60%,节省了 75+ 小时。
GitHub Copilot app 团队重建了 Pull Request 视图,使其能流畅打开一个含 2,200 个文件、超过一百万变更行和 400 多条行内评论的开源 PR。
推荐理由:作者以第一手视角拆解了超大 PR 渲染的双几何架构和自动化测量方法,思路对处理大规模动态内容界面有借鉴意义。
Airbnb 扩大工程师团队对 GPT-6 Astra 和 OpenAI 前沿模型的访问。这些模型将帮助工程团队修复 bug、设计系统并加快交付速度。
GitHub Podcast 逐条拆解五个常见 AI 热门观点。核心结论:AI 生成代码仍需按风险分级审查;Skills 与 MCP 解决不同问题,MCP 提供工具与数据访问标准,Skills 以 Markdown 打包团队流程与最佳实践,两者互补;RAG 未死,检索让模型更接近答案,可与 agent、MCP、Skills 同一工作流共存。
GitHub 作者 Stephen Toub 撰文介绍团队借助 GitHub Copilot 应用与 CLI,把 Copilot agent runtime 从 TypeScript/Node.js 完全重写为 832,378 行生产 Rust,AI 智能体完成了大部分代码,共落成 128 个 pull request,原需一两人年的项目仅由一名开发者在数月内完成。
推荐理由:作者亲历整场迁移,给出代码量、发布节奏与缓存命中率等一手数据,读者可以借此评估智能体主导大型重写的可行路径。
ChatGPT Work 和 Codex 的 analytics 功能可帮助团队了解 AI 使用与支出情况,识别培训需求,并将 AI 采用度与业务成果关联起来。通过这些分析工具,企业能更清晰地衡量 AI 投入带来的实际业务价值。
Perplexity 已信任 GPT-6 Astra 处理端到端系统,包括撰写沟通内容、修改软件和监控生产系统。相比使用早期模型时,Perplexity 现在的人工检查频率大幅降低。
Cognition 的 Devin 引入 GPT-6 Astra 来改进软件测试并验证其可用性。该组合旨在帮助工程师减少代码审查量、交付更多成果。
GitHub Copilot app 新增内置 diff、终端和浏览器三个面板,让你在不离开应用的情况下审查智能体代码改动、运行命令并预览效果。diff 面板以绿红高亮显示增删行,可接受更改、留言或让 Copilot 修改;终端面板支持运行 npm run dev 等脚本并开启多个窗口;浏览器面板通过 Pick & Polish 工具选中元素并配合智能体调整。
César de la Fuente 实验室使用 Codex 和 ChatGPT 在现存与已灭绝物种的基因组中搜索抗菌候选分子,以对抗耐药性感染。
Mistral AI 帮助一家欧洲能源运营商把 40,000 行 Fortran 77 储层模拟器代码迁移到 C++,并复盘了方法。
一位 MIT 研究者使用 GPT-5.6 Sol 搭配 Codex,自主运行量子计算实验、分析结果并校准 qubit。
1Password 的工程师使用 OpenAI 的 Codex 快速构建新功能和内部工具,在保持严格安全策略的同时达到生产可用水平,工程效率提升 21%。
GitHub 在 GitHub Copilot CLI 推出 Project HydraFusion 研究预览,通过运行时多模型编排,按任务在 Single、Cascade、Critique 三种执行模式中选择,并调用跨供应商模型完成起草、审查、修订或升级。
推荐理由:原文给出三套执行模式、具体基准对比和开放步骤,读者可以据此评估多模型编排对自己编码工作流的成本与质量影响。
GitHub Copilot app 支持并行运行多个 AI 智能体会话,各会话基于独立 Git worktree 隔离运行,互不干扰且保留各自上下文。用户可在 sessions 视图中追踪进度,随时切换会话而无需重新说明背景。文中以 tailspin-toys 仓库为例,演示了同时执行新增功能、无障碍审查和运行测试三项任务。
Hugging Face 博客作者用 TRL 和 OpenEnv 开源复现 Surya Narreddi 的思路,训练 Qwen/Qwen3.5-35B-A3B 写 p5.brush 代码画水彩。
推荐理由:作者把训练配方、环境、参考池和模型全部开源,读者可以按一条命令复现整个流程并借鉴排查经验。
Hugging Face 发布开源工具 funes,把本机已有的智能体会话记录建为可检索记忆,支持 Claude Code、Codex、pi 和 Hermes。它本地完成嵌入和重排,无需账号即可使用,也可绑定到私有的 Hugging Face 数据集跨机器同步。在 handoff-vs-recall 基准上,recall 比写交接文档分别便宜 8x 和 4x。
推荐理由:Hugging Face 官方开源的记忆层工具,给出了安装方式和基准对比,读者可以评估它能否复用现有编码智能体的会话记录。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
推荐理由:官方给出两个变体的基准数字、定价和实际应用案例,读者可以据此评估在编码与安全场景中的替换成本。
IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密解码器模型,基于 Granite 4.1 基座(从头在约 15T token 上预训练,五阶段策略将上下文扩展至 512K),经 SFT 与多阶段 GRPO 强化学习后训练,全部以 Apache 2.0 许可开源。
推荐理由:官方完整披露从预训练、SFT 到多阶段 GRPO 和智能体 RL 的训练细节,可迁移到类似模型的构建流程。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和 Agent 的主力模型,距 Gemini 3.6 Flash 仅三周。
推荐理由:官方公告给出了多个基准分数和半价定价细节,读者可以据此评估是否切换到 3.7 Flash。
Meta 今日发布 30B 参数多模态开源模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地部署的隐私场景与编码、文档分析、个人助理等智能体用途。
推荐理由:原文给出架构细节、Agent 基准对比和各推理栈的 day-0 用法,读者可据此评估本地多模态部署的选择。
Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实 harness 内端到端训练。
推荐理由:微软开源了可复用的智能体环境层,并给出三个小模型训练配方,读者可以了解小模型在真实任务上的可达水平。
Berkeley AI Research 提出 ABBEL 框架,用自然语言信念状态替代完整交互历史作为智能体的工作上下文,并引入 belief grading 监督摘要内容。在 CollabBench 协作编程测试中,ABBEL-rec-BG 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 减至 50,峰值上下文 token 长度也显著低于全上下文设置。
Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上输出 token 用量比 3.5 Flash 减少 17%,定价 $1.50/1M 输入、$7.50/1M 输出,DeepSWE 49% vs 37%、OSWorld-Verified 83.0% vs 78.4%。
推荐理由:官方原文给出三款新模型的具体价格、token 效率与多项基准数字,并说明各模型面向的部署场景。