GitHub 发布开源基准 ReviewBench 用于评测 AI 代码审查
GitHub 发布开源离线基准 ReviewBench,用于评测 AI 代码审查智能体。基准基于 1.039 亿 GitHub pull request 的分布建模。
GitHub 发布开源离线基准 ReviewBench,用于评测 AI 代码审查智能体。基准基于 1.039 亿 GitHub pull request 的分布建模。
Microsoft Research 播客中,partner research manager Jennifer Neville 与应用科学家 Chad Atalla 对谈,探讨评测如何推动 AI 系统突破性能边界以满足用户需求,以及模型在传统 benchmark 之外测试时出现的“意外失败”。她分享了使用现有 AI 系统的实用建议,并强调当结果不符合预期时仔细检查数据的重要性。
Z.ai(智谱)的 GLM 5.3 现已登陆 Amazon Bedrock,这是一个 753B 参数的 MoE 模型,面向编码和长程智能体任务,Z.ai 报告其在 CyberGym 基准上取得 84.5 的领先分数,并在内部编码基准上较 GLM 5.2 提升 50%。
AWS 介绍国际标准 ISO/IEC 42005:2025 对 AI 系统影响评估的指导,包括如何将其融入企业现有风险、隐私、安全等影响评估流程。标准的 Annex D 提供简化流程、避免重复评估的过程,Annex E 提供独立可用的模板。
Microsoft 与 Hugging Face 发布 ThinkingBox 智能体沙箱和 ThinkingBox-Bench 基准,507 个有状态业务工作流、每任务运行 20 次,用可执行检查评测终端数据库状态与副作用,现已通过 OpenEnv 在 Hugging Face 开放。
推荐理由:原文用可执行的后端状态检查区分了表面成功与真实结果,还给出各模型一致性与成本数据,对评估智能体有直接参考。
AWS Professional Services 构建了一套四智能体模式,基于 Strands Agents SDK 并运行在 Amazon Bedrock AgentCore 上,通过 AgentCore Gateway 以 MCP 工具连接迁移输入与输出系统。
Microsoft Research 开发了一套机器学习系统,为美国大陆 66,935 座变电站提供位置级电网空间天气风险预测,可提前 30-60 分钟预警。
Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5 现已通过 Amazon Bedrock 在印度区域开放。
GPT-6.1 Sol 在 Amazon Bedrock 正式可用,聚焦智能体编码、计算机操作和专业工作负载的更强推理能力。据 OpenAI 称,其 DeepSWE v1.1 成绩与 GPT-6 Astra 相当且每任务成本约为五分之一,超过 GPT-6 Sol 最佳成绩 6.4 个百分点;在透明度、用户意图和显式限制评估中也优于 GPT-6 Sol。
推荐理由:官方公告给出了与 GPT-6 Sol 和 GPT-6 Astra 的具体对比数据,可帮助读者评估其智能体工作场景的性价比。
这篇 AWS 指南逐个讲解 Amazon Quick 各组件的提示词写法。Quick Research 需明确目标、受众与关注领域,可从 Quick Index。
Microsoft Research 推出 Quine,一个包含生物学多模态世界模型和连接科学工具、文献与科研人员的交互框架的研究系统。它与 Broad Institute 合作将其用于胰腺导管腺癌(PDAC)研究,预测并排序可驱动肿瘤细胞状态转变的化合物,湿实验验证了排名靠前的候选化合物,从缩小化合物范围到确定待验证候选只需一个周末。
推荐理由:微软官方介绍 Quine 的架构与 PDAC 癌症研究实测结果,读者可以了解 AI 世界模型如何压缩湿实验迭代周期。
Microsoft Research Asia – Singapore(MSRA – Singapore)于 2025 年 7 月 24 日启用,是 Microsoft 在东南亚的首个研究实验室。
GitHub 官方教程介绍如何在 GitHub Copilot app 中用 canvases 搭建自定义工作流:在 agent 会话中运行 /create-canvas 技能,用自然语言描述工作流、用户可做的操作和 agent 可做的操作,agent 即生成看板、清单、仪表盘等界面并在右侧面板打开。
推荐理由:教程给出 /create-canvas 的三要素写法和双向协作机制,读者可以照着把自己的工作流变成可复用的画布。
AWS 展示了如何在 SageMaker HyperPod 上用开源 RL 框架 SkyRL 训练 Qwen3-VL-8B 视觉语言模型完成视觉迷宫导航任务。基于 VisGym SFT checkpoint,使用 GRPO 后训练将 64 个固定迷宫评测集的解题率从 43.75% 提升到 95% 以上。
Datacor 将 Amazon Quick Sight 集成到其 TrackAbout 解决方案中,为工业气体与焊接分销商提供自助式租赁数据分析,无需提交 IT 工单或等待数天甚至数周的自定义报表。
GitHub Copilot 作者认为聊天不是与 AI 协作的最佳界面,介绍了 GitHub Copilot app 中的 canvas 功能,它是可双向与 agent 通信的全栈小应用,可调用第三方 API 并在本地执行代码。
GitHub Copilot app 团队重建了 Pull Request 视图,使其能流畅打开一个含 2,200 个文件、超过一百万变更行和 400 多条行内评论的开源 PR。
推荐理由:作者以第一手视角拆解了超大 PR 渲染的双几何架构和自动化测量方法,思路对处理大规模动态内容界面有借鉴意义。
Microsoft Research 的研究显示,仅依赖机器人机载 GPU 运行物理 AI 推理会限制性能、续航和可扩展性,将推理卸载到边缘或云端 GPU 可显著改善。
Microsoft Research 的逆合成模型 RetroChimera 在期刊 Nature 发表,并开源了实现与权重。该模型组合基于 Transformer 的 R-SMILES 2 与基于 GNN 的 NeuralLoc 两个子模型,用学习到的重排序策略融合各自预测,覆盖常见与罕见反应类型。
GitHub 作者 Stephen Toub 撰文介绍团队借助 GitHub Copilot 应用与 CLI,把 Copilot agent runtime 从 TypeScript/Node.js 完全重写为 832,378 行生产 Rust,AI 智能体完成了大部分代码,共落成 128 个 pull request,原需一两人年的项目仅由一名开发者在数月内完成。
推荐理由:作者亲历整场迁移,给出代码量、发布节奏与缓存命中率等一手数据,读者可以借此评估智能体主导大型重写的可行路径。
GitHub Copilot app 新增内置 diff、终端和浏览器三个面板,让你在不离开应用的情况下审查智能体代码改动、运行命令并预览效果。diff 面板以绿红高亮显示增删行,可接受更改、留言或让 Copilot 修改;终端面板支持运行 npm run dev 等脚本并开启多个窗口;浏览器面板通过 Pick & Polish 工具选中元素并配合智能体调整。
GitHub Copilot app 支持并行运行多个 AI 智能体会话,各会话基于独立 Git worktree 隔离运行,互不干扰且保留各自上下文。用户可在 sessions 视图中追踪进度,随时切换会话而无需重新说明背景。文中以 tailspin-toys 仓库为例,演示了同时执行新增功能、无障碍审查和运行测试三项任务。
Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash,通过知识蒸馏将十亿参数 GigaPath 编码器压缩为 22M 参数 ViT-S 编码器,在约 50 倍算力降低的情况下性能与原模型差距在 3% 以内。
Microsoft Research 发布 Skala 1.1,其训练数据是上一版本的 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 个排名第一,加权平均误差为 2.8 kcal/mol,且计算成本相当于 meta-GGA 泛函。Skala 现已登陆 CP2K,并正在集成至 Psi4、FHI-aims、ORCA 和 VASP,同时推出跟踪各版本计算性能的动态基准。
Microsoft Research 推出 MindTopo 基准,评估多模态大模型对连通性、封闭、顺序、分离和绳结等拓扑概念的推理与规划能力。测试显示,模型在静态图像识别上表现明显好于交互式规划任务,且两者均远低于人类水平,错误多出在规划阶段丢失结构关系或提出违反物理约束的动作。该基准旨在为机器人和交互环境中的智能体研究提供受控诊断工具。
Microsoft Research 推出研究模型 CARE-X,一个统一胸部 X 光 VLM,基于 SigLIP2-so400M 与 Phi-4-mini-instruct(3.8B),通过辅助头联合训练提供报告生成与带置信度的结构化预测,并用 DAPO 强化学习对齐临床奖励。
Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实 harness 内端到端训练。
推荐理由:微软开源了可复用的智能体环境层,并给出三个小模型训练配方,读者可以了解小模型在真实任务上的可达水平。
Microsoft 在 Build 2026 宣布 Foundry Managed Compute 与 Hugging Face models on Foundry,提供每周更新、覆盖文本、视觉、音频与多模态的开源模型精选目录,可一键部署到 Managed Compute。