Mistral 发布 Mistral Large 4 公开预览版,月底开放权重
Mistral 发布 Mistral Large 4(ML4)公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,权重将于本月底开放下载。
推荐理由:官方发布了参数规模、基准分数、训练基础设施和权重开放时间表,读者可据此评估它在开源阵营中的实际位置。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
Mistral 发布 Mistral Large 4(ML4)公开预览版,这是一个 1 万亿参数、490 亿激活参数的原生多模态模型,权重将于本月底开放下载。
推荐理由:官方发布了参数规模、基准分数、训练基础设施和权重开放时间表,读者可据此评估它在开源阵营中的实际位置。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,定价为每百万输入 token $2、输出 token $10,缓存输入 95% 折扣。
推荐理由:官方博客给出定价、1M 输出 token 上限、基准分数和内部迁移案例,读者可以据此判断它在编程与安全防御上的实际定位。
Latent Space AINews 汇总 OpenAI DevDay 2026 的多项发布,包括常驻智能体 Dots(由 GPT-6 Astra 驱动,连接 4。
推荐理由:这篇汇总把 DevDay 发布与 Artificial Analysis 等第三方实测放在一起,读者可以对比官方宣传与独立评测的差距。
GPT-6.1 Sol 在 Amazon Bedrock 正式可用,聚焦智能体编码、计算机操作和专业工作负载的更强推理能力。据 OpenAI 称,其 DeepSWE v1.1 成绩与 GPT-6 Astra 相当且每任务成本约为五分之一,超过 GPT-6 Sol 最佳成绩 6.4 个百分点;在透明度、用户意图和显式限制评估中也优于 GPT-6 Sol。
推荐理由:官方公告给出了与 GPT-6 Sol 和 GPT-6 Astra 的具体对比数据,可帮助读者评估其智能体工作场景的性价比。
Simon Willison 在旧金山 Fort Mason 现场 live blog OpenAI DevDay 2026 主题演讲。
推荐理由:作者在现场逐条记录了 DevDay 的发布与演示翻车细节,读者可以借此了解各新品的第一手使用情况。
OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作场景,智能水平接近 Astra,API 输入和输出 token 价格为 Astra 标准价的五分之一。
推荐理由:原文给出了 GPT-6.1 Sol 的定位和价格对比,读者可以据此评估它相对 Astra 的成本优势。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上可用,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四档推理力度。
推荐理由:原文给出 Bedrock 上的接入方式、推理档位配置和成本权衡,读者可直接据此规划调用与费用。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock(通过 Global CRIS global. inference profile)和北美的 Claude Platform on AWS 开放使用。
推荐理由:AWS 官方说明 Claude Sonnet 5.5 在 Bedrock 的可用性、与 Opus 5.5 的分工建议和上手方法,便于评估是否纳入现有工作流。
GitHub Copilot app 团队重建了 Pull Request 视图,使其能流畅打开一个含 2,200 个文件、超过一百万变更行和 400 多条行内评论的开源 PR。
推荐理由:作者以第一手视角拆解了超大 PR 渲染的双几何架构和自动化测量方法,思路对处理大规模动态内容界面有借鉴意义。
Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30% 且每任务便宜 40%,token 定价从 $5/$25 降至 $4/$20,并成为 Claude Code 与 Claude 应用的默认模型。
推荐理由:原文汇总了 Opus 5.5 的定价、评测与争议细节,包括第三方拆解显示 40% 降价在 max effort 下并不成立。
GitHub 作者 Stephen Toub 撰文介绍团队借助 GitHub Copilot 应用与 CLI,把 Copilot agent runtime 从 TypeScript/Node.js 完全重写为 832,378 行生产 Rust,AI 智能体完成了大部分代码,共落成 128 个 pull request,原需一两人年的项目仅由一名开发者在数月内完成。
推荐理由:作者亲历整场迁移,给出代码量、发布节奏与缓存命中率等一手数据,读者可以借此评估智能体主导大型重写的可行路径。
GitHub 在 GitHub Copilot CLI 推出 Project HydraFusion 研究预览,通过运行时多模型编排,按任务在 Single、Cascade、Critique 三种执行模式中选择,并调用跨供应商模型完成起草、审查、修订或升级。
推荐理由:原文给出三套执行模式、具体基准对比和开放步骤,读者可以据此评估多模型编排对自己编码工作流的成本与质量影响。
Hugging Face 博客作者用 TRL 和 OpenEnv 开源复现 Surya Narreddi 的思路,训练 Qwen/Qwen3.5-35B-A3B 写 p5.brush 代码画水彩。
推荐理由:作者把训练配方、环境、参考池和模型全部开源,读者可以按一条命令复现整个流程并借鉴排查经验。
Hugging Face 发布开源工具 funes,把本机已有的智能体会话记录建为可检索记忆,支持 Claude Code、Codex、pi 和 Hermes。它本地完成嵌入和重排,无需账号即可使用,也可绑定到私有的 Hugging Face 数据集跨机器同步。在 handoff-vs-recall 基准上,recall 比写交接文档分别便宜 8x 和 4x。
推荐理由:Hugging Face 官方开源的记忆层工具,给出了安装方式和基准对比,读者可以评估它能否复用现有编码智能体的会话记录。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。
推荐理由:官方给出两个变体的基准数字、定价和实际应用案例,读者可以据此评估在编码与安全场景中的替换成本。
IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密解码器模型,基于 Granite 4.1 基座(从头在约 15T token 上预训练,五阶段策略将上下文扩展至 512K),经 SFT 与多阶段 GRPO 强化学习后训练,全部以 Apache 2.0 许可开源。
推荐理由:官方完整披露从预训练、SFT 到多阶段 GRPO 和智能体 RL 的训练细节,可迁移到类似模型的构建流程。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和 Agent 的主力模型,距 Gemini 3.6 Flash 仅三周。
推荐理由:官方公告给出了多个基准分数和半价定价细节,读者可以据此评估是否切换到 3.7 Flash。
Meta 今日发布 30B 参数多模态开源模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地部署的隐私场景与编码、文档分析、个人助理等智能体用途。
推荐理由:原文给出架构细节、Agent 基准对比和各推理栈的 day-0 用法,读者可据此评估本地多模态部署的选择。
Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实 harness 内端到端训练。
推荐理由:微软开源了可复用的智能体环境层,并给出三个小模型训练配方,读者可以了解小模型在真实任务上的可达水平。
Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上输出 token 用量比 3.5 Flash 减少 17%,定价 $1.50/1M 输入、$7.50/1M 输出,DeepSWE 49% vs 37%、OSWorld-Verified 83.0% vs 78.4%。
推荐理由:官方原文给出三款新模型的具体价格、token 效率与多项基准数字,并说明各模型面向的部署场景。