跳到正文

#编码

今日 4 条
今天10月7日周三
10月3日周六
10月1日周四
  1. TechCrunch · AI59

    Google 发布 Gemini 4 Argon,称其为迄今最强大的模型

    Google 发布新模型 Gemini 4 Argon,称其擅长网络安全、编码与研究,可自主发现、验证并修复关键软件漏洞。该模型经防御性网络安全任务专项训练,目前仅通过 Fairwind 安全计划向部分网络安全合作伙伴开放;Google 引用 Vals 的模型指数称其在多项基准上领先 OpenAI GPT-6 Astra 与 Anthropic 的 Fable 和 Opus。

  2. Ars Technica · AI61

    Google 宣布 Gemini 4 Argon 模型,暂未对公众开放

    Google 宣布新模型 Gemini 4 Argon,称其在编码、知识工作和网络安全上性能行业领先,但目前仍处有限测试阶段,普通用户暂不能使用。Google 内部已在大量使用:Argon 借助全集群遥测数据帮助节省 300 TiB 数据中心内存,其智能体已将包括 Fuchsia OS Zircon 内核超 80 万行在内的 C/C++ 代码迁移到 Rust。

  3. Google DeepMind77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络防御者开放,定价为每百万输入 token $2、输出 token $10,缓存输入 95% 折扣。

    推荐理由:官方博客给出定价、1M 输出 token 上限、基准分数和内部迁移案例,读者可以据此判断它在编程与安全防御上的实际定位。

9月29日周二
  1. OpenAI News68

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作场景,智能水平接近 Astra,API 输入和输出 token 价格为 Astra 标准价的五分之一。

    推荐理由:原文给出了 GPT-6.1 Sol 的定位和价格对比,读者可以据此评估它相对 Astra 的成本优势。

  2. Simon Willison73

    Anthropic 发布 Claude Sonnet 5.5,免费层模型升级

    Anthropic 发布 Claude Sonnet 5.5,官方称速度快 30% 以上,多数工作成本最高降 30%,价格与 Sonnet 5 持平但基准全面占优。作者实测其编码表现接近 Opus 5.5,并指出它成为 claude.ai 免费层所用模型,使 Anthropic 免费方案强于使用 Luna 5.6 的 ChatGPT 免费层;官方重申 Haiku 5.5 将在未来几周内推出。

9月23日周三
  1. Latent Space84

    Anthropic 发布 Claude Opus 5.5,OpenAI 同日跟进降价 50% 的 GPT-6 Sol 和 Luna

    Anthropic 发布 Claude 5.5 家族首个模型 Claude Opus 5.5,称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30% 且每任务便宜 40%,token 定价从 $5/$25 降至 $4/$20,并成为 Claude Code 与 Claude 应用的默认模型。

    推荐理由:原文汇总了 Opus 5.5 的定价、评测与争议细节,包括第三方拆解显示 40% 降价在 max effort 下并不成立。

9月22日周二
9月3日周四
8月25日周二
  1. Hugging Face Blog61

    IBM 发布 Granite 4.2 推理模型家族,详解 15T token 预训练与多阶段 RL 训练管线

    IBM 发布 Granite 4.2 推理模型家族,含 3B、8B、30B 三个稠密解码器模型,基于 Granite 4.1 基座(从头在约 15T token 上预训练,五阶段策略将上下文扩展至 512K),经 SFT 与多阶段 GRPO 强化学习后训练,全部以 Apache 2.0 许可开源。

    推荐理由:官方完整披露从预训练、SFT 到多阶段 GRPO 和智能体 RL 的训练细节,可迁移到类似模型的构建流程。

8月14日周五
8月10日周一
  1. Hugging Face Blog78

    Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景

    Meta 今日发布 30B 参数多模态开源模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地部署的隐私场景与编码、文档分析、个人助理等智能体用途。

    推荐理由:原文给出架构细节、Agent 基准对比和各推理栈的 day-0 用法,读者可据此评估本地多模态部署的选择。

7月21日周二
  1. Google DeepMind76

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

    Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上输出 token 用量比 3.5 Flash 减少 17%,定价 $1.50/1M 输入、$7.50/1M 输出,DeepSWE 49% vs 37%、OSWorld-Verified 83.0% vs 78.4%。

    推荐理由:官方原文给出三款新模型的具体价格、token 效率与多项基准数字,并说明各模型面向的部署场景。

7月17日周五
5月16日周六
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,首先推出 3.5 Flash,定位智能体与编码,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上超过 Gemini 3.1 Pro,输出速度为其他前沿模型的 4 倍。

    推荐理由:官方公布了 3.5 Flash 的基准成绩、开放渠道和 Pro 后续计划,读者可以据此评估它在智能体与编码场景的取舍。

3月17日周二
12月9日周二
  1. Mistral AI72

    Mistral AI 发布 Devstral 2(123B)与 Devstral Small 2(24B)编码模型及 Mistral Vibe CLI

    Mistral AI 发布开源编码模型家族 Devstral 2,包含 123B 的 Devstral 2(modified MIT 许可)和 24B 的 Devstral Small 2(Apache 2.0),两者均支持 256K 上下文窗口,分别在 SWE-bench Verified 上取得 72.2% 和 68.0%。

    推荐理由:官方公布了两个尺寸编码模型的开源协议、SWE-bench Verified 成绩、API 定价和硬件要求,可据此评估本地或端侧部署的可行性。

7月30日周三
7月11日周五
5月21日周三
5月7日周三
  1. Mistral AI64

    Mistral AI 发布 Mistral Medium 3,以约八分之一成本逼近 Claude Sonnet 3.7

    Mistral AI 发布 Mistral Medium 3,定位 SOTA 性能、成本降低 8 倍的新级别模型。基准上达到或超过 Claude Sonnet 3.7 的 90%,定价为 $0.4 输入 / $2 输出每 M token,超越 Llama 4 Maverick 和 Cohere Command A,可在 4 张 GPU 以上环境自部署。

    推荐理由:官方给出与 Claude Sonnet 3.7 的基准对比、定价和部署门槛,读者可据此评估企业落地的性价比。