编程 AI 模型怎么选?拿自己的代码试
把榜单变成候选清单,再用真实任务决定。
AI风向编辑整理 · 更新于 · 方法指南
先写下任务和验收方式
修一个 bug、补一个界面和理解一个大型仓库,需要的能力不同。选 5–10 个日常会遇到的任务:描述清楚输入,保存预期结果,明确编译、功能检查或人工审核条件。不要让模型自己给自己打分。
从编程榜选几个候选
用编程榜缩小范围,再检查具体模型版本、评测来源和证据覆盖。共识指数用于对比,不是代码正确率;名次接近或证据不足时,应该多保留一个候选。榜首也可能不适合你的项目约束。
用同样的上下文比较
给候选相同的代码、任务说明和工具权限。记录第一次完成是否可用、修正次数、耗时、输入和输出 Token。智能体场景还要记录实际工具调用及修改文件范围。先检查结果,再讨论回答是否看起来漂亮。
一张简单记录表:任务 / 模型版本 / 首次通过 / 修正次数 / 总 Token / 总耗时。重复跑少量任务,避免一次碰巧成功决定全部选型。
按任务拆分预算
可以用较便宜的模型处理常规修改,用更强的模型处理难定位的问题;但每次切换都会引入上下文和维护成本。先把一个模型用稳定,再决定是否值得增加第二个。