群发资讯网

编程 Agent 的模型账单能省多少? 9 月 10 日,做 Devin

编程 Agent 的模型账单能省多少?

9 月 10 日,做 Devin 的 Cognition 发布新一代编码模型 SWE-2,主打的是"能力-成本"曲线上的位置:在 FrontierCode 1.1 Main 上拿到 50.0%,只比 Fable 5.1 的 50.9% 低不到 1 分;DeepSWE 1.1 上 73.0%,高于 GPT-5.6 Sol 的 72.7%;Terminal-Bench 2.1 是 92.8%,也压过 Fable 5.1 的 91.4%。官方原话是"比 Fable 5.1 便宜 64%",并称接近 GPT-6 Astra 的水平只要它大约四分之一的成本。

省钱这次是主线。SWE-2 是在 Kimi K3(2.8 万亿参数)基础上做后训练,Cognition 说自己的强化学习又在上面加了 5 到 6 分。行为变化更直观:medium 档跑 FrontierCode 1.1 Main,比上一代 SWE-1.7 平均少 58% 的轮次、少花 81% 的钱;第一次真正动手改代码的中位步数是 18 步,上一代是 48 步——上一代被用户吐槽"过度探索、想太多",这次改的就是这一点。
但有个缺口必须看:换成更难的 Terminal-Bench 4,SWE-2 只有 27.3%,而 GPT-6 Astra 是 57.9%、Fable 5.1 是 55.8%。Hacker News 上这条 418 分、30 条评论,最前面的评论就在质疑"是不是在挑榜"。

所有跑分和"便宜 64%"都是 Cognition 自家口径,第三方还没有复现,对比用的是各家标价。落地范围也窄——SWE-2 目前只上线在 Devin 自家的 Desktop、CLI、Web 和 Fusion 里,没有开放权重,也没说什么时候开放给外部使用。我的判断是:用 Devin 的团队可以先把中等难度任务的默认档切到 SWE-2 跑一轮对比;但别急着拿它替掉处理最脏、最复杂任务的那一档模型,那部分它离第一梯队还有明显距离。

你现在给编码 Agent 是固定用最贵那一档,还是按任务难度分档?