群发资讯网

省钱插件报"省 89% token",实测账单没降:RTK 跑了 1740 次基

省钱插件报"省 89% token",实测账单没降:RTK 跑了 1740 次基准,DeepSeek 那边反而贵了 17

RTK(Rust Token Killer)是这波"给 AI 编码省钱"里最有名的工具,GitHub 上已有 8 万星,做的事很直接:把 Agent 读到的终端输出先压缩,再交给模型。它的 README 自己写着,能砍掉 Agent 读到的 bash 输出最多 90%,并明确提醒"这不等于账单省 90%";但社交平台上"给 Claude Code 省 60% token"的帖子有 31.3 万次浏览,很多人的预期就是按这个来的。

7 月,JetBrains 的测评首先没测出省钱。9 月 11 日,Quesma 团队又做了一遍代价更高的实验:花掉 1,500 多美元 token,在 Terminal-Bench 2.1 上跑满 1,740 次,每个任务开、关 RTK 各跑五遍,模型路由、平台、超时全部一致。按任务平均算,Claude Code 配 Fable 5.0 开了 RTK 反而贵 1%(置信区间跨 0,等于没有差别),OpenCode 配 DeepSeek V4 Pro 贵了 17%;按通过次数平摊,Fable 便宜 3%、DeepSeek 贵 7%,通过率还各掉了 1 和 2 个百分点。

最能说明问题的是它自己的计数器。445 次 DeepSeek 尝试里,`rtk gain` 报告省下 3.492 亿 token、压缩率 89%,但同一批任务的账单是涨的。因为这个数算的是"被去掉的输出字节数除以 4",不是你实际被计费的 token。有个任务里模型两次执行 `head -1 train.txt`,RTK 拿它跟整个文件比大小,一次记 1.205 亿 token 的节省,两笔就占了整个对比计数器的 69%——而这条命令原本就不会返回整个文件。

为什么省不下来,账单结构解释了原因。Fable 的输入 token 里,工具输出只占约 11%;上下文每轮之后进缓存,缓存读价格是普通输入的十分之一到三十分之一,占账单约 30%。真正贵的是模型自己的输出,约占成本 56%。而且压缩输出会让 Agent 多跑轮次:DeepSeek 那侧平均每轮输入少了 7%,但总轮次多了 18%,总输入反而涨。

实测里还踩到一个 bug:`rtk find` 不支持某个参数,插件把命令反复重写,同一个任务连续报错 339 次、约 12 分钟,最终成本是同样通过任务的 9 倍。该问题在 0.46.0 已修复,晚于这次测试。

这是单一第三方在 Terminal-Bench 2.1 上的结果,Claude Code 那侧大部分节省来自一个任务,换模型换基准结论可能不同;RTK 官方也从没承诺"省 90% 账单"。我的判断是:如果账单主要来自模型输出和缓存未命中,压终端输出就不是省钱杠杆,先量一遍自己的 token 结构,再决定装不装。

你给编码 Agent 省成本,是在压终端输出,还是先看账单构成?