训练方向上:长程 Coding、复杂知识工作和需要持续调用工具的 Agent 任务都有专项提升。
vllm给出的部署建议是16卡H200或8卡B300。
我把 Kimi K3 扔进了两个已经被 Fable 5 优化过好几轮的线上 GPU 推理项目。
规则很简单:精度不掉,性能提升,就算赢。
结果,K3 先从真实请求分布里找到 36.7% 的 Padding 浪费,把高并发 p50 延迟再压低 12% 到 18%;接着自己写 Triton Dequant GEMM,把 Anchor 显存从 4.6GB 降到 2.3GB,单请求 p50 又下降 5.6%。第二个项目它又继续提升了 5.7%。
它会主动否决精度不过线的量化方案,也会回退让 p99 变差的优化。
Fable 5 第一次让我看到模型真的能写对 CUDA。Kimi K3 让我意识到,这种能力正在变成可以复现的工程能力。
精度无损,性能提升,代码能用。这次,Kimi K3 通过!
















