群发资讯网

Kimi K3 究竟什么水平

imi K3 正式开源。MoE 架构,总参数量达到 2.8T,每个 Token 激活约 104B 参数。模型支持原生视觉输入和 100 万 Token 上下文。

训练方向上:长程 Coding、复杂知识工作和需要持续调用工具的 Agent 任务都有专项提升。
vllm给出的部署建议是16卡H200或8卡B300。

我把 Kimi K3 扔进了两个已经被 Fable 5 优化过好几轮的线上 GPU 推理项目。

规则很简单:精度不掉,性能提升,就算赢。

结果,K3 先从真实请求分布里找到 36.7% 的 Padding 浪费,把高并发 p50 延迟再压低 12% 到 18%;接着自己写 Triton Dequant GEMM,把 Anchor 显存从 4.6GB 降到 2.3GB,单请求 p50 又下降 5.6%。第二个项目它又继续提升了 5.7%。

它会主动否决精度不过线的量化方案,也会回退让 p99 变差的优化。

Fable 5 第一次让我看到模型真的能写对 CUDA。Kimi K3 让我意识到,这种能力正在变成可以复现的工程能力。

精度无损,性能提升,代码能用。这次,Kimi K3 通过!