群发资讯网

手头是 3090、7900 XT 或 Strix Halo 这类消费级硬件,本地

手头是 3090、7900 XT 或 Strix Halo 这类消费级硬件,本地跑大模型最难受的不是能不能跑,是解码太慢。lucebox 这个 Apache-2.0 的推理服务器就冲这件事:先让一个小「草稿模型」猜下一段,大模型再批量验证,猜对了就省掉一次完整前向。今天(09-28)实测:2,885 星、280 个 fork、102 个未关闭 issue,仓库当天仍在推送。

单张 Radeon AI PRO R9700 跑 Qwen 3.8 27B,HumanEval 平均 208.1 token/秒、单请求峰值 227.8,同一个草稿模型下是 llama.cpp 的 3.8 倍;RTX 3090 上把 33B 模型开到 256K 上下文,预填充从 411 秒压到 67.3 秒(6.1 倍),解码 152.3 token/秒;Strix Halo 上跑 DeepSeek V4 是 42 token/秒解码、320 token/秒预填充;R9700 加 Strix Halo 两台 AMD 设备合跑图像问答,58 张/分钟,对照 DGX Spark 的 18 张/分钟。

README 自己声明这些跑分用的 prompt、量化档和推理策略各不相同,「不是跨硬件排名」,别拿去当显卡选购表;每个模型都要配对应量化档的草稿模型,装完不会自动变快;HIP 构建还必须对准确切的 gfx 架构;所有数据都是项目自测,没有第三方复核。

我的判断:已经在本地跑模型、被解码速度卡住的人,这是值得花一个下午试的路线——它能把你手里现有的卡榨出可用吞吐;只是偶尔问答、或第一次玩本地模型的人,先把量化档降一档,比换引擎省事得多。