群发资讯网

本地跑大模型,先别急着下模型:3.6 万星 llmfit 一条命令扫完硬件,告诉

本地跑大模型,先别急着下模型:3.6 万星 llmfit 一条命令扫完硬件,告诉你哪些真能跑

本地跑大模型最常翻车的不是装不上,是模型下完了才发现跑不动。GitHub 上 3.6 万星的 llmfit(Rust 写的,MIT 许可)就干一件事:一条命令读你的 CPU 核数、系统内存、显卡和显存——NVIDIA 多卡会加总、Apple Silicon 按统一内存算,AMD ROCm、Intel Arc、昇腾也认——再从内置的上百个模型里挑出真正能在这台机器上跑得好的,按质量、速度、适配度、上下文四个维度打分排名。它同时提供终端界面、Web 面板、REST 接口和 Docker 镜像。

几个实现细节值得看。量化不是写死的:它从 Q8_0 一路试到 Q2_K,挑能在你显存里装下的最高质量那一档,装不下就退到一半上下文再试。MoE 模型单独处理:Mixtral 8x7B 总参数 46.7B,但每个 token 只激活约 12.9B,配上专家卸载后显存需求能从 23.9GB 降到约 6.6GB,只看总参数量会误判。速度是估算不是实测:按显卡内存带宽除以模型体积,再乘一个 0.55 的效率系数,内置约 80 张卡的带宽表;项目最近加了回传机制,你本机实测的 tok/s 可以提交回去,替换掉估算值。

估算终归是估算,认不出的显卡会退到按后端给的常数——CUDA 220、Metal 160、CPU x86 只有 70;公式里的效率系数还能自己调,调出来的数字只有自己认。我的判断是,它最值钱的场景是"下手之前":准备买机器,或者想判断旧显卡还能不能干活时,先花一分钟扫一遍,比到处翻推荐清单靠谱。

你现在是看推荐清单下模型,还是先按显存挑?