📌 项目地址:AlexsJones/llmfit | ⭐ 26,843 颗星 | 🔧 Rust | 📜 MIT
项目地址:AlexsJones/llmfit | ⭐ 26,843 | Rust
选型才是本地跑大模型最贵的环节
装 Ollama 五分钟就搞定,真正费时间的是选模型。几百个模型,每个一排量化版本,再叠加 MoE 架构、多 GPU、不同推理后端这些变量,没人能在脑子里算清楚自己这台机器到底能跑什么。
结果通常两种:模型下下来跑不动,几十 G 硬盘白占;或者反过来,硬件明明有余量,只敢跑个 7B 小模型。
去网上抄别人的”实测”也不行。他的 tok/s 是在他的显卡上测的,RTX 4090 和一张老卡差好几倍,照搬没有意义。
llmfit 做的事很直接:检测你系统的 RAM、CPU、GPU,对几百个模型和量化组合逐一打分。评分维度有四个——质量、速度、适配、上下文长度——最后给出一份”哪些模型在你这台机器上能真正跑好”的清单。
形态:Rust 终端工具,TUI 和 CLI 两种模式
默认进交互式 TUI,也有经典 CLI 模式留给脚本和自动化。README 列出的能力包括:
- 多 GPU 支持
- MoE 架构识别
- 动态量化选择
- 速度估算
- 对接五个本地运行时:Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio
最值得说的一点:把估算值换成实测值
速度估算有个天然矛盾——通用估算表对谁都不准。llmfit 最新版本的做法是把它变成众包实测,流程设计得比较讲究:
第一步只对自己负责。 你下载一个模型,用本地后端跑起来,测出真实 tok/s。每次结果先存本地,你自己的实测值直接替换 fit 表里的估算数字。这一步不依赖任何外部服务。
第二步才谈贡献。 愿意的话,在 TUI 里直接生成 PR 提交结果——不需要装 gh CLI,不需要第三方账号。PR 合并后随下一个版本发布,之后任何用同款硬件的人看到的直接是带 ✓ 的实测数字,不用自己再跑 benchmark。具体步骤在仓库的 docs/benchmarking.md。
我觉得这个闭环是它区别于”又一个模型推荐工具”的地方。用的人越多,按真实硬件型号索引的性能库就越厚,估算的盲区就越小。激励也顺:你贡献一次数据,下次换硬件时也能查到别人测的数字。
安装
Windows(Scoop):
scoop install llmfit
macOS / Linux(Homebrew 预编译二进制,README 推荐这条,全版本可用):
brew install AlexsJones/llmfit/llmfit
或走 homebrew-core 公式,无 bottle 的 macOS 版本会从源码构建:
brew install llmfit
MacPorts:
port install llmfit
快速安装脚本:
curl -fsSL https://llmfit.axjns.dev/install.sh | sh
周边生态
作者还有三个配套项目:sympozium 管 Kubernetes 里的 agent;llmserve 是个选模型、选后端、起服务的 TUI;llama-panel 是 macOS 原生应用,管理本地 llama-server 实例。在搭本地推理工作流的话,这几个能串起来用。
文档拆得细:TUI 用法、benchmark 步骤、CLI 自动化、运行时后端、自定义模型、平台与 GPU 支持,都在 docs/ 目录下。
我的判断
这类工具的价值密度取决于两件事:硬件检测准不准,模型数据全不全。前者 Rust 有天然优势;后者只能靠社区回流——这也解释了为什么 benchmark 在这个项目里是一等公民。
26,843 颗星说明”下载了跑不动”这个痛点足够普遍。踩过这个坑的人,装一个不亏。