📌 项目地址AlexsJones/llmfit | ⭐ 26,843 颗星 | 🔧 Rust | 📜 MIT

项目地址:AlexsJones/llmfit | ⭐ 26,843 | Rust

选型才是本地跑大模型最贵的环节

装 Ollama 五分钟就搞定,真正费时间的是选模型。几百个模型,每个一排量化版本,再叠加 MoE 架构、多 GPU、不同推理后端这些变量,没人能在脑子里算清楚自己这台机器到底能跑什么。

结果通常两种:模型下下来跑不动,几十 G 硬盘白占;或者反过来,硬件明明有余量,只敢跑个 7B 小模型。

去网上抄别人的”实测”也不行。他的 tok/s 是在他的显卡上测的,RTX 4090 和一张老卡差好几倍,照搬没有意义。

llmfit 做的事很直接:检测你系统的 RAM、CPU、GPU,对几百个模型和量化组合逐一打分。评分维度有四个——质量、速度、适配、上下文长度——最后给出一份”哪些模型在你这台机器上能真正跑好”的清单。

形态:Rust 终端工具,TUI 和 CLI 两种模式

默认进交互式 TUI,也有经典 CLI 模式留给脚本和自动化。README 列出的能力包括:

  • 多 GPU 支持
  • MoE 架构识别
  • 动态量化选择
  • 速度估算
  • 对接五个本地运行时:Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio

最值得说的一点:把估算值换成实测值

速度估算有个天然矛盾——通用估算表对谁都不准。llmfit 最新版本的做法是把它变成众包实测,流程设计得比较讲究:

第一步只对自己负责。 你下载一个模型,用本地后端跑起来,测出真实 tok/s。每次结果先存本地,你自己的实测值直接替换 fit 表里的估算数字。这一步不依赖任何外部服务。

第二步才谈贡献。 愿意的话,在 TUI 里直接生成 PR 提交结果——不需要装 gh CLI,不需要第三方账号。PR 合并后随下一个版本发布,之后任何用同款硬件的人看到的直接是带 ✓ 的实测数字,不用自己再跑 benchmark。具体步骤在仓库的 docs/benchmarking.md。

我觉得这个闭环是它区别于”又一个模型推荐工具”的地方。用的人越多,按真实硬件型号索引的性能库就越厚,估算的盲区就越小。激励也顺:你贡献一次数据,下次换硬件时也能查到别人测的数字。

安装

Windows(Scoop):

scoop install llmfit

macOS / Linux(Homebrew 预编译二进制,README 推荐这条,全版本可用):

brew install AlexsJones/llmfit/llmfit

或走 homebrew-core 公式,无 bottle 的 macOS 版本会从源码构建:

brew install llmfit

MacPorts:

port install llmfit

快速安装脚本:

curl -fsSL https://llmfit.axjns.dev/install.sh | sh

周边生态

作者还有三个配套项目:sympozium 管 Kubernetes 里的 agent;llmserve 是个选模型、选后端、起服务的 TUI;llama-panel 是 macOS 原生应用,管理本地 llama-server 实例。在搭本地推理工作流的话,这几个能串起来用。

文档拆得细:TUI 用法、benchmark 步骤、CLI 自动化、运行时后端、自定义模型、平台与 GPU 支持,都在 docs/ 目录下。

我的判断

这类工具的价值密度取决于两件事:硬件检测准不准,模型数据全不全。前者 Rust 有天然优势;后者只能靠社区回流——这也解释了为什么 benchmark 在这个项目里是一等公民。

26,843 颗星说明”下载了跑不动”这个痛点足够普遍。踩过这个坑的人,装一个不亏。

这篇文章对你有帮助吗?

发表回复