GitHub 趋势 · 第 27 期
别急着下模型:35k star 的 Rust 工具,一条命令算清你的机器能跑哪个
#本地推理#开源工具#Rust
我的判断:llmfit 不是推理引擎,它不替你跑模型。它解决的是更靠前的一步——在你按下「下载」之前,先告诉你哪些模型在你的内存/显存上跑得舒服、哪些纯属浪费硬盘。这类工具的价值不在技术炫技,而在省掉那几百 GB 的试错流量。手里有 Mac、小主机或单卡的人,值得先装它再谈下模型。
痛点场景:本地跑模型最大的浪费不是电费,是下载。看到一个新模型,先拖 40GB 下来,跑起来要么直接 OOM,要么两秒吐一个字。而你的硬件上限其实是有据可算的——8GB / 16GB / 32GB 内存能装下多大的模型、大概多快,取决于参数量、量化格式和内存带宽。可惜大多数人还是靠论坛帖子和运气在猜。
项目是什么
AlexsJones/llmfit 是一个纯 Rust 写的终端工具,README 里的一句话定位是:「搞清你的硬件能舒服地跑哪些开源大模型」。它会先探测你的 CPU 核数、系统内存、独显/核显 GPU、VRAM 以及统一内存架构(NVIDIA CUDA、Apple Silicon、AMD ROCm、Intel OneAPI),再把模型目录里的每一个模型按四个维度打分:内存适配、预估速度、质量、上下文。默认进交互式 TUI,也可以走经典 CLI、JSON 输出或起一个 Web 面板 + REST API。
核心能力
| 能力 | 说明(取自 README) |
|---|---|
| 硬件自动探测 | CPU 核数、系统内存、可用独显/核显 GPU、VRAM,以及统一内存架构(NVIDIA CUDA、Apple Silicon、AMD ROCm、Intel OneAPI) |
| 模型兼容引擎 | 分析参数量、上下文长度与量化格式(GGUF、AWQ、GPTQ、EXL2),推算内存占用与 tokens-per-second |
| TUI + Web 双界面 | 零依赖终端界面(默认)或功能更全的 Web 面板;同时保留经典 CLI 输出 |
| REST API | 暴露 /api/v1/system、/api/v1/models 等标准 JSON 接口,可接进编排器、面板与自动化流水线 |
| 多平台 | macOS(Apple Silicon & Intel)、Linux(x86_64 & ARM64)、Windows(x86_64) |
| 对接本地运行时 | Ollama、llama.cpp、MLX、Docker Model Runner、LM Studio |
| 多卡与 MoE | 支持多 GPU 配置、MoE 架构、动态量化档选择与速度估算 |
| 实测回馈社区 | llmfit bench 对你正在跑的 provider 测真实 tok/s 与 TTFT;--share 可把结果贡献回社区榜,同配置用户直接拿到实测值 |
上手
macOS / Linux 安装(README 原文,三选一):
brew install AlexsJones/llmfit/llmfit curl -fsSL https://llmfit.axjns.dev/install.sh | sh uv tool install -U llmfit
常用命令(README 原文):
llmfit # interactive TUI: your hardware, every model, ranked llmfit fit # table of all models ranked by fit llmfit recommend --json # top picks as JSON (agent/script consumption) llmfit info "<model>" # one model: fit analysis, estimate basis, verify commands llmfit bench # measure real tok/s/TTFT against your running provider llmfit doctor # hardware detection report for bug reports llmfit serve # start the api and web user interface
不装也能试,或者直接起 Web 面板(README 原文):
uvx llmfit docker run -it --rm ghcr.io/alexsjones/llmfit --tui docker run -d -p 8787:8787 ghcr.io/alexsjones/llmfit serve
TUI 里几个好用的键(README 原文):b 打开社区实测榜,I 打开实时推理基准,/ 按名字、家族或量化档过滤模型。
我的判断
适合谁:手上有 Mac、小主机或单张显卡,想跑本地模型又不想反复试错的人;已经装了 Ollama / LM Studio,但卡在「下一步该换哪个量化档」的人;要写自动化脚本、需要 JSON 输出批量挑模型的团队。
不适合谁:想「装完就能聊天」的纯用户——它不是推理引擎,不会替你跑模型;以及硬件早就不是瓶颈、手上是集群而不是单机的人,它的估算模型对你没有增量。
几个坑(均来自 README 与仓库记录原文):
- ▪默认给你的是估算值,不是实测值。速度来自内存带宽模型 + 社区采样,README 原话是「every estimate ships its inputs」,llmfit info 会摊开每个数字的假设。项目自己就记录过一次严重高估:MoE 卸载场景曾用「GPU 带宽 ÷ 活跃参数 × 0.8」估算,Qwen3-Next-80B 在 16GB VRAM 上估到 80 tok/s,实测只有 15.4 tok/s(issue #464 已修)。所以正确顺序是「估算 → 真跑 → llmfit bench 实测」。
- ▪平台边界写死在 README 里:macOS(Apple Silicon & Intel)、Linux(x86_64 & ARM64)、Windows(x86_64)。Windows on ARM 不在官方支持列表内,别想当然。
- ▪内置目录里的模型会滞后于新发布。好在支持本地加自定义模型(不用重编)或提 PR 进内置目录,冷门/私有模型要自己动手喂。
- ▪社区实测榜要联网上传。README 的隐私条款写明:只有你主动使用对应功能(下载模型、查询运行时、社区榜)时才会连接外部服务,其余情况不外传数据——介意的话就别用 --share。
仓库:github.com/AlexsJones/llmfit
总 star:35,597(截至 2026-09-11,今日 +247)
许可证:MIT
抓取时间:2026-09-11 00:24(GMT+8)
你现在的机器上跑着哪个本地模型?是先算过再下的,还是先下完才发现跑不动?评论区报一下配置和模型,我挑几个一起看。
下期预告:vercel-labs/skills(30,995 star)——前面几期文章里反复出现的 npx skills add 命令,背后就是它。这期就拆一拆这个「技能包管理器」到底管了什么。
#本地推理#开源工具#Rust