llmfit bench命令指南:3步实测你的硬件真实tok/s速度
发布时间:2026/8/30 8:55:14 作者:尧图编辑部 阅读量:1,286

llmfit bench命令指南3步实测你的硬件真实tok/s速度【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfitllmfit是一款一条命令找到能在你硬件上跑的大模型的开源工具而它的bench命令可以绕开理论估算用真实推理请求实测你的 GPU/内存到底能跑出多少tok/s每秒 token 数。本文带你完成安装、起模型、跑基准测试的全流程并教你把结果一键分享回社区。为什么估算值不可信实测才有说服力llmfit 启动时会扫描你的硬件CPU、显存、统一内存等并为数百个模型计算理论 tok/s 估算。但估算终究是公式算出来的——真实表现还受量化方式、上下文长度、后端实现影响。llmfit bench命令做的事很简单向正在运行的推理服务发送 4 条真实提示词跑 3 轮推理外加 1 次热身测出真实的 tok/s、首 token 延迟TTFT和总延迟测试提示词与统计逻辑见 llmfit-core/src/bench.rs。它自动探测 4 种推理后端后端默认地址Ollamalocalhost:11434vLLMlocalhost:8000llama-serverlocalhost:8080可通过/props端点精确识别MLXlocalhost:8080准备步骤安装 llmfit 并启动模型一键安装 llmfit任选一种方式安装macOS / Linux# 方式一官方安装脚本 curl -fsSL https://llmfit.axjns.dev/install.sh | sh # 方式二uv uv tool install -U llmfit启动一个本地推理服务bench 命令需要活的推理服务。以 llama.cpp 为例llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99看到model loaded/listening on http://127.0.0.1:8080就说明模型就绪。Ollama、vLLM、MLX 同理——llmfit 会自动检测正在运行的任何后端。核心步骤一条命令实测 tok/s服务启动后直接运行llmfit bench它会自动发现后端并加载的模型跑完 3 轮真实推理后输出汇总 Benchmark Results Model: Qwen3.5-0.8B-Q8_0.gguf Provider: llamacpp TPS: 31.5 avg (30.1 min / 33.0 max) TTFT: 95 ms avg Latency: 2050 ms avg几个实用细节先热身再计时首轮Say hello.请求不计入统计避免冷启动污染数据Ollama 走原生计时直接读取eval_durationTTFT 精确到毫秒vLLM/MLX 用墙钟时间估算TUI 用户更省事在 llmfit 终端界面中选中已安装的模型按b打开排行榜会直接弹出Benchmark this model提示按Enter开始实测、按Esc转后台运行。进阶参数批量测试与预览# 测所有发现的模型并自动提交社区 PR llmfit bench --all --share # 只预览要提交的 JSON不联网 llmfit bench --all --share --dry-run # 跳过确认提示适合脚本/自动化 llmfit bench --all --share --yes完整参数说明见 docs/cli.md。结果去哪了本地存档 社区排行榜每一次 bench 都会先存本地Linux 下位于~/.local/share/llmfit/benchmarks/pending/跳过分享也不会丢数据。本地结果带来两个立竿见影的改进你在排行榜顶部看到you (local)行你的实测 tok/s 替换掉理论估算值可靠的实测≥1B 参数、dense 模型还会反向校准同硬件上其他模型的估算公式——测一个准一片。如果想贡献给社区加上--sharellmfit 会自动 fork、提交结果文件并开 PR无需 gh CLI认证走 GitHub 设备码流程或设置GITHUB_TOKEN。之后llmfit bench --share单独执行即可把积压的本地结果批量上传。被合并的实测数据会打进下一个版本同硬件的用户无需跑 bench 就能直接看到带✓标记的校准值——完整四步流程下载→部署→实测→分享见 docs/benchmarking.md。常见问题Q报 No inference provider found 怎么办A先启动 Ollama / vLLM / MLX / llama-server 中任意一个并确认模型已加载再重试。QvLLM、MLX 的 TTFT 显示 n/aA精确 TTFT 需要流式输出OpenAI 兼容端点目前用非流式请求因此只显示总延迟Ollama 和 llama.cpp 可精确测量。Q换了硬件后旧数据会干扰吗A不会。记录在不同 CPU/GPU 配置上的运行结果会被自动忽略。小结估算看能不能跑llmfit bench看跑多快——3 轮真实推理 热身数据可信支持 Ollama、vLLM、MLX、llama.cpp 四大后端自动探测、自动发现模型结果本地永久存档并反哺估算校准--share一键把真实数据贡献给社区。跑一次 bench让你的硬件数据替你说话。【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考