ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

llmfit 基准测试完整指南:把估算速度跑成实测 tok/s

llmfit 基准测试完整指南:把估算速度跑成实测 tok/s llmfit 基准测试完整指南把估算速度跑成实测 tok/s【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfitllmfit是本地 LLM 的硬件适配工具一条命令列出你机器上值得跑的模型连适配分、预估速度都给你算好。它内置的基准测试能把这些预估变成实测 tok/s——本文带你走完整条链路拉模型、起服务、测速、分享全程不离开 TUI。账面数字是怎么来的为什么不够用打开 TUIllmfit 已经自动检测了你的 CPU、内存和显存给每个模型算出适配分和预估 tok/s。拿它挑模型很方便但数字都是公式算出来的。跑一次基准测试你才能得到真实的 tok/s 和出首 token 的等待时间TTFT而且每条记录都会落盘到本地日后再补交也不迟。模型文件去哪拿没有模型文件测速无从谈起。在 TUI 里按/进入搜索敲个关键词比如qwen3.5用j/k或方向键把光标挪到目标行按d开拉。若该模型有多个来源会弹出Download With浮层——方向键挑一个Enter敲定。之后你大可以回去继续逛列表下载在后台跑文件落在~/.cache/llmfit/models想看进度就按D打开下载管理器瞄一眼。服务没跑起来测速找谁基准测试打的是正在运行的推理服务所以得先把模型伺服起来。以 llama.cpp 为例另开一个终端把它跑起来llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99等终端打出model loaded与listening on http://127.0.0.1:8080回 TUI 按r刷新一下已装模型。表头出现llama.cpp: ✓ (1 models)说明自动探测成功Ollama、vLLM、MLX 同理。三轮请求换一组真实速度回表格选中刚装好的模型按b。由于服务正活着llmfit 会弹Benchmark this model确认框Enter之后它连打 3 轮真实推理请求把 tok/s 和出首 token 的耗时一起测出来。键说明b进排行榜选中模型在运行则先提示测它Enter开测Space/s切换测完以 PR 分享Esc转后台边跑边逛榜单结果自动写进~/.config/llmfit的 bench 区。当时不分享也没事日后再用llmfit bench --share补交就行。想让结果被别人用上吗可选分享要在测试开始之前打开确认框里按Space或s把开关拨上。测完llmfit 直接把你的结果提交出去、开一个社区 PR——不依赖 gh CLI认证走 GitHub 设备流也可预设GITHUB_TOKEN。合并后下个版本会用你的实测值替换估算值标✓同款硬件的用户跑不跑测试都能直接吃到校准后的预测榜单上你的记录以you (shared)显示。 若提示没有 GitHub 凭据先export GITHUB_TOKENghp_your_token再重启。三种进阶玩法可选按b进社区排行榜同款硬件上其他人的实测数字一目了然按H还能逛任意 GPU 的榜单按I进Inference Bench把所有运行时里的模型批量测一遍带质量评分和路由矩阵按S开硬件模拟手动改内存、显存和核数提前看一眼换机后哪些模型还跑得了想继续深挖基准测试全流程docs/benchmarking.mdTUI 键位全表docs/tui.md测量与分享逻辑llmfit-core/src/bench.rs、llmfit-core/src/share.rs下次有人问你这台机器能跑多快的本地模型你就报一个亲手测出来的 tok/s——答案不再是估算而是实测。【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表