ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

llama.cpp 本地推理实战:从克隆到跑通只要三步

llama.cpp 本地推理实战:从克隆到跑通只要三步 llama.cpp 本地推理实战从克隆到跑通只要三步【免费下载链接】llama.cppLLM inference in C/C项目地址: https://gitcode.com/GitHub_Trending/ll/llama.cpp想在自己电脑上跑大模型不靠云 API、不注册账号llama.cpp 是一套 C/C 编写的大模型推理引擎支持 CPU 与 CUDA、Metal、Vulkan 等 GPU 后端。三步命令编译一条命令开始对话。开工前环境自查项目要求用途操作系统Linux / macOS / Windows三大平台官方均支持硬件任意现代 CPUGPU 可选纯 CPU 也能跑GPU 只是更快Git任意新版拉取源码CMake3.14 以上配 C/C 编译器生成并驱动整个构建GPU 驱动与工具包可选NVIDIA 装 CUDA ToolkitAMD 装 ROCmIntel Arc 装 SYCL只有开 GPU 加速才需要不需要 Python。核心是纯 C/C零第三方依赖。极速上手克隆、编译、跑通三连git clone https://gitcode.com/GitHub_Trending/ll/llama.cpp cd llama.cpp cmake -B build cmake --build build --config Release -j前两条拿代码后两条配置加编译。-j让多核并行编译能省不少时间。几分钟后build/bin/下会生成一堆可执行文件其中就有llama-cli。然后启动第一次推理build/bin/llama-cli -hf ggml-org/Qwen3.5-0.8B-GGUF -p 介绍下你自己 -n 64-hf参数会自动把模型下载到本地缓存你不用自己找 GGUF 文件。看到模型下载、加载接着开始输出文字就说明跑通了。按需加料llama.cpp 硬件加速默认构建走纯 CPU能用但吃速度。想让硬件真正干活配置时加参数即可。NVIDIA CUDA 加速cmake -B build -DGGML_CUDAON cmake --build build --config Release -j前提是已装 CUDA Toolkit。构建日志里出现 GPU 检测信息即生效推理速度通常翻一倍以上。Apple Silicon 的 MetalmacOS 默认开启 Metal什么都不用配GPU 直接参与运算。想关掉加-DGGML_METALOFF。其他常见场景多张显卡运行时加--split-mode layer按层切分到各卡大模型放不进显存用 CPUGPU 混合推理超出显存的部分自动落到内存长文本预处理慢加-DGGML_BLASON -DGGML_BLAS_VENDOROpenBLAS启用 BLAS基础线性代数库加速Python 里调用装llama-cpp-python一行命令搞定要 CUDA 加速的话安装时需带上 CMAKE_ARGS 环境变量装完怎么验30 秒自检build/bin/llama-cli --version build/bin/llama-cli --list-devices第一条打印版本号和构建信息第二条列出可用设备。版本号正常、设备列表里有你的显卡说明没装坏。三个高频坑cmake: command not found先装 CMakeCUDA 编译报找不到 nvcc工具包没装或没进 PATH首次运行卡很久正常在下载模型之后走缓存就快了下一步装完你可以做什么起个服务跑build/bin/llama-server -hf ggml-org/Qwen3.5-0.8B-GGUF得到一个 OpenAI 兼容 API 加内置网页界面换更大的模型把-hf后的模型名换成更大的 GGUF 版本量化版更省内存带进手机仓库自带 Android 示例工程可直接导入 Android Studio 跑移动端推理【免费下载链接】llama.cppLLM inference in C/C项目地址: https://gitcode.com/GitHub_Trending/ll/llama.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表