ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

800KB 的 LLM 推理引擎,冷启动只要 2 秒:它在 RK3588 上跑起来了

800KB 的 LLM 推理引擎,冷启动只要 2 秒:它在 RK3588 上跑起来了 这篇讲一个“反差”跑一个能对话、能看图的大模型服务主流做法要带几 GB 的运行环境、等几十秒起服而我们的推理引擎是——一个 800KB 的可执行文件2 秒上线。数字都是 RK3588 板端实测不是 PPT。先直接上结论省得你划走你关心什么常见套路我们vllm_kestrel跑 LLM 服务要装多少东西Python 推理框架 CUDA/ROCmGB 级起步1 个 C11 可执行文件约 0.8 MB冷启动多久能服务模型加载 框架初始化几十秒常见2.0 秒spawn → HTTP ready实测内存占用起服即吞几个 GB峰值2.47 GB同机对比对象 3.03 GB依赖谁PyTorch / CUDA / 第三方库谁都不依赖标准构建只需 gcc libm这颗“800KB 的引擎”跑的是 Qwen3-VL 2B/8B纯文本能聊传图能看视频帧也能喂。它在 RK3588香橙派 5 Plus 这类 400 元级开发板上原生运行——不装 Python、不装 CUDA、不装任何推理框架。800KB 是什么概念一张老式 3.5 寸软盘 1.44 MB——它比软盘还小装得下llama.cpp 同场景的 llama-server 冷启动 5.0 秒它 2.0 秒我们不是“套壳调用别人引擎”28 个 C 文件把 NEON 量化 GEMM、线程池、国密 SM3/SM4/SM2、自研权重格式全写了——代码里唯一的外来组件是两段 MIT 授权的单头文件stb_image 图片解码、一段有署名的 llama.cpp 4x4 asm 内核引擎本体零第三方运行时。这套东西有多“轻”开-DVLLM_STATICON全静态构建后产物连.so都没有——拷到任意一台 aarch64 Linux 上双击就……不命令行就跑。断电、换板、SD 卡拔走插到另一块板它照样起。冷启动 2 秒对边缘设备意味着什么你可能觉得“2 秒 vs 5 秒”不过差 3 秒。但在边缘场景这个差距是质变服务重启 服务中断。边缘盒子跑在弱网/无网环境你不可能每次断线都让人重启容器栈。800KB 单文件 2 秒起服 看门狗拉起、断点续跑都变得很“便宜”。内存是钱。同机对比对方预分配 F16 KV 缓存吞到 3.03 GB我们 q8 按需分配只到 2.47 GB——省下的约 560 MB 在 4GB 入门板/多路并发场景就是能不能跑的差别。跑起来之后也不慢8K 长上下文 decode我们每 token 136.7 ms同机对比 411.6 ms约 3 倍跨进程重启后靠磁盘 KV 快照 13 倍速恢复会话——小归小活不糙。为什么能这么快一句话版本我们在“出厂前”就把活干完了——权重在转换阶段就完成量化与布局重排自研 VQF v2 格式推理时 mmap 直接映射、指针直挂启动不用现场“读权重→量化→重排”那一套 20 多秒的流程。类比别人是到店才洗菜切菜我们是罐头厂预先封装好你只负责下锅。一块 RK3588 就能复现不用云 GPU不用租机。手头有块 RK3588香橙派 5 / 5 Plus / 各种 RK3588 板卡都行git clone https://gitee.com/pei-xiaoguang/kestrel-llm.git cd kestrel-llm ./build_rk3588.sh # 原生构建产物 build-rk3588/vllm_kestrel ./vllm_kestrel --convert-vqf model.vqf --model hf目录 --wmode q4 # 权重转 VQF一次 ./vllm_kestrel --serve --model 模型目录 --port 8080 --wmode q4 --auto-load curl http://板子IP:8080/health # 2 秒后应看到 ready完整的复现方法、原始数据、所有自检命令都在仓库docs/里包括一条板端内存安全验证记录ASan 构建 0 内存错误——我们鼓励你按文档自己跑一遍而不是信这篇文的嘴。泼一盆冷水想做成长期项目这点必须说爆款文容易招黑丑话放前头它只适配 Qwen3-VL 系列2B/8Btokenizer/视觉塔都是为它特化的——拿 Llama 来跑会翻车别怪我们没写1K–4K 短上下文的 prefill对比对象比我们快 1.4–1.6 倍人家的 NEON 点积打磨了更久我们在 8K 长上下文才追平并在 decode 反超二进制体积我们只报自己的——跨框架比体积口径太乱是耍流氓。这些“不漂亮”的地方和踩坑清单仓库文档里一条没藏。Kestrelvllm_kestrel已完全开放https://gitee.com/pei-xiaoguang/kestrel-llm双许可协议Dual License学习与学术研究完全免费商业与产品化部署请先取得商业授权。如果你也在折腾 RK3588 / 树莓派级设备跑 LLM欢迎去仓库 Issues 聊聊——2 秒冷启动的秘诀不在魔法在把能省的都省了。相关文章技术拆解版《20 天、800KB、零依赖AI Agent 结对写出的纯 C 国密 LLM 推理引擎》
返回列表