
GenieX CLI 从 0 到 1在自己电脑上本地跑起 LLM 和 VLM 大模型【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieXGenieX CLI 让你在 Windows 和 Linux ARM64 设备上把前沿的大语言模型LLM和视觉语言模型VLM直接跑在本机——推理可以落到 NPU、GPU 或 CPU 上数据不出设备。安装完成后一条命令就能让模型在你屏幕上逐字吐出回答。下面从装到用带你把本地大模型部署这件事真正走通。第一站5 分钟装好并验证按系统选安装方式GenieX CLI 面向 Qualcomm 芯片提供两种安装包。先确认你的设备和架构再照表操作系统架构安装方式WindowsARM64Snapdragon X 系列下载geniex-cli.exe安装器双击安装LinuxARM64Dragonwing QCS9075 等终端执行安装脚本curl -fsSL …/install.sh \| shWindows 上安装器尚未代码签名SmartScreen 会拦截点更多信息 → 仍要运行即可。Linux 脚本会自动下载最新版、校验 SHA256 并免 sudo 安装若提示缺libCB.so.1之类的库先装好高通驱动包再来。装完如何验证版本打开一个新终端让 PATH 生效跑下面任意一条命令确认装好了geniex version会看到 CLI 版本以及 QAIRT 运行时和 llama.cpp 的运行时信息。如果提示找不到命令重新打开终端或按安装器结尾打印的那行export PATH…手动加进去。第二站第一次跑模型文本生成跑第一个 LLM不需要手动下载模型——geniex infer发现模型不在本地时会先自动拉取并让你选精度有 NPU 时选Q4_0最友好然后进入对话geniex infer unsloth/Qwen3.5-0.8B-GGUF回车后直接在提示符里输入你的问题模型会流式地把回答逐字打印出来就像在和一个离线助手聊天。图像与音频理解跑 VLM想让它看图说话换成视觉语言模型进入交互后把图片路径和问题一起输入即可例如贴!photo.jpg 这张图里有什么geniex infer Qwen/Qwen3-VL-2B-Instruct-GGUF部分 VLM 还支持音频输入直接在输入里带一个.wav路径就行这类功能依赖sox缺失时 CLI 会提示你补装。第三站从能用到好用加参数让输出更可控默认输出往往够用了想再调一调在infer后面追加参数。比如压低随机性、限制长度、给模型一句人设geniex infer unsloth/Qwen3.5-0.8B-GGUF --temperature 0.7 --max-tokens 1024 -s 你是一个简洁的助手用--compute gpu或--compute npu可以指定算力单元默认 NPU。不指定--prompt时命令会停在交互模式方便连续追问这就是现成的 REPL省去每次重新加载模型的等待。起一个本地服务用 API 调用想给别的应用接上模型就在后台起一个 OpenAI 兼容的 HTTP 服务默认监听127.0.0.1:18181geniex serve起来之后任何支持 OpenAI 接口的客户端都能指向它发请求返回的是标准格式的模型回答第四站遇到问题时看到报错想查根因把日志开到调试级geniex infer model --log debug或一次性export GENIEX_LOGdebug。麦克风录音等临时文件会落在系统临时目录下的geniex-cli里比如/tmp/geniex-cli/时间戳.wav排查时可以去翻。geniex list看你缓存了哪些模型geniex clean一键清空腾空间。提示有新版本时跑geniex update升到最新。从一条geniex infer起你已经在自己设备上跑起了前沿模型。更多命令和参数随时翻 CLI 参考 和 快速上手。【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieX创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考