ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive llama.cpp 部署:从 0 到 1 跑通本地多模态推理

Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive llama.cpp 部署:从 0 到 1 跑通本地多模态推理 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive llama.cpp 部署从 0 到 1 跑通本地多模态推理【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARSllama.cpp 把 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive 装进你的机器不审查文本、图像、视频全通部署完终端对话和 API 服务两种用法直接上手。部署之后你能拿它做什么这个模型的“多模态”不是摆设。丢给它一段文字、一张截图或一段视频它可以描述内容、定位界面元素、按你的指令行动。本仓库里一个多模态 GUI Agent 从感知画面到执行动作的完整链路如下图所示。跑起来之后有两条使用路线任选其一终端对话一条 CLI 命令和模型面对面聊适合尝鲜和临时任务API 服务llama-server 一跑端口 8080 对外提供 /completion 接口内网任意程序都能调用适合搭自己的工作流。两者共用同一份模型文件和同一套参数从哪边入手都行。开跑前先把配置对一遍先把下面的自检清单过一遍缺什么补什么比部署到一半再回头折腾便宜得多。硬件自检清单内存 ≥32GB推荐 64GB 以上具体吃多少看你选哪档量化版本支持 CUDA 的显卡显存 12GB 以上如 RTX 3090/4090 或同等配置GitC 编译器GCC 或 ClangCMake清单都打勾再决定模型体积。按你的硬件选哪档量化版本GGUF 量化常见三档级别越高文件越大、效果越接近原始权重越低越省显存。对着自己的机器挑量化级别文件体积适合谁Q8_K_PQwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q8_K_P.gguf约 44 GB高端 GPU / 服务器Q4_K_MQwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf约 21 GB中端 GPUIQ2_MQwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf约 11 GB入门级 GPU / CPU要多模态能力的话还差一件东西图像/视频输入依赖 f16 投影文件 mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf跟模型文件一起下好、放在同一处。从零到第一次跑通 下载、编译、验证、加载四步一条线每步做完再往下走。备齐模型文件。把对应量化档位的 GGUF 和 mmproj 投影文件取到本地一个目录里记好路径后面所有命令都要引用它们。编译 llama.cpp。项目是 C 写的本地编译完就能用。克隆仓库然后开启 CUDA 加速进行构建git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS cd UI-TARS make LLAMA_CUBLAS1LLAMA_CUBLAS1 是打开 GPU 加速的开关编译要跑几分钟等输出结束即可。验证编译结果。查一下版本号./llama-cli --version能看到版本信息输出说明编译成功继续下一步。首次加载模型。用下面这条命令把模型拉起来做个自检./llama-cli -m /path/to/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf \ --mmproj /path/to/mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \ --jinja -c 131072 -ngl 99进入对话界面不报错整条链路就跑通了。模型跑起来的两种姿势姿势一终端对话CLI核心命令就是上一步用过的那条各参数的分工如下参数作用-m模型文件路径--mmproj多模态投影文件图像/视频输入必须带上--jinja启用 Jinja 对话模板保证消息格式正确-c 131072上下文窗口大小即 128K tokens-ngl 99把所有层全部放进显存进界面直接聊。最小示例 你好介绍一下自己 我是一个不审查的多模态 AI文本、图像、视频都能处理说说看有什么要我帮忙的截图也一样能看懂比如丢一张桌面画面给它它会描述界面内容、指认元素位置姿势二30 秒启动 API 服务llama-server把 ./llama-cli 换成 ./llama-server再追加两个对外暴露的参数其余照旧./llama-server -m /path/to/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf \ --mmproj /path/to/mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \ --jinja -c 131072 -ngl 99 --host 0.0.0.0 --port 8080启动后 8080 端口打开内网任何设备都能访问。文本生成。用 curl 向 /completion 发请求把 prompt 换成你的任务即可curl -X POST http://localhost:8080/completion \ -H Content-Type: application/json \ -d { prompt: 写一篇关于人工智能的短文, temperature: 0.7, max_tokens: 512 }响应里直接返回生成出的文本。多模态输入。要让它看图把图像按 base64 编码后随 prompt 一起描述过去curl -X POST http://localhost:8080/completion \ -H Content-Type: application/json \ -d { prompt: 描述这张图片的内容: image, temperature: 0.7, max_tokens: 512 }模型会从截图里解析出界面内容还能以坐标形式返回元素位置效果如下图所示不同任务参数怎么调生成质量很吃三个采样参数官方按场景给出的推荐组合如下对号入座即可任务类型temperaturetop_ptop_k通用任务1.00.9520代码 / 精确任务0.60.9520推理任务1.01.040温度越低输出越稳适合要求准确的场景越高越发散适合开放对话。显存紧张时的备选动作加载吃紧或显存占用过高按顺序试这三招换更低的量化版本比如 IQ2_M约 11 GB追加 --low-vram 参数进入低显存模式把 -c 调小不是每个任务都需要 128K 上下文按实际需求设置。踩坑速查 ⚠️症状可能原因修复动作模型加载失败文件路径写错、下载不完整或 llama.cpp 版本过旧核对路径与文件完整性git pull 更新源码到最新版后重新编译推理速度明显偏慢GPU 层数给少了、别的程序占着显存或量化档偏低调大 -ngl把更多层推给 GPU99 表示全用关掉其他占用 GPU 的程序换 Q5_K_P、Q8_K_P 这类更高量化多模态输入不生效--mmproj 路径指错或图像格式不对把参数对准 f16 投影文件确认图像以 base64 形式传入跑通之后剩下的都是玩法终端对话与 API 调用两条路都在你手里。更细致的用法看项目里的 README.md 和 README_deploy.md遇到卡点官方社区里找答案最快。【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表