ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

self-llm 如何在 AMD Ryzen AI NPU 上用 Lemonade 部署 Gemma-4 E4B-it GGUF 模型服务

self-llm 如何在 AMD Ryzen AI NPU 上用 Lemonade 部署 Gemma-4 E4B-it GGUF 模型服务 self-llm 如何在 AMD Ryzen AI NPU 上用 Lemonade 部署 Gemma-4 E4B-it GGUF 模型服务【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llm如果你有一台带 AMD Ryzen AI NPU 的 Windows 11 电脑想在本地 NPU 上跑 Gemma-4 E4B-it 的 GGUF 权重并通过一个兼容 OpenAI 的接口调用它这篇文章给出 self-llm 教程中走过的完整操作路径先装好 NPU 驱动和 Ryzen AI 软件并验证 NPU 可用再安装 Lemonade Server、下载ggml-org/gemma-4-E4B-it-GGUF模型最后启动服务并用 Python 请求验证。教程的基础环境是 Windows 11 锐龙 AI 395 128G 内存文档明确目前支持的 AMD 芯片为 AI 395 和 AI 370。先决条件系统与软件版本在安装任何 NPU 相关内容之前按 self-llm AMD 环境准备文档 核对以下依赖项依赖项版本要求Windows 11build 22621.3527Visual Studio2022cmakeversion 3.26Python 发行版推荐 Miniforge最新版本文档特别强调两条容易漏掉的配置Visual Studio 2022 要安装使用 C 的桌面开发工作负载Miniforge 要在环境变量窗口的系统变量部分把path\to\miniforge3\condabin、path\to\miniforge3\Scripts\或path\to\miniforge3\三者之一加入系统 PATHpath\to是 Miniforge 实际安装位置后续所有安装程序都用管理员权限打开。安装并验证 NPU 驱动下载 NPU 驱动程序版本要求32.0.203.280 或更新版本文档同时给出了 32.0.203.304 这一更新的版本下载入口在 AMD 官方文档页面。解压下载的 ZIP 文件以管理员模式打开终端进入解压目录执行.\npu_sw_installer.exe验证安装打开任务管理器 → 性能 → NPU0确认 NPU MCDM 驱动程序已正确安装版本应为下列之一版本 32.0.203.280日期 5/16/2025版本 32.0.203.304日期 10/07/2025任务管理器里看不到 NPU0 或驱动版本对不上就先停在这里排查驱动不要继续后面的步骤。安装并验证 Ryzen AI 软件NPU 驱动就绪后安装 Ryzen AI 软件本体下载安装程序ryzenai-lt-1.6.1.exe。启动 EXE 安装程序并按向导操作接受许可协议条款提供安装目标文件夹默认C:\Program Files\RyzenAI\1.6.1指定 conda 环境名称默认ryzen-ai-1.6.1。安装完成后Ryzen AI 软件包位于安装程序创建的 conda 环境中。安装验证用安装文件夹自带的quicktest测试在 Windows 开始菜单搜索 Miniforge Prompt 打开 Conda 命令提示符激活安装程序创建的 conda 环境env_name替换为你安装时指定的环境名默认ryzen-ai-1.6.1conda activate env_name进入 quicktest 目录并运行测试RYZEN_AI_INSTALLATION_PATH是 Ryzen AI 软件安装文件夹的完整路径存储在同名环境变量中cd %RYZEN_AI_INSTALLATION_PATH%/quicktest python quicktest.pyquicktest.py会设置环境并运行一个简单的 CNN 模型。成功时输出类似以下内容文档示例说明模型正在 NPU 上运行、软件安装成功[Vitis AI EP] No. of Operators : NPU 398 VITIS_EP_CPU 2 [Vitis AI EP] No. of Subgraphs : NPU 1 Actually running on NPU 1 Test Passed看到Test Passed且 Actually running on NPU 为 1才进入下一步。安装 Lemonade Server 与 Python 依赖下载并安装lemonade-server部署文档中以截图标注了安装入口见文中 Lemonade Server 下载与安装说明。在 PowerShell 中先换源加速再安装依赖# 升级pip python -m pip install --upgrade pip # 更换 pypi 源加速库的安装 pip config set global.index-url https://pypi.tuna.tsinghua.edu.cn/simple pip install -U huggingface_hub pip install lemonade-sdk[dev]下载 Gemma-4 E4B-it GGUF 模型先在 Windows PowerShell 中配置镜像站再执行下载脚本$env:HF_ENDPOINT https://hf-mirror.com新建model_download.py文件内容如下完整脚本与文档一致#!/usr/bin/env python 使用 Python API 下载 Hugging Face 模型 import os from huggingface_hub import snapshot_download def download_model(repo_id: str, local_dir: str None, resume_download: bool True): 下载 Hugging Face 模型 Args: repo_id: 模型仓库ID例如 ggml-org/gemma-4-E4B-it-GGUF local_dir: 本地保存目录如果为None则使用默认缓存目录 resume_download: 是否支持断点续传 print(f开始下载模型: {repo_id}) print(f保存位置: {local_dir if local_dir else 默认缓存目录}) try: # 如果指定了本地目录使用它否则使用默认缓存 if local_dir: cache_dir os.path.dirname(local_dir) if os.path.dirname(local_dir) else None local_dir_use local_dir else: cache_dir None local_dir_use None # 下载模型 downloaded_path snapshot_download( repo_idrepo_id, local_dirlocal_dir_use, cache_dircache_dir, resume_downloadresume_download, local_files_onlyFalse ) print(f\n✓ 模型下载完成) print(f保存路径: {downloaded_path}) return downloaded_path except Exception as e: print(f\n✗ 下载失败: {str(e)}) raise if __name__ __main__: import sys # 默认下载的模型 repo_id ggml-org/gemma-4-E4B-it-GGUF # 如果提供了命令行参数使用它作为模型ID if len(sys.argv) 1: repo_id sys.argv[1] # 可选指定本地保存目录 local_dir None if len(sys.argv) 2: local_dir sys.argv[2] download_model(repo_id, local_dir)保存后执行下载。第二个参数是模型的本地保存路径文档中是作者机器的路径请替换为你自己的目录python model_download.py ggml-org/gemma-4-E4B-it-GGUF C:\Users\aup\.cache\huggingface\hub\gemma-4-E4B-it-GGUF脚本成功时会打印模型下载完成及保存路径。启动 Lemonade 服务在 Windows 菜单栏开始菜单搜索框输入Lemonade Server启动点击菜单里对应的图标然后选中刚下载的gemma-4-E4B-it-GGUF模型即可启动。服务启动后会对外输出兼容 OpenAI 的接口如上图所示。用 OpenAI 客户端测试服务新建test.py文件并保存以下代码base_url 指向本地 Lemonade 服务api_key固定填lemonade文档注明该 key 仅必填、实际不校验# Client library provided by OpenAI to automate request # and response processing with the server from openai import OpenAI # The base_url points to an LLM server, which can either be # local (localhost address) or cloud-based (web address) base_url fhttp://localhost:8000/api/v1 # The client instance here provides APIs to request # LLM invocations from the server client OpenAI( base_urlbase_url, api_keylemonade, # required, but unused in Lemonade ) # The messages list provides the history of messages from # the system, assistant, and user roles messages [ {role:system, content:You are a helpful assistant.}, {role:user, content:Hi, how are you?}, ] # This is the API call that sends the messages history to # the servers specific LLM model completion client.chat.completions.create( modelgemma-4-E4B-it-GGUF, messagesmessages, ) # Print the LLMs response response completion.choices[0].message.content print(response)运行python test.py能打印出模型对 Hi, how are you? 的回复即说明服务可用。文档示例中返回了一段正常对话文本见开头第三张截图。限制与边界芯片范围文档明确当前支持AI 395 和 AI 370其他型号不在教程验证范围内开始前先确认自己的芯片版本。硬件加速器与推理引擎的支持范围以 Lemonade 官方说明为准文档以截图形式列出了支持的硬件加速器与推理引擎清单见 部署文档 中支持的硬件加速器与支持的推理引擎两节配图。NPU 驱动版本低于 32.0.203.280 时不满足安装条件任务管理器中的驱动版本和日期是核对依据。多模态权重与 GGUF 权重来自不同仓库与 Lemonade 搭配部署时GGUF 用ggml-org/gemma-4-E4B-it-GGUF本文全程只使用 GGUF 仓库不需要下载多模态原始权重。完整步骤可对照仓库中的 AMD 环境准备文档 与 模型服务部署文档。【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表