ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Yi 模型 Cookbook 全栈实战指南:推理、本地部署、量化微调、RAG 与函数调用

Yi 模型 Cookbook 全栈实战指南:推理、本地部署、量化微调、RAG 与函数调用 Yi 模型 Cookbook 全栈实战指南推理、本地部署、量化微调、RAG 与函数调用【免费下载链接】YiA series of large language models trained from scratch by developers 01-ai项目地址: https://gitcode.com/GitHub_Trending/yi/YiYi Cookbook 是 Yi 系列大语言模型的官方中文综合实战资源库覆盖从开源模型推理、四种本地部署方案、三类量化工具、两种微调框架到 RAG 检索增强与函数调用等全链路应用场景。本文以Cookbook/README_cn.md为骨架结合仓库内demo/、finetune/、quantization/等源码为你逐章展开每篇教程的核心操作与可复现命令读完即可按图索骥完成一次从下载模型到微调专属模型的完整动手实践。Yi Cookbook 是什么Yi Cookbook 是围绕 Yi 系列大语言模型的综合资源库包含教程、演示和详细文档无论是刚接触大模型的初学者还是想深入研究的进阶用户都能在其中找到对应的实战内容。其定位是一站式动手手册每一个条目都对应一份可以直接运行的 Notebook.ipynb或分步 Markdown 教程而不是泛泛的原理介绍。仓库于 2024-07-29 发布 Yi Cookbook 1.0 版本中文教程与示例并于 2024-08-09 发布英文版本即Cookbook/README.md对应的en目录中英文教程一一对应便于对照学习。整个 Cookbook 按应用形态划分为三大板块板块覆盖场景OpenSource面向开源模型如 Yi-1.5-6B-Chat的推理、量化、微调、本地运行、RAG、函数调用API面向 Yi API 云端模型的 RAG 与函数调用应用构建Ecosystem完整落地案例数学逻辑增强微调、智能问答、游戏 Agent、思维导图生成器、Yi-VL 视觉模型微调开源模型推理四选一的推理方案OpenSource 板块的第一组教程解决拿到 Yi 模型后怎么跑起来的问题提供了四种主流推理路线教程核心内容Inference_using_swift.ipynb利用 Swiftms-swift框架快速进行 Yi 模型推理Inference_using_transformers.ipynb使用 Transformers 高效推理 Yi 模型Inference_using_lmdeploy.ipynb通过 LMDeploy 快速上手 Yi 模型推理vLLM_Inference_tutorial.ipynb使用 vLLM 体验 Yi 模型的快速推理四条路线各有侧重Transformers 是生态兼容性最好的基线方案适合快速验证与二次开发SWIFT 强调训练—推理—评测—部署的完整链路LMDeploy 与 vLLM 则面向高吞吐、低时延的服务化推理场景适合作为在线服务的推理后端。仓库根目录下的demo/提供了与这些 Notebook 配套的最小可运行脚本可以作为脱离 Notebook 环境的落地方案demo/text_generation.py单卡/单进程文本生成的最小示例demo/text_generation_tp.py张量并行Tensor Parallelism版本适合多 GPU 环境下的大尺寸 Yi 模型demo/web_demo.py基于 Web 界面的交互式演示脚本便于快速搭建可对话的 Demo 页面。从这几个文件的命名与组织可以推断仓库推荐的推理演进路径是先用text_generation.py跑通最小闭环再按显存规模决定是否启用text_generation_tp.py的张量并行最后用web_demo.py将能力暴露成可交互界面。本地部署四套方案覆盖全平台如果不想依赖云端算力OpenSource 板块提供了四套本地运行方案覆盖 Windows/macOS/Linux 与 Apple Silicon 等不同环境。下表汇总了各方案的适用前提方案适用环境模型形态local-ollama.md全平台官方 Ollama 模型库yi:6b 等local-llama.cpp.mdWindows / Linux / macOSGGUF 格式local-lm-studio.mdWindows / macOS 桌面端可视化搜索下载的 GGUF 模型local-mlx.md仅 macOSApple SiliconMLX 格式方案一Ollama 一行命令跑起来Ollama 是开源的大语言模型服务工具允许用户在自己的硬件环境中轻松部署和使用大规模预训练模型。安装完成后直接终端运行ollama run yi:6b运行命令后 Ollama 会自动将模型下载到本地下载完成后即可直接对话。若想获得可视化操作体验可以搭配 OpenWebUI 使用基本无需敲命令即可完成对话管理确保 Ollama 安装正确安装 Docker轻量级容器运行环境用于承载 OpenWebUI 服务终端执行以下命令启动 OpenWebUI 容器docker run -d -p 3000:8080 --add-hosthost.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main启动 Docker 后打开 OpenWebUI 页面在界面中下载模型即可在对话框中使用 Yi 模型。这套方案的亮点在于零代码ollama run负责模型下载与推理OpenWebUI 负责界面与交互两步即可获得一个可用的本地对话服务。方案二llama.cpp 高性能本地推理与二次量化llama.cpp 由 C 编写目标是以最少的设置实现 LLM 推理并支持 Yi 系列的 GGUF 格式模型。教程以 Yi-1.5-6B-Chat 为例给出两条获取 GGUF 模型的路径路径 A直接下载社区转换好的 GGUF 模型需安装huggingface_hubpip install huggingface_hub huggingface-cli download lmstudio-community/Yi-1.5-6B-Chat-GGUF --local-dir /root/yi-models/Yi-1.5-6B-Chat-GGUF路径 B自己转换。先下载 HF 原始权重再使用 llama.cpp 自带的转换脚本需先完成下文源码编译huggingface-cli download 01-ai/Yi-1.5-6B-Chat --local-dir /root/yi-models/Yi-1.5-6B-Chat python convert-hf-to-gguf.py /root/yi-models/Yi-1.5-6B-Chat --outfile /root/yi-models/Yi-1.5-6B-Chat-GGUF/Yi-1.5-6B-Chat-q8_0-v1.gguf --outtype q8_0接着从源码编译 llama.cpp先确认硬件能力运行python -c import torch; print(torch.cuda.is_available())输出True选 CUDA 版否则选 CPU 版git clone https://github.com/ggerganov/llama.cpp cd llama.cpp # CUDA 版本 cmake -B build_cuda -DLLAMA_CUDAON cmake --build build_cuda --config Release -j 8 # CPU 版本 cmake -B build_cpu cmake --build build_cpu --config Release进入bin目录后用llama-cli以多轮对话方式启动Linux/macOS./llama-cli -m /root/yi-models/Yi-1.5-6B-Chat-GGUF/Yi-1.5-6B-Chat-q8_0-v1.gguf -n -1 --color -r User: --in-prefix -i -p \ User: 你好 AI: 你好我来自零一万物有什么可以帮助您 User: 好啊 AI: 你想聊聊什么话题呢 User:Windows 下使用llama-cli.exe并把换行转义为\nllama-cli.exe -m /root/yi-models/Yi-1.5-6B-Chat-GGUF/Yi-1.5-6B-Chat-q8_0-v1.gguf -n -1 --color -r User: --in-prefix -i -e -p User: 你好\nAI: 你好我来自零一万物有什么可以帮助您\nUser: 好啊!\nAI: 你想聊聊什么话题呢\nUser:进阶用 llama.cpp 继续量化。若想进一步压缩模型体积可对已转换的 GGUF 文件执行重量化./llama-quantize --allow-requantize /root/yi-models/Yi-1.5-6B-Chat-GGUF/Yi-1.5-6B-Chat-q8_0-v1.gguf /root/yi-models/Yi-1.5-6B-Chat-GGUF/Yi-1.5-6B-Chat-q4_1-v1.gguf Q4_1执行./llama-quantize -h可查看全部支持的量化类型。以下是主要量化类型及其对应模型体积与困惑度增幅以 LLaMA-v1-7B 为参考基准可据此权衡体积与精度量化类型体积相对 F16 的困惑度增量Q4_03.56G0.2166 pplQ4_13.90G0.1585 pplQ5_04.33G0.0683 pplQ5_14.70G0.0349 pplQ2_K2.63G0.6717 pplQ3_K_S2.75G0.5551 pplQ3_K_M3.07G0.2496 pplQ3_K_L3.35G0.1764 pplQ4_K_S3.59G0.0992 pplQ4_K_M3.80G0.0532 pplQ5_K_S4.33G0.0400 pplQ5_K_M4.45G0.0122 pplQ6_K5.15G0.0008 pplQ8_06.70G0.0004 pplF1614.00G-0.0020 ppl参考基准BF1614.00G-0.0050 ppl此外还支持 IQ 系列低比特量化IQ1_S/IQ1_M、IQ2_XXS/IQ2_XS/IQ2_S/IQ2_M、IQ3_XXS/IQ3_XS/IQ3_S/IQ3_M、IQ4_NL/IQ4_XS可在 1.56–4.50 bpw 之间选择极低内存占用方案。原则很简单越低的比特数换来更小的体积但困惑度代价相应增大Q4_K/Q5_K 系列通常是性价比均衡点。方案三LM Studio 桌面可视化LM Studio 是易于使用的桌面应用程序用于试用本地和开源大模型操作门槛低。安装后直接在软件内搜索yi1.5-6b-chat或其他模型即可LM Studio 会自动评估当前电脑可运行的模型规模帮助规避显存不足的问题选择目标模型后点击Download即可完成下载并开始对话。该方案与 Ollama OpenWebUI 类似均为零命令的可视化路线区别在于 LM Studio 把搜索—下载—加载—对话全部收敛在单一下载应用内。方案四MLX-LM仅限 macOSMLX-LM 适用于 Mac OS 本地部署仅支持 macOS 操作系统。安装与使用都极其精简pip install mlx-lmfrom mlx_lm import load, generate model, tokenizer load(mlx-community/Yi-1.5-6B-Chat-8bit) response generate(model, tokenizer, prompthello, verboseTrue)模型名可替换为其他 MLX 社区转换版本例如mlx-community/Yi-1.5-34B-Chat-4bit从而在 Apple Silicon 的统一内存架构上以较低显存压力运行更大尺寸的 Yi 模型。量化压缩AutoAWQ、AutoGPTQ 与 SWIFT 三路并行当本地显存或推理吞吐成为瓶颈时量化是首选的优化手段。OpenSource 板块提供三篇量化教程全部以 Yi-1.5-6B-Chat 为演示对象。仓库quantization/目录下同样内置了对应的量化脚本quantization/awq/quant_autoawq.py与quantization/gptq/quant_autogptq.py可作为离线批处理参考。AutoAWQ4-bit 激活感知权重量化AutoAWQ 是易用的 4 位量化模型软件包实现了激活感知权重量化AWQ算法。演示环境下 Yi-1.5-6B-Chat 的显存使用约 6G、硬盘占用约 24.5G。安装pip 方式要求 CUDA 12.1CUDA 11.8、ROCm 5.6/5.7 推荐源码安装pip install autoawqgit clone https://github.com/casper-hansen/AutoAWQ.git cd AutoAWQ pip install -e .加载模型并量化。AWQ 完全兼容 Transformers可直接粘贴 HuggingFace 模型路径也可替换为本地微调好的模型from awq import AutoAWQForCausalLM from transformers import AutoTokenizer # model_path 是模型的路径这里从 huggingface 加载 Yi 模型 model_path 01-ai/Yi-1.5-6B-Chat # quant_path 为量化后模型的路径 quant_path Yi-1.5-6B-Chat-awq quant_config { zero_point: True, q_group_size: 128, w_bit: 4, version: GEMM } # 加载模型和分词器 model AutoAWQForCausalLM.from_pretrained(model_path) tokenizer AutoTokenizer.from_pretrained(model_path, trust_remote_codeTrue)保存量化模型model.save_quantized(quant_path) tokenizer.save_pretrained(quant_path) print(fModel is quantized and saved at {quant_path})也可将量化产物同步到云端盘如 Colab 环境挂载 Google Drive以便分享与备份from google.colab import drive import shutil drive.mount(/content/drive) local_path Yi-1.5-6B-Chat-awq drive_path /content/drive/MyDrive/Yi-1.5-6B-Chat-awq shutil.copytree(local_path, drive_path) print(f文件夹{local_path}已同步到{drive_path}。)通过 Transformers 直接加载量化模型进行推理from transformers import AutoModelForCausalLM, AutoTokenizer model_path Yi-1.5-6B-Chat-awq tokenizer AutoTokenizer.from_pretrained(model_path, use_fastFalse) model AutoModelForCausalLM.from_pretrained( model_path, device_mapauto, torch_dtypeauto ).eval() messages [ {role: user, content: hi} ] input_ids tokenizer.apply_chat_template(conversationmessages, tokenizeTrue, add_generation_promptTrue, return_tensorspt) output_ids model.generate(input_ids.to(cuda)) response tokenizer.decode(output_ids[0][input_ids.shape[1]:], skip_special_tokensTrue) print(response)AutoGPTQGPTQ 算法量化AutoGPTQ 是基于 GPTQ 算法、接口友好的量化工具包。演示环境下 Yi-1.5-6B-Chat 量化前后的显存约 7G、硬盘占用约 27G。安装推荐源码安装git clone https://github.com/AutoGPTQ/AutoGPTQ cd AutoGPTQ pip install .加载模型并配置量化超参from auto_gptq import AutoGPTQForCausalLM, BaseQuantizeConfig from transformers import AutoTokenizer model_path 01-ai/Yi-1.5-6B-Chat quant_path Yi-1.5-6B-Chat-GPTQ quantize_config BaseQuantizeConfig( bits8, # 量化为 8-bit 模型 group_size128, # 推荐 128 damp_percent0.01, desc_actFalse, # 设为 False 可以显著提升推理速度 ) tokenizer AutoTokenizer.from_pretrained(model_path) model AutoGPTQForCausalLM.from_pretrained(model_path, quantize_config)量化与保存。注意model.quantize(examples)中样本的数据类型应为List[Dict]且字典的键有且仅有input_ids和attention_maskimport torch examples [] messages [ {role: user, content: hi}, {role: assistant, content: Hello! Its great to see you today. How can I assist you} ] text tokenizer.apply_chat_template(messages, tokenizeFalse, add_generation_promptFalse) model_inputs tokenizer([text]) input_ids torch.tensor(model_inputs.input_ids[:max_len], dtypetorch.int) examples.append(dict(input_idsinput_ids, attention_maskinput_ids.ne(tokenizer.pad_token_id))) model.quantize(examples) model.save_quantized(quant_path, use_safetensorsTrue) tokenizer.save_pretrained(quant_path)加载量化模型推理from auto_gptq import AutoGPTQForCausalLM from transformers import AutoTokenizer quantized_model_dir Yi-1.5-6B-Chat-GPTQ tokenizer AutoTokenizer.from_pretrained(quantized_model_dir, use_fastTrue, trust_remote_codeTrue) model AutoGPTQForCausalLM.from_quantized(quantized_model_dir, device_mapauto, use_safetensorsTrue, trust_remote_codeTrue) output tokenizer.decode(model.generate( **tokenizer(|im_start|user Hi!|im_end| |im_start|assistant, return_tensorspt).to(model.device), max_new_tokens512)[0] ) print(output)SWIFT 一站式量化SWIFT 是 ModelScope 开源的多模态框架支持训练、推理、评测和部署完整链路量化只需几步。它支持awq、gptq、bnb、hqq、eetq五种量化技术按需安装对应后端即可# 使用 awq 量化注意 autoawq 与 CUDA 版本的对应关系 pip install autoawq -U # 使用 gptq 量化注意 auto_gptq 与 CUDA 版本的对应关系 pip install auto_gptq -U # 使用 bnb 量化 pip install bitsandbytes -U # 使用 hqq 量化需 transformers4.41 pip install hqq # 使用 eetq 量化需 transformers4.41源码安装 git clone https://github.com/NetEase-FuXi/EETQ.git cd EETQ/ git submodule update --init --recursive pip install .若运行报错可执行环境对齐通常不需要仓库使用最新环境测试pip install -r requirements/framework.txt -U pip install -r requirements/llm.txt -UAWQ 量化需要数据集教程使用alpaca-zh、alpaca-en、sharegpt-gpt4:defaultCUDA_VISIBLE_DEVICES0 swift export \ --model_type yi-1_5-6b-chat --quant_bits 4 \ --dataset alpaca-zh alpaca-en sharegpt-gpt4:default --quant_method awq量化完成后直接用 SWIFT 推理CUDA_VISIBLE_DEVICES0 swift infer \ --model_type yi-1_5-6b-chat \ --model_id_or_path yi-1_5-6b-chat-awq-int4HQQ 量化bnb、hqq、eetq 可直接用swift infer边量化边推理CUDA_VISIBLE_DEVICES0 swift infer \ --model_type yi-1_5-6b-chat \ --quant_method hqq \ --quantization_bit 4--model_type指定模型类型、--quant_method指定量化方法、--quantization_bit指定量化比特数三者是调节量化策略的核心参数。微调LLaMA-Factory 与 SWIFT 打造专属 Yi 模型如果通用能力无法满足业务需求就需要微调。OpenSource 板块提供两篇微调教程仓库finetune/目录下的finetune/sft/main.py与finetune/scripts/如run_sft_Yi_6b.sh、run_sft_Yi_34b.sh、run_sft_lora_Yi_6b.sh则提供了官方 SFT 与 LoRA 训练脚本作为底层的工程实现参考。使用 LLaMA-Factory 微调完整配置逐项解析LLaMA-Factory 是开源低代码大模型微调框架集成了业界广泛使用的微调技术。跟随以下四步即可完成一次 LoRA 微调Step 1安装git clone --depth 1 https://github.com/hiyouga/LLaMA-Factory.git cd LLaMA-Factory pip install -e .[torch,metrics]Step 2准备模型二选一# 从 ModelScope 下载 git clone https://www.modelscope.cn/01ai/Yi-1.5-6B-Chat.git # 从 HuggingFace 下载 git clone https://huggingface.co/01-ai/Yi-1.5-6B-ChatStep 3创建微调配置。在 LLaMA-Factory 的examples/train_qlora下复制llama3_lora_sft_awq.yaml并重命名为yi_lora_sft_bitsandbytes.yaml内容填充为4-bit QLoRA SFT 阶段各参数含义见注释### model model_name_or_path: 你下载的模型位置比如 ../Yi-1.5-6B-Chat quantization_bit: 4 # 4-bit 量化加载显著降低显存 ### method stage: sft # 训练阶段指令微调 do_train: true finetuning_type: lora # 微调方式LoRA lora_target: all # LoRA 作用的模块全部 ### dataset dataset: identity # 数据集identity自我认知 template: yi # 对话模板yi cutoff_len: 1024 # 截断长度 max_samples: 1000 # 最大样本数 overwrite_cache: true preprocessing_num_workers: 16 ### output output_dir: saves/yi-6b/lora/sft logging_steps: 10 save_steps: 500 plot_loss: true overwrite_output_dir: true ### train per_device_train_batch_size: 1 gradient_accumulation_steps: 8 # 与 batch_size 共同决定等效 batch size learning_rate: 1.0e-4 num_train_epochs: 3.0 lr_scheduler_type: cosine warmup_ratio: 0.1 fp16: true # 半精度训练 ### eval val_size: 0.1 # 10% 数据作为验证集 per_device_eval_batch_size: 1 eval_strategy: steps eval_steps: 500这里使用的identity数据集即自我认知数据集当问模型你是谁时模型会回答我叫 name由 author 开发。把数据集换成你自己的名字与信息就能微调出一个属于你自己的大模型。Step 4启动微调与推理llamafactory-cli train examples/train_qlora/yi_lora_sft_bitsandbytes.yaml训练完成后教程示例约需 10 分钟参考examples/inference下的llama3_lora_sft.yaml复制并重命名为yi_lora_sft.yamlmodel_name_or_path: 你下载的模型位置比如 ../Yi-1.5-6B-Chat adapter_name_or_path: saves/yi-6b/lora/sft template: yi finetuning_type: lora回到终端运行推理命令llamafactory-cli chat examples/inference/yi_lora_sft.yaml使用 SWIFT 微调SWIFT 微调采用 CLI 方式核心命令非常精简CUDA_VISIBLE_DEVICES0 swift sft \ --model_id_or_path 01ai/Yi-1.5-6B-Chat \ --dataset AI-ModelScope/blossom-math-v2 \ --output_dir output \三个核心参数的含义--model_id_or_path指定使用的模型--dataset选择数据集--output_dir指定微调后模型的存放位置。与 LLaMA-Factory 的 YAML 配置相比SWIFT 更强调一条命令完成训练参数通过命令行直接注入适合快速迭代。RAG 检索增强让 Yi 回答你的私有知识RAG检索增强生成是把外部知识库与 LLM 结合的标准方案。OpenSource 板块提供两套基于开源 Yi 模型的 RAG 教程教程框架特点yi_rag_llamaindex.ipynbLlamaIndex提供数据连接器、数据结构化工具和高级检索/查询接口yi_rag_langchain.ipynbLangChain组件灵活、生态庞大以 yi_rag_llamaindex.ipynb 为例构建流程大致为准备开源模型通过 Ollama 或 HuggingFace 下载 Yi 开源模型若已有微调好的模型也可通过HuggingFaceLLM的tokenizer_name与model_name字段直接加载配置嵌入模型教程使用bge-base-zh-v1.5作为中文检索嵌入模型英文场景可换为bge-base-en-v1.5构建索引与查询借助 LlamaIndex 的文档加载、索引构建与查询引擎完成文档 → 向量索引 → 基于检索结果的问答闭环。该 Notebook 运行环境依赖llama-index示例版本 0.10.58及其llama-index-llms-huggingface、llama-index-embeddings-openai等子包可作为环境准备清单参考。函数调用从零实现到框架集成函数调用Function Calling让模型具备调用外部工具/API的能力是构建 Agent 的关键一环。OpenSource 板块提供两篇教程教程内容function_calling.ipynb从零开始实现函数调用理解底层机制function_calling_llamaindex.ipynb基于 LlamaIndex 轻松实现函数调用两篇教程形成先理解原理、再借助框架提效的学习路径前者适合理解 Yi 模型如何产出结构化函数调用参数后者则利用 LlamaIndex 的 Agent 机制屏蔽底层细节快速集成到应用。API 板块基于 Yi 云端模型快速建应用若不想自行部署模型API 板块提供了直接基于 Yi API 的应用构建教程与 OpenSource 板块形成开源自部署 / 云端 API双轨教程内容yi_rag_llamaindex.ipynb使用 Yi API 模型与 LlamaIndex 构建 RAG 应用yi_rag_langchain.ipynb利用 LangChain 构建基于 Yi API 的 RAG 系统function_calling_llamaindex.ipynb使用 Yi API 模型基于 LlamaIndex 实现函数调用与开源版教程的唯一差异在于 LLM 来源本地模型替换为 API 调用后省去了显存与部署成本其余索引构建、查询、Agent 编排逻辑可复用是快速原型验证的首选路径。Ecosystem五个完整落地案例Ecosystem 板块收录了五个完整应用级案例展示 Yi 模型在真实场景中的组合用法案例类别核心内容强化Yi-1.5-6B-Chat的数学和逻辑能力.mdfine-tuning通过微调增强 Yi-1.5-6B-Chat 的数学与逻辑推理能力配套train_memory(GiB).png等训练资源分析基于LlamaIndex和Yi-large构建智能问答系统.mdRAG结合 LlamaIndex 与 Yi-large 构建智能问答系统使用Yi大模型玩转街霸三.mddemo大模型玩游戏探索 Yi 玩转街霸三Street Fighter III基于yi-large构建思维导图生成器.mddemo基于 Yi-large 打造高效的思维导图生成器yi-vl最佳实践.mdfine-tuning掌握 Yi-VL 多模态模型微调的最佳实践其中 Yi-VL 案例对应仓库VL/目录的多模态能力该目录提供了VL/cli.py、VL/web_demo.py、VL/single_inference.py等推理入口以及VL/llava/model/下的 LLaVA 架构实现clip_encoder、multimodal_projector、llava_llama等模块配合VL/images/中的示例图片如cats.jpg、extreme_ironing.jpg可完整验证 Yi-VL 的图文理解链路。数学逻辑增强案例则与finetune/的 SFT 训练框架finetune/sft/main.py一脉相承其训练/评估脚本可参考finetune/scripts/run_eval.sh。参与社区贡献Yi Cookbook 欢迎社区贡献参与方式包括问题报告发现 bug 或有功能建议可在仓库 Issues 中提交作品展示如果你有基于 Yi 模型做的有趣、实用的应用或教学欢迎提交 PR 到本仓库提交前请遵循 贡献指南。从入门到实战的推荐路径综合以上全部章节可以按自己的目标选择学习路线只想快速体验走 Ollama 或 LM Studio一行命令或一次点击即可对话想深度掌控推理研读四个推理 Notebook并用demo/text_generation.py验证最小闭环按需升级到demo/text_generation_tp.py张量并行显存不够在 AutoAWQ、AutoGPTQ、SWIFT 量化 三者中按 CUDA 版本与量化精度需求选择打造专属模型用 LLaMA-FactoryYAML 配置细粒度可控或 SWIFTCLI 一行命令完成 LoRA/SFT 微调接私有知识 / 做 Agent进入 RAG 与 函数调用 章节最后参考 Ecosystem 的五个案例把技术组合成完整产品。Yi Cookbook 的价值正在于此它不是零散的命令清单而是一条经过验证的、覆盖部署—压缩—定制—应用全链路的可执行路径仓库内的源码与脚本则为每一步提供了可对照的工程实现。【免费下载链接】YiA series of large language models trained from scratch by developers 01-ai项目地址: https://gitcode.com/GitHub_Trending/yi/Yi创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表