ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

30分钟完整教程:Tianji-天机智能体如何用LoRA微调出懂中文社交的大模型

30分钟完整教程:Tianji-天机智能体如何用LoRA微调出懂中文社交的大模型 30分钟完整教程Tianji-天机智能体如何用LoRA微调出懂中文社交的大模型【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llm送祝福、写敬酒词、化解饭局尴尬——这些中文社交场景里最让人头大的事正是Tianji-天机智能体要解决的。它来自 self-llm 仓库的示例项目完整走通了大模型微调的路径用LoRA把开源模型调教成人情世故助手。下面按它是什么→它怎么做到→效果实测→你如何玩的顺序来拆。它是什么 替你说好话的中文社交智能体中国文化讲人情世故长辈面前要恭敬同事之间要得体朋友之间要有趣。通用大模型写祝福常常端着出来的文字像群发模板。Tianji-天机智能体专治这个毛病——覆盖生日、节日、升职、敬酒、请客、送礼、化解尴尬、应对矛盾等场景能按对象28种角色和语气3种风格定制输出。它不只是一个好玩的社交demo。整个项目把提示词工程、智能体制作、模型微调、RAG数据清洗串成了完整链路读完 examples/Tianji-天机/readme.md 基本等于跟完一门大模型应用入门课。数据怎么来 用大模型批量造祝福语料微调效果的上限由数据决定。天机没有爬语料而是让另一个聪明的大模型当数据工厂批量生成QA对28个角色大舅、李总、导师、领导……18个场景生日、春节、乔迁新居、谈判顺利、工作升职……3种风格正常、小红书带emoji、商业严肃两个容易忽略的细节一是把造数据时的提示词替换成真实用户会输入的短句如祝姐姐生日快乐,小红书风格模型学到的才是真人输入二是维护一个随机语句列表随机注入提示词让生成结果更多样。多轮跑完的json合并成一份训练集tianji-wishes-chinese-v0.1.json再做二次清洗去重、过滤长度异常、修正标点。作者在文档里说得实在——真正复杂的工作都在清洗、处理、生成数据上这才是影响效果的最大难点。快速跑通 30分钟完成一次QLoRA微调准备一台24G显存的机器3090即可Python 3.10环境装好 xtuner v0.1.18可以理解为大模型微调的训练控制台。基座选 internlm2-chat-7b走QLoRA路线——把模型量化到4bit塞进显存只训练一组LoRA低秩矩阵改动小、显存省。从模板拷贝配置后只改三处模型本地路径、数据集路径、评估样例换成祝姐姐生日快乐这类输入mkdir /home/finetune cd /home/finetune xtuner copy-cfg internlm2_chat_7b_qlora_oasst1_e3 ./ # 改完配置后启动训练显存吃紧可换 --deepspeed deepspeed_zero3 xtuner train ./internlm2_chat_7b_qlora_oasst1_e3_copy.py --deepspeed deepspeed_zero2训练每50步存一个检查点过程中还会拿评估样例实时试考。注意这类任务通常训1轮就够LLM容易过拟合多训反而把话说死。效果实测合并权重后直接开聊LoRA权重转成HF格式、与原模型合并然后开个对话窗口验证xtuner convert pth_to_hf ${SCRIPT_PATH} ${WEIGHTS_PATH} ./hf xtuner convert merge ${SRC_MODEL_PATH} ./hf ./merge --max-shard-size 2GB xtuner chat ./merge --prompt-template internlm2_chat \ --system 你现在是一个送祝福大师,帮我针对不同人和事情、节日送对应的祝福 \ --temperature 0.7实测输出README中的示例输入祝弟弟工作升职,小红书风格 输出弟弟呀你的才华如同春日里的花朵绽放出绚烂的光彩。工作如鱼得水升职之路顺顺利利……风格切换同样在线严肃风格下给老师写生日祝福是恭祝您福寿安康事业蒸蒸日上的职场腔小红书风格则自带emoji和语气词。嫌命令行不方便把 InternLM 的web_demo.py中模型路径指向合并后的目录用 streamlit 起个6006端口的网页版就能浏览器里聊。你如何玩 从祝福模型改造成自己的场景这套流程的价值在于可复制。想加面试话术敬酒词只需往角色和场景列表里补条目重跑生成→合并→微调三件套想换基座、调LoRA超参模板里 r64、学习率2e-4配置里改两行就行。想走全量微调参考 examples/InternLM2/04-InternLM2-7B-chat Xtuner Qlora 微调.md需要2张A100 80G并用 deepspeed_zero3 多卡跑。同目录下 Chat-嬛嬛、AMchat-高等数学 等案例展示的是同一套方法论换数据的玩法入口在 examples/readme.md。下一步可以做什么补齐饭局全流程往训练集加入敬酒、请客、送礼语料让智能体覆盖从开场到散场的完整社交链路接入RAG把对方是谁、什么关系、有什么忌讳做成可检索的知识库对话时动态注入上下文对比实验换更大的LoRA rank、混入日常对话数据防遗忘或试DPO偏好对齐量化不同风格下的表达质量【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/GitHub_Trending/se/self-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表