ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

GPT2-Chinese 中文文本生成入门指南:三步从语料到生成小说

GPT2-Chinese 中文文本生成入门指南:三步从语料到生成小说 GPT2-Chinese 中文文本生成入门指南三步从语料到生成小说【免费下载链接】GPT2-ChineseChinese version of GPT2 training code, using BERT tokenizer.项目地址: https://gitcode.com/gh_mirrors/gpt/GPT2-ChineseGPT2-Chinese 是基于 HuggingFace Transformers 库的中文文本生成训练项目让你用自己的中文语料训练一个 GPT-2 语言模型按需生成诗词、散文、小说或歌词。它解决了什么麻烦想拿自己的语料某类小说、一批歌词、公司的技术博客训练一个有个人风格的小模型时你会发现原版 GPT-2 并不吃中文它的分词器按字节切中文基本被切碎。GPT2-Chinese 把这一步换成了 BERT 字符级分词和 BPE 两套方案中文语料可以直接喂给模型省掉了自己设计分词器和写预处理脚本的麻烦。GPT2-Chinese 核心能力一览支持字级、词级、BPE 三级中文文本生成粒度三种分词器实现都在 tokenizations/ 目录下可切换默认 BERT Tokenizer 自动切分中文训练前不需要手工分词可拆分预处理大语料num_pieces单本超大小说也能用 train_single.py 单独训练支持 FP16 与梯度累积Gradient Accumulation加速训练、省显存提供 config/ 里三套现成模型配置和 scripts/ 里的训练/生成示例脚本可直接照着跑GPT2-Chinese 安装三步跑起来安装克隆仓库并装依赖需要 PyTorch 环境git clone https://gitcode.com/gh_mirrors/gpt/GPT2-Chinese cd GPT2-Chinese pip install -r requirements.txt配置根目录建data/文件夹把语料放进data/train.json——格式是一个 JSON 列表每项是一篇文章的正文文本见 train.json 示例再从 config/ 挑一份模型配置。运行python train.py --raw会自动预处理并接着训练训完后用python generate.py --prefix [CLS]你的开头即可生成文本。原理解析它是怎么生成中文的自回归模型GPT-2 是预测下一个字的模型每生成一步都根据已有文本算出下一个字符的概率分布。分词中文没有空格BERT 分词器按字切开再映射成词表编号BPE 模式则会把高频字组合并成子词让序列更短。训练循环语料按 512 token 切块模型不断预测下一个字损失是标准语言模型负对数似然。依赖核心是 2019 年版的 transformers2.1.1加 PyTorch另附 eval.py 可以算生成模型的 PPL 困惑度方便对比两个模型谁更好。GPT2-Chinese 使用场景网文作者在开新书时用同类型旧书语料训一个模型快速产出剧情片段和人物对话找灵感。内容运营拿专栏的历史文章训练生成早报、周报初稿人工改一改就能发。语文老师用诗词模型让学生续写律诗绝句顺便观察模型哪里对仗失手、哪里开始说胡话。NLP 方向的学生在通用中文模型上做小规模微调完整走一遍数据预处理、训练、评估、生成的流程。适合谁不适合谁适合有 PyTorch 基础、手里有语料和 GPU、想训一个特定文风中文文本生成模型的人。 不适合想零代码、开箱即用的人——这是训练向代码生成时也要自己指定模型路径和分词器参数。两条如实提醒依赖的 transformers2.1.1 版本很老新 Python 环境可能要折腾降级作者也注明 fp16 训练可能不收敛默认先别开。另外用社区分享的预训练模型时输入文本前要加 [CLS] 起始符否则生成效果会差。结尾GPT2-Chinese 更像一份如何从 0 训练中文 GPT-2的完整范本它不提供开箱即用的产品但给了数据、训练、生成、评估整条可跑通的路。跑通之后遇到环境问题、或者训出了自己的模型欢迎提 Issue、提 PR 交流把成果分享出来也是很好的贡献。【免费下载链接】GPT2-ChineseChinese version of GPT2 training code, using BERT tokenizer.项目地址: https://gitcode.com/gh_mirrors/gpt/GPT2-Chinese创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表