ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

StoryDiffusion 指南:如何用一致性自注意力快速生成角色一致漫画图像序列

StoryDiffusion 指南:如何用一致性自注意力快速生成角色一致漫画图像序列 StoryDiffusion 指南如何用一致性自注意力快速生成角色一致漫画图像序列【免费下载链接】StoryDiffusionAccepted as [NeurIPS 2024] Spotlight Presentation Paper项目地址: https://gitcode.com/GitHub_Trending/st/StoryDiffusionStoryDiffusion 是一个一致性图像生成工具论文被 NeurIPS 2024 接收为 Spotlight。它基于 SDXL靠几句文字就能画出人物长相前后统一的多格画面适合想做漫画创作和角色一致图像生成的新手。一致性图像生成解决什么问题普通文生图模型每画一张图都是独立创作画同一角色十次就会得到十张不同的脸。StoryDiffusion 要解决的就是这个问题它给多个画面之间共享外观信息同一个角色在十几格漫画里始终保持同一张脸、同一身衣服。它的最大卖点是长序列下的角色一致性——官方示例里一个穿黑西装读报纸的红发男子连续出现在十个不同场景的分镜中长相始终不变。此外它还提供图生视频的第二阶段能力运动预测模型不过该部分的源码和权重目前尚未开放。从提示词到漫画核心流程分四步写分镜提示词每行文字对应一个画面至少 3 行官方建议 5~6 行以获得更好的排版。文字模式下用[Bob]、[Alice]这样的标签指定角色参考图模式下在角色描述后加img触发词指向你上传的人物照片。一致性自注意力生成图像自注意力本只在单张图内部计算这里被扩展到了多张图之间hot-pluggable可插拔地兼容 SD1.5 和 SDXL 系模型。通俗说就是让每格画面在画脸时都能参考其他格的同一角色从而跨画面保持一致。漫画排版与配字生成完成后自动按版式四格 Four Panel 或经典漫画 Classic Comic Style拼成网格并给每格加上对话字幕字体可在fonts/里选。可选图生视频把一致性图像序列作为条件图运动预测器在压缩语义空间里补出帧间运动实现两阶段长视频。此部分模型尚未开源当前版本可先跑通前三步。实际能做出哪些内容多格漫画输入十几行故事文本直接输出一整张带字幕的漫画网格。比如下面的官方示例讲的是一个男子在森林中寻到宝藏屋的故事十个分格里主角的外貌、西装、发型完全一致还能穿插老虎、汽车等纯场景格[NC]标签表示该格无角色。参考图角色入画上传 1~4 张人物照片仓库examples/里自带了示例图选 Using Ref Images 模式照片里的人物会以一致的外观出现在每格画面中适合做让指定人物出演某个故事的内容。两阶段图生视频把生成的一致性图像序列当作条件帧由运动预测器补全帧间过渡把静态分镜变成动态视频。需要说明README 的 TODO 列表中视频模型的源码与预训练权重仍标记为未完成这一阶段目前还无法本地运行。最快安装与启动步骤环境要求Python 3.10最低 3.8、PyTorch ≥ 2.0建议 NVIDIA GPU。最小启动命令共 3 行git clone https://gitcode.com/GitHub_Trending/st/StoryDiffusion conda create -n storydiffusion python3.10 conda activate storydiffusion pip install -r requirements.txt python gradio_app_sdxl_specific_id_low_vram.py启动后打开浏览器里的 Gradio 页面即可操作。关键参数速查Comic Description分镜描述每行一格至少 3 行角色前加[名字]标签纯场景格用[NC]model_typeOnly Using Textual Description纯文字控制角色Using Ref Images用 1~4 张参考照片锁定长相sa32 / sa64跨图共享外观的强度0~1默认 0.5调高一致性更强height / width默认 768范围 256~1024步长 32Number of sample steps采样步数默认 35Style template内置日式动漫、Photographic、Comic book 等 8 种风格预设定义在 utils/style_template.py核心逻辑在 gradio_app_sdxl_specific_id_low_vram.py界面 生成入口和 utils/pipeline.py基于 SDXL 的管线改造不想搭环境的话也可以直接运行仓库里的Comic_Generation.ipynb。参数选择与常见坑提示显存不够怎么办用仓库提供的 low_vram 版本本文启动命令官方在 24GB 显存的 A10 30GB 内存上测试通过20GB 以上显存基本可跑首次启动会自动从 Hugging Face 下载 SDXL 底模和 PhotoMaker 权重断网环境需提前备好转好的data/目录。角色一致性不满意先调高 sa32/sa64参考图模式下确认角色描述里带了img触发词且上传照片是清晰正脸。期待视频功能会落空README 明确列出Video Generation Model 源码与权重仍是待办项目前能本地复现的是漫画/图像生成部分写脚本时别把第二阶段算进依赖。仓库内附带完整示例examples/和结果展示results_examples/克隆下来按上面三步装好依赖就能生成自己的第一组一致性漫画分镜。【免费下载链接】StoryDiffusionAccepted as [NeurIPS 2024] Spotlight Presentation Paper项目地址: https://gitcode.com/GitHub_Trending/st/StoryDiffusion创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表