ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

用一张图和一句口播文案,15 分钟做出第一条数字人口播视频

用一张图和一句口播文案,15 分钟做出第一条数字人口播视频 用一张图和一句口播文案15 分钟做出第一条数字人口播视频【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video做带货短视频时你经常遇到这个矛盾每周都要出带真人出镜的口播内容却约不到固定模特也没人专门剪片。Pixelle-Video 是一个 AI 全自动短视频引擎它的数字人口播流水线只需要你上传一张人物形象图、写一句口播文案就能自动完成配音、配图和成片合成适合没有剪辑背景的内容创作者和想把生成流程跑起来的开发者。先花 3 分钟确认这 5 项能力一句话生成完整视频输入口播文案或主题LLM 负责写稿、配音、生成画面整条链路在web/pipelines/下按流水线拆分出片过程有进度状态可看。数字人口播合成在web/pipelines/digital_human.py对应的 数字人口播标签页上传人物图支持 jpg/jpeg/png/webp和可选的商品图系统把人物、素材与语音拼成口播视频。多语言 TTS内置 Edge-TTS 音色表覆盖中文、英文等默认selfhost/tts_edge.json工作流本地合成也可以换成 Index-TTS 并用参考音频做声音克隆。30 HTML 模板templates/下按 1080x1920、1080x1080、1920x1080 三种尺寸分目录存放竖屏、方图、横屏布局直接切换。双模式 ComfyUI 工作流workflows/ 里 runninghub云端与 selfhost本地 ComfyUI两套同名工作流改配置即可切换不用改代码。三步让第一条视频跑出来装好并启动 Web 界面。克隆仓库后用 uv 装依赖执行启动命令成功标准是浏览器打开 http://localhost:8501 能看到 Home 页和流水线标签页。git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video cd Pixelle-Video uv sync uv run streamlit run web/app.py配好密钥。进入首页的系统配置区对应 config.example.yaml 的字段复制一份为 config.yaml填llm的api_key、base_url、model注释里给了 qwen-max、gpt-4o、DeepSeek、Ollama 等现成预设成功标准是保存后配置区不再提示缺密钥。在 数字人口播 标签页出片。左侧上传人物形象图填入口播文案选工作流右侧点生成成功标准是预览区出现可播放的 mp4且 History 页有本次任务记录。最小可用配置长这样llm: api_key: sk-xxxx base_url: https://dashscope.aliyuncs.com/compatible-mode/v1 model: qwen-max template: default_template: 1080x1920/image_default.html三个最影响成片质量的旋钮1. 生成后端选 runninghub 还是 selfhost。comfyui.image.default_workflow和comfyui.video.default_workflow决定画面在哪生成选runninghub/前缀走云端、只需 API key选selfhost/前缀走本机 ComfyUI需要先把comfyui_url指对地址。字段默认值改动效果llm.model空需自填换更强的模型可提升口播稿质量comfyui.image.default_workflowrunninghub/image_flux.json云端/本地生图切换本地版免 API 费用comfyui.tts.default_workflowselfhost/tts_edge.json换 TTS 后端Index-TTS 支持声音克隆template.default_template1080x1920/image_default.html决定成片比例与版式换 1920x1080 即出横屏2.prompt_prefix统一画面风格。comfyui.image与comfyui.video各有一个prompt_prefix默认是黑白火柴笔触风格。把前缀换成你自己的风格描述如扁平插画暖色同一套文案生成的每张配图都会跟着变。3. 音色在代码表里换。Edge-TTS 的可选音色集中在 pixelle_video/tts_voices.pyzh-CN-XiaoxiaoNeural偏自然女声、zh-CN-YunjianNeural偏沉稳男声想要更像本人的效果就切 Index-TTS 工作流并上传参考音频。5 个常见卡点逐条对照处理生成按钮提示缺密钥→config.yaml里llm.api_key为空或base_url少填了路径 → 对照 config.example.yaml 注释中的预设 URL 原样粘贴。selfhost 工作流报错→ 本机 ComfyUI 没起或comfyui_url不对 → 先用 runninghub 工作流跑通整条流程再排查本地服务Docker 里部署要改用host.docker.internal:8188。人物形象生成跑偏→ 上传图主体不清晰或有干扰物 → 换成单人、正面、背景干净的 jpg/png 再试。配音机械感重→ 默认 Edge-TTS 音色固定 → 换tts_voices.py里的其他音色或改 TTS 工作流走克隆。成片比例与发布平台不符→template.default_template还是默认竖屏模板 → 抖音选 1080x1920、B 站横屏选 1920x1080具体文件名以 templates/ 目录实际内容为准。下一步建议先按第三步跑通一条竖屏成片再依次改default_template和prompt_prefix各出一版对比效果确认后端稳定后把 runninghub 工作流替换为 selfhost把单次生成成本压到最低。【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表