ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

扣子AI Agent实战:从主题到成片,自动化生成AI诗词视频

扣子AI Agent实战:从主题到成片,自动化生成AI诗词视频 1. 从一句提示词到一条成片这个项目到底在做什么第一次看到“扣子AI Agent 生成AI诗词视频”这个标题我脑子里蹦出来的第一个念头是这事儿到底卡在哪一步写诗大模型几秒钟就能吐一首做视频剪映模板一抓一大把。真正难的是把这两件事串成一条不需要人盯着的流水线——你输入一个主题比如“秋夜思乡”剩下的从写诗、配图、配音、加字幕到导出成片全部自动跑完。这个项目要解决的就是这条链路的自动化问题。说白了它做的事情可以拆成三个动作让AI写诗、让AI把诗变成画面和声音、让工具把画面和声音拼成视频。听起来简单但每一步都有坑。写诗不是随便让大模型自由发挥就行你得控制格式、押韵、意境配图不是随便找张图就完事画面得跟诗句对得上配音和字幕的节奏还得跟诗句的停顿匹配。这些细节如果全靠手动做一条视频少说半小时批量做根本扛不住。这个项目适合谁我梳理了一下大概三类人会感兴趣。第一类是内容创作者尤其是做文化类、教育类短视频的需要批量产出诗词赏析、国学启蒙这类内容。第二类是想入门AI Agent搭建的开发者拿这个项目练手特别合适因为它涉及大模型调用、工作流编排、第三方工具集成麻雀虽小五脏俱全。第三类是对自动化工作流好奇的普通用户你可能不会写代码但扣子的可视化编排界面足够友好照着搭一遍就能理解Agent是怎么回事。我实测下来整个流程跑通之后生成一条30秒左右的诗词视频从输入主题到拿到成片大概需要2到3分钟。这个速度不算快但胜在全程不用人管你可以一次性丢进去十个主题去干别的事回来收十条视频。这才是这个项目真正的价值——不是替代人的审美而是把人从重复劳动里解放出来。2. 整体架构拆解为什么选扣子加剪映这套组合2.1 核心思路把复杂流程拆成可编排的节点做任何自动化项目第一步都是想清楚“输入是什么、输出是什么、中间经过哪些环节”。这个项目的输入是一个诗词主题或者一句提示词输出是一条带画面、配音、字幕的MP4视频。中间环节我把它拆成了五个节点主题解析、诗词生成、画面生成、语音合成、视频合成。为什么这么拆因为每个节点用的工具不一样能力边界也不一样。主题解析和诗词生成靠大模型画面生成靠文生图模型或者素材库语音合成靠TTS服务视频合成靠剪映的批处理能力。如果把这些全塞给一个大模型去做它既写不了图也合不了视频所以必须拆开让每个环节用最合适的工具。扣子在这个架构里扮演的是调度中心的角色。它本身不生产内容但它能把大模型、插件、工作流串起来按照你设定的逻辑一步步执行。你可以把它理解成一个乐高底板大模型是积木块插件是连接件工作流是你拼出来的造型。2.2 工具选型为什么是扣子而不是其他平台市面上能做工作流编排的平台不少Dify、n8n、Coze扣子的海外版各有各的特点。我选扣子做这个项目主要基于三个考虑。第一是中文大模型的接入成本低。扣子国内版直接集成了豆包、DeepSeek等主流大模型不需要自己折腾API Key和网络环境。对于诗词生成这种对中文理解要求高的任务国产大模型的表现反而更贴合语境。我试过用同一个提示词让不同模型写七言绝句豆包和DeepSeek在押韵和意象连贯性上明显更稳。第二是插件生态对剪映友好。扣子有现成的剪映插件可以直接调用剪映的草稿文件生成能力。这意味着你不需要自己写代码去操作剪映的工程文件插件会帮你把图片、音频、字幕按照时间轴排好。这一点非常关键因为剪映的草稿文件格式是私有的自己解析成本很高。第三是工作流的调试体验好。扣子的工作流支持单节点测试你可以只跑诗词生成节点看输出对不对不用每次都把整个流程跑一遍。对于这种多环节串联的项目调试效率直接决定你能不能坚持做下去。2.3 剪映在流程中的角色不只是剪辑工具很多人以为剪映在这个项目里只是最后合成视频的工具其实它的作用远不止于此。剪映的草稿文件机制才是整个自动化流程的关键。具体来说扣子的剪映插件会生成一个JSON格式的草稿文件这个文件里定义了每个素材在时间轴上的位置、时长、动画效果、字幕样式。你把这个文件导入剪映剪映会自动还原成可编辑的工程。这意味着你可以在自动生成的基础上手动微调某些细节比如换一张图、改一句字幕的字体。我试过完全自动生成和手动微调两种方式。完全自动的优点是快缺点是画面风格可能不统一手动微调的优点是能控制质量缺点是费时间。我的建议是批量生成用全自动重点作品再手动调。这样既能保证产量又能保证重点内容的质量。3. 核心环节实操从主题到诗词的生成逻辑3.1 主题解析节点把一句话变成结构化指令用户输入的可能只是“写一首关于秋天的诗”这样一句话但大模型需要的是更具体的指令。主题解析节点的作用就是把模糊的需求翻译成结构化的参数。我在扣子里是这样配置的用一个大模型节点系统提示词写清楚“你是一个诗词创作助手需要从用户输入中提取以下信息主题、情感基调、诗词体裁、韵脚要求”。然后用户输入作为变量传进去模型输出一个JSON格式的结果。举个例子用户输入“秋夜思乡”模型输出可能是{ theme: 秋夜思乡, emotion: 惆怅、怀念, genre: 七言绝句, rhyme: 平水韵下平七阳 }这一步为什么要单独做因为如果直接把“秋夜思乡”丢给诗词生成节点模型可能会写成五言律诗也可能写成现代诗风格不可控。加上这一层解析后面的生成就有明确的约束条件。注意主题解析节点的提示词里一定要加一句“如果用户没有明确指定体裁默认使用七言绝句”。否则模型每次选的体裁可能不一样导致后续画面和配音的节奏对不上。3.2 诗词生成节点控制格式比控制内容更重要诗词生成是整个流程里最核心的一步也是最容易翻车的一步。大模型写诗有两个常见问题一是格式不对说好七言绝句它给你写八句二是意境断裂前两句写景后两句突然抒情中间没有过渡。我的解决方案是在提示词里做三重约束。第一重是格式约束明确告诉模型“每句七个字共四句第二句和第四句押韵”。第二重是结构约束要求“前两句写景后两句抒情景情之间有逻辑关联”。第三重是用词约束限制“避免使用生僻字和现代词汇”。实测下来加了这三重约束之后诗词的可用率从大概三成提升到了七成以上。剩下的三成怎么办我在工作流里加了一个判断节点让另一个大模型给生成的诗词打分低于阈值的自动重新生成。虽然多花一点时间但省去了人工筛选的麻烦。这里分享一个我踩过的坑不要用太长的提示词。我一开始把各种约束写得非常详细结果模型反而抓不住重点生成的诗词变得很僵硬。后来我把提示词精简到两百字以内只保留最关键的格式和结构要求效果反而更好。大模型跟人一样指令太多它会顾此失彼。3.3 画面生成节点让诗句变成可看的画面诗词生成之后下一步是给每句诗配画面。这里有两种方案文生图和素材库匹配。文生图的优点是画面跟诗句的匹配度高你可以把“月落乌啼霜满天”直接生成一张对应的图。缺点是风格不稳定同一首诗的四句可能生成四种画风。素材库匹配的优点是风格统一缺点是可能找不到完全匹配的素材。我最后选的是混合方案先用文生图生成四张图然后用一个图像处理节点统一色调和风格。具体做法是在文生图的提示词里加上统一的风格描述比如“中国水墨画风格淡雅色调留白构图”。这样即使四张图的内容不同风格也能保持一致。如果你用的是扣子内置的文生图插件注意图片比例要提前设定好。竖版视频用9:16横版用16:9。我一开始忘了设比例生成的图全是方的导入剪映之后两边留黑边非常难看。后来在插件配置里固定了比例这个问题就解决了。4. 语音合成与视频合成的实操细节4.1 语音合成停顿和语速比音色更重要诗词的朗读跟普通文本不一样它讲究节奏和停顿。五言诗通常是“二二一”或“二三”的停顿七言诗是“二二三”或“四三”的停顿。如果TTS服务不知道这些规则读出来的诗会像念课文完全没有韵味。我在扣子里用的是语音合成插件配置的时候做了两件事。第一是在诗句之间插入停顿标记比如在每句末尾加一个“。”让TTS自然停顿在逗号处加一个短停顿。第二是调整语速诗词朗读的语速要比正常说话慢一些我一般设在0.8倍速左右。音色的选择也很关键。我试过几种音色最后选了一个偏沉稳的男声因为大部分古诗词的意境比较悠远太活泼的音色会破坏氛围。如果你的视频风格偏清新也可以选温柔的女声这个没有标准答案多试几个找到最合适的就行。提示语音合成节点生成音频后一定要检查时长。如果音频比画面短视频会出现黑屏如果音频比画面长画面会被截断。我一般会让音频时长比画面时长多出0.5秒留一点缓冲。4.2 剪映草稿生成时间轴对齐是核心扣子的剪映插件会生成一个草稿文件这个文件里包含了所有素材的时间轴信息。你需要做的是确保每个素材的起止时间跟音频对齐。具体操作是这样的假设语音合成生成的音频总时长是20秒四句诗每句5秒。那么第一张图的显示时间就是0到5秒第二张图是5到10秒以此类推。字幕的出现时间也跟图片同步每句诗的字幕在对应图片出现时显示。这里有一个细节容易被忽略转场效果会占用时间。如果你在两张图之间加了1秒的转场那么总时长就变成了21秒音频就对不上了。我的做法是不加转场或者只加0.2秒的快速转场这样对时间轴的影响可以忽略不计。剪映草稿生成之后你可以直接在剪映里打开预览。如果发现某张图跟诗句不匹配可以手动替换如果发现字幕有错别字也可以直接改。这就是我前面说的自动化生成加手动微调的组合拳。4.3 批量生成的参数配置如果你要批量生成多条视频扣子的批处理模式可以帮你省很多事。你只需要准备一个表格第一列是主题第二列是体裁第三列是情感基调然后把这个表格作为输入传给工作流它就会自动循环执行。我在批量生成的时候会调整几个参数。一是并发数扣子默认是串行执行如果你要生成十条视频一条两分钟总共要二十分钟。把并发数调到3时间可以缩短到七分钟左右。但并发数不能调太高否则可能触发大模型的频率限制。二是失败重试次数我一般设成2次因为文生图偶尔会失败重试一下基本能成功。批量生成还有一个好处是风格统一。因为所有视频用的是同一套提示词模板和同一个音色生成出来的视频风格是一致的。如果你做的是一个系列内容比如“唐诗三百首”风格统一非常重要。5. 常见问题与排查技巧实录5.1 诗词生成质量不稳定的排查思路问题表现有时候生成的诗词押韵不对有时候意境跑偏有时候干脆写成现代诗。排查步骤先检查主题解析节点的输出。如果解析出来的体裁是“五言律诗”但你的提示词模板只支持七言绝句那生成结果肯定不对。解决办法是在主题解析节点里限定体裁范围只允许“七言绝句”和“五言绝句”两种。再检查诗词生成节点的提示词。如果提示词里没有明确押韵要求模型可能会忽略押韵。我一般会在提示词里加一句“第二句和第四句的最后一个字必须押相同的韵母”。最后检查模型选择。不同模型对中文诗词的理解能力差异很大。我实测下来DeepSeek在诗词生成上表现最稳豆包次之其他模型偶尔会翻车。速查表问题现象可能原因解决方法押韵不对提示词未明确押韵要求在提示词中指定韵脚意境跑偏主题解析不准确检查解析节点的输出格式错误体裁约束不明确限定体裁范围用词现代未限制词汇范围加“避免现代词汇”约束5.2 视频合成失败的常见原因问题表现草稿文件导入剪映后图片不显示、音频不同步、字幕错位。排查步骤检查素材路径。扣子生成的草稿文件里素材路径是相对路径还是绝对路径如果是相对路径剪映可能找不到文件。解决办法是在插件配置里把路径设成绝对路径或者把素材和草稿文件放在同一个文件夹里。检查时间轴单位。剪映的时间轴单位是微秒不是毫秒。如果你在配置里填的是毫秒时间轴会完全错乱。我一开始就踩了这个坑后来把单位改成微秒才正常。检查素材格式。剪映支持的图片格式是JPG和PNG音频格式是MP3和WAV。如果你生成的素材是WebP或者M4A剪映可能无法识别。解决办法是在生成素材的时候指定格式。注意剪映草稿文件的版本兼容性也要注意。不同版本的剪映草稿格式可能不一样如果你用的是旧版剪映扣子生成的草稿文件可能打不开。我的建议是保持剪映版本和扣子插件版本一致不要混用。5.3 批量生成时的性能优化技巧批量生成十条视频如果串行执行大概要二十分钟。我试过几种优化方案最后总结出三个有效的方法。第一是错峰调用大模型。文生图和诗词生成都依赖大模型如果同时发起太多请求可能会触发频率限制。我的做法是在工作流里加一个延时节点每生成一条视频后等待5秒再生成下一条。这样虽然总时间变长了但成功率提高了。第二是复用素材。如果你做的系列视频主题相近比如都是“四季”主题那么背景图可以复用。我把四季的背景图提前生成好存到素材库里生成视频的时候直接调用省去了每次重新生成的时间。第三是分段调试。不要一次性把整个工作流跑通先单独测试诗词生成节点再单独测试画面生成节点最后再串联起来。这样出问题的时候能快速定位是哪个环节的毛病。6. 这个项目还能怎么扩展跑通基础流程之后我试过几个扩展方向有些效果不错有些还在摸索。第一个扩展是加背景音乐。诗词视频如果只有朗读没有背景音乐会显得很干。我在剪映草稿里加了一条音频轨道放古筝或者笛子的纯音乐音量调到朗读音量的30%左右。注意背景音乐要选没有版权争议的我一般用剪映自带的音乐库。第二个扩展是加动态效果。静态图片看久了会腻可以给图片加一个缓慢的推拉效果让画面动起来。剪映的“关键帧”功能可以实现这个效果但需要在草稿文件里配置关键帧参数。我试过用扣子的图像处理节点生成带透明通道的PNG序列然后导入剪映做成逐帧动画效果很好但成本太高不适合批量做。第三个扩展是接入更多大模型。扣子支持接入自定义模型如果你有本地部署的大模型也可以通过API接进来。我试过用本地部署的模型生成诗词速度比云端慢但胜在免费且数据不出本地。如果你对数据隐私有要求这个方案值得考虑。第四个扩展是做成一个完整的Agent。现在的工作流需要你手动输入主题如果你把它包装成一个Agent用户只需要说“给我来一首关于春天的诗”Agent就能自动完成所有步骤并返回视频链接。扣子的Agent功能支持这种对话式交互我还在调试中等跑通了再分享。最后分享一个我在实际操作中的体会不要追求一步到位。我一开始想把所有环节都做到完美结果卡在画面生成那一步整整两天。后来我降低标准先用简单的素材库匹配跑通流程再逐步替换成文生图反而更快拿到了可用的结果。做自动化项目先跑通再优化比先优化再跑通要高效得多。
返回列表