ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

从463个AI视频到212个Skill:开源拆解全流程

从463个AI视频到212个Skill:开源拆解全流程 收藏夹里躺着几百个以后再看的AI视频大概是很多人的常态。我前阵子终于把这事彻底解决了把攒下的463个AI视频从Midjourney绘图、Agent实战到大模型原理讲解全部做成了一套可复用的Skill和提示语模版并且放到了GitHub上开源出来。这篇文章就聊聊整个过程——视频怎么清洗、怎么拆解成技能、提示语模版怎么抽出来才算能复用以及这个开源仓库背后真正值钱的部分是什么。如果你手里也囤了大量教程、网课、会议录屏或者你自己就在做AI知识付费和内容整理这篇应该能给你一条直接照搬的流水线。1. 为什么是463个视频一次让人崩溃的内容整理经历1.1 从收藏癖到内容负债事情得从我的收藏夹说起。做AI相关内容这两年我养成了一个非常坏的习惯看到任何可能有用的AI教程就收藏B站、YouTube、公众号、虎课网甚至一些付费社群里的直播回放全部往里塞。一开始只是觉得这条以后写文章用得上后来慢慢失控等到某天想找一条很早以前看过的Stable Diffusion局部重绘视频翻了半小时没找到我才意识到手里攒下的视频已经到了一个根本管不过来的量。统计了一下整整463个累计时长粗略算一下超过900个小时。如果按一天看8小时算不吃不喝也得看将近四个月。这还只是视频本身的时间成本更别提看完之后信息怎么记、怎么用的问题。我管这个叫内容负债收藏的时刻有一种虚假的获得感好像视频存下来了知识就是我的了但实际上这些素材没有任何实际产出反而因为整理成本太高变成了每次想起都会焦虑的心理负担。1.2 视频学习的三个硬伤时间、检索、时效真正动手处理之前我先把问题想清楚了。视频作为知识载体在AI这个领域有三个非常致命的硬伤。第一是时间成本太高。一段10分钟的视频实际有效信息可能只需要3分钟就能讲完但你还是得按10分钟听完。重复看的时候更痛苦因为你想找的那句话在视频的哪一段完全不记得只能从头快速拖进度条。第二是检索基本等于零。图文内容我可以CtrlF直接搜视频不行。哪怕现在很多平台做了字幕跨视频检索也几乎不可能。当时我想找ControlNet的tile模型配合放大脚本的操作细节最后是去一个没收藏的网页里找到的那个视频就白白躺在收藏夹里。第三是时效性太差。AI工具更新速度大家都懂今天讲Midjourney V5的视频下个月V6出来里面的命令就过时了。视频没法更新只能删了重发而收藏夹里的旧链接就成了死信息。这三个痛点叠加在一起指向同一个结论视频本身不是资产视频里能抽出来的可复用方法才是资产。所以我需要的不是再看一遍视频而是把视频里的知识榨干变成以后我能直接调用的东西。1.3 转机视频不是终点资产才是转机出现在我接触了Claude的Agent Skills之后。如果你用过Cursor、Claude Code或者Codex这类AI编程工具应该知道Skill是什么——它本质上是一套预置的技能包包含说明文档、脚本和参考资料让AI在特定任务上不用你每次重新教直接调用就行。我当时的反应是这不就是把视频内容结构化之后最好的容器吗AI视频里教的那些东西——用ComfyUI做一个工作流、让Agent调用搜索引擎、用提示词控制输出格式——拆到最后全是可执行的方法论。这些方法论天然适合做成SkillAI看一段结构化描述比看视频快得多而且Skill可以被反复调用不会过期。所以项目目标就定了463个AI视频全部转写、清洗、拆解把能沉淀成技能的内容做成Skill把能沉淀成话术的内容做成提示语模版最后整体开源。说实话当时我完全没把握这个事能干完但事实证明只要流水线搭建对了量产真的只是时间问题。2. 视频资产的拆解流水线从字幕到结构化文本2.1 采集与去重先把水挤干动手第一步不是转写而是去重。463个视频看着多实际上里面有大量重复内容。同一个AI绘画提示词工程的话题至少五六个UP主讲过框架大同小异只是案例不同。我当时做了一个粗糙的聚类先按标题关键词分组再对转写后的开场白做相似度计算相似度超过85%的就归为一类挑一个讲得最系统的作为代表其余标记为补充素材不再单独拆解。这一步做完463个视频里真正进入转写流程的只有约310个剩下的作为补充引用来源。采集工具上没什么好纠结的B站的就用通用的下载工具拉取YouTube的用对应命令行工具付费社群的录屏就直接问管理员要原始文件。这里有个经验下载视频的时候顺手把封面图和简介也存下来后面做分类和归纳的时候这些元信息能省很多事。2.2 ASR转写机器先把话说清楚采集之后是转写。这步是整个流水线里最枯燥但最关键的环节因为后续所有结构化处理都建立在文本质量上。我用的是基于Whisper的方案跑在本地GPU上具体来说是faster-whisper速度和准确率比较平衡。463个视频平均时长按两小时算转写一小时的音频在我的显卡上大概需要10到15分钟整个转写过程大概跑了一周多全是碎片时间挂机跑完的。这里必须吐槽一下Whisper在中文AI内容上的问题术语错得挺离谱的。提示词工程经常被识别成题诗词工程多模态可能变成多模式ComfyUI这种专有名词更是重灾区。所以我的做法是转写之后跑一遍自定义词典纠错把视频描述里出现过的专有名词全部加进词典强制替换。即便如此我还是抽检了大约40个视频的转写稿发现准确率能到95%以上但术语层面的错误依然存在。结论就是别指望全自动机器转写只能做到能用关键信息一定要人工过一眼。2.3 清洗与分段让文本有骨架转写出来的原始文本是没法直接用的口语化严重插入语多上下文全靠这个那个指代。我写了一个Python脚本做初步清洗删除语气词、合并重复断句、按语义段落切分。切分是个技术活不能光按句号断得结合话题切换判断。比如视频里讲完原理开始讲实操这里就必须切开否则后面的结构化提取会乱。清洗之后每段文本都带着时间戳和原始的段落编号。这一步有个很实用的技巧不用做完美的语义分段只要能让大模型看懂结构就行。后续的提取工作不是人肉做的而是交给LLM做人只需要保证输入文本干净到模型不会误判。2.4 分类体系463个视频的书架文本整理好之后接下来是分类。我按AI绘画、AI视频生成、AI编程、AI Agent、AI办公、大模型原理、工具评测、商业应用分了八个大类每个大类下再细分二级标签比如AI绘画下面有Stable Diffusion、Midjourney、ComfyUI、ControlNet、模型训练等。分类这步我试过完全交给LLM但效果不太行——模型容易把用AI写文案归到AI办公而不是商业应用因为这两个边界本来就模糊。最后的方案是先用LLM做初筛再由我人工过一遍。310个有效视频我花了大约三个晚上全部人工复核完毕。别觉得慢这个分类是整个项目的骨架分错了后面全乱值得花时间。分类结果是这样的大类有效视频数典型内容AI绘画68SD/MJ/ComfyUI工作流、模型训练、局部重绘AI视频生成37Runway/Pika/可灵操作、运镜提示词、视频修复AI编程52Copilot实战、Cursor用法、代码审查、自动化测试AI Agent41Agent搭建、工具调用、多Agent协作、RAGAI办公48文档生成、PPT/表格自动化、会议纪要大模型原理30Transformer讲解、推理过程、微调基础工具评测22新工具上手、横向对比、参数实测商业应用22接单案例、工作流改造、降本增效整个分类做完我才真正明白这些视频的价值在哪不是某条技巧多厉害而是它们几乎覆盖了AI应用的各个层面形成了一个完整的技能地图。3. 把视频变成Skill核心方法论与实操细节3.1 Skill到底是什么不是一个文件夹是一个会做事的人做Skill之前先要理解Skill的定位。我之前看到很多人把Skill理解成一段提示词这其实不太对。一个合格的Claude Agent Skill结构上是这样skill-name/ ├── SKILL.md # 技能说明包含name、description、使用场景 ├── scripts/ # 可执行脚本Python/Shell等 ├── references/ # 参考资料指导AI如何完成任务 └── assets/ # 图片、数据等静态资源但更准确地说Skill不是提示词是给AI的一份工作手册工具箱。SKILL.md里的description写得越清楚Agent越知道什么时候该调用它references里的资料越扎实AI完成任务的质量越高。Scripts则让AI不止会说还能动手执行命令、调用API、处理文件。这个区别非常重要因为视频里教的很多操作比如在ComfyUI里连接节点用Python脚本批量处理图片本质上不是靠提示词能完成的必须落到脚本上。3.2 从视频里提炼可执行动作而不是知识片段这是整个项目里我最想分享的方法论。看视频的时候人接收的是信息流——先讲原理再演示操作中间穿插技巧和踩坑。但如果直接把这些内容丢给AIAI会困惑哪些是背景知识哪些是要执行的操作哪些是特定工具特有的设定所以我给自己定了一个提取标准只保留可执行动作删掉知识背景。举个例子。一个讲用Stable Diffusion做电商海报的视频里面的大致内容是原理部分扩散模型如何一步步去噪生成图像删掉操作部分选用什么底模、设置什么采样器、CFG调到多少、用哪些ControlNet模型控制构图保留技巧部分如何通过多次抽卡局部重绘提升出图质量保留转成判断逻辑踩坑部分某个采样器在高CFG下容易出噪点保留转成注意事项提取后的结果是一个动作清单参数约束判断条件的组合。我把这个组合填进Skill模板里AI就知道接到做电商海报这个任务时用哪个模型、按什么参数、先做什么后做什么、遇到什么情况怎么调整。很多教程视频的价值恰恰在这层操作书上。视频本身会过期但操作书里的方法论可以长期复用。3.3 视频→Skill的转化模板为了让处理过程不那么依赖人肉发挥我写了一个固定的转化模板每个视频都用这个模板来抽。模板不复杂就六个字段技能名称一句话说明这个技能做什么 适用场景在什么情况下应该调用这个技能 核心步骤完成任务的顺序化操作步骤 参数配置涉及的关键参数及其推荐值 注意事项常见错误、边界条件和规避方法 参考示例一个完整的输入输出对填这个模板的时候最大的坑是贪多。一个视频往往包含好几个可以做进Skill的技能点比如AI绘画入门那类视频可能既讲了文生图参数又讲了图生图放大还讲了模型融合。我一开始想把它们全塞进一个Skill里结果Skill变得又臃肿又难描述Agent反而不知道该什么时候调用。后来我给自己定的规则是一个Skill解决一个完整任务。视频里如果有多个独立技能点宁可拆成多个Skill也不合并成一个全能包。拆完之后463个视频一共产出了212个Skill平均一个视频拆出不到一个——因为很多视频的干货密度并没有想象中高。3.4 三个真实转化案例说三个有代表性的方便你理解这个转化过程长什么样。第一个是AI视频生成类。有个UP主讲Runway的可控生成核心是通过关键帧运动幅度控制实现指定运镜。我把它做成了一个叫ai-camera-movement的Skill里面包含了三种运镜方式的参数推荐表、关键帧设置规则、以及人物出画物体漂移这两个高频问题的处理逻辑。AI在生成视频时只要给它一句镜头从近景推向远景它就能自动拆解出关键帧参数而不是生成一段没有运镜逻辑的随机视频。第二个是AI编程类。有个视频讲的是让Copilot写单元测试的实操里面有个技巧是先让AI基于代码生成测试框架再逐函数补测试用例最后统一修复失败项。这个流程完全可以固化。我做成Skill之后专门解决给项目写测试这个任务实测下来生成测试的完整度远高于直接对话式要求AI写测试。第三个是提示词工程类。一位讲师分享了一套角色设定任务拆解约束条件输出格式检查的四步提问框架视频里反复强调先把任务拆成子任务再提问。这个提炼出来就是底层可复用的提示词骨架被我直接做成了基础Skill其他所有Skill的prompt里都用到了这个框架。视频是流水的方法论是铁打的。4. 提示语模版不讲故事的复用品4.1 为什么模版比视频更耐用Skill是比较偏工程化的载体但不是所有视频内容都适合做成Skill更适合沉淀成提示语模版。模版的定位是轻量级的对话策略你不需要给AI配脚本和工具只需要一段精心设计的初始指令。我从视频里抽取模版的时候发现了一个很有意思的事真正的提示词高手在演示时很少念自己完整的prompt他们往往直接说你们把这句复制进去试试。当我把这些口语化的指令收集起来再对照他们的演示效果就会发现一段好的提示词背后几乎都是同一个骨架角色设定 → 任务描述 → 输入数据 → 约束条件 → 输出格式 → 自检要求这个骨架听起来不稀奇但九成的人写不好原因在于每个环节都写得不够具体。比如约束条件不是请用中文回答而是如果信息不足主动询问用户而不是自行揣测如果用户的需求存在歧义给出两种理解让用户选择——这种级别的约束才是视频里真正值钱的内功。4.2 模版的层级设计通用型、场景型、岗位型我最后沉淀出来的提示语模版数量是87个但它们不是平级的而是分了三层。第一层是通用型模版只有几个解决和AI对话的基本姿势。包括任务拆解模版、信息缺省询问模版、多方案对比模版、输出格式强制模版。这些模版不限定领域任何对话都能用。第二层是场景型模版按任务类型划分。比如写一篇公众号文章是一个场景生成一份数据分析报告是另一个场景。场景型模版通常是在通用型之上叠加了特定领域的输出要求。第三层是岗位型模版这层最有实战价值。比如AI自媒体运营助手模版里面定义了角色背景、内容风格、选题策略、数据复盘方式。视频里很多博主分享过我用AI做账号这类内容里面那些具体指令最后都被我提炼成了一个个岗位型模版。这三层不是孤立的使用的时候是叠加的关系通用型约束怎么对话场景型定义完成什么任务岗位型赋予什么身份和立场。直接用岗位型模版往往效果不好嵌套一层通用约束才完整。4.3 判断模版质量的三个指标87个模版里真正算是精品的其实不到三分之一。迭代过程中我总结出三个判断标准建议你以后自己提取模版时也这么筛。第一是可变量化程度。一段模版里如果全是固定话术换个场景就没法用那是废话模版。好的模版必须能把关键部分抽成变量比如任务目标、目标风格、约束项用户填入变量就能适配自己的场景。我在整理的时候把每个模版里需要用户填写的地方都用占位符标出来了剩下的骨架才是模版的真正价值。第二是反面约束密度。一句话的约束叫口号详细的边界条件才叫约束。比如避免AI腔这句约束等于没写好的反面约束是禁止使用综上所述赋能抓手这类词汇禁止夸夸其谈每个结论必须附带数据或来源。反面约束越具体模型输出的质量越稳定。第三是实例可复现性。我整理模版的时候有个硬性要求每个模版必须配一个输入输出的实际例子而且这个例子必须是我实际跑过的。没有实例的模版大概率是作者脑补的靠不住。视频里那些UP主现场演示的对话记录就是最好的实例来源。厘清这三层之后模版库的结构就完整了。这个通用-场景-岗位的层级设计也是我开源仓库提示语模版目录的骨架使用者可以先从通用层起步再叠加场景层和岗位层而不是一上来就抄一个完整大模板。5. 开源仓库的搭建与维护成本5.1 仓库结构让陌生人30秒找到东西既然决定开源就得考虑别人拿到这个仓库之后能不能快速用起来。我见过太多开源项目内容丰富但结构混乱最后变成代码坟场。所以我在仓库结构上花了不少心思。仓库大概长这样ai-video-skills/ ├── README.md ├── skills/ # 212个Skill │ ├── ai-painting/ │ │ ├── sd-ecommerce-poster/ │ │ ├── comfyui-workflow-builder/ │ │ └── ... │ ├── ai-coding/ │ │ ├── unit-test-generator/ │ │ └── ... │ └── ... ├── prompts/ # 87个提示语模版 │ ├── universal/ │ ├── scenario/ │ └── role/ ├── source-videos/ # 原视频的分类索引不含视频文件本身 │ └── README.md └── scripts/ # 视频转写、清洗工具脚本目录命名规则我用的是技能名-动词-对象的格式比如generate-unit-test而不是test目的就是让人不用点进去就知道这个Skill是干嘛的。每个Skill的SKILL.md我都在头部写清楚这个Skill处理什么任务、在什么场景下不要用、依赖哪些环境。这里要特别说明一下原视频我是不放进仓库的一个是版权问题另一个是仓库体积问题。我在source-videos目录里放了一份分类索引表格包含原视频的标题、来源平台、原作者、链接和拆解后的Skill对应关系。如果有人想对照学习可以自己去原链接看如果有人想批量处理自己的视频可以直接用scripts目录里的工具。5.2 许可协议、README以及那些容易被忽略的事开源不是把文件传上去就完了有几个人容易被忽略的问题我得单独说说。首先是许可协议。我选了CC BY-NC-SA 4.0也就是允许非商业使用和修改但必须署名、必须保持相同许可。这个选择权衡了很久如果选MIT意味着别人可以拿去商业化打包售卖我设计这个项目的初衷是让更多人低成本复用不太希望被直接搬运到付费课程里当赠品但如果选纯CC BY-NC又限制了别人基于它做衍生产品的灵活性。最后用SA条款既允许二次创作又保证衍生作品也得开源算是一个相对平衡的选择。其次是README的写法。我坚持README是给陌生人看的不是给自己看的所以第一屏就是项目是什么、能解决什么问题、怎么快速用起来然后才是目录结构和技术细节。我还专门写了一小节从视频到Skill的转化标准把我自己处理视频时用的六个字段模板贴出来了这样别人拿到的不只是结果还有方法论本身。再就是issue和PR的处理。开源项目必然有人提需求、报问题我一开始就拉了三个固定的版本计划v1.0是初始公开版v1.1计划补充一批AI Agent相关的Skillv1.2规划把提示语模版结构扩展为支持多语言。这些计划都被我写进了README这样社区用户看得到这个仓库不是一次性发布然后不管的状态。5.3 后续入库流程新增视频怎么处理开源的另一个问题是可持续性。AI领域每天都在出新东西几个月不更新仓库很快就过时了。所以我给自己设计了一个新视频入库的流程把这个当时最累的活儿变成了一个半自动化的任务新增一条视频 → 下载并抽帧 → ASR转写 → 纠错清洗 → LLM预提取 → 人工复核 → 归入分类目录 → 更新索引表 → 提交PR合并这个流程跑下来一条20分钟的视频从下载到入库熟练之后大约需要40分钟其中大部分时间花在人工复核上。可能有人觉得40分钟太长了但我必须说如果只靠全自动处理产出的Skill质量会急剧下滑。AI提取出来的步骤可能顺序颠倒参数可能张冠李戴人工复核是整个流程的保险丝不能省。我还在scripts目录里放了这套流程对应的工具脚本具体来说是三个Python脚本分别负责ASR纠错、文本清洗分段和LLM预提取。一个基础的视频拆解流水线照着跑是能用的目录里也留了说明文档。说白了开源不是终点维护才是。我这套流程跑通之后后续每两周集中处理一次新视频仓库就不会死掉。6. 复盘463个视频到底值不值6.1 我实际用这些Skill做了什么事项目做完到现在我自己的使用频率恐怕比所有外部用户加起来都高。这里说几个真实场景。第一个场景是写文章配图。以前我写AI相关内容配图都是随手生成风格不统一。现在直接用kitchen-vibe-tester这个Skill输入一段文字描述它能自动按我过去测试过的风格参数生成几张风格一致的配图再也不用每次从头调参数。第二个场景是自动化测试。我维护的几个开源Python项目之前补测试全靠手写效率很低。现在用unit-test-generator这个Skill先让它扫描项目结构再生成骨架我只需要检查边界用例。实测下来一个中等模块的测试覆盖率从30%提升到80%耗时反而少了一半。视频里那位UP主分享的经验确实解决了我的真实痛点。第三个场景是Agent开发。自从把一批多Agent协作的视频整理成Skill之后我搭Agent的效率高了不少。以前是边查文档边调prompt现在SKILL.md里直接写着分级任务拆分策略、工具调用的顺序约束、失败回退机制。尤其是做那种需要搜索-总结-写稿的Agent流程这套东西基本开箱即用。6.2 哪些视频适合转Skill哪些视频纯属浪费整理完这批视频我的一个强烈感受是不是所有视频都值得转成Skill里面大概三成是低价值的。这里做个分类帮你避坑。值得转的是操作流程型视频步骤明确、有参数、有可复现的结果。典型代表是ComfyUI工作流搭建、AI绘画参数调优、Agent工具调用配置。这些视频转成Skill之后使用价值甚至超过了原视频——因为AI可以按步骤执行不用人盯着屏幕看。不值得转的是资讯综述型和观点输出型视频这类视频讲的是趋势判断、工具发布总结、行业分析。它们的信息有很强的时效性而且严格来说不是技能是认知。除非知识密度极高否则转成Skill就变成了一堆过时的背景介绍毫无意义。还有一个让我意外的发现很多科普型视频尤其是讲Transformer原理、讲RAG内部机制的那种转成Skill效果很差但转成提示语模版却很香。原因是这类视频里的讲解框架是通用的——比如用类比解释复杂概念这个模版就是从好几个科普UP主的视频里提炼出来的。技能不能复用话术可以。6.3 给想做类似项目的人的三条建议最后分享三条我这一个多月踩坑踩出来的经验希望你能绕过去。第一条是先搭流水线再处理量。我一开始是手动处理了几个视频觉得自己效率很高。直到处理到第20个时开始崩溃——因为每个视频都要重新想一遍怎么提取。后来返工搭了标准化的六字段模板预提取脚本效率才真正上来。这个过程就像做菜先花时间备菜、调好酱汁后面炒起来才快。第二条是Skill的粒度宁小勿大。一个Skill只解决一个完整任务看着数量多但用起来舒服。当你把AI当成一个实习工程师来看给它安排的活儿越具体它的产出越靠谱。那些看似强大的万能Skill实际用起来经常因为描述含糊而失效。第三条是别被视频数量忽悠。463个视频听起来唬人但真正核心的产出可能就那些。如果你想做类似的事不必追求数量哪怕只整理50个精品视频只要每个都拆得足够深价值远超500个水视频的一键转写。我的仓库里也不是每个Skill质量都一样高有些我自己知道只是可用级别能打的永远是那几个深度拆解的。这个项目对我的意义远超整理了一批资源。它让我真正理解了内容的本质收藏不是学习把信息加工成能执行的东西才是学习。AI视频也好、教程文档也好只有当你把它们变成随时能调用的行为模式它们才真正属于你。如果你也有类似的一堆收藏夹吃灰内容我特别建议你试试这个方法。先拿10个视频跑一遍完整的流水线感受一下从视频到技能的转化过程——你会发现这比焦虑地囤积几百个教程踏实得多。
返回列表