做内容的人都在问一个问题:怎么用AI批量生产短视频,还不显得粗糙?
"每天听懂一首歌"这个赛道给了一个很好的答案。前两篇文章已经拆解了爆款逻辑和视频开头的工作流,这篇专门讲核心部分——歌曲正文解说。
这套工作流最终能做到什么?输入一个歌名,自动生成解说文案、配音、字幕、分镜视频,直接写入剪映草稿,一键出片。
下面逐层拆解。
完整工作流全貌
整个流程分四条主线同时推进:
歌曲解说:大模型生成文案 → 转语音配音 → 输出音频和字幕时间线
歌曲视频:根据解说内容拆分分镜 → 生成绘图提示词和视频提示词 → 图生视频
背景音乐:将音乐文件转为剪映音轨时间线
剪映草稿:把上面三条线生成的内容全部写入同一个草稿文件
四条线最终汇聚到一个草稿里,结构清晰,改起来也方便。
歌曲解说怎么跑
起点:初始化参数
开始节点需要填几个必填项:api_token(插件认证,后台回复【芝麻开门】获取)、歌曲音频文件、歌曲名称、男女主参考图、剪映草稿ID,以及轨道起始时间。
参数不多,但每一个都有用,缺一个后面就跑不通。
核心节点:文案生成
这里用的是扣子官方大模型节点。提示词的设定很关键——要求模型扮演"亲切口语化的音乐科普博主",按"开篇+主体分析+结尾金句"的结构输出,每句不超过15字,总字数控制在200-300字,无标点输出,方便后续直接做字幕。
这是个伪提示词,可以拿去豆包做反推,调整成自己的风格。
配音流程
文案生成后,用循环节点逐段调用官方【语音合成】插件的speech_synthesis工具,把每一段文字转成对应的音频文件。
时间单位转换
剪映用的时间单位是微秒,配音时长默认是秒。这里用三方插件【数字工具合集】的sec_2_us工具做转换,循环处理每一段配音。
这个细节容易被忽略,但不转换后面时间线就会对不上。
生成时间线
语音时间线用multi_audio_timeline工具生成,字幕时间线用multi_caption_timeline工具生成,两个都是三方插件【视频剪辑工具箱】里的工具。
到这里,解说部分的音频和字幕就全部就绪了。
分镜视频怎么生成
字幕合并
解说文案是按句子切分的,颗粒度比较细。生成视频分镜之前,需要先把相邻的短句合并成语义连贯的段落,每段时长控制在5秒以内。
这一步用大模型节点处理,提示词要求模型识别情绪和逻辑边界,只合并没有明显边界的相邻句子,不新增内容。
分镜图片提示词
合并后的文案交给大模型,生成新海诚风格的绘图提示词。
提示词要求按文案数量一一对应输出,包含人物物理描述(年龄、服装、表情姿态)、场景构建(侧逆光、漫反射、低饱和主色调),以表格格式输出。
为什么选新海诚风格?视觉辨识度高,情绪感强,和音乐解说的内容气质很搭。
图片生成
循环节点调用官方图像生成节点,逐张生成分镜图片。
视频提示词
有了分镜图,还需要视频提示词才能图生视频。
这里再调一次大模型,针对每张分镜图和对应文案,生成约5秒的视频提示词。要求单一场景+1个动态元素,固定或轻微推拉镜头,聚焦人物局部,控制在5秒节奏内。
视频生成
循环节点调用官方视频生成节点,把每张图片+对应提示词生成分镜视频。生成后用文本处理节点提取视频URL,最后用multi_video_timeline工具生成视频时间线。
背景音乐处理
这部分比较简单。文本处理节点把音乐文件转成URL格式,然后用single_audio_timeline工具生成背景音乐时间线,准备写入草稿。
写入剪映草稿
四步写入,顺序不能乱:
先添加正文解说音频 → 添加背景音乐 → 添加字幕 → 添加视频
注意,这里是接着"视频开头"的草稿继续编辑,不需要新建草稿。
全部添加完成后,用save_draft工具持久化,草稿才算真正保存下来。
结束节点输出
这个工作流结束后会输出四个值:草稿ID(传给视频结尾工作流)、草稿下载地址、解说视频的开始和结束位置。视频结尾工作流从end_us这个时间点开始接续。
拆完这个工作流,最大的感受是:拆成子流程是对的。
每个子流程职责单一,单独调试方便,哪个环节出问题直接定位,不用在一条长链里找。整体复杂度被分散到了三个独立模块里,维护起来省心很多。
想学Coze工作流实战,这个案例是个很好的切入点。
如果你对Coze AI赛道项目、自媒体引流、无人直播带货、小红书运营感兴趣,也想在互联网找一个稳定的副业收入,关注公众号可以领取:
❶ 2026年450个最新互联网搞钱野路子:告别信息差,快速找到方向
❷ 100+互联网创作免费工具:覆盖多个领域,效率直接拉满
❸ 200+Coze工作流合集:模板一键复制,直接用
❹ 多个AI实战案例宝库:冷门爆款赛道,实打实的案例
方法就这些,其实不难。任何项目都要经历从0到1的过程,不可能上来就赚大钱,需要持续打磨和执行。希望这篇拆解能帮你在这个赛道跑出自己的节奏。

