你是否想过,自己写一首歌,再用它做一支MV,全程不花一分钱?
我用星辰超级智能体(TeleAgent)做了一次实验:从零开始,一句话提需求,到最终拿到一支带歌词字幕的MV视频——全程免费,全程AI完成。这篇文章,就是完整的实战记录。
────────────────────
一、一句话启动全流程
我对星辰超级智能体说:“帮我创作一首爱国主义歌曲”。
它没有急着写,而是像专业音乐人一样,先问清楚我的需求。三轮对话后,它明确了:
情感基调:激昂奋进,使命与担当
叙事结构:古今交织对话,先辈与后人的精神共鸣
音乐风格:民族风,五声音阶,中国味
核心意象:黄河、长城、高铁、航天……千年山河与时代壮举
曲长约3分50秒,适合普通人演唱
然后它给歌取了名字——《九州长歌》。气势磅礴,我很满意。
────────────────────
二、写词谱曲,一次搞定
歌词:古今对话的三幕式
AI创作的歌词采用古今对话结构,主歌A段写古,主歌B段写今,副歌写山河担当——三幕交织,情感递进。几句印象深刻的歌词:
“黄河之水天上来,奔流千载不曾回”——写古
“如今高铁穿山越,神舟一跃九天飞”——写今
“九州万里我的家,山河壮烈山河长”——写魂
简谱:五声音阶的民族调式
歌词写完后,星辰超级智能体自动接上谱曲环节。它采用G宫五声调式,编写了完整的简谱,覆盖全曲十一个段落,升调部分转A宫调推高情感。每个音符的音高、时值、节拍都有明确标注,为下一步BGM合成提供了精确指令。
这一步很关键:没有简谱,后面的音乐合成就是瞎子摸象。AI能从歌词自动生成简谱,说明它真的理解音乐,不是胡乱拼凑。
────────────────────
三、BGM合成:五种民族乐器的数字演奏
星辰超级智能体用Python + NumPy,基于简谱的音高序列自动合成了整首BGM。它模拟了五种民族乐器音色:
乐器 | 职责 | 说明 |
竹笛 | 主旋律 | 清亮穿透,承载主旋律线 |
古筝 | 副旋律 | 流畅温柔,铺底和声 |
大鼓 | 节奏驱动 | 庄重有力,副歌高潮点缀 |
弦乐 | 和声铺底 | 温暖包裹,填充和声层次 |
钹 | 高潮点缀 | 明亮亮丽,副歌升调时的最强音 |
全曲约229.8秒,从前奏到尾声共十一个段落,包含升调设计。合成的音频就是最终的纯伴奏版BGM,可以直接作为MV的背景音乐。
────────────────────
四、关于AI歌唱:我们选择不用
三个原因:
版权风险。用AI复制歌手声音或风格,涉及声音权、表演者权的侵权风险。目前法律仍在演进,不值得冒这个险。
艺术质量。当前AI歌唱无法呈现真实的气息控制、情感起伏和音色变化。勉强使用只会降低作品质量。
尊重创作。歌唱是人类表演艺术的核心,我们尊重歌手的创造性劳动,不做声音克隆和模仿。
歌词以字幕形式嵌入MV,观众可以随伴奏自行唱和。AI是创作助手,不是替代者——这是我们的原则底线。
────────────────────
五、66个分镜脚本:AI的导演功力
写完歌,星辰超级智能体自动接上MV制作。它根据歌曲结构创作了66个分镜脚本,各段对应如下:
时间 | 段落 | 分镜 | 视觉主题 |
0:00-0:35 | 前奏 | S01-S04 | 山河壮观,营造氛围 |
0:35-1:01 | 主歌A·古 | S05-S12 | 黄河、长城、丝路、昆仑 |
1:01-1:25 | 主歌B·今 | S13-S20 | 高铁、北斗、神舟、城市 |
1:34-2:01 | 副歌1 | S25-S32 | 山河全景+担当群像 |
3:11-3:39 | 副歌升调 | S57-S64 | 全景高潮+群像 |
3:39-3:50 | 尾声 | S65-S66 | 山河归于宁静 |
每个分镜包含8个字段:镜号、时长、景别、运镜、内容、英文Prompt、字幕、音效。写得有条有理,就像真的导演写的分镜本。
────────────────────
六、视频生成:文字变画面的魔法
星辰超级智能体调用Agnes-Video-V2.0模型,把每个分镜的英文Prompt变成真实的视频片段。全部采用文生视频模式,统一16:9画幅、24fps。
几个细节值得一提:
所有人物Prompt都加了Chinese facial features,确保中国人物造型
古代场景自动加负向提示词排除现代元素,避免出戏
帧数自动计算,满足8n+1规则,对应不同时长的分镜
Agnes-Video目前免费促销期,生成视频零费用
视频生成后,星辰超级智能体自动用ffmpeg完成后期:统一分辨率、拼接片段、按时间节点烧录歌词字幕、混入BGM音频。最终输出一个完整的MV视频文件。
────────────────────
七、全流程技术与费用
下表汇总了整个创作流程的技术栈和费用情况:
环节 | 技术 | 星辰超级智能体做了什么 | 费用 |
写词谱曲 | AI大模型 | 创作歌词、编写简谱、编曲说明 | 免费 |
合成BGM | Python+NumPy | 五声音阶旋律自动生成,五种音色 | 免费 |
生成文档 | docx-js | 歌词简谱文档、分镜脚本文档 | 免费 |
视频生成 | Agnes-Video-V2.0 | 66个镜头文生视频、下载存储 | 免费促销期 |
后期制作 | ffmpeg | 归一分辨率、拼接、烧字幕、混音 | 免费 |
人声歌唱 | 未采用 | 因版权和艺术质量原因放弃 | — |
全流程零费用。
────────────────────
八、AI能做什么,做不了什么
✓ 能做的
精准理解音乐创作需求,多轮对话确定方向
从歌词到简谱到BGM到分镜脚本,一次g完成全链路
自动调用工具链:NumPy合成音乐、Agnes生成视频、ffmpeg后期处理
文生视频对风景、航拍类镜头效果稳定,配合精确Prompt可控
✗ 做不了的
歌唱演绎:版权风险+艺术质量双重原因,不应用于正式产出
跨镜头角色一致性,还需图生视频等方案缓解
NumPy合成音乐的表现力有限,将来可接入更强的音乐模型
────────────────────
写在最后
星辰超级智能体完成的这次实验,让我看到了AI在多模态创作中的巨大潜力,也看到了它的边界。
AI能写词、能谱曲、能合成音乐、能生成视频,而且全程免费。但歌唱这件事,交给人来做更好。不是因为技术不行,而是因为我们尊重每一个歌手的声音,尊重人类表演艺术的不可替代性。
如果你也想试试,打开星辰超级智能体,说一句“帮我创作一首歌”,就可以开始了。整个过程就像跟一个专业音乐团队合作——只是这个团队不收费。

