
- 论文(arXiv):https://arxiv.org/html/2606.30642v1 - 项目主页(Demo 试听):https://levo-demo.github.io/levo_v2_demo/ - GitHub 主仓库:https://github.com/tencent-ailab/SongGeneration - Hugging Face 模型集合:https://huggingface.co/collections/lglg666/levo - Hugging Face Space(在线试玩):https://huggingface.co/spaces/tencent/SongGeneration - ModelScope 镜像:https://modelscope.cn/models/AI-ModelScope/SongGeneration - 前作 LeVo v1 论文:https://arxiv.org/abs/2506.07520 - 发布机构:Tencent AI Lab + 清华深圳国际研究生院 + 武大等联合团队 - 开源协议:Tencent 自定许可(限学术研究、非商用,详见仓库 LICENSE) - 关键发布日期:SongGeneration-v2-large:2026-03-09;v2-medium:2026-03-18;扩展论文 v2:2026-06-29
想象这样一个场景。
你是个独立音乐人,今天想给短视频做一首国风摇滚。你打开 AI 写歌工具,输入了精心排版的歌词:
[verse] 芳菲落尽. 芳菲逝去. 在这纯白的季节里...又顺手敲了一行风格标签:gufeng, rock, heartbroken, electric guitar, drum kit, bass guitar。
按下回车。10 秒后,AI 交给你一首歌。
乍一听,"有那味儿了"。但你盯着歌词本看两遍,发现:
• 第二段主歌里"月光洒满地"被唱成了"月光撒满地" • 副歌"我始终无法忘记"在 AI 嘴里变成了"我失踪无法忘记" • 整首歌在 1 分 20 秒时突然"跳"了一段,像是忘了自己在写什么
这种"歌词幻觉"(lyrical hallucination),是过去两年所有 AI 写歌工具的通病——开源的会,闭源的商业模型也会,只是程度不同。
直到 LeVo 2 出现。
关键判断:在 2026 年之前,业界默认 "PER 12% 左右"是 AI 写歌的天花板。LeVo 2 把这个数字压到 8.55%——比 Suno v5(PER 12.4%)还低 4 个百分点。它不是"接近",是"超过"。一张消费级显卡就能跑 4 分 30 秒的全长歌曲。这就是 LeVo 2(SongGeneration 2)——把"商业级 AI 写歌"从云端拉到桌面的开源项目。
PER =Phoneme Error Rate(音素错误率)
LeVo 2 = SongGeneration 2:开源 AI 歌曲生成基础模型,4B 参数;输入"歌词+文本描述+参考音频",输出 4 分 30 秒以内的完整歌曲(含人声和伴奏);支持中/英/西/日等多语种;22GB 显存可跑大模型,12GB 显存可跑中型模型。
模型家族速览

显存说明:22G/28G 这种"X/Y"写法来自官方 README,X 是无参考音频的推理显存,Y 是带 10 秒参考音频的显存。
(DEMO随便放两个,感兴趣的自己去主页试听)
中等规模版本 v2-medium 的最低显存是 12GB。换句话说,一张 RTX 3060(12G 显存)就能跑中型版。旗舰版 v2-large 需要 22GB,对应 RTX 4090 或 A5000。另外还可以走"低显存模式"(--low_mem 参数),官方说能在更小显存上跑,速度会慢一些。
Q:生成的歌我能拿去商用吗?版权怎么算?
不能。LeVo 2 当前的 LICENSE 写得很清楚:"仅限学术、研究、教育用途",明确禁止任何商业或生产环境使用。这跟 YuE(Apache 2.0)、DiffRhythm 2(Apache 2.0)这种真正可商用的开源模型不同。想做商用产品,要么等官方换协议,要么选其他协议更宽松的模型。
Q:它跟 Suno 那种"傻瓜式"工具比呢?
Suno、Udio 强在"开箱即用":手机点几下就出歌。LeVo 2 强在"可调可控":你能改歌词结构、调乐器组合、传 10 秒参考音频定风格。普通用户用前者更省事;创作者和研究人员用后者更灵活。
Q:上传的参考音频会被拿去训练吗?
看代码与 LICENSE,权重和推理代码都公开,但没有迹象表明官方会把用户上传的音频回流到训练集。不过为了保险起见,别上传有版权问题的音乐——任何开源协议都不保证下游使用者"代你守法"。
LeVo 2 的核心是一个两阶段流水线,
讲人话就是"作曲家 + 录音师"。
(图源:论文 Fig. 1,LeVo 2 整体架构示意)
(图源:论文 Fig. 2,LeLM 架构:Mixed Semantic LM + Track-Specific LM 协同)
第一步:作曲家(LeLM 语言模型)写"乐谱"
LeVo 2 不像传统 AI 那样直接吐音频波形。它先把音乐"翻译"成一种离散 token(说白了就是把音频拆成有编号的小片段),再用语言模型预测这些 token 的序列。
这一步做的是"全局规划":
• 主歌要什么情绪? • 副歌什么时候"炸"? • 人声和伴奏的节奏对不对得上?
LeLM(LeVo Language Model)就是干这活的,它本质上是一个 Transformer 解码器,干的事跟 GPT 写文章很像——只不过它写的是"音乐 token"。
(图源:项目主页与论文示意图)

(图源:项目主页 Architecture 一图,详 https://levo-demo.github.io/levo_v2_demo/)
第二步:录音师(Music Codec + Diffusion)做"高保真渲染"
光有乐谱还不够,得有人"演奏 + 录音"。
LeVo 2 用了一个基于扩散模型的 Music Codec,
把 LeLM 输出的 token 重新变回 48kHz 的真实波形。
Music Codec 内部又拆成两个组件:
• VAE(变分自编码器):把波形压缩成紧凑特征 • DiT(Diffusion Transformer):用扩散过程把特征"画"成细节丰富的音频
这一对组合保证了"高保真"三个字。
(图源:论文 Fig. 3,Music Codec 框架:VAE + DiT 扩散)
杀手锏:分层语言模型
这是 LeVo 2 跟其他开源模型最不一样的地方。
之前的开源模型(包括 LeVo v1)面临一个两难:
• 方案 A:把人声和伴奏混在一起当"混合 token"预测。
好处是能保持人声伴奏的和谐度,坏处是音质损失大。
• 方案 B:把人声和伴奏分开预测"双轨 token"。
好处是音质好,坏处是序列长度翻倍、容易"忘了主歌在写什么"。
LeVo 2 的解法是分层预测:
• 第一层(Mixed Semantic LM):先生成"混合 token",负责全局结构和旋律走向 • 第二层(Track-Specific LM):再以第一层为条件,并行预测人声 token 和伴奏 token
一句话类比:方案 A 是"一个人边写词边唱",方案 B 是"词作者和歌手各干各的",LeVo 2 是"词作者先出 demo,歌手再分两轨录"。
这种设计既保住了"全局一致性",又拿到了"分轨细节",论文里叫它 Hierarchical Representation Modeling(分层表征建模)。
训练:把"音乐审美"塞进 AI 里
光有架构还不够,LeVo 2 训练流程的核心是"审美先验 + 三阶段后训练"。
预训练阶段(Aesthetics-Conditioned Pre-training)
• 用大规模歌曲数据训练 • 关键创新:搞了一套"自动化音乐美学评估框架",
自动给每首训练曲打"音乐性等级"标签
• 然后在训练时把这个等级作为"条件信号"输入模型 • 等于在训练时不停地告诉 AI:"这种是高级的、这种是低级的" • 论文叫它 musicality prior(音乐性先验)
后训练阶段(Progressive Post-Training)三步走,每步目标互不冲突:

说人话:SFT 是"先学规矩"——给一堆好歌让 AI 模仿;Offline DPO 是"改毛病"——给 20 万对"好歌词 vs 错乱歌词"让 AI 学会避错;Semi-online DPO 是"持续进化"——每过一段时间用 AI 自己生成的歌 + 人类审美分数再训练一轮。三步分开做,论文说是因为"同时优化多个目标会产生梯度冲突,分阶段能解耦"。
模块化扩展阶段(Modular Extension)
• 单独训练 Track-Specific LM 来提升人声/伴奏的细节 • 保留前两阶段已经训好的"全局规划师"不动 • 这种"分工明确"的训练策略降低了"改了 A 坏了 B"的风险
(图源:GitHub 仓库 README)

(图源:开源 vs 闭源评测对比图)

典型使用场景

它专注解决的痛点
1. 歌词幻觉
• 业界平均 PER 在 10-15% 之间 • LeVo 2 压到 8.55% • 论文里特别提了 "Suno v5 (12.4%) > Mureka v8 (9.96%) > LeVo 2 (8.55%)" • 这不是论文自夸,第三方对比也复现了类似结论
2. 人声和伴奏的"和声撕裂"
• 老方案要么音质差(混合 token),要么不协调(双轨独立预测) • 分层预测既保音质又保一致
3. 开源模型的"音乐性弱"
• 传统开源模型能出歌但"听起来机器感强" • 自动化美学评估 + 三阶段后训练把"审美"刻进模型
它解决了什么,没解决什么

开源阵营

闭源阵营(仅作参考)

关系图谱
• 前作:LeVo v1(2025-06 论文,3B 参数,单语种) • 本代:LeVo 2(2026-03 模型发布,2026-06 论文 v2,4B 参数,多语种) • 变体关系:v2-large 是旗舰,v2-medium 是轻量,v2-fast 是速度 • 生态位置:Tencent 系开源项目,与 YuE(m-a-p)、DiffRhythm 2(小米)形成开源三角
关键数字对比(各项目官方公开数据)

表格说明:标 "-" 的表示公开材料中未直接给出;所有数字都来自各项目官方公开材料。
注意:闭源一线商业系统的 8 分钟是 v4.5+ 升级版能力,需要 Pro 订阅。
1. 协议问题:开源但不能商用
LeVo 2 的 LICENSE 写得很明确:
"You agree to use the SongGeneration only for academic, research and education purposes, and refrain from using it for any commercial or production purposes under any circumstances."
这意味着:
• 你能下载、能跑、能改、能写论文 • 你不能把它集成到商业产品 • 你不能用生成的歌卖钱
想要商用?要么选 Apache 2.0 的 YuE / DiffRhythm 2 / ACE-Step,要么等 LeVo 2 后续换协议(目前没看到官方承诺)。
2. 主观评测的"自评"问题
LeVo 2 论文里 20 位专家、6 个维度、100 首歌/模型的评测,全部是Tencent 自己做的。第三方独立评测机构(2026-05 的一份对比报告)指出:"LeVo 2 produced the most natural-sounding music ... carries a non-commercial license"同时也指出 "Open-source still falls short of commercial systems overall"意思就是"它确实强,但还没到 Suno 那种"。
别只信论文表,自己去听 demo:项目主页提供了大量生成样本(中文/英文都有),亲自听完再判断"商业级"是不是真的商业级。
3. "商用级"这个标签
LeVo 2 官方多次使用 "commercial-grade"(商业级)这个词,
但这是"音乐性上的商业级",不是"许可上的商业级"。
换句话说:
• 听感上,它能跟 Suno / Mureka 这种闭源商业模型对打 • 法律上,它不能直接拿去做商用产品
别被 "commercial-grade" 这个词唬住——它说的是质量,不是授权。
4. 多人 / 实时 / MIDI 编辑
LeVo 2 仍然以"单主唱 + 伴奏"的单曲为主,
多人合唱、实时生成、MIDI 导出、DAW 插件 这些功能目前都还没有。
对"我想在 Ableton 里逐轨编辑"的专业音乐人来说,
现阶段 LeVo 2 只能算"半成品"。
5. 数据来源与版权
跟所有 AI 音乐模型一样,LeVo 2 的训练数据来源、版权清理情况没有完全公开。如果你的下游应用对版权链条敏感,得自己请法务过一遍。
适合谁 / 不适合谁

这些坑不是官方文档里写的,是社区和试用经验里攒出来的。
坑 1:歌词格式错了,模型就"瞎唱"
LeVo 2 对歌词格式极其敏感。
必须用结构标签:[verse]、[chorus]、[bridge]、[intro-medium]、[outro-medium] 等。必须用半角英文标点(.、;),不能用中文标点(。、,)。中文歌词块末尾不能加句号。英文歌词块末尾必须加句号。
写错了?模型会"自创"歌词、用错标点、跳过结构标签。
坑 2:文本描述和参考音频"打架"
README 明确说:"Avoid providing both prompt_audio_path and descriptions at the same time."
同时给音频提示 + 文本描述,且两者风格冲突时,模型会"精神分裂"。
要风格模仿,就别加文字描述;
要文字控制风格,就别传参考音频。
坑 3:参考音频别传太长的
只取前 10 秒。多传了也是截断。建议传副歌部分——节奏和情绪信息最浓的那段。
坑 4:显存不够记得开 low_mem
跑 v2-large 时 OOM(Out of Memory),试试:
sh generate.sh ckpt_path lyrics.jsonl output_path --low_mem会牺牲一些速度,但能装进 16G 甚至更小的卡。
坑 5:Flash Attention 版本不匹配
如果你的 CUDA / PyTorch / Python 组合跑不起来,
试试加 --not_use_flash_attn 关掉 Flash Attention。
README 里有针对 Python 3.10 + CUDA 12 的预编译 wheel 推荐。
坑 6:想听完整效果,多刷几次种子
AI 生成有随机性。
同样的歌词 + 描述,多刷几次能出明显不同的版本。
挑最好的那首——别一棵树上吊死。
坑 7:商用授权问题
再次强调:当前 LICENSE 限学术研究。要做短视频商用配乐?请选 YuE / DiffRhythm 2 / ACE-Step(都是 Apache 2.0)。等 LeVo 2 后续出商用协议再考虑。
官方推荐配置

RTF = Real Time Factor,越小越快。0.82 表示生成 1 分钟音频需要 0.82 分钟。显存数字"X/Y":X = 无参考音频,Y = 带 10 秒参考音频。
一键启动
仓库自带 Docker 镜像:
docker pull juhayna/song-generation-levo:hf0613docker run -it --gpus all --network=host juhayna/song-generation-levo:hf0613 /bin/bash不想装环境?直接去 Hugging Face Space 试 v2-fast,1 分钟以内出歌,但牺牲一点音乐性换速度。
实际部署经验
社区和云厂商反馈:
• 16G 显存的 RTX 4080 跑 v2-large 需要开 --low_mem• 24G 显存的 RTX 4090 / A5000 跑 v2-large 比较稳 • 显存不够时主要瓶颈在 DiT 的扩散过程
几个常见环境问题
• Python 版本:建议 3.8.12 以上,3.10 跑 Flash Attention 最稳- CUDA:11.8 起,README 推荐 12.x- 操作系统:Linux 优先,Windows 需要 WSL2- 依赖管理: pip install -r requirements.txt+requirements_nodeps.txt --no-deps
把 LeVo 2 放回 2026 年的行业里看,三个事实不能忽略。
1. 闭源圈打得越来越激烈
• Suno v4.5+(2026-04 升级)支持 8 分钟 • Suno v5(2025-09 发布)已经能"几乎无法与人声区分" • Udio 在 2025 年跟环球、索尼、华纳达成和解(不是收购,是法律和解) • Google 的 Lyria 3 Pro 在 2026-03 发布
闭源商业模型还在快速迭代,LeVo 2 想"开源追平",每 3-6 个月得再发一版。
2. 开源圈是另一片红海
• 2025-2026 期间,YuE、DiffRhythm 2、HeartMuLa、ACE-Step 密集发布 • DiffRhythm 2 论文里承认 "Open-source still falls short of commercial systems overall" • 真正可商用的开源模型(Apache 2.0)目前音质还达不到 Suno 水准 • LeVo 2 是"音质第一"的开源模型,但商用授权是软肋
3. 评测标准正在被重写
• Tencent AI Lab 提出的 SongBench(11,717 样本 7 维度评测),
是当前最专业的"AI 音乐质量评估"工具之一
• 传统指标 PER、CLAP、FAD 已经不够用 • 行业正在从"看分数"转向"听专家 + 听大众"双轨评测
(图源:SongBench 评测框架示例)

LeVo 2(SongGeneration 2)的意义,不在"它比 Suno 强"——它确实还差一点。也不在"它把 Suno 干掉了"——闭源还在进步。
它的意义在"开源模型第一次能在听感上威胁闭源商业模型"。
具体地说:
• PER 8.55%——比主流闭源商业模型都低 • 6 维度专家评测——综合超过所有开源基线 • 分层语言模型——架构上解决"音质 vs 和谐"的经典两难 • 三阶段后训练——把"音乐性先验"刻进模型 • 多语种 + 本地可跑——12G 显存就能玩中型版
它当然也有明显短板:
• 协议限学术研究,不能直接商用 • 实时生成、多人合唱、MIDI 编辑还没做 • 主观评测是 Tencent 自评,第三方要自己跑一遍
给三类读者的建议:
1. 音乐创作者:想免费做 Demo、试新风格、上传到 YouTube?先看 LICENSE 再说。如果只是非商用研究 + 个人玩,可以试试 v2-fast(1 分钟出歌)。如果想商用集成,请选 YuE / DiffRhythm 2。 2. AI 开发者 / 研究者:这是 2026 年开源 AI 音乐领域最值得读的一篇论文。分层语言模型 + 自动化美学评估 + 三阶段后训练,这套组合拳在很多生成任务上都能借鉴。 3. 普通爱好者:先去 Hugging Face Space 听几首 demo。如果觉得"哎,还真有点意思",再决定要不要本地跑。
最后一句话:
2026 年的 AI 音乐,已经不是"能不能写歌"的问题,而是"你想听闭源的天花板,还是想自己造一个开源的天花板"。
LeVo 2 至少告诉我们一件事:后者,正在成为可能。
• 论文:https://arxiv.org/html/2606.30642v1 • 前作 v1 论文:https://arxiv.org/abs/2506.07520 • 项目主页与 demo 试听:https://levo-demo.github.io/levo_v2_demo/ • GitHub 主仓库:https://github.com/tencent-ailab/SongGeneration • Hugging Face 集合:https://huggingface.co/collections/lglg666/levo • Hugging Face Space(在线试玩):https://huggingface.co/spaces/tencent/SongGeneration • ModelScope 镜像:https://modelscope.cn/models/AI-ModelScope/SongGeneration • SongBench 评测框架:https://github.com/Tencent/SongBench

