当前位置: 首页 音乐 腾讯&清华&武大联合开源4BAI歌曲生成基础模型:把AI写歌PER干到 8.55%,4分30 秒全长跑12G显卡
腾讯&清华&武大联合开源4BAI歌曲生成基础模型:把AI写歌PER干到 8.55%,4分30 秒全长跑12G显卡

腾讯&清华&武大联合开源4BAI歌曲生成基础模型:把AI写歌PER干到 8.55%,4分30 秒全长跑12G显卡

wang 音乐 评论0次 2026-07-01 2026-07-01
7
详情内容
腾讯&清华&武大联合开源4BAI歌曲生成基础模型:把AI写歌PER干到 8.55%,4分30 秒全长跑12G显卡
Heavy Type
LeVo 2:当开源AI音乐开始"听懂"歌词——SongGeneration 2 深度拆解
01
资源导航
  • - 论文(arXiv):https://arxiv.org/html/2606.30642v1
  • 项目主页(Demo 试听):https://levo-demo.github.io/levo_v2_demo/
  • GitHub 主仓库:https://github.com/tencent-ailab/SongGeneration
  • Hugging Face 模型集合:https://huggingface.co/collections/lglg666/levo
  • Hugging Face Space(在线试玩):https://huggingface.co/spaces/tencent/SongGeneration
  • ModelScope 镜像:https://modelscope.cn/models/AI-ModelScope/SongGeneration
  • 前作 LeVo v1 论文:https://arxiv.org/abs/2506.07520
  • 发布机构:Tencent AI Lab + 清华深圳国际研究生院 + 武大等联合团队
  • 开源协议:Tencent 自定许可(限学术研究、非商用,详见仓库 LICENSE)
  • 关键发布日期:SongGeneration-v2-large:2026-03-09;v2-medium:2026-03-18;扩展论文 v2:2026-06-29
02
把"幻觉歌词"按下静音键

想象这样一个场景。

你是个独立音乐人,今天想给短视频做一首国风摇滚。你打开 AI 写歌工具,输入了精心排版的歌词:

[verse] 芳菲落尽. 芳菲逝去. 在这纯白的季节里...又顺手敲了一行风格标签:gufeng, rock, heartbroken, electric guitar, drum kit, bass guitar

按下回车。10 秒后,AI 交给你一首歌。

乍一听,"有那味儿了"。但你盯着歌词本看两遍,发现:

  • • 第二段主歌里"月光洒满地"被唱成了"月光撒满地"
  • • 副歌"我始终无法忘记"在 AI 嘴里变成了"我失踪无法忘记"
  • • 整首歌在 1 分 20 秒时突然"跳"了一段,像是忘了自己在写什么

这种"歌词幻觉"(lyrical hallucination),是过去两年所有 AI 写歌工具的通病——开源的会,闭源的商业模型也会,只是程度不同。

直到 LeVo 2 出现。

关键判断:在 2026 年之前,业界默认 "PER 12% 左右"是 AI 写歌的天花板。LeVo 2 把这个数字压到 8.55%——比 Suno v5(PER 12.4%)还低 4 个百分点。它不是"接近",是"超过"。一张消费级显卡就能跑 4 分 30 秒的全长歌曲。这就是 LeVo 2(SongGeneration 2)——把"商业级 AI 写歌"从云端拉到桌面的开源项目。

PER =Phoneme Error Rate(音素错误率)

03
一句话讲清:LeVo 2 是什么

LeVo 2 = SongGeneration 2:开源 AI 歌曲生成基础模型,4B 参数;输入"歌词+文本描述+参考音频",输出 4 分 30 秒以内的完整歌曲(含人声和伴奏);支持中/英/西/日等多语种;22GB 显存可跑大模型,12GB 显存可跑中型模型。

模型家族速览

显存说明:22G/28G 这种"X/Y"写法来自官方 README,X 是无参考音频的推理显存,Y 是带 10 秒参考音频的显存。

(DEMO随便放两个,感兴趣的自己去主页试听)

04
解惑局:
Q:最低多少显存能跑?

中等规模版本 v2-medium 的最低显存是 12GB。换句话说,一张 RTX 3060(12G 显存)就能跑中型版。旗舰版 v2-large 需要 22GB,对应 RTX 4090 或 A5000。另外还可以走"低显存模式"(--low_mem 参数),官方说能在更小显存上跑,速度会慢一些。

Q:生成的歌我能拿去商用吗?版权怎么算?

不能。LeVo 2 当前的 LICENSE 写得很清楚:"仅限学术、研究、教育用途",明确禁止任何商业或生产环境使用。这跟 YuE(Apache 2.0)、DiffRhythm 2(Apache 2.0)这种真正可商用的开源模型不同。想做商用产品,要么等官方换协议,要么选其他协议更宽松的模型。

Q:它跟 Suno 那种"傻瓜式"工具比呢?

Suno、Udio 强在"开箱即用":手机点几下就出歌。LeVo 2 强在"可调可控":你能改歌词结构、调乐器组合、传 10 秒参考音频定风格。普通用户用前者更省事;创作者和研究人员用后者更灵活。

Q:上传的参考音频会被拿去训练吗?

看代码与 LICENSE,权重和推理代码都公开,但没有迹象表明官方会把用户上传的音频回流到训练集。不过为了保险起见,别上传有版权问题的音乐——任何开源协议都不保证下游使用者"代你守法"。

05
硬核拆解:LeVo 2 的"双脑"是怎么工作的

LeVo 2 的核心是一个两阶段流水线

讲人话就是"作曲家 + 录音师"。

(图源:论文 Fig. 1,LeVo 2 整体架构示意)

(图源:论文 Fig. 2,LeLM 架构:Mixed Semantic LM + Track-Specific LM 协同)

第一步:作曲家(LeLM 语言模型)写"乐谱"

LeVo 2 不像传统 AI 那样直接吐音频波形。它先把音乐"翻译"成一种离散 token(说白了就是把音频拆成有编号的小片段),再用语言模型预测这些 token 的序列。

这一步做的是"全局规划"

  • • 主歌要什么情绪?
  • • 副歌什么时候"炸"?
  • • 人声和伴奏的节奏对不对得上?

LeLM(LeVo Language Model)就是干这活的,它本质上是一个 Transformer 解码器,干的事跟 GPT 写文章很像——只不过它写的是"音乐 token"。

(图源:项目主页与论文示意图)

(图源:项目主页 Architecture 一图,详 https://levo-demo.github.io/levo_v2_demo/)

第二步:录音师(Music Codec + Diffusion)做"高保真渲染"

光有乐谱还不够,得有人"演奏 + 录音"。

LeVo 2 用了一个基于扩散模型的 Music Codec

把 LeLM 输出的 token 重新变回 48kHz 的真实波形。

Music Codec 内部又拆成两个组件:

  • • VAE(变分自编码器):把波形压缩成紧凑特征
  • • DiT(Diffusion Transformer):用扩散过程把特征"画"成细节丰富的音频

这一对组合保证了"高保真"三个字。

(图源:论文 Fig. 3,Music Codec 框架:VAE + DiT 扩散)

杀手锏:分层语言模型

这是 LeVo 2 跟其他开源模型最不一样的地方。

之前的开源模型(包括 LeVo v1)面临一个两难

  • • 方案 A:把人声和伴奏混在一起当"混合 token"预测。

好处是能保持人声伴奏的和谐度,坏处是音质损失大。

  • • 方案 B:把人声和伴奏分开预测"双轨 token"。

好处是音质好,坏处是序列长度翻倍、容易"忘了主歌在写什么"。

LeVo 2 的解法是分层预测

  • • 第一层(Mixed Semantic LM):先生成"混合 token",负责全局结构和旋律走向
  • • 第二层(Track-Specific LM):再以第一层为条件,并行预测人声 token 和伴奏 token

一句话类比:方案 A 是"一个人边写词边唱",方案 B 是"词作者和歌手各干各的",LeVo 2 是"词作者先出 demo,歌手再分两轨录"。

这种设计既保住了"全局一致性",又拿到了"分轨细节",论文里叫它 Hierarchical Representation Modeling(分层表征建模)。

训练:把"音乐审美"塞进 AI 里

光有架构还不够,LeVo 2 训练流程的核心是"审美先验 + 三阶段后训练"

预训练阶段(Aesthetics-Conditioned Pre-training)

  • • 用大规模歌曲数据训练
  • • 关键创新:搞了一套"自动化音乐美学评估框架",

自动给每首训练曲打"音乐性等级"标签

  • • 然后在训练时把这个等级作为"条件信号"输入模型
  • • 等于在训练时不停地告诉 AI:"这种是高级的、这种是低级的"
  • • 论文叫它 musicality prior(音乐性先验)

后训练阶段(Progressive Post-Training)三步走,每步目标互不冲突:

说人话:SFT 是"先学规矩"——给一堆好歌让 AI 模仿;Offline DPO 是"改毛病"——给 20 万对"好歌词 vs 错乱歌词"让 AI 学会避错;Semi-online DPO 是"持续进化"——每过一段时间用 AI 自己生成的歌 + 人类审美分数再训练一轮。三步分开做,论文说是因为"同时优化多个目标会产生梯度冲突,分阶段能解耦"。

模块化扩展阶段(Modular Extension)

  • • 单独训练 Track-Specific LM 来提升人声/伴奏的细节
  • • 保留前两阶段已经训好的"全局规划师"不动
  • • 这种"分工明确"的训练策略降低了"改了 A 坏了 B"的风险

(图源:GitHub 仓库 README)

(图源:开源 vs 闭源评测对比图)

06
实战场景:

典型使用场景

它专注解决的痛点

1. 歌词幻觉

  • • 业界平均 PER 在 10-15% 之间
  • • LeVo 2 压到 8.55%
  • • 论文里特别提了 "Suno v5 (12.4%) > Mureka v8 (9.96%) > LeVo 2 (8.55%)"
  • • 这不是论文自夸,第三方对比也复现了类似结论

2. 人声和伴奏的"和声撕裂"

  • • 老方案要么音质差(混合 token),要么不协调(双轨独立预测)
  • • 分层预测既保音质又保一致

3. 开源模型的"音乐性弱"

  • • 传统开源模型能出歌但"听起来机器感强"
  • • 自动化美学评估 + 三阶段后训练把"审美"刻进模型

它解决了什么,没解决什么

07
横向对照:开源圈的牌桌长什么样

开源阵营

闭源阵营(仅作参考)

关系图谱

  • • 前作:LeVo v1(2025-06 论文,3B 参数,单语种)
  • • 本代:LeVo 2(2026-03 模型发布,2026-06 论文 v2,4B 参数,多语种)
  • • 变体关系:v2-large 是旗舰,v2-medium 是轻量,v2-fast 是速度
  • • 生态位置:Tencent 系开源项目,与 YuE(m-a-p)、DiffRhythm 2(小米)形成开源三角

关键数字对比(各项目官方公开数据)

表格说明:标 "-" 的表示公开材料中未直接给出;所有数字都来自各项目官方公开材料。

注意:闭源一线商业系统的 8 分钟是 v4.5+ 升级版能力,需要 Pro 订阅。

08
争议与权衡:

1. 协议问题:开源但不能商用

LeVo 2 的 LICENSE 写得很明确:

"You agree to use the SongGeneration only for academic, research and education purposes, and refrain from using it for any commercial or production purposes under any circumstances."

这意味着:

  • • 你能下载、能跑、能改、能写论文
  • • 你不能把它集成到商业产品
  • • 你不能用生成的歌卖钱

想要商用?要么选 Apache 2.0 的 YuE / DiffRhythm 2 / ACE-Step,要么等 LeVo 2 后续换协议(目前没看到官方承诺)。

2. 主观评测的"自评"问题

LeVo 2 论文里 20 位专家、6 个维度、100 首歌/模型的评测,全部是Tencent 自己做的。第三方独立评测机构(2026-05 的一份对比报告)指出:"LeVo 2 produced the most natural-sounding music ... carries a non-commercial license"同时也指出 "Open-source still falls short of commercial systems overall"意思就是"它确实强,但还没到 Suno 那种"。

别只信论文表,自己去听 demo:项目主页提供了大量生成样本(中文/英文都有),亲自听完再判断"商业级"是不是真的商业级。

3. "商用级"这个标签

LeVo 2 官方多次使用 "commercial-grade"(商业级)这个词,

这是"音乐性上的商业级",不是"许可上的商业级"。

换句话说:

  • • 听感上,它能跟 Suno / Mureka 这种闭源商业模型对打
  • • 法律上,它能直接拿去做商用产品

别被 "commercial-grade" 这个词唬住——它说的是质量,不是授权。

4. 多人 / 实时 / MIDI 编辑

LeVo 2 仍然以"单主唱 + 伴奏"的单曲为主,

多人合唱、实时生成、MIDI 导出、DAW 插件 这些功能目前都还没有。

对"我想在 Ableton 里逐轨编辑"的专业音乐人来说,

现阶段 LeVo 2 只能算"半成品"。

5. 数据来源与版权

跟所有 AI 音乐模型一样,LeVo 2 的训练数据来源、版权清理情况没有完全公开。如果你的下游应用对版权链条敏感,得自己请法务过一遍。

适合谁 / 不适合谁

09
用 LeVo 2 时容易踩的坑

这些坑不是官方文档里写的,是社区和试用经验里攒出来的。

坑 1:歌词格式错了,模型就"瞎唱"

LeVo 2 对歌词格式极其敏感

必须用结构标签:[verse][chorus][bridge][intro-medium][outro-medium] 等。必须用半角英文标点(.;),不能用中文标点)。中文歌词块末尾不能加句号。英文歌词块末尾必须加句号

写错了?模型会"自创"歌词、用错标点、跳过结构标签。

坑 2:文本描述和参考音频"打架"

README 明确说:"Avoid providing both prompt_audio_path and descriptions at the same time."

同时给音频提示 + 文本描述,且两者风格冲突时,模型会"精神分裂"。

要风格模仿,就别加文字描述;

要文字控制风格,就别传参考音频。

坑 3:参考音频别传太长的

只取前 10 秒。多传了也是截断。建议传副歌部分——节奏和情绪信息最浓的那段。

坑 4:显存不够记得开 low_mem

跑 v2-large 时 OOM(Out of Memory),试试:

sh generate.sh ckpt_path lyrics.jsonl output_path --low_mem

会牺牲一些速度,但能装进 16G 甚至更小的卡。

坑 5:Flash Attention 版本不匹配

如果你的 CUDA / PyTorch / Python 组合跑不起来,

试试加 --not_use_flash_attn 关掉 Flash Attention。

README 里有针对 Python 3.10 + CUDA 12 的预编译 wheel 推荐。

坑 6:想听完整效果,多刷几次种子

AI 生成有随机性。

同样的歌词 + 描述,多刷几次能出明显不同的版本。

挑最好的那首——别一棵树上吊死。

坑 7:商用授权问题

再次强调:当前 LICENSE 限学术研究。要做短视频商用配乐?请选 YuE / DiffRhythm 2 / ACE-Step(都是 Apache 2.0)。等 LeVo 2 后续出商用协议再考虑。

10
硬件与部署:

官方推荐配置

RTF = Real Time Factor,越小越快。0.82 表示生成 1 分钟音频需要 0.82 分钟。显存数字"X/Y":X = 无参考音频,Y = 带 10 秒参考音频。

一键启动

仓库自带 Docker 镜像:

docker pull juhayna/song-generation-levo:hf0613docker run -it --gpus all --network=host juhayna/song-generation-levo:hf0613 /bin/bash

不想装环境?直接去 Hugging Face Space 试 v2-fast,1 分钟以内出歌,但牺牲一点音乐性换速度

实际部署经验

社区和云厂商反馈:

  • • 16G 显存的 RTX 4080 跑 v2-large 需要开 --low_mem
  • • 24G 显存的 RTX 4090 / A5000 跑 v2-large 比较稳
  • • 显存不够时主要瓶颈在 DiT 的扩散过程

几个常见环境问题

  • • Python 版本:建议 3.8.12 以上,3.10 跑 Flash Attention 最稳- CUDA:11.8 起,README 推荐 12.x- 操作系统:Linux 优先,Windows 需要 WSL2- 依赖管理pip install -r requirements.txt + requirements_nodeps.txt --no-deps
11
2026 年的 AI 音乐战场

把 LeVo 2 放回 2026 年的行业里看,三个事实不能忽略。

1. 闭源圈打得越来越激烈

  • • Suno v4.5+(2026-04 升级)支持 8 分钟
  • • Suno v5(2025-09 发布)已经能"几乎无法与人声区分"
  • • Udio 在 2025 年跟环球、索尼、华纳达成和解(不是收购,是法律和解)
  • • Google 的 Lyria 3 Pro 在 2026-03 发布

闭源商业模型还在快速迭代,LeVo 2 想"开源追平",每 3-6 个月得再发一版。

2. 开源圈是另一片红海

  • • 2025-2026 期间,YuE、DiffRhythm 2、HeartMuLa、ACE-Step 密集发布
  • • DiffRhythm 2 论文里承认 "Open-source still falls short of commercial systems overall"
  • • 真正可商用的开源模型(Apache 2.0)目前音质还达不到 Suno 水准
  • • LeVo 2 是"音质第一"的开源模型,但商用授权是软肋

3. 评测标准正在被重写

  • • Tencent AI Lab 提出的 SongBench(11,717 样本 7 维度评测),

是当前最专业的"AI 音乐质量评估"工具之一

  • • 传统指标 PER、CLAP、FAD 已经不够用
  • • 行业正在从"看分数"转向"听专家 + 听大众"双轨评测

(图源:SongBench 评测框架示例)

12
总结:开源音乐 AI 的"分水岭"

LeVo 2(SongGeneration 2)的意义,不在"它比 Suno 强"——它确实还差一点。也不在"它把 Suno 干掉了"——闭源还在进步。

它的意义在"开源模型第一次能在听感上威胁闭源商业模型"

具体地说:

  • • PER 8.55%——比主流闭源商业模型都低
  • • 6 维度专家评测——综合超过所有开源基线
  • • 分层语言模型——架构上解决"音质 vs 和谐"的经典两难
  • • 三阶段后训练——把"音乐性先验"刻进模型
  • • 多语种 + 本地可跑——12G 显存就能玩中型版

它当然也有明显短板:

  • • 协议限学术研究,不能直接商用
  • • 实时生成、多人合唱、MIDI 编辑还没做
  • • 主观评测是 Tencent 自评,第三方要自己跑一遍

给三类读者的建议

  1. 1. 音乐创作者:想免费做 Demo、试新风格、上传到 YouTube?先看 LICENSE 再说。如果只是非商用研究 + 个人玩,可以试试 v2-fast(1 分钟出歌)。如果想商用集成,请选 YuE / DiffRhythm 2。
  2. 2. AI 开发者 / 研究者:这是 2026 年开源 AI 音乐领域最值得读的一篇论文。分层语言模型 + 自动化美学评估 + 三阶段后训练,这套组合拳在很多生成任务上都能借鉴。
  3. 3. 普通爱好者:先去 Hugging Face Space 听几首 demo。如果觉得"哎,还真有点意思",再决定要不要本地跑。

最后一句话:

2026 年的 AI 音乐,已经不是"能不能写歌"的问题,而是"你想听闭源的天花板,还是想自己造一个开源的天花板"。

LeVo 2 至少告诉我们一件事:后者,正在成为可能。

13
参考资料
  • • 论文:https://arxiv.org/html/2606.30642v1
  • • 前作 v1 论文:https://arxiv.org/abs/2506.07520
  • • 项目主页与 demo 试听:https://levo-demo.github.io/levo_v2_demo/
  • • GitHub 主仓库:https://github.com/tencent-ailab/SongGeneration
  • • Hugging Face 集合:https://huggingface.co/collections/lglg666/levo
  • • Hugging Face Space(在线试玩):https://huggingface.co/spaces/tencent/SongGeneration
  • • ModelScope 镜像:https://modelscope.cn/models/AI-ModelScope/SongGeneration
  • • SongBench 评测框架:https://github.com/Tencent/SongBench

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。

猜您喜欢坚持每天更新,让您每天都有新鲜的资源下载

3资源个数(个)
3本月更新(个)
3本周更新(个)
2今日更新(个)