港科大开源音乐生成模型 YuE2:用可编辑乐谱实现白盒创作

0 阅读

YuE2 是什么

YuE2 是由香港科技大学与 M-A-P(Multimodal Art Projection)团队联合开发并开源的音乐生成模型。它最大的特点是引入了一个“符号规划”中间层——先根据歌词和风格提示生成可读、可编辑的 ABC 乐谱(包含旋律线与和弦进行),再将这份乐谱渲染为带人声与伴奏的 48kHz 完整音频。

这种设计让整个创作流程不再是黑盒“抽卡”,而是像传统作曲一样,有明确的结构可查、可改。用户可以在音频生成前修改旋律走向、调整和声配置,甚至让 AI Agent 围绕乐谱进行对话式编辑。在官方公布的 WildSongBench 基准测试中,YuE2 的 SongBench Avg 得分为 6.9632(best-of-8),超过了 Suno v5、Mureka 9 等主流商业模型。

更重要的是,YuE2 不只是个演示模型。它的代码遵循 Apache 2.0 协议,3.6B 参数的权重已公开在 Hugging Face,支持单卡 24GB 显存的本地离线运行,数据完全不出本机。

核心功能:从创作到编辑的闭环

YuE2 提供了一套完整的音乐生成与操控工具链,覆盖了从灵感输入到成品输出的多个环节。

首先是符号规划创作。用户只需提供一段歌词和风格描述(比如“抒情流行”或“复古爵士”),模型会先输出一份 ABC 格式的乐谱。这份乐谱不仅包含音高与时值,还标注了和弦进行,普通人用文本编辑器就能查看甚至手动调整。确认无误后,系统再将其合成为带人声演唱和乐器伴奏的完整歌曲。

其次是零样本翻唱。这项功能依赖于配套开源的 SheetSage2 模型——它能将任意录音(比如一首原唱 MP3)自动转录为旋律乐谱。有了这份乐谱,YuE2 就可以换新歌词、换风格重新演绎,而无需对翻唱任务做任何专门微调。实测显示,这种方式在 CLEWS mAP 指标上达到 0.647,说明源曲的旋律骨架被较好地保留了下来。

第三是Agent 对话式编辑。团队同步发布了 yue2-music 技能包,可集成到支持 SKILL.md 规范的智能体平台。用户可以用自然语言告诉 Agent:“把副歌的和弦改成小调”“加快第二段的速度”“重复最后一句作为结尾”。Agent 会解析指令、修改 ABC 文件,再调用 YuE2 重新渲染,实现真正的交互式创作。

此外,项目还包含了音频转谱(SheetSage2)和音乐理解(MERT2)两个基础模型。前者负责将声音还原为符号,后者则提供全曲级的语义表征,在 MARBLE 基准的 15 项任务中拿下 14 项 SOTA,为转谱、对齐等下游任务提供支撑。

技术原理:AR–NAR 混合架构与符号中间层

YuE2 的技术核心在于“符号规划”这一中间表示。传统端到端模型直接从文本生成波形,过程不可见;而 YuE2 在文本/音频条件与最终音频之间插入了一层显式的 ABC 乐谱。这层乐谱既是人类可读的“白盒接口”,又是声学生成的结构约束,确保旋律逻辑连贯、和声合理。

为了同时处理符号生成与高质量音频合成,模型采用了一种 AR–NAR 混合专家架构。整个系统基于单一的 Mixture-of-Transformers 骨干,内部包含两类专家:

  • AR(自回归)专家:使用因果注意力机制,按顺序预测乐谱 token 和语义 token。这部分保证了歌词与旋律的时序对齐,以及音乐本身的结构性(比如主歌-副歌的重复模式)。
  • NAR(非自回归)专家:使用双向注意力,对声学 latent 进行 flow matching 预测(分辨率为 25 Hz × 64)。这使得音频细节更丰富、音质更高。

Loomy

两类专家共享混合自注意力层和前馈网络,最终统一在一个 checkpoint 中。这意味着无论是创作、翻唱还是编辑,都使用同一套权重,区别仅在于乐谱的来源不同:自生成、转录而来,或人工/Agent 修改后传入。

音频生成部分采用 VAE 声学管线。NAR 专家输出的 latent 经 VAE 解码器还原为 48kHz 立体声音频,全程避免量化损失。训练时的目标信号由离线模块构建:SheetSage2 提取乐谱目标,MERT2 与 CVQ 生成语义 token 目标,VAE 编码器生成 latent 目标。

使用方式:分阶段 API 与本地部署

YuE2 的推理过程被明确拆分为四个阶段:plan()generate_semantic()synthesize()decode()。每个阶段的中间产物(乐谱、语义 token、声学 latent)都会落盘保存,用户可在任意节点介入。

例如,你可以先运行 plan() 导出 ABC 乐谱,用外部工具修改后再调用后续步骤重新渲染;或者复用已有的 plan,仅更换解码器尝试不同音色。这种设计兼顾了灵活性与实验可复现性。

部署方面,项目要求 Linux 系统、Python 3.12 和一块支持 BF16 的 NVIDIA GPU。安装只需克隆仓库、创建虚拟环境并执行 pip install .。首次运行时,模型权重会自动从 Hugging Face 下载。

快速体验可通过 python examples/generate.py --output outputs/first-song 实现,输出目录会包含 FLAC 音频、ABC 乐谱及所有中间文件。若需编程调用,可使用 YuE2Pipeline.from_pretrained("m-a-p/YuE2-3B") 加载管线,并通过 cot 参数控制模式:

  • "full"(默认):生成完整可编辑乐谱
  • "melody":仅生成旋律线,适用于翻唱场景,让伴奏自由适配新风格
  • "off":跳过规划,直接生成音频(不推荐,失去可控性)

翻唱操作则分两步:先用 SheetSage2 将原曲转为旋律谱,再以 cot="melody" 模式传入新歌词或风格提示重新生成。编辑已有作品时,只需修改导出的 ABC 文件,再通过 --abc-file edited.abc --cot full 重新渲染即可。

性能表现与竞品对比

在 WildSongBench 基准上,YuE2 的 SongBench Avg 达到 6.9632(best-of-8),在 17 个测试设置中排名第一和第四,明显优于 Suno v5.5 的 6.7150。这表明其整体音乐质量已达到甚至超越主流商业系统水平。

不过,细节指标上各有优劣。例如在歌词清晰度方面,YuE2 的发音错误率(PER)为 9.79%(Bo8),高于 Suno 的 5.96%,说明咬字准确性仍有提升空间。文本对齐(MuLan 指标)上,Suno 也略胜一筹(0.5089 vs 0.5051)。

但 YuE2 的优势在于可控性透明度。Suno 等闭源服务只能通过提示词间接控制,修改必须整曲重来;而 YuE2 允许逐音符干预,且所有中间步骤可追溯。翻唱能力更是拉开差距:YuE2 通过显式转谱-重演绎管线实现高保真改编,而 Suno 只能依赖 prompt 引导,旋律保持度不可控。

最关键的是,YuE2 完全开源且可本地运行。用户无需上传歌词或作品到云端,保护创作隐私。相比之下,Suno 作为闭源商业服务,数据托管于厂商服务器,无法满足对隐私或定制有要求的场景。

应用场景:不止于娱乐创作

虽然普通用户可以用 YuE2 快速把歌词变成歌,但它的潜力远不止于此。

个人创作者而言,即使不懂乐理,也能通过修改 ABC 乐谱精细调整旋律走向。比如觉得某句太高唱不上去,可以直接降低几个音;想让副歌更有张力,可以手动加入七和弦。这种“所见即所得”的体验,降低了音乐制作门槛。

二次创作与短视频领域,零样本翻唱功能特别实用。粉丝可以把偶像的歌转成摇滚版,或把中文歌词替换成方言版本,用于 BGM 或混剪。SheetSage2 的转谱准确度足够支撑这类轻量级改编。

对于影视、游戏或广告行业,YuE2 可快速生成带人声或纯伴奏的配乐 Demo。制片方能在前期低成本试听多种风格,确定方向后再投入真人制作,大幅减少沟通成本和返工风险。

音乐教育场景,教师可指定和弦进行(如 I–V–vi–IV)或曲式结构(ABA 形式),让模型生成示例曲目。学生一边听音频,一边对照 ABC 乐谱学习作曲技法,真正实现“听得见、看得见、改得动”的教学闭环。

生态与未来

YuE2 并非孤立模型,而是一个完整生态的一部分。项目同步开源了 SheetSage2(音频转谱)、MERT2(音乐理解)、WildSongBench(评测基准)以及 yue2-music Agent 技能包,覆盖了“转谱→创作→编辑→评测”全链路。

这种端到端的开源策略,为研究者提供了可复现、可扩展的基线系统,也为开发者构建上层应用(如 DAW 插件、在线创作平台)打下了基础。未来,随着社区对 ABC 乐谱编辑工具的完善,以及更多风格模板的积累,YuE2 有望成为开源音乐生成领域的事实标准。

目前,项目官网(https://map-yue2.github.io/)和 GitHub 仓库(https://github.com/multimodal-art-projection/YuE)均已开放,感兴趣的开发者可以立即尝试本地部署,体验这场“白盒化”的音乐创作革命。