流行音乐音频转乐谱:SheetSage-A2S 语料库、MuQ 增强与特征

20 九月 202625 视图

作者提出了 SheetSage-A2S——包含 61 小时音频录音,按 **kern 标记法划分为 9,468 个片段,来自 6,066 首歌曲,聚焦于流行曲目。数据增强与预训练音乐特征提取模型 MuQ 的结合将经典 Quartets 合集上的符号错误率降至 4.98%,并在新语料库上达到 20.92%,为后续研究设定了基线水平。

流行音乐音频转乐谱:SheetSage-A2S 语料库、MuQ 增强与特征

音频转乐谱与流行音乐的地位

Audio-to-score(A2S)将音频录音转换为乐谱文本。现有的 A2S 系统主要面向古典音乐。将其应用于流行音乐的研究仍然不足。此类系统中的乐谱以符号编码表示,包括 **kern 格式。

从事这一方向研究的有 Eoin Cummins、Zhongyi Huang、Alexandre D'Hooge、Zhuoru Mo 和 Yaolong Ju。预印本 v1 于 2026 年 8 月 6 日发布,v3 版本于 2026 年 8 月 25 日发布。该工作被第 34 届 ACM International Conference on Multimedia(MM '26)接收。

选择标准:工具所声称适用的曲目类型。古典音乐和流行音乐依赖不同的数据集和不同的基线结果。

SheetSage-A2S 语料库:构成与用途

该数据集为流行音乐上的 A2S 而创建。其构成:

  • 61 小时音频;
  • 9 468 个片段;
  • 6 066 首独特歌曲;
  • 以 **kern 编码表示的乐谱。

作者称该语料库是流行音乐 A2S 领域的首个此类数据集。数据、模型和代码均已公开。在该数据集上的结果为此后的工作设定了基准。

实用标准:该数据集适合作为比较流行音乐 A2S 模型时的参照点。对于古典曲目,则使用其他数据集,例如 Quartets。

数据增强:它改变了训练中的什么

数据增强通过变换已有样本来扩充训练集。作者将其与预训练的 MuQ 特征结合使用。目标是提升模型的泛化能力。

摘要中并未列出具体的变换类型及其参数。已知作者将数据增强与预训练特征的结合与泛化能力的提升相关联。这两种方法在同一训练方案中协同工作。

标准:在分析他人的流程时,有必要确认数据增强是否包含在训练中。作者将其与模型的泛化能力相关联。

预训练特征 MuQ

MuQ 是一个用于音乐音频的预训练特征提取模型。它已在音乐上训练过,因此 A2S 模型可以获得现成的音频表示。作者使用此类特征来提取音频的重要特征。

这为 A2S 系统带来什么:

  • 特征由单独的预训练模型提取;
  • A2S 模型使用现成的音频表示。

实用标准:预训练音乐特征适用于在 A2S 流程内部训练特征提取没有意义的情况。作者展示了这种方法带来的结果提升。

SER 指标与模型结果

SER(symbol error rate,符号错误率)是乐谱中符号的错误比例。评估在两个数据集上进行:古典音乐的 Quartets 和流行音乐的 SheetSage-A2S。

数据集音乐类型所提模型的 SER对比
Quartets古典4.98 %此前 state-of-the-art 的 SER 为 15.3 %(Alfaro-Contreras et al., 2024)
SheetSage-A2S流行20.92 %数据集为新增,结果作为未来工作的基准

在古典音乐上,该模型将 SER 从此前 state-of-the-art 的 15.3 % 降至 4.98 %。对于流行音乐,作者记录了 20.92 % 的 SER。这些数值是在不同数据集上获得的,因此各行之间的直接比较并不恰当。

标准:仅在同一个数据集和同一音乐类型内比较 SER。

这对选择工具意味着什么

该工作填补了两个空白:为流行音乐提供了公开语料库,并展示了结合数据增强与 MuQ 特征的训练方案。在古典音乐上,结果明显优于此前的 state-of-the-art。

实用参考:

  • 考虑模型是在什么材料上训练和验证的;
  • 检查数据和代码的可用性——在这项工作中它们是公开的;
  • 阅读 SER 时要结合数据集名称,而非孤立看待。

材料:预印本 arXiv:2608.06165,DOI 10.48550/arXiv.2608.06165。会议版本:DOI 10.1145/3767308.3835653。

常问问题

流行音乐音频转乐谱:SheetSage-A2S 语料库、MuQ 增强与特征