Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset
论文提出 SheetSage-A2S 数据集,含 61 小时音频和 9468 个片段(来自 6066 首歌曲)的 **kern 乐谱编码,用于流行音乐音频到乐谱转录。模型使用数据增强和预训练特征提取模型 MuQ,在古典音乐 Quartets 集合上达到 4.98% 符号错误率(SER),优于现有最优的 15.3%;在 SheetSage-A2S 上达到 20.92% SER。数据集、模型和代码已公开。
发展脉络
- 首次出现Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S DatasetarXiv cs.AI
- 当前判断该研究填补了流行音乐 A2S 数据集的空白,可能推动音乐转录工具从古典音乐扩展到流行音乐,影响音乐教育、版权识别和音乐制作领域。但当前 SER 20.92% 仍较高,实际应用需进一步优化。可验证信号:是否有商业公司采用该数据集或模型开发产品。Agent Pulse · 分析
该论文针对音频到乐谱转录(A2S)任务,指出现有系统主要聚焦古典音乐,流行音乐应用未被充分探索。作者发布了 SheetSage-A2S 数据集,包含 61 小时音频、9468 个片段(来自 6066 首歌曲)的 **kern 乐谱编码,是首个支持流行音乐 A2S 研究的数据集。方法上,利用数据增强和预训练音乐音频特征提取模型 MuQ 提升泛化能力。实验结果显示,模型在古典音乐 Quartets 集合上达到 4.98% 的符号错误率(SER),显著优于现有最优方法的 15.3%;在 SheetSage-A2S 流行音乐数据集上达到 20.92% SER,为未来研究提供强基准。数据集、模型和代码已在 GitHub 公开。
该工作表明,预训练音频特征(如 MuQ)结合数据增强能显著提升音频到乐谱转录的准确率,在古典音乐上 SER 从 15.3% 降至 4.98%,降幅约 67%。这提示通用音频预训练模型可迁移到专业音乐信息检索任务。未来可验证的信号:该模型在更多流行音乐子类型(如摇滚、电子)上的表现,以及是否可扩展到多声部或复杂编曲。
该研究填补了流行音乐 A2S 数据集的空白,可能推动音乐转录工具从古典音乐扩展到流行音乐,影响音乐教育、版权识别和音乐制作领域。但当前 SER 20.92% 仍较高,实际应用需进一步优化。可验证信号:是否有商业公司采用该数据集或模型开发产品。
对于音乐科技公司,该数据集和模型可降低流行音乐转录的研发成本,加速产品落地。例如,音乐教育应用可提供实时乐谱生成,版权方可用于内容识别。但需评估模型在真实场景的鲁棒性。
未来,A2S 技术可能集成到音乐制作软件或自动标注工具中,降低人工转录成本。随着数据集和模型开源,社区可复现并改进,推动 SER 进一步下降。可关注该团队后续是否发布更大规模数据集或更高精度模型。