当AI学会“听“懂整首乐队合奏

当AI学会“听“懂整首乐队合奏
这项由法国人工智能实验室Kyutai、初创公司Mirelo AI与法国国家科学研究中心附属机构IRCAM-CNRS索邦大学联合开展的研究于2026年7月以预印本论文形式发布论文编号为arXiv:2607.08168v1感兴趣的读者可通过该编号在arXiv平台查阅完整原文。**一首歌里藏着多少层声音**当你戴上耳机听一首喜欢的摇滚乐你的耳朵会同时接收到电吉他的嘶吼、贝斯的低鸣、架子鼓的爆发以及主唱的嗓音。人类的大脑经过多年训练能轻而易举地把这些声音分开来欣赏。但对于一台计算机来说这简直像是同时看懂一百个人在同一张纸上写的字——每个人的笔迹叠在一起没有橡皮没有颜色区分只有一团混沌的墨迹。自动音乐转录Automatic Music Transcription简称AMT正是要解决这个难题让计算机把一段音频录音翻译成乐谱或MIDI格式就像把语音识别成文字一样。MIDI可以理解为一种数字乐谱格式它记录了每个音符的音高、开始时间和持续时长钢琴曲、吉他独奏、交响乐都可以用MIDI来描述。有了准确的MIDI转录音乐人就能轻松扒谱练习音乐学者可以分析歌曲结构甚至AI作曲系统也能以此为素材进行学习创作。然而现实很骨感。现有的技术在处理单件乐器录音时还算凑合比如纯钢琴独奏或纯吉他演奏。一旦面对真实的流行歌曲或摇滚专辑——多种乐器同时发声、电吉他带着失真效果、混音经过专业处理——这些系统就开始抓瞎输出的结果错误百出根本不具备实用价值。这支来自欧洲的研究团队正是为了突破这道瓶颈而集结。他们推出了一个名为MuScriptor的开放权重多乐器音乐转录模型并把模型权重和推理代码完整公开在GitHub上任何人都可以免费使用。这在多乐器音乐转录领域可以说是头一次有如此实用且开放的成果。**一、这条路前人是怎么走的又卡在哪里了**音乐转录技术的演进走过了一段从专科医生到全科医生的漫长旅程。早期的研究者针对每种乐器单独开发算法用的是隐马尔可夫模型、非负矩阵分解、支持向量机这些经典统计工具——这些方法就像是专门为某一种病症设计的特效药换个症状就完全不管用了。随着深度学习的崛起研究者开始尝试用卷积神经网络和循环神经网络来判断每个时间点上哪些音符在响。其中一个颇具代表性的框架叫做Onsets and Frames它把每个音符的起始点和持续时段当作两个相互关联的任务来处理效果比之前好了不少。但这类方法本质上还是在操作一张巨大的钢琴卷——把时间和音高画成一张二维网格然后在每个格子里标记是否有音符。这张网格在面对多种乐器时会变得极为庞大而稀疏计算起来非常消耗资源。更新的思路是把音乐转录做成一个语言翻译任务。具体来说模型不再逐格判断而是像写句子一样按顺序输出一串离散的音符事件——某个时刻某种乐器奏出了某个音高持续了多少时间。这种方式更灵活也更接近人类记谱的方式。谷歌的研究团队2022年提出的MT3框架就是这个方向的重要里程碑它使用编码器-解码器Transformer架构把音频频谱图转换成MIDI事件序列并且支持多种乐器的同时转录。MT3之后学界又陆续提出了改进版本比如YourMT3它用一个在时频域操作的层级注意力Transformer替换了标准编码器还引入了专家混合层Mixture of Experts和跨数据集的音轨增强技术。再往后MIROS进一步把频谱图编码器换成了MusicFM这一自监督音频基础模型。然而这些模型都面临同一个致命伤它们严重依赖合成数据来训练也就是把MIDI文件用软件弹奏出来的音频而非真实的录音棚产品。合成音频和真实音乐之间存在巨大的域差异——真实录音里有专业的混音、效果处理、乐手的演奏风格这些都是合成音频模拟不来的。结果就是模型在合成测试集上表现不错一遇到真实歌曲就原形毕露转录结果几乎无法实际使用。**二、MuScriptor的核心思路让模型见过世面**MuScriptor的团队没有在模型结构上大搞花样而是把重心放在了数据和训练策略上。他们的核心判断是模型表现差根本原因不是架构不够聪明而是从来没见过足够多的真实音乐。为此他们在三个层面上构建了训练体系就像培养一个音乐人先打基础再精专业最后打磨细节。首先是合成数据的预训练阶段。团队收集了约145万首MIDI文件来源涵盖公开数据集如Lakh MIDI和商业数据提供商风格以流行和西方古典音乐为主。为了让这批数据更有用他们开发了一套实时合成流水线每次从MIDI库中随机选取片段对音符进行随机升降调、变换节奏、调整力度即音符的轻重然后随机替换乐器音色再用250多种不同的音色库soundfont把它合成为音频最后还会对合成出的音频做随机的微调音处理。这意味着同一段MIDI可以被合成成无数种听起来不同的音频大大丰富了模型接触到的声音多样性。这个合成数据集被称为DSynth。然后是真实音乐数据的微调阶段。这是MuScriptor最核心、也最难复现的资产他们收集了17万首真实音乐录音总时长超过1.1万小时涵盖从古典到重金属的几乎所有主流音乐风格并且每首都配有对齐的音符标注。这批数据绝大多数来自音频-乐谱同步技术——用算法把已有的MIDI/乐谱和对应的录音精确对齐从而自动生成标注。对齐过程中使用了基于色度特征和起始点特征的动态时间规整算法并通过设定时间扭曲阈值来过滤掉对齐质量差的样本。这个真实数据集被称为DReal。从DReal的乐器分布来看声学钢琴最多出现在约51%的曲目里其次是失真电吉他约47%、电贝斯约43%、鼓约32%、原声吉他约24%。总共有33种不同乐器类别而且有17种乐器出现在至少5%的曲目中说明数据集的乐器多样性相当丰富。最后是强化学习的后训练阶段。团队从DReal中人工筛选出300首标注质量特别高的曲目组成一个小型精品数据集DRL用于进一步打磨模型这个过程将在后面详细介绍。**三、模型的内部结构一个只听不回头的翻译家**MuScriptor使用的是纯解码器Transformer架构也就是说它只有解码器部分没有单独的编码器。这种架构已经在语言模型领域被证明非常有效MuScriptor把它迁移到了音乐转录任务上。模型的输入是两样东西一段5秒钟的音频片段对应的梅尔频谱图以及一份可选的乐器列表。梅尔频谱图可以理解为一张把时间和频率可视化的热力图横轴是时间纵轴是音高频率颜色深浅代表响度——人耳感知音高的方式本身就是非线性的梅尔尺度正好模拟了这个特点。具体来说音频先被转换成16kHz单声道然后用2048点的短时傅里叶变换、160个采样点的帧移对应100Hz的帧率、以及512个梅尔滤波器来计算频谱图。乐器列表的作用是告诉模型这首曲子里有哪些乐器从而帮助模型更有针对性地转录避免把低音提琴误认成大提琴或者对着纯人声歌曲硬生生找出根本不存在的钢琴音符。这里的乐器信息是整首曲子层面的而不是针对某个5秒片段的——这意味着即使某段5秒内某种乐器暂时没在响它仍然可能出现在乐器列表里。在模型内部梅尔频谱图被投影到Transformer的隐藏维度然后和各乐器类别的嵌入向量通过一个可学习的查找表获得拼接在一起作为前缀条件输入给Transformer。模型输出的是一串离散的音符事件词元token遵循与MT3相似的编码方案但把128种MIDI乐器映射到了36个乐器子组这套分类体系来自YourMT3提出的MT3_FULL_PLUS分类法。团队提供了四种不同规模的模型6000万、1亿、3亿和13亿参数参数量的差异主要来自注意力头数量、层数和隐藏维度的不同。训练时使用了100万个步骤批量大小64AdamW优化器动量参数β10.9β20.95学习率1e-4配合2000步线性预热和余弦衰减调度。为了让模型在有无乐器条件时都能工作训练时每个条件信号以0.2的概率独立随机丢弃这就是条件丢弃训练策略。推理时模型用贪心解码argmax逐步生成音符序列同时应用一种叫做无分类器引导Classifier-Free GuidanceCFG的技术引导强度αCFG2。这个技术原本流行于图像生成领域原理是同时做两次前向传播——一次带条件一次不带条件——然后把两个结果的差值按比例放大让模型更坚定地往有条件指导的方向生成从而提升转录的准确度和一致性。**四、强化学习用奖惩机制打磨细节**训练完成的模型已经比以往任何多乐器转录模型都要强但团队没有止步于此。他们借鉴了近年来在大语言模型对齐领域大放异彩的强化学习技术把它用在了音乐转录上——据他们所知这是这个领域的首次尝试。具体方法融合了两种算法思想REINFORCE算法一种经典的策略梯度强化学习方法和GRPOGroup Relative Policy Optimization来自DeepSeekMath论文的组相对策略优化方法中的组内相对优势归一化思想。操作流程是这样的在每个训练步骤把模型切换到评估模式针对同一段5秒音频用温度τ0.75进行随机采样生成G8个独立的转录结果。然后把这8个结果分别和真实标注的MIDI进行比对计算出一个奖励分数这个分数是三种F1指标的加总音符起始点F1、帧级F1和音符结束点F1。接下来对这8个奖励分数做组内标准化计算出每个结果相对于组内均值的优势——比均值好的结果获得正优势比均值差的获得负优势。最后把模型切回训练模式用REINFORCE目标函数更新参数对于优势为正的生成序列增大其出现概率对于优势为负的降低其概率。与完整版GRPO相比这里省去了重要性采样比率裁剪和相对于冻结参考策略的KL散度惩罚项实现更为简洁。批量大小为8。从实际效果来看这个强化学习后训练阶段带来了相当显著的提升以13亿参数模型为例所有评估指标都有明显改善音符起始点F1从52.5提升到60.4帧级F1从69.4提升到73.3音符结束点F1从42.0提升到49.0。从图1的钢琴卷展示来看定性上也能感受到变化——强化学习后的模型漏检绿色标记减少了预测的音符起始时间也更准确了。**五、评估标准怎么衡量一个转录结果好不好**研究团队使用了五种评估指标全部来自音乐信息检索领域的标准工具库mir_eval。最基础的是音符起始点F1Onset F1只要预测的音符音高正确且起始时间与真实值相差不超过50毫秒就算命中。50毫秒大约是人耳能感知到的最小时间差这个标准已经相当严格了。音符结束点F1Offset F1则在起始点F1的基础上更进一步除了起始时间要准预测的音符结束时间也必须落在真实值的50毫秒或20%时值范围内取较大者这样才算命中。这个指标更能反映模型对音符时值的理解对弦乐这类有延音效果的乐器尤其重要。帧级F1Frame F1则不那么在意精确时刻而是把时间轴切成62.5毫秒的小格看每个格子里预测的哪些音在响是否和真实情况吻合。直觉上这对应了两张钢琴卷的重叠程度对时间精度要求相对宽松。鼓起始点F1Drums Onset F1单独统计鼓的起始点F1因为鼓击打是瞬发的没有持续音只有起始点有意义。最严苛的是多乐器F1Multi F1在音符结束点F1的基础上还要求预测的乐器类别也正确——就算音符的时间完全准确如果你把小提琴当成了中提琴也不算命中。这个指标最接近实际应用中对转录质量的要求。测试数据集DTest由372首从DReal中精挑细选、具有高质量标注的曲目组成且已从训练集中移除同时还过滤掉了标题与测试集相似的训练曲目以保证评估的公正性。此外由于该模型的编码方案不允许同一乐器同时有两个相同音高的音符叠加评估前会从DTest中删除这类重叠音符中较短的那个这样理想的模型理论上可以达到满分1.0。**六、实验结果每一步训练都有多少提升**最直观的对比来自表1。最强基线模型YourMT3的多乐器F1为21.9帧级F1为45.54起始点F1为32.52。仅在合成数据DSynth上训练的MuScriptor13亿参数帧级F1已经能达到51.3开CFG后为48.9但起始点F134.5和多乐器F116.2还比较一般说明模型会感知到音频里有音在响但精确定位和乐器区分做得还不够好。加入真实数据DReal微调后情况发生了质的飞跃起始点F1跃升至54.4帧级F1升至69.3音符结束点F1从16.1跃至42.3多乐器F1从16.2跃至41.6。几乎所有指标都提升了约20个百分点这充分说明真实数据对于模型性能的关键作用光靠合成数据是不够的。再经过强化学习后训练后模型进一步提升起始点F1 60.4帧级F1 73.3音符结束点F1 49.0鼓起始点F1 50.2多乐器F1 48.2。这是目前公开模型中在多乐器音乐转录任务上最强的表现。从合成数据预训练的价值分析来看图4研究团队系统比较了不同比例的真实数据加入时有无合成数据预训练的差异。结论很有规律当真实数据极少时比如只用1%的DReal合成数据预训练的价值极其显著——仅用1%真实数据、有合成预训练的模型音符结束点F1能达到33.4而没有预训练的仅有9.9随着真实数据越来越多两者差距逐渐缩小但即便用满100%的真实数据有预训练的模型42.3仍略优于没有预训练的41.0。这说明合成预训练可以在数据稀少时显著降低对真实数据的依赖同时即便真实数据充足时也能带来边际收益。**七、乐器条件控制和模型规模对结果的影响**关于乐器条件控制团队在表3中做了专项对比仅在真实数据上训练的模型不提供乐器条件时多乐器F1为38.7提供正确乐器列表后提升至40.5。虽然看起来提升幅度不大但在实际使用中意义重大——它能让模型在同一首歌的不同片段之间保持一致的乐器判断避免前几秒认为是钢琴后几秒又认为是电钢琴这种不稳定现象也让用户能够自定义只转录某几种乐器。关于模型规模表4展示了从6000万到13亿参数四个规模的对比均仅在DReal上训练αCFG2。最小的6000万参数模型帧级F1已经达到65.713亿参数最大版本为68.7差距并不悬殊。这意味着即便是资源受限的用户使用小模型也能获得相当实用的结果。关于音频表示的选择表5比较了梅尔频谱图、常数Q变换幅度谱CQT、Encodec神经音频编解码器特征和MERT音乐理解嵌入四种输入方式的效果均用300M模型、仅DReal训练。梅尔频谱图表现最佳多乐器F1 39.7CQT稍差38.2MERT更差36.8Encodec最差28.9。有趣的是神经网络学习出的表示MERT、Encodec反而不如直接反映物理信号特性的传统频谱图这提示在音乐转录任务中贴近原始信号物理特性的表示可能更有利于模型捕捉精确的时频信息。在与其他公开数据集的比较中表2MuScriptor在多个数据集上都展示了相对于YourMT3的优势尤其在帧级F1方面提升明显比如Dagstuhl ChoirSet合唱数据集帧级F1从51.0提升到80.7PHENICX-Anechoic管弦乐录音从58.9提升到74.6RWC-P流行音乐从51.6提升到61.2。不过起始点和结束点分数的提升因数据集而异合唱这类音乐本身音符边界就比较模糊即便是人工标注也很难做到精确这反映在指标上就是起始点和结束点F1偏低。值得一提的是重叠音符问题的分析第4.2.3节如果不过滤掉DTest中同乐器同音高的重叠短音符13亿参数模型的起始点F1会从60.4下降至51.8结束点F1从49.0降至41.9多乐器F1从48.2降至42.0。这说明同一乐器同时奏出相同音高两个音的情况在真实音乐中确实存在而当前的编码方案无法处理这种情形。解决这一问题需要设计新的音符编码方案是未来改进的方向之一。**说到底这件事意味着什么**归根结底MuScriptor做到了一件之前没人做到过的事把一个对真实世界多乐器音乐实际有用的转录系统以开放的方式交到了所有人手中。对于音乐人来说这意味着扒谱这件事可能会发生根本性变化。以前要花几个小时一个音一个音地把喜欢的歌曲手动记下来现在也许几分钟内就能得到一份虽不完美但可以作为起点的参考乐谱再在此基础上校对修改效率会大幅提升。对于音乐信息检索研究者来说有了可靠的多乐器转录和弦识别、调性分析、曲式分析等下游任务都会受益。对于生成式AI音乐系统来说高质量的MIDI数据是训练的养料MuScriptor提供了一个更高效的途径来从海量录音中提炼这些养料。当然这个系统还不完美。它还不能处理同一乐器同时弹奏相同音高两个音的情况。它处理的片段长度只有5秒推理速度因此还有提升空间。它的乐器词汇表也还有扩展余地。团队在结论部分也坦诚地指出了这些局限并把它们列为未来工作的方向。这项研究最有趣的启示或许是一个领域的突破有时候不是来自架构的奇思妙想而是来自脚踏实地地去收集那17万首真实的歌曲并想清楚怎么用它们来训练。有兴趣深入了解MuScriptor的读者可以通过arXiv:2607.08168在arXiv平台查阅完整论文也可以直接访问GitHub上的muscriptor/muscriptor仓库获取代码和模型权重。QAQ1MuScriptor和以前的多乐器音乐转录模型相比最大的区别是什么A最大的区别在于训练数据的类型。以前的模型比如MT3、YourMT3主要依赖把MIDI用软件合成的音频来训练这类合成音频和真实录音有很大差距导致模型在真实歌曲上效果很差。MuScriptor则收集了17万首真实音乐录音共1.1万小时并配合对齐的音符标注来微调模型让模型真正见过带有专业混音和效果处理的真实音乐因此在实际应用中效果大幅超越前代模型。Q2MuScriptor的强化学习是怎么用在音乐转录上的A针对同一段5秒音频让模型随机生成8个不同的转录结果然后把每个结果和真实标注做比对计算奖励分数三种F1指标之和。再对这8个分数做组内标准化比平均分高的获得正奖励低的获得负奖励最后据此更新模型参数让好的生成方式概率增大、差的方式概率减小从而让模型向更准确的转录方向进化。Q3MuScriptor的乐器条件控制功能是怎么用的A用户可以在使用MuScriptor时提供一份这首曲子里有哪些乐器的列表作为输入条件。模型会根据这份列表来调整转录只关注被指定的乐器同时在整首歌的不同片段之间保持乐器判断的一致性避免同一首歌前后段落乐器识别不稳定的问题。如果不提供乐器列表模型也能独立工作只是准确率略低一些。