ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

【读论文】2005 一种旋律转录的分类方法A classification approach to melody transcription[C]

【读论文】2005 一种旋律转录的分类方法A classification approach to melody transcription[C] 国标GB/T 7714-2015标准引用格式POLINER G E, ELLIS D P W. A classification approach to melody transcription[C]//Proceedings of the 6th International Conference on Music Information Retrieval (ISMIR 2005). London: Queen Mary, University of London, 2005: 53-59.文章目录一种旋律转录的分类方法摘要1 引言2 系统描述2.1 声学特征2.2 支持向量机2.3 训练数据2.3.1 多轨录音2.3.2 MIDI文件2.3.3 重采样音频3 实验3.1N NN类分类3.2N NN个二元分类器4 讨论与结论致谢参考文献一种旋律转录的分类方法Graham E. Poliner 和 Daniel P.W. EllisLabROSA电子工程系哥伦比亚大学纽约NY 10027美国{graham,dpwe}ee.columbia.edu摘要旋律为多声部音频提供了一种重要的概念性概括。旋律内容的提取具有实际应用价值从基于内容的音频检索到音乐结构分析均涵盖其中。与以往基于音乐音高谐波或周期结构模型的转录系统不同我们提出了一种基于分类的自动旋律转录系统该系统除了从训练数据中学习到的内容之外不做任何额外假设。我们通过预测ISMIR 2004旋律竞赛评估集以及新生成的测试数据中的旋律来评估我们算法的成功率。结果表明支持向量机旋律分类器产生的效果可与当前最先进的基于模型的转录系统相媲美。关键词旋律转录分类1 引言旋律提供了一种简洁且自然的音乐描述方式。即使对于复杂的多声部信号感知上的主旋律也是最方便、最易于记忆的描述并可作为交流和检索的直观基础例如通过哼唱查询。然而要部署基于旋律的大规模音乐组织和检索系统我们需要能够从录制的音乐音频中自动提取旋律的机制。这种转录在音乐学分析和各种潜在的信号变换应用中也具有价值。因此近年来在主旋律检测领域涌现了大量研究Goto2004Eggink和Brown2004Marolt2004Paiva等2004Li和Wang2005。然而以往的方法都依赖于基于规则的分析核心该分析假定特定的音频结构即音乐音高由特定基频的一组谐波实现。这一假设在音乐声学中有坚实的依据但并非严格必要在许多领域如自动语音识别中可以在不了解事件在特征中如何表示的先验知识的情况下为特定事件构建分类器。在本文中我们通过研究一种机器学习系统来生成自动旋律转录从而深入探究这一见解。我们提出的系统仅通过带标签的示例训练就能学会推断正确的旋律标签。我们的算法通过一个直接从音频特征数据训练的支持向量机分类器执行主导旋律音符分类。因此该系统可以轻松推广到学习许多旋律结构或针对特定流派进行专门训练。2 系统描述我们转录系统的基本流程如下首先将输入音频波形转换为某种归一化短时幅度谱的特征表示。一个在真实多乐器录音和合成MIDI音频上训练的支持向量机SVM将每一帧分类为具有特定的主导音高量化到半音级别。下面将更详细地描述这些步骤中的每一步2.1 声学特征原始音乐录音被合并为单声道并降采样到8 k H z 8\mathrm{kHz}8kHz。该波形x [ n ] x[n]x[n]通过短时傅里叶变换STFT进行转换X S T F T [ k , n ] ∑ m 0 N − 1 x [ n − m ] ⋅ w [ m ] ⋅ e − j 2 π k m / N ( 1 ) X_{STFT}[k,n] \sum_{m 0}^{N - 1}x[n - m] \cdot w[m] \cdot e^{-j2\pi km / N} \quad (1)XSTFT​[k,n]m0∑N−1​x[n−m]⋅w[m]⋅e−j2πkm/N(1)使用N 1024 N 1024N1024点离散傅里叶变换即128 ms、一个N NN点汉宁窗w [ n ] w[n]w[n]以及相邻窗口944点重叠得到10 m s 10\mathrm{ms}10ms的时间网格。在大多数情况下仅使用低于2 k H z 2\mathrm{kHz}2kHz的频点即前256个频点。为改善在不同乐器音色上的泛化能力我们还尝试了多种特征归一化方案详见第3节。在所有情况下每个音频帧由一个256维的输入向量表示。2.2 支持向量机带标签的音频特征向量用于训练一个SVM该SVM为系统所区分的每个音符分配一个类别标签。SVM是一种有监督分类系统它利用高维特征空间中的线性函数假设空间来学习与所有训练模式距离最远的分离超平面。因此SVM分类试图推广得到类别之间的最优决策边界。给定空间中的带标签训练数据通过最大间隔超平面进行分离。在N NN类多类判别的情况下从N ( N − 1 ) / 2 N(N - 1) / 2N(N−1)/2个成对判别函数的输出中采取多数投票。为了对每一帧的主旋律音符进行分类我们假设某一时刻的旋律音符仅依赖于低于2 k H z 2\mathrm{kHz}2kHz的归一化频率数据。我们进一步假设每一帧独立于所有其他帧。2.3 训练数据一个有监督分类器需要大量特征向量及其真实标签的配对语料来进行训练。通常更多数量和更多样性的训练数据将产生更准确和更成功的分类器。因此在基于分类的转录方法中最大的问题变成了收集合适的训练数据。尽管与真实音频对齐的数字乐谱数量非常有限但仍有一些方向有助于生成带标签的音频。在本实验中我们研究了多轨录音和MIDI音频文件作为训练数据来源。2.3.1 多轨录音流行音乐录音通常通过叠加多个独立录制的音轨来创建。在某些情况下艺术家或其唱片公司可能会以CD或12 ∘ 12^{\circ}12∘黑胶单曲的形式提供单独的人声和乐器音轨。“清唱”人声录音可以作为完整合奏音乐中真实音高的来源因为它们通常可以使用标准工具进行音高跟踪。只要我们能够记录清唱录音中的哪些时间点对应于完整音乐人声加伴奏中的哪些时间点我们就可以自动提供真实音高。请注意清唱录音仅用于生成真实音高分类器不在孤立人声上进行训练因为我们不期望在那样数据上使用它。我们获得了30组多轨录音涵盖爵士、流行、RB和摇滚等流派。数字录音从CD读取然后降采样为8 k H z 8\mathrm{kHz}8kHz采样率的单声道文件。12 ∘ 12^{\circ}12∘黑胶录音从模拟转换为数字单声道文件采样率为8 k H z 8\mathrm{kHz}8kHz。对于每首歌曲使用YIN基频估计器de Cheveigne和Kawahara2002估计旋律轨道的基频。基频预测以10 m s 10\mathrm{ms}10ms步长计算并限制在100到1000 H z 1000\mathrm{Hz}1000Hz范围内。YIN定义了一个周期性度量P p e r i o d i c i t y P P E R I O D I C P T O T ( 2 ) P_{periodicity} \frac{P_{PERIODIC}}{P_{TOT}} \quad (2)Pperiodicity​PTOT​PPERIODIC​​(2)其中P P E R I O D I C P_{PERIODIC}PPERIODIC​是检测到的周期性的谐波所对应的能量P T O T P_{TOT}PTOT​是一帧的总能量只有周期性至少为95 % 95\%95%对应于清晰的浊音音符的帧才被用作训练样本。为了将清唱录音与完整合奏录音对齐我们沿着Turetsky和Ellis2003中描述的思路对每个信号的STFT表示执行动态时间规整DTW对齐。对该时间对齐进行平滑和线性插值以获得逐帧对应关系。对齐结果经过手动验证和校正以确保训练数据的完整性。通过计算在对应于STFT帧的时刻单音预测最接近的MIDI音符编号来分配目标标签。2.3.2 MIDI文件MIDI介质使用户能够合成音频并同时创建数字乐谱。存在大量MIDI文件集包含来自各种流派的众多演绎版本。我们的MIDI训练数据由从www.findmidis.com下载的30首经常下载的流行歌曲组成。使用Apple iTunes中的MIDI合成器将训练文件从标准MIDI文件格式转换为采样率为8 k H z 8\mathrm{kHz}8kHz的单声道音频文件.WAV。为找到对应的真实音高将MIDI文件解析为包含相关音频信息即轨道、通道号、音符事件等的数据结构。通过利用MIDI中表示主声部的约定来隔离和提取旋律。通常流行MIDI文件中的主声部由独立通道上的单音轨道表示。若主音轨中存在多个同时音符则假定旋律为其中最高的音符。通过在与合成音频分析中每个STFT帧精确对应的时刻对MIDI转录进行采样来确定目标标签。2.3.3 重采样音频当代表性训练集可用性有限时可以通过对录音进行重采样以实现整体音高偏移从而扩展训练数据的数量和多样性。将多轨和MIDI录音以对应于半音阶上对称半音频率偏移即± 1 , 2 , … 6 \pm 1,2,\ldots 6±1,2,…6半音的速率进行重采样。真实标签相应地缩放并进行线性插值以调整时间对齐。这种方法使训练分布更接近高斯分布并减少了训练集中特定调性造成的偏差。3 实验使用WEKA实现的Platt多项式序列最小优化SMOSVM算法将频域音频特征映射到MIDI音符编号类别Witten和Frank2000Platt1998。使用默认学习参数值C 1 \mathrm{C} 1C1epsilon 10 − 12 10^{- 12}10−12容差参数 10 3 10^{3}103来训练分类器。每个音频帧由一个256维输入向量表示对于N NN类分类有60个潜在输出类别覆盖从G2到F#7的五个八度范围对于N NN个二元分类有12个潜在输出类别代表一个八度的半音音阶。我们选择了30个多轨录音和30个具有清晰主导旋律的MIDI文件用于实验对于每个文件随机选择1000个存在主导旋律的帧10秒音频数据作为训练帧。指定10个多轨录音和10个MIDI文件作为测试集并使用ISMIR 2004旋律竞赛测试集作为验证集Gomez等2004。这是2004年夏季进行的首次此类国际主旋律提取评估。评估数据现已发布包含20个片段来自5种风格各4个覆盖广泛的音乐流派每个片段约30秒音频。按照该评估的惯例为了计算准确率我们将每个有音高帧的真实频率量化到最近的半音即其MIDI编号并统计分类器预测不同音符或在某些情况下预测不同半音即容忍八度错误的帧为错误。在本文中我们不涉及检测不包含任何“前景”旋律因此不应转录任何音符的帧的问题。3.1N NN类分类我们使用七种不同的音频特征归一化方案训练了独立的N NN类SVM分类器。三种归一化使用STFT四种使用梅尔频率倒谱系数MFCC。第一种情况下我们直接使用STFT的幅度并归一化使得每首歌曲中能量最大的帧的值为1。第二种情况下STFT幅度在每个时间帧内进行归一化使其在一个51帧的局部频率窗口内达到零均值和单位方差目的是减少训练和测试数据中不同乐器音色和上下文带来的影响。第三种归一化方案对STFT幅度应用立方根压缩使较大的频谱幅度看起来更相似立方根压缩通常用作人耳响度敏感度的近似。第四种特征配置通过计算STFT幅度的逆傅里叶变换IFT得到音频信号的自相关。对对数STFT幅度进行IFT得到倒谱这是我们的第五种特征类型。由于整体增益和宽频谱形状包含在前几个倒谱系数中而周期性出现在更高的索引处该特征也执行了一种音色归一化。我们还尝试了将这些基于自相关的特征按照频谱应用的局部均值和方差均衡进行归一化以及通过滤波对高阶倒谱系数乘以指数权重进行归一化。对于所有归一化方案我们比较了在多轨训练集、MIDI训练集以及两者组合上训练的SVM分类器。一个示例学习曲线基于局部归一化频谱数据如图1所示。分类误差数据通过在训练集的随机选择部分上进行训练用于交叉验证、测试和验证。测试集和验证集的分类误差在大约100秒随机选择的训练音频后趋于渐近。尽管仅在MIDI数据上训练的分类器在ISMIR验证集上泛化良好但MIDI文件内部方差太大导致该分类器在MIDI测试集上泛化较差。图1分类器帧错误率随训练数据量变化的曲线分别在真实录音左和MIDI合成右上训练。训练数据的100 % 100\%100%对应30,000帧或300秒音频。曲线显示了在训练集、测试集以及独立的ISMIR 2004集见正文上的准确率。表1比较了在不同归一化方案上训练的分类器的准确率。我们分别展示了仅在多轨音频、仅在MIDI合成以及两种数据源组合上训练的分类器的结果。帧准确率结果针对ISMIR 2004旋律评估集对应于最近半音的10次转录。基于分类的方法的一个缺点是分类器在与训练数据不相似的测试数据上会表现不可预测而我们方法的一个特别弱点在于故意忽略频谱与音高之间关系的先验知识导致系统无法从已见过的音符泛化到不同音高。例如ISMIR测试集中女声歌剧样本的最高f 0 f_{0}f0​值超过了我们所有训练数据中的最高音高。此外ISMIR集包含的风格流派差异如歌剧与我们的流行音乐语料库不匹配。然而如果期望输出状态映射到一个八度范围内则大量此类错误会减少。忽略八度错误后在ISMIR测试集上的平均有音高帧准确率超过了70 % 70\%70%。表1在ISMIR 2004集上每种考虑的归一化方案在仅多轨音频、仅MIDI合成或两者组合训练下的帧准确率百分比。归一化方案多轨MIDI两者组合STFT54.545.859.051-点归一化52.751.362.7立方根55.147.162.4自相关53.651.959.0倒谱48.544.752.1归一化自相关40.838.544.6提升倒谱53.448.660.3我们额外训练了六个分类器以展示重采样音频对分类成功率的影响。将所有多轨和MIDI文件重采样到正负1到6个半音并使用最佳性能的归一化方案在ISMIR 2004测试集上测试了在这些重采样音频上训练的分类器。图3显示了当重采样训练数据量从± 1 … 6 \pm 1\ldots 6±1…6半音变化时的分类成功率。图3包含经过移调的训练数据版本的影响。当训练数据在所有半音移调最高到± 6 \pm 6±6半音上被复制时原始转录的帧准确率提高了约5 % 5\%5%绝对值而半音八度等价转录的帧准确率提高了约2 % 2\%2%绝对值。包含重采样训练数据将分类准确率提高了超过5 % 5\%5%。在图2中显示了使用重采样音频训练的SVM分类器与2004年评估中20个测试样本的最佳性能系统相比的有音高帧转录成功率其中音高估计已经过时间偏移以最大化转录准确率Paiva等2004。图2在ISMIR 2004评估集的20个片段上转录帧准确率的变化。实线表示基于分类的转录器虚线表示2004年评估中最佳性能系统的结果。上图是原始音高准确率下图将所有结果折叠到一个八度的12个半音箱中以忽略八度错误。3.2N NN个二元分类器除了N NN类旋律分类之外我们训练了12个二元SVM分类器代表西方音阶的一个八度“半音”类。分类器在给定半音的所有出现以及相等数量的随机选择的负例上进行训练。我们将到分类器边界超平面的距离作为这些类别中每个类别的对数后验概率的粗略等价图4显示了一个示例“后验图”展示了这12个不同分类器的激活随时间的变化针对两个示例真实标签叠加在上面。对于上方的简单旋律我们可以看到系统表现良好对于下方的女声歌剧示例我们系统对数据的不熟悉非常明显。图表标题图4“后验图”显示12个分类器在八度不同音符上训练的到分类器边界距离的时间变化。真实标签用点绘制。上图是一个表现良好的简单旋律示例。下图是一个表现较差的女声歌剧片段。4 讨论与结论首先观察表1最明显的结果是除“NormAutoco”外所有特征表现大致相同其中51点跨频率局部均值和方差归一化略占优势。从某种意义上说这并不奇怪因为它们都包含大致等效的信息但这也引发了关于我们的归一化以及系统泛化能力效果如何的问题尽管注意“多轨”和“MIDI”数据之间最大的差异——这在一定程度上是泛化失败的度量——出现在第一行即仅通过全局最大值归一化的STFT特征。可能还存在更好的归一化方案有待发现。观察表中的列我们看到更真实的多轨数据确实比MIDI合成构成更好的训练集后者与大多数评估片段的声学相似度要低得多。同时使用两者从而获得更多样化的训练集总能带来显著的准确率提升——对表现最佳的51点归一化特征而言绝对提升高达10 % 10\%10%。我们可以假设在额外的多样化数据例如歌剧上训练将进一步提高在该评估集上的性能。如图2所示我们基于分类器的系统与2004年评估中最佳性能系统相比具有竞争力且平均略好几个百分点。这一结果还须考虑到该系统中未应用任何后处理。相反性能代表了每个音频帧的原始独立分类的得分。通常从简单的中值滤波到复杂的音乐期望模型各种平滑、清理和离群值去除技术都被用来改进底层声学模型的原始音高估计。这正是我们对图4中所示的多个并行分类器感兴趣的基础。通过将声学模型的结果表示为不同音符上的概率分布该前端可以有效地与基于概率推理的后端集成。特别是我们正在研究从上述大量MIDI文件中提取的旋律中训练可能的音符序列模型。我们进一步对隐藏模式模型感兴趣这些模型可以学习并识别旋律所暗示的局部调性或“模式”等潜在约束并自动将这些约束纳入旋律中就像Ryynanen和Klapuri2004中明确做的那样。我们注意到最差的表现出现在“歌剧”样本上尤其是女声歌剧如前述其中一些音符超出了我们训练集覆盖的范围因此我们的分类器永远无法报告。虽然这突显了基于模型的转录与我们基于示例的分类器相比的优势因为它们直接跨音高泛化但存在一种自然的折中方案通过将我们的训练音频按正负几个半音进行重采样并将这些“移调”版本作为额外训练数据真实标签相应偏移我们可以“教会”我们的分类器即一个简单频谱偏移对应一个音符变化正如基于模型的系统中隐含的那样。同样我们可以问训练后的分类器可能学到哪些基于模型的系统尚未知晓的内容。通过在上下文中训练特定音符的所有示例分类器转录器不仅可以观察到与目标音高对应的频谱或自相关中的显著谐波还可以观察到伴奏中的任何统计规律性例如最可能的伴奏音符。观察图4例如上方面板的最后一个音符尽管实际音符是B但分类器将其与G混淆——可能是因为在许多训练实例中旋律G包含了来自伴奏B的强谐波这在某些情况下可能是一个有用的规律性。的确注意到我们当前的分类器仅用几秒训练材料就似乎饱和了我们可以考虑通过包含更丰富的条件输入来训练更复杂的分类器上面建议的推断“模式”隐藏状态显然是一个竞争者。完整的旋律竞赛不仅涉及确定主旋律活跃帧的音符还涉及区分旋律和非旋律伴奏帧这显然是一个非常困难的问题。然而它非常适合分类器一旦我们有了带标签的真实数据我们可以训练一个单独的分类器或在现有分类器中增加一个新的输出来指示何时检测到背景且不应发出旋律音符不同的特征包括总体能量和不同的归一化方案适用于这个决策。总之我们已经表明这种新颖的旋律转录方法——将所有内容基本留给学习算法并且没有将音乐音高结构的实质性先验知识硬编码——是可行的、具有竞争力的且易于实现。最大的挑战是获取训练数据尽管在我们的配置中所需的数据量并不过多。我们强调这仅仅是一个更完整的音乐转录系统的第一阶段我们旨在每一层都建立在从音乐示例中学习而不是通过编码的专家知识的原则之上。致谢非常感谢Emilia Gomez、Beesuan Ong和Sebastian Streich组织了2004年ISMIR旋律竞赛并提供了结果。本工作得到了哥伦比亚学术质量基金和美国国家科学基金会NSF资助号 IIS-0238301的支持。本文中的任何观点、发现、结论或建议均为作者个人意见并不一定反映NSF的观点。参考文献A. de Cheveigne and H. Kawahara. Yin, a fundamental frequency estimator for speech and music. Journal Acoustic Society of America, 111(4):1917-1930, 2002.J. Eggink and G. J. Brown. Extracting melody lines from complex audio. In Proc. Int. Conf. on Music Info. Retrieval ISMIR-03, pages 84-91, 2004.E. Gomez, B. Ong, and S. Streich. Ismir 2004 melody extraction competition contest definition page, 2004. http://ismir2004.ismir.net/melody_contest/results.html.M. Goto. A predominant-f0 estimation method for polyphonic musical audio signals. In 18th International Congress on Acoustics, pages 1085-1088, 2004.Y. Li and D. Wang. Detecting pitch of singing voice in polyphonic audio. In IEEE International Conference on Acoustics, Speech, and Signal Processing, pages III.17-21, 2005.M. Marolt. On finding melodic lines in audio recordings. In DAFx, 2004.R. P. Paiva, T. Mendes, and A. Cardoso. A methodology for detection of melody in polyphonic music signals. In 116th AES Convention, 2004.J. Platt. Fast training of support vector machines using sequential minimal optimization. In B. Scholkopf, C. J. C. Burges, and A. J. Smola, editors, Advances in Kernel Methods - Support Vector Learning, pages 185-208. MIT Press, Cambridge, MA, 1998.M. P. Ryynanen and A. P. Klapuri. Modelling of note events for singing transcription. In Proc. ISCA Tutorial and Research Workshop on Statistical and Perceptual Audio Processing, Jeju, Korea, October 2004. URL http://www.cs.tut.fi/~mryynane/mryynane_final_sapa04.pdf.R. J. Turetsky and D. P. Ellis. Ground-truth transcriptions of real music from force-aligned midi syntheses. In Proc. Int. Conf. on Music Info. Retrieval ISMIR-03, 2003.I. H. Witten and E. Frank. Data Mining: Practical machine learning tools with Java implementations. Morgan Kaufmann, San Francisco, CA, USA, 2000. ISBN 1-55860-552-5.
返回列表