本篇文章将解读滴滴的《On Loss Functions and Recurrency Training for GAN-based Speech Enhancement Systems》论文。在本篇论文中,滴滴在提出一个全新的卷积循环对抗网络(CRGAN)的同时,也探索了不同损失函数、引入对抗机制以及引入循环层对语音增强系统所带来的提升。此外,在与之前的语音增强对抗网络进行对比的同时,滴滴团队也对CRGAN和传统基于RNN的语音增强系统进行了性能的对比。


论文地址: https://arxiv.org/abs/2007.14974
视频链接:http://www.interspeech2020.org/index.php?m=content&c=index&a=show&catid=335&id=974

研究背景
语音增强是一个非常具有挑战同时又拥有广泛应用场景的一个问题。语音增强的主要目的是增强目标说话人的语音信号同时抑制干扰人或干扰噪音以达到增强的效果。目前语音增强的主要方法包括:(1)基于全连接网络(DNN)的掩码预测(包括IRM, cIRM等),(2)基于循环递归网络(RNN)的掩码预测。在最近的几年时间,也发展了许多基于对抗神经网络(GAN)的语音增强系统。但是这些对抗网络往往都使用了不同的网络结构,也采用了不同的损失函数,同时这些系统也没有与传统的非对抗网络进行对比。这样一来,不同结构,不同损失函数以及引入对抗机制是否能对语音增强带来提升,能带来多少提升也成为了一个未解的问题。
模型

本文提出的卷积循环对抗网络模型。包括了生成器(Generator)模块和判别器(Discriminator)模块。生成器由2维卷积层(2D-Conv)和双向LSTM(BiLSTM)层构成。判别器则由2维卷积层和全连接层构成。
网络配置:
生成器输入:
含噪的对数幅度谱(Noisy log-magnitude spectrogram)生成器输出:
经过卷积以及循环层后,生成器输出预测的相位感知掩码(Phase-sensitive Mask, PSM)判别器输入:
取决于损失函数,输入可以是单个掩码(由生成器输出),或者是掩码对(生成器预测的增强掩码和目标掩码)判别器输出:
一个标量(由linear层输出)和其对应的概率(sigmoid层输出)损失函数(详情请参考论文):
(1)Wasserstein loss (W-CRGAN),(2)Relativistic/Relativistic average loss (R/Ra-CRGAN),(3)Metric loss (M-CRGAN)
实验
论文使用了之前语音增强对抗网络所广泛使用的数据集(详情见论文)。包括30位英文说话人,其中训练集(11572段语音)包括了28位(14位女性)说话人,测试机则涵盖了剩余的2位说话人。在训练集中总共由10种不同的噪音,信噪比的范围在0到15分贝之间。测试集(824段语音)中的信噪比则分布在2.5到17.5分贝之间。
实验结果如下所示,其中CRN-MSE代表的是使用均方差(MSE)作为损失函数的卷积循环网络(非对抗网络)。

结论
实验结果表明,我们所提出的CRGAN模型在使用相同的损失函数的情况下,相比过去的语音增强对抗神经网络取得了更优的表现(对比R-CRGAN和RSGAN)。同时我们也发现引入 对抗机制对系统的表现也有所提升(对比M-CRGAN和CRN-MSE)。另外,循环层在我们所提出的CRGAN模型中也至关重要(对比M-CRGAN和M-CGAN),直接影响到系统最终的表现。最后,在我们探索的损失函数中,Metric loss表现会优于其他的损失函数,额外再引入MSE loss则可以进一步提升系统的表现。


