本次Interspeech语音增强方面的论文解读可点击
Interspeech2020滴滴论文解读(一)| 探索基于生成对抗网络的语音增强系统中的损失函数和循环结构的影响查看。

本篇文章将解读滴滴的《Generative Adversarial Network based Acoustic Echo Cancellation》论文。在本篇论文中,滴滴将生成对抗网络应用在回声消除任务中,在线性以及非线性回声场景中均取得良好的回声抑制和较小目标语音失真的结果,且对于训练和测试任务中信号回声比(signal-to-echo-ratio, SER)和房间冲激响应(room impulse response, RIR)不匹配的情况有较好的鲁棒性。并且,在训练中采用多个不同的损失函数可以增加系统在回声消除中的灵活性,即找到合适的回声抑制与目标失真的折中点。

视频链接:
http://www.interspeech2020.org/index.php?m=content&c=index&a=show&catid=348&id=1112

研究背景
回声信号产生于闭合的扬声器与麦克风的声学回路,无论对听感还是识别引擎都有较大干扰。回声消除旨在对回声信号进行抑制的同时,尽可能低的对目标语音产生损伤。回声消除算法主要包含传统的信号处理方法和基于深度学习的模型两大类。传统的信号处理方法通常使用线性自适应滤波和非线性后处理的组合,其中线性自适应滤波针对回声中的线性成分,而非线性后处理用来进一步抑制线性滤波后残余的回声能量。基于深度学习的方法通过大量数据的训练,找到混合信号(即麦克风信号)到目标信号的投射关系,从而得到增强目标信号。

模型
本文针对声音谱图的特性使用卷积循环网络的生成对抗模型,其中生成器的结构如下图所示。生成器的输入为麦克风信号与参考信号的幅度谱,输出则是预测的目标信号的掩模(mask)。判别器的结构与生成器的encoder类似,其输入为增强信号与目标信号,输出为范围[0,1]区间的度量损失分数(metric loss score),本文中使用的指标为perceptual evaluation of speech quality (PESQ)和echo return loss enhancement (ERLE)。

实验
实验中的语音数据来源于TIMIT数据库。从TIMIT数据库的630个说话人中随机选择100对说话人(40对男性/女性,30对男性/男性,和30对女性/女性)作为远端和近端信号源。远端语音和近端语音通过不同的信号比进行混合来产生麦克风信号。3500句混合信号用来作为训练数据,300句混合信号作为测试数据。训练数据的信号回声比为{-6, -3, 0, 3, 6}dB,而测试数据的信号回声比为{0, 3.5, 7} dB。
空间冲激响应(RIR)来自于仿真产生和真实录音。仿真产生的RIR用于产生训练数据,而实录的RIR用来生成测试数据。
此外,实验数据引入了非线性失真。通过对远端语音进行硬截幅(hard clipping)来模拟扬声器饱和(saturation),令远端语音通过sigmoidal函数来模拟扬声器的非线性失真。通过这些数据,来测试模型在非线性回声场景下的性能。


结论
仿真实验结果证明,本文方法在线性与非线性回声环境中均取得良好结果,且对于训练测试不匹配的情况有一定的鲁棒性。另外,通过判别器中不同度量损失的权重配比,可以灵活控制系统的针对性,找到合适的折中点。


