• 盖亚学者科研基金

      Collaborative Research Funds

    • 主题研究计划

      Theme-Based Research Program

    • 国家科技项目

      National Science and Technology Program

    • AI 赋能社会

      AI for Social Good

    • 联合培养计划

      Joint Talent Program

    • 未来精英论坛

      DiDi-IEEE Elite Forum

    • 未来精英实习生计划

      Elite Intern Program

    • 产教融合

      Collaborative Education Programs

  • 关于我们

    About Us

  • 数据集

    Open Dataset

  • 盖亚科研合作项目

    GAIA Research Collaboration

    盖亚学者科研基金

    Collaborative Research Funds

    主题研究计划

    Theme-Based Research Program

    国家科技项目

    National Science and Technology Program

    数据集

    Open Dataset

    AI 赋能社会

    AI for Social Good

  • 雅典娜人才培养计划

    ATHENA Talent Programs

    联合培养计划

    Joint Talent Program

    未来精英论坛

    DiDi-IEEE Elite Forum

    未来精英实习生计划

    Elite Intern Program

    产教融合

    Collaborative Education Programs

  • 关于我们

    About Us

  • 数据集

    Open Dataset

  • 新闻中心

    News center

相关链接

  • 滴滴官网
  • 智能驾驶
  • 智慧交通
  • 人工智能实验室
  • AI开放平台

联系我们

  • 官方邮箱:didioutreach@didiglobal.com
  • 地址:北京市海淀区中关村软件园19号钻石大厦B座
二维码

扫一扫 关注我们

滴滴

© 2012-2026 北京小桔科技集团有限公司增值电信业务经营许可证:京B2-20192416 B1.B2-20160181 广播电视节目制作经营许可证:(京)字第15738号京ICP备12043664号-18京公网安备 11000002002025号

新闻详情

News Detail

当前位置:学术合作 > 新闻中心
2020-12-22 16:02作者:科技生态与发展部标签:科技
微信微博

Interspeech2020滴滴论文解读(二)| 基于生成对抗网络的回声消除


本次Interspeech语音增强方面的论文解读可点击

Interspeech2020滴滴论文解读(一)| 探索基于生成对抗网络的语音增强系统中的损失函数和循环结构的影响查看。




本篇文章将解读滴滴的《Generative Adversarial Network based Acoustic Echo Cancellation》论文。在本篇论文中,滴滴将生成对抗网络应用在回声消除任务中,在线性以及非线性回声场景中均取得良好的回声抑制和较小目标语音失真的结果,且对于训练和测试任务中信号回声比(signal-to-echo-ratio, SER)和房间冲激响应(room impulse response, RIR)不匹配的情况有较好的鲁棒性。并且,在训练中采用多个不同的损失函数可以增加系统在回声消除中的灵活性,即找到合适的回声抑制与目标失真的折中点。




视频链接:

http://www.interspeech2020.org/index.php?m=content&c=index&a=show&catid=348&id=1112




研究背景


回声信号产生于闭合的扬声器与麦克风的声学回路,无论对听感还是识别引擎都有较大干扰。回声消除旨在对回声信号进行抑制的同时,尽可能低的对目标语音产生损伤。回声消除算法主要包含传统的信号处理方法和基于深度学习的模型两大类。传统的信号处理方法通常使用线性自适应滤波和非线性后处理的组合,其中线性自适应滤波针对回声中的线性成分,而非线性后处理用来进一步抑制线性滤波后残余的回声能量。基于深度学习的方法通过大量数据的训练,找到混合信号(即麦克风信号)到目标信号的投射关系,从而得到增强目标信号。




模型


本文针对声音谱图的特性使用卷积循环网络的生成对抗模型,其中生成器的结构如下图所示。生成器的输入为麦克风信号与参考信号的幅度谱,输出则是预测的目标信号的掩模(mask)。判别器的结构与生成器的encoder类似,其输入为增强信号与目标信号,输出为范围[0,1]区间的度量损失分数(metric loss score),本文中使用的指标为perceptual evaluation of speech quality (PESQ)和echo return loss enhancement (ERLE)。




实验


实验中的语音数据来源于TIMIT数据库。从TIMIT数据库的630个说话人中随机选择100对说话人(40对男性/女性,30对男性/男性,和30对女性/女性)作为远端和近端信号源。远端语音和近端语音通过不同的信号比进行混合来产生麦克风信号。3500句混合信号用来作为训练数据,300句混合信号作为测试数据。训练数据的信号回声比为{-6, -3, 0, 3, 6}dB,而测试数据的信号回声比为{0, 3.5, 7} dB。


空间冲激响应(RIR)来自于仿真产生和真实录音。仿真产生的RIR用于产生训练数据,而实录的RIR用来生成测试数据。


此外,实验数据引入了非线性失真。通过对远端语音进行硬截幅(hard clipping)来模拟扬声器饱和(saturation),令远端语音通过sigmoidal函数来模拟扬声器的非线性失真。通过这些数据,来测试模型在非线性回声场景下的性能。





结论


仿真实验结果证明,本文方法在线性与非线性回声环境中均取得良好结果,且对于训练测试不匹配的情况有一定的鲁棒性。另外,通过判别器中不同度量损失的权重配比,可以灵活控制系统的针对性,找到合适的折中点。




    • 盖亚学者科研基金

      Collaborative Research Funds

    • 主题研究计划

      Theme-Based Research Program

    • 国家科技项目

      National Science and Technology Program

    • AI 赋能社会

      AI for Social Good

    • 联合培养计划

      Joint Talent Program

    • 未来精英论坛

      DiDi-IEEE Elite Forum

    • 未来精英实习生计划

      Elite Intern Program

    • 产教融合

      Collaborative Education Programs

  • 关于我们

    About Us

  • 数据集

    Open Dataset

  • 盖亚科研合作项目

    GAIA Research Collaboration

    盖亚学者科研基金

    Collaborative Research Funds

    主题研究计划

    Theme-Based Research Program

    国家科技项目

    National Science and Technology Program

    数据集

    Open Dataset

    AI 赋能社会

    AI for Social Good

  • 雅典娜人才培养计划

    ATHENA Talent Programs

    联合培养计划

    Joint Talent Program

    未来精英论坛

    DiDi-IEEE Elite Forum

    未来精英实习生计划

    Elite Intern Program

    产教融合

    Collaborative Education Programs

  • 关于我们

    About Us

  • 数据集

    Open Dataset

  • 新闻中心

    News center