• 盖亚学者科研基金

      Collaborative Research Funds

    • 主题研究计划

      Theme-Based Research Program

    • 国家科技项目

      National Science and Technology Program

    • AI 赋能社会

      AI for Social Good

    • 联合培养计划

      Joint Talent Program

    • 未来精英论坛

      DiDi-IEEE Elite Forum

    • 未来精英实习生计划

      Elite Intern Program

    • 产教融合

      Collaborative Education Programs

  • 关于我们

    About Us

  • 数据集

    Open Dataset

  • 盖亚科研合作项目

    GAIA Research Collaboration

    盖亚学者科研基金

    Collaborative Research Funds

    主题研究计划

    Theme-Based Research Program

    国家科技项目

    National Science and Technology Program

    数据集

    Open Dataset

    AI 赋能社会

    AI for Social Good

  • 雅典娜人才培养计划

    ATHENA Talent Programs

    联合培养计划

    Joint Talent Program

    未来精英论坛

    DiDi-IEEE Elite Forum

    未来精英实习生计划

    Elite Intern Program

    产教融合

    Collaborative Education Programs

  • 关于我们

    About Us

  • 数据集

    Open Dataset

  • 新闻中心

    News center

相关链接

  • 滴滴官网
  • 智能驾驶
  • 智慧交通
  • 人工智能实验室
  • AI开放平台

联系我们

  • 官方邮箱:didioutreach@didiglobal.com
  • 地址:北京市海淀区中关村软件园19号钻石大厦B座
二维码

扫一扫 关注我们

滴滴

© 2012-2026 北京小桔科技集团有限公司增值电信业务经营许可证:京B2-20192416 B1.B2-20160181 广播电视节目制作经营许可证:(京)字第15738号京ICP备12043664号-18京公网安备 11000002002025号

新闻详情

News Detail

当前位置:学术合作 > 新闻中心
2020-12-21 15:27作者:科技生态与发展部标签:科技
微信微博

Interspeech2020滴滴论文解读(一)| 探索基于生成对抗网络的语音增强系统中的损失函数和循环结构的影响

本篇文章将解读滴滴的《On Loss Functions and Recurrency Training for GAN-based Speech Enhancement Systems》论文。在本篇论文中,滴滴在提出一个全新的卷积循环对抗网络(CRGAN)的同时,也探索了不同损失函数、引入对抗机制以及引入循环层对语音增强系统所带来的提升。此外,在与之前的语音增强对抗网络进行对比的同时,滴滴团队也对CRGAN和传统基于RNN的语音增强系统进行了性能的对比。




论文地址: https://arxiv.org/abs/2007.14974

视频链接:http://www.interspeech2020.org/index.php?m=content&c=index&a=show&catid=335&id=974


研究背景

语音增强是一个非常具有挑战同时又拥有广泛应用场景的一个问题。语音增强的主要目的是增强目标说话人的语音信号同时抑制干扰人或干扰噪音以达到增强的效果。目前语音增强的主要方法包括:(1)基于全连接网络(DNN)的掩码预测(包括IRM, cIRM等),(2)基于循环递归网络(RNN)的掩码预测。在最近的几年时间,也发展了许多基于对抗神经网络(GAN)的语音增强系统。但是这些对抗网络往往都使用了不同的网络结构,也采用了不同的损失函数,同时这些系统也没有与传统的非对抗网络进行对比。这样一来,不同结构,不同损失函数以及引入对抗机制是否能对语音增强带来提升,能带来多少提升也成为了一个未解的问题。


模型


本文提出的卷积循环对抗网络模型。包括了生成器(Generator)模块和判别器(Discriminator)模块。生成器由2维卷积层(2D-Conv)和双向LSTM(BiLSTM)层构成。判别器则由2维卷积层和全连接层构成。


网络配置:


  • 生成器输入:
    含噪的对数幅度谱(Noisy log-magnitude spectrogram)

  • 生成器输出:
    经过卷积以及循环层后,生成器输出预测的相位感知掩码(Phase-sensitive Mask, PSM)

  • 判别器输入:
    取决于损失函数,输入可以是单个掩码(由生成器输出),或者是掩码对(生成器预测的增强掩码和目标掩码)

  • 判别器输出:
    一个标量(由linear层输出)和其对应的概率(sigmoid层输出)

  • 损失函数(详情请参考论文):
    (1)Wasserstein loss (W-CRGAN),(2)Relativistic/Relativistic average loss (R/Ra-CRGAN),(3)Metric loss (M-CRGAN)

实验

论文使用了之前语音增强对抗网络所广泛使用的数据集(详情见论文)。包括30位英文说话人,其中训练集(11572段语音)包括了28位(14位女性)说话人,测试机则涵盖了剩余的2位说话人。在训练集中总共由10种不同的噪音,信噪比的范围在0到15分贝之间。测试集(824段语音)中的信噪比则分布在2.5到17.5分贝之间。


实验结果如下所示,其中CRN-MSE代表的是使用均方差(MSE)作为损失函数的卷积循环网络(非对抗网络)。


结论

实验结果表明,我们所提出的CRGAN模型在使用相同的损失函数的情况下,相比过去的语音增强对抗神经网络取得了更优的表现(对比R-CRGAN和RSGAN)。同时我们也发现引入 对抗机制对系统的表现也有所提升(对比M-CRGAN和CRN-MSE)。另外,循环层在我们所提出的CRGAN模型中也至关重要(对比M-CRGAN和M-CGAN),直接影响到系统最终的表现。最后,在我们探索的损失函数中,Metric loss表现会优于其他的损失函数,额外再引入MSE loss则可以进一步提升系统的表现。


    • 盖亚学者科研基金

      Collaborative Research Funds

    • 主题研究计划

      Theme-Based Research Program

    • 国家科技项目

      National Science and Technology Program

    • AI 赋能社会

      AI for Social Good

    • 联合培养计划

      Joint Talent Program

    • 未来精英论坛

      DiDi-IEEE Elite Forum

    • 未来精英实习生计划

      Elite Intern Program

    • 产教融合

      Collaborative Education Programs

  • 关于我们

    About Us

  • 数据集

    Open Dataset

  • 盖亚科研合作项目

    GAIA Research Collaboration

    盖亚学者科研基金

    Collaborative Research Funds

    主题研究计划

    Theme-Based Research Program

    国家科技项目

    National Science and Technology Program

    数据集

    Open Dataset

    AI 赋能社会

    AI for Social Good

  • 雅典娜人才培养计划

    ATHENA Talent Programs

    联合培养计划

    Joint Talent Program

    未来精英论坛

    DiDi-IEEE Elite Forum

    未来精英实习生计划

    Elite Intern Program

    产教融合

    Collaborative Education Programs

  • 关于我们

    About Us

  • 数据集

    Open Dataset

  • 新闻中心

    News center