• 盖亚学者科研基金

      Collaborative Research Funds

    • 主题研究计划

      Theme-Based Research Program

    • 国家科技项目

      National Science and Technology Program

    • AI 赋能社会

      AI for Social Good

    • 联合培养计划

      Joint Talent Program

    • 未来精英论坛

      DiDi-IEEE Elite Forum

    • 未来精英实习生计划

      Elite Intern Program

    • 产教融合

      Collaborative Education Programs

  • 关于我们

    About Us

  • 数据集

    Open Dataset

  • 盖亚科研合作项目

    GAIA Research Collaboration

    盖亚学者科研基金

    Collaborative Research Funds

    主题研究计划

    Theme-Based Research Program

    国家科技项目

    National Science and Technology Program

    数据集

    Open Dataset

    AI 赋能社会

    AI for Social Good

  • 雅典娜人才培养计划

    ATHENA Talent Programs

    联合培养计划

    Joint Talent Program

    未来精英论坛

    DiDi-IEEE Elite Forum

    未来精英实习生计划

    Elite Intern Program

    产教融合

    Collaborative Education Programs

  • 关于我们

    About Us

  • 数据集

    Open Dataset

  • 新闻中心

    News center

相关链接

  • 滴滴官网
  • 智能驾驶
  • 智慧交通
  • 人工智能实验室
  • AI开放平台

联系我们

  • 官方邮箱:didioutreach@didiglobal.com
  • 地址:北京市海淀区中关村软件园19号钻石大厦B座
二维码

扫一扫 关注我们

滴滴

© 2012-2026 北京小桔科技集团有限公司增值电信业务经营许可证:京B2-20192416 B1.B2-20160181 广播电视节目制作经营许可证:(京)字第15738号京ICP备12043664号-18京公网安备 11000002002025号

新闻详情

News Detail

当前位置:学术合作 > 新闻中心
2020-12-28 16:39作者:科技生态与发展部标签:科技
微信微博

Interspeech2020滴滴论文解读(三)| 基于Transformer的模态翻译器用于提升视频场景对话中多模态序列表达




语音领域顶级学术会议 Interspeech于2020年10月25-29日在线举行。今年,滴滴共有4篇论文脱颖而出,入选本次大会。这4篇论文分别在语音增强、语音分离、回声消除、场景感知对话等场景下进行了探究。




本篇文章将解读滴滴的《TMT: A Transformer-based Modal Translator for Improving Multimodal Sequence Representations in Audio Visual Scene-aware Dialog》论文。受跨模态翻译有助于捕获异步模态相关信息捕获的启发,在本篇论文中滴滴提出了基于Transformer的模态翻译器(Transformer-based Modal Translator , TMT)来学习多模态序列。同时,滴滴将TMT应用到了语音视觉场景对话中的视频和对话两个模态,提出了MTN-TMT模型,该模型是在MTN[1]中加入了视频-描述翻译器(Video-caption translator)和对话-摘要翻译器(Dialog-summary translator)两个模块来学习更好的模态表达。在这篇论文中,滴滴还采用消融实验分析了TMT对各个模态性能的影响以及TMT深度对模态表达的影响。




论文地址:

https://arxiv.org/abs/2010.10839


视频链接:

http://www.interspeech2020.org/index.php?m=content&c=index&a=show&catid=408&id=1022




研究背景

语音视觉场景对话系统(Audio Visual Scene-aware dialog, AVSD)是在第七届对话系统挑战赛(7th Dialog System Technology Challenges)中提出的任务[2],该任务涉及了包括端到端对话系统,视觉对话系统和视频描述等研究领域。语音视觉场景对话系统的挑战之一在于需要准确地表达对话场景中的各个模态,为系统提供更好的场景信息。近几年来,国内外高校和企业的研究者针对多模态对话场景中的模态表达做出了许多研究,其中包括:1)采用额外的相关数据预训练特征提取器,例如语音模态的VGGish模型,视频的I3D ResNet模型,I3D-RGB和I3D-Flow特征;2)采用Attention来学习问题(Query)相关的多模态表达,例如FiLM Attention Hierarchical Recurrent Encoder-Decoder(FA-HRED)和Multimodal Transformer Networks (MTN)[20]。

模型


图1


图1展示了本文提出的MTN-TMT模型,包括了编码器(Encoder),视频-描述翻译器,对话-摘要翻译器,自编码器(Auto-encoder),和解码器(Decoder)。对于语音和视频模态,输入为VGGish,I3D-RGB和I3D-Flow特征。对于对话历史,摘要,视频描述,问题和答案这一类文本模态,输入为512维的词向量。


实验

本篇论文使用了第七届对话系统挑战赛中语音视觉场景对话系统的开源数据(详情见论文),其中训练集,验证集和测试集分别包含了153180,35740和13490轮对话。该数据集采用地是自然语言处理中常用的评价指标:Bleu, ROGUE-L, METEOR和CIDEr。


实验结果如下所示,表5展示了MTN-TMT与参赛模型的性能对比。



表2展示了TMT应用到视频和对话模态后,对话系统性能的提升,其中VCT和DST分别表示视频-描述翻译器和和对话-摘要翻译器。


表4展示了TMT的深度对模态表达的影响:


结论

在这篇论文中,我们提出了一个基于Transformer的模态翻译器(TMT)用于提升多模态序列的表达能力。在语音视觉场景对话中,我们把TMT应用到了视频和对话模态,为系统提供了更准确场景信息。在实验中,我们提出的MTN-TMT模型性能超过了参赛的其他模型。


参考文献

[1] H. Le, D. Sahoo, N. Chen, and S. Hoi,“Multimodal transformer networks for end-to-end video-grounded dialogue  systems,”in Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, 2019, pp. 5612–5623.

[2] H. Alamri, C. Hori, T. K. Marks, D. Batr, and D. Parikh, “Audiovisual scene-aware dialog (avsd) track for natural language generation in dstc7,” in DSTC7 workshop at AAAI, 2019.


Interspeech 2020滴滴论文解读系列


  • Interspeech2020滴滴论文解读(一)| 探索基于生成对抗网络的语音增强系统中的损失函数和循环结构的影响


  • Interspeech2020滴滴论文解读(二)| 基于生成对抗网络的回声消除







    • 盖亚学者科研基金

      Collaborative Research Funds

    • 主题研究计划

      Theme-Based Research Program

    • 国家科技项目

      National Science and Technology Program

    • AI 赋能社会

      AI for Social Good

    • 联合培养计划

      Joint Talent Program

    • 未来精英论坛

      DiDi-IEEE Elite Forum

    • 未来精英实习生计划

      Elite Intern Program

    • 产教融合

      Collaborative Education Programs

  • 关于我们

    About Us

  • 数据集

    Open Dataset

  • 盖亚科研合作项目

    GAIA Research Collaboration

    盖亚学者科研基金

    Collaborative Research Funds

    主题研究计划

    Theme-Based Research Program

    国家科技项目

    National Science and Technology Program

    数据集

    Open Dataset

    AI 赋能社会

    AI for Social Good

  • 雅典娜人才培养计划

    ATHENA Talent Programs

    联合培养计划

    Joint Talent Program

    未来精英论坛

    DiDi-IEEE Elite Forum

    未来精英实习生计划

    Elite Intern Program

    产教融合

    Collaborative Education Programs

  • 关于我们

    About Us

  • 数据集

    Open Dataset

  • 新闻中心

    News center