
语音领域顶级学术会议 Interspeech于2020年10月25-29日在线举行。今年,滴滴共有4篇论文脱颖而出,入选本次大会。这4篇论文分别在语音增强、语音分离、回声消除、场景感知对话等场景下进行了探究。

本篇文章将解读滴滴的《TMT: A Transformer-based Modal Translator for Improving Multimodal Sequence Representations in Audio Visual Scene-aware Dialog》论文。受跨模态翻译有助于捕获异步模态相关信息捕获的启发,在本篇论文中滴滴提出了基于Transformer的模态翻译器(Transformer-based Modal Translator , TMT)来学习多模态序列。同时,滴滴将TMT应用到了语音视觉场景对话中的视频和对话两个模态,提出了MTN-TMT模型,该模型是在MTN[1]中加入了视频-描述翻译器(Video-caption translator)和对话-摘要翻译器(Dialog-summary translator)两个模块来学习更好的模态表达。在这篇论文中,滴滴还采用消融实验分析了TMT对各个模态性能的影响以及TMT深度对模态表达的影响。

论文地址:
https://arxiv.org/abs/2010.10839
视频链接:
http://www.interspeech2020.org/index.php?m=content&c=index&a=show&catid=408&id=1022

研究背景
语音视觉场景对话系统(Audio Visual Scene-aware dialog, AVSD)是在第七届对话系统挑战赛(7th Dialog System Technology Challenges)中提出的任务[2],该任务涉及了包括端到端对话系统,视觉对话系统和视频描述等研究领域。语音视觉场景对话系统的挑战之一在于需要准确地表达对话场景中的各个模态,为系统提供更好的场景信息。近几年来,国内外高校和企业的研究者针对多模态对话场景中的模态表达做出了许多研究,其中包括:1)采用额外的相关数据预训练特征提取器,例如语音模态的VGGish模型,视频的I3D ResNet模型,I3D-RGB和I3D-Flow特征;2)采用Attention来学习问题(Query)相关的多模态表达,例如FiLM Attention Hierarchical Recurrent Encoder-Decoder(FA-HRED)和Multimodal Transformer Networks (MTN)[20]。
模型

图1
图1展示了本文提出的MTN-TMT模型,包括了编码器(Encoder),视频-描述翻译器,对话-摘要翻译器,自编码器(Auto-encoder),和解码器(Decoder)。对于语音和视频模态,输入为VGGish,I3D-RGB和I3D-Flow特征。对于对话历史,摘要,视频描述,问题和答案这一类文本模态,输入为512维的词向量。
实验
本篇论文使用了第七届对话系统挑战赛中语音视觉场景对话系统的开源数据(详情见论文),其中训练集,验证集和测试集分别包含了153180,35740和13490轮对话。该数据集采用地是自然语言处理中常用的评价指标:Bleu, ROGUE-L, METEOR和CIDEr。
实验结果如下所示,表5展示了MTN-TMT与参赛模型的性能对比。

表2展示了TMT应用到视频和对话模态后,对话系统性能的提升,其中VCT和DST分别表示视频-描述翻译器和和对话-摘要翻译器。

表4展示了TMT的深度对模态表达的影响:

结论
在这篇论文中,我们提出了一个基于Transformer的模态翻译器(TMT)用于提升多模态序列的表达能力。在语音视觉场景对话中,我们把TMT应用到了视频和对话模态,为系统提供了更准确场景信息。在实验中,我们提出的MTN-TMT模型性能超过了参赛的其他模型。
参考文献
[1] H. Le, D. Sahoo, N. Chen, and S. Hoi,“Multimodal transformer networks for end-to-end video-grounded dialogue systems,”in Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, 2019, pp. 5612–5623.
[2] H. Alamri, C. Hori, T. K. Marks, D. Batr, and D. Parikh, “Audiovisual scene-aware dialog (avsd) track for natural language generation in dstc7,” in DSTC7 workshop at AAAI, 2019.
Interspeech 2020滴滴论文解读系列


