
对话系统技术挑战赛(DSTC)是由微软研究院和卡内基梅隆大学等联合发起的一项国际顶尖人工智能竞赛,旨在解决时下最前沿、最具挑战性的对话系统技术问题,在对话领域具有极高的权威性,迄今已举办九届。本届DSTC9由微软、Google、IBM研究院、Amazon、CMU、清华大学等联合举办,吸引了业界和学术界各路顶尖团队纷纷参与。滴滴参与的端到端多领域面向任务型对话系统(End-to-end Multi-domain Task Completion Dialog)赛道共吸引全球60多只团队参赛。
面向任务型对话系统是指通过人机对话旨在帮助用户完成实际具体的任务,如预订酒店,订餐厅等。现实生活中的任务型对话应用往往涉及多领域多任务,如旅游服务对话应用一般会同时涉及景点、酒店、机票或餐厅等领域,车载交互应用需涉及定位导航、音乐推荐、路况播报等多领域任务。
此次比赛所用的MultiWoz公开数据集共跨七个领域,每个对话平均13轮。该比赛要求系统不仅要从人类复杂多变的表达中快速理解意图,还能在多领域中穿插切换,给予准确合适的回答,最终完成任务。这也对现有任务型对话系统提出更高要求。传统基于Pipeline的对话系统将对话任务划分为语义理解(NLU), 状态跟踪(DST), 对话策略(Policy), 以及自然语言回答生成(NLG)四个流程模块,每一子模块需要大量标注数据或是专家设计的规则,代价昂贵且难以移植到不同业务;此外,现有基于神经网络AI模型端到端系统仅以对话历史为输入、以系统回答为输出则很难捕捉复杂对话的变化过程特征。
为解决这一问题,比赛中,滴滴采用领域自适应(Domain Adaptive)以及任务自适应学习(Task Adaptive)混合技术,通过大规模domain数据预训练、任务分阶段多目标学习、领域自适应去词化预处理和后处理等,让模型可跨领域学习任务型对话系统的推理过程。另外,为了让系统回答更加智能接近人类,滴滴模型在GPT2基础上预训练并采用系列容错矫正机制。最终取得人工评测任务成功率(Average Success Rate,官方排名指标)世界第一,相对DSTC8同任务提升了近9个百分点,人工评测系统回答合适分数(Response Appropriateness Score)相较DSTC8提升了3.8%。这些指标的提升意味着人机对话的理解力和回复能力在多领域任务达到新的高度。

目前,这一语音对话系统已在滴滴广泛使用,如智能客服对话、车机系统语音交互、司机端内语音交互等。除积极探索技术前沿,滴滴也持续推进对话交互能力的开放。
去年8月,开源基于深度学习的自然语言平台DELTA,进一步降低开发者创建、部署自然语言处理系统和语音模型的难度。
10月24日,在语音顶会Interspeech上,滴滴还联合天津大学、杜克大学开放了大规模数据库DiDiSpeech,在滴滴盖亚数据集集中提供下载通道。数据库提供由超过6000名说话人专门录制的近800小时的语音数据和注音标注。


