
在今年KDD2020中,除有六篇论文被大会接收,滴滴还举办了KDD Cup 2020的RL Track(强化学习赛道)。在这一挑战赛中,滴滴邀请全球参赛团队聚焦按需出行平台,尝试应用机器学习解决方案来提出智能策略,在确保用户体验的基础上,进一步提高出行效率和司机收入。此次比赛滴滴共设计了订单分配和车辆调度两个任务,在派单分配任务中,参赛团队需设计开发算法来指定在派单窗口内的订单和司机的匹配;而在车辆调度任务中,参赛团队需设计开发调度算法指引一批空闲司机开往指定目的地。两个任务既可分别开发,也有联动的空间。
比赛将主要基于「滴滴盖亚数据集计划」脱敏数据集,该数据集包含一定时间内滴滴滴平台专车和快车在成都市部分区域内的脱敏轨迹数据,此外还新增加了其它比赛辅助数据。参赛团队提交的方案会在测试环境中进行评估打分。
历时近4个月,RL Track共吸引了来自全球380多家高校、科研机构和企业共1007支队伍报名参赛,参赛选手共计1195位。来自普渡大学、南京大学、中国科学技术大学、中山大学、东南大学、京东、Lyft、 NTT DOCOMO等参赛选手在比赛期间,提交参与评审共计9000+次。
比赛获奖名单

派单任务方面,为了最大化平台上所有司机日均收入,在计算每个订单的收益时,冠军团队Polar Bear采用基于SemiMDP建模的强化学习方法 (详见KDD2019滴滴论文),这种方法不仅能考虑当前时刻的收入,还能兼顾未来可能的收益。基于在线学习的框架基础上,采用了对状态的分布式表征,有效地增加了在线学习效率及稳定性。同时,结合剪枝与C++实现的高效二分图匹配算法,能够在2秒的规定时限内,及时找到合适的订单分配方案,保证乘客的用户体验。
车辆调度任务则需要在8000余个六边形网格内进行运力调度。相关算法可将乘客潜在出行需求与合适的司机相匹配,从而更高效地利用空置车辆,提高车辆周转率,提升用户体验与司机收入水平,优化系统运营效率。冠军团队TLab的方法将单智能体作为智能“调度中心” ,车辆发出调度请求后,“调度中心”进行全局运力调度。结合此前在大规模时空预测中的经验,进一步对研究区域进行筛选并自定义了一个N×N的网格,将全局信息(整个城市订单、车辆、价值的时空分布)和局部信息(车辆当前位置等)作为state。采用了一个经过剪枝的全局action space, 防止车辆陷入局部最优。
在KDD会议期间,KDD Cup Day回顾了今年KDD Cup比赛,并认可获奖团队,及参与者和比赛组织者对于比赛相关的讨论。线上直播当中,参赛选手对RL Track比赛展现了最大的兴趣度,也吸引了最多讨论。来自Lyft的参赛选手(Team Hail Mary)认为在众多实验过的派单方法中,强化学习确实是最后使模型表现有显著进步的关键方法。来自日本NTT DOCOMO实验室的团队参加了去年和今年两届RL Track比赛,他们觉得今年RL Track比赛比去年的场景更复杂,也更具挑战性。

滴滴AI Labs首席研究员秦志伟博士(Zhiwei Qin)代表RL Track组委会向KDD Cup主席团和参赛选手们表示感谢,并对优胜团队表示祝贺。他认为,未来RL Track比赛会对数据集和评估环境的多样性提出更高要求。网约车交易市场中的强化学习研究离不开仿真评估环境。未来,本次KDD Cup RL Track比赛的评估环境将继续对外开放,支持派单调度算法的研究。
滴滴KDD2020论文解析系列
滴滴KDD2020论文(一) | 实时事件嵌入学习的动态异质图神经网络
滴滴KDD2020论文(二) | 一种新奇且通用的面向在线推荐的异构图信息融合框架
滴滴KDD2020论文(三) | 为客服构建更加智能的对话机器人

