
Introduction
导读
随着网约车的兴起,越来越多的司机师傅加入到网约车的大家庭中。为了鼓励司机间建立友谊,帮助司机在网约车服务中获得归属感和成就感,滴滴在全国广泛开展了司机组队活动。那么如何设计活动才能更好的服务于司机群体呢?什么样的团队更有利于司机从活动中受益呢?为了回答这一系列问题,滴滴AI Labs与密西根大学安娜堡分校的行为经济学和大数据领域专家团队联合提出了一套用于大规模田野实验进行系统性分析、预测、优化的方法。相关工作近期以Oral长文形式发表在知识发现和数据挖掘大会KDD 2020,题为Predicting Individual Treatment Effects of Large-scale Team Competitions in a Ride-sharing Economy。本文将对这篇文章进行详细解读。

01
研究背景
网约车平台为司机提供了灵活的工作时间和可观的经济收益。为了帮助司机群体在享受共享经济带来的福利的同时,获得更佳的工作体验,滴滴在全国广泛开展了司机组队活动。作为团队的一份子参加活动,可帮助司机与队友间建立社会联系和团队认同,活动中表现较好的团队还可以获得成就感,有效解决了共享经济中工作孤独、无成就感等问题。仅2018年,滴滴就在全国超过180个城市成功举行了上千场组队活动,吸引了超过百万司机的积极参与,提升了司机的归属感、满意度和工作表现。
虽然组队活动整体上看非常成功,但因为每次组队活动的活动规则、城市、参与的司机和团队都存在差异,不同司机在不同活动中的归属感建立、绩效提升和满意程度都有显著差异。那么,哪些司机和团队可以更好的从组队活动中受益呢?为什么同样的活动设计在不同城市之间效果不一?这些问题的答案不仅可以帮助平台针对不同的司机群体优化活动设计,还有助于将组队活动成功推广到更多城市和场景中,使更广大的司机群体受益。
但是回答上述问题对运营团队(人)和数据挖掘方法(算法)都提出了巨大挑战。如何评估活动效果(活动对司机影响的因果关系而非相关关系)?如何从司机、团队、活动设计和环境因素所组成的高维复杂变量空间中识别可能影响实验效果的因素?该问题涉及的数据包含数百万的司机与订单交易、大量实际环境相关变量,如何选用算法使得其可以同时具有大规模数据处理能力和可解释性?
为了科学系统地解决上述问题,本文使用了可解释的机器学习模型预测组队活动对司机个体的效果,选取有预测力的特征进行解读(如奖金设置、团队结构),从而对优化组队活动设计和团队组建推荐系统提出了有操作性的建议。
02
什么是组队活动?
个体活动(实验)效果如何评估?
▍2.1 组队活动
我们首先介绍一下组队活动的一般流程。一次组队活动通常包括两个阶段:组队阶段(即Team Building Period)和比赛活动阶段(即Contest Period,如图1所示)。

图1:司机组队活动流程
在组队阶段,平台推送活动通知,邀请司机参与活动。在此期间,有兴趣的司机报名活动并开始组队。报名队长的司机会自动创建一个新车队,报名队员的司机将加入车队。队长可以自行邀请其他司机加入队伍,或在滴滴组队推荐系统的帮助下邀请被推荐司机加入队伍;推荐系统还会在组队阶段的尾声帮助尚未成功组队的司机撮合成团。在撮合队伍的过程中,系统随机将一部分未能成功组队的司机作为活动的对照组。在活动阶段,所有队伍会被划分到小规模的活动组中进行组内PK,每个活动组包含相同数量的团队。组内表现好的团队将会获得相应奖励。
▍2.2 个体实验效果评估
预测组队活动对司机个体的效果首先需要对个体效果进行准确估计。通过上述组队活动说明可以发现,滴滴的组队活动可以被看作一个有实验组和对照组的田野实验。因此,评估组队活动对司机个体的效果即评估田野实验的个体实验效果。
在本文中,个体实验效果具体是指组队活动对司机收入的影响,即司机通过参加组队活动而获得的额外收入。为了更准确的衡量该效果,计算个体实验效果时不仅应考虑(1)参与活动的司机(实验组)和报名但未能活动的司机(对照组)间的收入差异,还应顾及(2)同一司机在活动开始前后收入的个体差异。因此,本文使用改进的双重差分模型(Difference-in-Differences)计算个体实验效果。具体方法如下。


然后,取对照组中所有司机的收入差异均值:

最后,对于参加活动的每个司机个体提升效果可由下列公式计算:

03
个体实验效果预测
为了预测个体实验效果,本文选取了超过500个大型组队活动的田野实验数据,并且提取了活动设计、司机属性、团队属性和城市属性四大类共计超过500个特征。根据活动的时间,本文将所有活动分为训练、验证和测试集,并使用RMSE来衡量机器学习预测器的性能。本文主要目标不是优化预测准确性,而是了解各个预测因素对个体实验效果带来的影响。因此,本文选择了具有一定解释能力的线性模型Lasso Regression、Ridge Regression和非线性模型GBRT以预测个体效果,最佳模型的样本外预测误差比基准减少超过24%。
04
特征解读
GBRT的特征重要性评分和Lasso的特征系数可以帮助我们更好的理解特征和个体实验效果之间的关系。限于篇幅,我们选取个别GBRT和LASSO模型中重要性评分较高和特征系数绝对值较大的特征进行解读。
▍4.1 天气和供需比
本文发现活动期间暴风雪天的占比(proportion of snowstorm days)与实验效果呈负相关关系。即活动期间的暴风雪天气会降低活动效果。这个关系很容易理解,因为极端天气很可能严重限制了交通出行。城市的网约车供需比(City supply-demand rate)也对个体实验效果有负面影响,即在供给短缺的城市,活动对司机个体收入的提升效果更明显。这些特征虽然与活动设计和队伍结构无关,但可以帮助平台合理安排活动的时间和城市。因此,在资源有限的情况下,平台可以考虑优先在这些供给严重小于需求的地区开展组队活动。
▍4.2 队员完单区域相似性
本文发现,队员完单区域的相似程度与个体实验效果呈正相关关系,且这一影响几乎是线性的(如图2)。以往针对虚拟团队的研究显示地理上的隔离或距离会影响了团队协作,并对团队的绩效产生负面影响。这一发现扩展了该结论:即使对于接单驾驶这样较少依赖协调和沟通来完成的团队任务,地理距离也对团队表现有负面影响。

图2.队内成员完单区域相似性与个体实验效果关系图
▍4.3 活动成绩计算方法
我们发现一些计算活动成绩的规则也会影响组队活动的效果,例如队内最后一名的成绩是否计入团队活动成绩。Lasso 模型的系数显示,如果将每个活动日队内成绩最低的司机的收入从团队总成绩中剔除,即不计入团队成绩(和奖金分配),则司机们的积极性就会降低。这也许意味着强调组内竞争可能降低活动效果。换句话说,将每个司机的成绩都计入团队成绩,也许可以通过创造更加友好的队内氛围,帮助司机获得更强烈的团队归属感和更好的体验。这个发现可直接应用于优化活动设计。
05
这些发现怎么用?
——对活动设计和推荐系统设计的启发
本文发现的预测模型特征和实验效果间的关系,可直接应用于优化活动设计和推荐系统设计,具有现实意义。
例如,本文的许多发现都与活动设计直接相关,如上述的活动成绩计算方法。如果在活动设计中对这些部分做出相应调整与改进,则可能进一步提升司机参与活动的额外收益。为了探索这些发现的潜在价值,本文通过仿真进行了反事实(counterfactual)分析:选取真实的活动,更改相关的活动设计(比如将原“队内最后一名成绩不计入团队活动成绩”的活动设置更改为计入团队成绩),并在新的活动设置下预测司机个体的活动效果。分析结果表明,只需改变不超过三个实验设计,该活动的人均效果就可以提升高达26%。
此外,这些发现也在设计推荐系统方面给了我们很多启发,即通过更合理的推荐优化组队结构,从而提升司机绩效。比如系统可以先把彼此熟悉的司机或者之前有过共同组队经历的司机组为一队,在这基础上再向团队推荐新的司机。这样既可以帮助已经彼此熟悉的司机增强友谊和团队归属感,又可以为团队补充新鲜血液。系统也可以向绩效较低或者经验较少的司机推荐活跃度较高、经验丰富的司机,在这样的团队中成员会受到高绩效成员的帮助与鼓舞从而获得更好的体验。此外,系统还可以帮助来自同一完单区域工作的司机进行组队,拉近成员间的地理距离,进一步降低司机工作的孤独感,增强归属感。
滴滴KDD2020论文解析系列
滴滴KDD2020论文(一) | 实时事件嵌入学习的动态异质图神经网络
滴滴KDD2020论文(二) | 一种新奇且通用的面向在线推荐的异构图信息融合框架
滴滴KDD2020论文(三) | 为客服构建更加智能的对话机器人
滴滴KDD2020论文(四) | 更精确地预估到达时间,新提出异质时空图卷积网络
滴滴KDD2020论文(五)|滴滴×密西根大学: 共享经济中大规模组队活动的个体实验效果预测

