10月24日,在Interspeech的SLIMTS2020 Workshop上,滴滴联合天津大学和杜克昆山大学公开了DidiSpeech的语音开源数据库。

-Interspeech的「SLIMTS2020 Workshop」 在B站同步直播-
-滴滴首席NLP科学家「Kevin Knight」通过直播公开数据-
数据介绍
DidiSpeech是一个针对中文个性化语音合成任务的大规模数据库。该数据库提供了由超过6000名说话人录制的近800小时的语音数据。此次第一批开放数据为500人,时长60余小时的语音数据。
数据库中所有的音频均由说话人使用手机在安静环境中录制,具有较高的语音质量。同时,数据库中的说话人在性别、年龄以及地域等方面分布均匀,具有充足的多样性。在录制文本的设计上,数据库分别设计了平行文本与非平行文本,以确保在音色转换、多说话人语音合成等任务上数据的高度可用。此外,所有录制文本提供了注音标注。
详细的数据介绍已经上传arXiv,文章中介绍了DiDiSpeech语料库中数据的详细信息以及DiDiSpeech在多种语音任务中的初步表现。在ASR、说话人识别、性别分类以及说话人年龄预测等任务中, DiDiSpeech能够取得较高的准确率。在说话人语音合成以及音色转换任务中,基于DiDiSpeech训练得到的模型也具有良好的性能。

滴滴盖亚数据集:https://outreach.didichuxing.com/research/opendata/
扫描下方二维码
申请数据下载

我们在保护用户隐私、维护数据安全的前提下,秉承着“开放共享、协作共赢、创新发展”的理念 ,持续推进数据集,希望携手学界共同探索、扩宽科学的边界,将尖端科技应用到改变世界的实践中,共同让城市更适应每一个人的发展,让出行更美好。


