ESPnet发布YODAS v3语音数据集
ESPnet开源了110万小时多语言语音数据集,覆盖100多种语言,带时间戳和翻译,直接拿来训练语音模型。
ESPnet团队发布了YODAS v3语音数据集,包含超过110万小时的多语言网络音频,覆盖100多种语言。数据集提供句子和单词级别的时间戳字幕,大部分非英语内容配有英文翻译。数据集还标注了实际有效的音频采样率与声道信息,为语音识别、语音合成和音频表征模型训练提供高质量基准。
ESPnet发布YODAS v3语音数据集:大幅降低多语言语音AI的训练门槛
这个大规模开源数据集包含超过110万小时的多语言网络音频,覆盖了100多种语言。不仅提供句子和单词级别的时间戳字幕,还为大部分非英语内容配备了英文翻译,甚至标注了实际有效的音频采样率与声道信息。对于想要训练语音识别、语音合成或音频表征模型的研究者来说,可以直接获取规整、无版权问题、高质量、多语言的基准数据。
数据集:https://t.co/pcbTLKRWI5