蚂蚁开源声纹验证模型 AntSpeaker/MECT,9.57M 参数支持 100ms 实时推理
蚂蚁开源了个 9.57M 参数的小声纹模型,100ms 延迟就能实时验证身份,银行核身、端侧解锁直接能用,小模型打大模型这点挺有意思。
蚂蚁集团开源了声纹验证模型 AntSpeaker/MECT,把 MoE 架构引入全监督声纹训练。该模型只有 9.57M 参数,在 VoxCeleb1 上追平并在平均指标上反超了 5.87 亿参数预训练模型的水平。通过因果重训练,它在 100ms 低延迟下仍能保持接近离线精度的声纹特征提取。典型落地场景包括银行和客服热线的电话核身、App 登录以及端侧设备解锁。
语音模型这两天扎堆儿出,蚂蚁刚刚开源了一套声纹验证模型:AntSpeaker/MECT,超小、能实时跑
可低延时声纹流式推理,在100ms的低延迟下能保持高精度声纹特征提取
有几个典型使用场景 银行、客服热线电话核身,比如“请说一句话验证身份” App登录、设备唤醒只认主人声音
金融核身、端侧解锁,这是最直接的落点
跟上午那个英伟达的日志模型一样,都主打小、快,一个管谁在何时说、一个管是不是同一人,都是语音管线上的专精组件
MECT是把MoE引入了全监督声纹训练,结果用9.57M的小模型,在VoxCeleb1上追平(平均指标上反超)了5.87亿参数预训练模型才能达到的水平
证明了“专家分工”这套大模型玩法,在声纹验证这种小模型全监督任务上同样奏效
其通过因果重训练,实现了100ms延迟+近离线精度,也就意味着该模型能真正用在实时场景里
#AI语音验证模型 #AntSpeakerMECT