模型多源确认精选73°

英伟达发布 Nemotron 3 Diarization,支持 8 说话人日志

精选理由

英伟达新出的说话人日志模型,100M 能本地跑,专门负责“谁在何时说话”,配 ASR 就能做分角色转写,比 Qwen 那个更专精。

英伟达上线了多说话人日志模型 Nemotron 3 Diarization,用于标注谁在什么时间说话,支持最多 8 个说话人。该模型支持直播和录音输入,能处理重叠语音,参数量 100M,可本地部署。技术上通过按首次出现顺序固定 speaker 编号、AOSC 长期说话人缓存加 FIFO 短期上下文来保持跨时间、跨 chunk 的说话人标签一致,避免同人被拆成新 speaker 或多人混成一人。它只输出“谁+何时”,文本部分需另配 ASR,与阿里 Qwen 昨天发布的分角色转写 ASR 方向相近。

原文 · AIGCLINK

英伟达最新上的多说话人日志模型:Nemotron 3 Diarization,用来跟踪谁在什么时间说话,支持8说话人

直播与录音都支持、能处理重叠语音;100M,可本地跑

跟昨天阿里Qwen的那个分角色转写ASR是同一方向,英伟达这个等于是这个方向的专精组件版,不同的是英伟达这个只出“谁+何时”,文本需另配ASR

它通过“按首次出现顺序固定speaker编号+AOSC长期说话人缓存+FIFO短期上下文”来维持跨时间/跨chunk的说话人标签一致性,来避免把同一个人误判成新speaker、把不同人混成同一个speaker

#语音日志模型 #Nemotron3Diarization