16:07宝玉@dotey精选宝玉将 OpenMOSS 开源的 MOSS-Transcribe-Diarize-0.9B 集成到剪映工具 BaoCut 中,可直接输出带精确时间戳和说话人标注的结构化转写结果。该模型无需专用发言人识别模型,但转录速度比 Qwen3-ASR-0.6B 慢,且不支持标点符号,自定义 Prompt 与热词也未生效。项目地址为 github.com/OpenMOSS/MOSS-Transcribe-Diarize。AI模型BaoCutOpenMOSSMOSS-Transcribe-Diarize-0.9B推荐理由:宝玉给 BaoCut 集成了 MOSS-Transcribe-Diarize-0.9B,能一次搞定长音频转写和说话人标注,省去额外模型,适合做字幕或会议记录。原文稍后读已读值得跟进有用关注 BaoCut
16:06宝玉@dotey精选OpenMOSS 开源了 MOSS-Transcribe-Diarize-0.9B 模型,参数规模 0.9B,支持 128K 上下文,最长可一次处理约 90 分钟音频。该模型采用 Whisper-Medium 编码器 + Qwen3-0.6B 风格 decoder,端到端完成转写、说话人分离和时间对齐,无需级联流程。在单张 4090 显卡上,RTF 为 0.017,5-10 分钟录音约 30 秒转完,并支持热词增强。模型以 Apache 2.0 协议开源,可商用。AI模型OpenMOSSMOSS-Transcribe-Diarize-0.9BWhisper推荐理由:OpenMOSS 开源了一个 0.9B 参数的端到端模型,能一次搞定 90 分钟多人音频,告诉你谁说了什么、什么时候说的,单卡 4090 跑得飞快。原文稍后读已读值得跟进有用关注 OpenMOSS
22:17官方账号LMSYS Org (SGLang)@lmsysorg精选71°MosiAI 团队开源 MOSS-Transcribe-Diarize-0.9B,仅 0.9B 参数,基于 Whisper-Medium 编码器和 Qwen3-0.6B 风格解码器。模型支持 128K 上下文,可一次性处理约 90 分钟长音频。输出直接包含时间戳和说话人标签,无需分块或单独说话人分离。还支持热词提升,用于人名、领域术语和代码切换场景。SGLang 已提供 Day-0 支持,可立即运行。AI模型MOSS-Transcribe-Diarize-0.9BMosiAISGLang1 个信源在谈事件专题推荐理由:MosiAI 开源了一个0.9B的小模型,能一次性转录90分钟的多说话人音频,边缘设备就能跑,很适合本地部署。原文稍后读已读值得跟进有用关注 MOSS-Transcribe-Diarize-0.9B
19:22官方账号vLLM@vllm_project精选MosiAI 发布了 MOSS-Transcribe-Diarize-0.9B,一个 0.9B 参数的开源端到端模型,专门用于多说话人长音频转录。该模型将 ASR、说话人日记化和时间戳对齐整合为单个生成式过程,不同于 WhisperX 的分阶段串联方式。它支持最长约 90 分钟的音频一次性输入,无需分块或拼接,并具备关键词偏置功能以提升专有名词识别准确率。vLLM 在发布当天(day-0)即提供了对该模型的支持。AI模型MOSS-Transcribe-Diarize-0.9BMosiAIvLLM1 个信源在谈事件专题推荐理由:MosiAI 新发的 0.9B 开源模型,一次性搞定多人对话的转录、打标签和加时间戳,90 分钟音频都不用分块,还支持关键词纠偏,赶紧试试。原文稍后读已读值得跟进有用关注 MOSS-Transcribe-Diarize-0.9B