模型

Whistle:仅 16.9 MB 的离线语音转文字模型

精选理由

Cactus 出了个只有 16.9MB 的离线语音转文字模型,11 毫秒启动还能标注单词时间点,做嵌入式语音的可以看看。

Cactus 发布轻量语音识别模型 Whistle,整个文件只有 16.9 MB,可完全在本地离线运行,录音无需上传云端。模型支持英语、德语、法语、西班牙语、意大利语、荷兰语和波兰语共 7 种语言,自动识别语种,不支持中文。它能标注每个单词的精确时间点,单次输入最长 30 秒,启动响应约 11 毫秒。凭借低算力消耗,Whistle 适合部署在手机、智能手表、车载系统和家用设备上。

原文 · Gorden Sun

Whistle:超小的离线语音转文字 AI 模型。 最大的特点是体积小、速度快,整个文件只有 16.9 MB。

核心功能 本地运行: 语音识别全程在用户的设备本地完成,录音不需要上传到云端,在断网状态下也能使用,保护个人隐私。 多语言支持: 支持英语、德语、法语、西班牙语、意大利语、荷兰语和波兰语共 7 种语言,能自动识别说话者使用的语种。不支持中文。 单词时间: 模型不仅能听写文字,还能标出每个单词说出的精确时间点,最长支持单次输入 30 秒的语音。

性能表现 Whistle 主要依靠设备的普通处理器运行,启动响应只需 11 毫秒左右。和业内常见的同类大模型相比,它在保持体积小巧的同时,转写速度更快,在多项公开测试中的文字识别准确率也处在领先水平。

应用场景 因为极小的体积和极低的计算消耗,这个模型适合安装在手机、智能手表、家用电器、车载系统甚至小型机器人上。它可以配合 Cactus公司 现有的其他轻量工具,让普通智能硬件直接“听懂”人类的语音指令并触发相应操作。

Github:https://t.co/x21bYUKefd