02:24官方账号Meta AI@AIatMetaMuse Voice Transcribe今日正式上线,可通过Meta Model API、Meta AI for Mac和Muse Code三种渠道使用。该功能支持语音转文字,为开发者提供语音处理能力。Meta持续扩展其AI产品线,此次发布进一步丰富了Meta AI的功能矩阵。AI产品Muse Voice TranscribeMetaMeta Model API4 个信源在谈事件专题推荐理由:Meta发布了Muse语音转文字功能,支持多种平台使用,开发者可以轻松集成语音处理能力。原文稍后读已读值得跟进有用关注 Muse Voice Transcribe
02:15Philipp Schmid@_philschmid88°Gemini 3.5 Transcribe发布,支持85+语言,非流式识别错误率2.6%,流式识别错误率4.0%,比Chirp 3快70%。支持秒级双向流,提供词级时间戳和说话人识别。AI产品Gemini 3.5 Transcribe语音转文字GoogleAIStudio5 个信源在谈事件专题推荐理由:GoogleAIStudio和GeminiApp已上线,秒级流式识别,比Chirp 3快70%,体验更佳。原文稍后读已读值得跟进有用关注 Gemini 3.5 Transcribe
01:49Google AI Developers@googleaidevs81°Gemini 3.5 Transcribe 语音转文字模型可理解代码库,过滤犹豫语,精确匹配技术术语、文件名和代码变量,支持视觉偏置,增强开发者工作流。AI模型Gemini 3.5 Transcribe语音转文字代码理解5 个信源在谈事件专题推荐理由:谷歌发布了新的语音转文字模型,能理解代码,比之前版本更精准,值得开发者关注。原文稍后读已读值得跟进有用关注 Gemini 3.5 Transcribe
01:39官方账号Google AI@GoogleAI88°GoogleAI发布Gemini 3.5 Transcribe,精准智能语音转文字模型,支持85+语言,自动过滤填充词,格式化语音,与屏幕上下文配对执行语音命令。视频展示其将混乱语音输入和本地文件转换为电子邮件草稿的功能。AI产品Gemini 3.5 Transcribe智能体语音转文字5 个信源在谈事件专题推荐理由:GoogleAI发布全新Gemini 3.5 Transcribe,语音转文字更智能,支持多种语言,自动优化,比传统模型更强大。原文稍后读已读值得跟进有用关注 Gemini 3.5 Transcribe
18:23IT之家(博客/媒体)雷鸟 iO AI 眼镜采用全新萤火光引擎 Nano,实现等效 33 英寸屏幕,屏幕亮度达 1800 nits。首创全天智记功能,持续采集语音信息并转写为文字,帮助用户记住重要事项。雷鸟 iO AI 眼镜定位为人类增强 AI 眼镜,旨在融入人的视野、感知和行动之中。AI产品雷鸟 iO智能眼镜全天智记推荐理由:雷鸟 iO AI 眼镜,轻巧设计,全天智记功能强大,适合需要高效记录和提醒的用户。原文稍后读已读值得跟进有用关注 雷鸟 iO
21:33OpenRouter@OpenRouterAIDeepgram 推出 Nova-3,一款通用语音转文字模型,支持单语和多语转写。该模型在 OpenRouter 平台上可用,提供高精度转录能力。Nova-3 延续了 Deepgram 在语音识别领域的优势,适用于多种场景。AI模型DeepgramNova-3语音转文字推荐理由:Deepgram 出了 Nova-3,语音转文字更准了,还支持多语言,做转录工具很实用。原文稍后读已读值得跟进有用关注 Deepgram
16:07宝玉@dotey精选宝玉将 OpenMOSS 开源的 MOSS-Transcribe-Diarize-0.9B 集成到剪映工具 BaoCut 中,可直接输出带精确时间戳和说话人标注的结构化转写结果。该模型无需专用发言人识别模型,但转录速度比 Qwen3-ASR-0.6B 慢,且不支持标点符号,自定义 Prompt 与热词也未生效。项目地址为 github.com/OpenMOSS/MOSS-Transcribe-Diarize。AI模型BaoCutOpenMOSSMOSS-Transcribe-Diarize-0.9B推荐理由:宝玉给 BaoCut 集成了 MOSS-Transcribe-Diarize-0.9B,能一次搞定长音频转写和说话人标注,省去额外模型,适合做字幕或会议记录。原文稍后读已读值得跟进有用关注 BaoCut
18:46IT之家(博客/媒体)Canonical 于 6 月 17 日公布 Project Myna,一款面向 Ubuntu 桌面的本地语音转文字听写工具。首版计划随 Ubuntu 26.10(Stonking Stingray)发布。Myna 使用 AI 语音模型,所有识别任务在本地运行,无需联网。用户按下快捷键即可开始听写,转录文字直接插入当前应用,屏幕显示视觉反馈。Canonical 强调首版只专注基础听写,不涉及语音助手、语音命令或翻译功能。AI产品CanonicalUbuntuMyna推荐理由:Ubuntu 用户看过来!Canonical 出了个叫 Myna 的本地听写工具,不用联网就能把语音转成文字,直接敲进文档里,首发跟着 26.10 系统版本走。原文稍后读已读值得跟进有用关注 Canonical
10:57IT之家(博客/媒体)iOS 27 Beta 1 新增“高级听写预览”功能,支持离线运行。该功能提升语音转写准确率,能实时处理大写字母与标点符号。用户需在设置中手动开启,启用后覆盖系统全局键盘场景。适配机型包括 iPhone 17 Pro、iPhone Air、第二代 Vision Pro(M5 芯片)、M4 芯片及以上 iPad(需 12GB 内存)、M3 芯片及以上 Mac(需 12GB 内存)。AI产品iOS 27iPhone 17 Pro苹果推荐理由:苹果给新机加了离线听写原文稍后读已读值得跟进有用关注 iOS 27
04:17官方账号Together AI@togethercompute72°Together AI 推出了目前最快的两个语音转文字(STT)模型,其中 NVIDIA Parakeet-TDT 0.6B v3 能在 10 秒内转录 20 小时的语音。该模型基于 TensorRT 优化、条件 CUDA 图、事件驱动 I/O 和共享内存等技术实现极致性能。这一进展大幅降低了大规模语音转录的延迟和成本,对需要实时或批量处理语音的团队意义重大。Together AI 通过系统级优化展示了 STT 模型在推理速度上的新标杆。AI产品语音转文字NVIDIA Parakeet-TDTTogether AI5 个信源在谈事件专题推荐理由:语音转录速度提升了一个数量级,做实时语音应用或大规模音频处理的团队可以直接用上,省下不少时间和算力成本。原文稍后读已读值得跟进有用关注 语音转文字