Qwen-Audio-3

general · 首次出现 2026-07-15 · 最近出现 2026-08-17 · 累计提及 35

综述

Qwen-Audio-3 是阿里通义推出的新一代语音人工智能技术,聚焦语音识别、文本转语音及实时交互功能,在语音智能领域处于前沿位置。该技术通过多维度优化,提升语音交互体验与准确性。

Qwen-Audio-3 近期进展

阿里发布Qwen-Audio-3.0语音模型,ASR/TTS/实时交互全球第一:阿里推出Qwen-Audio-3后,其在自动语音识别(ASR)、文本转语音(TTS)及实时交互方面的性能达到全球领先水平,推动语音智能技术在各场景的应用拓展。 阿里巴巴发布首个全栈语音AI平台CosyVoice Studio,定位语音为智能体入口:阿里发布全栈语音AI平台CosyVoice Studio,将其定位为智能体的核心交互入口,构建从语音采集到响应的全流程智能生态体系。 阿里发布Qwen-Audio-3.0-ASR-Flash,强化上下文与领域术语识别:针对不同行业领域,优化Qwen-Audio-3的上下文理解与专业术语识别能力,让专业场景语音交互更精准。 阿里发布 Qwen-Audio-3.0-TTS 语音模型,已上线OpenRouter:其文本转语音(TTS)功能已接入OpenRouter平台,实现更便捷的语音合成服务对接。

当前焦点与观察点

当前Qwen-Audio-3在语音智能领域处于持续迭代阶段,通过多模块优化完善语音交互全流程。在专业领域应用方面,其上下文与领域术语识别能力的强化,有望提升特定场景下的语音交互准确率;同时,全栈语音平台的布局也显示语音作为智能体核心交互入口的趋势。未来该技术的进一步落地与应用场景拓展值得关注。

相关报道

10 条在档