ElevenLabs 发布 Eleven v4 与 v4 Turbo,脚本可直接控制情绪表演
ElevenLabs 新语音模型来了,写台词时直接标注情绪、停顿、笑声就能让声音照着演,Turbo 版首次出声只要 150ms 左右,做播客和实时对话的可以试试。
ElevenLabs 发布 Eleven v4 和 Eleven v4 Turbo 两款语音模型。v4 允许在脚本中写入情绪、停顿、笑声、耳语和音效标签来控制表演,支持 90 多种语言,官方点名粤语、蒙古语和奥里亚语。Instant Voice Clone 用约 10 秒录音克隆声音,并通过 context stitching 和 speaker stability 保持长篇生成的连贯性。Turbo 面向实时对话,推理时间约 100ms,中位首次出声约 150ms,支持双向流式生成。
Elevenlab 发布两款新语音模型:Eleven v4 和 Eleven v4 Turbo 能根据文本内容“按剧情表演”声音 Eleven v4 的主要功能特点: 脚本可以直接控制表演: 在台词中写入情绪、停顿、笑声、耳语、动作和环境音效,也可以用自然语言说明一句话应该怎样说。 声音克隆兼顾相似度和表现力: Instant Voice Clone 可用大约 10 秒录音创建声音,Professional Voice Clone 重新支持 v4 的完整情绪范围。 长篇和重生成更连贯:context stitching 负责衔接不同生成片段的节奏与状态,speaker stability 尽量让角色在旁白、对话和返工片段里保持同一声线。 支持多人对话和发音控制: 同一脚本可安排多个说话者、接话关系和音效,并通过 IPA 与发音词典固定姓名、缩写和专业词的读法。 覆盖 90 多种语言: 官方点名支持粤语、蒙古语和奥里亚语,演示还展示了加泰罗尼亚语旁白与音效标签。 Turbo 为实时对话降低等待:模型推理时间约为 100ms,中位首次出声约为 150ms,并支持双向流式生成。 Your browser does not support the video tag. 🔗 View on Twitter 💬 2 🔄 0 ❤️ 3 👀 1638 📊 2 ⚡