谷歌推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking 实时对话模型,支持 97 种语言切换
谷歌出了两个新的实时对话模型,支持 97 种语言切换,能自动检测语言,还能在对话中调用工具,比之前的模型更智能。
谷歌宣布推出其最新的实时对话模型 Gemini 3.8 Live 和 3.8 Live Extended Thinking。Gemini 3.8 Live 在智能和并行推理方面有重大升级,支持 97 种语言切换,在 Speech Agent Arena 排名第二。Gemini 3.8 Live Extended Thinking 在多项基准测试中表现领先,如 τ-Voice 智能体任务完成率达 68.6%,在 Big Bench Audio 得分 97.7%,同时保持有竞争力的定价。两款模型均可在对话中自动检测并切换语言,且支持工具与 API 调用,保持对话流畅不中断。
IT之家 9 月 16 日消息,当地时间 9 月 15 日,谷歌宣布推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。谷歌称这是其迄今最先进的实时对话模型,在智能和并行推理方面有重大升级,让 AI 对话更直观智能。 两款新品分别为面向规模部署与成本优化的 Gemini 3.8 Live ,以及面向高复杂度任务、强化多步推理能力的 Gemini 3.8 Live Extended Thinking 。 Gemini 3.8 Live 兼顾对话智能、流畅交流和视觉理解,面向规模化与成本效率。Gemini 3.8 Live Extended Thinking 面向高复杂度任务,具备更强的智能和多步推理能力。 Gemini 3.8 Live Extended Thinking 在多项基准测试中取得领先成绩,拿下 Artificial Analysis 语音对语音质量指数总排名第一( 82.6% ),在 τ-Voice 智能体任务完成率达 68.6% ,在 Sierra 的 τ-Voice-banking 基准测试达 35.1% ;推理能力方面,在 Big Bench Audio 得分 97.7% ,同时仍保持有竞争力的定价。 Gemini 3.8 Live 则获得用户高认可度,在 Speech Agent Arena 排名第二,且具备出色成本效益,适合大规模部署。两款模型在 ServiceNow EVA-Bench 语音智能体基准测试中,成功平衡准确性与对话质量,推高了复杂工作流的帕累托前沿。 Gemini 3.8 Live 可近实时处理视觉输入,在对话中自动检测并切换 97 种支持的语言,还能在后台执行工具与 API 调用,同时保持对话流畅不中断。 针对需要深度推理的任务,Gemini 3.8 Live Extended Thinking 可实现推理与发言同步进行,在不中断对话流畅度的前提下提升复杂工作流智能水平,通过“让我确认一下…”这类早期语言提示自然回应提示,还可实时讲解多步后台任务处理进度。 开发者可通过 Gemini Live API ,在声网、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents 等平台轻松构建部署高性能语音驱动界面;谷歌还与 Salesforce、Genspark、Lumeris 等企业开展合作,共同推进生态建设。 谷歌所有 AI 生成音频都添加了 SynthID 隐形水印,直接嵌入音频输出,可检测 AI 生成内容,帮助防止虚假信息传播。 目前 Gemini 3.8 Live 已开始推送:开发者可在 Gemini API 和 Google AI Studio 使用;企业用户可在 Gemini Enterprise 抢先体验,即将登陆 Gemini Enterprise for Customer Experience;全用户可在 Search Live 体验。 Gemini 3.8 Live Extended Thinking 也已开启推送:开发者可在 Gemini API 和 Google AI Studio 使用;企业用户可在 Gemini Enterprise 抢先体验,即将登陆 Gemini Enterprise for Customer Experience 以及 Google Workspace 企业客户;普通用户可在 Gemini Live 体验,Google AI Pro 和 Ultra 订阅者可在 Google Workspace 的 Docs 使用,所有 Google AI 订阅者可在 Gmail 和 Keep 体验。