2026年09月16日,Google 正式发布新一代实时语音模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,进一步强化 Gemini 在实时语音交互和 Voice Agent 场景中的能力。两款模型目前均已进入 Gemini API 的 Stable 模型列表。
其中,Gemini 3.8 Live 主要面向低延迟、大规模实时语音应用,在保持自然语音交互的同时支持文本、图像、音频和视频等多模态输入。模型能够近实时理解视觉内容,并可在一次对话过程中自动识别并切换 97 种语言。此外,模型支持同步及异步工具调用,可以在语音 Agent 中连接搜索、业务 API 或其他外部服务。
此次更值得关注的是同步推出的 Gemini 3.8 Live Extended Thinking。与普通 Live 模型强调快速响应不同,Extended Thinking 面向需要复杂规划和多步骤推理的语音任务,可以在与用户持续交流的同时进行后台推理和异步工具调用。例如,当用户要求 AI 查询航班、酒店并完成行程规划时,模型可以先通过语音回应“正在查询”,随后继续在后台调用多个工具、比较结果,最终再返回完整答案,减少传统语音 Agent 执行复杂任务时长时间沉默的问题。
开发者还可以为 Extended Thinking 设置 Low、Medium、High 三档推理深度,用于在响应速度与复杂推理能力之间进行调整。Google 公布的测试数据显示,Gemini 3.8 Live Extended Thinking 在 Artificial Analysis Speech-to-Speech Quality Index 中获得 82.6 分,τ-Voice 智能体任务完成测试达到 68.6%,Big Bench Audio 得分为 97.7%。
目前,Gemini 3.8 Live 与 Extended Thinking 均已向开发者开放,可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 正逐步应用于 Search Live;Extended Thinking 则开始进入 Gemini Live,以及 Docs Live、Gmail Live 和 Keep Live 等 Google 产品。企业端目前已在 Gemini Enterprise 中进入 Private Preview。
从这次更新可以看出,Google 对实时语音模型的定位已经不只是“和 AI 聊天”,而是进一步向能够持续交流、理解环境并自主调用工具完成任务的语音 Agent演进。尤其 Extended Thinking 将实时语音交互与后台持续推理结合,为客服、技术支持、教育、办公助手和复杂业务 Agent 等场景提供了新的实现方式。


