Gemini 3.8 Live 是什么
Gemini 3.8 Live 是 Google 推出的新一代实时多模态语音模型,主要面向语音助手、智能客服和 Voice Agent 等实时交互场景。模型支持原生语音对话、视觉理解、多语言交流及工具调用,可在保持自然对话节奏的同时执行实际任务。Google 同期推出 Gemini 3.8 Live Extended Thinking,进一步加入后台持续推理能力,使模型能够边与用户交流,边完成复杂分析、多步骤规划和工具调用,更适合需要较强任务执行能力的语音智能体。

Gemini 3.8 Live 的主要特性
- 实时音频对音频交互:支持原生语音输入和语音输出,针对实时对话进行了低延迟优化,可用于客服、语音助手和实时 AI Agent。
- 实时视觉理解:可以结合摄像头、屏幕或视频中的视觉信息进行近实时理解,使语音对话能够同时利用当前视觉环境。
- 97 种语言动态切换:模型能够在对话过程中自动识别语言,并在 97 种支持语言之间切换,无需重新启动会话。
- 异步工具调用:支持在后台执行工具和 API 请求,在任务处理过程中继续保持语音交流,减少等待外部服务时出现的对话中断。
- 多模态输入:支持文本、图像、音频和视频输入,单次输入上下文最高 131,072 Tokens,最大输出 65,536 Tokens。
- Google Search Grounding:支持调用 Google Search 获取实时信息,适合需要外部知识和最新数据的语音智能体。
Gemini 3.8 Live 与 Extended Thinking 的区别
Gemini 3.8 Live 更强调低延迟、自然对话和成本效率,适合需要即时响应的语音助手、客服和实时交互应用;模型采用交错式推理,并支持同步或异步工具调用。
Gemini 3.8 Live Extended Thinking 则针对复杂、多步骤任务设计,可以在与用户持续语音交流的同时进行后台推理,并异步执行多个工具。开发者还可以设置 Low、Medium、High 不同推理级别。
在 Extended Thinking 模式下,例如用户要求 AI 查询航班、酒店并制定旅行计划时,模型可以先通过语音告诉用户正在处理任务,同时继续在后台搜索、调用 API、比较结果,最终再给出完整答案,而不需要长时间保持沉默。
Gemini 3.8 Live 的模型表现
Google 公布的测试结果显示,Gemini 3.8 Live Extended Thinking 在 Artificial Analysis Speech-to-Speech Quality Index 中获得 82.6 分;在面向智能体任务完成能力的 τ-Voice 测试中达到 68.6%,在 Sierra τ-Voice Banking 测试中达到 35.1%,Big Bench Audio 得分达到 97.7%。
Gemini 3.8 Live 则主要面向大规模、低延迟语音应用,在 Speech Agent Arena 的用户偏好测试中位居第二。
Gemini 3.8 Live 的适用场景
- 实时 AI 语音助手:构建能够自然打断、连续交流和实时响应的语音助手。
- AI 客服与呼叫中心:结合业务 API 和企业系统处理查询、订单、售后及复杂客服流程。
- 语音 AI Agent:通过 Function Calling 连接搜索、数据库、预订系统等外部工具,完成实际任务。
- 实时教学与技术支持:结合语音、屏幕和视觉输入进行代码调试、设备排障、STEM 教学等多步骤任务。
- 企业办公助手:Extended Thinking 已应用于 Docs Live、Gmail Live 和 Keep Live 等场景,用语音处理复杂办公任务。
如何使用 Gemini 3.8 Live
1. 普通用户
Gemini 3.8 Live 已开始应用于 Search Live;Gemini 3.8 Live Extended Thinking 则进入 Gemini Live,并逐步应用于 Google Workspace 的 Docs、Gmail 和 Keep 等产品。不同功能的具体开放范围与 Google AI 订阅等级有关。
2. 开发者
开发者可以通过 Gemini API / Live API 调用:
gemini-3.8-live
或:
gemini-3.8-live-extended-thinking
两款模型也可以在 Google AI Studio 中体验和测试。
3. 企业用户
Google 正通过 Gemini Enterprise 向企业客户提供 Gemini 3.8 Live,其中部分企业能力目前处于 Private Preview,并计划进一步接入 Gemini Enterprise for Customer Experience 等平台。
Gemini 3.8 Live API 价格
Gemini Developer API 当前标准付费价格为:
- 文本输入:0.75 美元 / 100 万 Tokens
- 音频输入:3 美元 / 100 万 Tokens,约 0.005 美元/分钟
- 图像/视频输入:1 美元 / 100 万 Tokens,约 0.002 美元/分钟
- 文本输出:4.50 美元 / 100 万 Tokens
- 音频输出:12 美元 / 100 万 Tokens,约 0.018 美元/分钟
Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 当前采用相同的 Live API 标准价格,同时提供免费层。


