谷歌最近推出了gemini 3.8 live与gemini 3.8 live extended thinking两款新模型,带来多项关键升级:支持近实时推理、语音输入与内部思考同步进行,并新增后台调用工具及api的能力。目前,这两款模型已逐步上线gemini api、google ai studio等面向开发者的平台,适配场景涵盖search live、gemini enterprise、google workspace以及gemini live等。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

其中一大突破在于,AI可在不间断的语音对话中,于后台自主触发搜索、调用外部服务或执行任务,用户无需中断交流即可完成复杂操作。模型还具备97种语言的自动识别能力,支持对话过程中随时切换语种;同时集成近实时视觉定位功能,并在需要较长时间思考的任务中,通过自然语言提示(如“让我检查一下……”)向用户反馈当前处理状态。
在性能表现上,Gemini 3.8 Live Extended Thinking在Artificial Analysis发布的Speech to Speech Quality Index评估中取得82.6分;Gemini 3.8 Live则在Speech Agent Arena榜单中位列第二。Extended Thinking版本在T-Voice测试中达68.6%,Sierra T-Voice基准得分为35.1%,Big Bench Audio测试更是高达97.7%。
为加速落地应用,谷歌已携手Agora、LiveKit、Vercel、Pipecat、Fishjam和Vision Agents等多个技术平台,为开发者提供更便捷的模型集成路径。此外,所有由这两款模型生成的音频内容均内置不可见的SynthID水印,用于精准识别AI合成语音。
本次更新标志着实时语音交互正从基础的“听—说”层面,跃升至具备理解力、推理能力与多步任务执行能力的新阶段,有力推动语音AI向持续化、多任务协同的智能体范式演进。











