google 正式发布了其在原生端到端语音交互方向的最新成果,正式推出全新实时语音大模型 gemini 3.8 live,以及面向高复杂度任务深度优化的 gemini 3.8 live extended thinking。这两大模型标志着 google 原生音频技术体系的一次关键跃迁——不仅将实时语音交互的响应速度与自然流畅性提升至全新水准,更首次在毫秒级低延迟语音流中实现了具备上下文感知的多阶段深层推理能力,从而重新定义了语音ai在专业级、高智力密度场景中的应用边界。
传统主流语音交互系统长期受限于架构瓶颈:为保障响应速度,往往牺牲推理深度;而若追求复杂问题求解,则不得不引入明显停顿或分段式交互,导致用户体验割裂。Gemini 3.8 Live 则聚焦于极致流式对话体验,通过增强语调建模、精准打断识别与动态上下文保持机制,显著提升了语音交互的真实感与临场感,使对话节奏更贴近人类自然交流方式。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在此基础上演进的 Gemini 3.8 Live Extended Thinking,则专为高阶认知型任务设计。该模型创新性地引入“边说边想(Think-While-Speaking)”机制,在前台维持无缝语音输出的同时,后台自动启动并行化多步逻辑推演、代码调试分析或跨领域技术诊断流程,彻底规避了传统方案中因思考耗时导致的对话中断或卡顿现象。
从落地实践来看,Live 系列模型正快速拓展语音智能的服务纵深。除基础对话外,其在实时故障排查、多步数理运算推导、交互式外语即时辅导、以及连续多意图指令解析与执行等典型高智力负载场景中,均展现出远超前代模型的综合表现力,并在多项权威语音理解、多模态推理及实时交互基准测试中刷新纪录,稳居行业第一梯队。
面向开发者与企业客户,Google 已同步开放 Gemini 3.8 Live 全系列能力——即日起可通过官方 API 接口与集成开发工作台直接调用。开发者可基于超低延迟原生音频通道,在智能终端设备、AI客服中台、实时编程协作者、远程协作会议系统等多样化产品形态中,高效构建具备全双工感知、持续推理与上下文自适应能力的新一代语音智能体。











