9月28日,谷歌官方宣布,在gemini 3.8 live正式发布的基础上,全新推出集成live avatar功能的gemini 3.8 live版本,为原生实时对话模型赋予接近实时的视觉交互能力。该功能深度融合视频生成与语音技术,构建出具备倾听、观察及动态视觉响应能力的智能交互体验,现已面向gemini enterprise用户开放。
Live Avatar支持高精度唇形同步、自然微表情呈现以及流畅的对话轮次切换,可同步处理视觉与音频输入信号。依托Gemini强大的多模态推理能力,系统支持异步工具调用——即在后台自动触发外部服务并获取所需数据,全程不打断当前对话流。在语言支持方面,该功能实现原生多语种语音到语音实时转换,覆盖全球97种语言,切换过程中保持视频画质无损,杜绝视觉漂移现象。
企业客户不仅可从预置形象库中选择虚拟形象,还可基于高质量参考图像进行深度定制,确保生成的AI形象在外观相似度与品牌调性上高度一致。目前,该功能仅对谷歌企业白名单用户开放。所有由AI生成的音视频内容均通过SynthID技术嵌入不可见水印,直接写入输出流,从而有效遏制虚假信息传播与内容归属误判。
使用AIsa生成图像与视频。仅需一个API密钥即可调用Gemini 3 Pro Image(图像)和Qwen Wan 2.6(视频)。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜











