谷歌上周推出Gemini 3.8 Live及Live Extended Thinking模型,称其为迄今最先进的实时对话模型,旨在为开发者和企业提供构建生产级语音智能体的基础模块。在此基础上,谷歌进一步发布Gemini 3.8 Live with Live Avatar,引入视频元素,将近乎实时的视觉存在与实时对话相结合,打造具备动态视觉人格、能听、看、说的多模态交互体验。

多模态交互与企业级应用

该功能支持精准口型同步、自然表情及流畅的轮流对话。依托Gemini的高级推理能力,Live Avatar能在保持活跃对话的同时,在后台触发工具调用并获取数据。谷歌展示了写实与卡通两种风格的虚拟形象,强调其可通过面部表情进行交流,实现更自然的互动。

目前,Live Avatar专为列入白名单的企业级Gemini客户设计。谷歌提供多样化的预设虚拟形象库,也允许企业利用高质量参考图像定制形象,以保留品牌风格或角色身份。为确保安全与透明,所有形象均内置严格的安全保障措施,并使用谷歌SynthID进行水印标记。

尽管该技术旨在优化客户服务和销售支持,让用户在未来可能频繁接触到此类AI代理,但鉴于当前公众对AI生成内容的复杂情绪,其市场接受度仍待观察。