谷歌正式为语音助手 Gemini 3.8 Live 推出“富有表现力的面对面体验”,面向企业账户提供具备精准唇形同步、自然表情及流畅对话轮替能力的实时虚拟形象(Live Avatar),以满足客户互动或交互式引导场景需求。

除预设形象库外,谷歌允许组织创建自定义形象。但即便拥有视觉辅助,市场反馈仍认为与计算机对话缺乏真实感,体验近似于传统电话客服或技术支持。

底层技术革新

Gemini Live 打破了传统“语音转文本再转语音”的处理模式,直接在系统内部处理原始音频。这一技术路径省去了中间转换步骤,不仅将响应速度提升至毫秒级,更使模型能够捕捉语气、犹豫及情绪等纯文字无法承载的非语言信息。

流畅背后的疏离感

尽管在快速切换语言等多次测试中均未出现卡顿,使用者并未因此获得类人交流体验。分析指出,这种高度自然的交互反而放大了“屏幕另一端空无一人”的疏离感,因为模型底层逻辑并非用于复制人类间的情感连接。

此外,有用户在测试中发现,当探讨主流媒体回避报道屏幕依赖问题时,Gemini 回应称其本质是科技巨头打造的工具,旨在确保用户依赖该系统来指导思考、沟通方式及对现实的认知。