Google 推出了 Gemini 3.8 Live 和 Extended Thinking,支持通过后台 API 调用实现近乎实时的语音处理,并自动检测 97 种语言。这些模型支持持续多任务处理,将语音与推理和工具执行无缝集成,无需用户暂停。性能亮点包括在语音质量基准测试中名列前茅。该模型已与 Agora 和 LiveKit 等平台集成,具备 SynthID 音频水印功能,用于 AI 识别,推动语音 AI 向智能、连续的代理交互方向发展。
评论 (0)
0/300





首页
