跳到正文

#语音

今日 1 条
今天10月2日周五
9月25日周五
  1. Google DeepMind73

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上把近实时视频生成与语音对话原生结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。

    推荐理由:原文给出了实时视频形象与语音对话的原生耦合方式,读者可据此判断企业级实时多模态交互的落地形态。

9月23日周三
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:原文给出两款 TTS 模型的能力差异、基准排名和开放入口,读者可据此判断语音生成在创作与规模化场景中的分工。

9月16日周三