Hugging Face 发布 Open TTS Leaderboard:面向多语言 TTS 与声音克隆的可扩展评测
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型,让单模型评测耗时从数周投票缩短到数小时。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型,让单模型评测耗时从数周投票缩短到数小时。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上把近实时视频生成与语音对话原生结合,让企业智能体具备会听、会看、会说的动态视觉形象,即日起在 Gemini Enterprise 上线。
推荐理由:原文给出了实时视频形象与语音对话的原生耦合方式,读者可据此判断企业级实时多模态交互的落地形态。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:原文给出两款 TTS 模型的能力差异、基准排名和开放入口,读者可据此判断语音生成在创作与规模化场景中的分工。
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音对话模型,分别面向规模化低成本场景和高复杂度多步推理任务。
推荐理由:官方给出语音对话模型的两档定位与多语言、后台调用工具等能力细节,可供开发者判断接入场景。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案在沙特及中东地区的部署,合作规模达数亿欧元。双方将聚焦网络安全与语音领域,并开发阿拉伯语表现强劲的前沿模型;Mistral 还将探索使用 HUMAIN 的数据中心基础设施,双方计划在沙特面向受监管行业推出联合市场策略。