Hugging Face 发布 Open TTS Leaderboard:面向多语言 TTS 与声音克隆的可扩展评测
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型,让单模型评测耗时从数周投票缩短到数小时。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型,让单模型评测耗时从数周投票缩短到数小时。
英国 AI Security Institute(AISI)正使用 EvalEval 的 Every Eval Ever schema 和 Evaluation Cards 平台公开评测结果。
Google Research 提出 ToolGrad,一种“答案优先”的工具调用数据集生成范式:先生成 ground-truth 工具链,再反推用户 prompt,从而以更低成本生成更复杂的长程工具调用数据。
Microsoft Research 推出 MindTopo 基准,用于评测多模态大语言模型的拓扑推理能力,涵盖连续性、分离、顺序、包围与打结五类任务,并区分静态推理与交互规划两个层级。测试显示,当前闭源与开源模型在静态识别上表现明显优于交互规划,且均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧保留结构约束时才有帮助。