AI2 发布 Olmo-core 3:面向大型 MoE 的开源可扩展训练基础设施
AI2 发布 Olmo-core 3,这是其大语言模型训练框架的一次重要升级,重新设计了开源 MoE 训练系统,目标是把 MoE 训练扩展到万亿参数规模并保持计算效率。
推荐理由:原文给出 MoE 训练栈的关键改动和对比数据,可看到开源训练基础设施在效率上的取舍。
AI2 发布 Olmo-core 3,这是其大语言模型训练框架的一次重要升级,重新设计了开源 MoE 训练系统,目标是把 MoE 训练扩展到万亿参数规模并保持计算效率。
推荐理由:原文给出 MoE 训练栈的关键改动和对比数据,可看到开源训练基础设施在效率上的取舍。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型,让单模型评测耗时从数周投票缩短到数小时。
NVIDIA 发布表格数据开源基础模型 Kumo Tabular,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。
推荐理由:文章完整披露了表格基础模型的预训练数据构造与架构设计,可据此判断免训练推理在表格任务上的可行性边界。
Hugging Face 博客发布论文 ProvenanceGuard,一个运行在黑盒 MCP 智能体之上的生成后验证层,专门识别"跨来源混淆"——即内容属实但归错来源的说法。
H 公司发布 Holo4 系列智能体模型,包含 27B dense 和 35B-A3B MoE 两个尺寸,均可通过 H Models API 调用,同时开源基于 Nemotron 3 Nano Omni 后训练得到的 Holotron4 Nano。
推荐理由:Holo4 用同一套权重打通 GUI、代码、MCP 与 API,公开了完整轨迹,读者可据此评估通用计算机智能体的跨界面路线。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码实现设备端最高 3.13 倍、H100 上最高 2.66 倍解码加速,端到端最高提升 2.62 倍和 2.27 倍。
Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模超过 AlphaFold Database 30 倍,今日起通过网站门户、AlphaGenome API 和 Google Antigravity 技能向学术研究免费开放。
推荐理由:读者可据此了解 9 亿单核苷酸变异预测数据集如何把 AlphaGenome 的预测能力扩展到全基因组检索。