跳到正文

全部动态

今日 3 条
今天10月2日周五
  1. Hugging Face Blog43

    ServiceNow CoreAI 的 AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 推出 AutoSynthData,利用目标模型的失败案例与更强教师的成功轨迹定位能力缺口,再生成并校验新任务用于后训练。系统从评测中提炼「能力规格卡」指导生成器造题,不泄露原始 prompt、实体或验证器细节,并随模型提升动态调整课程。该流程已在 EnterpriseOps Gym 数据集上演示。

10月1日周四
9月30日周三
9月29日周二
9月25日周五
9月24日周四
9月21日周一
9月19日周六
  1. Google Research27

    Google Research 推出 MilleMiglia:面向中距离物流的真实实例生成器

    Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,可为中距离(middle-mile)物流生成真实且保护隐私的基准数据,代码与文档已在 GitHub 开源。该工具针对中距离运输的多商品流特性,建模货物在配送中心间的换车、分拣与时间窗衔接,而这一环节此前因企业网络拓扑与需求数据敏感、缺乏公开高质量数据,研究投入远少于首末公里配送。

9月18日周五
9月16日周三
  1. Google Research35

    Google Research 提出 Retrieve-for-Train:用离线 RL 加速复杂 AI 搜索查询扩展

    Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扩展并蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次前向的查询 fan-out。该方法在 Gemma3-4B 和 Qwen3-4B 上微调,绕过测试时 CoT 推理 token 的开销,同时满足多样性、覆盖度等集合级属性,相关论文已被 ICML 2026 收录。

9月11日周五
9月7日周一
9月4日周五
  1. Google Research25

    Google 研究:跨人群多基因风险评分的迁移学习

    Google 研究团队评估了迁移学习能否改善非欧洲人群的多基因风险评分(PRS),用 UK Biobank 约数十万欧洲样本向 Biobank Japan 近 20 万日本样本迁移,覆盖 BMI、血压、血脂等 8 项临床性状。结果显示,目标人群样本达 15k 以上时,纯目标人群模型反超混合欧洲数据的模型;欧洲数据仅在目标样本极少(如 5,000)时有增益,且增益窗口随性状遗传相关性而异。

8月24日周一
8月21日周五
8月17日周一
8月13日周四
  1. Microsoft Research32

    MindTopo 基准揭示 VLM 的空间推理能力短板

    Microsoft Research 推出 MindTopo 基准,用于评测多模态大语言模型的拓扑推理能力,涵盖连续性、分离、顺序、包围与打结五类任务,并区分静态推理与交互规划两个层级。测试显示,当前闭源与开源模型在静态识别上表现明显优于交互规划,且均远低于人类水平;失败多出现在规划阶段而非感知阶段,模型在场景变化后难以维持结构关系。图像与视频生成仅在单帧保留结构约束时才有帮助。

8月3日周一
7月29日周三
7月26日周日
4月20日周一
  1. Berkeley AI Research36

    GRASP:面向世界模型的梯度规划器,实现更长视野规划

    GRASP 是一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现时间并行优化、在状态迭代中注入随机性以探索、并重塑梯度让动作获得干净信号,避免经由高维视觉模型的脆弱"状态-输入"梯度。该方法由 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Bar 等参与提出,针对长视野规划中优化病态、非贪心局部极小值与高维潜空间失效模式问题。

3月13日周五
1月10日周六
  1. Berkeley AI Research28

    伯克利提出基于信息量的成像系统设计框架,可预测四大成像领域性能

    伯克利 AI 研究院提出一种基于互信息的成像系统评估与优化框架,仅用含噪测量值和噪声模型即可量化测量所含信息量,无需任务专用解码器。在 NeurIPS 2025 论文中,该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域均能预测解码器性能,优化后的设计达到端到端方法水平,且内存与算力需求更低。