Google Research 提出 Retrieve-for-Train:用离线 RL 加速复杂 AI 搜索查询扩展
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扩展并蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次前向的查询 fan-out。该方法在 Gemma3-4B 和 Qwen3-4B 上微调,绕过测试时 CoT 推理 token 的开销,同时满足多样性、覆盖度等集合级属性,相关论文已被 ICML 2026 收录。