跳到正文
原文
Google Research·· 14 天前AI 评分38

Google Research 提出 Retrieve-for-Train:用离线 RL 编译扩散检索器绕过推理瓶颈

Bypassing inference bottlenecks: Accelerating complex AI search with Retrieve-for-Train

AI 导读

Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现符合奖励的 fan-out 查询并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,在推理时以单次非自回归前向直接生成完整结果集,无需 CoT 推理 token。

来源:Google Research · research.google