跳到正文
原文
Berkeley AI Research·· 2025-11-01AI 评分42

Berkeley AI Research:无需 TD 学习的强化学习

RL without TD learning

AI 导读

Berkeley AI Research 提出一种基于分治法(divide and conquer)的强化学习算法,无需传统时间差分(TD)学习即可有效扩展至长视野任务。该方法通过将轨迹二分并结合其价值进行更新,理论上将 Bellman 递归次数对数级缩减,并在目标条件强化学习(goal-conditioned RL)任务中解决了自举误差累积难题。

来源:Berkeley AI Research · bair.berkeley.edu