Berkeley AI Research·· 2025-11-01AI 评分42
Berkeley AI Research:无需 TD 学习的强化学习
RL without TD learning
AI 导读
Berkeley AI Research 提出一种基于分治法(divide and conquer)的强化学习算法,无需传统时间差分(TD)学习即可有效扩展至长视野任务。该方法通过将轨迹二分并结合其价值进行更新,理论上将 Bellman 递归次数对数级缩减,并在目标条件强化学习(goal-conditioned RL)任务中解决了自举误差累积难题。
来源:Berkeley AI Research · bair.berkeley.edu