Berkeley AI Research·· 2025-11-01AI 评分43
无需 TD 学习的强化学习
RL without TD learning
AI 导读
研究者提出一种基于分治法(divide and conquer)的异策强化学习(off-policy RL)范式,无需依赖传统的时间差分(TD)学习。该算法将长轨迹拆分为子任务并组合价值,理论上能对数级减少 Bellman 递归次数,避免自举带来的误差累积。该范式已在目标条件强化学习(goal-conditioned RL)中实现,能有效扩展至复杂的长时域任务。
来源:Berkeley AI Research · bair.berkeley.edu