跳到正文
原文
Berkeley AI Research·· 2025-11-01AI 评分46

分而治之:不依赖 TD 学习的强化学习算法

RL without TD learning

AI 导读

Berkeley AI Research 提出一种基于分而治之(divide and conquer)的 off-policy RL 价值学习算法,不再使用时间差分(TD)学习,后者因 Bellman 递归误差累积难以扩展到长时程任务。

来源:Berkeley AI Research · bair.berkeley.edu