Berkeley AI Research·· 2025-11-01
不依赖 TD 学习的强化学习:用分治法扩展 off-policy RL
RL without TD learning
SI 导读
Berkeley AI Research 提出一种基于分治(divide and conquer)的强化学习算法,不依赖时序差分(TD)学习,可将 Bellman 递归次数从线性降为对数级,从而扩展到长时程任务。
SI 评分34
来源:Berkeley AI Research · bair.berkeley.edu