Berkeley AI Research·2025-11-01 17:00· 2025-11-01AI 评分34无需 TD 学习的强化学习:分治法如何扩展到长时程任务RL without TD learningAI 导读一篇新研究提出用"分治"范式替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹对半切分并组合子段价值来更新整体价值,理论上把 Bellman 递归次数从线性降到对数级。来源:Berkeley AI Research · bair.berkeley.edu#论文/研究#推理#数据/训练