Berkeley AI Research·· 2025-11-01AI 评分49
分治强化学习:不依赖TD学习的RL新范式
RL without TD learning
AI 导读
文章提出一种基于分治范式的强化学习算法,不依赖时序差分(TD)学习,通过将轨迹分为两段并组合其值更新完整轨迹,理论上可将Bellman递归次数从线性降至对数。该算法无需选择n步TD中的超参数,也不受高方差影响。近期与Aditya合作,已将其扩展到目标条件RL,据作者所知是首个此类工作。
来源:Berkeley AI Research · bair.berkeley.edu