跳到正文
原文
Berkeley AI Research·· 2025-11-01AI 评分49

分治强化学习:不依赖TD学习的RL新范式

RL without TD learning

AI 导读

文章提出一种基于分治范式的强化学习算法,不依赖时序差分(TD)学习,通过将轨迹分为两段并组合其值更新完整轨迹,理论上可将Bellman递归次数从线性降至对数。该算法无需选择n步TD中的超参数,也不受高方差影响。近期与Aditya合作,已将其扩展到目标条件RL,据作者所知是首个此类工作。

来源:Berkeley AI Research · bair.berkeley.edu