Berkeley AI Research·· 2025-11-01AI 评分53
Transitive RL:基于分治策略的可扩展离线强化学习算法
RL without TD learning
AI 导读
Berkeley AI Research发布Transitive RL算法,提出基于分治策略的离线强化学习范式。该方法通过递归分解轨迹解决长视界任务中的误差累积问题,无需像传统TD-n学习那样手动选择步长参数,在OGBench基准测试中达到最优性能。
来源:Berkeley AI Research · bair.berkeley.edu