应对未知随机延迟约束强化学习的CCPL方法
在现实世界的约束强化学习中,违规行为常带有延迟和随机性,这会导致传统方法误判,转而惩罚紧邻违规前的动作,而非真正的肇事动作。为此,研究人员提出了CCPL(Causal Consequence-Penalized Learning)方法。该方法包含两项核心技术:一是利用后果延迟分布学习自适应有效折扣,进而构建延迟修正的Bellman算子;二是引入因果归因机制。这项研究攻克了未知随机延迟下的约束强化学习收缩证明难题,显著提升了智能体在复杂真实场景下决策的安全性和可靠性。