arXiv 人工智能· Haomin Luo (University of Cambridge, Models2 AI)·· 18 小时前AI 评分34
体验时代的自发现强化学习:学习历史是资产还是负担?
Self-discovering RL in the Era of Experience: Is Learning History an Asset or a Burden?
AI 导读
研究人员对超越 PPO 达 SOTA 的自发现强化学习规则 Disco103 展开首个因果机制审计,评估学习历史是资产还是负担。审计发现循环历史可将可用奖励尺度扩展至 6 个数量级(归零固定下仅 3 个),且历史不匹配的惩罚源于持续钳制。在环境变化下控制回放保留会反转其相对 DQN 的适应优势,该框架已迁移验证至 OPEN 规则。
来源:arXiv 人工智能 · arxiv.org