跳到正文
原文
arXiv 人工智能· Jose Tupayachi, Xueping Li, Soham Das·· 8 小时前AI 评分34

在可再生公地中学习避免崩溃的资源收获:一种拉格朗日框架

Learning to Harvest Without Collapse in a Regenerative Commons: A Lagrangian Framework

AI 导读

该研究提出一种非平稳拉格朗日框架,将可再生公地建模为带消耗预算的约束马尔可夫博弈或约束多智能体 MDP,使多智能体在追求收益的同时避免资源耗尽。论文针对折现奖励与终端成本推导了可行性证明及约束 Nash 保证,能直接利用无约束问题的解构建约束策略序列。在 Gordon-Schaefer 渔业环境中结合约束 IPPO 和 MAPPO 进行的实验,验证了消耗预算对资源存留率与收益的影响。

来源:arXiv 人工智能 · arxiv.org