跳到正文
原文
arXiv 机器学习· Haoze Yan, Julien Roze, Ved Upadhyay, Unal Tatar, Thibaut Mastrolia·· 2 天前AI 评分36

人类何时应收回控制权?动荡 AI 风险下的最优任务委派

When Should a Human Take Back Control? Optimal Delegation under Turbulent AI Risk

AI 导读

研究提出一种应对动荡 AI 风险的连续时间自适应人类监督框架与 Hawkes-PPO 算法,解决 AI 故障聚集与级联风险下的最优控制问题。该框架将风险建模为自激动态过程,联合优化监控投入以及在人机协作与完全 AI 委派间的切换策略,平衡运行收益、监督成本与级联失败风险。在合成环境中,Hawkes-PPO 取得了优于固定模式的风险调整目标收益,并接近全信息基准。

来源:arXiv 机器学习 · arxiv.org