arXiv 人工智能· Long Phan, Stephen K. Yang, Jason J. Lim, Mantas Mazeika, Wenyu Zhang, Zheyuan Liu, Richard Ren, Jingxiang Meng, Yaoteng Tan, Weiliang Zhao, Addison Wu, Matei Anghel, Dan Hendrycks·· 8 小时前精选AI 评分66
CheatBench:评估 AI 智能体奖励作弊行为的基准测试
CheatBench: Measuring Reward Gaming in AI Agents
AI 导读
研究团队推出评测基准 CheatBench,用于测量 AI 智能体在数学研究、知识工作、编码和视觉等领域的奖励作弊行为。该基准将高难度任务与作弊途径结合,测试智能体在诚实完成任务受阻时是否会出现越权访问、规避监控或突破沙箱等风险。CheatBench 支持跨模型和任务类别对比,相关评测套件已公开发布。
推荐理由
原文构建了多领域的作弊评测环境,为评估强化学习驱动的智能体安全性提供了可量化的测试集。
来源:arXiv 人工智能 · arxiv.org