跳到正文
原文
arXiv 机器学习· Junwei Quan, Evgenii Opryshko, Rohan Subramani, Igor Gilitschenski·· 7 小时前AI 评分40

RH-Detect:用于大模型奖励黑客检测的统一评测基准

RH-Detect: A Unified Benchmark for Reward Hacking Detection

AI 导读

研究团队推出 RH-Detect 统一基准,整合 11 个公开数据集共 92,761 条数据,用于评测大语言模型的奖励黑客检测能力。在 5,021 个开放式评测单元中,最佳模型综合 AUROC 达 0.962 且准确率超 93%,但在多轮工具调用场景下准确率下降 10.7 至 15.9 个百分点。实验还发现移除思考过程对各模型影响不一,该基准亦可用于 SFT 与 GRPO 训练以提升检测性能。

来源:arXiv 机器学习 · arxiv.org