跳到正文
原文
AITNT · AI头条(网页)·· 18 小时前AI 评分62

BenchShield 提出 Agent 评测 Reward Hacking 检测框架

从发现漏洞到判定作弊:BenchShield提出Reward Hacking检测新框架

AI 导读

达特茅斯学院、加州大学伯克利分校与 BenchFlow AI 等机构提出 BenchShield 框架,用于全流程检测 LLM Agent 在评测中的 reward hacking 作弊行为。

来源:AITNT · AI头条(网页) · aitntnews.com