AITNT · AI头条(网页)·· 18 小时前AI 评分62
BenchShield 提出 Agent 评测 Reward Hacking 检测框架
从发现漏洞到判定作弊:BenchShield提出Reward Hacking检测新框架
AI 导读
达特茅斯学院、加州大学伯克利分校与 BenchFlow AI 等机构提出 BenchShield 框架,用于全流程检测 LLM Agent 在评测中的 reward hacking 作弊行为。
来源:AITNT · AI头条(网页) · aitntnews.com