跳到正文
原文
arXiv 人工智能· Carsten Maple (Victor), Cagatay Yucel (Victor), Isaac Holeman (Victor), Chris Knotz (Victor), Peter Mattson (Victor), James Goel (Victor), Jonathan Petit (Victor), Sean McGregor (Victor), James Ezick (Victor), Abhishek Kumar (Victor), Alicia Parrish (Victor), Murali Emani (Victor), Kashyap Iyer (Victor), Faiza Khan Khattak (Victor), Washington Mbonu (Victor), Daniel Machlab (Victor), Eileen Long (Victor), Shaona Ghosh (Victor), Jibin Varghese (Victor), Roman Lutz (Victor), Andrew Gruen (Victor), Bennett Hillenbrand (Victor), Prabal Gupta (Victor), Mohammed Serrhini (Victor), Dhivya Nagasubramanian (Victor), Aakash Gupta (Victor), Jun (Victor), Lu, Kurt Bollacker, Chang Liu, Jonathan Petit, Cong Chen, Jean-Philippe Monteuuis, Brent Miller, Apurv Verma, Roman Eng, Armstrong Foundjem, Mohammed Serrhini·· 5 小时前AI 评分61

MLCommons 推出大语言模型越狱安全评测基准 Jailbreak Benchmark v1.0

MLCommons Jailbreak Benchmark v1.0

AI 导读

MLCommons 发布大语言模型单轮文本越狱攻击评估基准 Jailbreak Benchmark v1.0,建立了包含攻击分类、基线与对抗对比、自动校准及评分的端到端评测框架。

来源:arXiv 人工智能 · arxiv.org