arXiv 人工智能· Melissa Kazemi Rad, Sihui Dai, Isha Slavin, Kushal Chawla, Mann Patel, Jian Ni, William M. Campbell, Stephen Rawls, Sambit Sahu·· 7 小时前AI 评分41
AdaGuard:利用具备推理能力的 LLM-as-a-Judge 护栏提升安全性与合规性
AdaGuard: Enhancing Safety and Policy Compliance with Reasoning-Enabled LLM-As-A-Judge Guardrails
AI 导读
AdaGuard 是基于 SFT 与 GRPO 构建的自适应 LLM-as-a-Judge 护栏框架,可在运行时动态执行用户自定义安全策略且无需频繁更新模型。该框架能动态评估复杂度并在高速黑盒推理与可解释的推理审查间切换,以极低延迟实现全时推理级别的准确率。其性能可媲美参数规模数倍于自身的前沿模型。
来源:arXiv 人工智能 · arxiv.org