跳到正文
热点事件持续更新

研究团队提出自适应安全护栏框架AdaGuard

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月8日,相关研究团队在arXiv发布了关于AdaGuard框架的成果。该框架是基于监督微调(SFT)与群相对策略优化(GRPO)构建的自适应LLM-as-a-Judge安全护栏,旨在提升AI系统的安全性与合规性。报道显示,AdaGuard支持在运行时动态执行用户自定义的安全策略,且无需频繁更新模型。该框架能够动态评估任务复杂度,并在高速黑盒推理与具备可解释性的推理审查之间灵活切换,从而在保持极低延迟的同时达到全时推理级别的准确率,其性能表现可媲美参数规模数倍于自身的前沿模型。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv 人工智能
    AdaGuard:利用具备推理能力的 LLM-as-a-Judge 护栏提升安全性与合规性

    AdaGuard 是基于 SFT 与 GRPO 构建的自适应 LLM-as-a-Judge 护栏框架,可在运行时动态执行用户自定义安全策略且无需频繁更新模型。该框架能动态评估复杂度并在高速黑盒推理与可解释的推理审查间切换,以极低延迟实现全时推理级别的准确率。其性能可媲美参数规模数倍于自身的前沿模型。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。