跳到正文
原文
arXiv 人工智能· Chenglin Yang·· 1 天前AI 评分50

评估防护栈而非单层:AI 智能体操作的确定性规则与 LLM 防护门是否独立失效?

Evaluate the Stack, Not the Layer: Do Deterministic and LLM Gates for Agent Actions Fail Independently?

AI 导读

针对 1,119 个标注 AI 智能体操作的研究表明,堆叠的多个 LLM 裁判存在显著耦合,两两组合的等效防护仅相当于 1.2 至 1.4 层。确定性规则层与单个 LLM 裁判组合则可达到 1.86 至 2.09 层的等效防护,表现接近错误独立相乘。此外,单层准确率无法预测联合收益,某规则包虽降低 20% 单独漏报率,却未带来新的联合覆盖。

来源:arXiv 人工智能 · arxiv.org