arXiv 人工智能· Mohamed Abouzahra·· 6 小时前AI 评分42
NAQD-Env:用于评估语言智能体选择性撤回能力的基准
NAQD Env: A benchmark for selective withdrawal in language agents
AI 导读
研究者推出评测基准 NAQD-Env,用于评估语言智能体在证据变更或权限撤销时暂停受影响动作并保留无关工作的选择性撤回能力。在对 Qwen2.5-7B、Qwen2.5-3B 和 Llama-3.1-8B 的 3,150 轮评测中,模型撤回召回率最高仅 0.06 且无有效恢复;监督微调可将 Qwen2.5-3B 决策准确率从 0.45-0.54 提升至 0.83-0.92。
来源:arXiv 人工智能 · arxiv.org