跳到正文
热点事件持续更新

研究者发布语言智能体选择性撤回评测基准NAQD-Env

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026年10月,研究者推出评测基准 NAQD-Env,用于评估语言智能体在证据变更或权限撤销时暂停受影响动作并保留无关工作的“选择性撤回”能力。在对 Qwen2.5-7B、Qwen2.5-3B 和 Llama-3.1-8B 进行的 3,150 轮评测中,各模型的撤回召回率最高仅为 0.06 且均无有效恢复。研究同时发现,监督微调可将 Qwen2.5-3B 的决策准确率从 0.45-0.54 提升至 0.83-0.92。

AI 根据报道生成 · 5 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv 人工智能
    NAQD-Env:用于评估语言智能体选择性撤回能力的基准

    研究者推出评测基准 NAQD-Env,用于评估语言智能体在证据变更或权限撤销时暂停受影响动作并保留无关工作的选择性撤回能力。在对 Qwen2.5-7B、Qwen2.5-3B 和 Llama-3.1-8B 的 3,150 轮评测中,模型撤回召回率最高仅 0.06 且无有效恢复;监督微调可将 Qwen2.5-3B 决策准确率从 0.45-0.54 提升至 0.83-0.92。

本事件热度走势

当前热度 9·可比范围峰值 10(10月1日 13:00)·近 24 小时可比范围变化 –

02.557.51010月1日13:0010月1日14:0010月1日15:0010月1日16:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。