arXiv 人工智能· Hongmin Li, Wanli Zhao·· 6 小时前AI 评分35
科学搜索智能体在何处失效:基于暴露与检查尝试的决策检查点审计
Where Scientific Search Agents Fail: Decision-Checkpoint Auditing of Exposure and Inspection Attempts
AI 导读
研究提出决策检查点协议,通过记录推理中的观测与工具动作,细粒度审计科学搜索智能体在目标论文暴露、检查与最终回答阶段的失效原因。在 AutoResearchBench Deep 的 540 道可回答问题评测中,关键词搜索与 read-first 准确率均为 24.6%(原始搜索为 17.8%),但 read-first 产生的证据搜索调用多出 27.4%,目标检查尝试达 199 次。
来源:arXiv 人工智能 · arxiv.org