arXiv 人工智能· Egor Pakhomov, Erik Nijkamp·· 4 小时前AI 评分34
基于冻结 Last-Write 解析器评估 MemoryAgentBench 的冲突解决得分
Bookkeeping, Composition, or Unreachable Gold? Reading MemoryAgentBench's Conflict-Resolution Scores Against a Frozen Last-Write Resolver
AI 导读
研究通过执行 MemoryAgentBench 基准自身的“最新陈述获胜”规则构建无学习解析器,发现该规则能直接解答其冲突解决测试集中 80.25% 的问题。其余题目中有 67 项的标准答案在最新写入图中无法触达,占 262K 上下文多跳题目的三分之一。长上下文模型在规则可解题目上得分达 84.7% 与 82.6%,但在不可达题目上骤降至 10.4% 与 11.9%。
来源:arXiv 人工智能 · arxiv.org