跳到正文
原文
arXiv 人工智能· Jeffrey Willette, Krishna C. Puvvada, Boris Ginsburg·· 6 小时前AI 评分43

保持专注:长周期 AI 智能体可靠性基础测试

Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability

AI 导读

研究人员推出 Long-Transduction 诊断基准,用于评测模型在长生成过程中持续执行依赖上下文操作的能力。对 7 款开源权重模型的评测显示,上下文长度从 4-128K 扩展时性能下降 62.8%,改变输入格式导致下降 36.5%,增加局部任务复杂度则导致下降 39.9%。这些失效现象构成了长周期 AI 智能体工作流中的关键可靠性缺陷。

来源:arXiv 人工智能 · arxiv.org