arXiv 人工智能· Nijesh Upreti, Chris Sypherd, Vaishak Belle·· 7 小时前AI 评分37
Agentic Cognitive Depth:评估 LLM 智能体的可操作标准
Agentic Cognitive Depth: Operational Criteria for Evaluating LLM Agents
AI 导读
研究提出了用于评估 LLM 智能体的“智能体认知深度”(Agentic Cognitive Depth)框架,以弥补仅依赖端到端任务成功率的局限。该框架在轨迹层面定义了语境敏感性(C)、时间连续性(T)、多模态协同(M)、自适应交互(A)与元认知监控(Mc)五项操作标准及微扰流程。该结构可直接扩展 GAIA、SWE-bench、WebArena 和 TRIP-Bench 等评测基准以实现逐项诊断。
来源:arXiv 人工智能 · arxiv.org