跳到正文
原文
arXiv 人工智能· Chengyang Shi, Xianglin Ji, Jintao Huang, Jicheng Wang, Yifeng He, Jiachen Liu·· 5 小时前AI 评分54

研究提出 OEB:仅凭执行日志评估 AI 智能体开放式研究认知过程

Open-Endedness Bench: Measuring Epistemic Process from Agent Records

AI 导读

研究团队提出 OEB(Open-Endedness Bench),一种无需参考答案或最终得分、仅通过解析执行记录来评估 AI 智能体认知过程的方法。该方法将记录编译为统一的认知事件图,对照智能体提出的命题与实际执行动作返回的证据,评估证据支持、实验验证、假设修正与防奖励作弊等能力。对 3 个基准中 12 项任务的 119 次运行评测显示,智能体声称的改进中仅 16-29% 真实有效。

来源:arXiv 人工智能 · arxiv.org