跳到正文
原文
arXiv 人工智能· Dhananjay Ashok, Jesse Thomason, Jonathan May·· 2 天前AI 评分42

迈向代码 API 的交互式理解

Toward Interactive Understanding of Code APIs

AI 导读

研究人员提出 PAU 基准,通过仅提供黑盒 API 级交互访问,评估 AI 智能体对 Python 代码片段功能的无监督理解能力。评测显示前沿模型普遍表现吃力,表现最佳的 Claude-4-Opus 仍无法理解超过 45% 的测试集,主因在于过度自信导致探索不足。借鉴机器人学习的 AAC 范式后训练后,微调后的 Qwen3-8B 性能追平了 GPT-5-mini。

来源:arXiv 人工智能 · arxiv.org