热点事件观察中
研究人员提出黑盒API交互理解基准PAU
1 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
2026年9月29日,研究人员在 arXiv 发布成果,提出 PAU 基准,通过仅提供黑盒 API 级交互访问,评估 AI 智能体对 Python 代码片段功能的无监督理解能力。评测结果显示,当前前沿模型普遍表现吃力,表现最佳的 Claude-4-Opus 仍有超过 45% 的测试集无法理解,主要原因在于模型过度自信导致探索不足。此外,借鉴机器人学习的 AAC 范式进行后训练后,微调后的 Qwen3-8B 在该任务上的性能追平了 GPT-5-mini。
AI 根据报道生成 · 15 小时前更新
最新进展9月29日 12:00
研究人员提出PAU基准评估代码黑盒交互理解,前沿模型普遍吃力,微调后Qwen3-8B追平GPT-5-mini。报道时间线
沿着报道,了解事件的不同侧面。
9月29日
- arXiv 人工智能迈向代码 API 的交互式理解
研究人员提出 PAU 基准,通过仅提供黑盒 API 级交互访问,评估 AI 智能体对 Python 代码片段功能的无监督理解能力。评测显示前沿模型普遍表现吃力,表现最佳的 Claude-4-Opus 仍无法理解超过 45% 的测试集,主因在于过度自信导致探索不足。借鉴机器人学习的 AAC 范式后训练后,微调后的 Qwen3-8B 性能追平了 GPT-5-mini。
本事件热度走势
当前热度 3·可比范围峰值 5(9月30日 12:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。