arXiv 人工智能· Yuxuan Liu, Haoran Li, Yuhao Zhang, Jiahe Guo, Hongyu Luo, Wenbin Hu, Huihao Jing, Kawai Chung, Junle Chen, Changxuan Fan, Qing Zong, Lingyun Xie, Yangqiu Song·· 6 小时前AI 评分37
SkillScriptBench:可执行 Agent 技能包自进化评测基准
SkillScriptBench: Benchmarking Self-Evolution of Executable Agent Skill Packages Beyond Markdown
AI 导读
研究团队推出包含 350 个任务的评测基准 SkillScriptBench,用于独立评估大语言模型 Agent 在文档修复、脚本修复与功能保持上的技能自进化能力。评测显示同时编辑文档和脚本的方法难以在文档修复或保持上持续优于纯 Markdown 修订。团队进而提出 AST 引导的技能修订方法,使故障包的修复成功率平均绝对提升最高达 27.7%。
来源:arXiv 人工智能 · arxiv.org