arXiv 自然语言处理· Wenxi Gan·· 7 小时前AI 评分35
结合任务进度学习行动:从紧凑教师监督中蒸馏小智能体
Learning to Act with Task Progress: Distilling Small Agents from Compact Teacher Supervision
AI 导读
任务进度蒸馏(TPD)是一种离线方法,通过将示范动作与描述任务阶段的简短标签配对来蒸馏小模型智能体。在 ALFWorld 上,用 404 条演示训练的 1.7B 学生模型实现了 72.4% 的未见任务平均成功率,显著优于推理训练学生的 48.3%。在 200 条演示预算下,显式阶段监督将成功率从纯动作监督的 48.0% 提升至 67.7%,并在 808 条演示时均达到 76.9%。
来源:arXiv 自然语言处理 · arxiv.org