跳到正文
原文
arXiv 人工智能· Wenxuan Wang, Zekai Liu, Weinan Zhang, Yu Cheng, Yang Yang·· 1 天前AI 评分42

通过同策略上下文蒸馏将 Agent 经验内化至扩散模型权重

Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation

AI 导读

研究者提出扩散同策略上下文蒸馏(D-OPCD),将文本生成图像 AI 智能体框架优化后的特权上下文知识直接蒸馏到扩散模型权重中。配合自动技能演进器(ASE),该方法使模型在 4 个基准上的直接生成平均分从 60.52 提升至 65.09。更新后的模型支持框架启动第二轮 ASE 并额外提升 1.83 分,实现了智能体与模型的持续协同演进。

来源:arXiv 人工智能 · arxiv.org