arXiv 机器学习· Zhengyi Guo, Jiayuan Sheng, Wenpin Tang·· 1 天前AI 评分39
DOHF:基于 Doob $h$-变换引导的扩散模型在线微调
DOHF: Online Diffusion Fine-tuning with Doob's $h$-transform Guidance
AI 导读
研究人员提出扩散模型在线微调算法 DOHF,将 Doob $h$-变换转化为实用的在线训练框架。该方法为生成样本赋予最优性权重并估计局部修正,直接蒸馏至生成模型中,且无需额外网络评估即可兼容黑盒与不可微奖励。DOHF 在三种实证场景下均提升了模型对齐效果,适用于统计采样与视觉生成任务。
来源:arXiv 机器学习 · arxiv.org