跳到正文
原文
arXiv 人工智能· Baode Wang, Zuming Huang, Kexuan Ren, Jun Huang, Wei Chu·· 6 小时前AI 评分34

通过门控与衰减同策略蒸馏提升 OCR 忠实度

Improving OCR Faithfulness via Gated and Attenuated On-Policy Distillation

AI 导读

研究人员提出 GAD-RL,在联合后训练中根据学生模型表现自适应调节教师监督,以提升视觉语言模型的 OCR 转录忠实度。GAD-RL 在输出任务奖励达到 0.95 时禁用蒸馏并随奖励增加持续衰减强度,同时结合学生概率对前向 KL 散度加权。

来源:arXiv 人工智能 · arxiv.org