arXiv 机器学习· Jianbin Zhang, Xin Sun, Shanwen Wang, Wei Ye, Susanto Rahardja·· 6 小时前AI 评分33
KVE-KD:面向视觉语言模型的关键视觉证据引导知识蒸馏
KVE-KD: Key Visual Evidence-Guided Knowledge Distillation for Vision-Language Models
AI 导读
KVE-KD 框架通过动态将特征蒸馏聚焦于教师模型识别的任务相关视觉 token,提升视觉语言模型的跨模态推理能力。该方法以生成前最终文本 token 为语义锚点确定融合层,结合注意力分布与归一化熵提取关键视觉证据以抑制背景噪声。在 6 个基准上的实验显示其超越现有跨模态蒸馏方法且不增加任何推理开销,代码已开源。
来源:arXiv 机器学习 · arxiv.org