跳到正文
原文
arXiv 自然语言处理· Ziyang Cheng, Yuhao Wang, Hongcheng Liu, Qimin Wu, Jingru Fan, Chen Qian, Yanfeng Wang, Yu Wang·· 3 小时前AI 评分43

面向全模态推理的以文本为中心后训练

Text-Centric Post-Training for Omni-Modal Reasoning

AI 导读

研究提出面向全模态大语言模型的以文本为中心后训练范式,先用纯文本训练优化核心推理,再通过减量音视频强化学习(RL)恢复感知能力。在 Qwen2.5-Omni-7B 上,纯文本微调与 RL 使 9 项推理得分几何均值较基座提升 25.83%,并节省 56.6% 的 GPU 工时。后续音视频微调减少约 90% 输入 token,恢复感知的同时保留了 93.5% 的推理增益。

来源:arXiv 自然语言处理 · arxiv.org