arXiv 机器学习· Miaobo Hu, Shuhao Hu, Xiaobo Guo, Xin Wang, Bokun Wang, Tianshu Fu, Daren Zha, Jun Xiao·· 11 小时前AI 评分33
FAER:用于大语言模型后训练的可审计效用对齐轨迹回放框架
FAER: Auditable Utility-Aligned Trajectory Replay for Language Model Post-Training
AI 导读
FAER 是一种用于大语言模型后训练的可审计全轨迹回放框架,旨在弥合缓存轨迹选择与下游学习效用之间的差距。在 GSM8K 数据集上基于 Qwen2.5-1.5B-Instruct 测试,其固定选择器在 128 次更新下取得 0.6329 的质量,优于均匀采样的 0.5482。
来源:arXiv 机器学习 · arxiv.org