跳到正文
原文
arXiv 机器学习· Zhishen Sun, Hongzhan Wang, Sizhe Dang, Guang Dai, Haishan Ye·· 5 小时前AI 评分37

DART-ES:结合难度感知重加权与针对性重放的演化策略大语言模型微调方法

DART-ES: Difficulty-Aware Reweighting and Targeted Replay for Fine-Tuning LLMs with Evolution Strategies

AI 导读

DART-ES 提出一种结合难度感知重加权与针对性重放的演化策略微调方法,无需反向传播即可高效完成大语言模型全参数微调。在 GSM8K 上该方法平均准确率达到 73.53%(超过 GRPO 的 73.26%),在 5 个数学推理基准上平均准确率达 49.20%,并展现出对 14B 模型的扩展能力。

来源:arXiv 机器学习 · arxiv.org