跳到正文
原文
arXiv 机器学习· Ali Aouad, Aymane El Gadarri, Vivek F. Farias·· 6 小时前AI 评分38

重新审视奖励优化的 Scaling Laws

Revisiting scaling laws for reward optimization

AI 导读

研究提出了一项联合考虑偏好训练数据量 M 与策略散度预算 K 的奖励优化 Scaling Law,性能表现近似遵循 $\Theta(\sqrt{\min\{\log(M),K\}})$。

来源:arXiv 机器学习 · arxiv.org