跳到正文
原文
arXiv 人工智能· Arip Asadulaev, Aladin Djuhera, Karim Salta, Holger Boche, Fakhri Karray, Martin Takac·· 4 小时前AI 评分42

热带强化学习(Tropical Reinforcement Learning)

Tropical Reinforcement Learning

AI 导读

研究提出热带强化学习(Tropical Reinforcement Learning)及训练算法 TROPIC,通过取候选解的最大值而非传统概率求和(引入热带半环),显著改善大语言模型的组合推理能力。

来源:arXiv 人工智能 · arxiv.org