arXiv 人工智能· Arip Asadulaev, Aladin Djuhera, Karim Salta, Holger Boche, Fakhri Karray, Martin Takac·· 4 小时前AI 评分42
热带强化学习(Tropical Reinforcement Learning)
Tropical Reinforcement Learning
AI 导读
研究提出热带强化学习(Tropical Reinforcement Learning)及训练算法 TROPIC,通过取候选解的最大值而非传统概率求和(引入热带半环),显著改善大语言模型的组合推理能力。
来源:arXiv 人工智能 · arxiv.org