跳到正文
原文
arXiv 机器学习· Xinyu Li, Mononito Goswami, Hao Liu, Nikos Kanakaris, Langlin Huang, Prithwish Jana, Patrick Bl\"obaum, Purak Jain·· 5 小时前AI 评分48

Hermes:通过学习上下文推理释放测试时扩展能力

Hermes: Learning Contextual Reasoning Unlocks Test-Time Scaling

AI 导读

研究人员提出 Hermes 框架族及两阶段训练框架 Hermes-Learn,将跨上下文窗口分配与信息复用等“上下文推理”决策权赋予模型本身,以释放测试时扩展能力。实验表明,Hermes-Learn 能填补小型开源模型在扩展能力上的差距,诱导出自适应推理策略,并可外推至更大推理算力及迁移到其他测试时扩展方法。

来源:arXiv 机器学习 · arxiv.org