arXiv 自然语言处理· Naen Xu, Wanqing Cui, Yibo Hu, Shixin Hong, Hengyu An, Meiguang Jin, Junfeng Ma, Tianyu Du·· 1 天前AI 评分43
StateTree:通过强化学习提升长对话推理能力
StateTree: Enhancing Long-Term Dialogue Reasoning via Reinforcement Learning
AI 导读
StateTree 是一种通过树结构路径追踪辅助任务提升大语言模型长对话推理能力的强化学习方法。模型仅在 10K-token 上下文训练即可泛化至 128K tokens,具备跨会话检索与时间推理能力。
来源:arXiv 自然语言处理 · arxiv.org