跳到正文
原文
arXiv 自然语言处理· Shuyu Gan, Young-Jun Lee, Dongyeop Kang·· 4 小时前AI 评分44

SanSi:面向系统 1.5 思维的循环类型决策模型

SanSi: A Looped Typed Decision Model for System 1.5 Thinking

AI 导读

SanSi 将预训练循环语言模型转化为类型决策模型,通过多轮递归循环修正隐状态实现无需生成 token 的“系统 1.5”思维,可自适应支持 1 到 8 次循环计算预算。在 59 个来源的 10,027 项测试决策中,SanSi 取得 72.0% 准确率,较同规格非循环模型提升 13.5 个百分点。作为强化学习策略优化的裁判时,它在无标准答案场景下使生成器的 F1 提升 7.7 个百分点。

来源:arXiv 自然语言处理 · arxiv.org