跳到正文
原文
arXiv 人工智能· Khurram Yamin, Xavier Fernandes, Paul Koch, Bryan Wilder, Eric Horvitz·· 5 小时前AI 评分38

训练语言模型成为连贯决策者

Training Language Models To Be Coherent Decision-Makers

AI 导读

研究人员通过监督微调训练语言模型在保持信念的同时最大化期望效用,在 20 个数据集上显著提升了连贯决策能力,并成功泛化至未见领域和问题框架。在不完全信息设定下,模型学会了识别关键决策信息的缺失并区分无关文本。此外,将决策完整性识别与效用敏感执行分离的路由系统进一步提升了决策表现。

来源:arXiv 人工智能 · arxiv.org