跳到正文
原文
arXiv 自然语言处理· Shuqing Shi, Ziyan Wang, Milind Tambe, Yali Du·· 4 小时前AI 评分37

基于显式画像推断的异构偏好大语言模型编排

Large Language Model Orchestration under Heterogeneous Preferences via Explicit Persona Inference

AI 导读

HARP 框架提出将 Agent 偏好置信度移出提示词,通过显式贝叶斯规则进行闭式更新,以解决大语言模型在多 Agent 异构偏好下的编排难题。该方法为每个 Agent 维护数值后验并实现估计与推理的解耦,理论上达到了 $\tilde O(\sqrt K)$ 的贝叶斯遗憾界。结合候选区分奖励规划的增强版 HARP+,在三种基准测试中均取得了非 oracle 方法的最优表现。

来源:arXiv 自然语言处理 · arxiv.org