跳到正文
原文
arXiv 人工智能· Ramin Pishehvar, Andrea Morandi, Mahesh Viswanathan·· 1 天前AI 评分50

大语言模型路由升级信号评估:目标、对照与五大误区

Evaluating Escalation Signals for LLM Routing: Targets, Controls, and Five Ways to Fool Yourself

AI 导读

研究提出了一套评估大语言模型路由升级信号的通用检查清单,用于检验小模型向大模型升级决策的真实有效性。在 GSM8K 上,语义熵区分小模型错误的 AUROC 达 0.871,同等成本下比随机升级准确率最高提升 9 个百分点。研究同时指出实时采样成本可能超过直接调用大模型,并揭示了缓存方案 AUROC 从 0.908 跌至 0.518 的失效风险。

来源:arXiv 人工智能 · arxiv.org