跳到正文
原文
arXiv 人工智能· Sam Wang, Julia White, Sahibzada Allahyar, Dhruv Atreja, Urchade Zaratiana, Kelton Zhang·· 3 小时前精选AI 评分66

论文指出动态 LLM 路由器表现常不及简单随机选择

Dynamic LLM Routers are Often Misguided

AI 导读

最新论文评估了 6 款商业 LLM 路由器在 8 个任务类别、14 种设定下的表现,发现没有一款在同等成本下优于在两款合适模型间随机选择的基线,部分表现落后超 10 个百分点。研究指出路由器存在难度盲区、长度反转、语义匹配和模型阵容次优四类模式,并提出了避免奖赏上述偏差的新评测方法与双模型路由器概念验证。

推荐理由

研究对比了商业 LLM 路由器与简单随机基线,揭示了动态路由因评测目标偏差导致效果不及预期的底层机制。

来源:arXiv 人工智能 · arxiv.org