arXiv 人工智能· Panagiotis Kasnesis, Christos Chatzigeorgiou, Lazaros Toumanidis, Amalia Contiero Syropoulou·· 6 小时前AI 评分55
智能体系统各调用点评估:小语言模型可在多数环节替代前沿模型并降低成本
Not Every Call Needs a Frontier Model: Per-Call-Site Evaluation of Small Language Models in a Deployed Agentic Home-Automation System
AI 导读
研究团队在开源智能家居系统 Wactorz 的 5 个 LLM 调用点上评估了 9 款模型,发现最佳本地小模型在其中 4 个环节与托管的前沿模型表现无统计显著差异,仅在代码生成环节存在明显差距。通过针对各调用点分流本地模型,系统可在零调用成本下达到 91.8% 的准确率,实测仅托管两个生成类调用点便以 28% 的花费实现了与全量托管相同的效果。
来源:arXiv 人工智能 · arxiv.org