arXiv 人工智能· Jundong Hu, Shekar Ramachandran·· 3 小时前AI 评分48
衡量微任务合格差距:开箱即用的小语言模型何时足以胜任智能体框架?
Measuring the Microtask Eligibility Gap: When Is an Off-the-Shelf SLM Enough for an Agent Harness?
AI 导读
研究构建了涵盖 4 项微任务的基准,测试开箱即用的小语言模型(SLM)在智能体框架中的合格差距。在 FP16 贪婪解码且未微调的设置下,Qwen3(0.6B/1.7B/4B/8B)和 Llama-3.x 的所有配置均未通过置信区间设定的阈值,且 4-bit 量化(RTN/GPTQ/AWQ)均无法使其达标。
来源:arXiv 人工智能 · arxiv.org