研究揭示模型量化对智能体工具调用的影响:崩溃阈值可复现但失效模式各异
该研究探讨了 GGUF 量化(从 8-bit 到 2-bit)对波兰语环境下智能体工具调用能力的影响。研究团队构建了确定性基准 PolAgentBench(包含 67 个主任务与 46 个算术隔离任务),并对 Bielik-11B、Bielik-Minitron-7B 及 Llama-PLLuM-8B 三个模型在 6 种量化精度下进行了系统评估。结果显示,模型性能发生崩溃的量化阈值具有跨模型可复现性,但具体的失效模式在不同模型架构间存在显著差异。
推荐理由探讨了低比特量化对端侧/本地模型工具调用稳定性的影响,对量化部署智能体有参考价值,但研究语种和模型偏小众。
原标题:Quantization Thresholds Replicate, Failure Modes Do Not: A Three-Model Study of Agentic Tool Use in Polish from 8-bit to 2-bit
阅读 arXiv 自然语言处理 原文 ↗