跳到正文
原文
arXiv 自然语言处理· Haotian Yang, Huikang Jiang, Yucheng Wu, Wen-Jie Jiang, Chenpeng Wang, Yibin Lou, Liangming Pan·· 2 小时前AI 评分45

激活引导会破坏大语言模型吗?LLM 引导方法多维度评测套件 SteerScope

Does Steering Break Your Model? A Multi-Dimensional Evaluation Suite for LLM Steering Methods

AI 导读

研究团队推出大语言模型激活引导多维度评测套件 SteerScope,通过 15 项指标系统评估引导效果与语言质量、任务能力及安全可靠性等副作用之间的权衡。在统一评测下测试 4 大类共 23 种方法(含 Prompt、LoRA 与 SFT 基线),发现现有激活引导方法在效果与副作用的综合平衡上均未超越 Prompt Steering。在分布外(OOD)提示词下引导副作用往往更明显,相关代码库已开源。

来源:arXiv 自然语言处理 · arxiv.org