跳到正文
原文
arXiv 机器学习· Ran Li, Lei Chen·· 5 小时前AI 评分45

学会决策而非推理:基于低秩激活引导的参数高效决策算子

Learning to Decide, Not to Reason: Parameter-Efficient Decision Operators via Low-Rank Activation Steering

AI 导读

研究者提出一种通过行为克隆训练的 System-1 决策算子,利用低秩激活引导向冻结语言模型注入技能,将参数成本降低约两个数量级。其默认算子仅用 330K 参数即可匹敌 1.33M 参数的强化学习算子,并将 3,685 token 的推理过程压缩至 6 token 决策且无精度损失。该方法跨 5 项任务和 3 个基座模型均有效,且技能支持在推理时直接相加、插值与热插拔。

来源:arXiv 机器学习 · arxiv.org