跳到正文
原文
arXiv 自然语言处理· Pulak Kuli·· 9 小时前AI 评分41

全双工语音模型 Moshi 的情绪引导研究:取决于几何特征而非标签

Steering Follows Geometry, Not Labels: Emotion Directions in a Full-Duplex Speech Model

AI 导读

研究针对开源全双工语音大模型 Moshi,采用均值差激活引导方法探索四种情绪控制,每帧仅需数次向量加法且无需重新训练。实验表明情绪可从 Moshi 残差流中线性解码,但激活引导效果并不均衡:快乐、愤怒与惊讶指向共享方向,而悲伤具有独立可控性,且三者的共享分量无法通过简单投影均等消除。

来源:arXiv 自然语言处理 · arxiv.org