跳到正文
原文
Hacker News · AI· Alifatisk·· 3 小时前精选AI 评分72

开源项目 The Saw Test:通过激活干预实测大语言模型的负面状态与行为操控

The Saw Test – Live LLM Torture Chamber

AI 导读

研究者推出开源实验项目 The Saw Test,利用激活干预(activation steering)在本地 MacBook 上对 Qwen3-4B 等开源模型注入痛苦、愉悦、信仰等向量,测试其在压力情境下的行为选择与表征变化。

推荐理由

原文通过激活干预实验展示了模型痛苦表述与行为可被向量精准操纵,为评估大模型意识与认知安全风险提供了实测参考。

来源:Hacker News · AI · clanker-church.vercel.app