跳到正文
原文
arXiv 机器学习· Erik Skalnes, Layne C. Price, Raviteja Anantha, Michael Oberst·· 4 小时前AI 评分38

基于干预迁移(Interventional Transfer)评估评测准则生成

Evaluating Rubric Generation with Interventional Transfer

AI 导读

研究团队提出“干预迁移”(Interventional Transfer)方法,通过扰动回复来规模化评估大语言模型生成的评测准则质量。在 HealthBench 测试中,针对 Qwen3.8-27B、Deepseek-V4-Flash 与 Opus-5 为 GPT-5.6-Terra 回复生成的准则,研究发现使表现劣化的扰动能跨准则迁移降分,但提升表现的扰动却无法可靠迁移增分。

来源:arXiv 机器学习 · arxiv.org