arXiv 机器学习· Erik Skalnes, Layne C. Price, Raviteja Anantha, Michael Oberst·· 4 小时前AI 评分38
基于干预迁移(Interventional Transfer)评估评测准则生成
Evaluating Rubric Generation with Interventional Transfer
AI 导读
研究团队提出“干预迁移”(Interventional Transfer)方法,通过扰动回复来规模化评估大语言模型生成的评测准则质量。在 HealthBench 测试中,针对 Qwen3.8-27B、Deepseek-V4-Flash 与 Opus-5 为 GPT-5.6-Terra 回复生成的准则,研究发现使表现劣化的扰动能跨准则迁移降分,但提升表现的扰动却无法可靠迁移增分。
来源:arXiv 机器学习 · arxiv.org