跳到正文
原文
arXiv 自然语言处理· Chen Yueh-Han, Bruce W. Lee, Ilia Sucholutsky, Tomek Korbak·· 1 天前AI 评分48

对齐预测:从训练数据预测模型失齐

Alignment Forecasting: Predicting Misalignment From Training Data

AI 导读

研究人员提出了在训练前预测模型失齐风险的“对齐预测”(Alignment Forecasting)任务,并发布包含超 5,000 个预测题的基准 ALIGNMENTFORECASTBENCH。针对前沿模型直接提示效果欠佳的问题,团队提出了结合数据评分与模型先验倾向的预测脚手架。该方法预测表现优于基线并能识别潜在有害样本,过滤 UltraChat 等数据后可有效提升模型的对齐表现。

来源:arXiv 自然语言处理 · arxiv.org