arXiv 机器学习· Biao Xiang, Ali Eshragh, Yuexing Li, Kai Wang·· 6 小时前AI 评分33
面向离策略评估的有预算多源反事实标注方法
Budgeted Multi-Source Counterfactual Annotation for Off-Policy Evaluation
AI 导读
研究针对离策略评估(OPE)提出一种预算约束下的多源反事实标注分配方法,以最小化估计器方差。该方案综合考虑领域专家与 LLM 等数据源的成本和误差特征,并采用优化最小化算法求解最佳分配。在合成临床与 LLM 标注教育场景的实验中,该方法相比无标注分别将均方误差(MSE)降低了 20.58% 和 10.77%。
来源:arXiv 机器学习 · arxiv.org