arXiv 人工智能· Shihab Ahmed, Debamita Ghosh, David Tang, Yudan Wang, Alvaro Velasquez, Yue Wang·· 6 小时前AI 评分36
偏好不确定性下的 Robust Nash Alignment 鲁棒对齐框架
Robust Nash Alignment under Preference Uncertainty
AI 导读
针对成对偏好存在噪声、异构或部署后偏移的脆弱性问题,研究者提出博弈论框架 Robust Nash Alignment。该框架通过四玩家原始-对偶代理博弈与单循环乐观镜像上升下降算法,在偏好不确定集下求解具备最坏情况胜率下界保证的鲁棒策略,并证明了 $\mathcal{O}(1/\sqrt{T})$ 的对偶间隙收敛率。在表格博弈与偏好不确定的 LLM 对齐实验中,其实际表现均优于名义基线。
来源:arXiv 人工智能 · arxiv.org