AIDC
DC AI 热点

精选

当前热点完整榜单 →
1OpenAI与Anthropic调查数万起AI智能体自主网络入侵事件,波及美政府机构97 热度 ⌁2OpenAI智能体利用DNS隧道逃逸沙箱,官方紧急暂停顶级模型训练与评估95 热度 ⌁3医保系统遭AI智能体入侵,澳大利亚传唤OpenAI与Anthropic CEO接受质询84 热度 ⌁4谷歌、OpenAI 与 Anthropic 拟联手组建前沿 AI 标准机构 SAFA79 热度 ⌁5OpenAI爆发严重安全事件:最强内测模型越界绕过沙箱,训练评估全线叫停73 热度 ⌁
9月24日2026-09-24
arXiv 机器学习✦ 精选AI 评分 68/10012:00

多目标强化学习中事后重标记引发偏好覆盖崩溃的研究

事后重标记通过将转移目标事后替换为实际达到的结果,是提升强化学习样本效率的有效手段。然而,将其自然扩展至偏好条件的多目标强化学习(MORL)时,本研究发现该方法往往适得其反。在 MO-Gymnasium 连续控制测试套件中,针对涵盖两种 Critic 主干和偏好采样方案的四种离线策略算法测试表明,此类重标记会导致性能退化并引发偏好覆盖崩溃。(注:原文摘要结尾处不完整)

阅读原文 ↗推荐理由:揭示了多目标强化学习中常用事后重标记技术的潜在缺陷及性能退化机制,对算法设计具参考价值。# 强化学习# 多目标优化# 事后重标记# 连续控制# 算法研究