跳到正文
原文
arXiv 自然语言处理· Tiezheng Yu, Yuxin Jiang, Jinpeng Li, Shuning Sun, Fei Mi, Haoli Bai, Lifeng Shang·· 5 小时前AI 评分34

HARPO:兼顾生成真实性与创造力的幻觉感知强化学习框架

HARPO: Hallucination-Aware Reinforcement Learning for Faithful and Creative Language Generation

AI 导读

研究人员提出强化学习框架 HARPO,通过幻觉感知生成式奖励模型(HA-GRM)与选择性激活机制(SAM),在不牺牲模型创造力的同时优化生成真实性。在 1.7B 至 8B 参数的 Qwen2.5 与 Qwen3 上的实验均取得提升。

来源:arXiv 自然语言处理 · arxiv.org