arXiv 人工智能· Rachel S. Y. Teo, Yutaro Yamada, Shashank Kotyan, Yuki Imajuku, Tarin Clanuwat·· 4 小时前AI 评分37
超越模仿:LLM 辅助同行评审框架与评测基准
Beyond Imitation: A Framework and Benchmark for LLM-Assisted Peer Review
AI 导读
研究提出以验证为核心的 LLM 辅助同行评审视角,构建了通过合成注入错误来评估逻辑矛盾识别能力的可扩展 Benchmark。同时推出的多层评审(MLR)框架在生成评审前优先深入理解手稿,不仅提升了 token 效率,还实现了高错误检测性能与人类评分对齐。评测同时证实系统仍存在对抗性操纵脆弱性,凸显了严格评估的重要性。
来源:arXiv 人工智能 · arxiv.org