跳到正文
原文
arXiv 自然语言处理· Chenguang Wang, Ming Li, Chengrui Fan, Jianpeng Chen, Han Chen, Tianyi Zhou, Dawei Zhou·· 1 天前AI 评分39

可信 AI 审稿人研究:从修辞鲁棒性基准到 SciCore 评审机制

A Missing Piece for Trustworthy AI Reviewers: From Benchmarking Rhetorical Robustness to SciCore Review

AI 导读

研究团队提出了修辞鲁棒性概念及包含 1,260 个稿件版本的 RobustReview 基准,用于评估 AI 审稿人在论文改写下的稳定性与区分度。针对 30 种审稿配置测试中暴露的虚假鲁棒性问题,研究设计了结合全文评审与结构化科学核心的双分支机制 SciCore。在基于 GPT-5.5 的对比中,SciCore 在保持人类对齐水平的同时取得了领先的稳定与区分表现。

来源:arXiv 自然语言处理 · arxiv.org