跳到正文
原文
arXiv 人工智能· Ji Young Byun, Anthony Hu, Jesse Rogers, Roujia Wang, Manasa Kesapragada, Falgun Shah·· 6 小时前AI 评分34

多智能体假设生成中的成对等价判断审计:自我批判效果与多样性测量

Auditing Pairwise Equivalence Judgments: Self-Critique Effects and Diversity Measurement in Multi-Agent Hypothesis Generation

AI 导读

针对基于 LLM 的多智能体假设生成研究显示,成对等价判断的判定规则会显著改变自我批判效果与多样性测量结果。测试表明,自我批判从 0 轮增至 1 轮可产生 34.5 个百分点(pp)的机制级分歧增量,而 1 轮增至 5 轮仅增加 1.3 pp。在因果链替换测试中,LLM-as-a-judge 识别出 83% 的机制差异,远优于 TF-IDF 的 0% 和 dense embedding 的 8%。

来源:arXiv 人工智能 · arxiv.org