arXiv 人工智能· Caiqi Zhang, Rujun Han, Zifeng Wang, Zoey CuiZhu, Nigel Collier, Tomas Pfister, Chen-Yu Lee·· 10 小时前AI 评分49
VeriHarness:面向长周期任务的智能体验证方法
VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks
AI 导读
VeriHarness 通过工作区、证据工具和可复用验证技能,将大语言模型转化为智能体验证器,用于在无参考答案的情况下检验长周期复杂任务。在 5 个长周期基准测试中,其基于证据的修订机制使 Gemini 3.5 Flash 和 Claude Opus 4.8 较单次 rollout 表现分别提升 6.2 分与 6.4 分。
来源:arXiv 人工智能 · arxiv.org