arXiv 人工智能· Katrina Drozdov, Oliver Chen, Langston Nashold, Rayan Krishnan·· 6 小时前AI 评分48
Legal Research Bench:评测长流程法律研究 AI 智能体的端到端可靠性
Legal Research Bench: Measuring End-to-End Reliability in Long-Horizon Legal Research Agents
AI 导读
Legal Research Bench(LRB)基准正式提出,包含 413 个美国法律研究开放问题,用于评测大语言模型智能体在长流程检索与分析中的端到端可靠性。对 13 个前沿模型的测试显示,表现最佳的 Claude Opus 4.8 全通过率仅为 42.9%,且在调和冲突法理依据时表现更低。此外,增加交互轮次、工具调用和推理成本并未带来更高准确率。
来源:arXiv 人工智能 · arxiv.org