arXiv 人工智能· Ziyang Xu, Haitian Zhong, Hao Zhou, Hao Qin, Chenhan Jin, Te Qi, Shengze Xu, Tieyong Zeng·· 12 小时前AI 评分50
大语言模型 Harness 的覆盖度与专业化解耦研究
More Programs or More Rolls? Separating Coverage from Specialization in LLM Harnesses
AI 导读
新研究提出了一套受控评估框架,用于解耦大语言模型 Harness 自动生成中的答案覆盖度、可重复任务优势与执行前选择收益。
来源:arXiv 人工智能 · arxiv.org