Hacker News · AI· gghootch·· 5 小时前精选AI 评分72
大语言模型 CI 评测噪声实测:通过的测试为何常随机失败?
How noisy are LLM evals in CI?
AI 导读
开源项目持续集成实测显示,大语言模型评测套件在代码完全未改动的情况下,前一次通过的测试在下一次运行中随机失败的概率约为 2.5% 至 3%。评测集越大,纯随机失败的数量越容易累积并掩盖真实的性能回退,且部分失败实为裁判模型失效或网络报错页面被计入打分。应对建议包括比对单个用例的历史通过率而非固定全量阈值、将基础设施异常单独隔离,以及对关键用例多次采样取平均值。
推荐理由
实测量化了持续集成中大语言模型评测的随机失败噪声,给出了依据用例历史稳定性和重试过滤误报的工程思路。
来源:Hacker News · AI · evalship.com