Hacker News · AI· somrout·· 4 小时前AI 评分59
开源大模型因果评测框架 Causeval 发布
Causeval – statistically rigorous, causal evaluation for LLM apps
AI 导读
开源大模型因果评测框架 Causeval 正式发布,该项目基于 DeepEval 构建,旨在为大语言模型应用提供统计严谨的不确定性量化与因果分析能力。框架引入了聚类 Bootstrap 置信区间、三值门控机制、RAG 反事实上下文干预、LLM 裁判偏差校准(PPI 与保序回归)以及智能体步骤级故障归因,拒绝输出无统计效力的单一裸分。
来源:Hacker News · AI · github.com