Benchy:面向任务型AI基准评测的通用语义语言与执行引擎
本文提出了Benchy,一个用于AI程序基准评测的语义规范语言与执行引擎。Benchy将基准测试形式化定义为由程序、评分函数和数据集构成的三元组B=(P,S,D),实现评测套件与被测AI系统的解耦。基准采用规范YAML编写,基于共享的任务/领域本体,可确定性编译为规范JSON中间表示并由引擎执行,为任务型AI评测提供了标准化、可复现的通用基础设施。
推荐理由提出了一种面向AI任务评测的规范化DSL与执行引擎,对解决大模型与Agent评测碎片化及复现难题具有参考价值。
原标题:Benchy: towards a universal language for task-oriented AI benchmarks
阅读 arXiv 人工智能 原文 ↗