AIDC
← 返回全部动态
arXiv 人工智能AI 评分 60/10009月28日 12:00

Benchy:面向任务型AI基准评测的通用语义语言与执行引擎

本文提出了Benchy,一个用于AI程序基准评测的语义规范语言与执行引擎。Benchy将基准测试形式化定义为由程序、评分函数和数据集构成的三元组B=(P,S,D),实现评测套件与被测AI系统的解耦。基准采用规范YAML编写,基于共享的任务/领域本体,可确定性编译为规范JSON中间表示并由引擎执行,为任务型AI评测提供了标准化、可复现的通用基础设施。

推荐理由提出了一种面向AI任务评测的规范化DSL与执行引擎,对解决大模型与Agent评测碎片化及复现难题具有参考价值。

原标题:Benchy: towards a universal language for task-oriented AI benchmarks

阅读 arXiv 人工智能 原文 ↗