ORCA:评估大语言模型在数据科学代码跨库转换能力的基准
研究人员提出了名为 ORCA 的综合基准测试,旨在评估大语言模型(LLM)在数据科学代码转换(DSCT)任务中的表现。数据科学代码转换涉及在不同数据科学库之间转换代码,同时保持功能等价性与跨生态互操作性。该基准包含 ORCA-MAIN 等设置,涵盖数据查询等三个代表性领域的 1600 个精选任务,填补了现有代码评测在跨库转换维度的不足。
推荐理由针对大模型在不同数据科学库间代码转换互操作性的评测基准,对 AI 编程工具开发具有一定参考价值。
原标题:ORCA: Evaluating LLMs on Data Science Code Translation
阅读 arXiv 人工智能 原文 ↗