AIDC
← 返回全部动态
arXiv 人工智能AI 评分 62/10009月28日 12:00

ORCA:评估大语言模型在数据科学代码跨库转换能力的基准

研究人员提出了名为 ORCA 的综合基准测试,旨在评估大语言模型(LLM)在数据科学代码转换(DSCT)任务中的表现。数据科学代码转换涉及在不同数据科学库之间转换代码,同时保持功能等价性与跨生态互操作性。该基准包含 ORCA-MAIN 等设置,涵盖数据查询等三个代表性领域的 1600 个精选任务,填补了现有代码评测在跨库转换维度的不足。

推荐理由针对大模型在不同数据科学库间代码转换互操作性的评测基准,对 AI 编程工具开发具有一定参考价值。

原标题:ORCA: Evaluating LLMs on Data Science Code Translation

阅读 arXiv 人工智能 原文 ↗

同一事件的其他来源

arXiv 自然语言处理09月29日 12:00

新基准OptiArena:评估大模型在固定资源预算下优化可执行算法的能力

静态问答与代码生成基准难以全面反映大模型作为编程智能体和科研工具的能力。为此,研究人员推出了 OptiArena 测试床,旨在研究大语言模型是否能在固定的最小脚手架、有限的评估器反馈和严格的资源预算约束下,通过五轮代码编辑来改进可执行的博弈算法。该基准结合了混淆控制、校准基准及压力测试,用于深入诊断模型的性能退化与异常失败情况。

arXiv 人工智能09月29日 12:00

新基准PAU提出:评估大模型黑盒交互式理解代码API的能力

现有代码大模型与智能体通常依赖直接读取源码来进行代码理解,但在面对外部闭源或远程 API 时该假设并不成立。为此,研究人员推出了 PAU(Python API 理解)基准测试。在该设定下,模型仅拥有代码片段的黑盒 API 访问权限,必须通过构造探索性输入并分析返回结果,主动推断并描述代码的真实功能,以此评估智能体的黑盒交互式逆向理解与探索能力。