arXiv 人工智能· Amit Kachroo, Like Hui, Haitao Mao, Yuhao Zhang, Nguyen Vo·· 4 小时前AI 评分47
FEAgent:基于图锚定差分代理执行的代码等价性评估
Functionally Equivalent or Not? Graph-Grounded Differential Surrogate Execution for Code Equivalence
AI 导读
FEAgent 结合类型化程序图证据与差分代理执行,通过生成区分性输入与双 LLM 独立预测,实现可审计的代码功能等价性评估。在 EquiBench 评测中,直接执行验证了其在 1,200 对代码中指出的 216 处(18.0%)公开标签错误;在 SWE-bench Verified 上,该方法检测出 331 个通过测试的智能体补丁中有 94 个(28.4%)与参考补丁存在行为差异。
来源:arXiv 人工智能 · arxiv.org