arXiv 人工智能· Jingjie Ning, Guojiang Zhao, Chen Xu, Shanshan Zhong, Xiaochuan Li, Ji Zeng, Guolin Ke·· 5 小时前AI 评分33
Rules to Tools:面向科学计算 LLM Agent 的可执行检查
Rules to Tools: Executable Checks for LLM Agents in Scientific Computing
AI 导读
Rules to Tools(R2T)为科学编程 LLM Agent 提供预制的可执行检查工具,跨两组任务队列将完整代码修复数从纯文本规范的 26/30 提升至 29/30。在偏微分方程(PDE)对比中,可执行检查取得 24/24 的修复成绩,并使模型输出减少 31.2%。该方法虽节省了 Agent 端输出,但也使两个任务队列的 CPU 使用量均有所上升。
来源:arXiv 人工智能 · arxiv.org