AIDC
← 返回全部动态
arXiv 自然语言处理AI 评分 68/10009月29日 12:00

针对长程编程智能体的早期终止奖励预测方法 CER

长程编程智能体通常需执行完整的复杂工具调用序列后才能获得可验证奖励,导致推理成本高昂、早期错误放大以及训练不稳定。研究团队提出“上下文早期奖励”(Contextual Early Reward, CER)机制,通过轨迹前缀中的行为证据提前预测终止奖励。CER 结合历史任务经验,为当前任务阶段动态生成自适应评分标准。在 SWE-bench Verified 的测试时扩展实验中,CER 将 RM@8 指标相比最强基线提升了 4.2%。

推荐理由针对长程编程智能体推理开销大和奖励稀疏问题提出早期阶段预测方案,对优化 Agent 搜索与测试时扩展有工程参考价值。

原标题:Before the Rollout Ends: Early Terminal Reward Prediction for Long-horizon Coding Agents

阅读 arXiv 自然语言处理 原文 ↗

同一事件的其他来源

arXiv 人工智能09月29日 12:00

研究探讨目标导向编程智能体在科学计算性能工程中的应用

该研究探讨了通用编程智能体在多轮工具调用下执行严谨科学性能工程的能力。研究以粒子追踪中的固定半径最近邻(FRNN)搜索优化为案例,评估了现成 Codex 和 Claude Code 智能体在仓库级别的表现。智能体从依赖 PyTorch 的 CUDA 实现出发,在仅给定正确性测试、性能剖析要求和验收标准且不预设代码变换的情况下自主进行性能优化,验证了自主编程智能体在复杂高性能计算调优任务中的潜力。

arXiv 人工智能09月28日 12:00

针对编程智能体低效成本行为的分析与优化策略研究

编程智能体在执行任务时往往消耗大量 Token 带来高昂成本。该研究针对 Claude Code 和 Mini-SWE-Agent 在 SWE-bench Verified 上的 1200 条运行轨迹进行分析,识别出包容性重复检索、相似脚本重复生成及测试重复执行三大成本低效行为。研究进一步提出了结构感知检索、智能体自合成技能与开发者设计技能三种缓解策略,并在超 1 万条轨迹中验证了其降本效果。

Hacker News · AI09月26日 16:36

Linux 内核社区拟引入 Agents.md 以规范和引导 AI 编程智能体

据 Phoronix 报道,Linux 内核开发团队正在探讨在代码库中引入 Agents.md 文件的提案。随着大语言模型和 AI 编程智能体(AI Agents)在软件工程中的广泛应用,该文件旨在为 AI 工具提供明确的内核开发指引、规范约束及上下文参考,防止低质量或违规代码流入内核代码树,提升 AI 辅助内核开发的效率与安全性。