AIDC
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 75/10012:00

预测智能体何时应当推理?基于行为压力测试的可靠性路由研究

该研究探讨了预测智能体在结合大模型推理、信息检索、集成与校准时,各决策行为在何时具备可靠性。研究人员在ForecastBench风格的二元预测任务上,将智能体选择检索、推理、参考市场先验或采用历史类比等策略视为可观测行为并展开压力测试。核心结论显示,机制的最优选择高度依赖于数据生成源,结构化类比在特定数据流程中占据主导,而市场群体策略与保守基线在其他情境下表现更优。

阅读原文 ↗推荐理由:系统化探索了预测智能体在多策略切换下的行为可靠性,为智能体决策路由工程提供了实用参考。# 预测智能体# 智能体# 推理# 压力测试# 可靠性
arXiv 人工智能✦ 精选AI 评分 78/10012:00

CounterRoute:基于分层反事实信用分配的自路由推理强化学习框架

针对具备推理能力的大语言模型在简单问题中生成过长思维链从而浪费推理算力的问题,研究人员提出了 CounterRoute 框架。该框架采用在线强化学习方法,直接基于原生双模式检查点联合学习路由决策与模式条件响应,无需特定微调预热。它有效解决了路由目标随策略演变、初始模式偏好破坏探索稳定性以及序列级目标耦合等挑战,实现了高效的自适应推理路由。

阅读原文 ↗推荐理由:提出了一种优化大模型推理算力浪费的自路由强化学习新框架,具有较高的前沿研究价值。# 大模型# 强化学习# 思维链# 算力# 推理
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 75/10012:00

Orthrus:面向迭代检索的异构批处理高效推理服务系统

现代信息检索系统通常同时结合嵌入模型与生成模型处理复杂查询,但现有系统往往将二者隔离部署,粗粒度分配硬件易引发计算气泡,导致 GPU 利用率低和吞吐不足。为此,研究团队提出服务系统 Orthrus。该系统在统一推理循环中引入异构批处理机制,旨在有效整合具有资源冲突特性的嵌入与生成工作负载,提升动态查询下的硬件利用效率。(注:素材摘要文末存在截断)

阅读原文 ↗推荐理由:针对检索增强等场景中嵌入与生成模型混部低效的痛点,提出了创新的异构推理批处理系统设计。# 推理# 异构计算# GPU利用率# 信息检索# 系统架构
arXiv 人工智能✦ 精选AI 评分 72/10012:00

对比认知解码:通过单模型双前向推理缓解大模型的盲从共识偏见

针对大语言模型容易受对抗性群体共识影响而产生盲从(阿谀)现象的问题,研究人员提出了对比认知解码(CED)。不同于依赖弱辅助模型的传统对比解码,CED在单模型架构上通过双重前向传播来隔离从众偏见。该方法引入了新型非对称零边界概率钳位和离散Top-k截断掩码,在数学上抑制有害的从众Token生成且避免语法崩塌,为零样本推理阶段的模型自主性提供了有效干预手段。

阅读原文 ↗推荐理由:提出了一种无需外挂辅助模型的推理期对比解码算法,有效缓解大语言模型的群体盲从偏差。# 大模型# 对比解码# 从众偏见# 推理# 模型健壮性
arXiv 人工智能✦ 精选AI 评分 75/10012:00

面向长程智能体高效压缩的证据感知上下文缩减方法

针对长程智能体因累积大量交互历史导致上下文和推理成本高昂的问题,该研究指出仅依据几何冗余进行压缩并不安全。实验发现,即便全局几何特征高度相似,所保留的关键任务证据也可能存在巨大差异。基于此提出的证据感知选择机制,在相同数据块保留量且质心相似度达0.98的前提下,将下一步动作Top-3保留率从0.31大幅提升至0.69,有效保障了智能体压缩后的决策性能。

阅读原文 ↗推荐理由:该研究针对长程智能体上下文爆炸与推理成本痛点,提出了兼顾几何结构与任务证据的高效压缩新策略。# 智能体# 上下文压缩# 推理# 长程任务# 模型效率