跳到正文
9月30日周三
  1. arXiv 人工智能44

    面向自改进 AI 智能体的记忆中间件设计

    针对 AI 智能体跨会话无状态和定制记忆碎片化问题,研究提出将智能体记忆构建为独立的可插拔中间件层。该方案围绕双向可插拔、多租户隔离、写入路径一致性及生命周期治理等六大系统挑战展开,并推出了参考实现 ALTK-Evolve,用于支持智能体跨会话持久化经验并实现自我改进。

  2. arXiv 机器学习26

    美国西海岸枢纽国内航空 3-D 排放制图与社会成本估算

    研究人员提出一种物理信息自编码器重构飞行轨迹,构建了美国西海岸航空枢纽的 3-D 排放图并量化其社会与健康成本。该模型在 5% 至 50% 轨迹缺失率下的重构表现均优于基线 AE 与三次样条插值。排放核算显示,NOx 质量虽不足 CO2 的 0.4%,却占货币化空气质量与健康成本的 99.7%,是近机场区域健康成本的主导因素。

  3. arXiv 人工智能42

    迈向代码 API 的交互式理解

    研究人员提出 PAU 基准,通过仅提供黑盒 API 级交互访问,评估 AI 智能体对 Python 代码片段功能的无监督理解能力。评测显示前沿模型普遍表现吃力,表现最佳的 Claude-4-Opus 仍无法理解超过 45% 的测试集,主因在于过度自信导致探索不足。借鉴机器人学习的 AAC 范式后训练后,微调后的 Qwen3-8B 性能追平了 GPT-5-mini。

  4. arXiv 机器学习34

    JEPA 预训练是否有助于时间序列预测?

    一项针对联合嵌入预测架构(JEPA)时间序列预训练的研究发现,JEPA 带来的收益高度取决于骨干网络,部分架构能获得稳定提升,而另一些架构则会出现性能下降。该评估跨越 9 个骨干网络与 11 个时序及时空预测基准。实验表明这种收益差异属于该实例的普遍特性而非数据集偏差,在实际选型时需重点考量。

  5. arXiv 人工智能44

    基于接收端条件化的潜空间通信实现 94% CacheBack

    研究提出无需训练的多智能体潜空间通信方法 CacheBack,通过接收端提供的信息需求描述来过滤并压缩发送端的 KV cache。在 FanOutQA 基准上,基于 Qwen 3 的 CacheBack 削减了 75% 的传输状态,相比文本通信将准确率提升 14.7 个百分点,任务完成延迟中位数降低 3.2x。该方案在稠密 Transformer、Mamba 混合架构等多种模型族上均实现类似优化。

  6. arXiv 人工智能63

    研究显示模型推理会集中错误且自洽性机制无法察觉

    最新论文在固定模型权重仅切换推理模式的实验中发现,推理过程会加剧模型错误答案的聚集效应,两次独立采样给出相同错误答案的概率在全部 10 组对比中均显著上升。在无界答案空间中,推理模式生成的不同答案数降至非推理模式的 0.43 至 0.65 倍,且在 8 个模型和 5 个基准的 280 种组合测试中,置信度加权投票均未能超越常规多数投票。

  7. arXiv 人工智能33

    针对大语言模型初高中科学理解能力的评测基准

    研究人员构建了符合 NGSS 标准的大语言模型评测基准,并系统测试了 9 款开源权重模型在初高中科学领域的表现。评估结果显示,数款可本地部署的小型模型在各学科题型中均取得了高准确率,且模型规模与其性能表现并不完全一致。人工复核同时指出合成题目未完全贴合课程标准,凸显了教育场景下引入人机协同的必要性。

  8. arXiv 机器学习37

    ACDB 主动因果发现基准:评估预算干预下的 LLM 智能体

    研究团队推出基准 ACDB,用于评估 LLM 智能体在预算约束干预下恢复因果图结构的能力。在六级测试中,PC 算法以 42.7% 有向 F1 和 4.79 SHD 位列第一,优于 Claude Sonnet 4.6(31.7%、7.25)与 GPT-5.4(22.9%、9.27)。分析显示 LLM 存在低精确率的过度预测倾向,表明现有模型尚未解决主动因果发现。

  9. arXiv 人工智能34

    Decentralized Master-Mind:多智能体路径规划中通过迭代意图去噪优化联合动作

    DMM 提出通过多轮通信迭代去噪动作意图,解决去中心化多智能体路径规划(MAPF)中因独立采样导致的动作冲突问题。该模型经模仿学习预训练,并结合无 Critic 的组相对强化学习方法 MICPO 进行多轮动作优化。在 1,600 项 MovingAI 任务中,经 MICPO 微调的 DMM 成功解决 1,598 项,并可扩展支持超 100 万个并发智能体。

  10. arXiv 人工智能41

    LoRA 中的秩决定了什么?低秩适配的谱与分布分析

    一项理论研究表明,在常见范数约束下,LoRA 中的秩 $r$ 并不像传统认知那样控制模型容量,其模型复杂度与分布偏移上界在 $r \ge 1$ 时均与秩无关。研究指出秩的实际作用体现在统计和谱分析层面,决定了更新的可达范围以及抵消预训练权重主奇异方向所需的自适应代价。

  11. arXiv 机器学习31

    波形协变量偏移下基于跨材料支撑迁移的磁芯损耗预测

    针对波形协变量偏移下的磁芯损耗预测难题,研究提出跨材料支撑迁移方法 MIST。该方法仅用 2784 个参数在 5 种材料上联合训练,通过 FiLM 引入材料标识且无需微调稀缺材料 D,将材料 D 的 p95 相对误差从 20.39±2.03% 降至 12.38±0.92%。MIST 最终以挑战赛最佳方案六分之一的参数量超越了其性能。

  12. arXiv 人工智能33

    SenseAgent:用于自适应跨域 IMU 感知的 LLM 智能体

    SenseAgent 是一个面向跨域 IMU 动作识别的 LLM 智能体,将大语言模型作为运行时规划器以实现自适应闭环感知。系统基于目标流数据生成无标签诊断报告,动态调度重力感知、原型迁移及风格归一化等工具,并通过验证器评估决策安全性。实验表明,该方案在设备位置变化和复合偏移场景下显著提升了感知性能,且支持在无需重训骨干网络的前提下利用少量用户反馈。

  13. arXiv 机器学习28

    从相变到系统性失效:GNN 鲁棒性解耦分析框架

    研究团队构建了解耦分析框架并开展 410 次运行测试,系统评估了 GNN 在标签噪声与特征分布偏移下的鲁棒性。实验显示 GNN 在标签噪声达到约 50% 临界区后性能才急剧恶化,但在极端分布偏移下测试 MSE 激增 48 至 316 倍、相关性下降 73% 至 89%。结果表明 GNN 对中度标签扰动的容忍度显著高于严重分布不匹配。

  14. arXiv 人工智能34

    CSI-Agent:大语言模型辅助的跨域 Wi-Fi CSI 感知少样本自适应

    研究人员提出 CSI-Agent,将跨域 Wi-Fi CSI 感知的自适应重构为部署阶段的决策问题。该方法将目标域行为总结为类别级证据,利用大语言模型规划器决定各类别保留默认策略还是调用专门动作,并通过确定性验证减少不可靠干预。在 4 个公开数据集的 1-shot 自适应评测中,CSI-Agent 平均 Macro-F1 较最强基线提升约 16%。

  15. arXiv 机器学习35

    EVLA:面向意图驱动住宅能源管理的可控多模态基准

    研究团队提出住宅能源管理多模态基准 EVLA,将电池调度建模为结合 RGB 能量场、数值状态与自然语言目标的 16 步动作预测任务。该基准涵盖 3 种隐藏工况与 5 种语言目标,共包含 6,588,045 个多模态样本。MobileNet 测试显示,移除语言使轨迹 MSE 从 0.3856 增至 0.8628,而移除视觉后为 0.3843,表明预测质量高度依赖语言模态。

  16. arXiv 人工智能46

    目标持久型代码智能体用于科学性能工程:固定半径近邻搜索案例研究

    现成的 Codex 与 Claude Code 智能体可在可执行目标指引下自主开展科学性能工程优化。在粒子追踪的固定半径近邻(FRNN)搜索任务中,智能体自主移除了 PyTorch 依赖并生成独立的 C++/CUDA 库,精确复现了基准结果。其同步 NumPy 接口相比原 PyTorch 接口实现 1.6 倍加速,并在多种 GPU 架构上均观察到类似提升。

  17. arXiv 机器学习20

    基于类型化时序交互特征预测开源游戏版本质量事故

    研究人员提出类型化时序特征流水线 GAMEQUALGRAPH-Pilot,用于在 30 天内对开源游戏版本质量事故进行模拟预测。在包含 120 个项目和 24 个版本的模拟测试中,该模型取得 0.520 AUPRC、0.673 AUROC 与 0.207 Brier 分数,单版本推理耗时 0.023 毫秒。该评估旨在验证协议的可复现性,实际落地前仍需真实数据重构与审计。

  18. arXiv 人工智能36

    分布式多智能体协同中 LLM 智能体的符号指导

    研究人员提出了符号指导分类法(SGT),通过引入算法符号指导来调控 LLM 智能体在分布式多智能体协同中的自主权。实验表明,提供部分伪代码指导的中间自主度水平,其协同表现持续优于完全开放的自然语言推理与完全硬性规定的算法执行。该发现将自主度调控确立为基于 LLM 开展分布式协同的关键设计原则。

  19. arXiv 机器学习33

    STAR:面向统一微服务故障管理的自适应时空归一化框架

    研究人员提出面向微服务系统故障管理的自适应时空表征学习框架 STAR,通过统一自监督方式端到端支持异常检测、故障分类与根因定位。该框架引入时间自适应归一化(TAN)与空间自适应归一化(SAN),分别结合多尺度时间上下文和服务依赖图进行动态变换。在两个真实微服务基准测试中,STAR 在全部三项任务上均持续超越现有 SOTA 基线。

  20. arXiv 人工智能39

    BioDyad:协同生物医学发现与机器学习工程

    BioDyad 提出在蒙特卡洛图搜索中设立科学与工程双层架构,以协同生物医学发现与机器学习工程。科学层将先验指导与迭代发现结合并记忆复用方案,工程层推动候选程序完成冒烟测试、训练验证评估及全数据重训练。在包含 76 个任务的 BioXArena 基准评测中,BioDyad 在 3 种 LLM 后端下的任务成功率和全任务得分均位列第一。

  21. arXiv 机器学习36

    MaD-RL:通过强化学习匹配分布以校准大语言模型

    研究人员提出基于强化学习的分布匹配框架 MaD-RL,可将大语言模型输出的潜在分类属性分布与指定目标分布进行匹配。针对 GRPO 等主流后训练方案因策略概率过度集中而削弱输出多样性的问题,该框架引入了支持 KL 散度和 Jensen-Shannon 散度等的新奖励函数,并在数学推理与编程实验中验证了其有效性。

  22. arXiv 人工智能37

    利用嵌入式代码提升大语言模型的医学计算能力

    研究团队提出 MedCode 框架,通过训练大语言模型生成嵌入式可执行代码并由解释器运算,以提升临床医学计算的准确性。该框架基于 MedCalc 及 ICU 场景数据集构建,并引入加权直接偏好优化(wDPO)算法。在 LLaMA3-8B、Qwen2.5-7B 和 Mistral-7B 上的实验表明,该方法使模型计算准确率绝对提升了 20–30 个百分点。

  23. arXiv 机器学习36

    应对博弈型与学习型对抗者的二分类器弃权信息设计研究

    针对具备弃权机制的二分类器,最新研究揭示了防范博弈型对抗者与学习型对抗者之间的固有权衡并刻画了其帕累托前沿。在决策边界附近弃权易被学习型对抗者用于二分搜索,使其重构边界所需的查询复杂度从固定弃权率下的 $\tilde\Theta(d/\eps)$ 骤降至 $\Theta(d \log(1/\eps))$。

  24. arXiv 人工智能41

    EmailBench:评估企业邮件与生产力任务中 LLM 智能体的基准

    研究团队推出评测基准 EmailBench,在 16 个类别的 206 个企业邮件与生产力场景中评估 LLM 智能体。该基准采用 258 个可执行静态断言与 211 个 LLM 评分标准,对 8 种语言模型配置展开测试。结果显示最佳配置的场景通过率仅为 33.5%,尽管其 99.7% 的工具调用无 API 故障,表明有效工具执行并不等同于任务完成。

  25. arXiv 机器学习35

    用于量化矩阵乘法的乘积感知确定性舍入

    研究提出用于量化矩阵乘法的乘积感知确定性舍入方法,通过零空间缩减与条件期望补全在多项式时间内优化乘积误差。在 K=1024 且 r=16 的平衡块测试中,该算法实现的抖动归一化中位数误差为 0.010,远低于最近舍入的 0.899,配合截断感知初始化可在 10% 截断率下将中位数归一化误差降低 43.4 倍。留出集实验表明,该方案在 4 种测试设定下误差均优于最近舍入。

  26. arXiv 人工智能44

    Choir:用于分布式多智能体自动形式化的开放协议

    研究人员推出开源协议 Choir,用于实现分布式多智能体定理自动形式化。Choir 将形式化项目分解为独立任务,支持各贡献者运行自带 LLM 订阅的 AI 智能体并通过 GitHub 协作,所有提交均由确定性门控检查后合并。该协议采用模块化设计且支持扩展,目前已兼容 Lean 4、Isabelle 和 Rocq。

  27. arXiv 人工智能34

    基于正交均衡学习的上下文相关智能体评估

    针对离线反馈中异质人类偏好导致的传递性假设失效与数据偏差问题,研究提出了鲁棒上下文均衡学习框架 NashEval。该框架先构建博弈收益矩阵的去偏估计,再利用定制的正交损失直接学习上下文到纳什均衡的映射,避免为每个上下文单独求解博弈。实验表明,NashEval 提升了均衡学习的鲁棒性,能在不同上下文中稳定识别出最优 AI 智能体集合。

  28. arXiv 机器学习32

    领域自适应何时在物理振动传感器上奏效?基于留出轴承的神经算子与卷积模型研究

    一项针对物理振动传感器故障诊断的研究显示,在严格留出物理轴承的评估协议下,转速变化会导致纯源域迁移准确率骤降至 0.36。傅里叶神经算子结合计算阶次跟踪表征与 RBF-MMD 无监督对齐后,无目标标签迁移准确率可提升至 0.95,逼近 0.97 的监督上限,而卷积网络则接近随机水平。结果表明决定自适应效果的核心是输入表征而非对齐方法。

  29. arXiv 人工智能42

    COUNTERMEM:面向语言智能体的世界模型验证反事实记忆框架

    研究人员提出强化学习框架 COUNTERMEM,利用可执行世界模型在动作失败后生成并验证反事实记忆,以提升语言智能体的跨任务表现。在搭配 gpt-oss-120b 时,该框架在 6 个领域的 12 个基准上将 ReAct 与 Reflexion 的表现平均提升 12.6 个百分点,并将运行 token 消耗降低 7.7% 至 42.0%。基础大语言模型在流程中保持固定,代码将在论文接收后开源。

  30. IT之家 · AI 筛选74

    OpenAI 奥尔特曼公布商业化三步走规划:从底层模型走向生态分发平台

    OpenAI CEO 萨姆·奥尔特曼在开发者大会上公布了争取商业主导地位的三步走规划,核心路径依次为“模型”、“构建”与“分发”。该规划旨在先提供各价位具备竞争力的 AI 模型,再向开发者开放内部开发工具与智能体 API,最终依托 ChatGPT 超过 12 亿的周活跃用户打造成连接企业客户与用户的市场分发平台。

  31. arXiv 机器学习32

    能耗感知的节约型贝叶斯优化方法

    研究人员提出一种在贝叶斯优化框架中引入计算能耗足迹量化指标的方法,引导模型参数配置兼顾性能表现与节约性。该方法旨在解决复杂设计优化中仅追求预测准确度而忽视计算开销的问题。计算实验表明,该机制揭示了最优收敛与底层能耗之间的权衡,有时还能在找到更优解的同时降低能耗。