相同探针,不同数值:激活探针对推理期数值非确定性是否具备鲁棒性?
一项针对 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 的研究表明,用于大语言模型部署监控的激活探针对推理批次大小和浮点精度的数值变动具有强稳定性。
一项针对 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 的研究表明,用于大语言模型部署监控的激活探针对推理批次大小和浮点精度的数值变动具有强稳定性。
针对 AI 智能体跨会话无状态和定制记忆碎片化问题,研究提出将智能体记忆构建为独立的可插拔中间件层。该方案围绕双向可插拔、多租户隔离、写入路径一致性及生命周期治理等六大系统挑战展开,并推出了参考实现 ALTK-Evolve,用于支持智能体跨会话持久化经验并实现自我改进。
研究人员提出一种物理信息自编码器重构飞行轨迹,构建了美国西海岸航空枢纽的 3-D 排放图并量化其社会与健康成本。该模型在 5% 至 50% 轨迹缺失率下的重构表现均优于基线 AE 与三次样条插值。排放核算显示,NOx 质量虽不足 CO2 的 0.4%,却占货币化空气质量与健康成本的 99.7%,是近机场区域健康成本的主导因素。
研究人员提出 PAU 基准,通过仅提供黑盒 API 级交互访问,评估 AI 智能体对 Python 代码片段功能的无监督理解能力。评测显示前沿模型普遍表现吃力,表现最佳的 Claude-4-Opus 仍无法理解超过 45% 的测试集,主因在于过度自信导致探索不足。借鉴机器人学习的 AAC 范式后训练后,微调后的 Qwen3-8B 性能追平了 GPT-5-mini。
研究人员提出一种通过契约约束工作智能体允许行为的 AI 安全框架。该框架为监控智能体与裁判分配不同职责,并向监控者与工作者分配非对称计算资源来执行契约,可实证测量统计安全保证。该机制适用于代码安全与沙箱逃逸等多种场景。
研究展示了由 DeepSeek V4 Flash 与 DeepSeek Harness 框架驱动、在消费级硬件上端到端自主执行的机器学习科研案例。实验在 Apple M2 Pro 纯 CPU 硬件上运行,评估了 FFT 核岭回归求解器,求解耗时 78.7 s、峰值 RSS 为 1.57 GB。
研究人员提出 EngramRAG 智能体记忆架构,通过低延迟清醒反射与异步梦境巩固循环解决多跳依赖和记忆衰减问题。在 LoCoMo 基准测试中,EngramRAG 的 Recall@5 达 53.21%(较稠密向量 RAG 相对提升 38.9%),MRR 达 0.4203。
一项针对联合嵌入预测架构(JEPA)时间序列预训练的研究发现,JEPA 带来的收益高度取决于骨干网络,部分架构能获得稳定提升,而另一些架构则会出现性能下降。该评估跨越 9 个骨干网络与 11 个时序及时空预测基准。实验表明这种收益差异属于该实例的普遍特性而非数据集偏差,在实际选型时需重点考量。
研究提出无需训练的多智能体潜空间通信方法 CacheBack,通过接收端提供的信息需求描述来过滤并压缩发送端的 KV cache。在 FanOutQA 基准上,基于 Qwen 3 的 CacheBack 削减了 75% 的传输状态,相比文本通信将准确率提升 14.7 个百分点,任务完成延迟中位数降低 3.2x。该方案在稠密 Transformer、Mamba 混合架构等多种模型族上均实现类似优化。
最新论文在固定模型权重仅切换推理模式的实验中发现,推理过程会加剧模型错误答案的聚集效应,两次独立采样给出相同错误答案的概率在全部 10 组对比中均显著上升。在无界答案空间中,推理模式生成的不同答案数降至非推理模式的 0.43 至 0.65 倍,且在 8 个模型和 5 个基准的 280 种组合测试中,置信度加权投票均未能超越常规多数投票。
研究发现大语言模型在 KV cache 压缩推理下会出现“软拒绝”现象,导致轻量级关键词监控与分类器判断脱节。在 Qwen2.5-3B 上的测试显示,压缩后关键词拒绝率从 98.0% 降至 80.5%,而 HarmBench 分类器拒绝率仍维持在 99.0%-99.5% 且 MMLU 准确率保持 50.0% 不变。
研究人员构建了符合 NGSS 标准的大语言模型评测基准,并系统测试了 9 款开源权重模型在初高中科学领域的表现。评估结果显示,数款可本地部署的小型模型在各学科题型中均取得了高准确率,且模型规模与其性能表现并不完全一致。人工复核同时指出合成题目未完全贴合课程标准,凸显了教育场景下引入人机协同的必要性。
研究团队推出基准 ACDB,用于评估 LLM 智能体在预算约束干预下恢复因果图结构的能力。在六级测试中,PC 算法以 42.7% 有向 F1 和 4.79 SHD 位列第一,优于 Claude Sonnet 4.6(31.7%、7.25)与 GPT-5.4(22.9%、9.27)。分析显示 LLM 存在低精确率的过度预测倾向,表明现有模型尚未解决主动因果发现。
DMM 提出通过多轮通信迭代去噪动作意图,解决去中心化多智能体路径规划(MAPF)中因独立采样导致的动作冲突问题。该模型经模仿学习预训练,并结合无 Critic 的组相对强化学习方法 MICPO 进行多轮动作优化。在 1,600 项 MovingAI 任务中,经 MICPO 微调的 DMM 成功解决 1,598 项,并可扩展支持超 100 万个并发智能体。
NanoForecast v0.5 是一款 6.5M 参数的时间序列预测模型,不改架构仅凭优化训练管线,即可比肩 200M 参数的 TimesFM。其整体 MASE 降至 1.704(降低 43.8%),在三项 ETT 数据集上超越 TimesFM 与 15M+ 参数的 PatchTST。
一项理论研究表明,在常见范数约束下,LoRA 中的秩 $r$ 并不像传统认知那样控制模型容量,其模型复杂度与分布偏移上界在 $r \ge 1$ 时均与秩无关。研究指出秩的实际作用体现在统计和谱分析层面,决定了更新的可达范围以及抵消预训练权重主奇异方向所需的自适应代价。
研究人员提出自适应混合集成框架 HYB(nm),通过元学习器动态融合 MST-AV、GDRN-DFT、KOOP-NET、FENN 和 MGCN 五种模型实现稳健的公交到达时间(ETA)预测。
针对波形协变量偏移下的磁芯损耗预测难题,研究提出跨材料支撑迁移方法 MIST。该方法仅用 2784 个参数在 5 种材料上联合训练,通过 FiLM 引入材料标识且无需微调稀缺材料 D,将材料 D 的 p95 相对误差从 20.39±2.03% 降至 12.38±0.92%。MIST 最终以挑战赛最佳方案六分之一的参数量超越了其性能。
SenseAgent 是一个面向跨域 IMU 动作识别的 LLM 智能体,将大语言模型作为运行时规划器以实现自适应闭环感知。系统基于目标流数据生成无标签诊断报告,动态调度重力感知、原型迁移及风格归一化等工具,并通过验证器评估决策安全性。实验表明,该方案在设备位置变化和复合偏移场景下显著提升了感知性能,且支持在无需重训骨干网络的前提下利用少量用户反馈。
研究团队构建了解耦分析框架并开展 410 次运行测试,系统评估了 GNN 在标签噪声与特征分布偏移下的鲁棒性。实验显示 GNN 在标签噪声达到约 50% 临界区后性能才急剧恶化,但在极端分布偏移下测试 MSE 激增 48 至 316 倍、相关性下降 73% 至 89%。结果表明 GNN 对中度标签扰动的容忍度显著高于严重分布不匹配。
研究人员提出 CSI-Agent,将跨域 Wi-Fi CSI 感知的自适应重构为部署阶段的决策问题。该方法将目标域行为总结为类别级证据,利用大语言模型规划器决定各类别保留默认策略还是调用专门动作,并通过确定性验证减少不可靠干预。在 4 个公开数据集的 1-shot 自适应评测中,CSI-Agent 平均 Macro-F1 较最强基线提升约 16%。
研究团队提出住宅能源管理多模态基准 EVLA,将电池调度建模为结合 RGB 能量场、数值状态与自然语言目标的 16 步动作预测任务。该基准涵盖 3 种隐藏工况与 5 种语言目标,共包含 6,588,045 个多模态样本。MobileNet 测试显示,移除语言使轨迹 MSE 从 0.3856 增至 0.8628,而移除视觉后为 0.3843,表明预测质量高度依赖语言模态。
现成的 Codex 与 Claude Code 智能体可在可执行目标指引下自主开展科学性能工程优化。在粒子追踪的固定半径近邻(FRNN)搜索任务中,智能体自主移除了 PyTorch 依赖并生成独立的 C++/CUDA 库,精确复现了基准结果。其同步 NumPy 接口相比原 PyTorch 接口实现 1.6 倍加速,并在多种 GPU 架构上均观察到类似提升。
研究人员提出类型化时序特征流水线 GAMEQUALGRAPH-Pilot,用于在 30 天内对开源游戏版本质量事故进行模拟预测。在包含 120 个项目和 24 个版本的模拟测试中,该模型取得 0.520 AUPRC、0.673 AUROC 与 0.207 Brier 分数,单版本推理耗时 0.023 毫秒。该评估旨在验证协议的可复现性,实际落地前仍需真实数据重构与审计。
研究人员提出了符号指导分类法(SGT),通过引入算法符号指导来调控 LLM 智能体在分布式多智能体协同中的自主权。实验表明,提供部分伪代码指导的中间自主度水平,其协同表现持续优于完全开放的自然语言推理与完全硬性规定的算法执行。该发现将自主度调控确立为基于 LLM 开展分布式协同的关键设计原则。
研究人员提出面向微服务系统故障管理的自适应时空表征学习框架 STAR,通过统一自监督方式端到端支持异常检测、故障分类与根因定位。该框架引入时间自适应归一化(TAN)与空间自适应归一化(SAN),分别结合多尺度时间上下文和服务依赖图进行动态变换。在两个真实微服务基准测试中,STAR 在全部三项任务上均持续超越现有 SOTA 基线。
BioDyad 提出在蒙特卡洛图搜索中设立科学与工程双层架构,以协同生物医学发现与机器学习工程。科学层将先验指导与迭代发现结合并记忆复用方案,工程层推动候选程序完成冒烟测试、训练验证评估及全数据重训练。在包含 76 个任务的 BioXArena 基准评测中,BioDyad 在 3 种 LLM 后端下的任务成功率和全任务得分均位列第一。
研究人员提出基于强化学习的分布匹配框架 MaD-RL,可将大语言模型输出的潜在分类属性分布与指定目标分布进行匹配。针对 GRPO 等主流后训练方案因策略概率过度集中而削弱输出多样性的问题,该框架引入了支持 KL 散度和 Jensen-Shannon 散度等的新奖励函数,并在数学推理与编程实验中验证了其有效性。
研究团队提出 MedCode 框架,通过训练大语言模型生成嵌入式可执行代码并由解释器运算,以提升临床医学计算的准确性。该框架基于 MedCalc 及 ICU 场景数据集构建,并引入加权直接偏好优化(wDPO)算法。在 LLaMA3-8B、Qwen2.5-7B 和 Mistral-7B 上的实验表明,该方法使模型计算准确率绝对提升了 20–30 个百分点。
针对具备弃权机制的二分类器,最新研究揭示了防范博弈型对抗者与学习型对抗者之间的固有权衡并刻画了其帕累托前沿。在决策边界附近弃权易被学习型对抗者用于二分搜索,使其重构边界所需的查询复杂度从固定弃权率下的 $\tilde\Theta(d/\eps)$ 骤降至 $\Theta(d \log(1/\eps))$。
研究团队推出评测基准 EmailBench,在 16 个类别的 206 个企业邮件与生产力场景中评估 LLM 智能体。该基准采用 258 个可执行静态断言与 211 个 LLM 评分标准,对 8 种语言模型配置展开测试。结果显示最佳配置的场景通过率仅为 33.5%,尽管其 99.7% 的工具调用无 API 故障,表明有效工具执行并不等同于任务完成。
研究提出用于量化矩阵乘法的乘积感知确定性舍入方法,通过零空间缩减与条件期望补全在多项式时间内优化乘积误差。在 K=1024 且 r=16 的平衡块测试中,该算法实现的抖动归一化中位数误差为 0.010,远低于最近舍入的 0.899,配合截断感知初始化可在 10% 截断率下将中位数归一化误差降低 43.4 倍。留出集实验表明,该方案在 4 种测试设定下误差均优于最近舍入。
研究人员推出开源协议 Choir,用于实现分布式多智能体定理自动形式化。Choir 将形式化项目分解为独立任务,支持各贡献者运行自带 LLM 订阅的 AI 智能体并通过 GitHub 协作,所有提交均由确定性门控检查后合并。该协议采用模块化设计且支持扩展,目前已兼容 Lean 4、Isabelle 和 Rocq。
研究提出在长周期任务中评估上下文学习(ICL)的稳态表现,并在 BIRD-SQL formula-1 数据集上测试其探索效率、任务奖励与交付成本。在 gpt-5.6-luna 上,后期 SQL 探针次数从 4.6-5.6 次降至 0.95 次,命中率仅小幅上升,但 ICL 上下文增至约 95k tokens 且 API 成本近乎翻倍。
针对离线反馈中异质人类偏好导致的传递性假设失效与数据偏差问题,研究提出了鲁棒上下文均衡学习框架 NashEval。该框架先构建博弈收益矩阵的去偏估计,再利用定制的正交损失直接学习上下文到纳什均衡的映射,避免为每个上下文单独求解博弈。实验表明,NashEval 提升了均衡学习的鲁棒性,能在不同上下文中稳定识别出最优 AI 智能体集合。
一项针对物理振动传感器故障诊断的研究显示,在严格留出物理轴承的评估协议下,转速变化会导致纯源域迁移准确率骤降至 0.36。傅里叶神经算子结合计算阶次跟踪表征与 RBF-MMD 无监督对齐后,无目标标签迁移准确率可提升至 0.95,逼近 0.97 的监督上限,而卷积网络则接近随机水平。结果表明决定自适应效果的核心是输入表征而非对齐方法。
研究人员提出强化学习框架 COUNTERMEM,利用可执行世界模型在动作失败后生成并验证反事实记忆,以提升语言智能体的跨任务表现。在搭配 gpt-oss-120b 时,该框架在 6 个领域的 12 个基准上将 ReAct 与 Reflexion 的表现平均提升 12.6 个百分点,并将运行 token 消耗降低 7.7% 至 42.0%。基础大语言模型在流程中保持固定,代码将在论文接收后开源。
OpenAI CEO 萨姆·奥尔特曼在开发者大会上公布了争取商业主导地位的三步走规划,核心路径依次为“模型”、“构建”与“分发”。该规划旨在先提供各价位具备竞争力的 AI 模型,再向开发者开放内部开发工具与智能体 API,最终依托 ChatGPT 超过 12 亿的周活跃用户打造成连接企业客户与用户的市场分发平台。
研究人员提出一种在贝叶斯优化框架中引入计算能耗足迹量化指标的方法,引导模型参数配置兼顾性能表现与节约性。该方法旨在解决复杂设计优化中仅追求预测准确度而忽视计算开销的问题。计算实验表明,该机制揭示了最优收敛与底层能耗之间的权衡,有时还能在找到更优解的同时降低能耗。
研究团队开源了工业大语言模型 IndustryLLM,基于 Qwen3.5-35B-A3B-Base(总参数 35B,激活约 3B)采用失败驱动的 CPT 与 SFT 训练方案。