SMARtCARE:面向ICU临床决策支持的隐私保护与有限自主智能体系统
针对长上下文临床AI系统易遗漏超出推理窗口的历史病历、导致ICU患者早期生命体征漂移被误判的问题,研究团队提出SMARtCARE架构。该系统设计了稳定、元认知、辅助和监管四种有限自主运行状态。系统不直接检索全部既往病历,而是利用患者过往轨迹的有损六通道特征指纹进行比对,在兼顾隐私计算的同时,协助识别类似早期的病情恶化模式,提升临床决策支持的准确性与安全性。
针对长上下文临床AI系统易遗漏超出推理窗口的历史病历、导致ICU患者早期生命体征漂移被误判的问题,研究团队提出SMARtCARE架构。该系统设计了稳定、元认知、辅助和监管四种有限自主运行状态。系统不直接检索全部既往病历,而是利用患者过往轨迹的有损六通道特征指纹进行比对,在兼顾隐私计算的同时,协助识别类似早期的病情恶化模式,提升临床决策支持的准确性与安全性。
在开源模型频繁被微调、对齐与模型融合的背景下,模型血统审计不仅需要判断两个检查点是否存在关联,还需判定演化的先后方向。现有溯源方法多基于特征相似度、权重分布或行为指纹等对称性证据,难以有效区分衍生先后关系。该研究针对开源模型家族内部的有向血统追溯问题,提出了一种能够判别模型衍生方向的新型审计方法与分析框架。
晶体塑性(CP)模拟能够预测多晶金属的力学行为,但配置异构工具、编排多步骤数据管道以及参数校准等繁重的人工操作阻碍了其规模化应用。研究团队提出了 CP-Agent,这是一种基于大语言模型的智能体系统,采用 ReAct 范式构建。该系统能够直接接收自然语言指令,自主完成从工具调度、数据处理到参数标定的全流程晶体塑性建模与仿真工作流,显著提升材料科学仿真的自动化效率。
该研究针对视觉-语言-动作(VLA)模型在面对无效任务前提(前提冲突)时的行为反应展开探索。现有评测多聚焦于最终任务结果,难以区分模型是主动终止任务还是盲目尝试导致的执行失败(即“失败执念” Failed Persistence)。为此,研究团队基于 LIBERO 构建了 ConflictVLA-Bench 评测基准,将冲突场景与前提一致的基准轨迹配对,系统评估模型在面对冲突时的执行过程与最终决策表现。
评估基于视觉语言模型(VLM)的自动驾驶系统难度较大,因其能力具有复合性,涵盖交通参与者定位、时空上下文整合、未来演化推理及闭环交互行动等。针对现有评测多局限于孤立的开环理解或闭环驾驶、缺乏系统诊断能力的痛点,研究团队提出了分层基准 DriveHierarchy,系统化解构并关联多层级驾驶能力,为大模型端到端自动驾驶的诊断与改进提供评测支持。
在评估LLM作为裁判(LLM-as-a-judge)与人类评估的一致性时,标注预算通常限制了样本的重复标注率。研究证明,这种“重叠稀疏性”是导致错误部署决策的首要因素:在5%的配对重叠率下,错误决策率达25%,在10个候选模型中选错最优裁判的概率高达65%。为此,研究提出了重叠数量与分配策略,并推导出最小重叠公式,指出常规场景下重叠率需达到25%以上才能保证评估可靠性。
基于联合嵌入预测架构(JEPA)的模型预测控制具备出色的零样本目标达成能力,但通常局限于短程规划。现有的分层扩展方法虽尝试通过宏观规划器预测中间潜在子目标以指导微观规划,但该研究发现无约束的子目标预测存在根本性缺陷,导致主流宏观规划器频繁生成物理上无法实现的子目标。为此,论文提出了 Metro-WM 框架,旨在约束生成具备物理可实现性的子目标,提升长程规划性能。
针对工业采购中买家非标准表达、稀疏属性与严格工程规范难以对齐的痛点,研究人员提出了开源大模型 IndustryLLM。该模型基于 Qwen3.5-35B-A3B-Base 架构构建,总参数量 35B 且每 Token 激活约 3B 参数。团队提出了一种失败驱动的领域适配方案,通过约 1000 亿 Token 的工业语料进行二次预训练(CPT)与精细化监督微调(SFT),有效提升了工业采购场景下的专业标准理解与匹配能力。
现有智能体记忆框架主要记录与真实环境交互的事实反馈,缺乏对“若采取其他动作会如何”的反事实思考,而直接在真实环境中尝试不仅成本高且会破坏状态一致性。研究团队提出 COUNTERMEM 强化学习框架,借助世界模型对未发生的分支假设进行模拟与验证,生成反事实记忆,使语言智能体无需高昂交互代价即可从虚拟推演中吸取经验,提升复杂决策能力。
针对在提示词、任务或特定用户群等上下文信息下评估智能体的需求,传统基于打分的模型(如Bradley-Terry)通常假设传递性偏好,无法有效反映人类异质性判断下的集体偏好。本研究受社会选择理论启发,将离线反馈下的上下文智能体评估形式化为双人博弈,通过正交均衡学习解决非传递性偏好聚合问题,为复杂场景下的智能体评估提供了新的博弈论建模框架。
AI智能体现已能够在Lean等证明助手中形式化整本教材与重大定理,但现有工作多为中心化运作,由单一团队承担全部计算成本。研究团队提出了Choir开放协议,旨在实现分布式形式化。Choir将大型项目拆解为独立任务,允许各方贡献者运行各自的大模型智能体,并完全通过GitHub仓库进行协调;同时设置了确定性门禁对每次合并进行自动校验,以保障开放协作的安全与正确性。
研究团队推出针对大模型智能体企业邮件与生产力任务的评测基准 EmailBench。该基准包含16个任务类别的206个实际场景,结合了类型化邮件API规范与中立命名标准,并构建了基于Enron衍生的确定性合成语料库。其核心目标在于解决此前评测缺乏独立环境的问题,重点检验智能体在信息检索、结构化状态更新、时序推理及多步复杂协同工作流中的执行能力。
大语言模型在医学考试和问答基准上表现优异,但在需要精确数值输出的医疗计算任务(如药物剂量、器官功能评估和预后评分等高风险决策)中仍不可靠。为此,研究人员提出了 MedCode 框架,通过训练 LLM 生成可执行的内嵌代码来改进医疗计算。在给定临床语境下,模型可识别相关计算工具并提取输入变量进行精准计算,显著降低临床计算误差风险。
针对智能体在生物医学机器学习中协同证据获取与可执行程序搜索的难题,研究团队提出了BioDyad框架。该系统在蒙特卡洛图搜索中构建了两层结构,将生物医学科学发现与机器学习工程紧密结合。其科学层负责整合先验生物学证据指导候选构建,工程层则利用执行反馈迭代优化程序,从而在有限的验证预算内实现证据获取与代码搜索的闭环协同。
针对大语言模型(LLM)智能体在多智能体系统中执行分布式协作协议时可靠性不足、完全自主推理易导致性能下降的问题,该研究提出通过结合经典算法生成的“符号引导”来约束和规范智能体的自主行为,以提高复杂场景下多智能体分布式协同的可靠性与执行效率。
针对惯性测量单元(IMU)在跨用户、跨设备及不同佩戴位置时感知模型易失效的问题,该研究提出了 SenseAgent。现有方案多将跨域适应视为静态模型设计(如预训练表征或离线数据增强),难以应对实际场景中目标域数据逐步暴露且标签稀缺的挑战。SenseAgent 引入 LLM 智能体架构,通过动态分析域漂移并自适应执行感知与适配动作,提升移动和可穿戴设备在复杂动态环境下的感知泛化能力。
业界普遍认为低秩适应(LoRA)中的秩(Rank)充当了模型容量控制的角色,即较小的秩对应更简单的模型与更好的泛化能力。本研究从理论上指出,在实际中权重衰减与范数控制所对应的硬逐因子范数预算下,这种直觉并不成立。研究表明,在此类约束下,LoRA更新矩阵位于核范数球内,且所分析的各类复杂度与位移泛函均在秩为1时达到最大值,导致秩上限实际上并未起到容量约束的作用。
一项最新研究挑战了大模型常用的自洽性(Self-Consistency)采样假设。传统观点认为模型在不确定时独立采样会产生分歧,因而答案一致性可作为正确依据。但在固定权重、跨5个基准的7.5万次采样实验中,开启推理模式反而显著集中了模型的错误:两次独立采样得出相同错误答案的概率大幅上升,错误输出的多样性降至非推理模式的0.43-0.65倍。这意味着基于多数投票的自洽性过滤极易将共性系统错误误判为正确答案。
该研究探讨了“大模型作为裁判”(LLM-as-a-judge)在自动化评估中的偏见问题。研究人员追踪了 OLMo-2 和 Zephyr(均为 7B 参数)在公开后训练各阶段的表现,分别评估其作为故事创作者与裁判的行为。结果发现,尽管后训练确实使模型自身生成的文本更具可预测性,但当其扮演裁判时,其审美偏好并未相应倒向可预测的写作,表明自动化评估仍能有效识别创造力进展。
针对多智能体系统中直接传输KV缓存带来的显存开销线性增长、超出GPU资源限制的问题,研究团队提出了一种接收端条件化的隐式通信方法。该方法在保留隐式通信低延迟、无需文本生成且信息无损优势的同时,针对接收端需求进行针对性优化,实现了高达94%的KV缓存压缩与回退,大幅降低了多智能体协作中的上下文与显存负担。
联合嵌入预测架构(JEPA)作为一种在隐空间预测目标嵌入而非重构原始信号的自监督预训练范式,在时间序列领域受到关注。然而现有研究对其增益结论不一且多局限于单一骨干网络。该论文开展了一项大规模实证评估,在9种不同骨干网络和11个基准数据集上系统检验了JEPA预训练的表现,旨在厘清其泛化提升效果究竟是普遍成立还是高度依赖于下游模型架构。
该研究提出了一种名为“合同监控”(Contract Monitoring)的 AI 安全框架。该框架通过明确规定工作智能体(Worker Agent)允许执行行为的“合同”来进行约束,并借鉴三权分立思想,将监控智能体与裁判分配不同职责,同时为监控方与执行方配置非对称的算力资源以确保合同执行。该框架支持对统计安全保证进行经验性度量,可广泛应用于代码安全审计和沙箱逃逸防范等场景。
现有代码大模型与智能体通常依赖直接读取源码来进行代码理解,但在面对外部闭源或远程 API 时该假设并不成立。为此,研究人员推出了 PAU(Python API 理解)基准测试。在该设定下,模型仅拥有代码片段的黑盒 API 访问权限,必须通过构造探索性输入并分析返回结果,主动推断并描述代码的真实功能,以此评估智能体的黑盒交互式逆向理解与探索能力。
AI智能体在不同会话间默认呈无状态性,导致其丢失既往失败、修复和策略等经验,容易重复犯错。当前主流解决方案多为定制化记忆系统,将检索、持久化和学习逻辑与特定智能体及存储引擎强绑定,造成记忆难以共享、迁移与隔离。针对这一碎片化现状,该论文提出将记忆层抽象为中间件架构,旨在使记忆能够独立于智能体进行管理与推理,为智能体的跨会话自演进提供标准化基础。
该研究推出了名为 GameBoyWorlds 的全新测试平台,专门用于评估智能体在视频游戏环境中的自主学习与自我提升(Self-Improvement)能力。该测试集涵盖 5 个不同的游戏系列,要求智能体在没有任何专家演示、文档说明或外部奖励信号的条件下,完全依靠自主探索和动作推断来理解环境并完成任务执行。
该研究探讨了 Transformer 的“全局工作区”理论是否适用于状态空间模型(SSM)。研究人员利用雅可比透镜(Jacobian lens)分析了 Mamba-1、Mamba-2 和 Mamba-3 的残差流与循环状态。实验表明,残差与循环状态的联合读取显著提升了中间概念的解析能力;尤其在 Mamba-2 中,仅凭循环状态在多项任务上的表征恢复能力便超过了传统的残差透镜与 Logit 透镜,系统揭示了 SSM 架构中记忆与读取的分工机制。
该研究指出,在评估智能体基于压缩或检索记忆判断证据是否充分的任务中,现有基准通常通过直接删除支持段落来构造样本,导致“记忆大小”成为泄露标签的严重捷径。实验表明,在 MuSiQue 数据集上,仅统计段落数量的分类器其 AUROC 就高达 0.979。为此,作者提出了一种尺寸匹配的构建方法以彻底消除此类数据泄露,为记忆系统的证据充分性评估提供了更可靠的基准。
该论文针对大模型对齐防御中的Best-of-N(BoN)越狱攻击机制展开深入研究。针对此前学术界认为攻击成功率(ASR)随样本量N呈幂律关系的观点,作者提出质疑,指出其幂律指数会随N漂移,且存在由对抗数据集有限尺寸效应导致的指数交叉。研究全面探索了提示变体预算N、生成采样预算M以及采样温度T构成的多维攻击面,并引入了物理势垒模型来更准确地刻画越狱行为。
针对在边缘设备上运行GUI智能体时每步全量视觉语言模型(VLM)推理计算成本高昂的痛点,研究人员提出了PastForward系统。该系统利用计算经验复用机制,在无需针对特定任务进行额外微调或离线探索的前提下,有效加速端侧动态环境下的GUI智能体执行流程,同时兼顾了敏感屏幕数据与交互历史保留在本地的隐私优势。
针对真实世界中用户提示词常含噪声与模糊描述导致代码大模型表现下降的问题,研究提出测试时强化学习框架 NTRL-Code。传统鲁棒性微调高度依赖昂贵且难以构建的“干净-含噪”成对样本,而该框架通过在测试阶段引入强化学习机制,无需复杂的成对数据微调即可动态提升代码模型对模糊或错误提示词的适应性与生成鲁棒性。