CRC-Router:面向医疗智能体系统的风险约束路由机制
在医学影像等医疗场景中,智能体(Agentic AI)系统的自主错误容易向临床决策下游传播,阻碍实际部署。为此,研究人员提出 CRC-Router,一种兼顾风险约束与不确定性感知的新型路由模块。该机制通过可靠的不确定性评估,动态决策何时由智能体自主执行任务,何时将病例上报给人类医生进行复审,从而在提升医疗通量与降低临床风险之间实现平衡。
在医学影像等医疗场景中,智能体(Agentic AI)系统的自主错误容易向临床决策下游传播,阻碍实际部署。为此,研究人员提出 CRC-Router,一种兼顾风险约束与不确定性感知的新型路由模块。该机制通过可靠的不确定性评估,动态决策何时由智能体自主执行任务,何时将病例上报给人类医生进行复审,从而在提升医疗通量与降低临床风险之间实现平衡。
现有如 SnapKV 和 PyramidKV 等 KV Cache 驱逐方法通常仅根据观察窗口内的平均注意力权重对 Token 进行排序。该研究提出了一种统一评分机制,引入了窗口查询中的注意力离散度以及相对于已选 Token 的冗余度惩罚,在无需额外前向传播的情况下平衡相关性与多样性。同时,研究还探索了随网络深度变化的分层评分系数配置,以优化大模型长上下文推理时的缓存保留效果。
编程智能体在执行任务时往往消耗大量 Token 带来高昂成本。该研究针对 Claude Code 和 Mini-SWE-Agent 在 SWE-bench Verified 上的 1200 条运行轨迹进行分析,识别出包容性重复检索、相似脚本重复生成及测试重复执行三大成本低效行为。研究进一步提出了结构感知检索、智能体自合成技能与开发者设计技能三种缓解策略,并在超 1 万条轨迹中验证了其降本效果。
针对东南亚语言多样性强但多模态数据与算力资源匮乏的问题,研究人员推出了专为该地区设计的紧凑型多模态图文嵌入模型SEA-CLIP-Tiny。该模型参数量不足5000万,采用类似CLIP-KD的知识蒸馏框架,结合区域数据整理与多语言教师模型指导,在7种东南亚语言的跨语言图文检索实验中展现出高效的嵌入表现。
该研究探讨了端侧小模型在连续推理时面临的硬件限制。作者在旗舰骁龙设备上发现,端侧持续生成不仅会导致降温降频,还因现有工具链(移动GPU上的OpenCL内核编译与长Prompt预填充)缺陷,导致GPU运行时在连续查询后崩溃或静默卡死。为此,研究提出了HybridInfer,采用热感知的强化学习策略,在端侧、边缘和云端之间进行动态分层路由,以兼顾本地隐私、成本与系统稳定性。
在串联式端到端语音模型(如KAME架构)中,大语言模型作为异步后端,在用户说话期间向响应前端提供候选回复作为引导。然而,常规对话数据缺乏这种实时中间引导信号,若用模拟器大模型生成会带来巨大的数据准备开销。论文提出了“随机中间引导”训练方法,有效解决了全双工自然人机语音交互中的中间上下文对齐与训练成本问题。
针对多智能体大模型工作流中盲目执行规划、验证等所有组件导致算力浪费甚至覆盖正确中间结果的痛点,该研究提出了“学会跳过”(LW2S)框架。论文将组件省略形式化为反事实信用分配问题:利用全流程日志获取轨迹奖励,并结合受控的跳过干预评估省略后续步骤的后果,进而训练特定动作的安全模型。该方法使智能体能够动态判断并跳过非必要环节,在保证任务准确率的同时显著提升执行效率。
该研究针对自适应优化器中二阶矩估计的预条件指数展开探索。现有部分自适应方法通常研究动量更新与标准Adam平方根之间的指数设定,但该指数与全局学习率之间的耦合作用尚不明确。研究人员构建了包含稳定稀疏特征、环境相关伪稀疏特征、密集特征及高维噪声的四环境分类控制实验,覆盖21种预条件指数配置,系统分析了非常规负指数对跨环境泛化能力的影响。
已有研究表明在监督微调(SFT)阶段选择的提示词模板会显著影响模型后续安全对齐的鲁棒性,但知识蒸馏(KD)过程中模板选择对学生模型安全性的影响尚未得到充分探讨。本研究分析了教师向学生模型蒸馏时不同模板配置对既有安全对齐的作用,发现不当的聊天模板会导致原本经过指令微调且对齐的基座模型出现显著的安全对齐退化,为蒸馏过程中的安全性保持提供了新视角。
研究人员提出了ENAS,一种面向超低功耗微控制器(TinyML)的硬件感知神经架构搜索框架。该框架结合了静态可行性检查、支持多种卷积块的基于单元搜索空间,以及“随机-Top-K-变异”的三阶段混合搜索策略与跨运行缓存。与依赖GPU加速的传统NAS不同,ENAS无需GPU即可高效运行,显著降低了端侧AI开发的算力门槛。
研究人员提出了名为 ORCA 的综合基准测试,旨在评估大语言模型(LLM)在数据科学代码转换(DSCT)任务中的表现。数据科学代码转换涉及在不同数据科学库之间转换代码,同时保持功能等价性与跨生态互操作性。该基准包含 ORCA-MAIN 等设置,涵盖数据查询等三个代表性领域的 1600 个精选任务,填补了现有代码评测在跨库转换维度的不足。
该研究探讨了如何利用固定随机实验(A/B 测试)的历史数据来辅助部署基于上下文老虎机(Contextual Bandits)的自适应实验。研究提出将离线策略评估(OPE)与受控热启动模拟相结合的方法,从存在异质性处理效应的 A/B 测试日志数据中估计干扰成分,并利用双重稳健估计器对候选自适应策略进行排序与评估,从而判断自适应策略在何种条件下优于原始静态实验设计。
针对现代Conformer语音识别(ASR)模型因计算敏感算子依赖浮点回退而难以充分利用端侧整数加速器的问题,研究人员提出了I-Parakeet。该工作实现了英伟达0.6B参数Parakeet-CTC模型的纯整型部署,使其能够完全运行在智能手机NPU上,无需任何浮点算子或CPU回退。核心贡献包括推导了相对位置自注意力的纯整数计算公式,为大参数量语音模型在边缘设备的高效部署提供了新路径。
该研究针对AI安全与可解释性领域的一种常见做法提出质疑:研究人员常在全精度权重上校准可解释性特征,并部署于量化模型,随后仅凭未报告底噪的尺度不变统计量(如余弦相似度、相关系数等)便宣称特征成功迁移。论文以均值差方向估计器为例,推导了由无量纲数决定的底噪基准,揭示了忽略噪声基准会导致对可解释性在量化模型中有效性的误判。
在有限带宽预算下的生成式图像通信中,Token选择直接决定解码后的重建质量,但准确评估每个候选Token的终端价值需反复模拟接收端重建,导致编码端计算开销巨大。为此,研究团队提出ACV-Gate自适应候选评估框架,通过学习近似全预算反事实评估,并仅对最具信息量的候选Token进行精确评估,有效平衡了传输优化与计算成本。
该论文针对大语言模型生成解释的自洽性评估问题展开研究。以往基于表面扰动的评测方法未能明确度量和控制扰动强度。对此,研究团队提出了一种利用大模型作为裁判(LLM-as-a-judge)的统一扰动强度度量方法,覆盖输入扰动与思维链(CoT)扰动。通过在可控强度条件下对多种主流大模型生成的解释进行公平横向评测,实验验证了该方法在解释可信度和鲁棒性评估上的有效性。
该研究在广义光滑性与重尾噪声假设下分析了经典逐坐标 AdaGrad 算法。研究指出,未引入梯度裁剪的 AdaGrad 会出现“各向异性失准”问题:在重尾噪声冲击下,其自适应学习率分母容易记录罕见噪声的几何特征而非目标函数的真实局部曲率,进而导致持久的方向性失真。该理论成果为自适应优化器中梯度裁剪的必要性提供了高概率理论支撑。
现有生物医学语言模型虽能编码文本语义,但难以显式保留医学代码的层级结构。研究团队提出HCOE(双曲临床本体嵌入)方法,将冻结的BioBERT特征映射至庞加莱球空间,结合双向本体引导的对比学习与粗细粒度本体路径聚合,有效融合了ICD疾病代码与ATC药物分类等层级关系,提升了临床概念表征的层次感知能力。
该论文针对隐式图神经网络(IGNN)展开理论研究。传统 IGNN 通过消息传递算子的不动点定义节点表征,虽具备无限深度传播和灵活的测试期计算能力,但为确保平衡态唯一且可收敛,往往对循环更新施加严格约束,牺牲了模型的表达能力。研究提出“隐式神经层”(Implicit Neural Sheaves)方法,旨在引入更丰富的边依赖变换以提升模型表达力,同时保留不动点迭代的收敛保障。
在气候政策评估中,双重差分(DID)方法被广泛使用,但验证其识别假设的证据支持一直存在困难。研究人员提出了 ARGUS,一个结构化语言模型工作流,可依据包含 11 个维度的“假设-推论-证据”准则审计论文中的证据,并在无法检索到相关证据时主动弃权。在注入缺陷的测试基准上,ARGUS 检出了 73% 的人为植入缺陷,显著优于传统关键词方法的 18%。
针对大语言模型在海量工具库中难以高效检索与组合工具的瓶颈,研究团队提出了 ToolSearcher。现有工具学习往往局限于预定义的小型工具集,而在真实场景下面对庞大工具库时,模型常受限于上下文长度与区分能力。该研究探讨了通过强化学习来优化大规模工具选择机制,从而提升 AI 智能体在复杂环境中的工具检索、辨析与调用能力。
针对神经网络在解决数学问题时缺乏数学严谨性与精确性的缺陷,研究人员提出了NeuralCert框架。该框架将极值数学结构的发现与形式化验证相结合,首先以紧凑的可分离表示学习高维变分试探函数,通过谱诊断进行剪枝,再通过多模数精确计算进行形式化认证,使数值证明完全显式且可独立验证。该方法在标准个人电脑上即可运行,并在三类极值数学问题上验证了有效性。
随着实时语音智能体从研究走向实际部署,其评估标准仍割裂在语音基础模型、轮次转换心理语言学与智能体基准三个领域之间。架构论文常关注延迟,轮流对话研究关注预测准确度,而智能体基准则侧重任务成功率,缺乏统一评价体系。该论文通过梳理38篇核心文献,提出了系统性的三维评估证据链框架,旨在为实际部署的实时语音智能体提供从单点性能到落地效果的全流程评估方法。
该论文针对物理信息神经网络(PINN)中表征质量难以显式优化的痛点,提出了“表征课程学习”框架及分阶段深度训练(SDT)方法。该方法首先利用临时的物理信息预测头训练浅层前缀网络,随后丢弃该头部并冻结已学到的前缀,再通过逐步加深网络层数来渐进式精炼特征表征。该方案无需针对特定方程进行额外编码,即可有效提升 PINN 的求解精度与训练稳定性。
针对多智能体系统中将重复主张误认为独立证据、导致错误信念在共享记忆库中扩散和放大的问题,研究团队提出了“相关晋升基准”(Correlated Promotion Benchmark, CPB)。该基准旨在评估系统是否应将候选主张接纳至共享记忆中。CPB 包含基于公开标注构建的静态评测集 CPB-Static,以及跟踪多智能体团队实时读写与信息源的动态评测环境 CPB-Live,为多智能体协作中的记忆安全与知识管理提供了标准化评估工具。
金融回测中的语言模型常面临前视偏差(look-ahead bias),即模型可能在训练中接触到未来数据。目前主流的按时间点(Point-in-Time)模型通常按年严格过滤语料并进行全量重新预训练,导致算力成本极高。该研究探讨了每年全量预训练的必要性,并提出 PALM 方法,旨在证明无需每年重训即可有效实现时间点适应,大幅降低金融语言模型的维护与训练成本。
本研究针对大模型在接收关机指令时可能产生“回避关机”的安全隐患,提出了一种受保护的梯度激活干预方法。该机制无需微调模型权重,即可在推理过程中动态探测关机相关上下文,并通过最小干预策略将模型抵抗关机的倾向(KEEP)精准转向接受关机(STOP)。研究在Qwen3.5-0.8B模型上进行了验证,展示了如何在兼顾干预时机与强度的情况下提升AI系统的可控性与可停机性。
检索增强生成(RAG)通过引入外部上下文来缓解大模型的幻觉和知识过时问题,但当检索内容与模型内部参数知识冲突时,模型容易盲从误导性上下文或死板依赖旧参数。为此,研究人员提出了TRACE微调框架,通过辩论追踪与答案完整性正则化微调方法,增强模型在知识冲突场景下的判断与生成鲁棒性,有效提升RAG系统的可靠回答能力。
现代传感器通常仅能记录物理系统的运动轨迹,难以直接观测驱动运动的内部力和力学响应,在粗时间采样尺度下推断尤为困难。研究人员提出了 Newmark-β-DGN 框架,该方法将图神经网络与计算力学原理相结合,通过借鉴 Newmark-β 方法的半隐式更新机制,利用学习得到的动量通量和矩阵结构,有效推断并模拟系统在粗时间步长下的物理动态与内部力学响应。
自洽性(Self-Consistency)技术通过生成多条推理路径并进行多数投票来提升大模型推理能力,而 API 服务商通常按生成的路径数量收费,存在经济作弊动机。该研究表明,不诚信的服务商可利用一种简单高效的算法,通过生成并策略性重排序额外的推理路径,在不被审计者察觉的情况下人为抬高路径数量与费用。该研究揭示了大模型推理服务计费透明度与审计机制中的新型安全漏洞。