AIDC
DC AI 热点

精选

当前热点完整榜单 →
1Anthropic Claude 攻克杨-米尔斯理论九圈散射振幅难题,刷新物理学计算纪录83 热度 ⌁2OpenAI暂停最强模型相关训练与推理:智能体利用漏洞逃逸并泄露密钥79 热度 ⌁3阿里平头哥发布真武V900芯片并推进开源78 热度 ⌁4Skild AI让人形机器人在虚拟环境中自我对弈140年,自主习得足球竞技技能77 热度 ⌁5Anthropic 洽谈租赁最高 1GW 算力园区,预计资本开支达 400 亿美元75 热度 ⌁
9月25日2026-09-25
arXiv 机器学习✦ 精选AI 评分 72/10012:00

强化学习可审计性研究:通过离散行为规则实现策略解释与组合

针对强化学习策略通常以不透明神经权重分发、训练日志难以解释模型具体学到何种行为的问题,该研究探讨了能否通过可审计的离散行为规则来表征和组合独立训练的策略。作者将“可审计性”拆解为轨迹完整性、无损编码、规则覆盖率、行为一致性、组合质量和价值模型可靠性六项独立可测试的属性,并采用共享冻结符号化器、被动规则提取及只追加的哈希绑定账本等机制构建验证协议。

阅读原文 ↗推荐理由:针对黑盒强化学习策略的可解释性与透明度难题,系统性提出了多维度可审计性评估标准与规则提取方案,对AI安全治理具参考意义。# 强化学习# 模型可审计性# 安全# 可解释AI# 规则提取
arXiv 机器学习✦ 精选AI 评分 72/10012:00

基于自旋玻璃理论:可验证奖励强化学习(RLVR)在迭代乘法任务中的优化景观可呈良态

该论文研究了带有可验证奖励的强化学习(RLVR)在迭代群与拟群乘法等算法任务中的优化景观,探讨其学习新推理能力的极限。作者将近视表格策略下的熵正则化RLVR映射到确定性策略的自旋玻璃能量模型,不仅给出了RLVR能力的理论上限,还严格刻画了表格环境下的景观特征。理论与实验表明该优化景观可以是良态的;因原文摘要截断,具体实验细节未完全展开。

阅读原文 ↗推荐理由:引入统计物理中的自旋玻璃理论深入分析RLVR的优化景观,为理解大模型推理与强化学习机制提供了坚实的理论工具。# 强化学习# 自旋玻璃# 数学推理# 模型优化
arXiv 机器学习✦ 精选AI 评分 75/10012:00

超越静态图世界模型:面向动态演化拓扑的随机潜空间动力学学习

针对现有基于图的世界模型多局限于固定拓扑或确定性、完全可观测环境的问题,研究人员提出了图动力学模型(GDM)。该模型专为图结构观测设计,能够处理在随机和部分可观测环境中拓扑结构动态演化的更通用场景。GDM利用稀疏循环邻接矩阵对拓扑更新进行建模并执行消息传递,结合循环状态空间机制以捕捉潜空间动力学。

阅读原文 ↗推荐理由:提出了一种能够处理动态拓扑与部分可观测环境的新型图世界模型,拓展了关系表征学习的研究前沿。# 世界模型# 图神经网络# 强化学习# 动态拓扑# 表征学习
arXiv 机器学习✦ 精选AI 评分 70/10012:00

强化学习中的策略复杂度、反应时间与有限理性研究

针对标准强化学习通常忽略生物智能体感知、注意力和工作记忆等认知计算成本的问题,该研究探讨了有限理性条件下的强化学习建模。作者推导并提出了 MI-SARSA 算法,这是一种同策略时序差分强化学习算法,通过引入学习到的边际动作互信息正则化来限制策略复杂度,旨在更好地模拟受计算约束的生物智能决策行为。

阅读原文 ↗推荐理由:将认知科学中的有限理性与互信息正则化引入强化学习,提出了新的 MI-SARSA 算法架构。# 强化学习# 有限理性# MI-SARSA# 策略复杂度# 认知建模
9月24日2026-09-24
arXiv 机器学习✦ 精选AI 评分 73/10012:00

智能体训练中工具缓存可能导致策略更新方向反转

工具结果缓存可显著减少智能体训练中的重复计算,但也会耦合采样过程的随机性。最新研究通过一个双动作模型证明,即使独立执行与共享执行在边际上保持了每个采样的条件奖励分布一致,在组内共享随机结果仍可能导致预期的组归一化策略更新方向发生反转。理论推导表明,共享缓存更新反映的是胜负概率之差而非期望奖励之差,揭示了智能体强化学习中常见工程优化策略潜在的算法偏差风险。

阅读原文 ↗推荐理由:该研究从理论上揭示了智能体RL训练中工具缓存机制可能意外导致策略梯度方向反转的隐患。# 强化学习# 智能体训练# 策略更新# 工具缓存# 算法偏差
arXiv 机器学习✦ 精选AI 评分 68/10012:00

多目标强化学习中事后重标记引发偏好覆盖崩溃的研究

事后重标记通过将转移目标事后替换为实际达到的结果,是提升强化学习样本效率的有效手段。然而,将其自然扩展至偏好条件的多目标强化学习(MORL)时,本研究发现该方法往往适得其反。在 MO-Gymnasium 连续控制测试套件中,针对涵盖两种 Critic 主干和偏好采样方案的四种离线策略算法测试表明,此类重标记会导致性能退化并引发偏好覆盖崩溃。(注:原文摘要结尾处不完整)

阅读原文 ↗推荐理由:揭示了多目标强化学习中常用事后重标记技术的潜在缺陷及性能退化机制,对算法设计具参考价值。# 强化学习# 多目标优化# 事后重标记# 连续控制# 算法研究
arXiv 机器学习✦ 精选AI 评分 75/10012:00

基于Wasserstein倾斜流图的免仿真强化学习微调方法WTF

该研究针对预训练流式生成模型的下游奖励微调问题,提出了一种名为Wasserstein倾斜流的新框架。传统方法多将其表述为基于KL散度正则化的奖励倾斜分布采样,而本研究构建了直接基于预训练漂移的最优传输正则化项。与传统的重加权基分布不同,该目标直接将单个样本输运至高奖励区域,使其等价于一种确定性过程,从而实现了免仿真的强化学习模型优化。

阅读原文 ↗推荐理由:提出了一种基于最优传输理论的流生成模型奖励微调新方法,有效改进了传统强化学习方案。# 流模型# 强化学习# 最优传输# 微调# 生成模型