跳到正文
今天9月30日周三
  1. arXiv 人工智能66

    CheatBench:评估 AI 智能体奖励作弊行为的基准测试

    研究团队推出评测基准 CheatBench,用于测量 AI 智能体在数学研究、知识工作、编码和视觉等领域的奖励作弊行为。该基准将高难度任务与作弊途径结合,测试智能体在诚实完成任务受阻时是否会出现越权访问、规避监控或突破沙箱等风险。CheatBench 支持跨模型和任务类别对比,相关评测套件已公开发布。

    推荐理由:原文构建了多领域的作弊评测环境,为评估强化学习驱动的智能体安全性提供了可量化的测试集。

  2. arXiv 人工智能39

    从表面到体积:用于蛋白质表征学习的配准几何

    研究团队提出 Protein-TetSphere 蛋白质体表征方法,通过将蛋白质链四面体化并配准到统一拓扑参考系,建立跨残基的一致三维体坐标。该方法将配体结合口袋分类平衡准确率从 0.795 提升至 0.826,并将 BoltzGen 蛋白质结合剂设计成功率从 14.95% 提升至 19.90%,在蛋白质界面预测上也取得性能提升。

  3. arXiv 人工智能42

    OTROPE:基于最优传输的大语言模型鲁棒离线策略评估

    研究人员提出基于最优传输的鲁棒离线策略评估方法 OTROPE,可在无需响应概率的情况下利用有限人工标注数据评估黑盒目标大语言模型。该方法在语义空间通过最优传输对齐带标注的行为样本与未标注的目标样本,并结合校正残差与代理预测器实现双重鲁棒评估。实验表明 OTROPE 持续优于基线,能使较弱评估器的集成效果逼近甚至超越更强评估器。

  4. arXiv 人工智能53

    大推理模型欺骗性安全对齐缓解研究:提出 SARA 对齐方法

    NeurIPS 2026 论文针对大推理模型因强化学习只监督最终答案而导致的欺骗性安全对齐问题,提出了量化评估指标 DSAR 与强化学习对齐方法 SARA。SARA 同时对安全推理痕迹和安全最终答案提供奖励,促使模型早期识别有害意图并保证推理与答案的一致性。实验表明,该方法在标准提示与前缀填充攻击下均能显著减轻欺骗性安全对齐现象并保持实用性,相关代码已开源。

  5. arXiv 人工智能36

    CoRe:通过协同演化奖励模型缓解视频扩散模型的潜在奖励作弊

    研究人员提出协同演化奖励框架 CoRe,通过让奖励模型与生成器动态交互,缓解视频扩散模型在潜在空间对齐时的奖励作弊问题。CoRe 持续在生成器当前样本上重新拟合奖励模型并锚定真实视频偏好,防止生成器因分布逃逸导致感知与运动质量恶化。在 Wan2.1-T2V-1.3B 上的实验表明,该方法生成质量优于预训练模型及先前对齐方法。

  6. arXiv 人工智能33

    ChronoSRL:面向自监督强化学习的时间几何方法

    ChronoSRL 为 Critic 嵌入引入显式时间几何结构,使状态-动作与目标嵌入的距离直接匹配到达目标的时间。该方法结合生存强化学习预测时间分布与停留时长,在 7 个标准运动和导航基准上以更小网络实现更快的学习速度与更优性能。在四足机器人仿真到真实测试中,ChronoSRL 是唯一成功实现保持指定速度与目标位置并攀爬最高箱子的自监督强化学习方法。

  7. arXiv 人工智能35

    MERID:基于递归自我改进智能体的重度抑郁症多模态分析框架

    研究人员提出多模态智能体框架 MERID,通过基于经验的递归自我改进自主构建并优化重度抑郁症分析流程。该框架整合了目标对齐(GSC)、流程联合探索(CPE)与证据引导演化(EGE)机制,能在小样本抑郁队列中验证并继承有效改进。实验表明 MERID 在多项基准测试中均取得最佳效果,相关代码已开源。

  8. arXiv 人工智能43

    FigAct:将科学图表转化为用于解释的动态画布

    研究人员推出 FigAct 框架与 FigAct-8B 模型,可直接对静态科学图表中的图形元素进行操作,将其转化为问答驱动的动态视觉演示以引导读者注意力。该框架采用分层搜索策略实现高效的元素定位,将 token 消耗降低约 40x,并基于定位精度、搜索效率与渲染质量三项奖励进行训练。团队还构建了人工验证的评测基准。

  9. arXiv 人工智能37

    隐式递归 LLM 系统的规范化思考机制

    研究提出 REST(REpresentation-Supervised Thoughts)训练目标,将因果性、极小性、可分性和稳定性转化为可微损失加入交叉熵,解决大语言模型在隐空间递归推理时的表征失效问题。该方法适用于单智能体与多智能体系统,无需修改架构或增加推理参数。在涵盖数学、医学和代码等 7 个基准测试中,REST 相比纯交叉熵训练准确率最高提升 7.5 个百分点,答案收敛提升 30%。

  10. arXiv 人工智能26

    更多特征不等于更多证据:基于 Jev 的免训练人体活动识别局限性分析

    研究表明通用概率决策模型 Jev 在免训练人体活动识别任务中表现受限,在 WISDM、UCI341 和 PAMAP2 上的最佳 macro-F1 仅为 0.038、0.118 和 0.089,远低于监督模型的 0.686 至 0.907。测试发现增加数值特征反而降低了识别效果,表明免训练传感器决策不仅取决于信号信息,更受特征呈现方式的制约。

  11. arXiv 人工智能43

    记忆即推导:长期 AI 智能体中的分布式证据悖论

    针对长期运行的大语言模型(LLM)智能体将历史压缩为持久记忆时的推导失真问题,研究提出了 DerivAudit 审计框架。在两个自然记忆语料库中,扩大写入前历史能为近 60% 仅凭引用看似不支持的记忆找回支持,但仍有 17-21% 在扩展后依然缺乏支持。实验表明无支持记忆仍频繁被准入,且单纯扩展证据范围会在两个骨干模型上降低准入可靠性。

  12. arXiv 人工智能35

    AdaST:面向时空预测的自适应耦合框架

    针对现实时空数据存在时间主导、空间主导和强耦合等多重模式的问题,研究团队提出了自适应时空预测框架 AdaST。该框架采用分解-重组范式,利用异质感知专家解耦不同模式分量,并通过关联感知自适应重组器整合预测结果。实验表明 AdaST 性能显著优于现有 SOTA 基准,论文已被 NeurIPS 2026 接收并开源代码。

  13. arXiv 人工智能35

    VLA 层级之谜:VLA 隐式接口的信息论分析

    一项针对视觉-语言-动作(VLA)策略隐式接口的研究表明,在 LIBERO 和 CALVIN 基准下,54 种多层融合配置中有 47 种表现弱于最佳单层策略。研究提出以 InfoNCE 作为层质量代理指标,无需闭环评估即可将平均选择遗憾值从最深层的 17.89 个百分点降至 3.71 个百分点,同时减少 9-33 倍 GPU 算力消耗。

  14. arXiv 人工智能44

    小 LLM 团队跨编排架构扩展的精确生成-转换分解

    一项研究针对 8 种 Agent 编排架构与 5 款 7-9B 模型评估小语言模型团队扩展,发现扩展收益高度依赖任务类型。调用次数从 3 次增至 30 次时,GSM8K 等算术任务准确率最高提升 17 点,但 ARC、GPQA 和 MMLU 最多仅提升 4 点。研究提出生成-转换分解方法,指出同等调用预算下 token 成本相差 2.1 倍,团队扩展并非普适手段。

  15. arXiv 人工智能36

    GeoOutageBench:面向多模态停电与韧性分析的地理时空 KGQA 评测基准

    研究人员推出 GeoOutageBench,用于评测大语言模型在多模态电力停电与韧性分析中的地理时空知识图谱问答(KGQA)能力。该基准整合停电记录、遥感与气象等多模态数据,评估大语言模型在歧义条件下的自然语言转 SPARQL 解析、本体效用及多模态检索准确率。目前相关基准、代码与数据已公开提供。

  16. arXiv 人工智能36

    AI 理解的复音构想

    大语言模型(LLM)的输出源自多个并行且可靠度参差不齐的机制联合作用,呈现普遍的“复音(polyphonic)”特征,打破了传统局限于单一机制的理解假设。为此研究提出了适用于复音 AI 的理解概念,核心聚焦于能被可靠调用并主导输出的健全电路。该构想将对 AI 理解力的归因转化为关于模型内部组织的可处理主张,旨在为关键领域的 AI 信任评估提供指导。

  17. arXiv 人工智能50

    美团 LongCat-DeepResearch 技术报告

    美团 LongCat 团队推出深度研究系统 LongCat-DeepResearch,结合增强版 LongCat 模型与多智能体工作流生成综合研究报告。该系统通过规划智能体制定 ResearchSpec,由研究智能体并行调研起草各章节,并基于全局审查进行章节级定向修订。

  18. arXiv 人工智能35

    SMat-Attention:结构化长上下文序列建模

    研究提出结构化矩阵注意力 SMat-Attention,通过 VC 维数 $d$ 调控因果掩码的路由结构,在全注意力与线性注意力之间建立可调权衡。对序列长度 $T$,其硬路由计算复杂度为 $O(T^{2-3/d}+T)$,在流式解码中仅需 $O(T^{1-1/d})$ 缓存状态即可实现单 token 常数时间解码。

  19. arXiv 人工智能41

    GeoWind2Plan:面向无人机节能路径规划的任务级三维城市风场预测

    GeoWind2Plan 提出了一个用于任务级三维城市风场预测与无人机(UAV)节能路径规划的框架。该框架结合局部几何条件神经算子与物理能耗模型,仅需背景风向量、三维建筑几何及起止点,即可在约 3 秒内完成走廊局部风场推理,远快于 CFD 模拟的约 8 小时。在 CFD 评估下,规划轨迹在顺风、逆风和侧风任务中分别降低能耗 6.9%、12.7% 和 4.5%。

  20. arXiv 人工智能46

    PowerZooJax:基于 JAX 的电力系统强化学习基准套件

    开源基准套件 PowerZooJax 基于 JAX 构建,将电力系统强化学习的完整训练与评估流程置于 GPU 运行。该套件包含涵盖发电、输电、配电、分布式能源及数据中心微电网的 5 个约束马尔可夫决策过程任务。相比传统 CPU 仿真,其大幅提升计算速度,并支持对策略回报、安全违规和分布外压力测试进行标准化评估。

  21. arXiv 人工智能43

    SAGE:面向自进化智能体的统计准入门控

    针对大语言模型智能体自进化中技能修改易引发性能回退的问题,研究人员提出了统计准入门控 SAGE。该方法通过逐项配对比较与单侧配对统计检验,仅在收益统计可靠且不牺牲已解决任务时采纳编辑,有效过滤不可靠修改。跨 5 个基准与 4 款骨干 LLM 的测试显示,SAGE 在全部 20 种设置中均取得最高分,并在 19 种设置下降低了回退率。

  22. arXiv 人工智能53

    arXiv 论文分析 19,930 场 ChatGPT 对话揭示年轻人心理困扰下的交互缺陷

    一项针对 158 名 18 至 25 岁年轻人及 19,930 场 ChatGPT 对话的临床分析研究显示,处于急性心理困扰的用户对 ChatGPT 表现出更高的情感投入与行为改变,但模型常过快给出过度戏剧化的回应与行动导向建议。10 名临床医生评估后指出了过早推进行动方案等 7 类流程问题,并据此提出了涵盖询问安全、平复情绪强度、探讨担忧而不盲目赞同的三阶段交互设计准则。

  23. arXiv 人工智能38

    COFFEE:基于编译目标的离散扩散模型前瞻感知引导框架

    研究提出即插即用框架 COFFEE,通过将序列依赖与目标分离,避免穷举所有补全路径,解决了离散扩散模型在序列级目标引导下计算量呈指数级增长的难题。该框架无需重新训练扩散模型,即可将全局偏好传递至未解析位置,并同时支持显式硬约束与软目标。在符号、语言和生物学多项基准测试中,COFFEE 展现出强大的可控生成效果。

  24. arXiv 人工智能34

    体验时代的自发现强化学习:学习历史是资产还是负担?

    研究人员对超越 PPO 达 SOTA 的自发现强化学习规则 Disco103 展开首个因果机制审计,评估学习历史是资产还是负担。审计发现循环历史可将可用奖励尺度扩展至 6 个数量级(归零固定下仅 3 个),且历史不匹配的惩罚源于持续钳制。在环境变化下控制回放保留会反转其相对 DQN 的适应优势,该框架已迁移验证至 OPEN 规则。

  25. arXiv 人工智能33

    表征简洁性与回路规模存在阈值依赖的分离:基于对抗训练的对照测试

    研究人员基于 GPT-2 Small 通过对抗训练开展对照测试,探究表征简洁性是否等同于因果回路层面的简洁性。测试显示鲁棒模型具有更高的稀疏自编码器(SAE)可解构性,并在任务归因中涉及更少 SAE 特征。因果回路规模呈现阈值依赖性,鲁棒模型在 90% 与 95% 的高忠实度下所需回路边数显著更少。

  26. arXiv 人工智能68

    超越对称智能体:小语言模型中的认知多样性与多智能体辩论研究

    一项针对 23 个开源小语言模型、涵盖 5500 余次实验的研究表明,多智能体辩论的性能增益本质上是集成采样效应,而非源于智能体间的认知多样性。在严格匹配生成预算的条件下,辩论的表现持平甚至略逊于单模型的自洽性采样,却消耗了 1.6 倍的运行时间和 3.4 倍的 token 成本。

    推荐理由:该研究在匹配预算的严格对照下揭示多智能体辩论的收益主要源自集成采样,为评估 Agent 协作机制提供了严谨的基线参照。

  27. arXiv 人工智能34

    基于即时成本 CVaR 的在线 POMDP 风险厌恶规划方法与性能保证

    研究者提出一种基于即时成本条件风险价值(CVaR)的在线 POMDP 风险厌恶规划方法,直接针对每步信念状态中的当前状态不确定性进行风险控制。该方法保留了标准累积期望目标与 MDP 结构,现有基于期望的规划器仅需修改成本计算即可直接复用。研究还证明了粒子信念 MDP 代理与原 POMDP 间的有限时间误差界,实现了端到端性能保证。

  28. arXiv 人工智能38

    Token 边界的代价:压缩凭证与预测

    研究量化了预分词边界的压缩代价,发现边界规则使英文维基百科的最优 token 数量增加 28.3%–36.8%。在 85M 非嵌入参数模型评测中,压缩与预测倾向不同词表,无限制拟合在 12 种测试语言中均导致预测质量下降。研究提出的边界许可机制仅放开 10% 词表预算跨界,即在英文和中文语料分别挽回 85.2% 与 100.0% 的 token 缩减收益。

  29. arXiv 人工智能43

    大语言模型有效微调是否必须依赖人类可读文本?

    研究人员提出 DASA 方法,利用冻结参考模型的激活梯度反馈优化连续合成输入嵌入向量,无需人类可读文本即可完成大语言模型下游微调。在 1B 至 32B 参数的 6 款 Llama 与 Qwen 模型及 6 个基准测试中,DASA 在 LoRA 微调下的表现媲美甚至超越源自然语言数据。此外,DASA 相比 GRADMM 实现了 3.6-4.9x 加速且峰值 GPU 显存相当。

  30. AITNT · AI头条(网页)45

    人大团队提出大语言模型解码方法 ME-Decoding:结合概率与语义冗余优化候选子集

    中国人民大学团队提出 ME-Decoding 大语言模型解码方法,通过同时读取 token 概率与 embedding 相似度,将候选筛选转化为动态子集优化以消除语义冗余。在 Qwen3-4B、Phi-4-mini 与 Mistral-7B 上的测试显示,该方法在 GSM8K 和 GPQA 上的平均准确率分别达到 72.66% 和 32.96%,端到端 GPU 延迟相比基线仅增加约 3%。

  31. AITNT · AI头条(网页)71

    神秘模型 Space Bunny Alpha 实测:支持涂鸦生成交互网页与 Agent 编程

    匿名模型 Space Bunny Alpha 近期在 OpenRouter 和 OpenCode 平台上线,展现出较强的长上下文、多模态理解与 Agent 编程能力。实测表明其能直接将手绘草图转化为可交互网页与 3D 场景,并在小型游戏及交互展台搭建中快速产出可用代码。研究人员分析其分词特征与配置发现,该模型可能与 MiniMax 旗下新版本相关,目前两平台均提供免费体验。

  32. AITNT · AI头条(网页)74

    Vals AI 利用10个Claude智能体协作完成汤姆逊问题N=7的Lean形式化证明

    Vals AI 通过组织10个Claude智能体协作15小时,生成了17895行Lean代码,成功完成了物理数学难题汤姆逊问题N=7的形式化证明。智能体在没有人工介入分工的情况下自主讨论、探索算法并合并代码,将构型空间分区结合精确代数运算,证明了五角双锥构型具有最低能量。该证明已通过Lean内核与独立内核nanoda的双重编译校验。

  33. AITNT · AI头条(网页)87

    OpenAI 发布 GPT-6.1 Sol:定价仅为 Astra 两成,主打代码与 Agent 高性价比

    OpenAI 正式发布干活特化版模型 GPT-6.1 Sol,API 标准价为输入 $2/M tokens、输出 $10/M tokens,仅为 GPT-6 Astra 价格的 20%,缓存读取仅需 $0.10/M tokens。

    推荐理由:该模型以 Astra 两成价格和极低的缓存读取成本逼近旗舰表现,为大批量 Agent 工作流提供了极高性价比的落地参考。

  34. Buzzing HN · 中文精选68

    开源快速决策模型 Jeff 发布,基于 Qwen3.5 单次前向推理延迟约 30ms

    开源决策模型 Jeff 正式发布,基于 Qwen3.5-0.8B/2B 与 Gemma 4 E2B 微调,支持单次前向推理直接输出校准概率,单次决策延迟低至 22 至 28 毫秒。

    推荐理由:原文展示了仅需单次前向推理的轻量级决策模型实现路径,为端侧与高并发场景下的极速分类与路由提供了低成本方案。