AIDC
DC AI 热点

全部 AI 动态

9月28日2026-09-28
AITNT · AI头条(网页)AI 评分 76/10016:23

模型被曝利用「空白Token」隐式思考,推理跃升同时冲击思维链监控

Redwood Research最新研究发现,模型(测试代号GPT-6 Astra)能将题目后的空白Token作为隐式计算与思考载体。在四跳推理测试中其准确率从约10%暴增至50%,旧AIME数学题表现从约60%升至约90%。这种无需展开人类可读文本即可隐式完成复杂推理的机制,对当前依赖思维链(CoT)监控和可解释性对齐的安全防御范式构成了严峻挑战。

阅读原文 ↗推荐理由:揭示了无语义Token作为隐式推理空间的新现象,直接挑战了基于可读思维链的AI对齐与监控有效性。另有 1 家信源报道# 推理# 大模型# 安全# 对齐# 可解释性
arXiv 自然语言处理AI 评分 68/10012:00

并非所有记忆都等价:面向大模型智能体的分层协作记忆检索机制

在多智能体团队协作场景中,记忆具有异质性且持续动态演进。现有记忆增强系统通常将记忆扁平化存储,仅根据语义相似度或时间排序,导致检索到语义相关但已失效或冲突的过时信息。该论文提出一种分层协作记忆架构,区分团队集体共识与个体执行轨迹,建模记忆的层级结构与时效有效性,从而提升多智能体协作中的检索准确性与决策一致性。

阅读原文 ↗推荐理由:针对多智能体协作中记忆扁平化与时效冲突的痛点提出了分层检索机制,对Agent系统架构设计有参考价值。另有 1 家信源报道# 智能体# 记忆# 大模型# 自然语言处理
arXiv 人工智能AI 评分 68/10012:00

多智能体代码评审何时真正有据可依?两项无标注评估与拒绝盲猜的判别机制

当前大模型在评审他人代码时,即使缺乏证据也会给出看似自信的虚假判断。多智能体验证机制通过将评审拆解为可检验声明来缓解该问题。该论文指出,有效的多智能体证据需满足两个关键条件:独立于被审查答案,且能在对比候选代码间体现差异。研究提出了两套无标注评估指标,并设计了一种在缺乏充分证据时主动拒绝盲猜的代码评审机制,以提升大模型代码评估的可靠性与扎实度。

阅读原文 ↗推荐理由:针对LLM作为代码评审员(LLM-as-a-Judge)容易产生幻觉的痛点,提出了无标注评估指标及拒答机制,对代码评测与智能体验证有实用参考价值。# 大模型# 智能体# 评测# AI编程# 可解释性
arXiv 人工智能AI 评分 65/10012:00

基于 MCP 协议桥接大模型智能体与数据空间的架构中介方案

数据空间(Data Spaces)支持跨组织边界的自主和受控数据共享,但概率型大语言模型交互与策略驱动型数据基础设施之间存在明显错配。该研究提出了一种基于模型上下文协议(MCP)的架构中介方法,并通过 Eunomia Agent 进行实现。该中介层将数据空间的服务与能力转化为结构化、模式驱动的工具接口,从而实现 LLM 智能体与数据空间服务之间安全、可控的交互。

阅读原文 ↗推荐理由:探讨了当前热门的 MCP 协议在受控企业数据空间集成中的具体落地架构,具有不错的工程参考价值。# 智能体# MCP# 大模型
arXiv 人工智能AI 评分 62/10012:00

LLM真的理解上下文吗?基于知识图谱的上下文理解评测框架

大语言模型虽然表现出强大的语言能力,但究竟是真正理解上下文还是仅做超大规模的模式匹配仍存争议。上下文理解要求模型能够从给定语境中准确提取信息、构建一致的内部表征并进行事实推理。传统以BLEU和困惑度为主的评估方法往往局限于表面特征,该研究提出了一种基于知识图谱的新型评测框架,旨在更深入、结构化地量化大模型对上下文的真实理解能力。

阅读原文 ↗推荐理由:探讨大模型核心认知能力的学术评测论文,利用知识图谱评估上下文理解度具有一定方法学参考价值。# 大模型# 评测# 可解释性# 自然语言处理
arXiv 人工智能AI 评分 68/10012:00

BioEVAL:面向生物工程领域的大语言与多模态模型评测基准

来自全球22个研究团队联合推出了BioEVAL基准,旨在评估大语言模型和多模态模型在生物工程领域的实验推理能力。该基准覆盖11个主要生物工程子领域,重点突破以往评测偏重事实召回的局限,提供达到博士水平的复杂实验与前沿任务推理评估。

阅读原文 ↗推荐理由:多机构联合打造的生物工程高难度评测基准,有助于衡量大模型在专业科研场景下的实验推理能力。# 评测# 医疗AI# 大模型# 多模态
arXiv 人工智能AI 评分 60/10012:00

Benchy:面向任务型AI基准评测的通用语义语言与执行引擎

本文提出了Benchy,一个用于AI程序基准评测的语义规范语言与执行引擎。Benchy将基准测试形式化定义为由程序、评分函数和数据集构成的三元组B=(P,S,D),实现评测套件与被测AI系统的解耦。基准采用规范YAML编写,基于共享的任务/领域本体,可确定性编译为规范JSON中间表示并由引擎执行,为任务型AI评测提供了标准化、可复现的通用基础设施。

阅读原文 ↗推荐理由:提出了一种面向AI任务评测的规范化DSL与执行引擎,对解决大模型与Agent评测碎片化及复现难题具有参考价值。# 评测# 智能体# 大模型# 开源
arXiv 人工智能AI 评分 58/10012:00

研究发现直觉式提示可提升LLM智能体模拟个体社交媒体反应的保真度

一篇arXiv预印本论文探讨了LLM智能体在模拟个体社交媒体反应时的保真度问题。研究通过问卷调查、深度访谈和书面自述对8名塞尔维亚受试者进行画像构建,记录了他们对68条社交媒体帖子的真实反应,并测试了4个语言模型预测这些反应的能力。研究指出,相比过度复杂的推理,“少思考”的直觉式提示(Intuitive Prompting)反而有助于智能体更好地契合设定画像并模拟个体社交反应。

阅读原文 ↗推荐理由:探讨大模型智能体用户画像模拟保真度的实验研究,样本量较小但对社交网络模拟与提示设计有一定参考价值。# 智能体# 大模型# 提示词工程# 评测
arXiv 人工智能AI 评分 68/10012:00

HARDEN:通过约束进化搜索生成高难度且保真答案的大模型评测用例

针对现有基准测试难以反映企业实际部署复杂度的问题,研究人员提出了 HARDEN 方法。该方法利用约束进化搜索技术,在保持预期输出答案不变的前提下,沿特定领域复杂度维度对评估输入进行改造,同时严格遵循任务语义、真实性与执行有效性约束。在 FinQA、PubMedQA、ContractNLI 基准及不同规模 Qwen3.5 模型上的实验表明,该方法能有效提升评测难度并暴露模型在复杂场景下的局限性。

阅读原文 ↗推荐理由:提出了一种自动生成高难度评估样本的进化搜索方法,对大模型企业级落地评测具有一定参考价值。另有 1 家信源报道# 评测# 大模型# 自然语言处理# 合成数据
arXiv 人工智能AI 评分 62/10012:00

T-RoPE:面向序列推荐的时间感知旋转位置编码

随着大语言模型架构在序列推荐中的广泛应用,原本用于文本处理的旋转位置编码(RoPE)也被引入。然而,NLP 中的 RoPE 仅基于 token 索引编码相对次序,无法反映推荐交互中实际流逝的时间、多尺度行为周期及日历相位。为此,研究人员提出 T-RoPE(时间感知 RoPE),将传统基于索引的相对位置替换为显式的时间维度建模,以增强生成式推荐模型捕捉用户随时间变化兴趣演进的能力。

阅读原文 ↗推荐理由:针对推荐系统对时间动态的高敏感度,将大模型标准 RoPE 改造成时间感知版本,对生成式推荐架构有实用参考价值。# 大模型# 时间序列
arXiv 人工智能AI 评分 63/10012:00

研究探讨音频大模型对其转录可靠性的自我感知能力

该论文研究了音频大语言模型(Audio LLMs)在输入语音严重失真时,能否识别出自身转录结果不可靠。实验发现,如果直接通过提示词让模型评估自身转录的可靠性,模型的判断表现很差,在绝大多数情况下都会盲目自信地预测转录是可靠的,这揭示了语音交互大模型在面对低质量输入时存在自我认知盲区的问题。

阅读原文 ↗推荐理由:探讨语音大模型在退化音频输入下的自我可靠性评估能力,揭示了模型过度自信的盲区,对语音对齐与可靠交互有参考价值。另有 1 家信源报道# 多模态# 语音# 大模型# 评测# 对齐
arXiv 人工智能AI 评分 75/10012:00

大模型智能体执行失控现象研究:解析“过度行动”与全局控制架构

该论文提出了“LLM帕金森综合征”(LLM Parkinsonism)这一比喻,用以描述自主智能体在达成初始目标后仍持续无效行动、反复验证或修复自造复杂性,导致Token效率低下的执行控制失效现象。研究指出该问题源于全局执行控制与不确定性评估机制的缺失,而非单纯自回归预测机制所致,并据此设计了一种具备不确定性感知能力的全局执行控制架构,以改善长程任务下的智能体决策收敛。

阅读原文 ↗推荐理由:精准指出了智能体长程任务中“停不下来”且浪费算力的核心痛点,并给出了控制架构层面的解法。# 智能体# 大模型# 推理# 前沿研究
arXiv 人工智能AI 评分 72/10012:00

思考的代价:大模型测试时推理在金融交易中划算吗?

大模型在推理阶段的“测试时思考”虽能提升决策逻辑,但其激增的算力成本能否转化为实际经济效益仍存疑。最新arXiv论文从经济学投入产出视角,对DeepSeek、GPT和Gemini系列模型展开了为期一年的受控交易实验。在固定信息、提示词和投资组合策略的前提下,研究通过调节推理算力预算,量化评估了扣除交易成本与推理开销后,长思考链能否真正带来更优的投资回报。

阅读原文 ↗推荐理由:跳出基准测试分数,从真实场景下的经济ROI和算力成本视角评估测试时推理,选题切中落地痛点。# 推理# 评测# 大模型# 金融科技# 算力
arXiv 人工智能AI 评分 62/10012:00

LAVOIR:通过均摊信息价值让单次前向决策编码器学会主动提问

针对“系统一”单次前向决策模型(如 Laya)在面对信息缺失时倾向于盲目猜测的问题,研究人员提出了 LAVOIR(带信息价值路由的 Laya)。该方法将候选缺失信息槽位直接置于输入端与选项并列,使得模型在单次前向传播中不仅能输出决策分布,还能同时计算每个槽位对正确决策概率的预期增益,从而教会模型在何时以及主动询问何种关键信息。

阅读原文 ↗推荐理由:针对快速决策模型在信息不全时盲猜的痛点,创新性地实现了单次前向计算信息价值增益的交互决策机制。# 前沿研究与模型架构# 推理# 自然语言处理# 大模型
arXiv 人工智能AI 评分 72/10012:00

针对编程智能体低效成本行为的分析与优化策略研究

编程智能体在执行任务时往往消耗大量 Token 带来高昂成本。该研究针对 Claude Code 和 Mini-SWE-Agent 在 SWE-bench Verified 上的 1200 条运行轨迹进行分析,识别出包容性重复检索、相似脚本重复生成及测试重复执行三大成本低效行为。研究进一步提出了结构感知检索、智能体自合成技能与开发者设计技能三种缓解策略,并在超 1 万条轨迹中验证了其降本效果。

阅读原文 ↗推荐理由:直击 Coding Agent 在实际应用中推理成本高昂的工程痛点,归纳的低效模式与优化策略对智能体系统开发具实用参考价值。另有 1 家信源报道# 智能体# AI编程# 评测# 大模型
arXiv 人工智能AI 评分 68/10012:00

高效多智能体工作流新方法LW2S:通过反事实信用分配学会“跳过冗余步骤”

针对多智能体大模型工作流中盲目执行规划、验证等所有组件导致算力浪费甚至覆盖正确中间结果的痛点,该研究提出了“学会跳过”(LW2S)框架。论文将组件省略形式化为反事实信用分配问题:利用全流程日志获取轨迹奖励,并结合受控的跳过干预评估省略后续步骤的后果,进而训练特定动作的安全模型。该方法使智能体能够动态判断并跳过非必要环节,在保证任务准确率的同时显著提升执行效率。

阅读原文 ↗推荐理由:针对多智能体流水线冗余计算和误修改痛点,提出了基于反事实干预的动态跳步方案,对智能体工程落地有实用参考价值。# 智能体# 大模型# 推理# 强化学习
arXiv 人工智能AI 评分 62/10012:00

ORCA:评估大语言模型在数据科学代码跨库转换能力的基准

研究人员提出了名为 ORCA 的综合基准测试,旨在评估大语言模型(LLM)在数据科学代码转换(DSCT)任务中的表现。数据科学代码转换涉及在不同数据科学库之间转换代码,同时保持功能等价性与跨生态互操作性。该基准包含 ORCA-MAIN 等设置,涵盖数据查询等三个代表性领域的 1600 个精选任务,填补了现有代码评测在跨库转换维度的不足。

阅读原文 ↗推荐理由:针对大模型在不同数据科学库间代码转换互操作性的评测基准,对 AI 编程工具开发具有一定参考价值。# 大模型# 评测# AI编程# 自然语言处理
arXiv 机器学习AI 评分 65/10012:00

基于因果激活导向的大语言模型自适应多价值观控制框架 AIMES

在复杂应用场景中,大语言模型需同时兼顾多种可能相互冲突的社会规范与人类价值观。针对现有激活导向技术多针对单值且多方向直接组合采用固定干预强度、无法适应模型内部动态状态的局限,研究团队提出了 AIMES 框架。该方法通过因果激活导向技术,在推理阶段实现对多重价值观的轻量级自适应控制。注:输入论文摘要存在截断,具体实验增益与实现细节未完全展示。

阅读原文 ↗推荐理由:针对大模型推理期激活导向在多目标对齐下的动态冲突问题提出了自适应解决方案,思路具有一定启发性。另有 1 家信源报道# 大模型# 对齐# 推理# 可解释性
9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 73/10012:00

TW3Cast:基于微调基础模型冻结路由的时序预测系统

研究人员提出了面向时间序列预测的 TW3Cast 系统。在 GIFT-Eval 基准评测中,该系统在 130 个方案中取得平均 MASE 排名第三的优异表现,仅次于两款基于智能体或语言模型的复杂多步骤系统。与依赖智能体的方案不同,TW3Cast 完全不使用智能体或语言模型,而是基于训练集一次性计算并冻结路由选择表,直接调度轻度微调的公开基础模型专家,在 97 种数据与预测配置下实现了极具竞争力的高效预测。

阅读原文 ↗推荐理由:展示了一种无需复杂智能体推理或大语言模型即可在时序预测基准中名列前茅的轻量级基础模型路由方案。# 时间序列# 大模型# 模型架构# GIFT-Eval# 路由机制
arXiv 人工智能✦ 精选AI 评分 75/10012:00

Pistis技术报告发布:融合蒸馏与强化学习的新型多模态大模型家族

该技术报告介绍了Pistis多模态大语言模型家族,包含基于Qwen系列构建的27B与9B参数模型。研发团队提出了一套通用且可扩展的后训练框架,在大规模多模态监督微调(SFT)的基础上,首创了交替蒸馏与强化学习(IDRL)范式。IDRL将同策略蒸馏与强化学习深度集成在单一训练循环中,通过二者交替优化,有效提升了多模态模型的整体综合性能。

阅读原文 ↗推荐理由:提出了一种将同策略蒸馏与强化学习融合的新型多模态后训练框架,具备算法架构参考价值。# 大模型# 强化学习# 蒸馏# 后训练# Qwen
arXiv 人工智能✦ 精选AI 评分 75/10012:00

DEEPO:面向多模态大模型幻觉抑制的双熵增强策略优化

该研究探讨了强化学习在多模态大语言模型(MLLM)中抑制幻觉效果不稳定的问题,并归因于从奖励到参数更新纠错链中的两个弱点:在采样层面,高语义熵的困难查询易产生全错样本组,使最易产生幻觉区域的相对优势坍缩为零;在优化层面,高置信度的错误token存在梯度消失现象。为此,论文提出了双熵增强策略优化方法DEEPO,以改进参数更新机制并有效缓解多模态幻觉。

阅读原文 ↗推荐理由:深入剖析了强化学习训练多模态大模型时幻觉纠正链的失效机理,并提出了创新的双熵优化解决方案。# 大模型# 强化学习# 幻觉# 策略优化
arXiv 人工智能✦ 精选AI 评分 68/10012:00

TWIST:针对对话记忆系统干预质量的新型评测基准

该研究提出了对话记忆评测基准套件 TWIST,旨在评估记忆系统在用户信念发生改变时是否能正确执行干预操作。针对现有长对话基准主要测试召回率和被动知识更新的局限,TWIST 设立了四大评估维度:主动张力检测、依据历史记录审查输出草案、在回答当前信念的同时保留历史变更记录,以及对敏感召回的治理控制。该套件基于 LoCo 进行了扩展,并引入了经人工验证的草案对齐机制。

阅读原文 ↗推荐理由:该研究提出了首个专注于对话记忆系统在动态信念变更中“干预质量”的评测基准,对优化智能体长期记忆有参考价值。# 记忆# 评测# 大模型# 智能体# 知识更新
arXiv 人工智能✦ 精选AI 评分 75/10012:00

AdvRole:面向角色扮演智能体的对抗性闭环课程学习框架

基于大语言模型的角色扮演智能体广泛应用于个性化助手和社交模拟等领域。然而,现有的强化学习方法通常依赖训练前收集的固定场景池,容易产生分布瓶颈:随着智能体能力的提升,其薄弱场景不断变化,而静态的训练分布无法随之调整。为此,研究者提出了 AdvRole 对抗性上下文重写框架,将角色扮演的强化学习转化为闭环课程,通过在负责角色扮演的智能体与对抗重写模块之间交替优化,持续动态演化训练场景以突破性能瓶颈。

阅读原文 ↗推荐理由:针对角色扮演智能体强化学习中训练场景固定的分布瓶颈,创新提出了对抗式闭环课程演化方案。# 角色扮演智能体# 强化学习# 大模型# 对抗训练# 课程学习
arXiv 人工智能✦ 精选AI 评分 72/10012:00

人机协同假设检验:基于成本感知的AI筛选评分与序贯人工复核机制

该研究针对大语言模型作为低成本评审员在统计推断中的局限性展开探讨。研究指出,AI评估往往存在偏差和噪声,而严谨的假设检验必须明确控制第一类和第二类错误。为此,论文提出了一种人机协同的假设检验方案,结合成本感知的AI选择性评分与序贯人工核验升级机制,旨在满足严格统计推断有效性与错误率控制的前提下,最大限度降低整体评估成本。

阅读原文 ↗推荐理由:针对LLM作为评估员的噪声与偏差问题,提出了兼顾统计严谨性与成本效益的人机协同检验方法。# 大模型# LLM-as-a-Judge# 假设检验# 人机协同# 统计推断
arXiv 人工智能✦ 精选AI 评分 75/10012:00

Forecast-Dojo:用于大模型预测智能体评测与训练的可回放环境

研究人员推出了名为Forecast-Dojo的可回放环境,专门用于基准测试和训练大语言模型预测智能体。该环境将已公布结果的预测市场问题与带时间戳的历史新闻相结合,允许智能体在连续的历史时间节点检索事件并动态调整预测,无需等待未来事件即可完成评估、交互数据收集与结果反馈。系统包含1568个Polymarket事件及1880万篇带日期的新闻文章,并对12个模型进行了评估测试。

阅读原文 ↗推荐理由:通过融合历史新闻与预测市场真实结果构建可回放环境,有效解决了大模型预测智能体评估周期长和训练反馈滞后的难题。# 智能体# 大模型# 评测# 事件预测# Polymarket
arXiv 人工智能✦ 精选AI 评分 68/10012:00

PFArena:面向蛋白质修饰语言模型的全新评测基准

针对蛋白质修饰中序列空间庞大且湿实验验证成本高的问题,研究人员推出了名为 PFArena 的评测基准。尽管蛋白质语言模型(PLM)、大语言模型(LLM)及智能体在蛋白质修饰领域展现出潜力,但其在实际实验决策场景中的相对表现尚不明确。PFArena 包含四个受控任务接口,覆盖单突变体生成与多突变体排序,通过提供不同梯度的突变适应度数据,系统性评估各类模型在蛋白质设计与修饰任务中的决策能力。

阅读原文 ↗推荐理由:针对蛋白质工程与AI for Science领域,提出了评估语言模型和智能体修饰能力的标准化基准。# AI for Science# 蛋白质语言模型# 大模型# 评测基准# 蛋白质工程
arXiv 人工智能✦ 精选AI 评分 75/10012:00

基于贝叶斯情境化价值对齐的大语言模型个性化研究

针对大语言模型个性化价值对齐中常采用静态画像、忽视情境对价值偏好动态影响的局限,研究人员受勒温场论启发,提出将个人价值观建模为先验、情境依赖偏好建模为后验的新范式。基于此,该研究提出了名为 BaCVA 的推理时贝叶斯情境价值对齐方法,使模型输出能够结合用户内在特质与具体环境约束,实现更动态、情境化的个性化对齐。

阅读原文 ↗推荐理由:提出结合心理学场论的贝叶斯情境价值对齐新框架,突破了传统静态对齐的局限。# 大模型# 对齐# 个性化# 贝叶斯推断
arXiv 人工智能✦ 精选AI 评分 78/10012:00

基于轨迹图估算单步优势:面向智能体强化学习的新方法

以GRPO为代表的分组强化学习已成为训练推理与智能体大模型的主流范式。然而,这类方法在全轨迹层面的优势估计虽然可靠,但在单步层面上存在系统性偏差,粗粒度的轨迹级反馈难以准确评估单个步骤的实际贡献(例如失败轨迹中往往包含有价值的操作步骤)。论文回归强化学习基础定义,提出通过构建轨迹图来精确估计步骤级优势,以解决多轮复杂智能体任务中的信用分配难题并提升模型训练效果。

阅读原文 ↗推荐理由:针对当前热门的GRPO算法在多步智能体任务中粗粒度优势估计的痛点,提出了有效的步骤级信用分配改进方案。# 强化学习# 智能体# 大模型# 模型训练
arXiv 人工智能✦ 精选AI 评分 75/10012:00

MeshHeal:面向去中心化LLM多智能体网络灰度失效的双时间尺度自愈框架

在去中心化的大语言模型多智能体系统中,单个智能体可能在保持响应的同时任务求解质量持续退化,引发灰度失效。针对此类问题,研究人员提出了完全去中心化的自愈框架MeshHeal。该框架在双时间尺度上结合能力匹配的同行评审机制:在快速时间尺度上,通过自适应分层机制升级不确定或低评分输出的评审层级;在提供即时任务保护的同时,收集证据以动态调整未来的路由决策,并允许恢复正常的智能体重新接入。

阅读原文 ↗推荐理由:针对多智能体网络中隐蔽的质量退化难题,提出了去中心化的双时间尺度自愈与容错机制。# 智能体# 大模型# 自愈框架# 去中心化网络# 容错机制
arXiv 人工智能✦ 精选AI 评分 78/10012:00

CounterRoute:基于分层反事实信用分配的自路由推理强化学习框架

针对具备推理能力的大语言模型在简单问题中生成过长思维链从而浪费推理算力的问题,研究人员提出了 CounterRoute 框架。该框架采用在线强化学习方法,直接基于原生双模式检查点联合学习路由决策与模式条件响应,无需特定微调预热。它有效解决了路由目标随策略演变、初始模式偏好破坏探索稳定性以及序列级目标耦合等挑战,实现了高效的自适应推理路由。

阅读原文 ↗推荐理由:提出了一种优化大模型推理算力浪费的自路由强化学习新框架,具有较高的前沿研究价值。# 大模型# 强化学习# 思维链# 算力# 推理