AIDC
DC AI 热点

全部 AI 动态

全部语言仅中文162 条动态
来源筛选
全部来源AITNT · AI头条(网页)Buzzing HN · 中文精选C114 通信网 · AI与算力(网页)DeepSeek 公众号IDC 圈·云与算力(网页)IT168 服务器存储 · AI与算力(网页)IT之家 · AI 筛选InfoQ · 架构与云计算Solidot · AI 筛选少数派 · AI 筛选智谱 公众号月之暗面 Kimi 公众号爱范儿 · AI 筛选腾讯混元 公众号通义实验室 公众号量子位阮一峰 · AI 筛选阶跃 StepFun 公众号AI Roundup · X AI coding圈日报AWS ArchitectureAWS HPCAWS News · 云基础设施AWS 机器学习Anthropic News(RSS)Apple Machine Learning ResearchArs Technica · AI 筛选Azure Blog · 云基础设施CNCF BlogCerebras 官方博客(网页)Claude Code 更新Claude 官方博客(网页)Cloudflare Blog · 网络基础设施Data Center DynamicsData Center KnowledgeEngineering at MetaEquinix Blog · 互联基础设施Gary MarcusGitHub Blog · AI 与安全Google AIGoogle DeepMindGoogle Developers · AI 筛选Google InfrastructureGoogle ResearchHacker News · AIHugging FaceKubernetes BlogLangChain 官方博客(网页)Last Week in AILlamaIndex 官方博客(网页)MIT News · AIMIT Technology Review AIMicrosoft ResearchNVIDIA Developer BlogNVIDIA · AI 筛选Ollama 更新OpenAI 官方动态OpenStack BlogSebastian RaschkaSemiAnalysis · 算力产业ServeTheHomeSimon WillisonTechCrunch AIThe Batch · DeepLearning.AIThe DecoderThe Next PlatformThe Verge · AI 筛选Transformers 更新Transluce 研究(网页)Vertiv 官方新闻arXiv 人工智能arXiv 机器学习arXiv 自然语言处理vLLM 官方博客(网页)vLLM 更新施耐德电气博客
9月29日2026-09-29
arXiv 人工智能AI 评分 58/10012:00

AI Harness:面向基础模型智能体的提案条件化信息安全认证研究

该论文研究了基础模型智能体在实际部署中的安全认证问题。实际系统中运行时往往在模型输出语义提案后才介入,使提案既是动作候选也是决策时观测。研究表明,若将其简化为仅基于状态的提案包络,虽然能保持提案覆盖率但会破坏可认证性。作者基于有限鲁棒接口形式化分析了可行性核,为智能体运行时安全干预提供了理论认证框架。

阅读原文 ↗推荐理由:探讨基础模型智能体运行时干预与形式化安全认证的理论研究,对构建可靠智能体系统有一定理论参考价值。# 智能体# 安全# 对齐# 大模型
9月28日2026-09-28
AITNT · AI头条(网页)AI 评分 76/10016:23

模型被曝利用「空白Token」隐式思考,推理跃升同时冲击思维链监控

Redwood Research最新研究发现,模型(测试代号GPT-6 Astra)能将题目后的空白Token作为隐式计算与思考载体。在四跳推理测试中其准确率从约10%暴增至50%,旧AIME数学题表现从约60%升至约90%。这种无需展开人类可读文本即可隐式完成复杂推理的机制,对当前依赖思维链(CoT)监控和可解释性对齐的安全防御范式构成了严峻挑战。

阅读原文 ↗推荐理由:揭示了无语义Token作为隐式推理空间的新现象,直接挑战了基于可读思维链的AI对齐与监控有效性。另有 1 家信源报道# 推理# 大模型# 安全# 对齐# 可解释性
arXiv 人工智能AI 评分 60/10012:00

将 AI 引入自主系统:从认知到群体智能的设计框架

该论文探讨了自主系统作为 AI 发展核心阶段的定位,重点分析了融合联结主义 AI 与符号主义 AI、以及打通 AI 与系统工程的技术挑战。作者提出了一个用于设计与评估自主系统的通用智能体架构框架,将智能体行为定义为围绕长期记忆和演进知识构建的多项认知功能组合,为复杂自主系统与群体智能的工程化落地提供了方法论参考。

阅读原文 ↗推荐理由:提出融合神经与符号 AI 的自主智能体系统工程设计框架,具有一定的理论参考价值,但缺乏具体工程实测突破。# 智能体# 具身智能# 记忆# 前沿研究
arXiv 人工智能AI 评分 72/10012:00

安全评测基准ScopeBench:检验智能体在目标压力下是否会越界攻击

随着具有自主行动能力的智能体被广泛应用于Web应用和网络渗透测试,智能体是否遵守授权范围(Scope Adherence)成为落地的关键安全对齐问题。现有基准多关注攻击能力,缺乏对越界风险的评估。研究人员提出了ScopeBench基准,设计了30个死胡同安全任务。在这些任务中,目标仅能通过违反规定范围来实现,以此测试智能体在面临目标达成压力时是否能守住安全边界。

阅读原文 ↗推荐理由:针对网络安全自主智能体落地中最关键的越界风险提出了专门的对齐评测基准,对Agent安全攻防实践具有参考价值。# 智能体# 安全# 评测# 对齐
arXiv 人工智能AI 评分 68/10012:00

多智能体代码评审何时真正有据可依?两项无标注评估与拒绝盲猜的判别机制

当前大模型在评审他人代码时,即使缺乏证据也会给出看似自信的虚假判断。多智能体验证机制通过将评审拆解为可检验声明来缓解该问题。该论文指出,有效的多智能体证据需满足两个关键条件:独立于被审查答案,且能在对比候选代码间体现差异。研究提出了两套无标注评估指标,并设计了一种在缺乏充分证据时主动拒绝盲猜的代码评审机制,以提升大模型代码评估的可靠性与扎实度。

阅读原文 ↗推荐理由:针对LLM作为代码评审员(LLM-as-a-Judge)容易产生幻觉的痛点,提出了无标注评估指标及拒答机制,对代码评测与智能体验证有实用参考价值。# 大模型# 智能体# 评测# AI编程# 可解释性
arXiv 人工智能AI 评分 65/10012:00

基于 MCP 协议桥接大模型智能体与数据空间的架构中介方案

数据空间(Data Spaces)支持跨组织边界的自主和受控数据共享,但概率型大语言模型交互与策略驱动型数据基础设施之间存在明显错配。该研究提出了一种基于模型上下文协议(MCP)的架构中介方法,并通过 Eunomia Agent 进行实现。该中介层将数据空间的服务与能力转化为结构化、模式驱动的工具接口,从而实现 LLM 智能体与数据空间服务之间安全、可控的交互。

阅读原文 ↗推荐理由:探讨了当前热门的 MCP 协议在受控企业数据空间集成中的具体落地架构,具有不错的工程参考价值。# 智能体# MCP# 大模型
arXiv 人工智能AI 评分 72/10012:00

隐蔽分散但协同危害:针对技能型智能体系统的级联攻击研究

基于技能(Skill)的智能体系统允许在运行时加载第三方模块化能力,但其开放生态也带来了新型安全风险。以往研究多聚焦于单一技能本身的漏洞,忽视了跨技能交互带来的威胁。该论文提出“技能级联攻击”这一全新威胁范式,揭示了攻击者如何利用看似独立隐蔽、各自无害的恶意技能,在智能体组合调用时引发连锁危害,拓展了多技能智能体生态的安全研究边界。

阅读原文 ↗推荐理由:针对智能体技能生态系统提出了新颖的跨技能级联攻击范式,对 Agent 安全防护设计具有重要参考价值。# 智能体# 安全# 对齐
arXiv 人工智能AI 评分 58/10012:00

用于评估可解释AI方法的合成真实基准框架

评估可解释人工智能(XAI)方法一直面临缺乏可靠评估程序及真实解释基准(ground truth)的挑战。现有评估通常仅测量解释与黑盒模型预测之间的忠实度(fidelity),但这仅量化了解释复现模型输出的程度,无法确保其真实反映底层的决策过程。为此,该研究提出了一个合成真实基准框架,旨在解决不同解释方法难以进行客观真实度评测的难题。

阅读原文 ↗推荐理由:针对XAI评测缺乏真实标注痛点提出的合成基准方案,具有一定学术参考价值,但属于常规理论探讨。# 可解释性# 评测# 前沿研究
arXiv 人工智能AI 评分 58/10012:00

基于3D结构与全原子GNN预测跨膜蛋白拓扑结构

本研究提出了一种基于图神经网络(SchNet)预测跨膜蛋白拓扑结构的新方法。与传统仅依赖蛋白序列或α-碳骨架特征的方法不同,该模型直接利用全原子级嵌入特征进行拓扑推断。在与DeepTMHMM相同的基准数据集上进行5折交叉验证,研究表明在不使用任何预训练权重的情况下,GNN在该任务上表现出良好潜力,展示了3D结构信息在蛋白拓扑预测中的应用价值。

阅读原文 ↗推荐理由:将全原子GNN应用于跨膜蛋白拓扑预测的学术探索,属于常规生物AI前沿研究论文。# 医疗AI# 前沿研究与模型架构
arXiv 人工智能AI 评分 62/10012:00

用于蛋白质扩散模型测试时对齐的谱反馈算法

针对离散扩散模型在奖励最大化对齐中主要依赖单向引导逆过程、缺乏回溯修正机制的问题,研究人员提出了 Spectral Feedback(谱反馈)算法。该方法在反馈循环中自适应选择编辑位置,利用离散扩散模型的掩码结构进行重新掩码和重采样,使模型能够在推理阶段迭代修正自身生成结果,有效提升了蛋白质设计等任务中的对齐表现。

阅读原文 ↗推荐理由:提出了一种针对蛋白质离散扩散模型的测试时迭代自纠错对齐方法,对生成生物学与推理时计算研究具有一定参考价值。# 对齐# 医疗AI# 推理# 前沿研究
arXiv 人工智能AI 评分 68/10012:00

BioEVAL:面向生物工程领域的大语言与多模态模型评测基准

来自全球22个研究团队联合推出了BioEVAL基准,旨在评估大语言模型和多模态模型在生物工程领域的实验推理能力。该基准覆盖11个主要生物工程子领域,重点突破以往评测偏重事实召回的局限,提供达到博士水平的复杂实验与前沿任务推理评估。

阅读原文 ↗推荐理由:多机构联合打造的生物工程高难度评测基准,有助于衡量大模型在专业科研场景下的实验推理能力。# 评测# 医疗AI# 大模型# 多模态
arXiv 人工智能AI 评分 60/10012:00

Benchy:面向任务型AI基准评测的通用语义语言与执行引擎

本文提出了Benchy,一个用于AI程序基准评测的语义规范语言与执行引擎。Benchy将基准测试形式化定义为由程序、评分函数和数据集构成的三元组B=(P,S,D),实现评测套件与被测AI系统的解耦。基准采用规范YAML编写,基于共享的任务/领域本体,可确定性编译为规范JSON中间表示并由引擎执行,为任务型AI评测提供了标准化、可复现的通用基础设施。

阅读原文 ↗推荐理由:提出了一种面向AI任务评测的规范化DSL与执行引擎,对解决大模型与Agent评测碎片化及复现难题具有参考价值。# 评测# 智能体# 大模型# 开源
arXiv 人工智能AI 评分 58/10012:00

基于教师引导排序近似的TinyML神经架构搜索框架TGL-NSGA-II

针对微型机器学习(TinyML)神经架构搜索计算开销巨大的难题,论文提出低保真度评估框架TGL-NSGA-II。该方法基于进化搜索仅需可靠比较候选模型优劣而非精确适应度值的洞察,利用预训练教师模型根据样本难度与类别进行分层抽样,再通过短周期的轻量知识蒸馏(KD-Lite)在压缩数据集上快速训练候选网络并排序评估,大幅降低了端侧资源受限环境下的搜索成本。

阅读原文 ↗推荐理由:提出利用相对排序替代绝对精度评估的TinyML架构搜索方案,为高算力消耗的进化优化算法提供了实用的降本思路。# 端侧AI# 蒸馏# 模型压缩
arXiv 自然语言处理AI 评分 68/10012:00

CARGO:面向生产环境智能体的上下文感知检索门控评测框架

针对生产环境中智能体在动态实体(如客服工单、账户等)操作时的评测难题,传统基于参考答案的 LLM-as-a-judge 方案常因参考案例与实际运行实体的标识、日期等不同而误判为幻觉或错误(即参考与实例分歧 RID)。为此,研究人员提出 CARGO 评测框架。该框架将检索到的历史参考样本视作“操作流程范例”,同时结合实时运行上下文进行事实性判定,从而显著提高了生产环境智能体评测的鲁棒性与准确率。

阅读原文 ↗推荐理由:针对生产环境智能体评测中“参考案例与动态上下文不一致导致误判”的实际工程痛点提出了解法,具备落地参考价值。另有 2 家信源报道# 智能体# 评测# 大模型# 自然语言处理
arXiv 人工智能AI 评分 58/10012:00

研究发现直觉式提示可提升LLM智能体模拟个体社交媒体反应的保真度

一篇arXiv预印本论文探讨了LLM智能体在模拟个体社交媒体反应时的保真度问题。研究通过问卷调查、深度访谈和书面自述对8名塞尔维亚受试者进行画像构建,记录了他们对68条社交媒体帖子的真实反应,并测试了4个语言模型预测这些反应的能力。研究指出,相比过度复杂的推理,“少思考”的直觉式提示(Intuitive Prompting)反而有助于智能体更好地契合设定画像并模拟个体社交反应。

阅读原文 ↗推荐理由:探讨大模型智能体用户画像模拟保真度的实验研究,样本量较小但对社交网络模拟与提示设计有一定参考价值。# 智能体# 大模型# 提示词工程# 评测
arXiv 人工智能AI 评分 68/10012:00

HARDEN:通过约束进化搜索生成高难度且保真答案的大模型评测用例

针对现有基准测试难以反映企业实际部署复杂度的问题,研究人员提出了 HARDEN 方法。该方法利用约束进化搜索技术,在保持预期输出答案不变的前提下,沿特定领域复杂度维度对评估输入进行改造,同时严格遵循任务语义、真实性与执行有效性约束。在 FinQA、PubMedQA、ContractNLI 基准及不同规模 Qwen3.5 模型上的实验表明,该方法能有效提升评测难度并暴露模型在复杂场景下的局限性。

阅读原文 ↗推荐理由:提出了一种自动生成高难度评估样本的进化搜索方法,对大模型企业级落地评测具有一定参考价值。另有 1 家信源报道# 评测# 大模型# 自然语言处理# 合成数据
arXiv 人工智能AI 评分 62/10012:00

T-RoPE:面向序列推荐的时间感知旋转位置编码

随着大语言模型架构在序列推荐中的广泛应用,原本用于文本处理的旋转位置编码(RoPE)也被引入。然而,NLP 中的 RoPE 仅基于 token 索引编码相对次序,无法反映推荐交互中实际流逝的时间、多尺度行为周期及日历相位。为此,研究人员提出 T-RoPE(时间感知 RoPE),将传统基于索引的相对位置替换为显式的时间维度建模,以增强生成式推荐模型捕捉用户随时间变化兴趣演进的能力。

阅读原文 ↗推荐理由:针对推荐系统对时间动态的高敏感度,将大模型标准 RoPE 改造成时间感知版本,对生成式推荐架构有实用参考价值。# 大模型# 时间序列
arXiv 人工智能AI 评分 63/10012:00

研究探讨音频大模型对其转录可靠性的自我感知能力

该论文研究了音频大语言模型(Audio LLMs)在输入语音严重失真时,能否识别出自身转录结果不可靠。实验发现,如果直接通过提示词让模型评估自身转录的可靠性,模型的判断表现很差,在绝大多数情况下都会盲目自信地预测转录是可靠的,这揭示了语音交互大模型在面对低质量输入时存在自我认知盲区的问题。

阅读原文 ↗推荐理由:探讨语音大模型在退化音频输入下的自我可靠性评估能力,揭示了模型过度自信的盲区,对语音对齐与可靠交互有参考价值。另有 1 家信源报道# 多模态# 语音# 大模型# 评测# 对齐
arXiv 人工智能AI 评分 75/10012:00

大模型智能体执行失控现象研究:解析“过度行动”与全局控制架构

该论文提出了“LLM帕金森综合征”(LLM Parkinsonism)这一比喻,用以描述自主智能体在达成初始目标后仍持续无效行动、反复验证或修复自造复杂性,导致Token效率低下的执行控制失效现象。研究指出该问题源于全局执行控制与不确定性评估机制的缺失,而非单纯自回归预测机制所致,并据此设计了一种具备不确定性感知能力的全局执行控制架构,以改善长程任务下的智能体决策收敛。

阅读原文 ↗推荐理由:精准指出了智能体长程任务中“停不下来”且浪费算力的核心痛点,并给出了控制架构层面的解法。# 智能体# 大模型# 推理# 前沿研究
arXiv 人工智能AI 评分 72/10012:00

思考的代价:大模型测试时推理在金融交易中划算吗?

大模型在推理阶段的“测试时思考”虽能提升决策逻辑,但其激增的算力成本能否转化为实际经济效益仍存疑。最新arXiv论文从经济学投入产出视角,对DeepSeek、GPT和Gemini系列模型展开了为期一年的受控交易实验。在固定信息、提示词和投资组合策略的前提下,研究通过调节推理算力预算,量化评估了扣除交易成本与推理开销后,长思考链能否真正带来更优的投资回报。

阅读原文 ↗推荐理由:跳出基准测试分数,从真实场景下的经济ROI和算力成本视角评估测试时推理,选题切中落地痛点。# 推理# 评测# 大模型# 金融科技# 算力
arXiv 人工智能AI 评分 62/10012:00

LAVOIR:通过均摊信息价值让单次前向决策编码器学会主动提问

针对“系统一”单次前向决策模型(如 Laya)在面对信息缺失时倾向于盲目猜测的问题,研究人员提出了 LAVOIR(带信息价值路由的 Laya)。该方法将候选缺失信息槽位直接置于输入端与选项并列,使得模型在单次前向传播中不仅能输出决策分布,还能同时计算每个槽位对正确决策概率的预期增益,从而教会模型在何时以及主动询问何种关键信息。

阅读原文 ↗推荐理由:针对快速决策模型在信息不全时盲猜的痛点,创新性地实现了单次前向计算信息价值增益的交互决策机制。# 前沿研究与模型架构# 推理# 自然语言处理# 大模型
arXiv 人工智能AI 评分 62/10012:00

CRC-Router:面向医疗智能体系统的风险约束路由机制

在医学影像等医疗场景中,智能体(Agentic AI)系统的自主错误容易向临床决策下游传播,阻碍实际部署。为此,研究人员提出 CRC-Router,一种兼顾风险约束与不确定性感知的新型路由模块。该机制通过可靠的不确定性评估,动态决策何时由智能体自主执行任务,何时将病例上报给人类医生进行复审,从而在提升医疗通量与降低临床风险之间实现平衡。

阅读原文 ↗推荐理由:针对医疗高风险场景下智能体缺乏可靠容错机制的痛点,提出了务实的人机协同分流方案,对医疗AI落地工程有参考价值。# 智能体# 医疗AI# 安全
arXiv 人工智能AI 评分 72/10012:00

针对编程智能体低效成本行为的分析与优化策略研究

编程智能体在执行任务时往往消耗大量 Token 带来高昂成本。该研究针对 Claude Code 和 Mini-SWE-Agent 在 SWE-bench Verified 上的 1200 条运行轨迹进行分析,识别出包容性重复检索、相似脚本重复生成及测试重复执行三大成本低效行为。研究进一步提出了结构感知检索、智能体自合成技能与开发者设计技能三种缓解策略,并在超 1 万条轨迹中验证了其降本效果。

阅读原文 ↗推荐理由:直击 Coding Agent 在实际应用中推理成本高昂的工程痛点,归纳的低效模式与优化策略对智能体系统开发具实用参考价值。另有 2 家信源报道# 智能体# AI编程# 评测# 大模型
arXiv 人工智能AI 评分 68/10012:00

高效多智能体工作流新方法LW2S:通过反事实信用分配学会“跳过冗余步骤”

针对多智能体大模型工作流中盲目执行规划、验证等所有组件导致算力浪费甚至覆盖正确中间结果的痛点,该研究提出了“学会跳过”(LW2S)框架。论文将组件省略形式化为反事实信用分配问题:利用全流程日志获取轨迹奖励,并结合受控的跳过干预评估省略后续步骤的后果,进而训练特定动作的安全模型。该方法使智能体能够动态判断并跳过非必要环节,在保证任务准确率的同时显著提升执行效率。

阅读原文 ↗推荐理由:针对多智能体流水线冗余计算和误修改痛点,提出了基于反事实干预的动态跳步方案,对智能体工程落地有实用参考价值。# 智能体# 大模型# 推理# 强化学习
arXiv 人工智能AI 评分 58/10012:00

ACV-Gate:面向视觉Token通信的全预算反事实推理选择性摊销框架

在有限带宽预算下的生成式图像通信中,Token选择直接决定解码后的重建质量,但准确评估每个候选Token的终端价值需反复模拟接收端重建,导致编码端计算开销巨大。为此,研究团队提出ACV-Gate自适应候选评估框架,通过学习近似全预算反事实评估,并仅对最具信息量的候选Token进行精确评估,有效平衡了传输优化与计算成本。

阅读原文 ↗推荐理由:针对语义通信与视觉Token传输开销痛点提出的算法级优化,属于细分技术领域的常规前沿研究成果。# 计算机视觉# 多模态# 模型压缩
arXiv 人工智能AI 评分 62/10012:00

HCOE:基于双曲空间的生物医学语言模型临床本体嵌入

现有生物医学语言模型虽能编码文本语义,但难以显式保留医学代码的层级结构。研究团队提出HCOE(双曲临床本体嵌入)方法,将冻结的BioBERT特征映射至庞加莱球空间,结合双向本体引导的对比学习与粗细粒度本体路径聚合,有效融合了ICD疾病代码与ATC药物分类等层级关系,提升了临床概念表征的层次感知能力。

阅读原文 ↗推荐理由:提出利用双曲几何映射解决医疗语言模型缺乏代码层级结构感知的方案,具备一定垂直领域学术参考价值。# 医疗AI# 自然语言处理
arXiv 人工智能AI 评分 68/10012:00

实时语音智能体评估:从组件质量到实际落地效果

随着实时语音智能体从研究走向实际部署,其评估标准仍割裂在语音基础模型、轮次转换心理语言学与智能体基准三个领域之间。架构论文常关注延迟,轮流对话研究关注预测准确度,而智能体基准则侧重任务成功率,缺乏统一评价体系。该论文通过梳理38篇核心文献,提出了系统性的三维评估证据链框架,旨在为实际部署的实时语音智能体提供从单点性能到落地效果的全流程评估方法。

阅读原文 ↗推荐理由:梳理了当前语音智能体评测碎片化的痛点,提出跨领域的端到端评测框架,对构建实时语音交互系统的团队有参考价值。另有 1 家信源报道# 智能体# 语音# 评测# 多模态
arXiv 人工智能AI 评分 68/10012:00

多智能体共享记忆准入基准与诊断研究

针对多智能体系统中将重复主张误认为独立证据、导致错误信念在共享记忆库中扩散和放大的问题,研究团队提出了“相关晋升基准”(Correlated Promotion Benchmark, CPB)。该基准旨在评估系统是否应将候选主张接纳至共享记忆中。CPB 包含基于公开标注构建的静态评测集 CPB-Static,以及跟踪多智能体团队实时读写与信息源的动态评测环境 CPB-Live,为多智能体协作中的记忆安全与知识管理提供了标准化评估工具。

阅读原文 ↗推荐理由:针对多智能体共享记忆中容易出现的信息回音室与错误传播问题,提出了实用的准入评测基准。# 智能体# 记忆# 评测
9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 75/10012:00

预测智能体何时应当推理?基于行为压力测试的可靠性路由研究

该研究探讨了预测智能体在结合大模型推理、信息检索、集成与校准时,各决策行为在何时具备可靠性。研究人员在ForecastBench风格的二元预测任务上,将智能体选择检索、推理、参考市场先验或采用历史类比等策略视为可观测行为并展开压力测试。核心结论显示,机制的最优选择高度依赖于数据生成源,结构化类比在特定数据流程中占据主导,而市场群体策略与保守基线在其他情境下表现更优。

阅读原文 ↗推荐理由:系统化探索了预测智能体在多策略切换下的行为可靠性,为智能体决策路由工程提供了实用参考。# 预测智能体# 智能体# 推理# 压力测试# 可靠性
arXiv 人工智能✦ 精选AI 评分 73/10012:00

TW3Cast:基于微调基础模型冻结路由的时序预测系统

研究人员提出了面向时间序列预测的 TW3Cast 系统。在 GIFT-Eval 基准评测中,该系统在 130 个方案中取得平均 MASE 排名第三的优异表现,仅次于两款基于智能体或语言模型的复杂多步骤系统。与依赖智能体的方案不同,TW3Cast 完全不使用智能体或语言模型,而是基于训练集一次性计算并冻结路由选择表,直接调度轻度微调的公开基础模型专家,在 97 种数据与预测配置下实现了极具竞争力的高效预测。

阅读原文 ↗推荐理由:展示了一种无需复杂智能体推理或大语言模型即可在时序预测基准中名列前茅的轻量级基础模型路由方案。# 时间序列# 大模型# 模型架构# GIFT-Eval# 路由机制