AIDC
DC AI 热点

全部 AI 动态

全部语言仅中文71 条动态
来源筛选
全部来源AITNT · AI头条(网页)Buzzing HN · 中文精选C114 通信网 · AI与算力(网页)DeepSeek 公众号IDC 圈·云与算力(网页)IT168 服务器存储 · AI与算力(网页)IT之家 · AI 筛选InfoQ · 架构与云计算Solidot · AI 筛选少数派 · AI 筛选智谱 公众号月之暗面 Kimi 公众号爱范儿 · AI 筛选腾讯混元 公众号通义实验室 公众号量子位阮一峰 · AI 筛选阶跃 StepFun 公众号AI Roundup · X AI coding圈日报AWS ArchitectureAWS HPCAWS News · 云基础设施AWS 机器学习Anthropic News(RSS)Apple Machine Learning ResearchArs Technica · AI 筛选Azure Blog · 云基础设施CNCF BlogCerebras 官方博客(网页)Claude Code 更新Claude 官方博客(网页)Cloudflare Blog · 网络基础设施Data Center DynamicsData Center KnowledgeEngineering at MetaEquinix Blog · 互联基础设施Gary MarcusGitHub Blog · AI 与安全Google AIGoogle DeepMindGoogle Developers · AI 筛选Google InfrastructureGoogle ResearchHacker News · AIHugging FaceKubernetes BlogLangChain 官方博客(网页)Last Week in AILlamaIndex 官方博客(网页)MIT News · AIMIT Technology Review AIMicrosoft ResearchNVIDIA Developer BlogNVIDIA · AI 筛选Ollama 更新OpenAI 官方动态OpenStack BlogSebastian RaschkaSemiAnalysis · 算力产业ServeTheHomeSimon WillisonTechCrunch AIThe Batch · DeepLearning.AIThe DecoderThe Next PlatformThe Verge · AI 筛选Transformers 更新Transluce 研究(网页)Vertiv 官方新闻arXiv 人工智能arXiv 机器学习arXiv 自然语言处理vLLM 官方博客(网页)vLLM 更新施耐德电气博客
9月24日2026-09-24
arXiv 人工智能AI 评分 55/10012:00

利用最小风险训练增强小型语言模型生成停电报告

研究人员将最小风险训练(MRT)应用于全国停电数据倡议(ODIN)的停电报告生成任务。不同于传统仅依赖词元级最大似然目标的方法,MRT使模型能够直接针对序列级评估指标进行优化。该方法将异构停电报告转化为符合CIM IEC 61968-3标准的规范XML格式,显著提升了Qwen2.5-7B等小型语言模型在垂直结构化报告生成任务中的准确性与可用性。

阅读原文 ↗推荐理由:展示了通过MRT优化算法将小型开源语言模型落地于电网结构化报告生成的垂直工程实践。# 小型语言模型# 最小风险训练# Qwen2.5# 电力系统# 应用落地
arXiv 人工智能✦ 精选AI 评分 75/10012:00

针对利益冲突环境,新基准CAVEAT评估计算机使用智能体鲁棒性

随着计算机使用智能体(CUA)日益广泛地代表用户执行在线操作,当所处环境的利益激励与用户目标不一致(如电商平台倾向于推荐特定商品而诱导智能体偏离目标)时,智能体表现面临新挑战。现有基准多局限于合作场景或显式攻击,忽略了环境自身存在利益诉求的情况。为此,研究团队推出了受控基准测试 CAVEAT,涵盖 9 个市场环境及相关分类法,专门评估智能体在利益错位环境下的目标坚守能力。

阅读原文 ↗推荐理由:针对计算机使用智能体在现实商业利益诱导下的对齐与鲁棒性问题,填补了现有评测基准的空白。# 智能体# CUA# 评测# 鲁棒性# 对齐
arXiv 人工智能✦ 精选AI 评分 75/10012:00

DRSR:基于集合级删除风险的长流程智能体高效上下文压缩框架

针对长流程大语言模型智能体积累海量交互历史带来的效率挑战,现有压缩策略通常独立评估单条记录,忽略了组合删除所引起的冗余或累积信息损失。为此,研究团队提出了直接关系集合风险修剪(DRSR)框架。该方法将智能体历史上下文压缩建模为基于删除集合的风险约束选择问题,从集合层面综合评估删除风险与保留信息,在保障决策安全与任务表现的前提下,实现了长程智能体的高效修剪。

阅读原文 ↗推荐理由:针对长流程智能体上下文膨胀痛点,提出了集合级删除风险评估的新压缩范式,实用性较强。# 智能体# 上下文压缩# 长程任务# 模型压缩# 大模型
arXiv 人工智能✦ 精选AI 评分 75/10012:00

TimeEvo:基于故障驱动的时序数据智能体自我演化机制

该研究针对通过调用外部工具回答分析问题的时间序列智能体,指出了传统人工预设工具配置的缺陷:一是人机工具不匹配,专家挑选的工具库可能在特定任务中降低异常检测准确率;二是隐性损害,常规自我修正可能在微弱提升总体评分的同时破坏原有的正确答案。论文指出工具的有效性需在运行时根据具体问题动态决定,并提出了故障驱动的智能体自我演化方案。

阅读原文 ↗推荐理由:深入剖析了时序分析智能体在工具调用与自我修正中的失效机理,提出了自演化解决思路。# 智能体# 时间序列# 工具调用# 自我演化# TimeEvo
arXiv 人工智能✦ 精选AI 评分 75/10012:00

EnSIMem:基于实体结构化索引的智能体长期记忆架构

长期与用户交互的智能体需要准确召回事实、偏好和事件等信息,但现有记忆系统常将其压缩为通用摘要或检索无标签文本块,难以精准识别实体属性及支撑依据。研究人员提出了EnSIMem,一种面向智能体的实体结构化长期记忆架构。该系统在离线阶段将历史交互组织为主题连贯的情节片段,并构建基于对话的实体索引条目,以提升长上下文对话中智能体记忆检索与推理的准确性。

阅读原文 ↗推荐理由:针对智能体长期交互中的记忆痛点,提出了基于实体结构化索引的新型记忆检索架构。# 智能体# 长期记忆# 实体索引# 对话系统# 信息检索
arXiv 人工智能✦ 精选AI 评分 75/10012:00

StateComp:面向长程任务智能体的状态条件历史压缩机制

在执行长程任务时,智能体会持续积累交互历史,而既有上下文管理方法多依赖固定窗口或即时相关性,难以判断历史交互何时可安全替换。过早压缩易导致未来关键信息丢失,过度保留又会带来巨大的上下文开销。为此,该研究提出了状态条件压缩框架StateComp,旨在根据智能体的状态演变动态学习何时适合压缩历史,在降低上下文负载的同时保留关键信息(注:原文摘要末尾内容有所截断)。

阅读原文 ↗推荐理由:针对长程AI智能体面临的上下文开销与关键信息丢失两难问题,提出了自适应压缩时机的新方案。# 智能体# 长程任务# 上下文管理# 历史压缩# StateComp
arXiv 人工智能✦ 精选AI 评分 72/10012:00

从自身交互中学习行动:面向GUI智能体的在线自蒸馏方法

针对图形用户界面(GUI)智能体在执行复杂软件指令时所需的分步推理与长程记忆能力,研究团队探索了在线自蒸馏(OPSD)技术的应用。现有OPSD方法虽在GUI定位等基础任务上表现优异,但在向多轮交互场景扩展时受限于自教师模型的特权机制(原摘要末尾存在信息截断)。该研究旨在通过从自身交互中学习,改进自蒸馏机制以提升多轮GUI智能体的决策执行效果。

阅读原文 ↗推荐理由:聚焦GUI智能体多轮复杂交互的技术瓶颈,提出了改进的在线自蒸馏训练方案。# GUI智能体# 自蒸馏# 多轮交互# 智能体# 前沿研究
arXiv 人工智能✦ 精选AI 评分 75/10012:00

VHD-Play:基于机制求解生成可验证的智能体强化学习环境

随着大语言模型智能体处理长程任务的需求增加,扩展其强化学习训练亟需多样化环境与可靠奖励信号。针对现有生成管道在环境动态与事后评估对齐上的缺陷,研究提出VHD-Play框架。该方法颠倒了传统的构建依赖关系,首先对数学模型进行采样与求解,再通过基于语料的设置器将其决策过程渲染为具备状态的可执行工具环境,为智能体强化学习提供了低成本、可验证的交互环境生成方案。

阅读原文 ↗推荐理由:提出了一种逆向生成机制,有效解决了智能体强化学习训练中高质量、可验证交互环境稀缺的问题。# 智能体# 强化学习# 环境生成# 大模型# 合成数据
arXiv 人工智能✦ 精选AI 评分 75/10012:00

Just-in-Time Memory:面向LLM智能体的任务自适应即时记忆整理架构

针对大模型智能体在重用历史经验时普遍采用的“写入时整理”局限,该研究分析了传统方法在任务完成时过早将轨迹蒸馏为固定形式(如反思、工作流或策略)所带来的信息不可逆丢失问题。传统做法在未知未来查询的情况下生成静态摘要,难以适配多样化的下游任务。为此,论文探索了即时自适应记忆构建机制,提升智能体记忆提取与任务匹配的灵活性。

阅读原文 ↗推荐理由:针对LLM智能体记忆系统的核心痛点提出了动态自适应整理方案,对智能体工程架构优化具有较高参考价值。# 智能体# 智能体记忆# 记忆架构
arXiv 人工智能✦ 精选AI 评分 72/10012:00

MolDesignBench:面向真实场景分子设计任务的LLM智能体评估基准

真实环境下的分子设计对大语言模型智能体提出了极高要求,需要其理解复杂上下文、满足多重约束并进行多步工具推理。针对现有基准偏向狭窄约束和单一路径的问题,研究人员提出了MolDesignBench。该基准紧密贴合实际分子设计场景,可系统评估工具增强型LLM智能体在处理多约束、不可行规范识别及多步工具调用下的综合推理与设计能力。

阅读原文 ↗推荐理由:针对AI4Science与LLM智能体落地场景,构建了更贴近真实复杂分子设计需求的评测基准。# 智能体# 大模型# 分子设计# AI for Science# 评测
arXiv 人工智能✦ 精选AI 评分 72/10012:00

Emergi-PersonaOS:支持情境适应与可控演化的人格化智能体操作系统

为解决长期人机交互中数字存在的身份连续性与个性化发展问题,研究人员提出了基于心理学理论的操作系统 Emergi-PersonaOS。该系统旨在对人格化智能体全生命周期进行管理,通过构建涵盖倾向性特质、情境适应特征和叙事认同的三层架构,实现智能体在动态情境下的自适应与可控演化,为人机共生交互提供了新型计算架构支撑。

阅读原文 ↗推荐理由:提出了一种基于心理学架构的人格化智能体操作系统,探索了长期人机交互中数字生命的连续性与演化机制。# 智能体# PersonaOS# 人机交互# 数字人# 系统架构