AIDC
DC AI 热点

全部 AI 动态

全部语言仅中文162 条动态
来源筛选
全部来源AITNT · AI头条(网页)Buzzing HN · 中文精选C114 通信网 · AI与算力(网页)DeepSeek 公众号IDC 圈·云与算力(网页)IT168 服务器存储 · AI与算力(网页)IT之家 · AI 筛选InfoQ · 架构与云计算Solidot · AI 筛选少数派 · AI 筛选智谱 公众号月之暗面 Kimi 公众号爱范儿 · AI 筛选腾讯混元 公众号通义实验室 公众号量子位阮一峰 · AI 筛选阶跃 StepFun 公众号AI Roundup · X AI coding圈日报AWS ArchitectureAWS HPCAWS News · 云基础设施AWS 机器学习Anthropic News(RSS)Apple Machine Learning ResearchArs Technica · AI 筛选Azure Blog · 云基础设施CNCF BlogCerebras 官方博客(网页)Claude Code 更新Claude 官方博客(网页)Cloudflare Blog · 网络基础设施Data Center DynamicsData Center KnowledgeEngineering at MetaEquinix Blog · 互联基础设施Gary MarcusGitHub Blog · AI 与安全Google AIGoogle DeepMindGoogle Developers · AI 筛选Google InfrastructureGoogle ResearchHacker News · AIHugging FaceKubernetes BlogLangChain 官方博客(网页)Last Week in AILlamaIndex 官方博客(网页)MIT News · AIMIT Technology Review AIMicrosoft ResearchNVIDIA Developer BlogNVIDIA · AI 筛选Ollama 更新OpenAI 官方动态OpenStack BlogSebastian RaschkaSemiAnalysis · 算力产业ServeTheHomeSimon WillisonTechCrunch AIThe Batch · DeepLearning.AIThe DecoderThe Next PlatformThe Verge · AI 筛选Transformers 更新Transluce 研究(网页)Vertiv 官方新闻arXiv 人工智能arXiv 机器学习arXiv 自然语言处理vLLM 官方博客(网页)vLLM 更新施耐德电气博客
9月29日2026-09-29
arXiv 人工智能AI 评分 62/10012:00

SMARtCARE:面向ICU临床决策支持的隐私保护与有限自主智能体系统

针对长上下文临床AI系统易遗漏超出推理窗口的历史病历、导致ICU患者早期生命体征漂移被误判的问题,研究团队提出SMARtCARE架构。该系统设计了稳定、元认知、辅助和监管四种有限自主运行状态。系统不直接检索全部既往病历,而是利用患者过往轨迹的有损六通道特征指纹进行比对,在兼顾隐私计算的同时,协助识别类似早期的病情恶化模式,提升临床决策支持的准确性与安全性。

阅读原文 ↗推荐理由:针对ICU长时序临床决策痛点提出的有限自主智能体架构,在隐私保护与病历特征比对上有工程参考价值。# 智能体# 医疗AI# 隐私计算# 安全
arXiv 人工智能AI 评分 62/10012:00

Witness Overlap:开源权重模型家族的有向血统与溯源审计研究

在开源模型频繁被微调、对齐与模型融合的背景下,模型血统审计不仅需要判断两个检查点是否存在关联,还需判定演化的先后方向。现有溯源方法多基于特征相似度、权重分布或行为指纹等对称性证据,难以有效区分衍生先后关系。该研究针对开源模型家族内部的有向血统追溯问题,提出了一种能够判别模型衍生方向的新型审计方法与分析框架。

阅读原文 ↗推荐理由:针对开源大模型复杂的衍生、微调与融合生态,探讨了具备方向性的模型版权与血统溯源难题,具有一定的学术与治理参考价值。# 开源# 安全# 治理# 大模型# 评测
arXiv 人工智能AI 评分 58/10012:00

CP-Agent:面向晶体塑性模拟工作流的自主智能体

晶体塑性(CP)模拟能够预测多晶金属的力学行为,但配置异构工具、编排多步骤数据管道以及参数校准等繁重的人工操作阻碍了其规模化应用。研究团队提出了 CP-Agent,这是一种基于大语言模型的智能体系统,采用 ReAct 范式构建。该系统能够直接接收自然语言指令,自主完成从工具调度、数据处理到参数标定的全流程晶体塑性建模与仿真工作流,显著提升材料科学仿真的自动化效率。

阅读原文 ↗推荐理由:将 LLM 智能体落地于材料科学与晶体塑性仿真领域的垂直应用探索,具备一定的工程参考价值。# 智能体# 大模型# 前沿研究
arXiv 人工智能AI 评分 68/10012:00

具身评测基准 ConflictVLA-Bench 发布:探究 VLA 模型对前提冲突的行为响应

该研究针对视觉-语言-动作(VLA)模型在面对无效任务前提(前提冲突)时的行为反应展开探索。现有评测多聚焦于最终任务结果,难以区分模型是主动终止任务还是盲目尝试导致的执行失败(即“失败执念” Failed Persistence)。为此,研究团队基于 LIBERO 构建了 ConflictVLA-Bench 评测基准,将冲突场景与前提一致的基准轨迹配对,系统评估模型在面对冲突时的执行过程与最终决策表现。

阅读原文 ↗推荐理由:聚焦 VLA 模型在不可行任务指令下的行为模式与安全鲁棒性,填补了具身智能在前提冲突评测维度的空白。# 具身智能# 评测# 多模态# 安全
arXiv 人工智能AI 评分 68/10012:00

DriveHierarchy:贯通开环理解与闭环执行的VLM自动驾驶分层评测基准

评估基于视觉语言模型(VLM)的自动驾驶系统难度较大,因其能力具有复合性,涵盖交通参与者定位、时空上下文整合、未来演化推理及闭环交互行动等。针对现有评测多局限于孤立的开环理解或闭环驾驶、缺乏系统诊断能力的痛点,研究团队提出了分层基准 DriveHierarchy,系统化解构并关联多层级驾驶能力,为大模型端到端自动驾驶的诊断与改进提供评测支持。

阅读原文 ↗推荐理由:针对VLM在自动驾驶中从认知到执行的断层问题提出了系统化的分层评测体系,对端到端智驾模型诊断有一定参考价值。另有 1 家信源报道# 自动驾驶# 多模态# 评测# 大模型
arXiv 人工智能AI 评分 72/10012:00

稀疏重叠下大模型裁判验证方法研究:从推断到设计

在评估LLM作为裁判(LLM-as-a-judge)与人类评估的一致性时,标注预算通常限制了样本的重复标注率。研究证明,这种“重叠稀疏性”是导致错误部署决策的首要因素:在5%的配对重叠率下,错误决策率达25%,在10个候选模型中选错最优裁判的概率高达65%。为此,研究提出了重叠数量与分配策略,并推导出最小重叠公式,指出常规场景下重叠率需达到25%以上才能保证评估可靠性。

阅读原文 ↗推荐理由:针对当前大模型评测中广泛使用的LLM-as-a-judge方案,系统分析了数据标注重叠稀疏带来的评测偏差并给出了量化设计指导,具备较高实用价值。# 大模型# 评测# 前沿研究
arXiv 人工智能AI 评分 65/10012:00

Metro-WM:通过可实现子目标解决世界模型的长程隐空间规划缺陷

基于联合嵌入预测架构(JEPA)的模型预测控制具备出色的零样本目标达成能力,但通常局限于短程规划。现有的分层扩展方法虽尝试通过宏观规划器预测中间潜在子目标以指导微观规划,但该研究发现无约束的子目标预测存在根本性缺陷,导致主流宏观规划器频繁生成物理上无法实现的子目标。为此,论文提出了 Metro-WM 框架,旨在约束生成具备物理可实现性的子目标,提升长程规划性能。

阅读原文 ↗推荐理由:指出并尝试解决基于 JEPA 的世界模型在长程规划中容易生成“物理不可实现子目标”的关键缺陷,具有一定学术参考价值。# 世界模型# 强化学习# 具身智能# 前沿研究
arXiv 人工智能AI 评分 65/10012:00

IndustryLLM:面向工业采购的失败驱动大语言模型训练方案

针对工业采购中买家非标准表达、稀疏属性与严格工程规范难以对齐的痛点,研究人员提出了开源大模型 IndustryLLM。该模型基于 Qwen3.5-35B-A3B-Base 架构构建,总参数量 35B 且每 Token 激活约 3B 参数。团队提出了一种失败驱动的领域适配方案,通过约 1000 亿 Token 的工业语料进行二次预训练(CPT)与精细化监督微调(SFT),有效提升了工业采购场景下的专业标准理解与匹配能力。

阅读原文 ↗推荐理由:聚焦工业采购场景的垂直领域大模型微调与预训练方案,对垂类落地与专业术语对齐具有参考价值。# 大模型# 微调# 开源# 自然语言处理
arXiv 人工智能AI 评分 65/10012:00

COUNTERMEM:引入世界模型验证的反事实记忆机制,增强智能体决策泛化

现有智能体记忆框架主要记录与真实环境交互的事实反馈,缺乏对“若采取其他动作会如何”的反事实思考,而直接在真实环境中尝试不仅成本高且会破坏状态一致性。研究团队提出 COUNTERMEM 强化学习框架,借助世界模型对未发生的分支假设进行模拟与验证,生成反事实记忆,使语言智能体无需高昂交互代价即可从虚拟推演中吸取经验,提升复杂决策能力。

阅读原文 ↗推荐理由:将世界模型引入智能体反事实记忆构建,为解决智能体多路径探索与试错成本问题提供了有价值的研究思路。# 智能体# 世界模型# 记忆# 强化学习
arXiv 人工智能AI 评分 68/10012:00

基于正交均衡学习的上下文相关智能体评估方法

针对在提示词、任务或特定用户群等上下文信息下评估智能体的需求,传统基于打分的模型(如Bradley-Terry)通常假设传递性偏好,无法有效反映人类异质性判断下的集体偏好。本研究受社会选择理论启发,将离线反馈下的上下文智能体评估形式化为双人博弈,通过正交均衡学习解决非传递性偏好聚合问题,为复杂场景下的智能体评估提供了新的博弈论建模框架。

阅读原文 ↗推荐理由:针对传统BT模型无法处理人类异质性偏好的缺陷,提出博弈论视角的智能体评测新框架,具备理论价值。# 评测# 智能体# 对齐
arXiv 人工智能AI 评分 68/10012:00

Choir:面向分布式多智能体自动形式化证明的开放协议

AI智能体现已能够在Lean等证明助手中形式化整本教材与重大定理,但现有工作多为中心化运作,由单一团队承担全部计算成本。研究团队提出了Choir开放协议,旨在实现分布式形式化。Choir将大型项目拆解为独立任务,允许各方贡献者运行各自的大模型智能体,并完全通过GitHub仓库进行协调;同时设置了确定性门禁对每次合并进行自动校验,以保障开放协作的安全与正确性。

阅读原文 ↗推荐理由:将去中心化众包模式引入AI形式化数学证明与智能体协作,具备不错的工程创新与实践价值。另有 1 家信源报道# 智能体# 开源# 推理# 大模型
arXiv 人工智能AI 评分 68/10012:00

EmailBench:面向企业邮件与办公生产力场景的智能体评测基准

研究团队推出针对大模型智能体企业邮件与生产力任务的评测基准 EmailBench。该基准包含16个任务类别的206个实际场景,结合了类型化邮件API规范与中立命名标准,并构建了基于Enron衍生的确定性合成语料库。其核心目标在于解决此前评测缺乏独立环境的问题,重点检验智能体在信息检索、结构化状态更新、时序推理及多步复杂协同工作流中的执行能力。

阅读原文 ↗推荐理由:聚焦企业邮件这一高频复杂场景的垂直智能体评测工具,填补了端到端办公自动化工作流的评估空缺。另有 1 家信源报道# 智能体# 评测# 大模型# 自然语言处理
arXiv 人工智能AI 评分 68/10012:00

MedCode:利用内嵌代码生成提升大模型医疗计算精准度

大语言模型在医学考试和问答基准上表现优异,但在需要精确数值输出的医疗计算任务(如药物剂量、器官功能评估和预后评分等高风险决策)中仍不可靠。为此,研究人员提出了 MedCode 框架,通过训练 LLM 生成可执行的内嵌代码来改进医疗计算。在给定临床语境下,模型可识别相关计算工具并提取输入变量进行精准计算,显著降低临床计算误差风险。

阅读原文 ↗推荐理由:针对大模型在严肃医疗场景中易发生数值计算错误的痛点,采用程序辅助生成思路提升计算准确性,具临床落地参考价值。# 医疗AI# 大模型# AI编程# 推理
arXiv 人工智能AI 评分 65/10012:00

BioDyad:协同生物医学发现与机器学习工程的双层搜索框架

针对智能体在生物医学机器学习中协同证据获取与可执行程序搜索的难题,研究团队提出了BioDyad框架。该系统在蒙特卡洛图搜索中构建了两层结构,将生物医学科学发现与机器学习工程紧密结合。其科学层负责整合先验生物学证据指导候选构建,工程层则利用执行反馈迭代优化程序,从而在有限的验证预算内实现证据获取与代码搜索的闭环协同。

阅读原文 ↗推荐理由:提出了一种将生物医学知识发现与机器学习代码工程双向协同的智能体搜索架构,对AI for Science领域有一定参考价值。# 智能体# 医疗AI# AI编程
arXiv 人工智能AI 评分 60/10012:00

符号引导提升大语言模型分布式多智能体协同能力

针对大语言模型(LLM)智能体在多智能体系统中执行分布式协作协议时可靠性不足、完全自主推理易导致性能下降的问题,该研究提出通过结合经典算法生成的“符号引导”来约束和规范智能体的自主行为,以提高复杂场景下多智能体分布式协同的可靠性与执行效率。

阅读原文 ↗推荐理由:探讨将传统符号算法与大模型智能体结合以增强多智能体分布式协同稳定性的前沿研究,具备一定的工程参考价值。# 智能体# 大模型# 评测# 强化学习
arXiv 人工智能AI 评分 62/10012:00

SenseAgent:面向自适应跨域惯性传感的大模型智能体

针对惯性测量单元(IMU)在跨用户、跨设备及不同佩戴位置时感知模型易失效的问题,该研究提出了 SenseAgent。现有方案多将跨域适应视为静态模型设计(如预训练表征或离线数据增强),难以应对实际场景中目标域数据逐步暴露且标签稀缺的挑战。SenseAgent 引入 LLM 智能体架构,通过动态分析域漂移并自适应执行感知与适配动作,提升移动和可穿戴设备在复杂动态环境下的感知泛化能力。

阅读原文 ↗推荐理由:将大模型智能体机制引入可穿戴 IMU 传感器自适应跨域感知,为移动与端侧传感器的动态域适配提供了新颖的研究视角。# 智能体# 端侧AI# 大模型# 时间序列
arXiv 人工智能AI 评分 68/10012:00

重新审视LoRA中的秩:谱与分布视角的理论分析

业界普遍认为低秩适应(LoRA)中的秩(Rank)充当了模型容量控制的角色,即较小的秩对应更简单的模型与更好的泛化能力。本研究从理论上指出,在实际中权重衰减与范数控制所对应的硬逐因子范数预算下,这种直觉并不成立。研究表明,在此类约束下,LoRA更新矩阵位于核范数球内,且所分析的各类复杂度与位移泛函均在秩为1时达到最大值,导致秩上限实际上并未起到容量约束的作用。

阅读原文 ↗推荐理由:从理论层面颠覆了关于LoRA超参数Rank作为容量控制的传统直觉,对大模型微调实践与机理研究有参考价值。# 微调# 大模型# 可解释性# 自然语言处理
arXiv 人工智能AI 评分 78/10012:00

最新研究:推理模式会集中错误,导致自洽性投票机制失效

一项最新研究挑战了大模型常用的自洽性(Self-Consistency)采样假设。传统观点认为模型在不确定时独立采样会产生分歧,因而答案一致性可作为正确依据。但在固定权重、跨5个基准的7.5万次采样实验中,开启推理模式反而显著集中了模型的错误:两次独立采样得出相同错误答案的概率大幅上升,错误输出的多样性降至非推理模式的0.43-0.65倍。这意味着基于多数投票的自洽性过滤极易将共性系统错误误判为正确答案。

阅读原文 ↗推荐理由:有力揭示了推理模型在测试期扩展中的关键盲点,表明多数投票策略面对系统性趋同错误时存在失效风险。另有 1 家信源报道# 大模型# 推理# 评测
arXiv 自然语言处理AI 评分 72/10012:00

LLM 裁判偏差研究:后训练使模型写作更可预测,但作为裁判的品味保持稳定

该研究探讨了“大模型作为裁判”(LLM-as-a-judge)在自动化评估中的偏见问题。研究人员追踪了 OLMo-2 和 Zephyr(均为 7B 参数)在公开后训练各阶段的表现,分别评估其作为故事创作者与裁判的行为。结果发现,尽管后训练确实使模型自身生成的文本更具可预测性,但当其扮演裁判时,其审美偏好并未相应倒向可预测的写作,表明自动化评估仍能有效识别创造力进展。

阅读原文 ↗推荐理由:深入探讨了大模型作为裁判的后训练偏差机制,为 LLM 自动化评测的可靠性提供了实证支持。另有 1 家信源报道# 评测# 大模型# 对齐# 前沿研究# 自然语言处理
arXiv 人工智能AI 评分 72/10012:00

基于接收端条件化的多智能体隐式通信方法 CacheBack:压缩高达94%的KV缓存

针对多智能体系统中直接传输KV缓存带来的显存开销线性增长、超出GPU资源限制的问题,研究团队提出了一种接收端条件化的隐式通信方法。该方法在保留隐式通信低延迟、无需文本生成且信息无损优势的同时,针对接收端需求进行针对性优化,实现了高达94%的KV缓存压缩与回退,大幅降低了多智能体协作中的上下文与显存负担。

阅读原文 ↗推荐理由:针对多智能体系统在隐式通信(KV Cache传递)中面临的高昂显存成本问题提出了高压缩比优化方案,具有实用价值。另有 1 家信源报道# 智能体# 推理# 模型压缩# 自然语言处理
arXiv 机器学习AI 评分 62/10012:00

JEPA自监督预训练对时间序列预测是否真正有效?

联合嵌入预测架构(JEPA)作为一种在隐空间预测目标嵌入而非重构原始信号的自监督预训练范式,在时间序列领域受到关注。然而现有研究对其增益结论不一且多局限于单一骨干网络。该论文开展了一项大规模实证评估,在9种不同骨干网络和11个基准数据集上系统检验了JEPA预训练的表现,旨在厘清其泛化提升效果究竟是普遍成立还是高度依赖于下游模型架构。

阅读原文 ↗推荐理由:系统性评测了JEPA架构在时间序列领域的预训练有效性,对时序大模型与表征学习研究有一定参考价值。另有 1 家信源报道# 时间序列# 评测# 前沿研究与模型架构
arXiv 人工智能AI 评分 65/10012:00

合同监控机制:借鉴三权分立治理 AI 智能体安全

该研究提出了一种名为“合同监控”(Contract Monitoring)的 AI 安全框架。该框架通过明确规定工作智能体(Worker Agent)允许执行行为的“合同”来进行约束,并借鉴三权分立思想,将监控智能体与裁判分配不同职责,同时为监控方与执行方配置非对称的算力资源以确保合同执行。该框架支持对统计安全保证进行经验性度量,可广泛应用于代码安全审计和沙箱逃逸防范等场景。

阅读原文 ↗推荐理由:提出了一种基于权力制衡与资源非对称的多智能体安全监控机制,对 Agent 运行期安全治理有参考价值。# 安全# 智能体# 对齐# 治理
arXiv 人工智能AI 评分 63/10012:00

新基准PAU提出:评估大模型黑盒交互式理解代码API的能力

现有代码大模型与智能体通常依赖直接读取源码来进行代码理解,但在面对外部闭源或远程 API 时该假设并不成立。为此,研究人员推出了 PAU(Python API 理解)基准测试。在该设定下,模型仅拥有代码片段的黑盒 API 访问权限,必须通过构造探索性输入并分析返回结果,主动推断并描述代码的真实功能,以此评估智能体的黑盒交互式逆向理解与探索能力。

阅读原文 ↗推荐理由:提出了评估智能体黑盒 API 探索与代码功能逆向理解能力的新基准,对代码智能体评测具有一定参考价值。另有 1 家信源报道# 智能体# AI编程# 评测# 大模型
arXiv 人工智能AI 评分 70/10012:00

将记忆作为中间件:实现自进化AI智能体的新架构思路

AI智能体在不同会话间默认呈无状态性,导致其丢失既往失败、修复和策略等经验,容易重复犯错。当前主流解决方案多为定制化记忆系统,将检索、持久化和学习逻辑与特定智能体及存储引擎强绑定,造成记忆难以共享、迁移与隔离。针对这一碎片化现状,该论文提出将记忆层抽象为中间件架构,旨在使记忆能够独立于智能体进行管理与推理,为智能体的跨会话自演进提供标准化基础。

阅读原文 ↗推荐理由:直击智能体缺乏跨会话持久记忆的痛点,提出将记忆解耦为中间件的架构思路,对Agent系统工程设计有启发意义。另有 1 家信源报道# 智能体# 记忆# 前沿研究
arXiv 人工智能AI 评分 66/10012:00

GameBoyWorlds:面向视频游戏具身智能体自我提升的评测基准

该研究推出了名为 GameBoyWorlds 的全新测试平台,专门用于评估智能体在视频游戏环境中的自主学习与自我提升(Self-Improvement)能力。该测试集涵盖 5 个不同的游戏系列,要求智能体在没有任何专家演示、文档说明或外部奖励信号的条件下,完全依靠自主探索和动作推断来理解环境并完成任务执行。

阅读原文 ↗推荐理由:聚焦具身智能体在无先验指导下的自我提升与自主探索能力,提供了结构化的游戏评测基准。# 智能体# 评测# 强化学习# 具身智能
arXiv 人工智能AI 评分 68/10012:00

残差流负责读取、循环状态负责记忆:探究 Mamba 模型的内部表征机制

该研究探讨了 Transformer 的“全局工作区”理论是否适用于状态空间模型(SSM)。研究人员利用雅可比透镜(Jacobian lens)分析了 Mamba-1、Mamba-2 和 Mamba-3 的残差流与循环状态。实验表明,残差与循环状态的联合读取显著提升了中间概念的解析能力;尤其在 Mamba-2 中,仅凭循环状态在多项任务上的表征恢复能力便超过了传统的残差透镜与 Logit 透镜,系统揭示了 SSM 架构中记忆与读取的分工机制。

阅读原文 ↗推荐理由:深入探究了 Mamba 状态空间模型的机制可解释性,揭示了残差流与循环状态在信息表征与记忆中的不同分工。# 大模型# 可解释性# 自然语言处理
arXiv 自然语言处理AI 评分 72/10012:00

揭秘智能体记忆评测捷径:证据充分性评估中的尺寸泄漏问题与改进

该研究指出,在评估智能体基于压缩或检索记忆判断证据是否充分的任务中,现有基准通常通过直接删除支持段落来构造样本,导致“记忆大小”成为泄露标签的严重捷径。实验表明,在 MuSiQue 数据集上,仅统计段落数量的分类器其 AUROC 就高达 0.979。为此,作者提出了一种尺寸匹配的构建方法以彻底消除此类数据泄露,为记忆系统的证据充分性评估提供了更可靠的基准。

阅读原文 ↗推荐理由:指出了当前智能体记忆与检索评测中普遍存在的数据泄露捷径,并提出了有效的尺寸匹配修正方法,具有扎实的参考价值。另有 1 家信源报道# 智能体# 记忆# 评测# RAG# 自然语言处理
arXiv 人工智能AI 评分 68/10012:00

逃逸对齐:Best-of-N越狱攻击的物理陷阱模型研究

该论文针对大模型对齐防御中的Best-of-N(BoN)越狱攻击机制展开深入研究。针对此前学术界认为攻击成功率(ASR)随样本量N呈幂律关系的观点,作者提出质疑,指出其幂律指数会随N漂移,且存在由对抗数据集有限尺寸效应导致的指数交叉。研究全面探索了提示变体预算N、生成采样预算M以及采样温度T构成的多维攻击面,并引入了物理势垒模型来更准确地刻画越狱行为。

阅读原文 ↗推荐理由:从物理势垒视角重新审视并修正了主流越狱攻击的缩放定律认知,对理解大模型对齐脆弱性具有一定理论价值。# 对齐# 安全# 大模型# 评测
arXiv 人工智能AI 评分 68/10012:00

PastForward系统:通过计算经验复用加速端侧GUI智能体

针对在边缘设备上运行GUI智能体时每步全量视觉语言模型(VLM)推理计算成本高昂的痛点,研究人员提出了PastForward系统。该系统利用计算经验复用机制,在无需针对特定任务进行额外微调或离线探索的前提下,有效加速端侧动态环境下的GUI智能体执行流程,同时兼顾了敏感屏幕数据与交互历史保留在本地的隐私优势。

阅读原文 ↗推荐理由:提出了一种通过经验复用加速端侧GUI Agent推理的新系统方案,对降低移动端多模态智能体延迟具有工程参考价值。# 智能体# 端侧AI# 推理# 多模态
arXiv 人工智能AI 评分 62/10012:00

面向代码大模型的含噪测试时强化学习框架 NTRL-Code

针对真实世界中用户提示词常含噪声与模糊描述导致代码大模型表现下降的问题,研究提出测试时强化学习框架 NTRL-Code。传统鲁棒性微调高度依赖昂贵且难以构建的“干净-含噪”成对样本,而该框架通过在测试阶段引入强化学习机制,无需复杂的成对数据微调即可动态提升代码模型对模糊或错误提示词的适应性与生成鲁棒性。

阅读原文 ↗推荐理由:将测试时强化学习引入代码生成以解决真实场景提示词噪声问题,方法实用但属于常规学术预印本研究。# 强化学习# AI编程# 大模型# 推理