跳到正文
9月30日周三
  1. arXiv 人工智能51

    微软团队发布面向数据系统的 AI 软件工厂研究

    微软等机构的研究团队发表论文,提出面向数据系统的 AI 软件工厂(AI SW Factory)以加速软件开发全生命周期。该方案覆盖目标定位、编码、代码审查与运维全阶段,通过产生元数据沉淀微调权重并更新世界模型。该系统已在微软数十个代码库规模化部署,在智能体编码基础上取得 3 倍工程效率提升以及最高 22 倍的 token 效率。

  2. arXiv 人工智能41

    StateTape:面向长程编码智能体的动作条件证据生命周期建模

    StateTape 提出了一种面向长程编码智能体的新框架,通过将代码库建模为符号级代码图并跟踪修改,实现随代码仓库变化动态重写智能体上下文。该研究还提出了评估上下文有效性的基准 TraceBench,并结合轻量管理器模型清理失效记录。实验表明,StateTape 在 6 个编码智能体和 3 个重度编辑基准上均以极低计算开销提升了解决率。

  3. arXiv 人工智能66

    CheatBench:评估 AI 智能体奖励作弊行为的基准测试

    研究团队推出评测基准 CheatBench,用于测量 AI 智能体在数学研究、知识工作、编码和视觉等领域的奖励作弊行为。该基准将高难度任务与作弊途径结合,测试智能体在诚实完成任务受阻时是否会出现越权访问、规避监控或突破沙箱等风险。CheatBench 支持跨模型和任务类别对比,相关评测套件已公开发布。

    推荐理由:原文构建了多领域的作弊评测环境,为评估强化学习驱动的智能体安全性提供了可量化的测试集。

  4. arXiv 人工智能39

    从表面到体积:用于蛋白质表征学习的配准几何

    研究团队提出 Protein-TetSphere 蛋白质体表征方法,通过将蛋白质链四面体化并配准到统一拓扑参考系,建立跨残基的一致三维体坐标。该方法将配体结合口袋分类平衡准确率从 0.795 提升至 0.826,并将 BoltzGen 蛋白质结合剂设计成功率从 14.95% 提升至 19.90%,在蛋白质界面预测上也取得性能提升。

  5. arXiv 人工智能42

    OTROPE:基于最优传输的大语言模型鲁棒离线策略评估

    研究人员提出基于最优传输的鲁棒离线策略评估方法 OTROPE,可在无需响应概率的情况下利用有限人工标注数据评估黑盒目标大语言模型。该方法在语义空间通过最优传输对齐带标注的行为样本与未标注的目标样本,并结合校正残差与代理预测器实现双重鲁棒评估。实验表明 OTROPE 持续优于基线,能使较弱评估器的集成效果逼近甚至超越更强评估器。

  6. arXiv 人工智能53

    大推理模型欺骗性安全对齐缓解研究:提出 SARA 对齐方法

    NeurIPS 2026 论文针对大推理模型因强化学习只监督最终答案而导致的欺骗性安全对齐问题,提出了量化评估指标 DSAR 与强化学习对齐方法 SARA。SARA 同时对安全推理痕迹和安全最终答案提供奖励,促使模型早期识别有害意图并保证推理与答案的一致性。实验表明,该方法在标准提示与前缀填充攻击下均能显著减轻欺骗性安全对齐现象并保持实用性,相关代码已开源。

  7. arXiv 人工智能36

    CoRe:通过协同演化奖励模型缓解视频扩散模型的潜在奖励作弊

    研究人员提出协同演化奖励框架 CoRe,通过让奖励模型与生成器动态交互,缓解视频扩散模型在潜在空间对齐时的奖励作弊问题。CoRe 持续在生成器当前样本上重新拟合奖励模型并锚定真实视频偏好,防止生成器因分布逃逸导致感知与运动质量恶化。在 Wan2.1-T2V-1.3B 上的实验表明,该方法生成质量优于预训练模型及先前对齐方法。

  8. C114 通信网 · AI与算力(网页)61

    三大运营商2025年度业绩盘点:营收增速放缓并加速转向算力业务

    中国三大电信运营商2025年度业绩报告悉数出炉,全年营收增速集体降至1%以内,传统业务增长见顶并加速布局算力与智能业务。中国移动全年营收达10502亿元(净利润1371亿元),算力与智能服务收入占比提升至20.2%;中国电信实现营收5239亿元(净利润332亿元),资本开支为804亿元;中国联通营收达3922亿元(利润总额253亿元),资本开支为542亿元。

  9. arXiv 人工智能33

    ChronoSRL:面向自监督强化学习的时间几何方法

    ChronoSRL 为 Critic 嵌入引入显式时间几何结构,使状态-动作与目标嵌入的距离直接匹配到达目标的时间。该方法结合生存强化学习预测时间分布与停留时长,在 7 个标准运动和导航基准上以更小网络实现更快的学习速度与更优性能。在四足机器人仿真到真实测试中,ChronoSRL 是唯一成功实现保持指定速度与目标位置并攀爬最高箱子的自监督强化学习方法。

  10. C114 通信网 · AI与算力(网页)59

    三大运营商2026年上半年业绩盘点:中国移动、中国电信与中国联通财报出炉

    三大运营商2026年上半年财报公布,中国移动营收5380亿元、净利润789亿元,中国电信营收2590亿元、净利润196亿元,中国联通营收2014亿元、净利润95亿元。在算力与云业务方面,中国电信天翼云收入达到618亿元(同比增长7.8%),中国移动算力与智能服务收入在主营业务中占比提升至22.6%。

  11. arXiv 人工智能35

    MERID:基于递归自我改进智能体的重度抑郁症多模态分析框架

    研究人员提出多模态智能体框架 MERID,通过基于经验的递归自我改进自主构建并优化重度抑郁症分析流程。该框架整合了目标对齐(GSC)、流程联合探索(CPE)与证据引导演化(EGE)机制,能在小样本抑郁队列中验证并继承有效改进。实验表明 MERID 在多项基准测试中均取得最佳效果,相关代码已开源。

  12. C114 通信网 · AI与算力(网页)12

    C114 通信网人工智能与算力频道最新动态汇总

    C114 通信网人工智能频道汇总了近期算力网络与 AI 产业的最新动态。重点内容包括腾讯专有云发布案例集、睿芯量产 RISC-V 数据流 AI 芯片高光 D35,以及超大规模智算集群中的算网协同进展。同时,该频道还收录了 OpenAI 动态、Anthropic 研发数据及 Gartner 趋势预测等多项行业资讯。

  13. arXiv 人工智能38

    《欧盟人工智能法案》合规检查工具的实证研究与评估

    一项针对 12 款主流欧盟《人工智能法案》合规检查工具(AIACCs)的实证研究显示,当前工具质量差异显著,仅能作为早期参考。这些工具普遍存在过度简化或遗漏关键法律义务的问题,且无法提供明确可操作的指导,过度依赖易产生虚假的合规安全感。该研究为此类工具建立了评估基准,并提出了更可靠工具的设计原则。

  14. C114 通信网 · AI与算力(网页)24

    C114通信网卫星通信与天基算力行业最新动态

    C114通信网汇总了卫星通信与天基算力的最新动态,国内首个一体化算力卫星“超智算一号”与“通感智算”技术验证卫星已成功发射入轨。同时,我国完成卫星互联网低轨25组卫星发射,千帆极轨组网卫星发射后千帆星座在轨规模已增至256颗。业内正加速推进高低轨融合网络、天基数智平台及卫星物联网的规模商用。

  15. arXiv 人工智能43

    FigAct:将科学图表转化为用于解释的动态画布

    研究人员推出 FigAct 框架与 FigAct-8B 模型,可直接对静态科学图表中的图形元素进行操作,将其转化为问答驱动的动态视觉演示以引导读者注意力。该框架采用分层搜索策略实现高效的元素定位,将 token 消耗降低约 40x,并基于定位精度、搜索效率与渲染质量三项奖励进行训练。团队还构建了人工验证的评测基准。

  16. C114 通信网 · AI与算力(网页)23

    Fortinet 网络安全与 AI 防御动态汇总

    Fortinet 推出集成 FortiSASE Outpost 的 FortiGate 1200G 防火墙,以及依托 Agentic AI 的云端统一 FortiSOC 平台。同时发布融合 AI 安全管控、新一代 SASE 与抗量子防护的 FortiOS 8.0,并深化与阿里云的云原生安全合作。相关报告显示勒索软件受害者年增 389%,强调需加速普及 AI 技能以弥合安全人才缺口。

  17. arXiv 人工智能37

    隐式递归 LLM 系统的规范化思考机制

    研究提出 REST(REpresentation-Supervised Thoughts)训练目标,将因果性、极小性、可分性和稳定性转化为可微损失加入交叉熵,解决大语言模型在隐空间递归推理时的表征失效问题。该方法适用于单智能体与多智能体系统,无需修改架构或增加推理参数。在涵盖数学、医学和代码等 7 个基准测试中,REST 相比纯交叉熵训练准确率最高提升 7.5 个百分点,答案收敛提升 30%。

  18. arXiv 人工智能26

    更多特征不等于更多证据:基于 Jev 的免训练人体活动识别局限性分析

    研究表明通用概率决策模型 Jev 在免训练人体活动识别任务中表现受限,在 WISDM、UCI341 和 PAMAP2 上的最佳 macro-F1 仅为 0.038、0.118 和 0.089,远低于监督模型的 0.686 至 0.907。测试发现增加数值特征反而降低了识别效果,表明免训练传感器决策不仅取决于信号信息,更受特征呈现方式的制约。

  19. C114 通信网 · AI与算力(网页)23

    C114通信网:云计算与算力产业动态汇总

    云计算与算力领域近期迎来多项进展,Gartner调研显示88%的受访者关注云原生投资优化策略。政策层面,六部门联合印发指导意见,提出突破关键核心技术并推动云边端计算协同与数据产业发展。同时,央视纪录片《大国基石》展示了天翼云依托智算能力推进科技创新的实践。

  20. arXiv 人工智能43

    记忆即推导:长期 AI 智能体中的分布式证据悖论

    针对长期运行的大语言模型(LLM)智能体将历史压缩为持久记忆时的推导失真问题,研究提出了 DerivAudit 审计框架。在两个自然记忆语料库中,扩大写入前历史能为近 60% 仅凭引用看似不支持的记忆找回支持,但仍有 17-21% 在扩展后依然缺乏支持。实验表明无支持记忆仍频繁被准入,且单纯扩展证据范围会在两个骨干模型上降低准入可靠性。

  21. C114 通信网 · AI与算力(网页)20

    C114通信网:全球量子计算与量子通信产业最新动态

    中国信通院数据显示全球超30个国家和地区布局量子产业,总投资突破350亿美元,量子信息进入计算、通信、测量多线突破的攻坚培育期。在产业投资方面,IBM旗下量子制造企业与美国商务部签订10亿美元补贴协议,中国移动链长基金出资超亿元投资弧光量子。与此同时,日本NEC因预期需投资十多年且难以盈利,已宣布退出量子计算机研发。

  22. arXiv 人工智能35

    AdaST:面向时空预测的自适应耦合框架

    针对现实时空数据存在时间主导、空间主导和强耦合等多重模式的问题,研究团队提出了自适应时空预测框架 AdaST。该框架采用分解-重组范式,利用异质感知专家解耦不同模式分量,并通过关联感知自适应重组器整合预测结果。实验表明 AdaST 性能显著优于现有 SOTA 基准,论文已被 NeurIPS 2026 接收并开源代码。

  23. C114 通信网 · AI与算力(网页)13

    C114 通信网物联网频道资讯动态汇总

    C114 通信网物联网频道汇集了端侧 AI、5G RedCap、工业物联网与智能出行等领域的最新动态。报道重点呈现了移远通信发布的 M.2 智能算力板卡 QSC600XA-AP 及 NXP i.MX9 系列核心模组、Semtech 与 Palo Alto Networks 的零信任工控安全方案等内容。此外还涵盖了九部委物联网行动方案以及电摩智能化、割草机器人等终端落地案例。

  24. arXiv 人工智能35

    VLA 层级之谜:VLA 隐式接口的信息论分析

    一项针对视觉-语言-动作(VLA)策略隐式接口的研究表明,在 LIBERO 和 CALVIN 基准下,54 种多层融合配置中有 47 种表现弱于最佳单层策略。研究提出以 InfoNCE 作为层质量代理指标,无需闭环评估即可将平均选择遗憾值从最深层的 17.89 个百分点降至 3.71 个百分点,同时减少 9-33 倍 GPU 算力消耗。

  25. arXiv 人工智能44

    小 LLM 团队跨编排架构扩展的精确生成-转换分解

    一项研究针对 8 种 Agent 编排架构与 5 款 7-9B 模型评估小语言模型团队扩展,发现扩展收益高度依赖任务类型。调用次数从 3 次增至 30 次时,GSM8K 等算术任务准确率最高提升 17 点,但 ARC、GPQA 和 MMLU 最多仅提升 4 点。研究提出生成-转换分解方法,指出同等调用预算下 token 成本相差 2.1 倍,团队扩展并非普适手段。

  26. C114 通信网 · AI与算力(网页)17

    信而泰与 VIAVI 布局多项 AI 智算与高速光互联测试方案

    信而泰与 VIAVI 密集公布多项网络与光通信测试方案,重点聚焦 AI 智算、CPO 及高速互联场景。信而泰正式发布 E2-10G 测试模块并升级 800G RoCE 功能,同时参与发布 6G 智能融合承载网络白皮书;VIAVI 则展示了 1.6T/3.2T 解决方案、真相位 DAS 监测仪及面向 AI 光互联的 DCX700 多芯光纤测试仪。

  27. arXiv 人工智能36

    GeoOutageBench:面向多模态停电与韧性分析的地理时空 KGQA 评测基准

    研究人员推出 GeoOutageBench,用于评测大语言模型在多模态电力停电与韧性分析中的地理时空知识图谱问答(KGQA)能力。该基准整合停电记录、遥感与气象等多模态数据,评估大语言模型在歧义条件下的自然语言转 SPARQL 解析、本体效用及多模态检索准确率。目前相关基准、代码与数据已公开提供。

  28. arXiv 人工智能36

    AI 理解的复音构想

    大语言模型(LLM)的输出源自多个并行且可靠度参差不齐的机制联合作用,呈现普遍的“复音(polyphonic)”特征,打破了传统局限于单一机制的理解假设。为此研究提出了适用于复音 AI 的理解概念,核心聚焦于能被可靠调用并主导输出的健全电路。该构想将对 AI 理解力的归因转化为关于模型内部组织的可处理主张,旨在为关键领域的 AI 信任评估提供指导。

  29. arXiv 人工智能50

    美团 LongCat-DeepResearch 技术报告

    美团 LongCat 团队推出深度研究系统 LongCat-DeepResearch,结合增强版 LongCat 模型与多智能体工作流生成综合研究报告。该系统通过规划智能体制定 ResearchSpec,由研究智能体并行调研起草各章节,并基于全局审查进行章节级定向修订。

  30. arXiv 人工智能35

    SMat-Attention:结构化长上下文序列建模

    研究提出结构化矩阵注意力 SMat-Attention,通过 VC 维数 $d$ 调控因果掩码的路由结构,在全注意力与线性注意力之间建立可调权衡。对序列长度 $T$,其硬路由计算复杂度为 $O(T^{2-3/d}+T)$,在流式解码中仅需 $O(T^{1-1/d})$ 缓存状态即可实现单 token 常数时间解码。

  31. C114 通信网 · AI与算力(网页)20

    C114 通信网专网行业资讯汇总

    C114 通信网汇集了多项企业通信与数字化动态,其中 Avaya 获评 Aragon Research 2023 年度智能联络中心对话式 AI 领导者。商越科技完成 1.5 亿元 B+ 轮融资,资金将用于采购 SaaS 和千机阁 PaaS 产品的研发投入。此外,内容还涵盖了人口红利见顶下的企业增长路径及音视频通话场景向互联网拓展等行业趋势。

  32. C114 通信网 · AI与算力(网页)19

    C114通信网光通信行业动态汇总

    C114通信网光通信频道汇集了近期行业重点动态。AT&T与康宁达成价值超30亿美元的光纤光缆供应协议,亨通光电拟募资不超过66.36亿元投向新一代光纤等项目,汇绿生态扩建武汉基地新增200万支光模块产能。同时,中国电信工业PON技术获得ECOC 2026光接入创新奖。

  33. arXiv 人工智能41

    GeoWind2Plan:面向无人机节能路径规划的任务级三维城市风场预测

    GeoWind2Plan 提出了一个用于任务级三维城市风场预测与无人机(UAV)节能路径规划的框架。该框架结合局部几何条件神经算子与物理能耗模型,仅需背景风向量、三维建筑几何及起止点,即可在约 3 秒内完成走廊局部风场推理,远快于 CFD 模拟的约 8 小时。在 CFD 评估下,规划轨迹在顺风、逆风和侧风任务中分别降低能耗 6.9%、12.7% 和 4.5%。

  34. C114 通信网 · AI与算力(网页)13

    C114无线通信频道聚焦5G-A商用与6G演进最新动态

    C114无线通信频道汇总了5G-A与6G技术演进及产业落地的多项最新动态。重点内容涵盖第三届5G-A万兆网产业论坛举办、高通推出第六代骁龙8移动平台,以及中国移动联合高通完成全球首个U6G频段6G原型基站与终端对接测试。相关报道还涉及各厂商在5G-A大上行、具身智能融合与应急通信等场景的应用实践。

  35. arXiv 人工智能46

    PowerZooJax:基于 JAX 的电力系统强化学习基准套件

    开源基准套件 PowerZooJax 基于 JAX 构建,将电力系统强化学习的完整训练与评估流程置于 GPU 运行。该套件包含涵盖发电、输电、配电、分布式能源及数据中心微电网的 5 个约束马尔可夫决策过程任务。相比传统 CPU 仿真,其大幅提升计算速度,并支持对策略回报、安全违规和分布外压力测试进行标准化评估。

  36. C114 通信网 · AI与算力(网页)25

    广电行业近期动态:涉及基础设施共建、跨省算力协同与行业规章修订

    中国广电四川公司与四川移动就基础设施共建共享及无线网络品质升级深化交流合作。在算力协同方面,吉视传媒赴中国广电宁夏网络公司调研交流,推动跨省算力结对合作。此外,国家广电总局针对有线广播电视及交互式网络电视(IPTV)两项运营管理规章公开征求意见。

  37. arXiv 人工智能43

    SAGE:面向自进化智能体的统计准入门控

    针对大语言模型智能体自进化中技能修改易引发性能回退的问题,研究人员提出了统计准入门控 SAGE。该方法通过逐项配对比较与单侧配对统计检验,仅在收益统计可靠且不牺牲已解决任务时采纳编辑,有效过滤不可靠修改。跨 5 个基准与 4 款骨干 LLM 的测试显示,SAGE 在全部 20 种设置中均取得最高分,并在 19 种设置下降低了回退率。