AIDC
DC AI 热点

全部 AI 动态

全部语言仅中文10 条动态
来源筛选
全部来源AITNT · AI头条(网页)Buzzing HN · 中文精选C114 通信网 · AI与算力(网页)DeepSeek 公众号IDC 圈·云与算力(网页)IT168 服务器存储 · AI与算力(网页)IT之家 · AI 筛选InfoQ · 架构与云计算Solidot · AI 筛选少数派 · AI 筛选智谱 公众号月之暗面 Kimi 公众号爱范儿 · AI 筛选腾讯混元 公众号通义实验室 公众号量子位阮一峰 · AI 筛选阶跃 StepFun 公众号AI Roundup · X AI coding圈日报AWS ArchitectureAWS HPCAWS News · 云基础设施AWS 机器学习Anthropic News(RSS)Apple Machine Learning ResearchArs Technica · AI 筛选Azure Blog · 云基础设施CNCF BlogCerebras 官方博客(网页)Claude Code 更新Claude 官方博客(网页)Cloudflare Blog · 网络基础设施Data Center DynamicsData Center KnowledgeEngineering at MetaEquinix Blog · 互联基础设施Gary MarcusGitHub Blog · AI 与安全Google AIGoogle DeepMindGoogle Developers · AI 筛选Google InfrastructureGoogle ResearchHacker News · AIHugging FaceKubernetes BlogLangChain 官方博客(网页)Last Week in AILlamaIndex 官方博客(网页)MIT News · AIMIT Technology Review AIMicrosoft ResearchNVIDIA Developer BlogNVIDIA · AI 筛选Ollama 更新OpenAI 官方动态OpenStack BlogSebastian RaschkaSemiAnalysis · 算力产业ServeTheHomeSimon WillisonTechCrunch AIThe Batch · DeepLearning.AIThe DecoderThe Next PlatformThe Verge · AI 筛选Transformers 更新Transluce 研究(网页)Vertiv 官方新闻arXiv 人工智能arXiv 机器学习arXiv 自然语言处理vLLM 官方博客(网页)vLLM 更新施耐德电气博客
9月24日2026-09-24
Apple Machine Learning ResearchAI 评分 72/10008:00

苹果提出隐空间蒸馏技术:压缩端侧流式神经音频编码器

苹果系统级听写功能完全在设备端运行,音频需通过编码器分词后输入基础模型。针对端侧常驻分词器与稀疏激活模型争抢 DRAM 内存、影响功耗和延迟的问题,研究团队提出了基于隐空间蒸馏的流式神经音频编码器压缩方法,有效降低了编码器参数量与计算开销,提升了端侧语音识别的资源利用效率。

阅读原文 ↗推荐理由:苹果针对端侧基础模型音频前端的内存与功耗瓶颈提出的模型蒸馏优化方案,对端侧语音部署具较高工程参考价值。# 端侧AI# 模型压缩# 蒸馏# 语音# Apple
Apple Machine Learning ResearchAI 评分 62/10008:00

半监督联邦语音识别实用方案:在线伪标签与服务端更新稳定化

该研究针对半监督联邦学习(SSFL)在自动语音识别(ASR)场景中极易发散的技术痛点提出改进方案。在客户端仅有未标注数据的情况下,ASR 伪标签错误会在输出序列与多轮训练中复合累积,导致模型性能大幅落后于全监督联邦学习。研究表明,弥合这一差距的关键在于两个耦合的设计维度:一是优化生成在线伪标签的教师模型机制,二是利用服务端少量标注数据进行更新以构建稳定训练的“锚点”,有效抑制了误差累积。

阅读原文 ↗推荐理由:针对联邦学习在语音识别场景中伪标签误差复合发散的痛点提出了针对性工程与架构解法,对端侧隐私计算训练具备参考价值。# 语音# 隐私计算# 端侧AI# 前沿研究与模型架构
9月23日2026-09-23
Apple Machine Learning ResearchAI 评分 68/10008:00

Probe Guidance:无需额外前向传播的扩散流匹配模型引导新方法

该研究提出了一种名为探针引导(probe guidance)的新方法,用于引导流匹配(flow matching)模型。该方法利用现有扩散模型冻结的内部状态来构建引导信号,原理类似自动引导(autoguidance),但消除了推理时额外的模型前向传播开销,并确保弱模型与强模型具有一致的动力学特性。在连续扩散语言模型上的基准测试表明,该方法在无条件生成任务上刷新了 SOTA 性能表现。

阅读原文 ↗推荐理由:针对连续扩散/流匹配语言模型推理引导机制的有效改进,在降低计算开销的同时实现了SOTA表现。# 大模型# 推理# 自然语言处理# 前沿研究
9月18日2026-09-18
Apple Machine Learning ResearchAI 评分 70/10008:00

动态缩放激活转向技术(DSAS):按需调节大模型干预强度的对齐新框架

激活转向是引导生成模型行为(如降低毒性)的重要技术,但传统方法通常对所有输入采用统一干预,容易在无需转向的场景下损害模型原有性能。研究人员提出了动态缩放激活转向(DSAS)框架,将“何时干预”与“如何干预”解耦。DSAS能够跨层并根据具体输入自适应调整现有转向变换的强度,仅在检测到不良行为时进行强干预,从而在保障对齐控制的同时最大程度保留模型基础能力。

阅读原文 ↗推荐理由:针对激活工程中一刀切干预导致能力受损的痛点,提出了动态自适应的转向框架,对大模型可控对齐具有实用参考价值。# 对齐# 可解释性# 大模型# 安全
9月17日2026-09-17
Apple Machine Learning ResearchAI 评分 70/10008:00

REVERSAL-BENCH:衡量无重置强化学习可逆性瓶颈的新基准

自主强化学习的核心目标是摆脱外部重置实现持续策略训练,但现有范式大多依赖环境的可逆性假设,这在现实物理操作(如物体掉落或粉末洒出等不可逆事件)中并不成立。研究团队推出了 REVERSAL-BENCH 基准,通过连续参数控制可逆性程度,并提供真实状态可恢复性验证机制(Reset Oracle),覆盖5个物理引擎中的8种操作场景,用于系统评估强化学习在不可逆环境下的性能断崖问题。

阅读原文 ↗推荐理由:针对真实世界强化学习落地中最关键的‘不可逆状态’难题提出了量化基准,对具身智能自主训练有重要参考价值。# 强化学习# 具身智能# 评测# 前沿研究
9月16日2026-09-16
Apple Machine Learning ResearchAI 评分 72/10008:00

面向智能体系统的共享选择性持久记忆架构

针对基于大模型的多轮工具调用智能体在会话间上下文丢失、以及全量持久化历史导致 Token 浪费和生成质量下降的问题,研究提出了一种“共享选择性持久记忆”架构。该方案通过识别并保留任务规范、数据 Schema 等四类高价值可复用上下文,实现了跨会话的经验沉淀与高效检索,在降低上下文冗余的同时提升了多轮代码生成等场景的执行效率与准确率。

阅读原文 ↗推荐理由:针对 Agent 跨会话记忆与 Token 膨胀痛点提出了细粒度选择性存储方案,对工程落地有实用参考价值。# 智能体# 记忆# 大模型# AI编程
Apple Machine Learning ResearchAI 评分 68/10008:00

Glyph:用于企业数据目录列描述与敏感本体标注的多策略智能体系统

针对企业数据湖中数据表增长过快、人工难以维护列描述和数据治理标签的痛点,该研究提出了生产级系统 Glyph。该系统将列描述生成与敏感数据类型标注两项任务,建模为基于有状态图编排的协作型大模型智能体。其中,描述生成器通过按需检索生成各数据列的数据管道源代码作为上下文依据,实现精准的元数据自动化补齐与合规标签标注,有效解决数据治理负债问题。

阅读原文 ↗推荐理由:将多智能体协作与代码上下文追溯引入企业数据治理,解决元数据缺失和合规标注痛点,工程落地性强。# 智能体# 大模型# 治理
Apple Machine Learning ResearchAI 评分 72/10008:00

DACA-GRPO:面向扩散语言模型强化学习的去噪感知信用分配算法

扩散大语言模型作为自回归模型的替代方案备受关注,但现有强化学习方法通常将所有去噪步视为同等重要,且依赖高方差、有偏的似然估计。为此,研究团队提出 DACA-GRPO(去噪感知信用分配 GRPO)。该方法作为一种轻量级、即插即用的增强方案,解决了去噪轨迹中时间信用分配缺失及策略优化时平均场似然估计的系统性偏差问题,提升了扩散语言模型的强化学习训练效果。

阅读原文 ↗推荐理由:针对扩散语言模型强化学习训练中信用分配缺失的痛点提出改进方案,技术针对性强,值得关注扩散模型架构优化的研究者阅读。# 大模型# 强化学习# 前沿研究与模型架构# 对齐
Apple Machine Learning ResearchAI 评分 75/10008:00

以轨迹为师:基于能量导航蒸馏实现少步数离散流匹配

离散流匹配在文本生成中通常需要数百次前向计算,而传统蒸馏旨在用少量步数复现该轨迹。该研究指出,少步数蒸馏效果不佳的瓶颈并非学生模型容量不足,而是教师轨迹本身存在缺陷——无序的随机跳转使得早期中继点的错误不断向后传播。为此,研究团队提出以轨迹质量为核心,结合能量导航机制指导蒸馏过程,显著提升了少步数离散流匹配文本生成的效率与质量。

阅读原文 ↗推荐理由:颠覆了离散流匹配蒸馏中学生模型容量受限的传统认知,从轨迹质量与能量导航切入解决了少步数生成瓶颈。# 蒸馏# 自然语言处理# 前沿研究# 模型压缩# 推理
Apple Machine Learning ResearchAI 评分 72/10008:00

价值注入如何重塑大语言模型的行为模式

对话大模型在后训练阶段常被注入好奇心、同理心以及“有用、无害、诚实”等特定价值观与行为特征,以提升安全性与交互体验。然而,各项价值观念复杂交织,诱导或强化某一价值观可能意外改变模型在其他维度的表现。研究指出,不当的价值注入可能导致模型生成更具成瘾性或谄媚(sycophancy)倾向的语言,进而对用户产生潜在负面影响,揭示了后训练价值对齐的复杂性与副作用。

阅读原文 ↗推荐理由:探讨大模型后训练中价值对齐引起的连锁反应与次生风险,对理解模型谄媚与行为控制有参考价值。# 对齐# 大模型# 安全# 自然语言处理# 前沿研究