AIDC
DC AI 热点

全部 AI 动态

全部语言仅中文13 条动态
来源筛选
全部来源AITNT · AI头条(网页)Buzzing HN · 中文精选C114 通信网 · AI与算力(网页)DeepSeek 公众号IDC 圈·云与算力(网页)IT168 服务器存储 · AI与算力(网页)IT之家 · AI 筛选InfoQ · 架构与云计算Solidot · AI 筛选少数派 · AI 筛选智谱 公众号月之暗面 Kimi 公众号爱范儿 · AI 筛选腾讯混元 公众号通义实验室 公众号量子位阮一峰 · AI 筛选阶跃 StepFun 公众号AI Roundup · X AI coding圈日报AWS ArchitectureAWS HPCAWS News · 云基础设施AWS 机器学习Anthropic News(RSS)Apple Machine Learning ResearchArs Technica · AI 筛选Azure Blog · 云基础设施CNCF BlogCerebras 官方博客(网页)Claude Code 更新Claude 官方博客(网页)Cloudflare Blog · 网络基础设施Data Center DynamicsData Center KnowledgeEngineering at MetaEquinix Blog · 互联基础设施Gary MarcusGitHub Blog · AI 与安全Google AIGoogle DeepMindGoogle Developers · AI 筛选Google InfrastructureGoogle ResearchHacker News · AIHugging FaceKubernetes BlogLangChain 官方博客(网页)Last Week in AILlamaIndex 官方博客(网页)MIT News · AIMIT Technology Review AIMicrosoft ResearchNVIDIA Developer BlogNVIDIA · AI 筛选Ollama 更新OpenAI 官方动态OpenStack BlogSebastian RaschkaSemiAnalysis · 算力产业ServeTheHomeSimon WillisonTechCrunch AIThe Batch · DeepLearning.AIThe DecoderThe Next PlatformThe Verge · AI 筛选Transformers 更新Transluce 研究(网页)Vertiv 官方新闻arXiv 人工智能arXiv 机器学习arXiv 自然语言处理vLLM 官方博客(网页)vLLM 更新施耐德电气博客
9月29日2026-09-29
AITNT · AI头条(网页)AI 评分 70/10011:17

香港大学提出SceneMosaic:单图快速生成可仿真多样化3D场景

香港大学戴勃团队推出 3D 场景生成方法 SceneMosaic。该方法采用混合智能体布局演化机制,仅凭单张图像即可快速构建符合物理规律且具备多样化布局的仿真就绪 3D 室内场景。相较于现有的 SceneSmith,SceneMosaic 将生成速度提升了 24 倍,生成单个场景变体仅需约 0.03 小时,显著降低了具身智能高保真仿真环境的构建门槛与耗时。

阅读原文 ↗推荐理由:单图生成高质量可仿真3D场景是具身智能环境构建的重要方向,提速24倍具备较好的工程实用价值。# 计算机视觉# 具身智能# 智能体# 前沿研究
AITNT · AI头条(网页)AI 评分 76/10011:14

上海AI Lab开源多模态决策模型Intern-Decision,推理速度提升2-3倍

上海人工智能实验室正式开源多模态决策模型Intern-Decision,提供0.8B、2B和4B三个尺寸版本。该模型采用自回归式掩码语言任务框架,相比基准模型Jev推理速度提升2至3倍,并拿下多模态决策SOTA。模型重点提升了将视觉感知理解转化为结构化动作决策的能力,适用于游戏AI决策、图形验证码识别及GUI网页自动化操作等应用场景。

阅读原文 ↗推荐理由:上海AI实验室开源的多模态轻量决策模型,在GUI和游戏操作等具身/智能体决策场景具备速度与性能优势。# 开源# 多模态# 智能体# 推理# 计算机视觉
AITNT · AI头条(网页)AI 评分 62/10011:10

华为联合华科团队利用大模型算法设计平台斩获国际SAT大赛冠军

华为诺亚方舟实验室、华为云天筹AI求解器团队与华中科技大学John Hopcroft计算中心组成的联合团队,依托华为云天筹决策智能引擎和LLM4AD_Next算法设计平台,在国际SAT竞赛并行AI赛道SAT组夺得冠军。该成果展示了大模型在自动化算法设计与复杂组合优化求解领域的落地潜力。

阅读原文 ↗推荐理由:展示了大模型在启发式算法自动化设计与组合优化求解中的实用进展,属于有参考价值的技术竞赛成果。# 华为# 大模型# 前沿研究# 推理
9月28日2026-09-28
AITNT · AI头条(网页)AI 评分 76/10016:23

模型被曝利用「空白Token」隐式思考,推理跃升同时冲击思维链监控

Redwood Research最新研究发现,模型(测试代号GPT-6 Astra)能将题目后的空白Token作为隐式计算与思考载体。在四跳推理测试中其准确率从约10%暴增至50%,旧AIME数学题表现从约60%升至约90%。这种无需展开人类可读文本即可隐式完成复杂推理的机制,对当前依赖思维链(CoT)监控和可解释性对齐的安全防御范式构成了严峻挑战。

阅读原文 ↗推荐理由:揭示了无语义Token作为隐式推理空间的新现象,直接挑战了基于可读思维链的AI对齐与监控有效性。另有 1 家信源报道# 推理# 大模型# 安全# 对齐# 可解释性
AITNT · AI头条(网页)AI 评分 68/10016:22

分析称DeepSeek mHC多流残差架构在深层存在坍塌现象

一项针对DeepSeek-V4-Flash模型中mHC(多流残差)结构的机制分析显示,原本设计的四条残差流在实际读写权重中主要集中于其中约两条流。此外,在第22至42层等深层网络中,残差混合矩阵已退化并接近单位矩阵。该观察表明,模型在充分训练后对动态多流混合机制的实际依赖程度较为有限,部分残差通道可能存在冗余或功能退化。

阅读原文 ↗推荐理由:对前沿模型新型残差连接机制的逆向与可解释性分析,为大模型架构设计提供了务实的消融与反思视角。# DeepSeek# 大模型# 可解释性
AITNT · AI头条(网页)AI 评分 68/10016:20

国科大提出智能体能力周期表:涵盖从零到无限智能的243种构型

中国科学院大学研究团队在《数据科学年鉴》发表论文,提出了“智能体能力周期表”。该研究将智能体抽象为控制、生成、记忆、输入、输出五大核心能力,每种能力细分为三个层级,构建出包含243种构型的系统化分类体系。研究指出,人类与细菌同处122号构型,当前最强的大模型智能体仅在控制维度上低一个层级(位列41号),并基于该体系对经典物理、相对论与量子力学中的观察者角色差异进行了全新阐释。

阅读原文 ↗推荐理由:提出了一种系统化划分智能体演进构型的理论框架,视角新颖,对理解AI与生物智能的演进差异具有启发意义。# 智能体# 大模型# 前沿研究
9月25日2026-09-25
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

Rufus-Air:基于GLM-4.5-Air的开源大模型后训练完整方案

该研究提出了开源且可复现的大模型后训练方案Rufus-Air,基于GLM-4.5-Air-Base模型构建。该方案包含八个串行阶段:SFT、推理强化学习、代码强化学习、指令遵循强化学习、通用智能体、代码智能体、搜索智能体及RLHF。能力训练从基础逐步演进至高级,奖励信号从可验证的硬规则过渡到软性评判。全流程依托开源组件与公开数据,无需新增人工标注,并公开了完整的复现细节与基建配置。

阅读原文 ↗推荐理由:开源了包含八个阶段的大语言模型后训练完整工作流与奖励设计,对模型后训练实践具有较高参考价值。另有 1 家信源报道# 大模型# 后训练# 强化学习# GLM# 开源
AITNT · AI头条(网页)✦ 精选AI 评分 75/10010:14

科大讯飞发布全国产算力训练语音识别大模型Spark-ASR-2.0

科大讯飞推出基于全国产算力训练的语音识别大模型Spark-ASR-2.0,该模型依托语音基座大模型Spark-Audio-1.0-Preview构建。新版本在方言免切换识别、嘈杂环境应对、上下文纠错以及口语书面化规范等方面实现显著提升,同时整体推理成本较上一代仅增加10%。目前,该模型已落地讯飞输入法,并通过讯飞开放平台对外提供API服务。

阅读原文 ↗推荐理由:科大讯飞基于全国产算力推出新一代语音识别大模型,在上下文理解与低成本推理上实现重要升级并已开放落地。# 科大讯飞# 语音# 算力# 大模型
AITNT · AI头条(网页)✦ 精选AI 评分 75/10010:13

盘点梁文锋署名技术论文:聚焦底层架构与核心算子创新

该文梳理了梁文锋在学术论文中的署名脉络。过去三年中,梁文锋极少作为第一作者或通讯作者出现在动辄上百人署名的旗舰模型整体报告中,而是将研究精力与署名重点投向最底层的原子技术,包括MLA注意力机制、MoE路由机制、mHC拓扑流形、DSpark推理算子以及DSec智能体沙盒等关键底层技术论文,展现了其对AI基础架构研发的深耕。

阅读原文 ↗推荐理由:梳理了梁文锋在MLA、MoE路由等关键底层模型架构与算子上的核心技术论文贡献。# 模型架构# MLA# MoE# 芯片
AITNT · AI头条(网页)✦ 精选AI 评分 78/10010:11

GLM-5.3-Flash融合Kimi与DeepSeek注意力架构,大模型设计走向混合组合

GLM-5.3-Flash在同一模型架构中融合了Kimi的KDA线性注意力与DeepSeek的KPool-DSA稀疏注意力机制。这一架构创新表明,大模型底层Attention机制正经历演进,从以往不同机构各自独立押注的竞争性技术路线,转变为可在单一模型内按需分工、协同组合的模块化设计选项,为长文本处理与高效推理提供了新的工程实践范式。

阅读原文 ↗推荐理由:体现了大模型底层注意力机制从单一路线竞争向异构融合设计演进的重要技术趋势。# GLM# DeepSeek# Kimi# 注意力机制# 模型架构
9月24日2026-09-24
AITNT · AI头条(网页)✦ 精选AI 评分 60/10013:57

两周一次迭代且千元起步,有初创团队致力于降低大模型后训练门槛

近期后训练已成为大模型领域备受瞩目的核心议题。有企业推出低门槛的后训练服务,旨在通过两周一次的高频迭代节奏以及1000美元起的亲民价格,推动后训练技术向更广泛的开发者普及,实现“人人可用”。由于当前所获素材信息较为有限,关于该公司的具体技术路线、优化机制以及完整商业服务形态等细节,仍有待进一步披露。

阅读原文 ↗推荐理由:反映了大模型后训练技术正朝着低成本、高频迭代与平民化方向发展的趋势。# 大模型# 后训练# 微调# 模型服务# 技术普及
AITNT · AI头条(网页)✦ 精选AI 评分 68/10013:22

沐晨科技布局AI长程任务学习与数据基础设施

在外滩大会上,北京大学关于“长程任务学习”的合作研究引发关注,探讨AI从单次问答迈向长周期复杂任务时,模型如何通过持续交互实现进化积累。沐晨科技作为合作方参与其中,依托训练数据与科研验证能力,押注并构建面向复杂交互场景的AI新型基础设施,助力前沿模型演进。

阅读原文 ↗推荐理由:聚焦AI由简单问答转向长程复杂任务进化的前沿研究与数据基础设施支撑。# 沐晨科技# 长程任务学习# 训练数据# 模型演进# 前沿科研
AITNT · AI头条(网页)✦ 精选AI 评分 78/10013:21

从三维视觉到世界模型:空间智能成为 AI 走向物理世界的核心路径

该内容围绕相关前沿学术动态展开复盘,探讨从三维视觉向世界模型演进的技术主线。文章指出,当前人工智能的发展正从单纯理解平面画面的感知阶段,迈向能够理解三维空间、预测环境动态变化并执行动作的认知与行动阶段,空间智能因而成为 AI 融入物理世界的关键枢纽。由于现有素材信息较为精炼,更多会议复盘的具体模型细节与前沿论文分析仍有待进一步展开。

阅读原文 ↗推荐理由:梳理了从三维视觉到世界模型的技术演进,直击空间智能与物理世界交互的核心趋势。# 空间智能# 世界模型# 三维视觉# 计算机视觉# 具身智能