铠侠展示XL1 CXL内存扩展设备,搭载第二代XL-FLASH闪存
铠侠(Kioxia)展示了其最新推出的XL1内存扩展设备。该设备搭载第二代XL-FLASH NAND闪存技术,通过CXL高速互连接口与系统相连,可作为512GB的系统内存扩展设备使用。该技术旨在为需要高带宽、低延迟和高密度内存层级的数据中心及服务器计算平台提供新型分层存储解决方案。
铠侠(Kioxia)展示了其最新推出的XL1内存扩展设备。该设备搭载第二代XL-FLASH NAND闪存技术,通过CXL高速互连接口与系统相连,可作为512GB的系统内存扩展设备使用。该技术旨在为需要高带宽、低延迟和高密度内存层级的数据中心及服务器计算平台提供新型分层存储解决方案。
在2026华为全联接大会上,神州鲲泰正式推出基于鲲鹏与昇腾950技术路线的新一代算力产品矩阵。首批新品包括基于鲲鹏950的KunTai R722 K3均衡型服务器,以及搭载昇腾950DT的KunTai A989 I5标准服务器、KunTai A989 I5风冷超节点和KunTai PoD2000 A5液冷超节点,涵盖通用计算与AI智算集群方案,推动国产算力底座进入系统级竞争阶段。
AWS 宣布正式推出全新的低成本突发型 Amazon EC2 T8i 实例。该实例搭载专供 AWS 的定制第六代英特尔至强可扩展处理器(代号 Granite Rapids)。作为 AWS 成本最低的 EC2 实例类型之一,T8i 实例相比上一代 T3 实例实现了最高达 30% 的性价比提升,适用于微服务、低流量网站及开发测试等轻量突发型工作负载。
在华为全联接大会2026上,华为副董事长、轮值董事长汪涛发表主题演讲,正式发布全球首个采用近封装光学(NPO)技术的超节点——昇腾960超节点。该超节点旨在突破互联瓶颈,大幅提升集群算力效率,为十万亿参数规模的超大模型训练与推理任务提供强大的算力基础设施支持,加速智能世界的底座构建。
在数据中心运营中,被遗弃的作业、实例和存储卷等“僵尸负载”往往会无限期闲置运行,严重消耗电力并削弱整体运营效率。尽管现有的FinOps(云财务管理)工具能够提供一定支持,但在GPU时代的大规模AI工作负载下,传统的资源监测方式已难以满足需求,行业亟需开发全新的清理与管控方法以优化算力资源利用。
量子技术公司Infleqtion与英伟达(NVIDIA)展开合作,成功降低了量子计算中的物理量子比特与逻辑量子比特比率。该进展旨在优化量子纠错机制,减少实现容错量子计算所需的物理硬件开销。由于提供的新闻素材信息有限,具体的技术方案、压缩比例及后续商用规划等细节有待进一步公开披露。
英伟达下一代 Vera Rubin NVL72 系统在 MLPerf Inference v6.1 基准测试中正式亮相并取得领先成绩。测试强调了系统性能、基础设施高效扩展与持续软件优化对 AI 推理经济性的决定性影响:高系统性能可提升 Token 生成效率与商业收益,高效扩展能确保硬件吞吐量成比例增长并降低资源开销,持续优化则可最大化基础设施的投资回报价值。
该文章聚焦于高性能计算与算力系统中所面临的“内存墙”(Memory Wall)瓶颈挑战,探讨如何通过新型架构与技术方案突破计算核心与内存传输之间的带宽与延迟限制。由于原始输入仅提供标题、缺乏详细正文内容,具体的硬件架构创新、互连技术或算法优化等突破路径尚有待进一步信息披露。
随着人工智能的爆发式增长,AI算力基础设施正逐步演变为材料科学的挑战。底层硬件材料的重要性已不亚于运行其上的算法。当前,半导体和数据中心在计算性能、热管理、电气效率和运行可靠性等方面正不断逼近物理极限,这对能够在极端条件下维持高性能的新型先进材料提出了迫切需求。
英伟达阐述了下一代互联技术 NVLink 6 如何为超大规模“AI 工厂”提供多层弹性与高可用保障。对于大规模 AI 训练而言,保障集群持续稳定运行是提升算力生产力的关键。NVLink 6 通过针对性设计的多层韧性机制,在庞大 GPU 集群互联中降低软硬件故障引发的训练中断风险,确保超大规模并行计算的高吞吐与业务连续性。
文章介绍了针对Kimi-K3模型构建高效DSpark训练系统的技术实践。通过结合投机采样技术(Speculators)与Mooncake分布式架构,团队在GB300 NVL72算力集群上成功实现了多节点DSpark的高效扩展与训练,大幅提升了大模型训练中的吞吐表现与集群算力利用效率。
Novita AI 与 vLLM 社区合作开源了高性能 W4A16 MoE CUDA 算子 Chord。该算子专为 Kimi K2.x 等混合专家模型的推理服务架构优化,支持与 Humming 兼容的索引路径及 SM90 分组。基准测试显示,Chord 在英伟达 H200 芯片上可实现最高 1.3 倍的加速,在未调优的 B300 芯片上加速比达 2.15 倍,显著优化了 MoE 架构的推理性能。
vime与RL-Kernel在AMD Instinct MI300X及ROCm软件栈上,实现了Megatron训练端与vLLM推理端(Rollout)选定Token对数概率的按位(bit-for-bit)完全一致。该技术解决了大模型强化学习微调过程中,因训练与采样引擎底层算子实现差异导致的数值偏差痛点,达成测试零误差,大幅提升了AMD算力生态在RLHF等强化学习工作流中的稳定性和可用性。