AI 周报 · 2026 年第 39 周 · 09.21 — 09.27
AIDC热点

旗舰大模型同日发布与智算供电演进
本期(2026-09-21 至 2026-09-27)AI 与算力基础设施迎来关键节点。AI 领域,Anthropic 与 OpenAI 同日推出 Claude Opus 5.5 及 GPT-6 Sol 与 Luna,引爆新一轮模型性能升级与 API 定价竞争;编码智能体、全栈开发工具及多模态生成模型密集迭代,科学 AI 在酶系统发现与逆合成化学领域取得突破。数据中心领域,单机架高功率密度挑战倒逼供电与散热体系重塑,NVIDIA 推出 DSX Ready 认证计划覆盖储能与液冷产品,Google 推进电网互动型供电演进;IDC 数据显示全球加速服务器销售额持续飙升,AMD 披露 2nm 架构下一代服务器 CPU 规划。
旗舰模型密集发布与价格重塑
本版导读Anthropic 与 OpenAI 同日展开正面竞争,分别推出 Claude Opus 5.5 以及 GPT-6 Sol、Luna,大幅下调 API 定价并优化提示词缓存机制,推动前沿智能走向普惠。同时,Google DeepMind 发布 Gemini 3.8 文本转语音及实时虚拟人模型,腾讯推出高性价比的混元图像 3.5 预览版,头部大模型在推理效能与多模态交互上持续分化演进。
Anthropic 发布 Claude Opus 5.5,OpenAI 随后推出 GPT-6 Sol 与 Luna
Anthropic 正式推出 Claude Opus 5.5,约一小时后 OpenAI 也发布了 GPT-6 Sol 与 Luna,两家头部厂商同日打响价格战。
Claude Opus 5.5 与 GPT-6 Sol、Luna 评测及新一轮价格战分析
Anthropic 与 OpenAI 分别推出 Claude Opus 5.5 以及 GPT-6 Sol 和 GPT-6 Luna,新模型价格大幅下调并引发了新一轮 API 定价竞争。
OpenAI 推出 GPT-6 Sol 与 Luna 模型
OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款新模型,将前沿智能引入日常工作。两款模型在能力与成本之间提供了不同的平衡选择。
Claude Code v2.1.280 发布,默认接入 Claude Opus 5.5
Anthropic 发布 Claude Code v2.1.280,将默认 Opus 模型升级为 Claude Opus 5.5,支持 1M 上下文窗口且定价为 $4/$20 每百万 token(缓存读取 $0.20/Mtok)。
GPT-6 优化提示词缓存:提升命中率并降低延迟与成本
OpenAI 介绍了 GPT-6 提示词缓存(prompt caching)的改进机制。该功能通过提高缓存命中率、增加新诊断工具、支持显式断点及控制项,帮助开发者降低模型调用的延迟和成本。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 文本转语音模型
Google DeepMind 正式推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示词定制角色声音并逐行掌控对话演绎。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将实时对话能力与低延迟流式视频生成结合,赋予对话 AI 具备自然口型与表情的动态视觉形象。
混元图像 3.5 预览版发布,腾讯推出高性价比专业级生图模型
腾讯正式发布混元图像 3.5 预览版(Hy Image3.5 preview),定位高性价比专业级生图模型,官方盲测对比 Hy Image3.0 综合能力提升约 30%。
智算基础设施与供电液冷升级
本版导读AI 算力负载持续攀升推动数据中心底层架构变革。NVIDIA 正式推出 DSX Ready 认证计划,首批重点覆盖电池储能系统(BESS)与冷量分配单元(CDU);Google 针对单机架接近 1MW 的密度挑战阐述电网互动型供电方案;IDC 报告显示全球单季 GPU 加速系统销售额突破 870 亿美元。此外,AMD 披露 2nm 制程 EPYC Venice 处理器规划,NVIDIA 强化了多 GPU 推理通信能力。
NVIDIA 推出 DSX Ready 认证计划,涵盖 AI 数据中心供电与液冷散热产品
NVIDIA 正式推出 DSX Ready 认证计划,用于验证符合其 DSX AI 工厂参考设计要求的合作伙伴供电与散热解决方案。该项目首批设立电池储能系统(BESS)与冷量分配单元(CDU)两个类别,首批认证方案来自 Hitachi Energy、LG Energy Solution、Tesla、LG Electronics、LiquidStack 和 Vertiv。
Google 推进电网互动型 AI 数据中心架构与供电演进
Google 在 Data Center World 会议上阐述了其电网互动型 AI 数据中心演进方案,推动数据中心从备用电源用户转向电网稳定性合作伙伴。目前 Google 每月处理超过 3000 万亿 AI token,为应对单机架接近 1MW 的密度挑战,其供电架构正从机柜级 54VDC 向 800VDC 演进,并采用相邻 sidecar 机柜布线以节省空间。
IDC 数据显示全球加速服务器销售额持续飙升
IDC 最新数据显示,2026 年第二季度全球服务器销售额达到 1663.2 亿美元,同比增长 52%,其中 GPU 加速系统销售额达 874 亿美元。
AMD 披露下一代 EPYC 9006 Venice 服务器处理器细节:基于 Zen 6 架构与台积电 2nm 制程
AMD 公布了代号 Venice 的下一代 EPYC 9006 系列服务器 CPU 规划,全系采用 Zen 6 架构与台积电 2nm 制程。Zen 6c 高密度版本最高配备 256 核与 1024MB L3 缓存,高频 Zen 6 版本最高达 96 核与 5.0GHz 频率,顶级型号 TDP 上升至 600W。
NVIDIA Dynamo-Triton 集成 TensorRT 多设备推理以简化多 GPU 模型服务
NVIDIA 推出 TensorRT 多设备推理能力并在 Dynamo-Triton 中完成集成,旨在简化多 GPU 场景下的模型服务。该能力基于 NCCL 分布式通信集合,允许单个 TensorRT 网络跨多张 GPU 执行,同时保留 TensorRT 的推理优化性能,已自 TensorRT 11.0 起获得完整支持。
智能体落地与开发工具链进化
本版导读AI 智能体正加速融入企业级开发与生产力工具。月之暗面发布 Kimi Code Desktop 桌面客户端,Anthropic 升级 Claude Code 默认模型,阶跃星辰 Step 5 Preview 上线 AI 工具 TRAE。与此同时,AWS 推出 CloudWatch Omni 专攻生成式 AI 可观测性,GitHub 推出双向交互 Canvas 技能与全自动模糊测试流水线,助力复杂场景下的人机协同与自动化。
Kimi 发布 Kimi Code Desktop 桌面端,支持 macOS 与 Windows
月之暗面正式推出 Kimi Code Desktop 桌面客户端,同步上线 macOS 与 Windows 版本,将 Kimi Code 编程智能体能力整合至可视化工作区中。
阶跃星辰 Step 5 Preview 正式上线 TRAE
阶跃星辰宣布 Step 5 Preview 正式上线豆包旗下 AI 开发工具 TRAE,用户可在全流程开发工作流中直接调用。该模型覆盖 9 类任务与 33 种编程语言,支持代码库理解、跨文件修改、重构与持续数小时的长程任务推进,官方公布其 DeepSWE 得分为 67.7 分,ProgramBench 通过率为 80.5%。
AWS 推出 Amazon CloudWatch Omni 为生成式 AI 与智能体提供专用可观测性
AWS 正式推出 Amazon CloudWatch Omni,为生成式 AI 和 AI 智能体工作负载提供跨模型与框架的统一可观测、评估及实验方案。该方案提供 VS Code 与 Kiro 原生 IDE 插件以及独立 Web 界面,内置 17 种评估指标,支持分步追踪 LLM 与工具调用、提示词版本对比及自动化回归测试。IDE 插件免费提供且支持纯本地开发,无需 AWS 账号即可开始使用。
Amazon CloudWatch 推出 Omni 协作式 AI 可观测平台
Amazon CloudWatch 正式推出 CloudWatch Omni,为应用程序与 AI 智能体提供基于 OpenTelemetry 的协作式 AI 可观测体验。
GitHub Copilot 教程:如何使用画布构建自定义工作流
GitHub Copilot 现支持通过 /create-canvas 技能利用自然语言描述直接生成双向交互画布,用于搭建看板、Issue 分流板或发布清单等工作流界面。用户与 AI 智能体可以实时共享并修改画布状态,无需手动编写布局代码即可同步更新数据。生成的画布支持保存为扩展在团队内复用,社区也已在 Awesome Copilot 中提供了一系列开箱即用的预设模板。
GitHub Security Lab 开源 AI 模糊测试工具 Fuzzing Taskflow
GitHub Security Lab 推出基于 Taskflow Agent 的自主模糊测试流水线 Fuzzing Taskflow,可全自动完成 C/C++ 项目的代码入口识别、Harness 编写、AFL++ 执行与崩溃分类。该框架将大语言模型的调度决策与 MCP 工具执行解耦,内置覆盖率反馈驱动的用例迭代与结构感知变异机制,并在测试结束后自动生成包含根本原因分析和修复补丁建议的漏洞报告。
Cloudflare 推出 Turnstile Spin:支持通过 AI 编码智能体自动配置网站安全防护
Cloudflare 推出 Turnstile Spin,允许用户通过 Claude Code、Cursor 等 AI 编码智能体端到端自动配置 Turnstile 人机验证。
开源推理加速与科学 AI 突破
本版导读在底层框架方面,vLLM 发布 v0.30.0 引入显存权重缓存以加速引擎启动,Hugging Face 推进 GGUF 原生支持及 tokenizers 吞吐提升,Ollama 在 Apple 平台默认启用 MLX 运行时。科学计算领域成果丰硕,Claude 智能体自主筛选并发现类似 CRISPR 的新型酶系统 ART,微软在《Nature》开源逆合成预测模型 RetroChimera,展现出 Physical AI 与生物计算的深厚潜力。
推理框架 vLLM 发布 v0.30.0 版本
推理框架 vLLM 正式发布 v0.30.0 版本,新增对 DeepSeek-V4.1-Flash、GLM-5.3-Flash 等新架构模型的端到端支持。核心更新引入支持 FP4 与多机 TP 的 Fast Start 显存权重缓存守护进程,大幅缩短引擎重启与初始化耗时;同时上线 HiSparse 分层稀疏 MLA 解码机制,并深度优化了投机解码、上下文并行及 NVFP4 量化性能。
Transformers 原生支持运行 llama.cpp GGUF 量化模型
Hugging Face 在 Transformers 库中新增对 GGUF 量化格式的原生高效推理支持,用户可通过标准 from_pretrained API 直接加载 Hub 上的 GGUF 模型并在本地运行。
Hugging Face 发布 tokenizers v1 候选版,编码吞吐提速 3 至 30 倍
Hugging Face 推出分词库 tokenizers v1 发布候选版,在保持输出 token ID、词表与 API 完全兼容的前提下,单线程编码速度相比 v0.23 提升 3 至 30 倍。
Claude 自主发现类似 CRISPR 重复序列的新型酶系统 ART
Anthropic 生命科学团队宣布,Claude 智能体在噬菌体基因数据中自主发现了一种具有类似 CRISPR 重复序列的新型酶系统 ART。约 950 个 Claude 智能体在 21 小时内消耗 2.1 亿 token 筛选了超过 20 万个逆转录酶序列,最终锁定了包含逆转录酶、辅助蛋白和重复序列特征的新系统。团队已通过湿实验验证该序列可表达为多条短 RNA,并公开发布了相关预印本。
微软开源逆合成预测模型 RetroChimera 并在 Nature 发表
微软研究院在《Nature》发表并开源了逆合成预测模型 RetroChimera 的代码与权重,用于自动生成高质量的小分子化学合成路径。该框架结合了基于 Transformer 的生成模型 R-SMILES 2 与基于图神经网络的模板模型 NeuralLoc,并通过学习重排序机制聚合两者的互补优势。
NVIDIA 联合 Google DeepMind 等开源 2800 多种病毒的蛋白质复合物 3D 结构数据集
NVIDIA 联合 Google DeepMind 及 EMBL-EBI 等机构,通过 AlphaFold Database 公开发布了超过 2800 种病毒的蛋白质复合物预测 3D 结构数据集。
Ollama v0.40.0 发布:Apple Silicon 设备默认采用 MLX 运行时
Ollama 发布 v0.40.0 预发布版本,在 Apple Silicon 设备上默认通过 MLX 运行时加载并运行受支持的模型架构。团队在预发布期间将持续测试并启用更多模型架构,支持通过标准命令拉取和运行 Qwen3.8 等模型。