KubeCon + CloudNativeCon 北美 2026:盐湖城参会日程指南
CNCF 旗舰大会 KubeCon + CloudNativeCon 北美 2026 正式公布日程,将于 2026 年 11 月 9–12 日在盐湖城举行。
CNCF 旗舰大会 KubeCon + CloudNativeCon 北美 2026 正式公布日程,将于 2026 年 11 月 9–12 日在盐湖城举行。
企业每接入一个新的云平台、AI 提供商或合作伙伴,都意味着需要额外设计、配置和管理一条网络连接。Equinix 指出,更多元化的技术生态选择不应带来更高的网络复杂度,应通过任意互联(Any-to-Any Connectivity)架构简化连接管理。
OpenAI 阐述了其存储平台 Habitat 如何从最初的 Python 库演进为全球分布式存储平台。该架构目前用于支撑 10 亿 ChatGPT 用户,并能处理每秒 2200 万次请求。
推荐理由:原文展示了支撑十亿级用户与千万级并发的底层存储演进路径,具有工程架构参考价值。
vLLM 正式发布 vllm-proto 0.1.0 版本(Git 提交哈希 69db1c2)。该 release 标签已包含提交者的验证签名,并提供了 2 个版本资产文件。
Google Research 提出 ToolGrad 框架,通过文本梯度指导 API 链的迭代构建,采用答案优先范式低成本合成高质量工具调用训练数据。该框架由提议、并行执行、选择和更新四个模块构成,克服了传统基于深度优先搜索探索路径的高成本弊端,在 ToolBench 的 16k+ API 上实现了更高的通过率与更低的数据生成成本。
微软在 2026 年 Gartner 容器管理魔力象限(Magic Quadrant)中获评领导者,并在“愿景完整度”维度处于最右端。其容器产品矩阵涵盖 AKS、Azure Container Apps 和 Azure Arc 等,支持持久化模型服务与 Serverless GPU 按需推理等 AI 架构。
Microsoft Foundry 推出 AI 智能体成本治理方案,通过实时可观测性与链路拦截控制智能体支出并量化 ROI。平台已对 Azure OpenAI 等模型上线项目级成本归因(preview),支持精确追踪单智能体的 token 消耗与成本。配合 AI Gateway,系统可在请求链路中执行每分钟 token 限速(返回 429)与总配额限制(返回 403),防止重试死循环。
NVIDIA 通过全栈 NIM 优化,使 Nemotron 3 Ultra 模型在现有 GPU 基础设施上支持的用户并发量提升至 2.5 倍。该方案在保障应用交互响应速度的同时最大化并发承载能力,重点针对长提示词以及跨步骤复用上下文的 AI 智能体工作负载。
Google 搜索借助 AI 功能为用户备战跑步赛事提供定制训练、音乐与装备推荐支持。用户可在 AI Mode 中通过 Canvas 工具生成个性化跑步训练计划,并联动 YouTube Music 账号定制跑步专属歌单。此外,搜索依托收录超 600 亿商品信息的 Google Shopping Graph,支持按特定预算和需求筛选装备,并提供现货对比与本地库存查询。
César de la Fuente 实验室利用 Codex 和 ChatGPT 在现存及已灭绝物种的基因组中搜索候选抗菌分子。该研究旨在通过发掘新型抗菌分子,对抗耐药性感染。
微软 Azure 阐述了基础设施现代化与弹性构建策略,并推出 Azure Infrastructure Resiliency Manager 以帮助组织在应用层面评估弹性态势与弥补短板。该工具结合 Azure Copilot 中的弹性智能体提供 AI 辅助建议及部署模板生成;此外,针对 Azure Managed Disks 的单盘弹性功能已在部分区域开启公开预览。
OpenAI 在 ChatGPT Work 中推出 Data agent(数据智能体)。该功能支持用户使用自然语言连接企业数据、挖掘业务洞察,并借助 AI 构建交互式仪表盘。
推荐理由:原文介绍了面向企业数据分析的智能体功能,读者可以据此了解 ChatGPT 在连接企业数据与构建交互看板上的落地进展。
NVIDIA BioNeMo Inference Runtime(BioIR)可在保持 PyTorch 工作流的同时,加速 NVIDIA GPU 上支持的生物分子结构预测模型。该运行时针对蛋白质组规模的高吞吐任务设计,通过优化算子并在适用场景下结合 CUDA Graphs 来提升模型运行速度。
Transformers 5.17.0 发布,新增对 780B MoE 模型 Hy4-Preview、多说话人语音框架 VibeVoice 及月之暗面 Kimi Linear 等架构的支持。版本同时集成了 Fun-ASR-Nano、Canary-1B-v2、NeoMME 与 NeuCodec 等模型。此外,更新统一了 2D/3D 视觉 RoPE 模块,并优化了解码步骤中的加速器同步开销。
企业 AI 战略不仅需要决定使用何种模型,更面临将推理负载部署在何处的关键抉择。随着企业级 AI 应用落地,基础设施架构与模型运行位置正成为决定其实施效果的核心问题。
NVIDIA 借助 Nemotron 与 Palantir Foundry 将其复杂供应链的专业知识代码化,并以“从晶圆出厂到首次 Token”衡量全流程性能。该区间划分为两大阶段:Time-to-rack 涵盖从芯片离开晶圆厂到组装系统进入数据中心机房,Time-to-token 则涵盖后续的供电、冷却、网络连接及软件栈部署。
OpenAI 与美国总务管理局(GSA)合作,为符合条件的联邦、州、地方和部落政府提供 0 美元许可费、50% 的用量折扣以及扩展的网络安全防御支持。
OpenAI 推出面向金融服务的 ChatGPT(ChatGPT for Financial Services),结合内置金融数据与 GPT-6 Astra 模型,用于辅助研究、财务建模以及生成面向客户的材料。
推荐理由:原文介绍了 OpenAI 结合特定模型与内置数据推出的行业版工具,读者可以据此了解其在金融研究与建模场景的具体定位。
深度求索正式发布并开源 552B 参数的原生多模态模型 DeepSeek V4.1 Flash。该模型采用 Causal-Encoder-Decoder 非对称 MoE 结构,输入激活 8B、输出激活 16B,大幅减少了 KV Cache 对 HBM 和 SSD 的占用需求。
推荐理由:原文公开了非对称 MoE 架构与大幅压缩 KV Cache 的技术细节,为开发者评估多模态与 Agent 任务落地成本提供了直接参考。
Kimi 正式启动企业合作伙伴计划,与 IT 服务商及系统集成商共建前线部署工程师(FDE)队伍,推动模型能力与 Agent 底座深入客户现场完成生产级交付。首批签约伙伴包括华胜天成、金山云、亚康股份、亚信科技和中软国际,重点应对数据不出域、系统私有化与算力适配等落地难题。Kimi 将提供模型能力、Hosted Agents 运行底座与工程师培训认证,利用一线场景认知反哺模型研发闭环。
推荐理由:原文展现了模型厂商借力传统系统集成商与 FDE 模式切入政企核心业务的路径,读者可借此评估大模型商业落地的交付分工。
OpenAI 推出 Agents API 托管服务,支持开发者构建和运行云端智能体。该服务由 Codex harness 提供支持,主要用于智能体编排、长时间运行会话管理以及工具调用。
推荐理由:原文说明了该托管 API 针对编排与长会话的核心支持,开发者可据此评估构建云端智能体的新基础设施选项。
OpenAI 正式在 API 中推出 GPT-Live-1 模型,为开发者提供自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信集成。
推荐理由:该模型将全双工语音对话接入API并提供电话支持,方便开发者直接构建实时语音交互应用。
Hugging Face 团队基于 Gradio Workflow 画布推出 Workflow1111,通过 73 个节点和 11 条管线重构了 AUTOMATIC1111 的核心功能。
推荐理由:展示了如何用可视化节点图复构复杂生图系统,且每个输出节点均可自动转为 REST 接口与 MCP 工具供智能体调用。
Hugging Face 在 TRL v1.14 中为 AsyncGRPOTrainer 增加了 LoRA 适配器同步支持,使训练节点与 vLLM 推理副本无需跨机 NCCL 即可跨节点独立运行。
推荐理由:原文展示了无需 NCCL 跨机通信的异步 GRPO 架构实现与调优细节,读者可据此排查强化学习训练与推理流水线的吞吐瓶颈。
编码-预填充-解码(EPD)解耦是一种多模态模型推理优化技术,将视觉编码器阶段与预填充和解码阶段分离。该技术在图像密集型提示词、中短长度输出以及量化 MoE 模型场景中最为有效。文章介绍了结合 NVIDIA Dynamo 使用 EPD 解耦的具体时机与方法,最高可实现 5 倍加速。
NVIDIA 发布 CUDA Toolkit 13.4,新增对 Windows on Arm 平台的支持,并增强对共享 GPU 的控制能力。CUDA 应用此前已通过 Linux 长期支持 Arm 架构,本次更新将相关计算能力进一步拓展至 Windows on Arm 平台,持续优化 NVIDIA GPU 的开发与运行体验。
Azure 提出工作负载可用区弹性设计框架,强调不应默认全盘采用三可用区,而应按组件逐一决策。无状态计算与网络组件部署在两个可用区即可满足单区容灾目标,而涉及法定人数(Quorum)、共识选举或高持久性的数据存储才需要三可用区。架构设计应优先采用 Azure 服务托管的可用区冗余,以平衡成本与复杂度。
Paul Christiano 正式加入 OpenAI 基金会董事会及其安全与安保委员会。他将为 OpenAI 带来在 AI 对齐、安全与标准制定方面的专业经验。
推荐理由:原文公布了对齐领域核心学者进入治理层的变动,有助于读者了解机构在安全与对齐监管架构上的调整。
Google DeepMind 与电影制作团队合作推出纪录短片《Love, Rendered》,利用 AI 技术重现了一对结婚超 70 年夫妇未曾被影像记录的初遇记忆。团队结合生成模型修复黑白老照片,并通过动作捕捉模型将老人当下的微表情与神态映射至年轻形象。用户也可在 Gemini 应用中上传老照片进行修复与上色。
Google 搜索推出面向美式橄榄球赛季的新功能,上线包含逐回合赛况更新、视频集锦与 AI 洞察的 Live Game Feed。用户还可将 Yahoo Fantasy 或 Sleeper 账号关联至搜索,通过 AI Mode 获取首发与替补等阵容定制建议。相关功能已在美区移动端英文版上线,赛事流预计本月晚些时候支持大学球队并推向全球。
OpenAI 的 Chris Lehane 指出,更强大的 AI 能力需要更坚实的安全证据与共同标准。他强调在当前的政策窗口期内,各方必须把握机遇并推进持久的政策行动。
OpenAI 推出面向企业工作场景的模型 GPT-6 Astra。该模型具备高级推理与计算机操作能力,并在写作表达与设计判断方面进行了提升。
推荐理由:原文介绍了面向工作场景的核心能力升级,读者可据此了解其在推理和计算机操作上的新定位。
Google 宣布未来两年将在芬兰投资 130 亿欧元用于数字基础设施、清洁能源项目及经济合作,以满足 Search、Maps 和 Gemini 等服务的需求。这是 Google 在欧洲的最大单笔投资,建设期预计每年为芬兰 GDP 贡献 36 亿欧元并支持逾 3.7 万个岗位。配套能源措施包括签署 22 年期协议支持洛维萨核电站延期营运、新增陆上风电以及签约 94MW 电池储能系统。
推荐理由:材料披露了科技巨头在欧洲单笔算力基建投资细节,展现了数据中心扩建与核电长协、储能及余热回收协同的落地路径。
Google 宣布扩大在芬兰的数字基础设施,计划在 Hamina、Kajaani、Muhos 和 Vaala 扩建数据中心并推进清洁能源配套。配套措施包括与 Fortum 达成 Loviisa 核电站延寿 PPA 协议以支持其运营至 2050 年,使签约芬兰陆上风电总规模达到 629 MW。
推荐理由:Google 结合核电延寿 PPA 与储能配套推进芬兰数据中心扩建,为超大规模算力基建与电网协同提供了可参考的消纳路径。
微软 Microsoft Discovery Engine 搭载 CLIO,在基准测试 Agent’s Last Exam 的健康与医学(61.6%)、物理科学(75.2%)和生命科学(64.6%)领域均获得最高分。CLIO 允许自适应探索多条独立推理路径,支持动态调整策略、切换模型及引入专家介入。该平台已面向企业研发组织开放,并曾辅助发现新型有机氧化还原液流电池。
Kubernetes v1.37 正式推进工作负载感知调度,核心 Workload 与 PodGroup API(支持 Gang Scheduling)、工作负载感知抢占及 DRA 资源共享均晋升至 Beta 阶段。
推荐理由:多层级拓扑感知调度与 PodGroup 队列机制原生落地,为大规模分布式 AI 训练与复杂批处理提供了更细粒度的协同编排能力。
MIT 研究人员结合使用 GPT-5.6 Sol 与 Codex,实现了量子计算实验的自主运行。该方案能够自动分析实验结果,并完成量子比特(qubits)的校准工作。
Google DeepMind 正式推出 AlphaGenome Atlas 平台,预计算了人类基因组中全部约 90 亿个单核苷酸变异的分子生物学影响。该数据集规模达 1PB,整合 AlphaGenome 与 AlphaMissense 预测能力生成 AVI 评分,可直接评估编码区与占比 98% 的非编码区变异。
推荐理由:该平台通过预计算人类基因组全量单碱基突变的分子效应,为罕见病致病变异排查和非编码区功能解析提供了开箱即用的参考图谱。
OpenAI 探讨了更强大且实惠的 AI 如何拓展个人与企业能够完成的工作范畴。通过提升模型能力并降低使用门槛,AI 正在让业务与个人发展的增长模式更具经济效益。
NVIDIA 宣布推出 CUDA Rust,正式支持使用 Rust 语言进行原生 GPU 内核编程。继 CUDA C++ 与 CUDA Python 之后,NVIDIA 计划在 2027 年及未来持续完善 CUDA Rust 工具链,以支持推理引擎、服务基建与智能体运行时等 AI 系统层软件的开发。
推荐理由:NVIDIA 将 GPU 内核编程拓展至 Rust 生态,为 AI 系统层与推理基础设施开发提供了新的工具选择。