Emerald AI、Google 与 NVIDIA 联合发起 AI 能源管理联盟(AEMA)
Emerald AI、Google 和 NVIDIA 宣布联合发起 AI 能源管理联盟(AEMA),旨在推动能够根据电网状况动态调节用电的柔性 AI 数据中心建设。
推荐理由:原文介绍了科技巨头联合推动柔性用电数据中心的技术与并网准则,读者可据此了解 AI 算力扩张应对电力瓶颈的协同路径。
Emerald AI、Google 和 NVIDIA 宣布联合发起 AI 能源管理联盟(AEMA),旨在推动能够根据电网状况动态调节用电的柔性 AI 数据中心建设。
推荐理由:原文介绍了科技巨头联合推动柔性用电数据中心的技术与并网准则,读者可据此了解 AI 算力扩张应对电力瓶颈的协同路径。
OpenAI 推出基于 AI 的广告新体验,包含赞助智能体(Sponsored Agents)以及面向营销人员的工具。该体系还提供了与 HubSpot 和 Shopify 的集成支持。
推荐理由:OpenAI 探索赞助智能体与第三方生态集成,读者可以据此了解其商业化广告与营销工具的新形态。
OpenAI 介绍了如何通过 ChatGPT Work 与 Codex 分析功能帮助团队掌握 AI 使用情况与支出成本。该分析工具还能协助企业识别培训需求,并将 AI 应用落地与实际业务成果紧密挂钩。
Hex 借助 GPT-6 Astra 支持其数据智能体将复杂分析结果转化为交互式可视化报告,便于员工进行展示与分享。
企业 AI 的成功不仅取决于硬件与模型,托管工作负载的物理位置以及跨分布式工作负载之间的网络连接同样关键。当企业部署分布式 AI 业务时,底层网络互联与公网路由质量直接影响整体系统性能。
OpenAI 经济研究发布最新成果,揭示了职场人如何突破传统角色使用 AI,以及哪些新兴工作活动正在成为其日常工作的常态化组成部分。
vLLM 正式发布 vllm-proto 0.2.0(Tag 为 proto-v0.2.0)。该版本对应提交 f37c550,已通过 PR #56538 的 CI 验证并包含 2 个发布资产(Assets)。
曼彻斯特大学利用 NVIDIA Earth-2 的 CorrDiff 与 StormCast 模型,构建了分辨率达 2-3 平方公里的全英空气污染预测工作流。该模型在英国超算 Isambard-AI 的单个 8 GPU 节点上仅耗时 2 天完成训练,并支持在搭载 GB10 的 DGX Spark 桌面系统上运行推理。团队计划开源相关训练数据与工作流,以供全球更多地区构建本地化污染预测模型。
苹果研究团队提出面向 Agentic LLM 系统的共享选择性持久记忆架构,通过保留任务规范、数据模式、工具配置和输出约束四类可复用上下文,舍弃容易导致模型性能下降的会话特定推理轨迹。
Glyph 是一个将企业数据目录列描述生成与敏感本体标注建模为协作 LLM 智能体的生产系统。系统利用 Descriptor 检索 GitHub 源码生成描述,并通过 Tagger 并行运行三项策略与 RRF 融合匹配 275 个叶节点的数据分类本体。其微调的 6 层 MiniLM 编码器将检索 NDCG@10 从 0.55 提升至 0.92(MAP@100 从 0.19 升至 0.90)。
研究人员提出 DACA-GRPO,为扩散大语言模型的 GRPO 强化学习训练引入去噪进度评分与分层掩码似然机制,解决时间信用分配缺失及似然估计偏差问题。该方法作为即插即用模块,在数学推理、代码生成、约束满足和 JSON 模式遵循基准上分别实现最高 5.6pp、7.4pp、36.3pp 和 5.9pp 的性能提升。
黄仁勋在 Salesforce Dreamforce 大会上发表演讲,强调 AI 已成为全球基础设施层,同时 Salesforce 宣布推出基于 NVIDIA Nemotron 3 Super 构建的首个 CRM 推理模型 Koa。
推荐理由:黄仁勋在对话中阐明了企业级推理模型与安全工程的边界,有助于理解开源基础模型在垂直领域落地的技术路径。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习与扩散模型编译解决复杂 AI 搜索在查询扇出检索中的推理延迟瓶颈。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款近实时对话模型,主打面向企业与开发者的端到端语音智能体构建。
推荐理由:两款模型展示了近实时语音交互与后台复杂推理并行执行的技术路径,为构建低延迟端到端语音智能体提供了参考基准。
混合专家模型(MoE)通过为每个 token 仅激活子集参数,在保持大模型容量的同时提升计算效率。以 Nemotron 3.5 Lightning 为例,该 30B 参数模型在处理每个 token 时仅激活 3B 参数。文章深入对比了 Dense 与 MoE 两种主流模型架构在激活参数与吞吐量等维度的表现,并提供架构选型参考。
NVIDIA 详细阐述了面向 AI 工厂的 DSX 能效管理架构,涵盖动态电力分配软件 DSX MaxLPS、电网柔性调度 DSX Flex 以及 800V DC 供电设计。
推荐理由:原文给出了 AI 工厂在固定电力预算下的动态调优与电网响应实测数据,读者可以据此评估算力中心的能效瓶颈与扩展方案。
NVIDIA 在 AI Infra Summit 上公布了 Vera Rubin 系统与 DSX 平台的最新能效进展,推动 AI 基础设施评估从峰值性能转向每兆瓦有效 Token 产出。
推荐理由:材料展现了从单卡峰值算力转向每兆瓦可用生成量的指标变化,为评估智算集群的电力与能效经济性提供了参考数据。
NVLink 6 通过多层弹性机制保障 AI 工厂的持续输出,降低大规模训练与推理任务中的非计划停机风险。在超大规模 AI 训练中,集群内所有 GPU 每秒必须在数千次集体通信中同步梯度;在推理阶段,任何意外中断都会直接减少请求处理量并影响收益。
NVIDIA Groq 3 LPX 通过确定性执行,在 NVIDIA Vera Rubin 平台上实现兼顾高能效与高交互性的推理。针对电力成为 AI 工厂核心限制的现状,Vera Rubin 平台旨在有限功耗预算内最大化产出,将每瓦性能而非单纯吞吐量作为衡量 AI 平台价值的关键指标。
ALTK-Evolve 开源框架推出 Consistency Analyzer 与一致性准则功能,用于诊断并修复 AI 智能体在重复执行相同任务时的偶发失败问题。
推荐理由:针对智能体多次运行结果不一致的隐性问题,该工具无需重新跑完全程即可定位脆弱决策点并生成改进规则。
Google 宣布其技术已支持超 300 种语言并覆盖 70 亿人口,同时公布多项加速科学研究的前沿 AI 进展。其开源了预测人类基因组 90 亿种单字母变异影响的 AlphaGenome Atlas,并推出将降水预报准确率提升 50% 的 WeatherNext 3 全球天气模型。
Google 推进多语言 AI 技术,推出支持 70 种语言和 2,000+ 语言对实时翻译的 Gemini 3.5 Live Translate,以及高精度语音转文本模型 Gemini 3.5 Transcribe。为解决网络受限环境下的使用需求,Google 还发布了基于 Gemini 构建的轻量级开源翻译模型家族 TranslateGemma,覆盖 55 种语言并支持端侧离线高效运行。
Google 正与全球研究人员及社区展开合作,推动 AI 技术解决现实世界中的复杂挑战。相关实际应用重点覆盖疾病检测与防治、自然灾害预测、拓展学习途径以及解锁经济机会等关键领域,旨在让 AI 技术突破带来的发展红利惠及更多人。
Google 宣布设立 $10 million 的能源影响基金(EIF),以支持内华达州的能源创新与可负担性。其中 $5 million 将提供给内华达清洁能源基金(NCEF),用于支持其住宅能源升级计划(RE-UP)。该计划为内华达北部和南部数据中心周边的家庭免费提供能效提升与耐候化改造,帮助居民降低电费并增强电网韧性。
NVIDIA FLARE 支持跨 Docker、Kubernetes 和 Slurm 等异构基础设施扩展联邦学习系统。随着联邦学习项目规模扩大,运维重心正从算法运行转向共享基础设施管理。该方案可解决 GPU 资源按需分配、多项研究隔离以及各参与机构保留本地资源控制权等运维挑战。
Google 上线了 AI & Economy ATLAS 交互式开放数据平台,并联合 Google DeepMind 与 MIT FutureTech 发布关于 AI 赋能科研与全球劳动力转型的最新研究。
数字主权已成为众多商业领袖关注的核心议题,但其具体内涵与落地方式因组织和业务需求而异。Equinix 探讨了数字主权在实际业务场景中的具体形态,并通过实践用例展示不同机构如何应对相关挑战。
费城儿童医院(CHOP)利用 MONAI 等 NVIDIA 开源 AI 工具,将儿童心脏 3D 建模时间从 4 小时缩短至数秒,显著提升先天性心脏病手术规划效率。目前全美已有 20 多家儿童医院开展此类建模,CHOP 预计今年将完成约 200 例。团队还在结合 NVIDIA Warp 和 Newton 物理引擎进行近实时器械仿真,并推进基于 Omniverse 的数字孪生工作流。
阶跃星辰正式发布 StepAudio 3 系列语音大模型,涵盖 Realtime、ASR、TTS、Gen 和 Music 五款模型并上线开放平台。
推荐理由:原文给出了五款音频模型在实时交互与全链路生成上的评测表现,读者可以据此了解原生语音模型在复杂任务中的落地能力。
NASA 宇航员 Christina Koch 与 Google 高级副总裁 James Manyika 展开深度对谈,探讨太空探索以及宇航员、机器人与 AI 之间的关键协作。Koch 结合其在国际空间站停留 328 天、首次全女性太空行走以及 NASA 的 Artemis II 绕月任务等经历,深入分享了太空视角与对未来探索者的建议。
NVIDIA Transformer Engine 支持在 JAX 中加速 Dropless MoE 模型的训练。MoE 架构通过条件计算替代传统的单个共享稠密前馈网络(FFN),使 DeepSeek、千问(Qwen)与 Mixtral 等模型能以稠密模型更少比例的训练算力达到或超越其性能表现。
Google 开发者社区(GDG)主办的 DevFest 将于 10 月 1 日至 12 月 31 日举行,计划在 115 个国家开展超 800 场活动并汇聚近百万开发者。
AWS 宣布 OpenAI GPT-6 Astra 模型在 Amazon Bedrock 正式可用,支持最高 100 万输入 token 上下文窗口及高级计算机与浏览器操作能力。
Google 正在探索在新墨西哥州利县(Lea County)建设新数据中心项目,目前相关讨论仍在进行中。Google 表示将及早与当地社区展开沟通,并承诺负责任地管理关键水资源,同时全额支付 100% 的自用能源及所需基础设施费用。
Fyxer 利用 OpenAI 模型、微调、记忆能力以及真实用户反馈构建 AI 高管助理。该助理能够自动整理收件箱,并以符合每位用户个人风格的语气起草电子邮件。
Perplexity 已采用 OpenAI GPT-6 Astra 模型处理撰写沟通内容、修改软件以及监控生产系统等端到端任务。与使用早期模型相比,团队对系统的人工介入检查频率显著降低。
vLLM 发布 v0.29.1rc0 候选版本。该版本主要包含针对投机解码的 Dual-key Gumbel-max 水印(Dual-key gumbel-max watermarking for speculative decoding)相关功能更新。
GPT‑6 Astra 提升了 Devin 测试软件并证明其正常运行的能力。该能力旨在帮助工程师减少代码审查负担,从而更快交付软件成果。
AWS 架构博客介绍了结合 Amazon Chronos2 零样本时序预测模型与 Amazon Bedrock AgentCore 多 Agent 编排的库存自动化架构,实现从需求预测到合规采购订单的全流程闭环。
CNCF 旗舰大会 KubeCon + CloudNativeCon 北美 2026 正式公布日程,将于 2026 年 11 月 9–12 日在盐湖城举行。