跳到正文
9月11日周五
  1. Google Research51

    Google Research 提出 ToolGrad:利用文本梯度高效合成工具调用数据集

    Google Research 提出 ToolGrad 框架,通过文本梯度指导 API 链的迭代构建,采用答案优先范式低成本合成高质量工具调用训练数据。该框架由提议、并行执行、选择和更新四个模块构成,克服了传统基于深度优先搜索探索路径的高成本弊端,在 ToolBench 的 16k+ API 上实现了更高的通过率与更低的数据生成成本。

  2. Azure Blog · 云基础设施39

    智能体优化经济学:AI 智能体治理如何控制成本并证明 ROI

    Microsoft Foundry 推出 AI 智能体成本治理方案,通过实时可观测性与链路拦截控制智能体支出并量化 ROI。平台已对 Azure OpenAI 等模型上线项目级成本归因(preview),支持精确追踪单智能体的 token 消耗与成本。配合 AI Gateway,系统可在请求链路中执行每分钟 token 限速(返回 429)与总配额限制(返回 403),防止重试死循环。

  3. Google AI28

    用 Google 搜索备战大型跑步赛事的 3 种方式

    Google 搜索借助 AI 功能为用户备战跑步赛事提供定制训练、音乐与装备推荐支持。用户可在 AI Mode 中通过 Canvas 工具生成个性化跑步训练计划,并联动 YouTube Music 账号定制跑步专属歌单。此外,搜索依托收录超 600 亿商品信息的 Google Shopping Graph,支持按特定预算和需求筛选装备,并提供现货对比与本地库存查询。

  4. Azure Blog · 云基础设施35

    Azure 基础设施弹性的未来始于现代化

    微软 Azure 阐述了基础设施现代化与弹性构建策略,并推出 Azure Infrastructure Resiliency Manager 以帮助组织在应用层面评估弹性态势与弥补短板。该工具结合 Azure Copilot 中的弹性智能体提供 AI 辅助建议及部署模板生成;此外,针对 Azure Managed Disks 的单盘弹性功能已在部分区域开启公开预览。

9月10日周四
  1. OpenAI 官方动态68

    OpenAI 在 ChatGPT Work 中推出 Data agent

    OpenAI 在 ChatGPT Work 中推出 Data agent(数据智能体)。该功能支持用户使用自然语言连接企业数据、挖掘业务洞察,并借助 AI 构建交互式仪表盘。

    推荐理由:原文介绍了面向企业数据分析的智能体功能,读者可以据此了解 ChatGPT 在连接企业数据与构建交互看板上的落地进展。

  2. Transformers 更新49

    Transformers 5.17.0 发布

    Transformers 5.17.0 发布,新增对 780B MoE 模型 Hy4-Preview、多说话人语音框架 VibeVoice 及月之暗面 Kimi Linear 等架构的支持。版本同时集成了 Fun-ASR-Nano、Canary-1B-v2、NeoMME 与 NeuCodec 等模型。此外,更新统一了 2D/3D 视觉 RoPE 模块,并优化了解码步骤中的加速器同步开销。

  3. NVIDIA Developer Blog35

    从晶圆出厂到首次 Token:借助 Nemotron 与 Palantir Foundry 将供应链经验代码化

    NVIDIA 借助 Nemotron 与 Palantir Foundry 将其复杂供应链的专业知识代码化,并以“从晶圆出厂到首次 Token”衡量全流程性能。该区间划分为两大阶段:Time-to-rack 涵盖从芯片离开晶圆厂到组装系统进入数据中心机房,Time-to-token 则涵盖后续的供电、冷却、网络连接及软件栈部署。

  4. OpenAI 官方动态64

    OpenAI 推出面向金融服务的 ChatGPT

    OpenAI 推出面向金融服务的 ChatGPT(ChatGPT for Financial Services),结合内置金融数据与 GPT-6 Astra 模型,用于辅助研究、财务建模以及生成面向客户的材料。

    推荐理由:原文介绍了 OpenAI 结合特定模型与内置数据推出的行业版工具,读者可以据此了解其在金融研究与建模场景的具体定位。

  5. DeepSeek 公众号89

    DeepSeek 正式发布 V4.1 Flash 原生多模态模型并开源

    深度求索正式发布并开源 552B 参数的原生多模态模型 DeepSeek V4.1 Flash。该模型采用 Causal-Encoder-Decoder 非对称 MoE 结构,输入激活 8B、输出激活 16B,大幅减少了 KV Cache 对 HBM 和 SSD 的占用需求。

    推荐理由:原文公开了非对称 MoE 架构与大幅压缩 KV Cache 的技术细节,为开发者评估多模态与 Agent 任务落地成本提供了直接参考。

  6. 月之暗面 Kimi 公众号64

    Kimi 启动企业合作伙伴计划,联合集成商共建 FDE 推进企业级落地

    Kimi 正式启动企业合作伙伴计划,与 IT 服务商及系统集成商共建前线部署工程师(FDE)队伍,推动模型能力与 Agent 底座深入客户现场完成生产级交付。首批签约伙伴包括华胜天成、金山云、亚康股份、亚信科技和中软国际,重点应对数据不出域、系统私有化与算力适配等落地难题。Kimi 将提供模型能力、Hosted Agents 运行底座与工程师培训认证,利用一线场景认知反哺模型研发闭环。

    推荐理由:原文展现了模型厂商借力传统系统集成商与 FDE 模式切入政企核心业务的路径,读者可借此评估大模型商业落地的交付分工。

  7. OpenAI 官方动态69

    OpenAI 推出 Agents API

    OpenAI 推出 Agents API 托管服务,支持开发者构建和运行云端智能体。该服务由 Codex harness 提供支持,主要用于智能体编排、长时间运行会话管理以及工具调用。

    推荐理由:原文说明了该托管 API 针对编排与长会话的核心支持,开发者可据此评估构建云端智能体的新基础设施选项。

  8. OpenAI 官方动态78

    OpenAI 在 API 中上线 GPT-Live-1 语音模型

    OpenAI 正式在 API 中推出 GPT-Live-1 模型,为开发者提供自然的全双工语音对话能力。该模型具备更强的指令遵循能力,并支持自定义声音和电话通信集成。

    推荐理由:该模型将全双工语音对话接入API并提供电话支持,方便开发者直接构建实时语音交互应用。

  9. Hugging Face70

    Hugging Face 展示基于 Storage Bucket 与代理的跨节点 LoRA 异步 GRPO 训练实践

    Hugging Face 在 TRL v1.14 中为 AsyncGRPOTrainer 增加了 LoRA 适配器同步支持,使训练节点与 vLLM 推理副本无需跨机 NCCL 即可跨节点独立运行。

    推荐理由:原文展示了无需 NCCL 跨机通信的异步 GRPO 架构实现与调优细节,读者可据此排查强化学习训练与推理流水线的吞吐瓶颈。

  10. NVIDIA Developer Blog55

    何时使用编码-预填充-解码解耦(EPD)加速多模态模型服务

    编码-预填充-解码(EPD)解耦是一种多模态模型推理优化技术,将视觉编码器阶段与预填充和解码阶段分离。该技术在图像密集型提示词、中短长度输出以及量化 MoE 模型场景中最为有效。文章介绍了结合 NVIDIA Dynamo 使用 EPD 解耦的具体时机与方法,最高可实现 5 倍加速。

  11. Azure Blog · 云基础设施47

    双可用区还是三可用区?Azure 工作负载可用区弹性设计框架

    Azure 提出工作负载可用区弹性设计框架,强调不应默认全盘采用三可用区,而应按组件逐一决策。无状态计算与网络组件部署在两个可用区即可满足单区容灾目标,而涉及法定人数(Quorum)、共识选举或高持久性的数据存储才需要三可用区。架构设计应优先采用 Azure 服务托管的可用区冗余,以平衡成本与复杂度。

  12. Google AI48

    Google DeepMind 借助 AI 逐帧重现 70 年爱情故事

    Google DeepMind 与电影制作团队合作推出纪录短片《Love, Rendered》,利用 AI 技术重现了一对结婚超 70 年夫妇未曾被影像记录的初遇记忆。团队结合生成模型修复黑白老照片,并通过动作捕捉模型将老人当下的微表情与神态映射至年轻形象。用户也可在 Gemini 应用中上传老照片进行修复与上色。

  13. Google AI38

    Google 搜索推出美式橄榄球新功能,上线实时赛事流并支持 AI 联动 Fantasy 阵容

    Google 搜索推出面向美式橄榄球赛季的新功能,上线包含逐回合赛况更新、视频集锦与 AI 洞察的 Live Game Feed。用户还可将 Yahoo Fantasy 或 Sleeper 账号关联至搜索,通过 AI Mode 获取首发与替补等阵容定制建议。相关功能已在美区移动端英文版上线,赛事流预计本月晚些时候支持大学球队并推向全球。

9月9日周三
  1. Google Infrastructure77

    Google 宣布在芬兰投资 130 亿欧元扩建 AI 算力与能源基础设施

    Google 宣布未来两年将在芬兰投资 130 亿欧元用于数字基础设施、清洁能源项目及经济合作,以满足 Search、Maps 和 Gemini 等服务的需求。这是 Google 在欧洲的最大单笔投资,建设期预计每年为芬兰 GDP 贡献 36 亿欧元并支持逾 3.7 万个岗位。配套能源措施包括签署 22 年期协议支持洛维萨核电站延期营运、新增陆上风电以及签约 94MW 电池储能系统。

    推荐理由:材料披露了科技巨头在欧洲单笔算力基建投资细节,展现了数据中心扩建与核电长协、储能及余热回收协同的落地路径。

  2. Google Infrastructure67

    Google 宣布在芬兰扩建数据中心并发布清洁能源发展蓝图

    Google 宣布扩大在芬兰的数字基础设施,计划在 Hamina、Kajaani、Muhos 和 Vaala 扩建数据中心并推进清洁能源配套。配套措施包括与 Fortum 达成 Loviisa 核电站延寿 PPA 协议以支持其运营至 2050 年,使签约芬兰陆上风电总规模达到 629 MW。

    推荐理由:Google 结合核电延寿 PPA 与储能配套推进芬兰数据中心扩建,为超大规模算力基建与电网协同提供了可参考的消纳路径。

  3. Azure Blog · 云基础设施49

    超越基准:微软自适应方法如何推动科学发现

    微软 Microsoft Discovery Engine 搭载 CLIO,在基准测试 Agent’s Last Exam 的健康与医学(61.6%)、物理科学(75.2%)和生命科学(64.6%)领域均获得最高分。CLIO 允许自适应探索多条独立推理路径,支持动态调整策略、切换模型及引入专家介入。该平台已面向企业研发组织开放,并曾辅助发现新型有机氧化还原液流电池。

  4. Kubernetes Blog70

    Kubernetes v1.37 推进工作负载感知调度:Gang Scheduling 升至 Beta 并引入多层级调度 API

    Kubernetes v1.37 正式推进工作负载感知调度,核心 Workload 与 PodGroup API(支持 Gang Scheduling)、工作负载感知抢占及 DRA 资源共享均晋升至 Beta 阶段。

    推荐理由:多层级拓扑感知调度与 PodGroup 队列机制原生落地,为大规模分布式 AI 训练与复杂批处理提供了更细粒度的协同编排能力。

9月8日周二
  1. Google DeepMind85

    Google DeepMind 推出全基因组突变预测图谱 AlphaGenome Atlas

    Google DeepMind 正式推出 AlphaGenome Atlas 平台,预计算了人类基因组中全部约 90 亿个单核苷酸变异的分子生物学影响。该数据集规模达 1PB,整合 AlphaGenome 与 AlphaMissense 预测能力生成 AVI 评分,可直接评估编码区与占比 98% 的非编码区变异。

    推荐理由:该平台通过预计算人类基因组全量单碱基突变的分子效应,为罕见病致病变异排查和非编码区功能解析提供了开箱即用的参考图谱。

  2. NVIDIA Developer Blog61

    NVIDIA 推出 CUDA Rust:提供两条路径编写 GPU 内核

    NVIDIA 宣布推出 CUDA Rust,正式支持使用 Rust 语言进行原生 GPU 内核编程。继 CUDA C++ 与 CUDA Python 之后,NVIDIA 计划在 2027 年及未来持续完善 CUDA Rust 工具链,以支持推理引擎、服务基建与智能体运行时等 AI 系统层软件的开发。

    推荐理由:NVIDIA 将 GPU 内核编程拓展至 Rust 生态,为 AI 系统层与推理基础设施开发提供了新的工具选择。