Grab 与 OpenAI 合作将实用 AI 技能引入东南亚
OpenAI 与 Grab 联合推出“GO Forward with AI”区域项目。该项目旨在帮助东南亚地区的 30,000 名合作伙伴建立实用的 AI 技能。
OpenAI 与 Grab 联合推出“GO Forward with AI”区域项目。该项目旨在帮助东南亚地区的 30,000 名合作伙伴建立实用的 AI 技能。
Anthropic 与 OpenAI 分别推出 Claude Opus 5.5 以及 GPT-6 Sol 和 GPT-6 Luna,新模型价格大幅下调并引发了新一轮 API 定价竞争。
推荐理由:原文对比了新一代模型的价格梯度与实测表现,读者可以据此评估不同推理级别在应用开发中的成本与限制。
针对近日引发关注的 Meta 新 AI 智能体 Muse,Gary Marcus 指出其预订餐厅与门票等目标与 2015 年夭折的 Facebook Project M 高度相似。Project M 当年仅面向约 10,000 名用户且严重依赖人工,仅有不超过 30% 的请求由 AI 处理,最终于 2018 年 1 月关停。作者认为 Meta 正在重蹈覆辙,并再次面临隐私质疑。
Amazon CloudWatch 正式推出 CloudWatch Omni,为应用程序与 AI 智能体提供基于 OpenTelemetry 的协作式 AI 可观测体验。
推荐理由:原文介绍了以应用为中心的协作排障方案,展示了集成智能体与自动化拓扑发现的完整运维工作流。
AWS 正式推出 Amazon CloudWatch Omni,为生成式 AI 和 AI 智能体工作负载提供跨模型与框架的统一可观测、评估及实验方案。该方案提供 VS Code 与 Kiro 原生 IDE 插件以及独立 Web 界面,内置 17 种评估指标,支持分步追踪 LLM 与工具调用、提示词版本对比及自动化回归测试。IDE 插件免费提供且支持纯本地开发,无需 AWS 账号即可开始使用。
推荐理由:AWS 将智能体追踪与评估能力内嵌到 IDE 和独立 Web 界面中,让开发者无需登录控制台即可排查非确定性调用问题。
OpenAI 介绍了 GPT-6 提示词缓存(prompt caching)的改进机制。该功能通过提高缓存命中率、增加新诊断工具、支持显式断点及控制项,帮助开发者降低模型调用的延迟和成本。
推荐理由:原文介绍了提示词缓存机制的具体改进方向,读者可以据此评估其对降低调用成本和延迟的作用。
Ollama 发布 v0.34.3 版本,GET `/api/show` 接口及 CLI 支持展示各模型的思考控制(thinking controls)与默认配置,云端模型也可直接在 ollama.com 查看。
数据中心内部因 UPS 电池、冷水机组、备用发电机、开关柜及水处理等设备,潜藏着近 10 种气体与化学安全隐患。铅酸电池析氢与锂电池热失控容易引发火灾与有毒气体释放,制冷剂泄漏、发电机废气及 SF6 分解物还会导致窒息风险,高密闭建筑与液冷管路增加进一步加剧了积聚隐患。运维团队应统一化学品与危险源清单,按气体特性合理设定探测器安装高度,并确保传感器易于校准维护。
Simon Willison 发布了 llm 0.36 相关动态。此外,其推出了每月 $10 的赞助订阅服务,订阅者可获取当月重要 LLM 进展的精选邮件简报。
Gary Marcus 发文批评联合国邀请 Sam Altman 发言,质疑其向联合国安理会提供安全简报的合理性。
TikTok 创作者 @therealcornpop 指出,用 AI 为 TikTok 和 YouTube 撰写视频脚本非常容易被识别。其破绽不仅在于“不是 X 而是 Y”、三段论排比以及断奏式标点等常见 AI 句式,更关键的是内容缺乏个人声音,无法体现创作者对所谈论主题的真实观点。
Kubernetes SIG Apps 联合主席 Janet Kuo 与 Maciej Szulik 介绍了核心工作负载 API 的演进方向与当前重点。团队在维护 Deployment、StatefulSet、DaemonSet 等控制器的同时,正推进 Agent Sandbox 等子项目以适配 AI 及智能体工作负载。
OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款新模型,将前沿智能引入日常工作。两款模型在能力与成本之间提供了不同的平衡选择。
推荐理由:OpenAI 推出两款新模型分别在能力与成本间提供不同平衡,方便用户根据日常工作需求进行选型。
NVIDIA 机密计算(Confidential Computing)为生产级大语言模型(LLM)推理提供安全可信的运行环境。该方案通过内存加密机密虚拟机(CVM)与机密 GPU,保障个人、企业及受监管场景中敏感信息与专有模型上下文的数据安全。
NVIDIA Topograph 聚焦于受电力限制的 AI 工厂场景,通过拓扑感知优化 GPU 工作负载调度与放置。不合理的工作负载放置会割裂拓扑域并迫使网络流量经过共享链路,从而降低系统吞吐量并推高作业成本。这还会导致 GPU 在等待数据交互时持续消耗预留电力,无法有效推进计算负载。
Simon Willison 发布了插件 llm-anthropic 0.29 版本。此外,作者提供了每月 10 美元的赞助订阅服务,订阅者可获取当月重要大语言模型(LLM)进展的精选邮件简报。
独立向量数据库正快速被 Postgres、Elasticsearch、ClickHouse 等通用引擎的内建 ANN 索引取代,但向量检索的底层内存成本与硬件物理限制并未改变。
推荐理由:文章拆解了向量检索内嵌后的真实内存与吞吐成本曲线,为技术团队在自建索引与托管服务之间权衡提供了具体参考。
Anthropic 发布 Claude Code v2.1.280,将默认 Opus 模型升级为 Claude Opus 5.5,支持 1M 上下文窗口且定价为 $4/$20 每百万 token(缓存读取 $0.20/Mtok)。
推荐理由:新版本默认接入具备 1M 上下文的 Opus 5.5 模型,并放宽了 MCP 工具描述长度上限并修复多项自动化交互异常。
Anthropic 生命科学团队宣布,Claude 智能体在噬菌体基因数据中自主发现了一种具有类似 CRISPR 重复序列的新型酶系统 ART。约 950 个 Claude 智能体在 21 小时内消耗 2.1 亿 token 筛选了超过 20 万个逆转录酶序列,最终锁定了包含逆转录酶、辅助蛋白和重复序列特征的新系统。团队已通过湿实验验证该序列可表达为多条短 RNA,并公开发布了相关预印本。
推荐理由:展示了多智能体自主挖掘海量基因数据并提出科学假说的端到端协作流程,为大模型驱动基础生物学研究提供了具体范式。
Simon Willison 发布了 LLM 工具新插件 llm-typesafe 0.1a0,为 LLM CLI 工具新增对 TypeSafe AI 旗下 Jev 模型的支持。用户安装并配置 API key 后,可调用 Jev 模型执行 yes/no(noul)判断、多选分类(choice)以及评分(score)等结构化问答任务。
工程师 Shreyas Mocherla 在 KubeCon + CloudNativeCon India 2026 上完成了首次参会与演讲,展示了如何通过 Kubernetes、GPU 与 DRA 在 NVIDIA DGX Spark 上搭建自托管 AI 集群并提供模型服务。
NVIDIA 推出 DLSS 5 并引入 3D 导向神经渲染技术,为开发者提供更细粒度的光照与材质控制能力。同时更新还涵盖角色 AI 工具 NVIDIA ACE、RTX Mega Geometry 2.0 以及 RTX Kit,针对高密度几何体与渲染工作流进行了功能扩展。
推荐理由:原文汇总了神经渲染与角色工具的技术更新,读者可借此了解新特性对画质控制与图形工作流的改变。
主权 AI 使企业和政府能够在特定法律及地理边界内完全掌控数据、基础设施、模型与治理策略,以满足严格的安全合规要求。HPE 联合 Nvidia 推出 HPE Sovereign AI Factory,为强监管行业提供定制化基础设施与全流程服务。该方案帮助客户在保持敏感数据与操作本地可控的前提下,安全运行 AI 模型与 AI 智能体。
阶跃星辰宣布 Step 5 Preview 正式上线豆包旗下 AI 开发工具 TRAE,用户可在全流程开发工作流中直接调用。该模型覆盖 9 类任务与 33 种编程语言,支持代码库理解、跨文件修改、重构与持续数小时的长程任务推进,官方公布其 DeepSWE 得分为 67.7 分,ProgramBench 通过率为 80.5%。
推荐理由:阶跃星辰将 Step 5 Preview 接入 TRAE 开发环境,并给出了该模型在 33 种编程语言下的代码评测数据。
NVIDIA 在 ROSCon 大会上发布开源软件套件 Isaac ROS 5.0,通过引入智能体工作流帮助开发者与 AI 智能体协同开发机器人应用。新版本增加了对 ROS Lyrical 和 Ubuntu 24.04 的支持,贡献了跨硬件的标准数据处理接口,并提供 FoundationStereo 微调、目标位姿估计模型 FoundationPose 的智能体推理库等技能。
推荐理由:Isaac ROS 5.0 通过标准化硬件接口和可复用技能,降低了开发者与智能体协同构建机器人感知和抓取工作流的门槛。
NVIDIA 介绍了如何结合 AI 智能体与 NVIDIA Isaac ROS 加速 ROS 2 节点。针对消息在节点间传递时因 CPU 内存序列化与数据复制、从而削弱 GPU 运行感知与 AI 工作负载优势的问题,NVIDIA 提供了上游抽象机制与 CUDA buffer backend 解决方案。
Parallel 的 AI 智能体采用 GPT-6 Astra 进行劳动力市场数据的研究与综合分析。相比以往模型,GPT-6 Astra 帮助其将研究耗时和成本均缩减了一半。
Equinix 探讨了在技术快速迭代背景下的 AI 硬件采购策略。其曾于 2025 年底撰文对比 GPU 与 CPU 等 AI 硬件处理器,旨在帮助企业厘清不同处理器特性,以应对不断变化的硬件选型与采购需求。
学者 Timnit Gebru 与 Emily M. Bender 发文批评近期科技企业围绕超级智能、数学突破和失控黑客的宣传属于营销炒作,呼吁公众与政策制定者保持审慎。
2026 年春季波斯湾 AWS 设施遭无人机袭击表明相关威胁已成现实,数据中心运营商亟需建立分层无人机防御体系。防御措施涵盖部署防护网与雷达探测、关键组件物理硬化、热红外特征管理,以及完善站点内冗余和跨站点故障转移机制。此外,选址需综合考量地形隐蔽性与监管成熟度,并与民航和执法机构协同推进地理围栏与空域防护。
Grok 4.7 正式发布并在 Cursor 上线,定价为输入 $2/M tokens、输出 $6/M tokens,在 CursorBench 4.0 取得 46.3% 分数,但社区实测反映其 token 效率与速度不及预期。同时,小米以 MIT 协议开源全模态大模型 MiMo-V2.6 Pro 与 Flash,总参数量达 1.02T、激活参数 42B,并将开源其端到端强化学习框架与训练环境。
推理框架 vLLM 正式发布 v0.30.0 版本,新增对 DeepSeek-V4.1-Flash、GLM-5.3-Flash 等新架构模型的端到端支持。核心更新引入支持 FP4 与多机 TP 的 Fast Start 显存权重缓存守护进程,大幅缩短引擎重启与初始化耗时;同时上线 HiSparse 分层稀疏 MLA 解码机制,并深度优化了投机解码、上下文并行及 NVFP4 量化性能。
推荐理由:该版本通过显存权重常驻守护进程与稀疏解码分层卸载,为大模型长上下文与高并发推理提供了可迁移的部署优化方案。
腾讯正式发布混元图像 3.5 预览版(Hy Image3.5 preview),定位高性价比专业级生图模型,官方盲测对比 Hy Image3.0 综合能力提升约 30%。
推荐理由:新模型在多轮编辑与文字渲染上做了针对性优化,配合较低的单图调用成本,有助于降低批量视觉物料生成的试错门槛。
oMLX 创建者及维护者 Jun Kim 正式加入 Hugging Face,全面负责 oMLX 的长期维护并加速 Apple MLX 本地 AI 生态建设。oMLX 将继续保持 Apache 2.0 开源协议并作为新想法的试验场,同时强化与 mlx-lm、mlx-vlm 以及 LMStudio 等项目的协作。
英国人工智能安全研究所(UK AISI)正式采用 EvalEval 基础设施公开基准评测结果,利用 Evaluation Cards 平台与统一的 EEE 规范提升评测的可复现性与透明度。
推荐理由:通过统一元数据和运行配置公开评测记录,为行业对比前沿模型评测差异提供了标准化的复现参考。
OpenAI 阐述了针对前沿模型及安全防护措施开展第三方 AI 安全评估的重点与原则。该原则强调外部评估需具备严谨性、安全性和独立性,以推动对前沿 AI 模型与保障机制的有效安全评估。
Hugging Face 在 Transformers 库中新增对 GGUF 量化格式的原生高效推理支持,用户可通过标准 from_pretrained API 直接加载 Hub 上的 GGUF 模型并在本地运行。
推荐理由:原文展示了在 PyTorch 生态中直接加载 GGUF 权重的实现路径,让开发者无需脱离 Transformers 工作流即可兼顾端侧推理性能。
TypeSafe AI 推出新型模型 Jev,主打输入非结构化文本并直接输出分类、评分与布尔判断等类型化浮点概率决策。该模型输出免费且输入价格为 $0.042 per M tokens,支持在上下文窗口内并行评估多个问题,适用于垃圾检测、标签推荐与搜索重排序等分类任务。Simon Willison 指出 Jev 带来了更彻底的黑盒特性与潜在偏见风险,当前社区已出现开源权重复现项目及评测基准。
推荐理由:原文详细拆解了仅输出类型化浮点概率的决策模型机制与定价特点,有助于读者理解分类与重排序场景下降低成本的新架构路径。
NVIDIA 推出 TensorRT 多设备推理能力并在 Dynamo-Triton 中完成集成,旨在简化多 GPU 场景下的模型服务。该能力基于 NCCL 分布式通信集合,允许单个 TensorRT 网络跨多张 GPU 执行,同时保留 TensorRT 的推理优化性能,已自 TensorRT 11.0 起获得完整支持。
推荐理由:原文介绍了基于 NCCL 的多 GPU 分布式推理新特性,读者可据此了解 TensorRT 11.0 的多卡部署优化机制。
Gary Marcus 在联合国大会数字合作活动上发表演讲,随后 20 多个国家签署了关于 AI 治理的行动呼吁。他指出当前 AI 的现实风险集中于大规模深度伪造与网络攻击而非人类灭绝,呼吁禁止具有不受限互联网访问权限的 AI 智能体。他建议成立具备实权的国际咨询委员会,对新系统进行事前风险评估、持续发布后审计及危险系统召回。