跳到正文
9月30日周三
  1. vLLM 官方博客(网页)66

    深入解析 vLLM:高吞吐大语言模型推理系统的架构剖析

    vLLM 官方博客发布技术长文深度剖析其 V1 推理引擎,系统拆解从单卡底层内核到大规模分布式服务的完整架构。文章详细解读了调度器运行机制、PagedAttention 内存分配与连续批处理流程,并深入探讨分块 Prefill、前缀缓存、基于有限状态机的引导解码、推测解码以及 Prefill/Decode 分离等高级特性。

    推荐理由:文章从单机引擎内核层层拆解到多节点分布式服务,为理解和优化高吞吐大模型推理系统提供了完整清晰的架构参考。

  2. vLLM 官方博客(网页)36

    vLLM 开源大语言模型推理与服务库介绍

    vLLM 是源自 UC Berkeley Sky Computing Lab 的开源大语言模型推理与服务库,拥有超过 2000 位社区贡献者。该框架采用 PagedAttention、连续批处理与前缀缓存技术,支持 FP8/INT4 等多种量化方案及 200 多种模型架构。系统提供兼容 OpenAI 与 Anthropic 的 API 服务,并广泛适配 NVIDIA、AMD 等多种硬件平台。

  3. vLLM 官方博客(网页)31

    vLLM 社区概览

    vLLM 是面向大语言模型(LLM)的高吞吐与高内存效率推理服务引擎,支持在 CUDA、ROCm、XPU 及 CPU 等硬件上部署并提供兼容 OpenAI 的 API。该引擎通过 PagedAttention 与连续批处理(continuous batching)提升 GPU 利用率以降低推理成本,并获得 a16z、Sequoia Capital 及 NVIDIA 等机构的资金与算力支持。

  4. vLLM 官方博客(网页)27

    vLLM 开放常年人才库招聘与社区合作通道

    vLLM 宣布开放常年人才库招聘与岗位内推,面向美国旧金山湾区及中国北京、上海、深圳、广州、成都等地招募实习与全职人才。官方表示为优秀推理工程师提供不设上限的薪酬待遇,投递简历将与合作企业共享。此外,该渠道还支持人才库对接、Meetup 组织与技术合作,并为被搁置的重要代码贡献提供跟进反馈入口。

  5. vLLM 官方博客(网页)21

    vLLM 社区活动日程

    vLLM 汇总社区活动日程,涵盖 Meetup、Office Hours、Release News、Conference 与 SIG Meeting 等多类活动安排。社区现面向全球征集演讲者与赞助商,欢迎开发者分享 vLLM 功能特性、使用案例、项目扩展或部署经验,并在各自所在城市申办线下 Meetup。

  6. vLLM 官方博客(网页)31

    vLLM 官方文档

    vLLM 是一款开源的大语言模型推理与服务库,由 UC Berkeley Sky Computing Lab 发起并由超 2000 名贡献者共同维护。该框架通过 PagedAttention、连续批处理、多样化量化与投机解码实现高吞吐量服务,并支持张量及流水线等分布式并行推理。

  7. Google Developers · AI 筛选67

    Google 推出 autofinetune:在 TPU 上基于 Tunix 实现 LLM 自主后训练

    Google 推出开源项目 autofinetune,利用 Gemini Flash 3.7、Tunix 与 Cloud TPU 驱动 AI 智能体自主闭环完成大语言模型的监督微调(SFT)与 GRPO 强化学习后训练。

    推荐理由:展示了如何通过规范配置让智能体在硬件集群上自主调优并验证变更,为模型后训练提供了可复用的自动化实践路径。

  8. Google Developers · AI 筛选65

    Google 详解如何构建面向意图判断的零信任 AI Agent 运行时安全体系

    Google 发布零信任 AI Agent 系列第二篇指南,介绍如何将安全边界从代码级检查迁移至平台运行时治理。方案通过 Model Armor 在边缘拦截提示词注入与敏感数据,利用基于大模型的语义治理策略(Semantic Governance Policies)在工具调用前校验业务意图,并通过 Agent 异常检测捕获多轮会话攻击并实现无须重构代码的闭环修复。

    推荐理由:原文给出了结合边缘过滤语义治理与多轮异常检测的 Agent 运行时防护架构读者可直接参考开源示例提升系统的安全性。

  9. Google Developers · AI 筛选67

    Google AI 订阅正式整合 Google Colab 高级权益

    Google 宣布即日起将 Google Colab 高级权益纳入 Google AI 订阅方案,订阅用户可优先访问更快的加速器与更强算力机型。其中 Google AI Ultra 订阅者还可解锁高级 GPU 访问以及不中断的后台执行能力,长时间训练无需保持浏览器标签页打开。已有 Colab 订阅的用户权益不受影响且支持权益叠加,相关更新将在接下来数周内逐步推送。

    推荐理由:原文明确了不同订阅档位新增的硬件与后台运行权限,开发者可据此评估打包订阅的算力性价比。

  10. Google Developers · AI 筛选72

    Google Antigravity SDK 宣布支持本地 AI 模型工作流

    Google 宣布 Antigravity SDK 正式支持本地 AI 模型工作流,首发通过 Google AI Edge 的 LiteRT 支持 Gemma 4 26B A4B 模型离线运行。

    推荐理由:官方为智能体开发框架引入端侧模型执行能力,通过云端规划与本地执行的混合编排方案,为平衡数据隐私与推理成本提供了具体参考。

  11. Google Developers · AI 筛选63

    Google 基于 MaxText 与 TPU 完整复现 Olmo 3 7B 预训练流程

    Google 团队使用基于 JAX 的 MaxText 框架与 Cloud TPU,从头完整复现了 Ai2 的 Olmo 3 7B 第一阶段约 5.9T token 预训练与第二阶段 mid-training 退火训练。

    推荐理由:原文系统复盘了在 TPU 上复现 PyTorch 大模型预训练的工程细节与性能调优,读者可据此参考跨框架对齐与断点续训的验证方法。

  12. Google Developers · AI 筛选74

    Google Cloud API Gateway 支持将 REST API 直接转换为 MCP 工具

    Google Cloud API Gateway 推出公开预览版功能,支持直接充当远程 MCP 服务器,无需单独搭建与维护服务器即可将现有 REST API 转换为智能体可调用的 MCP 工具。

    推荐理由:原文给出了通过注解规范将现有网关直转为协议端点的具体配置与限制,有助于降低企业工具接入智能体的运维成本。

  13. Ollama 更新72

    Ollama v0.35.0 发布:新增决策模型接口与概率评分输出

    Ollama 发布 v0.35.0 版本,通过 /v1/systemone 接口新增对决策模型的支持。该功能基于 TypeSafe 的 Jev API,使模型直接返回选项、概率和分值而非生成文本,适用于工单分拣、模型路由和内容分类等场景,首批支持 Nimble 和 Tev1 模型。新版本还修复了 MLX 模型下载挂起的问题,并优化了设置加载与已弃用参数的告警处理。

    推荐理由:原文给出了决策模型的调用接口与结构化返回示例,展示了本地运行时从文本生成拓展至精准分类与路由的能力。

  14. AWS 机器学习74

    GPT-6.1 Sol 正式上线 Amazon Bedrock

    GPT-6.1 Sol 已在 Amazon Bedrock 正式全面可用(GA),重点增强了智能体编码、计算机使用和多步骤日常工作流的推理能力。根据 OpenAI 评测数据,GPT-6.1 Sol 在 DeepSWE v1.1 上的表现媲美 GPT-6 Astra,而单任务成本仅约为后者的五分之一,得分比 GPT-6 Sol 高出 6.4 个百分点。

    推荐理由:原文介绍了模型上线云端托管后的性能与成本表现,企业读者可据此评估其在智能体工作流中的部署性价比。

  15. Claude Code 更新48

    Claude Code v2.1.285 发布

    Claude Code 发布 v2.1.285 版本。新版本新增 `CLAUDE_CODE_DISABLE_WEB_FETCH` 环境变量以关闭 WebFetch 工具,支持通过 `claude --desktop` 打开桌面端应用,并加入 `allowedProviders` 托管设置限制可用的 API 提供商。

  16. Google Research49

    Diffusion Controller 如何统一并简化 AI 图像生成

    Diffusion Controller 框架将文生图去噪过程重构为连续控制问题,通过统一的数学表征平衡图像质量与用户偏好对齐。该方法引入轻量附加网络动态校准生成轨迹,无需修改基础模型权重即可超越行业标准,其完全解锁微调版本对比基线模型取得 90% 胜率。实验在 Stable Diffusion v1.4 上验证了其在灰盒及闭源模型中的控制能力。

  17. AWS 机器学习43

    Amazon Quick 提示词工程基础

    Amazon Quick 提供了适用于构建自定义智能体、自动化流程与对话式分析等 AI 功能的提示词工程基础原则。其核心原则强调通过高具体性明确指标与范围、注入业务上下文指导输出深度,并借助少样本示例规范输出结构。此外文章还推荐采用 CRISPE 等结构化框架定义上下文、角色与输入要素,以减少试错迭代并实现标准化复用。

  18. AWS 机器学习44

    Amazon Quick 各组件提示词工程:实用模式与避坑指南

    AWS 详解了 Amazon Quick 各核心组件的提示词工程模式与避坑指南。针对 Quick Research,需明确目标受众、拆解子问题并限定数据源以生成带引用的结构化报告;针对 Quick Flows 自动化,需使用编号步骤明确时间表、触发条件与分支逻辑;使用 Quick Sight 探索数据时,则需在对话式查询中清晰界定业务指标、维度与可视化偏好。

9月29日周二
  1. AWS 机器学习50

    Condé Nast 如何基于 Amazon Bedrock 构建多模态视频检索方案

    Condé Nast 联合 AWS 基于 Amazon Bedrock 与 Amazon OpenSearch Service 构建了多模态视频检索方案,将单次内容发现耗时从 250 分钟缩短至 2 分钟以内。该方案采用 TwelveLabs Marengo 嵌入模型联合编码视觉、音频与字幕信号,支持自然语言意图搜索、以图搜视频及精确时间戳定位,高效覆盖超 140,000 个视频的媒体资源库。

  2. Hugging Face76

    NVIDIA 开源表格基础模型 Kumo Tabular

    NVIDIA 正式开源表格基础模型 Kumo Tabular,支持在无需训练、微调或特征工程的前提下,通过单次前向传播直接完成表格数据的分类与回归预测。该模型包含 28M 到 215M 三种参数规模,完全基于结构因果模型生成的合成数据完成预训练,并在 TabArena、BeyondArena、TALENT 与 ScoringBench 四项基准测试中均位居榜首。

    推荐理由:模型展示了完全依赖因果合成数据预训练表格大模型的可行路径,读者可以借此了解免微调与零特征工程在表格预测任务中的落地机制。

  3. GitHub Blog · AI 与安全47

    GitHub 开发者政策更新:透明度、州政策与后续展望

    GitHub 发布最新透明度中心数据并回顾 2026 年立法进展,其在 2026 年上半年收到的政府下架请求达 708 起(2025 年全年为 98 起),主因是统计口径调整为计入全部请求与重复项,并非实际移除量增加。立法方面,GitHub 推动加州《AI 透明度法案》(SB 1000)修改以化解与开源许可证的冲突,并持续跟进多州年龄确认法案以保护开发者基础设施。

  4. Microsoft Research67

    Microsoft Research 发布生物学 AI 研究系统 Quine

    Microsoft Research 推出生物学 AI 研究系统 Quine,由多模态生物学世界模型以及连接科研工具、文献与湿实验的交互框架组成。系统联合学习基因组、蛋白质、细胞状态及生物成像等跨尺度数据,以预测干预后的生物状态演变;在与 Broad Institute 合作的胰腺癌研究中,Quine 快速完成化合物筛选并在湿实验中验证了候选分子。

    推荐理由:原文展示了生物学世界模型与湿实验结合的闭环流程,读者可据此了解 AI 辅助跨模态生物学推理与药物筛选的具体范式。

  5. Cloudflare Blog · 网络基础设施65

    Cloudflare 推出 AI 时代自适应应用安全框架

    Cloudflare 推出面向 AI 时代的应用安全框架,将风险发现、智能体治理、运行时防护与安全调查响应串联为闭环系统。该框架结合前沿 LLM 自动化渗透测试 WAF、上线可自动学习合法流量结构的 Application Profiles 功能,并向所有账户免费开放 Cloudforce One 威胁情报事件平台。

    推荐理由:原文给出了 AI 时代自动化攻击的演进机制与全链路防御框架,读者可以据此了解大模型对抗渗透与智能体流量治理的具体落地实践。

  6. Cloudflare Blog · 网络基础设施67

    Cloudflare 推出 Threat Signals 并向所有账户免费开放,利用 Agent 技能自动化开源威胁情报

    Cloudflare 推出面向开源威胁情报的 Threat Signals,并向所有 Cloudflare 账户免费开放。该功能利用 Agent 技能自动解析 RSS 等非结构化威胁报告,提取并标准化失陷指标(IOC),将生成的上下文威胁事件存入账户私有数据集,并可直接联动 WAF 规则进行防护。

    推荐理由:Cloudflare 将 Agent 技能引入开源威胁情报解析,使安全团队能自动提取 IOC 并在私有数据集中直接联动 WAF 防护策略。

  7. Cloudflare Blog · 网络基础设施60

    Cloudflare 使用前沿 AI 模型实测自家 WAF:1107 次攻击变异与规则加固

    Cloudflare 使用前沿大语言模型构建双模型自适应循环,在黑盒环境下对自家 WAF 展开动态渗透与变异载荷测试。测试覆盖 XSS、SQLi、CMDi、SSRF、LFI 和 Log4j 等 6 类攻击共 1,107 次尝试,人工筛查后确认 49 个主要集中于 CMDi 和 SSRF 的有效防御缺口。

    推荐理由:Cloudflare 详述了利用大模型动态变异载荷测试 WAF 的闭环框架,为安全团队探索 AI 辅助渗透与防御加固提供了可落地的工程实践。

  8. Cloudflare Blog · 网络基础设施48

    通过 Cloudflare Application Profiles 强化正面安全策略

    Cloudflare 推出 Application Profiles,将正面安全策略扩展至 Web 应用程序,通过学习正常 HTTP 请求的结构与格式来缩减攻击面。系统可自动分析路径变量、参数、标头及请求体的数据类型与约束,对格式异常或偏离基线的请求进行实时检测和标记。该功能目前已对拥有 API Security 的客户开放,并向部分受邀企业客户开启封闭测试。