跳到正文
9月30日周三
  1. Claude 官方博客(网页)81

    Claude 推出 Skills 功能,支持将组织知识封装为可复用智能体能力

    Claude 正式推出 Skills 功能,允许用户与企业将专业知识、业务规范及最佳实践封装为结构化资源,在 Claude.ai、Claude Code 与 API 间跨平台通用。开发者只需构建包含 SKILL.md 指引、参考资料及脚本的文件夹,或通过内置的 skill-creator 自动生成,Claude 即可在复杂任务中自动组合并调用对应技能。

    推荐理由:原文明确了用文件夹和元数据打包组织流程的标准格式,读者可以据此将团队制度沉淀为跨客户端与接口通用的智能体能力。

  2. vLLM 官方博客(网页)72

    vLLM-Omni 推出分布式分层卸载技术,支持超显存容量 DiT 模型高效推理

    vLLM-Omni 推出分布式分层卸载(DLO)技术,通过 Meta 设备与 mmap 加载、权重切分重构、双缓冲预取以及数据并行多并发,使单卡显存不足的超大视频生成模型可在多卡 GPU 或 NPU 上高效运行。

    推荐理由:vLLM-Omni 结合 mmap 与多流 AllGather 卸载降低显存与内存峰值,为大参数量扩散模型的低成本分布式推理提供了落地路径。

  3. LlamaIndex 官方博客(网页)25

    LlamaIndex 助力保险行业实现理赔与核保自动化

    LlamaIndex 推出基于 AI 智能体的保险自动化解决方案,用于处理发票分类、表单录入与合规审查等繁重文档任务。该方案依托 LlamaParse 解析包含图表的复杂文档,涵盖理赔助手、合规跟踪、保单解答及欺诈监测四大功能,并提供 Python 与 TypeScript SDK 及 API。

  4. Claude 官方博客(网页)77

    Claude 推出插件市场 Marketplace 提供 340 款一键安装工具与 MCP 集成

    Claude 推出插件市场(Claude Marketplace),聚合了 340 款整合工具、技能与集成的插件并支持一键安装。市场覆盖了 GitHub、Microsoft Playwright、Vercel、Supabase、Figma 等官方 MCP 服务与开发套件,支持在 Claude Code 中完成代码审查、浏览器自动化测试、云端部署与设计稿转代码等任务。

    推荐理由:原文给出了插件市场的具体分类与集成工具清单,读者可以据此评估将外部开发工具接入工作流的可行性。

  5. LlamaIndex 官方博客(网页)26

    金融分析师如何借助 LlamaIndex 构建 AI 金融模型

    LlamaIndex 推出面向金融分析的 AI 解决方案,利用 LlamaParse 高精度解析复杂财报 PDF、图表与嵌套表格,可减少 80% 的研究时间。系统支持自动提取营收、FCF 等关键指标,快速完成 10-K/10-Q 报告摘要、尽职调查与趋势分析,并构建专属 AI 智能体。平台还提供 Python 与 TypeScript SDK 及 API,支持可追溯引用与企业级并行处理。

  6. Claude 官方博客(网页)64

    Claude Marketplace 聚合 867 个连接器与 MCP 插件

    Claude Marketplace 汇集了 867 个连接器与插件,支持将外部工具直接接入 Claude 对话。平台支持前端代码生成、子智能体开发与代码审查、Upstash Context7 实时文档检索、微软 Playwright 浏览器自动化端到端测试以及 monday.com 项目管理等功能。

    推荐理由:原文给出了连接器生态与典型 MCP 服务能力,读者可以据此了解工具集成支持的开发和自动化场景。

  7. Claude 官方博客(网页)86

    Anthropic 推出 Claude Design 设计与原型制作功能

    Anthropic 在 Claude 平台及 Claude Code 中正式推出 Claude Design 功能,支持用户通过自然语言描述并结合自有设计系统直接生成符合品牌规范的视觉设计、单页企划与可交互流程原型。

    推荐理由:Anthropic 官方介绍了该功能如何接入企业设计系统与代码库,读者可以据此评估它对前端原型与营销设计协作流程的改变。

  8. vLLM 官方博客(网页)42

    IsoExec:通过统一执行消除 SkyRL 训练与推理不一致

    SkyRL 引入跨框架统一执行抽象 IsoExec,通过统一执行契约与对齐的批次无关算子,消除 vLLM 推理引擎与 Megatron 训练引擎之间的数值执行不一致。在单台 8×H100 节点运行 Qwen3.5-35B-A3B 同步 DAPO 训练时,IsoExec 将采样与训练间的平均 logprob 差异降至 1e-6 以下,50 步内的额外开销为 25%。

  9. LlamaIndex 官方博客(网页)30

    LlamaIndex 行政运营方案:简化业务流程

    LlamaIndex 基于 LlamaParse 与 AI 智能体工作流推出行政运营方案,旨在消除发票匹配、表单录入与合同审查等手动流程,释放 80% 的时间。该方案提供发票评估、合同提取与表单处理等模块,并配备 Python 和 TypeScript SDK 与 API。系统支持解析复杂图表和表格,提供字段溯源与置信度评分,适用于高合规性企业 RAG 管道。

  10. Transluce 研究(网页)25

    Transluce 最新动态与研究汇总

    Transluce 汇总了其在模型可解释性、AI 智能体监控及对齐治理领域的最新研究与项目动态。近期成果涵盖在 urlquery.net 上发现早期失控 AI 智能体黑客攻击痕迹、推出前沿模型精神健康评估,并将 Activation Oracles 扩展至万亿参数模型。此外,其用于分析与干预智能体行为的系统 Docent 已基于 Apache 2.0 协议开源。

  11. Transluce 研究(网页)28

    Transluce 的宗旨:构建理解与监管 AI 的基础设施

    非营利研究实验室 Transluce 致力于推进对复杂 AI 系统的公众监督,正在构建理解 AI 所需的平台、研究和工具。团队鼓励开源贡献者测试其 GitHub 代码,并开放了涵盖工程、研究、政策和运营等多个方向的职位招聘。此外,该机构还发布了独立性与透明度政策以及负责任披露政策以规范治理。

  12. Claude 官方博客(网页)78

    Claude 推出 Artifacts 新功能:上线 Design、Slides 与 Docs 测试版

    Claude 宣布在付费计划中上线 Claude Design、Claude Slides 和 Claude Docs 测试版,支持在对话旁直接生成可交互的视觉设计、演示文稿和动态文档。

    推荐理由:官方全面介绍了 Design、Slides 和 Docs 三类新组件的功能细节与权限机制,有助于评估其对现有办公协作流程的改造潜力。

  13. vLLM 官方博客(网页)70

    vLLM 基于 Ray Direct Transport 实现大规模分片权重传输引擎

    vLLM 联合 NIXL 团队推出了基于 Ray Direct Transport(RDT)的原生分片权重传输引擎,在 48 台 8×H100 节点集群上实现 Kimi K2 模型 BF16 格式 7.9TB 权重在 7.53 秒内完成同步,聚合带宽达 1,049 GB/s。

    推荐理由:针对在线强化学习超大 MoE 权重同步慢且显存开销高的问题,该方案通过分片点对点拉取与流水线重叠优化提供了高效的训推协同实践路径。

  14. LlamaIndex 官方博客(网页)20

    LlamaIndex 助力工程与研发加速产品开发

    LlamaIndex 针对工程与研发场景推出解决方案,通过加速技术文档理解将产品开发周期缩短 80%。该方案依托 LlamaParse 解析包含图表和嵌套表格的复杂多模态文档,支持构建研发助手、系统架构问答与技术规范对比等 AI 智能体工作流。平台提供 Python 和 TypeScript SDK 及 API,已被 Salesforce Agentforce 等团队用于落地企业级 RAG 应用。

  15. Claude 官方博客(网页)80

    Claude 推出科学研究工作台应用 Claude Science

    Anthropic 推出面向科研人员的 AI 工作台应用 Claude Science 并开启公测,支持在本地、集群或 GPU 上运行数据分析与作业调度。该应用可原生查看蛋白质与分子结构,直连 60 余个科学数据库及 NVIDIA BioNeMo 工具链,并支持通过 MCP 连接外部工具。每次分析生成的图表与结论都会绑定完整代码、运行环境与对话记录,以便后续复现与核验。

    推荐理由:原文详细展示了面向生命科学的数据分析、算力编排与可追溯工作流,读者可据此评估其对科研实验及生信管线的适配度。

  16. vLLM 官方博客(网页)69

    vLLM 在 AMD GPU 上的投机解码实践指南与性能实测

    vLLM 官方发布在 AMD Instinct MI300X 与 MI355X GPU 上实现投机解码的实践指南与评测结果,系统评估了单次目标模型前向验证多个草稿 token 的加速效果。

    推荐理由:文章详细对比了五种投机解码机制在不同模型与负载下的吞吐表现,为大模型推理加速与参数调优提供了可迁移的工程参考。

  17. LlamaIndex 官方博客(网页)76

    LlamaIndex 开源本地文档解析工具 LiteParse

    LlamaIndex 团队开源本地文档解析工具 LiteParse,支持在无云端依赖且不消耗模型 token 的情况下快速解析 PDF、Office 文档及图像。该工具采用嵌入文本结构化结合传统 OCR 的混合方案,能够输出带有精确边界框坐标的结构化 JSON 数据。LiteParse 提供命令行工具与 Python 包,支持跨核心扩展与批量处理,便于直接接入 AI 智能体与向量数据库工作流。

    推荐理由:该工具无需调用大模型即可在本地快速解析多格式文档并保留边界框坐标,为构建低成本 RAG 与 Agent 工作流提供了轻量开源方案。

  18. vLLM 官方博客(网页)75

    vLLM-Omni 支持 MiniMax H3 系统级优化与 FastH3 实时推理

    vLLM-Omni 宣布完成对 MiniMax H3 的全栈推理优化并集成 FastVideo 的 4 步蒸馏方案 FastH3,实现了生成速度快于播放时长的端到端实时服务。

    推荐理由:文章拆解了音视频联合生成从 DiT 到 VAE 及视频封装的全链路瓶颈,为多模态大模型的低延迟部署提供了系统级参考。

  19. LlamaIndex 官方博客(网页)20

    LlamaIndex Index 数据索引与检索功能介绍

    LlamaIndex 提供 Index 功能,通过智能切块与嵌入向量处理让数据支持高精度的大规模检索。平台目前已累计处理超过 1B 份文档,每月安装包下载量超 25M 次,LlamaParse 用户突破 300k。该功能支持多模态索引与数据增量同步,并可直接对接 AI 智能体实现下游工作流自动化。

  20. LlamaIndex 官方博客(网页)28

    LlamaIndex LlamaExtract:复杂文档结构化数据提取

    LlamaIndex 旗下文档提取工具 LlamaExtract 支持从复杂文档中提取结构化数据,并提供字段级置信度评分与来源引用追溯。该工具结合版面与上下文感知推理,支持用户自定义或自动检测 Schema,且具备多种解析模式以平衡成本与准确率。目前平台已处理超 10 亿份文档,LlamaParse 用户数超 30 万。

  21. vLLM 官方博客(网页)77

    vLLM 针对真实 Agent 工作负载推出全栈推理服务优化

    vLLM 针对多轮会话、长上下文及高前缀复用的 Agent 工作负载推出全栈推理优化方案,涵盖统一内存页混合 KV cache 管理、分层离线卸载、模型自适应并行及防队头阻塞调度。

    推荐理由:原文梳理了长上下文与高前缀复用负载下的全栈推理优化方案,为大模型智能体部署和算力选型提供了实测参考。

  22. LlamaIndex 官方博客(网页)26

    LlamaParse 文档解析工具介绍

    LlamaIndex 旗下的 LlamaParse 可将复杂排版、表格、图表、手写内容及图像等转化为干净的 Markdown 格式。它具备版面感知与多模态解析能力,开箱支持 100+ 种语言,并提供本地云部署与高并发等企业级支持。目前该工具累计处理文档超 1B+,月度包下载量超 25M+,用户规模达 300k+。

  23. Claude 官方博客(网页)83

    Anthropic 推出终端代码智能体 Claude Code

    Anthropic 推出代码智能体工具 Claude Code,支持在终端、IDE、Slack 或网页端协同工作,能够自主处理 Bug 修复、跨文件重构与长期代码迁移等研发任务。

    推荐理由:官方全面介绍了这款代码智能体的终端定位与长流程处理能力,方便开发者评估其接入现有开发栈的实际价值。

  24. vLLM 官方博客(网页)72

    vLLM 引入 Hybrid HiSparse 混合稀疏卸载优化,支持 GLM 5.3 单机长上下文高并发推理

    vLLM 针对 GLM 5.3 推出 Hybrid HiSparse 混合稀疏卸载优化机制,使单个 8× H200 节点即可运行 100 万全长上下文并显著提升并发能力。

    推荐理由:文章给出了混合稀疏卸载机制在单节点上的显存管理设计,为长上下文大模型推理的高并发部署提供了实用方案。

  25. LlamaIndex 官方博客(网页)29

    LlamaParse:兼顾成本与准确度的智能体文档处理

    LlamaParse 提供端到端 AI 文档理解方案,具备 Parse 复杂版面与图表解析、Extract 上下文数据提取(含置信度分数与引用)以及 Index 智能分块与嵌入检索能力。该工具专注于复杂表格与层级文档处理,已应用于 Salesforce Agentforce 等团队的企业级 RAG 和 AI 智能体开发,有效降低了数据管道的维护成本。

  26. Claude 官方博客(网页)69

    Claude 升级产品功能体系并整合 Cowork 功能

    Anthropic 升级 Claude 产品定位与功能体系,将其从对话问答扩展为可接管长任务与多应用工作流的协作智能体,并将 Claude Cowork 与 Chat 整合为统一体验。

    推荐理由:官方整合了对话与工作流执行能力,展示了从单轮问答向多工具协同和长任务接管的具体落地形态。

  27. LlamaIndex 官方博客(网页)60

    LlamaIndex 发布文档提取基准 ExtractBench 并推出 Agentic Plus

    LlamaIndex 正式发布开源企业级文档提取评测基准 ExtractBench,并同步推出文档提取服务新层级 LlamaExtract Agentic Plus。

    推荐理由:原文同时评估了提取准确率、长文档衰减与单页成本,读者可以据此对比不同模型在实际企业文档提取中的性价比与能力边界。

  28. vLLM 官方博客(网页)73

    vLLM 推出分层 KV Cache 卸载框架

    vLLM 正式推出分层 KV Cache 卸载框架(Tiered KV Cache Offloading),支持将加速卡显存中逐出的 KV 数据下沉至主机内存、文件系统、对象存储或远端节点以避免重复计算。

    推荐理由:框架通过主机内存统筹多级存储与节点间共享,为长上下文和大并发下的显存瓶颈提供了低成本扩展方案。

  29. vLLM 官方博客(网页)67

    vLLM 发布 Kimi K3 性能优化:端到端吞吐提升达 2.8 倍

    vLLM 宣布针对 Kimi K3 模型完成全栈推理性能优化,在 B300 节点 8K/1K 负载下实现端到端吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%,平均延迟降低 56%–60%。

    推荐理由:原文给出了从自适应调度、KDA 检查点到 ReplaySSM 的全栈优化细节,读者可据此参考混合架构大模型推理加速方案。

  30. vLLM 官方博客(网页)69

    vLLM 团队基于 GB300 NVL72 与 Mooncake 训练 Kimi K3 的 DSpark 投机草稿模型

    vLLM 团队通过 Speculators 训练库与 Mooncake 传输引擎,在 Verda 提供的 GB300 NVL72 机架上完成了 2.8T 参数 Kimi K3 模型的 DSpark 投机草稿模型训练与部署。

    推荐理由:原文给出了基于 Mooncake 跨节点传输隐藏状态训练超大模型投机草稿模型的完整拓扑,读者可直接参考其多机训练与部署配置。

  31. vLLM 官方博客(网页)64

    vLLM 集成 PyNvVideoCodec 硬件视频解码以提升多 GPU 视频处理吞吐

    vLLM 宣布集成 PyNvVideoCodec 以支持 NVIDIA GPU 硬件视频解码(NVDEC),将视频解码工作负载从 CPU 转移至专用硬件。该方案消除了多 GPU 节点运行视觉语言模型时 CPU 易满载的瓶颈,在 8×H100 配置下使视频描述任务的吞吐量达到 CPU 解码方案的两倍以上。

    推荐理由:通过将视频解码从 CPU 卸载至 GPU 硬件解码器,解决了多卡视觉模型推理中的预处理瓶颈并给出了部署配置参考。

  32. vLLM 官方博客(网页)65

    vLLM 详解 Qwen3.8-2.4T 的 PD 分离推理优化实践

    vLLM 在 GB300 NVL72 集群上实现了千问 Qwen3.8-2.4T 的 Prefill-Decode(PD)分离式推理优化,在 8K/1K 负载下达成单 GPU 5000 token/s 吞吐量以及每用户 180 token/s 的交互速率。

    推荐理由:文章系统拆解了超大混合架构模型在显卡上的显存预算计算与拓扑选择,为超大规模模型落地分离式推理提供了可复用的调优方法论。