跳到正文
原文
vLLM 官方博客(网页)·· 7 小时前AI 评分31

vLLM 社区概览

Community

AI 导读

vLLM 是面向大语言模型(LLM)的高吞吐与高内存效率推理服务引擎,支持在 CUDA、ROCm、XPU 及 CPU 等硬件上部署并提供兼容 OpenAI 的 API。该引擎通过 PagedAttention 与连续批处理(continuous batching)提升 GPU 利用率以降低推理成本,并获得 a16z、Sequoia Capital 及 NVIDIA 等机构的资金与算力支持。

来源:vLLM 官方博客(网页) · vllm.ai