跳到正文
原文
Hugging Face·· 8 天前精选AI 评分80

Transformers 原生支持运行 llama.cpp GGUF 量化模型

Transformers now runs llama.cpp quants

AI 导读

Hugging Face 在 Transformers 库中新增对 GGUF 量化格式的原生高效推理支持,用户可通过标准 from_pretrained API 直接加载 Hub 上的 GGUF 模型并在本地运行。

推荐理由

原文展示了在 PyTorch 生态中直接加载 GGUF 权重的实现路径,让开发者无需脱离 Transformers 工作流即可兼顾端侧推理性能。

来源:Hugging Face · huggingface.co