Hugging Face·· 8 天前精选AI 评分80
Transformers 原生支持运行 llama.cpp GGUF 量化模型
Transformers now runs llama.cpp quants
AI 导读
Hugging Face 在 Transformers 库中新增对 GGUF 量化格式的原生高效推理支持,用户可通过标准 from_pretrained API 直接加载 Hub 上的 GGUF 模型并在本地运行。
推荐理由
原文展示了在 PyTorch 生态中直接加载 GGUF 权重的实现路径,让开发者无需脱离 Transformers 工作流即可兼顾端侧推理性能。
来源:Hugging Face · huggingface.co