Hugging Face Blog·· 2023-08-23精选AI 评分70
Transformers 原生集成 AutoGPTQ 支持模型量化
Making LLMs lighter with AutoGPTQ and transformers
AI 导读
Hugging Face 在 Transformers 中原生集成 AutoGPTQ 库,支持使用 GPTQ 算法将大语言模型量化至 8、4、3 或 2-bit 精度。该集成兼容 Nvidia 和 AMD 显卡,4-bit 量化下精度损失极小,推理速度接近 fp16 基线,并支持通过 PEFT 对量化模型进行微调。
推荐理由
原生集成让量化部署更便捷,显著降低显存占用且保持推理速度。
来源:Hugging Face Blog · huggingface.co