Hugging Face Blog·· 2023-09-12精选AI 评分72
Transformers 原生量化方案对比:bitsandbytes 与 GPTQ
Overview of natively supported quantization schemes in 🤗 Transformers
AI 导读
Hugging Face 博客对比了 Transformers 中 bitsandbytes 与 auto-gptq 两种原生量化方案。GPTQ 在文本生成推理速度上显著优于 bitsandbytes,而 bitsandbytes 在微调适配器时速度更快且支持跨模态。文章建议先使用 bitsandbytes 进行零样本量化并微调适配器,再使用 GPTQ 量化合并后的模型以部署。
推荐理由
通过实测对比 bitsandbytes 与 GPTQ 在推理与微调中的性能差异,提供量化方案选型与混合使用策略。
来源:Hugging Face Blog · huggingface.co