Hugging Face Blog·· 2023-05-16AI 评分33
Smaller is better: Q8-Chat, an efficient generative AI experience on Xeon
Smaller is better: Q8-Chat, an efficient generative AI experience on Xeon
AI 导读
Hugging Face 与 Intel 合作推出 Q8-Chat,利用 SmoothQuant 技术将 LLaMA、OPT 等大语言模型量化为 8 位整数(INT8)。该方案使模型体积缩小约 2 倍,并在 Intel Xeon CPU 上实现低延迟推理,显著降低了运行成本。
来源:Hugging Face Blog · huggingface.co