跳到正文
原文
Hugging Face Blog·· 2023-05-16AI 评分33

Smaller is better: Q8-Chat, an efficient generative AI experience on Xeon

Smaller is better: Q8-Chat, an efficient generative AI experience on Xeon

AI 导读

Hugging Face 与 Intel 合作推出 Q8-Chat,利用 SmoothQuant 技术将 LLaMA、OPT 等大语言模型量化为 8 位整数(INT8)。该方案使模型体积缩小约 2 倍,并在 Intel Xeon CPU 上实现低延迟推理,显著降低了运行成本。

来源:Hugging Face Blog · huggingface.co