跳到正文
原文
Hugging Face Blog·· 2023-05-15AI 评分36

如何在单张 AMD GPU 上使用 ROCm 运行类 ChatGPT 聊天机器人

Run a Chatgpt-like Chatbot on a Single GPU with ROCm

AI 导读

本文详解如何在单张 AMD GPU 上使用 ROCm 运行 130 亿参数的开源聊天机器人 Vicuna 13B。通过 GPTQ 技术将模型量化至 4-bit,可将显存需求从 28GB 降至 6GB,从而在内存受限环境下实现高效推理。教程提供了基于 Docker 和 PyTorch 的完整部署步骤,包括模型下载、量化及 Web UI 服务搭建。

来源:Hugging Face Blog · huggingface.co