跳到正文
原文
Hugging Face Blog·· 2022-10-12AI 评分36

Bloom 推理优化故事

Optimization story: Bloom inference

AI 导读

Hugging Face 团队通过优化 BLOOM 推理服务器,实现了 5 倍延迟降低和 50 倍吞吐量提升。该过程涉及将基于 Megatron-Deepspeed 训练的 176B 参数模型移植到 transformers 库,并利用 Accelerate 进行分布式部署。

来源:Hugging Face Blog · huggingface.co