Hugging Face Blog·· 2022-10-12AI 评分36
Bloom 推理优化故事
Optimization story: Bloom inference
AI 导读
Hugging Face 团队通过优化 BLOOM 推理服务器,实现了 5 倍延迟降低和 50 倍吞吐量提升。该过程涉及将基于 Megatron-Deepspeed 训练的 176B 参数模型移植到 transformers 库,并利用 Accelerate 进行分布式部署。
来源:Hugging Face Blog · huggingface.co