Hugging Face Blog·· 2022-05-02精选AI 评分60
使用 PyTorch FSDP 加速大模型训练
Accelerate Large Model Training using PyTorch Fully Sharded Data Parallel
AI 导读
Hugging Face 发布教程介绍如何使用 Accelerate 库集成 PyTorch Fully Sharded Data Parallel (FSDP) 训练大模型。实测显示 FSDP 相比 DDP 可将最大批量提升 2-3 倍,并支持 CPU Offload 在单卡运行 1.5B 模型。文章同时指出 FSDP 目前不支持混合精度,并强调需先准备模型再创建优化器以避免参数组丢失。
推荐理由
文章通过 GPT-2 实测对比 DDP 与 FSDP,给出显存节省与批量提升数据,提供可直接复用的配置与代码规范。
来源:Hugging Face Blog · huggingface.co