Hugging Face Blog·· 2025-06-03精选AI 评分80
TRL 新增 vLLM 共置模式实现训练推理同卡
No GPU left behind: Unlocking Efficiency with Co-located vLLM in TRL
AI 导读
TRL 新增 vLLM 共置模式,将训练与推理置于同一 GPU 进程组,消除 HTTP 通信与设备闲置。该模式支持 TP/DP 并行,配合 vLLM sleep API 与 DeepSpeed ZeRO 优化,在 Qwen2.5-72B 等模型上实现更高吞吐量与更低硬件成本。
推荐理由
TRL 新增 vLLM 共置模式实现训练推理同卡,显著降低硬件成本并提升大模型训练效率。
来源:Hugging Face Blog · huggingface.co