跳到正文
原文
Hugging Face Blog·· 2025-06-03精选AI 评分80

TRL 新增 vLLM 共置模式实现训练推理同卡

No GPU left behind: Unlocking Efficiency with Co-located vLLM in TRL

AI 导读

TRL 新增 vLLM 共置模式,将训练与推理置于同一 GPU 进程组,消除 HTTP 通信与设备闲置。该模式支持 TP/DP 并行,配合 vLLM sleep API 与 DeepSpeed ZeRO 优化,在 Qwen2.5-72B 等模型上实现更高吞吐量与更低硬件成本。

推荐理由

TRL 新增 vLLM 共置模式实现训练推理同卡,显著降低硬件成本并提升大模型训练效率。

来源:Hugging Face Blog · huggingface.co