跳到正文
原文
Hugging Face Blog·· 2025-04-26精选AI 评分75

ServiceNow开源PipelineRL,实现推理中权重更新

PipelineRL

AI 导读

ServiceNow开源PipelineRL,通过推理中权重更新解决大规模LLM强化学习中的延迟与吞吐权衡问题。在7B和32B模型上,其推理性能与Open-Reasoner-Zero相当,但算法更简单且训练稳定。

推荐理由

ServiceNow开源PipelineRL,通过推理中权重更新解决RL训练中的延迟与吞吐权衡问题。

来源:Hugging Face Blog · huggingface.co