跳到正文
原文
Hugging Face Blog·· 2026-09-03精选AI 评分74

100步GRPO微调LFM2.5-350M提升结构化输出合规性

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

AI 导读

Liquid AI 发布教程,展示使用 TRL 库和 GRPO 算法微调 LFM2.5-350M 模型。在 IFStruct 基准测试中,经过约 500 样本和 100 步训练,模型结构化输出合规率从 22.6% 提升至 29.7%,其中 JSON 通过率提升近 14 个百分点。

推荐理由

提供在免费算力上微调小模型提升结构化输出合规性的具体方法与数据。

来源:Hugging Face Blog · huggingface.co