跳到正文
原文
Hugging Face Blog·· 2023-09-29精选AI 评分66

TRL 库集成 DDPO 训练器,支持微调 Stable Diffusion 对齐人类审美

Finetune Stable Diffusion Models with DDPO via TRL

AI 导读

Hugging Face 在 TRL 库中集成 DDPOTrainer,提供使用 Denoising Diffusion Policy Optimization 微调 Stable Diffusion 的完整代码与参数配置。该方法通过审美奖励模型对齐人类偏好,无需中间监督微调,支持 LoRA 训练,可显著提升生成图像质量。

推荐理由

TRL 库集成 DDPO 训练器,提供微调 Stable Diffusion 的完整代码与参数配置,可直接复现人类审美对齐。

来源:Hugging Face Blog · huggingface.co