Hugging Face Blog·· 2023-09-29精选AI 评分66
TRL 库集成 DDPO 训练器,支持微调 Stable Diffusion 对齐人类审美
Finetune Stable Diffusion Models with DDPO via TRL
AI 导读
Hugging Face 在 TRL 库中集成 DDPOTrainer,提供使用 Denoising Diffusion Policy Optimization 微调 Stable Diffusion 的完整代码与参数配置。该方法通过审美奖励模型对齐人类偏好,无需中间监督微调,支持 LoRA 训练,可显著提升生成图像质量。
推荐理由
TRL 库集成 DDPO 训练器,提供微调 Stable Diffusion 的完整代码与参数配置,可直接复现人类审美对齐。
来源:Hugging Face Blog · huggingface.co