HERO: Human-Feedback Efficient Reinforcement Learning for Online Diffusion Model Finetuning.
Ayano Hiranaka, Shang-Fu Chen, Chieh-Hsin Lai, Dongjun Kim, Naoki Murata, Takashi Shibuya, Wei-Hsiang Liao, Shao-Hua Sun, Yuki Mitsufuji
Browse the full ICLR paper archive.