Skip to content

Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference.

Qining Zhang, Lei Ying

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.