Skip to content

Making RL with Preference-based Feedback Efficient via Randomization.

Runzhe Wu, Wen Sun

VenueA*ICLR
Year2024
ProceedingsICLR

Browse the full ICLR paper archive.