Skip to content

Neural Dueling Bandits: Preference-Based Optimization with Human Feedback.

Arun Verma, Zhongxiang Dai, Xiaoqiang Lin, Patrick Jaillet, Bryan Kian Hsiang Low

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.