Neural Dueling Bandits: Preference-Based Optimization with Human Feedback.
Arun Verma, Zhongxiang Dai, Xiaoqiang Lin, Patrick Jaillet, Bryan Kian Hsiang Low
Browse the full ICLR paper archive.
Arun Verma, Zhongxiang Dai, Xiaoqiang Lin, Patrick Jaillet, Bryan Kian Hsiang Low
Browse the full ICLR paper archive.