Query-Policy Misalignment in Preference-Based Reinforcement Learning.
Xiao Hu, Jianxiong Li, Xianyuan Zhan, Qing-Shan Jia, Ya-Qin Zhang
Browse the full ICLR paper archive.
Xiao Hu, Jianxiong Li, Xianyuan Zhan, Qing-Shan Jia, Ya-Qin Zhang
Browse the full ICLR paper archive.