DUO: Diverse, Uncertain, On-Policy Query Generation and Selection for Reinforcement Learning from Human Feedback.
Xuening Feng, Zhaohui Jiang, Timo Kaufmann, Puchen Xu, Eyke Hllermeier, Paul Weng, Yifei Zhu
Browse the full AAAI paper archive.
Xuening Feng, Zhaohui Jiang, Timo Kaufmann, Puchen Xu, Eyke Hllermeier, Paul Weng, Yifei Zhu
Browse the full AAAI paper archive.