Skip to content

DUO: Diverse, Uncertain, On-Policy Query Generation and Selection for Reinforcement Learning from Human Feedback.

Xuening Feng, Zhaohui Jiang, Timo Kaufmann, Puchen Xu, Eyke Hllermeier, Paul Weng, Yifei Zhu

VenueA*AAAI
Year2025
ProceedingsAAAI

Browse the full AAAI paper archive.