Skip to content

Language Models Learn to Mislead Humans via RLHF.

Jiaxin Wen, Ruiqi Zhong, Akbir Khan, Ethan Perez, Jacob Steinhardt, Minlie Huang, Samuel R. Bowman, He He, Shi Feng

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.