Skip to content

Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data.

Han Xia, Songyang Gao, Qiming Ge, Zhiheng Xi, Qi Zhang, Xuanjing Huang

VenueA*EMNLP
Year2024
ProceedingsEMNLP (Findings)

Browse the full EMNLP paper archive.