Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data.
Han Xia, Songyang Gao, Qiming Ge, Zhiheng Xi, Qi Zhang, Xuanjing Huang
Browse the full EMNLP paper archive.
Han Xia, Songyang Gao, Qiming Ge, Zhiheng Xi, Qi Zhang, Xuanjing Huang
Browse the full EMNLP paper archive.