Enhancing Reinforcement Learning with Dense Rewards from Language Model Critic.
Meng Cao, Lei Shu, Lei Yu, Yun Zhu, Nevan Wichers, Yinxiao Liu, Lei Meng
Browse the full EMNLP paper archive.
Meng Cao, Lei Shu, Lei Yu, Yun Zhu, Nevan Wichers, Yinxiao Liu, Lei Meng
Browse the full EMNLP paper archive.