Improving Large Language Models via Fine-grained Reinforcement Learning with Minimum Editing Constraint.
Zhipeng Chen, Kun Zhou, Xin Zhao, Junchen Wan, Fuzheng Zhang, Di Zhang, Ji-Rong Wen
Browse the full ACL paper archive.
Zhipeng Chen, Kun Zhou, Xin Zhao, Junchen Wan, Fuzheng Zhang, Di Zhang, Ji-Rong Wen
Browse the full ACL paper archive.