Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models.
Shaoning Sun, Mingzhu Cai, Huang He, Bingjin Chen, Siqi Bao, Yujiu Yang, Hua Wu, Haifeng Wang
Browse the full ACL paper archive.
Shaoning Sun, Mingzhu Cai, Huang He, Bingjin Chen, Siqi Bao, Yujiu Yang, Hua Wu, Haifeng Wang
Browse the full ACL paper archive.