RLMR: Reinforcement Learning with Mixed Rewards for Creative Writing.
Jianxing Liao, Tian Zhang, Xiao Feng, Yusong Zhang, Haorui Wang, Bosi Wen, Ziying Wang, Runzhi Shi
Browse the full AAAI paper archive.
Jianxing Liao, Tian Zhang, Xiao Feng, Yusong Zhang, Haorui Wang, Bosi Wen, Ziying Wang, Runzhi Shi
Browse the full AAAI paper archive.