Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation.
Yifeng Liu, Siqi Ouyang, Yatish Hosmane Revanasiddappa, Lei Li
Browse the full ACL paper archive.
Yifeng Liu, Siqi Ouyang, Yatish Hosmane Revanasiddappa, Lei Li
Browse the full ACL paper archive.