Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax.
Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang
Browse the full ACL paper archive.