QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training-Inference Mismatch.
Hao Gu, Hao Wang, Jiacheng Liu, Lujun Li, Qiyuan Zhu, Bei Liu, Binxing Xu, Lei Wang, Xintong Yang, Sida Lin, Sirui Han, Yike Guo
Browse the full ACL paper archive.