Improved Policy Optimization for Mixture-of-Experts Models: Importance Sampling and Rewarding from an Expert-Centric Perspective.
Yining Qian, Jinpeng Li, Fei Mi, Lifeng Shang, Xiang Zhang
Browse the full ACL paper archive.
Yining Qian, Jinpeng Li, Fei Mi, Lifeng Shang, Xiang Zhang
Browse the full ACL paper archive.