Skip to content

Improved Policy Optimization for Mixture-of-Experts Models: Importance Sampling and Rewarding from an Expert-Centric Perspective.

Yining Qian, Jinpeng Li, Fei Mi, Lifeng Shang, Xiang Zhang

VenueA*ACL
Year2026
ProceedingsACL (Findings)

Browse the full ACL paper archive.