Skip to content

LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment.

Shipeng Li, Zhiqin Yang, Shikun Li, Xiaobo Xia, Hengyu Liu, Xinghua Zhang, Gaode Chen, Dong Fang, Ying Tai, Zhe Peng

VenueA*ACL
Year2026
ProceedingsACL (Findings)

Browse the full ACL paper archive.