Unearthing Gems from Stones: Policy Optimization with Negative Sample Augmentation for LLM Reasoning.
Zhaohui Yang, Yuxiao Ye, Shilei Jiang, Shihong Deng, Chen Hu, Linjing Li, Daxin Jiang
Browse the full EMNLP paper archive.
Zhaohui Yang, Yuxiao Ye, Shilei Jiang, Shihong Deng, Chen Hu, Linjing Li, Daxin Jiang
Browse the full EMNLP paper archive.