Skip to content

Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination.

Mingqi Wu, Zhihao Zhang, Qiaole Dong, Zhiheng Xi, Jun Zhao, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Huijie Lv, Ming Zhang, Yanwei Fu, Qin Liu, Songyang Zhang, Qi Zhang

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.