Skip to content

Reinforcement Learning from Imperfect Corrective Actions and Proxy Rewards.

Zhaohui Jiang, Xuening Feng, Paul Weng, Yifei Zhu, Yan Song, Tianze Zhou, Yujing Hu, Tangjie Lv, Changjie Fan

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.