Navigating Noisy Feedback: Enhancing Reinforcement Learning with Error-Prone Language Models.
Muhan Lin, Shuyang Shi, Yue Guo, Behdad Chalaki, Vaishnav Tadiparthi, Ehsan Moradi-Pari, Simon Stepputtis, Joseph Campbell, Katia P. Sycara
Browse the full EMNLP paper archive.