Dense Reward for Free in Reinforcement Learning from Human Feedback.
Alex James Chan, Hao Sun, Samuel Holt, Mihaela van der Schaar
Browse the full ICML paper archive.
Alex James Chan, Hao Sun, Samuel Holt, Mihaela van der Schaar
Browse the full ICML paper archive.