Skip to content

Policy Evaluation for Reinforcement Learning from Human Feedback: A Sample Complexity Analysis.

Zihao Li, Xiang Ji, Minshuo Chen, Mengdi Wang

Year2024
ProceedingsAISTATS

Browse the full AISTATS paper archive.