Semi-Supervised Reward Modeling via Iterative Self-Training.
Yifei He, Haoxiang Wang, Ziyan Jiang, Alexandros Papangelis, Han Zhao
Browse the full EMNLP paper archive.
Yifei He, Haoxiang Wang, Ziyan Jiang, Alexandros Papangelis, Han Zhao
Browse the full EMNLP paper archive.