Reinforcement Learning for Bandit Neural Machine Translation with Simulated Human Feedback.
Khanh Nguyen, Hal Daum III, Jordan L. Boyd-Graber
Browse the full EMNLP paper archive.
Khanh Nguyen, Hal Daum III, Jordan L. Boyd-Graber
Browse the full EMNLP paper archive.