Reliability and Learnability of Human Bandit Feedback for Sequence-to-Sequence Reinforcement Learning.
Julia Kreutzer, Joshua Uyheng, Stefan Riezler
Browse the full ACL paper archive.
Julia Kreutzer, Joshua Uyheng, Stefan Riezler
Browse the full ACL paper archive.