Skip to content

Reliability and Learnability of Human Bandit Feedback for Sequence-to-Sequence Reinforcement Learning.

Julia Kreutzer, Joshua Uyheng, Stefan Riezler

VenueA*ACL
Year2018
ProceedingsACL (1)

Browse the full ACL paper archive.