Align-RUDDER: Learning From Few Demonstrations by Reward Redistribution.
Vihang Patil, Markus Hofmarcher, Marius-Constantin Dinu, Matthias Dorfer, Patrick M. Blies, Johannes Brandstetter, Jos Antonio Arjona-Medina, Sepp Hochreiter
Browse the full ICML paper archive.