Learning Value Functions in Deep Policy Gradients using Residual Variance.
Yannis Flet-Berliac, Reda Ouhamma, Odalric-Ambrym Maillard, Philippe Preux
Browse the full ICLR paper archive.
Yannis Flet-Berliac, Reda Ouhamma, Odalric-Ambrym Maillard, Philippe Preux
Browse the full ICLR paper archive.