Skip to content

The Optimal Reward Baseline for Gradient-Based Reinforcement Learning.

Lex Weaver, Nigel Tao

VenueAUAI
Year2001
ProceedingsUAI

Browse the full UAI paper archive.