Value-aligned Behavior Cloning for Offline Reinforcement Learning via Bi-level Optimization.
Xingyu Jiang, Ning Gao, Xiuhui Zhang, Hongkun Dou, Yue Deng
Browse the full ICLR paper archive.
Xingyu Jiang, Ning Gao, Xiuhui Zhang, Hongkun Dou, Yue Deng
Browse the full ICLR paper archive.