On-policy Reinforcement Fine-tuning with Offline reward for Multi-step Embodied Planning.
Di Wu, Jiaxin Fan, Chloe Gu, Guanbo Wang, Wei Yin, Wenhao Li, Bo Jin
Browse the full ACL paper archive.
Di Wu, Jiaxin Fan, Chloe Gu, Guanbo Wang, Wei Yin, Wenhao Li, Bo Jin
Browse the full ACL paper archive.