Skip to content

On-policy Reinforcement Fine-tuning with Offline reward for Multi-step Embodied Planning.

Di Wu, Jiaxin Fan, Chloe Gu, Guanbo Wang, Wei Yin, Wenhao Li, Bo Jin

VenueA*ACL
Year2026
ProceedingsACL (1)

Browse the full ACL paper archive.