MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions.
Yekun Chai, Haoran Sun, Huang Fang, Shuohuan Wang, Yu Sun, Hua Wu
Browse the full ICLR paper archive.
Yekun Chai, Haoran Sun, Huang Fang, Shuohuan Wang, Yu Sun, Hua Wu
Browse the full ICLR paper archive.