R*: Efficient Reward Design via Reward Structure Evolution and Parameter Alignment Optimization with Large Language Models.
Pengyi Li, Jianye Hao, Hongyao Tang, Yifu Yuan, Jinbin Qiao, Zibin Dong, Yan Zheng
Browse the full ICML paper archive.
Pengyi Li, Jianye Hao, Hongyao Tang, Yifu Yuan, Jinbin Qiao, Zibin Dong, Yan Zheng
Browse the full ICML paper archive.