MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization.
Yang Zhao, Hepeng Wang, Xiao Ding, Yangou Ouyang, Bibo Cai, Kai Xiong, Jinglong Gao, Zhouhao Sun, Li Du, Bing Qin, Ting Liu
Browse the full ACL paper archive.