Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models.
Chengao Li, Hanyu Zhang, Yunkun Xu, Hongyan Xue, Xiang Ao, Qing He
Browse the full ACL paper archive.
Chengao Li, Hanyu Zhang, Yunkun Xu, Hongyan Xue, Xiang Ao, Qing He
Browse the full ACL paper archive.