PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model.
Baijiong Lin, Weisen Jiang, Yuancheng Xu, Hao Chen, Ying-Cong Chen
Browse the full ICML paper archive.
Baijiong Lin, Weisen Jiang, Yuancheng Xu, Hao Chen, Ying-Cong Chen
Browse the full ICML paper archive.