Preference-Oriented Supervised Fine-Tuning: Favoring Target Model over Aligned Large Language Models.
Yuchen Fan, Yuzhong Hong, Qiushi Wang, Junwei Bao, Hongfei Jiang, Yang Song
Browse the full AAAI paper archive.
Yuchen Fan, Yuzhong Hong, Qiushi Wang, Junwei Bao, Hongfei Jiang, Yang Song
Browse the full AAAI paper archive.