Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling.
Qiyuan Deng, Xuefeng Bai, Kehai Chen, Yaowei Wang, Liqiang Nie, Min Zhang
Browse the full ACL paper archive.
Qiyuan Deng, Xuefeng Bai, Kehai Chen, Yaowei Wang, Liqiang Nie, Min Zhang
Browse the full ACL paper archive.