Skip to content

Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling.

Qiyuan Deng, Xuefeng Bai, Kehai Chen, Yaowei Wang, Liqiang Nie, Min Zhang

VenueA*ACL
Year2025
ProceedingsACL (1)

Browse the full ACL paper archive.