Skip to content

Preference Poisoning Attacks on Reward Model Learning.

Junlin Wu, Jiongxiao Wang, Chaowei Xiao, Chenguang Wang, Ning Zhang, Yevgeniy Vorobeychik

VenueA*SP
Year2025
ProceedingsSP

Browse the full SP paper archive.