Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models.
Guangyu Yang, Jinghong Chen, Jingbiao Mei, Weizhe Lin, Bill Byrne
Browse the full ACL paper archive.
Guangyu Yang, Jinghong Chen, Jingbiao Mei, Weizhe Lin, Bill Byrne
Browse the full ACL paper archive.