Skip to content

Safety Guardrails of Large Language Models Are Vulnerable to Value-Driven Adversarial Prompting.

Xiaohao Luo, Ying Wei, Zhijun Li

VenueA*ACL
Year2026
ProceedingsACL (Findings)

Browse the full ACL paper archive.