Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training.
Fenghua Weng, Jian Lou, Jun Feng, Minlie Huang, Wenjie Wang
Browse the full EMNLP paper archive.
Fenghua Weng, Jian Lou, Jun Feng, Minlie Huang, Wenjie Wang
Browse the full EMNLP paper archive.