| 2026 | ACL | Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race? | Yuan Xin, Dingfan Chen, Linyi Yang, Michael Backes, Xiao Zhang |
| 2025 | ICML | Provably Cost-Sensitive Adversarial Defense via Randomized Smoothing. | Yuan Xin, Dingfan Chen, Michael Backes, Xiao Zhang |
| 2024 | ECAI | Inside the Black Box: Detecting Data Leakage in Pre-Trained Language Encoders. | Yuan Xin, Zheng Li, Ning Yu, Dingfan Chen, Mario Fritz, Michael Backes, Yang Zhang |
| 2024 | NAACL | PoLLMgraph: Unraveling Hallucinations in Large Language Models via State Transition Dynamics. | Derui Zhu, Dingfan Chen, Qing Li, Zongxiong Chen, Lei Ma, Jens Grossklags, Mario Fritz |
| 2022 | ICLR | RelaxLoss: Defending Membership Inference Attacks without Losing Utility. | Dingfan Chen, Ning Yu, Mario Fritz |
| 2022 | ICLR | Responsible Disclosure of Generative Models Using Scalable Fingerprinting. | Ning Yu, Vladislav Skripniuk, Dingfan Chen, Larry S. Davis, Mario Fritz |
| 2021 | ACSAC | BadNL: Backdoor Attacks against NLP Models with Semantic-preserving Improvements. | Xiaoyi Chen, Ahmed Salem, Dingfan Chen, Michael Backes, Shiqing Ma, Qingni Shen, Zhonghai Wu, Yang Zhang |
| 2020 | CCS | GAN-Leaks: A Taxonomy of Membership Inference Attacks against Generative Models. | Dingfan Chen, Ning Yu, Yang Zhang, Mario Fritz |