Skip to content

Xiangyu Qi

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

15

Venues

8

Active years

2021–2025

Best venue rank

A*

Where they publish

Papers

15 indexed papers, newest first.

YearVenueTitleAuthors
2025ACLDefensive Prompt Patch: A Robust and Generalizable Defense of Large Language Models against Jailbreak Attacks.Chen Xiong, Xiangyu Qi, Pin-Yu Chen, Tsung-Yi Ho
2025AIESThe Model Hears You: Audio Language Model Deployments Should Consider the Principle of Least Privilege.Luxi He, Xiangyu Qi, Michel Liao, Inyoung Cheong, Prateek Mittal, Danqi Chen, Peter Henderson
2025ICLRSafety Alignment Should be Made More Than Just a Few Tokens Deep.Xiangyu Qi, Ashwinee Panda, Kaifeng Lyu, Xiao Ma, Subhrajit Roy, Ahmad Beirami, Prateek Mittal, Peter Henderson
2025ICLROn Evaluating the Durability of Safeguards for Open-Weight LLMs.Xiangyu Qi, Boyi Wei, Nicholas Carlini, Yangsibo Huang, Tinghao Xie, Luxi He, Matthew Jagielski, Milad Nasr, Prateek Mittal, Peter Henderson
2025ICLRSORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal.Tinghao Xie, Xiangyu Qi, Yi Zeng, Yangsibo Huang, Udari Madhushani Sehwag, Kaixuan Huang, Luxi He, Boyi Wei, Dacheng Li, Ying Sheng, Ruoxi Jia, Bo Li, Kai Li, Danqi Chen, Peter Henderson, Prateek Mittal
2025NAACLLibra-Leaderboard: Towards Responsible AI through a Balanced Leaderboard of Safety and Capability.Haonan Li, Xudong Han, Zenan Zhai, Honglin Mu, Hao Wang, Zhenxuan Zhang, Yilin Geng, Shom Lin, Renxi Wang, Artem Shelmanov, Xiangyu Qi, Yuxia Wang, Donghai Hong, Youliang Yuan, Meng Chen, Haoqin Tu, Fajri Koto, Cong Zeng, Tatsuki Kuribayashi, Rishabh Bhardwaj, Bingchen Zhao, Yawen Duan, Yi Liu, Emad A. Alghamdi, Yaodong Yang, Yinpeng Dong, Soujanya Poria, Pengfei Liu, Zhengzhong Liu, Xuguang Ren, Eduard H. Hovy, Iryna Gurevych, Preslav Nakov, Monojit Choudhury, Timothy Baldwin
2025VROrbitText: A Hybrid Prediction System for Efficient and Effortless Text Entry in Virtual Reality.Zihao Li, Dongdong Weng, Xiaonuo Dongye, Jie Hao, Xiangyu Qi
2024AAAIVisual Adversarial Examples Jailbreak Aligned Large Language Models.Xiangyu Qi, Kaixuan Huang, Ashwinee Panda, Peter Henderson, Mengdi Wang, Prateek Mittal
2024ICLRFine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!Xiangyu Qi, Yi Zeng, Tinghao Xie, Pin-Yu Chen, Ruoxi Jia, Prateek Mittal, Peter Henderson
2024ICLRBaDExpert: Extracting Backdoor Functionality for Accurate Backdoor Input Detection.Tinghao Xie, Xiangyu Qi, Ping He, Yiming Li, Jiachen T. Wang, Prateek Mittal
2024ICMLAssessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications.Boyi Wei, Kaixuan Huang, Yangsibo Huang, Tinghao Xie, Xiangyu Qi, Mengzhou Xia, Prateek Mittal, Mengdi Wang, Peter Henderson
2023ICLRRevisiting the Assumption of Latent Separability for Backdoor Defenses.Xiangyu Qi, Tinghao Xie, Yiming Li, Saeed Mahloujifar, Prateek Mittal
2023ICMLUncovering Adversarial Risks of Test-Time Adaptation.Tong Wu, Feiran Jia, Xiangyu Qi, Jiachen T. Wang, Vikash Sehwag, Saeed Mahloujifar, Prateek Mittal
2022CVPRTowards Practical Deployment-Stage Backdoor Attack on Deep Neural Networks.Xiangyu Qi, Tinghao Xie, Ruizhe Pan, Jifeng Zhu, Yong Yang, Kai Bu
2021ICMLKnowledge Enhanced Machine Learning Pipeline against Diverse Adversarial Attacks.Nezihe Merve Grel, Xiangyu Qi, Luka Rimanic, Ce Zhang, Bo Li