| 2025 | ACL | Monitoring Decoding: Mitigating Hallucination via Evaluating the Factuality of Partial Response during Generation. | Yurui Chang, Bochuan Cao, Lu Lin |
| 2025 | ACL | JoPA: Explaining Large Language Model's Generation via Joint Prompt Attribution. | Yurui Chang, Bochuan Cao, Yujia Wang, Jinghui Chen, Lu Lin |
| 2025 | CCS | You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors. | Bochuan Cao, Changjiang Li, Yuanpu Cao, Yameng Ge, Ting Wang, Jinghui Chen |
| 2025 | ICML | TruthFlow: Truthful LLM Generation via Representation Flow Correction. | Hanyu Wang, Bochuan Cao, Yuanpu Cao, Jinghui Chen |
| 2025 | ICML | AdvI2I: Adversarial Image Attack on Image-to-Image Diffusion Models. | Yaopei Zeng, Yuanpu Cao, Bochuan Cao, Yurui Chang, Jinghui Chen, Lu Lin |
| 2025 | IJCNLP | On the Convergence of Moral Self-Correction in Large Language Models. | Guangliang Liu, Haitao Mao, Bochuan Cao, Xitong Zhang, Zhiyu Xue, Rongrong Wang, Kristen Marie Johnson |
| 2025 | NAACL | WordGame: Efficient & Effective LLM Jailbreak via Simultaneous Obfuscation in Query and Response. | Tianrong Zhang, Bochuan Cao, Yuanpu Cao, Lu Lin, Prasenjit Mitra, Jinghui Chen |
| 2024 | ACL | Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM. | Bochuan Cao, Yuanpu Cao, Lu Lin, Jinghui Chen |
| 2024 | ACL | Jailbreak Open-Sourced Large Language Models via Enforced Decoding. | Hangfan Zhang, Zhimeng Guo, Huaisheng Zhu, Bochuan Cao, Lu Lin, Jinyuan Jia, Jinghui Chen, Dinghao Wu |
| 2024 | NAACL | Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections. | Yuanpu Cao, Bochuan Cao, Jinghui Chen |