| 2026 | AAAI | When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs' Toxicity. | Shiyao Cui, Xijia Feng, Yingkang Wang, Junxiao Yang, Zhexin Zhang, Biplab Sikdar, Hongning Wang, Han Qiu, Minlie Huang |
| 2026 | ACL | New Terms, New Toxicity: Consensus-based Chinese Neologism Toxicity Detection via Search-Augmented LLMs. | Shiyao Cui, Qinglin Zhang, Di Wang, Yida Lu, Zhexin Zhang, Jinhua Gao, Jinglin Yang, Min He, Han Qiu, Minlie Huang |
| 2026 | ACL | LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety. | Junxiao Yang, Haoran Liu, Jinzhe Tu, Jiale Cheng, Zhexin Zhang, Shiyao Cui, Jiaqi Weng, Jialing Tao, Hui Xue, Hongning Wang, Han Qiu, Minlie Huang |
| 2026 | ACL | How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study. | Zhexin Zhang, Xian Qi Loye, Victor Shea-Jay Huang, Junxiao Yang, Qi Zhu, Shiyao Cui, Fei Mi, Lifeng Shang, Yingkang Wang, Hongning Wang, Minlie Huang |
| 2025 | ACL | LongSafety: Evaluating Long-Context Safety of Large Language Models. | Yida Lu, Jiale Cheng, Zhexin Zhang, Shiyao Cui, Cunxiang Wang, Xiaotao Gu, Yuxiao Dong, Jie Tang, Hongning Wang, Minlie Huang |
| 2025 | ACL | Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints. | Junxiao Yang, Zhexin Zhang, Shiyao Cui, Hongning Wang, Minlie Huang |
| 2025 | KDD | Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models. | Shangqing Tu, Zhuoran Pan, Wenxuan Wang, Zhexin Zhang, Yuliang Sun, Jifan Yu, Hongning Wang, Lei Hou, Juanzi Li |
| 2024 | ACL | SafetyBench: Evaluating the Safety of Large Language Models. | Zhexin Zhang, Leqi Lei, Lindong Wu, Rui Sun, Yongkang Huang, Chong Long, Xiao Liu, Xuanyu Lei, Jie Tang, Minlie Huang |
| 2024 | ACL | Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization. | Zhexin Zhang, Junxiao Yang, Pei Ke, Fei Mi, Hongning Wang, Minlie Huang |
| 2024 | CHI | A Design of Interface for Visual-Impaired People to Access Visual Information from Images Featuring Large Language Models and Visual Language Models. | Zhexin Zhang |
| 2024 | EMNLP | ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectors. | Zhexin Zhang, Yida Lu, Jingyuan Ma, Di Zhang, Rui Li, Pei Ke, Hao Sun, Lei Sha, Zhifang Sui, Hongning Wang, Minlie Huang |
| 2023 | ACL | MoralDial: A Framework to Train and Evaluate Moral Dialogue Systems via Moral Discussions. | Hao Sun, Zhexin Zhang, Fei Mi, Yasheng Wang, Wei Liu, Jianwei Cui, Bin Wang, Qun Liu, Minlie Huang |
| 2023 | ACL | Self-Supervised Sentence Polishing by Adding Engaging Modifiers. | Zhexin Zhang, Jian Guan, Xin Cui, Yu Ran, Bo Liu, Minlie Huang |
| 2023 | ACL | ETHICIST: Targeted Training Data Extraction Through Loss Smoothed Soft Prompting and Calibrated Confidence Estimation. | Zhexin Zhang, Jiaxin Wen, Minlie Huang |
| 2023 | EMNLP | Unveiling the Implicit Toxicity in Large Language Models. | Jiaxin Wen, Pei Ke, Hao Sun, Zhexin Zhang, Chengfei Li, Jinfeng Bai, Minlie Huang |
| 2023 | EMNLP | InstructSafety: A Unified Framework for Building Multidimensional and Explainable Safety Detector through Instruction Tuning. | Zhexin Zhang, Jiale Cheng, Hao Sun, Jiawen Deng, Minlie Huang |
| 2022 | ACL | Selecting Stickers in Open-Domain Dialogue through Multitask Learning. | Zhexin Zhang, Yeshuang Zhu, Zhengcong Fei, Jinchao Zhang, Jie Zhou |
| 2022 | EMNLP | Constructing Highly Inductive Contexts for Dialogue Safety through Controllable Reverse Generation. | Zhexin Zhang, Jiale Cheng, Hao Sun, Jiawen Deng, Fei Mi, Yasheng Wang, Lifeng Shang, Minlie Huang |
| 2022 | EMNLP | Automatic Comment Generation for Chinese Student Narrative Essays. | Zhexin Zhang, Jian Guan, Guowei Xu, Yixiang Tian, Minlie Huang |
| 2022 | HCI | Visualizing the Electroencephalography Signal Discrepancy When Maintaining Social Distancing: EEG-Based Interactive Moir Patterns. | Jingjing Li, Ye Yang, Zhexin Zhang, Yinan Zhao, Xanat Vargas Meza, Yoichi Ochiai |
| 2022 | HCI | Indoor Auto-Navigate System for Electric Wheelchairs in a Nursing Home. | Zhexin Zhang, Jun-Li Lu, Yoichi Ochiai |
| 2022 | NAACL | Persona-Guided Planning for Controlling the Protagonist's Persona in Story Generation. | Zhexin Zhang, Jiaxin Wen, Jian Guan, Minlie Huang |
| 2021 | ACL | OpenMEVA: A Benchmark for Evaluating Open-ended Story Generation Metrics. | Jian Guan, Zhexin Zhang, Zhuoer Feng, Zitao Liu, Wenbiao Ding, Xiaoxi Mao, Changjie Fan, Minlie Huang |
| 2021 | HCI | A Customized VR Rendering with Neural-Network Generated Frames for Reducing VR Dizziness. | Zhexin Zhang, Jun-Li Lu, Yoichi Ochiai |
| 2019 | NDSS | Neural Machine Translation Inspired Binary Code Similarity Comparison beyond Function Pairs. | Fei Zuo, Xiaopeng Li, Patrick Young, Lannan Luo, Qiang Zeng, Zhexin Zhang |