SafeConf: A Confidence-Calibrated Safety Self-Evaluation Method for Large Language Models.
Bo Zhang, Cong Gao, Linkang Yang, Bingxu Han, Minghao Hu, Zhunchen Luo, Guotong Geng, Xiaoying Bai, Jun Zhang, Wen Yao, Zhong Wang
Browse the full EMNLP paper archive.