Skip to content

Josef Dai

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

6

Venues

3

Active years

2024–2025

Best venue rank

A*

Where they publish

Papers

6 indexed papers, newest first.

YearVenueTitleAuthors
2025AAAISequence to Sequence Reward Modeling: Improving RLHF by Language Feedback.Jiayi Zhou, Jiaming Ji, Josef Dai, Yaodong Yang
2025ACLSafeLawBench: Towards Safe Alignment of Large Language Models.Chuxue Cao, Han Zhu, Jiaming Ji, Qichao Sun, Zhenghao Zhu, Yinyu Wu, Josef Dai, Yaodong Yang, Sirui Han, Yike Guo
2025ACLPKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference.Jiaming Ji, Donghai Hong, Borong Zhang, Boyuan Chen, Josef Dai, Boren Zheng, Tianyi Alex Qiu, Jiayi Zhou, Kaile Wang, Boxun Li, Sirui Han, Yike Guo, Yaodong Yang
2025ACLLanguage Models Resist Alignment: Evidence From Data Compression.Jiaming Ji, Kaile Wang, Tianyi Alex Qiu, Boyuan Chen, Jiayi Zhou, Changye Li, Hantao Lou, Josef Dai, Yunhuai Liu, Yaodong Yang
2025ACLReward Generalization in RLHF: A Topological Perspective.Tianyi Alex Qiu, Fanzhi Zeng, Jiaming Ji, Dong Yan, Kaile Wang, Jiayi Zhou, Yang Han, Josef Dai, Xuehai Pan, Yaodong Yang
2024ICLRSafe RLHF: Safe Reinforcement Learning from Human Feedback.Josef Dai, Xuehai Pan, Ruiyang Sun, Jiaming Ji, Xinbo Xu, Mickel Liu, Yizhou Wang, Yaodong Yang