Josef Dai
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
6
Venues
3
Active years
2024–2025
Best venue rank
A*
Where they publish
Papers
6 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | AAAI | Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback. | Jiayi Zhou, Jiaming Ji, Josef Dai, Yaodong Yang |
| 2025 | ACL | SafeLawBench: Towards Safe Alignment of Large Language Models. | Chuxue Cao, Han Zhu, Jiaming Ji, Qichao Sun, Zhenghao Zhu, Yinyu Wu, Josef Dai, Yaodong Yang, Sirui Han, Yike Guo |
| 2025 | ACL | PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference. | Jiaming Ji, Donghai Hong, Borong Zhang, Boyuan Chen, Josef Dai, Boren Zheng, Tianyi Alex Qiu, Jiayi Zhou, Kaile Wang, Boxun Li, Sirui Han, Yike Guo, Yaodong Yang |
| 2025 | ACL | Language Models Resist Alignment: Evidence From Data Compression. | Jiaming Ji, Kaile Wang, Tianyi Alex Qiu, Boyuan Chen, Jiayi Zhou, Changye Li, Hantao Lou, Josef Dai, Yunhuai Liu, Yaodong Yang |
| 2025 | ACL | Reward Generalization in RLHF: A Topological Perspective. | Tianyi Alex Qiu, Fanzhi Zeng, Jiaming Ji, Dong Yan, Kaile Wang, Jiayi Zhou, Yang Han, Josef Dai, Xuehai Pan, Yaodong Yang |
| 2024 | ICLR | Safe RLHF: Safe Reinforcement Learning from Human Feedback. | Josef Dai, Xuehai Pan, Ruiyang Sun, Jiaming Ji, Xinbo Xu, Mickel Liu, Yizhou Wang, Yaodong Yang |