| 2025 | ACL | Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment. | Xueyao Zhang, Yuancheng Wang, Chaoren Wang, Ziniu Li, Zhuo Chen, Zhizheng Wu |
| 2025 | ICLR | Preserving Diversity in Supervised Fine-Tuning of Large Language Models. | Ziniu Li, Congliang Chen, Tian Xu, Zeyu Qin, Jiancong Xiao, Zhi-Quan Luo, Ruoyu Sun |
| 2025 | ICLR | Understanding and Mitigating Hallucination in Large Vision-Language Models via Modular Attribution and Intervention. | Tianyun Yang, Ziniu Li, Juan Cao, Chang Xu |
| 2025 | ICLR | Adam-mini: Use Fewer Learning Rates To Gain More. | Yushun Zhang, Congliang Chen, Ziniu Li, Tian Ding, Chenwei Wu, Diederik P. Kingma, Yinyu Ye, Zhi-Quan Luo, Ruoyu Sun |
| 2025 | ICML | Controlling Large Language Model with Latent Action. | Chengxing Jia, Ziniu Li, Pengyuan Wang, Yi-Chen Li, Zhenyu Hou, Yuxiao Dong, Yang Yu |
| 2024 | EMNLP | Unlocking Black-Box Prompt Tuning Efficiency via Zeroth-Order Optimization. | Heshen Zhan, Congliang Chen, Tian Ding, Ziniu Li, Ruoyu Sun |
| 2024 | ICLR | When is RL better than DPO in RLHF? A Representation and Optimization Perspective. | Ziniu Li, Tian Xu, Yang Yu |
| 2024 | ICML | ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models. | Ziniu Li, Tian Xu, Yushun Zhang, Zhihang Lin, Yang Yu, Ruoyu Sun, Zhi-Quan Luo |
| 2023 | UAI | Provably Efficient Adversarial Imitation Learning with Unknown Transitions. | Tian Xu, Ziniu Li, Yang Yu, Zhi-Quan Luo |
| 2022 | ICLR | HyperDQN: A Randomized Exploration Method for Deep Reinforcement Learning. | Ziniu Li, Yingru Li, Yushun Zhang, Tong Zhang, Zhi-Quan Luo |