Shihan Dou
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
39
Venues
8
Active years
2022–2026
Best venue rank
A*
Where they publish
Papers
39 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | MetaAct-RL: Training Language Models for Reasoning Through Meta-Action-Based Reinforcement Learning. | Zhiheng Xi, Yuhui Wang, Yiwen Ding, Guanyu Li, Senjie Jin, Shichun Liu, Jixuan Huang, Dingwen Yang, Jiafu Tang, Boyang Hong, Junjie Ye, Shihan Dou, Ming Zhang, Jian Guan, Wei Wu, Rui Zheng, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | From Scores to Preferences: Redefining Evaluation Paradigm for Speech Quality Reward Modeling. | Yifei Cao, Changhao Jiang, Jiabao Zhuang, Jiajun Sun, Ming Zhang, Zhiheng Xi, Hui Li, Shihan Dou, Yuran Wang, Yunke Zhang, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding. | Deming Ding, Shichun Liu, Enhui Yang, Jiahang Lin, Ziying Chen, Shihan Dou, Honglin Guo, Weiyu Cheng, Pengyu Zhao, Chengjun Xiao, Qunhong Zeng, Qi Zhang, Xuanjing Huang, Qidi Xu, Tao Gui |
| 2026 | ACL | Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style Control. | Changhao Jiang, Jiahao Chen, Zhenghao Xiang, Zhixiong Yang, Hanchen Wang, Jiabao Zhuang, Xinmeng Che, Jiajun Sun, Hui Li, Yifei Cao, Shihan Dou, Ming Zhang, Junjie Ye, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training. | Changhao Jiang, Ming Zhang, Yifei Cao, Junjie Ye, Xiaoran Fan, Shihan Dou, Zhiheng Xi, Jiajun Sun, Yi Dong, Yujiong Shen, Jingqi Tong, Baoyu Fan, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning. | Jiahang Lin, Kai Hu, Binghai Wang, Yuhao Zhou, Zhiheng Xi, Honglin Guo, Shichun Liu, Junzhe Wang, Shihan Dou, Enyu Zhou, Hang Yan, Zhenhua Han, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | DARM: Distribution-Aware Reward Modeling by Alleviating Biases from Low Preference-Context Dependency Data. | Shaofan Liu, Guoqiang Zhang, Shihan Dou, Huiyuan Zheng, Yiming Zhou, Junjie Ye, Shaowen Wang, Shichun Liu, Jiazheng Zhang, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization. | Junzhe Wang, Zhiheng Xi, Yajie Yang, Hao Luo, Shihan Dou, Tao Gui, Qi Zhang |
| 2026 | ACL | JanusMM: A Benchmark for Self-Deprecation Understanding in Real-World Multimodal Conversations. | Xinyi Xu, Bingguang Hao, Yongyi Xiong, Zimo Chen, Xinchen Liu, Hongxin Guo, Xuelong Wang, Silin Zhou, Shihan Dou |
| 2026 | ACL | LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models. | Ming Zhang, Yujiong Shen, Jingyi Deng, Yuhui Wang, Huayu Sha, Kexin Tan, Qiyuan Peng, Yue Zhang, Junzhe Wang, Shichun Liu, Yueyuan Huang, Jingqi Tong, Changhao Jiang, Yilong Wu, Zhihao Zhang, Mingqi Wu, Mingxu Chai, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2026 | ACL | PRISM: Probabilistic Reward Model with Inherent Structural Modeling. | Yuhang Zhou, Yixin Cao, Yuchen Ni, Shihan Dou, Xutian Chen, Ge Zhang, Xiang Liu, Guangnan Ye |
| 2026 | ACL | VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training. | Dingwei Zhu, Shihan Dou, Zhiheng Xi, Senjie Jin, Guoqiang Zhang, Jiazheng Zhang, Junjie Ye, Mingxu Chai, Enyu Zhou, Ming Zhang, Yuhui Wang, Caishuang Huang, Chenhao Huang, Yunke Zhang, Yuran Wang, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang |
| 2025 | AAAI | Alleviating Shifted Distribution in Human Preference Alignment through Meta-Learning. | Shihan Dou, Yan Liu, Enyu Zhou, Songyang Gao, Tianlong Li, Limao Xiong, Xin Zhao, Haoxiang Jia, Junjie Ye, Rui Zheng, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | ACL | DocFusion: A Unified Framework for Document Parsing Tasks. | Mingxu Chai, Ziyu Shen, Chong Zhang, Yue Zhang, Xiao Wang, Shihan Dou, Jihua Kang, Jiazheng Zhang, Qi Zhang |
| 2025 | ACL | Lost in the Context: Insufficient and Distracted Attention to Contexts in Preference Modeling. | Shihan Dou, Jiayi Chen, Chenhao Huang, Feng Chen, Wei Chengzhi, Huiyuan Zheng, Shichun Liu, Yan Liu, Chenxiao Liu, Chao Xin, Lin Yan, Zongzhang Zhang, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | ACL | Multi-Programming Language Sandbox for LLMs. | Shihan Dou, Jiazheng Zhang, Jianxiang Zang, Yunbo Tao, Weikang Zhou, Haoxiang Jia, Shichun Liu, Yuming Yang, Shenxi Wu, Zhiheng Xi, Muling Wu, Rui Zheng, Changze Lv, Limao Xiong, Shaoqing Zhang, Lin Zhang, Wenyu Zhan, Rongxiang Weng, Jingang Wang, Xunliang Cai, Yueming Wu, Ming Wen, Yixin Cao, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang |
| 2025 | ACL | Measuring Data Diversity for Instruction Tuning: A Systematic Analysis and A Reliable Metric. | Yuming Yang, Yang Nan, Junjie Ye, Shihan Dou, Xiao Wang, Shuo Li, Huijie Lv, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | ACL | PFDial: A Structured Dialogue Instruction Fine-tuning Method Based on UML Flowcharts. | Ming Zhang, Yuhui Wang, Yujiong Shen, Tingyi Yang, Changhao Jiang, Yilong Wu, Shihan Dou, Qinhao Chen, Zhiheng Xi, Zhihao Zhang, Yi Dong, Zhen Wang, Zhihui Fei, Mingyang Wan, Tao Liang, Guojun Ma, Qi Zhang, Tao Gui, Xuanjing Huang |
| 2025 | CogSci | SpikeBERT: A Language Understanding Spiking Neural Network Learned from BERT with Knowledge Distillation. | Changze Lv, Tianlong Li, Xiaohua Wang, Muling Wu, Wenhao Liu, Shihan Dou, Xiaoqing Zheng, Xuanjing Huang |
| 2025 | COLING | Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective. | Tianlong Li, Zhenghua Wang, Wenhao Liu, Muling Wu, Shihan Dou, Changze Lv, Xiaohua Wang, Xiaoqing Zheng, Xuanjing Huang |
| 2025 | COLING | ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios. | Junjie Ye, Guanyu Li, Songyang Gao, Caishuang Huang, Yilong Wu, Sixian Li, Xiaoran Fan, Shihan Dou, Tao Ji, Qi Zhang, Tao Gui, Xuanjing Huang |
| 2025 | EMNLP | Governance in Motion: Co-evolution of Constitutions and AI models for Scalable Safety. | Chenhao Huang, Ziyu Shen, Yicong Ren, Huiyuan Zheng, Jiazheng Zhang, Mingxu Chai, Ming Zhang, Shihan Dou, Fan Mo, Jie Shi, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | EMNLP | UPLex: Fine-Grained Personality Control in Large Language Models via Unsupervised Lexical Modulation. | Tianlong Li, Wenhao Liu, Muling Wu, Shihan Dou, Zhenghua Wang, Changze Lv, Xiaohua Wang, Xiaoqing Zheng, Xuanjing Huang |
| 2025 | EMNLP | LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation. | Ming Zhang, Yujiong Shen, Zelin Li, Huayu Sha, Binze Hu, Yuhui Wang, Chenhao Huang, Shichun Liu, Jingqi Tong, Changhao Jiang, Mingxu Chai, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2025 | ICLR | RMB: Comprehensively benchmarking reward models in LLM alignment. | Enyu Zhou, Guodong Zheng, Binghai Wang, Zhiheng Xi, Shihan Dou, Rong Bao, Wei Shen, Limao Xiong, Jessica Fan, Yurong Mou, Rui Zheng, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2024 | ACL | StepCoder: Improving Code Generation with Reinforcement Learning from Compiler Feedback. | Shihan Dou, Yan Liu, Haoxiang Jia, Enyu Zhou, Limao Xiong, Junjie Shan, Caishuang Huang, Xiao Wang, Xiaoran Fan, Zhiheng Xi, Yuhao Zhou, Tao Ji, Rui Zheng, Qi Zhang, Tao Gui, Xuanjing Huang |
| 2024 | ACL | LoRAMoE: Alleviating World Knowledge Forgetting in Large Language Models via MoE-Style Plugin. | Shihan Dou, Enyu Zhou, Yan Liu, Songyang Gao, Wei Shen, Limao Xiong, Yuhao Zhou, Xiao Wang, Zhiheng Xi, Xiaoran Fan, Shiliang Pu, Jiang Zhu, Rui Zheng, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2024 | EMNLP | TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities. | Ming Zhang, Caishuang Huang, Yilong Wu, Shichun Liu, Huiyuan Zheng, Yurui Dong, Yujiong Shen, Shihan Dou, Jun Zhao, Junjie Ye, Qi Zhang, Tao Gui, Xuanjing Huang |
| 2024 | ICLR | Improving Generalization of Alignment with Human Preferences through Group Invariant Learning. | Rui Zheng, Wei Shen, Yuan Hua, Wenbin Lai, Shihan Dou, Yuhao Zhou, Zhiheng Xi, Xiao Wang, Haoran Huang, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2024 | ICML | Linear Alignment: A Closed-form Solution for Aligning Human Preferences without Tuning and Feedback. | Songyang Gao, Qiming Ge, Wei Shen, Shihan Dou, Junjie Ye, Xiao Wang, Rui Zheng, Yicheng Zou, Zhi Chen, Hang Yan, Qi Zhang, Dahua Lin |
| 2024 | ICML | Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning. | Zhiheng Xi, Wenxiang Chen, Boyang Hong, Senjie Jin, Rui Zheng, Wei He, Yiwen Ding, Shichun Liu, Xin Guo, Junzhe Wang, Honglin Guo, Wei Shen, Xiaoran Fan, Yuhao Zhou, Shihan Dou, Xiao Wang, Xinbo Zhang, Peng Sun, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2023 | ACL | DSRM: Boost Textual Adversarial Training with Distribution Shift Risk Minimization. | Songyang Gao, Shihan Dou, Yan Liu, Xiao Wang, Qi Zhang, Zhongyu Wei, Jin Ma, Ying Shan |
| 2023 | ACL | On the Universal Adversarial Perturbations for Efficient Data-free Adversarial Detection. | Songyang Gao, Shihan Dou, Qi Zhang, Xuanjing Huang, Jin Ma, Ying Shan |
| 2023 | ACL | Detecting Adversarial Samples through Sharpness of Loss Landscape. | Rui Zheng, Shihan Dou, Yuhao Zhou, Qin Liu, Tao Gui, Qi Zhang, Zhongyu Wei, Xuanjing Huang, Menghan Zhang |
| 2023 | EMNLP | Loose lips sink ships: Mitigating Length Bias in Reinforcement Learning from Human Feedback. | Wei Shen, Rui Zheng, WenYu Zhan, Jun Zhao, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang |
| 2022 | ACL | MINER: Improving Out-of-Vocabulary Named Entity Recognition from an Information Theoretic Perspective. | Xiao Wang, Shihan Dou, Limao Xiong, Yicheng Zou, Qi Zhang, Tao Gui, Liang Qiao, Zhanzhan Cheng, Xuanjing Huang |
| 2022 | COLING | Decorrelate Irrelevant, Purify Relevant: Overcome Textual Spurious Correlations from a Feature Perspective. | Shihan Dou, Rui Zheng, Ting Wu, Songyang Gao, Junjie Shan, Qi Zhang, Yueming Wu, Xuanjing Huang |
| 2022 | EMNLP | Kernel-Whitening: Overcome Dataset Bias with Isotropic Sentence Embedding. | Songyang Gao, Shihan Dou, Qi Zhang, Xuanjing Huang |
| 2022 | ICSE | VulCNN: An Image-inspired Scalable Vulnerability Detection System. | Yueming Wu, Deqing Zou, Shihan Dou, Wei Yang, Duo Xu, Hai Jin |