Skip to content

Dong Yan

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

21

Venues

12

Active years

2007–2026

Best venue rank

A*

Where they publish

Papers

21 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLWhat If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time.Dong Yan, Jian Liang, Yanbo Wang, Shuo Lu, Ran He, Tieniu Tan
2025AAAISequential Preference Optimization: Multi-Dimensional Preference Alignment with Implicit Reward Modeling.Xingzhou Lou, Junge Zhang, Jian Xie, Lifeng Liu, Dong Yan, Kaiqi Huang
2025ACLReward Generalization in RLHF: A Topological Perspective.Tianyi Alex Qiu, Fanzhi Zeng, Jiaming Ji, Dong Yan, Kaile Wang, Jiayi Zhou, Yang Han, Josef Dai, Xuehai Pan, Yaodong Yang
2025ICLR3D-Properties: Identifying Challenges in DPO and Charting a Path Forward.Yuzi Yan, Yibo Miao, Jialian Li, Yipin Zhang, Jian Xie, Zhijie Deng, Dong Yan
2025ICLRLearning LLM-as-a-Judge for Preference Alignment.Ziyi Ye, Xiangsheng Li, Qiuchi Li, Qingyao Ai, Yujia Zhou, Wei Shen, Dong Yan, Yiqun Liu
2025ICMLSTAIR: Improving Safety Alignment with Introspective Reasoning.Yichi Zhang, Siyuan Zhang, Yao Huang, Zeyu Xia, Zhengwei Fang, Xiao Yang, Ranjie Duan, Dong Yan, Yinpeng Dong, Jun Zhu
2024EMNLPReward Modeling Requires Automatic Adjustment Based on Data Quality.Binghai Wang, Rui Zheng, Lu Chen, Zhiheng Xi, Wei Shen, Yuhao Zhou, Dong Yan, Tao Gui, Qi Zhang, Xuanjing Huang
2024ICMLExploring the LLM Journey from Cognition to Expression with Linear Representations.Yuzi Yan, Jialian Li, Yipin Zhang, Dong Yan
2023IJCAIOn the Reuse Bias in Off-Policy Reinforcement Learning.Chengyang Ying, Zhongkai Hao, Xinning Zhou, Hang Su, Dong Yan, Jun Zhu
2022AAAIPolicy Learning for Robust Markov Decision Process with a Mismatched Generative Model.Jialian Li, Tongzheng Ren, Dong Yan, Hang Su, Jun Zhu
2022IJCAITowards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk.Chengyang Ying, Xinning Zhou, Hang Su, Dong Yan, Ning Chen, Jun Zhu
2021AAAILearning Task-Distribution Reward Shaping with Meta-Learning.Haosheng Zou, Tongzheng Ren, Dong Yan, Hang Su, Jun Zhu
2021IJCAICombining Tree Search and Action Prediction for State-of-the-Art Performance in DouDiZhu.Yunsheng Zhang, Dong Yan, Bei Shi, Haobo Fu, Qiang Fu, Hang Su, Jun Zhu, Ning Chen
2020ICLRLazy-CFR: fast and near-optimal regret minimization for extensive games with imperfect information.Yichi Zhou, Tongzheng Ren, Jialian Li, Dong Yan, Jun Zhu
2020WCNCCharacterization for High-Speed Railway Channel enabling Smart Rail Mobility at 22.6 GHz.Lei Ma, Ke Guan, Dong Yan, Danping He, Bo Ai, Junhyeong Kim, Hee-Sang Chung
2019IJCAIPlaying FPS Games With Environment-Aware Hierarchical Reinforcement Learning.Shihong Song, Jiayi Weng, Hang Su, Dong Yan, Haosheng Zou, Jun Zhu
2017COMPSACComprehensive Static Analysis for Configurable Software via Combinatorial Instantiation.Dong Yan, Linjie Pan, Rongjie Yan, Jun Yan, Jian Zhang
2017ICSEPSpec: a formal specification language for fine-grained control on distributed data analytics.Chen Luo, Fei He, Dong Yan, Dan Zhang, Xin Zhou, Bow-Yaw Wang
2016APSECThe Floating-Point Extension of Symbolic Execution Engine for Bug Detection.Xingming Wu, Zhenbo Xu, Dong Yan, Tianyong Wu, Jun Yan, Jian Zhang
2011TrustComThe Role of Trust in Social Life.Dong Yan, Wang Qi
2007NetworkingThroughput Analysis Considering Capture Effect in IEEE 802.11 Networks.Xiaohu Ge, Dong Yan, Yaoting Zhu