Skip to content

Yuanzhao Zhai

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

15

Venues

9

Active years

2021–2026

Best venue rank

A*

Where they publish

Papers

15 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLEvoNarrator: Modeling Scientific Evolution for Feasible Hypothesis Generation.Xiaoying Le, Pengfei Qian, Yuanzhao Zhai, Xu Zhang, Qian Liu, Dawei Feng, Bo Ding
2026ICPRDiagnosing LLM Benchmark: A Psychometric Analysis of Difficulty and Discrimination.Jiacheng Qin, Xu Zhang, Dawei Feng, Bo Ding, Yuanzhao Zhai
2025AAAIEnhancing Decision-Making for LLM Agents via Step-Level Q-Value Models.Yuanzhao Zhai, Tingkai Yang, Kele Xu, Dawei Feng, Cheng Yang, Bo Ding, Huaimin Wang
2025AAAICorrecting Large Language Model Behavior via Influence Function.Han Zhang, Zhuo Zhang, Yi Zhang, Yuanzhao Zhai, Hanyang Peng, Yu Lei, Yue Yu, Hui Wang, Bin Liang, Lin Gui, Ruifeng Xu
2025ACLCOPR: Continual Human Preference Learning via Optimal Policy Regularization.Han Zhang, Lin Gui, Yu Lei, Yuanzhao Zhai, Yehong Zhang, Zhuo Zhang, Yulan He, Hui Wang, Yue Yu, Kam-Fai Wong, Bin Liang, Ruifeng Xu
2025ICPADSGRACE: Graph-Adapted Case-Augmented Execution for Tool Use in Large Language Models.Tong Lin, Yuanzhao Zhai, Dawei Feng, Bo Ding
2025SIGIRPreference-Strength-Aware Self-Improving Alignment with Generative Preference Models.Yuanzhao Zhai, Zhuo Zhang, Cheng Yang, Kele Xu, Yue Yu, Wei Li, Hui Wang, Zenglin Xu, Dawei Feng, Bo Ding, Huaimin Wang
2025SIGIREmpowering Large Language Model Agent through Step-Level Self-Critique and Self-Training.Yuanzhao Zhai, Huanxi Liu, Zhuo Zhang, Tong Lin, Kele Xu, Cheng Yang, Dawei Feng, Bo Ding, Huaimin Wang
2024AAAIOptimistic Model Rollouts for Pessimistic Offline Policy Optimization.Yuanzhao Zhai, Yiying Li, Zijian Gao, Xudong Gong, Kele Xu, Dawei Feng, Bo Ding, Huaimin Wang
2024ICASSPNuclear-Norm Maximization for Low-Rank Updates.Huanxi Liu, Yuanzhao Zhai, Kele Xu, Dawei Feng, Yiying Li
2024ICMLIterative Regularized Policy Optimization with Imperfect Demonstrations.Xudong Gong, Dawei Feng, Kele Xu, Yuanzhao Zhai, Chengkang Yao, Weijia Wang, Bo Ding, Huaimin Wang
2023ICASSPProgressive Diversifying Policy for Multi-Agent Reinforcement Learning.Shaoqi Sun, Yuanzhao Zhai, Kele Xu, Dawei Feng, Bo Ding
2023ICASSPDiversifying Message Aggregation in Multi-Agent Communication Via Normalized Tensor Nuclear Norm Regularization.Yuanzhao Zhai, Kele Xu, Bo Ding, Dawei Feng, Zijian Gao, Huaimin Wang
2022ICTAIExploring Policy Diversity in Parallel Actor-Critic Learning.Yanqiang Zhang, Yuanzhao Zhai, Gongqian Zhou, Bo Ding, Dawei Feng, Songwang Liu
2021HPCCAccelerating Robot Reinforcement Learning with Samples of Different Simulation Precision.Yong Zhao, Yuanzhao Zhai, Jie Luo, Dawei Feng, Bo Ding, Zhen Li