| 2026 | ACL | Your Reasoning Model is Secretly a Reward Model - Optimization-Free Verification from Experience. | Zhenwen Liang, Ruosen Li, Yujun Zhou, Linfeng Song, Dian Yu, Xinya Du, Haitao Mi, Dong Yu |
| 2026 | ACL | Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data. | Zhenwen Liang, Yujun Zhou, Sidi Lu, Xiangliang Zhang, Haitao Mi, Dong Yu |
| 2026 | ACL | EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving. | Mukai Li, Linfeng Song, Zhenwen Liang, Jiahao Xu, Shansan Gong, Qi Liu, Haitao Mi, Dong Yu |
| 2026 | ACL | Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning. | Haolin Liu, Dian Yu, Sidi Lu, Yujun Zhou, Rui Liu, Zhenwen Liang, Haitao Mi, Chen-Yu Wei, Dong Yu |
| 2026 | ACL | Verified Critical Step Optimization for LLM Agents. | Mukai Li, Qingcheng Zeng, Tianqing Fang, Zhenwen Liang, Linfeng Song, Qi Liu, Haitao Mi, Dong Yu |
| 2026 | ACL | Crossing the Reward Bridge: Expanding Reinforcement Learning with Verifiable Rewards Across Diverse Domains. | Yi Su, Dian Yu, Linfeng Song, Juntao Li, Haitao Mi, Zhaopeng Tu, Min Zhang, Dong Yu |
| 2026 | ACL | Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification. | Yuxuan Wan, Tianqing Fang, Zaitang LI, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu |
| 2026 | ACL | Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding. | Wenkai Wang, Xiyun Li, Hongcan Guo, Wenhao Yu, Tianqing Fang, Haitao Mi, Dong Yu, Shengyu Zhang |
| 2026 | ACL | WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models. | Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong |
| 2026 | EACL | WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms. | Zhisong Zhang, Tianqing Fang, Kaixin Ma, Wenhao Yu, Hongming Zhang, Haitao Mi, Dong Yu |
| 2025 | AAAI | LiteSearch: Efficient Tree Search with Dynamic Exploration Budget for Math Reasoning. | Ante Wang, Linfeng Song, Ye Tian, Baolin Peng, Dian Yu, Haitao Mi, Jinsong Su, Dong Yu |
| 2025 | ACL | Low-Bit Quantization Favors Undertrained LLMs. | Xu Ouyang, Tao Ge, Thomas Hartvigsen, Zhisong Zhang, Haitao Mi, Dong Yu |
| 2025 | ACL | Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls. | Ante Wang, Linfeng Song, Ye Tian, Dian Yu, Haitao Mi, Xiangyu Duan, Zhaopeng Tu, Jinsong Su, Dong Yu |
| 2025 | ACL | Self-Tuning: Instructing LLMs to Effectively Acquire New Knowledge through Self-Teaching. | Xiaoying Zhang, Baolin Peng, Ye Tian, Jingyan Zhou, Yipeng Zhang, Haitao Mi, Helen M. Meng |
| 2025 | COLING | Entropy Guided Extrapolative Decoding to Improve Factuality in Large Language Models. | Souvik Das, Lifeng Jin, Linfeng Song, Haitao Mi, Baolin Peng, Dong Yu |
| 2025 | EMNLP | WebEvolver: Enhancing Web Agent Self-Improvement with Co-evolving World Model. | Tianqing Fang, Hongming Zhang, Zhisong Zhang, Kaixin Ma, Wenhao Yu, Haitao Mi, Dong Yu |
| 2025 | EMNLP | WebCoT: Enhancing Web Agent Reasoning by Reconstructing Chain-of-Thought in Reflection, Branching, and Rollback. | Minda Hu, Tianqing Fang, Jianshu Zhang, Jun-Yu Ma, Zhisong Zhang, Jingyan Zhou, Hongming Zhang, Haitao Mi, Dong Yu, Irwin King |
| 2025 | EMNLP | Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation. | Jun-Yu Ma, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu |
| 2025 | ICLR | DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search. | Murong Yue, Wenlin Yao, Haitao Mi, Dian Yu, Ziyu Yao, Dong Yu |
| 2025 | ICLR | Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning. | Yuheng Zhang, Dian Yu, Baolin Peng, Linfeng Song, Ye Tian, Mingyue Huo, Nan Jiang, Haitao Mi, Dong Yu |
| 2025 | ICML | Do NOT Think That Much for 2+3=? On the Overthinking of Long Reasoning Models. | Xingyu Chen, Jiahao Xu, Tian Liang, Zhiwei He, Jianhui Pang, Dian Yu, Linfeng Song, Qiuzhi Liu, Mengfei Zhou, Zhuosheng Zhang, Rui Wang, Zhaopeng Tu, Haitao Mi, Dong Yu |
| 2024 | ACL | Improving LLM Generations via Fine-Grained Self-Endorsement. | Ante Wang, Linfeng Song, Baolin Peng, Lifeng Jin, Ye Tian, Haitao Mi, Jinsong Su, Dong Yu |
| 2024 | ACL | Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation. | Xiaoying Zhang, Baolin Peng, Ye Tian, Jingyan Zhou, Lifeng Jin, Linfeng Song, Haitao Mi, Helen Meng |
| 2024 | COLING | A Knowledge Plug-and-Play Test Bed for Open-domain Dialogue Generation. | Xiangci Li, Linfeng Song, Lifeng Jin, Haitao Mi, Jessica Ouyang, Dong Yu |
| 2024 | EACL | Inconsistent dialogue responses and how to recover from them. | Mian Zhang, Lifeng Jin, Linfeng Song, Haitao Mi, Dong Yu |
| 2024 | EMNLP | Self-Consistency Boosts Calibration for Math Reasoning. | Ante Wang, Linfeng Song, Ye Tian, Baolin Peng, Lifeng Jin, Haitao Mi, Jinsong Su, Dong Yu |
| 2024 | ICLR | The Trickle-down Impact of Reward Inconsistency on RLHF. | Lingfeng Shen, Sihao Chen, Linfeng Song, Lifeng Jin, Baolin Peng, Haitao Mi, Daniel Khashabi, Dong Yu |
| 2023 | ACL | Bi-level Finetuning with Task-dependent Similarity Structure for Low-resource Training. | Sai Ashish Somayajula, Lifeng Jin, Linfeng Song, Haitao Mi, Dong Yu |
| 2023 | ACL | SafeConv: Explaining and Correcting Conversational Unsafe Behavior. | Mian Zhang, Lifeng Jin, Linfeng Song, Haitao Mi, Wenliang Chen, Dong Yu |
| 2023 | EACL | Friend-training: Learning from Models of Different but Related Tasks. | Mian Zhang, Lifeng Jin, Linfeng Song, Haitao Mi, Xiabing Zhou, Dong Yu |
| 2023 | EMNLP | More Than Spoken Words: Nonverbal Message Extraction and Generation. | Dian Yu, Xiaoyang Wang, Wanshun Chen, Nan Du, Longyue Wang, Haitao Mi, Dong Yu |
| 2022 | EMNLP | Cross-lingual Text-to-SQL Semantic Parsing with Representation Mixup. | Peng Shi, Linfeng Song, Lifeng Jin, Haitao Mi, He Bai, Jimmy Lin, Dong Yu |
| 2022 | EMNLP | Fast-R2D2: A Pretrained Recursive Neural Network based on Pruned CKY for Grammar Induction and Text Representation. | Xiang Hu, Haitao Mi, Liang Li, Gerard de Melo |
| 2022 | EMNLP | Learning a Grammar Inducer from Massive Uncurated Instructional Videos. | Songyang Zhang, Linfeng Song, Lifeng Jin, Haitao Mi, Kun Xu, Dong Yu, Jiebo Luo |
| 2022 | KDD | COSSUM: Towards Conversation-Oriented Structured Summarization for Automatic Medical Insurance Assessment. | Sheng Xu, Xiaojun Wan, Sen Hu, Mengdi Zhou, Teng Xu, Hongbin Wang, Haitao Mi |
| 2021 | ACL | R2D2: Recursive Transformer based on Differentiable Tree for Interpretable Hierarchical Language Modeling. | Xiang Hu, Haitao Mi, Zujie Wen, Yafang Wang, Yi Su, Jing Zheng, Gerard de Melo |
| 2021 | ACL | A Dialogue-based Information Extraction System for Medical Insurance Assessment. | Shuang Peng, Mengdi Zhou, Minghui Yang, Haitao Mi, Shaosheng Cao, Zujie Wen, Teng Xu, Hongbin Wang, Lei Liu |
| 2021 | IJCAI | IIAS: An Intelligent Insurance Assessment System through Online Real-time Conversation Analysis. | Mengdi Zhou, Shuang Peng, Minghui Yang, Nan Li, Hongbin Wang, Li Qiao, Haitao Mi, Zujie Wen, Teng Xu, Lei Liu |
| 2016 | ACL | Vocabulary Manipulation for Neural Machine Translation. | Haitao Mi, Zhiguo Wang, Abe Ittycheriah |
| 2016 | COLING | Sentence Similarity Learning by Lexical Decomposition and Composition. | Zhiguo Wang, Haitao Mi, Abraham Ittycheriah |
| 2016 | CoNLL | Semi-supervised Clustering for Short Text via Deep Representation Learning. | Zhiguo Wang, Haitao Mi, Abraham Ittycheriah |
| 2016 | EMNLP | Coverage Embedding Models for Neural Machine Translation. | Haitao Mi, Baskaran Sankaran, Zhiguo Wang, Abe Ittycheriah |
| 2016 | EMNLP | Supervised Attentions for Neural Machine Translation. | Haitao Mi, Zhiguo Wang, Abe Ittycheriah |
| 2015 | ACL | Feature Optimization for Constituent Parsing via Neural Networks. | Zhiguo Wang, Haitao Mi, Nianwen Xue |
| 2015 | NAACL | Shift-Reduce Constituency Parsing with Dynamic Programming and POS Tag Lattice. | Haitao Mi, Liang Huang |
| 2014 | ACL | Hierarchical MT Training using Max-Violation Perceptron. | Kai Zhao, Liang Huang, Haitao Mi, Abraham Ittycheriah |
| 2014 | COLING | A Structured Language Model for Incremental Tree-to-String Translation. | Heng Yu, Haitao Mi, Liang Huang, Qun Liu |
| 2013 | EMNLP | Flexible and Efficient Hypergraph Interactions for Joint Hierarchical and Forest-to-String Decoding. | Martin Cmejrek, Haitao Mi, Bowen Zhou |
| 2013 | EMNLP | Max-Violation Perceptron and Forced Decoding for Scalable MT Training. | Heng Yu, Liang Huang, Haitao Mi, Kai Zhao |
| 2011 | ACL | Rule Markov Models for Fast Tree-to-String Translation. | Ashish Vaswani, Haitao Mi, Liang Huang, David Chiang |
| 2011 | EMNLP | A novel dependency-to-string model for statistical machine translation. | Jun Xie, Haitao Mi, Qun Liu |
| 2011 | ICNC | Parallelizing a machine translation decoder for multicore computer. | Long Chen, Wei Huo, Haitao Mi, Zhaoqing Zhang, Xiaobing Feng, Zhiyuan Li |
| 2010 | AAAI | Forest-Based Semantic Role Labeling. | Hao Xiong, Haitao Mi, Yang Liu, Qun Liu |
| 2010 | ACL | Constituency to Dependency Translation with Forests. | Haitao Mi, Qun Liu |
| 2010 | ACL | Learning Lexicalized Reordering Models from Reordering Graphs. | Jinsong Su, Yang Liu, Yajuan L, Haitao Mi, Qun Liu |
| 2010 | COLING | An Efficient Shift-Reduce Decoding Algorithm for Phrased-Based Machine Translation. | Yang Feng, Haitao Mi, Yang Liu, Qun Liu |
| 2010 | COLING | Machine Translation with Lattices and Forests. | Haitao Mi, Liang Huang, Qun Liu |
| 2010 | COLING | Dependency-Based Bracketing Transduction Grammar for Statistical Machine Translation. | Jinsong Su, Yang Liu, Haitao Mi, Hongmei Zhao, Yajuan Lv, Qun Liu |
| 2010 | EMNLP | Efficient Incremental Decoding for Tree-to-String Translation. | Liang Huang, Haitao Mi |
| 2010 | PACLIC | Statistical Translation Model Based On Source Syntax Structure. | Qun Liu, Yang Liu, Haitao Mi |
| 2009 | ACL | Joint Decoding with Multiple Translation Models. | Yang Liu, Haitao Mi, Yang Feng, Qun Liu |
| 2009 | ACL | Sub-Sentence Division for Tree-Based Machine Translation. | Hao Xiong, Wenwen Xu, Haitao Mi, Yang Liu, Qun Liu |
| 2009 | EMNLP | Lattice-based System Combination for Statistical Machine Translation. | Yang Feng, Yang Liu, Haitao Mi, Qun Liu, Yajuan L |
| 2008 | ACL | Forest-Based Translation. | Haitao Mi, Liang Huang, Qun Liu |
| 2008 | COLING | Word Lattice Reranking for Chinese Word Segmentation and Part-of-Speech Tagging. | Wenbin Jiang, Haitao Mi, Qun Liu |
| 2008 | EMNLP | Forest-based Translation Rule Extraction. | Haitao Mi, Liang Huang |
| 2008 | IJCNLP | Refinements in BTG-based Statistical Machine Translation. | Deyi Xiong, Min Zhang, AiTi Aw, Haitao Mi, Qun Liu, Shouxun Lin |