Yilun Zhao
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
80
Venues
12
Active years
2021–2026
Best venue rank
A*
Where they publish
Papers
80 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | SciMDR: Advancing Scientific Multimodal Document Reasoning. | Ziyu Chen, Yilun Zhao, Chengye Wang, Rilyn Han, Manasi Patwardhan, Arman Cohan |
| 2026 | ACL | Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs. | Zhiyuan Hu, Yucheng Wang, Yufei He, Jiaying Wu, Yilun Zhao, See-Kiong Ng, Cynthia Breazeal, Anh Tuan Luu, Hae Won Park, Bryan Hooi |
| 2026 | ACL | Experience Retrieval-Augmentation with Electronic Health Records Enables Accurate Discharge QA. | Justice Ou, Tinglin Huang, Yilun Zhao, Ziyang Yu, Peiqing Lu, Yifei Shen, Rex Ying |
| 2026 | ACL | MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application. | Xueqing Peng, Lingfei Qian, Yan Wang, Ruoyu Xiang, Yueru He, Yang Ren, Mingyang Jiang, Vincent Jim Zhang, Yuqing Guo, Jeff Zhao, Huan He, Yi Han, Yun Feng, Yuechen Jiang, Yupeng Cao, Haohang Li, Yangyang Yu, Xiaoyu Wang, Penglei Gao, Shengyuan Lin, Keyi Wang, Shanshan Yang, Yilun Zhao, Zhiwei Liu, Peng Lu, Jerry Huang, Suyuchen Wang, Triantafillos Papadopoulos, Polydoros Giannouris, Efstathia Soufleri, Nuo Chen, Zhiyang Deng, Heming Fu, Yijia Zhao, Mingquan Lin, Meikang Qiu, Kaleb E. Smith, Arman Cohan, Xiao-Yang Liu, Jimin Huang, Guojun Xiong, Alejandro Lopez-Lira, Xi Chen, Junichi Tsujii, Jian-Yun Nie, Sophia Ananiadou, Qianqian Xie |
| 2026 | ACL | Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing. | Tingyu Song, Yanzhao Zhang, Mingxin Li, Zhuoning Guo, Dingkun Long, Pengjun Xie, Siyue Zhang, Yilun Zhao, Shu Wu |
| 2026 | ACL | TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction. | Chengye Wang, Lin Fu, Zexi Kuang, Yilun Zhao |
| 2026 | ACL | A Survey of Reasoning-Intensive Retrieval: Progress and Challenges. | Yiyang Wei, Tingyu Song, Siyue Zhang, Yilun Zhao |
| 2026 | ACL | Anchor: Branch-Point Data Generation for GUI Agents. | Jinbiao Wei, Yilun Zhao, Kangqi Ni, Arman Cohan |
| 2026 | ACL | Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future. | Sihong Wu, Owen Jiang, Yilun Zhao, Tiansheng Hu, Yiling Ma, Kaiyan Zhang, Manasi Patwardhan, Arman Cohan |
| 2026 | ACL | RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation. | Sihong Wu, Yiling Ma, Yilun Zhao, Tiansheng Hu, Owen Jiang, Manasi Patwardhan, Arman Cohan |
| 2026 | ACL | MMSciCode: Real-world Evaluation of Multilingual Multi-Discipline Scientific Research Coding. | Xue Xia, Zheyuan Yang, Arman Cohan, Yilun Zhao |
| 2026 | ACL | TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity. | Zheyuan Yang, Liqiang Shang, Junjie Chen, Xun Yang, Chenglong Xu, Bo Yuan, Chenyuan Jiao, Yaoru Sun, Yilun Zhao |
| 2026 | ACL | A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning. | Tianyu Yang, Sihong Wu, Yilun Zhao, Zhenwen Liang, Lisen Dai, Chen Zhao, Minhao Cheng, Arman Cohan, Xiangliang Zhang |
| 2026 | ACL | A Survey on Evaluation of LLM-based Agents. | Asaf Yehudai, Lilach Eden, Alan Li, Guy Uziel, Yilun Zhao, Roy Bar-Haim, Arman Cohan, Michal Shmueli-Scheuer |
| 2026 | ACL | Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems. | Yilun Zhao, Jinbiao Wei, Tingyu Song, Siyue Zhang, Chen Zhao, Arman Cohan |
| 2026 | EACL | SciRAG: Adaptive, Citation-Aware, and Outline-Guided Retrieval and Synthesis for Scientific Literature. | Hang Ding, Yilun Zhao, Tiansheng Hu, Manasi Patwardhan, Arman Cohan |
| 2026 | EACL | Patient-Similarity Cohort Reasoning in Clinical Text-to-SQL. | Yifei Shen, Yilun Zhao, Justice Ou, Tinglin Huang, Arman Cohan |
| 2025 | ACL | AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research. | Yilun Zhao, Weiyuan Chen, Zhijian Xu, Manasi Patwardhan, Chengye Wang, Yixin Liu, Lovekesh Vig, Arman Cohan |
| 2025 | ACL | Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers. | Yilun Zhao, Chengye Wang, Chuhan Li, Arman Cohan |
| 2025 | ACL | Physics: Benchmarking Foundation Models on University-Level Physics Problem Solving. | Kaiyue Feng, Yilun Zhao, Yixin Liu, Tianyu Yang, Chen Zhao, John Sous, Arman Cohan |
| 2025 | ACL | VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos. | Tingyu Song, Tongyan Hu, Guo Gan, Yilun Zhao |
| 2025 | ACL | SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification. | Chengye Wang, Yifei Shen, Zexi Kuang, Arman Cohan, Yilun Zhao |
| 2025 | ACL | Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers. | Zhijian Xu, Yilun Zhao, Manasi Patwardhan, Lovekesh Vig, Arman Cohan |
| 2025 | ACL | Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure. | Zheyuan Yang, Zexi Kuang, Xue Xia, Yilun Zhao |
| 2025 | ACL | HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation Task. | Zhaojian Yu, Yilun Zhao, Arman Cohan, Xiaoping Zhang |
| 2025 | CVPR | MMVU: Measuring Expert-Level Multi-Discipline Video Understanding. | Yilun Zhao, Haowei Zhang, Lujing Xie, Tongyan Hu, Guo Gan, Yitao Long, Zhiyuan Hu, Weiyuan Chen, Chuhan Li, Zhijian Xu, Chengye Wang, Ziyao Shangguan, Zhenwen Liang, Yixin Liu, Chen Zhao, Arman Cohan |
| 2025 | EMNLP | Efficiency-Effectiveness Reranking FLOPs for LLM-based Rerankers. | Zhiyuan Peng, Ting-Ruen Wei, Tingyu Song, Yilun Zhao |
| 2025 | EMNLP | SportReason: Evaluating Retrieval-Augmented Reasoning across Tables and Text for Sports Question Answering. | Kaiyue Feng, Siyue Zhang, Bingsen Chen, Yilun Zhao, Chen Zhao |
| 2025 | EMNLP | FinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance Domain. | Tiansheng Hu, Tongyan Hu, Liuyang Bai, Yilun Zhao, Arman Cohan, Chen Zhao |
| 2025 | EMNLP | MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search. | Yunhai Hu, Yilun Zhao, Chen Zhao, Arman Cohan |
| 2025 | EMNLP | FinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering. | Yitao Long, Tiansheng Hu, Yilun Zhao, Arman Cohan, Chen Zhao |
| 2025 | EMNLP | Judging with Many Minds: Do More Perspectives Mean Less Prejudice? On Bias Amplification and Resistance in Multi-Agent Based LLM-as-Judge. | Chiyu Ma, Enpei Zhang, Yilun Zhao, Wenjun Liu, Yaning Jia, Peijun Qing, Lin Shi, Arman Cohan, Yujun Yan, Soroush Vosoughi |
| 2025 | EMNLP | LimRank: Less is More for Reasoning-Intensive Information Reranking. | Tingyu Song, Yilun Zhao, Siyue Zhang, Chen Zhao, Arman Cohan |
| 2025 | EMNLP | SciSketch: An Open-source Framework for Automated Schematic Diagram Generation in Scientific Papers. | Zihang Wang, Yilun Zhao, Kaiyan Zhang, Chen Zhao, Manasi Patwardhan, Arman Cohan |
| 2025 | EMNLP | Table-R1: Inference-Time Scaling for Table Reasoning Tasks. | Zheyuan Yang, Lyuhao Chen, Arman Cohan, Yilun Zhao |
| 2025 | EMNLP | Z1: Efficient Test-time Scaling with Code. | Zhaojian Yu, Yinghao Wu, Yilun Zhao, Arman Cohan, Xiao-Ping Zhang |
| 2025 | EMNLP | Diffusion vs. Autoregressive Language Models: A Text Embedding Perspective. | Siyue Zhang, Yilun Zhao, Liyuan Geng, Arman Cohan, Anh Tuan Luu, Chen Zhao |
| 2025 | ICCAD | CLASS: A Controller-Centric Layout Synthesizer for Dynamic Quantum Circuits. | Yu Chen, Yilun Zhao, Bing Li, He Li, Mengdi Wang, Yinhe Han, Ying Wang |
| 2025 | ICLR | TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models. | Ziyao Shangguan, Chuhan Li, Yuxuan Ding, Yanan Zheng, Yilun Zhao, Tesca Fitzgerald, Arman Cohan |
| 2025 | ICLR | ChemAgent: Self-updating Memories in Large Language Models Improves Chemical Reasoning. | Xiangru Tang, Tianyu Hu, Muyang Ye, Yanjun Shao, Xunjian Yin, Siru Ouyang, Wangchunshu Zhou, Pan Lu, Zhuosheng Zhang, Yilun Zhao, Arman Cohan, Mark Gerstein |
| 2025 | MICRO | Distributed-HISQ: A Distributed Quantum Control Architecture. | Yilun Zhao, Kangding Zhao, Peng Zhou, Dingdong Liu, Tingyu Luo, Yuzhen Zheng, Peng Luo, Shun Hu, Jin Lin, Cheng Guo, Yinhe Han, Ying Wang, Mingtang Deng, Junjie Wu, Xiang Fu |
| 2025 | NAACL | ReIFE: Re-evaluating Instruction-Following Evaluation. | Yixin Liu, Kejian Shi, Alexander R. Fabbri, Yilun Zhao, Peifeng Wang, Chien-Sheng Wu, Shafiq Joty, Arman Cohan |
| 2025 | NAACL | IFIR: A Comprehensive Benchmark for Evaluating Instruction-Following in Expert-Domain Information Retrieval. | Tingyu Song, Guo Gan, Mingsheng Shang, Yilun Zhao |
| 2025 | NAACL | Are Multimodal LLMs Robust Against Adversarial Perturbations? RoMMath: A Systematic Evaluation on Multimodal Math Reasoning. | Yilun Zhao, Guo Gan, Chen Zhao, Arman Cohan |
| 2024 | ACL | TaPERA: Enhancing Faithfulness and Interpretability in Long-Form Table QA by Content Planning and Execution-based Reasoning. | Yilun Zhao, Lyuhao Chen, Arman Cohan, Chen Zhao |
| 2024 | ACL | DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Financial Documents. | Yilun Zhao, Yitao Long, Hongjun Liu, Ryo Kamoi, Linyong Nan, Lyuhao Chen, Yixin Liu, Xiangru Tang, Rui Zhang, Arman Cohan |
| 2024 | ACL | KnowledgeFMath: A Knowledge-Intensive Math Reasoning Dataset in Finance Domains. | Yilun Zhao, Hongjun Liu, Yitao Long, Rui Zhang, Chen Zhao, Arman Cohan |
| 2024 | ACL | Unveiling the Spectrum of Data Contamination in Language Model: A Survey from Detection to Remediation. | Chunyuan Deng, Yilun Zhao, Yuzhao Heng, Yitong Li, Jiannan Cao, Xiangru Tang, Arman Cohan |
| 2024 | ACL | MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning. | Xiangru Tang, Anni Zou, Zhuosheng Zhang, Ziming Li, Yilun Zhao, Xingyao Zhang, Arman Cohan, Mark Gerstein |
| 2024 | EMNLP | FinDVer: Explainable Claim Verification over Long and Hybrid-content Financial Documents. | Yilun Zhao, Yitao Long, Tintin Jiang, Chengye Wang, Weiyuan Chen, Hongjun Liu, Xiangru Tang, Yiming Zhang, Chen Zhao, Arman Cohan |
| 2024 | EMNLP | OpenT2T: An Open-Source Toolkit for Table-to-Text Generation. | Haowei Zhang, Shengyun Si, Yilun Zhao, Lujing Xie, Zhijian Xu, Lyuhao Chen, Linyong Nan, Pengcheng Wang, Xiangru Tang, Arman Cohan |
| 2024 | EMNLP | TAIL: A Toolkit for Automatic and Realistic Long-Context Large Language Model Evaluation. | Gefei Gu, Yilun Zhao, Ruoxi Ning, Yanan Zheng, Arman Cohan |
| 2024 | EMNLP | FOLIO: Natural Language Reasoning with First-Order Logic. | Simeng Han, Hailey Schoelkopf, Yilun Zhao, Zhenting Qi, Martin Riddell, Wenfei Zhou, James Coady, David Peng, Yujie Qiao, Luke Benson, Lucy Sun, Alexander Wardle-Solano, Hannah Szab, Ekaterina Zubova, Matthew Burtell, Jonathan Fan, Yixin Liu, Brian Wong, Malcolm Sailor, Ansong Ni, Linyong Nan, Jungo Kasai, Tao Yu, Rui Zhang, Alexander R. Fabbri, Wojciech Kryscinski, Semih Yavuz, Ye Liu, Xi Victoria Lin, Shafiq Joty, Yingbo Zhou, Caiming Xiong, Rex Ying, Arman Cohan, Dragomir Radev |
| 2024 | EMNLP | P-FOLIO: Evaluating and Improving Logical Reasoning with Abundant Human-Written Reasoning Chains. | Simeng Han, Aaron Yu, Rui Shen, Zhenting Qi, Martin Riddell, Wenfei Zhou, Yujie Qiao, Yilun Zhao, Semih Yavuz, Ye Liu, Shafiq Joty, Yingbo Zhou, Caiming Xiong, Dragomir Radev, Rex Ying, Arman Cohan |
| 2024 | EMNLP | M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models. | Chuhan Li, Ziyao Shangguan, Yilun Zhao, Deyuan Li, Yixin Liu, Arman Cohan |
| 2024 | EMNLP | OMG-QA: Building Open-Domain Multi-Modal Generative Question Answering Systems. | Linyong Nan, Weining Fang, Aylin Rasteh, Pouya Lahabi, Weijin Zou, Yilun Zhao, Arman Cohan |
| 2024 | EMNLP | MIMIR: A Customizable Agent Tuning Platform for Enhanced Scientific Applications. | Xiangru Tang, Chunyuan Deng, Hanming Wang, Haoran Wang, Yilun Zhao, Wenqi Shi, May Fung, Wangchunshu Zhou, Jiannan Cao, Heng Ji, Arman Cohan, Mark Gerstein |
| 2024 | EMNLP | Revisiting Automated Evaluation for Long-form Table Question Answering. | Yuqi Wang, Lyuhao Chen, Songcheng Cai, Zhijian Xu, Yilun Zhao |
| 2024 | IGARSS | Staggered SAR Simulation of the Sea Surface and Moving Ships. | Xinyue Ma, Yun Zhang, Xin Qi, Xuan Liu, Long Li, Yilun Zhao, He Wei |
| 2024 | IGARSS | Research on Integrated Sensing and Communications Based on OCDM. | Dan Zhang, Yun Zhang, Dai Gao, Wenlong Tian, Yilun Zhao, Wei He |
| 2024 | IGARSS | Complex Target Imaging Model Based on Statistical Characterization and Structured Characterizations. | Shuojia Feng, Yun Zhang, Hongbo Li, Yilun Zhao, Yadong Lu |
| 2024 | NAACL | Investigating Data Contamination in Modern Benchmarks for Large Language Models. | Chunyuan Deng, Yilun Zhao, Xiangru Tang, Mark Gerstein, Arman Cohan |
| 2024 | NAACL | Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization. | Yixin Liu, Alexander R. Fabbri, Jiawen Chen, Yilun Zhao, Simeng Han, Shafiq Joty, Pengfei Liu, Dragomir Radev, Chien-Sheng Wu, Arman Cohan |
| 2024 | NAACL | On Evaluating the Integration of Reasoning and Action in LLM Agents with Database Question Answering. | Linyong Nan, Ellen Zhang, Weijin Zou, Yilun Zhao, Wenfei Zhou, Arman Cohan |
| 2024 | NAACL | Struc-Bench: Are Large Language Models Good at Generating Complex Structured Tabular Data? | Xiangru Tang, Yiming Zong, Jason Phang, Yilun Zhao, Wangchunshu Zhou, Arman Cohan, Mark Gerstein |
| 2023 | ACL | Revisiting the Gold Standard: Grounding Summarization Evaluation with Robust Human Evaluation. | Yixin Liu, Alexander R. Fabbri, Pengfei Liu, Yilun Zhao, Linyong Nan, Ruilin Han, Simeng Han, Shafiq Joty, Chien-Sheng Wu, Caiming Xiong, Dragomir Radev |
| 2023 | ACL | OpenRT: An Open-source Framework for Reasoning Over Tabular Data. | Yilun Zhao, Boyu Mi, Zhenting Qi, Linyong Nan, Minghao Guo, Arman Cohan, Dragomir Radev |
| 2023 | ACL | RobuT: A Systematic Study of Table QA Robustness Against Human-Annotated Adversarial Perturbations. | Yilun Zhao, Chen Zhao, Linyong Nan, Zhenting Qi, Wenlin Zhang, Xiangru Tang, Boyu Mi, Dragomir Radev |
| 2023 | EACL | LoFT: Enhancing Faithfulness and Diversity for Table-to-Text Generation via Logic Form Control. | Yilun Zhao, Zhenting Qi, Linyong Nan, Lorenzo Jaime Yu Flores, Dragomir Radev |
| 2023 | EMNLP | QTSumm: Query-Focused Summarization over Tabular Data. | Yilun Zhao, Zhenting Qi, Linyong Nan, Boyu Mi, Yixin Liu, Weijin Zou, Simeng Han, Ruizhe Chen, Xiangru Tang, Yumo Xu, Dragomir Radev, Arman Cohan |
| 2023 | EMNLP | Investigating Table-to-Text Generation Capabilities of Large Language Models in Real-World Information Seeking Scenarios. | Yilun Zhao, Haowei Zhang, Shengyun Si, Linyong Nan, Xiangru Tang, Arman Cohan |
| 2023 | EMNLP | Towards Interpretable and Efficient Automatic Reference-Based Summarization Evaluation. | Yixin Liu, Alexander R. Fabbri, Yilun Zhao, Pengfei Liu, Shafiq Joty, Chien-Sheng Wu, Caiming Xiong, Dragomir Radev |
| 2023 | EMNLP | Enhancing Text-to-SQL Capabilities of Large Language Models: A Study on Prompt Design Strategies. | Linyong Nan, Yilun Zhao, Weijin Zou, Narutatsu Ri, Jaesung Tae, Ellen Zhang, Arman Cohan, Dragomir Radev |
| 2023 | ICCAD | Full State Quantum Circuit Simulation Beyond Memory Limit. | Yilun Zhao, Yu Chen, He Li, Ying Wang, Kaiyan Chang, Bingmeng Wang, Bing Li, Yinhe Han |
| 2022 | ACL | MultiHiertt: Numerical Reasoning over Multi Hierarchical Tabular and Textual Data. | Yilun Zhao, Yunxiang Li, Chenying Li, Rui Zhang |
| 2022 | EMNLP | R2D2: Robust Data-to-Text with Replacement Detection. | Linyong Nan, Lorenzo Jaime Yu Flores, Yilun Zhao, Yixin Liu, Luke Benson, Weijin Zou, Dragomir Radev |
| 2022 | EMNLP | ReasTAP: Injecting Table Reasoning Skills During Pre-training via Synthetic Reasoning Examples. | Yilun Zhao, Linyong Nan, Zhenting Qi, Rui Zhang, Dragomir Radev |
| 2022 | HPCA | Q-GPU: A Recipe of Optimizations for Quantum Circuit Simulation Using GPUs. | Yilun Zhao, Yanan Guo, Yuan Yao, Amanda Dumi, Devin M. Mulvey, Shiv Upadhyay, Youtao Zhang, Kenneth D. Jordan, Jun Yang, Xulong Tang |
| 2022 | LREC | FinMath: Injecting a Tree-structured Solver for Question Answering over Financial Reports. | Chenying Li, Wenbo Ye, Yilun Zhao |
| 2021 | MMM | MusiCoder: A Universal Music-Acoustic Encoder Based on Transformer. | Yilun Zhao, Jia Guo |