Skip to content

Yilun Zhao

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

80

Venues

12

Active years

2021–2026

Best venue rank

A*

Where they publish

Papers

80 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLSciMDR: Advancing Scientific Multimodal Document Reasoning.Ziyu Chen, Yilun Zhao, Chengye Wang, Rilyn Han, Manasi Patwardhan, Arman Cohan
2026ACLRewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs.Zhiyuan Hu, Yucheng Wang, Yufei He, Jiaying Wu, Yilun Zhao, See-Kiong Ng, Cynthia Breazeal, Anh Tuan Luu, Hae Won Park, Bryan Hooi
2026ACLExperience Retrieval-Augmentation with Electronic Health Records Enables Accurate Discharge QA.Justice Ou, Tinglin Huang, Yilun Zhao, Ziyang Yu, Peiqing Lu, Yifei Shen, Rex Ying
2026ACLMultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application.Xueqing Peng, Lingfei Qian, Yan Wang, Ruoyu Xiang, Yueru He, Yang Ren, Mingyang Jiang, Vincent Jim Zhang, Yuqing Guo, Jeff Zhao, Huan He, Yi Han, Yun Feng, Yuechen Jiang, Yupeng Cao, Haohang Li, Yangyang Yu, Xiaoyu Wang, Penglei Gao, Shengyuan Lin, Keyi Wang, Shanshan Yang, Yilun Zhao, Zhiwei Liu, Peng Lu, Jerry Huang, Suyuchen Wang, Triantafillos Papadopoulos, Polydoros Giannouris, Efstathia Soufleri, Nuo Chen, Zhiyang Deng, Heming Fu, Yijia Zhao, Mingquan Lin, Meikang Qiu, Kaleb E. Smith, Arman Cohan, Xiao-Yang Liu, Jimin Huang, Guojun Xiong, Alejandro Lopez-Lira, Xi Chen, Junichi Tsujii, Jian-Yun Nie, Sophia Ananiadou, Qianqian Xie
2026ACLRethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing.Tingyu Song, Yanzhao Zhang, Mingxin Li, Zhuoning Guo, Dingkun Long, Pengjun Xie, Siyue Zhang, Yilun Zhao, Shu Wu
2026ACLTexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction.Chengye Wang, Lin Fu, Zexi Kuang, Yilun Zhao
2026ACLA Survey of Reasoning-Intensive Retrieval: Progress and Challenges.Yiyang Wei, Tingyu Song, Siyue Zhang, Yilun Zhao
2026ACLAnchor: Branch-Point Data Generation for GUI Agents.Jinbiao Wei, Yilun Zhao, Kangqi Ni, Arman Cohan
2026ACLCan AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future.Sihong Wu, Owen Jiang, Yilun Zhao, Tiansheng Hu, Yiling Ma, Kaiyan Zhang, Manasi Patwardhan, Arman Cohan
2026ACLRbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation.Sihong Wu, Yiling Ma, Yilun Zhao, Tiansheng Hu, Owen Jiang, Manasi Patwardhan, Arman Cohan
2026ACLMMSciCode: Real-world Evaluation of Multilingual Multi-Discipline Scientific Research Coding.Xue Xia, Zheyuan Yang, Arman Cohan, Yilun Zhao
2026ACLTableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity.Zheyuan Yang, Liqiang Shang, Junjie Chen, Xun Yang, Chenglong Xu, Bo Yuan, Chenyuan Jiao, Yaoru Sun, Yilun Zhao
2026ACLA Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning.Tianyu Yang, Sihong Wu, Yilun Zhao, Zhenwen Liang, Lisen Dai, Chen Zhao, Minhao Cheng, Arman Cohan, Xiangliang Zhang
2026ACLA Survey on Evaluation of LLM-based Agents.Asaf Yehudai, Lilach Eden, Alan Li, Guy Uziel, Yilun Zhao, Roy Bar-Haim, Arman Cohan, Michal Shmueli-Scheuer
2026ACLRethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems.Yilun Zhao, Jinbiao Wei, Tingyu Song, Siyue Zhang, Chen Zhao, Arman Cohan
2026EACLSciRAG: Adaptive, Citation-Aware, and Outline-Guided Retrieval and Synthesis for Scientific Literature.Hang Ding, Yilun Zhao, Tiansheng Hu, Manasi Patwardhan, Arman Cohan
2026EACLPatient-Similarity Cohort Reasoning in Clinical Text-to-SQL.Yifei Shen, Yilun Zhao, Justice Ou, Tinglin Huang, Arman Cohan
2025ACLAbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research.Yilun Zhao, Weiyuan Chen, Zhijian Xu, Manasi Patwardhan, Chengye Wang, Yixin Liu, Lovekesh Vig, Arman Cohan
2025ACLCan Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers.Yilun Zhao, Chengye Wang, Chuhan Li, Arman Cohan
2025ACLPhysics: Benchmarking Foundation Models on University-Level Physics Problem Solving.Kaiyue Feng, Yilun Zhao, Yixin Liu, Tianyu Yang, Chen Zhao, John Sous, Arman Cohan
2025ACLVF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos.Tingyu Song, Tongyan Hu, Guo Gan, Yilun Zhao
2025ACLSciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification.Chengye Wang, Yifei Shen, Zexi Kuang, Arman Cohan, Yilun Zhao
2025ACLCan LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers.Zhijian Xu, Yilun Zhao, Manasi Patwardhan, Lovekesh Vig, Arman Cohan
2025ACLCan LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure.Zheyuan Yang, Zexi Kuang, Xue Xia, Yilun Zhao
2025ACLHumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation Task.Zhaojian Yu, Yilun Zhao, Arman Cohan, Xiaoping Zhang
2025CVPRMMVU: Measuring Expert-Level Multi-Discipline Video Understanding.Yilun Zhao, Haowei Zhang, Lujing Xie, Tongyan Hu, Guo Gan, Yitao Long, Zhiyuan Hu, Weiyuan Chen, Chuhan Li, Zhijian Xu, Chengye Wang, Ziyao Shangguan, Zhenwen Liang, Yixin Liu, Chen Zhao, Arman Cohan
2025EMNLPEfficiency-Effectiveness Reranking FLOPs for LLM-based Rerankers.Zhiyuan Peng, Ting-Ruen Wei, Tingyu Song, Yilun Zhao
2025EMNLPSportReason: Evaluating Retrieval-Augmented Reasoning across Tables and Text for Sports Question Answering.Kaiyue Feng, Siyue Zhang, Bingsen Chen, Yilun Zhao, Chen Zhao
2025EMNLPFinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance Domain.Tiansheng Hu, Tongyan Hu, Liuyang Bai, Yilun Zhao, Arman Cohan, Chen Zhao
2025EMNLPMCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search.Yunhai Hu, Yilun Zhao, Chen Zhao, Arman Cohan
2025EMNLPFinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering.Yitao Long, Tiansheng Hu, Yilun Zhao, Arman Cohan, Chen Zhao
2025EMNLPJudging with Many Minds: Do More Perspectives Mean Less Prejudice? On Bias Amplification and Resistance in Multi-Agent Based LLM-as-Judge.Chiyu Ma, Enpei Zhang, Yilun Zhao, Wenjun Liu, Yaning Jia, Peijun Qing, Lin Shi, Arman Cohan, Yujun Yan, Soroush Vosoughi
2025EMNLPLimRank: Less is More for Reasoning-Intensive Information Reranking.Tingyu Song, Yilun Zhao, Siyue Zhang, Chen Zhao, Arman Cohan
2025EMNLPSciSketch: An Open-source Framework for Automated Schematic Diagram Generation in Scientific Papers.Zihang Wang, Yilun Zhao, Kaiyan Zhang, Chen Zhao, Manasi Patwardhan, Arman Cohan
2025EMNLPTable-R1: Inference-Time Scaling for Table Reasoning Tasks.Zheyuan Yang, Lyuhao Chen, Arman Cohan, Yilun Zhao
2025EMNLPZ1: Efficient Test-time Scaling with Code.Zhaojian Yu, Yinghao Wu, Yilun Zhao, Arman Cohan, Xiao-Ping Zhang
2025EMNLPDiffusion vs. Autoregressive Language Models: A Text Embedding Perspective.Siyue Zhang, Yilun Zhao, Liyuan Geng, Arman Cohan, Anh Tuan Luu, Chen Zhao
2025ICCADCLASS: A Controller-Centric Layout Synthesizer for Dynamic Quantum Circuits.Yu Chen, Yilun Zhao, Bing Li, He Li, Mengdi Wang, Yinhe Han, Ying Wang
2025ICLRTOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models.Ziyao Shangguan, Chuhan Li, Yuxuan Ding, Yanan Zheng, Yilun Zhao, Tesca Fitzgerald, Arman Cohan
2025ICLRChemAgent: Self-updating Memories in Large Language Models Improves Chemical Reasoning.Xiangru Tang, Tianyu Hu, Muyang Ye, Yanjun Shao, Xunjian Yin, Siru Ouyang, Wangchunshu Zhou, Pan Lu, Zhuosheng Zhang, Yilun Zhao, Arman Cohan, Mark Gerstein
2025MICRODistributed-HISQ: A Distributed Quantum Control Architecture.Yilun Zhao, Kangding Zhao, Peng Zhou, Dingdong Liu, Tingyu Luo, Yuzhen Zheng, Peng Luo, Shun Hu, Jin Lin, Cheng Guo, Yinhe Han, Ying Wang, Mingtang Deng, Junjie Wu, Xiang Fu
2025NAACLReIFE: Re-evaluating Instruction-Following Evaluation.Yixin Liu, Kejian Shi, Alexander R. Fabbri, Yilun Zhao, Peifeng Wang, Chien-Sheng Wu, Shafiq Joty, Arman Cohan
2025NAACLIFIR: A Comprehensive Benchmark for Evaluating Instruction-Following in Expert-Domain Information Retrieval.Tingyu Song, Guo Gan, Mingsheng Shang, Yilun Zhao
2025NAACLAre Multimodal LLMs Robust Against Adversarial Perturbations? RoMMath: A Systematic Evaluation on Multimodal Math Reasoning.Yilun Zhao, Guo Gan, Chen Zhao, Arman Cohan
2024ACLTaPERA: Enhancing Faithfulness and Interpretability in Long-Form Table QA by Content Planning and Execution-based Reasoning.Yilun Zhao, Lyuhao Chen, Arman Cohan, Chen Zhao
2024ACLDocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Financial Documents.Yilun Zhao, Yitao Long, Hongjun Liu, Ryo Kamoi, Linyong Nan, Lyuhao Chen, Yixin Liu, Xiangru Tang, Rui Zhang, Arman Cohan
2024ACLKnowledgeFMath: A Knowledge-Intensive Math Reasoning Dataset in Finance Domains.Yilun Zhao, Hongjun Liu, Yitao Long, Rui Zhang, Chen Zhao, Arman Cohan
2024ACLUnveiling the Spectrum of Data Contamination in Language Model: A Survey from Detection to Remediation.Chunyuan Deng, Yilun Zhao, Yuzhao Heng, Yitong Li, Jiannan Cao, Xiangru Tang, Arman Cohan
2024ACLMedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning.Xiangru Tang, Anni Zou, Zhuosheng Zhang, Ziming Li, Yilun Zhao, Xingyao Zhang, Arman Cohan, Mark Gerstein
2024EMNLPFinDVer: Explainable Claim Verification over Long and Hybrid-content Financial Documents.Yilun Zhao, Yitao Long, Tintin Jiang, Chengye Wang, Weiyuan Chen, Hongjun Liu, Xiangru Tang, Yiming Zhang, Chen Zhao, Arman Cohan
2024EMNLPOpenT2T: An Open-Source Toolkit for Table-to-Text Generation.Haowei Zhang, Shengyun Si, Yilun Zhao, Lujing Xie, Zhijian Xu, Lyuhao Chen, Linyong Nan, Pengcheng Wang, Xiangru Tang, Arman Cohan
2024EMNLPTAIL: A Toolkit for Automatic and Realistic Long-Context Large Language Model Evaluation.Gefei Gu, Yilun Zhao, Ruoxi Ning, Yanan Zheng, Arman Cohan
2024EMNLPFOLIO: Natural Language Reasoning with First-Order Logic.Simeng Han, Hailey Schoelkopf, Yilun Zhao, Zhenting Qi, Martin Riddell, Wenfei Zhou, James Coady, David Peng, Yujie Qiao, Luke Benson, Lucy Sun, Alexander Wardle-Solano, Hannah Szab, Ekaterina Zubova, Matthew Burtell, Jonathan Fan, Yixin Liu, Brian Wong, Malcolm Sailor, Ansong Ni, Linyong Nan, Jungo Kasai, Tao Yu, Rui Zhang, Alexander R. Fabbri, Wojciech Kryscinski, Semih Yavuz, Ye Liu, Xi Victoria Lin, Shafiq Joty, Yingbo Zhou, Caiming Xiong, Rex Ying, Arman Cohan, Dragomir Radev
2024EMNLPP-FOLIO: Evaluating and Improving Logical Reasoning with Abundant Human-Written Reasoning Chains.Simeng Han, Aaron Yu, Rui Shen, Zhenting Qi, Martin Riddell, Wenfei Zhou, Yujie Qiao, Yilun Zhao, Semih Yavuz, Ye Liu, Shafiq Joty, Yingbo Zhou, Caiming Xiong, Dragomir Radev, Rex Ying, Arman Cohan
2024EMNLPM3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models.Chuhan Li, Ziyao Shangguan, Yilun Zhao, Deyuan Li, Yixin Liu, Arman Cohan
2024EMNLPOMG-QA: Building Open-Domain Multi-Modal Generative Question Answering Systems.Linyong Nan, Weining Fang, Aylin Rasteh, Pouya Lahabi, Weijin Zou, Yilun Zhao, Arman Cohan
2024EMNLPMIMIR: A Customizable Agent Tuning Platform for Enhanced Scientific Applications.Xiangru Tang, Chunyuan Deng, Hanming Wang, Haoran Wang, Yilun Zhao, Wenqi Shi, May Fung, Wangchunshu Zhou, Jiannan Cao, Heng Ji, Arman Cohan, Mark Gerstein
2024EMNLPRevisiting Automated Evaluation for Long-form Table Question Answering.Yuqi Wang, Lyuhao Chen, Songcheng Cai, Zhijian Xu, Yilun Zhao
2024IGARSSStaggered SAR Simulation of the Sea Surface and Moving Ships.Xinyue Ma, Yun Zhang, Xin Qi, Xuan Liu, Long Li, Yilun Zhao, He Wei
2024IGARSSResearch on Integrated Sensing and Communications Based on OCDM.Dan Zhang, Yun Zhang, Dai Gao, Wenlong Tian, Yilun Zhao, Wei He
2024IGARSSComplex Target Imaging Model Based on Statistical Characterization and Structured Characterizations.Shuojia Feng, Yun Zhang, Hongbo Li, Yilun Zhao, Yadong Lu
2024NAACLInvestigating Data Contamination in Modern Benchmarks for Large Language Models.Chunyuan Deng, Yilun Zhao, Xiangru Tang, Mark Gerstein, Arman Cohan
2024NAACLBenchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization.Yixin Liu, Alexander R. Fabbri, Jiawen Chen, Yilun Zhao, Simeng Han, Shafiq Joty, Pengfei Liu, Dragomir Radev, Chien-Sheng Wu, Arman Cohan
2024NAACLOn Evaluating the Integration of Reasoning and Action in LLM Agents with Database Question Answering.Linyong Nan, Ellen Zhang, Weijin Zou, Yilun Zhao, Wenfei Zhou, Arman Cohan
2024NAACLStruc-Bench: Are Large Language Models Good at Generating Complex Structured Tabular Data?Xiangru Tang, Yiming Zong, Jason Phang, Yilun Zhao, Wangchunshu Zhou, Arman Cohan, Mark Gerstein
2023ACLRevisiting the Gold Standard: Grounding Summarization Evaluation with Robust Human Evaluation.Yixin Liu, Alexander R. Fabbri, Pengfei Liu, Yilun Zhao, Linyong Nan, Ruilin Han, Simeng Han, Shafiq Joty, Chien-Sheng Wu, Caiming Xiong, Dragomir Radev
2023ACLOpenRT: An Open-source Framework for Reasoning Over Tabular Data.Yilun Zhao, Boyu Mi, Zhenting Qi, Linyong Nan, Minghao Guo, Arman Cohan, Dragomir Radev
2023ACLRobuT: A Systematic Study of Table QA Robustness Against Human-Annotated Adversarial Perturbations.Yilun Zhao, Chen Zhao, Linyong Nan, Zhenting Qi, Wenlin Zhang, Xiangru Tang, Boyu Mi, Dragomir Radev
2023EACLLoFT: Enhancing Faithfulness and Diversity for Table-to-Text Generation via Logic Form Control.Yilun Zhao, Zhenting Qi, Linyong Nan, Lorenzo Jaime Yu Flores, Dragomir Radev
2023EMNLPQTSumm: Query-Focused Summarization over Tabular Data.Yilun Zhao, Zhenting Qi, Linyong Nan, Boyu Mi, Yixin Liu, Weijin Zou, Simeng Han, Ruizhe Chen, Xiangru Tang, Yumo Xu, Dragomir Radev, Arman Cohan
2023EMNLPInvestigating Table-to-Text Generation Capabilities of Large Language Models in Real-World Information Seeking Scenarios.Yilun Zhao, Haowei Zhang, Shengyun Si, Linyong Nan, Xiangru Tang, Arman Cohan
2023EMNLPTowards Interpretable and Efficient Automatic Reference-Based Summarization Evaluation.Yixin Liu, Alexander R. Fabbri, Yilun Zhao, Pengfei Liu, Shafiq Joty, Chien-Sheng Wu, Caiming Xiong, Dragomir Radev
2023EMNLPEnhancing Text-to-SQL Capabilities of Large Language Models: A Study on Prompt Design Strategies.Linyong Nan, Yilun Zhao, Weijin Zou, Narutatsu Ri, Jaesung Tae, Ellen Zhang, Arman Cohan, Dragomir Radev
2023ICCADFull State Quantum Circuit Simulation Beyond Memory Limit.Yilun Zhao, Yu Chen, He Li, Ying Wang, Kaiyan Chang, Bingmeng Wang, Bing Li, Yinhe Han
2022ACLMultiHiertt: Numerical Reasoning over Multi Hierarchical Tabular and Textual Data.Yilun Zhao, Yunxiang Li, Chenying Li, Rui Zhang
2022EMNLPR2D2: Robust Data-to-Text with Replacement Detection.Linyong Nan, Lorenzo Jaime Yu Flores, Yilun Zhao, Yixin Liu, Luke Benson, Weijin Zou, Dragomir Radev
2022EMNLPReasTAP: Injecting Table Reasoning Skills During Pre-training via Synthetic Reasoning Examples.Yilun Zhao, Linyong Nan, Zhenting Qi, Rui Zhang, Dragomir Radev
2022HPCAQ-GPU: A Recipe of Optimizations for Quantum Circuit Simulation Using GPUs.Yilun Zhao, Yanan Guo, Yuan Yao, Amanda Dumi, Devin M. Mulvey, Shiv Upadhyay, Youtao Zhang, Kenneth D. Jordan, Jun Yang, Xulong Tang
2022LRECFinMath: Injecting a Tree-structured Solver for Question Answering over Financial Reports.Chenying Li, Wenbo Ye, Yilun Zhao
2021MMMMusiCoder: A Universal Music-Acoustic Encoder Based on Transformer.Yilun Zhao, Jia Guo