| 2026 | ACL | Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing. | Tingyu Song, Yanzhao Zhang, Mingxin Li, Zhuoning Guo, Dingkun Long, Pengjun Xie, Siyue Zhang, Yilun Zhao, Shu Wu |
| 2026 | ACL | A Survey of Reasoning-Intensive Retrieval: Progress and Challenges. | Yiyang Wei, Tingyu Song, Siyue Zhang, Yilun Zhao |
| 2026 | ACL | Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems. | Yilun Zhao, Jinbiao Wei, Tingyu Song, Siyue Zhang, Chen Zhao, Arman Cohan |
| 2025 | ACL | VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos. | Tingyu Song, Tongyan Hu, Guo Gan, Yilun Zhao |
| 2025 | EMNLP | Efficiency-Effectiveness Reranking FLOPs for LLM-based Rerankers. | Zhiyuan Peng, Ting-Ruen Wei, Tingyu Song, Yilun Zhao |
| 2025 | EMNLP | LimRank: Less is More for Reasoning-Intensive Information Reranking. | Tingyu Song, Yilun Zhao, Siyue Zhang, Chen Zhao, Arman Cohan |
| 2025 | NAACL | IFIR: A Comprehensive Benchmark for Evaluating Instruction-Following in Expert-Domain Information Retrieval. | Tingyu Song, Guo Gan, Mingsheng Shang, Yilun Zhao |