| 2026 | AAAI | RICo: Refined In-Context Contribution for Automatic Instruction-Tuning Data Selection. | Yixin Yang, Qingxiu Dong, Linli Yao, Fangwei Zhu, Weilin Luo, Bin Wang, Zhifang Sui |
| 2025 | ACL | Generative Frame Sampler for Long Video Understanding. | Linli Yao, Haoning Wu, Kun Ouyang, Yuanxing Zhang, Caiming Xiong, Bei Chen, Xu Sun, Junnan Li |
| 2025 | EMNLP | RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction. | Yuchi Wang, Yishuo Cai, Shuhuai Ren, Sihan Yang, Linli Yao, Yuanxin Liu, Yuanxing Zhang, Pengfei Wan, Xu Sun |
| 2025 | ICLR | Temporal Reasoning Transfer from Text to Video. | Lei Li, Yuanxin Liu, Linli Yao, Peiyuan Zhang, Chenxin An, Lean Wang, Xu Sun, Lingpeng Kong, Qi Liu |
| 2024 | CVPR | TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding. | Shuhuai Ren, Linli Yao, Shicheng Li, Xu Sun, Lu Hou |
| 2024 | NAACL | LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation? | Yuchi Wang, Shuhuai Ren, Rundong Gao, Linli Yao, Qingyan Guo, Kaikai An, Jianhong Bai, Xu Sun |
| 2023 | WWW | CapEnrich: Enriching Caption Semantics for Web Images via Cross-modal Pre-trained Knowledge. | Linli Yao, Weijing Chen, Qin Jin |
| 2023 | SIGIR | Rethinking Benchmarks for Cross-modal Image-text Retrieval. | Weijing Chen, Linli Yao, Qin Jin |
| 2022 | AAAI | Image Difference Captioning with Pre-training and Contrastive Learning. | Linli Yao, Weiying Wang, Qin Jin |