| 2025 | AAAI | Friends-MMC: A Dataset for Multi-modal Multi-party Conversation Understanding. | Yueqian Wang, Xiaojun Meng, Yuxuan Wang, Jianxin Liang, Qun Liu, Dongyan Zhao |
| 2025 | CVPR | OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts. | Yuxuan Wang, Yueqian Wang, Bo Chen, Tong Wu, Dongyan Zhao, Zilong Zheng |
| 2025 | EMNLP | VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format. | Yueqian Wang, Xiaojun Meng, Yuxuan Wang, Jianxin Liang, Jiansheng Wei, Huishuai Zhang, Dongyan Zhao |
| 2025 | IJCAI | Understanding Visual Detail Hallucinations of Large Vision-Language Models. | Xiaoxi Sun, Jianxin Liang, Yueqian Wang, Huishuai Zhang, Dongyan Zhao |
| 2025 | NAACL | ReasVQA: Advancing VideoQA with Imperfect Reasoning Process. | Jianxin Liang, Xiaojun Meng, Huishuai Zhang, Yueqian Wang, Jiansheng Wei, Dongyan Zhao |
| 2024 | AAAI | STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering. | Yueqian Wang, Yuxuan Wang, Kai Chen, Dongyan Zhao |
| 2024 | EMNLP | Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge. | Yuxuan Wang, Yueqian Wang, Pengfei Wu, Jianxin Liang, Dongyan Zhao, Yang Liu, Zilong Zheng |
| 2023 | ACL | VSTAR: A Video-grounded Dialogue Dataset for Situated Semantic Understanding with Scene and Topic Transitions. | Yuxuan Wang, Zilong Zheng, Xueliang Zhao, Jinpeng Li, Yueqian Wang, Dongyan Zhao |
| 2022 | EMNLP | SMASH: Improving SMAll Language Models' Few-SHot Ability with Prompt-Based Distillation. | Yueqian Wang, Chang Liu, Kai Chen, Xi Wang, Dongyan Zhao |