| 2026 | ACL | WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments. | Jinchao Li, Yunxin Li, Chenrui Zhao, Zhenran Xu, Baotian Hu, Min Zhang |
| 2026 | ACL | UniMoE-Audio: Unified Speech and Music Generation with Dynamic-Capacity Mixture-of-Experts. | Zhenyu Liu, Yunxin Li, Xuanyu Zhang, Qixun Teng, Shenyuan Jiang, Xinyu Chen, Haoyuan Shi, Haolan Chen, Fanbo Meng, Mingjun Zhao, Yu Xu, Yancheng He, Baotian Hu, Haizhou Li, Min Zhang |
| 2026 | ACL | Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs. | Zhenyu Liu, Xuanyu Zhang, Yunxin Li, Qixun Teng, Shenyuan Jiang, Haolan Chen, Mingjun Zhao, Fanbo Meng, Yu Xu, Yancheng He, Baotian Hu, Haizhou Li, Min Zhang |
| 2026 | ACL | MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation. | Haoyuan Shi, Yunxin Li, Nanhao Deng, Zhenran Xu, Xinyu Chen, Longyue Wang, Baotian Hu, Min Zhang |
| 2026 | ACL | ComfyFlow: Benchmarking LLMs for AIGC Workflow Generation. | Zhenran Xu, Yiyu Wang, Yunxin Li, Muyang Ye, Xue Yang, Kai Chen, Longyue Wang, Weihua Luo, Baotian Hu, Min Zhang |
| 2025 | ACL | VideoVista-CulturalLingo: 360° Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension. | Xinyu Chen, Yunxin Li, Haoyuan Shi, Baotian Hu, Wenhan Luo, Yaowei Wang, Min Zhang |
| 2025 | CIKM | Advancing Temporal Sensitive Question Answering through Progressive Multi-Step Reflection. | Ziyang Chen, Erxue Min, Xiang Zhao, Yunxin Li, Xin Jia, Jinzhi Liao, Shuaiqiang Wang, Baotian Hu, Dawei Yin |
| 2025 | SiggraphA | AniMaker: Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation. | Haoyuan Shi, Yunxin Li, Xinyu Chen, Longyue Wang, Baotian Hu, Min Zhang |
| 2024 | ACL | Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment. | Yunxin Li, Xinyu Chen, Baotian Hu, Haoyuan Shi, Min Zhang |
| 2024 | COLING | A Multimodal In-Context Tuning Approach for E-Commerce Product Description Generation. | Yunxin Li, Baotian Hu, Wenhan Luo, Lin Ma, Yuxin Ding, Min Zhang |
| 2024 | ICML | VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context. | Yunxin Li, Baotian Hu, Haoyuan Shi, Wei Wang, Longyue Wang, Min Zhang |
| 2024 | SiggraphA | Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation. | Yunxin Li, Haoyuan Shi, Baotian Hu, Longyue Wang, Jiashun Zhu, Jinyi Xu, Zhen Zhao, Min Zhang |
| 2023 | ACL | A Multi-Modal Context Reasoning Approach for Conditional Inference on Joint Textual and Visual Clues. | Yunxin Li, Baotian Hu, Xinyu Chen, Yuxin Ding, Lin Ma, Min Zhang |
| 2023 | ACL | A Neural Divide-and-Conquer Reasoning Framework for Image Retrieval from Linguistically Complex Text. | Yunxin Li, Baotian Hu, Yuxin Ding, Lin Ma, Min Zhang |
| 2022 | KDD | Medical Dialogue Response Generation with Pivotal Information Recalling. | Yu Zhao, Yunxin Li, Yuxiang Wu, Baotian Hu, Qingcai Chen, Xiaolong Wang, Yuxin Ding, Min Zhang |
| 2011 | GLOBECOM | A Simplified User Identification Approach for Multi-User Diversity with Enhanced Throughput. | Hang Li, Qinghua Guo, Yunxin Li, Defeng Huang |
| 2003 | PIMRC | Simple noncoherent CPM receivers by PAM decomposition and MMSE equalization. | Xiaojing Huang, Yunxin Li |
| 2003 | PIMRC | Sample rate conversion by trapezoidal interpolation for software defined radio. | Xiaojing Huang, Yunxin Li, Son Nguyen |
| 2002 | GLOBECOM | Scalable complete complementary sets of sequences. | Xiaojing Huang, Yunxin Li |