| 2026 | ACL | Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation. | Yubo Jiang, Xin Yang, Abudukelimu Wuerkaixi, Zheming Yuan, Xuxin Cheng, Cao Liu, Ke Zeng, Fengying Xie, Zhiguo Jiang, Haopeng Zhang |
| 2026 | ACL | When 20 Agents Fail to Sort: The Distributed Sorting Benchmark for Scalable Multi-Agent Systems. | Xin Yang, Junhao Wang, Bintao Tang, Xuxin Cheng, Cao Liu, Ke Zeng, Wenyuan Jiang |
| 2026 | ACL | SILO-BENCH: A Scalable Environment for Evaluating Distributed Coordination in Multi-Agent LLM Systems. | Yuzhe Zhang, Feiran Liu, Yi Shan, Xinyi Huang, Xin Yang, Yueqi Zhu, Xuxin Cheng, Cao Liu, Ke Zeng, Terry Jingchen Zhang, Wenyuan Jiang |
| 2026 | ACL | DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding. | Jiaming Zhou, Xuxin Cheng, Shiwan Zhao, Yuhang Jia, Cao Liu, Ke Zeng, Xunliang Cai, Yong Qin |
| 2026 | EACL | MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models. | Siwei Wu, King Zhu, Yu Bai, Yiming Liang, Yizhi Li, Haoning Wu, Jiaheng Liu, Ruibo Liu, Xingwei Qu, Xuxin Cheng, Ge Zhang, Wenhao Huang, Chenghua Lin |
| 2025 | AAAI | EXCGEC: A Benchmark for Edit-Wise Explainable Chinese Grammatical Error Correction. | Jingheng Ye, Shang Qin, Yinghui Li, Xuxin Cheng, Libo Qin, Hai-Tao Zheng, Ying Shen, Peng Xing, Zishan Xu, Guo Cheng, Wenhao Jiang |
| 2025 | CVPR | CountLLM: Towards Generalizable Repetitive Action Counting via Large Language Model. | Ziyu Yao, Xuxin Cheng, Zhiqi Huang, Lei Li |
| 2025 | ICLR | DisPose: Disentangling Pose Guidance for Controllable Human Image Animation. | Hongxiang Li, Yaowei Li, Yuhang Yang, Junjie Cao, Zhihong Zhu, Xuxin Cheng, Long Chen |
| 2025 | ICLR | UniCoTT: A Unified Framework for Structural Chain-of-Thought Distillation. | Xianwei Zhuang, Zhihong Zhu, Zhichang Wang, Xuxin Cheng, Yuexian Zou |
| 2025 | ICRA | Mobile-TeleVision: Predictive Motion Priors for Humanoid Whole-Body Control. | Chenhao Lu, Xuxin Cheng, Jialong Li, Shiqi Yang, Mazeyu Ji, Chengjing Yuan, Ge Yang, Sha Yi, Xiaolong Wang |
| 2025 | IROS | Helpful DoggyBot: Open-World Object Fetching using Legged Robots and Vision-Language Models. | Qi Wu, Zipeng Fu, Xuxin Cheng, Xiaolong Wang, Chelsea Finn |
| 2024 | AAAI | Towards Multi-Intent Spoken Language Understanding via Hierarchical Attention and Optimal Transport. | Xuxin Cheng, Zhihong Zhu, Hongxiang Li, Yaowei Li, Xianwei Zhuang, Yuexian Zou |
| 2024 | AAAI | Exploiting Auxiliary Caption for Video Grounding. | Hongxiang Li, Meng Cao, Xuxin Cheng, Yaowei Li, Zhihong Zhu, Yuexian Zou |
| 2024 | AAAI | Embracing Language Inclusivity and Diversity in CLIP through Continual Language Learning. | Bang Yang, Yong Dai, Xuxin Cheng, Yaowei Li, Asif Raza, Yuexian Zou |
| 2024 | AAAI | Towards Explainable Joint Models via Information Theory for Multiple Intent Detection and Slot Filling. | Xianwei Zhuang, Xuxin Cheng, Yuexian Zou |
| 2024 | AAAI | Aligner²: Enhancing Joint Multiple Intent Detection and Slot Filling via Adjustive and Forced Cross-Task Alignment. | Zhihong Zhu, Xuxin Cheng, Yaowei Li, Hongxiang Li, Yuexian Zou |
| 2024 | ACL | Soul-Mix: Enhancing Multimodal Machine Translation with Manifold Mixup. | Xuxin Cheng, Ziyu Yao, Yifei Xin, Hao An, Hongxiang Li, Yaowei Li, Yuexian Zou |
| 2024 | ACL | Cyclical Contrastive Learning Based on Geodesic for Zero-shot Cross-lingual Spoken Language Understanding. | Xuxin Cheng, Zhihong Zhu, Bang Yang, Xianwei Zhuang, Hongxiang Li, Yuexian Zou |
| 2024 | ACL | MoE-SLU: Towards ASR-Robust Spoken Language Understanding via Mixture-of-Experts. | Xuxin Cheng, Zhihong Zhu, Xianwei Zhuang, Zhanpeng Chen, Zhiqi Huang, Yuexian Zou |
| 2024 | ACL | Enhancing Dialogue State Tracking Models through LLM-backed User-Agents Simulation. | Cheng Niu, Xingguang Wang, Xuxin Cheng, Juntong Song, Tong Zhang |
| 2024 | ACL | PCAD: Towards ASR-Robust Spoken Language Understanding via Prototype Calibration and Asymmetric Decoupling. | Xianwei Zhuang, Xuxin Cheng, Liming Liang, Yuxin Xie, Zhichang Wang, Zhiqi Huang, Yuexian Zou |
| 2024 | ACL | Code-Switching Can be Better Aligners: Advancing Cross-Lingual SLU through Representation-Level and Prediction-Level Alignment. | Zhihong Zhu, Xuxin Cheng, Zhanpeng Chen, Xianwei Zhuang, Zhiqi Huang, Yuexian Zou |
| 2024 | CIKM | SaLa: Scenario-aware Label Graph Interaction for Multi-intent Spoken Language Understanding. | Zhihong Zhu, Xuxin Cheng, Zhanpeng Chen, Zhichang Wang, Zhiqi Huang, Yuexian Zou |
| 2024 | COLING | Knowledge-enhanced Prompt Tuning for Dialogue-based Relation Extraction with Trigger and Label Semantic. | Hao An, Zhihong Zhu, Xuxin Cheng, Zhiqi Huang, Yuexian Zou |
| 2024 | COLING | Zero-Shot Spoken Language Understanding via Large Language Models: A Preliminary Study. | Zhihong Zhu, Xuxin Cheng, Hao An, Zhichang Wang, Dongsheng Chen, Zhiqi Huang |
| 2024 | COLING | Towards Multi-modal Sarcasm Detection via Disentangled Multi-grained Multi-modal Distilling. | Zhihong Zhu, Xuxin Cheng, Guimin Hu, Yaowei Li, Zhiqi Huang, Yuexian Zou |
| 2024 | COLING | Alignment before Awareness: Towards Visual Question Localized-Answering in Robotic Surgery via Optimal Transport and Answer Semantics. | Zhihong Zhu, Yunyan Zhang, Xuxin Cheng, Zhiqi Huang, Derong Xu, Xian Wu, Yefeng Zheng |
| 2024 | CoRL | Open-TeleVision: Teleoperation with Immersive Active Visual Feedback. | Xuxin Cheng, Jialong Li, Shiqi Yang, Ge Yang, Xiaolong Wang |
| 2024 | CoRL | Visual Whole-Body Control for Legged Loco-Manipulation. | Minghuan Liu, Zixuan Chen, Xuxin Cheng, Yandong Ji, Ri-Zhao Qiu, Ruihan Yang, Xiaolong Wang |
| 2024 | CoRL | ACE: A Cross-platform and visual-Exoskeletons System for Low-Cost Dexterous Teleoperation. | Shiqi Yang, Minghuan Liu, Yuzhe Qin, Runyu Ding, Jialong Li, Xuxin Cheng, Ruihan Yang, Sha Yi, Xiaolong Wang |
| 2024 | ECCV | Uncertainty-Aware Sign Language Video Retrieval with Probability Distribution Modeling. | Xuan Wu, Hongxiang Li, Yuanjiang Luo, Xuxin Cheng, Xianwei Zhuang, Meng Cao, Keren Fu |
| 2024 | ECCV | KDProR: A Knowledge-Decoupling Probabilistic Framework for Video-Text Retrieval. | Xianwei Zhuang, Hongxiang Li, Xuxin Cheng, Zhihong Zhu, Yuxin Xie, Yuexian Zou |
| 2024 | EMNLP | RAG-HAT: A Hallucination-Aware Tuning Pipeline for LLM in Retrieval-Augmented Generation. | Juntong Song, Xingguang Wang, Juno Zhu, Yuanhao Wu, Xuxin Cheng, Randy Zhong, Cheng Niu |
| 2024 | EMNLP | Learning to Match Representations is Better for End-to-End Task-Oriented Dialog System. | Wanshi Xu, Xuxin Cheng, Zhihong Zhu, Zhanpeng Chen, Yuexian Zou |
| 2024 | EMNLP | What are the Generator Preferences for End-to-end Task-Oriented Dialog System? | Wanshi Xu, Xianwei Zhuang, Zhanpeng Chen, Zhihong Zhu, Xuxin Cheng, Yuexian Zou |
| 2024 | ICASSP | KC-Prompt: End-To-End Knowledge-Complementary Prompting for Rehearsal-Free Continual Learning. | Yaowei Li, Yating Liu, Xuxin Cheng, Zhihong Zhu, Hongxiang Li, Bang Yang, Zhiqi Huang |
| 2024 | ICLR | Retrieval is Accurate Generation. | Bowen Cao, Deng Cai, Leyang Cui, Xuxin Cheng, Wei Bi, Yuexian Zou, Shuming Shi |
| 2024 | ICLR | PolyVoice: Language Models for Speech to Speech Translation. | Qianqian Dong, Zhiying Huang, Qi Tian, Chen Xu, Tom Ko, Yunlong Zhao, Siyuan Feng, Tang Li, Kexin Wang, Xuxin Cheng, Fengpeng Yue, Ye Bai, Xi Chen, Lu Lu, Zejun Ma, Yuping Wang, Mingxuan Wang, Yuxuan Wang |
| 2024 | IJCAI | Generating More Audios for End-to-End Spoken Language Understanding. | Xuxin Cheng, Yuexian Zou |
| 2024 | ICRA | Extreme Parkour with Legged Robots. | Xuxin Cheng, Kexin Shi, Ananye Agarwal, Deepak Pathak |
| 2024 | Interspeech | DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval. | Yifei Xin, Xuxin Cheng, Zhihong Zhu, Xusheng Yang, Yuexian Zou |
| 2024 | Interspeech | Audio-text Retrieval with Transformer-based Hierarchical Alignment and Disentangled Cross-modal Representation. | Yifei Xin, Zhihong Zhu, Xuxin Cheng, Xusheng Yang, Yuexian Zou |
| 2024 | MICCAI | Multivariate Cooperative Game for Image-Report Pairs: Hierarchical Semantic Alignment for Medical Report Generation. | Zhihong Zhu, Xuxin Cheng, Yunyan Zhang, Zhaorun Chen, Qingqing Long, Hongxiang Li, Zhiqi Huang, Xian Wu, Yefeng Zheng |
| 2024 | NAACL | MaCSC: Towards Multimodal-augmented Pre-trained Language Models via Conceptual Prototypes and Self-balancing Calibration. | Xianwei Zhuang, Zhichang Wang, Xuxin Cheng, Yuxin Xie, Liming Liang, Yuexian Zou |
| 2024 | WSDM | Dance with Labels: Dual-Heterogeneous Label Graph Interaction for Multi-intent Spoken Language Understanding. | Zhihong Zhu, Xuxin Cheng, Hongxiang Li, Yaowei Li, Yuexian Zou |
| 2023 | ACL | ML-LMCL: Mutual Learning and Large-Margin Contrastive Learning for Improving ASR Robustness in Spoken Language Understanding. | Xuxin Cheng, Bowen Cao, Qichen Ye, Zhihong Zhu, Hongxiang Li, Yuexian Zou |
| 2023 | ACL | Towards Unified Spoken Language Understanding Decoding via Label-aware Compact Linguistics Representations. | Zhihong Zhu, Xuxin Cheng, Zhiqi Huang, Dongsheng Chen, Yuexian Zou |
| 2023 | CIKM | Towards Spoken Language Understanding via Multi-level Multi-grained Contrastive Learning. | Xuxin Cheng, Wanshi Xu, Zhihong Zhu, Hongxiang Li, Yuexian Zou |
| 2023 | CIKM | DAS-CL: Towards Multimodal Machine Translation via Dual-Level Asymmetric Contrastive Learning. | Xuxin Cheng, Zhihong Zhu, Yaowei Li, Hongxiang Li, Yuexian Zou |
| 2023 | EMNLP | MRRL: Modifying the Reference via Reinforcement Learning for Non-Autoregressive Joint Multiple Intent Detection and Slot Filling. | Xuxin Cheng, Zhihong Zhu, Bowen Cao, Qichen Ye, Yuexian Zou |
| 2023 | EMNLP | Accelerating Multiple Intent Detection and Slot Filling via Targeted Knowledge Distillation. | Xuxin Cheng, Zhihong Zhu, Wanshi Xu, Yaowei Li, Hongxiang Li, Yuexian Zou |
| 2023 | EMNLP | MCLF: A Multi-grained Contrastive Learning Framework for ASR-robust Spoken Language Understanding. | Zhiqi Huang, Dongsheng Chen, Zhihong Zhu, Xuxin Cheng |
| 2023 | EMNLP | Syntax Matters: Towards Spoken Language Understanding via Syntax-Aware Attention. | Yifeng Xie, Zhihong Zhu, Xuxin Cheng, Zhiqi Huang, Dongsheng Chen |
| 2023 | EMNLP | Enhancing Code-Switching for Cross-lingual SLU: A Unified View of Semantic and Grammatical Coherence. | Zhihong Zhu, Xuxin Cheng, Zhiqi Huang, Dongsheng Chen, Yuexian Zou |
| 2023 | ICASSP | M | Xuxin Cheng, Qianqian Dong, Fengpeng Yue, Tom Ko, Mingxuan Wang, Yuexian Zou |
| 2023 | ICASSP | SSVMR: Saliency-Based Self-Training for Video-Music Retrieval. | Xuxin Cheng, Zhihong Zhu, Hongxiang Li, Yaowei Li, Yuexian Zou |
| 2023 | ICASSP | A Dynamic Graph Interactive Framework with Label-Semantic Injection for Spoken Language Understanding. | Zhihong Zhu, Weiyuan Xu, Xuxin Cheng, Tengtao Song, Yuexian Zou |
| 2023 | ICCV | G2L: Semantically Aligned and Uniform Video Grounding via Geodesic and Game Theory. | Hongxiang Li, Meng Cao, Xuxin Cheng, Yaowei Li, Zhihong Zhu, Yuexian Zou |
| 2023 | ICCV | Unify, Align and Refine: Multi-Level Semantic Alignment for Radiology Report Generation. | Yaowei Li, Bang Yang, Xuxin Cheng, Zhihong Zhu, Hongxiang Li, Yuexian Zou |
| 2023 | ICRA | Legs as Manipulator: Pushing Quadrupedal Agility Beyond Locomotion. | Xuxin Cheng, Ashish Kumar, Deepak Pathak |
| 2023 | Interspeech | C²A-SLU: Cross and Contrastive Attention for Improving ASR Robustness in Spoken Language Understanding. | Xuxin Cheng, Ziyu Yao, Zhihong Zhu, Yaowei Li, Hongxiang Li, Yuexian Zou |
| 2023 | Interspeech | FC-MTLF: A Fine- and Coarse-grained Multi-Task Learning Framework for Cross-Lingual Spoken Language Understanding. | Xuxin Cheng, Wanshi Xu, Ziyu Yao, Zhihong Zhu, Yaowei Li, Hongxiang Li, Yuexian Zou |
| 2023 | Interspeech | GhostT5: Generate More Features with Cheap Operations to Improve Textless Spoken Question Answering. | Xuxin Cheng, Zhihong Zhu, Ziyu Yao, Hongxiang Li, Yaowei Li, Yuexian Zou |
| 2023 | Interspeech | Mix before Align: Towards Zero-shot Cross-lingual Sentiment Analysis via Soft-Mix and Multi-View Learning. | Zhihong Zhu, Xuxin Cheng, Dongsheng Chen, Zhiqi Huang, Hongxiang Li, Yuexian Zou |
| 2022 | CoRL | Deep Whole-Body Control: Learning a Unified Policy for Manipulation and Locomotion. | Zipeng Fu, Xuxin Cheng, Deepak Pathak |
| 2021 | ICRA | Reinforcement Learning for Robust Parameterized Locomotion Control of Bipedal Robots. | Zhongyu Li, Xuxin Cheng, Xue Bin Peng, Pieter Abbeel, Sergey Levine, Glen Berseth, Koushil Sreenath |