| 2026 | AAAI | SCAN: Self-Calibrated AutoregressioN for High-Quality Visual Generation. | Zhanzhou Feng, Qingpei Guo, Jingdong Chen, Feng Gao, Ming Yang, Shiliang Zhang |
| 2026 | AAAI | When Person Re-Identification Meets Event Camera: A Benchmark Dataset and an Attribute-Guided Re-Identification Framework. | Xiao Wang, Qian Zhu, Shujuan Wu, Bo Jiang, Shiliang Zhang |
| 2026 | ISCAS | Binary Descriptor Learning via Diffusion-based Feature Disentanglement. | Shunan Mao, Gang Shen, Xuefei Lv, Ziwei Liu, Shiliang Zhang |
| 2025 | AAAI | Speech Recognition Meets Large Language Model: Benchmarking, Models, and Exploration. | Ziyang Ma, Guanrou Yang, Yifan Yang, Zhifu Gao, Jiaming Wang, Zhihao Du, Fan Yu, Qian Chen, Siqi Zheng, Shiliang Zhang, Xie Chen |
| 2025 | AAAI | MV-VTON: Multi-View Virtual Try-On with Diffusion Models. | Haoyu Wang, Zhilu Zhang, Donglin Di, Shiliang Zhang, Wangmeng Zuo |
| 2025 | ACL | UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook. | Yidi Jiang, Qian Chen, Shengpeng Ji, Yu Xi, Wen Wang, Chong Zhang, Xianghu Yue, Shiliang Zhang, Haizhou Li |
| 2025 | ACL | OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation. | Qinglin Zhang, Luyao Cheng, Chong Deng, Qian Chen, Wen Wang, Siqi Zheng, Jiaqing Liu, Hai Yu, Chao-Hong Tan, Zhihao Du, Shiliang Zhang |
| 2025 | CVPR | NN-Former: Rethinking Graph Structure in Neural Architecture Representation. | Ruihan Xu, Haokui Zhang, Yaowei Wang, Wei Zeng, Shiliang Zhang |
| 2025 | CVPR | Generalizable Object Keypoint Localization from Generative Priors. | Dongkai Wang, Jiang Duan, Liangjian Wen, Shiyu Xuan, Hao Chen, Shiliang Zhang |
| 2025 | EMNLP | UniSpeaker: A Unified Approach for Multimodality-driven Speaker Generation. | Zhengyan Sheng, Zhihao Du, Heng Lu, Shiliang Zhang, Zhen-Hua Ling |
| 2025 | ICASSP | Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision. | Yafeng Chen, Siqi Zheng, Hui Wang, Luyao Cheng, Qian Chen, Chong Deng, Shiliang Zhang, Wen Wang |
| 2025 | ICASSP | 3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization. | Yafeng Chen, Siqi Zheng, Hui Wang, Luyao Cheng, Tinglong Zhu, Rongjie Huang, Chong Deng, Qian Chen, Shiliang Zhang, Wen Wang, Xihao Li |
| 2025 | ICASSP | Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap. | Guanrou Yang, Fan Yu, Ziyang Ma, Zhihao Du, Zhifu Gao, Shiliang Zhang, Xie Chen |
| 2025 | ICCV | Unified Visual Generation via Next-Set Prediction in Continuous Domain. | Zhanzhou Feng, Qingpei Guo, Xinyu Xiao, Ruihan Xu, Ming Yang, Shiliang Zhang |
| 2025 | ICML | OmniAudio: Generating Spatial Audio from 360-Degree Video. | Huadai Liu, Tianyi Luo, Kaicheng Luo, Qikai Jiang, Peiwen Sun, Jialei Wang, Rongjie Huang, Qian Chen, Wen Wang, Xiangtai Li, Shiliang Zhang, Zhijie Yan, Zhou Zhao, Wei Xue |
| 2025 | ICML | Efficient Multi-modal Long Context Learning for Training-free Adaptation. | Zehong Ma, Shiliang Zhang, Longhui Wei, Qi Tian |
| 2025 | Interspeech | Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR. | Mingyu Cui, Yifan Yang, Jiajun Deng, Jiawen Kang, Shujie Hu, Tianzi Wang, Zhaoqing Li, Shiliang Zhang, Xie Chen, Xunying Liu |
| 2025 | Interspeech | Differentiable Reward Optimization for LLM based TTS system. | Changfeng Gao, Zhihao Du, Shiliang Zhang |
| 2025 | VTC | Extended Vehicle Energy Dataset (eVED): An Enhanced Large-Scale Dataset for Vehicle Energy Consumption Analysis. | Shiliang Zhang, Dyako Fatih, Fahmi Abdulqadir, Tobias Schwarz, Xuehui Ma |
| 2024 | AAAI | Decoupled Optimisation for Long-Tailed Visual Recognition. | Cong Cong, Shiyu Xuan, Sidong Liu, Shiliang Zhang, Maurice Pagnucco, Yang Song |
| 2024 | AAAI | Decoupled Contrastive Learning for Long-Tailed Recognition. | Shiyu Xuan, Shiliang Zhang |
| 2024 | AAAI | Recognizing Ultra-High-Speed Moving Objects with Bio-Inspired Spike Camera. | Junwei Zhao, Shiliang Zhang, Zhaofei Yu, Tiejun Huang |
| 2024 | ACL | emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation. | Ziyang Ma, Zhisheng Zheng, Jiaxin Ye, Jinchao Li, Zhifu Gao, Shiliang Zhang, Xie Chen |
| 2024 | CVPR | OVMR: Open-Vocabulary Recognition with Multi-Modal References. | Zehong Ma, Shiliang Zhang, Longhui Wei, Qi Tian |
| 2024 | CVPR | LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language Model. | Dongkai Wang, Shiyu Xuan, Shiliang Zhang |
| 2024 | CVPR | Spatial-Aware Regression for Keypoint Localization. | Dongkai Wang, Shiliang Zhang |
| 2024 | CVPR | Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs. | Shiyu Xuan, Qingpei Guo, Ming Yang, Shiliang Zhang |
| 2024 | ICASSP | Loss Masking Is Not Needed In Decoder-Only Transformer For Discrete-Token-Based ASR. | Qian Chen, Wen Wang, Qinglin Zhang, Siqi Zheng, Shiliang Zhang, Chong Deng, Yukun Ma, Hai Yu, Jiaqing Liu, Chong Zhang |
| 2024 | ICASSP | FunCodec: A Fundamental, Reproducible and Integrable Open-Source Toolkit for Neural Speech Codec. | Zhihao Du, Shiliang Zhang, Kai Hu, Siqi Zheng |
| 2024 | ICASSP | Leveraging Speech PTM, Text LLM, And Emotional TTS For Speech Emotion Recognition. | Ziyang Ma, Wen Wu, Zhisheng Zheng, Yiwei Guo, Qian Chen, Shiliang Zhang, Xie Chen |
| 2024 | ICASSP | SeACo-Paraformer: A Non-Autoregressive ASR System with Flexible and Effective Hotword Customization Ability. | Xian Shi, Yexin Yang, Zerui Li, Yanni Chen, Zhifu Gao, Shiliang Zhang |
| 2024 | ICASSP | SlideSpeech: A Large Scale Slide-Enriched Audio-Visual Corpus. | Haoxu Wang, Fan Yu, Xian Shi, Yuezhang Wang, Shiliang Zhang, Ming Li |
| 2024 | ICASSP | Hourglass-AVSR: Down-Up Sampling-Based Computational Efficiency Model for Audio-Visual Speech Recognition. | Fan Yu, Haoxu Wang, Ziyang Ma, Shiliang Zhang |
| 2024 | ICASSP | LCB-Net: Long-Context Biasing for Audio-Visual Speech Recognition. | Fan Yu, Haoxu Wang, Xian Shi, Shiliang Zhang |
| 2024 | Interspeech | ERes2NetV2: Boosting Short-Duration Speaker Verification Performance with Computational Efficiency. | Yafeng Chen, Siqi Zheng, Hui Wang, Luyao Cheng, Qian Chen, Shiliang Zhang, Junjie Li |
| 2024 | Interspeech | Personality-memory Gated Adaptation: An Efficient Speaker Adaptation for Personalized End-to-end Automatic Speech Recognition. | Yue Gu, Zhihao Du, Shiliang Zhang, Jiqing Han, Yongjun He |
| 2024 | Interspeech | Incorporating Class-based Language Model for Named Entity Recognition in Factorized Neural Transducer. | Peng Wang, Yifan Yang, Zheng Liang, Tian Tan, Shiliang Zhang, Xie Chen |
| 2024 | Interspeech | MaLa-ASR: Multimedia-Assisted LLM-Based ASR. | Guanrou Yang, Ziyang Ma, Fan Yu, Zhifu Gao, Shiliang Zhang, Xie Chen |
| 2023 | ASRU | The Second Multi-Channel Multi-Party Meeting Transcription Challenge (M2MeT 2.0): A Benchmark for Speaker-Attributed ASR. | Yuhao Liang, Mohan Shi, Fan Yu, Yangze Li, Shiliang Zhang, Zhihao Du, Qian Chen, Lei Xie, Yanmin Qian, Jian Wu, Zhuo Chen, Kong Aik Lee, Zhijie Yan, Hui Bu |
| 2023 | ASRU | Sa-Paraformer: Non-Autoregressive End-To-End Speaker-Attributed ASR. | Yangze Li, Fan Yu, Yuhao Liang, Pengcheng Guo, Mohan Shi, Zhihao Du, Shiliang Zhang, Lei Xie |
| 2023 | CVPR | Evolved Part Masking for Self-Supervised Learning. | Zhanzhou Feng, Shiliang Zhang |
| 2023 | ICASSP | Speech and Noise Dual-Stream Spectrogram Refine Network With Speech Distortion Loss For Robust Speech Recognition. | Haoyu Lu, Nan Li, Tongtong Song, Longbiao Wang, Jianwu Dang, Xiaobao Wang, Shiliang Zhang |
| 2023 | ICASSP | TOLD: a Novel Two-Stage Overlap-Aware Framework for Speaker Diarization. | Jiaming Wang, Zhihao Du, Shiliang Zhang |
| 2023 | ICCV | ParCNetV2: Oversized Kernel with Enhanced Attention | Ruihan Xu, Haokui Zhang, Wenze Hu, Shiliang Zhang, Xiaoyu Wang |
| 2023 | ICCV | 3D Human Mesh Recovery with Sequentially Global Rotation Estimation. | Dongkai Wang, Shiliang Zhang |
| 2023 | Interspeech | BAT: Boundary aware transducer for memory-efficient and low-latency ASR. | Keyu An, Xian Shi, Shiliang Zhang |
| 2023 | Interspeech | FunASR: A Fundamental End-to-End Speech Recognition Toolkit. | Zhifu Gao, Zerui Li, Jiaming Wang, Haoneng Luo, Xian Shi, Mengzhe Chen, Yabin Li, Lingyun Zuo, Zhihao Du, Shiliang Zhang |
| 2023 | Interspeech | Personality-aware Training based Speaker Adaptation for End-to-end Speech Recognition. | Yue Gu, Zhihao Du, Shiliang Zhang, Qian Chen, Jiqing Han |
| 2023 | Interspeech | BA-SOT: Boundary-Aware Serialized Output Training for Multi-Talker ASR. | Yuhao Liang, Fan Yu, Yangze Li, Pengcheng Guo, Shiliang Zhang, Qian Chen, Lei Xie |
| 2023 | Interspeech | Rethinking the Visual Cues in Audio-Visual Speaker Extraction. | Junjie Li, Meng Ge, Zexu Pan, Rui Cao, Longbiao Wang, Jianwu Dang, Shiliang Zhang |
| 2023 | Interspeech | CASA-ASR: Context-Aware Speaker-Attributed ASR. | Mohan Shi, Zhihao Du, Qian Chen, Fan Yu, Yangze Li, Shiliang Zhang, Jie Zhang, Li-Rong Dai |
| 2023 | Interspeech | Accurate and Reliable Confidence Estimation Based on Non-Autoregressive End-to-End Speech Recognition System. | Xian Shi, Haoneng Luo, Zhifu Gao, Shiliang Zhang, Zhijie Yan |
| 2023 | Interspeech | Semantic VAD: Low-Latency Voice Activity Detection for Speech Interaction. | Mohan Shi, Yuchun Shu, Lingyun Zuo, Qian Chen, Shiliang Zhang, Jie Zhang, Li-Rong Dai |
| 2023 | Interspeech | MMSpeech: Multi-modal Multi-task Encoder-Decoder Pre-training for speech recognition. | Xiaohuan Zhou, Jiaming Wang, Zeyu Cui, Shiliang Zhang, Zhijie Yan, Jingren Zhou, Chang Zhou |
| 2022 | ACL | MDERank: A Masked Document Embedding Rank Approach for Unsupervised Keyphrase Extraction. | Linhan Zhang, Qian Chen, Wen Wang, Chong Deng, Shiliang Zhang, Bing Li, Wei Wang, Xin Cao |
| 2022 | BMVC | Domain Generalization Capability Enhancement for Binary Neural Networks. | Jianming Ye, Shunan Mao, Shiliang Zhang |
| 2022 | CVPR | Contextual Instance Decoupling for Robust Multi-Person Pose Estimation. | Dongkai Wang, Shiliang Zhang |
| 2022 | EMNLP | Speaker Overlap-aware Neural Diarization for Multi-party Meeting Analysis. | Zhihao Du, Shiliang Zhang, Siqi Zheng, Zhi-Jie Yan |
| 2022 | ICASSP | Prosospeech: Enhancing Prosody with Quantized Vector Pre-Training in Text-To-Speech. | Yi Ren, Ming Lei, Zhiying Huang, Shiliang Zhang, Qian Chen, Zhijie Yan, Zhou Zhao |
| 2022 | ICASSP | M2Met: The Icassp 2022 Multi-Channel Multi-Party Meeting Transcription Challenge. | Fan Yu, Shiliang Zhang, Yihui Fu, Lei Xie, Siqi Zheng, Zhihao Du, Weilong Huang, Pengcheng Guo, Zhijie Yan, Bin Ma, Xin Xu, Hui Bu |
| 2022 | ICASSP | Summary on the ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Grand Challenge. | Fan Yu, Shiliang Zhang, Pengcheng Guo, Yihui Fu, Zhihao Du, Siqi Zheng, Weilong Huang, Lei Xie, Zheng-Hua Tan, DeLiang Wang, Yanmin Qian, Kong Aik Lee, Zhijie Yan, Bin Ma, Xin Xu, Hui Bu |
| 2022 | ICASSP | Modeling The Detection Capability Of High-Speed Spiking Cameras. | Junwei Zhao, Zhaofei Yu, Lei Ma, Ziluo Ding, Shiliang Zhang, Yonghong Tian, Tiejun Huang |
| 2022 | ICASSP | Transformer-Based Domain Adaptation for Event Data Classification. | Junwei Zhao, Shiliang Zhang, Tiejun Huang |
| 2022 | Interspeech | Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition. | Zhifu Gao, Shiliang Zhang, Ian McLoughlin, Zhijie Yan |
| 2022 | Interspeech | A Comparative Study on Speaker-attributed Automatic Speech Recognition in Multi-party Meetings. | Fan Yu, Zhihao Du, Shiliang Zhang, Yuxiao Lin, Lei Xie |
| 2022 | ISCAS | SpikingSIM: A Bio-Inspired Spiking Simulator. | Junwei Zhao, Shiliang Zhang, Lei Ma, Zhaofei Yu, Tiejun Huang |
| 2021 | CVPR | Intra-Inter Camera Similarity for Unsupervised Person Re-Identification. | Shiyu Xuan, Shiliang Zhang |
| 2021 | IJCAI | Graph Consistency Based Mean-Teaching for Unsupervised Domain Adaptive Person Re-Identification. | Xiaobin Liu, Shiliang Zhang |
| 2021 | Interspeech | Extremely Low Footprint End-to-End ASR System for Smart Device. | Zhifu Gao, Yiwu Yao, Shiliang Zhang, Jun Yang, Ming Lei, Ian McLoughlin |
| 2021 | Interspeech | Investigation of Spatial-Acoustic Features for Overlapping Speech Detection in Multiparty Meetings. | Shiliang Zhang, Siqi Zheng, Weilong Huang, Ming Lei, Hongbin Suo, Jinwei Feng, Zhijie Yan |
| 2020 | CVPR | Unsupervised Person Re-Identification via Multi-Label Classification. | Dongkai Wang, Shiliang Zhang |
| 2020 | CVPR | Robust Partial Matching for Person Search in the Wild. | Yingji Zhong, Xiaoyu Wang, Shiliang Zhang |
| 2020 | ECCV | Joint Visual and Temporal Consistency for Unsupervised Domain Adaptive Person Re-identification. | Jianing Li, Shiliang Zhang |
| 2020 | ICASSP | Pan: Phoneme-Aware Network for Monaural Speech Enhancement. | Zhihao Du, Ming Lei, Jiqing Han, Shiliang Zhang |
| 2020 | Interspeech | Self-Supervised Adversarial Multi-Task Learning for Vocoder-Based Monaural Speech Enhancement. | Zhihao Du, Ming Lei, Jiqing Han, Shiliang Zhang |
| 2020 | Interspeech | Neural Zero-Inflated Quality Estimation Model for Automatic Speech Recognition System. | Kai Fan, Bo Li, Jiayi Wang, Shiliang Zhang, Boxing Chen, Niyu Ge, Zhijie Yan |
| 2020 | Interspeech | SAN-M: Memory Equipped Self-Attention for End-to-End Speech Recognition. | Zhifu Gao, Shiliang Zhang, Ming Lei, Ian McLoughlin |
| 2020 | Interspeech | Streaming Chunk-Aware Multihead Attention for Online End-to-End Speech Recognition. | Shiliang Zhang, Zhifu Gao, Haoneng Luo, Ming Lei, Jie Gao, Zhijie Yan, Lei Xie |
| 2019 | AAAI | Multi-Scale 3D Convolution Network for Video Based Person Re-Identification. | Jianing Li, Shiliang Zhang, Tiejun Huang |
| 2019 | CVPR | Bi-Directional Cascade Network for Perceptual Edge Detection. | Jianzhong He, Shiliang Zhang, Ming Yang, Yanhu Shan, Tiejun Huang |
| 2019 | ICASSP | Investigation of Modeling Units for Mandarin Speech Recognition Using Dfsmn-ctc-smbr. | Shiliang Zhang, Ming Lei, Yuan Liu, Wei Li |
| 2019 | ICASSP | Robust Audio-visual Speech Recognition Using Bimodal Dfsmn with Multi-condition Training and Dropout Regularization. | Shiliang Zhang, Ming Lei, Bin Ma, Lei Xie |
| 2019 | ICCV | Global-Local Temporal Representations for Video Person Re-Identification. | Jianing Li, Shiliang Zhang, Jingdong Wang, Wen Gao, Qi Tian |
| 2019 | IJCAI | Resolution-invariant Person Re-Identification. | Shunan Mao, Shiliang Zhang, Ming Yang |
| 2019 | Interspeech | Audio Tagging with Compact Feedforward Sequential Memory Network and Audio-to-Audio Ratio Based Data Augmentation. | Zhiying Huang, Shiliang Zhang, Ming Lei |
| 2019 | Interspeech | Towards Language-Universal Mandarin-English Speech Recognition. | Shiliang Zhang, Yuan Liu, Ming Lei, Bin Ma, Lei Xie |
| 2019 | Interspeech | Investigation of Transformer Based Spelling Correction Model for CTC-Based End-to-End Mandarin Speech Recognition. | Shiliang Zhang, Ming Lei, Zhijie Yan |
| 2018 | CVPR | Person Transfer GAN to Bridge Domain Gap for Person Re-Identification. | Longhui Wei, Shiliang Zhang, Wen Gao, Qi Tian |
| 2018 | ICASSP | Deep Feed-Forward Sequential Memory Networks for Speech Synthesis. | Mengxiao Bi, Heng Lu, Shiliang Zhang, Ming Lei, Zhijie Yan |
| 2018 | ICASSP | Deep-FSMN for Large Vocabulary Continuous Speech Recognition. | Shiliang Zhang, Ming Lei, Zhijie Yan, Lirong Dai |
| 2018 | Interspeech | Compact Feedforward Sequential Memory Networks for Small-footprint Keyword Spotting. | Mengzhe Chen, Shiliang Zhang, Ming Lei, Yong Liu, Haitao Yao, Jie Gao |
| 2018 | Interspeech | Acoustic Modeling with DFSMN-CTC and Joint CTC-CE Learning. | Shiliang Zhang, Ming Lei |
| 2017 | ICCV | Pose-Driven Deep Convolutional Model for Person Re-identification. | Chi Su, Jianing Li, Shiliang Zhang, Junliang Xing, Wen Gao, Qi Tian |
| 2017 | Interspeech | Gaussian Prediction Based Attention for Online End-to-End Speech Recognition. | Junfeng Hou, Shiliang Zhang, Li-Rong Dai |
| 2016 | ECCV | Deep Attributes Driven Multi-camera Person Re-identification. | Chi Su, Shiliang Zhang, Junliang Xing, Wen Gao, Qi Tian |
| 2016 | Interspeech | Future Context Attention for Unidirectional LSTM Based Acoustic Model. | Jian Tang, Shiliang Zhang, Si Wei, Li-Rong Dai |
| 2016 | Interspeech | Compact Feedforward Sequential Memory Networks for Large Vocabulary Continuous Speech Recognition. | Shiliang Zhang, Hui Jiang, Shifu Xiong, Si Wei, Li-Rong Dai |
| 2015 | ACL | The Fixed-Size Ordinally-Forgetting Encoding Method for Neural Network Language Models. | Shiliang Zhang, Hui Jiang, Mingbin Xu, Junfeng Hou, Li-Rong Dai |
| 2015 | ICCV | Multi-Task Learning with Low Rank Attribute Embedding for Person Re-Identification. | Chi Su, Fan Yang, Shiliang Zhang, Qi Tian, Larry S. Davis, Wen Gao |
| 2015 | Interspeech | Rectified linear neural networks with tied-scalar regularization for LVCSR. | Shiliang Zhang, Hui Jiang, Si Wei, Li-Rong Dai |
| 2014 | ACCV | Hybrid-Indexing Multi-type Features for Large-Scale Image Search. | Qingjun Luo, Shiliang Zhang, Tiejun Huang, Wen Gao, Qi Tian |
| 2014 | ICASSP | Improving deep neural networks for LVCSR using dropout and shrinking structure. | Shiliang Zhang, Yebo Bao, Pan Zhou, Hui Jiang, Li-Rong Dai |
| 2013 | ICCV | Semantic-Aware Co-indexing for Image Retrieval. | Shiliang Zhang, Ming Yang, Xiaoyu Wang, Yuanqing Lin, Qi Tian |
| 2011 | MMSP | ObjectBook construction for large-scale semantic-aware image retrieval. | Shiliang Zhang, Qi Tian, Qingming Huang, Wen Gao |
| 2010 | ICASSP | Building pair-wise visual word tree for efficent image re-ranking. | Shiliang Zhang, Qingming Huang, Yijuan Lu, Wen Gao, Qi Tian |
| 2009 | ICIP | Utilizing affective analysis for efficient movie browsing. | Shiliang Zhang, Qi Tian, Qingming Huang, Wen Gao, Shipeng Li |