Skip to content

Shiliang Zhang

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

106

Venues

17

Active years

2009–2026

Best venue rank

A*

Where they publish

Papers

106 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAISCAN: Self-Calibrated AutoregressioN for High-Quality Visual Generation.Zhanzhou Feng, Qingpei Guo, Jingdong Chen, Feng Gao, Ming Yang, Shiliang Zhang
2026AAAIWhen Person Re-Identification Meets Event Camera: A Benchmark Dataset and an Attribute-Guided Re-Identification Framework.Xiao Wang, Qian Zhu, Shujuan Wu, Bo Jiang, Shiliang Zhang
2026ISCASBinary Descriptor Learning via Diffusion-based Feature Disentanglement.Shunan Mao, Gang Shen, Xuefei Lv, Ziwei Liu, Shiliang Zhang
2025AAAISpeech Recognition Meets Large Language Model: Benchmarking, Models, and Exploration.Ziyang Ma, Guanrou Yang, Yifan Yang, Zhifu Gao, Jiaming Wang, Zhihao Du, Fan Yu, Qian Chen, Siqi Zheng, Shiliang Zhang, Xie Chen
2025AAAIMV-VTON: Multi-View Virtual Try-On with Diffusion Models.Haoyu Wang, Zhilu Zhang, Donglin Di, Shiliang Zhang, Wangmeng Zuo
2025ACLUniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook.Yidi Jiang, Qian Chen, Shengpeng Ji, Yu Xi, Wen Wang, Chong Zhang, Xianghu Yue, Shiliang Zhang, Haizhou Li
2025ACLOmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation.Qinglin Zhang, Luyao Cheng, Chong Deng, Qian Chen, Wen Wang, Siqi Zheng, Jiaqing Liu, Hai Yu, Chao-Hong Tan, Zhihao Du, Shiliang Zhang
2025CVPRNN-Former: Rethinking Graph Structure in Neural Architecture Representation.Ruihan Xu, Haokui Zhang, Yaowei Wang, Wei Zeng, Shiliang Zhang
2025CVPRGeneralizable Object Keypoint Localization from Generative Priors.Dongkai Wang, Jiang Duan, Liangjian Wen, Shiyu Xuan, Hao Chen, Shiliang Zhang
2025EMNLPUniSpeaker: A Unified Approach for Multimodality-driven Speaker Generation.Zhengyan Sheng, Zhihao Du, Heng Lu, Shiliang Zhang, Zhen-Hua Ling
2025ICASSPSelf-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision.Yafeng Chen, Siqi Zheng, Hui Wang, Luyao Cheng, Qian Chen, Chong Deng, Shiliang Zhang, Wen Wang
2025ICASSP3D-Speaker-Toolkit: An Open-Source Toolkit for Multimodal Speaker Verification and Diarization.Yafeng Chen, Siqi Zheng, Hui Wang, Luyao Cheng, Tinglong Zhu, Rongjie Huang, Chong Deng, Qian Chen, Shiliang Zhang, Wen Wang, Xihao Li
2025ICASSPEnhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap.Guanrou Yang, Fan Yu, Ziyang Ma, Zhihao Du, Zhifu Gao, Shiliang Zhang, Xie Chen
2025ICCVUnified Visual Generation via Next-Set Prediction in Continuous Domain.Zhanzhou Feng, Qingpei Guo, Xinyu Xiao, Ruihan Xu, Ming Yang, Shiliang Zhang
2025ICMLOmniAudio: Generating Spatial Audio from 360-Degree Video.Huadai Liu, Tianyi Luo, Kaicheng Luo, Qikai Jiang, Peiwen Sun, Jialei Wang, Rongjie Huang, Qian Chen, Wen Wang, Xiangtai Li, Shiliang Zhang, Zhijie Yan, Zhou Zhao, Wei Xue
2025ICMLEfficient Multi-modal Long Context Learning for Training-free Adaptation.Zehong Ma, Shiliang Zhang, Longhui Wei, Qi Tian
2025InterspeechExploring SSL Discrete Speech Features for Zipformer-based Contextual ASR.Mingyu Cui, Yifan Yang, Jiajun Deng, Jiawen Kang, Shujie Hu, Tianzi Wang, Zhaoqing Li, Shiliang Zhang, Xie Chen, Xunying Liu
2025InterspeechDifferentiable Reward Optimization for LLM based TTS system.Changfeng Gao, Zhihao Du, Shiliang Zhang
2025VTCExtended Vehicle Energy Dataset (eVED): An Enhanced Large-Scale Dataset for Vehicle Energy Consumption Analysis.Shiliang Zhang, Dyako Fatih, Fahmi Abdulqadir, Tobias Schwarz, Xuehui Ma
2024AAAIDecoupled Optimisation for Long-Tailed Visual Recognition.Cong Cong, Shiyu Xuan, Sidong Liu, Shiliang Zhang, Maurice Pagnucco, Yang Song
2024AAAIDecoupled Contrastive Learning for Long-Tailed Recognition.Shiyu Xuan, Shiliang Zhang
2024AAAIRecognizing Ultra-High-Speed Moving Objects with Bio-Inspired Spike Camera.Junwei Zhao, Shiliang Zhang, Zhaofei Yu, Tiejun Huang
2024ACLemotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation.Ziyang Ma, Zhisheng Zheng, Jiaxin Ye, Jinchao Li, Zhifu Gao, Shiliang Zhang, Xie Chen
2024CVPROVMR: Open-Vocabulary Recognition with Multi-Modal References.Zehong Ma, Shiliang Zhang, Longhui Wei, Qi Tian
2024CVPRLocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language Model.Dongkai Wang, Shiyu Xuan, Shiliang Zhang
2024CVPRSpatial-Aware Regression for Keypoint Localization.Dongkai Wang, Shiliang Zhang
2024CVPRPink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs.Shiyu Xuan, Qingpei Guo, Ming Yang, Shiliang Zhang
2024ICASSPLoss Masking Is Not Needed In Decoder-Only Transformer For Discrete-Token-Based ASR.Qian Chen, Wen Wang, Qinglin Zhang, Siqi Zheng, Shiliang Zhang, Chong Deng, Yukun Ma, Hai Yu, Jiaqing Liu, Chong Zhang
2024ICASSPFunCodec: A Fundamental, Reproducible and Integrable Open-Source Toolkit for Neural Speech Codec.Zhihao Du, Shiliang Zhang, Kai Hu, Siqi Zheng
2024ICASSPLeveraging Speech PTM, Text LLM, And Emotional TTS For Speech Emotion Recognition.Ziyang Ma, Wen Wu, Zhisheng Zheng, Yiwei Guo, Qian Chen, Shiliang Zhang, Xie Chen
2024ICASSPSeACo-Paraformer: A Non-Autoregressive ASR System with Flexible and Effective Hotword Customization Ability.Xian Shi, Yexin Yang, Zerui Li, Yanni Chen, Zhifu Gao, Shiliang Zhang
2024ICASSPSlideSpeech: A Large Scale Slide-Enriched Audio-Visual Corpus.Haoxu Wang, Fan Yu, Xian Shi, Yuezhang Wang, Shiliang Zhang, Ming Li
2024ICASSPHourglass-AVSR: Down-Up Sampling-Based Computational Efficiency Model for Audio-Visual Speech Recognition.Fan Yu, Haoxu Wang, Ziyang Ma, Shiliang Zhang
2024ICASSPLCB-Net: Long-Context Biasing for Audio-Visual Speech Recognition.Fan Yu, Haoxu Wang, Xian Shi, Shiliang Zhang
2024InterspeechERes2NetV2: Boosting Short-Duration Speaker Verification Performance with Computational Efficiency.Yafeng Chen, Siqi Zheng, Hui Wang, Luyao Cheng, Qian Chen, Shiliang Zhang, Junjie Li
2024InterspeechPersonality-memory Gated Adaptation: An Efficient Speaker Adaptation for Personalized End-to-end Automatic Speech Recognition.Yue Gu, Zhihao Du, Shiliang Zhang, Jiqing Han, Yongjun He
2024InterspeechIncorporating Class-based Language Model for Named Entity Recognition in Factorized Neural Transducer.Peng Wang, Yifan Yang, Zheng Liang, Tian Tan, Shiliang Zhang, Xie Chen
2024InterspeechMaLa-ASR: Multimedia-Assisted LLM-Based ASR.Guanrou Yang, Ziyang Ma, Fan Yu, Zhifu Gao, Shiliang Zhang, Xie Chen
2023ASRUThe Second Multi-Channel Multi-Party Meeting Transcription Challenge (M2MeT 2.0): A Benchmark for Speaker-Attributed ASR.Yuhao Liang, Mohan Shi, Fan Yu, Yangze Li, Shiliang Zhang, Zhihao Du, Qian Chen, Lei Xie, Yanmin Qian, Jian Wu, Zhuo Chen, Kong Aik Lee, Zhijie Yan, Hui Bu
2023ASRUSa-Paraformer: Non-Autoregressive End-To-End Speaker-Attributed ASR.Yangze Li, Fan Yu, Yuhao Liang, Pengcheng Guo, Mohan Shi, Zhihao Du, Shiliang Zhang, Lei Xie
2023CVPREvolved Part Masking for Self-Supervised Learning.Zhanzhou Feng, Shiliang Zhang
2023ICASSPSpeech and Noise Dual-Stream Spectrogram Refine Network With Speech Distortion Loss For Robust Speech Recognition.Haoyu Lu, Nan Li, Tongtong Song, Longbiao Wang, Jianwu Dang, Xiaobao Wang, Shiliang Zhang
2023ICASSPTOLD: a Novel Two-Stage Overlap-Aware Framework for Speaker Diarization.Jiaming Wang, Zhihao Du, Shiliang Zhang
2023ICCVParCNetV2: Oversized Kernel with Enhanced AttentionRuihan Xu, Haokui Zhang, Wenze Hu, Shiliang Zhang, Xiaoyu Wang
2023ICCV3D Human Mesh Recovery with Sequentially Global Rotation Estimation.Dongkai Wang, Shiliang Zhang
2023InterspeechBAT: Boundary aware transducer for memory-efficient and low-latency ASR.Keyu An, Xian Shi, Shiliang Zhang
2023InterspeechFunASR: A Fundamental End-to-End Speech Recognition Toolkit.Zhifu Gao, Zerui Li, Jiaming Wang, Haoneng Luo, Xian Shi, Mengzhe Chen, Yabin Li, Lingyun Zuo, Zhihao Du, Shiliang Zhang
2023InterspeechPersonality-aware Training based Speaker Adaptation for End-to-end Speech Recognition.Yue Gu, Zhihao Du, Shiliang Zhang, Qian Chen, Jiqing Han
2023InterspeechBA-SOT: Boundary-Aware Serialized Output Training for Multi-Talker ASR.Yuhao Liang, Fan Yu, Yangze Li, Pengcheng Guo, Shiliang Zhang, Qian Chen, Lei Xie
2023InterspeechRethinking the Visual Cues in Audio-Visual Speaker Extraction.Junjie Li, Meng Ge, Zexu Pan, Rui Cao, Longbiao Wang, Jianwu Dang, Shiliang Zhang
2023InterspeechCASA-ASR: Context-Aware Speaker-Attributed ASR.Mohan Shi, Zhihao Du, Qian Chen, Fan Yu, Yangze Li, Shiliang Zhang, Jie Zhang, Li-Rong Dai
2023InterspeechAccurate and Reliable Confidence Estimation Based on Non-Autoregressive End-to-End Speech Recognition System.Xian Shi, Haoneng Luo, Zhifu Gao, Shiliang Zhang, Zhijie Yan
2023InterspeechSemantic VAD: Low-Latency Voice Activity Detection for Speech Interaction.Mohan Shi, Yuchun Shu, Lingyun Zuo, Qian Chen, Shiliang Zhang, Jie Zhang, Li-Rong Dai
2023InterspeechMMSpeech: Multi-modal Multi-task Encoder-Decoder Pre-training for speech recognition.Xiaohuan Zhou, Jiaming Wang, Zeyu Cui, Shiliang Zhang, Zhijie Yan, Jingren Zhou, Chang Zhou
2022ACLMDERank: A Masked Document Embedding Rank Approach for Unsupervised Keyphrase Extraction.Linhan Zhang, Qian Chen, Wen Wang, Chong Deng, Shiliang Zhang, Bing Li, Wei Wang, Xin Cao
2022BMVCDomain Generalization Capability Enhancement for Binary Neural Networks.Jianming Ye, Shunan Mao, Shiliang Zhang
2022CVPRContextual Instance Decoupling for Robust Multi-Person Pose Estimation.Dongkai Wang, Shiliang Zhang
2022EMNLPSpeaker Overlap-aware Neural Diarization for Multi-party Meeting Analysis.Zhihao Du, Shiliang Zhang, Siqi Zheng, Zhi-Jie Yan
2022ICASSPProsospeech: Enhancing Prosody with Quantized Vector Pre-Training in Text-To-Speech.Yi Ren, Ming Lei, Zhiying Huang, Shiliang Zhang, Qian Chen, Zhijie Yan, Zhou Zhao
2022ICASSPM2Met: The Icassp 2022 Multi-Channel Multi-Party Meeting Transcription Challenge.Fan Yu, Shiliang Zhang, Yihui Fu, Lei Xie, Siqi Zheng, Zhihao Du, Weilong Huang, Pengcheng Guo, Zhijie Yan, Bin Ma, Xin Xu, Hui Bu
2022ICASSPSummary on the ICASSP 2022 Multi-Channel Multi-Party Meeting Transcription Grand Challenge.Fan Yu, Shiliang Zhang, Pengcheng Guo, Yihui Fu, Zhihao Du, Siqi Zheng, Weilong Huang, Lei Xie, Zheng-Hua Tan, DeLiang Wang, Yanmin Qian, Kong Aik Lee, Zhijie Yan, Bin Ma, Xin Xu, Hui Bu
2022ICASSPModeling The Detection Capability Of High-Speed Spiking Cameras.Junwei Zhao, Zhaofei Yu, Lei Ma, Ziluo Ding, Shiliang Zhang, Yonghong Tian, Tiejun Huang
2022ICASSPTransformer-Based Domain Adaptation for Event Data Classification.Junwei Zhao, Shiliang Zhang, Tiejun Huang
2022InterspeechParaformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition.Zhifu Gao, Shiliang Zhang, Ian McLoughlin, Zhijie Yan
2022InterspeechA Comparative Study on Speaker-attributed Automatic Speech Recognition in Multi-party Meetings.Fan Yu, Zhihao Du, Shiliang Zhang, Yuxiao Lin, Lei Xie
2022ISCASSpikingSIM: A Bio-Inspired Spiking Simulator.Junwei Zhao, Shiliang Zhang, Lei Ma, Zhaofei Yu, Tiejun Huang
2021CVPRIntra-Inter Camera Similarity for Unsupervised Person Re-Identification.Shiyu Xuan, Shiliang Zhang
2021IJCAIGraph Consistency Based Mean-Teaching for Unsupervised Domain Adaptive Person Re-Identification.Xiaobin Liu, Shiliang Zhang
2021InterspeechExtremely Low Footprint End-to-End ASR System for Smart Device.Zhifu Gao, Yiwu Yao, Shiliang Zhang, Jun Yang, Ming Lei, Ian McLoughlin
2021InterspeechInvestigation of Spatial-Acoustic Features for Overlapping Speech Detection in Multiparty Meetings.Shiliang Zhang, Siqi Zheng, Weilong Huang, Ming Lei, Hongbin Suo, Jinwei Feng, Zhijie Yan
2020CVPRUnsupervised Person Re-Identification via Multi-Label Classification.Dongkai Wang, Shiliang Zhang
2020CVPRRobust Partial Matching for Person Search in the Wild.Yingji Zhong, Xiaoyu Wang, Shiliang Zhang
2020ECCVJoint Visual and Temporal Consistency for Unsupervised Domain Adaptive Person Re-identification.Jianing Li, Shiliang Zhang
2020ICASSPPan: Phoneme-Aware Network for Monaural Speech Enhancement.Zhihao Du, Ming Lei, Jiqing Han, Shiliang Zhang
2020InterspeechSelf-Supervised Adversarial Multi-Task Learning for Vocoder-Based Monaural Speech Enhancement.Zhihao Du, Ming Lei, Jiqing Han, Shiliang Zhang
2020InterspeechNeural Zero-Inflated Quality Estimation Model for Automatic Speech Recognition System.Kai Fan, Bo Li, Jiayi Wang, Shiliang Zhang, Boxing Chen, Niyu Ge, Zhijie Yan
2020InterspeechSAN-M: Memory Equipped Self-Attention for End-to-End Speech Recognition.Zhifu Gao, Shiliang Zhang, Ming Lei, Ian McLoughlin
2020InterspeechStreaming Chunk-Aware Multihead Attention for Online End-to-End Speech Recognition.Shiliang Zhang, Zhifu Gao, Haoneng Luo, Ming Lei, Jie Gao, Zhijie Yan, Lei Xie
2019AAAIMulti-Scale 3D Convolution Network for Video Based Person Re-Identification.Jianing Li, Shiliang Zhang, Tiejun Huang
2019CVPRBi-Directional Cascade Network for Perceptual Edge Detection.Jianzhong He, Shiliang Zhang, Ming Yang, Yanhu Shan, Tiejun Huang
2019ICASSPInvestigation of Modeling Units for Mandarin Speech Recognition Using Dfsmn-ctc-smbr.Shiliang Zhang, Ming Lei, Yuan Liu, Wei Li
2019ICASSPRobust Audio-visual Speech Recognition Using Bimodal Dfsmn with Multi-condition Training and Dropout Regularization.Shiliang Zhang, Ming Lei, Bin Ma, Lei Xie
2019ICCVGlobal-Local Temporal Representations for Video Person Re-Identification.Jianing Li, Shiliang Zhang, Jingdong Wang, Wen Gao, Qi Tian
2019IJCAIResolution-invariant Person Re-Identification.Shunan Mao, Shiliang Zhang, Ming Yang
2019InterspeechAudio Tagging with Compact Feedforward Sequential Memory Network and Audio-to-Audio Ratio Based Data Augmentation.Zhiying Huang, Shiliang Zhang, Ming Lei
2019InterspeechTowards Language-Universal Mandarin-English Speech Recognition.Shiliang Zhang, Yuan Liu, Ming Lei, Bin Ma, Lei Xie
2019InterspeechInvestigation of Transformer Based Spelling Correction Model for CTC-Based End-to-End Mandarin Speech Recognition.Shiliang Zhang, Ming Lei, Zhijie Yan
2018CVPRPerson Transfer GAN to Bridge Domain Gap for Person Re-Identification.Longhui Wei, Shiliang Zhang, Wen Gao, Qi Tian
2018ICASSPDeep Feed-Forward Sequential Memory Networks for Speech Synthesis.Mengxiao Bi, Heng Lu, Shiliang Zhang, Ming Lei, Zhijie Yan
2018ICASSPDeep-FSMN for Large Vocabulary Continuous Speech Recognition.Shiliang Zhang, Ming Lei, Zhijie Yan, Lirong Dai
2018InterspeechCompact Feedforward Sequential Memory Networks for Small-footprint Keyword Spotting.Mengzhe Chen, Shiliang Zhang, Ming Lei, Yong Liu, Haitao Yao, Jie Gao
2018InterspeechAcoustic Modeling with DFSMN-CTC and Joint CTC-CE Learning.Shiliang Zhang, Ming Lei
2017ICCVPose-Driven Deep Convolutional Model for Person Re-identification.Chi Su, Jianing Li, Shiliang Zhang, Junliang Xing, Wen Gao, Qi Tian
2017InterspeechGaussian Prediction Based Attention for Online End-to-End Speech Recognition.Junfeng Hou, Shiliang Zhang, Li-Rong Dai
2016ECCVDeep Attributes Driven Multi-camera Person Re-identification.Chi Su, Shiliang Zhang, Junliang Xing, Wen Gao, Qi Tian
2016InterspeechFuture Context Attention for Unidirectional LSTM Based Acoustic Model.Jian Tang, Shiliang Zhang, Si Wei, Li-Rong Dai
2016InterspeechCompact Feedforward Sequential Memory Networks for Large Vocabulary Continuous Speech Recognition.Shiliang Zhang, Hui Jiang, Shifu Xiong, Si Wei, Li-Rong Dai
2015ACLThe Fixed-Size Ordinally-Forgetting Encoding Method for Neural Network Language Models.Shiliang Zhang, Hui Jiang, Mingbin Xu, Junfeng Hou, Li-Rong Dai
2015ICCVMulti-Task Learning with Low Rank Attribute Embedding for Person Re-Identification.Chi Su, Fan Yang, Shiliang Zhang, Qi Tian, Larry S. Davis, Wen Gao
2015InterspeechRectified linear neural networks with tied-scalar regularization for LVCSR.Shiliang Zhang, Hui Jiang, Si Wei, Li-Rong Dai
2014ACCVHybrid-Indexing Multi-type Features for Large-Scale Image Search.Qingjun Luo, Shiliang Zhang, Tiejun Huang, Wen Gao, Qi Tian
2014ICASSPImproving deep neural networks for LVCSR using dropout and shrinking structure.Shiliang Zhang, Yebo Bao, Pan Zhou, Hui Jiang, Li-Rong Dai
2013ICCVSemantic-Aware Co-indexing for Image Retrieval.Shiliang Zhang, Ming Yang, Xiaoyu Wang, Yuanqing Lin, Qi Tian
2011MMSPObjectBook construction for large-scale semantic-aware image retrieval.Shiliang Zhang, Qi Tian, Qingming Huang, Wen Gao
2010ICASSPBuilding pair-wise visual word tree for efficent image re-ranking.Shiliang Zhang, Qingming Huang, Yijuan Lu, Wen Gao, Qi Tian
2009ICIPUtilizing affective analysis for efficient movie browsing.Shiliang Zhang, Qi Tian, Qingming Huang, Wen Gao, Shipeng Li