Shi-Xiong Zhang
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
52
Venues
8
Active years
2007–2026
Best venue rank
A*
Where they publish
Papers
52 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Routing with Generated Data: Annotation-Free LLM Skill Estimation and Expert Selection. | Tianyi Niu, Justin Chih-Yao Chen, Genta Indra Winata, Shi-Xiong Zhang, Supriyo Chakraborty, Sambit Sahu, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal |
| 2026 | EACL | Lessons from the Field: An Adaptable Lifecycle Approach to Applied Dialogue Summarization. | Kushal Chawla, Chenyang Zhu, Pengshan Cai, Sangwoo Cho, Scott Novotney, Ayushman Singh, Jonah Lewis, Keasha Safewright, Alfy Samuel, Erin Babinsky, Shi-Xiong Zhang, Sambit Sahu |
| 2025 | ICASSP | BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech. | Anton Ratnarajah, Shi-Xiong Zhang, Dong Yu |
| 2025 | ICLR | RainbowPO: A Unified Framework for Combining Improvements in Preference Optimization. | Hanyang Zhao, Genta Indra Winata, Anirban Das, Shi-Xiong Zhang, David D. Yao, Wenpin Tang, Sambit Sahu |
| 2025 | NAACL | WorldCuisines: A Massive-Scale Benchmark for Multilingual and Multicultural Visual Question Answering on Global Cuisines. | Genta Indra Winata, Frederikus Hudi, Patrick Amadeus Irawan, David Anugraha, Rifki Afina Putri, Yutong Wang, Adam Nohejl, Ubaidillah Ariq Prathama, Nedjma Ousidhoum, Afifa Amriani, Anar Rzayev, Anirban Das, Ashmari Pramodya, Aulia Adila, Bryan Wilie, Candy Olivia Mawalim, Cheng Ching Lam, Daud Abolade, Emmanuele Chersoni, Enrico Santus, Fariz Ikhwantri, Garry Kuwanto, Hanyang Zhao, Haryo Akbarianto Wibowo, Holy Lovenia, Jan Christian Blaise Cruz, Jan Wira Gotama Putra, Junho Myung, Lucky Susanto, Maria Angelica Riera Machin, Marina Zhukova, Michael Anugraha, Muhammad Farid Adilazuarda, Natasha Christabelle Santosa, Peerat Limkonchotiwat, Raj Dabre, Rio Alexander Audino, Samuel Cahyawijaya, Shi-Xiong Zhang, Stephanie Yulia Salim, Yi Zhou, Yinxuan Gui, David Ifeoluwa Adelani, En-Shiun Annie Lee, Shogo Okada, Ayu Purwarianti, Alham Fikri Aji, Taro Watanabe, Derry Tanti Wijaya, Alice Oh, Chong-Wah Ngo |
| 2024 | AAAI | SECap: Speech Emotion Captioning with Large Language Model. | Yaoxun Xu, Hangting Chen, Jianwei Yu, Qiaochu Huang, Zhiyong Wu, Shi-Xiong Zhang, Guangzhi Li, Yi Luo, Rongzhi Gu |
| 2024 | ICASSP | UniX-Encoder: A Universal X-Channel Speech Encoder for AD-HOC Microphone Array Speech Processing. | Zili Huang, Yiwen Shao, Shi-Xiong Zhang, Dong Yu |
| 2024 | Interspeech | LibriheavyMix: A 20, 000-Hour Dataset for Single-Channel Reverberant Multi-Talker Speech Separation, ASR and Speaker Diarization. | Zengrui Jin, Yifan Yang, Mohan Shi, Wei Kang, Xiaoyu Yang, Zengwei Yao, Fangjun Kuang, Liyong Guo, Lingwei Meng, Long Lin, Yong Xu, Shi-Xiong Zhang, Daniel Povey |
| 2024 | Interspeech | RIR-SF: Room Impulse Response Based Spatial Feature for Target Speech Recognition in Multi-Channel Multi-Speaker Scenarios. | Yiwen Shao, Shi-Xiong Zhang, Dong Yu |
| 2024 | Interspeech | Multi-Channel Multi-Speaker ASR Using Target Speaker's Solo Segment. | Yiwen Shao, Shi-Xiong Zhang, Yong Xu, Meng Yu, Dong Yu, Daniel Povey, Sanjeev Khudanpur |
| 2024 | Interspeech | Comparing Discrete and Continuous Space LLMs for Speech Recognition. | Yaoxun Xu, Shi-Xiong Zhang, Jianwei Yu, Zhiyong Wu, Dong Yu |
| 2023 | ASRU | Neuralecho: Hybrid of Full-Band and Sub-Band Recurrent Neural Network For Acoustic Echo Cancellation and Speech Enhancement. | Meng Yu, Yong Xu, Chunlei Zhang, Shi-Xiong Zhang, Dong Yu |
| 2023 | ICASSP | Deep Neural Mel-Subband Beamformer for in-Car Speech Separation. | Vinay Kothapally, Yong Xu, Meng Yu, Shi-Xiong Zhang, Dong Yu |
| 2023 | ICASSP | MMCosine: Multi-Modal Cosine Loss Towards Balanced Audio-Visual Fine-Grained Learning. | Ruize Xu, Ruoxuan Feng, Shi-Xiong Zhang, Di Hu |
| 2022 | ICASSP | Fast-Rir: Fast Neural Diffuse Room Impulse Response Generator. | Anton Ratnarajah, Shi-Xiong Zhang, Meng Yu, Zhenyu Tang, Dinesh Manocha, Dong Yu |
| 2022 | ICASSP | Multi-Channel Multi-Speaker ASR Using 3D Spatial Feature. | Yiwen Shao, Shi-Xiong Zhang, Dong Yu |
| 2022 | ICASSP | Consistent Training and Decoding for End-to-End Speech Recognition Using Lattice-Free MMI. | Jinchuan Tian, Jianwei Yu, Chao Weng, Shi-Xiong Zhang, Dan Su, Dong Yu, Yuexian Zou |
| 2022 | ICASSP | Joint Modeling of Code-Switched and Monolingual ASR via Conditional Factorization. | Brian Yan, Chunlei Zhang, Meng Yu, Shi-Xiong Zhang, Siddharth Dalmia, Dan Berrebbi, Chao Weng, Shinji Watanabe, Dong Yu |
| 2022 | Interspeech | Joint Neural AEC and Beamforming with Double-Talk Detection. | Vinay Kothapally, Yong Xu, Meng Yu, Shi-Xiong Zhang, Dong Yu |
| 2021 | ASRU | 3D Spatial Features for Multi-Channel Target Speech Separation. | Rongzhi Gu, Shi-Xiong Zhang, Meng Yu, Dong Yu |
| 2021 | ICASSP | Directional ASR: A New Paradigm for E2E Multi-Speaker Speech Recognition with Source Localization. | Aswin Shanmugam Subramanian, Chao Weng, Shinji Watanabe, Meng Yu, Yong Xu, Shi-Xiong Zhang, Dong Yu |
| 2021 | ICASSP | ADL-MVDR: All Deep Learning MVDR Beamformer for Target Speech Separation. | Zhuohuang Zhang, Yong Xu, Meng Yu, Shi-Xiong Zhang, Lianwu Chen, Dong Yu |
| 2021 | Interspeech | Multi-Channel Speaker Verification for Single and Multi-Talker Speech. | Saurabh Kataria, Shi-Xiong Zhang, Dong Yu |
| 2021 | Interspeech | MIMO Self-Attentive RNN Beamformer for Multi-Speaker Speech Separation. | Xiyun Li, Yong Xu, Meng Yu, Shi-Xiong Zhang, Jiaming Xu, Bo Xu, Dong Yu |
| 2021 | Interspeech | TeCANet: Temporal-Contextual Attention Network for Environment-Aware Speech Dereverberation. | Helin Wang, Bo Wu, Lianwu Chen, Meng Yu, Jianwei Yu, Yong Xu, Shi-Xiong Zhang, Chao Weng, Dan Su, Dong Yu |
| 2021 | Interspeech | Generalized Spatio-Temporal RNN Beamformer for Target Speech Separation. | Yong Xu, Zhuohuang Zhang, Meng Yu, Shi-Xiong Zhang, Dong Yu |
| 2021 | Interspeech | MetricNet: Towards Improved Modeling For Non-Intrusive Speech Quality Assessment. | Meng Yu, Chunlei Zhang, Yong Xu, Shi-Xiong Zhang, Dong Yu |
| 2020 | ICASSP | Self-Supervised Learning for Audio-Visual Speaker Diarization. | Yifan Ding, Yong Xu, Shi-Xiong Zhang, Yahuan Cong, Liqiang Wang |
| 2020 | ICASSP | Enhancing End-to-End Multi-Channel Speech Separation Via Spatial Feature Learning. | Rongzhi Gu, Shi-Xiong Zhang, Lianwu Chen, Yong Xu, Meng Yu, Dan Su, Yuexian Zou, Dong Yu |
| 2020 | ICASSP | Far-Field Location Guided Target Speech Extraction Using End-to-End Speech Recognition Objectives. | Aswin Shanmugam Subramanian, Chao Weng, Meng Yu, Shi-Xiong Zhang, Yong Xu, Shinji Watanabe, Dong Yu |
| 2020 | ICASSP | Audio-Visual Recognition of Overlapped Speech for the LRS2 Dataset. | Jianwei Yu, Shi-Xiong Zhang, Jian Wu, Shahram Ghorbani, Bo Wu, Shiyin Kang, Shansong Liu, Xunying Liu, Helen Meng, Dong Yu |
| 2020 | Interspeech | Exploiting Cross-Domain Visual Feature Generation for Disordered Speech Recognition. | Shansong Liu, Xurong Xie, Jianwei Yu, Shoukang Hu, Mengzhe Geng, Rongfeng Su, Shi-Xiong Zhang, Xunying Liu, Helen Meng |
| 2020 | Interspeech | Neural Spatio-Temporal Beamformer for Target Speech Separation. | Yong Xu, Meng Yu, Shi-Xiong Zhang, Lianwu Chen, Chao Weng, Jianming Liu, Dong Yu |
| 2020 | Interspeech | Audio-Visual Multi-Channel Recognition of Overlapped Speech. | Jianwei Yu, Bo Wu, Rongzhi Gu, Shi-Xiong Zhang, Lianwu Chen, Yong Xu, Meng Yu, Dan Su, Dong Yu, Xunying Liu, Helen Meng |
| 2019 | ASRU | Time Domain Audio Visual Speech Separation. | Jian Wu, Yong Xu, Shi-Xiong Zhang, Lianwu Chen, Meng Yu, Lei Xie, Dong Yu |
| 2019 | ICASSP | Encrypted Speech Recognition Using Deep Polynomial Networks. | Shi-Xiong Zhang, Yifan Gong, Dong Yu |
| 2019 | Interspeech | A Comprehensive Study of Speech Separation: Spectrogram vs Waveform Separation. | Fahimeh Bahmaninezhad, Jian Wu, Rongzhi Gu, Shi-Xiong Zhang, Yong Xu, Meng Yu, Dong Yu |
| 2019 | Interspeech | Neural Spatial Filter: Target Speaker Speech Separation Assisted with Directional Information. | Rongzhi Gu, Lianwu Chen, Shi-Xiong Zhang, Jimeng Zheng, Yong Xu, Meng Yu, Dan Su, Yuexian Zou, Dong Yu |
| 2019 | Interspeech | Improved Speaker-Dependent Separation for CHiME-5 Challenge. | Jian Wu, Yong Xu, Shi-Xiong Zhang, Lianwu Chen, Meng Yu, Lei Xie, Dong Yu |
| 2018 | ICASSP | Exploring Sequential Characteristics in Speaker Bottleneck Feature for Text-Dependent Speaker Verification. | Liping Chen, Yong Zhao, Shi-Xiong Zhang, Jie Li, Guoli Ye, Frank K. Soong |
| 2018 | ICASSP | Domain and Speaker Adaptation for Cortana Speech Recognition. | Yong Zhao, Jinyu Li, Shi-Xiong Zhang, Liping Chen, Yifan Gong |
| 2016 | ICASSP | Simplifying long short-term memory acoustic models for fast training and decoding. | Yajie Miao, Jinyu Li, Yongqiang Wang, Shi-Xiong Zhang, Yifan Gong |
| 2016 | ICASSP | Recurrent support vector machines for speech recognition. | Shi-Xiong Zhang, Rui Zhao, Chaojun Liu, Jinyu Li, Yifan Gong |
| 2015 | ICASSP | Deep neural support vector machines for speech recognition. | Shi-Xiong Zhang, Chaojun Liu, Kaisheng Yao, Yifan Gong |
| 2014 | ICASSP | Infinite structured support vector machines for speech recognition. | Jingzhou Yang, Rogier C. van Dalen, Shi-Xiong Zhang, Mark J. F. Gales |
| 2013 | ASRU | Investigation of multilingual deep neural networks for spoken term detection. | Kate M. Knill, Mark J. F. Gales, Shakti P. Rath, Philip C. Woodland, Chao Zhang, Shi-Xiong Zhang |
| 2013 | ICASSP | Kernelized log linear models for continuous speech recognition. | Shi-Xiong Zhang, Mark J. F. Gales |
| 2011 | ASRU | Extending noise robust structured support vector machines to larger vocabulary tasks. | Shi-Xiong Zhang, Mark J. F. Gales |
| 2011 | Interspeech | Structured Support Vector Machines for Noise Robust Continuous Speech Recognition. | Shi-Xiong Zhang, Mark J. F. Gales |
| 2009 | Interspeech | Optimization of discriminative kernels in SVM speaker verification. | Shi-Xiong Zhang, Man-Wai Mak |
| 2008 | Interspeech | High-level speaker verification via articulatory-feature based sequence kernels and SVM. | Shi-Xiong Zhang, Man-Wai Mak |
| 2007 | Interspeech | High-level feature-based speaker verification via articulatory phonetic-class pronunciation modeling. | Shi-Xiong Zhang, Man-Wai Mak, Helen M. Meng |