| 2026 | AAAI | AHAMask: Reliable Task Specification for Large Audio Language Models Without Instructions. | Yiwei Guo, Bohan Li, Hankun Wang, Zhihan Li, Shuai Wang, Xie Chen, Kai Yu |
| 2026 | ACL | MelTrim: Coarse-to-Fine Data Pruning for Speech Classification. | Shaobo Wang, Tianle Niu, Xuan Ouyang, Xintong Li, Zhengkun Ge, Yue Min, Xiaoqian Liu, Hankun Wang, Linfeng Zhang |
| 2025 | ASRU | Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency. | Haoran Wang, Guanyu Chen, Bohan Li, Hankun Wang, Yiwei Guo, Zhihan Li, Xie Chen, Kai Yu |
| 2025 | ICASSP | VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech. | Chenpeng Du, Yiwei Guo, Hankun Wang, Yifan Yang, Zhikang Niu, Shuai Wang, Hui Zhang, Xie Chen, Kai Yu |
| 2025 | ICASSP | Fast and High-Quality Auto-Regressive Speech Synthesis via Speculative Decoding. | Bohan Li, Hankun Wang, Situo Zhang, Yiwei Guo, Kai Yu |
| 2025 | Interspeech | LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec. | Yiwei Guo, Zhihan Li, Chenpeng Du, Hankun Wang, Xie Chen, Kai Yu |