Guangzhi Sun
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
36
Venues
9
Active years
2019–2026
Best venue rank
A*
Where they publish
Papers
36 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Protecting Bystander Privacy via Selective Hearing in Audio LLMs. | Xiao Zhan, Guangzhi Sun, Jose Such, Philip C. Woodland |
| 2025 | ACL | SkillAggregation: Reference-free LLM-Dependent Aggregation. | Guangzhi Sun, Anmol Kagrecha, Potsawee Manakul, Philip C. Woodland, Mark J. F. Gales |
| 2025 | EMNLP | Unlearning vs. Obfuscation: Are We Truly Removing Knowledge? | Guangzhi Sun, Potsawee Manakul, Xiao Zhan, Mark J. F. Gales |
| 2025 | EMNLP | Audio-centric Video Understanding Benchmark without Text Shortcut. | Yudong Yang, Jimin Zhuang, Guangzhi Sun, Changli Tang, Yixuan Li, Peihan Li, Yifan Jiang, Wei Li, Zejun Ma, Chao Zhang |
| 2025 | ICASSP | Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation. | Siyin Wang, Wenyi Yu, Yudong Yang, Changli Tang, Yixuan Li, Jimin Zhuang, Xianzhao Chen, Xiaohai Tian, Jun Zhang, Guangzhi Sun, Lu Lu, Chao Zhang |
| 2025 | ICLR | Bayesian WeakS-to-Strong from Text Classification to Generation. | Ziyun Cui, Ziyang Zhang, Guangzhi Sun, Wen Wu, Chao Zhang |
| 2025 | ICML | Improving LLM Video Understanding with 16 Frames Per Second. | Yixuan Li, Changli Tang, Jimin Zhuang, Yudong Yang, Guangzhi Sun, Wei Li, Zejun Ma, Chao Zhang |
| 2025 | ICML | video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model. | Guangzhi Sun, Yudong Yang, Jimin Zhuang, Changli Tang, Yixuan Li, Wei Li, Zejun Ma, Chao Zhang |
| 2025 | ICML | CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models. | Guangzhi Sun, Xiao Zhan, Shutong Feng, Philip C. Woodland, Jose Such |
| 2025 | Interspeech | Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models. | Potsawee Manakul, Guangzhi Sun, Warit Sirichotedumrong, Kasima Tharnpipitchai, Kunat Pipatanakul |
| 2025 | NAACL | Wav2Prompt: End-to-End Speech Prompt Learning and Task-based Fine-tuning for Text-based LLMs. | Keqi Deng, Guangzhi Sun, Philip C. Woodland |
| 2024 | ACL | M³AV: A Multimodal, Multigenre, and Multipurpose Audio-Visual Academic Lecture Dataset. | Zhe Chen, Heyang Liu, Wenyi Yu, Guangzhi Sun, Hongcheng Liu, Ji Wu, Chao Zhang, Yu Wang, Yanfeng Wang |
| 2024 | ACL | Speech-based Slot Filling using Large Language Models. | Guangzhi Sun, Shutong Feng, Dongcheng Jiang, Chao Zhang, Milica Gasic, Philip C. Woodland |
| 2024 | ICASSP | Parameter Efficient Finetuning for Speech Emotion Recognition and Domain Adaptation. | Nineli Lashkarashvili, Wen Wu, Guangzhi Sun, Philip C. Woodland |
| 2024 | ICASSP | Extending Large Language Models for Speech and Audio Captioning. | Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang |
| 2024 | ICASSP | Connecting Speech Encoder and Large Language Model for ASR. | Wenyi Yu, Changli Tang, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang |
| 2024 | ICASSP | Enhancing Quantised End-to-End ASR Models Via Personalisation. | Qiuming Zhao, Guangzhi Sun, Chao Zhang, Mingxing Xu, Thomas Fang Zheng |
| 2024 | ICLR | SALMONN: Towards Generic Hearing Abilities for Large Language Models. | Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang |
| 2024 | ICML | video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models. | Guangzhi Sun, Wenyi Yu, Changli Tang, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Yuxuan Wang, Chao Zhang |
| 2024 | Interspeech | Can Large Language Models Understand Spatial Audio? | Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Jun Zhang, Lu Lu, Zejun Ma, Yuxuan Wang, Chao Zhang |
| 2024 | Interspeech | SAML: Speaker Adaptive Mixture of LoRA Experts for End-to-End ASR. | Qiuming Zhao, Guangzhi Sun, Chao Zhang, Mingxing Xu, Thomas Fang Zheng |
| 2024 | Interspeech | Whisper-PMFA: Partial Multi-Scale Feature Aggregation for Speaker Verification using Whisper Models. | Yiyang Zhao, Shuai Wang, Guangzhi Sun, Zehua Chen, Chao Zhang, Mingxing Xu, Thomas Fang Zheng |
| 2024 | Interspeech | SOT Triggered Neural Clustering for Speaker Attributed ASR. | Xianrui Zheng, Guangzhi Sun, Chao Zhang, Philip C. Woodland |
| 2024 | SIGdial | Affect Recognition in Conversations Using Large Language Models. | Shutong Feng, Guangzhi Sun, Nurul Lubis, Wen Wu, Chao Zhang, Milica Gasic |
| 2023 | ASRU | TorchAudio 2.1: Advancing Speech Recognition, Self-Supervised Learning, and Audio Processing Components for Pytorch. | Jeff Hwang, Moto Hira, Caroline Chen, Xiaohui Zhang, Zhaoheng Ni, Guangzhi Sun, Pingchuan Ma, Ruizhe Huang, Vineel Pratap, Yuekai Zhang, Anurag Kumar, Chin-Yun Yu, Chuang Zhu, Chunxi Liu, Jacob Kahn, Mirco Ravanelli, Peng Sun, Shinji Watanabe, Yangyang Shi, Yumeng Tao |
| 2023 | ICASSP | Spectral Clustering-Aware Learning of Embeddings for Speaker Diarisation. | Evonne P. C. Lee, Guangzhi Sun, Chao Zhang, Philip C. Woodland |
| 2023 | ICASSP | End-to-End Spoken Language Understanding with Tree-Constrained Pointer Generator. | Guangzhi Sun, Chao Zhang, Philip C. Woodland |
| 2023 | Interspeech | Can Contextual Biasing Remain Effective with Whisper and GPT-2? | Guangzhi Sun, Xianrui Zheng, Chao Zhang, Philip C. Woodland |
| 2022 | ACL | Cross-Utterance Conditioned VAE for Non-Autoregressive Text-to-Speech. | Yang Li, Cheng Yu, Guangzhi Sun, Hua Jiang, Fanglei Sun, Weiqin Zu, Ying Wen, Yang Yang, Jun Wang |
| 2022 | Interspeech | Tree-constrained Pointer Generator with Graph Neural Network Encodings for Contextual Speech Recognition. | Guangzhi Sun, Chao Zhang, Philip C. Woodland |
| 2021 | ASRU | Tree-Constrained Pointer Generator for End-to-End Contextual Speech Recognition. | Guangzhi Sun, Chao Zhang, Philip C. Woodland |
| 2021 | ICASSP | Transformer Language Models with LSTM-Based Cross-Utterance Information Representation. | Guangzhi Sun, Chao Zhang, Philip C. Woodland |
| 2021 | ICASSP | Content-Aware Speaker Embeddings for Speaker Diarisation. | Guangzhi Sun, D. Liu, Chao Zhang, Philip C. Woodland |
| 2020 | ICASSP | Generating Diverse and Natural Text-to-Speech Samples Using a Quantized Fine-Grained VAE and Autoregressive Prosody Prior. | Guangzhi Sun, Yu Zhang, Ron J. Weiss, Yuan Cao, Heiga Zen, Andrew Rosenberg, Bhuvana Ramabhadran, Yonghui Wu |
| 2020 | ICASSP | Fully-Hierarchical Fine-Grained Prosody Modeling For Interpretable Speech Synthesis. | Guangzhi Sun, Yu Zhang, Ron J. Weiss, Yuan Cao, Heiga Zen, Yonghui Wu |
| 2019 | ICASSP | Speaker Diarisation Using 2D Self-attentive Combination of Embeddings. | Guangzhi Sun, Chao Zhang, Philip C. Woodland |