Skip to content

Guangzhi Sun

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

36

Venues

9

Active years

2019–2026

Best venue rank

A*

Where they publish

Papers

36 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLProtecting Bystander Privacy via Selective Hearing in Audio LLMs.Xiao Zhan, Guangzhi Sun, Jose Such, Philip C. Woodland
2025ACLSkillAggregation: Reference-free LLM-Dependent Aggregation.Guangzhi Sun, Anmol Kagrecha, Potsawee Manakul, Philip C. Woodland, Mark J. F. Gales
2025EMNLPUnlearning vs. Obfuscation: Are We Truly Removing Knowledge?Guangzhi Sun, Potsawee Manakul, Xiao Zhan, Mark J. F. Gales
2025EMNLPAudio-centric Video Understanding Benchmark without Text Shortcut.Yudong Yang, Jimin Zhuang, Guangzhi Sun, Changli Tang, Yixuan Li, Peihan Li, Yifan Jiang, Wei Li, Zejun Ma, Chao Zhang
2025ICASSPEnabling Auditory Large Language Models for Automatic Speech Quality Evaluation.Siyin Wang, Wenyi Yu, Yudong Yang, Changli Tang, Yixuan Li, Jimin Zhuang, Xianzhao Chen, Xiaohai Tian, Jun Zhang, Guangzhi Sun, Lu Lu, Chao Zhang
2025ICLRBayesian WeakS-to-Strong from Text Classification to Generation.Ziyun Cui, Ziyang Zhang, Guangzhi Sun, Wen Wu, Chao Zhang
2025ICMLImproving LLM Video Understanding with 16 Frames Per Second.Yixuan Li, Changli Tang, Jimin Zhuang, Yudong Yang, Guangzhi Sun, Wei Li, Zejun Ma, Chao Zhang
2025ICMLvideo-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model.Guangzhi Sun, Yudong Yang, Jimin Zhuang, Changli Tang, Yixuan Li, Wei Li, Zejun Ma, Chao Zhang
2025ICMLCASE-Bench: Context-Aware SafEty Benchmark for Large Language Models.Guangzhi Sun, Xiao Zhan, Shutong Feng, Philip C. Woodland, Jose Such
2025InterspeechEnhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models.Potsawee Manakul, Guangzhi Sun, Warit Sirichotedumrong, Kasima Tharnpipitchai, Kunat Pipatanakul
2025NAACLWav2Prompt: End-to-End Speech Prompt Learning and Task-based Fine-tuning for Text-based LLMs.Keqi Deng, Guangzhi Sun, Philip C. Woodland
2024ACLM³AV: A Multimodal, Multigenre, and Multipurpose Audio-Visual Academic Lecture Dataset.Zhe Chen, Heyang Liu, Wenyi Yu, Guangzhi Sun, Hongcheng Liu, Ji Wu, Chao Zhang, Yu Wang, Yanfeng Wang
2024ACLSpeech-based Slot Filling using Large Language Models.Guangzhi Sun, Shutong Feng, Dongcheng Jiang, Chao Zhang, Milica Gasic, Philip C. Woodland
2024ICASSPParameter Efficient Finetuning for Speech Emotion Recognition and Domain Adaptation.Nineli Lashkarashvili, Wen Wu, Guangzhi Sun, Philip C. Woodland
2024ICASSPExtending Large Language Models for Speech and Audio Captioning.Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang
2024ICASSPConnecting Speech Encoder and Large Language Model for ASR.Wenyi Yu, Changli Tang, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang
2024ICASSPEnhancing Quantised End-to-End ASR Models Via Personalisation.Qiuming Zhao, Guangzhi Sun, Chao Zhang, Mingxing Xu, Thomas Fang Zheng
2024ICLRSALMONN: Towards Generic Hearing Abilities for Large Language Models.Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Chao Zhang
2024ICMLvideo-SALMONN: Speech-Enhanced Audio-Visual Large Language Models.Guangzhi Sun, Wenyi Yu, Changli Tang, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma, Yuxuan Wang, Chao Zhang
2024InterspeechCan Large Language Models Understand Spatial Audio?Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Jun Zhang, Lu Lu, Zejun Ma, Yuxuan Wang, Chao Zhang
2024InterspeechSAML: Speaker Adaptive Mixture of LoRA Experts for End-to-End ASR.Qiuming Zhao, Guangzhi Sun, Chao Zhang, Mingxing Xu, Thomas Fang Zheng
2024InterspeechWhisper-PMFA: Partial Multi-Scale Feature Aggregation for Speaker Verification using Whisper Models.Yiyang Zhao, Shuai Wang, Guangzhi Sun, Zehua Chen, Chao Zhang, Mingxing Xu, Thomas Fang Zheng
2024InterspeechSOT Triggered Neural Clustering for Speaker Attributed ASR.Xianrui Zheng, Guangzhi Sun, Chao Zhang, Philip C. Woodland
2024SIGdialAffect Recognition in Conversations Using Large Language Models.Shutong Feng, Guangzhi Sun, Nurul Lubis, Wen Wu, Chao Zhang, Milica Gasic
2023ASRUTorchAudio 2.1: Advancing Speech Recognition, Self-Supervised Learning, and Audio Processing Components for Pytorch.Jeff Hwang, Moto Hira, Caroline Chen, Xiaohui Zhang, Zhaoheng Ni, Guangzhi Sun, Pingchuan Ma, Ruizhe Huang, Vineel Pratap, Yuekai Zhang, Anurag Kumar, Chin-Yun Yu, Chuang Zhu, Chunxi Liu, Jacob Kahn, Mirco Ravanelli, Peng Sun, Shinji Watanabe, Yangyang Shi, Yumeng Tao
2023ICASSPSpectral Clustering-Aware Learning of Embeddings for Speaker Diarisation.Evonne P. C. Lee, Guangzhi Sun, Chao Zhang, Philip C. Woodland
2023ICASSPEnd-to-End Spoken Language Understanding with Tree-Constrained Pointer Generator.Guangzhi Sun, Chao Zhang, Philip C. Woodland
2023InterspeechCan Contextual Biasing Remain Effective with Whisper and GPT-2?Guangzhi Sun, Xianrui Zheng, Chao Zhang, Philip C. Woodland
2022ACLCross-Utterance Conditioned VAE for Non-Autoregressive Text-to-Speech.Yang Li, Cheng Yu, Guangzhi Sun, Hua Jiang, Fanglei Sun, Weiqin Zu, Ying Wen, Yang Yang, Jun Wang
2022InterspeechTree-constrained Pointer Generator with Graph Neural Network Encodings for Contextual Speech Recognition.Guangzhi Sun, Chao Zhang, Philip C. Woodland
2021ASRUTree-Constrained Pointer Generator for End-to-End Contextual Speech Recognition.Guangzhi Sun, Chao Zhang, Philip C. Woodland
2021ICASSPTransformer Language Models with LSTM-Based Cross-Utterance Information Representation.Guangzhi Sun, Chao Zhang, Philip C. Woodland
2021ICASSPContent-Aware Speaker Embeddings for Speaker Diarisation.Guangzhi Sun, D. Liu, Chao Zhang, Philip C. Woodland
2020ICASSPGenerating Diverse and Natural Text-to-Speech Samples Using a Quantized Fine-Grained VAE and Autoregressive Prosody Prior.Guangzhi Sun, Yu Zhang, Ron J. Weiss, Yuan Cao, Heiga Zen, Andrew Rosenberg, Bhuvana Ramabhadran, Yonghui Wu
2020ICASSPFully-Hierarchical Fine-Grained Prosody Modeling For Interpretable Speech Synthesis.Guangzhi Sun, Yu Zhang, Ron J. Weiss, Yuan Cao, Heiga Zen, Yonghui Wu
2019ICASSPSpeaker Diarisation Using 2D Self-attentive Combination of Embeddings.Guangzhi Sun, Chao Zhang, Philip C. Woodland