Skip to content

Xuesong Yang

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

17

Venues

8

Active years

2011–2026

Best venue rank

A*

Where they publish

Papers

17 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAILLaVA-UHD v2: Exploiting Hierarchical Vision Granularity in MLLMs via Inverse Semantic Pyramid.Yipeng Zhang, Yifan Liu, Zonghao Guo, Yidan Zhang, Xuesong Yang, Xiaoying Zhang, Chi Chen, Jun Song, Yuan Yao, Tat-Seng Chua, Maosong Sun
2025ACLNeKo: Cross-Modality Post-Recognition Error Correction with Tasks-Guided Mixture-of-Experts Language Model.Yen-Ting Lin, Zhehuai Chen, Piotr Zelasko, Zhen Wan, Xuesong Yang, Zih-Ching Chen, Krishna C. Puvvada, Ke Hu, Szu-Wei Fu, Jun Wei Chiu, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Chao-Han Huck Yang
2025EMNLPKoel-TTS: Enhancing LLM based Speech Generation with Preference Alignment and Classifier Free Guidance.Shehzeen Samarah Hussain, Paarth Neekhara, Xuesong Yang, Edresson Casanova, Subhankar Ghosh, Roy Fejgin, Mikyas T. Desta, Rafael Valle, Jason Li
2025InterspeechNanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference.Edresson Casanova, Paarth Neekhara, Ryan Langman, Shehzeen Hussain, Subhankar Ghosh, Xuesong Yang, Ante Jukic, Jason Li, Boris Ginsburg
2025InterspeechVoiceNoNG: Robust High-Quality Speech Editing Model without Hallucinations.Sung-Feng Huang, Heng-Cheng Kuo, Zhehuai Chen, Xuesong Yang, Pin-Jui Ku, Ante Jukic, Huck Yang, Yu Tsao, Yu-Chiang Frank Wang, Hung-yi Lee, Szu-Wei Fu
2025InterspeechHiFiTTS-2: A Large-Scale High Bandwidth Speech Dataset.Ryan Langman, Xuesong Yang, Paarth Neekhara, Shehzeen Hussain, Edresson Casanova, Evelina Bakhturina, Jason Li
2024NSDIPudica: Toward Near-Zero Queuing Delay in Congestion Control for Cloud Gaming.Shibo Wang, Shusen Yang, Xiao Kong, Chenglei Wu, Longwei Jiang, Chenren Xu, Cong Zhao, Xuesong Yang, Jianjun Xiao, Xin Liu, Changxi Zheng, Jing Wang, Honghao Liu
2021ICASSPREDAT: Accent-Invariant Representation for End-To-End ASR by Domain Adversarial Training with Relabeling.Hu Hu, Xuesong Yang, Zeynab Raeesy, Jinxi Guo, Gokce Keskin, Harish Arsikere, Ariya Rastrow, Andreas Stolcke, Roland Maas
2019ICASSPWhen CTC Training Meets Acoustic Landmarks.Di He, Xuesong Yang, Boon Pang Lim, Yi Liang, Mark Hasegawa-Johnson, Deming Chen
2019ICMLAutoVC: Zero-Shot Voice Style Transfer with Only Autoencoder Loss.Kaizhi Qian, Yang Zhang, Shiyu Chang, Xuesong Yang, Mark Hasegawa-Johnson
2018ICASSPDeep Learning Based Speech Beamforming.Kaizhi Qian, Yang Zhang, Shiyu Chang, Xuesong Yang, Dinei A. F. Florncio, Mark Hasegawa-Johnson
2018ICASSPJoint Modeling of Accents and Acoustics for Multi-Accent Speech Recognition.Xuesong Yang, Kartik Audhkhasi, Andrew Rosenberg, Samuel Thomas, Bhuvana Ramabhadran, Mark Hasegawa-Johnson
2018InterspeechImproved ASR for Under-resourced Languages through Multi-task Learning with Acoustic Landmarks.Di He, Boon Pang Lim, Xuesong Yang, Mark Hasegawa-Johnson, Deming Chen
2017ICASSPEnd-to-end joint learning of natural language understanding and dialogue manager.Xuesong Yang, Yun-Nung Chen, Dilek Hakkani-Tr, Paul A. Crook, Xiujun Li, Jianfeng Gao, Li Deng
2017InterspeechSpeech Enhancement Using Bayesian Wavenet.Kaizhi Qian, Yang Zhang, Shiyu Chang, Xuesong Yang, Dinei Florncio, Mark Hasegawa-Johnson
2011InterspeechImprovement of Segmental Mispronunciation Detection with Prior Knowledge Extracted from Large L2 Speech Corpus.Dean Luo, Xuesong Yang, Lan Wang
2011IROSSound source localization for mobile robot based on time difference feature and space grid matching.Xiaofei Li, Hong Liu, Xuesong Yang