| 2025 | Adaptive Knowledge Distillation for Device-Directed Speech Detection. | Hyung-Gun Chi, Florian Pesce, Wonil Chang, Oggi Rudovic, Arturo Argueta, Stefan Braun, Vineet Garg, Ahmed Hussen Abdelaziz |
| 2025 | CAPR: Confidence-Aware Prompt Refinement in Large Language Models. | Jen-Tzung Chien, Po-Chun Huang |
| 2025 | A Deformable Convolution GAN Approach for Speech Dereverberation in Cochlear Implant Users. | Hsin-Tien Chiang, John H. L. Hansen |
| 2025 | DiceHuBERT: Distilling HuBERT with a Self-Supervised Learning Objective. | Hyung-Gun Chi, Zakaria Aldeneh, Tatiana Likhomanenko, Oggi Rudovic, Takuya Higuchi, Li-Wei Chen, Shinji Watanabe, Ahmed Hussen Abdelaziz |
| 2025 | DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model. | Xueyuan Chen, Dongchao Yang, Wenxuan Wu, Minglin Wu, Jing Xu, Xixin Wu, Zhiyong Wu, Helen Meng |
| 2025 | Predicting Adolescent Suicidal Risk from Multi-task-based Speech: An Ensemble Learning Approach. | Xi Chen, Renzhe Yu, Yanshen Tan, Yiyi Li, Quan Qian, Ying Lin |
| 2025 | Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition. | Youjun Chen, Xurong Xie, Haoning Xu, Mengzhe Geng, Guinan Li, Chengxi Deng, Huimeng Wang, Shujie Hu, Xunying Liu |
| 2025 | AF-Vocoder: Artifact-Free Neural Vocoder with Global Artifact Filter. | Zhuangqi Chen, Xianjun Xia, Xiaohuai Le, Siyu Sun, Chuanzeng Huang |
| 2025 | Decoding Speaker-Normalized Pitch from EEG for Mandarin Perception. | Jia-Xin Chen, Yi-Ming Wang, Ziyu Zhang, Jiayang Han, Yin-Long Liu, Rui Feng, Xiuyuan Liang, Zhen-Hua Ling, Jia-Hong Yuan |
| 2025 | Towards Robust Speaker Recognition against Intrinsic Variation with Foundation Model Few-shot Tuning and Effective Speech Synthesis. | Zhiyong Chen, Shuhang Wu, Xinnuo Li, Zhiqi Ai, Shugong Xu |
| 2025 | Perception of Emotional Speech by Individuals with High Borderline Personality Features. | Yizhou Chen, Xiyu Wu |
| 2025 | The Prosodic Characteristics of Standard Chinese Rhetorical Questions in Naturalistic Settings. | Shuwen Chen, Qingke Sun, Yue Huang, Yingyi Luo |
| 2025 | SoundSculpt: Direction and Semantics Driven Ambisonic Target Sound Extraction. | Tuochao Chen, D. Shin, Hakan Erdogan, Sinan Hersek |
| 2025 | The ML-SUPERB 2.0 Challenge: Towards Inclusive ASR Benchmarking for All Language Varieties. | William Chen, Chutong Meng, Jiatong Shi, Martijn Bartelds, Shih-Heng Wang, Hsiu-Hsuan Wang, Rafael Mosquera, Sara Hincapie, Dan Jurafsky, Antonis Anastasopoulos, Hung-yi Lee, Karen Livescu, Shinji Watanabe |
| 2025 | Codec-Based Deepfake Source Tracing via Neural Audio Codec Taxonomy. | Xuanjun Chen, I-Ming Lin, Lin Zhang, Jiawei Du, Haibin Wu, Hung-yi Lee, Jyh-Shing Roger Jang |
| 2025 | MIKU-PAL: An Automated and Standardized Multimodal Method for Speech Paralinguistic and Affect Labeling. | Yifan Cheng, Ruoyi Zhang, Jiatong Shi |
| 2025 | DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec. | Peijie Chen, Wenhao Guan, Kaidi Wang, Weijie Wu, Hukai Huang, Qingyang Hong, Lin Li |
| 2025 | Multi-Channel Sequence-to-Sequence Neural Diarization: Experimental Results for The MISP 2025 Challenge. | Ming Cheng, Fei Su, Cancan Li, Juan Liu, Ming Li |
| 2025 | Speech Unlearning. | Jiali Cheng, Hadi Amiri |
| 2025 | A Study of Real-world Audio-Visual Corpus Design and Production: A Perspective from MISP Challenges. | Hang Chen, Jun Du, Qing Wang, Juan Xie, Shi-Fu XIong |
| 2025 | Pushing the Frontiers of Self-Distillation Prototypes Network with Dimension Regularization and Score Normalization. | Yafeng Chen, Chong Deng, Hui Wang, Yiheng Jiang, Han Yin, Qian Chen, Wen Wang |
| 2025 | Phonetic Posteriorgram-Based Phoneme Selection for Vocal Cord Disorder Classification in Continuous Mandarin Speech. | Chih-Ning Chen, Yu-Lan Chuang, Ming-Jhang Yang, Wei-Cheng Hsu, Yung-An Tsou, Yi-Wen Liu |
| 2025 | Fine-Tuning Text-to-Speech Diffusion Models Using Reinforcement Learning with Human Feedback. | Jingyi Chen, Ju-Seung Byun, Micha Elsner, Pichao Wang, Andrew Perrault |
| 2025 | Using Neurogram Similarity Index Measure (NSIM) to Model Hearing Loss and Cochlear Neural Degeneration. | Ahsan J. Cheema, Sunil Puria |
| 2025 | Medusa: A Multimodal Deep Fusion Multi-Stage Training Framework for Speech Emotion Recognition in Naturalistic Conditions. | Georgios Chatzichristodoulou, Despoina Kosmopoulou, Antonios Kritikos, Anastasia Poulopoulou, Efthymios Georgiou, Athanasios Katsamanis, Vassilis Katsouros, Alexandros Potamianos |