| 2025 | ASRU | Expressive Speech Retrieval using Natural Language Descriptions of Speaking Style. | Wonjune Kang, Deb Roy |
| 2025 | Interspeech | VocalAgent: Large Language Models for Vocal Health Diagnostics with Safety-Aware Evaluation. | Yubin Kim, Taehan Kim, Wonjune Kang, Eugene Park, Joonsik Yoon, Dongjae Lee, Xin Liu, Daniel McDuff, Hyeonhoon Lee, Cynthia Breazeal, Hae Won Park |
| 2025 | Interspeech | Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech. | Wonjune Kang, Junteng Jia, Chunyang Wu, Wei Zhou, Egor Lakomkin, Yashesh Gaur, Leda Sari, Suyoun Kim, Ke Li, Jay Mahadeokar, Ozlem Kalinli |
| 2024 | ICASSP | Multi-Task Learning for Front-End Text Processing in TTS. | Wonjune Kang, Yun Wang, Shun Zhang, Arthur Hinsvark, Qing He |
| 2024 | Interspeech | Prompting Large Language Models with Audio for General-Purpose Speech Summarization. | Wonjune Kang, Deb Roy |
| 2023 | Interspeech | End-to-End Zero-Shot Voice Conversion with Location-Variable Convolutions. | Wonjune Kang, Mark Hasegawa-Johnson, Deb Roy |
| 2020 | ICASSP | Multimodal Speaker Diarization of Real-World Meetings Using D-Vectors With Spatial Features. | Wonjune Kang, Brandon C. Roy, Wesley Chow |