| 2025 | CVPR | From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech. | Ji-Hoon Kim, Jeongsoo Choi, Jaehun Kim, Chaeyoung Jung, Joon Son Chung |
| 2025 | ICASSP | VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis. | Jaemin Jung, Junseok Ahn, Chaeyoung Jung, Tan Dat Nguyen, Youngjoon Jang, Joon Son Chung |
| 2025 | Interspeech | InfiniteAudio: Infinite-Length Audio Generation with Consistency. | Chaeyoung Jung, Hojoon Ki, Ji-Hoon Kim, Junmo Kim, Joon Son Chung |
| 2025 | Interspeech | SEED: Speaker Embedding Enhancement Diffusion Model. | Kihyun Nam, Jungwoo Heo, Jee-weon Jung, Gangin Park, Chaeyoung Jung, Ha-Jin Yu, Joon Son Chung |
| 2024 | ICASSP | TalkNCE: Improving Active Speaker Detection with Talk-Aware Contrastive Learning. | Chaeyoung Jung, Suyeon Lee, Kihyun Nam, Kyeongha Rho, You Jin Kim, Youngjoon Jang, Joon Son Chung |
| 2024 | ICASSP | Seeing Through The Conversation: Audio-Visual Speech Separation Based on Diffusion Model. | Suyeon Lee, Chaeyoung Jung, Youngjoon Jang, Jaehun Kim, Joon Son Chung |
| 2024 | Interspeech | FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching. | Chaeyoung Jung, Suyeon Lee, Ji-Hoon Kim, Joon Son Chung |