| 2025 | CVPR | From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech. | Ji-Hoon Kim, Jeongsoo Choi, Jaehun Kim, Chaeyoung Jung, Joon Son Chung |
| 2025 | EMNLP | Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing. | Jeongsoo Choi, Jaehun Kim, Joon Son Chung |
| 2025 | ICASSP | V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow. | Jeongsoo Choi, Ji-Hoon Kim, Jinyu Li, Joon Son Chung, Shujie Liu |
| 2025 | ICASSP | Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding. | Tan Dat Nguyen, Ji-Hoon Kim, Jeongsoo Choi, Shukjae Choi, Jinseok Park, Younglo Lee, Joon Son Chung |
| 2025 | ICCV | MAVFlow: Preserving Paralinguistic Elements with Conditional Flow Matching for Zero-Shot AV2AV Multilingual Translation. | Sungwoo Cho, Jeongsoo Choi, Sungnyun Kim, Se-Young Yun |
| 2025 | ICCV | VoiceCraft-Dub: Automated Video Dubbing with Neural Codec Language Models. | Sung-Bin Kim, Jeongsoo Choi, Puyuan Peng, Joon Son Chung, Tae-Hyun Oh, David Harwath |
| 2025 | ICLR | ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation. | Zongyi Li, Shujie Hu, Shujie Liu, Long Zhou, Jeongsoo Choi, Lingwei Meng, Xun Guo, Jinyu Li, Hefei Ling, Furu Wei |
| 2025 | Interspeech | Accelerating Diffusion-based Text-to-Speech Model Trainingwith Dual Modality Alignment. | Jeongsoo Choi, Zhikang Niu, Ji-Hoon Kim, Chunhui Wang, Joon Son Chung, Xie Chen |
| 2024 | CVPR | AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation. | Jeongsoo Choi, Se Jin Park, Minsu Kim, Yong Man Ro |
| 2024 | ICASSP | Text-Driven Talking Face Synthesis by Reprogramming Audio-Driven Models. | Jeongsoo Choi, Minsu Kim, Se Jin Park, Yong Man Ro |
| 2024 | ICASSP | Towards Practical and Efficient Image-to-Speech Captioning with Vision-Language Pre-Training and Multi-Modal Tokens. | Minsu Kim, Jeongsoo Choi, Soumi Maiti, Jeong Hun Yeo, Shinji Watanabe, Yong Man Ro |
| 2024 | ICASSP | Exploring Phonetic Context-Aware Lip-Sync for Talking Face Generation. | Se Jin Park, Minsu Kim, Jeongsoo Choi, Yong Man Ro |
| 2023 | CVPR | Watch or Listen: Robust Audio-Visual Speech Recognition with Visual Corruption Modeling and Reliability Scoring. | Joanna Hong, Minsu Kim, Jeongsoo Choi, Yong Man Ro |
| 2023 | ICCV | DiffV2S: Diffusion-based Video-to-Speech Synthesis with Vision-guided Speaker Embedding. | Jeongsoo Choi, Joanna Hong, Yong Man Ro |
| 2023 | ICCV | Lip Reading for Low-resource Languages by Learning and Combining General Speech Knowledge and Language-specific Knowledge. | Minsu Kim, Jeong Hun Yeo, Jeongsoo Choi, Yong Man Ro |
| 2023 | Interspeech | Intelligible Lip-to-Speech Synthesis with Speech Units. | Jeongsoo Choi, Minsu Kim, Yong Man Ro |
| 2022 | AAAI | SyncTalkFace: Talking Face Generation with Precise Lip-Syncing via Audio-Lip Memory. | Se Jin Park, Minsu Kim, Joanna Hong, Jeongsoo Choi, Yong Man Ro |