Skip to content

Jeongsoo Choi

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

17

Venues

7

Active years

2022–2025

Best venue rank

A*

Where they publish

Papers

17 indexed papers, newest first.

YearVenueTitleAuthors
2025CVPRFrom Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech.Ji-Hoon Kim, Jeongsoo Choi, Jaehun Kim, Chaeyoung Jung, Joon Son Chung
2025EMNLPDub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing.Jeongsoo Choi, Jaehun Kim, Joon Son Chung
2025ICASSPV2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow.Jeongsoo Choi, Ji-Hoon Kim, Jinyu Li, Joon Son Chung, Shujie Liu
2025ICASSPAccelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding.Tan Dat Nguyen, Ji-Hoon Kim, Jeongsoo Choi, Shukjae Choi, Jinseok Park, Younglo Lee, Joon Son Chung
2025ICCVMAVFlow: Preserving Paralinguistic Elements with Conditional Flow Matching for Zero-Shot AV2AV Multilingual Translation.Sungwoo Cho, Jeongsoo Choi, Sungnyun Kim, Se-Young Yun
2025ICCVVoiceCraft-Dub: Automated Video Dubbing with Neural Codec Language Models.Sung-Bin Kim, Jeongsoo Choi, Puyuan Peng, Joon Son Chung, Tae-Hyun Oh, David Harwath
2025ICLRARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation.Zongyi Li, Shujie Hu, Shujie Liu, Long Zhou, Jeongsoo Choi, Lingwei Meng, Xun Guo, Jinyu Li, Hefei Ling, Furu Wei
2025InterspeechAccelerating Diffusion-based Text-to-Speech Model Trainingwith Dual Modality Alignment.Jeongsoo Choi, Zhikang Niu, Ji-Hoon Kim, Chunhui Wang, Joon Son Chung, Xie Chen
2024CVPRAV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation.Jeongsoo Choi, Se Jin Park, Minsu Kim, Yong Man Ro
2024ICASSPText-Driven Talking Face Synthesis by Reprogramming Audio-Driven Models.Jeongsoo Choi, Minsu Kim, Se Jin Park, Yong Man Ro
2024ICASSPTowards Practical and Efficient Image-to-Speech Captioning with Vision-Language Pre-Training and Multi-Modal Tokens.Minsu Kim, Jeongsoo Choi, Soumi Maiti, Jeong Hun Yeo, Shinji Watanabe, Yong Man Ro
2024ICASSPExploring Phonetic Context-Aware Lip-Sync for Talking Face Generation.Se Jin Park, Minsu Kim, Jeongsoo Choi, Yong Man Ro
2023CVPRWatch or Listen: Robust Audio-Visual Speech Recognition with Visual Corruption Modeling and Reliability Scoring.Joanna Hong, Minsu Kim, Jeongsoo Choi, Yong Man Ro
2023ICCVDiffV2S: Diffusion-based Video-to-Speech Synthesis with Vision-guided Speaker Embedding.Jeongsoo Choi, Joanna Hong, Yong Man Ro
2023ICCVLip Reading for Low-resource Languages by Learning and Combining General Speech Knowledge and Language-specific Knowledge.Minsu Kim, Jeong Hun Yeo, Jeongsoo Choi, Yong Man Ro
2023InterspeechIntelligible Lip-to-Speech Synthesis with Speech Units.Jeongsoo Choi, Minsu Kim, Yong Man Ro
2022AAAISyncTalkFace: Talking Face Generation with Precise Lip-Syncing via Audio-Lip Memory.Se Jin Park, Minsu Kim, Joanna Hong, Jeongsoo Choi, Yong Man Ro