Skip to content

Joon Son Chung

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

84

Venues

13

Active years

2014–2026

Best venue rank

A*

Where they publish

Papers

84 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAIMMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence.Sonal Kumar, Simon Sedlcek, Vaibhavi Lokegaonkar, Fernando Lpez, Wenyi Yu, Nishit Anand, Hyeonggon Ryu, Lichang Chen, Maxim Plicka, Miroslav Hlavcek, William Fineas Ellingwood, Sathvik Udupa, Siyuan Hou, Allison Ferner, Sara Barahona, Cecilia Bolaos, Satish Rahi, Laura Herrera-Alarcn, Satvik Dixit, Rupali S. Patil, Soham Deshmukh, Lasha Koroshinadze, Yao Liu, Leibny Paola Garca-Perera, Eleni Zanou, Themos Stafylakis, Joon Son Chung, David Harwath, Chao Zhang, Dinesh Manocha, Alicia Lozano-Diez, Santosh Kesiraju, Sreyan Ghosh, Ramani Duraiswami
2026ACLTwo Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses.Sungnyun Kim, Kangwook Jang, Sungwoo Cho, Joon Son Chung, Hoirin Kim, Se-Young Yun
2025CVPRFrom Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech.Ji-Hoon Kim, Jeongsoo Choi, Jaehun Kim, Chaeyoung Jung, Joon Son Chung
2025CVPRSeeing Speech and Sound: Distinguishing and Locating Audio Sources in Visual Scenes.Hyeonggon Ryu, Seongyu Kim, Joon Son Chung, Arda Senocak
2025EMNLPDub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing.Jeongsoo Choi, Jaehun Kim, Joon Son Chung
2025ICASSPV2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow.Jeongsoo Choi, Ji-Hoon Kim, Jinyu Li, Joon Son Chung, Shujie Liu
2025ICASSPVoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis.Jaemin Jung, Junseok Ahn, Chaeyoung Jung, Tan Dat Nguyen, Youngjoon Jang, Joon Son Chung
2025ICASSPAdaptVC: High Quality Voice Conversion with Adaptive Learning.Jaehun Kim, Ji-Hoon Kim, Yeunju Choi, Tan Dat Nguyen, Seongkyu Mun, Joon Son Chung
2025ICASSPAccelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding.Tan Dat Nguyen, Ji-Hoon Kim, Jeongsoo Choi, Shukjae Choi, Jinseok Park, Younglo Lee, Joon Son Chung
2025ICASSPLAVCap: LLM-based Audio-Visual Captioning using Optimal Transport.Kyeongha Rho, Hyeongkeun Lee, Valentio Iverson, Joon Son Chung
2025ICCVVoiceCraft-Dub: Automated Video Dubbing with Neural Codec Language Models.Sung-Bin Kim, Jeongsoo Choi, Puyuan Peng, Joon Son Chung, Tae-Hyun Oh, David Harwath
2025ICLRHigh-Quality Joint Image and Video Tokenization with Causal VAE.Dawit Mureja Argaw, Xian Liu, Qinsheng Zhang, Joon Son Chung, Ming-Yu Liu, Fitsum Reda
2025ICLRAVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models.Sung-Bin Kim, Oh Hyun-Bin, JungMok Lee, Arda Senocak, Joon Son Chung, Tae-Hyun Oh
2025InterspeechAccelerating Diffusion-based Text-to-Speech Model Trainingwith Dual Modality Alignment.Jeongsoo Choi, Zhikang Niu, Ji-Hoon Kim, Chunhui Wang, Joon Son Chung, Xie Chen
2025InterspeechInfiniteAudio: Infinite-Length Audio Generation with Consistency.Chaeyoung Jung, Hojoon Ki, Ji-Hoon Kim, Junmo Kim, Joon Son Chung
2025InterspeechThe Text-to-speech in the Wild (TITW) Database.Jee-weon Jung, Wangyou Zhang, Soumi Maiti, Yihan Wu, Xin Wang, Ji-Hoon Kim, Yuta Matsunaga, Seyun Um, Jinchuan Tian, Hye-jin Shim, Nicholas W. D. Evans, Joon Son Chung, Shinnosuke Takamichi, Shinji Watanabe
2025InterspeechSEED: Speaker Embedding Enhancement Diffusion Model.Kihyun Nam, Jungwoo Heo, Jee-weon Jung, Gangin Park, Chaeyoung Jung, Ha-Jin Yu, Joon Son Chung
2024AAAILet There Be Sound: Reconstructing High Quality Speech from Silent Videos.Ji-Hoon Kim, Jaehun Kim, Joon Son Chung
2024CVPRScaling Up Video Summarization Pretraining with Large Language Models.Dawit Mureja Argaw, Seunghyun Yoon, Fabian Caba Heilbron, Hanieh Deilamsalehy, Trung Bui, Zhaowen Wang, Franck Dernoncourt, Joon Son Chung
2024CVPRTowards Automated Movie Trailer Generation.Dawit Mureja Argaw, Mattia Soldan, Alejandro Pardo, Chen Zhao, Fabian Caba Heilbron, Joon Son Chung, Bernard Ghanem
2024CVPRFaces that Speak: Jointly Synthesising Talking Face and Speech from Text.Youngjoon Jang, Ji-Hoon Kim, Junseok Ahn, Doyeop Kwak, Hongsun Yang, Yooncheol Ju, Ilhwan Kim, Byeong-Yeol Kim, Joon Son Chung
2024ICASSPSlowfast Network for Continuous Sign Language Recognition.Junseok Ahn, Youngjoon Jang, Joon Son Chung
2024ICASSPFrom Coarse to Fine: Efficient Training for Audio Spectrogram Transformers.Jiu Feng, Mehmet Hamza Erol, Joon Son Chung, Arda Senocak
2024ICASSPRethinking Session Variability: Leveraging Session Embeddings for Session Robustness in Speaker Verification.Hee-Soo Heo, Kihyun Nam, Bong-Jin Lee, Youngki Kwon, Minjae Lee, You Jin Kim, Joon Son Chung
2024ICASSPTalkNCE: Improving Active Speaker Detection with Talk-Aware Contrastive Learning.Chaeyoung Jung, Suyeon Lee, Kihyun Nam, Kyeongha Rho, You Jin Kim, Youngjoon Jang, Joon Son Chung
2024ICASSPVoxMM: Rich Transcription of Conversations in the Wild.Doyeop Kwak, Jaemin Jung, Kihyun Nam, Youngjoon Jang, Jee-Weon Jung, Shinji Watanabe, Joon Son Chung
2024ICASSPSeeing Through The Conversation: Audio-Visual Speech Separation Based on Diffusion Model.Suyeon Lee, Chaeyoung Jung, Youngjoon Jang, Jaehun Kim, Joon Son Chung
2024ICASSPVoiceLDM: Text-to-Speech with Environmental Context.Yeonghyeon Lee, Inmo Yeon, Juhan Nam, Joon Son Chung
2024ICASSPFregrad: Lightweight and Fast Frequency-Aware Diffusion Vocoder.Tan Dat Nguyen, Ji-Hoon Kim, Youngjoon Jang, Jaehun Kim, Joon Son Chung
2024ICASSPSpeech Guided Masked Image Modeling for Visually Grounded Speech.Jongbhin Woo, Hyeonggon Ryu, Arda Senocak, Joon Son Chung
2024ICMLEquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning.Jongsuk Kim, Hyeongkeun Lee, Kyeongha Rho, Junmo Kim, Joon Son Chung
2024InterspeechVoxSim: A perceptual voice similarity dataset.Junseok Ahn, Youkyum Kim, Yeunju Choi, Doyeop Kwak, Ji-Hoon Kim, Seongkyu Mun, Joon Son Chung
2024InterspeechElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions.Jiu Feng, Mehmet Hamza Erol, Joon Son Chung, Arda Senocak
2024InterspeechTo what extent can ASV systems naturally defend against spoofing attacks?Jee-weon Jung, Xin Wang, Nicholas W. D. Evans, Shinji Watanabe, Hye-jin Shim, Hemlata Tak, Siddhant Arora, Junichi Yamagishi, Joon Son Chung
2024InterspeechFlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching.Chaeyoung Jung, Suyeon Lee, Ji-Hoon Kim, Joon Son Chung
2024InterspeechLightweight Audio Segmentation for Long-form Speech Translation.Jaesong Lee, Soyoon Kim, Hanbyul Kim, Joon Son Chung
2024InterspeechDisentangled Representation Learning for Environment-agnostic Speaker Recognition.Kihyun Nam, Hee-Soo Heo, Jee-Weon Jung, Joon Son Chung
2024WACVCan CLIP Help Sound Source Localization?Sooyoung Park, Arda Senocak, Joon Son Chung
2023ICASSPSelf-Sufficient Framework for Continuous Sign Language Recognition.Youngjoon Jang, Youngtaek Oh, Jae-Won Cho, Myungchul Kim, Dong-Jin Kim, In So Kweon, Joon Son Chung
2023ICASSPIn Search of Strong Embedding Extractors for Speaker Diarisation.Jee-Weon Jung, Hee-Soo Heo, Bong-Jin Lee, Jaesung Huh, Andrew Brown, Youngki Kwon, Shinji Watanabe, Joon Son Chung
2023ICASSPMetric Learning for User-Defined Keyword Spotting.Jaemin Jung, Youkyum Kim, Jihwan Park, Youshin Lim, Byeong-Yeol Kim, Youngjoon Jang, Joon Son Chung
2023ICASSPAdvancing the Dimensionality Reduction of Speaker Embeddings for Speaker Diarisation: Disentangling Noise and Informing Speech Activity.You Jin Kim, Hee-Soo Heo, Jee-Weon Jung, Youngki Kwon, Bong-Jin Lee, Joon Son Chung
2023ICASSPImaginary Voice: Face-Styled Diffusion Model for Text-to-Speech.Jiyoung Lee, Joon Son Chung, Soo-Whan Chung
2023ICASSPMarginNCE: Robust Sound Localization with a Negative Margin.Sooyoung Park, Arda Senocak, Joon Son Chung
2023ICASSPHindi as a Second Language: Improving Visually Grounded Speech with Semantically Similar Samples.Hyeonggon Ryu, Arda Senocak, In So Kweon, Joon Son Chung
2023ICCVSound Source Localization is All about Cross-Modal Alignment.Arda Senocak, Hyeonggon Ryu, Junsik Kim, Tae-Hyun Oh, Hanspeter Pfister, Joon Son Chung
2023InterspeechFlexiAST: Flexibility is What AST Needs.Jiu Feng, Mehmet Hamza Erol, Joon Son Chung, Arda Senocak
2023InterspeechCurriculum Learning for Self-supervised Speaker Verification.Hee-Soo Heo, Jee-weon Jung, Jingu Kang, Youngki Kwon, Bong-Jin Lee, You Jin Kim, Joon Son Chung
2023InterspeechDisentangled Representation Learning for Multilingual Speaker Recognition.Kihyun Nam, Youkyum Kim, Jaesung Huh, Hee-Soo Heo, Jee-weon Jung, Joon Son Chung
2022BMVCSigning Outside the Studio: Benchmarking Background Robustness for Continuous Sign Language Recognition.Youngjoon Jang, Youngtaek Oh, Jae-Won Cho, Dong-Jin Kim, Joon Son Chung, In So Kweon
2022ICASSPAASIST: Audio Anti-Spoofing Using Integrated Spectro-Temporal Graph Attention Networks.Jee-weon Jung, Hee-Soo Heo, Hemlata Tak, Hye-jin Shim, Joon Son Chung, Bong-Jin Lee, Ha-Jin Yu, Nicholas W. D. Evans
2022ICASSPSpell My Name: Keyword Boosted Speech Recognition.Namkyu Jung, Geonmin Kim, Joon Son Chung
2022ICASSPMulti-Scale Speaker Embedding-Based Graph Attention Networks For Speaker Diarisation.Youngki Kwon, Hee-Soo Heo, Jee-Weon Jung, You Jin Kim, Bong-Jin Lee, Joon Son Chung
2022InterspeechPushing the limits of raw waveform speaker recognition.Jee-weon Jung, You Jin Kim, Hee-Soo Heo, Bong-Jin Lee, Youngki Kwon, Joon Son Chung
2021ICASSPPlaying a Part: Speaker Verification at the movies.Andrew Brown, Jaesung Huh, Arsha Nagrani, Joon Son Chung, Andrew Zisserman
2021ICASSPGraph Attention Networks for Speaker Verification.Jee-weon Jung, Hee-Soo Heo, Ha-Jin Yu, Joon Son Chung
2021ICASSPThe ins and outs of speaker recognition: lessons from VoxSRC 2020.Yoohwan Kwon, Hee-Soo Heo, Bong-Jin Lee, Joon Son Chung
2021InterspeechThree-Class Overlapped Speech Detection Using a Convolutional Recurrent Neural Network.Jee-weon Jung, Hee-Soo Heo, Youngki Kwon, Joon Son Chung, Bong-Jin Lee
2021InterspeechLook Who's Talking: Active Speaker Detection in the Wild.You Jin Kim, Hee-Soo Heo, Soyeon Choe, Soo-Whan Chung, Yoohwan Kwon, Bong-Jin Lee, Youngki Kwon, Joon Son Chung
2021InterspeechAdapting Speaker Embeddings for Speaker Diarisation.Youngki Kwon, Jee-weon Jung, Hee-Soo Heo, You Jin Kim, Bong-Jin Lee, Joon Son Chung
2020ECCVSelf-supervised Learning of Audio-Visual Objects from Video.Triantafyllos Afouras, Andrew Owens, Joon Son Chung, Andrew Zisserman
2020ECCVBSL-1K: Scaling Up Co-articulated Sign Language Recognition Using Mouthing Cues.Samuel Albanie, Gl Varol, Liliane Momeni, Triantafyllos Afouras, Joon Son Chung, Neil Fox, Andrew Zisserman
2020ICASSPASR is All You Need: Cross-Modal Distillation for Lip Reading.Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman
2020ICASSPThe Sound of My Voice: Speaker Representation Loss for Target Voice Separation.Seongkyu Mun, Soyeon Choe, Jaesung Huh, Joon Son Chung
2020ICASSPDisentangled Speech Embeddings Using Cross-Modal Self-Supervision.Arsha Nagrani, Joon Son Chung, Samuel Albanie, Andrew Zisserman
2020InterspeechNow You're Speaking My Language: Visual Language Identification.Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman
2020InterspeechFaceFilter: Audio-Visual Speech Separation Using Still Images.Soo-Whan Chung, Soyeon Choe, Joon Son Chung, Hong-Goo Kang
2020InterspeechIn Defence of Metric Learning for Speaker Recognition.Joon Son Chung, Jaesung Huh, Seongkyu Mun, Minjae Lee, Hee-Soo Heo, Soyeon Choe, Chiheon Ham, Sunghwan Jung, Bong-Jin Lee, Icksang Han
2020InterspeechSpot the Conversation: Speaker Diarisation in the Wild.Joon Son Chung, Jaesung Huh, Arsha Nagrani, Triantafyllos Afouras, Andrew Zisserman
2020InterspeechSeeing Voices and Hearing Voices: Learning Discriminative Embeddings Using Cross-Modal Self-Supervision.Soo-Whan Chung, Hong-Goo Kang, Joon Son Chung
2019ICASSPPerfect Match: Improved Cross-modal Embeddings for Audio-visual Synchronisation.Soo-Whan Chung, Joon Son Chung, Hong-Goo Kang
2019ICASSPUtterance-level Aggregation for Speaker Recognition in the Wild.Weidi Xie, Arsha Nagrani, Joon Son Chung, Andrew Zisserman
2019InterspeechMy Lips Are Concealed: Audio-Visual Speech Enhancement Through Obstructions.Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman
2019InterspeechWho Said That?: Audio-Visual Speaker Diarisation of Real-World Meetings.Joon Son Chung, Bong-Jin Lee, Icksang Han
2018InterspeechThe Conversation: Deep Audio-Visual Speech Enhancement.Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman
2018InterspeechDeep Lip Reading: A Comparison of Models and an Online Application.Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman
2018InterspeechVoxCeleb2: Deep Speaker Recognition.Joon Son Chung, Arsha Nagrani, Andrew Zisserman
2017BMVCYou said that?Joon Son Chung, Amir Jamaludin, Andrew Zisserman
2017BMVCLip Reading in Profile.Joon Son Chung, Andrew Zisserman
2017CVPRLip Reading Sentences in the Wild.Joon Son Chung, Andrew W. Senior, Oriol Vinyals, Andrew Zisserman
2017InterspeechVoxCeleb: A Large-Scale Speaker Identification Dataset.Arsha Nagrani, Joon Son Chung, Andrew Zisserman
2016ACCVLip Reading in the Wild.Joon Son Chung, Andrew Zisserman
2016ACCVOut of Time: Automated Lip Sync in the Wild.Joon Son Chung, Andrew Zisserman
2014ECCVRe-presentations of Art Collections.Joon Son Chung, Relja Arandjelovic, Giles Bergel, Alexandra Franklin, Andrew Zisserman