Joon Son Chung
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
84
Venues
13
Active years
2014–2026
Best venue rank
A*
Where they publish
Papers
84 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence. | Sonal Kumar, Simon Sedlcek, Vaibhavi Lokegaonkar, Fernando Lpez, Wenyi Yu, Nishit Anand, Hyeonggon Ryu, Lichang Chen, Maxim Plicka, Miroslav Hlavcek, William Fineas Ellingwood, Sathvik Udupa, Siyuan Hou, Allison Ferner, Sara Barahona, Cecilia Bolaos, Satish Rahi, Laura Herrera-Alarcn, Satvik Dixit, Rupali S. Patil, Soham Deshmukh, Lasha Koroshinadze, Yao Liu, Leibny Paola Garca-Perera, Eleni Zanou, Themos Stafylakis, Joon Son Chung, David Harwath, Chao Zhang, Dinesh Manocha, Alicia Lozano-Diez, Santosh Kesiraju, Sreyan Ghosh, Ramani Duraiswami |
| 2026 | ACL | Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses. | Sungnyun Kim, Kangwook Jang, Sungwoo Cho, Joon Son Chung, Hoirin Kim, Se-Young Yun |
| 2025 | CVPR | From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech. | Ji-Hoon Kim, Jeongsoo Choi, Jaehun Kim, Chaeyoung Jung, Joon Son Chung |
| 2025 | CVPR | Seeing Speech and Sound: Distinguishing and Locating Audio Sources in Visual Scenes. | Hyeonggon Ryu, Seongyu Kim, Joon Son Chung, Arda Senocak |
| 2025 | EMNLP | Dub-S2ST: Textless Speech-to-Speech Translation for Seamless Dubbing. | Jeongsoo Choi, Jaehun Kim, Joon Son Chung |
| 2025 | ICASSP | V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow. | Jeongsoo Choi, Ji-Hoon Kim, Jinyu Li, Joon Son Chung, Shujie Liu |
| 2025 | ICASSP | VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis. | Jaemin Jung, Junseok Ahn, Chaeyoung Jung, Tan Dat Nguyen, Youngjoon Jang, Joon Son Chung |
| 2025 | ICASSP | AdaptVC: High Quality Voice Conversion with Adaptive Learning. | Jaehun Kim, Ji-Hoon Kim, Yeunju Choi, Tan Dat Nguyen, Seongkyu Mun, Joon Son Chung |
| 2025 | ICASSP | Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding. | Tan Dat Nguyen, Ji-Hoon Kim, Jeongsoo Choi, Shukjae Choi, Jinseok Park, Younglo Lee, Joon Son Chung |
| 2025 | ICASSP | LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport. | Kyeongha Rho, Hyeongkeun Lee, Valentio Iverson, Joon Son Chung |
| 2025 | ICCV | VoiceCraft-Dub: Automated Video Dubbing with Neural Codec Language Models. | Sung-Bin Kim, Jeongsoo Choi, Puyuan Peng, Joon Son Chung, Tae-Hyun Oh, David Harwath |
| 2025 | ICLR | High-Quality Joint Image and Video Tokenization with Causal VAE. | Dawit Mureja Argaw, Xian Liu, Qinsheng Zhang, Joon Son Chung, Ming-Yu Liu, Fitsum Reda |
| 2025 | ICLR | AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models. | Sung-Bin Kim, Oh Hyun-Bin, JungMok Lee, Arda Senocak, Joon Son Chung, Tae-Hyun Oh |
| 2025 | Interspeech | Accelerating Diffusion-based Text-to-Speech Model Trainingwith Dual Modality Alignment. | Jeongsoo Choi, Zhikang Niu, Ji-Hoon Kim, Chunhui Wang, Joon Son Chung, Xie Chen |
| 2025 | Interspeech | InfiniteAudio: Infinite-Length Audio Generation with Consistency. | Chaeyoung Jung, Hojoon Ki, Ji-Hoon Kim, Junmo Kim, Joon Son Chung |
| 2025 | Interspeech | The Text-to-speech in the Wild (TITW) Database. | Jee-weon Jung, Wangyou Zhang, Soumi Maiti, Yihan Wu, Xin Wang, Ji-Hoon Kim, Yuta Matsunaga, Seyun Um, Jinchuan Tian, Hye-jin Shim, Nicholas W. D. Evans, Joon Son Chung, Shinnosuke Takamichi, Shinji Watanabe |
| 2025 | Interspeech | SEED: Speaker Embedding Enhancement Diffusion Model. | Kihyun Nam, Jungwoo Heo, Jee-weon Jung, Gangin Park, Chaeyoung Jung, Ha-Jin Yu, Joon Son Chung |
| 2024 | AAAI | Let There Be Sound: Reconstructing High Quality Speech from Silent Videos. | Ji-Hoon Kim, Jaehun Kim, Joon Son Chung |
| 2024 | CVPR | Scaling Up Video Summarization Pretraining with Large Language Models. | Dawit Mureja Argaw, Seunghyun Yoon, Fabian Caba Heilbron, Hanieh Deilamsalehy, Trung Bui, Zhaowen Wang, Franck Dernoncourt, Joon Son Chung |
| 2024 | CVPR | Towards Automated Movie Trailer Generation. | Dawit Mureja Argaw, Mattia Soldan, Alejandro Pardo, Chen Zhao, Fabian Caba Heilbron, Joon Son Chung, Bernard Ghanem |
| 2024 | CVPR | Faces that Speak: Jointly Synthesising Talking Face and Speech from Text. | Youngjoon Jang, Ji-Hoon Kim, Junseok Ahn, Doyeop Kwak, Hongsun Yang, Yooncheol Ju, Ilhwan Kim, Byeong-Yeol Kim, Joon Son Chung |
| 2024 | ICASSP | Slowfast Network for Continuous Sign Language Recognition. | Junseok Ahn, Youngjoon Jang, Joon Son Chung |
| 2024 | ICASSP | From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers. | Jiu Feng, Mehmet Hamza Erol, Joon Son Chung, Arda Senocak |
| 2024 | ICASSP | Rethinking Session Variability: Leveraging Session Embeddings for Session Robustness in Speaker Verification. | Hee-Soo Heo, Kihyun Nam, Bong-Jin Lee, Youngki Kwon, Minjae Lee, You Jin Kim, Joon Son Chung |
| 2024 | ICASSP | TalkNCE: Improving Active Speaker Detection with Talk-Aware Contrastive Learning. | Chaeyoung Jung, Suyeon Lee, Kihyun Nam, Kyeongha Rho, You Jin Kim, Youngjoon Jang, Joon Son Chung |
| 2024 | ICASSP | VoxMM: Rich Transcription of Conversations in the Wild. | Doyeop Kwak, Jaemin Jung, Kihyun Nam, Youngjoon Jang, Jee-Weon Jung, Shinji Watanabe, Joon Son Chung |
| 2024 | ICASSP | Seeing Through The Conversation: Audio-Visual Speech Separation Based on Diffusion Model. | Suyeon Lee, Chaeyoung Jung, Youngjoon Jang, Jaehun Kim, Joon Son Chung |
| 2024 | ICASSP | VoiceLDM: Text-to-Speech with Environmental Context. | Yeonghyeon Lee, Inmo Yeon, Juhan Nam, Joon Son Chung |
| 2024 | ICASSP | Fregrad: Lightweight and Fast Frequency-Aware Diffusion Vocoder. | Tan Dat Nguyen, Ji-Hoon Kim, Youngjoon Jang, Jaehun Kim, Joon Son Chung |
| 2024 | ICASSP | Speech Guided Masked Image Modeling for Visually Grounded Speech. | Jongbhin Woo, Hyeonggon Ryu, Arda Senocak, Joon Son Chung |
| 2024 | ICML | EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning. | Jongsuk Kim, Hyeongkeun Lee, Kyeongha Rho, Junmo Kim, Joon Son Chung |
| 2024 | Interspeech | VoxSim: A perceptual voice similarity dataset. | Junseok Ahn, Youkyum Kim, Yeunju Choi, Doyeop Kwak, Ji-Hoon Kim, Seongkyu Mun, Joon Son Chung |
| 2024 | Interspeech | ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions. | Jiu Feng, Mehmet Hamza Erol, Joon Son Chung, Arda Senocak |
| 2024 | Interspeech | To what extent can ASV systems naturally defend against spoofing attacks? | Jee-weon Jung, Xin Wang, Nicholas W. D. Evans, Shinji Watanabe, Hye-jin Shim, Hemlata Tak, Siddhant Arora, Junichi Yamagishi, Joon Son Chung |
| 2024 | Interspeech | FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching. | Chaeyoung Jung, Suyeon Lee, Ji-Hoon Kim, Joon Son Chung |
| 2024 | Interspeech | Lightweight Audio Segmentation for Long-form Speech Translation. | Jaesong Lee, Soyoon Kim, Hanbyul Kim, Joon Son Chung |
| 2024 | Interspeech | Disentangled Representation Learning for Environment-agnostic Speaker Recognition. | Kihyun Nam, Hee-Soo Heo, Jee-Weon Jung, Joon Son Chung |
| 2024 | WACV | Can CLIP Help Sound Source Localization? | Sooyoung Park, Arda Senocak, Joon Son Chung |
| 2023 | ICASSP | Self-Sufficient Framework for Continuous Sign Language Recognition. | Youngjoon Jang, Youngtaek Oh, Jae-Won Cho, Myungchul Kim, Dong-Jin Kim, In So Kweon, Joon Son Chung |
| 2023 | ICASSP | In Search of Strong Embedding Extractors for Speaker Diarisation. | Jee-Weon Jung, Hee-Soo Heo, Bong-Jin Lee, Jaesung Huh, Andrew Brown, Youngki Kwon, Shinji Watanabe, Joon Son Chung |
| 2023 | ICASSP | Metric Learning for User-Defined Keyword Spotting. | Jaemin Jung, Youkyum Kim, Jihwan Park, Youshin Lim, Byeong-Yeol Kim, Youngjoon Jang, Joon Son Chung |
| 2023 | ICASSP | Advancing the Dimensionality Reduction of Speaker Embeddings for Speaker Diarisation: Disentangling Noise and Informing Speech Activity. | You Jin Kim, Hee-Soo Heo, Jee-Weon Jung, Youngki Kwon, Bong-Jin Lee, Joon Son Chung |
| 2023 | ICASSP | Imaginary Voice: Face-Styled Diffusion Model for Text-to-Speech. | Jiyoung Lee, Joon Son Chung, Soo-Whan Chung |
| 2023 | ICASSP | MarginNCE: Robust Sound Localization with a Negative Margin. | Sooyoung Park, Arda Senocak, Joon Son Chung |
| 2023 | ICASSP | Hindi as a Second Language: Improving Visually Grounded Speech with Semantically Similar Samples. | Hyeonggon Ryu, Arda Senocak, In So Kweon, Joon Son Chung |
| 2023 | ICCV | Sound Source Localization is All about Cross-Modal Alignment. | Arda Senocak, Hyeonggon Ryu, Junsik Kim, Tae-Hyun Oh, Hanspeter Pfister, Joon Son Chung |
| 2023 | Interspeech | FlexiAST: Flexibility is What AST Needs. | Jiu Feng, Mehmet Hamza Erol, Joon Son Chung, Arda Senocak |
| 2023 | Interspeech | Curriculum Learning for Self-supervised Speaker Verification. | Hee-Soo Heo, Jee-weon Jung, Jingu Kang, Youngki Kwon, Bong-Jin Lee, You Jin Kim, Joon Son Chung |
| 2023 | Interspeech | Disentangled Representation Learning for Multilingual Speaker Recognition. | Kihyun Nam, Youkyum Kim, Jaesung Huh, Hee-Soo Heo, Jee-weon Jung, Joon Son Chung |
| 2022 | BMVC | Signing Outside the Studio: Benchmarking Background Robustness for Continuous Sign Language Recognition. | Youngjoon Jang, Youngtaek Oh, Jae-Won Cho, Dong-Jin Kim, Joon Son Chung, In So Kweon |
| 2022 | ICASSP | AASIST: Audio Anti-Spoofing Using Integrated Spectro-Temporal Graph Attention Networks. | Jee-weon Jung, Hee-Soo Heo, Hemlata Tak, Hye-jin Shim, Joon Son Chung, Bong-Jin Lee, Ha-Jin Yu, Nicholas W. D. Evans |
| 2022 | ICASSP | Spell My Name: Keyword Boosted Speech Recognition. | Namkyu Jung, Geonmin Kim, Joon Son Chung |
| 2022 | ICASSP | Multi-Scale Speaker Embedding-Based Graph Attention Networks For Speaker Diarisation. | Youngki Kwon, Hee-Soo Heo, Jee-Weon Jung, You Jin Kim, Bong-Jin Lee, Joon Son Chung |
| 2022 | Interspeech | Pushing the limits of raw waveform speaker recognition. | Jee-weon Jung, You Jin Kim, Hee-Soo Heo, Bong-Jin Lee, Youngki Kwon, Joon Son Chung |
| 2021 | ICASSP | Playing a Part: Speaker Verification at the movies. | Andrew Brown, Jaesung Huh, Arsha Nagrani, Joon Son Chung, Andrew Zisserman |
| 2021 | ICASSP | Graph Attention Networks for Speaker Verification. | Jee-weon Jung, Hee-Soo Heo, Ha-Jin Yu, Joon Son Chung |
| 2021 | ICASSP | The ins and outs of speaker recognition: lessons from VoxSRC 2020. | Yoohwan Kwon, Hee-Soo Heo, Bong-Jin Lee, Joon Son Chung |
| 2021 | Interspeech | Three-Class Overlapped Speech Detection Using a Convolutional Recurrent Neural Network. | Jee-weon Jung, Hee-Soo Heo, Youngki Kwon, Joon Son Chung, Bong-Jin Lee |
| 2021 | Interspeech | Look Who's Talking: Active Speaker Detection in the Wild. | You Jin Kim, Hee-Soo Heo, Soyeon Choe, Soo-Whan Chung, Yoohwan Kwon, Bong-Jin Lee, Youngki Kwon, Joon Son Chung |
| 2021 | Interspeech | Adapting Speaker Embeddings for Speaker Diarisation. | Youngki Kwon, Jee-weon Jung, Hee-Soo Heo, You Jin Kim, Bong-Jin Lee, Joon Son Chung |
| 2020 | ECCV | Self-supervised Learning of Audio-Visual Objects from Video. | Triantafyllos Afouras, Andrew Owens, Joon Son Chung, Andrew Zisserman |
| 2020 | ECCV | BSL-1K: Scaling Up Co-articulated Sign Language Recognition Using Mouthing Cues. | Samuel Albanie, Gl Varol, Liliane Momeni, Triantafyllos Afouras, Joon Son Chung, Neil Fox, Andrew Zisserman |
| 2020 | ICASSP | ASR is All You Need: Cross-Modal Distillation for Lip Reading. | Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman |
| 2020 | ICASSP | The Sound of My Voice: Speaker Representation Loss for Target Voice Separation. | Seongkyu Mun, Soyeon Choe, Jaesung Huh, Joon Son Chung |
| 2020 | ICASSP | Disentangled Speech Embeddings Using Cross-Modal Self-Supervision. | Arsha Nagrani, Joon Son Chung, Samuel Albanie, Andrew Zisserman |
| 2020 | Interspeech | Now You're Speaking My Language: Visual Language Identification. | Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman |
| 2020 | Interspeech | FaceFilter: Audio-Visual Speech Separation Using Still Images. | Soo-Whan Chung, Soyeon Choe, Joon Son Chung, Hong-Goo Kang |
| 2020 | Interspeech | In Defence of Metric Learning for Speaker Recognition. | Joon Son Chung, Jaesung Huh, Seongkyu Mun, Minjae Lee, Hee-Soo Heo, Soyeon Choe, Chiheon Ham, Sunghwan Jung, Bong-Jin Lee, Icksang Han |
| 2020 | Interspeech | Spot the Conversation: Speaker Diarisation in the Wild. | Joon Son Chung, Jaesung Huh, Arsha Nagrani, Triantafyllos Afouras, Andrew Zisserman |
| 2020 | Interspeech | Seeing Voices and Hearing Voices: Learning Discriminative Embeddings Using Cross-Modal Self-Supervision. | Soo-Whan Chung, Hong-Goo Kang, Joon Son Chung |
| 2019 | ICASSP | Perfect Match: Improved Cross-modal Embeddings for Audio-visual Synchronisation. | Soo-Whan Chung, Joon Son Chung, Hong-Goo Kang |
| 2019 | ICASSP | Utterance-level Aggregation for Speaker Recognition in the Wild. | Weidi Xie, Arsha Nagrani, Joon Son Chung, Andrew Zisserman |
| 2019 | Interspeech | My Lips Are Concealed: Audio-Visual Speech Enhancement Through Obstructions. | Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman |
| 2019 | Interspeech | Who Said That?: Audio-Visual Speaker Diarisation of Real-World Meetings. | Joon Son Chung, Bong-Jin Lee, Icksang Han |
| 2018 | Interspeech | The Conversation: Deep Audio-Visual Speech Enhancement. | Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman |
| 2018 | Interspeech | Deep Lip Reading: A Comparison of Models and an Online Application. | Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman |
| 2018 | Interspeech | VoxCeleb2: Deep Speaker Recognition. | Joon Son Chung, Arsha Nagrani, Andrew Zisserman |
| 2017 | BMVC | You said that? | Joon Son Chung, Amir Jamaludin, Andrew Zisserman |
| 2017 | BMVC | Lip Reading in Profile. | Joon Son Chung, Andrew Zisserman |
| 2017 | CVPR | Lip Reading Sentences in the Wild. | Joon Son Chung, Andrew W. Senior, Oriol Vinyals, Andrew Zisserman |
| 2017 | Interspeech | VoxCeleb: A Large-Scale Speaker Identification Dataset. | Arsha Nagrani, Joon Son Chung, Andrew Zisserman |
| 2016 | ACCV | Lip Reading in the Wild. | Joon Son Chung, Andrew Zisserman |
| 2016 | ACCV | Out of Time: Automated Lip Sync in the Wild. | Joon Son Chung, Andrew Zisserman |
| 2014 | ECCV | Re-presentations of Art Collections. | Joon Son Chung, Relja Arandjelovic, Giles Bergel, Alexandra Franklin, Andrew Zisserman |