| 2025 | CVPR | Seeing Speech and Sound: Distinguishing and Locating Audio Sources in Visual Scenes. | Hyeonggon Ryu, Seongyu Kim, Joon Son Chung, Arda Senocak |
| 2025 | ICLR | AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models. | Sung-Bin Kim, Oh Hyun-Bin, JungMok Lee, Arda Senocak, Joon Son Chung, Tae-Hyun Oh |
| 2024 | ICASSP | From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers. | Jiu Feng, Mehmet Hamza Erol, Joon Son Chung, Arda Senocak |
| 2024 | ICASSP | Speech Guided Masked Image Modeling for Visually Grounded Speech. | Jongbhin Woo, Hyeonggon Ryu, Arda Senocak, Joon Son Chung |
| 2024 | Interspeech | ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions. | Jiu Feng, Mehmet Hamza Erol, Joon Son Chung, Arda Senocak |
| 2024 | WACV | Can CLIP Help Sound Source Localization? | Sooyoung Park, Arda Senocak, Joon Son Chung |
| 2023 | CVPR | Sound to Visual Scene Generation by Audio-to-Visual Latent Alignment. | Sung-Bin Kim, Arda Senocak, Hyunwoo Ha, Andrew Owens, Tae-Hyun Oh |
| 2023 | ICASSP | MarginNCE: Robust Sound Localization with a Negative Margin. | Sooyoung Park, Arda Senocak, Joon Son Chung |
| 2023 | ICASSP | Hindi as a Second Language: Improving Visually Grounded Speech with Semantically Similar Samples. | Hyeonggon Ryu, Arda Senocak, In So Kweon, Joon Son Chung |
| 2023 | ICCV | Sound Source Localization is All about Cross-Modal Alignment. | Arda Senocak, Hyeonggon Ryu, Junsik Kim, Tae-Hyun Oh, Hanspeter Pfister, Joon Son Chung |
| 2023 | Interspeech | FlexiAST: Flexibility is What AST Needs. | Jiu Feng, Mehmet Hamza Erol, Joon Son Chung, Arda Senocak |
| 2023 | WACV | Event-Specific Audio-Visual Fusion Layers: A Simple and New Perspective on Video Understanding. | Arda Senocak, Junsik Kim, Tae-Hyun Oh, Dingzeyu Li, In So Kweon |
| 2022 | ICASSP | Learning Sound Localization Better from Semantically Similar Samples. | Arda Senocak, Hyeonggon Ryu, Junsik Kim, In So Kweon |
| 2022 | WACV | Less Can Be More: Sound Source Localization With a Classification Model. | Arda Senocak, Hyeonggon Ryu, Junsik Kim, In So Kweon |
| 2018 | CVPR | Learning to Localize Sound Source in Visual Scenes. | Arda Senocak, Tae-Hyun Oh, Junsik Kim, Ming-Hsuan Yang, In So Kweon |
| 2018 | CVPR | On Learning Association of Sound Source and Visual Scenes. | Arda Senocak, Tae-Hyun Oh, Junsik Kim, Ming-Hsuan Yang, In So Kweon |
| 2018 | CVPR | Part-Based Player Identification Using Deep Convolutional Representation and Multi-Scale Pooling. | Arda Senocak, Tae-Hyun Oh, Junsik Kim, In So Kweon |