| 2026 | ACL | GOAT: A Training Framework for Goal-Oriented Agent with Tools. | Hyunji Min, Sangwon Jung, Junyoung Sung, Dosung Lee, Leekyeung Han, Paul Hongsuck Seo |
| 2025 | AAAI | Multi-Granularity Video Object Segmentation. | Sangbeom Lim, Seongchan Kim, Seungjun An, Seokju Cho, Paul Hongsuck Seo, Seungryong Kim |
| 2025 | ACL | ReSCORE: Label-free Iterative Retriever Training for Multi-hop Question Answering with Relevance-Consistency Supervision. | Dosung Lee, Wonjun Oh, Boyoung Kim, Minyoung Kim, Joonsuk Park, Paul Hongsuck Seo |
| 2025 | CVPR | Random Conditioning for Diffusion Model Compression with Distillation. | Dohyun Kim, Sehwan Park, Geonhee Han, Seung Wook Kim, Paul Hongsuck Seo |
| 2025 | EMNLP | ReTAG: Retrieval-Enhanced, Topic-Augmented Graph-Based Global Sensemaking. | Boyoung Kim, Dosung Lee, Sumin An, Jinseong Jeong, Paul Hongsuck Seo |
| 2025 | ICCV | DialNav: Multi-Turn Dialog Navigation with a Remote Guide. | Leekyeung Han, Hyunji Min, Gyeom Hwangbo, Jonghyun Choi, Paul Hongsuck Seo |
| 2025 | Interspeech | Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries. | Minyoung Kim, Sehwan Park, Sungmin Cha, Paul Hongsuck Seo |
| 2025 | Interspeech | DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization. | Geonyoung Lee, Geonhee Han, Paul Hongsuck Seo |
| 2025 | Interspeech | Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models. | Seung-jae Lee, Paul Hongsuck Seo |
| 2025 | NAACL | LCIRC: A Recurrent Compression Approach for Efficient Long-form Context and Query Dependent Modeling in LLMs. | Sumin An, Junyoung Sung, Wonpyo Park, Chanjun Park, Paul Hongsuck Seo |
| 2024 | CVPR | CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation. | Seokju Cho, Heeseong Shin, Sunghwan Hong, Anurag Arnab, Paul Hongsuck Seo, Seungryong Kim |
| 2024 | CVPR | Learning Correlation Structures for Vision Transformers. | Manjin Kim, Paul Hongsuck Seo, Cordelia Schmid, Minsu Cho |
| 2024 | ECCV | Pseudo-RIS: Distinctive Pseudo-Supervision Generation for Referring Image Segmentation. | Seonghoon Yu, Paul Hongsuck Seo, Jeany Son |
| 2023 | CVPR | AVFormer: Injecting Vision into Frozen Speech Models for Zero-Shot AV-ASR. | Paul Hongsuck Seo, Arsha Nagrani, Cordelia Schmid |
| 2023 | CVPR | Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning. | Antoine Yang, Arsha Nagrani, Paul Hongsuck Seo, Antoine Miech, Jordi Pont-Tuset, Ivan Laptev, Josef Sivic, Cordelia Schmid |
| 2023 | CVPR | IFSeg: Image-free Semantic Segmentation via Vision-Language Model. | Sukmin Yun, Seong Hyeon Park, Paul Hongsuck Seo, Jinwoo Shin |
| 2023 | CVPR | Zero-shot Referring Image Segmentation with Global-Local Context Features. | Seonghoon Yu, Paul Hongsuck Seo, Jeany Son |
| 2022 | CVPR | End-to-end Generative Pretraining for Multimodal Video Captioning. | Paul Hongsuck Seo, Arsha Nagrani, Anurag Arnab, Cordelia Schmid |
| 2022 | ECCV | Learning Audio-Video Modalities from Image Captions. | Arsha Nagrani, Paul Hongsuck Seo, Bryan Seybold, Anja Hauth, Santiago Manen, Chen Sun, Cordelia Schmid |
| 2022 | Interspeech | AVATAR: Unconstrained Audiovisual Speech Recognition. | Valentin Gabeur, Paul Hongsuck Seo, Arsha Nagrani, Chen Sun, Karteek Alahari, Cordelia Schmid |
| 2021 | CVPR | Look Before You Speak: Visually Contextualized Utterances. | Paul Hongsuck Seo, Arsha Nagrani, Cordelia Schmid |
| 2020 | AAAI | Reinforcing an Image Caption Generator Using Off-Line Human Feedback. | Paul Hongsuck Seo, Piyush Sharma, Tomer Levinboim, Bohyung Han, Radu Soricut |
| 2019 | ACML | Regularizing Neural Networks via Stochastic Branch Layers. | Wonpyo Park, Paul Hongsuck Seo, Bohyung Han, Minsu Cho |
| 2019 | CVPR | Learning for Single-Shot Confidence Calibration in Deep Neural Networks Through Stochastic Inferences. | Seonguk Seo, Paul Hongsuck Seo, Bohyung Han |
| 2018 | BMVC | Progressive Attention Networks for Visual Attribute Prediction. | Paul Hongsuck Seo, Zhe Lin, Scott Cohen, Xiaohui Shen, Bohyung Han |
| 2018 | ECCV | Attentive Semantic Alignment with Offset-Aware Correlation Kernels. | Paul Hongsuck Seo, Jongmin Lee, Deunsol Jung, Bohyung Han, Minsu Cho |
| 2018 | ECCV | CPlaNet: Enhancing Image Geolocalization by Combinatorial Partitioning of Maps. | Paul Hongsuck Seo, Tobias Weyand, Jack Sim, Bohyung Han |
| 2017 | ICCV | MarioQA: Answering Questions by Watching Gameplay Videos. | Jonghwan Mun, Paul Hongsuck Seo, Ilchae Jung, Bohyung Han |
| 2016 | CVPR | Image Question Answering Using Convolutional Neural Network with Dynamic Parameter Prediction. | Hyeonwoo Noh, Paul Hongsuck Seo, Bohyung Han |
| 2015 | SIGdial | Conversational Knowledge Teaching Agent that uses a Knowledge Base. | Kyusong Lee, Paul Hongsuck Seo, Junhwi Choi, Sangjun Koo, Gary Geunbae Lee |