| 2026 | AAAI | Emotion-Coherent Reasoning for Multimodal LLMs via Emotional Rationale Verifier. | Hyeongseop Rha, Jeong Hun Yeo, Yeonju Kim, Yong Man Ro |
| 2025 | AAAI | Personalized Lip Reading: Adapting to Your Unique Lip Movements with Vision and Language. | Jeong Hun Yeo, Chae Won Kim, Hyunjun Kim, Hyeongseop Rha, Seunghee Han, Wen-Huang Cheng, Yong Man Ro |
| 2025 | ACL | MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens. | Jeong Hun Yeo, Hyeongseop Rha, Se Jin Park, Yong Man Ro |
| 2025 | ICCV | Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations. | Jeong Hun Yeo, Minsu Kim, Chae Won Kim, Stavros Petridis, Yong Man Ro |
| 2024 | ACL | Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation. | Se Jin Park, Chae Won Kim, Hyeongseop Rha, Minsu Kim, Joanna Hong, Jeong Hun Yeo, Yong Man Ro |
| 2024 | EMNLP | Where Visual Speech Meets Language: VSP-LLM Framework for Efficient and Context-Aware Visual Speech Processing. | Jeong Hun Yeo, Seunghee Han, Minsu Kim, Yong Man Ro |
| 2024 | ICASSP | Towards Practical and Efficient Image-to-Speech Captioning with Vision-Language Pre-Training and Multi-Modal Tokens. | Minsu Kim, Jeongsoo Choi, Soumi Maiti, Jeong Hun Yeo, Shinji Watanabe, Yong Man Ro |
| 2024 | ICASSP | Visual Speech Recognition for Languages with Limited Labeled Data Using Automatic Labels from Whisper. | Jeong Hun Yeo, Minsu Kim, Shinji Watanabe, Yong Man Ro |
| 2023 | ICASSP | Multi-Temporal Lip-Audio Memory for Visual Speech Recognition. | Jeong Hun Yeo, Minsu Kim, Yong Man Ro |
| 2023 | ICCV | Lip Reading for Low-resource Languages by Learning and Combining General Speech Knowledge and Language-specific Knowledge. | Minsu Kim, Jeong Hun Yeo, Jeongsoo Choi, Yong Man Ro |
| 2022 | AAAI | Distinguishing Homophenes Using Multi-Head Visual-Audio Memory for Lip Reading. | Minsu Kim, Jeong Hun Yeo, Yong Man Ro |