Yuan Gong
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
31
Venues
13
Active years
2018–2025
Best venue rank
A*
Where they publish
Papers
31 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | CVPR | CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment. | Edson Araujo, Andrew Rouditchenko, Yuan Gong, Saurabhchand Bhati, Samuel Thomas, Brian Kingsbury, Leonid Karlinsky, Rogrio Feris, James R. Glass, Hilde Kuehne |
| 2025 | ICASSP | AER-LLM: Ambiguity-aware Emotion Recognition Leveraging Large Language Models. | Xin Hong, Yuan Gong, Vidhyasaharan Sethu, Ting Dang |
| 2025 | ICASSP | Revise, Reason, and Recognize: LLM-Based Emotion Recognition via Emotion-Specific Prompts and ASR Error Correction. | Yuanchao Li, Yuan Gong, Chao-Han Huck Yang, Peter Bell, Catherine Lai |
| 2025 | ICLR | UniWav: Towards Unified Pre-training for Speech Representation Learning and Generation. | Alexander H. Liu, Sang-gil Lee, Chao-Han Huck Yang, Yuan Gong, Yu-Chiang Frank Wang, James R. Glass, Rafael Valle, Bryan Catanzaro |
| 2024 | ECCV | Storytelling Video Generation with Retrieval Augmentation and Character Consistency. | Yingqing He, Menghan Xia, Haoxin Chen, Xiaodong Cun, Yuan Gong, Jinbo Xing, Yong Zhang, Xintao Wang, Chao Weng, Ying Shan, Qifeng Chen |
| 2024 | ICLR | Listen, Think, and Understand. | Yuan Gong, Hongyin Luo, Alexander H. Liu, Leonid Karlinsky, James R. Glass |
| 2024 | Interspeech | Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation. | Andrew Rouditchenko, Yuan Gong, Samuel Thomas, Leonid Karlinsky, Hilde Kuehne, Rogrio Feris, James Glass |
| 2024 | Interspeech | Automatic Prediction of Amyotrophic Lateral Sclerosis Progression using Longitudinal Speech Transformer. | Liming Wang, Yuan Gong, Nauman Dawalatabad, Marco Vilela, Katerina Placek, Brian Tracey, Yishu Gong, Alan Premasiri, Fernando Vieira, James R. Glass |
| 2024 | NAACL | Natural Language Embedded Programs for Hybrid Language Symbolic Reasoning. | Tianhua Zhang, Jiaxin Ge, Hongyin Luo, Yung-Sung Chuang, Mingye Gao, Yuan Gong, Yoon Kim, Xixin Wu, Helen Meng, Jim Glass |
| 2023 | ASRU | Joint Audio and Speech Understanding. | Yuan Gong, Alexander H. Liu, Hongyin Luo, Leonid Karlinsky, James R. Glass |
| 2023 | CVPR | MAP: Multimodal Uncertainty-Aware Vision-Language Pre-training Model. | Yatai Ji, Junjie Wang, Yuan Gong, Lin Zhang, Yanru Zhu, Hongfa Wang, Jiaxing Zhang, Tetsuya Sakai, Yujiu Yang |
| 2023 | CVPR | 3D GAN Inversion with Facial Symmetry Prior. | Fei Yin, Yong Zhang, Xuan Wang, Tengfei Wang, Xiaoyu Li, Yuan Gong, Yanbo Fan, Xiaodong Cun, Ying Shan, Cengiz ztireli, Yujiu Yang |
| 2023 | EMNLP | Search Augmented Instruction Learning. | Hongyin Luo, Tianhua Zhang, Yung-Sung Chuang, Yuan Gong, Yoon Kim, Xixin Wu, Helen Meng, James R. Glass |
| 2023 | ICCV | ToonTalker: Cross-Domain Face Reenactment. | Yuan Gong, Yong Zhang, Xiaodong Cun, Fei Yin, Yanbo Fan, Xuan Wang, Baoyuan Wu, Yujiu Yang |
| 2023 | ICLR | Contrastive Audio-Visual Masked Autoencoder. | Yuan Gong, Andrew Rouditchenko, Alexander H. Liu, David Harwath, Leonid Karlinsky, Hilde Kuehne, James R. Glass |
| 2023 | Interspeech | Whisper-AT: Noise-Robust Automatic Speech Recognizers are Also Strong General Audio Event Taggers. | Yuan Gong, Sameer Khurana, Leonid Karlinsky, James R. Glass |
| 2023 | SiggraphA | Interactive Story Visualization with Multiple Characters. | Yuan Gong, Youxin Pang, Xiaodong Cun, Menghan Xia, Yingqing He, Haoxin Chen, Longyue Wang, Yong Zhang, Xintao Wang, Ying Shan, Yujiu Yang |
| 2022 | AAAI | SSAST: Self-Supervised Audio Spectrogram Transformer. | Yuan Gong, Cheng-I Lai, Yu-An Chung, James R. Glass |
| 2022 | CVPR | NTIRE 2022 Challenge on Perceptual Image Quality Assessment. | Jinjin Gu, Haoming Cai, Chao Dong, Jimmy S. Ren, Radu Timofte, Yuan Gong, Shanshan Lao, Shuwei Shi, Jiahao Wang, Sidi Yang, Tianhe Wu, Weihao Xia, Yujiu Yang, Mingdeng Cao, Cong Heng, Lingzhi Fu, Rongyu Zhang, Yusheng Zhang, Hao Wang, Hongjian Song, Jing Wang, Haotian Fan, Xiaoxia Hou, Ming Sun, Mading Li, Kai Zhao, Kun Yuan, Zishang Kong, Mingda Wu, Chuanchuan Zheng, Marcos V. Conde, Maxime Burchi, Longtao Feng, Tao Zhang, Yang Li, Jingwen Xu, Haiqiang Wang, Yiting Liao, Junlin Li, Kele Xu, Tao Sun, Yunsheng Xiong, Abhisek Keshari, Komal, Sadbhawana Thakur, Vinit Jakhetiya, Badri N. Subudhi, Hao-Hsiang Yang, Hua-En Chang, Zhi-Kai Huang, Wei-Ting Chen, Sy-Yen Kuo, Saikat Dutta, Sourya Dipta Das, Nisarg A. Shah, Anil Kumar Tiwari |
| 2022 | CVPR | Attentions Help CNNs See Better: Attention-based Hybrid Image Quality Assessment Network. | Shanshan Lao, Yuan Gong, Shuwei Shi, Sidi Yang, Tianhe Wu, Jiahao Wang, Weihao Xia, Yujiu Yang |
| 2022 | CVPR | Focal and Global Knowledge Distillation for Detectors. | Zhendong Yang, Zhe Li, Xiaohu Jiang, Yuan Gong, Zehuan Yuan, Danpei Zhao, Chun Yuan |
| 2022 | CVPR | MANIQA: Multi-dimension Attention Network for No-Reference Image Quality Assessment. | Sidi Yang, Tianhe Wu, Shuwei Shi, Shanshan Lao, Yuan Gong, Mingdeng Cao, Jiahao Wang, Yujiu Yang |
| 2022 | EMNLP | Detecting Dementia from Long Neuropsychological Interviews. | Nauman Dawalatabad, Yuan Gong, Sameer Khurana, Rhoda Au, James R. Glass |
| 2022 | ICASSP | Transformer-Based Multi-Aspect Multi-Granularity Non-Native English Speaker Pronunciation Assessment. | Yuan Gong, Ziyi Chen, Iek-Heng Chu, Peng Chang, James R. Glass |
| 2022 | ICASSP | Vocalsound: A Dataset for Improving Human Vocal Sounds Recognition. | Yuan Gong, Jin Yu, James R. Glass |
| 2021 | Interspeech | AST: Audio Spectrogram Transformer. | Yuan Gong, Yu-An Chung, James R. Glass |
| 2019 | ICCV | Second-Order Non-Local Attention Networks for Person Re-Identification. | Bryan Bryan, Yuan Gong, Yizhe Zhang, Christian Poellabauer |
| 2019 | IJCAI | Real-Time Adversarial Attacks. | Yuan Gong, Boyang Li, Christian Poellabauer, Yiyu Shi |
| 2019 | Interspeech | ReMASC: Realistic Replay Attack Corpus for Voice Controlled Systems. | Yuan Gong, Jian Yang, Jacob Huber, Mitchell MacKnight, Christian Poellabauer |
| 2018 | ICCCN | Protecting Voice Controlled Systems Using Sound Source Identification Based on Acoustic Cues. | Yuan Gong, Christian Poellabauer |
| 2018 | Interspeech | Impact of Aliasing on Deep CNN-Based End-to-End Acoustic Models. | Yuan Gong, Christian Poellabauer |