| 2024 | ICASSP | Large Scale Self-Supervised Pretraining for Active Speaker Detection. | Otavio Braga, Wei Xia, Keith Johnson, Alice Chuang, Yunfan Ye, Olivier Siohan, Tuan Anh Nguyen |
| 2022 | ICASSP | Best of Both Worlds: Multi-Task Audio-Visual Automatic Speech Recognition and Active Speaker Detection. | Otavio Braga, Olivier Siohan |
| 2022 | Interspeech | Transformer-Based Video Front-Ends for Audio-Visual Speech Recognition for Single and Muti-Person Video. | Dmitriy Serdyuk, Otavio Braga, Olivier Siohan |
| 2021 | ASRU | Audio-Visual Speech Recognition is Worth $32\times 32\times 8$ Voxels. | Dmitriy Serdyuk, Otavio Braga, Olivier Siohan |
| 2021 | ICASSP | A Closer Look at Audio-Visual Multi-Person Speech Recognition and Active Speaker Selection. | Otavio Braga, Olivier Siohan |
| 2021 | Interspeech | End-to-End Audio-Visual Speech Recognition for Overlapping Speech. | Richard Rose, Olivier Siohan, Anshuman Tripathi, Otavio Braga |
| 2020 | ICASSP | End-to-End Multi-Person Audio/Visual Automatic Speech Recognition. | Otavio Braga, Takaki Makino, Olivier Siohan, Hank Liao |
| 2019 | ASRU | Recurrent Neural Network Transducer for Audio-Visual Speech Recognition. | Takaki Makino, Hank Liao, Yannis M. Assael, Brendan Shillingford, Basilio Garcia, Otavio Braga, Olivier Siohan |