| 2026 | ICPR | A Multi-modal BLIP-2 Approach for Video Captioning. | Antoine Brimont, Titus Zaharia, Ruxandra Tapu |
| 2025 | CAIP | Automatic Audio Description: A Training-Free Approach Using Foundation Models. | Ruxandra Tapu, Bogdan Mocanu |
| 2025 | CBMI | Lip Reading Across Languages: A Cross-Modal Framework Leveraging Foundation Models. | Ruxandra Tapu, Bogdan Mocanu |
| 2025 | ISVC | Seeing Through Words: A Zero-Shot Multimodal Audio Description System with Foundation Models. | Bogdan Mocanu, Ruxandra Tapu |
| 2022 | ISVC | Emotion Recognition in Video Streams Using Intramodal and Intermodal Attention Mechanisms. | Bogdan Mocanu, Ruxandra Tapu |
| 2020 | ISVC | A Multimodal High Level Video Segmentation for Content Targeted Online Advertising. | Bogdan Mocanu, Ruxandra Tapu, Titus Zaharia |
| 2017 | ACIVS | Object Tracking Using Deep Convolutional Neural Networks and Visual Appearance Models. | Bogdan Cosmin Mocanu, Ruxandra Tapu, Titus Zaharia |
| 2016 | ACIVS | Automatic Segmentation of TV News into Stories Using Visual and Temporal Information. | Bogdan Cosmin Mocanu, Ruxandra Tapu, Titus Zaharia |
| 2016 | ECCV | Using Computer Vision to See. | Bogdan Cosmin Mocanu, Ruxandra Tapu, Titus Zaharia |
| 2011 | ISVC | High Level Video Temporal Segmentation. | Ruxandra Tapu, Titus Zaharia |