| 2026 | WACV | ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models. | Sibo Dong, Ismail Shaheen, Maggie Shen, Rupayan Mallick, Sarah Adel Bargal |
| 2026 | WACV | Gen-AFFECT: Generation of Avatar Fine-grained Facial Expressions with Consistent identiTy. | Hao Yu, Rupayan Mallick, Margrit Betke, Sarah Adel Bargal |
| 2026 | WACV | GenEava: Generating Cartoon Avatars With Fine-Grained Facial Expressions From Realistic Diffusion-Based Faces. | Hao Yu, Rupayan Mallick, Margrit Betke, Sarah Adel Bargal |
| 2025 | CVPR | D-Feat Occlusions: Diffusion Features for Robustness to Partial Visual Occlusions in Object Recognition. | Rupayan Mallick, Sibo Dong, Nataniel Ruiz, Sarah Adel Bargal |
| 2024 | MMM | IFI: Interpreting for Improving: A Multimodal Transformer with an Interpretability Technique for Recognition of Risk Events. | Rupayan Mallick, Jenny Benois-Pineau, Akka Zemmari |
| 2022 | ICIP | I Saw: A Self-Attention Weighted Method for Explanation of Visual Transformers. | Rupayan Mallick, Jenny Benois-Pineau, Akka Zemmari |
| 2022 | ICPR | Pooling Transformer for Detection of Risk Events in In-The-Wild Video Ego Data. | Rupayan Mallick, Jenny Benois-Pineau, Akka Zemmari, Thinhinane Yebda, Marion Pech, Hlne Amieva, Laura Middleton |
| 2021 | CBMI | A GRU Neural Network with attention mechanism for detection of risk situations on multimodal lifelog data. | Rupayan Mallick, Thinhinane Yebda, Jenny Benois-Pineau, Akka Zemmari, Marion Pech, Hlne Amieva |
| 2021 | WACV | Selective Spatio-Temporal Aggregation Based Pose Refinement System: Towards Understanding Human Activities in Real-World Videos. | Di Yang, Rui Dai, Yaohui Wang, Rupayan Mallick, Luca Minciullo, Gianpiero Francesca, Franois Brmond |