| 2025 | ICASSP | Resource-Efficient and Noise-Robust Modality Fusion for Audio-Visual Speech Recognition. | Alexandros Koumparoulis, Gerasimos Potamianos |
| 2025 | ICCV | Seeing in 2D, Thinking in 3D: 3D Hand Mesh-Guided Feature Learning for Continuous Fingerspelling. | Katerina Papadimitriou, Panayiotis Paraskevas Filntisis, George Retsinas, Gerasimos Potamianos, Petros Maragos |
| 2025 | ICCV | Controllable Single-Shot Animation Blending with Temporal Conditioning. | Eleni Tselepi, Spyridon Thermos, Gerasimos Potamianos |
| 2025 | Interspeech | A Multi-Stream Framework Utilizing 3D Human Reconstruction for Cued Speech Recognition. | Katerina Papadimitriou, Gerasimos Potamianos |
| 2024 | Interspeech | Multimodal Continuous Fingerspelling Recognition via Visual Alignment Learning. | Katerina Papadimitriou, Gerasimos Potamianos |
| 2023 | ICASSP | Sign Language Recognition via Deformable 3D Convolutions and Modulated Graph Convolutional Networks. | Katerina Papadimitriou, Gerasimos Potamianos |
| 2023 | ICASSP | SL-REDU GSL: A Large Greek Sign Language Recognition Corpus. | Katerina Papadimitriou, Galini Sapountzaki, Kyriaki Vasilaki, Eleni Efthimiou, Stavroula-Evita Fotinea, Gerasimos Potamianos |
| 2023 | Interspeech | Multimodal Locally Enhanced Transformer for Continuous Sign Language Recognition. | Katerina Papadimitriou, Gerasimos Potamianos |
| 2022 | ICASSP | Accurate and Resource-Efficient Lipreading with Efficientnetv2 and Transformers. | Alexandros Koumparoulis, Gerasimos Potamianos |
| 2022 | ICASSP | Spatio-Temporal Graph Convolutional Networks for Continuous Sign Language Recognition. | Maria Parelli, Katerina Papadimitriou, Gerasimos Potamianos, Georgios Pavlakos, Petros Maragos |
| 2021 | HCI | The SL-ReDu Environment for Self-monitoring and Objective Learner Assessment in Greek Sign Language. | Eleni Efthimiou, Stavroula-Evita Fotinea, Christina Flouda, Theodore Goulas, Gkioulan Ametoglou, Galini Sapountzaki, Katerina Papadimitriou, Gerasimos Potamianos |
| 2021 | HCI | Multimodal Fusion and Sequence Learning for Cued Speech Recognition from Videos. | Katerina Papadimitriou, Maria Parelli, Galini Sapountzaki, Georgios Pavlakos, Petros Maragos, Gerasimos Potamianos |
| 2020 | ECCV | Emotion Understanding in Videos Through Body, Context, and Visual-Semantic Embedding Loss. | Panagiotis Paraskevas Filntisis, Niki Efthymiou, Gerasimos Potamianos, Petros Maragos |
| 2020 | ECCV | Exploiting 3D Hand Pose Estimation in Deep Learning-Based Sign Language Recognition from RGB Videos. | Maria Parelli, Katerina Papadimitriou, Gerasimos Potamianos, Georgios Pavlakos, Petros Maragos |
| 2020 | ICASSP | Audio-Assisted Image Inpainting for Talking Faces. | Alexandros Koumparoulis, Gerasimos Potamianos, Samuel Thomas, Edmilson da Silva Morais |
| 2020 | ICASSP | A Deep Learning Approach to Object Affordance Segmentation. | Spyridon Thermos, Petros Daras, Gerasimos Potamianos |
| 2020 | Interspeech | Resource-Adaptive Deep Learning for Visual Speech Recognition. | Alexandros Koumparoulis, Gerasimos Potamianos, Samuel Thomas, Edmilson da Silva Morais |
| 2020 | Interspeech | Multimodal Sign Language Recognition via Temporal Deformable Convolutional Sequence Learning. | Katerina Papadimitriou, Gerasimos Potamianos |
| 2019 | Interspeech | MobiLipNet: Resource-Efficient Deep Learning Based Lipreading. | Alexandros Koumparoulis, Gerasimos Potamianos |
| 2019 | Interspeech | End-to-End Convolutional Sequence Learning for ASL Fingerspelling Recognition. | Katerina Papadimitriou, Gerasimos Potamianos |
| 2018 | ICASSP | Far-Field Audio-Visual Scene Perception of Multi-Party Human-Robot Interaction for Children and Adults. | Antigoni Tsiami, Panagiotis Paraskevas Filntisis, Niki Efthymiou, Petros Koutras, Gerasimos Potamianos, Petros Maragos |
| 2018 | ICIP | Multi- View Fusion for Action Recognition in Child-Robot Interaction. | Niki Efthymiou, Petros Koutras, Panagiotis Paraskevas Filntisis, Gerasimos Potamianos, Petros Maragos |
| 2018 | ICIP | Attention-Enhanced Sensorimotor Object Recognition. | Spyridon Thermos, Georgios Th. Papadopoulos, Petros Daras, Gerasimos Potamianos |
| 2018 | IROS | Object Assembly Guidance in Child-Robot Interaction using RGB-D based 3D Tracking. | Jack Hadfield, Petros Koutras, Niki Efthymiou, Gerasimos Potamianos, Costas S. Tzafestas, Petros Maragos |
| 2018 | ICRA | Multi3: Multi-Sensory Perception System for Multi-Modal Child Interaction with Multiple Robots. | Antigoni Tsiami, Petros Koutras, Niki Efthymiou, Panagiotis Paraskevas Filntisis, Gerasimos Potamianos, Petros Maragos |
| 2017 | CVPR | Deep Affordance-Grounded Sensorimotor Object Recognition. | Spyridon Thermos, Georgios Th. Papadopoulos, Petros Daras, Gerasimos Potamianos |
| 2015 | ICASSP | Multichannel speech enhancement using MEMS microphones. | Z.-I. Skordilis, Antigoni Tsiami, Petros Maragos, Gerasimos Potamianos, Luca Spelgatti, Roberto Sannino |
| 2015 | Interspeech | Detecting audio-visual synchrony using deep neural networks. | Etienne Marcheret, Gerasimos Potamianos, Josef Vopicka, Vaibhava Goel |
| 2014 | ICASSP | Robust far-field spoken command recognition for home automation combining adaptation and multichannel processing. | Athanasios Katsamanis, Isidoros Rodomagoulakis, Gerasimos Potamianos, Petros Maragos, Antigoni Tsiami |
| 2014 | Interspeech | ATHENA: a Greek multi-sensory database for home automation control uthor: isidoros rodomagoulakis (NTUA, Greece). | Antigoni Tsiami, Isidoros Rodomagoulakis, Panagiotis Giannoulis, Athanasios Katsamanis, Gerasimos Potamianos, Petros Maragos |
| 2013 | HCI | Robust Multi-Modal Speech Recognition in Two Languages Utilizing Video and Distance Information from the Kinect. | Georgios Galatas, Gerasimos Potamianos, Fillia Makedon |
| 2012 | LREC | A hierarchical approach with feature selection for emotion recognition from speech. | Panagiotis Giannoulis, Gerasimos Potamianos |
| 2010 | ICASSP | Joint estimation of DOA and speech based on EM beamforming. | Lae-Hoon Kim, Mark Hasegawa-Johnson, Gerasimos Potamianos, Vit Libal |
| 2009 | ASRU | Audio-visual automatic speech recognition and related bimodal speech technologies: A review of the state-of-the-art and open problems. | Gerasimos Potamianos |
| 2009 | CVPR | Audio-visual speech synchronization detection using a bimodal linear prediction model. | Kshitiz Kumar, Jir Navrtil, Etienne Marcheret, Vit Libal, Ganesh N. Ramaswamy, Gerasimos Potamianos |
| 2009 | ICASSP | Long-time span acoustic activity analysis from far-field sensors in smart homes. | Jing Huang, Xiaodan Zhuang, Vit Libal, Gerasimos Potamianos |
| 2009 | ICASSP | Acoustic fall detection using Gaussian mixture models and GMM supervectors. | Xiaodan Zhuang, Jing Huang, Gerasimos Potamianos, Mark Hasegawa-Johnson |
| 2009 | Interspeech | Robust audio-visual speech synchrony detection by generalized bimodal linear prediction. | Kshitiz Kumar, Jir Navrtil, Etienne Marcheret, Vit Libal, Gerasimos Potamianos |
| 2009 | IWANN | Multimodal Classification of Activities of Daily Living Inside Smart Homes. | Vit Libal, Bhuvana Ramabhadran, Nadia Mana, Fabio Pianesi, Paul Chippendale, Oswald Lanz, Gerasimos Potamianos |
| 2008 | ICMI | A multi-modal spoken dialog system for interactive TV. | Rajesh Balchandran, Mark E. Epstein, Gerasimos Potamianos, Ladislav Serdi |
| 2007 | CVPR | Kernel-Based 3D Tracking. | Ambrish Tyagi, Mark A. Keck, James W. Davis, Gerasimos Potamianos |
| 2007 | ICASSP | Dynamic Stream Weight Modeling for Audio-Visual Speech Recognition. | Etienne Marcheret, Vit Libal, Gerasimos Potamianos |
| 2007 | Interspeech | Detection, diarization, and transcription of far-field lecture speech. | Jing Huang, Etienne Marcheret, Karthik Visweswariah, Vit Libal, Gerasimos Potamianos |
| 2007 | Interspeech | A unified approach to multi-pose audio-visual ASR. | Patrick Lucey, Gerasimos Potamianos, Sridha Sridharan |
| 2007 | MMSP | An Embedded System for In-Vehicle Visual Speech Activity Detection. | Vit Libal, Jonathan Connell, Gerasimos Potamianos, Etienne Marcheret |
| 2006 | MMSP | Lipreading Using Profile Versus Frontal Views. | Patrick Lucey, Gerasimos Potamianos |
| 2005 | ICCV | A Joint System for Person Tracking and Face Detection. | ZhenQiu Zhang, Gerasimos Potamianos, Andrew W. Senior, Stephen M. Chu, Thomas S. Huang |
| 2005 | Interspeech | Speech activity detection fusing acoustic phonetic and energy features. | Etienne Marcheret, Karthik Visweswariah, Gerasimos Potamianos |
| 2004 | ICASSP | Improved face and feature finding for audio-visual speech recognition in visually challenging environments. | Jintao Jiang, Gerasimos Potamianos, Harriet J. Nock, Giridharan Iyengar, Chalapathy Neti |
| 2004 | ICASSP | Towards practical deployment of audio-visual speech recognition. | Gerasimos Potamianos, Chalapathy Neti, Jing Huang, Jonathan H. Connell, Stephen M. Chu, Vit Libal, Etienne Marcheret, Norman Haas, Jintao Jiang |
| 2004 | Interspeech | Efficient likelihood computation in multi-stream HMM based audio-visual speech recognition. | Etienne Marcheret, Stephen M. Chu, Vaibhava Goel, Gerasimos Potamianos |
| 2004 | Interspeech | Mutual information based visual feature selection for lipreading. | Patricia Scanlon, Gerasimos Potamianos, Vit Libal, Stephen M. Chu |
| 2003 | ICASSP | Audio-visual speaker recognition using time-varying stream reliability prediction. | Upendra V. Chaudhari, Ganesh N. Ramaswamy, Gerasimos Potamianos, Chalapathy Neti |
| 2003 | ICASSP | Frame-dependent multi-stream reliability indicators for audio-visual speech recognition. | Ashutosh Garg, Gerasimos Potamianos, Chalapathy Neti, Thomas S. Huang |
| 2003 | Interspeech | Audio-visual speech recognition in challenging environments. | Gerasimos Potamianos, Chalapathy Neti |
| 2002 | ICASSP | Noisy audio feature enhancement using audio-visual speech data. | Roland Goecke, Gerasimos Potamianos, Chalapathy Neti |
| 2002 | ICASSP | Maximum entropy and MCE based HMM stream weight estimation for audio-visual ASR. | Guillaume Gravier, Scott Axelrod, Gerasimos Potamianos, Chalapathy Neti |
| 2002 | Interspeech | Audio-visual speech enhancement with AVCDCN (audio-visual codebook dependent cepstral normalization). | Sabine Deligne, Gerasimos Potamianos, Chalapathy Neti |
| 2001 | ICASSP | Weighting schemes for audio-visual fusion in speech recognition. | Herv Glotin, D. Vergyr, Chalapathy Neti, Gerasimos Potamianos, Juergen Luettin |
| 2001 | ICASSP | Asynchronous stream modeling for large vocabulary audio-visual speech recognition. | Juergen Luettin, Gerasimos Potamianos, Chalapathy Neti |
| 2001 | ICASSP | Hierarchical discriminant features for audio-visual LVCSR. | Gerasimos Potamianos, Juergen Luettin, Chalapathy Neti |
| 2001 | ICIP | Improved ROI and within frame discriminant features for lipreading. | Gerasimos Potamianos, Chalapathy Neti |
| 2001 | Interspeech | Large-vocabulary audio-visual speech recognition by machines and humans. | Gerasimos Potamianos, Chalapathy Neti, Giridharan Iyengar, Eric Helmuth |
| 2001 | MMSP | Robust detection of visual ROI for automatic speechreading. | Giridharan Iyengar, Gerasimos Potamianos, Chalapathy Neti, Tanveer A. Faruquie, Ashish Verma |
| 2001 | MMSP | Large-vocabulary audio-visual speech recognition: a summary of the Johns Hopkins Summer 2000 Workshop. | Chalapathy Neti, Gerasimos Potamianos, Juergen Luettin, Iain A. Matthews, Herv Glotin, Dimitra Vergyri |
| 2000 | Interspeech | Perceptual interfaces for information interaction: joint processing of audio and visual information for human-computer interaction. | Chalapathy Neti, Giridharan Iyengar, Gerasimos Potamianos, Andrew W. Senior, Benot Maison |
| 2000 | Interspeech | Stream confidence estimation for audio-visual speech recognition. | Gerasimos Potamianos, Chalapathy Neti |
| 1999 | Interspeech | Speaker adaptation for audio-visual speech recognition. | Gerasimos Potamianos, Alexandros Potamianos |
| 1998 | ICASSP | Discriminative training of HMM stream exponents for audio-visual speech recognition. | Gerasimos Potamianos, Hans Peter Graf |
| 1998 | ICIP | An Image Transform Approach for HMM based Automatic Lipreading. | Gerasimos Potamianos, Hans Peter Graf, Eric Cosatto |
| 1998 | MMSP | Linear discriminant analysis for speechreading. | Gerasimos Potamianos, Hans Peter Graf |
| 1993 | ICASSP | An analysis of Monte Carlo methods for likelihood estimation of Gibbsian images. | Gerasimos Potamianos, John Goutsias |
| 1991 | ICASSP | A novel method for computing the partition function of Markov random field images using Monte Carlo simulations. | Gerasimos Potamianos, John Goutsias |