| 2025 | ICASSP | Gen-A: Generalizing Ambisonics Neural Encoding to Unseen Microphone Arrays. | Mikko Heikkinen, Archontis Politis, Konstantinos Drossos, Tuomas Virtanen |
| 2025 | ICASSP | A decade of DCASE: Achievements, practices, evaluations and future challenges. | Annamaria Mesaros, Romain Serizel, Toni Heittola, Tuomas Virtanen, Mark D. Plumbley |
| 2025 | Interspeech | Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction. | Wang Dai, Archontis Politis, Tuomas Virtanen |
| 2025 | Interspeech | Attractor-Based Speech Separation of Multiple Utterances by Unknown Number of Speakers. | Yuzhu Wang, Archontis Politis, Konstantinos Drossos, Tuomas Virtanen |
| 2024 | ICASSP | Neural Ambisonics Encoding For Compact Irregular Microphone Arrays. | Mikko Heikkinen, Archontis Politis, Tuomas Virtanen |
| 2024 | ICASSP | Attention-Driven Multichannel Speech Enhancement in Moving Sound Source Scenarios. | Yuzhu Wang, Archontis Politis, Tuomas Virtanen |
| 2023 | ICASSP | On Negative Sampling for Contrastive Audio-Text Retrieval. | Huang Xie, Okko Rsnen, Tuomas Virtanen |
| 2023 | Interspeech | Few-shot Class-incremental Audio Classification Using Adaptively-refined Prototypes. | Wei Xie, Yanxiong Li, Qianhua He, Wenchang Cao, Tuomas Virtanen |
| 2022 | ICASSP | Unsupervised Audio-Caption Aligning Learns Correspondences Between Individual Sound Events and Textual Phrases. | Huang Xie, Okko Rsnen, Konstantinos Drossos, Tuomas Virtanen |
| 2022 | MMSP | Domestic Activity Clustering from Audio via Depthwise Separable Convolutional Autoencoder Network. | Yanxiong Li, Wenchang Cao, Konstantinos Drossos, Tuomas Virtanen |
| 2022 | MMSP | Subjective Evaluation of Deep Neural Network Based Speech Enhancement Systems in Real-World Conditions. | Gaurav Naithani, Kirsi Pietil, Riitta Niemist, Erkki Paajanen, Tero Takala, Tuomas Virtanen |
| 2021 | ICASSP | Learning Contextual Tag Embeddings for Cross-Modal Alignment of Audio and Tags. | Xavier Favory, Konstantinos Drossos, Tuomas Virtanen, Xavier Serra |
| 2021 | ICASSP | A Curated Dataset of Urban Scenes for Audio-Visual Scene Analysis. | Shanshan Wang, Annamaria Mesaros, Toni Heittola, Tuomas Virtanen |
| 2021 | ICASSP | Zero-Shot Audio Classification with Factored Linear and Nonlinear Acoustic-Semantic Projections. | Huang Xie, Okko Rsnen, Tuomas Virtanen |
| 2021 | ICMI | Towards Sonification in Multimodal and User-friendlyExplainable Artificial Intelligence. | Bjrn W. Schuller, Tuomas Virtanen, Maria Riveiro, Georgios Rizos, Jing Han, Annamaria Mesaros, Konstantinos Drossos |
| 2020 | ICASSP | Clotho: an Audio Captioning Dataset. | Konstantinos Drossos, Samuel Lipping, Tuomas Virtanen |
| 2020 | ICASSP | Sound Event Detection Via Dilated Convolutional Recurrent Neural Networks. | Yanxiong Li, Mingle Liu, Konstantinos Drossos, Tuomas Virtanen |
| 2020 | IJCNN | Sound Event Detection with Depthwise Separable and Dilated Convolutions. | Konstantinos Drossos, Stylianos I. Mimilakis, Shayan Gharib, Yanxiong Li, Tuomas Virtanen |
| 2020 | MMSP | Depthwise Separable Convolutions Versus Recurrent Neural Networks for Monaural Singing Voice Separation. | Pyry Pyykknen, Stylianos I. Mimilakis, Konstantinos Drossos, Tuomas Virtanen |
| 2019 | ICASSP | Sound Event Envelope Estimation in Polyphonic Mixtures. | Irene Martn-Morat, Annamaria Mesaros, Toni Heittola, Tuomas Virtanen, Maximo Cobos, Francesc J. Ferri |
| 2019 | ICASSP | Low-latency Deep Clustering for Speech Separation. | Shanshan Wang, Gaurav Naithani, Tuomas Virtanen |
| 2019 | IJCNN | Detection of Typical Pronunciation Errors in Non-native English Speech Using Convolutional Recurrent Neural Networks. | Aleksandr Diment, Eemi Fagerlund, Adrian Benfield, Tuomas Virtanen |
| 2018 | ICASSP | Bayesian Anisotropic Gaussian Model for Audio Source Separation. | Paul Magron, Tuomas Virtanen |
| 2018 | ICASSP | Monaural Singing Voice Separation with Skip-Filtering Connections and Recurrent Inference of Time-Frequency Mask. | Stylianos Ioannis Mimilakis, Konstantinos Drossos, Joo Felipe Santos, Gerald Schuller, Tuomas Virtanen, Yoshua Bengio |
| 2018 | ICASSP | Estimation of Time-Varying Room Impulse Responses of Multiple Sound Sources from Observed Mixture and Isolated Source Signals. | Joonas Nikunen, Tuomas Virtanen |
| 2018 | IJCNN | Multichannel Sound Event Detection Using 3D Convolutional Neural Networks for Learning Inter-channel Features. | Sharath Adavanne, Archontis Politis, Tuomas Virtanen |
| 2018 | IJCNN | End-to-End Polyphonic Sound Event Detection Using Convolutional Recurrent Neural Networks with Learned Time-Frequency Representation Input. | Emre Cakir, Tuomas Virtanen |
| 2018 | IJCNN | MaD TwinNet: Masker-Denoiser Architecture with Twin Networks for Monaural Sound Source Separation. | Konstantinos Drossos, Stylianos Ioannis Mimilakis, Dmitriy Serdyuk, Gerald Schuller, Tuomas Virtanen, Yoshua Bengio |
| 2018 | Interspeech | Reducing Interference with Phase Recovery in DNN-based Monaural Singing Voice Separation. | Paul Magron, Konstantinos Drossos, Stylianos Ioannis Mimilakis, Tuomas Virtanen |
| 2018 | Interspeech | Expectation-Maximization Algorithms for Itakura-Saito Nonnegative Matrix Factorization. | Paul Magron, Tuomas Virtanen |
| 2017 | ICASSP | Sound event detection using spatial features and convolutional recurrent neural network. | Sharath Adavanne, Pasi Pertil, Tuomas Virtanen |
| 2017 | ICASSP | Active learning for sound event classification by clustering unlabeled data. | Shuyang Zhao, Toni Heittola, Tuomas Virtanen |
| 2017 | IJCNN | A convolutional neural network approach for acoustic scene classification. | Michele Valenti, Stefano Squartini, Aleksandr Diment, Giambattista Parascandolo, Tuomas Virtanen |
| 2016 | ICASSP | Recurrent neural networks for polyphonic sound event detection in real life recordings. | Giambattista Parascandolo, Heikki Huttunen, Tuomas Virtanen |
| 2016 | IJCNN | Filterbank learning for deep neural network based polyphonic sound event detection. | Emre Cakir, Ezgi Can Ozan, Tuomas Virtanen |
| 2015 | ICASSP | Exemplar-based speech enhancement for deep neural network based automatic speech recognition. | Deepak Baby, Jort F. Gemmeke, Tuomas Virtanen, Hugo Van hamme |
| 2015 | ICASSP | Low-latency sound-source-separation using non-negative matrix factorisation with coupled analysis and synthesis dictionaries. | Tom Barker, Tuomas Virtanen, Niels Henrik Pontoppidan |
| 2015 | ICASSP | Similarity induced group sparsity for non-negative matrix factorisation. | Antti Hurmalainen, Rahim Saeidi, Tuomas Virtanen |
| 2015 | ICASSP | Sound event detection in real life recordings using coupled matrix factorization of spectral representations and class activity annotations. | Annamaria Mesaros, Toni Heittola, Onur Dikmen, Tuomas Virtanen |
| 2015 | IJCNN | Polyphonic sound event detection using multi label deep neural networks. | Emre Cakir, Toni Heittola, Heikki Huttunen, Tuomas Virtanen |
| 2015 | Interspeech | Noise robust speaker recognition with convolutive sparse coding. | Antti Hurmalainen, Rahim Saeidi, Tuomas Virtanen |
| 2014 | ACCV | Lifelog Scene Change Detection Using Cascades of Audio and Video Detectors. | Katariina Mahkonen, Joni-Kristian Kmrinen, Tuomas Virtanen |
| 2014 | ICASSP | Coupled dictionary training for exemplar-based speech enhancement. | Deepak Baby, Tuomas Virtanen, Tom Barker, Hugo Van hamme |
| 2014 | ICASSP | Ultrasound-coupled semi-supervised nonnegative matrix factorisation for speech enhancement. | Tom Barker, Tuomas Virtanen, Olivier Delhomme |
| 2014 | ICASSP | Multichannel audio separation by direction of arrival based spatial covariance model and non-negative matrix factorization. | Joonas Nikunen, Tuomas Virtanen |
| 2014 | ICASSP | Active-set newton algorithm for non-negative sparse coding of audio. | Tuomas Virtanen, Bhiksha Raj, Jort F. Gemmeke, Hugo Van hamme |
| 2014 | IJCNN | Semi-supervised non-negative tensor factorisation of modulation spectrograms for monaural speech separation. | Tom Barker, Tuomas Virtanen |
| 2014 | Interspeech | Modelling primitive streaming of simple tone sequences through factorisation of modulation pattern tensors. | Tom Barker, Hugo Van hamme, Tuomas Virtanen |
| 2013 | ASRU | Learning state labels for sparse classification of speech with matrix deconvolution. | Antti Hurmalainen, Tuomas Virtanen |
| 2013 | ICASSP | Exemplar-based joint channel and noise compensation. | Jort F. Gemmeke, Tuomas Virtanen, Kris Demuynck |
| 2013 | ICASSP | Supervised model training for overlapping sound events based on unsupervised source separation. | Toni Heittola, Annamaria Mesaros, Tuomas Virtanen, Moncef Gabbouj |
| 2013 | Interspeech | Non-negative tensor factorisation of modulation spectrograms for monaural sound source separation. | Tom Barker, Tuomas Virtanen |
| 2013 | Interspeech | Exemplar-based unit selection for voice conversion utilizing temporal information. | Zhizheng Wu, Tuomas Virtanen, Tomi Kinnunen, Engsiong Chng, Haizhou Li |
| 2012 | ICASSP | Modelling spectro-temporal dynamics in factorisation-based noise-robust automatic speech recognition. | Antti Hurmalainen, Tuomas Virtanen |
| 2012 | ICASSP | Non-negative matrix factorization for highly noise-robust ASR: To enhance or to recognize? | Felix Weninger, Martin Wllmer, Jrgen T. Geiger, Bjrn W. Schuller, Jort F. Gemmeke, Antti Hurmalainen, Tuomas Virtanen, Gerhard Rigoll |
| 2012 | Interspeech | Group Sparsity for Speaker Identity Discrimination in Factorisation-based Speech Recognition. | Antti Hurmalainen, Rahim Saeidi, Tuomas Virtanen |
| 2012 | Interspeech | Human sound perception - what can we learn from it when developing audio analysis algorithms? | Tuomas Virtanen |
| 2011 | ICASSP | Non-negative matrix deconvolution in noise robust speech recognition. | Antti Hurmalainen, Jort F. Gemmeke, Tuomas Virtanen |
| 2011 | Interspeech | Uncertainty Measures for Improving Exemplar-Based Source Separation. | Heikki Kallasjoki, Ulpu Remes, Jort F. Gemmeke, Tuomas Virtanen, Kalle J. Palomki |
| 2011 | Interspeech | Mapping Sparse Representation to State Likelihoods in Noise-Robust Automatic Speech Recognition. | Katariina Mahkonen, Antti Hurmalainen, Tuomas Virtanen, Jort F. Gemmeke |
| 2011 | Interspeech | Phoneme-Dependent NMF for Speech Enhancement in Monaural Mixtures. | Bhiksha Raj, Rita Singh, Tuomas Virtanen |
| 2010 | ICASSP | Noise robust exemplar-based connected digit recognition. | Jort F. Gemmeke, Tuomas Virtanen |
| 2010 | ICASSP | Sound source separation in monaural music signals using excitation-filter model and em algorithm. | Anssi Klapuri, Tuomas Virtanen, Toni Heittola |
| 2010 | ICASSP | Recognition of phonemes and words in singing. | Annamaria Mesaros, Tuomas Virtanen |
| 2010 | ICASSP | Noise-to-mask ratio minimization by weighted non-negative matrix factorization. | Joonas Nikunen, Tuomas Virtanen |
| 2010 | Interspeech | Artificial and online acquired noise dictionaries for noise robust ASR. | Jort F. Gemmeke, Tuomas Virtanen |
| 2010 | Interspeech | Non-negative matrix factorization based compensation of music for automatic speech recognition. | Bhiksha Raj, Tuomas Virtanen, Sourish Chaudhuri, Rita Singh |
| 2010 | Interspeech | State-based labelling for a sparse representation of speech and its application to robust speech recognition. | Tuomas Virtanen, Jort F. Gemmeke, Antti Hurmalainen |
| 2009 | ICASSP | Interpolating hidden Markov model and its application to automatic instrument recognition. | Tuomas Virtanen, Toni Heittola |
| 2009 | IDA | Mixtures of Gamma Priors for Non-negative Matrix Factorization Based Speech Separation. | Tuomas Virtanen, Ali Taylan Cemgil |
| 2008 | ICASSP | Bayesian extensions to non-negative matrix factorisation for audio signal modelling. | Tuomas Virtanen, Ali Taylan Cemgil, Simon J. Godsill |
| 2008 | Interspeech | Combining pitch-based inference and non-negative spectrogram factorization in separating vocals from polyphonic music. | Tuomas Virtanen, Annamaria Mesaros, Matti Ryynnen |
| 2007 | ICASSP | Query by Example of Audio Signals using Euclidean Distance Between Gaussian Mixture Models. | Marko Leonard Heln, Tuomas Virtanen |
| 2006 | Interspeech | Speech recognition using factorial hidden Markov models for separation in the feature space. | Tuomas Virtanen |
| 2004 | Interspeech | Separation of sound sources by convolutive sparse coding. | Tuomas Virtanen |
| 2002 | ICASSP | Separation of harmonic sounds using linear models for the overtone series. | Tuomas Virtanen, Anssi Klapuri |
| 2000 | ICASSP | Separation of harmonic sound sources using sinusoidal modeling. | Tuomas Virtanen, Anssi Klapuri |