| 2019 | Neural Machine Translation with Acoustic Embedding. | Takatomo Kano, Sakriani Sakti, Satoshi Nakamura |
| 2019 | Simultaneous Speech Recognition and Speaker Diarization for Monaural Dialogue Recordings with Target-Speaker Acoustic Models. | Naoyuki Kanda, Shota Horiguchi, Yusuke Fujita, Yawen Xue, Kenji Nagamatsu, Shinji Watanabe |
| 2019 | Additional Shared Decoder on Siamese Multi-View Encoders for Learning Acoustic Word Embeddings. | Myunghun Jung, Hyungjun Lim, Jahyun Goo, Youngmoon Jung, Hoirin Kim |
| 2019 | Short Utterance Compensation in Speaker Verification via Cosine-Based Teacher-Student Learning of Speaker Embeddings. | Jee-Weon Jung, Hee-Soo Heo, Hye-Jin Shim, Ha-Jin Yu |
| 2019 | Self-Adaptive Soft Voice Activity Detection Using Deep Neural Networks for Robust Speaker Verification. | Youngmoon Jung, Yeunju Choi, Hoirin Kim |
| 2019 | Spatio-Temporal Context Modelling for Speech Emotion Classification. | Md Asif Jalal, Roger K. Moore, Thomas Hain |
| 2019 | Analyzing Large Receptive Field Convolutional Networks for Distant Speech Recognition. | Salar Jafarlou, Soheil Khorram, Vinay Kothapally, John H. L. Hansen |
| 2019 | Training Language Models for Long-Span Cross-Sentence Evaluation. | Kazuki Irie, Albert Zeyer, Ralf Schlter, Hermann Ney |
| 2019 | Multilingual End-to-End Speech Translation. | Hirofumi Inaguma, Kevin Duh, Tatsuya Kawahara, Shinji Watanabe |
| 2019 | Semi-Supervised Training and Data Augmentation for Adaptation of Automatic Broadcast News Captioning Systems. | Yinghui Huang, Samuel Thomas, Masayuki Suzuki, Zoltn Tske, Larry Sansone, Michael Picheny |
| 2019 | Exploring Model Units and Training Strategies for End-to-End Speech Recognition. | Mingkun Huang, Yizhou Lu, Lan Wang, Yanmin Qian, Kai Yu |
| 2019 | Adapting Pretrained Transformer to Lattices for Spoken Language Understanding. | Chao-Wei Huang, Yun-Nung Chen |
| 2019 | Exploring Effective Data Augmentation with TDNN-LSTM Neural Network Embedding for Speaker Recognition. | Chien-Lin Huang |
| 2019 | Towards Controlling False Alarm - Miss Trade-Off in Perceptual Speaker Comparison via Non-Neutral Listening Task Framing. | Rosa Gonzlez Hautamki, Tomi H. Kinnunen |
| 2019 | State-of-the-Art Speech Recognition Using Multi-Stream Self-Attention with Dilated 1D Convolutions. | Kyu Jeong Han, Ramon Prieto, Tao Ma |
| 2019 | Domain Expansion in DNN-Based Acoustic Models for Robust Speech Recognition. | Shahram Ghorbani, Soheil Khorram, John H. L. Hansen |
| 2019 | Improved Multi-Stage Training of Online Attention-Based Encoder-Decoder Models. | Abhinav Garg, Dhananjaya Gowda, Ankur Kumar, Kwangyoun Kim, Mehul Kumar, Chanwoo Kim |
| 2019 | One-to-Many Multilingual End-to-End Speech Translation. | Mattia Antonino Di Gangi, Matteo Negri, Marco Turchi |
| 2019 | A Dropout-Based Single Model Committee Approach for Active Learning in ASR. | Jiayi Fu, Kuang Ru |
| 2019 | Mixed Bandwidth Acoustic Modeling Leveraging Knowledge Distillation. | Takashi Fukuda, Samuel Thomas |
| 2019 | End-to-End Neural Speaker Diarization with Self-Attention. | Yusuke Fujita, Naoyuki Kanda, Shota Horiguchi, Yawen Xue, Kenji Nagamatsu, Shinji Watanabe |
| 2019 | Speaker-Aware Speech-Transformer. | Zhiyun Fan, Jie Li, Shiyu Zhou, Bo Xu |
| 2019 | Acoustic Model Adaptation from Raw Waveforms with Sincnet. | Joachim Fainberg, Ondrej Klejch, Erfan Loweimi, Peter Bell, Steve Renals |
| 2019 | Listening While Speaking and Visualizing: Improving ASR Through Multimodal Chain. | Johanes Effendi, Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2019 | WaveNet Factorization with Singular Value Decomposition for Voice Conversion. | Hongqiang Du, Xiaohai Tian, Lei Xie, Haizhou Li |