| 2026 | EACL | Automatic Generation of a Compositional QA Benchmark for Geospatial Reasoning under Spatial and Entity Constraints. | Tetsuhisa Suizu, Shohei Higashiyama, Hiroyuki Shindo, Hiroki Ouchi, Sakriani Sakti |
| 2025 | ASRU | Learning Marmoset Vocal Patterns with a Masked Autoencoder for Robust Call Segmentation, Classification, and Caller Identification. | Bin Wu, Shinnosuke Takamichi, Sakriani Sakti, Satoshi Nakamura |
| 2025 | COLING | Indonesian Speech Content De-Identification in Low Resource Transcripts. | Rifqi Naufal Abdjul, Dessi Puji Lestari, Ayu Purwarianti, Candy Olivia Mawalim, Sakriani Sakti, Masashi Unoki |
| 2025 | HAI | Exploring the Relationship Between Ostracism and Communication Apprehension in Human-Robot Interaction. | Faisal Mehmood, Sakriani Sakti |
| 2025 | HSI | Role of Social Treatment and Mode of Communication in Shaping Social Acceptance. | Faisal Mehmood, Sakriani Sakti |
| 2025 | ICASSP | Enhancing Unsupervised Acoustic Word Embedding with Visual-Grounded Speech Model and Novel Word-level ABX Evaluation Schemes. | Mau Nguyen, Shinobu Hasegawa, Sakriani Sakti |
| 2025 | ICASSP | Toward Visual Pronunciation Learning: A Speech-to-Articulatory Animation Pipeline Leveraging wav2vec 2.0 and rtMRI Landmarks. | Mushaffa Rasyid Ridha, Shinobu Hasegawa, Sakriani Sakti |
| 2025 | ICASSP | From Pixels to Voice: A Simple and Efficient End-to-End Spoken Image Description Approach via Vision Codec Language Models. | Chung Tran, Sakriani Sakti |
| 2025 | Interspeech | SepVAC: Multitask Learning of Speaker Separation, Speaker Localization, Microphone Array Localization, and Room Acoustic Parameter Estimation in Various Acoustic Conditions. | Roland Hartanto, Sakriani Sakti, Koichi Shinoda |
| 2025 | Interspeech | SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition. | Yuta Hirano, Sakriani Sakti |
| 2024 | COLING | Refining rtMRI Landmark-Based Vocal Tract Contour Labels with FCN-Based Smoothing and Point-to-Curve Projection. | Mushaffa Rasyid Ridha, Sakriani Sakti |
| 2024 | Interspeech | MSDET: Multitask Speaker Separation and Direction-of-Arrival Estimation Training. | Roland Hartanto, Sakriani Sakti, Koichi Shinoda |
| 2024 | Interspeech | Contrastive Feedback Mechanism for Simultaneous Speech Translation. | Haotian Tan, Sakriani Sakti |
| 2023 | ACL | NusaCrowd: Open Source Initiative for Indonesian NLP Resources. | Samuel Cahyawijaya, Holy Lovenia, Alham Fikri Aji, Genta Indra Winata, Bryan Wilie, Fajri Koto, Rahmad Mahendra, Christian Wibisono, Ade Romadhony, Karissa Vincentio, Jennifer Santoso, David Moeljadi, Cahya Wirawan, Frederikus Hudi, Muhammad Satrio Wicaksono, Ivan Halim Parmonangan, Ika Alfina, Ilham Firdausi Putra, Samsul Rahmadani, Yulianti Oenang, Ali Akbar Septiandri, James Jaya, Kaustubh D. Dhole, Arie Ardiyanti Suryani, Rifki Afina Putri, Dan Su, Keith Stevens, Made Nindyatama Nityasya, Muhammad Farid Adilazuarda, Ryan Hadiwijaya, Ryandito Diandaru, Tiezheng Yu, Vito Ghifari, Wenliang Dai, Yan Xu, Dyah Damapuspita, Haryo Akbarianto Wibowo, Cuk Tho, Ichwanul Muslim Karo Karo, Tirana Fatyanosa, Ziwei Ji, Graham Neubig, Timothy Baldwin, Sebastian Ruder, Pascale Fung, Herry Sujaini, Sakriani Sakti, Ayu Purwarianti |
| 2023 | ASRU | Leveraging the Multilingual Indonesian Ethnic Languages Dataset In Self-Supervised Models for Low-Resource ASR Task. | Sakriani Sakti, Benita Angela Titalim |
| 2023 | EMNLP | Speech Recognition and Meaning Interpretation: Towards Disambiguation of Structurally Ambiguous Spoken Utterances in Indonesian. | Ruhiyah Widiaputri, Ayu Purwarianti, Dessi Puji Lestari, Kurniawati Azizah, Dipta Tanaya, Sakriani Sakti |
| 2023 | ICASSP | An Isotropy Analysis for Self-Supervised Acoustic Unit Embeddings on the Zero Resource Speech Challenge 2021 Framework. | Jianan Chen, Sakriani Sakti |
| 2023 | ICASSP | Self-Adaptive Incremental Machine Speech Chain for Lombard TTS with High-Granularity ASR Feedback in Dynamic Noise Condition. | Sashi Novitasari, Sakriani Sakti, Satoshi Nakamura |
| 2023 | Interspeech | Unsupervised Learning of Discrete Latent Representations with Data-Adaptive Dimensionality from Continuous Speech Streams. | Shun Takahashi, Sakriani Sakti |
| 2023 | Interspeech | STEN-TTS: Improving Zero-shot Cross-Lingual Transfer for Multi-Lingual TTS with Style-Enhanced Normalization Diffusion Framework. | Chung Tran, Chi Mai Luong, Sakriani Sakti |
| 2022 | Interspeech | Improved Consistency Training for Semi-Supervised Sequence-to-Sequence ASR via Speech Chain Reconstruction and Self-Transcribing. | Heli Qi, Sashi Novitasari, Sakriani Sakti, Satoshi Nakamura |
| 2021 | Interspeech | Weakly-Supervised Speech-to-Text Mapping with Visually Connected Non-Parallel Speech-Text Data Using Cyclic Partially-Aligned Transformer. | Johanes Effendi, Sakriani Sakti, Satoshi Nakamura |
| 2021 | Interspeech | ASR Posterior-Based Loss for Multi-Task End-to-End Speech Translation. | Yuka Ko, Katsuhito Sudoh, Sakriani Sakti, Satoshi Nakamura |
| 2021 | Interspeech | Dynamically Adaptive Machine Speech Chain Inference for TTS in Noisy Environment: Listen and Speak Louder. | Sashi Novitasari, Sakriani Sakti, Satoshi Nakamura |
| 2021 | Interspeech | Unsupervised Neural-Based Graph Clustering for Variable-Length Speech Representation Discovery of Zero-Resource Languages. | Shun Takahashi, Sakriani Sakti, Satoshi Nakamura |
| 2021 | Interspeech | Transcribing Paralinguistic Acoustic Cues to Target Language Text in Transformer-Based Speech-to-Text Translation. | Hirotaka Tokuyama, Sakriani Sakti, Katsuhito Sudoh, Satoshi Nakamura |
| 2020 | ICASSP | Using Panoramic Videos for Multi-Person Localization and Tracking In A 3D Panoramic Coordinate. | Fan Yang, Feiran Li, Yang Wu, Sakriani Sakti, Satoshi Nakamura |
| 2020 | Interspeech | The Zero Resource Speech Challenge 2020: Discovering Discrete Subword and Word Units. | Ewan Dunbar, Julien Karadayi, Mathieu Bernard, Xuan-Nga Cao, Robin Algayres, Lucas Ondel, Laurent Besacier, Sakriani Sakti, Emmanuel Dupoux |
| 2020 | Interspeech | Augmenting Images for ASR and TTS Through Single-Loop and Dual-Loop Multimodal Chain Framework. | Johanes Effendi, Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2020 | Interspeech | Incremental Machine Speech Chain Towards Enabling Listening While Speaking in Real-Time. | Sashi Novitasari, Andros Tjandra, Tomoya Yanagita, Sakriani Sakti, Satoshi Nakamura |
| 2020 | Interspeech | Combining Audio and Brain Activity for Predicting Speech Quality. | Ivan Halim Parmonangan, Hiroki Tanaka, Sakriani Sakti, Satoshi Nakamura |
| 2020 | Interspeech | Transformer VQ-VAE for Unsupervised Unit Discovery and Speech Synthesis: ZeroSpeech 2020 Challenge. | Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2020 | Interspeech | Neural Speech Completion. | Kazuki Tsunematsu, Johanes Effendi, Sakriani Sakti, Satoshi Nakamura |
| 2020 | LREC | Emotional Speech Corpus for Persuasive Dialogue System. | Sara Asai, Koichiro Yoshino, Seitaro Shinagawa, Sakriani Sakti, Satoshi Nakamura |
| 2019 | ASRU | Listening While Speaking and Visualizing: Improving ASR Through Multimodal Chain. | Johanes Effendi, Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2019 | ASRU | Neural Machine Translation with Acoustic Embedding. | Takatomo Kano, Sakriani Sakti, Satoshi Nakamura |
| 2019 | ASRU | Zero-Shot Code-Switching ASR and TTS with Multilingual Machine Speech Chain. | Sahoko Nakayama, Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2019 | ASRU | Speech-to-Speech Translation Between Untranscribed Unknown Languages. | Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2019 | ICASSP | Speech Artifact Removal from Eeg Recordings of Spoken Word Production with Tensor Decomposition. | Holy Lovenia, Hiroki Tanaka, Sakriani Sakti, Ayu Purwarianti, Satoshi Nakamura |
| 2019 | ICASSP | End-to-end Feedback Loss in Speech Chain Framework via Straight-through Estimator. | Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2019 | ICASSP | Cross-lingual Speech-based Tobi Label Generation Using Bidirectional Lstm. | Marco Vetter, Sakriani Sakti, Satoshi Nakamura |
| 2019 | Interspeech | The Zero Resource Speech Challenge 2019: TTS Without T. | Ewan Dunbar, Robin Algayres, Julien Karadayi, Mathieu Bernard, Juan Benjumea, Xuan-Nga Cao, Lucie Miskic, Charlotte Dugrain, Lucas Ondel, Alan W. Black, Laurent Besacier, Sakriani Sakti, Emmanuel Dupoux |
| 2019 | Interspeech | Sequence-to-Sequence Learning via Attention Transfer for Incremental Speech Recognition. | Sashi Novitasari, Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2019 | Interspeech | Speech Quality Evaluation of Synthesized Japanese Speech Using EEG. | Ivan Halim Parmonangan, Hiroki Tanaka, Sakriani Sakti, Shinnosuke Takamichi, Satoshi Nakamura |
| 2019 | Interspeech | VQVAE Unsupervised Unit Discovery and Multi-Scale Code2Spec Inverter for Zerospeech Challenge 2019. | Andros Tjandra, Berrak Sisman, Mingyang Zhang, Sakriani Sakti, Haizhou Li, Satoshi Nakamura |
| 2018 | AAAI | Eliciting Positive Emotion through Affect-Sensitive Dialogue Response Generation: A Neural Network Approach. | Nurul Lubis, Sakriani Sakti, Koichiro Yoshino, Satoshi Nakamura |
| 2018 | ICASSP | Graph Regularized Tensor Factorization for Single-Trial EEG Analysis. | Hayato Maki, Hiroki Tanaka, Sakriani Sakti, Satoshi Nakamura |
| 2018 | ICASSP | Sequence-to-Sequence Asr Optimization Via Reinforcement Learning. | Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2018 | IJCNN | Tensor Decomposition for Compressing Recurrent Neural Network. | Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2018 | Interspeech | Compressing End-to-end ASR Networks by Tensor-Train Decomposition. | Takuma Mori, Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2018 | Interspeech | Machine Speech Chain with One-shot Speaker Adaptation. | Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2018 | Interspeech | Incremental TTS for Japanese Language. | Tomoya Yanagita, Sakriani Sakti, Satoshi Nakamura |
| 2018 | LREC | Construction of English-French Multimodal Affective Conversational Corpus from TV Dramas. | Sashi Novitasari, Quoc Truong Do, Sakriani Sakti, Dessi Puji Lestari, Satoshi Nakamura |
| 2018 | LREC | Dialogue Scenario Collection of Persuasive Dialogue with Emotional Expressions via Crowdsourcing. | Koichiro Yoshino, Yoko Ishikawa, Masahiro Mizukami, Yu Suzuki, Sakriani Sakti, Satoshi Nakamura |
| 2018 | SIGdial | Unsupervised Counselor Dialogue Clustering for Positive Emotion Elicitation in Neural Dialogue System. | Nurul Lubis, Sakriani Sakti, Koichiro Yoshino, Satoshi Nakamura |
| 2017 | ACII | Processing negative emotions through social communication: Multimodal database construction and analysis. | Nurul Lubis, Michael Heck, Sakriani Sakti, Koichiro Yoshino, Satoshi Nakamura |
| 2017 | ASRU | Feature optimized DPGMM clustering for unsupervised subword modeling: A contribution to zerospeech 2017. | Michael Heck, Sakriani Sakti, Satoshi Nakamura |
| 2017 | ASRU | Listening while speaking: Speech chain by deep learning. | Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2017 | ASRU | Attention-based Wav2Text with feature transfer learning. | Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2017 | ICMI | Tracking liking state in brain activity while watching multiple movies. | Naoto Terasawa, Hiroki Tanaka, Sakriani Sakti, Satoshi Nakamura |
| 2017 | IJCNLP | Local Monotonic Attention Mechanism for End-to-End Speech And Language Processing. | Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2017 | IJCNN | Compressing recurrent neural network with tensor train. | Andros Tjandra, Sakriani Sakti, Satoshi Nakamura |
| 2017 | Interspeech | Toward Expressive Speech Translation: A Unified Sequence-to-Sequence LSTMs Approach for Translating Words and Emphasis. | Quoc Truong Do, Sakriani Sakti, Satoshi Nakamura |
| 2017 | Interspeech | Structured-Based Curriculum Learning for End-to-End English-Japanese Speech Translation. | Takatomo Kano, Sakriani Sakti, Satoshi Nakamura |
| 2017 | Interspeech | Subject-Independent Classification of Japanese Spoken Sentences by Multiple Frequency Bands Phase Pattern of EEG Response During Speech Perception. | Hiroki Watanabe, Hiroki Tanaka, Sakriani Sakti, Satoshi Nakamura |
| 2016 | ICMI | Personalized unknown word detection in non-native language reading using eye gaze. | Rui Hiraoka, Hiroki Tanaka, Sakriani Sakti, Graham Neubig, Satoshi Nakamura |
| 2016 | IJCNN | Gated Recurrent Neural Tensor Network. | Andros Tjandra, Sakriani Sakti, Ruli Manurung, Mirna Adriani, Satoshi Nakamura |
| 2016 | Interspeech | Transferring Emphasis in Speech Translation Using Hard-Attentional Neural Network Models. | Quoc Truong Do, Sakriani Sakti, Graham Neubig, Satoshi Nakamura |
| 2016 | Interspeech | A Hybrid System for Continuous Word-Level Emphasis Modeling Based on HMM State Clustering and Adaptive Training. | Quoc Truong Do, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2016 | Interspeech | Supervised Learning of Acoustic Models in a Zero Resource Setting to Improve DPGMM Clustering. | Michael Heck, Sakriani Sakti, Satoshi Nakamura |
| 2016 | Interspeech | Unsupervised Joint Estimation of Grapheme-to-Phoneme Conversion Systems and Acoustic Model Adaptation for Non-Native Speech Recognition. | Satoshi Tsujioka, Sakriani Sakti, Koichiro Yoshino, Graham Neubig, Satoshi Nakamura |
| 2016 | LREC | Construction of Japanese Audio-Visual Emotion Database and Its Application in Emotion Recognition. | Nurul Lubis, Randy Gomez, Sakriani Sakti, Keisuke Nakamura, Koichiro Yoshino, Satoshi Nakamura, Kazuhiro Nakadai |
| 2015 | ACL | Improving Pivot Translation by Remembering the Pivot. | Akiva Miura, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2015 | ACL | Syntax-based Simultaneous Translation through Prediction of Unseen Syntactic Constituents. | Yusuke Oda, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2015 | ASRU | The NAIST ASR system for the 2015 Multi-Genre Broadcast challenge: On combination of deep learning systems using a rank-score function. | Quoc Truong Do, Michael Heck, Sakriani Sakti, Graham Neubig, Tomoki Toda, Satoshi Nakamura |
| 2015 | ASRU | A study of social-affective communication: Automatic prediction of emotion triggers and responses in television talk shows. | Nurul Lubis, Sakriani Sakti, Graham Neubig, Koichiro Yoshino, Tomoki Toda, Satoshi Nakamura |
| 2015 | ASRU | Adaptive selection from multiple response candidates in example-based dialogue. | Masahiro Mizukami, Hideaki Kizuki, Toshio Nomura, Graham Neubig, Koichiro Yoshino, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2015 | ASRU | Incremental sentence compression using LSTM recurrent networks. | Sakriani Sakti, Faiz Ilham, Graham Neubig, Tomoki Toda, Ayu Purwarianti, Satoshi Nakamura |
| 2015 | ASRU | Stochastic Gradient Variational Bayes for deep learning-based ASR. | Andros Tjandra, Sakriani Sakti, Satoshi Nakamura, Mirna Adriani |
| 2015 | ASSETS | An Enhanced Electrolarynx with Automatic Fundamental Frequency Control based on Statistical Prediction. | Kou Tanaka, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2015 | ICASSP | EEG signal enhancement using multi-channel wiener filter with a spatial correlation prior. | Hayato Maki, Tomoki Toda, Sakriani Sakti, Graham Neubig, Satoshi Nakamura |
| 2015 | ICASSP | Combination of two-dimensional cochleogram and spectrogram features for deep learning-based ASR. | Andros Tjandra, Sakriani Sakti, Graham Neubig, Tomoki Toda, Mirna Adriani, Satoshi Nakamura |
| 2015 | Interspeech | Preserving word-level emphasis in speech-to-speech translation using linear regression HSMMs. | Quoc Truong Do, Shinnosuke Takamichi, Sakriani Sakti, Graham Neubig, Tomoki Toda, Satoshi Nakamura |
| 2015 | Interspeech | Statistical singing voice conversion based on direct waveform modification with global variance. | Kazuhiro Kobayashi, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2015 | Interspeech | Speed or accuracy? a study in evaluation of simultaneous speech translation. | Takashi Mieno, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2015 | Interspeech | A latent variable model for joint pause prediction and dependency parsing. | The Tung Nguyen, Graham Neubig, Hiroyuki Shindo, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2015 | Interspeech | Non-native speech synthesis preserving speaker individuality based on partial correction of prosodic and phonetic characteristics. | Yuji Oshima, Shinnosuke Takamichi, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2015 | Interspeech | Non-audible murmur enhancement based on statistical conversion using air- and body-conductive microphones in noisy environments. | Yusuke Tajiri, Kou Tanaka, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2015 | Interspeech | Articulatory controllable speech modification based on Gaussian mixture models with direct waveform modification using spectrum differential. | Patrick Lumban Tobing, Kazuhiro Kobayashi, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2015 | IUI | Automated Social Skills Trainer. | Hiroki Tanaka, Sakriani Sakti, Graham Neubig, Tomoki Toda, Hideki Negoro, Hidemi Iwasaka, Satoshi Nakamura |
| 2015 | NAACL | Ckylark: A More Robust PCFG-LA Parser. | Yusuke Oda, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2015 | SP | Evaluation of a Fully Automatic Cooperative Persuasive Dialogue System. | Takuya Hiraoka, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2015 | SP | A Study on Natural Expressive Speech: Automatic Memorable Spoken Quote Detection. | Fajri Koto, Sakriani Sakti, Graham Neubig, Tomoki Toda, Mirna Adriani, Satoshi Nakamura |
| 2015 | SP | Linguistic Individuality Transformation for Spoken Language. | Masahiro Mizukami, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2015 | SP | Unknown Word Detection Based on Event-Related Brain Desynchronization Responses. | Takafumi Sasakura, Sakriani Sakti, Graham Neubig, Tomoki Toda, Satoshi Nakamura |
| 2015 | SP | An Analysis Towards Dialogue-Based Deception Detection. | Yuiko Tsunomori, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2014 | ACL | Optimizing Segmentation Strategies for Simultaneous Speech Translation. | Yusuke Oda, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2014 | COLING | Discriminative Language Models as a Tool for Machine Translation Error Analysis. | Koichi Akabe, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2014 | COLING | Reinforcement Learning of Cooperative Persuasive Dialogue Policies using Framing. | Takuya Hiraoka, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2014 | EACL | Acquiring a Dictionary of Emotion-Provoking Events. | Hoa Trong Vu, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2014 | ICASSP | Regression approaches to perceptual age control in singing voice conversion. | Kazuhiro Kobayashi, Tomoki Toda, Tomoyasu Nakano, Masataka Goto, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2014 | ICASSP | Narrow Adaptive Regularization of weights for grapheme-to-phoneme conversion. | Keigo Kubo, Sakriani Sakti, Graham Neubig, Tomoki Toda, Satoshi Nakamura |
| 2014 | ICASSP | A postfilter to modify the modulation spectrum in HMM-based speech synthesis. | Shinnosuke Takamichi, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2014 | ICASSP | An evaluation of excitation feature prediction in a hybrid approach to electrolaryngeal speech enhancement. | Kou Tanaka, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2014 | Interspeech | A hearing impairment simulation method using audiogram-based approximation of auditory charatecteristics. | Nozomi Jinbo, Shinnosuke Takamichi, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2014 | Interspeech | Statistical singing voice conversion with direct waveform modification based on the spectrum differential. | Kazuhiro Kobayashi, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2014 | Interspeech | Structured soft margin confidence weighted learning for grapheme-to-phoneme conversion. | Keigo Kubo, Sakriani Sakti, Graham Neubig, Tomoki Toda, Satoshi Nakamura |
| 2014 | Interspeech | Data-driven generation of text balloons based on linguistic and acoustic features of a comics-anime corpus. | Sho Matsumiya, Sakriani Sakti, Graham Neubig, Tomoki Toda, Satoshi Nakamura |
| 2014 | Interspeech | Direct F | Kou Tanaka, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2014 | Interspeech | Articulatory controllable speech modification based on statistical feature mapping with Gaussian mixture models. | Patrick Lumban Tobing, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura, Ayu Purwarianti |
| 2014 | LREC | Towards Multilingual Conversations in the Medical Domain: Development of Multilingual Medical Data and A Network-based ASR System. | Sakriani Sakti, Keigo Kubo, Sho Matsumiya, Graham Neubig, Tomoki Toda, Satoshi Nakamura, Fumihiro Adachi, Ryosuke Isotani |
| 2014 | LREC | Collection of a Simultaneous Translation Corpus for Comparative Analysis. | Hiroaki Shimizu, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2013 | ACL | Towards High-Reliability Speech Translation in the Medical Domain. | Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura, Yuji Matsumoto, Ryosuke Isotani, Yukichi Ikeda |
| 2013 | ASRU | Dialogue management for leading the conversation in persuasive dialogue systems. | Takuya Hiraoka, Yuki Yamauchi, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2013 | Interspeech | Simple, lexicalized choice of translation timing for simultaneous speech translation. | Tomoki Fujita, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2013 | Interspeech | Generalizing continuous-space translation of paralinguistic information. | Takatomo Kano, Shinnosuke Takamichi, Sakriani Sakti, Graham Neubig, Tomoki Toda, Satoshi Nakamura |
| 2013 | Interspeech | An investigation of acoustic features for singing voice conversion based on perceptual age. | Kazuhiro Kobayashi, Hironori Doi, Tomoki Toda, Tomoyasu Nakano, Masataka Goto, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2013 | Interspeech | Grapheme-to-phoneme conversion based on adaptive regularization of weight vectors. | Keigo Kubo, Sakriani Sakti, Graham Neubig, Tomoki Toda, Satoshi Nakamura |
| 2013 | Interspeech | A digital signal processor implementation of silent/electrolaryngeal speech enhancement based on real-time statistical voice conversion. | Takuto Moriguchi, Tomoki Toda, Motoaki Sano, Hiroshi Sato, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2013 | Interspeech | An empirical comparison of joint optimization techniques for speech translation. | Masaya Ohgushi, Graham Neubig, Sakriani Sakti, Tomoki Toda, Satoshi Nakamura |
| 2013 | Interspeech | Improvements to HMM-based speech synthesis based on parameter generation with rich context models. | Shinnosuke Takamichi, Tomoki Toda, Yoshinori Shiga, Sakriani Sakti, Graham Neubig, Satoshi Nakamura |
| 2013 | Interspeech | A hybrid approach to electrolaryngeal speech enhancement based on spectral subtraction and statistical voice conversion. | Kou Tanaka, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2012 | Interspeech | An Evaluation of Parameter Generation Methods with Rich Context Models in HMM-Based Speech Synthesis. | Shinnosuke Takamichi, Tomoki Toda, Yoshinori Shiga, Hisashi Kawai, Sakriani Sakti, Satoshi Nakamura |
| 2011 | ASRU | Blind noise suppression for Non-Audible Murmur recognition with stereo signal processing. | Shunta Ishii, Tomoki Toda, Hiroshi Saruwatari, Sakriani Sakti, Satoshi Nakamura |
| 2011 | ICASSP | Unsupervised determination of efficient Korean LVCSR units using a Bayesian Dirichlet process model. | Sakriani Sakti, Andrew M. Finch, Ryosuke Isotani, Hisashi Kawai, Satoshi Nakamura |
| 2010 | Interspeech | Brazilian portuguese acoustic model training based on data borrowing from other language. | Kazuhiko Abe, Sakriani Sakti, Ryosuke Isotani, Hisashi Kawai, Satoshi Nakamura |
| 2010 | Interspeech | Utilizing a noisy-channel approach for Korean LVCSR. | Sakriani Sakti, Ryosuke Isotani, Hisashi Kawai, Satoshi Nakamura |
| 2009 | ASRU | The Asian network-based speech-to-speech translation system. | Sakriani Sakti, Noriyuki Kimura, Michael Paul, Chiori Hori, Eiichiro Sumita, Satoshi Nakamura, Jun Park, Chai Wutiwiwatchai, Bo Xu, Hammam Riza, Karunesh Arora, Chi Mai Luong, Haizhou Li |
| 2008 | IJCNLP | Development of Indonesian Large Vocabulary Continuous Speech Recognition System within A-STAR Project. | Sakriani Sakti, Eka Kelana, Hammam Riza, Shinsuke Sakai, Konstantin Markov, Satoshi Nakamura |
| 2007 | Interspeech | An HMM acoustic model incorporating various additional knowledge sources. | Sakriani Sakti, Konstantin Markov, Satoshi Nakamura |
| 2006 | ICASSP | Incorporation of Pentaphone-Context Dependency Based on Hybrid Hmm/Bn Acoustic Modeling Framework. | Sakriani Sakti, Konstantin Markov, Satoshi Nakamura |
| 2006 | Interspeech | The use of Bayesian network for incorporating accent, gender and wide-context dependency information. | Sakriani Sakti, Konstantin Markov, Satoshi Nakamura |
| 2005 | Interspeech | Incorporating a Bayesian wide phonetic context model for acoustic rescoring. | Sakriani Sakti, Satoshi Nakamura, Konstantin Markov |
| 2004 | Interspeech | Indonesian speech recognition for hearing and speaking impaired people. | Sakriani Sakti, Arry Akhmad Arman, Satoshi Nakamura, Paulus Hutagaol |