| 2025 | Interspeech | Voice Impression Control in Zero-Shot TTS. | Kenichi Fujita, Shota Horiguchi, Yusuke Ijima |
| 2024 | ICASSP | What Do Self-Supervised Speech and Speaker Models Learn? New Findings from a Cross Model Layer-Wise Analysis. | Takanori Ashihara, Marc Delcroix, Takafumi Moriya, Kohei Matsuura, Taichi Asami, Yusuke Ijima |
| 2024 | ICASSP | Noise-Robust Zero-Shot Text-to-Speech Synthesis Conditioned on Self-Supervised Speech-Representation Model with Adapters. | Kenichi Fujita, Hiroshi Sato, Takanori Ashihara, Hiroki Kanagawa, Marc Delcroix, Takafumi Moriya, Yusuke Ijima |
| 2024 | ICASSP | STYLECAP: Automatic Speaking-Style Captioning from Speech Based on Speech and Language Self-Supervised Learning Models. | Kazuki Yamauchi, Yusuke Ijima, Yuki Saito |
| 2024 | Interspeech | Lightweight Zero-shot Text-to-Speech with Mixture of Adapters. | Kenichi Fujita, Takanori Ashihara, Marc Delcroix, Yusuke Ijima |
| 2024 | Interspeech | Knowledge Distillation from Self-Supervised Representation Learning Model with Discrete Speech Units for Any-to-Any Streaming Voice Conversion. | Hiroki Kanagawa, Yusuke Ijima |
| 2024 | Interspeech | Pre-training Neural Transducer-based Streaming Voice Conversion for Faster Convergence and Alignment-free Training. | Hiroki Kanagawa, Takafumi Moriya, Yusuke Ijima |
| 2023 | ICASSP | Zero-Shot Text-to-Speech Synthesis Conditioned Using Self-Supervised Speech Representation Model. | Kenichi Fujita, Takanori Ashihara, Hiroki Kanagawa, Takafumi Moriya, Yusuke Ijima |
| 2023 | ICASSP | Enhancement of Text-Predicting Style Token With Generative Adversarial Network for Expressive Speech Synthesis. | Hiroki Kanagawa, Yusuke Ijima |
| 2023 | Interspeech | SpeechGLUE: How Well Can Self-Supervised Speech Models Capture Linguistic Knowledge? | Takanori Ashihara, Takafumi Moriya, Kohei Matsuura, Tomohiro Tanaka, Yusuke Ijima, Taichi Asami, Marc Delcroix, Yukinori Honma |
| 2023 | Interspeech | VC-T: Streaming Voice Conversion Based on Neural Transducer. | Hiroki Kanagawa, Takafumi Moriya, Yusuke Ijima |
| 2023 | Interspeech | A stimulus-organism-response model of willingness to buy from advertising speech using voice quality. | Mizuki Nagano, Yusuke Ijima, Sadao Hiroya |
| 2023 | Interspeech | Influence of Personal Traits on Impressions of One's Own Voice. | Hikaru Yanagida, Yusuke Ijima, Naohiro Tawara |
| 2022 | ICASSP | Multi-Sample Subband Wavernn Via Multivariate Gaussian. | Hiroki Kanagawa, Yusuke Ijima |
| 2022 | Interspeech | Joint Modeling of Multi-Sample and Subband Signals for Fast Neural Vocoding on CPU. | Hiroki Kanagawa, Yusuke Ijima, Hiroyuki Toda |
| 2022 | Interspeech | Predicting VQVAE-based Character Acting Style from Quotation-Annotated Text for Audiobook Speech Synthesis. | Wataru Nakata, Tomoki Koriyama, Shinnosuke Takamichi, Yuki Saito, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2021 | ASRU | Robust Speech-Age Estimation Using Local Maximum Mean Discrepancy Under Mismatched Recording Conditions. | Naohiro Tawara, Atsunori Ogawa, Yuki Kitagishi, Hosana Kamiyama, Yusuke Ijima |
| 2021 | ICASSP | Speech Emotion Recognition Based on Listener Adaptive Models. | Atsushi Ando, Ryo Masumura, Hiroshi Sato, Takafumi Moriya, Takanori Ashihara, Yusuke Ijima, Tomoki Toda |
| 2021 | ICASSP | Simpleflat: A Simple Whole-Network Pre-Training Approach for RNN Transducer-Based End-to-End Speech Recognition. | Takafumi Moriya, Takanori Ashihara, Tomohiro Tanaka, Tsubasa Ochiai, Hiroshi Sato, Atsushi Ando, Yusuke Ijima, Ryo Masumura, Yusuke Shinohara |
| 2021 | Interspeech | Phoneme Duration Modeling Using Speech Rhythm-Based Speaker Embeddings for Multi-Speaker Speech Synthesis. | Kenichi Fujita, Atsushi Ando, Yusuke Ijima |
| 2021 | Interspeech | Phonetic and Prosodic Information Estimation from Texts for Genuine Japanese End-to-End Text-to-Speech. | Naoto Kakegawa, Sunao Hara, Masanobu Abe, Yusuke Ijima |
| 2021 | Interspeech | Impact of Emotional State on Estimation of Willingness to Buy from Advertising Speech. | Mizuki Nagano, Yusuke Ijima, Sadao Hiroya |
| 2020 | Interspeech | Lightweight LPCNet-Based Neural Vocoder with Tensor Decomposition. | Hiroki Kanagawa, Yusuke Ijima |
| 2020 | Interspeech | Investigating Effective Additional Contextual Factors in DNN-Based Spontaneous Speech Synthesis. | Yuki Yamashita, Tomoki Koriyama, Yuki Saito, Shinnosuke Takamichi, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2020 | LREC | DNN-based Speech Synthesis Using Abundant Tags of Spontaneous Speech Corpus. | Yuki Yamashita, Tomoki Koriyama, Yuki Saito, Shinnosuke Takamichi, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2019 | Interspeech | End-to-End Automatic Speech Recognition with a Reconstruction Criterion Using Speech-to-Text and Text-to-Speech Encoder-Decoders. | Ryo Masumura, Hiroshi Sato, Tomohiro Tanaka, Takafumi Moriya, Yusuke Ijima, Takanobu Oba |
| 2018 | ICASSP | Soft-Target Training with Ambiguous Emotional Utterances for DNN-Based Speech Emotion Classification. | Atsushi Ando, Satoshi Kobashikawa, Hosana Kamiyama, Ryo Masumura, Yusuke Ijima, Yushi Aono |
| 2018 | ICASSP | Neural Confnet Classification: Fully Neural Network Based Spoken Utterance Classification Using Word Confusion Networks. | Ryo Masumura, Yusuke Ijima, Taichi Asami, Hirokazu Masataki, Ryuichiro Higashinaka |
| 2018 | ICASSP | Non-Parallel Voice Conversion Using Variational Autoencoders Conditioned by Phonetic Posteriorgrams and D-Vectors. | Yuki Saito, Yusuke Ijima, Kyosuke Nishida, Shinnosuke Takamichi |
| 2017 | ICASSP | Generative adversarial network-based postfilter for statistical parametric speech synthesis. | Takuhiro Kaneko, Hirokazu Kameoka, Nobukatsu Hojo, Yusuke Ijima, Kaoru Hiramatsu, Kunio Kashino |
| 2017 | Interspeech | DNN-SPACE: DNN-HMM-Based Generative Model of Voice F | Nobukatsu Hojo, Yasuhito Ohsugi, Yusuke Ijima, Hirokazu Kameoka |
| 2017 | Interspeech | Prosody Aware Word-Level Encoder Based on BLSTM-RNNs for DNN-Based Speech Synthesis. | Yusuke Ijima, Nobukatsu Hojo, Ryo Masumura, Taichi Asami |
| 2016 | Interspeech | An Investigation of DNN-Based Speech Synthesis Using Speaker Codes. | Nobukatsu Hojo, Yusuke Ijima, Hideyuki Mizuno |
| 2016 | Interspeech | Objective Evaluation Using Association Between Dimensions Within Spectral Features for Statistical Parametric Speech Synthesis. | Yusuke Ijima, Taichi Asami, Hideyuki Mizuno |
| 2015 | Interspeech | Sub-band text-to-speech combining sample-based spectrum with statistically generated spectrum. | Tadashi Inai, Sunao Hara, Masanobu Abe, Yusuke Ijima, Noboru Miyazaki, Hideyuki Mizuno |
| 2013 | ICASSP | HMM-based expressive speech synthesis based on phrase-level F0 context labeling. | Yu Maeno, Takashi Nose, Takao Kobayashi, Tomoki Koriyama, Yusuke Ijima, Hideharu Nakajima, Hideyuki Mizuno, Osamu Yoshioka |
| 2012 | Interspeech | Similar Speaker Selection Technique Based on Distance Metric Learning with Perceptual Voice Quality Similarity. | Yusuke Ijima, Mitsuaki Isogai, Hideyuki Mizuno |
| 2011 | Interspeech | Correlation Analysis of Acoustic Features with Perceptual Voice Quality Similarity for Similar Speaker Selection. | Yusuke Ijima, Mitsuaki Isogai, Hideyuki Mizuno |
| 2011 | Interspeech | HMM-Based Emphatic Speech Synthesis Using Unsupervised Context Labeling. | Yu Maeno, Takashi Nose, Takao Kobayashi, Yusuke Ijima, Hideharu Nakajima, Hideyuki Mizuno, Osamu Yoshioka |
| 2009 | ICASSP | Emotional speech recognition based on style estimation and adaptation with multiple-regression HMM. | Yusuke Ijima, Makoto Tachibana, Takashi Nose, Takao Kobayashi |
| 2009 | Interspeech | Speaking style adaptation for spontaneous speech recognition using multiple-regression HMM. | Yusuke Ijima, Takeshi Matsubara, Takashi Nose, Takao Kobayashi |
| 2008 | Interspeech | An on-line adaptation technique for emotional speech recognition using style estimation with multiple-regression HMM. | Yusuke Ijima, Makoto Tachibana, Takashi Nose, Takao Kobayashi |