| 2026 | ICPR | Sign-to-Speech Prosody Transfer via Sign Reconstruction-Based GAN. | Toranosuke Manabe, Yuto Shibata, Shinnosuke Takamichi, Yoshimitsu Aoki |
| 2026 | LREC | Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches. | Anum Afzal, Yuki Saito, Hiroya Takamura, Katsuhito Sudoh, Shinnosuke Takamichi, Graham Neubig, Florian Matthes, Tatsuya Ishigaki |
| 2026 | LREC | J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling. | Wataru Nakata, Kentaro Seki, Hitomi Yanaka, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2025 | ASRU | Analysing the Language of Neural Audio Codecs. | Joonyong Park, Shinnosuke Takamichi, David M. Chan, Shunsuke Kando, Yuki Saito, Hiroshi Saruwatari |
| 2025 | ASRU | Learning Marmoset Vocal Patterns with a Masked Autoencoder for Robust Call Segmentation, Classification, and Caller Identification. | Bin Wu, Shinnosuke Takamichi, Sakriani Sakti, Satoshi Nakamura |
| 2025 | Interspeech | The Text-to-speech in the Wild (TITW) Database. | Jee-weon Jung, Wangyou Zhang, Soumi Maiti, Yihan Wu, Xin Wang, Ji-Hoon Kim, Yuta Matsunaga, Seyun Um, Jinchuan Tian, Hye-jin Shim, Nicholas W. D. Evans, Joon Son Chung, Shinnosuke Takamichi, Shinji Watanabe |
| 2025 | Interspeech | RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio. | Yusuke Kanamori, Yuki Okamoto, Taisei Takano, Shinnosuke Takamichi, Yuki Saito, Hiroshi Saruwatari |
| 2025 | Interspeech | Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models. | Shunsuke Kando, Yusuke Miyao, Shinnosuke Takamichi |
| 2025 | Interspeech | J-SPAW: Japanese speaker verification and spoofing attacks recorded in-the-wild dataset. | Sayaka Shiota, Suzuka Horie, Kouta Kanno, Shinnosuke Takamichi |
| 2025 | Interspeech | Voice Conversion for Likability Control via Automated Rating of Speech Synthesis Corpora. | Hitoshi Suda, Shinnosuke Takamichi, Satoru Fukayama |
| 2025 | PACLIC | Analysis of the Correlation Between Theory of Mind and Dialogue Ability to Identify Essential ToM for Dialogue Systems. | Haruhisa Iseno, Atsumoto Ohashi, Tetsuji Ogawa, Shinnosuke Takamichi, Ryuichiro Higashinaka |
| 2024 | EGVE | Character-Voice Embodiment Impacts on the Cognitive Task Performance with the Voice Ownership Illusion. | Yusuke Kunimi, Kentaro Kimura, Keigo Matsumoto, Shinnosuke Takamichi, Takuji Narumi, Masaaki Mochimaru |
| 2024 | ICASSP | Environmental Sound Synthesis from Vocal Imitations and Sound Event Labels. | Yuki Okamoto, Keisuke Imoto, Shinnosuke Takamichi, Ryotaro Nagase, Takahiro Fukumori, Yoichi Yamashita |
| 2024 | ICASSP | Diversity-Based Core-Set Selection for Text-to-Speech with Linguistic and Acoustic Features. | Kentaro Seki, Shinnosuke Takamichi, Takaaki Saeki, Hiroshi Saruwatari |
| 2024 | ICASSP | Do Learned Speech Symbols Follow Zipf's Law? | Shinnosuke Takamichi, Hiroki Maeda, Joonyong Park, Daisuke Saito, Hiroshi Saruwatari |
| 2024 | Interspeech | Noise-Robust Voice Conversion by Conditional Denoising Training Using Latent Variables of Recording Quality and Environment. | Takuto Igarashi, Yuki Saito, Kentaro Seki, Shinnosuke Takamichi, Ryuichi Yamamoto, Kentaro Tachibana, Hiroshi Saruwatari |
| 2024 | Interspeech | Textless Dependency Parsing by Labeled Sequence Prediction. | Shunsuke Kando, Yusuke Miyao, Jason Naradowsky, Shinnosuke Takamichi |
| 2024 | Interspeech | SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics. | Takaaki Saeki, Soumi Maiti, Shinnosuke Takamichi, Shinji Watanabe, Hiroshi Saruwatari |
| 2024 | Interspeech | SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark. | Yuki Saito, Takuto Igarashi, Kentaro Seki, Shinnosuke Takamichi, Ryuichi Yamamoto, Kentaro Tachibana, Hiroshi Saruwatari |
| 2024 | Interspeech | Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals. | Kentaro Seki, Shinnosuke Takamichi, Norihiro Takamune, Yuki Saito, Kanami Imamura, Hiroshi Saruwatari |
| 2024 | Interspeech | Who Finds This Voice Attractive? A Large-Scale Experiment Using In-the-Wild Data. | Hitoshi Suda, Aya Watanabe, Shinnosuke Takamichi |
| 2024 | Interspeech | SaSLaW: Dialogue Speech Corpus with Audio-visual Egocentric Information Toward Environment-adaptive Dialogue Speech Synthesis. | Osamu Take, Shinnosuke Takamichi, Kentaro Seki, Yoshiaki Bando, Hiroshi Saruwatari |
| 2023 | ASRU | Yodas: Youtube-Oriented Dataset for Audio and Speech. | Xinjian Li, Shinnosuke Takamichi, Takaaki Saeki, William Chen, Sayaka Shiota, Shinji Watanabe |
| 2023 | ASRU | COCO-NUT: Corpus of Japanese Utterance and Voice Characteristics Description for Prompt-Based Control. | Aya Watanabe, Shinnosuke Takamichi, Yuki Saito, Wataru Nakata, Detai Xin, Hiroshi Saruwatari |
| 2023 | ICASSP | jaCappella Corpus: A Japanese a Cappella Vocal Ensemble Corpus. | Tomohiko Nakamura, Shinnosuke Takamichi, Naoko Tanji, Satoru Fukayama, Hiroshi Saruwatari |
| 2023 | ICASSP | Visual Onoma-to-Wave: Environmental Sound Synthesis from Visual Onomatopoeias and Sound-Source Images. | Hien Ohnaka, Shinnosuke Takamichi, Keisuke Imoto, Yuki Okamoto, Kazuki Fujii, Hiroshi Saruwatari |
| 2023 | ICASSP | MID-Attribute Speaker Generation Using Optimal-Transport-Based Interpolation of Gaussian Mixture Models. | Aya Watanabe, Shinnosuke Takamichi, Yuki Saito, Detai Xin, Hiroshi Saruwatari |
| 2023 | ICASSP | Improving Speech Prosody of Audiobook Text-To-Speech Synthesis with Acoustic and Textual Contexts. | Detai Xin, Sharath Adavanne, Federico Ang, Ashish Kulkarni, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2023 | IJCAI | Learning to Speak from Text: Zero-Shot Multilingual Text-to-Speech with Unsupervised Text Pretraining. | Takaaki Saeki, Soumi Maiti, Xinjian Li, Shinji Watanabe, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2023 | Interspeech | How Generative Spoken Language Modeling Encodes Noisy Speech: Investigation from Phonetics to Syntactics. | Joonyong Park, Shinnosuke Takamichi, Tomohiko Nakamura, Kentaro Seki, Detai Xin, Hiroshi Saruwatari |
| 2023 | Interspeech | CALLS: Japanese Empathetic Dialogue Speech Corpus of Complaint Handling and Attentive Listening in Customer Center. | Yuki Saito, Eiji Iimori, Shinnosuke Takamichi, Kentaro Tachibana, Hiroshi Saruwatari |
| 2023 | Interspeech | ChatGPT-EDSS: Empathetic Dialogue Speech Synthesis Trained from ChatGPT-derived Context Word Embeddings. | Yuki Saito, Shinnosuke Takamichi, Eiji Iimori, Kentaro Tachibana, Hiroshi Saruwatari |
| 2023 | Interspeech | HumanDiffusion: diffusion model using perceptual gradients. | Yota Ueda, Shinnosuke Takamichi, Yuki Saito, Norihiro Takamune, Hiroshi Saruwatari |
| 2023 | Interspeech | Laughter Synthesis using Pseudo Phonetic Tokens with a Large-scale In-the-wild Laughter Corpus. | Detai Xin, Shinnosuke Takamichi, Ai Morimatsu, Hiroshi Saruwatari |
| 2023 | IUI | TimToShape: Supporting Practice of Musical Instruments by Visualizing Timbre with 2D Shapes based on Crossmodal Correspondences. | Kota Arai, Yutaro Hirao, Takuji Narumi, Tomohiko Nakamura, Shinnosuke Takamichi, Shigeo Yoshida |
| 2022 | Interspeech | Predicting VQVAE-based Character Acting Style from Quotation-Annotated Text for Audiobook Speech Synthesis. | Wataru Nakata, Tomoki Koriyama, Shinnosuke Takamichi, Yuki Saito, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2022 | Interspeech | Acoustic Modeling for End-to-End Empathetic Dialogue Speech Synthesis Using Linguistic and Prosodic Contexts of Dialogue History. | Yuto Nishimura, Yuki Saito, Shinnosuke Takamichi, Kentaro Tachibana, Hiroshi Saruwatari |
| 2022 | Interspeech | SelfRemaster: Self-Supervised Speech Restoration with Analysis-by-Synthesis Approach Using Channel Modeling. | Takaaki Saeki, Shinnosuke Takamichi, Tomohiko Nakamura, Naoko Tanji, Hiroshi Saruwatari |
| 2022 | Interspeech | UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022. | Takaaki Saeki, Detai Xin, Wataru Nakata, Tomoki Koriyama, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2022 | Interspeech | STUDIES: Corpus of Japanese Empathetic Dialogue Speech Towards Friendly Voice Agent. | Yuki Saito, Yuto Nishimura, Shinnosuke Takamichi, Kentaro Tachibana, Hiroshi Saruwatari |
| 2022 | Interspeech | J-MAC: Japanese multi-speaker audiobook corpus for speech synthesis. | Shinnosuke Takamichi, Wataru Nakata, Naoko Tanji, Hiroshi Saruwatari |
| 2022 | LREC | Personalized Filled-pause Generation with Group-wise Prediction Models. | Yuta Matsunaga, Takaaki Saeki, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2021 | ASRU | Low-Latency Incremental Text-to-Speech Synthesis with Distilled Context Prediction Network. | Takaaki Saeki, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2021 | HCI | Japanese EFL Learners' Speaking Practice Utilizing Text-to-Speech Technology Within a Team-Based Flipped Learning Framework. | Yasushige Ishikawa, Shinnosuke Takamichi, Takatoyo Umemoto, Masao Aikawa, Kishio Sakamoto, Kikuko Yui, Shigeo Fujiwara, Ayako Suto, Koichi Nishiyama |
| 2021 | ICASSP | Humanacgan: Conditional Generative Adversarial Network with Human-Based Auxiliary Classifier and its Evaluation in Phoneme Perception. | Yota Ueda, Kazuki Fujii, Yuki Saito, Shinnosuke Takamichi, Yukino Baba, Hiroshi Saruwatari |
| 2021 | ICASSP | Disentangled Speaker and Language Representations Using Mutual Information Minimization and Domain Adaptation for Cross-Lingual TTS. | Detai Xin, Tatsuya Komatsu, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2021 | ICMI | Digital Speech Makeup: Voice Conversion Based Altered Auditory Feedback for Transforming Self-Representation. | Riku Arakawa, Zendai Kashino, Shinnosuke Takamichi, Adrien Verhulst, Masahiko Inami |
| 2021 | Interspeech | Cross-Lingual Speaker Adaptation Using Domain Adaptation and Speaker Consistency Loss for Text-To-Speech Synthesis. | Detai Xin, Yuki Saito, Shinnosuke Takamichi, Tomoki Koriyama, Hiroshi Saruwatari |
| 2020 | ICASSP | Humangan: Generative Adversarial Network With Human-Based Discriminator And Its Evaluation In Speech Perception Modeling. | Kazuki Fujii, Yuki Saito, Shinnosuke Takamichi, Yukino Baba, Hiroshi Saruwatari |
| 2020 | ICASSP | Lifter Training and Sub-Band Modeling for Computationally Efficient and High-Quality Voice Conversion Using Spectral Differentials. | Takaaki Saeki, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2020 | Interspeech | End-to-End Text-to-Speech Synthesis with Unaligned Multiple Language Units Based on Attention. | Masashi Aso, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2020 | Interspeech | Real-Time, Full-Band, Online DNN-Based Voice Conversion System Using a Single CPU. | Takaaki Saeki, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2020 | Interspeech | Cross-Lingual Text-To-Speech Synthesis via Domain Adaptation and Perceptual Similarity Regression in Speaker Space. | Detai Xin, Yuki Saito, Shinnosuke Takamichi, Tomoki Koriyama, Hiroshi Saruwatari |
| 2020 | Interspeech | Investigating Effective Additional Contextual Factors in DNN-Based Spontaneous Speech Synthesis. | Yuki Yamashita, Tomoki Koriyama, Yuki Saito, Shinnosuke Takamichi, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2020 | LREC | SMASH Corpus: A Spontaneous Speech Corpus Recording Third-person Audio Commentaries on Gameplay. | Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2020 | LREC | DNN-based Speech Synthesis Using Abundant Tags of Spontaneous Speech Corpus. | Yuki Yamashita, Tomoki Koriyama, Yuki Saito, Shinnosuke Takamichi, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2019 | CHI | Estimating confidence in voices using crowdsourcing for alleviating tension with altered auditory feedback. | Kana Naruse, Shinnosuke Takamichi, Tomohiro Tanikawa, Shigeo Yoshida, Takuji Narumi, Michitaka Hirose |
| 2019 | ICASSP | Generative Moment Matching Network-based Random Modulation Post-filter for DNN-based Singing Voice Synthesis and Neural Double-tracking. | Hiroki Tamaru, Yuki Saito, Shinnosuke Takamichi, Tomoki Koriyama, Hiroshi Saruwatari |
| 2019 | Interspeech | Speech Quality Evaluation of Synthesized Japanese Speech Using EEG. | Ivan Halim Parmonangan, Hiroki Tanaka, Sakriani Sakti, Shinnosuke Takamichi, Satoshi Nakamura |
| 2019 | UIST | TransVoice: Real-Time Voice Conversion for Augmenting Near-Field Speech Communication. | Riku Arakawa, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2018 | ICASSP | Non-Parallel Voice Conversion Using Variational Autoencoders Conditioned by Phonetic Posteriorgrams and D-Vectors. | Yuki Saito, Yusuke Ijima, Kyosuke Nishida, Shinnosuke Takamichi |
| 2018 | ICASSP | Text-to-Speech Synthesis Using STFT Spectra Based on Low-/Multi-Resolution Generative Adversarial Networks. | Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2018 | LREC | CPJD Corpus: Crowdsourced Parallel Speech Corpus of Japanese Dialects. | Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2017 | ICASSP | Blind source separation based on independent low-rank matrix analysis with sparse regularization for time-series activity. | Yoshiki Mitsui, Daichi Kitamura, Shinnosuke Takamichi, Nobutaka Ono, Hiroshi Saruwatari |
| 2017 | ICASSP | Training algorithm to deceive Anti-Spoofing Verification for DNN-based speech synthesis. | Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2017 | Interspeech | Voice Conversion Using Sequence-to-Sequence Learning of Context Posterior Probabilities. | Hiroyuki Miyoshi, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2017 | Interspeech | Sampling-Based Speech Parameter Generation Using Moment-Matching Networks. | Shinnosuke Takamichi, Tomoki Koriyama, Hiroshi Saruwatari |
| 2016 | Interspeech | The NU-NAIST Voice Conversion System for the Voice Conversion Challenge 2016. | Kazuhiro Kobayashi, Shinnosuke Takamichi, Satoshi Nakamura, Tomoki Toda |
| 2015 | ICASSP | Parameter generation algorithm considering Modulation Spectrum for HMM-based speech synthesis. | Shinnosuke Takamichi, Tomoki Toda, Alan W. Black, Satoshi Nakamura |
| 2015 | ICASSP | Modulation spectrum-constrained trajectory training algorithm for GMM-based Voice Conversion. | Shinnosuke Takamichi, Tomoki Toda, Alan W. Black, Satoshi Nakamura |
| 2015 | Interspeech | Preserving word-level emphasis in speech-to-speech translation using linear regression HSMMs. | Quoc Truong Do, Shinnosuke Takamichi, Sakriani Sakti, Graham Neubig, Tomoki Toda, Satoshi Nakamura |
| 2015 | Interspeech | Non-native speech synthesis preserving speaker individuality based on partial correction of prosodic and phonetic characteristics. | Yuji Oshima, Shinnosuke Takamichi, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2015 | Interspeech | Modulation spectrum-constrained trajectory training algorithm for HMM-based speech synthesis. | Shinnosuke Takamichi, Tomoki Toda, Alan W. Black, Satoshi Nakamura |
| 2014 | ICASSP | A postfilter to modify the modulation spectrum in HMM-based speech synthesis. | Shinnosuke Takamichi, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2014 | Interspeech | A hearing impairment simulation method using audiogram-based approximation of auditory charatecteristics. | Nozomi Jinbo, Shinnosuke Takamichi, Tomoki Toda, Graham Neubig, Sakriani Sakti, Satoshi Nakamura |
| 2013 | Interspeech | Generalizing continuous-space translation of paralinguistic information. | Takatomo Kano, Shinnosuke Takamichi, Sakriani Sakti, Graham Neubig, Tomoki Toda, Satoshi Nakamura |
| 2013 | Interspeech | Improvements to HMM-based speech synthesis based on parameter generation with rich context models. | Shinnosuke Takamichi, Tomoki Toda, Yoshinori Shiga, Sakriani Sakti, Graham Neubig, Satoshi Nakamura |
| 2012 | Interspeech | An Evaluation of Parameter Generation Methods with Rich Context Models in HMM-Based Speech Synthesis. | Shinnosuke Takamichi, Tomoki Toda, Yoshinori Shiga, Hisashi Kawai, Sakriani Sakti, Satoshi Nakamura |