| 2026 | LREC | Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches. | Anum Afzal, Yuki Saito, Hiroya Takamura, Katsuhito Sudoh, Shinnosuke Takamichi, Graham Neubig, Florian Matthes, Tatsuya Ishigaki |
| 2026 | LREC | J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling. | Wataru Nakata, Kentaro Seki, Hitomi Yanaka, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2026 | SIGdial | DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio. | Wataru Nakata, Yuki Saito, Kazuki Yamauchi, Emiru Tsunoo, Hiroshi Saruwatari |
| 2025 | ASRU | CAVIARES: Corpus for Audio-Visual Expressive Voice Agent. | Jinsheng Chen, Yuki Saito, Dong Yang, Naoko Tanji, Hironori Doi, Byeongseon Park, Yuma Shirahata, Kentaro Tachibana, Hiroshi Saruwatari |
| 2025 | ASRU | Multi-Sampling-Frequency Naturalness MOS Prediction Using Self-Supervised Learning Model with Sampling-Frequency-Independent Layer. | Go Nishikawa, Wataru Nakata, Yuki Saito, Kanami Imamura, Hiroshi Saruwatari, Tomohiko Nakamura |
| 2025 | ASRU | Analysing the Language of Neural Audio Codecs. | Joonyong Park, Shinnosuke Takamichi, David M. Chan, Shunsuke Kando, Yuki Saito, Hiroshi Saruwatari |
| 2025 | EMNLP | Static Word Embeddings for Sentence Semantic Representation. | Takashi Wada, Yuki Hirakawa, Ryotaro Shimizu, Takahiro Kawashima, Yuki Saito |
| 2025 | ICASSP | Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features. | Emiru Tsunoo, Yuki Saito, Wataru Nakata, Hiroshi Saruwatari |
| 2025 | ICLR | Mastering Task Arithmetic: τJp as a Key Indicator for Weight Disentanglement. | Kotaro Yoshida, Yuji Naraki, Takafumi Horie, Ryosuke Yamaki, Ryotaro Shimizu, Yuki Saito, Julian J. McAuley, Hiroki Naganuma |
| 2025 | IJCAI | Explaining Black-box Model Predictions via Two-level Nested Feature Attributions with Consistency Property. | Yuya Yoshikawa, Masanari Kimura, Ryotaro Shimizu, Yuki Saito |
| 2025 | Interspeech | RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio. | Yusuke Kanamori, Yuki Okamoto, Taisei Takano, Shinnosuke Takamichi, Yuki Saito, Hiroshi Saruwatari |
| 2025 | WWW | Disentangling Likes and Dislikes in Personalized Generative Explainable Recommendation. | Ryotaro Shimizu, Takashi Wada, Yu Wang, Johannes Kruse, Sean O'Brien, Sai Htaung Kham, Linxin Song, Yuya Yoshikawa, Yuki Saito, Fugee Tsung, Masayuki Goto, Julian J. McAuley |
| 2024 | ICAART | An Analysis of Knowledge Representation for Anime Recommendation Using Graph Neural Networks. | Yuki Saito, Shusaku Egami, Yuichi Sei, Yasuyuki Tahara, Akihiko Ohsuga |
| 2024 | ICASSP | STYLECAP: Automatic Speaking-Style Captioning from Speech Based on Speech and Language Self-Supervised Learning Models. | Kazuki Yamauchi, Yusuke Ijima, Yuki Saito |
| 2024 | Interspeech | Noise-Robust Voice Conversion by Conditional Denoising Training Using Latent Variables of Recording Quality and Environment. | Takuto Igarashi, Yuki Saito, Kentaro Seki, Shinnosuke Takamichi, Ryuichi Yamamoto, Kentaro Tachibana, Hiroshi Saruwatari |
| 2024 | Interspeech | SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark. | Yuki Saito, Takuto Igarashi, Kentaro Seki, Shinnosuke Takamichi, Ryuichi Yamamoto, Kentaro Tachibana, Hiroshi Saruwatari |
| 2024 | Interspeech | Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals. | Kentaro Seki, Shinnosuke Takamichi, Norihiro Takamune, Yuki Saito, Kanami Imamura, Hiroshi Saruwatari |
| 2024 | Interspeech | Frame-Wise Breath Detection with Self-Training: An Exploration of Enhancing Breath Naturalness in Text-to-Speech. | Dong Yang, Tomoki Koriyama, Yuki Saito |
| 2024 | VTC | Low Complexity CSI Feedback Method Using Reformer. | Yuki Saito, Mondher Bouazizi, Tomoaki Ohtsuki |
| 2024 | SiggraphA | An Empirical Analysis of GPT-4V's Performance on Fashion Aesthetic Evaluation. | Yuki Hirakawa, Takashi Wada, Kazuya Morishita, Ryotaro Shimizu, Takuya Furusawa, Sai Htaung Kham, Yuki Saito |
| 2023 | ASRU | COCO-NUT: Corpus of Japanese Utterance and Voice Characteristics Description for Prompt-Based Control. | Aya Watanabe, Shinnosuke Takamichi, Yuki Saito, Wataru Nakata, Detai Xin, Hiroshi Saruwatari |
| 2023 | CVPR | SHIFT15M: Fashion-specific dataset for set-to-set matching with several distribution shifts. | Masanari Kimura, Takuma Nakamura, Yuki Saito |
| 2023 | ICASSP | MID-Attribute Speaker Generation Using Optimal-Transport-Based Interpolation of Gaussian Mixture Models. | Aya Watanabe, Shinnosuke Takamichi, Yuki Saito, Detai Xin, Hiroshi Saruwatari |
| 2023 | ICASSP | Duration-Aware Pause Insertion Using Pre-Trained Language Model for Multi-Speaker Text-To-Speech. | Dong Yang, Tomoki Koriyama, Yuki Saito, Takaaki Saeki, Detai Xin, Hiroshi Saruwatari |
| 2023 | Interspeech | CALLS: Japanese Empathetic Dialogue Speech Corpus of Complaint Handling and Attentive Listening in Customer Center. | Yuki Saito, Eiji Iimori, Shinnosuke Takamichi, Kentaro Tachibana, Hiroshi Saruwatari |
| 2023 | Interspeech | ChatGPT-EDSS: Empathetic Dialogue Speech Synthesis Trained from ChatGPT-derived Context Word Embeddings. | Yuki Saito, Shinnosuke Takamichi, Eiji Iimori, Kentaro Tachibana, Hiroshi Saruwatari |
| 2023 | Interspeech | HumanDiffusion: diffusion model using perceptual gradients. | Yota Ueda, Shinnosuke Takamichi, Yuki Saito, Norihiro Takamune, Hiroshi Saruwatari |
| 2022 | Interspeech | Predicting VQVAE-based Character Acting Style from Quotation-Annotated Text for Audiobook Speech Synthesis. | Wataru Nakata, Tomoki Koriyama, Shinnosuke Takamichi, Yuki Saito, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2022 | Interspeech | Acoustic Modeling for End-to-End Empathetic Dialogue Speech Synthesis Using Linguistic and Prosodic Contexts of Dialogue History. | Yuto Nishimura, Yuki Saito, Shinnosuke Takamichi, Kentaro Tachibana, Hiroshi Saruwatari |
| 2022 | Interspeech | STUDIES: Corpus of Japanese Empathetic Dialogue Speech Towards Friendly Voice Agent. | Yuki Saito, Yuto Nishimura, Shinnosuke Takamichi, Kentaro Tachibana, Hiroshi Saruwatari |
| 2022 | Interspeech | Human-in-the-loop Speaker Adaptation for DNN-based Multi-speaker TTS. | Kenta Udagawa, Yuki Saito, Hiroshi Saruwatari |
| 2022 | IECON | Validation of a Property Estimation Method Based on Sequential and Posteriori Estimation. | Tomoya Kitamura, Atsumi Saito, Keisuke Yamazaki, Yuki Saito, Hiroshi Asai, Kouhei Ohnishi |
| 2021 | ICASSP | Humanacgan: Conditional Generative Adversarial Network with Human-Based Auxiliary Classifier and its Evaluation in Phoneme Perception. | Yota Ueda, Kazuki Fujii, Yuki Saito, Shinnosuke Takamichi, Yukino Baba, Hiroshi Saruwatari |
| 2021 | Interspeech | Cross-Lingual Speaker Adaptation Using Domain Adaptation and Speaker Consistency Loss for Text-To-Speech Synthesis. | Detai Xin, Yuki Saito, Shinnosuke Takamichi, Tomoki Koriyama, Hiroshi Saruwatari |
| 2020 | ECCV | Exchangeable Deep Neural Networks for Set-to-Set Matching and Learning. | Yuki Saito, Takuma Nakamura, Hirotaka Hachiya, Kenji Fukumizu |
| 2020 | ICASSP | Humangan: Generative Adversarial Network With Human-Based Discriminator And Its Evaluation In Speech Perception Modeling. | Kazuki Fujii, Yuki Saito, Shinnosuke Takamichi, Yukino Baba, Hiroshi Saruwatari |
| 2020 | ICASSP | Lifter Training and Sub-Band Modeling for Computationally Efficient and High-Quality Voice Conversion Using Spectral Differentials. | Takaaki Saeki, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2020 | Interspeech | Face2Speech: Towards Multi-Speaker Text-to-Speech Synthesis Using an Embedding Vector Predicted from a Face Image. | Shunsuke Goto, Kotaro Onishi, Yuki Saito, Kentaro Tachibana, Koichiro Mori |
| 2020 | Interspeech | Real-Time, Full-Band, Online DNN-Based Voice Conversion System Using a Single CPU. | Takaaki Saeki, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2020 | Interspeech | Cross-Lingual Text-To-Speech Synthesis via Domain Adaptation and Perceptual Similarity Regression in Speaker Space. | Detai Xin, Yuki Saito, Shinnosuke Takamichi, Tomoki Koriyama, Hiroshi Saruwatari |
| 2020 | Interspeech | Investigating Effective Additional Contextual Factors in DNN-Based Spontaneous Speech Synthesis. | Yuki Yamashita, Tomoki Koriyama, Yuki Saito, Shinnosuke Takamichi, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2020 | LREC | SMASH Corpus: A Spontaneous Speech Corpus Recording Third-person Audio Commentaries on Gameplay. | Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2020 | LREC | DNN-based Speech Synthesis Using Abundant Tags of Spontaneous Speech Corpus. | Yuki Yamashita, Tomoki Koriyama, Yuki Saito, Shinnosuke Takamichi, Yusuke Ijima, Ryo Masumura, Hiroshi Saruwatari |
| 2019 | ICASSP | Generative Moment Matching Network-based Random Modulation Post-filter for DNN-based Singing Voice Synthesis and Neural Double-tracking. | Hiroki Tamaru, Yuki Saito, Shinnosuke Takamichi, Tomoki Koriyama, Hiroshi Saruwatari |
| 2019 | IECON | A Controller Design Method of Bilateral Teleoperation for Velocity Control Driver. | Yuki Saito, Shuhei Shimmyo, Takahiro Nozaki, Kouhei Ohnishi |
| 2019 | IECON | Bandwidth Expansion of Bilateral Teleoperation Based on Synergy of Observer Gain and Velocity Feedback Gain. | Shuhei Shimmyo, Yuki Saito, Takahiro Nozaki, Kouhei Ohnishi |
| 2018 | ICASSP | Non-Parallel Voice Conversion Using Variational Autoencoders Conditioned by Phonetic Posteriorgrams and D-Vectors. | Yuki Saito, Yusuke Ijima, Kyosuke Nishida, Shinnosuke Takamichi |
| 2018 | ICASSP | Text-to-Speech Synthesis Using STFT Spectra Based on Low-/Multi-Resolution Generative Adversarial Networks. | Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2018 | SMC | Effects of EEG Electrode Positional Deviations for Classification Accuracy on Different Days. | Yudai Gamano, Yuki Saito, Koyoe Takamori, Ken-ichi Morishige |
| 2018 | SMC | 2.5D Faster R-CNN for Distance Estimation. | Hirotaka Hachiya, Yuki Saito, Kazuma Iteya, Masaya Nomura, Takayuki Nakamura |
| 2017 | ICASSP | Training algorithm to deceive Anti-Spoofing Verification for DNN-based speech synthesis. | Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2017 | Interspeech | Voice Conversion Using Sequence-to-Sequence Learning of Context Posterior Probabilities. | Hiroyuki Miyoshi, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari |
| 2017 | IECON | Motion-reproduction system adaptable to position fluctuation of picking objects based on image information. | Xiaobai Sun, Daisuke Tomizuka, Hiromu Sekiguchi, Satoshi Fukushima, Yuki Saito, Takahiro Nozaki, Kouhei Ohnishi |
| 2010 | PIMRC | Robust interference management to satisfy allowable outage probability using minority game. | Yuki Saito, Koji Yamamoto, Hidekazu Murata, Susumu Yoshida |
| 2009 | GLOBECOM | Joint Dynamics of Spectrum Allocation and User Behavior in Spectrum Markets. | Yuki Saito, Koji Yamamoto, Hidekazu Murata, Susumu Yoshida |
| 2009 | ICASSP | Adaptive rhythmic component extractionwith regularization for EEG data analysis. | Yuki Saito, Toshihisa Tanaka, Hiroshi Higashi |
| 2008 | ICASSP | Rhythmic component extraction for multi-channel EEG data analysis. | Toshihisa Tanaka, Yuki Saito |