| 2025 | Interspeech | Towards Pre-training an Effective Respiratory Audio Foundation Model. | Daisuke Niizumi, Daiki Takeuchi, Masahiro Yasuda, Binh Thien Nguyen, Yasunori Ohishi, Noboru Harada |
| 2025 | Interspeech | CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer. | Daiki Takeuchi, Binh Thien Nguyen, Masahiro Yasuda, Yasunori Ohishi, Daisuke Niizumi, Noboru Harada |
| 2024 | Interspeech | M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation. | Daisuke Niizumi, Daiki Takeuchi, Yasunori Ohishi, Noboru Harada, Masahiro Yasuda, Shunsuke Tsubaki, Keisuke Imoto |
| 2023 | ICASSP | Masked Modeling Duo: Learning Representations by Encouraging Both Networks to Model the Input. | Daisuke Niizumi, Daiki Takeuchi, Yasunori Ohishi, Noboru Harada, Kunio Kashino |
| 2023 | Interspeech | Masked Modeling Duo for Speech: Specializing General-Purpose Audio Representation to Speech using Denoising Distillation. | Daisuke Niizumi, Daiki Takeuchi, Yasunori Ohishi, Noboru Harada, Kunio Kashino |
| 2022 | ICASSP | Echo-Aware Adaptation of Sound Event Localization and Detection in Unknown Environments. | Masahiro Yasuda, Yasunori Ohishi, Shoichiro Saito |
| 2022 | ICASSP | Multi-View And Multi-Modal Event Detection Utilizing Transformer-Based Multi-Sensor Fusion. | Masahiro Yasuda, Yasunori Ohishi, Shoichiro Saito, Noboru Harada |
| 2022 | Interspeech | Introducing Auxiliary Text Query-modifier to Content-based Audio Retrieval. | Daiki Takeuchi, Yasunori Ohishi, Daisuke Niizumi, Noboru Harada, Kunio Kashino |
| 2021 | IJCNN | BYOL for Audio: Self-Supervised Learning for General-Purpose Audio Representation. | Daisuke Niizumi, Daiki Takeuchi, Yasunori Ohishi, Noboru Harada, Kunio Kashino |
| 2020 | ICASSP | Trilingual Semantic Embeddings of Visually Grounded Speech with Self-Attention Mechanisms. | Yasunori Ohishi, Akisato Kimura, Takahito Kawanishi, Kunio Kashino, David Harwath, James R. Glass |
| 2020 | ICPR | Unsupervised Co-Segmentation for Athlete Movements and Live Commentaries Using Crossmodal Temporal Proximity. | Yasunori Ohishi, Yuki Tanaka, Kunio Kashino |
| 2020 | Interspeech | Pair Expansion for Learning Multilingual Semantic Embeddings Using Disjoint Visually-Grounded Speech Audio Datasets. | Yasunori Ohishi, Akisato Kimura, Takahito Kawanishi, Kunio Kashino, David Harwath, James R. Glass |
| 2020 | Interspeech | Harmonic Lowering for Accelerating Harmonic Convolution for Audio Signals. | Hirotoshi Takeuchi, Kunio Kashino, Yasunori Ohishi, Hiroshi Saruwatari |
| 2020 | Interspeech | Crossmodal Sound Retrieval Based on Specific Target Co-Occurrence Denoted with Weak Labels. | Masahiro Yasuda, Yasunori Ohishi, Yuma Koizumi, Noboru Harada |
| 2014 | ICASSP | Mondrian hidden Markov model for music signal processing. | Masahiro Nakano, Yasunori Ohishi, Hirokazu Kameoka, Ryo Mukai, Kunio Kashino |
| 2014 | ICASSP | Mixture of Gaussian process experts for predicting sung melodic contour with expressive dynamic fluctuations. | Yasunori Ohishi, Daichi Mochihashi, Hirokazu Kameoka, Kunio Kashino |
| 2013 | ICASSP | Bayesian semi-supervised audio event transcription based on Markov indian buffet process. | Yasunori Ohishi, Daichi Mochihashi, Tomoko Matsui, Masahiro Nakano, Hirokazu Kameoka, Tomonori Izumitani, Kunio Kashino |
| 2013 | Interspeech | Generative modeling of speech F | Hirokazu Kameoka, Kota Yoshizato, Tatsuma Ishihara, Yasunori Ohishi, Kunio Kashino, Shigeki Sagayama |
| 2012 | ICASSP | Bayesian nonparametric music parser. | Masahiro Nakano, Yasunori Ohishi, Hirokazu Kameoka, Ryo Mukai, Kunio Kashino |
| 2012 | Interspeech | A Stochastic Model of Singing Voice F0 Contours for Characterizing Expressive Dynamic Components. | Yasunori Ohishi, Hirokazu Kameoka, Daichi Mochihashi, Kunio Kashino |
| 2011 | ICASSP | Automatic audio tag classification via semi-supervised canonical density estimation. | Jun Takagi, Yasunori Ohishi, Akisato Kimura, Masashi Sugiyama, Makoto Yamada, Hirokazu Kameoka |
| 2010 | Interspeech | A statistical model of speech F0 contours. | Hirokazu Kameoka, Jonathan Le Roux, Yasunori Ohishi |
| 2010 | Interspeech | Statistical modeling of F0 dynamics in singing voices based on Gaussian processes with multiple oscillation bases. | Yasunori Ohishi, Hirokazu Kameoka, Daichi Mochihashi, Hidehisa Nagano, Kunio Kashino |
| 2008 | Interspeech | Parameter estimation method of F0 control model for singing voices. | Yasunori Ohishi, Hirokazu Kameoka, Kunio Kashino, Kazuya Takeda |
| 2008 | Interspeech | Building and combining document and music spaces for music query-by-webpage system. | Ryoei Takahashi, Yasunori Ohishi, Norihide Kitaoka, Kazuya Takeda |
| 2006 | LREC | Statistical Analysis for Thesaurus Construction using an Encyclopedic Corpus. | Yasunori Ohishi, Katunobu Itou, Kazuya Takeda, Atsushi Fujii |
| 2005 | Interspeech | Discrimination between singing and speaking voices. | Yasunori Ohishi, Masataka Goto, Katunobu Itou, Kazuya Takeda |