Yuki Mitsufuji
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
82
Venues
13
Active years
2013–2026
Best venue rank
A*
Where they publish
Papers
82 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | SteerMusic: Enhanced Musical Consistency for Zero-shot Text-Guided and Personalized Music Editing. | Xinlei Niu, Kin Wai Cheuk, Jing Zhang, Naoki Murata, Chieh-Hsin Lai, Michele Mancusi, Woosung Choi, Giorgio Fabbro, Wei-Hsiang Liao, Charles Patrick Martin, Yuki Mitsufuji |
| 2026 | AAAI | Video Camera Trajectory Editing with Generative Rendering from Estimated Geometry. | Junyoung Seo, Jisang Han, Jaewoo Jung, Siyoon Jin, Joungbin Lee, Takuya Narihira, Kazumi Fukuda, Takashi Shibuya, Donghoon Ahn, Shoukang Hu, Seungryong Kim, Yuki Mitsufuji |
| 2026 | CHI | Emergent, not Immanent: A Baradian Reading of Explainable AI. | Fabio Morreale, Joan Serr, Yuki Mitsufuji |
| 2025 | CVPR | Classifier-Free Guidance Inside the Attraction Basin May Cause Memorization. | Anubhav Jain, Yuya Kobayashi, Takashi Shibuya, Yuhta Takida, Nasir D. Memon, Julian Togelius, Yuki Mitsufuji |
| 2025 | CVPR | MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis. | Ho Kei Cheng, Masato Ishii, Akio Hayakawa, Takashi Shibuya, Alexander G. Schwing, Yuki Mitsufuji |
| 2025 | CVPR | VinaBench: Benchmark for Faithful and Consistent Visual Narratives. | Silin Gao, Sheryl Mathew, Li Mi, Sepideh Mamooler, Mengjie Zhao, Hiromi Wakaki, Yuki Mitsufuji, Syrielle Montariol, Antoine Bosselut |
| 2025 | CVPR | Dyadic Mamba: Long-term Dyadic Human Motion Synthesis. | Julian Tanke, Takashi Shibuya, Kengo Uchida, Koichi Saito, Yuki Mitsufuji |
| 2025 | CVPR | MoLA: Motion Generation and Editing with Latent Diffusion Enhanced by Adversarial Training. | Kengo Uchida, Takashi Shibuya, Yuhta Takida, Naoki Murata, Julian Tanke, Shusuke Takahashi, Yuki Mitsufuji |
| 2025 | EMNLP | CARE: Multilingual Human Preference Learning for Cultural Awareness. | Geyang Guo, Tarek Naous, Hiromi Wakaki, Yukiko Nishimura, Yuki Mitsufuji, Alan Ritter, Wei Xu |
| 2025 | EMNLP | DeepResonance: Enhancing Multimodal Music Understanding via Music-centric Multi-way Instruction Tuning. | Zhuoyuan Mao, Mengjie Zhao, Qiyu Wu, Hiromi Wakaki, Yuki Mitsufuji |
| 2025 | ICASSP | 30+ Years of Source Separation Research: Achievements and Future Challenges. | Shoko Araki, Nobutaka Ito, Reinhold Haeb-Umbach, Gordon Wichern, Zhong-Qiu Wang, Yuki Mitsufuji |
| 2025 | ICASSP | Variable Bitrate Residual Vector Quantization for Audio Coding. | Yunkee Chae, Woosung Choi, Yuhta Takida, Junghyun Koo, Yukara Ikemiya, Zhi Zhong, Kin Wai Cheuk, Marco A. Martnez Ramrez, Kyogu Lee, Wei-Hsiang Liao, Yuki Mitsufuji |
| 2025 | ICASSP | Latent Diffusion Bridges for Unsupervised Musical Audio Timbre Transfer. | Michele Mancusi, Yurii Halychanskyi, Kin Wai Cheuk, Eloi Moliner, Chieh-Hsin Lai, Stefan Uhlich, Junghyun Koo, Marco A. Martnez Ramrez, Wei-Hsiang Liao, Giorgio Fabbro, Yuki Mitsufuji |
| 2025 | ICASSP | Twenty-Five Years of MIR Research: Achievements, Practices, Evaluations, and Future Challenges. | Geoffroy Peeters, Zafar Rafii, Magdalena Fuentes, Zhiyao Duan, Emmanouil Benetos, Juhan Nam, Yuki Mitsufuji |
| 2025 | ICCV | TITAN-Guide: Taming Inference-Time Alignment for Guided Text-to-Video Diffusion Models. | Christian Simon, Masato Ishii, Akio Hayakawa, Zhi Zhong, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji |
| 2025 | ICCV | Transformed Low-rank Adaptation via Tensor Decomposition and Its Applications to Text-to-image Models. | Zerui Tao, Yuhta Takida, Naoki Murata, Qibin Zhao, Yuki Mitsufuji |
| 2025 | ICCV | Towards Reporting Bias in Visual-Language Datasets: Bi-Modal Data Augmentation by Decoupling Object-Attribute Association. | Qiyu Wu, Mengjie Zhao, Yutong He, Lang Huang, Junya Ono, Hiromi Wakaki, Yuki Mitsufuji |
| 2025 | ICLR | MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation. | Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji |
| 2025 | ICLR | HERO: Human-Feedback Efficient Reinforcement Learning for Online Diffusion Model Finetuning. | Ayano Hiranaka, Shang-Fu Chen, Chieh-Hsin Lai, Dongjun Kim, Naoki Murata, Takashi Shibuya, Wei-Hsiang Liao, Shao-Hua Sun, Yuki Mitsufuji |
| 2025 | ICLR | Mining your own secrets: Diffusion Classifier Scores for Continual Personalization of Text-to-Image Diffusion Models. | Saurav Jha, Shiqi Yang, Masato Ishii, Mengjie Zhao, Christian Simon, Muhammad Jehanzeb Mirza, Dong Gong, Lina Yao, Shusuke Takahashi, Yuki Mitsufuji |
| 2025 | ICLR | Jump Your Steps: Optimizing Sampling Schedule of Discrete Diffusion Models. | Yong-Hyun Park, Chieh-Hsin Lai, Satoshi Hayakawa, Yuhta Takida, Yuki Mitsufuji |
| 2025 | ICLR | SoundCTM: Unifying Score-based and Consistency Models for Full-band Text-to-Sound Generation. | Koichi Saito, Dongjun Kim, Takashi Shibuya, Chieh-Hsin Lai, Zhi Zhong, Yuhta Takida, Yuki Mitsufuji |
| 2025 | ICLR | Weighted Point Set Embedding for Multimodal Contrastive Learning Toward Optimal Similarity Metric. | Toshimitsu Uesaka, Taiji Suzuki, Yuhta Takida, Chieh-Hsin Lai, Naoki Murata, Yuki Mitsufuji |
| 2025 | ICML | Distillation of Discrete Diffusion through Dimensional Correlations. | Satoshi Hayakawa, Yuhta Takida, Masaaki Imaizumi, Hiromi Wakaki, Yuki Mitsufuji |
| 2025 | ICML | Supervised Contrastive Learning from Weakly-Labeled Audio Segments for Musical Version Matching. | Joan Serr, Recep Oguz Araz, Dmitry Bogdanov, Yuki Mitsufuji |
| 2025 | ICML | VCT: Training Consistency Models with Variational Noise Coupling. | Gianluigi Silvestri, Luca Ambrogioni, Chieh-Hsin Lai, Yuhta Takida, Yuki Mitsufuji |
| 2025 | IJCNN | A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation. | Masato Ishii, Akio Hayakawa, Takashi Shibuya, Yuki Mitsufuji |
| 2025 | IJCNN | Efficiency without Compromise: CLIP-aided Text-to-Image GANs with Increased Diversity. | Yuya Kobayashi, Yuhta Takida, Takashi Shibuya, Yuki Mitsufuji |
| 2025 | IJCNN | StereoSync: Spatially-Aware Stereo Audio Generation from Video. | Christian Marinoni, Riccardo F. Gramaccioni, Kazuki Shimada, Takashi Shibuya, Yuki Mitsufuji, Danilo Comminiello |
| 2025 | IJCNN | Improving Vector-Quantized Image Modeling with Latent Consistency-Matching Diffusion. | Bac Nguyen, Chieh-Hsin Lai, Yuhta Takida, Naoki Murata, Toshimitsu Uesaka, Stefano Ermon, Yuki Mitsufuji |
| 2025 | Interspeech | A Comprehensive Real-World Assessment of Audio Watermarking Algorithms: Will They Survive Neural Codecs? | Yigitcan zer, Woosung Choi, Joan Serr, Mayank Kumar Singh, Wei-Hsiang Liao, Yuki Mitsufuji |
| 2024 | ACL | DiffuCOMET: Contextual Commonsense Knowledge Diffusion. | Silin Gao, Mete Ismayilzada, Mengjie Zhao, Hiromi Wakaki, Yuki Mitsufuji, Antoine Bosselut |
| 2024 | ACL | On the Language Encoder of Contrastive Cross-modal Models. | Mengjie Zhao, Junya Ono, Zhi Zhong, Chieh-Hsin Lai, Yuhta Takida, Naoki Murata, Wei-Hsiang Liao, Takashi Shibuya, Hiromi Wakaki, Yuki Mitsufuji |
| 2024 | ICASSP | BIGVSAN: Enhancing Gan-Based Neural Vocoders with Slicing Adversarial Network. | Takashi Shibuya, Yuhta Takida, Yuki Mitsufuji |
| 2024 | ICASSP | Timbre-Trap: A Low-Resource Framework for Instrument-Agnostic Music Transcription. | Frank Cwitkowitz, Kin Wai Cheuk, Woosung Choi, Marco A. Martnez Ramrez, Keisuke Toyama, Wei-Hsiang Liao, Yuki Mitsufuji |
| 2024 | ICASSP | Enhancing Semantic Communication with Deep Generative Models: An Overview. | Eleonora Grassucci, Yuki Mitsufuji, Ping Zhang, Danilo Comminiello |
| 2024 | ICASSP | VRDMG: Vocal Restoration via Diffusion Posterior Sampling with Multiple Guidance. | Carlos Hernandez-Olivan, Koichi Saito, Naoki Murata, Chieh-Hsin Lai, Marco A. Martnez Ramrez, Wei-Hsiang Liao, Yuki Mitsufuji |
| 2024 | ICASSP | Zero- and Few-Shot Sound Event Localization and Detection. | Kazuki Shimada, Kengo Uchida, Yuichiro Koyama, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji, Tatsuya Kawahara |
| 2024 | ICASSP | Diffusion-Based Speech Enhancement with Joint Generative and Predictive Decoders. | Hao Shi, Kazuki Shimada, Masato Hirano, Takashi Shibuya, Yuichiro Koyama, Zhi Zhong, Shusuke Takahashi, Tatsuya Kawahara, Yuki Mitsufuji |
| 2024 | ICLR | Manifold Preserving Guided Diffusion. | Yutong He, Naoki Murata, Chieh-Hsin Lai, Yuhta Takida, Toshimitsu Uesaka, Dongjun Kim, Wei-Hsiang Liao, Yuki Mitsufuji, J. Zico Kolter, Ruslan Salakhutdinov, Stefano Ermon |
| 2024 | ICLR | Consistency Trajectory Models: Learning Probability Flow ODE Trajectory of Diffusion. | Dongjun Kim, Chieh-Hsin Lai, Wei-Hsiang Liao, Naoki Murata, Yuhta Takida, Toshimitsu Uesaka, Yutong He, Yuki Mitsufuji, Stefano Ermon |
| 2024 | ICLR | SAN: Inducing Metrizability of GAN with Discriminative Normalized Linear Layer. | Yuhta Takida, Masaaki Imaizumi, Takashi Shibuya, Chieh-Hsin Lai, Toshimitsu Uesaka, Naoki Murata, Yuki Mitsufuji |
| 2024 | IJCAI | MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models. | Yixiao Zhang, Yukara Ikemiya, Gus Xia, Naoki Murata, Marco A. Martnez Ramrez, Wei-Hsiang Liao, Yuki Mitsufuji, Simon Dixon |
| 2024 | Interspeech | SilentCipher: Deep Audio Watermarking. | Mayank Kumar Singh, Naoya Takahashi, Wei-Hsiang Liao, Yuki Mitsufuji |
| 2023 | ACL | PeaCoK: Persona Commonsense Knowledge for Consistent and Engaging Narratives. | Silin Gao, Beatriz Borges, Soyoung Oh, Deniz Bayazit, Saya Kanno, Hiromi Wakaki, Yuki Mitsufuji, Antoine Bosselut |
| 2023 | ICASSP | Diffroll: Diffusion-Based Generative Music Transcription with Unsupervised Pretraining Capability. | Kin Wai Cheuk, Ryosuke Sawata, Toshimitsu Uesaka, Naoki Murata, Naoya Takahashi, Shusuke Takahashi, Dorien Herremans, Yuki Mitsufuji |
| 2023 | ICASSP | Music Mixing Style Transfer: A Contrastive Learning Approach to Disentangle Audio Effects. | Junghyun Koo, Marco A. Martnez Ramrez, Wei-Hsiang Liao, Stefan Uhlich, Kyogu Lee, Yuki Mitsufuji |
| 2023 | ICASSP | Unsupervised Vocal Dereverberation with Diffusion-Based Generative Models. | Koichi Saito, Naoki Murata, Toshimitsu Uesaka, Chieh-Hsin Lai, Yuhta Takida, Takao Fukui, Yuki Mitsufuji |
| 2023 | ICASSP | Hierarchical Diffusion Models for Singing Voice Neural Vocoder. | Naoya Takahashi, Mayank Kumar Singh, Yuki Mitsufuji |
| 2023 | ICASSP | An Attention-Based Approach to Hierarchical Multi-Label Music Instrument Classification. | Zhi Zhong, Masato Hirano, Kazuki Shimada, Kazuya Tateishi, Shusuke Takahashi, Yuki Mitsufuji |
| 2023 | ICLR | CLIPSep: Learning Text-queried Sound Separation with Noisy Unlabeled Videos. | Hao-Wen Dong, Naoya Takahashi, Yuki Mitsufuji, Julian J. McAuley, Taylor Berg-Kirkpatrick |
| 2023 | ICML | FP-Diffusion: Improving Score-based Diffusion Models by Enforcing the Underlying Score Fokker-Planck Equation. | Chieh-Hsin Lai, Yuhta Takida, Naoki Murata, Toshimitsu Uesaka, Yuki Mitsufuji, Stefano Ermon |
| 2023 | ICML | GibbsDDRM: A Partially Collapsed Gibbs Sampler for Solving Blind Inverse Problems with Denoising Diffusion Restoration. | Naoki Murata, Koichi Saito, Chieh-Hsin Lai, Yuhta Takida, Toshimitsu Uesaka, Yuki Mitsufuji, Stefano Ermon |
| 2023 | Interspeech | Diffiner: A Versatile Diffusion-based Generative Refiner for Speech Enhancement. | Ryosuke Sawata, Naoki Murata, Yuhta Takida, Toshimitsu Uesaka, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji |
| 2022 | EMNLP | ComFact: A Benchmark for Linking Contextual Commonsense Knowledge. | Silin Gao, Jena D. Hwang, Saya Kanno, Hiromi Wakaki, Yuki Mitsufuji, Antoine Bosselut |
| 2022 | ICASSP | Automatic DJ Transitions with Differentiable Audio Effects and Generative Adversarial Networks. | Bo-Yu Chen, Wei-Han Hsu, Wei-Hsiang Liao, Marco A. Martnez Ramrez, Yuki Mitsufuji, Yi-Hsuan Yang |
| 2022 | ICASSP | Music Source Separation With Deep Equilibrium Models. | Yuichiro Koyama, Naoki Murata, Stefan Uhlich, Giorgio Fabbro, Shusuke Takahashi, Yuki Mitsufuji |
| 2022 | ICASSP | Spatial Data Augmentation with Simulated Room Impulse Responses for Sound Event Localization and Detection. | Yuichiro Koyama, Kazuhide Shigemi, Masafumi Takahashi, Kazuki Shimada, Naoya Takahashi, Emiru Tsunoo, Shusuke Takahashi, Yuki Mitsufuji |
| 2022 | ICASSP | Spatial Mixup: Directional Loudness Modification as Data Augmentation for Sound Event Localization and Detection. | Ricardo Falcn Prez, Kazuki Shimada, Yuichiro Koyama, Shusuke Takahashi, Yuki Mitsufuji |
| 2022 | ICASSP | Multi-ACCDOA: Localizing And Detecting Overlapping Sounds From The Same Class With Auxiliary Duplicating Permutation Invariant Training. | Kazuki Shimada, Yuichiro Koyama, Shusuke Takahashi, Naoya Takahashi, Emiru Tsunoo, Yuki Mitsufuji |
| 2022 | ICASSP | Amicable Examples for Informed Source Separation. | Naoya Takahashi, Yuki Mitsufuji |
| 2022 | ICASSP | Amicable Examples for Informed Source Separation. | Naoya Takahashi, Yuki Mitsufuji |
| 2022 | ICML | SQ-VAE: Variational Bayes on Discrete Representation with Self-annealed Stochastic Quantization. | Yuhta Takida, Takashi Shibuya, Wei-Hsiang Liao, Chieh-Hsin Lai, Junki Ohmura, Toshimitsu Uesaka, Naoki Murata, Shusuke Takahashi, Toshiyuki Kumakura, Yuki Mitsufuji |
| 2021 | ACII | Psychophysiological Effect of Immersive Spatial Audio Experience Enhanced Using Sound Field Synthesis. | Yasuhide Hyodo, Chihiro Sugai, Junya Suzuki, Masafumi Takahashi, Masahiko Koizumi, Asako Tomura, Yuki Mitsufuji, Yota Komoriya |
| 2021 | CVPR | Densely Connected Multi-Dilated Convolutional Networks for Dense Prediction Tasks. | Naoya Takahashi, Yuki Mitsufuji |
| 2021 | ICASSP | All For One And One For All: Improving Music Separation By Bridging Networks. | Ryosuke Sawata, Stefan Uhlich, Shusuke Takahashi, Yuki Mitsufuji |
| 2021 | ICASSP | Accdoa: Activity-Coupled Cartesian Direction of Arrival Representation for Sound Event Localization And Detection. | Kazuki Shimada, Yuichiro Koyama, Naoya Takahashi, Shusuke Takahashi, Yuki Mitsufuji |
| 2021 | ICASSP | Adversarial Attacks on Audio Source Separation. | Naoya Takahashi, Shota Inoue, Yuki Mitsufuji |
| 2021 | IJCNN | Hierarchical disentangled representation learning for singing voice conversion. | Naoya Takahashi, Mayank Kumar Singh, Yuki Mitsufuji |
| 2020 | ICASSP | Array-Geometry-Aware Spatial Active Noise Control Based on Direction-of-Arrival Weighting. | Yu Maeno, Yuhta Takida, Naoki Murata, Yuki Mitsufuji |
| 2020 | ICASSP | Improving Voice Separation by Incorporating End-To-End Speech Recognition. | Naoya Takahashi, Mayank Kumar Singh, Sakya Basak, Sudarsanam Parthasaarathy, Sriram Ganapathy, Yuki Mitsufuji |
| 2019 | ICASSP | Global and Local Mode-domain Adaptive Algorithms for Spatial Active Noise Control Using Higher-order Sources. | Naoki Murata, Jihui Zhang, Yu Maeno, Yuki Mitsufuji |
| 2019 | Interspeech | Recursive Speech Separation for Unknown Number of Speakers. | Naoya Takahashi, Sudarsanam Parthasaarathy, Nabarun Goswami, Yuki Mitsufuji |
| 2018 | ICASSP | Mode Domain Spatial Active Noise Control Using Sparse Signal Representation. | Yu Maeno, Yuki Mitsufuji, Thushara D. Abhayapala |
| 2018 | Interspeech | PhaseNet: Discretized Phase Modeling with Deep Neural Networks for Audio Source Separation. | Naoya Takahashi, Purvi Agrawal, Nabarun Goswami, Yuki Mitsufuji |
| 2017 | ICASSP | Supervised monaural source separation based on autoencoders. | Keiichi Osako, Yuki Mitsufuji, Rita Singh, Bhiksha Raj |
| 2017 | ICASSP | Improving music source separation based on deep neural networks through data augmentation and network blending. | Stefan Uhlich, Marcello Porcu, Franck Giron, Michael Enenkl, Thomas Kemp, Naoya Takahashi, Yuki Mitsufuji |
| 2016 | ICASSP | Multichannel blind source separation based on non-negative tensor factorization in wavenumber domain. | Yuki Mitsufuji, Shoichi Koyama, Hiroshi Saruwatari |
| 2015 | ICASSP | NMF-based blind source separation using a linear predictive coding error clustering criterion. | Xin Guo, Stefan Uhlich, Yuki Mitsufuji |
| 2015 | ICASSP | Deep neural network based instrument extraction from music. | Stefan Uhlich, Franck Giron, Yuki Mitsufuji |
| 2014 | ICASSP | Online NON-negative Tensor Deconvolution for source detection in 3DTV audio. | Yuki Mitsufuji, Marco Liuni, Alex Baker, Axel Roebel |
| 2013 | ICASSP | Sound source separation based on non-negative tensor factorization incorporating spatial cue as prior knowledge. | Yuki Mitsufuji, Axel Roebel |