| 2026 | ACL | Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception. | Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-Wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Boris Ginsburg, Yu-Chiang Frank Wang |
| 2025 | ACL | LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences. | Yusuke Hirota, Boyi Li, Ryo Hachiuma, Yueh-Hua Wu, Boris Ivanovic, Marco Pavone, Yejin Choi, Yu-Chiang Frank Wang, Yuta Nakashima, Chao-Han Huck Yang |
| 2025 | CVPR | Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks. | Miran Heo, Min-Hung Chen, De-An Huang, Sifei Liu, Subhashree Radhakrishnan, Seon Joo Kim, Yu-Chiang Frank Wang, Ryo Hachiuma |
| 2025 | CVPR | VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models. | Byung-Kwan Lee, Ryo Hachiuma, Yu-Chiang Frank Wang, Yong Man Ro, Yueh-Hua Wu |
| 2025 | ICCV | Bias in Gender Bias Benchmarks: How Spurious Features Distort Evaluation. | Yusuke Hirota, Ryo Hachiuma, Boyi Li, Ximing Lu, Michael Ross Boone, Boris Ivanovic, Yejin Choi, Marco Pavone, Yu-Chiang Frank Wang, Noa Garcia, Yuta Nakashima, Chao-Han Huck Yang |
| 2025 | ICCV | Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation. | Reina Ishikawa, Ryo Fujii, Hideo Saito, Ryo Hachiuma |
| 2025 | ICIP | Frozen Network Few-Shot Object Detection. | Koshiro Nagano, Fumiaki Sato, Ryo Hachiuma, Kazuki Tsutsukawa, Taiki Sekii |
| 2025 | ICLR | SANER: Annotation-free Societal Attribute Neutralizer for Debiasing CLIP. | Yusuke Hirota, Min-Hung Chen, Chien-Yi Wang, Yuta Nakashima, Yu-Chiang Frank Wang, Ryo Hachiuma |
| 2025 | WACV | CrowdMAC: Masked Crowd Density Completion for Robust Crowd Density Forecasting. | Ryo Fujii, Ryo Hachiuma, Hideo Saito |
| 2024 | ECCV | Multimodal Cross-Domain Few-Shot Learning for Egocentric Action Recognition. | Masashi Hatano, Ryo Hachiuma, Ryo Fujii, Hideo Saito |
| 2024 | ECCV | EMAG: Ego-Motion Aware and Generalizable 2D Hand Forecasting from Egocentric Videos. | Masashi Hatano, Ryo Hachiuma, Hideo Saito |
| 2024 | EMNLP | From Descriptive Richness to Bias: Unveiling the Dark Side of Generative Image Caption Enrichment. | Yusuke Hirota, Ryo Hachiuma, Chao-Han Huck Yang, Yuta Nakashima |
| 2024 | ICASSP | Weakly Semi-Supervised Tool Detection in Minimally Invasive Surgery Videos. | Ryo Fujii, Ryo Hachiuma, Hideo Saito |
| 2024 | VR | OS-NeRF: Generalizable Novel View Synthesis for Occluded Open-Surgical Scenes. | Mana Masuda, Ryo Hachiuma, Hideo Saito, Hiroki Kajita, Yoshifumi Takatsume |
| 2023 | CVPR | Unified Keypoint-Based Action Recognition Framework via Structured Keypoint Pooling. | Ryo Hachiuma, Fumiaki Sato, Taiki Sekii |
| 2023 | CVPR | Prompt-Guided Zero-Shot Anomaly Action Recognition using Pretrained Deep Skeleton Features. | Fumiaki Sato, Ryo Hachiuma, Taiki Sekii |
| 2022 | ISVC | Transformer Networks for Future Person Localization in First-Person Videos. | Amar Alikadic, Hideo Saito, Ryo Hachiuma |
| 2021 | ICIP | Silhouette-Based Synthetic Data Generation For 3D Human Pose Estimation With A Single Wrist-Mounted 360° Camera. | Ryosuke Hori, Ryo Hachiuma, Hideo Saito, Mariko Isogawa, Dan Mikami |
| 2021 | ICIP | Toward Unsupervised 3d Point Cloud Anomaly Detection Using Variational Autoencoder. | Mana Masuda, Ryo Hachiuma, Ryo Fujii, Hideo Saito, Yusuke Sekikawa |
| 2020 | ICPR | Single-modal Incremental Terrain Clustering from Self-Supervised Audio-Visual Feature Learning. | Reina Ishikawa, Ryo Hachiuma, Akiyoshi Kurobe, Hideo Saito |
| 2020 | ICPR | Audio-Visual Hybrid Approach for Filling Mass Estimation. | Reina Ishikawa, Yuichi Nagao, Ryo Hachiuma, Hideo Saito |
| 2020 | ISMAR | LCR-SMPL: Toward Real-time Human Detection and 3D Reconstruction from a Single RGB Image. | Elena Pea-Tapia, Ryo Hachiuma, Antoine Pasquali, Hideo Saito |
| 2020 | ISVC | Unsupervised Anomaly Detection of the First Person in Gait from an Egocentric Camera. | Mana Masuda, Ryo Hachiuma, Ryo Fujii, Hideo Saito |
| 2020 | MICCAI | Deep Selection: A Fully Supervised Camera Selection Network for Surgery Recordings. | Ryo Hachiuma, Tomohiro Shimizu, Hideo Saito, Hiroki Kajita, Yoshifumi Takatsume |
| 2019 | BMVC | DetectFusion: Detecting and Segmenting Both Known and Unknown Dynamic Objects in Real-time SLAM. | Ryo Hachiuma, Christian Pirchheim, Dieter Schmalstieg, Hideo Saito |
| 2019 | ISMAR | Joint Inpainting of RGB and Depth Images by Generative Adversarial Network with a Late Fusion Approach. | Ryo Fujii, Ryo Hachiuma, Hideo Saito |
| 2019 | ISMAR | Volumetric Representation of Human Body Parts Using Superquadrics. | Ryo Hachiuma, Hideo Saito |
| 2016 | VR | Recognition and pose estimation of primitive shapes from depth images for spatial augmented reality. | Ryo Hachiuma, Hideo Saito |