| 2025 | ACL | Towards Effective and Efficient Continual Pre-training of Large Language Models. | Jie Chen, Zhipeng Chen, Jiapeng Wang, Kun Zhou, Yutao Zhu, Jinhao Jiang, Yingqian Min, Xin Zhao, Zhicheng Dou, Jiaxin Mao, Yankai Lin, Ruihua Song, Jun Xu, Xu Chen, Rui Yan, Zhewei Wei, Di Hu, Wenbing Huang, Ji-Rong Wen |
| 2025 | CVPR | Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation. | Henghui Du, Guangyao Li, Chang Zhou, Chunjie Zhang, Alan Zhao, Di Hu |
| 2025 | CVPR | Adaptive Unimodal Regulation for Balanced Multimodal Information Acquisition. | Chengxiang Huang, Yake Wei, Zequn Yang, Di Hu |
| 2025 | CVPR | Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception. | Ruotian Peng, Haiying He, Yake Wei, Yandong Wen, Di Hu |
| 2025 | CVPR | Phoenix: A Motion-based Self-Reflection Framework for Fine-grained Robotic Action Correction. | Wenke Xia, Ruoxuan Feng, Dong Wang, Di Hu |
| 2025 | ICLR | AnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors. | Ruoxuan Feng, Jiangyu Hu, Wenke Xia, Tianci Gao, Ao Shen, Yuhao Sun, Bin Fang, Di Hu |
| 2025 | ICML | RollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer. | Haotian Ni, Yake Wei, Hang Liu, Gong Chen, Chong Peng, Hao Lin, Di Hu |
| 2025 | ICML | Efficient Quantification of Multimodal Interaction at Sample Level. | Zequn Yang, Hongfa Wang, Di Hu |
| 2025 | SIGIR | MGIPF: Multi-Granularity Interest Prediction Framework for Personalized Recommendation. | Ruoxuan Feng, Zhen Tian, Qiushi Peng, Jiaxin Mao, Wayne Xin Zhao, Di Hu, Changwang Zhang |
| 2024 | AAAI | Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer. | Yaoting Wang, Weisong Liu, Guangyao Li, Jian Ding, Di Hu, Xi Li |
| 2024 | AAAI | SphereDiffusion: Spherical Geometry-Aware Distortion Resilient Diffusion Model. | Tao Wu, Xuewei Li, Zhongang Qi, Di Hu, Xintao Wang, Ying Shan, Xi Li |
| 2024 | CoRL | Play to the Score: Stage-Guided Dynamic Multi-Sensory Fusion for Robotic Manipulation. | Ruoxuan Feng, Di Hu, Wenke Ma, Xuelong Li |
| 2024 | CoRL | KOI: Accelerating Online Imitation Learning via Hybrid Key-state Guidance. | Jingxian Lu, Wenke Xia, Dong Wang, Zhigang Wang, Bin Zhao, Di Hu, Xuelong Li |
| 2024 | CVPR | Enhancing Multimodal Cooperation via Sample-Level Modality Valuation. | Yake Wei, Ruoxuan Feng, Zihe Wang, Di Hu |
| 2024 | ECCV | Stepping Stones: A Progressive Training Strategy for Audio-Visual Semantic Segmentation. | Juncheng Ma, Peiwen Sun, Yaoting Wang, Di Hu |
| 2024 | ECCV | Can Textual Semantics Mitigate Sounding Object Segmentation Preference? | Yaoting Wang, Peiwen Sun, Yuanchao Li, Honggang Zhang, Di Hu |
| 2024 | ECCV | Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes. | Yaoting Wang, Peiwen Sun, Dongzhan Zhou, Guangyao Li, Honggang Zhang, Di Hu |
| 2024 | ECCV | Diagnosing and Re-learning for Balanced Multimodal Learning. | Yake Wei, Siwei Li, Ruoxuan Feng, Di Hu |
| 2024 | ICLR | Quantifying and Enhancing Multi-modal Robustness with Modality Preference. | Zequn Yang, Yake Wei, Ce Liang, Di Hu |
| 2024 | ICML | MMPareto: Boosting Multimodal Learning with Innocent Unimodal Assistance. | Yake Wei, Di Hu |
| 2024 | IROS | Depth Helps: Improving Pre-trained RGB-based Policy with Depth Information Injection. | Xincheng Pang, Wenke Xia, Zhigang Wang, Bin Zhao, Di Hu, Dong Wang, Xuelong Li |
| 2024 | ICRA | Kinematic-aware Prompting for Generalizable Articulated Object Manipulation with LLMs. | Wenke Xia, Dong Wang, Xincheng Pang, Zhigang Wang, Bin Zhao, Di Hu, Xuelong Li |
| 2024 | ISM | Two-stage instrument timbre transfer method using RAVE. | Di Hu, Katunobu Ito |
| 2023 | HealthCom | Personalized-Enhanced Federated Learning on Heterogeneous Internet of Medical Things. | Yi Lv, Lichen Yan, Puning Zhang, Di Hu, Shuman Shao |
| 2023 | ICASSP | MMCosine: Multi-Modal Cosine Loss Towards Balanced Audio-Visual Fine-Grained Learning. | Ruize Xu, Ruoxuan Feng, Shi-Xiong Zhang, Di Hu |
| 2023 | ICCV | Towards Inadequately Pre-trained Models in Transfer Learning. | Andong Deng, Xingjian Li, Di Hu, Tianyang Wang, Haoyi Xiong, Cheng-Zhong Xu |
| 2023 | Interspeech | Multi-Scale Attention for Audio Question Answering. | Guangyao Li, Yixin Xu, Di Hu |
| 2023 | WACV | Exploiting Visual Context Semantics for Sound Source Localization. | Xinchi Zhou, Dongzhan Zhou, Di Hu, Hang Zhou, Wanli Ouyang |
| 2023 | WACV | SeCo: Separating Unknown Musical Visual Sounds with Consistency Guidance. | Xinchi Zhou, Dongzhan Zhou, Wanli Ouyang, Hang Zhou, Di Hu |
| 2022 | AAAI | Visual Sound Localization in the Wild by Cross-Modal Interference Erasing. | Xian Liu, Rui Qian, Hang Zhou, Di Hu, Weiyao Lin, Ziwei Liu, Bolei Zhou, Xiaowei Zhou |
| 2022 | AAAI | SepFusion: Finding Optimal Fusion Structures for Visual Sound Separation. | Dongzhan Zhou, Xinchi Zhou, Di Hu, Hang Zhou, Lei Bai, Ziwei Liu, Wanli Ouyang |
| 2022 | CVPR | Learning to Answer Questions in Dynamic Audio-Visual Scenarios. | Guangyao Li, Yake Wei, Yapeng Tian, Chenliang Xu, Ji-Rong Wen, Di Hu |
| 2022 | CVPR | Balanced Multimodal Learning via On-the-fly Gradient Modulation. | Xiaokang Peng, Yake Wei, Andong Deng, Dong Wang, Di Hu |
| 2022 | ICONIP | Entropy-minimization Mean Teacher for Source-Free Domain Adaptive Object Detection. | Xing Wei, Ting Bai, Zhangling Duan, Ming Zhao, Chong Zhao, Yang Lu, Di Hu |
| 2022 | ICONIP | Cross-domain Object Detection Model via Contrastive Learning with Style Transfer. | Ming Zhao, Xing Wei, Yang Lu, Ting Bai, Chong Zhao, Lei Chen, Di Hu |
| 2021 | AAAI | Temporal Relational Modeling with Self-Supervision for Action Segmentation. | Dong Wang, Di Hu, Xingjian Li, Dejing Dou |
| 2021 | CVPR | Unsupervised Multi-Source Domain Adaptation for Person Re-Identification. | Zechen Bai, Zhigang Wang, Jian Wang, Di Hu, Errui Ding |
| 2021 | CVPR | Cyclic Co-Learning of Sounding Object Visual Grounding and Sound Separation. | Yapeng Tian, Di Hu, Chenliang Xu |
| 2020 | ECCV | Cross-Task Transfer for Geotagged Audiovisual Aerial Scene Recognition. | Di Hu, Xuhong Li, Lichao Mou, Pu Jin, Dong Chen, Liping Jing, Xiaoxiang Zhu, Dejing Dou |
| 2020 | ECCV | Multiple Sound Sources Localization from Coarse to Fine. | Rui Qian, Di Hu, Heinrich Dinkel, Mengyue Wu, Ning Xu, Weiyao Lin |
| 2019 | ACML | Multivariate Time Series Prediction Based on Optimized Temporal Convolutional Networks with Stacked Auto-encoders. | Yunxiao Wang, Zheng Liu, Di Hu, Mian Zhang |
| 2019 | CVPR | Listen to the Image. | Di Hu, Dong Wang, Xuelong Li, Feiping Nie, Qi Wang |
| 2019 | CVPR | Deep Multimodal Clustering for Unsupervised Audiovisual Learning. | Di Hu, Feiping Nie, Xuelong Li |
| 2019 | ICASSP | Dense Multimodal Fusion for Hierarchically Joint Representation. | Di Hu, Chengze Wang, Feiping Nie, Xuelong Li |
| 2018 | CGI | GASDL: Geometric algebra-based spatial data description Language. | Jiaying Lu, Di Hu, Tianyu Wang, Zhuo Zhang |
| 2017 | AAAI | Large Graph Hashing with Spectral Rotation. | Xuelong Li, Di Hu, Feiping Nie |
| 2017 | ICCV | Image2song: Song Retrieval via Bridging Image Content and Lyric Words. | Xuelong Li, Di Hu, Xiaoqiang Lu |
| 2017 | ICNC | An approximate ripple-spreading algorithm to identify the k best paths. | Xiao-Bing Hu, Ming-Kong Zhang, Di Hu |
| 2016 | CEC | Improving the computational efficiency of ripple-spreading algorithm for the k shortest paths problem. | Xiao-Bing Hu, Ming-Kong Zhang, Di Hu |
| 2016 | CVPR | Temporal Multimodal Learning in Audiovisual Speech Recognition. | Di Hu, Xuelong Li, Xiaoqiang Lu |
| 2013 | WSC | Time-stepped, simulation-based scheduling system for large-scale industrial construction projects. | Di Hu, Yasser Mohamed |