Skip to content

Di Hu

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

51

Venues

22

Active years

2013–2025

Best venue rank

A*

Where they publish

Papers

51 indexed papers, newest first.

YearVenueTitleAuthors
2025ACLTowards Effective and Efficient Continual Pre-training of Large Language Models.Jie Chen, Zhipeng Chen, Jiapeng Wang, Kun Zhou, Yutao Zhu, Jinhao Jiang, Yingqian Min, Xin Zhao, Zhicheng Dou, Jiaxin Mao, Yankai Lin, Ruihua Song, Jun Xu, Xu Chen, Rui Yan, Zhewei Wei, Di Hu, Wenbing Huang, Ji-Rong Wen
2025CVPRCrab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation.Henghui Du, Guangyao Li, Chang Zhou, Chunjie Zhang, Alan Zhao, Di Hu
2025CVPRAdaptive Unimodal Regulation for Balanced Multimodal Information Acquisition.Chengxiang Huang, Yake Wei, Zequn Yang, Di Hu
2025CVPRPatch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception.Ruotian Peng, Haiying He, Yake Wei, Yandong Wen, Di Hu
2025CVPRPhoenix: A Motion-based Self-Reflection Framework for Fine-grained Robotic Action Correction.Wenke Xia, Ruoxuan Feng, Dong Wang, Di Hu
2025ICLRAnyTouch: Learning Unified Static-Dynamic Representation across Multiple Visuo-tactile Sensors.Ruoxuan Feng, Jiangyu Hu, Wenke Xia, Tianci Gao, Ao Shen, Yuhao Sun, Bin Fang, Di Hu
2025ICMLRollingQ: Reviving the Cooperation Dynamics in Multimodal Transformer.Haotian Ni, Yake Wei, Hang Liu, Gong Chen, Chong Peng, Hao Lin, Di Hu
2025ICMLEfficient Quantification of Multimodal Interaction at Sample Level.Zequn Yang, Hongfa Wang, Di Hu
2025SIGIRMGIPF: Multi-Granularity Interest Prediction Framework for Personalized Recommendation.Ruoxuan Feng, Zhen Tian, Qiushi Peng, Jiaxin Mao, Wayne Xin Zhao, Di Hu, Changwang Zhang
2024AAAIPrompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer.Yaoting Wang, Weisong Liu, Guangyao Li, Jian Ding, Di Hu, Xi Li
2024AAAISphereDiffusion: Spherical Geometry-Aware Distortion Resilient Diffusion Model.Tao Wu, Xuewei Li, Zhongang Qi, Di Hu, Xintao Wang, Ying Shan, Xi Li
2024CoRLPlay to the Score: Stage-Guided Dynamic Multi-Sensory Fusion for Robotic Manipulation.Ruoxuan Feng, Di Hu, Wenke Ma, Xuelong Li
2024CoRLKOI: Accelerating Online Imitation Learning via Hybrid Key-state Guidance.Jingxian Lu, Wenke Xia, Dong Wang, Zhigang Wang, Bin Zhao, Di Hu, Xuelong Li
2024CVPREnhancing Multimodal Cooperation via Sample-Level Modality Valuation.Yake Wei, Ruoxuan Feng, Zihe Wang, Di Hu
2024ECCVStepping Stones: A Progressive Training Strategy for Audio-Visual Semantic Segmentation.Juncheng Ma, Peiwen Sun, Yaoting Wang, Di Hu
2024ECCVCan Textual Semantics Mitigate Sounding Object Segmentation Preference?Yaoting Wang, Peiwen Sun, Yuanchao Li, Honggang Zhang, Di Hu
2024ECCVRef-AVS: Refer and Segment Objects in Audio-Visual Scenes.Yaoting Wang, Peiwen Sun, Dongzhan Zhou, Guangyao Li, Honggang Zhang, Di Hu
2024ECCVDiagnosing and Re-learning for Balanced Multimodal Learning.Yake Wei, Siwei Li, Ruoxuan Feng, Di Hu
2024ICLRQuantifying and Enhancing Multi-modal Robustness with Modality Preference.Zequn Yang, Yake Wei, Ce Liang, Di Hu
2024ICMLMMPareto: Boosting Multimodal Learning with Innocent Unimodal Assistance.Yake Wei, Di Hu
2024IROSDepth Helps: Improving Pre-trained RGB-based Policy with Depth Information Injection.Xincheng Pang, Wenke Xia, Zhigang Wang, Bin Zhao, Di Hu, Dong Wang, Xuelong Li
2024ICRAKinematic-aware Prompting for Generalizable Articulated Object Manipulation with LLMs.Wenke Xia, Dong Wang, Xincheng Pang, Zhigang Wang, Bin Zhao, Di Hu, Xuelong Li
2024ISMTwo-stage instrument timbre transfer method using RAVE.Di Hu, Katunobu Ito
2023HealthComPersonalized-Enhanced Federated Learning on Heterogeneous Internet of Medical Things.Yi Lv, Lichen Yan, Puning Zhang, Di Hu, Shuman Shao
2023ICASSPMMCosine: Multi-Modal Cosine Loss Towards Balanced Audio-Visual Fine-Grained Learning.Ruize Xu, Ruoxuan Feng, Shi-Xiong Zhang, Di Hu
2023ICCVTowards Inadequately Pre-trained Models in Transfer Learning.Andong Deng, Xingjian Li, Di Hu, Tianyang Wang, Haoyi Xiong, Cheng-Zhong Xu
2023InterspeechMulti-Scale Attention for Audio Question Answering.Guangyao Li, Yixin Xu, Di Hu
2023WACVExploiting Visual Context Semantics for Sound Source Localization.Xinchi Zhou, Dongzhan Zhou, Di Hu, Hang Zhou, Wanli Ouyang
2023WACVSeCo: Separating Unknown Musical Visual Sounds with Consistency Guidance.Xinchi Zhou, Dongzhan Zhou, Wanli Ouyang, Hang Zhou, Di Hu
2022AAAIVisual Sound Localization in the Wild by Cross-Modal Interference Erasing.Xian Liu, Rui Qian, Hang Zhou, Di Hu, Weiyao Lin, Ziwei Liu, Bolei Zhou, Xiaowei Zhou
2022AAAISepFusion: Finding Optimal Fusion Structures for Visual Sound Separation.Dongzhan Zhou, Xinchi Zhou, Di Hu, Hang Zhou, Lei Bai, Ziwei Liu, Wanli Ouyang
2022CVPRLearning to Answer Questions in Dynamic Audio-Visual Scenarios.Guangyao Li, Yake Wei, Yapeng Tian, Chenliang Xu, Ji-Rong Wen, Di Hu
2022CVPRBalanced Multimodal Learning via On-the-fly Gradient Modulation.Xiaokang Peng, Yake Wei, Andong Deng, Dong Wang, Di Hu
2022ICONIPEntropy-minimization Mean Teacher for Source-Free Domain Adaptive Object Detection.Xing Wei, Ting Bai, Zhangling Duan, Ming Zhao, Chong Zhao, Yang Lu, Di Hu
2022ICONIPCross-domain Object Detection Model via Contrastive Learning with Style Transfer.Ming Zhao, Xing Wei, Yang Lu, Ting Bai, Chong Zhao, Lei Chen, Di Hu
2021AAAITemporal Relational Modeling with Self-Supervision for Action Segmentation.Dong Wang, Di Hu, Xingjian Li, Dejing Dou
2021CVPRUnsupervised Multi-Source Domain Adaptation for Person Re-Identification.Zechen Bai, Zhigang Wang, Jian Wang, Di Hu, Errui Ding
2021CVPRCyclic Co-Learning of Sounding Object Visual Grounding and Sound Separation.Yapeng Tian, Di Hu, Chenliang Xu
2020ECCVCross-Task Transfer for Geotagged Audiovisual Aerial Scene Recognition.Di Hu, Xuhong Li, Lichao Mou, Pu Jin, Dong Chen, Liping Jing, Xiaoxiang Zhu, Dejing Dou
2020ECCVMultiple Sound Sources Localization from Coarse to Fine.Rui Qian, Di Hu, Heinrich Dinkel, Mengyue Wu, Ning Xu, Weiyao Lin
2019ACMLMultivariate Time Series Prediction Based on Optimized Temporal Convolutional Networks with Stacked Auto-encoders.Yunxiao Wang, Zheng Liu, Di Hu, Mian Zhang
2019CVPRListen to the Image.Di Hu, Dong Wang, Xuelong Li, Feiping Nie, Qi Wang
2019CVPRDeep Multimodal Clustering for Unsupervised Audiovisual Learning.Di Hu, Feiping Nie, Xuelong Li
2019ICASSPDense Multimodal Fusion for Hierarchically Joint Representation.Di Hu, Chengze Wang, Feiping Nie, Xuelong Li
2018CGIGASDL: Geometric algebra-based spatial data description Language.Jiaying Lu, Di Hu, Tianyu Wang, Zhuo Zhang
2017AAAILarge Graph Hashing with Spectral Rotation.Xuelong Li, Di Hu, Feiping Nie
2017ICCVImage2song: Song Retrieval via Bridging Image Content and Lyric Words.Xuelong Li, Di Hu, Xiaoqiang Lu
2017ICNCAn approximate ripple-spreading algorithm to identify the k best paths.Xiao-Bing Hu, Ming-Kong Zhang, Di Hu
2016CECImproving the computational efficiency of ripple-spreading algorithm for the k shortest paths problem.Xiao-Bing Hu, Ming-Kong Zhang, Di Hu
2016CVPRTemporal Multimodal Learning in Audiovisual Speech Recognition.Di Hu, Xuelong Li, Xiaoqiang Lu
2013WSCTime-stepped, simulation-based scheduling system for large-scale industrial construction projects.Di Hu, Yasser Mohamed