| 2024 | ODTr: Transformer Integrating OCR Auxiliary Map and Image Depth Information for Document Image Unwarping. | Xiangyu Xie, Yuxuan Zhou, Liangcai Gao |
| 2024 | Tracking Model gdi-SAM2 for RGB, Depth, and Infrared Data. | Xinglin Xie, Kehuan Song, Kefan Chen |
| 2024 | Multimodal Drivers of Attention Interruption to Baby Product Video Ads. | Wen Xie, Lingfei Luan, Yanjun Zhu, Yakov Bart, Sarah Ostadabbas |
| 2024 | A Novel Encoder-Decoder Network with Multi-domain Information Fusion for Video Deblurring. | Peiqi Xie, Jinhong He, Chengyun Song, Minglong Xue |
| 2024 | Depth-Enhanced Alignment for Label-Free 3D Semantic Segmentation. | Shangjin Xie, Jiawei Feng, Zibo Chen, Zhixuan Liu, Wei-Shi Zheng |
| 2024 | ORA-Trans: Object Region Attention Transformer Based on Key Tokens Selector with Structure Feature Modeling for Fine-Grained Visual Classification. | Yulong Xia, Jianwei Zhang |
| 2024 | ConDGAD: Multi-augmentation Contrastive Learning for Dynamic Graph Anomaly Detection. | Siqi Xia, Sutharshan Rajasegarar, Lei Pan, Christopher Leckie, Sarah M. Erfani, Jeffrey Chan |
| 2024 | Conformer-Based Audio Visual Speech Recognition with Taylor Attention. | Yewei Xiao, Jian Huang, Xuanming Liu, Aosu Zhu |
| 2024 | Generalization Gap in Data Augmentation: Insights from Illumination. | Jianqiang Xiao, Weiwen Guo, Junfeng Liu, Mengze Li |
| 2024 | Harmonizing Regression-Classification Inconsistency for Task-Specific Decoupling in Underwater Object Detection. | Minrui Xiang, Tianyang Xu, Xiaojun Wu |
| 2024 | BotSCL: Heterophily-Aware Social Bot Detection with Supervised Contrastive Learning. | Qi Wu, Yingguang Yang, Buyun He, Hao Liu, Renyu Yang, Yong Liao |
| 2024 | Rethinking Attention Module Design for Point Cloud Analysis. | Chengzhi Wu, Kaige Wang, Zeyun Zhong, Hao Fu, Junwei Zheng, Jiaming Zhang, Julius Pfrommer, Jrgen Beyerer |
| 2024 | Merging Multiple Datasets for Improved Appearance-Based Gaze Estimation. | Liang Wu, Bertram E. Shi |
| 2024 | Nonlinear Progressive Denoising: A Universal Regularized Denoising Strategy for Low PSNR Images. | Ziyu Wu, Silong Peng |
| 2024 | Candidate Evaluation with Multimodal Data-Driven for Recruitment. | Xing Wu, Kehong Liu, Jianjia Wang, Junfeng Yao, Bin Deng, Rongqi Lv, Jun Song |
| 2024 | MRCI: Multi-range Context Interaction for Boundary Refinement in Image Segmentation. | Yaqiang Wu, Wanjun Lyu, Xianchen Liang, Qinghua Zheng, Jin Wei, Lianwen Jin |
| 2024 | Improving Multimodal Rumor Detection via Dynamic Graph Modeling. | Xinyu Wu, Xiaoxu Hu, Xugong Qin, Peng Zhang, Gangyan Zeng, Yu Guo, Runbo Zhao, Xinjian Huang |
| 2024 | Unsupervised Domain Adaptation for Cross-Device Iris Liveness Detection Model Transfer. | Xiuying Wu, Chenxi Du, Hui Zhang, Jing Liu, Dexin Zhang, Hang Zou |
| 2024 | STMAE: Spatial Temporal Masked Auto-Encoder for Traffic Forecasting. | Xing Wu, Chengyou Cai, Xiaoxiao Wang, Jianjia Wang, Junfeng Yao, Quan Qian, Jun Song |
| 2024 | Enhancing Multi-modal Object Detection with Data Augmentation, Focal Loss, and Model Ensembling. | Junyu Wu, Yuhao Chao, Jie Liu |
| 2024 | Goal-Driven Transformer for Robot Behavior Learning from Play Data. | Congcong Wen, Jiazhao Liang, Shuaihang Yuan, Hao Huang, Yu Hao, Hui Lin, Yu-Shen Liu, Yi Fang |
| 2024 | Zero-Shot Object Navigation with Vision-Language Models Reasoning. | Congcong Wen, Yisiyuan Huang, Hao Huang, Yanjia Huang, Shuaihang Yuan, Yu Hao, Hui Lin, Yu-Shen Liu, Yi Fang |
| 2024 | Facet-Aware Multimodal Summarization via Cross-Modal Alignment. | Yu Weng, Xuming Ye, Tianjiao Xing, Zheng Liu, Chaomurilige, Xuan Liu |
| 2024 | DereflectFormer: Vision Transformers for Single Image Reflection Removal. | Ao Wei, Hanbin Zhang, Erhu Zhao |
| 2024 | TVT: Training-Free Vision Transformer Search on Tiny Datasets. | Zimian Wei, Hengyue Pan, Lujun Li, Peijie Dong, Dongsheng Li |