| 2024 | Prompt Highlighter: Interactive Control for Multi-Modal LLMs. | Yuechen Zhang, Shengju Qian, Bohao Peng, Shu Liu, Jiaya Jia |
| 2024 | An Effective Ensemble Learning Framework for Affective Behaviour Analysis. | Wei Zhang, Feng Qiu, Chen Liu, Lincheng Li, Heming Du, Tianchen Guo, Xin Yu |
| 2024 | Degrees of Freedom Matter: Inferring Dynamics from Point Trajectories. | Yan Zhang, Sergey Prokudin, Marko Mihajlovic, Qianli Ma, Siyu Tang |
| 2024 | ImageNet-D: Benchmarking Neural Network Robustness on Diffusion Synthetic Object. | Chenshuang Zhang, Fei Pan, Junmo Kim, In So Kweon, Chengzhi Mao |
| 2024 | CoDISP: Exploring Compressed Domain Camera ISP with RGB-guided Encoder. | Molin Zhang, Soumendu Majee, Chengyu Wang, Seok-Jun Lee, Hamid R. Sheikh |
| 2024 | Groundhog Grounding Large Language Models to Holistic Segmentation. | Yichi Zhang, Ziqiao Ma, Xiaofeng Gao, Suhaila Shakiah, Qiaozi Gao, Joyce Chai |
| 2024 | GoodSAM: Bridging Domain and Capacity Gaps via Segment Anything Model for Distortion-Aware Panoramic Semantic Segmentation. | Weiming Zhang, Yexin Liu, Xu Zheng, Lin Wang |
| 2024 | HumanRef: Single Image to 3D Human Generation via Reference-Guided Diffusion. | Jingbo Zhang, Xiaoyu Li, Qi Zhang, Yanpei Cao, Ying Shan, Jing Liao |
| 2024 | Focusing on What Matters: Fine-grained Medical Activity Recognition for Trauma Resuscitation via Actor Tracking. | Wenjin Zhang, Keyi Li, Sen Yang, Sifan Yuan, Ivan Marsic, Genevieve J. Sippel, Mary S. Kim, Randall S. Burd |
| 2024 | EditGuard: Versatile Image Watermarking for Tamper Localization and Copyright Protection. | Xuanyu Zhang, Runyi Li, Jiwen Yu, Youmin Xu, Weiqi Li, Jian Zhang |
| 2024 | MM-Narrator: Narrating Long-form Videos with Multimodal In-Context Learning. | Chaoyi Zhang, Kevin Lin, Zhengyuan Yang, Jianfeng Wang, Linjie Li, Chung-Ching Lin, Zicheng Liu, Lijuan Wang |
| 2024 | Bi-Causal: Group Activity Recognition via Bidirectional Causality. | Youliang Zhang, Wenxuan Liu, Danni Xu, Zhuo Zhou, Zheng Wang |
| 2024 | C3Net: Compound Conditioned ControlNet for Multimodal Content Generation. | Juntao Zhang, Yuehuai Liu, Yu-Wing Tai, Chi-Keung Tang |
| 2024 | TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models. | Zhongwei Zhang, Fuchen Long, Yingwei Pan, Zhaofan Qiu, Ting Yao, Yang Cao, Tao Mei |
| 2024 | Residual Learning in Diffusion Models. | Junyu Zhang, Daochang Liu, Eunbyung Park, Shichao Zhang, Chang Xu |
| 2024 | Decoupled Pseudo-Labeling for Semi-Supervised Monocular 3D Object Detection. | Jiacheng Zhang, Jiaming Li, Xiangru Lin, Wei Zhang, Xiao Tan, Junyu Han, Errui Ding, Jingdong Wang, Guanbin Li |
| 2024 | Towards CLIP-Driven Language-Free 3D Visual Grounding via 2D-3D Relational Enhancement and Consistency. | Yuqi Zhang, Han Luo, Yinjie Lei |
| 2024 | Layout-Agnostic Scene Text Image Synthesis with Diffusion Models. | Qilong Zhangli, Jindong Jiang, Di Liu, Licheng Yu, Xiaoliang Dai, Ankit Ramchandani, Guan Pang, Dimitris N. Metaxas, Praveen Krishnan |
| 2024 | CaKDP: Category-Aware Knowledge Distillation and Pruning Framework for Lightweight 3D Object Detection. | Haonan Zhang, Longjun Liu, Yuqi Huang, Zhao Yang, Xinyu Lei, Bihan Wen |
| 2024 | An Upload-Efficient Scheme for Transferring Knowledge From a Server-Side Pre-trained Generator to Clients in Heterogeneous Federated Learning. | Jianqing Zhang, Yang Liu, Yang Hua, Jian Cao |
| 2024 | DeMatch: Deep Decomposition of Motion Field for Two-View Correspondence Learning. | Shihua Zhang, Zizhuo Li, Yuan Gao, Jiayi Ma |
| 2024 | CSCO: Connectivity Search of Convolutional Operators. | Tunhou Zhang, Shiyu Li, Hsin-Pai Cheng, Feng Yan, Hai Li, Yiran Chen |
| 2024 | DiaLoc: An Iterative Approach to Embodied Dialog Localization. | Chao Zhang, Mohan Li, Ignas Budvytis, Stephan Liwicki |
| 2024 | Improving Training Efficiency of Diffusion Models via Multi-Stage Framework and Tailored Multi-Decoder Architecture. | Huijie Zhang, Yifu Lu, Ismail Alkhouri, Saiprasad Ravishankar, Dogyoon Song, Qing Qu |
| 2024 | Revisiting the Domain Shift and Sample Uncertainty in Multi-source Active Domain Transfer. | Wenqiao Zhang, Zheqi Lv |