| 2024 | PreLAR: World Model Pre-training with Learnable Action Representation. | Lixuan Zhang, Meina Kan, Shiguang Shan, Xilin Chen |
| 2024 | Weakly-Supervised 3D Hand Reconstruction with Knowledge Prior and Uncertainty Guidance. | Yufei Zhang, Jeffrey O. Kephart, Qiang Ji |
| 2024 | MATHVERSE: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems? | Renrui Zhang, Dongzhi Jiang, Yichi Zhang, Haokun Lin, Ziyu Guo, Pengshuo Qiu, Aojun Zhou, Pan Lu, Kai-Wei Chang, Yu Qiao, Peng Gao, Hongsheng Li |
| 2024 | GRACE: Graph-Based Contextual Debiasing for Fair Visual Question Answering. | Yifeng Zhang, Ming Jiang, Qi Zhao |
| 2024 | Learning Chain of Counterfactual Thought for Bias-Robust Vision-Language Reasoning. | Yifeng Zhang, Ming Jiang, Qi Zhao |
| 2024 | E3V-K5: An Authentic Benchmark for Redefining Video-Based Energy Expenditure Estimation. | Shengxuming Zhang, Lei Jin, Yifan Wang, Xinyu Wang, Xu Wen, Zunlei Feng, Mingli Song |
| 2024 | Large Motion Model for Unified Multi-modal Motion Generation. | Mingyuan Zhang, Daisheng Jin, Chenyang Gu, Fangzhou Hong, Zhongang Cai, Jingfang Huang, Chongzhi Zhang, Xinying Guo, Lei Yang, Ying He, Ziwei Liu |
| 2024 | To Generate or Not? Safety-Driven Unlearned Diffusion Models Are Still Easy to Generate Unsafe Images ... For Now. | Yimeng Zhang, Jinghan Jia, Xin Chen, Aochuan Chen, Yihua Zhang, Jiancheng Liu, Ke Ding, Sijia Liu |
| 2024 | LaPose: Laplacian Mixture Shape Modeling for RGB-Based Category-Level Object Pose Estimation. | Ruida Zhang, Ziqin Huang, Gu Wang, Chenyangguang Zhang, Yan Di, Xingxing Zuo, Jiwen Tang, Xiangyang Ji |
| 2024 | Omni6DPose: A Benchmark and Model for Universal 6D Object Pose Estimation and Tracking. | Jiyao Zhang, Weiyao Huang, Bo Peng, Mingdong Wu, Fei Hu, Zijian Chen, Bo Zhao, Hao Dong |
| 2024 | Masked Video and Body-Worn IMU Autoencoder for Egocentric Action Recognition. | Mingfang Zhang, Yifei Huang, Ruicong Liu, Yoichi Sato |
| 2024 | Pixel-GS: Density Control with Pixel-Aware Gradient for 3D Gaussian Splatting. | Zheng Zhang, Wenbo Hu, Yixing Lao, Tong He, Hengshuang Zhao |
| 2024 | Agent3D-Zero: An Agent for Zero-Shot 3D Understanding. | Sha Zhang, Di Huang, Jiajun Deng, Shixiang Tang, Wanli Ouyang, Tong He, Yanyong Zhang |
| 2024 | GaussianImage: 1000 FPS Image Representation and Compression by 2D Gaussian Splatting. | Xinjie Zhang, Xingtong Ge, Tongda Xu, Dailan He, Yan Wang, Hongwei Qin, Guo Lu, Jing Geng, Jun Zhang |
| 2024 | POA: Pre-training Once for Models of All Sizes. | Yingying Zhang, Xin Guo, Jiangwei Lao, Lei Yu, Lixiang Ru, Jian Wang, Guo Ye, Huimei He, Jingdong Chen, Ming Yang |
| 2024 | Learned Rate Control for Frame-Level Adaptive Neural Video Compression via Dynamic Neural Network. | Chenhao Zhang, Wei Gao |
| 2024 | Background Adaptation with Residual Modeling for Exemplar-Free Class-Incremental Semantic Segmentation. | Anqi Zhang, Guangyu Gao |
| 2024 | Physically Plausible Color Correction for Neural Radiance Fields. | Qi Zhang, Ying Feng, Hongdong Li |
| 2024 | General Geometry-Aware Weakly Supervised 3D Object Detection. | Guowen Zhang, Junsong Fan, Liyi Chen, Zhaoxiang Zhang, Zhen Lei, Lei Zhang |
| 2024 | GarmentAligner: Text-to-Garment Generation via Retrieval-Augmented Multi-level Corrections. | Shiyue Zhang, Zheng Chong, Xujie Zhang, Hanhui Li, Yuhao Cheng, Yiqiang Yan, Xiaodan Liang |
| 2024 | HiDiffusion: Unlocking Higher-Resolution Creativity and Efficiency in Pretrained Diffusion Models. | Shen Zhang, Zhaowei Chen, Zhenyu Zhao, Yuhao Chen, Yao Tang, Jiajun Liang |
| 2024 | Dyn-Adapter: Towards Disentangled Representation for Efficient Visual Recognition. | Yurong Zhang, Honghao Chen, Xinyu Zhang, Xiangxiang Chu, Li Song |
| 2024 | RodinHD: High-Fidelity 3D Avatar Generation with Diffusion Models. | Bowen Zhang, Yiji Cheng, Chunyu Wang, Ting Zhang, Jiaolong Yang, Yansong Tang, Feng Zhao, Dong Chen, Baining Guo |
| 2024 | Take a Step Back: Rethinking the Two Stages in Visual Reasoning. | Mingyu Zhang, Jiting Cai, Mingyu Liu, Yue Xu, Cewu Lu, Yong-Lu Li |
| 2024 | An Optimal Control View of LoRA and Binary Controller Design for Vision Transformers. | Chi Zhang, Jingpu Cheng, Qianxiao Li |