| 2025 | Instance-Level Video Depth in Groups Beyond Occlusions. | Yuan Liang, Yang Zhou, Ziming Sun, Tianyi Xiang, Guiqing Li, Shengfeng He |
| 2025 | Fine-Grained Spatiotemporal Grounding on Egocentric Videos. | Shuo Liang, Yiwu Zhong, Zi-Yuan Hu, Yeyao Tao, Liwei Wang |
| 2025 | EventUPS: Uncalibrated Photometric Stereo Using an Event Camera. | Jinxiu Liang, Bohan Yu, Siqi Yang, Haotian Zhuang, Jieji Ren, Peiqi Duan, Boxin Shi |
| 2025 | UniDxMD: Towards Unified Representation for Cross-Modal Unsupervised Domain Adaptation in 3D Semantic Segmentation. | Zhengyin Liang, Hui Yin, Min Liang, Qianqian Du, Ying Yang, Hua Huang |
| 2025 | Towards Human-Like Virtual Beings: Simulating Human Behavior in 3D Scenes. | Chen Liang, Wenguan Wang, Yi Yang |
| 2025 | Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models. | Xiao Liang, Di Wang, Zhicheng Jiao, Ronghan Li, Pengfei Yang, Quan Wang, Tat-Seng Chua |
| 2025 | Dual Reciprocal Learning of Language-based Human Motion Understanding and Generation. | Chen Liang, Zhicheng Shi, Wenguan Wang, Yi Yang |
| 2025 | Unraveling the Smoothness Properties of Diffusion Models: A Gaussian Mixture Perspective. | Yingyu Liang, Zhizhou Sha, Zhenmei Shi, Zhao Song, Mingda Wan, Yufa Zhou |
| 2025 | ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations. | Tianming Liang, Kun-Yu Lin, Chaolei Tan, Jianguo Zhang, Wei-Shi Zheng, Jian-Fang Hu |
| 2025 | Gradient-Reweighted Adversarial Camouflage for Physical Object Detection Evasion. | Jiawei Liang, Siyuan Liang, Tianrui Lou, Ming Zhang, Wenjin Li, Dunqiu Fan, Xiaochun Cao |
| 2025 | Efficient Event Camera Data Pretraining with Adaptive Prompt Fusion. | Quanmin Liang, Qiang Li, Shuai Liu, Xinzi Cao, Jinyi Lu, Feidiao Yang, Wei Zhang, Kai Huang, Yonghong Tian |
| 2025 | WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image. | Yuci Liang, Xinheng Lyu, Wenting Chen, Meidan Ding, Jipeng Zhang, Xiangjian He, Song Wu, Xiaohan Xing, Sen Yang, Xiyue Wang, Linlin Shen |
| 2025 | Perspective-Invariant 3D Object Detection. | Ao Liang, Lingdong Kong, Dongyue Lu, Youquan Liu, Jian Fang, Huaici Zhao, Wei Tsang Ooi |
| 2025 | Superior and Pragmatic Talking Face Generation with Teacher-Student Framework. | Chao Liang, Jianwen Jiang, Tianyun Zhong, Gaojie Lin, Zhengkun Rong, Yongming Zhu, Jiaqi Yang, Xin Chen |
| 2025 | $\pi$-AVAS: Can Physics-Integrated Audio-Visual Modeling Boost Neural Acoustic Synthesis? | Susan Liang, Chao Huang, Yunlong Tang, Zeliang Zhang, Chenliang Xu |
| 2025 | Learning Dense Feature Matching via Lifting Single 2D Image to 3D Space. | Yingping Liang, Yutao Hu, Wenqi Shao, Ying Fu |
| 2025 | Spatial Alignment and Temporal Matching Adapter for Video-Radar Remote Physiological Measurement. | Qian Liang, Ruixu Geng, Jinbo Chen, Haoyu Wang, Yan Chen, Yang Hu |
| 2025 | DGTalker: Disentangled Generative Latent Space Learning for Audio-Driven Gaussian Talking Heads. | Xiaoxi Liang, Yanbo Fan, Qiya Yang, Xuan Wang, Wei Gao, Ge Li |
| 2025 | CrossCompanion: An Empathetic Real-Time Assistant Supporting Street Crossing for Low-Vision Users. | Jiazhao Liang, Yi Fang |
| 2025 | Diffusion Curriculum: Synthetic-to-Real Data Curriculum via Image-Guided Diffusion. | Yijun Liang, Shweta Bhardwaj, Tianyi Zhou |
| 2025 | Describe Anything: Detailed Localized Image and Video Captioning. | Long Lian, Yifan Ding, Yunhao Ge, Sifei Liu, Hanzi Mao, Boyi Li, Marco Pavone, Ming-Yu Liu, Trevor Darrell, Adam Yala, Yin Cui |
| 2025 | LLM Thought Divergence and Convergence for Dialogue-Based Image Generation Control. | Hui Li |
| 2025 | SD | Jiayi Li |
| 2025 | MCL for MLLMs: Benchmarking Forgetting in Task-Incremental Multimodal Learning. | Zichao Li |
| 2025 | AI vs. Human Moderators: A Comparative Evaluation of Multimodal LLMs in Content Moderation for Brand Safety. | Adi Levi, Or Levi, Sardhendu Mishra, Jonathan Morra |