| 2025 | FGU3R: Fine-Grained Fusion via Unified 3D Representation for Multimodal 3D Object Detection. | Guoxin Zhang, Ziying Song, Lin Liu, Zhonghong Ou |
| 2025 | Predicting Compact Phrasal Rewrites with Large Language Models for ASR Post Editing. | Hao Zhang, Felix Stahlberg, Shankar Kumar |
| 2025 | Edge-interaction Mamba Network for MRI Brain Tumor Segmentation. | Muqing Zhang, Qiule Sun, Yutong Han, Jianxin Zhang |
| 2025 | Multi-Task Joint 3D Swin Transformer Learning for Segmentation and Classification of Hyperspectral Medicine Images. | Dong Zhang, Meijun Sun |
| 2025 | Stable Test-Time Training for Semantic Segmentation with Output Contrastive Loss. | Yunlong Zhang, Zhongyi Shui, Honglin Li, Yuxuan Sun, Chenglu Zhu, Lin Yang |
| 2025 | MPNAS: Multimodal Sentiment Analysis Pruning via Neural Architecture Search. | Binyan Zhang, Ao Ren, Zihao Zhang, Moming Duan, Duo Liu, Yujuan Tan, Kan Zhong |
| 2025 | BeatKAN: An Efficient and Drum-Attuned Beat Tracking Method Using Kolmogorov-Arnold Networks. | Zhicheng Zhang, Ganghui Ru, Wei Li |
| 2025 | Lightweight Self-Supervised Monocular Depth Estimation for All-Day Scenes Using Generative Adversarial Network. | Junding Zhang, Di Rao, Youssef Akoudad, Wei Gao, Jie Chen |
| 2025 | Efficient Prototypical Classifier for Class-Incremental Learning. | Wei Zhang, Jingyang Qiao, Yuan Xie, Zhizhong Zhang, Xin Tan |
| 2025 | VisTa: Visual-contextual and Text-augmented Zero-shot Object-level OOD Detection. | Bin Zhang, Xiaoyang Qu, Guokuan Li, Jiguang Wan, Jianzong Wang |
| 2025 | Spatial-Frequency Information Interaction Diffusion for SAR Colorization. | Xupei Zhang, Hanlin Qin, Jingjing Li, Jinni Geng, Zihan Gao, Yue Yu |
| 2025 | SwapTalk: Audio-Driven Talking Face Generation with One-Shot Customization in Latent Space. | Zeren Zhang, Haibo Qin, Jiayu Huang, Jo-Ku Cheng, Yixin Li, Hui Lin, Yitao Duan, Jinwen Ma |
| 2025 | GSMM: Efficient Global Sparsification for Resource-Conscious Multimodal Models. | Wenlun Zhang, Haoran Pang, Yucai Zhou, Shixiao Wang, Luking Li |
| 2025 | LMFCA-Net: A Lightweight Model for Multi-Channel Speech Enhancement with Efficient Narrow-Band and Cross-Band Attention. | Yaokai Zhang, Hanchen Pei, Wanqi Wang, Gongping Huang |
| 2025 | Diffusion based Text-to-Music Generation with Global and Local Text based Conditioning. | Jisi Zhang, Pablo Peso Parada, Md Asif Jalal, Karthikeyan Saravanan |
| 2025 | Calibration of Multiple Asynchronous Microphone Arrays using Hybrid TDOA. | Chengjie Zhang, Wenda Pan, Xinyang Han, He Kong |
| 2025 | Bridging Modality Gap with Large Speech and Language Models for End-to-End Speech-to-Text Translation. | Weitai Zhang, Simran Naagar, Zhongyi Ye, Peiwang Tang, Xinyuan Zhou, Junhua Liu, Lirong Dai |
| 2025 | Rethinking Mamba in Speech Processing by Self-Supervised Models. | Xiangyu Zhang, Jianbo Ma, Mostafa Shahin, Beena Ahmed, Julien Epps |
| 2025 | Partial Reconstruction Error for Deepfake Detection. | Yufei Zhang, Zheling Meng, Bo Peng, Jing Dong, Beilin Chu, Wei Wang |
| 2025 | Accurate Hardware Trojan Detection for SGIN Device: A Prompt-Tuning and LangChain Approach. | Duo Zhang, Ming Mao, Yunchuan Guo, Fenghua Li, Daiyong Quan |
| 2025 | Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance. | Beiyuan Zhang, Yue Ma, Chunlei Fu, Xinyang Song, Zhenan Sun, Ziqiang Li |
| 2025 | Audiogram-Informed End-to-End Noise Reduction and Wide Dynamic Range Compression for Hearing Aids. | Huiyong Zhang, Brian C. J. Moore, Lingling Dai, Fengyuan Hao, Xiaodong Li, Chengshi Zheng |
| 2025 | Principal Curvatures Estimation with Applications to Single Cell Data. | Yanlei Zhang, Lydia Mezrag, Xingzhi Sun, Charles Xu, Kincaid MacDonald, Dhananjay Bhaskar, Smita Krishnaswamy, Guy Wolf, Bastian Rieck |
| 2025 | Retinex-Based Self-Conditioned Diffusion Model for Low-Light Image Enhancement. | Jiawei Zhang, Ziwen Li, Jinpu Zhang, Yuehuan Wang |
| 2025 | AgentPose: Progressive Distribution Alignment via Feature Agent for Human Pose Distillation. | Feng Zhang, Jinwei Liu, Xiatian Zhu, Lei Chen |