| 2025 | A Multi-aspect Multi-granularity Pronunciation Assessment Method Based on Branchformer Encoder and Hierarchical Aggregation. | Wenxu Du, Aishan Wumaier, Yahui Shi, Nian Yi, Dehua Liu |
| 2025 | Modality-Specific Hashing: Transform Cross-Modal Retrieval Into Single-Modal Retrieval. | Guohui Ding, Zhonghua Li, Yongqiang Ren |
| 2025 | Using Language Models to Generate and Forget the Narrative Memories of an Assistive Robot. | Angel F. Garcia Contreras, Wen-Yu Chang, Seiya Kawano, Yun-Nung Chen, Koichiro Yoshino |
| 2025 | CleverFox: Integrating Visual Mnemonics with AI for Enhanced Language Learning. | Yung-Chu Chiang, Zi-Xian Tang, Yi-Ching Luo, Jason S. Chang |
| 2025 | Uncertainty-Guided Joint Semi-supervised Segmentation and Registration of Cardiac Images. | Junjian Chen, Xuan Yang |
| 2025 | Balancing Efficiency and Accuracy: An Analysis of Sampling for Video Copy Detection. | Xiangyu Chen, Shin'ichi Satoh |
| 2025 | A Dual-Branch Model for Color Constancy. | Zhaoxin Chen, Bo Ma |
| 2025 | Grounding Deliberate Reasoning in Multimodal Large Language Models. | Jiaxing Chen, Yuxuan Liu, Dehu Li, Xiang An, Weimo Deng, Ziyong Feng, Yongle Zhao, Yin Xie |
| 2025 | Cross-View Geo-Localization via Learning Correspondence Semantic Similarity Knowledge. | Guanli Chen, Guoheng Huang, Xiaochen Yuan, Xuhang Chen, Guo Zhong, Chi-Man Pun |
| 2025 | Skin-Adapter: Fine-Grained Skin-Color Preservation for Text-to-Image Generation. | Zhuowei Chen, Mengqi Huang, Nan Chen, Zhendong Mao |
| 2025 | Interactive Video Search with Multi-modal LLM Video Captioning. | Yu-Tong Cheng, Jiaxin Wu, Zhixin Ma, Jiangshan He, Xiao-Yong Wei, Chong-Wah Ngo |
| 2025 | MPPQNet: A Moment-Preserving Product Quantization Neural Network for Progressive 3D Point Cloud Transmission. | Shyi-Chyi Cheng, Yen-Lin Chen, Shih-Yu Li |
| 2025 | HCV: Lightweight Hybrid CNN-Vision Transformer for Visual Object Tracking. | Liang-Chia Chen, Wei-Ta Chu |
| 2025 | SPLGAN-TTS: Learning Semantic and Prosody to Enhance the Text-to-Speech Quality of Lightweight GAN Models. | Ding-Chi Chang, Shiou-Chi Li, Jen-Wei Huang |
| 2025 | Understanding the Roles of Visual Modality in Multimodal Dialogue: An Empirical Study. | Qian Cao, Ruihua Song, Xu Chen |
| 2025 | MLP-AMDC: A MLP Architecture for Adaptive-Mask-Based Dual-Camera Snapshot Hyperspectral Imaging. | Zeyu Cai, Can Zhang, Yuchong Chen, Xunhao Chen, Jiming Yang, Wubin Shi, Feipeng Da, Chengqian Jin |
| 2025 | Pubic Symphysis-Fetal Head Segmentation Network Using BiFormer Attention Mechanism and Multipath Dilated Convolution. | Pengzhou Cai, Lu Jiang, Yanxin Li, Xiaojuan Liu, Libin Lan |
| 2025 | Better Image Segmentation with Classification: Guiding Zero-Shot Models Using Class Activation Maps. | Hanna Borgli, Hkon Kvale Stensland, Pl Halvorsen |
| 2025 | Synchronization and Calibration of Video Sequences Acquired Using Multiple Plenoptic 2.0 Cameras. | Daniele Bonatto, Sarah Fachada, Jaime Sancho, Eduardo Jurez, Gauthier Lafruit, Mehrdad Teratani |
| 2025 | MediaMix: Multimedia Retrieval in Mixed Reality. | Rahel Arnold, Rahel Kempf, Raphael Waltenspl, Heiko Schuldt |
| 2025 | Image-Generation AI Model Retrieval by Contrastive Learning-Based Style Distance Calculation. | Vu Thi Ngoc Anh, Yoshiyuki Shoji, Yuma Oe, Huu-Long Pham, Hiroaki Ohshima |
| 2025 | Modeling High-Order Relationships Between Human and Video for Emotion Recognition in Video Learning. | Hanxu Ai, Xiaomei Tao, Xingbing Li, Yanling Gan |
| 2024 | MRHF: Multi-stage Retrieval and Hierarchical Fusion for Textbook Question Answering. | Peide Zhu, Zhen Wang, Manabu Okumura, Jie Yang |
| 2024 | Advancing Incremental Few-Shot Semantic Segmentation via Semantic-Guided Relation Alignment and Adaptation. | Yuan Zhou, Xin Chen, Yanrong Guo, Jun Yu, Richang Hong, Qi Tian |
| 2024 | Localization and Local Motion Magnification of Pulsatile Regions in Endoscopic Surgery Videos. | Honglei Zheng, Wenkang Fan, Yinran Chen, Xiongbiao Luo |