| 2024 | An Approach to Complex Visual Data Interpretation with Vision-Language Models. | Thanh-Son Nguyen, Viet-Tham Huynh, Van-Loc Nguyen, Minh-Triet Tran |
| 2024 | CrossPAR: Enhancing Pedestrian Attribute Recognition with Vision-Language Fusion and Human-Centric Pre-training. | Bach-Hoang Ngo, Si-Tri Ngo, Phu-Duc Le, Quang-Minh Phan, Minh-Triet Tran, Trung-Nghia Le |
| 2024 | HYPNOS: Highly Precise Foreground-Focused Diffusion Finetuning for Inanimate Objects. | Oliverio Theophilus Nathanael, Jonathan Samuel Lumentut, Nicholas Hans Muliawan, Edbert Valencio Angky, Felix Indra Kurniadi, Alfi Yusrotis Zakiyyah, Jeklin Harefa |
| 2024 | Improving Image Clustering with Artifacts Attenuation via Inference-Time Attention Engineering. | Kazumoto Nakamura, Yuji Nozawa, Yu-Chieh Lin, Kengo Nakata, Youyang Ng |
| 2024 | E2CANet: An Efficient and Effective Convolutional Attention Network for Semantic Segmentation. | Yuerong Mu, Qiang Guo |
| 2024 | Cross Feature Fusion of Fundus Image and Generated Lesion Map for Referable Diabetic Retinopathy Classification. | Dahyun Mok, Junghyun Bum, Duc-Tai Le, Hyunseung Choo |
| 2024 | U-ENHANCE: Underwater Image Enhancement Using Wavelet Triple Self-attention. | Priyanka Mishra, Santosh Kumar Vipparthi, Subrahmanyam Murala |
| 2024 | 3-D Reconstruction from Consecutive Endoscopic Images Using Gaussian Splatting. | Hung-Le Minh, Duy-Van Truong, Huy-Xuan Manh, Viet-Hang Dao, Phuc-Binh Nguyen, Thanh-Tung Nguyen, Hai Vu |
| 2024 | Masking Cascaded Self-attentions for Few-Shot Font-Generation Transformer. | Jing Ma, Xiang Xiang, Yan He |
| 2024 | Enhancing Visual Question Answering with Pre-trained Vision-Language Models: An Ensemble Approach at the LAVA Challenge 2024. | Trong-Hieu Nguyen Mau, Nhu-Binh Nguyen Truc, Nhu-Vinh Hoang, Minh-Triet Tran, Hai-Dang Nguyen |
| 2024 | Deneb: A Hallucination-Robust Automatic Evaluation Metric for Image Captioning. | Kazuki Matsuda, Yuiga Wada, Komei Sugiura |
| 2024 | NewMove: Customizing Text-to-Video Models with Novel Motions. | Joanna Materzynska, Josef Sivic, Eli Shechtman, Antonio Torralba, Richard Zhang, Bryan C. Russell |
| 2024 | ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes. | Hashmat Shadab Malik, Muhammad Huzaifa, Muzammal Naseer, Salman Khan, Fahad Khan |
| 2024 | Multiview Detection with Cardboard Human Modeling. | Jiahao Ma, Zicheng Duan, Liang Zheng, Chuong Nguyen |
| 2024 | Enhancing Photo Animation: Augmented Stylistic Modules and Prior Knowledge Integration. | Zhanyi Lu, Yue Zhou, Ao Chen |
| 2024 | Questioning, Answering, and Captioning for Zero-Shot Detailed Image Caption. | Duc-Tuan Luu, Viet-Tuan Le, Duc Minh Vo |
| 2024 | 3D Prompt Learning for RGB-D Tracking. | Bocen Li, Yunzhi Zhuge, Shan Jiang, Lijun Wang, Yifan Wang, Huchuan Lu |
| 2024 | Dessie: Disentanglement for Articulated 3D Horse Shape and Pose Estimation from Images. | Ci Li, Yi Yang, Zehang Weng, Elin Hernlund, Silvia Zuffi, Hedvig Kjellstrm |
| 2024 | Chinese Character Component Segmentation Based on Character Structure Masks. | Haiyan Li, Fang Yang |
| 2024 | COCA: Classifier-Oriented Calibration via Textual Prototype for Source-Free Universal Domain Adaptation. | Xinghong Liu, Yi Zhou |
| 2024 | TexDC: Text-Driven Disease-Aware 4D Cardiac Cine MRI Images Generation. | Cong Liu, Xiaohan Yuan, Zhipeng Yu, Yangang Wang |
| 2024 | GSMNet: Towards Long-Term Trajectory Prediction by Integrating Multi-scale Information. | Shaohua Liu, Yisu Wang, Yinglong Zhu, Pengfei Yao, Tianlu Mao, Zhaoqi Wang |
| 2024 | Pluggable Style Representation Learning for Multi-style Transfer. | Hongda Liu, Longguang Wang, Weijun Guan, Ye Zhang, Yulan Guo |
| 2024 | Stable Single-View 3D Human Digitization via Explicit Geometric Field with Semantic Guidance. | Ruizhi Liu, Paolo Remagnino |
| 2024 | NT-VOT211: A Large-Scale Benchmark for Night-Time Visual Object Tracking. | Yu Liu, Arif Mahmood, Muhammad Haris Khan |