| 2025 | EMNLP | Learning to Describe Implicit Changes: Noise-robust Pre-training for Image Difference Captioning. | Zixin Guo, Jiayang Sun, Tzu-Jui Julius Wang, Abduljalil Radman, Selen Pehlivan, Min Cao, Jorma Laaksonen |
| 2023 | SIGIR | PiTL: Cross-modal Retrieval with Weakly-supervised Vision-language Pre-training via Prompting. | Zixin Guo, Tzu-Jui Julius Wang, Selen Pehlivan, Abduljalil Radman, Jorma Laaksonen |
| 2023 | WACV | Learning by Hallucinating: Vision-Language Pre-training with Weak Supervision. | Tzu-Jui Julius Wang, Jorma Laaksonen, Tomas Langer, Heikki Arponen, Tom E. Bishop |
| 2022 | ICPR | Post-Attention Modulator for Dense Video Captioning. | Zixin Guo, Tzu-Jui Julius Wang, Jorma Laaksonen |
| 2022 | IJCNLP | CLIP4IDC: CLIP for Image Difference Captioning. | Zixin Guo, Tzu-Jui Julius Wang, Jorma Laaksonen |
| 2020 | BMVC | Tackling the Unannotated: Scene Graph Generation with Bias-Reduced Models. | Tzu-Jui Julius Wang, Selen Pehlivan, Jorma Laaksonen |
| 2019 | ICIP | A Multi-Task Bayesian Deep Neural Net for Detecting Life-Threatening Infant Incidents From Head Images. | Tzu-Jui Julius Wang, Jorma Laaksonen, Yi-Ping Liao, Bo-Zong Wu, Shih-Yun Shen |