| 2026 | CHI | SeekUI: Predicting Visual Search Behavior on Graphical User Interfaces with a Reward-Augmented Vision Language Model. | Zixin Guo, Yue Jiang, Luis A. Leiva, Antti Oulasvirta |
| 2025 | EMNLP | Learning to Describe Implicit Changes: Noise-robust Pre-training for Image Difference Captioning. | Zixin Guo, Jiayang Sun, Tzu-Jui Julius Wang, Abduljalil Radman, Selen Pehlivan, Min Cao, Jorma Laaksonen |
| 2024 | ACCV | Diffusion-Based Multimodal Video Captioning. | Jaakko Kainulainen, Zixin Guo, Jorma Laaksonen |
| 2024 | ECCV | FastTalker: Jointly Generating Speech and Conversational Gestures from Text. | Zixin Guo, Jian Zhang |
| 2024 | ECCV | TexGen: Text-Guided 3D Texture Generation with Multi-view Sampling and Resampling. | Dong Huo, Zixin Guo, Xinxin Zuo, Zhihao Shi, Juwei Lu, Peng Dai, Songcen Xu, Li Cheng, Yee-Hong Yang |
| 2024 | UIST | EyeFormer: Predicting Personalized Scanpaths with Transformer-Guided Reinforcement Learning. | Yue Jiang, Zixin Guo, Hamed Rezazadegan Tavakoli, Luis A. Leiva, Antti Oulasvirta |
| 2023 | HCI | Designing a Robot for Enhancing Attention of Office Workers with the Heavily Use of Screen. | Zhiya Tan, Zhen Liu, Zixin Guo, Shiqi Gong |
| 2023 | SIGIR | PiTL: Cross-modal Retrieval with Weakly-supervised Vision-language Pre-training via Prompting. | Zixin Guo, Tzu-Jui Julius Wang, Selen Pehlivan, Abduljalil Radman, Jorma Laaksonen |
| 2022 | ICPR | Post-Attention Modulator for Dense Video Captioning. | Zixin Guo, Tzu-Jui Julius Wang, Jorma Laaksonen |
| 2022 | IJCNLP | CLIP4IDC: CLIP for Image Difference Captioning. | Zixin Guo, Tzu-Jui Julius Wang, Jorma Laaksonen |
| 2021 | AAAI | Global Fusion Attention for Vision and Language Understanding (Student Abstract). | Zixin Guo, Chen Liang, Ziyu Wan, Yang Bai |
| 2013 | ICIP | Graph-based multiple instance learning for action recognition. | Zixin Guo, Yang Yi |