| 2025 | COLING | MuKA: Multimodal Knowledge Augmented Visual Information-Seeking. | Lianghao Deng, Yuchong Sun, Shizhe Chen, Ning Yang, Yunfeng Wang, Ruihua Song |
| 2025 | ICCV | HORT: Monocular Hand-held Objects Reconstruction with Transformers. | Zerui Chen, Rolandos Alexandros Potamias, Shizhe Chen, Cordelia Schmid |
| 2025 | ICLR | NextBestPath: Efficient 3D Mapping of Unseen Environments. | Shiyao Li, Antoine Gudon, Clmentin Boittiaux, Shizhe Chen, Vincent Lepetit |
| 2025 | ICRA | ViViDex: Learning Vision-Based Dexterous Manipulation from Human Videos. | Zerui Chen, Shizhe Chen, Etienne Arlaud, Ivan Laptev, Cordelia Schmid |
| 2025 | ICRA | Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-Guided 3D Policy. | Ricardo Garcia, Shizhe Chen, Cordelia Schmid |
| 2024 | CVPR | SUGAR : Pre-training 3D Visual Representations for Robotics. | Shizhe Chen, Ricardo Garcia, Ivan Laptev, Cordelia Schmid |
| 2023 | ACL | InfoMetIC: An Informative Metric for Reference-free Image Caption Evaluation. | Anwen Hu, Shizhe Chen, Liang Zhang, Qin Jin |
| 2023 | CoRL | PolarNet: 3D Point Clouds for Language-Guided Robotic Manipulation. | Shizhe Chen, Ricardo Garcia, Cordelia Schmid, Ivan Laptev |
| 2023 | CVPR | gSDF: Geometry-Driven Signed Distance Functions for 3D Hand-Object Reconstruction. | Zerui Chen, Shizhe Chen, Cordelia Schmid, Ivan Laptev |
| 2023 | ICCV | Explore and Tell: Embodied Visual Captioning in 3D Environments. | Anwen Hu, Shizhe Chen, Liang Zhang, Qin Jin |
| 2023 | IROS | Object Goal Navigation with Recursive Implicit Maps. | Shizhe Chen, Thomas Chabal, Ivan Laptev, Cordelia Schmid |
| 2023 | IROS | Robust Visual Sim-to-Real Transfer for Robotic Manipulation. | Ricardo Garcia, Robin Strudel, Shizhe Chen, Etienne Arlaud, Ivan Laptev, Cordelia Schmid |
| 2022 | CoRL | Instruction-driven history-aware policies for robotic manipulations. | Pierre-Louis Guhur, Shizhe Chen, Ricardo Garcia, Makarand Tapaswi, Ivan Laptev, Cordelia Schmid |
| 2022 | CVPR | Think Global, Act Local: Dual-scale Graph Transformer for Vision-and-Language Navigation. | Shizhe Chen, Pierre-Louis Guhur, Makarand Tapaswi, Cordelia Schmid, Ivan Laptev |
| 2022 | CVPR | VRDFormer: End-to-End Video Visual Relation Detection with Transformers. | Sipeng Zheng, Shizhe Chen, Qin Jin |
| 2022 | ECCV | Learning from Unlabeled 3D Environments for Vision-and-Language Navigation. | Shizhe Chen, Pierre-Louis Guhur, Makarand Tapaswi, Cordelia Schmid, Ivan Laptev |
| 2022 | ECCV | Few-Shot Action Recognition with Hierarchical Matching and Contrastive Learning. | Sipeng Zheng, Shizhe Chen, Qin Jin |
| 2021 | CVPR | Towards Diverse Paragraph Captioning for Untrimmed Videos. | Yuqing Song, Shizhe Chen, Qin Jin |
| 2021 | CVPR | Sketch, Ground, and Refine: Top-Down Dense Video Captioning. | Chaorui Deng, Shizhe Chen, Da Chen, Yuan He, Qi Wu |
| 2021 | ICCV | Elaborative Rehearsal for Zero-shot Action Recognition. | Shizhe Chen, Dong Huang |
| 2021 | ICCV | Airbert: In-domain Pretraining for Vision-and-Language Navigation. | Pierre-Louis Guhur, Makarand Tapaswi, Shizhe Chen, Ivan Laptev, Cordelia Schmid |
| 2020 | CVPR | Say As You Wish: Fine-Grained Control of Image Caption Generation With Abstract Scene Graphs. | Shizhe Chen, Qin Jin, Peng Wang, Qi Wu |
| 2020 | CVPR | Fine-Grained Video-Text Retrieval With Hierarchical Graph Reasoning. | Shizhe Chen, Yida Zhao, Qin Jin, Qi Wu |
| 2019 | AAAI | Unsupervised Bilingual Lexicon Induction from Mono-Lingual Multimodal Data. | Shizhe Chen, Qin Jin, Alexander G. Hauptmann |
| 2019 | EMNLP | YouMakeup: A Large-Scale Domain-Specific Multimodal Dataset for Fine-Grained Semantic Comprehension. | Weiying Wang, Yongcheng Wang, Shizhe Chen, Qin Jin |
| 2019 | ICASSP | Cross-culture Multimodal Emotion Recognition with Adversarial Learning. | Jingjun Liang, Shizhe Chen, Jinming Zhao, Qin Jin, Haibo Liu, Li Lu |
| 2019 | IJCAI | From Words to Sentences: A Progressive Learning Approach for Zero-resource Machine Translation with Visual Pivots. | Shizhe Chen, Qin Jin, Jianlong Fu |
| 2019 | Interspeech | Speech Emotion Recognition in Dyadic Dialogues with Attentive Interaction Modeling. | Jinming Zhao, Shizhe Chen, Jingjun Liang, Qin Jin |
| 2017 | ICMI | Emotion recognition with multimodal features and temporal models. | Shuai Wang, Wenxuan Wang, Jinming Zhao, Shizhe Chen, Qin Jin, Shilei Zhang, Yong Qin |
| 2016 | ICMI | Video emotion recognition in the wild based on fusion of multimodal features. | Shizhe Chen, Xinrui Li, Qin Jin, Shilei Zhang, Yong Qin |
| 2015 | ICASSP | Speech emotion recognition with acoustic and lexical features. | Qin Jin, Chengxin Li, Shizhe Chen, Huimin Wu |