Skip to content

Shizhe Chen

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

31

Venues

15

Active years

2015–2025

Best venue rank

A*

Where they publish

Papers

31 indexed papers, newest first.

YearVenueTitleAuthors
2025COLINGMuKA: Multimodal Knowledge Augmented Visual Information-Seeking.Lianghao Deng, Yuchong Sun, Shizhe Chen, Ning Yang, Yunfeng Wang, Ruihua Song
2025ICCVHORT: Monocular Hand-held Objects Reconstruction with Transformers.Zerui Chen, Rolandos Alexandros Potamias, Shizhe Chen, Cordelia Schmid
2025ICLRNextBestPath: Efficient 3D Mapping of Unseen Environments.Shiyao Li, Antoine Gudon, Clmentin Boittiaux, Shizhe Chen, Vincent Lepetit
2025ICRAViViDex: Learning Vision-Based Dexterous Manipulation from Human Videos.Zerui Chen, Shizhe Chen, Etienne Arlaud, Ivan Laptev, Cordelia Schmid
2025ICRATowards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-Guided 3D Policy.Ricardo Garcia, Shizhe Chen, Cordelia Schmid
2024CVPRSUGAR : Pre-training 3D Visual Representations for Robotics.Shizhe Chen, Ricardo Garcia, Ivan Laptev, Cordelia Schmid
2023ACLInfoMetIC: An Informative Metric for Reference-free Image Caption Evaluation.Anwen Hu, Shizhe Chen, Liang Zhang, Qin Jin
2023CoRLPolarNet: 3D Point Clouds for Language-Guided Robotic Manipulation.Shizhe Chen, Ricardo Garcia, Cordelia Schmid, Ivan Laptev
2023CVPRgSDF: Geometry-Driven Signed Distance Functions for 3D Hand-Object Reconstruction.Zerui Chen, Shizhe Chen, Cordelia Schmid, Ivan Laptev
2023ICCVExplore and Tell: Embodied Visual Captioning in 3D Environments.Anwen Hu, Shizhe Chen, Liang Zhang, Qin Jin
2023IROSObject Goal Navigation with Recursive Implicit Maps.Shizhe Chen, Thomas Chabal, Ivan Laptev, Cordelia Schmid
2023IROSRobust Visual Sim-to-Real Transfer for Robotic Manipulation.Ricardo Garcia, Robin Strudel, Shizhe Chen, Etienne Arlaud, Ivan Laptev, Cordelia Schmid
2022CoRLInstruction-driven history-aware policies for robotic manipulations.Pierre-Louis Guhur, Shizhe Chen, Ricardo Garcia, Makarand Tapaswi, Ivan Laptev, Cordelia Schmid
2022CVPRThink Global, Act Local: Dual-scale Graph Transformer for Vision-and-Language Navigation.Shizhe Chen, Pierre-Louis Guhur, Makarand Tapaswi, Cordelia Schmid, Ivan Laptev
2022CVPRVRDFormer: End-to-End Video Visual Relation Detection with Transformers.Sipeng Zheng, Shizhe Chen, Qin Jin
2022ECCVLearning from Unlabeled 3D Environments for Vision-and-Language Navigation.Shizhe Chen, Pierre-Louis Guhur, Makarand Tapaswi, Cordelia Schmid, Ivan Laptev
2022ECCVFew-Shot Action Recognition with Hierarchical Matching and Contrastive Learning.Sipeng Zheng, Shizhe Chen, Qin Jin
2021CVPRTowards Diverse Paragraph Captioning for Untrimmed Videos.Yuqing Song, Shizhe Chen, Qin Jin
2021CVPRSketch, Ground, and Refine: Top-Down Dense Video Captioning.Chaorui Deng, Shizhe Chen, Da Chen, Yuan He, Qi Wu
2021ICCVElaborative Rehearsal for Zero-shot Action Recognition.Shizhe Chen, Dong Huang
2021ICCVAirbert: In-domain Pretraining for Vision-and-Language Navigation.Pierre-Louis Guhur, Makarand Tapaswi, Shizhe Chen, Ivan Laptev, Cordelia Schmid
2020CVPRSay As You Wish: Fine-Grained Control of Image Caption Generation With Abstract Scene Graphs.Shizhe Chen, Qin Jin, Peng Wang, Qi Wu
2020CVPRFine-Grained Video-Text Retrieval With Hierarchical Graph Reasoning.Shizhe Chen, Yida Zhao, Qin Jin, Qi Wu
2019AAAIUnsupervised Bilingual Lexicon Induction from Mono-Lingual Multimodal Data.Shizhe Chen, Qin Jin, Alexander G. Hauptmann
2019EMNLPYouMakeup: A Large-Scale Domain-Specific Multimodal Dataset for Fine-Grained Semantic Comprehension.Weiying Wang, Yongcheng Wang, Shizhe Chen, Qin Jin
2019ICASSPCross-culture Multimodal Emotion Recognition with Adversarial Learning.Jingjun Liang, Shizhe Chen, Jinming Zhao, Qin Jin, Haibo Liu, Li Lu
2019IJCAIFrom Words to Sentences: A Progressive Learning Approach for Zero-resource Machine Translation with Visual Pivots.Shizhe Chen, Qin Jin, Jianlong Fu
2019InterspeechSpeech Emotion Recognition in Dyadic Dialogues with Attentive Interaction Modeling.Jinming Zhao, Shizhe Chen, Jingjun Liang, Qin Jin
2017ICMIEmotion recognition with multimodal features and temporal models.Shuai Wang, Wenxuan Wang, Jinming Zhao, Shizhe Chen, Qin Jin, Shilei Zhang, Yong Qin
2016ICMIVideo emotion recognition in the wild based on fusion of multimodal features.Shizhe Chen, Xinrui Li, Qin Jin, Shilei Zhang, Yong Qin
2015ICASSPSpeech emotion recognition with acoustic and lexical features.Qin Jin, Chengxin Li, Shizhe Chen, Huimin Wu