| 2025 | CVPR | UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding. | Yang Jiao, Haibo Qiu, Zequn Jie, Shaoxiang Chen, Jingjing Chen, Lin Ma, Yu-Gang Jiang |
| 2024 | AAAI | Instance-Aware Multi-Camera 3D Object Detection with Structural Priors Mining and Self-Boosting Learning. | Yang Jiao, Zequn Jie, Shaoxiang Chen, Lechao Cheng, Jingjing Chen, Lin Ma, Yu-Gang Jiang |
| 2024 | ECCV | Making Large Language Models Better Planners with Reasoning-Decision Alignment. | Zhijian Huang, Tao Tang, Shaoxiang Chen, Sihao Lin, Zequn Jie, Lin Ma, Guangrun Wang, Xiaodan Liang |
| 2023 | CVPR | MSMDFusion: Fusing LiDAR and Camera at Multiple Scales with Multi-Depth Seeds for 3D Object Detection. | Yang Jiao, Zequn Jie, Shaoxiang Chen, Jingjing Chen, Lin Ma, Yu-Gang Jiang |
| 2022 | ECCV | MORE: Multi-Order RElation Mining for Dense Captioning in 3D Scenes. | Yang Jiao, Shaoxiang Chen, Zequn Jie, Jingjing Chen, Lin Ma, Yu-Gang Jiang |
| 2021 | CVPR | Towards Bridging Event Captioner and Sentence Localizer for Weakly Supervised Dense Event Captioning. | Shaoxiang Chen, Yu-Gang Jiang |
| 2021 | ICCV | Motion Guided Region Message Passing for Video Captioning. | Shaoxiang Chen, Yu-Gang Jiang |
| 2020 | ECCV | Hierarchical Visual-Textual Graph for Temporal Activity Localization via Language. | Shaoxiang Chen, Yu-Gang Jiang |
| 2020 | ECCV | Learning Modality Interaction for Temporal Sentence Localization and Event Captioning in Videos. | Shaoxiang Chen, Wenhao Jiang, Wei Liu, Yu-Gang Jiang |
| 2019 | AAAI | Motion Guided Spatial Attention for Video Captioning. | Shaoxiang Chen, Yu-Gang Jiang |
| 2019 | AAAI | Semantic Proposal for Activity Localization in Videos via Sentence Query. | Shaoxiang Chen, Yu-Gang Jiang |
| 2019 | IJCAI | Deep Learning for Video Captioning: A Review. | Shaoxiang Chen, Ting Yao, Yu-Gang Jiang |
| 2018 | ECCV | Non-local NetVLAD Encoding for Video Classification. | Yongyi Tang, Xing Zhang, Jingwen Wang, Shaoxiang Chen, Lin Ma, Yu-Gang Jiang |
| 2018 | MICCAI | ESU-P-Net: Cascading Network for Full Quantification of Left Ventricle from Cine MRI. | Wenjun Yan, Yuanyuan Wang, Shaoxiang Chen, Rob J. van der Geest, Qian Tao |