| 2026 | AAAI | Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling. | Hao Li, Shuai Yang, Yilun Chen, Xinyi Chen, Xiaoda Yang, Yang Tian, Hanqing Wang, Tai Wang, Dahua Lin, Feng Zhao, Jiangmiao Pang |
| 2026 | ACL | Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning. | Jiacheng Hua, Yishu Yin, Yuhang Wu, Tai Wang, Yifei Huang, Miao Liu |
| 2025 | CVPR | GENMANIP: LLM-driven Simulation for Generalizable Instruction-Following Manipulation. | Ning Gao, Yilun Chen, Shuai Yang, Xinyi Chen, Yang Tian, Hao Li, Haifeng Huang, Hanqing Wang, Tai Wang, Jiangmiao Pang |
| 2025 | CVPR | RoboGround: Robotic Manipulation with Grounded Vision-Language Priors. | Haifeng Huang, Xinyi Chen, Yilun Chen, Hao Li, Xiaoshen Han, Zehan Wang, Tai Wang, Jiangmiao Pang, Zhou Zhao |
| 2025 | EMNLP | Language-to-Space Programming for Training-Free 3D Visual Grounding. | Boyu Mi, Hanqing Wang, Tai Wang, Yilun Chen, Jiangmiao Pang |
| 2025 | ICCV | Gleam: Learning Generalizable Exploration Policy for Active Mapping in Complex 3D Indoor Scenes. | Xiao Chen, Tai Wang, Quanyi Li, Tao Huang, Jiangmiao Pang, Tianfan Xue |
| 2025 | ICCV | Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities. | Liuyi Wang, Xinyuan Xia, Hui Zhao, Hanqing Wang, Tai Wang, Yilun Chen, Chengju Liu, Qijun Chen, Jiangmiao Pang |
| 2025 | ICCV | VFLowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization. | Sihan Yang, Runsen Xu, Chenhang Cui, Tai Wang, Dahua Lin, Jiangmiao Pang |
| 2025 | ICCV | LLaVA-3D: A Simple Yet Effective Pathway to Empowering LMMs with 3D Capabilities. | Chenming Zhu, Tai Wang, Wenwei Zhang, Jiangmiao Pang, Xihui Liu |
| 2025 | ICRA | Towards Latency-Aware 3D Streaming Perception for Autonomous Driving. | Jiaqi Peng, Tai Wang, Jiangmiao Pang, Yuan Shen |
| 2024 | CoRL | VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding. | Runsen Xu, Zhiwei Huang, Tai Wang, Yilun Chen, Jiangmiao Pang, Dahua Lin |
| 2024 | CVPR | GenNBV: Generalizable Next-Best-View Policy for Active 3D Reconstruction. | Xiao Chen, Quanyi Li, Tai Wang, Tianfan Xue, Jiangmiao Pang |
| 2024 | CVPR | EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI. | Tai Wang, Xiaohan Mao, Chenming Zhu, Runsen Xu, Ruiyuan Lyu, Peisen Li, Xiao Chen, Wenwei Zhang, Kai Chen, Tianfan Xue, Xihui Liu, Cewu Lu, Dahua Lin, Jiangmiao Pang |
| 2024 | ECCV | Learning to Adapt SAM for Segmenting Cross-Domain Point Clouds. | Xidong Peng, Runnan Chen, Feng Qiao, Lingdong Kong, Youquan Liu, Yujing Sun, Tai Wang, Xinge Zhu, Yuexin Ma |
| 2024 | ECCV | PointLLM: Empowering Large Language Models to Understand Point Clouds. | Runsen Xu, Xiaolong Wang, Tai Wang, Yilun Chen, Jiangmiao Pang, Dahua Lin |
| 2024 | ECCV | Omni6D: Large-Vocabulary 3D Object Dataset for Category-Level 6D Object Pose Estimation. | Mengchen Zhang, Tong Wu, Tai Wang, Tengfei Wang, Ziwei Liu, Dahua Lin |
| 2024 | ECCV | ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities. | Chenming Zhu, Tai Wang, Wenwei Zhang, Kai Chen, Xihui Liu |
| 2024 | ICLR | Unified Human-Scene Interaction via Prompted Chain-of-Contacts. | Zeqi Xiao, Tai Wang, Jingbo Wang, Jinkun Cao, Wenwei Zhang, Bo Dai, Dahua Lin, Jiangmiao Pang |
| 2023 | CoRL | DORT: Modeling Dynamic Objects in Recurrent for Multi-Camera 3D Object Detection and Tracking. | Qing Lian, Tai Wang, Dahua Lin, Jiangmiao Pang |
| 2023 | CVPR | MV-JAR: Masked Voxel Jigsaw and Reconstruction for LiDAR-Based Self-Supervised Pre-Training. | Runsen Xu, Tai Wang, Wenwei Zhang, Runjian Chen, Jinkun Cao, Jiangmiao Pang, Dahua Lin |
| 2023 | ICCV | GeoMIM: Towards Better 3D Knowledge Transfer via Masked Image Modeling for Multi-view 3D Understanding. | Jihao Liu, Tai Wang, Boxiao Liu, Qihang Zhang, Yu Liu, Hongsheng Li |
| 2023 | ICCV | Scene as Occupancy. | Wenwen Tong, Chonghao Sima, Tai Wang, Li Chen, Silei Wu, Hanming Deng, Yi Gu, Lewei Lu, Ping Luo, Dahua Lin, Hongyang Li |
| 2023 | ICCV | MonoDETR: Depth-guided Transformer for Monocular 3D Object Detection. | Renrui Zhang, Han Qiu, Tai Wang, Ziyu Guo, Ziteng Cui, Yu Qiao, Hongsheng Li, Peng Gao |
| 2022 | ECCV | Monocular 3D Object Detection with Depth from Motion. | Tai Wang, Jiangmiao Pang, Dahua Lin |
| 2022 | WACV | SIDE: Center-based Stereo 3D Detector with Structure-aware Instance Depth Estimation. | Xidong Peng, Xinge Zhu, Tai Wang, Yuexin Ma |
| 2021 | CoRL | Probabilistic and Geometric Depth: Detecting Objects in Perspective. | Tai Wang, Xinge Zhu, Jiangmiao Pang, Dahua Lin |
| 2021 | CVPR | Cylindrical and Asymmetrical 3D Convolution Networks for LiDAR Segmentation. | Xinge Zhu, Hui Zhou, Tai Wang, Fangzhou Hong, Yuexin Ma, Wei Li, Hongsheng Li, Dahua Lin |
| 2020 | CoRL | Reconfigurable Voxels: A New Representation for LiDAR-Based Point Clouds. | Tai Wang, Xinge Zhu, Dahua Lin |
| 2020 | ECCV | SSN: Shape Signature Networks for Multi-class Object Detection from Point Clouds. | Xinge Zhu, Yuexin Ma, Tai Wang, Yan Xu, Jianping Shi, Dahua Lin |
| 2020 | UIST | FLAVA: Find, Localize, Adjust and Verify to Annotate LiDAR-based Point Clouds. | Tai Wang, Conghui He, Zhe Wang, Jianping Shi, Dahua Lin |
| 2018 | ICALT | An Emotion Oriented Topic Modeling Approach to Discover What Students are Concerned about in Course Forums. | Zhi Liu, Tai Wang, Niels Pinkwart, Sannyuya Liu, Lingyun Kang |
| 2006 | AINA | Internal popularity of streaming video and its implication on caching. | Jiang Yu, Xu Du, Tai Wang, Chun Tung Chou |