Skip to content

Xiaojian Ma

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

35

Venues

14

Active years

2009–2026

Best venue rank

A*

Where they publish

Papers

35 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAITongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents.Bofei Zhang, Zirui Shang, Zhi Gao, Wang Zhang, Rui Xie, Xiaojian Ma, Tao Yuan, Xinxiao Wu, Song-Chun Zhu, Qing Li
2026WWWDualGR: Generative Retrieval with Long and Short-Term Interests Modeling.Zhongchao Yi, Kai Feng, Xiaojian Ma, Yalong Wang, Yongqi Liu, Han Li, Zhengyang Zhou, Yang Wang
2025ACLJARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse.Muyao Li, Zihao Wang, Kaichen He, Xiaojian Ma, Yitao Liang
2025CVPRROCKET-1: Mastering Open-World Interaction with Visual-Temporal Context Prompting.Shaofei Cai, Zihao Wang, Kewei Lian, Zhancun Mu, Xiaojian Ma, Anji Liu, Yitao Liang
2025ICCVEmbodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding.Yue Fan, Xiaojian Ma, Rongpeng Su, Jun Guo, Rujie Wu, Xi Chen, Qing Li
2025ICCVMove to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation.Ziyu Zhu, Xilin Wang, Yixuan Li, Zhuofan Zhang, Xiaojian Ma, Yixin Chen, Baoxiong Jia, Wei Liang, Qian Yu, Zhidong Deng, Siyuan Huang, Qing Li
2025ICLRGROOT-2: Weakly Supervised Multimodal Instruction Following Agents.Shaofei Cai, Bowei Zhang, Zihao Wang, Haowei Lin, Xiaojian Ma, Anji Liu, Yitao Liang
2025ICLRMulti-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage.Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaojian Ma, Tao Yuan, Yue Fan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li
2025ICMLFalcon: Fast Visuomotor Policies via Partial Denoising.Haojun Chen, Minghao Liu, Chengdong Ma, Xiaojian Ma, Zailin Ma, Huimin Wu, Yuanpei Chen, Yifan Zhong, Mingzhi Wang, Qing Li, Yaodong Yang
2024CVPRCLOVA: A Closed-LOop Visual Assistant with Tool Usage and Update.Zhi Gao, Yuntao Du, Xintong Zhang, Xiaojian Ma, Wenjuan Han, Song-Chun Zhu, Qing Li
2024ECCV🤖 VideoAgent: A Memory-Augmented Multimodal Agent for Video Understanding.Yue Fan, Xiaojian Ma, Rujie Wu, Yuntao Du, Jiaqi Li, Zhi Gao, Qing Li
2024ECCVUnifying 3D Vision-Language Understanding via Promptable Queries.Ziyu Zhu, Zhuofan Zhang, Xiaojian Ma, Xuesong Niu, Yixin Chen, Baoxiong Jia, Zhidong Deng, Siyuan Huang, Qing Li
2024ICLRGROOT: Learning to Follow Instructions by Watching Gameplay Videos.Shaofei Cai, Bowei Zhang, Zihao Wang, Xiaojian Ma, Anji Liu, Yitao Liang
2024ICLRBongard-OpenWorld: Few-Shot Reasoning for Free-form Visual Concepts in the Real World.Rujie Wu, Xiaojian Ma, Zhenliang Zhang, Wei Wang, Qing Li, Song-Chun Zhu, Yizhou Wang
2024ICLRMMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning.Haozhe Zhao, Zefan Cai, Shuzheng Si, Xiaojian Ma, Kaikai An, Liang Chen, Zixuan Liu, Sheng Wang, Wenjuan Han, Baobao Chang
2024ICMLAn Embodied Generalist Agent in 3D World.Jiangyong Huang, Silong Yong, Xiaojian Ma, Xiongkun Linghu, Puhao Li, Yan Wang, Qing Li, Song-Chun Zhu, Baoxiong Jia, Siyuan Huang
2024NAACLMindAgent: Emergent Gaming Interaction.Ran Gong, Qiuyuan Huang, Xiaojian Ma, Yusuke Noda, Zane Durante, Zilong Zheng, Demetri Terzopoulos, Li Fei-Fei, Jianfeng Gao, Hoi Vo
2023CVPROpen-World Multi-Task Control Through Goal-Aware Representation Learning and Adaptive Horizon Prediction.Shaofei Cai, Zihao Wang, Xiaojian Ma, Anji Liu, Yitao Liang
2023ICCV3D-VisTA: Pre-trained Transformer for 3D Vision and Text Alignment.Ziyu Zhu, Xiaojian Ma, Yixin Chen, Zhidong Deng, Siyuan Huang, Qing Li
2023ICLRSQA3D: Situated Question Answering in 3D Scenes.Xiaojian Ma, Silong Yong, Zilong Zheng, Qing Li, Yitao Liang, Song-Chun Zhu, Siyuan Huang
2022CVPRBongard-HOI: Benchmarking Few-Shot Visual Reasoning for Human-Object Interactions.Huaizu Jiang, Xiaojian Ma, Weili Nie, Zhiding Yu, Yuke Zhu, Anima Anandkumar
2022ICLRRelViT: Concept-guided Vision Transformer for Visual Relational Reasoning.Xiaojian Ma, Weili Nie, Zhiding Yu, Huaizu Jiang, Chaowei Xiao, Yuke Zhu, Song-Chun Zhu, Anima Anandkumar
2022ICMLLatent Diffusion Energy-Based Model for Interpretable Text Modelling.Peiyu Yu, Sirui Xie, Xiaojian Ma, Baoxiong Jia, Bo Pang, Ruiqi Gao, Yixin Zhu, Song-Chun Zhu, Ying Nian Wu
2022KDDContinuous-Time and Multi-Level Graph Representation Learning for Origin-Destination Demand Prediction.Liangzhe Han, Xiaojian Ma, Leilei Sun, Bowen Du, Yanjie Fu, Weifeng Lv, Hui Xiong
2022PRICAIZoom-Based AutoEncoder for Origin-Destination Demand Prediction.Xiaojian Ma, Liangzhe Han, Gang Wang, Xu Liu, Tongyu Zhu
2021ICMLAdversarial Option-Aware Hierarchical Imitation Learning.Mingxuan Jing, Wenbing Huang, Fuchun Sun, Xiaojian Ma, Tao Kong, Chuang Gan, Lei Li
2020AAAITheory-Based Causal Transfer: Integrating Instance-Level Induction and Abstract-Level Structure Learning.Mark Edmonds, Xiaojian Ma, Siyuan Qi, Yixin Zhu, Hongjing Lu, Song-Chun Zhu
2020AAAIReinforcement Learning from Imperfect Demonstrations under Soft Expert Guidance.Mingxuan Jing, Xiaojian Ma, Wenbing Huang, Fuchun Sun, Chao Yang, Bin Fang, Huaping Liu
2020IROSRobust Robotic Pouring using Audition and Haptics.Hongzhuo Liang, Chuangchuang Zhou, Shuang Li, Xiaojian Ma, Norman Hendrich, Timo Gerkmann, Fuchun Sun, Marcus Stoffel, Jianwei Zhang
2020IROSA Mobile Robot Hand-Arm Teleoperation System by Vision and IMU.Shuang Li, Jiaxi Jiang, Philipp Ruppel, Hongzhuo Liang, Xiaojian Ma, Norman Hendrich, Fuchun Sun, Jianwei Zhang
2019AAAITask Transfer by Preference-Based Cost Learning.Mingxuan Jing, Xiaojian Ma, Wen-bing Huang, Fuchun Sun, Huaping Liu
2019ICRAPointNetGPD: Detecting Grasp Configurations from Point Sets.Hongzhuo Liang, Xiaojian Ma, Shuang Li, Michael Grner, Song Tang, Bin Fang, Fuchun Sun, Jianwei Zhang
2019ICRAVision-based Teleoperation of Shadow Dexterous Hand using End-to-End Deep Neural Network.Shuang Li, Xiaojian Ma, Hongzhuo Liang, Michael Grner, Philipp Ruppel, Bin Fang, Fuchun Sun, Jianwei Zhang
2019IROSMaking Sense of Audio Vibration for Liquid Height Estimation in Robotic Pouring.Hongzhuo Liang, Shuang Li, Xiaojian Ma, Norman Hendrich, Timo Gerkmann, Fuchun Sun, Jianwei Zhang
2009ICNCCondition Monitoring and Faults Recognizing of Dish Centrifugal Separator by Artifical Neural Network Combined with Expert System.Xiaojian Ma, Xuehui Gan