Xiaojian Ma
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
35
Venues
14
Active years
2009–2026
Best venue rank
A*
Where they publish
Papers
35 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents. | Bofei Zhang, Zirui Shang, Zhi Gao, Wang Zhang, Rui Xie, Xiaojian Ma, Tao Yuan, Xinxiao Wu, Song-Chun Zhu, Qing Li |
| 2026 | WWW | DualGR: Generative Retrieval with Long and Short-Term Interests Modeling. | Zhongchao Yi, Kai Feng, Xiaojian Ma, Yalong Wang, Yongqi Liu, Han Li, Zhengyang Zhou, Yang Wang |
| 2025 | ACL | JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse. | Muyao Li, Zihao Wang, Kaichen He, Xiaojian Ma, Yitao Liang |
| 2025 | CVPR | ROCKET-1: Mastering Open-World Interaction with Visual-Temporal Context Prompting. | Shaofei Cai, Zihao Wang, Kewei Lian, Zhancun Mu, Xiaojian Ma, Anji Liu, Yitao Liang |
| 2025 | ICCV | Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding. | Yue Fan, Xiaojian Ma, Rongpeng Su, Jun Guo, Rujie Wu, Xi Chen, Qing Li |
| 2025 | ICCV | Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation. | Ziyu Zhu, Xilin Wang, Yixuan Li, Zhuofan Zhang, Xiaojian Ma, Yixin Chen, Baoxiong Jia, Wei Liang, Qian Yu, Zhidong Deng, Siyuan Huang, Qing Li |
| 2025 | ICLR | GROOT-2: Weakly Supervised Multimodal Instruction Following Agents. | Shaofei Cai, Bowei Zhang, Zihao Wang, Haowei Lin, Xiaojian Ma, Anji Liu, Yitao Liang |
| 2025 | ICLR | Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage. | Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaojian Ma, Tao Yuan, Yue Fan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li |
| 2025 | ICML | Falcon: Fast Visuomotor Policies via Partial Denoising. | Haojun Chen, Minghao Liu, Chengdong Ma, Xiaojian Ma, Zailin Ma, Huimin Wu, Yuanpei Chen, Yifan Zhong, Mingzhi Wang, Qing Li, Yaodong Yang |
| 2024 | CVPR | CLOVA: A Closed-LOop Visual Assistant with Tool Usage and Update. | Zhi Gao, Yuntao Du, Xintong Zhang, Xiaojian Ma, Wenjuan Han, Song-Chun Zhu, Qing Li |
| 2024 | ECCV | 🤖 VideoAgent: A Memory-Augmented Multimodal Agent for Video Understanding. | Yue Fan, Xiaojian Ma, Rujie Wu, Yuntao Du, Jiaqi Li, Zhi Gao, Qing Li |
| 2024 | ECCV | Unifying 3D Vision-Language Understanding via Promptable Queries. | Ziyu Zhu, Zhuofan Zhang, Xiaojian Ma, Xuesong Niu, Yixin Chen, Baoxiong Jia, Zhidong Deng, Siyuan Huang, Qing Li |
| 2024 | ICLR | GROOT: Learning to Follow Instructions by Watching Gameplay Videos. | Shaofei Cai, Bowei Zhang, Zihao Wang, Xiaojian Ma, Anji Liu, Yitao Liang |
| 2024 | ICLR | Bongard-OpenWorld: Few-Shot Reasoning for Free-form Visual Concepts in the Real World. | Rujie Wu, Xiaojian Ma, Zhenliang Zhang, Wei Wang, Qing Li, Song-Chun Zhu, Yizhou Wang |
| 2024 | ICLR | MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning. | Haozhe Zhao, Zefan Cai, Shuzheng Si, Xiaojian Ma, Kaikai An, Liang Chen, Zixuan Liu, Sheng Wang, Wenjuan Han, Baobao Chang |
| 2024 | ICML | An Embodied Generalist Agent in 3D World. | Jiangyong Huang, Silong Yong, Xiaojian Ma, Xiongkun Linghu, Puhao Li, Yan Wang, Qing Li, Song-Chun Zhu, Baoxiong Jia, Siyuan Huang |
| 2024 | NAACL | MindAgent: Emergent Gaming Interaction. | Ran Gong, Qiuyuan Huang, Xiaojian Ma, Yusuke Noda, Zane Durante, Zilong Zheng, Demetri Terzopoulos, Li Fei-Fei, Jianfeng Gao, Hoi Vo |
| 2023 | CVPR | Open-World Multi-Task Control Through Goal-Aware Representation Learning and Adaptive Horizon Prediction. | Shaofei Cai, Zihao Wang, Xiaojian Ma, Anji Liu, Yitao Liang |
| 2023 | ICCV | 3D-VisTA: Pre-trained Transformer for 3D Vision and Text Alignment. | Ziyu Zhu, Xiaojian Ma, Yixin Chen, Zhidong Deng, Siyuan Huang, Qing Li |
| 2023 | ICLR | SQA3D: Situated Question Answering in 3D Scenes. | Xiaojian Ma, Silong Yong, Zilong Zheng, Qing Li, Yitao Liang, Song-Chun Zhu, Siyuan Huang |
| 2022 | CVPR | Bongard-HOI: Benchmarking Few-Shot Visual Reasoning for Human-Object Interactions. | Huaizu Jiang, Xiaojian Ma, Weili Nie, Zhiding Yu, Yuke Zhu, Anima Anandkumar |
| 2022 | ICLR | RelViT: Concept-guided Vision Transformer for Visual Relational Reasoning. | Xiaojian Ma, Weili Nie, Zhiding Yu, Huaizu Jiang, Chaowei Xiao, Yuke Zhu, Song-Chun Zhu, Anima Anandkumar |
| 2022 | ICML | Latent Diffusion Energy-Based Model for Interpretable Text Modelling. | Peiyu Yu, Sirui Xie, Xiaojian Ma, Baoxiong Jia, Bo Pang, Ruiqi Gao, Yixin Zhu, Song-Chun Zhu, Ying Nian Wu |
| 2022 | KDD | Continuous-Time and Multi-Level Graph Representation Learning for Origin-Destination Demand Prediction. | Liangzhe Han, Xiaojian Ma, Leilei Sun, Bowen Du, Yanjie Fu, Weifeng Lv, Hui Xiong |
| 2022 | PRICAI | Zoom-Based AutoEncoder for Origin-Destination Demand Prediction. | Xiaojian Ma, Liangzhe Han, Gang Wang, Xu Liu, Tongyu Zhu |
| 2021 | ICML | Adversarial Option-Aware Hierarchical Imitation Learning. | Mingxuan Jing, Wenbing Huang, Fuchun Sun, Xiaojian Ma, Tao Kong, Chuang Gan, Lei Li |
| 2020 | AAAI | Theory-Based Causal Transfer: Integrating Instance-Level Induction and Abstract-Level Structure Learning. | Mark Edmonds, Xiaojian Ma, Siyuan Qi, Yixin Zhu, Hongjing Lu, Song-Chun Zhu |
| 2020 | AAAI | Reinforcement Learning from Imperfect Demonstrations under Soft Expert Guidance. | Mingxuan Jing, Xiaojian Ma, Wenbing Huang, Fuchun Sun, Chao Yang, Bin Fang, Huaping Liu |
| 2020 | IROS | Robust Robotic Pouring using Audition and Haptics. | Hongzhuo Liang, Chuangchuang Zhou, Shuang Li, Xiaojian Ma, Norman Hendrich, Timo Gerkmann, Fuchun Sun, Marcus Stoffel, Jianwei Zhang |
| 2020 | IROS | A Mobile Robot Hand-Arm Teleoperation System by Vision and IMU. | Shuang Li, Jiaxi Jiang, Philipp Ruppel, Hongzhuo Liang, Xiaojian Ma, Norman Hendrich, Fuchun Sun, Jianwei Zhang |
| 2019 | AAAI | Task Transfer by Preference-Based Cost Learning. | Mingxuan Jing, Xiaojian Ma, Wen-bing Huang, Fuchun Sun, Huaping Liu |
| 2019 | ICRA | PointNetGPD: Detecting Grasp Configurations from Point Sets. | Hongzhuo Liang, Xiaojian Ma, Shuang Li, Michael Grner, Song Tang, Bin Fang, Fuchun Sun, Jianwei Zhang |
| 2019 | ICRA | Vision-based Teleoperation of Shadow Dexterous Hand using End-to-End Deep Neural Network. | Shuang Li, Xiaojian Ma, Hongzhuo Liang, Michael Grner, Philipp Ruppel, Bin Fang, Fuchun Sun, Jianwei Zhang |
| 2019 | IROS | Making Sense of Audio Vibration for Liquid Height Estimation in Robotic Pouring. | Hongzhuo Liang, Shuang Li, Xiaojian Ma, Norman Hendrich, Timo Gerkmann, Fuchun Sun, Jianwei Zhang |
| 2009 | ICNC | Condition Monitoring and Faults Recognizing of Dish Centrifugal Separator by Artifical Neural Network Combined with Expert System. | Xiaojian Ma, Xuehui Gan |