Xiaoda Yang
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
18
Venues
9
Active years
2024–2026
Best venue rank
A*
Where they publish
Papers
18 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling. | Hao Li, Shuai Yang, Yilun Chen, Xinyi Chen, Xiaoda Yang, Yang Tian, Hanqing Wang, Tai Wang, Dahua Lin, Feng Zhao, Jiangmiao Pang |
| 2026 | AAAI | SpatialLogic-Bench: A Diagnostic Benchmark for Task-Oriented Spatiotemporal Reasoning. | Xiaoda Yang, Shenzhou Gao, Can Wang, Jiahe Zhang, Menglan Tang, Jingyang Xue, Sheng Liu, Peijian Zhang, Yao Mu, Xiangyu Yue |
| 2026 | WACV | VividAnimator: An End-to-End Audio and Pose-driven Half-Body Human Animation Framework. | Donglin Huang, Yongyuan Li, Tianhang Liu, Junming Huang, Xiaoda Yang, Chi Wang, Weiwei Xu |
| 2025 | AAAI | Storynizor: Consistent Story Generation via Inter-Frame Synchronized and Shuffled ID Injection. | Yuhang Ma, Wenting Xu, Chaoyi Zhao, Keqiang Sun, Qinfeng Jin, Xiaoda Yang, Zeng Zhao, Changjie Fan, Zhipeng Hu |
| 2025 | ACL | CART: A Generative Cross-Modal Retrieval Framework With Coarse-To-Fine Semantic Modeling. | Minghui Fang, Shengpeng Ji, Jialong Zuo, Hai Huang, Yan Xia, Jieming Zhu, Xize Cheng, Xiaoda Yang, Wenrui Liu, Gang Wang, Zhenhua Dong, Zhou Zhao |
| 2025 | ACL | Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching. | Jialong Zuo, Shengpeng Ji, Minghui Fang, Mingze Li, Ziyue Jiang, Xize Cheng, Xiaoda Yang, Feiyang Chen, Xinyu Duan, Zhou Zhao |
| 2025 | COLING | VoxpopuliTTS: a large-scale multilingual TTS corpus for zero-shot speech generation. | Wenrui Liu, Jionghao Bai, Xize Cheng, Jialong Zuo, Ziyue Jiang, Shengpeng Ji, Minghui Fang, Xiaoda Yang, Qian Yang, Zhou Zhao |
| 2025 | EMNLP | BrainLoc: Brain Signal-Based Object Detection with Multi-modal Alignment. | Jiaqi Duan, Xiaoda Yang, Kaixuan Luan, Hongshun Qiu, Weicai Yan, Xueyi Zhang, Youliang Zhang, Zhaoyang Li, Donglin Huang, Junyu Lu, Ziyue Jiang, Xifeng Yang |
| 2025 | EMNLP | PACHAT: Persona-Aware Speech Assistant for Multi-party Dialogue. | Dongjie Fu, Xize Cheng, Linjun Li, Xiaoda Yang, Lujia Yang, Tao Jin |
| 2025 | ICLR | VoxDialogue: Can Spoken Dialogue Systems Understand Information Beyond Words? | Xize Cheng, Ruofan Hu, Xiaoda Yang, Jingyu Lu, Dongjie Fu, Zehan Wang, Shengpeng Ji, Rongjie Huang, Boyang Zhang, Tao Jin, Zhou Zhao |
| 2025 | ICLR | WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling. | Shengpeng Ji, Ziyue Jiang, Wen Wang, Yifu Chen, Minghui Fang, Jialong Zuo, Qian Yang, Xize Cheng, Zehan Wang, Ruiqi Li, Ziang Zhang, Xiaoda Yang, Rongjie Huang, Yidi Jiang, Qian Chen, Siqi Zheng, Zhou Zhao |
| 2025 | ICLR | Diff-Prompt: Diffusion-Driven Prompt Generator with Mask Supervision. | Weicai Yan, Wang Lin, Zirun Guo, Ye Wang, Fangming Feng, Xiaoda Yang, Zehan Wang, Tao Jin |
| 2025 | Interspeech | GTA: Towards Generative Text-To-Audio Retrieval via Multi-Scale Tokenizer. | Minghui Fang, Shengpeng Ji, Jialong Zuo, Xize Cheng, Wenrui Liu, Xiaoda Yang, Ruofan Hu, Jieming Zhu, Zhou Zhao |
| 2025 | Interspeech | Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval. | Ruofan Hu, Yan Xia, Minjie Hong, Jieming Zhu, Bo Chen, Xiaoda Yang, Minghui Fang, Tao Jin |
| 2025 | Interspeech | MelRe: Vision-Based Mel-Spectrogram Restoration. | Kaixuan Luan, Xiaoda Yang, Shile Cai, Ruofan Hu, Minghui Fang, Wenrui Liu, Jialong Zuo, Jiaqi Duan, Yuhang Ma, Junyu Lu |
| 2025 | KDD | Multimodal Conditional Retrieval with High Controllability. | Xiaoda Yang, Xize Cheng, Minghui Fang, Hongshun Qiu, Yuhang Ma, Junyu Lu, Jiaqi Duan, Sihang Cai, Zehan Wang, Ruofan Hu, Dongjie Fu, Zhou Zhao, Tao Jin |
| 2025 | WWW | EAGER-LLM: Enhancing Large Language Models as Recommenders through Exogenous Behavior-Semantic Integration. | Minjie Hong, Yan Xia, Zehan Wang, Jieming Zhu, Ye Wang, Sihang Cai, Xiaoda Yang, Quanyu Dai, Zhenhua Dong, Zhimeng Zhang, Zhou Zhao |
| 2024 | EMNLP | AudioVSR: Enhancing Video Speech Recognition with Audio Data. | Xiaoda Yang, Xize Cheng, Jiaqi Duan, Hongshun Qiu, Minjie Hong, Minghui Fang, Shengpeng Ji, Jialong Zuo, Zhiqing Hong, Zhimeng Zhang, Tao Jin |