Xize Cheng
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
36
Venues
11
Active years
2023–2026
Best venue rank
A*
Where they publish
Papers
36 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | Masked Text-to-Audio Flow-Matching and Reward Feedback Optimization. | Rongjie Huang, Dongchao Yang, Wenxiang Guo, Huadai Liu, Xize Cheng, Zehan Wang, Zhou Zhao, Xixin Wu, Helen M. Meng |
| 2026 | ACL | SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness. | Jingyu Lu, Yuhan Wang, Fan Zhuo, Xize Cheng, Changhao Pan, Xueyi Pu, Yifu Chen, Chenyuhao Wen, Tianle Liang, Zhou Zhao |
| 2025 | AAAI | A Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal Adapter. | Zirun Guo, Xize Cheng, Yangyang Wu, Tao Jin |
| 2025 | ACL | T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback. | Zehan Wang, Ke Lei, Chen Zhu, Jiawei Huang, Sashuai Zhou, Luping Liu, Xize Cheng, Shengpeng Ji, Zhenhui Ye, Tao Jin, Zhou Zhao |
| 2025 | ACL | CART: A Generative Cross-Modal Retrieval Framework With Coarse-To-Fine Semantic Modeling. | Minghui Fang, Shengpeng Ji, Jialong Zuo, Hai Huang, Yan Xia, Jieming Zhu, Xize Cheng, Xiaoda Yang, Wenrui Liu, Gang Wang, Zhenhua Dong, Zhou Zhao |
| 2025 | ACL | ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control. | Shengpeng Ji, Qian Chen, Wen Wang, Jialong Zuo, Minghui Fang, Ziyue Jiang, Hai Huang, Zehan Wang, Xize Cheng, Siqi Zheng, Zhou Zhao |
| 2025 | ACL | Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching. | Jialong Zuo, Shengpeng Ji, Minghui Fang, Mingze Li, Ziyue Jiang, Xize Cheng, Xiaoda Yang, Feiyang Chen, Xinyu Duan, Zhou Zhao |
| 2025 | COLING | VoxpopuliTTS: a large-scale multilingual TTS corpus for zero-shot speech generation. | Wenrui Liu, Jionghao Bai, Xize Cheng, Jialong Zuo, Ziyue Jiang, Shengpeng Ji, Minghui Fang, Xiaoda Yang, Qian Yang, Zhou Zhao |
| 2025 | CVPR | SpatialCLIP: Learning 3D-aware Image Representations from Spatially Discriminative Language. | Zehan Wang, Sashuai Zhou, Shaoxuan He, Haifeng Huang, Lihe Yang, Ziang Zhang, Xize Cheng, Shengpeng Ji, Tao Jin, Hengshuang Zhao, Zhou Zhao |
| 2025 | EMNLP | PACHAT: Persona-Aware Speech Assistant for Multi-party Dialogue. | Dongjie Fu, Xize Cheng, Linjun Li, Xiaoda Yang, Lujia Yang, Tao Jin |
| 2025 | ICASSP | Curriculum Learning aided Audio-Visual Speech Recognition with Arbitrary Speaker Number. | Yuxiao Lin, Tao Jin, Xize Cheng, Zhou Zhao, Fei Wu |
| 2025 | ICASSP | Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model. | Jialong Zuo, Shengpeng Ji, Minghui Fang, Ziyue Jiang, Xize Cheng, Qian Yang, Wenrui Liu, Guangyan Zhang, Zehai Tu, Yiwen Guo, Zhou Zhao |
| 2025 | ICLR | OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces. | Zehan Wang, Ziang Zhang, Minjie Hong, Hang Zhang, Luping Liu, Rongjie Huang, Xize Cheng, Shengpeng Ji, Tao Jin, Hengshuang Zhao, Zhou Zhao |
| 2025 | ICLR | VoxDialogue: Can Spoken Dialogue Systems Understand Information Beyond Words? | Xize Cheng, Ruofan Hu, Xiaoda Yang, Jingyu Lu, Dongjie Fu, Zehan Wang, Shengpeng Ji, Rongjie Huang, Boyang Zhang, Tao Jin, Zhou Zhao |
| 2025 | ICLR | OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup. | Xize Cheng, Siqi Zheng, Zehan Wang, Minghui Fang, Ziang Zhang, Rongjie Huang, Shengpeng Ji, Jialong Zuo, Tao Jin, Zhou Zhao |
| 2025 | ICLR | WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling. | Shengpeng Ji, Ziyue Jiang, Wen Wang, Yifu Chen, Minghui Fang, Jialong Zuo, Qian Yang, Xize Cheng, Zehan Wang, Ruiqi Li, Ziang Zhang, Xiaoda Yang, Rongjie Huang, Yidi Jiang, Qian Chen, Siqi Zheng, Zhou Zhao |
| 2025 | Interspeech | GTA: Towards Generative Text-To-Audio Retrieval via Multi-Scale Tokenizer. | Minghui Fang, Shengpeng Ji, Jialong Zuo, Xize Cheng, Wenrui Liu, Xiaoda Yang, Ruofan Hu, Jieming Zhu, Zhou Zhao |
| 2025 | KDD | Multimodal Conditional Retrieval with High Controllability. | Xiaoda Yang, Xize Cheng, Minghui Fang, Hongshun Qiu, Yuhang Ma, Junyu Lu, Jiaqi Duan, Sihang Cai, Zehan Wang, Ruofan Hu, Dongjie Fu, Zhou Zhao, Tao Jin |
| 2024 | ACL | TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation. | Xize Cheng, Rongjie Huang, Linjun Li, Zehan Wang, Tao Jin, Aoxiong Yin, Feiyang Chen, Xinyu Duan, Baoxing Huai, Zhou Zhao |
| 2024 | ACL | Text-to-Song: Towards Controllable Music Generation Incorporating Vocal and Accompaniment. | Zhiqing Hong, Rongjie Huang, Xize Cheng, Yongqi Wang, Ruiqi Li, Fuming You, Zhou Zhao, Zhimeng Zhang |
| 2024 | ACL | Rethinking the Multimodal Correlation of Multimodal Sequential Learning via Generalizable Attentional Results Alignment. | Tao Jin, Wang Lin, Ye Wang, Linjun Li, Xize Cheng, Zhou Zhao |
| 2024 | ACL | Uni-Dubbing: Zero-Shot Speech Synthesis from Visual Articulation. | Songju Lei, Xize Cheng, Mengjiao Lyu, Jianqiao Hu, Jintao Tan, Runlin Liu, Lingyu Xiong, Tao Jin, Xiandong Li, Zhou Zhao |
| 2024 | ACL | Wav2SQL: Direct Generalizable Speech-To-SQL Parsing. | Huadai Liu, Rongjie Huang, Jinzheng He, Gang Sun, Ran Shen, Xize Cheng, Zhou Zhao |
| 2024 | EMNLP | AudioVSR: Enhancing Video Speech Recognition with Audio Data. | Xiaoda Yang, Xize Cheng, Jiaqi Duan, Hongshun Qiu, Minjie Hong, Minghui Fang, Shengpeng Ji, Jialong Zuo, Zhiqing Hong, Zhimeng Zhang, Tao Jin |
| 2024 | ICML | FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion. | Zehan Wang, Ziang Zhang, Xize Cheng, Rongjie Huang, Luping Liu, Zhenhui Ye, Haifeng Huang, Yang Zhao, Tao Jin, Peng Gao, Zhou Zhao |
| 2024 | ICML | InstructSpeech: Following Speech Editing Instructions via Large Language Models. | Rongjie Huang, Ruofan Hu, Yongqi Wang, Zehan Wang, Xize Cheng, Ziyue Jiang, Zhenhui Ye, Dongchao Yang, Luping Liu, Peng Gao, Zhou Zhao |
| 2023 | ACL | OpenSR: Open-Modality Speech Recognition via Maintaining Multi-Modality Alignment. | Xize Cheng, Tao Jin, Linjun Li, Wang Lin, Xinyu Duan, Zhou Zhao |
| 2023 | ACL | AV-TranSpeech: Audio-Visual Robust Speech-to-Speech Translation. | Rongjie Huang, Huadai Liu, Xize Cheng, Yi Ren, Linjun Li, Zhenhui Ye, Jinzheng He, Lichao Zhang, Jinglin Liu, Xiang Yin, Zhou Zhao |
| 2023 | ACL | Contrastive Token-Wise Meta-Learning for Unseen Performer Visual Temporal-Aligned Translation. | Linjun Li, Tao Jin, Xize Cheng, Ye Wang, Wang Lin, Rongjie Huang, Zhou Zhao |
| 2023 | ACL | TAVT: Towards Transferable Audio-Visual Text Generation. | Wang Lin, Tao Jin, Wenwen Pan, Linjun Li, Xize Cheng, Ye Wang, Zhou Zhao |
| 2023 | ACL | Semantic-conditioned Dual Adaptation for Cross-domain Query-based Visual Segmentation. | Ye Wang, Tao Jin, Wang Lin, Xize Cheng, Linjun Li, Zhou Zhao |
| 2023 | ACL | Weakly-Supervised Spoken Video Grounding via Semantic Interaction Learning. | Ye Wang, Wang Lin, Shengyu Zhang, Tao Jin, Linjun Li, Xize Cheng, Zhou Zhao |
| 2023 | EMNLP | 3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding. | Zehan Wang, Haifeng Huang, Yang Zhao, Linjun Li, Xize Cheng, Yichen Zhu, Aoxiong Yin, Zhou Zhao |
| 2023 | ICCV | MixSpeech: Cross-Modality Self-Learning with Audio-Visual Stream Mixup for Visual Speech Translation and Recognition. | Xize Cheng, Tao Jin, Rongjie Huang, Linjun Li, Wang Lin, Zehan Wang, Ye Wang, Huadai Liu, Aoxiong Yin, Zhou Zhao |
| 2023 | ICCV | Exploring Group Video Captioning with Efficient Relational Approximation. | Wang Lin, Tao Jin, Ye Wang, Wenwen Pan, Linjun Li, Xize Cheng, Zhou Zhao |
| 2023 | ICCV | Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual Grounding. | Zehan Wang, Haifeng Huang, Yang Zhao, Linjun Li, Xize Cheng, Yichen Zhu, Aoxiong Yin, Zhou Zhao |