Skip to content

Xize Cheng

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

36

Venues

11

Active years

2023–2026

Best venue rank

A*

Where they publish

Papers

36 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLMasked Text-to-Audio Flow-Matching and Reward Feedback Optimization.Rongjie Huang, Dongchao Yang, Wenxiang Guo, Huadai Liu, Xize Cheng, Zehan Wang, Zhou Zhao, Xixin Wu, Helen M. Meng
2026ACLSDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness.Jingyu Lu, Yuhan Wang, Fan Zhuo, Xize Cheng, Changhao Pan, Xueyi Pu, Yifu Chen, Chenyuhao Wen, Tianle Liang, Zhou Zhao
2025AAAIA Wander Through the Multimodal Landscape: Efficient Transfer Learning via Low-rank Sequence Multimodal Adapter.Zirun Guo, Xize Cheng, Yangyang Wu, Tao Jin
2025ACLT2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback.Zehan Wang, Ke Lei, Chen Zhu, Jiawei Huang, Sashuai Zhou, Luping Liu, Xize Cheng, Shengpeng Ji, Zhenhui Ye, Tao Jin, Zhou Zhao
2025ACLCART: A Generative Cross-Modal Retrieval Framework With Coarse-To-Fine Semantic Modeling.Minghui Fang, Shengpeng Ji, Jialong Zuo, Hai Huang, Yan Xia, Jieming Zhu, Xize Cheng, Xiaoda Yang, Wenrui Liu, Gang Wang, Zhenhua Dong, Zhou Zhao
2025ACLControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control.Shengpeng Ji, Qian Chen, Wen Wang, Jialong Zuo, Minghui Fang, Ziyue Jiang, Hai Huang, Zehan Wang, Xize Cheng, Siqi Zheng, Zhou Zhao
2025ACLRhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching.Jialong Zuo, Shengpeng Ji, Minghui Fang, Mingze Li, Ziyue Jiang, Xize Cheng, Xiaoda Yang, Feiyang Chen, Xinyu Duan, Zhou Zhao
2025COLINGVoxpopuliTTS: a large-scale multilingual TTS corpus for zero-shot speech generation.Wenrui Liu, Jionghao Bai, Xize Cheng, Jialong Zuo, Ziyue Jiang, Shengpeng Ji, Minghui Fang, Xiaoda Yang, Qian Yang, Zhou Zhao
2025CVPRSpatialCLIP: Learning 3D-aware Image Representations from Spatially Discriminative Language.Zehan Wang, Sashuai Zhou, Shaoxuan He, Haifeng Huang, Lihe Yang, Ziang Zhang, Xize Cheng, Shengpeng Ji, Tao Jin, Hengshuang Zhao, Zhou Zhao
2025EMNLPPACHAT: Persona-Aware Speech Assistant for Multi-party Dialogue.Dongjie Fu, Xize Cheng, Linjun Li, Xiaoda Yang, Lujia Yang, Tao Jin
2025ICASSPCurriculum Learning aided Audio-Visual Speech Recognition with Arbitrary Speaker Number.Yuxiao Lin, Tao Jin, Xize Cheng, Zhou Zhao, Fei Wu
2025ICASSPEnhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model.Jialong Zuo, Shengpeng Ji, Minghui Fang, Ziyue Jiang, Xize Cheng, Qian Yang, Wenrui Liu, Guangyan Zhang, Zehai Tu, Yiwen Guo, Zhou Zhao
2025ICLROmniBind: Large-scale Omni Multimodal Representation via Binding Spaces.Zehan Wang, Ziang Zhang, Minjie Hong, Hang Zhang, Luping Liu, Rongjie Huang, Xize Cheng, Shengpeng Ji, Tao Jin, Hengshuang Zhao, Zhou Zhao
2025ICLRVoxDialogue: Can Spoken Dialogue Systems Understand Information Beyond Words?Xize Cheng, Ruofan Hu, Xiaoda Yang, Jingyu Lu, Dongjie Fu, Zehan Wang, Shengpeng Ji, Rongjie Huang, Boyang Zhang, Tao Jin, Zhou Zhao
2025ICLROmniSep: Unified Omni-Modality Sound Separation with Query-Mixup.Xize Cheng, Siqi Zheng, Zehan Wang, Minghui Fang, Ziang Zhang, Rongjie Huang, Shengpeng Ji, Jialong Zuo, Tao Jin, Zhou Zhao
2025ICLRWavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling.Shengpeng Ji, Ziyue Jiang, Wen Wang, Yifu Chen, Minghui Fang, Jialong Zuo, Qian Yang, Xize Cheng, Zehan Wang, Ruiqi Li, Ziang Zhang, Xiaoda Yang, Rongjie Huang, Yidi Jiang, Qian Chen, Siqi Zheng, Zhou Zhao
2025InterspeechGTA: Towards Generative Text-To-Audio Retrieval via Multi-Scale Tokenizer.Minghui Fang, Shengpeng Ji, Jialong Zuo, Xize Cheng, Wenrui Liu, Xiaoda Yang, Ruofan Hu, Jieming Zhu, Zhou Zhao
2025KDDMultimodal Conditional Retrieval with High Controllability.Xiaoda Yang, Xize Cheng, Minghui Fang, Hongshun Qiu, Yuhang Ma, Junyu Lu, Jiaqi Duan, Sihang Cai, Zehan Wang, Ruofan Hu, Dongjie Fu, Zhou Zhao, Tao Jin
2024ACLTransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation.Xize Cheng, Rongjie Huang, Linjun Li, Zehan Wang, Tao Jin, Aoxiong Yin, Feiyang Chen, Xinyu Duan, Baoxing Huai, Zhou Zhao
2024ACLText-to-Song: Towards Controllable Music Generation Incorporating Vocal and Accompaniment.Zhiqing Hong, Rongjie Huang, Xize Cheng, Yongqi Wang, Ruiqi Li, Fuming You, Zhou Zhao, Zhimeng Zhang
2024ACLRethinking the Multimodal Correlation of Multimodal Sequential Learning via Generalizable Attentional Results Alignment.Tao Jin, Wang Lin, Ye Wang, Linjun Li, Xize Cheng, Zhou Zhao
2024ACLUni-Dubbing: Zero-Shot Speech Synthesis from Visual Articulation.Songju Lei, Xize Cheng, Mengjiao Lyu, Jianqiao Hu, Jintao Tan, Runlin Liu, Lingyu Xiong, Tao Jin, Xiandong Li, Zhou Zhao
2024ACLWav2SQL: Direct Generalizable Speech-To-SQL Parsing.Huadai Liu, Rongjie Huang, Jinzheng He, Gang Sun, Ran Shen, Xize Cheng, Zhou Zhao
2024EMNLPAudioVSR: Enhancing Video Speech Recognition with Audio Data.Xiaoda Yang, Xize Cheng, Jiaqi Duan, Hongshun Qiu, Minjie Hong, Minghui Fang, Shengpeng Ji, Jialong Zuo, Zhiqing Hong, Zhimeng Zhang, Tao Jin
2024ICMLFreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion.Zehan Wang, Ziang Zhang, Xize Cheng, Rongjie Huang, Luping Liu, Zhenhui Ye, Haifeng Huang, Yang Zhao, Tao Jin, Peng Gao, Zhou Zhao
2024ICMLInstructSpeech: Following Speech Editing Instructions via Large Language Models.Rongjie Huang, Ruofan Hu, Yongqi Wang, Zehan Wang, Xize Cheng, Ziyue Jiang, Zhenhui Ye, Dongchao Yang, Luping Liu, Peng Gao, Zhou Zhao
2023ACLOpenSR: Open-Modality Speech Recognition via Maintaining Multi-Modality Alignment.Xize Cheng, Tao Jin, Linjun Li, Wang Lin, Xinyu Duan, Zhou Zhao
2023ACLAV-TranSpeech: Audio-Visual Robust Speech-to-Speech Translation.Rongjie Huang, Huadai Liu, Xize Cheng, Yi Ren, Linjun Li, Zhenhui Ye, Jinzheng He, Lichao Zhang, Jinglin Liu, Xiang Yin, Zhou Zhao
2023ACLContrastive Token-Wise Meta-Learning for Unseen Performer Visual Temporal-Aligned Translation.Linjun Li, Tao Jin, Xize Cheng, Ye Wang, Wang Lin, Rongjie Huang, Zhou Zhao
2023ACLTAVT: Towards Transferable Audio-Visual Text Generation.Wang Lin, Tao Jin, Wenwen Pan, Linjun Li, Xize Cheng, Ye Wang, Zhou Zhao
2023ACLSemantic-conditioned Dual Adaptation for Cross-domain Query-based Visual Segmentation.Ye Wang, Tao Jin, Wang Lin, Xize Cheng, Linjun Li, Zhou Zhao
2023ACLWeakly-Supervised Spoken Video Grounding via Semantic Interaction Learning.Ye Wang, Wang Lin, Shengyu Zhang, Tao Jin, Linjun Li, Xize Cheng, Zhou Zhao
2023EMNLP3DRP-Net: 3D Relative Position-aware Network for 3D Visual Grounding.Zehan Wang, Haifeng Huang, Yang Zhao, Linjun Li, Xize Cheng, Yichen Zhu, Aoxiong Yin, Zhou Zhao
2023ICCVMixSpeech: Cross-Modality Self-Learning with Audio-Visual Stream Mixup for Visual Speech Translation and Recognition.Xize Cheng, Tao Jin, Rongjie Huang, Linjun Li, Wang Lin, Zehan Wang, Ye Wang, Huadai Liu, Aoxiong Yin, Zhou Zhao
2023ICCVExploring Group Video Captioning with Efficient Relational Approximation.Wang Lin, Tao Jin, Ye Wang, Wenwen Pan, Linjun Li, Xize Cheng, Zhou Zhao
2023ICCVDistilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual Grounding.Zehan Wang, Haifeng Huang, Yang Zhao, Linjun Li, Xize Cheng, Yichen Zhu, Aoxiong Yin, Zhou Zhao