Skip to content

Shengpeng Ji

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

29

Venues

10

Active years

2024–2026

Best venue rank

A*

Where they publish

Papers

29 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLWavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training.Yifu Chen, Shengpeng Ji, Qian Chen, Tianle Liang, Yangzhuo Li, Ziqing Wang, Wen Wang, Jingyu Lu, Haoxiao Wang, Xueyi Pu, Fan Zhuo, Zhou Zhao
2026ACLDual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models.Yifu Chen, Shengpeng Ji, Zhengqing Liu, Qian Chen, Wen Wang, Ziqing Wang, Yangzhuo Li, Tianle Liang, Zhou Zhao
2026ACLVoxMind: An End-to-End Agentic Spoken Dialogue System.Tianle Liang, Yifu Chen, Shengpeng Ji, Yijun Chen, Zhiyang Jia, Jingyu Lu, Fan Zhuo, Xueyi Pu, Yangzhuo Li, Zhou Zhao
2026ACLDual-Reasoner: Bridging Interleaved Atomicity and Streaming Latency via Thinking-while-Talking.Yangzhuo Li, Shengpeng Ji, Yifu Chen, Tianle Liang, Haoyu Yang, Junbo Li, Jun Fang, Lin Li, Qingyang Hong
2025AAAISpeech Watermarking with Discrete Intermediate Representations.Shengpeng Ji, Ziyue Jiang, Jialong Zuo, Minghui Fang, Yifu Chen, Tao Jin, Zhou Zhao
2025ACLT2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback.Zehan Wang, Ke Lei, Chen Zhu, Jiawei Huang, Sashuai Zhou, Luping Liu, Xize Cheng, Shengpeng Ji, Zhenhui Ye, Tao Jin, Zhou Zhao
2025ACLCART: A Generative Cross-Modal Retrieval Framework With Coarse-To-Fine Semantic Modeling.Minghui Fang, Shengpeng Ji, Jialong Zuo, Hai Huang, Yan Xia, Jieming Zhu, Xize Cheng, Xiaoda Yang, Wenrui Liu, Gang Wang, Zhenhua Dong, Zhou Zhao
2025ACLEnhancing Multimodal Unified Representations for Cross Modal Generalization.Hai Huang, Yan Xia, Shengpeng Ji, Shulei Wang, Hanting Wang, Minghui Fang, Jieming Zhu, Zhenhua Dong, Sashuai Zhou, Zhou Zhao
2025ACLWavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models.Yifu Chen, Shengpeng Ji, Haoxiao Wang, Ziqing Wang, Siyu Chen, Jinzheng He, Jin Xu, Zhou Zhao
2025ACLLanguage-Codec: Bridging Discrete Codec Representations and Speech Language Models.Shengpeng Ji, Minghui Fang, Jialong Zuo, Ziyue Jiang, Dingdong Wang, Hanting Wang, Hai Huang, Zhou Zhao
2025ACLUniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook.Yidi Jiang, Qian Chen, Shengpeng Ji, Yu Xi, Wen Wang, Chong Zhang, Xianghu Yue, Shiliang Zhang, Haizhou Li
2025ACLControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control.Shengpeng Ji, Qian Chen, Wen Wang, Jialong Zuo, Minghui Fang, Ziyue Jiang, Hai Huang, Zehan Wang, Xize Cheng, Siqi Zheng, Zhou Zhao
2025ACLInSerter: Speech Instruction Following with Unsupervised Interleaved Pre-training.Dingdong Wang, Jin Xu, Ruihang Chu, Zhifang Guo, Xiong Wang, Jincenzi Wu, Dongchao Yang, Shengpeng Ji, Junyang Lin
2025ACLRhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching.Jialong Zuo, Shengpeng Ji, Minghui Fang, Mingze Li, Ziyue Jiang, Xize Cheng, Xiaoda Yang, Feiyang Chen, Xinyu Duan, Zhou Zhao
2025COLINGVoxpopuliTTS: a large-scale multilingual TTS corpus for zero-shot speech generation.Wenrui Liu, Jionghao Bai, Xize Cheng, Jialong Zuo, Ziyue Jiang, Shengpeng Ji, Minghui Fang, Xiaoda Yang, Qian Yang, Zhou Zhao
2025CVPRSpatialCLIP: Learning 3D-aware Image Representations from Spatially Discriminative Language.Zehan Wang, Sashuai Zhou, Shaoxuan He, Haifeng Huang, Lihe Yang, Ziang Zhang, Xize Cheng, Shengpeng Ji, Tao Jin, Hengshuang Zhao, Zhou Zhao
2025EMNLPInteractSpeech: A Speech Dialogue Interaction Corpus for Spoken Dialogue Model.Yifu Chen, Shengpeng Ji, Ziqing Wang, Hanting Wang, Zhou Zhao
2025ICASSPEnhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model.Jialong Zuo, Shengpeng Ji, Minghui Fang, Ziyue Jiang, Xize Cheng, Qian Yang, Wenrui Liu, Guangyan Zhang, Zehai Tu, Yiwen Guo, Zhou Zhao
2025ICCVOpen-Set Cross Modal Generalization via Multimodal Unified Representation.Hai Huang, Yan Xia, Shulei Wang, Hanting Wang, Minghui Fang, Shengpeng Ji, Sashuai Zhou, Tao Jin, Zhou Zhao
2025ICLROmniBind: Large-scale Omni Multimodal Representation via Binding Spaces.Zehan Wang, Ziang Zhang, Minjie Hong, Hang Zhang, Luping Liu, Rongjie Huang, Xize Cheng, Shengpeng Ji, Tao Jin, Hengshuang Zhao, Zhou Zhao
2025ICLRVoxDialogue: Can Spoken Dialogue Systems Understand Information Beyond Words?Xize Cheng, Ruofan Hu, Xiaoda Yang, Jingyu Lu, Dongjie Fu, Zehan Wang, Shengpeng Ji, Rongjie Huang, Boyang Zhang, Tao Jin, Zhou Zhao
2025ICLROmniSep: Unified Omni-Modality Sound Separation with Query-Mixup.Xize Cheng, Siqi Zheng, Zehan Wang, Minghui Fang, Ziang Zhang, Rongjie Huang, Shengpeng Ji, Jialong Zuo, Tao Jin, Zhou Zhao
2025ICLRWavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling.Shengpeng Ji, Ziyue Jiang, Wen Wang, Yifu Chen, Minghui Fang, Jialong Zuo, Qian Yang, Xize Cheng, Zehan Wang, Ruiqi Li, Ziang Zhang, Xiaoda Yang, Rongjie Huang, Yidi Jiang, Qian Chen, Siqi Zheng, Zhou Zhao
2025ICMLIRBridge: Solving Image Restoration Bridge with Pre-trained Generative Diffusion Models.Hanting Wang, Tao Jin, Wang Lin, Shulei Wang, Hai Huang, Shengpeng Ji, Zhou Zhao
2025InterspeechGTA: Towards Generative Text-To-Audio Retrieval via Multi-Scale Tokenizer.Minghui Fang, Shengpeng Ji, Jialong Zuo, Xize Cheng, Wenrui Liu, Xiaoda Yang, Ruofan Hu, Jieming Zhu, Zhou Zhao
2024ACLMobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech.Shengpeng Ji, Ziyue Jiang, Hanting Wang, Jialong Zuo, Zhou Zhao
2024EMNLPAudioVSR: Enhancing Video Speech Recognition with Audio Data.Xiaoda Yang, Xize Cheng, Jiaqi Duan, Hongshun Qiu, Minjie Hong, Minghui Fang, Shengpeng Ji, Jialong Zuo, Zhiqing Hong, Zhimeng Zhang, Tao Jin
2024ICASSPTextrolSpeech: A Text Style Control Speech Corpus with Codec Language Text-to-Speech Models.Shengpeng Ji, Jialong Zuo, Minghui Fang, Ziyue Jiang, Feiyang Chen, Xinyu Duan, Baoxing Huai, Zhou Zhao
2024ICLRMega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis.Ziyue Jiang, Jinglin Liu, Yi Ren, Jinzheng He, Zhenhui Ye, Shengpeng Ji, Qian Yang, Chen Zhang, Pengfei Wei, Chunfeng Wang, Xiang Yin, Zejun Ma, Zhou Zhao