Skip to content

Minghui Fang

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

19

Venues

9

Active years

2024–2025

Best venue rank

A*

Where they publish

Papers

19 indexed papers, newest first.

YearVenueTitleAuthors
2025AAAIZero-resource Hallucination Detection for Text Generation via Graph-based Contextual Knowledge Triples Modeling.Xinyue Fang, Zhen Huang, Zhiliang Tian, Minghui Fang, Ziyi Pan, Quntian Fang, Zhihua Wen, Hengyue Pan, Dongsheng Li
2025AAAISpeech Watermarking with Discrete Intermediate Representations.Shengpeng Ji, Ziyue Jiang, Jialong Zuo, Minghui Fang, Yifu Chen, Tao Jin, Zhou Zhao
2025ACLCART: A Generative Cross-Modal Retrieval Framework With Coarse-To-Fine Semantic Modeling.Minghui Fang, Shengpeng Ji, Jialong Zuo, Hai Huang, Yan Xia, Jieming Zhu, Xize Cheng, Xiaoda Yang, Wenrui Liu, Gang Wang, Zhenhua Dong, Zhou Zhao
2025ACLEnhancing Multimodal Unified Representations for Cross Modal Generalization.Hai Huang, Yan Xia, Shengpeng Ji, Shulei Wang, Hanting Wang, Minghui Fang, Jieming Zhu, Zhenhua Dong, Sashuai Zhou, Zhou Zhao
2025ACLLanguage-Codec: Bridging Discrete Codec Representations and Speech Language Models.Shengpeng Ji, Minghui Fang, Jialong Zuo, Ziyue Jiang, Dingdong Wang, Hanting Wang, Hai Huang, Zhou Zhao
2025ACLControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control.Shengpeng Ji, Qian Chen, Wen Wang, Jialong Zuo, Minghui Fang, Ziyue Jiang, Hai Huang, Zehan Wang, Xize Cheng, Siqi Zheng, Zhou Zhao
2025ACLRhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching.Jialong Zuo, Shengpeng Ji, Minghui Fang, Mingze Li, Ziyue Jiang, Xize Cheng, Xiaoda Yang, Feiyang Chen, Xinyu Duan, Zhou Zhao
2025COLINGVoxpopuliTTS: a large-scale multilingual TTS corpus for zero-shot speech generation.Wenrui Liu, Jionghao Bai, Xize Cheng, Jialong Zuo, Ziyue Jiang, Shengpeng Ji, Minghui Fang, Xiaoda Yang, Qian Yang, Zhou Zhao
2025EMNLPMitigating Hallucinations in LM-Based TTS Models via Distribution Alignment Using GFlowNets.Chenlin Liu, Minghui Fang, Patrick Zhang, Wei Zhou, Jie Gao, Jiqing Han
2025ICASSPEnhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model.Jialong Zuo, Shengpeng Ji, Minghui Fang, Ziyue Jiang, Xize Cheng, Qian Yang, Wenrui Liu, Guangyan Zhang, Zehai Tu, Yiwen Guo, Zhou Zhao
2025ICCVOpen-Set Cross Modal Generalization via Multimodal Unified Representation.Hai Huang, Yan Xia, Shulei Wang, Hanting Wang, Minghui Fang, Shengpeng Ji, Sashuai Zhou, Tao Jin, Zhou Zhao
2025ICLROmniSep: Unified Omni-Modality Sound Separation with Query-Mixup.Xize Cheng, Siqi Zheng, Zehan Wang, Minghui Fang, Ziang Zhang, Rongjie Huang, Shengpeng Ji, Jialong Zuo, Tao Jin, Zhou Zhao
2025ICLRWavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling.Shengpeng Ji, Ziyue Jiang, Wen Wang, Yifu Chen, Minghui Fang, Jialong Zuo, Qian Yang, Xize Cheng, Zehan Wang, Ruiqi Li, Ziang Zhang, Xiaoda Yang, Rongjie Huang, Yidi Jiang, Qian Chen, Siqi Zheng, Zhou Zhao
2025InterspeechGTA: Towards Generative Text-To-Audio Retrieval via Multi-Scale Tokenizer.Minghui Fang, Shengpeng Ji, Jialong Zuo, Xize Cheng, Wenrui Liu, Xiaoda Yang, Ruofan Hu, Jieming Zhu, Zhou Zhao
2025InterspeechVela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval.Ruofan Hu, Yan Xia, Minjie Hong, Jieming Zhu, Bo Chen, Xiaoda Yang, Minghui Fang, Tao Jin
2025InterspeechMelRe: Vision-Based Mel-Spectrogram Restoration.Kaixuan Luan, Xiaoda Yang, Shile Cai, Ruofan Hu, Minghui Fang, Wenrui Liu, Jialong Zuo, Jiaqi Duan, Yuhang Ma, Junyu Lu
2025KDDMultimodal Conditional Retrieval with High Controllability.Xiaoda Yang, Xize Cheng, Minghui Fang, Hongshun Qiu, Yuhang Ma, Junyu Lu, Jiaqi Duan, Sihang Cai, Zehan Wang, Ruofan Hu, Dongjie Fu, Zhou Zhao, Tao Jin
2024EMNLPAudioVSR: Enhancing Video Speech Recognition with Audio Data.Xiaoda Yang, Xize Cheng, Jiaqi Duan, Hongshun Qiu, Minjie Hong, Minghui Fang, Shengpeng Ji, Jialong Zuo, Zhiqing Hong, Zhimeng Zhang, Tao Jin
2024ICASSPTextrolSpeech: A Text Style Control Speech Corpus with Codec Language Text-to-Speech Models.Shengpeng Ji, Jialong Zuo, Minghui Fang, Ziyue Jiang, Feiyang Chen, Xinyu Duan, Baoxing Huai, Zhou Zhao