Ziyang Ma
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
48
Venues
12
Active years
2013–2026
Best venue rank
A*
Where they publish
Papers
48 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | AAAI | Ghost in the Transformer: Detecting Model Reuse with Invariant Spectral Signatures. | Suqing Wang, Ziyang Ma, Xinyi Li, Zuchao Li |
| 2026 | ACL | SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization. | Wenxi Chen, Ruiqi Yan, Yushen Chen, Zhikang Niu, Ziyang Ma, Xiquan Li, Yuzhe Liang, Wenhan Lin, Shunshun Yin, Ming Tao, Xinsheng Wang, Xie Chen |
| 2026 | ACL | FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining. | Xiquan Li, Xuenan Xu, Ziyang Ma, Wenxi Chen, Haolin He, Qiuqiang Kong, Xie Chen |
| 2026 | ACL | Evaluating the Expressive Appropriateness of Speech in Rich Contexts. | Tianrui Wang, Ziyang Ma, Yizhou Peng, Haoyu Wang, Zhikang Niu, Zikang Huang, Yihao Wu, Yi-Wen Chao, Yu Jiang, Yuheng Lu, Guanrou Yang, Xuanchen Li, Hexin Liu, Chunyu Qiang, Cheng Gong, Yifan Yang, Tianchi Liu, Junyu Wang, Nana Hou, Meng Ge, Fuming You, Yang Wei, Zhongqian Sun, Haifeng Hu, Xiaobao Wang, Eng Siong Chng, Xie Chen, Longbiao Wang, Jianwu Dang |
| 2026 | ACL | Towards Fine-Grained and Multi-Granular Contrastive Language-Speech Pre-training. | Yifan Yang, Bing Han, Hui Wang, Wei Wang, Ziyang Ma, Long Zhou, Zengrui Jin, Guanrou Yang, Tianrui Wang, Xu Tan, Xie Chen |
| 2025 | AAAI | VQTalker: Towards Multilingual Talking Avatars Through Facial Motion Tokenization. | Tao Liu, Ziyang Ma, Qi Chen, Feilong Chen, Shuai Fan, Xie Chen, Kai Yu |
| 2025 | AAAI | Language Model Can Listen While Speaking. | Ziyang Ma, Yakun Song, Chenpeng Du, Jian Cong, Zhuo Chen, Yuping Wang, Yuxuan Wang, Xie Chen |
| 2025 | AAAI | Speech Recognition Meets Large Language Model: Benchmarking, Models, and Exploration. | Ziyang Ma, Guanrou Yang, Yifan Yang, Zhifu Gao, Jiaming Wang, Zhihao Du, Fan Yu, Qian Chen, Siqi Zheng, Shiliang Zhang, Xie Chen |
| 2025 | AAAI | ELLA-V: Stable Neural Codec Language Modeling with Alignment-Guided Sequence Reordering. | Yakun Song, Zhuo Chen, Xiaofei Wang, Ziyang Ma, Xie Chen |
| 2025 | ACL | Towards Reliable Large Audio Language Model. | Ziyang Ma, Xiquan Li, Yakun Song, Wenxi Chen, Chenpeng Du, Jian Wu, Yuanzhe Chen, Zhuo Chen, Yuping Wang, Yuxuan Wang, Xie Chen |
| 2025 | ACL | GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement. | Yifan Yang, Zheshu Song, Jianheng Zhuo, Mingyu Cui, Jinpeng Li, Bo Yang, Yexing Du, Ziyang Ma, Xunying Liu, Ziyuan Wang, Ke Li, Shuai Fan, Kai Yu, Wei-Qiang Zhang, Guoguo Chen, Xie Chen |
| 2025 | ACL | SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training. | Wenxi Chen, Ziyang Ma, Ruiqi Yan, Yuzhe Liang, Xiquan Li, Ruiyang Xu, Zhikang Niu, Yanqiao Zhu, Yifan Yang, Zhanxun Liu, Kai Yu, Yuxuan Hu, Jinyu Li, Yan Lu, Shujie Liu, Xie Chen |
| 2025 | ACL | F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching. | Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Chunhui Wang, Jian Zhao, Kai Yu, Xie Chen |
| 2025 | ACL | Making LLMs Better Many-to-Many Speech-to-Text Translators with Curriculum Learning. | Yexing Du, Youcheng Pan, Ziyang Ma, Bo Yang, Yifan Yang, Keqi Deng, Xie Chen, Yang Xiang, Ming Liu, Bing Qin |
| 2025 | ASRU | Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model. | Ziyang Ma, Zhuo Chen, Yuping Wang, Eng Siong Chng, Xie Chen |
| 2025 | EMNLP | Enhancing Speech-to-Speech Dialogue Modeling with End-to-End Retrieval-Augmented Generation. | Pengchao Feng, Ziyang Ma, Wenxi Chen, Yao Li, Sheng Wang, Kai Yu, Xie Chen |
| 2025 | EMNLP | Large Language Models Have Intrinsic Meta-Cognition, but Need a Good Lens. | Ziyang Ma, Qingyue Yuan, Zhenglin Wang, Deyu Zhou |
| 2025 | EMNLP | CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models. | Zicong Tang, Ziyang Ma, Suqing Wang, Zuchao Li, Lefei Zhang, Hai Zhao, Yun Li, Qianren Wang |
| 2025 | EMNLP | URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Models. | Ruiqi Yan, Xiquan Li, Wenxi Chen, Zhikang Niu, Chen Yang, Ziyang Ma, Kai Yu, Xie Chen |
| 2025 | ICASSP | SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs. | Wenxi Chen, Ziyang Ma, Xiquan Li, Xuenan Xu, Yuzhe Liang, Zhisheng Zheng, Kai Yu, Xie Chen |
| 2025 | ICASSP | DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning. | Xiquan Li, Wenxi Chen, Ziyang Ma, Xuenan Xu, Yuzhe Liang, Zhisheng Zheng, Qiuqiang Kong, Xie Chen |
| 2025 | ICASSP | Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap. | Guanrou Yang, Fan Yu, Ziyang Ma, Zhihao Du, Zhifu Gao, Shiliang Zhang, Xie Chen |
| 2025 | ICLR | MuPT: A Generative Symbolic Music Pretrained Transformer. | Xingwei Qu, Yuelin Bai, Yinghao Ma, Ziya Zhou, Ka Man Lo, Jiaheng Liu, Ruibin Yuan, Lejun Min, Xueling Liu, Tianyu Zhang, Xeron Du, Shuyue Guo, Yiming Liang, Yizhi Li, Shangda Wu, Junting Zhou, Tianyu Zheng, Ziyang Ma, Fengze Han, Wei Xue, Gus Xia, Emmanouil Benetos, Xiang Yue, Chenghua Lin, Xu Tan, Wenhao Huang, Jie Fu, Ge Zhang |
| 2025 | Interspeech | Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling. | Qixi Zheng, Yushen Chen, Zhikang Niu, Ziyang Ma, Xiaofei Wang, Kai Yu, Xie Chen |
| 2024 | ACL | emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation. | Ziyang Ma, Zhisheng Zheng, Jiaxin Ye, Jinchao Li, Zhifu Gao, Shiliang Zhang, Xie Chen |
| 2024 | ACL | ChatMusician: Understanding and Generating Music Intrinsically with LLM. | Ruibin Yuan, Hanfeng Lin, Yi Wang, Zeyue Tian, Shangda Wu, Tianhao Shen, Ge Zhang, Yuhang Wu, Cong Liu, Ziya Zhou, Liumeng Xue, Ziyang Ma, Qin Liu, Tianyu Zheng, Yizhi Li, Yinghao Ma, Yiming Liang, Xiaowei Chi, Ruibo Liu, Zili Wang, Chenghua Lin, Qifeng Liu, Tao Jiang, Wenhao Huang, Wenhu Chen, Jie Fu, Emmanouil Benetos, Gus Xia, Roger B. Dannenberg, Wei Xue, Shiyin Kang, Yike Guo |
| 2024 | COLING | Source-free Domain Adaptation for Aspect-based Sentiment Analysis. | Zishuo Zhao, Ziyang Ma, Zhenzhou Lin, Jingyou Xie, Yinghui Li, Ying Shen |
| 2024 | ICASSP | VoiceFlow: Efficient Text-To-Speech with Rectified Flow Matching. | Yiwei Guo, Chenpeng Du, Ziyang Ma, Xie Chen, Kai Yu |
| 2024 | ICASSP | Leveraging Speech PTM, Text LLM, And Emotional TTS For Speech Emotion Recognition. | Ziyang Ma, Wen Wu, Zhisheng Zheng, Yiwei Guo, Qian Chen, Shiliang Zhang, Xie Chen |
| 2024 | ICASSP | Towards Universal Speech Discrete Tokens: A Case Study for ASR and TTS. | Yifan Yang, Feiyu Shen, Chenpeng Du, Ziyang Ma, Kai Yu, Daniel Povey, Xie Chen |
| 2024 | ICASSP | Hourglass-AVSR: Down-Up Sampling-Based Computational Efficiency Model for Audio-Visual Speech Recognition. | Fan Yu, Haoxu Wang, Ziyang Ma, Shiliang Zhang |
| 2024 | ICML | BAT: Learning to Reason about Spatial Sounds with Large Language Models. | Zhisheng Zheng, Puyuan Peng, Ziyang Ma, Xie Chen, Eunsol Choi, David Harwath |
| 2024 | IJCAI | EAT: Self-Supervised Pre-Training with Efficient Audio Transformer. | Wenxi Chen, Yuzhe Liang, Ziyang Ma, Zhisheng Zheng, Xie Chen |
| 2024 | Interspeech | EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark. | Ziyang Ma, Mingjie Chen, Hezhao Zhang, Zhisheng Zheng, Wenxi Chen, Xiquan Li, Jiaxin Ye, Xie Chen, Thomas Hain |
| 2024 | Interspeech | TacoLM: GaTed Attention Equipped Codec Language Model are Efficient Zero-Shot Text to Speech Synthesizers. | Yakun Song, Zhuo Chen, Xiaofei Wang, Ziyang Ma, Guanrou Yang, Xie Chen |
| 2024 | Interspeech | LoRA-Whisper: Parameter-Efficient and Extensible Multilingual ASR. | Zheshu Song, Jianheng Zhuo, Yifan Yang, Ziyang Ma, Shixiong Zhang, Xie Chen |
| 2024 | Interspeech | MaLa-ASR: Multimedia-Assisted LLM-Based ASR. | Guanrou Yang, Ziyang Ma, Fan Yu, Zhifu Gao, Shiliang Zhang, Xie Chen |
| 2023 | ASRU | Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition. | Yujin Wang, Changli Tang, Ziyang Ma, Zhisheng Zheng, Xie Chen, Wei-Qiang Zhang |
| 2023 | ASRU | Fast-Hubert: an Efficient Training Framework for Self-Supervised Speech Representation Learning. | Guanrou Yang, Ziyang Ma, Zhisheng Zheng, Yakun Song, Zhikang Niu, Xie Chen |
| 2023 | ICASSP | Improving Few-Shot Learning for Talking Face System with TTS Data Augmentation. | Qi Chen, Ziyang Ma, Tao Liu, Xu Tan, Qu Lu, Kai Yu, Xie Chen |
| 2023 | ICASSP | Front-End Adapter: Adapting Front-End Input of Speech Based Self-Supervised Learning for Speech Recognition. | Xie Chen, Ziyang Ma, Changli Tang, Yujin Wang, Zhisheng Zheng |
| 2023 | Interspeech | Improving Code-Switching and Name Entity Recognition in ASR with Speech Editing based Data Augmentation. | Zheng Liang, Zheshu Song, Ziyang Ma, Chenpeng Du, Kai Yu, Xie Chen |
| 2023 | Interspeech | MT4SSL: Boosting Self-Supervised Speech Representation Learning by Integrating Multiple Targets. | Ziyang Ma, Zhisheng Zheng, Changli Tang, Yujin Wang, Xie Chen |
| 2023 | Interspeech | Pushing the Limits of Unsupervised Unit Discovery for SSL Speech Representation. | Ziyang Ma, Zhisheng Zheng, Guanrou Yang, Yu Wang, Chao Zhang, Xie Chen |
| 2023 | Interspeech | Unsupervised Active Learning: Optimizing Labeling Cost-Effectiveness for Automatic Speech Recognition. | Zhisheng Zheng, Ziyang Ma, Yu Wang, Xie Chen |
| 2015 | CVPR | Handling motion blur in multi-frame super-resolution. | Ziyang Ma, Renjie Liao, Xin Tao, Li Xu, Jiaya Jia, Enhua Wu |
| 2015 | ICCV | Video Super-Resolution via Deep Draft-Ensemble Learning. | Renjie Liao, Xin Tao, Ruiyu Li, Ziyang Ma, Jiaya Jia |
| 2013 | ICCV | Constant Time Weighted Median Filtering for Stereo Matching and Beyond. | Ziyang Ma, Kaiming He, Yichen Wei, Jian Sun, Enhua Wu |