Skip to content

Puyuan Peng

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

22

Venues

11

Active years

2022–2026

Best venue rank

A*

Where they publish

Papers

22 indexed papers, newest first.

YearVenueTitleAuthors
2026ACLVoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation.Puyuan Peng, Zhisheng Zheng, Shang-Wen Li, Abdelrahman Mohamed, David Harwath
2025EMNLPVoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing.Zhisheng Zheng, Puyuan Peng, Anuj Diwan, Cong Phuoc Huynh, Xiaohang Sun, Zhu Liu, Vimal Bhat, David Harwath
2025ICCVVoiceCraft-Dub: Automated Video Dubbing with Neural Codec Language Models.Sung-Bin Kim, Jeongsoo Choi, Puyuan Peng, Joon Son Chung, Tae-Hyun Oh, David Harwath
2025ICLRSyllableLM: Learning Coarse Semantic Units for Speech Language Models.Alan Baade, Puyuan Peng, David Harwath
2025ICLRDynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks.Chien-yu Huang, Wei-Chih Chen, Shu-Wen Yang, Andy T. Liu, Chen-An Li, Yu-Xiang Lin, Wei-Cheng Tseng, Anuj Diwan, Yi-Jen Shih, Jiatong Shi, William Chen, Chih-Kai Yang, Xuanjun Chen, Chi-Yuan Hsiao, Puyuan Peng, Shih-Heng Wang, Chun-Yi Kuan, Ke-Han Lu, Kai-Wei Chang, Fabian Alejandro Ritter Gutierrez, et al.
2025InterspeechCS-FLEURS: A Massively Multilingual and Code-Switched Speech Dataset.Brian Yan, Injy Hamed, Shuichiro Shimizu, Vasista Sai Lodagala, William Chen, Olga Iakovenko, Bashar Talafha, Amir Hussein, Alexander Polok, Kalvin Chang, Dominik Klement, Sara Althubaiti, Puyuan Peng, Matthew Wiesner, Thamar Solorio, Ahmed Ali, Sanjeev Khudanpur, Shinji Watanabe
2025WACVTemporally Streaming Audio-Visual Synchronization for Real-World Videos.Jordan Voas, Wei-Cheng Tseng, Layne Berry, Xixi Hu, Puyuan Peng, James Stuedemann, David Harwath
2025UISTTalkLess: Blending Extractive and Abstractive Summarization for Editing Speech to Preserve Content and Style.Karim Benharrak, Puyuan Peng, Amy Pavel
2024ACLVoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild.Puyuan Peng, Po-Yao Huang, Shang-Wen Li, Abdelrahman Mohamed, David Harwath
2024ECCVAction2Sound: Ambient-Aware Generation of Action Sounds from Egocentric Videos.Changan Chen, Puyuan Peng, Ami Baid, Zihui Xue, Wei-Ning Hsu, David Harwath, Kristen Grauman
2024ICASSPIntegrating Self-Supervised Speech Model with Pseudo Word-Level Targets from Visually-Grounded Speech Model.Hung-Chieh Fang, Nai-Xuan Ye, Yi-Jen Shih, Puyuan Peng, Hsuan-Fu Wang, Layne Berry, Hung-Yi Lee, David Harwath
2024ICASSPAV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models.Yuan Tseng, Layne Berry, Yiting Chen, I-Hsiang Chiu, Hsuan-Hao Lin, Max Liu, Puyuan Peng, Yi-Jen Shih, Hung-Yu Wang, Haibin Wu, Poyao Huang, Chun-Mao Lai, Shang-Wen Li, David Harwath, Yu Tsao, Abdelrahman Mohamed, Chi-Luen Feng, Hung-Yi Lee
2024ICASSPSpeechCLIP+: Self-Supervised Multi-Task Representation Learning for Speech Via Clip and Speech-Image Data.Hsuan-Fu Wang, Yi-Jen Shih, Heng-Jui Chang, Layne Berry, Puyuan Peng, Hung-Yi Lee, Hsin-Min Wang, David Harwath
2024ICMLBAT: Learning to Reason about Spatial Sounds with Large Language Models.Zhisheng Zheng, Puyuan Peng, Ziyang Ma, Xie Chen, Eunsol Choi, David Harwath
2024InterspeechNeural Codec Language Models for Disentangled and Textless Voice Conversion.Alan Baade, Puyuan Peng, David Harwath
2023ASRUAudio-Visual Neural Syntax Acquisition.Cheng-I Jeff Lai, Freda Shi, Puyuan Peng, Yoon Kim, Kevin Gimpel, Shiyu Chang, Yung-Sung Chuang, Saurabhchand Bhati, David D. Cox, David Harwath, Yang Zhang, Karen Livescu, James R. Glass
2023InterspeechStyle-transfer based Speech and Audio-visual Scene understanding for Robot Action Sequence Acquisition from Videos.Chiori Hori, Puyuan Peng, David Harwath, Xinyu Liu, Kei Ota, Siddarth Jain, Radu Corcodel, Devesh K. Jha, Diego Romeres, Jonathan Le Roux
2023InterspeechSyllable Discovery and Cross-Lingual Generalization in a Visually Grounded, Self-Supervised Speech Model.Puyuan Peng, Shang-Wen Li, Okko Rsnen, Abdelrahman Mohamed, David Harwath
2023InterspeechPrompting the Hidden Talent of Web-Scale Speech Models for Zero-Shot Task Generalization.Puyuan Peng, Brian Yan, Shinji Watanabe, David Harwath
2022ICASSPFast-Slow Transformer for Visually Grounding Speech.Puyuan Peng, David Harwath
2022InterspeechMAE-AST: Masked Autoencoding Audio Spectrogram Transformer.Alan Baade, Puyuan Peng, David Harwath
2022InterspeechWord Discovery in Visually Grounded, Self-Supervised Speech Models.Puyuan Peng, David Harwath