Puyuan Peng
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
22
Venues
11
Active years
2022–2026
Best venue rank
A*
Where they publish
Papers
22 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2026 | ACL | VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation. | Puyuan Peng, Zhisheng Zheng, Shang-Wen Li, Abdelrahman Mohamed, David Harwath |
| 2025 | EMNLP | VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing. | Zhisheng Zheng, Puyuan Peng, Anuj Diwan, Cong Phuoc Huynh, Xiaohang Sun, Zhu Liu, Vimal Bhat, David Harwath |
| 2025 | ICCV | VoiceCraft-Dub: Automated Video Dubbing with Neural Codec Language Models. | Sung-Bin Kim, Jeongsoo Choi, Puyuan Peng, Joon Son Chung, Tae-Hyun Oh, David Harwath |
| 2025 | ICLR | SyllableLM: Learning Coarse Semantic Units for Speech Language Models. | Alan Baade, Puyuan Peng, David Harwath |
| 2025 | ICLR | Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks. | Chien-yu Huang, Wei-Chih Chen, Shu-Wen Yang, Andy T. Liu, Chen-An Li, Yu-Xiang Lin, Wei-Cheng Tseng, Anuj Diwan, Yi-Jen Shih, Jiatong Shi, William Chen, Chih-Kai Yang, Xuanjun Chen, Chi-Yuan Hsiao, Puyuan Peng, Shih-Heng Wang, Chun-Yi Kuan, Ke-Han Lu, Kai-Wei Chang, Fabian Alejandro Ritter Gutierrez, et al. |
| 2025 | Interspeech | CS-FLEURS: A Massively Multilingual and Code-Switched Speech Dataset. | Brian Yan, Injy Hamed, Shuichiro Shimizu, Vasista Sai Lodagala, William Chen, Olga Iakovenko, Bashar Talafha, Amir Hussein, Alexander Polok, Kalvin Chang, Dominik Klement, Sara Althubaiti, Puyuan Peng, Matthew Wiesner, Thamar Solorio, Ahmed Ali, Sanjeev Khudanpur, Shinji Watanabe |
| 2025 | WACV | Temporally Streaming Audio-Visual Synchronization for Real-World Videos. | Jordan Voas, Wei-Cheng Tseng, Layne Berry, Xixi Hu, Puyuan Peng, James Stuedemann, David Harwath |
| 2025 | UIST | TalkLess: Blending Extractive and Abstractive Summarization for Editing Speech to Preserve Content and Style. | Karim Benharrak, Puyuan Peng, Amy Pavel |
| 2024 | ACL | VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild. | Puyuan Peng, Po-Yao Huang, Shang-Wen Li, Abdelrahman Mohamed, David Harwath |
| 2024 | ECCV | Action2Sound: Ambient-Aware Generation of Action Sounds from Egocentric Videos. | Changan Chen, Puyuan Peng, Ami Baid, Zihui Xue, Wei-Ning Hsu, David Harwath, Kristen Grauman |
| 2024 | ICASSP | Integrating Self-Supervised Speech Model with Pseudo Word-Level Targets from Visually-Grounded Speech Model. | Hung-Chieh Fang, Nai-Xuan Ye, Yi-Jen Shih, Puyuan Peng, Hsuan-Fu Wang, Layne Berry, Hung-Yi Lee, David Harwath |
| 2024 | ICASSP | AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models. | Yuan Tseng, Layne Berry, Yiting Chen, I-Hsiang Chiu, Hsuan-Hao Lin, Max Liu, Puyuan Peng, Yi-Jen Shih, Hung-Yu Wang, Haibin Wu, Poyao Huang, Chun-Mao Lai, Shang-Wen Li, David Harwath, Yu Tsao, Abdelrahman Mohamed, Chi-Luen Feng, Hung-Yi Lee |
| 2024 | ICASSP | SpeechCLIP+: Self-Supervised Multi-Task Representation Learning for Speech Via Clip and Speech-Image Data. | Hsuan-Fu Wang, Yi-Jen Shih, Heng-Jui Chang, Layne Berry, Puyuan Peng, Hung-Yi Lee, Hsin-Min Wang, David Harwath |
| 2024 | ICML | BAT: Learning to Reason about Spatial Sounds with Large Language Models. | Zhisheng Zheng, Puyuan Peng, Ziyang Ma, Xie Chen, Eunsol Choi, David Harwath |
| 2024 | Interspeech | Neural Codec Language Models for Disentangled and Textless Voice Conversion. | Alan Baade, Puyuan Peng, David Harwath |
| 2023 | ASRU | Audio-Visual Neural Syntax Acquisition. | Cheng-I Jeff Lai, Freda Shi, Puyuan Peng, Yoon Kim, Kevin Gimpel, Shiyu Chang, Yung-Sung Chuang, Saurabhchand Bhati, David D. Cox, David Harwath, Yang Zhang, Karen Livescu, James R. Glass |
| 2023 | Interspeech | Style-transfer based Speech and Audio-visual Scene understanding for Robot Action Sequence Acquisition from Videos. | Chiori Hori, Puyuan Peng, David Harwath, Xinyu Liu, Kei Ota, Siddarth Jain, Radu Corcodel, Devesh K. Jha, Diego Romeres, Jonathan Le Roux |
| 2023 | Interspeech | Syllable Discovery and Cross-Lingual Generalization in a Visually Grounded, Self-Supervised Speech Model. | Puyuan Peng, Shang-Wen Li, Okko Rsnen, Abdelrahman Mohamed, David Harwath |
| 2023 | Interspeech | Prompting the Hidden Talent of Web-Scale Speech Models for Zero-Shot Task Generalization. | Puyuan Peng, Brian Yan, Shinji Watanabe, David Harwath |
| 2022 | ICASSP | Fast-Slow Transformer for Visually Grounding Speech. | Puyuan Peng, David Harwath |
| 2022 | Interspeech | MAE-AST: Masked Autoencoding Audio Spectrogram Transformer. | Alan Baade, Puyuan Peng, David Harwath |
| 2022 | Interspeech | Word Discovery in Visually Grounded, Self-Supervised Speech Models. | Puyuan Peng, David Harwath |