| 2025 | EMNLP | Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation. | Weiting Tan, Jiachen Lian, Hirofumi Inaguma, Paden Tomasello, Philipp Koehn, Xutai Ma |
| 2024 | COLING | Evaluating the IWSLT2023 Speech Translation Tasks: Human Annotations, Automatic Metrics, and Segmentation. | Matthias Sperber, Ondrej Bojar, Barry Haddow, Dvid Javorsk, Xutai Ma, Matteo Negri, Jan Niehues, Peter Polk, Elizabeth Salesky, Katsuhito Sudoh, Marco Turchi |
| 2024 | ICLR | Multi-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction. | Jiatong Shi, Hirofumi Inaguma, Xutai Ma, Ilia Kulikov, Anna Y. Sun |
| 2024 | Interspeech | MMM: Multi-Layer Multi-Residual Multi-Stream Discrete Speech Representation from Self-supervised Learning Model. | Jiatong Shi, Xutai Ma, Hirofumi Inaguma, Anna Sun, Shinji Watanabe |
| 2023 | ACL | Hybrid Transducer and Attention based Encoder-Decoder Modeling for Speech-to-Text Tasks. | Yun Tang, Anna Y. Sun, Hirofumi Inaguma, Xinyue Chen, Ning Dong, Xutai Ma, Paden Tomasello, Juan Pino |
| 2022 | ACL | Direct Speech-to-Speech Translation With Discrete Units. | Ann Lee, Peng-Jen Chen, Changhan Wang, Jiatao Gu, Sravya Popuri, Xutai Ma, Adam Polyak, Yossi Adi, Qing He, Yun Tang, Juan Pino, Wei-Ning Hsu |
| 2022 | Interspeech | From Start to Finish: Latency Reduction Strategies for Incremental Speech Synthesis in Simultaneous Speech-to-Speech Translation. | Danni Liu, Changhan Wang, Hongyu Gong, Xutai Ma, Yun Tang, Juan Miguel Pino |
| 2021 | ICASSP | Streaming Simultaneous Speech Translation with Augmented Memory Transformer. | Xutai Ma, Yongqiang Wang, Mohammad Javad Dousti, Philipp Koehn, Juan Miguel Pino |
| 2021 | ICASSP | A General Multi-Task Learning Framework to Leverage Text Data for Speech to Text Tasks. | Yun Tang, Juan Miguel Pino, Changhan Wang, Xutai Ma, Dmitriy Genzel |
| 2020 | EMNLP | SIMULEVAL: An Evaluation Toolkit for Simultaneous Translation. | Xutai Ma, Mohammad Javad Dousti, Changhan Wang, Jiatao Gu, Juan Miguel Pino |
| 2020 | ICLR | Monotonic Multihead Attention. | Xutai Ma, Juan Miguel Pino, James Cross, Liezl Puzon, Jiatao Gu |
| 2020 | IJCNLP | SimulMT to SimulST: Adapting Simultaneous Text Translation to End-to-End Simultaneous Speech Translation. | Xutai Ma, Juan Miguel Pino, Philipp Koehn |
| 2020 | IJCNLP | Fairseq S2T: Fast Speech-to-Text Modeling with Fairseq. | Changhan Wang, Yun Tang, Xutai Ma, Anne Wu, Dmytro Okhonko, Juan Miguel Pino |
| 2020 | Interspeech | Self-Training for End-to-End Speech Translation. | Juan Miguel Pino, Qiantong Xu, Xutai Ma, Mohammad Javad Dousti, Yun Tang |
| 2019 | ACL | AMR Parsing as Sequence-to-Graph Transduction. | Sheng Zhang, Xutai Ma, Kevin Duh, Benjamin Van Durme |
| 2019 | EMNLP | Broad-Coverage Semantic Parsing as Transduction. | Sheng Zhang, Xutai Ma, Kevin Duh, Benjamin Van Durme |
| 2018 | EAMT | An Analysis of Source Context Dependency in Neural Machine Translation. | Xutai Ma, Ke Li, Philipp Koehn |
| 2018 | EMNLP | Cross-lingual Decompositional Semantic Parsing. | Sheng Zhang, Xutai Ma, Rachel Rudinger, Kevin Duh, Benjamin Van Durme |