| 2024 | COLING | Two Counterexamples to Tokenization and the Noiseless Channel. | Marco Cognetta, Vilm Zouhar, Sangwhan Moon, Naoaki Okazaki |
| 2023 | EACL | Parameter-Efficient Korean Character-Level Language Modeling. | Marco Cognetta, Sangwhan Moon, Lawrence Wolf-Sonkin, Naoaki Okazaki |
| 2023 | PACLIC | Revisiting Korean Corpus Studies through Technological Advances. | Won-Ik Cho, Sangwhan Moon, Youngsook Song |
| 2022 | LREC | StyleKQC: A Style-Variant Paraphrase Corpus for Korean Questions and Commands. | Won-Ik Cho, Sangwhan Moon, Jong In Kim, Seok Min Kim, Nam Soo Kim |
| 2022 | LREC | Learning How to Translate North Korean through South Korean. | Hwichan Kim, Sangwhan Moon, Naoaki Okazaki, Mamoru Komachi |
| 2022 | LREC | OpenKorPOS: Democratizing Korean Tokenization with Voting-Based Open Corpus Annotation. | Sangwhan Moon, Won-Ik Cho, Hye Joo Han, Naoaki Okazaki, Nam Soo Kim |
| 2020 | EMNLP | Machines Getting with the Program: Understanding Intent Arguments of Non-Canonical Directives. | Won-Ik Cho, Young Ki Moon, Sangwhan Moon, Seok Min Kim, Nam Soo Kim |
| 2020 | EMNLP | PatchBERT: Just-in-Time, Out-of-Vocabulary Patching. | Sangwhan Moon, Naoaki Okazaki |
| 2020 | LREC | Jamo Pair Encoding: Subcharacter Representation-based Extreme Korean Vocabulary Compression for Efficient Subword Tokenization. | Sangwhan Moon, Naoaki Okazaki |