| 2026 | LREC | JamC-QA: A Multiple-Choice Question Answering Benchmark for Japan-Specific Knowledge. | Teruaki Oka, Tomohide Shibata, Nao Yoshida |
| 2024 | COLING | A Document-Level Text Simplification Dataset for Japanese. | Yoshinari Nagai, Teruaki Oka, Mamoru Komachi |
| 2024 | COLING | Token-length Bias in Minimal-pair Paradigm Datasets. | Naoya Ueda, Masato Mita, Teruaki Oka, Mamoru Komachi |
| 2024 | PACLIC | DejaVu: Disambiguation evaluation dataset for English-JApanese machine translation on VisUal information. | Ayako Sato, Tosho Hirasawa, Hwichan Kim, Zhousi Chen, Teruaki Oka, Masato Mita, Mamoru Komachi |
| 2023 | PACLIC | Simultaneous Domain Adaptation of Tokenization and Machine Translation. | Taisei Enomoto, Tosho Hirasawa, Hwichan Kim, Teruaki Oka, Mamoru Komachi |
| 2023 | PACLIC | Construction of Evaluation Dataset for Japanese Lexical Semantic Change Detection. | Zhidong Ling, Taichi Aida, Teruaki Oka, Mamoru Komachi |
| 2022 | NAACL | Zuo Zhuan Ancient Chinese Dataset for Word Sense Disambiguation. | Xiaomeng Pan, Hongfei Wang, Teruaki Oka, Mamoru Komachi |
| 2022 | PACLIC | Japanese Named Entity Recognition from Automatic Speech Recognition Using Pre-trained Models. | Seiichiro Kondo, Naoya Ueda, Teruaki Oka, Masakazu Sugiyama, Asahi Hentona, Mamoru Komachi |
| 2020 | LREC | KOTONOHA: A Corpus Concordance System for Skewer-Searching NINJAL Corpora. | Teruaki Oka, Yuichi Ishimoto, Yutaka Yagi, Takenori Nakamura, Masayuki Asahara, Kikuo Maekawa, Toshinobu Ogiso, Hanae Koiso, Kumiko Sakoda, Nobuko Kibe |
| 2011 | IJCNLP | Automatic Labeling of Voiced Consonants for Morphological Analysis of Modern Japanese Literature. | Teruaki Oka, Mamoru Komachi, Toshinobu Ogiso, Yuji Matsumoto |