| 2026 | ACL | A Dual-Task Paradigm to Investigate Sentence Comprehension Strategies in Language Models. | Rei Emura, Saku Sugawara |
| 2026 | ACL | C2: Scalable Rubric-Augmented Reward Modeling from Binary Preferences. | Akira Kawabata, Saku Sugawara |
| 2026 | ACL | CxMP: A Linguistic Minimal-Pair Benchmark for Evaluating Constructional Understanding in Language Models. | Miyu Oba, Saku Sugawara |
| 2026 | ACL | Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge. | Xin Sun, Di Wu, Sijing Qin, Isao Echizen, Abdallah El Ali, Saku Sugawara |
| 2026 | CHI | Seeing the Reasoning: How LLM Rationales Influence User Trust and Decision-Making in Factual Verification Tasks. | Xin Sun, Shu Wei, Jos A. Bosch, Isao Echizen, Saku Sugawara, Abdallah El Ali |
| 2025 | COLING | Development of Numerical Error Detection Tasks to Analyze the Numerical Capabilities of Language Models. | Taku Sakamoto, Saku Sugawara, Akiko Aizawa |
| 2025 | EMNLP | Are Checklists Really Useful for Automatic Evaluation of Generative Tasks? | Momoka Furuhashi, Kouta Nakayama, Takashi Kodama, Saku Sugawara |
| 2025 | EMNLP | TactfulToM: Do LLMs have the Theory of Mind ability to understand White Lies? | Yiwei Liu, Emma Jane Pretty, Jiahao Huang, Saku Sugawara |
| 2025 | IJCNN | Measuring Human Involvement in AI-Generated Text: A Case Study on Academic Writing. | Yuchen Guo, Zhicheng Dou, Huy H. Nguyen, Ching-Chun Chang, Saku Sugawara, Isao Echizen |
| 2024 | ACL | What Makes Language Models Good-enough? | Daiki Asami, Saku Sugawara |
| 2024 | ACL | Modeling Overregularization in Children with Small Language Models. | Akari Haga, Saku Sugawara, Akiyo Fukatsu, Miyu Oba, Hiroki Ouchi, Taro Watanabe, Yohei Oseki |
| 2024 | EMNLP | Rationale-Aware Answer Verification by Pairwise Self-Evaluation. | Akira Kawabata, Saku Sugawara |
| 2024 | EMNLP | Can Language Models Induce Grammatical Knowledge from Indirect Evidence? | Miyu Oba, Yohei Oseki, Akiyo Fukatsu, Akari Haga, Hiroki Ouchi, Taro Watanabe, Saku Sugawara |
| 2023 | AAAI | Which Shortcut Solution Do Question Answering Models Prefer to Learn? | Kazutoshi Shinoda, Saku Sugawara, Akiko Aizawa |
| 2023 | ACL | Probing Physical Reasoning with Counter-Commonsense Context. | Kazushi Kondo, Saku Sugawara, Akiko Aizawa |
| 2023 | ACL | On Degrees of Freedom in Defining and Testing Natural Language Understanding. | Saku Sugawara, Shun Tsugita |
| 2023 | CoNLL | PROPRES: Investigating the Projectivity of Presupposition with Various Triggers and Environments. | Daiki Asami, Saku Sugawara |
| 2023 | EACL | Analyzing the Effectiveness of the Underlying Reasoning Tasks in Multi-hop Question Answering. | Xanh Ho, Anh-Khoa Duong Nguyen, Saku Sugawara, Akiko Aizawa |
| 2023 | EMNLP | Evaluating the Rationale Understanding of Critical Reasoning in Logical Reading Comprehension. | Akira Kawabata, Saku Sugawara |
| 2023 | ICAIL | Improving Translation of Case Descriptions into Logical Fact Formulas using LegalCaseNER. | May Myo Zin, Ha-Thanh Nguyen, Ken Satoh, Saku Sugawara, Fumihito Nishino |
| 2023 | JURIX | Information Extraction from Lengthy Legal Contracts: Leveraging Query-Based Summarization and GPT-3.5. | May Myo Zin, Ha-Thanh Nguyen, Ken Satoh, Saku Sugawara, Fumihito Nishino |
| 2022 | ACL | What Makes Reading Comprehension Questions Difficult? | Saku Sugawara, Nikita Nangia, Alex Warstadt, Samuel R. Bowman |
| 2022 | COLING | Possible Stories: Evaluating Situated Commonsense Reasoning under Multiple Possible Scenarios. | Mana Ashida, Saku Sugawara |
| 2022 | EMNLP | Debiasing Masks: A New Framework for Shortcut Mitigation in NLU. | Johannes Mario Meissner, Saku Sugawara, Akiko Aizawa |
| 2022 | EMNLP | Cross-Modal Similarity-Based Curriculum Learning for Image Captioning. | Hongkuan Zhang, Saku Sugawara, Akiko Aizawa, Lei Zhou, Ryohei Sasano, Koichi Takeda |
| 2022 | IJCNLP | How Well Do Multi-hop Reading Comprehension Models Understand Date Information? | Xanh Ho, Saku Sugawara, Akiko Aizawa |
| 2021 | ACL | Embracing Ambiguity: Shifting the Training Target of NLI Models. | Johannes Mario Meissner, Napat Thumwanit, Saku Sugawara, Akiko Aizawa |
| 2021 | ACL | What Ingredients Make for an Effective Crowdsourcing Protocol for Difficult NLU Data Collection Tasks? | Nikita Nangia, Saku Sugawara, Harsh Trivedi, Alex Warstadt, Clara Vania, Samuel R. Bowman |
| 2021 | ACL | Improving the Robustness of QA Models to Challenge Sets with Variational Question-Answer Pair Generation. | Kazutoshi Shinoda, Saku Sugawara, Akiko Aizawa |
| 2021 | EACL | Benchmarking Machine Reading Comprehension: A Psychological Perspective. | Saku Sugawara, Pontus Stenetorp, Akiko Aizawa |
| 2020 | AAAI | Assessing the Benchmarking Capacity of Machine Reading Comprehension Datasets. | Saku Sugawara, Pontus Stenetorp, Kentaro Inui, Akiko Aizawa |
| 2020 | COLING | Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps. | Xanh Ho, Anh-Khoa Duong Nguyen, Saku Sugawara, Akiko Aizawa |
| 2018 | EMNLP | What Makes Reading Comprehension Questions Easier? | Saku Sugawara, Kentaro Inui, Satoshi Sekine, Akiko Aizawa |
| 2017 | AAAI | Prerequisite Skills for Reading Comprehension: Multi-Perspective Analysis of MCTest Datasets and Systems. | Saku Sugawara, Hikaru Yokono, Akiko Aizawa |
| 2017 | ACL | Evaluation Metrics for Machine Reading Comprehension: Prerequisite Skills and Readability. | Saku Sugawara, Yusuke Kido, Hikaru Yokono, Akiko Aizawa |