| 2026 | ACL | Clustered Self-Assessment: A Simple yet Effective Method for Uncertainty Quantification in Large Language Models. | Qi Cao, Takeshi Kojima, Andrew Gambardella, Helinyi Peng, Yutaka Matsuo, Yusuke Iwasawa |
| 2026 | ACL | Understanding Emergent Misalignment via Feature Superposition Geometry. | Gouki Minegishi, Hiroki Furuta, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo |
| 2026 | ACL | ClinDet-Bench: Beyond Abstention, Evaluating Judgment Determinability of LLMs in Clinical Decision-Making. | Yusuke Watanabe, Yohei Kobashi, Takeshi Kojima, Yusuke Iwasawa, Yasushi Okuno, Yutaka Matsuo |
| 2026 | CoNLL | Automated Refinement of Essay Scoring Rubrics for Language Models via Reflect-and-Revise. | Keno Harada, Lui Yoshida, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo |
| 2026 | EACL | Semantic Token Clustering for Efficient Uncertainty Quantification in Large Language Models. | Qi Cao, Andrew Gambardella, Takeshi Kojima, Yutaka Matsuo, Yusuke Iwasawa |
| 2026 | EACL | Revealing Redundant Syntax in Large Language Models through Multi-Hop Dependency Paths. | Masaki Sashida, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo |
| 2026 | EACL | Infinity-MoE: Generalizing Mixture of Experts to Infinite Experts. | Shota Takashiro, Takeshi Kojima, Shohei Taniguchi, Yusuke Iwasawa, Yutaka Matsuo |
| 2025 | ACL | Inconsistent Tokenizations Cause Language Models to be Perplexed by Japanese Grammar. | Andrew Gambardella, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo |
| 2025 | ACL | Answer When Needed, Forget When Not: Language Models Pretend to Forget via In-Context Knowledge Unlearning. | Shota Takashiro, Takeshi Kojima, Andrew Gambardella, Qi Cao, Yusuke Iwasawa, Yutaka Matsuo |
| 2025 | COLING | Slender-Mamba: Fully Quantized Mamba in 1.58 Bits From Head to Toe. | Zhenxuan Yu, Takeshi Kojima, Yutaka Matsuo, Yusuke Iwasawa |
| 2025 | EMNLP | When Instructions Multiply: Measuring and Estimating LLM Capabilities of Multiple Instructions Following. | Keno Harada, Yudai Yamazaki, Masachika Taniguchi, Edison Marrese-Taylor, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo |
| 2025 | EMNLP | Dynamic Injection of Entity Knowledge into Dense Retrievers. | Ikuya Yamada, Ryokan Ri, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo |
| 2025 | IJCAI | A Comprehensive Survey on Physical Risk Control in the Era of Foundation Model-enabled Robotics. | Takeshi Kojima, Yaonan Zhu, Yusuke Iwasawa, Toshinori Kitamura, Gang Yan, Shu Morikuni, Ryosuke Takanami, Alfredo Solano, Tatsuya Matsushima, Akiko Murakami, Yutaka Matsuo |
| 2025 | IJCNLP | Crypto-LLM: Two-Stage Language Model Pre-training with Ciphered and Natural Language Data. | Yohei Kobashi, Fumiya Uchiyama, Takeshi Kojima, Andrew Gambardella, Qi Cao, Yusuke Iwasawa, Yutaka Matsuo |
| 2025 | NAACL | Lost in the Distance: Large Language Models Struggle to Capture Long-Distance Relational Knowledge. | Meiyun Wang, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo |
| 2024 | EMNLP | Which Programming Language and What Features at Pre-training Stage Affect Downstream Logical Inference Performance? | Fumiya Uchiyama, Takeshi Kojima, Andrew Gambardella, Qi Cao, Yusuke Iwasawa, Yutaka Matsuo |
| 2024 | NAACL | On the Multilingual Ability of Decoder-based Pre-trained Language Models: Finding and Controlling Language-Specific Neurons. | Takeshi Kojima, Itsuki Okimura, Yusuke Iwasawa, Hitomi Yanaka, Yutaka Matsuo |
| 2023 | EMNLP | Unnatural Error Correction: GPT-4 Can Almost Perfectly Handle Unnatural Scrambled Text. | Qi Cao, Takeshi Kojima, Yutaka Matsuo, Yusuke Iwasawa |
| 2022 | IJCAI | Robustifying Vision Transformer without Retraining from Scratch by Test-Time Class-Conditional Feature Alignment. | Takeshi Kojima, Yutaka Matsuo, Yusuke Iwasawa |
| 2021 | EACL | Making Use of Latent Space in Language GANs for Generating Diverse Text without Pre-training. | Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo |