| 2026 | ACL | Language Statistics and False Belief Reasoning: Evidence from 41 Open-Weight LMs. | Sean Trott, Samuel M. Taylor, Cameron Robert Jones, James A. Michaelov, Pamela D. Rivire |
| 2025 | ACL | On the Acquisition of Shared Grammatical Representations in Bilingual Language Models. | Catherine Arnett, Tyler A. Chang, James A. Michaelov, Ben Bergen |
| 2025 | ACL | Not quite Sherlock Holmes: Language model predictions do not reliably differentiate impossible from improbable events. | James A. Michaelov, Reeka Estacio, Zhien Zhang, Ben Bergen |
| 2023 | ACL | Rarely a problem? Language models exhibit inverse scaling in their predictions following few-type quantifiers. | James A. Michaelov, Benjamin K. Bergen |
| 2023 | CogSci | Can Peanuts Fall in Love with Distributional Semantics? | James A. Michaelov, Seana Coulson, Benjamin Bergen |
| 2023 | EMNLP | Emergent Inabilities? Inverse Scaling Over the Course of Pretraining. | James A. Michaelov, Ben Bergen |
| 2023 | EMNLP | Structural Priming Demonstrates Abstract Grammatical Representations in Multilingual Language Models. | James A. Michaelov, Catherine Arnett, Tyler A. Chang, Ben Bergen |
| 2022 | CogSci | Distrubutional Semantics Still Can't Account for Affordances. | Cameron R. Jones, Tyler A. Chang, Seana Coulson, James A. Michaelov, Sean Trott, Benjamin Bergen |
| 2022 | COLING | Do Language Models Make Human-like Predictions about the Coreferents of Italian Anaphoric Zero Pronouns? | James A. Michaelov, Benjamin K. Bergen |
| 2022 | CoNLL | Collateral facilitation in humans and language models. | James A. Michaelov, Benjamin K. Bergen |
| 2021 | CogSci | Different kinds of cognitive plausibility: why are transformers better than RNNs at predicting N400 amplitude? | James A. Michaelov, Megan D. Bardolph, Seana Coulson, Benjamin Bergen |
| 2020 | CoNLL | How well does surprisal explain N400 amplitude under different experimental conditions? | James A. Michaelov, Benjamin K. Bergen |