| 2025 | CogSci | Do Large Language Models Have a Planning Theory of Mind? Evidence from MindGames: a Multi-Step Persuasion Task. | Jared Moore, Rasmus Overmark, Ned Cooper, Beba Cibralic, Nick Haber, Cameron R. Jones |
| 2025 | CogSci | Dissecting the Ullman Variations with a SCALPEL: Why do LLMs fail at Trivial Alterations to the False Belief Task? | Zhiqiang Pi, Annapurna Vadaparty, Benjamin Bergen, Cameron R. Jones |
| 2025 | CogSci | Judging the Judges: Displacing and Inverting the Turing test to Investigate the Interrogator. | Ishika Rathi, Benjamin Bergen, Cameron R. Jones |
| 2025 | CogSci | Does Language Stabilize Quantity Representations in Vision Transformers? | Pamela D. Rivire, Oisin Parkinson-Coombs, Cameron R. Jones, Sean Trott |
| 2025 | COLING | GPT-4 is Judged More Human than Humans in Displaced and Inverted Turing Tests. | Ishika Rathi, Sydney Taylor, Benjamin Bergen, Cameron R. Jones |
| 2024 | CogSci | Does reading words help you to read minds? A comparison of humans and LLMs at a recursive mindreading task. | Cameron R. Jones, Sean Trott, Benjamin Bergen |
| 2024 | COLING | Multimodal Language Models Show Evidence of Embodied Simulation. | Cameron R. Jones, Sean Trott |
| 2024 | NAACL | Does GPT-4 pass the Turing test? | Cameron R. Jones, Ben Bergen |
| 2022 | CogSci | Distrubutional Semantics Still Can't Account for Affordances. | Cameron R. Jones, Tyler A. Chang, Seana Coulson, James A. Michaelov, Sean Trott, Benjamin Bergen |
| 2021 | CogSci | The Role of Physical Inference in Pronoun Resolution. | Cameron R. Jones, Benjamin K. Bergen |