| 2026 | Can MLLMs Find Their Way in a City? Exploring Emergent Navigation from Web-Scale Knowledge. | Dwip Dalal, Utkarsh Mishra, Narendra Ahuja, Nebojsa Jojic |
| 2026 | Compositional Reasoning via Joint Image and Language Decomposition. | Dwip Dalal, Madhav Kanda, Zhenhailong Wang, Heng Ji, Unnat Jain |
| 2026 | Breach in the Shield: Unveiling the Vulnerabilities of Large Language Models. | Runpeng Dai, Run Yang, Fan Zhou, Hongtu Zhu |
| 2026 | Leveraging Digitized Newspapers to Collect Summarization Data in Low-Resource Languages. | Noam Dahan, Omer Kidron, Gabriel Stanovsky |
| 2026 | VortexPIA: Indirect Prompt Injection Attack against LLMs for Efficient Extraction of User Privacy. | Yu Cui, Sicheng Pan, Yifei Liu, Haibin Zhang, Cong Zuo |
| 2026 | Lightweight Domain-Specific Language Model for Real-Time Structuring of Medical Prescriptions. | Jonathan Pattin Cottet, Vronique Eglin, Alex Aussem |
| 2026 | Text Classification Under Class Distribution Shift: A Survey. | Adriana Valentina Costache, Silviu Florin Gheorghe, Eduard Gabriel Poesina, Paul Irofti, Radu Tudor Ionescu |
| 2026 | DRIVINGVQA: A Dataset for Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios. | Charles Corbire, Simon Roburin, Syrielle Montariol, Antoine Bosselut, Alexandre Alahi |
| 2026 | MedRiskEval: Medical Risk Evaluation Benchmark of Language Models, On the Importance of User Perspectives in Healthcare Settings. | Jean-Philippe Corbeil, Minseon Kim, Maxime Griot, Sheela Agarwal, Alessandro Sordoni, Franois Beaulieu, Paul Vozila |
| 2026 | CacheNotes: Task-Aware Key-Value Cache Compression for Reasoning-Intensive Knowledge Tasks. | Giulio Corallo, Orion Weller, Fabio Petroni, Paolo Papotti |
| 2026 | Balanced Accuracy: The Right Metric for Evaluating LLM Judges - Explained through Youden's J statistic. | Stephane Collot, Colin Fraser, Justin Zhao, William F. Shen, Timon Willi, Ilias Leontiadis |
| 2026 | DFPE: A Diverse Fingerprint Ensemble for Enhancing LLM Performance. | Seffi Cohen, Nurit Cohen-Inger, Niv Goldshlager, Bracha Shapira, Lior Rokach |
| 2026 | ReMedQA: Are We Done With Medical Multiple-Choice Benchmarks? | Alessio Cocchieri, Luca Ragazzi, Giuseppe Tagliavini, Gianluca Moro |
| 2026 | XMAD-Bench: Cross-Domain Multilingual Audio Deepfake Benchmark. | Ioan-Paul Ciobanu, Andrei Iulian Hji, Nicolae-Catalin Ristea, Paul Irofti, Cristian Rusu, Radu Tudor Ionescu |
| 2026 | MIMIC: Multi-party Dialogue Augmentation via Speaker Stylistic Transfer. | Gaetano Cimino, Giuseppe Carenini, Vincenzo Deufemia |
| 2026 | BigTokDetect: A Clinically-Informed Vision-Language Modeling Framework for Detecting Pro-Bigorexia Videos on TikTok. | Minh Duc Chu, Kshitij Pawar, Zihao He, Roxanna Sharifi, Ross M. Sonnenblick, Magdalayna Curry, Laura D'Adamo, Lindsay E. Young, Stuart B. Murray, Kristina Lerman |
| 2026 | Beyond Length: Context-Aware Expansion and Independence as Developmentally Sensitive Evaluation in Child Utterances. | Jiyun Chun, Eric Fosler-Lussier, Michael White, Andrew Perrault |
| 2026 | FaithLM: Towards Faithful Explanations for Large Language Models. | Yu-Neng Chuang, Guanchu Wang, Chia-Yuan Chang, Ruixiang Tang, Shaochen Zhong, Fan Yang, Andrew Wen, Mengnan Du, Xuanting Cai, Vladimir Braverman, Xia Hu |
| 2026 | A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models. | Iwona Christop, Mateusz Czyznikiewicz, Pawel Skrzewski, Lukasz Bondaruk, Jakub Kubiak, Marcin Lewandowski, Marek Kubis |
| 2026 | Training-Free Text Emotion Tagging via LLM-Based Best-Worst Scaling. | Lukas Christ, Shahin Amiriparian |
| 2026 | Communication as a Complex System: Modeling the Feedback Dynamics of Trust and Credibility. | Swaptik Chowdhury, Samuel D. Allen, Jung Hee Hyun |
| 2026 | Better Call CLAUSE: A Discrepancy Benchmark for Auditing LLMs Legal Reasoning Capabilities. | Manan Roy Choudhury, Adithya Chandramouli, Mannan Anand, Vivek Gupta |
| 2026 | Do LLMs model human linguistic variation? A case study in Hindi-English Verb code-mixing. | Mukund Choudhary, Madhur Jindal, Gaurja Aeron, Monojit Choudhury |
| 2026 | DeepInsert: Early Layer Bypass for Efficient and Performant Multimodal Understanding. | Moulik Choraria, Xinbo Wu, Akhil Bhimaraju, Nitesh Sekhar, Yue Wu, Xu Zhang, Prateek Singhal, Lav R. Varshney |
| 2026 | Plane Geometry Problem Solving with Multi-modal Reasoning: A Survey. | Seunghyuk Cho, Zhenyue Qin, Yang Liu, Youngbin Choi, Seungbeom Lee, Dongwoo Kim |