| 2025 | 'Rich Dad, Poor Lad': How do Large Language Models Contextualize Socioeconomic Factors in College Admission ? | Huy Nghiem, Phuong-Anh Nguyen-Le, John Prindle, Rachel Rudinger, Hal Daum III |
| 2025 | RuCCoD: Towards Automated ICD Coding in Russian. | Alexandr Nesterov, Andrey Sakhovskiy, Ivan Sviridov, Airat Valiev, Vladimir Makharev, Petr Anokhin, Galina Zubkova, Elena Tutubalina |
| 2025 | Reading Between the Prompts: How Stereotypes Shape LLM's Implicit Personalization. | Vera Neplenbroek, Arianna Bisazza, Raquel Fernndez |
| 2025 | CulturalFrames: Assessing Cultural Expectation Alignment in Text-to-Image Models and Evaluation Metrics. | Shravan Nayak, Mehar Bhatia, Xiaofeng Zhang, Verena Rieser, Lisa Anne Hendricks, Sjoerd van Steenkiste, Yash Goyal, Karolina Stanczak, Aishwarya Agrawal |
| 2025 | Taming the Real-world Complexities in CPT E/M Coding with Large Language Models. | Islam Nassar, Yang Lin, Yuan Jin, Rongxin Zhu, Chang Wei Tan, Zenan Zhai, Nitika Mathur, Thanh Tien Vu, Xu Zhong, Long Duong, Yuan-Fang Li |
| 2025 | Can Multiple Responses from an LLM Reveal the Sources of Its Uncertainty? | Yang Nan, Pengfei He, Ravi Tandon, Han Xu |
| 2025 | The Psychology of Falsehood: A Human-Centric Survey of Misinformation Detection. | Arghodeep Nandi, Megha Sundriyal, Euna Mehnaz Khan, Jikai Sun, Emily K. Vraga, Jaideep Srivastava, Tanmoy Chakraborty |
| 2025 | AMACE: Automatic Multi-Agent Chart Evolution for Iteratively Tailored Chart Generation. | Hyuk Namgoong, Jeesu Jung, Hyeonseok Kang, Yohan Lee, Sangkeun Jung |
| 2025 | Multi-view-guided Passage Reranking with Large Language Models. | Jeongwoo Na, Jun Kwon, Eunseong Choi, Jongwuk Lee |
| 2025 | Effective Red-Teaming of Policy-Adherent Agents. | Itay Nakash, George Kour, Koren Lazar, Matan Vetzler, Guy Uziel, Ateret Anaby-Tavor |
| 2025 | Just One is Enough: An Existence-based Alignment Check for Robust Japanese Pronunciation Estimation. | Hayate Nakano, Nobuhiro Kaji |
| 2025 | Are LLMs Better than Reported? Detecting Label Errors and Mitigating Their Effect on Model Performance. | Omer Nahum, Nitay Calderon, Orgad Keller, Idan Szpektor, Roi Reichart |
| 2025 | Dynamic Retriever for In-Context Knowledge Editing via Policy Optimization. | Mahmud Wasif Nafee, Maiqi Jiang, Haipeng Chen, Yanfu Zhang |
| 2025 | EduAdapt: A Question Answer Benchmark Dataset for Evaluating Grade-Level Adaptability in LLMs. | Numaan Naeem, Abdellah El Mekki, Muhammad Abdul-Mageed |
| 2025 | Prototypical Human-AI Collaboration Behaviors from LLM-Assisted Writing in the Wild. | Sheshera Mysore, Debarati Das, Hancheng Cao, Bahareh Sarrafzadeh |
| 2025 | The "r" in "woman" stands for rights. Auditing LLMs in Uncovering Social Dynamics in Implicit Misogyny. | Arianna Muti, Chris Emmery, Debora Nozza, Alberto Barrn-Cedeo, Tommaso Caselli |
| 2025 | DICP: Deep In-Context Prompt for Event Causality Identification. | Lin Mu, Jun Shen, Li Ni, Lei Sang, Zhize Wu, Peiquan Jin, Yiwen Zhang |
| 2025 | Jailbreak-Tuning: Models Efficiently Learn Jailbreak Susceptibility. | Brendan Murphy, Dillon Bowen, Shahrad Mohammadzadeh, Tom Tseng, Julius Broomfield, Adam Gleave, Kellin Pelrine |
| 2025 | RTTC: Reward-Guided Collaborative Test-Time Compute. | Juan Pablo Muoz, Jinjie Yuan |
| 2025 | Nested Named Entity Recognition as Single-Pass Sequence Labeling. | Alberto Muoz-Ortiz, David Vilares, Caio COrro, Carlos Gmez-Rodrguez |
| 2025 | Entity Profile Generation and Reasoning with LLMs for Entity Alignment. | Rumana Ferdous Munne, Md. Mostafizur Rahman, Yuji Matsumoto |
| 2025 | Fingerprinting LLMs through Survey Item Factor Correlation: A Case Study on Humor Style Questionnaire. | Simon Mnker |
| 2025 | WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning. | Gagan Mundada, Yash Vishe, Amit Namburi, Xin Xu, Zachary Novack, Julian J. McAuley, Junda Wu |
| 2025 | Few-Shot Learning Translation from New Languages. | Carlos Mullov, Alexander Waibel |
| 2025 | Text Takes Over: A Study of Modality Bias in Multimodal Intent Detection. | Ankan Mullick, Saransh Sharma, Abhik Jana, Pawan Goyal |