| 2025 | Amulet: Putting Complex Multi-Turn Conversations on the Stand with LLM Juries. | Sahana Ramnath, Anurag Mudgil, Brihi Joshi, Skyler Hallinan, Xiang Ren |
| 2025 | The discordance between embedded ethics and cultural inference in large language models. | Aida Ramezani, Yang Xu |
| 2025 | seqBench: A Tunable Benchmark to Quantify Sequential Reasoning Limits of LLMs. | Mohammad Ramezanali, Mo Vazifeh, Paolo Santi |
| 2025 | SynthTextEval: Synthetic Text Data Generation and Evaluation for High-Stakes Domains. | Krithika Ramesh, Daniel Smolyak, Zihao Zhao, Nupoor Gandhi, Ritu Agarwal, Margrt V. Bjarnadttir, Anjalie Field |
| 2025 | Model Consistency as a Cheap yet Predictive Proxy for LLM Elo Scores. | Ashwin Ramaswamy, Nestor Demeure, Ermal Rrapaj |
| 2025 | LUME: LLM Unlearning with Multitask Evaluations. | Anil Ramakrishna, Yixin Wan, Xiaomeng Jin, Kai-Wei Chang, Zhiqi Bu, Bhanukiran Vinzamuri, Volkan Cevher, Mingyi Hong, Rahul Gupta |
| 2025 | VeriFastScore: Speeding up long-form factuality evaluation. | Rishanth Rajendhran, Amir Zadeh, Matthew Sarte, Chuan Li, Mohit Iyyer |
| 2025 | Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition: Dysarthric Case Studies. | Vishnu Raja, Adithya V. Ganesan, Anand Syamkumar, Ritwik Banerjee, H. Andrew Schwartz |
| 2025 | When Annotators Disagree, Topology Explains: Mapper, a Topological Tool for Exploring Text Embedding Geometry and Ambiguity. | Nisrine Rair, Alban Goupil, Valeriu Vrabie, Emmanuel Chochoy |
| 2025 | A Graph-Theoretical Framework for Analyzing the Behavior of Causal Language Models. | Rashin Rahnamoun, Mehrnoush Shamsfard |
| 2025 | Text2Vis: A Challenging and Diverse Benchmark for Generating Multimodal Visualizations from Text. | Mizanur Rahman, Md. Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque |
| 2025 | Exploring Hyperbolic Hierarchical Structure for Multimodal Rumor Detection. | Md Mahbubur Rahman, Shufeng Hao, Chongyang Shi, An Lao, Jinyan Liu |
| 2025 | LLM-Guided Co-Training for Text Classification. | Md Mezbaur Rahman, Cornelia Caragea |
| 2025 | Not Lost After All: How Cross-Encoder Attribution Challenges Position Bias Assumptions in LLM Summarization. | Elahe Rahimi, Hassan Sajjad, Domenic Rosati, Abeer Badawi, Elham Dolatabadi, Frank Rudzicz |
| 2025 | Learning What to Remember: Adaptive Probabilistic Memory Retention for Memory-Efficient Language Models. | S. M. Rafiuddin, Muntaha Nujat Khan |
| 2025 | GRAID: Synthetic Data Generation with Geometric Constraints and Multi-Agentic Reflection for Harmful Content Detection. | Melissa Kazemi Rad, Alberto Purpura, Himanshu Kumar, Emily Chen, Mohammad Shahed Sorower |
| 2025 | A Category-Theoretic Approach to Neural-Symbolic Task Planning with Bidirectional Search. | Shuhui Qu, Jie Wang, Kincho Law |
| 2025 | Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios. | Jingen Qu, Lijun Li, Bo Zhang, Yichen Yan, Jing Shao |
| 2025 | Adapting Bias Evaluation to Domain Contexts using Generative Models. | Tamara Quiroga, Felipe Bravo-Marquez, Valentin Barriere |
| 2025 | Uplift-RAG: Uplift-Driven Knowledge Preference Alignment for Retrieval-Augmented Generation. | Changle Qu, Sunhao Dai, Hengyi Cai, Yiyang Cheng, Jun Xu, Shuaiqiang Wang, Dawei Yin |
| 2025 | On the Same Wavelength? Evaluating Pragmatic Reasoning in Language Models across Broad Concepts. | Linlu Qiu, Cedegao E. Zhang, Joshua B. Tenenbaum, Yoon Kim, Roger P. Levy |
| 2025 | DeepWell-Adol: A Scalable Expert-Based Dialogue Corpus for Adolescent Positive Mental Health and Wellbeing Promotion. | Wenyu Qiu, Yuxiong Wang, Jiajun Tan, Hanchao Hou, Qinda Liu, Wei Yao, Shiguang Ni |
| 2025 | Superpose Task-specific Features for Model Merging. | Haiquan Qiu, You Wu, Dong Li, Jianmin Guo, Quanming Yao |
| 2025 | Training Medical QA Models Based on Mixed Rewards from Multiple-Choice and Open-Ended Questions. | Yue Qiu, Yujan Ting, Pei Dong, Terrence Chen, Weijing Huang |
| 2025 | Latent Inter-User Difference Modeling for LLM Personalization. | Yilun Qiu, Tianhao Shi, Xiaoyan Zhao, Fengbin Zhu, Yang Zhang, Fuli Feng |