| 2025 | Pre-trained Language Models Learn Remarkably Accurate Representations of Numbers. | Marek Kadlck, Michal Stefnik, Timothee Mickus, Josef Kuchar, Michal Spiegel |
| 2025 | PrismRAG: Boosting RAG Factuality with Distractor Resilience and Strategized Reasoning. | Mohammad Kachuee, Teja Gollapudi, Minseok Kim, Yin Huang, Kai Sun, Xiao Yang, Jiaqi Wang, Nirav Shah, Yue Liu, Aaron Colak, Anuj Kumar, Wen-tau Yih, Xin Luna Dong |
| 2025 | From n-gram to Attention: How Model Architectures Learn and Propagate Bias in Language Modeling. | Mohsinul Kabir, Tasfia Tahsin, Sophia Ananiadou |
| 2025 | Bidirectional Reasoning Supervision for Multilingual Financial Decision Making. | Muhammad Rafsan Kabir, Jawad Ibn Ahad, Robin Krambroeckers, Silvia Ahmed, Mirza M. Lutfe Elahi, Nabeel Mohammed, Shafin Rahman |
| 2025 | Break the Checkbox: Challenging Closed-Style Evaluations of Cultural Alignment in LLMs. | Mohsinul Kabir, Ajwad Abrar, Sophia Ananiadou |
| 2025 | Controlled Retrieval-augmented Context Evaluation for Long-form RAG. | Jia-Huei Ju, Suzan Verberne, Maarten de Rijke, Andrew Yates |
| 2025 | A Similarity Measure for Comparing Conversational Dynamics. | Sang Min Jung, Kaixiang Zhang, Cristian Danescu-Niculescu-Mizil |
| 2025 | Code Execution as Grounded Supervision for LLM Reasoning. | Dongwon Jung, Wenxuan Zhou, Muhao Chen |
| 2025 | ToDi: Token-wise Distillation via Fine-Grained Divergence Control. | Seongryong Jung, Suwan Yoon, DongGeon Kim, Hwanhee Lee |
| 2025 | ZEBRA: Leveraging Model-Behavioral Knowledge for Zero-Annotation Preference Dataset Construction. | Jeesu Jung, Chanjun Park, Sangkeun Jung |
| 2025 | MythTriage: Scalable Detection of Opioid Use Disorder Myths on a Video-Sharing Platform. | Hayoung Jung, Shravika Mittal, Ananya Aatreya, Navreet Kaur, Munmun De Choudhury, Tanushree Mitra |
| 2025 | Can LLMs Truly Plan? A Comprehensive Evaluation of Planning Capabilities. | Gayeon Jung, HyeonSeok Lim, Minjun Kim, Joon-ho Lim, KyungTae Lim, Hansaem Kim |
| 2025 | Familiarity-Aware Evidence Compression for Retrieval-Augmented Generation. | Dongwon Jung, Qin Liu, Tenghao Huang, Ben Zhou, Muhao Chen |
| 2025 | QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering. | Woojun Jung, Junyeong Kim |
| 2025 | LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding. | Sheikh Jubair, Arwa Omayrah, Amal Alshammari, Alhanoof Althnian, Abdulhamed Alothaimen, Norah A. Alzahrani, Shahad D. Alzaidi, Nora Al-Twairesh, Abdulmohsen Al-Thubaity |
| 2025 | PoseStitch-SLT: Linguistically Inspired Pose-Stitching for End-to-End Sign Language Translation. | Abhinav Joshi, Vaibhav Sharma, Sanjeet Singh, Ashutosh Modi |
| 2025 | Improving Language Model Personas via Rationalization with Psychological Scaffolds. | Brihi Joshi, Xiang Ren, Swabha Swayamdipta, Rik Koncel-Kedziorski, Tim Paek |
| 2025 | Dependency Parsing-Based Syntactic Enhancement of Relation Extraction in Scientific Texts. | Devvrat Joshi, Islem Rekik |
| 2025 | SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connection. | Maithili Joshi, Palash Nandi, Tanmoy Chakraborty |
| 2025 | I-SEE: An Instruction-tuned, SOP-Enhanced Quality Evaluator for Product Content. | Aniket Joshi, Cyrus Andre DSouza, Sejal Jain, Jitenkumar Babubhai Rana, Promod Yenigalla |
| 2025 | Calibration Across Layers: Understanding Calibration Evolution in LLMs. | Abhinav Joshi, Areeb Ahmad, Ashutosh Modi |
| 2025 | Public Data Assisted Differentially Private In-Context Learning. | Seongho Joo, Hyukhun Koh, Kyomin Jung |
| 2025 | Harmful Prompt Laundering: Jailbreaking LLMs with Abductive Styles and Symbolic Encoding. | Seongho Joo, Hyukhun Koh, Kyomin Jung |
| 2025 | The Dangers of Indirect Prompt Injection Attacks on LLM-based Autonomous Web Navigation Agents: A Demonstration. | Sam Johnson, Viet Pham, Thai Le |
| 2025 | FicSim: A Dataset for Multi-Faceted Semantic Similarity in Long-Form Fiction. | Natasha Johnson, Amanda Bertsch, Maria-Emil Deal, Emma Strubell |