| 2025 | Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data Generation. | Zijian Li, Jingjing Fu, Lei Song, Jiang Bian, Jun Zhang, Rui Wang |
| 2025 | Formalizing Test-Time Compute for Function-Level Code Generation. | Haau-Sing Li, Patrick Fernandes, Iryna Gurevych, Andr F. T. Martins |
| 2025 | LLM-Based Behavior Prediction for Social Media Users with Continuous Memory. | Kun Li, Chengwei Dai, Wei Zhou, Songlin Hu |
| 2025 | Do Persona-Infused LLMs Affect Performance in a Strategic Reasoning Game? | John Licato, Stephen Steinle |
| 2025 | Improving Proficiency and Grammar Accuracy for Chinese Language Learners with Large Language Models. | Yuqi Liang, Wenjing Xu, Hongzhi Xu |
| 2025 | Reasoning RAG via System 1 or System 2: A Survey on Reasoning Agentic Retrieval-Augmented Generation for Industry Challenges. | Jintao Liang, Gang Su, Huifeng Lin, You Wu, Rui Zhao, Ziyue Li |
| 2025 | CtrlShift: Steering Language Models for Dense Quotation Retrieval with Dynamic Prompts. | Chuang Liang, Wei Li, Yanqiu Shao |
| 2025 | Semantic, Orthographic, and Phonological Biases in Humans' Wordle Gameplay. | Jiadong Gary Liang, Adam Kabbara, Jiaying Liu, Ronaldo Luo, Kina Kim, Michael Guerzhoy |
| 2025 | ACE-ICD: Acronym Expansion As Data Augmentation For Automated ICD Coding. | Tuan-Dung Le, Shohreh Haddadan, Thanh Thieu |
| 2025 | Multilingual, Not Multicultural: Uncovering the Cultural Empathy Gap in LLMs through a Comparative Empathetic Dialogue Benchmark. | Woojin Lee, Yujin Sim, Hongjin Kim, Harksoo Kim |
| 2025 | Critical Thinking: Which Kinds of Complexity Govern Optimal Reasoning Length? | Celine Lee, Alexander M. Rush, Keyon Vafa |
| 2025 | ControlMed: Adding Reasoning Control to Medical Language Model. | Sung-Min Lee, Siyoon Lee, Juyeon Kim, Kyoungmin Roh |
| 2025 | Speak & Spell: LLM-Driven Controllable Phonetic Error Augmentation for Robust Dialogue State Tracking. | Jihyun Lee, Solee Im, Wonjun Lee, Gary Lee |
| 2025 | Autoformalizing Natural Language to First-Order Logic: A Case Study in Logical Fallacy Detection. | Abhinav Lalwani, Tasha Kim, Lovish Chopra, Christopher Hahn, Zhijing Jin, Mrinmaya Sachan |
| 2025 | MuSciClaims: Multimodal Scientific Claim Verification. | Yash Kumar Lal, Manikanta Bandham, Mohammad Saqib Hasan, Apoorva Kashi, Mahnaz Koupaee, Niranjan Balasubramanian |
| 2025 | Whose story is it? Personalizing story generation by inferring author styles. | Nischal Ashok Kumar, Chau Minh Pham, Mohit Iyyer, Andrew Lan |
| 2025 | Enhancing BERT Fine-Tuning for Sentiment Analysis in Lower-Resourced Languages. | Jozef Kubk, Marek Suppa, Martin Takc |
| 2025 | Signs of Struggle: Spotting Cognitive Distortions across Language and Register. | Abhishek Kuber, Enrico Liscio, Ruixuan Zhang, Caroline A. Figueroa, Pradeep K. Murukannaiah |
| 2025 | ClinStructor: AI-Powered Structuring of Unstructured Clinical Texts. | Karthikeyan K, Raghuveer Thirukovalluru, David E. Carlson |
| 2025 | Social Bias in Popular Question-Answering Benchmarks. | Angelie Kraft, Judith Simon, Sonja Schimmler |
| 2025 | Building Helpful-Only Large Language Models: A Complete Approach from Motivation to Evaluation. | Donghyeon Ko, Sohee Yang, Donghyun Kwak, Sang-Woo Lee |
| 2025 | Multimodal Language Models for Financial Forecasting from Interleaved Sequences of Text and Time Series. | Ross Koval, Nicholas Andrews, Xifeng Yan |
| 2025 | SafePersuasion: A Dataset, Taxonomy, and Baselines for Analysis of Rational Persuasion and Manipulation. | Haein Kong, A M. Muntasir Rahman, Ruixiang Tang, Vivek Singh |
| 2025 | EWoRA: Expert Weighted Low-Rank Adaptation for Heterogeneous Data. | Harsh Kohli, Helian Feng, Lenon Minorics, Bhoomit Vasani, Xin He, Ali Kebarighotbi |
| 2025 | Crypto-LLM: Two-Stage Language Model Pre-training with Ciphered and Natural Language Data. | Yohei Kobashi, Fumiya Uchiyama, Takeshi Kojima, Andrew Gambardella, Qi Cao, Yusuke Iwasawa, Yutaka Matsuo |