| 2026 | TELLME: Test-Enhanced Learning for Language Model Enrichment. | Minjun Kim, Inho Won, HyeonSeok Lim, MinKyu Kim, Junghun Yuk, Wooyoung Go, Jongyoul Park, Jungyeul Park, KyungTae Lim |
| 2026 | Marking Code Without Breaking It: Code Watermarking for Detecting LLM-Generated Code. | Jungin Kim, Shinwoo Park, Yo-Sub Han |
| 2026 | Hey, wait a minute: on at-issue sensitivity in Language Models. | Sanghee J. Kim, Kanishka Misra |
| 2026 | Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models. | Dain Kim, Jiwoo Lee, Jaehoon Yun, Yonghoe Koo, Qingyu Chen, Hyunjae Kim, Jaewoo Kang |
| 2026 | Detecting Training Data of Large Language Models via Expectation Maximization. | Gyuwan Kim, Yang Li, Evangelia Spiliopoulou, Jie Ma, William Yang Wang |
| 2026 | Diagnosis of Dysarthria Severity and Explanation Generation Using XAI-Enhanced CLINIC-GENIE on Diadochokinetic Tasks. | Jihyeon Kim, Insung Lee, Myoung-Wan Koo |
| 2026 | Think Just Enough: Leveraging Self-Assessed Confidence for Adaptive Reasoning in Language Models. | Junyeob Kim, Sang-goo Lee, Taeuk Kim |
| 2026 | D3: Dynamic Docid Decoding for Multi-Intent Generative Retrieval. | Jaeyoung Kim, Dohyeon Lee, Soona Hong, Seung-won Hwang |
| 2026 | SCRIPTMIND: Crime Script Inference and Cognitive Evaluation for LLM-based Social Engineering Scam Detection System. | Heedou Kim, Changsik Kim, Sanghwa Shin, Jaewoo Kang |
| 2026 | Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs. | Sewon Kim, Jiwon Kim, Seungwoo Shin, Hyejin Chung, Daeun Moon, Yejin Kwon, Hyunsoo Yoon |
| 2026 | Don't Generate, Classify! Low-Latency Prompt Optimization with Structured Complementary Prompt. | Hee-Soo Kim, Jun-Young Kim, Jeong-Hwan Lee, Seong-Jin Park, Kang-Min Kim |
| 2026 | Visual-Linguistic Abductive Reasoning with LLMs for Knowledge-based Visual Question Answering. | Jieun Kim, Yujin Jeong, Sung-Bae Cho |
| 2026 | Aligning Paralinguistic Understanding and Generation in Speech LLMs via Multi-Task Reinforcement Learning. | Minseok Kim, Jingxiang Chen, Seong-Gyun Leem, Yin Huang, Rashi Rungta, Zhicheng Ouyang, Haibin Wu, Surya Teja Appini, Ankur Bansal, Yang Bai, Yue Liu, Florian Metze, Ahmed Aly, Anuj Kumar, Ariya Rastrow, Zhaojiang Lin |
| 2026 | Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Benchmark. | Mohammad Khodadad, Ali Shiraee Kasmaee, Mahdi Astaraki, Nicholas Sherck, Hamidreza Mahyar, Soheila Samiee |
| 2026 | Plasticity vs. Rigidity: The Impact of Low-Rank Adapters on Reasoning on a Micro-Budget. | Zohaib Khan, Omer Tafveez, Zoha Hayat Bhatti |
| 2026 | How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains. | Reza Khanmohammadi, Erfan Miahi, Simerjot Kaur, Charese Smiley, Ivan Brugere, Kundan Thind, Mohammad M. Ghassemi |
| 2026 | DF-RAG: Query-Aware Diversity for Retrieval-Augmented Generation. | Saadat Hasan Khan, Spencer Hong, Jingyu Wu, Kevin Lybarger, Youbing Yin, Erin Babinsky, Daben Liu |
| 2026 | Computational Benchmarks for Egyptian Arabic Child Directed Speech. | Salam Khalifa, Abdelrahim Qaddoumi, Nizar Habash, Owen Rambow |
| 2026 | To Paraphrase or Not: Efficient Comment Detoxification with Unsupervised Detoxifiability Discrimination. | Jing Ke, Zheyong Xie, Shaosheng Cao, Tong Xu, Enhong Chen |
| 2026 | Safeguarding Language Models via Self-Destruct Trapdoor. | Shahar Katz, Bar Alon, Ariel Shaulov, Lior Wolf, Mahmood Sharif |
| 2026 | How Good Are LLMs at Processing Tool Outputs? | Kiran Kate, Yara Rizk, Poulami Ghosh, Ashu Gulati, Tathagata Chakraborti, Zidane Wright, Mayank Agarwal |
| 2026 | How Robust Are Router-LLMs? Analysis of the Fragility of LLM Routing Capabilities. | Aly M. Kassem, Bernhard Schlkopf, Zhijing Jin |
| 2026 | Revealing the Truth with ConLLM for Detecting Multi-Modal Deepfakes. | Gautam Siddharth Kashyap, Harsh Joshi, Niharika Jain, Ebad Shabbir, Jiechao Gao, Nipun Joshi, Usman Naseem |
| 2026 | When the Model Said 'No Comment', We Knew Helpfulness Was Dead, Honesty Was Alive, and Safety Was Terrified. | Gautam Siddharth Kashyap, Mark Dras, Usman Naseem |
| 2026 | DashboardQA: Benchmarking Multimodal Agents for Question Answering on Interactive Dashboards. | Aaryaman Kartha, Ahmed Masry, Mohammed Saidul Islam, Thinh Lang, Shadikur Rahman, Ridwan Mahbub, Mizanur Rahman, Mahir Ahmed, Md. Rizwan Parvez, Enamul Hoque, Shafiq Joty |