| 2026 | Assessing the Impact of Typological Features on Multilingual Machine Translation in the Age of Large Language Models. | Vitalii Hirak, Jaap Jumelet, Arianna Bisazza |
| 2026 | BERT, are you paying attention? Attention regularization with human-annotated rationales. | Elize Herrewijnen, Dong Nguyen, Floris Bex, Albert Gatt |
| 2026 | Detecting Subtle Sense Shift with Polysemy-Aware Trends. | Ondrej Herman, Pavel Rychl |
| 2026 | Re2-DocRED: Revisiting Revisited-DocRED for Joint Entity and Relation Extraction. | Chen Kim Heng, Shao Wen Tong, Julian Wong Wei Sheng |
| 2026 | Can LLMs reason over extended multilingual contexts? Towards long-context evaluation beyond retrieval over haystacks. | Amey Hengle, Prasoon Bajpai, Soham Dan, Tanmoy Chakraborty |
| 2026 | Examining the Utility of Self-disclosure Types for Modeling Annotators of Social Norms. | Kieran Henderson, Kian Omoomi, Vasudha Varadarajan, Allison Lahnala, Charles Welch |
| 2026 | Uncovering Hidden Correctness in LLM Causal Reasoning via Symbolic Verification. | Paul He, Yinya Huang, Mrinmaya Sachan, Zhijing Jin |
| 2026 | From Numbers to Narratives: Efficient Language Model-Based Detection for Safety-Critical Minority Classes. | Ahatsham Hayat, Hunter Tridle, Mohammad Rashedul Hasan |
| 2026 | Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies. | Kazuki Hayashi, Shintaro Ozaki, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe |
| 2026 | An Empirical Study of Collective Behaviors and Social Dynamics in Large Language Model Agents. | Farnoosh Hashemi, Michael Macy |
| 2026 | MapAgent: A Hierarchical Agent for Geospatial Reasoning with Dynamic Map Tool Integration. | Md Hasebul Hasan, Mahir Labib Dihan, Tanzima Hashem, Mohammed Eunus Ali, Md. Rizwan Parvez |
| 2026 | Synthesizing question answering data from financial documents: An End-to-End Multi-Agent Approach. | Chetan Harsha, Karmvir Singh Phogat, Sridhar Dasaratha, Shashishekar Ramakrishna |
| 2026 | Debate, Deliberate, Decide (D3): A Cost-Aware Adversarial Framework for Reliable and Interpretable LLM Evaluation. | Abir Harrasse, Chaithanya Bandi, Hari Bandi |
| 2026 | RB-LoRA: Rank-Balanced Aggregation for Low-Rank Adaptation with Federated Fine-Tuning. | Sihyeon Ha, Yongjeong Oh, Yo-Seb Jeon |
| 2026 | Towards Singable Lyrics Translation Using Large Language Models. | Liu Hanze, Yusuke Sakai, Taro Watanabe |
| 2026 | SAGE: An Agentic Explainer Framework for Interpreting SAE Features in Language Models. | Jiaojiao Han, Wujiang Xu, Mingyu Jin, Mengnan Du |
| 2026 | Quantifying Data Contamination in Psychometric Evaluations of LLMs. | Jongwook Han, Woojung Song, Jonggeun Lee, Yohan Jo |
| 2026 | TDFlow: Agentic Workflows for Test Driven Development. | Kevin Han, Siddharth Maddikayala, Tim Knappe, Om Patel, Austen Liao, Amir Barati Farimani |
| 2026 | KAD: A Framework for Proxy-based Test-time Alignment with Knapsack Approximation Deferral. | Ayoub Hammal, Pierre Zweigenbaum, Caio Corro |
| 2026 | NarraBench: A Comprehensive Framework for Narrative Benchmarking. | Sil Hamilton, Matthew Wilkens, Andrew Piper |
| 2026 | Common Sense or Ableism? Rethinking Commonsense Reasoning Through the Lens of Disability. | Karina Halevy, Kimi Wenzel, Seyun Kim, Kyle Dean Bauer, Bruno Neira, Mona T. Diab, Maarten Sap |
| 2026 | RiddleBench: A New Generative Reasoning Benchmark for LLMs. | Deepon Halder, Alan Saji, Thanmay Jayakumar, Anoop Kunchukuttan, Ratish Puduppully, Raj Dabre |
| 2026 | The Price of Thought: A Multilingual Analysis of Reasoning, Performance, and Cost of Negotiation in Large Language Models. | Sherzod Hakimov, Roland Bernard, Tim Leiber, Karl Osswald, Kristina Richert, Ruilin Yang, Raffaella Bernardi, David Schlangen |
| 2026 | Query4Regex: Verifiable Regex Transformation through Formal Operations from NL and DSL Queries. | Joonghyuk Hahn, Yo-Sub Han |
| 2026 | Comparing Text Compression Capabilities of Large Language Models with Traditional Compression Algorithms. | Mehran Haddadi, William John Teahan |