| 2025 | LexTime: A Benchmark for Temporal Ordering of Legal Events. | Claire Barale, Leslie Barrett, Vikram Sunil Bajaj, Michael Rovatsos |
| 2025 | Alleviating Performance Degradation Caused by Out-of-Distribution Issues in Embedding-Based Retrieval. | Haotong Bao, Jianjin Zhang, Qi Chen, Weihao Han, Zhengxin Zeng, Ruiheng Chang, Mingzheng Li, Hao Sun, Weiwei Deng, Feng Sun, Qian Zhang |
| 2025 | Permitted Knowledge Boundary: Evaluating the Knowledge-Constrained Responsiveness of Large Language Models. | Wenrui Bao, Kai Wang, Siqiang Luo, Xiang Li |
| 2025 | CalligraphicOCR for Chinese Calligraphy Recognition. | Xiaoyi Bao, Zhongqing Wang, Jinghang Gu, Chu-Ren Huang |
| 2025 | SurveyGen: Quality-Aware Scientific Survey Generation with Large Language Models. | Tong Bao, Mir Tafseer Nayeem, Davood Rafiei, Chengzhi Zhang |
| 2025 | R2A-TLS: Reflective Retrieval-Augmented Timeline Summarization with Causal-Semantic Integration. | Chenlong Bao, Shijie Li, Minghao Hu, Ming Qiao, Bin Zhang, Jin-Tao Tang, Shasha Li, Ting Wang |
| 2025 | Exploring Quality and Diversity in Synthetic Data Generation for Argument Mining. | Jianzhu Bao, Yuqi Huang, Yang Sun, Wenya Wang, Yice Zhang, Bojun Jin, Ruifeng Xu |
| 2025 | Who's the Author? How Explanations Impact User Reliance in AI-Assisted Authorship Attribution. | Calvin Bao, Connor Baumler, Hal Daum III, Marine Carpuat |
| 2025 | GAP: a Global Adaptive Pruning Method for Large Language Models. | Zhihua Ban, Haotian Ma, Siheng Zhang, Shengyu Liu, Xichen Chen, Ming Yang |
| 2025 | MuseScorer: Idea Originality Scoring At Scale. | Ali Sarosh Bangash, Krish Veera, Ishfat Abrar Islam, Raiyan Abdul Baten |
| 2025 | Soteria: Language-Specific Functional Parameter Steering for Multilingual Safety Alignment. | Somnath Banerjee, Sayan Layek, Pratyush Chatterjee, Animesh Mukherjee, Rima Hazra |
| 2025 | Personalized open world plan generation for safety-critical human centered autonomous systems: A case study on Artificial Pancreas. | Ayan Banerjee, Sandeep Gupta |
| 2025 | Can you SPLICE it together? A Human Curated Benchmark for Probing Visual Reasoning in VLMs. | Mohamad Ballout, Okajevo Wilfred, Seyedalireza Yaghoubi, Nohayr Abdelmoneim, Julius Mayer, Elia Bruni |
| 2025 | Can Large Language Models Personalize Dialogues to Generational Styles? | Pier Felice Balestrucci, Ondrej Dusek, Luca Anselma, Alessandro Mazzei |
| 2025 | A Good Plan is Hard to Find: Aligning Models with Preferences is Misaligned with What Helps Users. | Nishant Balepur, Matthew Shu, Yoo Yeon Sung, Seraphina Goldfarb-Tarrant, Shi Feng, Fumeng Yang, Rachel Rudinger, Jordan Lee Boyd-Graber |
| 2025 | A Closer Look at Bias and Chain-of-Thought Faithfulness of Large (Vision) Language Models. | Sriram Balasubramanian, Samyadeep Basu, Soheil Feizi |
| 2025 | Train One Sparse Autoencoder Across Multiple Sparsity Budgets to Preserve Interpretability and Accuracy. | Nikita Balagansky, Yaroslav Aksenov, Daniil Laptev, Vadim Kurochkin, Gleb Gerasimov, Nikita Koriagin, Daniil Gavrilov |
| 2025 | Power doesn't reside in size: A Low Parameter Hybrid Language Model (HLM) for Sentiment Analysis in Code-mixed data. | Pavan Sai Balaga, Nagasamudram Karthik, Challa Vishwanath, Raksha Sharma, Rudra Murthy, Ashish R. Mittal |
| 2025 | Generating Spatial Knowledge Graphs from Automotive Diagrams for Question Answering. | Steve Bakos, Chen Xing, Heidar Davoudi, Aijun An, Ron DiCarlantonio |
| 2025 | Section-Level Simplification of Biomedical Abstracts. | Jan Bakker, Jaap Kamps |
| 2025 | Molecular String Representation Preferences in Pretrained LLMs: A Comparative Study in Zero- & Few-Shot Molecular Property Prediction. | George Arthur Baker, Mario Sanz-Guerrero, Katharina von der Wense |
| 2025 | FoodSafeSum: Enabling Natural Language Processing Applications for Food Safety Document Summarization and Analysis. | Juli Bakagianni, Korbinian Randl, Guido Rocchietti, Cosimo Rulli, Franco Maria Nardini, Salvatore Trani, Aron Henriksson, Anna Romanova, John Pavlopoulos |
| 2025 | Temporal Referential Consistency: Do LLMs Favor Sequences Over Absolute Time References? | Ashutosh Bajpai, Tanmoy Chakraborty |
| 2025 | Understanding and Leveraging the Expert Specialization of Context Faithfulness in Mixture-of-Experts LLMs. | Jun Bai, Minghao Tong, Yang Liu, Zixia Jia, Zilong Zheng |
| 2025 | CodeComplex: Dataset for Worst-Case Time Complexity Prediction. | Seung-Yeop Baik, Joonghyuk Hahn, Jungin Kim, Aditi, Mingi Jeon, Yo-Sub Han, Sang-Ki Ko |