Skip to content

A Reward-Guided Dual-Phase Framework for Adaptive Inference-Time Reasoning.

Yingqian Cui, Zhenwei Dai, Pengfei He, Bing He, Hui Liu, Zhan Shi, Xianfeng Tang, Jingying Zeng, Suhang Wang, Yue Xing, Jiliang Tang, Benoit Dumoulin

VenueA*ACL
Year2026
ProceedingsACL (Findings)

Browse the full ACL paper archive.