Skip to content

LEASH: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model.

Yanhao Li, Lu Ma, Jiaran Zhang, Lexiang Tang, Wentao Zhang, Guibo Luo

VenueA*ACL
Year2026
ProceedingsACL (1)

Browse the full ACL paper archive.