Skip to content

HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization.

Chengyu Huang, Zhengxin Zhang, Claire Cardie

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.