Skip to content

Sparse Growing Transformer: Training-Time Sparse Depth Allocation via Progressive Attention Looping.

Yao Chen, Yilong Chen, Yinqi Yang, Junyuan Shang, Zhenyu Zhang, Zefeng Zhang, Shuaiyi Nie, Shuohuan Wang, Yu Sun, Hua Wu, Haifeng Wang, Tingwen Liu

VenueA*ACL
Year2026
ProceedingsACL (Findings)

Browse the full ACL paper archive.