Sparse Growing Transformer: Training-Time Sparse Depth Allocation via Progressive Attention Looping.
Yao Chen, Yilong Chen, Yinqi Yang, Junyuan Shang, Zhenyu Zhang, Zefeng Zhang, Shuaiyi Nie, Shuohuan Wang, Yu Sun, Hua Wu, Haifeng Wang, Tingwen Liu
Browse the full ACL paper archive.