Gated Linear Attention Transformers with Hardware-Efficient Training.
Songlin Yang, Bailin Wang, Yikang Shen, Rameswar Panda, Yoon Kim
Browse the full ICML paper archive.
Songlin Yang, Bailin Wang, Yikang Shen, Rameswar Panda, Yoon Kim
Browse the full ICML paper archive.