Skip to content

DeFT: Decoding with Flash Tree-attention for Efficient Tree-structured LLM Inference.

Jinwei Yao, Kaiqi Chen, Kexun Zhang, Jiaxuan You, Binhang Yuan, Zeke Wang, Tao Lin

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.