DIAA: A Decoding-Efficient Inference Acceleration Approach for On-Device Large Language Models.
Hao Tian, Sheng Lu, Fuwen Tian, Guangming Cui, Zheng Li, Xuyun Zhang, Quan Z. Sheng, Wanchun Dou
Browse the full AAAI paper archive.
Hao Tian, Sheng Lu, Fuwen Tian, Guangming Cui, Zheng Li, Xuyun Zhang, Quan Z. Sheng, Wanchun Dou
Browse the full AAAI paper archive.