Skip to content

DIAA: A Decoding-Efficient Inference Acceleration Approach for On-Device Large Language Models.

Hao Tian, Sheng Lu, Fuwen Tian, Guangming Cui, Zheng Li, Xuyun Zhang, Quan Z. Sheng, Wanchun Dou

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.