RecFlow: Unlocking GPU Efficiency for DLRM Inference via Fine-Grained Parallelism and Incremental Batching.
Siheng Pan, Shaolong Li, Minwei Zhang, Shuxi Guo, Haifeng Sun, Qi Qi, Zirui Zhuang, Xiang Yang, Chunyang Jiang, Jianxin Liao, Jing Wang
Browse the full INFOCOM paper archive.