Skip to content

RecFlow: Unlocking GPU Efficiency for DLRM Inference via Fine-Grained Parallelism and Incremental Batching.

Siheng Pan, Shaolong Li, Minwei Zhang, Shuxi Guo, Haifeng Sun, Qi Qi, Zirui Zhuang, Xiang Yang, Chunyang Jiang, Jianxin Liao, Jing Wang

Year2026
ProceedingsINFOCOM

Browse the full INFOCOM paper archive.