Shuaiwen Leon Song
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
51
Venues
21
Active years
2012–2025
Best venue rank
A*
Where they publish
Papers
51 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2025 | ICML | Improving Model Alignment Through Collective Intelligence of Open-Source Models. | Junlin Wang, Roy Xie, Shang Zhu, Jue Wang, Ben Athiwaratkun, Bhuwan Dhingra, Shuaiwen Leon Song, Ce Zhang, James Zou |
| 2025 | ICML | Ladder-Residual: Parallelism-Aware Architecture for Accelerating Large Model Inference with Communication Overlapping. | Muru Zhang, Mayank Mishra, Zhongzhu Zhou, William Brandon, Jue Wang, Yoon Kim, Jonathan Ragan-Kelley, Shuaiwen Leon Song, Ben Athiwaratkun, Tri Dao |
| 2024 | OSDI | MonoNN: Enabling a New Monolithic Optimization Space for Neural Network Inference Tasks on Modern GPU-Centric Architectures. | Donglin Zhuang, Zhen Zheng, Haojun Xia, Xiafei Qiu, Junjie Bai, Wei Lin, Shuaiwen Leon Song |
| 2024 | PODC | System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models. | Sam Ade Jacobs, Masahiro Tanaka, Chengming Zhang, Minjia Zhang, Reza Yazdani Aminadabi, Shuaiwen Leon Song, Samyam Rajbhandari, Yuxiong He |
| 2024 | USENIX | Quant-LLM: Accelerating the Serving of Large Language Models via FP6-Centric Algorithm-System Co-Design on Modern GPUs. | Haojun Xia, Zhen Zheng, Xiaoxia Wu, Shiyang Chen, Zhewei Yao, Stephen Youn, Arash Bakhtiari, Michael Wyatt, Donglin Zhuang, Zhongzhu Zhou, Olatunji Ruwase, Yuxiong He, Shuaiwen Leon Song |
| 2023 | EuroSys | TEA: A General-Purpose Temporal Graph Random Walk Engine. | Chengying Huan, Shuaiwen Leon Song, Santosh Pandey, Hang Liu, Yongchao Liu, Baptiste Lepers, Changhua He, Kang Chen, Jinlei Jiang, Yongwei Wu |
| 2023 | HPCA | Post0-VR: Enabling Universal Realistic Rendering for Modern VR via Exploiting Architectural Similarity and Data Sharing. | Yu Wen, Chenhao Xie, Shuaiwen Leon Song, Xin Fu |
| 2023 | ICS | HEAT: A Highly Efficient and Affordable Training System for Collaborative Filtering Based Recommendation on CPUs. | Chengming Zhang, Shaden Smith, Baixi Sun, Jiannan Tian, Jonathan Soifer, Xiaodong Yu, Shuaiwen Leon Song, Yuxiong He, Dingwen Tao |
| 2023 | MICRO | NAS-SE: Designing A Highly-Efficient In-Situ Neural Architecture Search Engine for Large-Scale Deployment. | Qiyu Wan, Lening Wang, Jing Wang, Shuaiwen Leon Song, Xin Fu |
| 2022 | ASPLOS | AStitch: enabling a new multi-dimensional optimization space for memory-intensive ML training and inference on modern SIMT architectures. | Zhen Zheng, Xuanda Yang, Pengzhan Zhao, Guoping Long, Kai Zhu, Feiwen Zhu, Wenyi Zhao, Xiaoyong Liu, Jun Yang, Jidong Zhai, Shuaiwen Leon Song, Wei Lin |
| 2022 | ICDE | TeGraph: A Novel General-Purpose Temporal Graph Computing Engine. | Chengying Huan, Hang Liu, Mengxing Liu, Yongchao Liu, Changhua He, Kang Chen, Jinlei Jiang, Yongwei Wu, Shuaiwen Leon Song |
| 2022 | ICS | Bring orders into uncertainty: enabling efficient uncertain graph processing via novel path sampling on multi-accelerator systems. | Heng Zhang, Lingda Li, Hang Liu, Donglin Zhuang, Rui Liu, Chengying Huan, Shuang Song, Dingwen Tao, Yongchao Liu, Charles He, Yanjun Wu, Shuaiwen Leon Song |
| 2022 | PPoPP | Vapro: performance variance detection and diagnosis for production-run parallel applications. | Liyan Zheng, Jidong Zhai, Xiongchao Tang, Haojie Wang, Teng Yu, Yuyang Jin, Shuaiwen Leon Song, Wenguang Chen |
| 2022 | RTAS | Brief Industry Paper: The Necessity of Adaptive Data Fusion in Infrastructure-Augmented Autonomous Driving System. | Shaoshan Liu, Jianda Wang, Zhendong Wang, Bo Yu, Wei Hu, Yahui Liu, Jie Tang, Shuaiwen Leon Song, Cong Liu, Yang Hu |
| 2021 | ASPLOS | Q-VR: system-level design for future mobile collaborative virtual reality. | Chenhao Xie, Xie Li, Yang Hu, Huwan Peng, Michael B. Taylor, Shuaiwen Leon Song |
| 2021 | ICPP | Fast and Scalable Sparse Triangular Solver for Multi-GPU Based HPC Architectures. | Chenhao Xie, Jieyang Chen, Jesun Firoz, Jiajia Li, Shuaiwen Leon Song, Kevin J. Barker, Mark Raugas, Ang Li |
| 2021 | ISCA | η-LSTM: Co-Designing Highly-Efficient Large LSTM Training via Exploiting Memory-Saving and Architectural Design Opportunities. | Xingyao Zhang, Haojun Xia, Donglin Zhuang, Hao Sun, Xin Fu, Michael B. Taylor, Shuaiwen Leon Song |
| 2021 | ICS | ClickTrain: efficient and accurate end-to-end deep learning training via fine-grained architecture-preserving pruning. | Chengming Zhang, Geng Yuan, Wei Niu, Jiannan Tian, Sian Jin, Donglin Zhuang, Zhe Jiang, Yanzhi Wang, Bin Ren, Shuaiwen Leon Song, Dingwen Tao |
| 2021 | MICRO | Shift-BNN: Highly-Efficient Probabilistic Bayesian Neural Network Training via Memory-Friendly Pattern Retrieving. | Qiyu Wan, Haojun Xia, Xingyao Zhang, Lening Wang, Shuaiwen Leon Song, Xin Fu |
| 2021 | PPoPP | A novel memory-efficient deep learning training framework via error-bounded lossy compression. | Sian Jin, Guanpeng Li, Shuaiwen Leon Song, Dingwen Tao |
| 2021 | PPoPP | An efficient uncertain graph processing framework for heterogeneous architectures. | Heng Zhang, Lingda Li, Donglin Zhuang, Rui Liu, Shuang Song, Dingwen Tao, Yanjun Wu, Shuaiwen Leon Song |
| 2021 | SC | Dr. Top-k: delegate-centric Top-k on GPUs. | Anil Gaihre, Da Zheng, Scott Weitze, Lingda Li, Shuaiwen Leon Song, Caiwen Ding, Xiaoye S. Li, Hang Liu |
| 2021 | SC | MAPA: multi-accelerator pattern allocation policy for multi-tenant GPU servers. | Kiran Ranganath, Joshua D. Suetterlein, Joseph B. Manzano, Shuaiwen Leon Song, Daniel Wong |
| 2020 | HPCA | Enabling Highly Efficient Capsule Networks Processing Through A PIM-Based Architecture Design. | Xingyao Zhang, Shuaiwen Leon Song, Chenhao Xie, Jing Wang, Weigong Zhang, Xin Fu |
| 2019 | DATE | LoSCache: Leveraging Locality Similarity to Build Energy-Efficient GPU L2 Cache. | Jingweijia Tan, Kaige Yan, Shuaiwen Leon Song, Xin Fu |
| 2019 | ISCA | OO-VR: NUMA friendly object-oriented VR rendering framework for future NUMA-based multi-GPU systems. | Chenhao Xie, Xin Fu, Mingsong Chen, Shuaiwen Leon Song |
| 2019 | SC | BSTC: a novel binarized-soft-tensor-core design for accelerating bit-based approximated neural nets. | Ang Li, Tong Geng, Tianqi Wang, Martin C. Herbordt, Shuaiwen Leon Song, Kevin J. Barker |
| 2018 | CGO | Lightweight detection of cache conflicts. | Probir Roy, Shuaiwen Leon Song, Sriram Krishnamoorthy, Xu Liu |
| 2018 | CGO | CUDAAdvisor: LLVM-based runtime profiling for modern GPUs. | Du Shen, Shuaiwen Leon Song, Ang Li, Xu Liu |
| 2018 | ICS | Warp-Consolidation: A Novel Execution Model for GPUs. | Ang Li, Weifeng Liu, Linnan Wang, Kevin J. Barker, Shuaiwen Leon Song |
| 2018 | PPoPP | Superneurons: dynamic GPU memory management for training deep neural networks. | Linnan Wang, Jinmian Ye, Yiyang Zhao, Wei Wu, Ang Li, Shuaiwen Leon Song, Zenglin Xu, Tim Kraska |
| 2017 | ASPLOS | Locality-Aware CTA Clustering for Modern GPUs. | Ang Li, Shuaiwen Leon Song, Weifeng Liu, Xu Liu, Akash Kumar, Henk Corporaal |
| 2017 | HPCA | Processing-in-Memory Enabled Graphics Processors for 3D Rendering. | Chenhao Xie, Shuaiwen Leon Song, Jing Wang, Weigong Zhang, Xin Fu |
| 2017 | ICS | Enabling scalability-sensitive speculative parallelization for FSM computations. | Junqiao Qiu, Zhijia Zhao, Bo Wu, Abhinav Vishnu, Shuaiwen Leon Song |
| 2017 | MICRO | BVF: enabling significant on-chip power savings via bit-value-favor for throughput processors. | Ang Li, Wenfeng Zhao, Shuaiwen Leon Song |
| 2017 | SC | Exploring and analyzing the real impact of modern on-package memory on HPC scientific kernels. | Ang Li, Weifeng Liu, Mads Ruben Burgdorff Kristensen, Brian Vinter, Hao Wang, Kaixi Hou, Andres Marquez, Shuaiwen Leon Song |
| 2017 | SC | Evaluating GPGPU Memory Performance Through the C-AMAT Model. | Ning Zhang, Chuntao Jiang, Xian-He Sun, Shuaiwen Leon Song |
| 2016 | DATE | Critical points based register-concurrency autotuning for GPUs. | Ang Li, Shuaiwen Leon Song, Akash Kumar, Eddy Z. Zhang, Daniel G. Chavarra-Miranda, Henk Corporaal |
| 2016 | HPDC | SMT-Aware Instantaneous Footprint Optimization. | Probir Roy, Xu Liu, Shuaiwen Leon Song |
| 2016 | HPDC | New-Sum: A Novel Online ABFT Scheme For General Iterative Methods. | Dingwen Tao, Shuaiwen Leon Song, Sriram Krishnamoorthy, Panruo Wu, Xin Liang, Eddy Z. Zhang, Darren J. Kerbyson, Zizhong Chen |
| 2016 | ICS | Tag-Split Cache for Efficient GPGPU Cache Utilization. | Lingda Li, Ari B. Hayes, Shuaiwen Leon Song, Eddy Z. Zhang |
| 2016 | ICS | SFU-Driven Transparent Approximation Acceleration on GPUs. | Ang Li, Shuaiwen Leon Song, Mark Wijtvliet, Akash Kumar, Henk Corporaal |
| 2016 | Middleware | Orion: A Framework for GPU Occupancy Tuning. | Ari B. Hayes, Lingda Li, Daniel G. Chavarra-Miranda, Shuaiwen Leon Song, Eddy Z. Zhang |
| 2015 | ICS | Locality-Driven Dynamic GPU Cache Bypassing. | Chao Li, Shuaiwen Leon Song, Hongwen Dai, Albert Sidelnik, Siva Kumar Sastry Hari, Huiyang Zhou |
| 2015 | SC | GraphReduce: processing large-scale graphs on accelerator-based systems. | Dipanjan Sengupta, Shuaiwen Leon Song, Kapil Agarwal, Karsten Schwan |
| 2014 | ICPADS | ACDT: Architected Composite Data Types trading-in unfettered data access for improved execution. | Andres Marquez, Joseph B. Manzano, Shuaiwen Leon Song, Benot Meister, Sunil Shrestha, Thomas St. John, Guang R. Gao |
| 2014 | ICS | An adaptive cross-architecture combination method for graph traversal. | Yang You, Shuaiwen Leon Song, Darren J. Kerbyson |
| 2013 | CLUSTER | EDR: An energy-aware runtime load distribution system for data-intensive applications in the cloud. | Bo Li, Shuaiwen Leon Song, Ivona Bezkov, Kirk W. Cameron |
| 2013 | SC | Unified performance and power modeling of scientific workloads. | Shuaiwen Leon Song, Kevin J. Barker, Darren J. Kerbyson |
| 2012 | SC | Poster: Three Steps to Model Power-Performance Efficiency for Emergent GPU-Based Parallel Systems. | Shuaiwen Leon Song |
| 2012 | SC | Abstract: Three Steps to Model Power-Performance Efficiency for Emergent GPU-Based Parallel Systems. | Shuaiwen Leon Song, Chun-Yi Su, Barry Rountree, Kirk W. Cameron |