| 2026 | HPCA | RidgeWalker: Perfectly Pipelined Graph Random Walks on FPGAs. | Hongshi Tan, Yao Chen, Xinyu Chen, Qizhen Zhang, Cheng Chen, Weng-Fai Wong, Bingsheng He |
| 2026 | HPDC | CARBS: Compiler Autotuning via Randomized Biased Search. | Wei Li, Bin Gao, Weng-Fai Wong |
| 2026 | ICDE | Incremental GNN Embedding Computation on Streaming Graphs. | Qiange Wang, Haoran Lv, Yanfeng Zhang, Weng-Fai Wong, Bingsheng He |
| 2026 | ISCA | Approaching Shannon Bound with Lossless LLM Weight Compression. | Hongshi Tan, Yao Chen, Gustavo Alonso, Weng-Fai Wong, Bingsheng He |
| 2026 | ISCA | XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA. | Feng Yu, Hongshi Tan, Yao Chen, Weng-Fai Wong, Bingsheng He |
| 2026 | WWW | Energy-Efficient and Dequantization-Free Quantization of LLMs: A Spiking Neural Network Approach to Salient Value Mitigation. | Chenyu Wang, Zhanglu Yan, Zhi Zhou, Xu Chen, Weng-Fai Wong |
| 2025 | DAC | Configurable DSP-Based CAM Architecture for Data-Intensive Applications on FPGAs. | Yao Chen, Feng Yu, Di Wu, Weng-Fai Wong, Bingsheng He |
| 2025 | ICCAD | Optimizing Neural Networks with Learnable Non-Linear Activation Functions via Lookup-Based FPGA Acceleration. | Mengyuan Yin, Benjamin Chen Ming Choong, Chuping Qu, Rick Siow Mong Goh, Weng-Fai Wong, Tao Luo |
| 2025 | ICDE | Vista: Vector Indexing and Search for Large-Scale Imbalanced Datasets. | Yujian Fu, Cheng Chen, Yao Chen, Weng-Fai Wong, Bingsheng He |
| 2025 | ICML | Sorbet: A Neuromorphic Hardware-Compatible Transformer-Based Spiking Language Model. | Kaiwen Tang, Zhanglu Yan, Weng-Fai Wong |
| 2025 | INFOCOM | Online Context Caching for Distributed Large Language Models Serving. | Bin Gao, Zhuomin He, Yizhen Yao, Zhanzhi Lou Lou, Zhi Zhou, Weng-Fai Wong |
| 2025 | KDD | ScalaGBM: Memory Efficient GBDT Training for High-Dimensional Data on GPU. | Borui Xu, Zeyi Wen, Yao Chen, Weiguo Liu, Weng-Fai Wong, Bingsheng He |
| 2024 | ACSAC | T-Edge: Trusted Heterogeneous Edge Computing. | Jiamin Shen, Yao Chen, Weng-Fai Wong, Ee-Chien Chang |
| 2024 | DATE | NOVA: NoC-based Vector Unit for Mapping Attention Layers on a CNN Accelerator. | Mohit Upadhyay, Rohan Juneja, Weng-Fai Wong, Li-Shiuan Peh |
| 2024 | FPGA | Table-Lookup MAC: Scalable Processing of Quantised Neural Networks in FPGA Soft Logic. | Daniel Gerlinghoff, Benjamin Chen Ming Choong, Rick Siow Mong Goh, Weng-Fai Wong, Tao Luo |
| 2024 | ICPP | IMI: In-memory Multi-job Inference Acceleration for Large Language Models. | Bin Gao, Zhehui Wang, Zhuomin He, Tao Luo, Weng-Fai Wong, Zhi Zhou |
| 2024 | IJCNN | OneSpike: Ultra-low latency spiking neural networks. | Kaiwen Tang, Zhanglu Yan, Weng-Fai Wong |
| 2023 | ICDE | OpenEmbedding: A Distributed Parameter Server for Deep Learning Recommendation Models using Persistent Memory. | Cheng Chen, Yilin Wang, Jun Yang, Yiming Liu, Mian Lu, Zhao Zheng, Bingsheng He, Weng-Fai Wong, Liang You, Penghao Sun, Yuping Zhao, Fenghua Hu, Andy Rudoff |
| 2023 | ISCAS | 1.7pJ/SOP Neuromorphic Processor with Integrated Partial Sum Routers for In-Network Computing. | Bo Wang, Ming Ming Wong, Dongrui Li, Yi Sheng Chong, Jun Zhou, Weng-Fai Wong, Li-Shiuan Peh, Aarthy Mani, Mohit Upadhyay, Ananta Narayanan Balaji, Anh Tuan Do |
| 2022 | DAC | REACT: a heterogeneous reconfigurable neural network accelerator with software-configurable NoCs for training and inference on wearables. | Mohit Upadhyay, Rohan Juneja, Bo Wang, Jun Zhou, Weng-Fai Wong, Li-Shiuan Peh |
| 2022 | MICRO | ReGraph: Scaling Graph Processing on HBM-enabled FPGAs with Heterogeneous Pipelines. | Xinyu Chen, Yao Chen, Feng Cheng, Hongshi Tan, Bingsheng He, Weng-Fai Wong |
| 2021 | AAAI | Near Lossless Transfer Learning for Spiking Neural Networks. | Zhanglu Yan, Jun Zhou, Weng-Fai Wong |
| 2021 | DAC | Skew-Oblivious Data Routing for Data Intensive Applications on FPGAs with HLS. | Xinyu Chen, Hongshi Tan, Yao Chen, Bingsheng He, Weng-Fai Wong, Deming Chen |
| 2021 | DATE | Posit Arithmetic for the Training and Deployment of Generative Adversarial Networks. | Nhut-Minh Ho, Duy Thanh Nguyen, Himeshi De Silva, John L. Gustafson, Weng-Fai Wong, Ik Joon Chang |
| 2021 | FPGA | ThunderGP: HLS-based Graph Processing Framework on FPGAs. | Xinyu Chen, Hongshi Tan, Yao Chen, Bingsheng He, Weng-Fai Wong, Deming Chen |
| 2021 | FPL | DeepFire: Acceleration of Convolutional Spiking Neural Network on Modern Field Programmable Gate Arrays. | Myat Thu Linn Aung, Chuping Qu, Liwei Yang, Tao Luo, Rick Siow Mong Goh, Weng-Fai Wong |
| 2021 | ICS | ThundeRiNG: generating multiple independent random number sequences on FPGAs. | Hongshi Tan, Xinyu Chen, Yao Chen, Bingsheng He, Weng-Fai Wong |
| 2020 | CIDR | Is FPGA Useful for Hash Joins? | Xinyu Chen, Yao Chen, Ronak Bajaj, Jiong He, Bingsheng He, Weng-Fai Wong, Deming Chen |
| 2020 | DATE | Shenjing: A low power reconfigurable neuromorphic accelerator with partial-sum and spike networks-on-chip. | Bo Wang, Jun Zhou, Weng-Fai Wong, Li-Shiuan Peh |
| 2019 | BIBE | Resource Efficient Personalized ECG Beat Classification via Temporal Logic Synthesis. | Jun Zhou, Weng-Fai Wong |
| 2019 | DATE | Multi-objective Precision Optimization of Deep Neural Networks for Edge Devices. | Nhut-Minh Ho, Ramesh Vaddi, Weng-Fai Wong |
| 2019 | FPL | On-The-Fly Parallel Data Shuffling for Graph Processing on OpenCL-Based FPGAs. | Xinyu Chen, Ronak Bajaj, Yao Chen, Jiong He, Bingsheng He, Weng-Fai Wong, Deming Chen |
| 2018 | ASPLOS | Gloss: Seamless Live Reconfiguration and Reoptimization of Stream Programs. | Sumanaruban Rajadurai, Jeffrey Bosboom, Weng-Fai Wong, Saman P. Amarasinghe |
| 2018 | HiPC | Making Strassen Matrix Multiplication Safe. | Himeshi De Silva, John L. Gustafson, Weng-Fai Wong |
| 2017 | ASPDAC | Efficient floating point precision tuning for approximate computing. | Nhut-Minh Ho, Elavarasi Manogaran, Weng-Fai Wong, Asha Anoosheh |
| 2017 | ICDE | Parallelizing Skip Lists for In-Memory Multi-Core Database Systems. | Zhongle Xie, Qingchao Cai, H. V. Jagadish, Beng Chin Ooi, Weng-Fai Wong |
| 2015 | CASES | PAC: Program Analysis for Approximation-aware Compilation. | Pooja Roy, Jianxing Wang, Weng-Fai Wong |
| 2015 | ICDE | "Anti-Caching"-based elastic memory management for Big Data. | Hao Zhang, Gang Chen, Beng Chin Ooi, Weng-Fai Wong, Shensen Wu, Yubin Xia |
| 2014 | ASPDAC | A coherent hybrid SRAM and STT-RAM L1 cache architecture for shared memory multicores. | Jianxing Wang, Yenni Tim, Weng-Fai Wong, Zhong-Liang Ong, Zhenyu Sun, Hai Li |
| 2014 | CASES | EnVM: Virtual memory design for new memory architectures. | Pooja Roy, Manmohan Manoharan, Weng-Fai Wong |
| 2014 | ICCD | Optimizing MLC-based STT-RAM caches by dynamic block size reconfiguration. | Jianxing Wang, Pooja Roy, Weng-Fai Wong, Xiuyuan Bi, Hai Li |
| 2014 | OOPSLA | StreamJIT: a commensal compiler for high-performance stream programming. | Jeffrey Bosboom, Sumanaruban Rajadurai, Weng-Fai Wong, Saman P. Amarasinghe |
| 2013 | DAC | SAW: system-assisted wear leveling on the write endurance of NAND flash devices. | Chundong Wang, Weng-Fai Wong |
| 2013 | DATE | TreeFTL: efficient RAM management for high performance of NAND flash-based storage systems. | Chundong Wang, Weng-Fai Wong |
| 2013 | ISLPED | A practical low-power memristor-based analog neural branch predictor. | Jianxing Wang, Yenni Tim, Weng-Fai Wong, Hai (Helen) Li |
| 2013 | SC | Accelerating sparse matrix-vector multiplication on GPUs using bit-representation-optimized schemes. | Wai Teng Tang, Wen Jun Tan, Rajarshi Ray, Yi Wen Wong, Weiguang Chen, Shyh-Hao Kuo, Rick Siow Mong Goh, Stephen John Turner, Weng-Fai Wong |
| 2012 | DAC | Observational wear leveling: an efficient algorithm for flash memory management. | Chundong Wang, Weng-Fai Wong |
| 2012 | DATE | Extending the lifetime of NAND flash memory by salvaging bad blocks. | Chundong Wang, Weng-Fai Wong |
| 2012 | EuroPar | Tulipse: A Visualization Framework for User-Guided Parallelization. | Yi Wen Wong, Tomasz Dubrownik, Wai Teng Tang, Wen Jun Tan, Rubing Duan, Rick Siow Mong Goh, Shyh-Hao Kuo, Stephen John Turner, Weng-Fai Wong |
| 2012 | ICPADS | Automatic Refactoring of Legacy Fortran Code to the Array Slicing Notation. | Chandrasehar Rajaseharan, Wen Jun Tan, Wai Teng Tang, Stephen John Turner, Shyh-Hao Kuo, Rick Siow Mong Goh, Weng-Fai Wong |
| 2012 | PPoPP | Scalable framework for mapping streaming applications onto multi-GPU systems. | Huynh Phung Huynh, Andrei Hagiescu, Weng-Fai Wong, Rick Siow Mong Goh |
| 2012 | SC | Abstract: Mapping Streaming Applications onto GPU Systems. | Huynh Phung Huynh, Andrei Hagiescu, Weng-Fai Wong, Rick Siow Mong Goh, Abhishek Ray |
| 2012 | SC | Poster: Automated Mapping Streaming Applications onto GPUs. | Huynh Phung Huynh, Andrei Hagiescu, Weng-Fai Wong, Rick Siow Mong Goh, Abhishek Ray |
| 2011 | DATE | A UML 2-based hardware-software co-design framework for body sensor network applications. | Zhenxin Sun, Chi-Tsai Yeh, Weng-Fai Wong |
| 2011 | FPGA | Co-synthesis of FPGA-based application-specific floating point simd accelerators. | Andrei Hagiescu, Weng-Fai Wong |
| 2011 | ISLPED | Processor caches with multi-level spin-transfer torque ram cells. | Yiran Chen, Weng-Fai Wong, Hai Li, Cheng-Kok Koh |
| 2011 | MICRO | Multi retention level STT-RAM cache designs with a dynamic refresh scheme. | Zhenyu Sun, Xiuyuan Bi, Hai (Helen) Li, Weng-Fai Wong, Zhong-Liang Ong, Xiaochun Zhu, Wenqing Wu |
| 2011 | VEE | Dynamic cache contention detection in multi-threaded applications. | Qin Zhao, David Koh, Syed Raza, Derek Bruening, Weng-Fai Wong, Saman P. Amarasinghe |
| 2010 | FCCM | Interprocedural Placement-Aware Configuration Prefetching for FPGA-Based Systems. | Joon Edward Sim, Weng-Fai Wong, Gregor Walla, Tobias Ziermann, Jrgen Teich |
| 2009 | ASPDAC | A UML-based approach for heterogeneous IP integration. | Zhenxin Sun, Weng-Fai Wong |
| 2009 | DAC | A DVS-based pipelined reconfigurable instruction memory. | Zhiguo Ge, Tulika Mitra, Weng-Fai Wong |
| 2009 | DAC | A computing origami: folding streams in FPGAs. | Andrei Hagiescu, Weng-Fai Wong, David F. Bacon, Rodric M. Rabbah |
| 2009 | FCCM | Optimal Placement-aware Trace-Based Scheduling of Hardware Reconfigurations for FPGA Accelerators. | Joon Edward Sim, Weng-Fai Wong, Jrgen Teich |
| 2009 | ICCD | The salvage cache: A fault-tolerant cache architecture for next-generation memory technologies. | Cheng-Kok Koh, Weng-Fai Wong, Yiran Chen, Hai Li |
| 2009 | BSN | BSN Simulator: Optimizing Application Using System Level Simulation. | Ioana Cutcutache, Thi Thanh Nga Dang, Wai Kay Leong, Shanshan Liu, Kathy Dang Nguyen, Linh Thi Xuan Phan, Joon Edward Sim, Zhenxin Sun, Teck Bok Tok, Lin Xu, Francis Eng Hock Tay, Weng-Fai Wong |
| 2009 | SOSP | Automatically patching errors in deployed software. | Jeff H. Perkins, Sunghun Kim, Samuel Larsen, Saman P. Amarasinghe, Jonathan Bachrach, Michael Carbin, Carlos Pacheco, Frank Sherwood, Stelios Sidiroglou, Gregory T. Sullivan, Weng-Fai Wong, Yoav Zibin, Michael D. Ernst, Martin C. Rinard |
| 2008 | CC | How to Do a Million Watchpoints: Efficient Debugging Using Dynamic Instrumentation. | Qin Zhao, Rodric M. Rabbah, Saman P. Amarasinghe, Larry Rudolph, Weng-Fai Wong |
| 2008 | CGO | Pipa: pipelined profiling and analysis on multi-core systems. | Qin Zhao, Ioana Cutcutache, Weng-Fai Wong |
| 2007 | AINA | An Inter-Core Communication Enabled Multi-Core Simulator Based on SimpleScalar. | Rongrong Zhong, Yongxin Zhu, Weiwei Chen, Mingliang Lin, Weng-Fai Wong |
| 2007 | CGO | Ubiquitous Memory Introspection. | Qin Zhao, Rodric M. Rabbah, Saman P. Amarasinghe, Larry Rudolph, Weng-Fai Wong |
| 2007 | DATE | DRIM: a low power dynamically reconfigurable instruction memory hierarchy for embedded systems. | Zhiguo Ge, Weng-Fai Wong, Hock-Beng Lim |
| 2007 | ICCD | VOSCH: Voltage scaled cache hierarchies. | Weng-Fai Wong, Cheng-Kok Koh, Yiran Chen, Hai Li |
| 2007 | RTSS | A UML-Based Design Framework for Time-Triggered Applications. | Kathy Dang Nguyen, P. S. Thiagarajan, Weng-Fai Wong |
| 2006 | EUC | Co-optimization of Performance and Power in a Superscalar Processor Design. | Yongxin Zhu, Weng-Fai Wong, Stefan Andrei |
| 2005 | ASPDAC | Design of clocked circuits using UML. | Zhenxin Sun, Weng-Fai Wong, Yongxin Zhu, Santhosh Kumar Pilakkat |
| 2005 | ASPDAC | An integrated performance and power model for superscalar processor designs. | Yongxin Zhu, Weng-Fai Wong, Stefan Andrei |
| 2005 | FPL | A Reconfigurable Instruction Memory Hierarchy for Embedded Systems. | Zhiguo Ge, Hock-Beng Lim, Weng-Fai Wong |
| 2005 | HiPC | Cooperative Instruction Scheduling with Linear Scan Register Allocation. | Khaing Khaing Kyi Win, Weng-Fai Wong |
| 2005 | LCN | Sensor Grid: Integration ofWireless Sensor Networks and the Grid. | Hock-Beng Lim, Yong Meng Teo, Protik Mukherjee, Vinh The Lam, Weng-Fai Wong, Simon See |
| 2005 | RTCSA | Using UML 2.0 for System Level Design of Real Time SoC Platforms for Stream Processing. | Yongxin Zhu, Zhenxin Sun, Alexander Maxiaguine, Weng-Fai Wong |
| 2004 | ASPLOS | Compiler orchestrated prefetching via speculation and predication. | Rodric M. Rabbah, Hariharan Sandanagobalane, Mongkol Ekpanyapong, Weng-Fai Wong |
| 2004 | CGO | Static Identification of Delinquent Loads. | Vlad-Mihai Panait, Amit Sasturkar, Weng-Fai Wong |
| 2004 | ICCAD | Configuration bitstream compression for dynamically reconfigurable FPGAs. | Lei He, Tulika Mitra, Weng-Fai Wong |
| 2004 | PDPTA | Adaptive Compiler Directed Prefetching for EPIC Processors. | Jinwoo Kim, Rodric M. Rabbah, Krishna V. Palem, Weng-Fai Wong |
| 2004 | RTSS | Model-Driven SoC Design via Executable UML to SystemC. | Kathy Dang Nguyen, Zhenxin Sun, P. S. Thiagarajan, Weng-Fai Wong |
| 2003 | CCGRID | The Performance Model of SilkRoad - A Multithreaded DSM System for Clusters. | Liang Peng, Weng-Fai Wong, Chung-Kwong Yuen |
| 2003 | FPL | A Model for Hardware Realization of Kernel Loops. | Jirong Liao, Weng-Fai Wong, Tulika Mitra |
| 2002 | CLUSTER | SilkRoad II: A Multi-Paradigm Runtime System for Cluster Computing. | Liang Peng, Weng-Fai Wong, Chung-Kwong Yuen |
| 2002 | CLUSTER | Shell over a Cluster (SHOC): Towards Achieving Single System Image via the Shell. | C. M. Tan, C. P. Tan, Weng-Fai Wong |
| 2002 | ICCD | A Framework for Data Prefetching Using Off-Line Training of Markovian Predictors. | Jinwoo Kim, Krishna V. Palem, Weng-Fai Wong |
| 2001 | CASES | The emerging power crisis in embedded processors: what can a poor compiler do? | Lakshmi N. Chakrapani, Pinar Korkmaz, Vincent John Mooney III, Krishna V. Palem, Kiran Puttaswamy, Weng-Fai Wong |
| 2001 | EMSOFT | Compiler Optimizations for Adaptive EPIC Processors. | Krishna V. Palem, Surendranath Talla, Weng-Fai Wong |
| 2000 | CLUSTER | SilkRoad: A Multithreaded Runtime System with Software Distributed Shared Memory for SMP Clusters. | Liang Peng, Weng-Fai Wong, Ming-Dong Feng, Chung-Kwong Yuen |
| 2000 | ICPADS | ORION: An Adaptive Home-Based Software Distributed Shared Memory System. | M. C. Ng, Weng-Fai Wong |
| 1995 | ICPP | Design and Implementation of Abstract Machine for Parallel Lisp Compilation. | Ming-Dong Feng, Weng-Fai Wong, Chung-Kwong Yuen |
| 1989 | ICTAI | BIDDLE: a bidirectional data driven Lisp engine. | Weng-Fai Wong, Chung-Kwong Yuen |