Skip to content

Kunle Olukotun

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

117

Venues

33

Active years

1987–2026

Best venue rank

A*

Where they publish

Papers

117 indexed papers, newest first.

YearVenueTitleAuthors
2026ASPLOSFuseFlow: A Fusion-Centric Compilation Framework for Sparse Deep Learning on Streaming Dataflow.Rubens Lacouture, Nathan Zhang, Ritvik Sharma, Marco Siracusa, Fredrik Kjolstad, Kunle Olukotun, Olivia Hsu
2026ASPLOSStreaming Tensor Programs: A Streaming Abstraction for Dynamic Parallelism.Gina Sohn, Genghan Zhang, Konstantin Hofeld, Jungwoo Kim, Nathan Sobotka, Nathan Zhang, Olivia Hsu, Kunle Olukotun
2025CGOStardust: Compiling Sparse Tensor Algebra to a Reconfigurable Dataflow Architecture.Olivia Hsu, Alexander Rucker, Tian Zhao, Varun Desai, Kunle Olukotun, Fredrik Kjolstad
2025ICCDSSM-RDU: A Reconfigurable Dataflow Unit for Long-Sequence State-Space Models.Sho Ko, Kunle Olukotun
2025ICMLAdaptive Self-improvement LLM Agentic System for ML Library Development.Genghan Zhang, Weixin Liang, Olivia Hsu, Kunle Olukotun
2025ICMLLowRA: Accurate and Efficient LoRA Fine-Tuning of LLMs under 2 Bits.Zikai Zhou, Qizheng Zhang, Hermann Kumbong, Kunle Olukotun
2024HPCARevet: A Language and Compiler for Dataflow Threads.Alexander C. Rucker, Shiv Sundram, Coleman Smith, Matthew Vilim, Raghu Prabhakar, Fredrik Kjlstad, Kunle Olukotun
2024ISCAThe Dataflow Abstract Machine Simulator Framework.Nathan Zhang, Rubens Lacouture, Gina Sohn, Paul Mure, Qizheng Zhang, Fredrik Kjolstad, Kunle Olukotun
2024MICROSambaNova SN40L: Scaling the AI Memory Wall with Dataflow and Composition of Experts.Raghu Prabhakar, Ram Sivaramakrishnan, Darshan Gandhi, Yun Du, Mingran Wang, Xiangyu Song, Kejie Zhang, Tianren Gao, Angela Wang, Xiaoyan Li, Yongning Sheng, Joshua Brot, Denis Sokolov, Apurv Vivek, Calvin Leung, Arjun Sabnis, Jiayu Bai, Tuowen Zhao, Mark Gottscho, David Jackson, Mark Luttrell, Manish K. Shah, Zhengyu Chen, Kaizhao Liang, Swayambhoo Jain, Urmish Thakker, Dawei Huang, Sumti Jairath, Kevin J. Brown, Kunle Olukotun
2024OSDICaravan: Practical Online Learning of In-Network ML Models with Labeling Agents.Qizheng Zhang, Ali Imran, Enkeleda Bardhi, Tushar Swamy, Nathan Zhang, Muhammad Shahbaz, Kunle Olukotun
2023ASPLOSSigma: Compiling Einstein Summations to Locality-Aware Dataflow.Tian Zhao, Alexander Rucker, Kunle Olukotun
2023ASPLOSBaCO: A Fast and Portable Bayesian Compiler Optimization Framework.Erik Orm Hellsten, Artur L. F. Souza, Johannes Lenfers, Rubens Lacouture, Olivia Hsu, Adel Ejjeh, Fredrik Kjolstad, Michel Steuwer, Kunle Olukotun, Luigi Nardi
2023ASPLOSThe Sparse Abstract Machine.Olivia Hsu, Maxwell Strange, Ritvik Sharma, Jaeyeon Won, Kunle Olukotun, Joel S. Emer, Mark A. Horowitz, Fredrik Kjlstad
2023ASPLOSHomunculus: Auto-Generating Efficient Data-Plane ML Pipelines for Datacenter Networks.Tushar Swamy, Annus Zulfiqar, Luigi Nardi, Muhammad Shahbaz, Kunle Olukotun
2022ASPLOSTaurus: a data plane architecture for per-packet ML.Tushar Swamy, Alexander Rucker, Muhammad Shahbaz, Ishan Gaur, Kunle Olukotun
2021CIDR"Let the Data Flow!".Kunle Olukotun
2021ISCASARA: Scaling a Reconfigurable Dataflow Accelerator.Yaqi Zhang, Nathan Zhang, Tian Zhao, Matt Vilim, Muhammad Shahbaz, Kunle Olukotun
2021ISCAAurochs: An Architecture for Dataflow Threads.Matthew Vilim, Alexander Rucker, Kunle Olukotun
2021MICROCapstan: A Vector RDA for Sparsity.Alexander Rucker, Matthew Vilim, Tian Zhao, Yaqi Zhang, Raghu Prabhakar, Kunle Olukotun
2020ISCAGorgon: Accelerating Machine Learning from Relational Data.Matthew Vilim, Alexander Rucker, Yaqi Zhang, Sophia Liu, Kunle Olukotun
2019FPLTensorFlow to Cloud FPGAs: Tradeoffs for Accelerating Deep Neural Networks.Stefan Hadjis, Kunle Olukotun
2019ICDCSPolystore++: Accelerated Polystore System for Heterogeneous Workloads.Rekha Singhal, Nathan Zhang, Luigi Nardi, Muhammad Shahbaz, Kunle Olukotun
2019ISCAScalable interconnects for reconfigurable spatial architectures.Yaqi Zhang, Alexander Rucker, Matthew Vilim, Raghu Prabhakar, William Hwang, Kunle Olukotun
2019MASCOTSPractical Design Space Exploration.Luigi Nardi, David Koeplinger, Kunle Olukotun
2019MASCOTSHyperMapper: a Practical Design Space Exploration Framework.Luigi Nardi, Artur L. F. Souza, David Koeplinger, Kunle Olukotun
2018ICDELevelHeaded: A Unified Engine for Business Intelligence and Linear Algebra Querying.Christopher R. Aberger, Andrew Lamb, Kunle Olukotun, Christopher R
2018OSDIFlare: Optimizing Apache Spark with Native Compilation for Scale-Up Architectures and Medium-Size Data.Grgory M. Essertel, Ruby Y. Tahboub, James M. Decker, Kevin J. Brown, Kunle Olukotun, Tiark Rompf
2018PLDISpatial: a language and compiler for application accelerators.David Koeplinger, Matthew Feldman, Raghu Prabhakar, Yaqi Zhang, Stefan Hadjis, Ruben Fiszel, Tian Zhao, Luigi Nardi, Ardavan Pedram, Christos Kozyrakis, Kunle Olukotun
2018SIGMODExploring the Utility of Developer Exhaust.Jian Zhang, Max Lam, Stephanie Wang, Paroma Varma, Luigi Nardi, Kunle Olukotun, Christopher R
2017IJCAIEnsuring Rapid Mixing and Low Bias for Asynchronous Gibbs Sampling.Christopher De Sa, Kunle Olukotun, Christopher R
2017ISCAPlasticine: A Reconfigurable Architecture For Parallel Paterns.Raghu Prabhakar, Yaqi Zhang, David Koeplinger, Matthew Feldman, Tian Zhao, Stefan Hadjis, Ardavan Pedram, Christos Kozyrakis, Kunle Olukotun
2017ISCAUnderstanding and Optimizing Asynchronous Low-Precision Stochastic Gradient Descent.Christopher De Sa, Matthew Feldman, Christopher R, Kunle Olukotun
2016ASPLOSGenerating Configurable Hardware from Parallel Patterns.Raghu Prabhakar, David Koeplinger, Kevin J. Brown, HyoukJoong Lee, Christopher De Sa, Christos Kozyrakis, Kunle Olukotun
2016CGOHave abstraction and eat performance, too: optimized heterogeneous computing with parallel patterns.Kevin J. Brown, HyoukJoong Lee, Tiark Rompf, Arvind K. Sujeeth, Christopher De Sa, Christopher R. Aberger, Kunle Olukotun
2016FPGAGraphOps: A Dataflow Library for Graph Analytics Acceleration.Tayo Oguntebi, Kunle Olukotun
2016ICDEOld techniques for new join algorithms: A case study in RDF processing.Christopher R. Aberger, Susan Tu, Kunle Olukotun, Christopher R
2016ICMLEnsuring Rapid Mixing and Low Bias for Asynchronous Gibbs Sampling.Christopher De Sa, Christopher R, Kunle Olukotun
2016ISCAAutomatic Generation of Efficient Accelerators for Reconfigurable Hardware.David Koeplinger, Raghu Prabhakar, Yaqi Zhang, Christina Delimitrou, Christos Kozyrakis, Kunle Olukotun
2016SIGMODEmptyHeaded: A Relational Engine for Graph Processing.Christopher R. Aberger, Susan Tu, Kunle Olukotun, Christopher R
2015CGOEMEURO: a framework for generating multi-purpose accelerators via deep learning.Lawrence C. McAfee, Kunle Olukotun
2015FPLAutomatic support for multi-module parallelism from computational patterns.Nithin George, HyoukJoong Lee, David Novo, Muhsen Owaida, David Andrews, Kunle Olukotun, Paolo Ienne
2015ICMLGlobal Convergence of Stochastic Gradient Descent for Some Non-convex Matrix Problems.Christopher De Sa, Christopher R, Kunle Olukotun
2014CGOSimplifying Scalable Graph Processing with a Domain-Specific Language.Sungpack Hong, Semih Salihoglu, Jennifer Widom, Kunle Olukotun
2014FPGAHardware acceleration of database operations.Jared Casper, Kunle Olukotun
2014FPLHardware system synthesis from Domain-Specific Languages.Nithin George, HyoukJoong Lee, David Novo, Tiark Rompf, Kevin J. Brown, Arvind K. Sujeeth, Martin Odersky, Kunle Olukotun, Paolo Ienne
2014ICSAuthor's retrospective for: improving the performance of speculatively parallel applications on the hydra CMP.Kunle Olukotun, Lance Hammond, Mark Willey
2014MICROLocality-Aware Mapping of Nested Parallel Patterns on GPUs.HyoukJoong Lee, Kevin J. Brown, Arvind K. Sujeeth, Tiark Rompf, Kunle Olukotun
2014PLDISurgical precision JIT compilers.Tiark Rompf, Arvind K. Sujeeth, Kevin J. Brown, HyoukJoong Lee, Hassan Chafi, Kunle Olukotun
2014PPoPPBeyond parallel programming with domain specific languages.Kunle Olukotun
2013ECOOPComposition and Reuse with Compiled Domain-Specific Languages.Arvind K. Sujeeth, Tiark Rompf, Kevin J. Brown, HyoukJoong Lee, Hassan Chafi, Victoria Popic, Michael Wu, Aleksandar Prokopec, Vojin Jovanovic, Martin Odersky, Kunle Olukotun
2013GPCEForge: generating a high performance DSL implementation from a declarative specification.Arvind K. Sujeeth, Austin Gibbons, Kevin J. Brown, HyoukJoong Lee, Tiark Rompf, Martin Odersky, Kunle Olukotun
2013POPLOptimizing data structures in high-level programs: new directions for extensible compilers based on staging.Tiark Rompf, Arvind K. Sujeeth, Nada Amin, Kevin J. Brown, Vojin Jovanovic, HyoukJoong Lee, Manohar Jonnalagedda, Kunle Olukotun, Martin Odersky
2013SCOn fast parallel detection of strongly connected components (SCC) in small-world graphs.Sungpack Hong, Nicole C. Rodia, Kunle Olukotun
2012ASPLOSGreen-Marl: a DSL for easy and efficient graph analysis.Sungpack Hong, Hassan Chafi, Eric Sedlar, Kunle Olukotun
2012ICFPHigh performance embedded domain specific languages.Kunle Olukotun
2012ICMLUtilizing Static Analysis and Code Generation to Accelerate Neural Networks.Lawrence C. McAfee, Kunle Olukotun
2011ASPLOSHardware acceleration of transactional memory on commodity systems.Jared Casper, Tayo Oguntebi, Sungpack Hong, Nathan Grasso Bronson, Christos Kozyrakis, Kunle Olukotun
2011CGORuntime automatic speculative parallelization.Ben Hertzberg, Kunle Olukotun
2011ICMLOptiML: An Implicitly Parallel Domain-Specific Language for Machine Learning.Arvind K. Sujeeth, HyoukJoong Lee, Kevin J. Brown, Tiark Rompf, Hassan Chafi, Michael Wu, Anand R. Atreya, Martin Odersky, Kunle Olukotun
2011PPoPPA domain-specific approach to heterogeneous parallelism.Hassan Chafi, Arvind K. Sujeeth, Kevin J. Brown, HyoukJoong Lee, Anand R. Atreya, Kunle Olukotun
2011PPoPPAccelerating CUDA graph algorithms at maximum warp.Sungpack Hong, Sang Kyun Kim, Tayo Oguntebi, Kunle Olukotun
2010FCCMA Large-Scale Architecture for Restricted Boltzmann Machines.Sang Kyun Kim, Peter Leonard McMahon, Kunle Olukotun
2010FCCMFARM: A Prototyping Environment for Tightly-Coupled, Heterogeneous Architectures.Tayo Oguntebi, Sungpack Hong, Jared Casper, Nathan Grasso Bronson, Christos Kozyrakis, Kunle Olukotun
2010HPCAExtreme scale computing: Challenges and opportunities.Josep Torrellas, Bill Gropp, Vivek Sarkar, Jaime H. Moreno, Kunle Olukotun
2010ICECCSImplementing and Evaluating a Model Checker for Transactional Memory Systems.Woongki Baek, Nathan Grasso Bronson, Christos Kozyrakis, Kunle Olukotun
2010ICSMaking nested parallel transactions practical using lightweight hardware support.Woongki Baek, Nathan Grasso Bronson, Christos Kozyrakis, Kunle Olukotun
2010OOPSLALanguage virtualization for heterogeneous parallel computing.Hassan Chafi, Zach DeVito, Adriaan Moors, Tiark Rompf, Arvind K. Sujeeth, Pat Hanrahan, Martin Odersky, Kunle Olukotun
2010PODCTransactional predication: high-performance concurrent sets and maps for STM.Nathan Grasso Bronson, Jared Casper, Hassan Chafi, Kunle Olukotun
2010PPoPPA practical concurrent binary search tree.Nathan Grasso Bronson, Jared Casper, Hassan Chafi, Kunle Olukotun
2010PPoPPExtreme scale computing: challenges and opportunities.Josep Torrellas, Bill Gropp, Jaime H. Moreno, Kunle Olukotun, Vivek Sarkar
2010SPAAImplementing and evaluating nested parallel transactions in software transactional memory.Woongki Baek, Nathan Grasso Bronson, Christos Kozyrakis, Kunle Olukotun
2009FPLA highly scalable Restricted Boltzmann Machine FPGA implementation.Sang Kyun Kim, Lawrence C. McAfee, Peter Leonard McMahon, Kunle Olukotun
2009POPLFeedback-directed barrier optimization in a strongly isolated STM.Nathan Grasso Bronson, Christos Kozyrakis, Kunle Olukotun
2008SPAAAsed: availability, security, and debugging support usingtransactional memory.JaeWoong Chung, Woongki Baek, Nathan Grasso Bronson, Jiwon Seo, Christos Kozyrakis, Kunle Olukotun
2008SPAAImproving software concurrency with hardware-assisted memory snapshot.JaeWoong Chung, Jiwon Seo, Woongki Baek, Chi Cao Minh, Austen McDonald, Christos Kozyrakis, Kunle Olukotun
2007DATEATLAS: a chip-multiprocessor with transactional memory support.Njuguna Njoroge, Jared Casper, Sewook Wee, Yuriy Teslyar, Daxia Ge, Christos Kozyrakis, Kunle Olukotun
2007FPGAA practical FPGA-based framework for novel CMP research.Sewook Wee, Jared Casper, Njuguna Njoroge, Yuriy Teslyar, Daxia Ge, Christos Kozyrakis, Kunle Olukotun
2007HPCAA Scalable, Non-blocking Approach to Transactional Memory.Hassan Chafi, Jared Casper, Brian D. Carlstrom, Austen McDonald, Chi Cao Minh, Woongki Baek, Christos Kozyrakis, Kunle Olukotun
2007ISCAAn effective hybrid transactional memory system with strong isolation guarantees.Chi Cao Minh, Martin Trautmann, JaeWoong Chung, Austen McDonald, Nathan Grasso Bronson, Jared Casper, Christos Kozyrakis, Kunle Olukotun
2007PPoPPTransactional collection classes.Brian D. Carlstrom, Austen McDonald, Michael Carbin, Christos Kozyrakis, Kunle Olukotun
2007SPAATowards soft optimization techniques for parallel cognitive applications.Woongki Baek, JaeWoong Chung, Chi Cao Minh, Christos Kozyrakis, Kunle Olukotun
2006ASPLOSTradeoffs in transactional memory virtualization.JaeWoong Chung, Chi Cao Minh, Austen McDonald, Travis Skare, Hassan Chafi, Brian D. Carlstrom, Christos Kozyrakis, Kunle Olukotun
2006HPCAThe common case transactional behavior of multithreaded programs.JaeWoong Chung, Hassan Chafi, Chi Cao Minh, Austen McDonald, Brian D. Carlstrom, Christos Kozyrakis, Kunle Olukotun
2006ISCAArchitectural Semantics for Practical Transactional Memory.Austen McDonald, JaeWoong Chung, Brian D. Carlstrom, Chi Cao Minh, Hassan Chafi, Christos Kozyrakis, Kunle Olukotun
2006PLDIThe Atomos transactional programming language.Brian D. Carlstrom, Austen McDonald, Hassan Chafi, JaeWoong Chung, Chi Cao Minh, Christoforos E. Kozyrakis, Kunle Olukotun
2005HiPCA New Approach to Programming and Prototyping Parallel Systems.Kunle Olukotun
2005ICSTAPE: a transactional application profiling environment.Hassan Chafi, Chi Cao Minh, Austen McDonald, Brian D. Carlstrom, JaeWoong Chung, Lance Hammond, Christos Kozyrakis, Kunle Olukotun
2005PPoPPExposing speculative thread parallelism in SPEC2000.Manohar K. Prabhu, Kunle Olukotun
2004ASPLOSProgramming with transactional coherence and consistency (TCC).Lance Hammond, Brian D. Carlstrom, Vicky Wong, Ben Hertzberg, Michael K. Chen, Christos Kozyrakis, Kunle Olukotun
2004ISCATransactional Memory Coherence and Consistency.Lance Hammond, Vicky Wong, Michael K. Chen, Brian D. Carlstrom, John D. Davis, Ben Hertzberg, Manohar K. Prabhu, Honggo Wijaya, Christos Kozyrakis, Kunle Olukotun
2003CGOTEST: A Tracer for Extracting Speculative Thread.Michael K. Chen, Kunle Olukotun
2003ISCAThe Jrpm System for Dynamically Parallelizing Java Programs.Michael K. Chen, Kunle Olukotun
2003PPoPPUsing thread-level speculation to simplify manual parallelization.Manohar K. Prabhu, Kunle Olukotun
2002DACEfficient state representation for symbolic simulation.Valeria Bertacco, Kunle Olukotun
1999ICCADJMTP: an architecture for exploiting concurrency in embedded Java applications with real-time considerations.Rachid Helaihel, Kunle Olukotun
1999ICSImproving the performance of speculatively parallel applications on the Hydra CMP.Kunle Olukotun, Lance Hammond, Mark Willey
1998ASPLOSData Speculation Support for a Chip Multiprocessor.Lance Hammond, Mark Willey, Kunle Olukotun
1998DACDigital System Simulation: Methodologies and Examples.Kunle Olukotun, Mark A. Heinrich, David Ofelt
1998FCCMA Quantitative Analysis of Reconfigurable Coprocessors for Multimedia Applications.Takashi Miyamori, Kunle Olukotun
1998FPGAREMARC: Reconfigurable Multimedia Array Coprocessor (Abstract).Takashi Miyamori, Kunle Olukotun
1998ICCDDCP: an algorithm for datapath/control partitioning of synthesizable RTL models.Victor J. Lam, Kunle Olukotun
1997ICCADJava as a specification language for hardware-software systems.Rachid Helaihel, Kunle Olukotun
1997ICCADVerifying correct pipeline implementation for microprocessors.Jeremy R. Levitt, Kunle Olukotun
1997ISCADesigning High Bandwidth On-Chip Caches.Kenneth M. Wilson, Kunle Olukotun
1996ASPLOSThe Case for a Single-Chip Multiprocessor.Kunle Olukotun, Basem A. Nayfeh, Lance Hammond, Kenneth G. Wilson, Kunyung Chang
1996DACA Scalable Formal Verification Methodology for Pipelined Microprocessors.Jeremy R. Levitt, Kunle Olukotun
1996HPCAThe Impact of Shared-Cache Clustering in Small-Scale Shared-Memory Multiprocessors.Basem A. Nayfeh, Kunle Olukotun, Jaswinder Pal Singh
1996ISCAEvaluation of Design Alternatives for a Multiprocessor Microprocessor.Basem A. Nayfeh, Lance Hammond, Kunle Olukotun
1996ISCAIncreasing Cache Port Efficiency for Dynamic Superscalar Microprocessors.Kenneth M. Wilson, Kunle Olukotun, Mendel Rosenblum
1995DACA General Method for Compiling Event-Driven Simulations.Robert S. French, Monica S. Lam, Jeremy R. Levitt, Kunle Olukotun
1995SCThe Benefits of Clustering in Shared Address Space Multiprocessors: An Applications-Driven Investigation.Andrew Erlichson, Basem A. Nayfeh, Jaswinder Pal Singh, Kunle Olukotun
1994ISCAExploring the Design Space for a Shared-Cache Multiprocessor.Basem A. Nayfeh, Kunle Olukotun
1992ISCAPerformance Optimization of Pipelined Primary Caches.Kunle Olukotun, Trevor N. Mudge, Richard B. Brown
1991ISCAImplementing a Cache for a High-Performance GaAs Microprocessor.Kunle Olukotun, Trevor N. Mudge, Richard B. Brown
1990DACAnalysis and Design of Latch-Controlled Synchronous Digital Circuits.Karem A. Sakallah, Trevor N. Mudge, Kunle Olukotun
1990ICCADUntitled recordKarem A. Sakallah, Trevor N. Mudge, Kunle Olukotun
1987DACA Preliminary Investigation into Parallel Routing on a Hypercube Computer.Kunle Olukotun, Trevor N. Mudge