William J. Dally
Publication record assembled from the DBLP archive of ranked conferences.
Papers indexed
123
Venues
28
Active years
1985–2023
Best venue rank
A*
Where they publish
- A*ISCA24 papers
- A*HPCA14 papers
- CICCD13 papers
- ASC12 papers
- A*MICRO9 papers
- A*DAC8 papers
- BSPAA6 papers
- A*ASPLOS5 papers
- AICS5 papers
- A*ICLR4 papers
- BPPoPP4 papers
- BICPP2 papers
- NationalHOTI2 papers
- A*ICML1 paper
- AICCAD1 paper
- AUSENIX1 paper
- A*CVPR1 paper
- BISPASS1 paper
- Journal PublishedCASES1 paper
- BEuroPar1 paper
- ADATE1 paper
- AISLPED1 paper
- NationalWCAE1 paper
- A*INFOCOM1 paper
- CISCAS1 paper
- ACIKM1 paper
- A*SIGMOD1 paper
- A*PLDI1 paper
Papers
123 indexed papers, newest first.
| Year | Venue | Title | Authors |
|---|---|---|---|
| 2023 | ASPLOS | GPU-Initiated On-Demand High-Throughput Storage Access in the BaM System Architecture. | Zaid Qureshi, Vikram Sharma Mailthody, Isaac Gelado, Seungwon Min, Amna Masood, Jeongmin Brian Park, Jinjun Xiong, Chris J. Newburn, Dmitri Vainbrand, I-Hsin Chung, Michael Garland, William J. Dally, Wen-Mei W. Hwu |
| 2022 | ICML | Optimal Clipping and Magnitude-aware Differentiation for Improved Quantization-aware Training. | Charbel Sakr, Steve Dai, Rangharajan Venkatesan, Brian Zimmer, William J. Dally, Brucek Khailany |
| 2021 | SPAA | SPAA'21 Panel Paper: Architecture-Friendly Algorithms versus Algorithm-Friendly Architectures. | Guy E. Blelloch, William J. Dally, Margaret Martonosi, Uzi Vishkin, Katherine A. Yelick |
| 2020 | HPCA | SpArch: Efficient Architecture for Sparse Matrix Multiplication. | Zhekai Zhang, Hanrui Wang, Song Han, William J. Dally |
| 2019 | DAC | Analog/Mixed-Signal Hardware Error Modeling for Deep Learning Inference. | Angad S. Rekhi, Brian Zimmer, Nikola Nedovic, Ningxi Liu, Rangharajan Venkatesan, Miaorong Wang, Brucek Khailany, William J. Dally, C. Thomas Gray |
| 2019 | HPCA | Darwin-WGA: A Co-processor Provides Increased Sensitivity in Whole Genome Alignments with High Speedup. | Yatish Turakhia, Sneha D. Goenka, Gill Bejerano, William J. Dally |
| 2019 | ICCAD | MAGNet: A Modular Accelerator Generator for Neural Networks. | Rangharajan Venkatesan, Yakun Sophia Shao, Miaorong Wang, Jason Clemons, Steve Dai, Matthew Fojtik, Ben Keller, Alicia Klinefelter, Nathaniel Ross Pinckney, Priyanka Raina, Yanqing Zhang, Brian Zimmer, William J. Dally, Joel S. Emer, Stephen W. Keckler, Brucek Khailany |
| 2019 | MICRO | Simba: Scaling Deep-Learning Inference with Multi-Chip-Module-Based Architecture. | Yakun Sophia Shao, Jason Clemons, Rangharajan Venkatesan, Brian Zimmer, Matthew Fojtik, Nan Jiang, Ben Keller, Alicia Klinefelter, Nathaniel Ross Pinckney, Priyanka Raina, Stephen G. Tell, Yanqing Zhang, William J. Dally, Joel S. Emer, C. Thomas Gray, Brucek Khailany, Stephen W. Keckler |
| 2019 | USENIX | Darwin: A Genomics Co-processor Provides up to 15, 000X Acceleration on Long Read Assembly. | Yatish Turakhia, Gill Bejerano, William J. Dally |
| 2018 | ASPLOS | Darwin: A Genomics Co-processor Provides up to 15, 000X Acceleration on Long Read Assembly. | Yatish Turakhia, Gill Bejerano, William J. Dally |
| 2018 | DAC | Bandwidth-efficient deep learning. | Song Han, William J. Dally |
| 2018 | ICLR | Efficient Sparse-Winograd Convolutional Neural Networks. | Xingyu Liu, Jeff Pool, Song Han, William J. Dally |
| 2017 | CVPR | Exploring the Granularity of Sparsity in Convolutional Neural Networks. | Huizi Mao, Song Han, Jeff Pool, Wenshuo Li, Xingyu Liu, Yu Wang, William J. Dally |
| 2017 | HPCA | Architecting an Energy-Efficient DRAM System for GPUs. | Niladrish Chatterjee, Mike O'Connor, Donghyuk Lee, Daniel R. Johnson, Stephen W. Keckler, Minsoo Rhu, William J. Dally |
| 2017 | ICLR | DSD: Dense-Sparse-Dense Training for Deep Neural Networks. | Song Han, Jeff Pool, Sharan Narang, Huizi Mao, Enhao Gong, Shijian Tang, Erich Elsen, Peter Vajda, Manohar Paluri, John Tran, Bryan Catanzaro, William J. Dally |
| 2017 | ICLR | Efficient Sparse-Winograd Convolutional Neural Networks. | Xingyu Liu, Song Han, Huizi Mao, William J. Dally |
| 2017 | ICLR | Trained Ternary Quantization. | Chenzhuo Zhu, Song Han, Huizi Mao, William J. Dally |
| 2017 | ISCA | SCNN: An Accelerator for Compressed-sparse Convolutional Neural Networks. | Angshuman Parashar, Minsoo Rhu, Anurag Mukkara, Antonio Puglielli, Rangharajan Venkatesan, Brucek Khailany, Joel S. Emer, Stephen W. Keckler, William J. Dally |
| 2017 | MICRO | Fine-grained DRAM: energy-efficient DRAM for extreme bandwidth systems. | Mike O'Connor, Niladrish Chatterjee, Donghyuk Lee, John M. Wilson, Aditya Agrawal, Stephen W. Keckler, William J. Dally |
| 2016 | ISCA | EIE: Efficient Inference Engine on Compressed Deep Neural Network. | Song Han, Xingyu Liu, Huizi Mao, Jing Pu, Ardavan Pedram, Mark A. Horowitz, William J. Dally |
| 2015 | ISCA | SLIP: reducing wire energy in the memory hierarchy. | Subhasis Das, Tor M. Aamodt, William J. Dally |
| 2015 | SC | Network endpoint congestion control for fine-grained communication. | Nan Jiang, Larry R. Dennison, William J. Dally |
| 2014 | ICS | Author retrospective for design tradeoffs for tiled CMP on-chip networks. | William J. Dally, James D. Balfour |
| 2014 | SC | Scaling the Power Wall: A Path to Exascale. | Oreste Villa, Daniel R. Johnson, Mike O'Connor, Evgeny Bolotin, David W. Nellans, Justin Luitjens, Nikolai Sakharnykh, Peng Wang, Paulius Micikevicius, Anthony Scudiero, Stephen W. Keckler, William J. Dally |
| 2013 | DAC | 21st century digital design tools. | William J. Dally, Chris Malachowsky, Stephen W. Keckler |
| 2013 | ISPASS | A detailed and flexible cycle-accurate Network-on-Chip simulator. | Nan Jiang, Daniel U. Becker, George Michelogiannakis, James D. Balfour, Brian Towles, David E. Shaw, John Kim, William J. Dally |
| 2013 | SC | Channel reservation protocol for over-subscribed channels and destinations. | George Michelogiannakis, Nan Jiang, Daniel Becker, William J. Dally |
| 2012 | HPCA | Network congestion avoidance through Speculative Reservation. | Nan Jiang, Daniel U. Becker, George Michelogiannakis, William J. Dally |
| 2012 | ICCD | Adaptive Backpressure: Efficient buffer management for on-chip networks. | Daniel U. Becker, Nan Jiang, George Michelogiannakis, William J. Dally |
| 2012 | MICRO | Unifying Primary Cache, Scratch, and Register File Memories in a Throughput Processor. | Mark Gebhart, Stephen W. Keckler, Brucek Khailany, Ronny Krashinsky, William J. Dally |
| 2011 | ISCA | Energy-efficient mechanisms for managing thread context in throughput processors. | Mark Gebhart, Daniel R. Johnson, David Tarjan, Stephen W. Keckler, William J. Dally, Erik Lindholm, Kevin Skadron |
| 2011 | MICRO | A compile-time managed multi-level register file hierarchy. | Mark Gebhart, Stephen W. Keckler, William J. Dally |
| 2011 | MICRO | Packet chaining: efficient single-cycle allocation for on-chip networks. | George Michelogiannakis, Nan Jiang, Daniel Becker, William J. Dally |
| 2010 | CASES | Fine-grain dynamic instruction placement for L0 scratch-pad memory. | JongSoo Park, James D. Balfour, William J. Dally |
| 2010 | ICPP | Block-Parallel Programming for Real-Time Embedded Applications. | David Black-Schaffer, William J. Dally |
| 2010 | ISCA | Moving the needle, computer architecture research in academe and industry. | William J. Dally |
| 2010 | ICS | Throughput computing. | William J. Dally |
| 2010 | SPAA | Buffer-space efficient and deadlock-free scheduling of stream applications on multi-core architectures. | JongSoo Park, William J. Dally |
| 2009 | HPCA | Elastic-buffer flow control for on-chip networks. | George Michelogiannakis, James D. Balfour, William J. Dally |
| 2009 | ISCA | Indirect adaptive routing on large scale interconnection networks. | Nan Jiang, John Kim, William J. Dally |
| 2009 | SC | Allocator implementations for network-on-chip routers. | Daniel U. Becker, William J. Dally |
| 2009 | SC | Router designs for elastic buffer on-chip networks. | George Michelogiannakis, William J. Dally |
| 2008 | EuroPar | Stream Scheduling: A Framework to Manage Bulk Operations in Memory Hierarchies. | Abhishek Das, William J. Dally |
| 2008 | ISCA | Technology-Driven, Highly-Scalable Dragonfly Topology. | John Kim, William J. Dally, Steve Scott, Dennis Abts |
| 2008 | PPoPP | A portable runtime interface for multi-level memory hierarchies. | Mike Houston, Ji Young Park, Manman Ren, Timothy J. Knight, Kayvon Fatahalian, Alex Aiken, William J. Dally, Pat Hanrahan |
| 2007 | DATE | Register pointer architecture for efficient embedded processors. | JongSoo Park, Sung-Boem Park, James D. Balfour, David Black-Schaffer, Christos Kozyrakis, William J. Dally |
| 2007 | HPCA | Interconnect-Centric Computing. | William J. Dally |
| 2007 | ISCA | Flattened butterfly: a cost-efficient topology for high-radix networks. | John Kim, William J. Dally, Dennis Abts |
| 2007 | ICS | Tradeoff between data-, instruction-, and thread-level parallelism in stream processors. | Jung Ho Ahn, Mattan Erez, William J. Dally |
| 2007 | ICS | Executing irregular scientific applications on stream architectures. | Mattan Erez, Jung Ho Ahn, Jayanth Gummaraju, Mendel Rosenblum, William J. Dally |
| 2007 | ISLPED | Future of on-chip interconnection architectures. | Shekhar Borkar, William J. Dally |
| 2007 | MICRO | Flattened Butterfly Topology for On-Chip Networks. | John Kim, James D. Balfour, William J. Dally |
| 2007 | PPoPP | Compilation for explicitly managed memory hierarchies. | Timothy J. Knight, Ji Young Park, Manman Ren, Mike Houston, Mattan Erez, Kayvon Fatahalian, Alex Aiken, William J. Dally, Pat Hanrahan |
| 2006 | ICCD | Computer Architecture in the Many-Core Era. | William J. Dally |
| 2006 | ISCA | The BlackWidow High-Radix Clos Network. | Steve Scott, Dennis Abts, John Kim, William J. Dally |
| 2006 | ICS | Design tradeoffs for tiled CMP on-chip networks. | James D. Balfour, William J. Dally |
| 2006 | SC | Architecture - The design space of data-parallel memory systems. | Jung Ho Ahn, Mattan Erez, William J. Dally |
| 2006 | SC | Sequoia: programming the memory hierarchy. | Kayvon Fatahalian, Daniel Reiter Horn, Timothy J. Knight, Larkhoon Leem, Mike Houston, Ji Young Park, Mattan Erez, Manman Ren, Alex Aiken, William J. Dally, Pat Hanrahan |
| 2006 | SC | Interconnect routing and scheduling - Adaptive routing in high-radix clos network. | John Kim, William J. Dally, Dennis Abts |
| 2006 | SC | Multi-core issues - Multi-Core for HPC: breakthrough or breakdown? | Thomas L. Sterling, Peter M. Kogge, William J. Dally, Steve Scott, William Gropp, David E. Keyes, Peter H. Beckman |
| 2005 | DAC | Explaining the gap between ASIC and custom power: a custom perspective. | Andrew Chang, William J. Dally |
| 2005 | HPCA | Scatter-Add in Data Parallel Architectures. | Jung Ho Ahn, Mattan Erez, William J. Dally |
| 2005 | ISCA | Microarchitecture of a High-Radix Router. | John Kim, William J. Dally, Brian Towles, Amit K. Gupta |
| 2005 | SC | Fault Tolerance Techniques for the Merrimac Streaming Supercomputer. | Mattan Erez, Nuwan Jayasena, Timothy J. Knight, William J. Dally |
| 2004 | HPCA | Stream Register Files with Indexed Access. | Nuwan Jayasena, Mattan Erez, Jung Ho Ahn, William J. Dally |
| 2004 | ISCA | Evaluating the Imagine Stream Architecture. | Jung Ho Ahn, William J. Dally, Brucek Khailany, Ujval J. Kapasi, Abhishek Das |
| 2004 | SC | Analysis and Performance Results of a Molecular Modeling Application on Merrimac. | Mattan Erez, Jung Ho Ahn, Ankit Garg, William J. Dally, Eric Darve |
| 2004 | SPAA | Adaptive channel queue routing on k-ary n-cubes. | Arjun Singh, William J. Dally, Amit K. Gupta, Brian Towles |
| 2004 | WCAE | The case for broader computer architecture education: keynote address. | William J. Dally |
| 2003 | HPCA | Exploring the VLSI Scalability of Stream Processors. | Brucek Khailany, William J. Dally, Scott Rixner, Ujval J. Kapasi, John D. Owens, Brian Towles |
| 2003 | ICCD | CMOS High-Speed I/Os - Present and Future. | Ming-Ju Edward Lee, William J. Dally, Ramin Farjad-Rad, Hiok-Tiaq Ng, Ramesh Senthinathan, John H. Edmondson, John W. Poulton |
| 2003 | ISCA | GOAL: A Load-Balanced Adaptive Routing Algorithm for Torus Networks. | Arjun Singh, William J. Dally, Amit K. Gupta, Brian Towles |
| 2003 | SC | Merrimac: Supercomputing with Streams. | William J. Dally, Francois Labonte, Abhishek Das, Pat Hanrahan, Jung Ho Ahn, Jayanth Gummaraju, Mattan Erez, Nuwan Jayasena, Ian Buck, Timothy J. Knight, Ujval J. Kapasi |
| 2003 | SPAA | Throughput-centric routing algorithm design. | Brian Towles, William J. Dally, Stephen P. Boyd |
| 2002 | HOTI | Scalable Opto-Electronic Network (SOENet). | Amit K. Gupta, William J. Dally, Arjun Singh, Brian Towles |
| 2002 | ICCD | The Imagine Stream Processor. | Ujval J. Kapasi, William J. Dally, Scott Rixner, John D. Owens, Brucek Khailany |
| 2002 | ICCD | VLSI Design and Verification of the Imagine Processor. | Brucek Khailany, William J. Dally, Andrew Chang, Ujval J. Kapasi, Jinyung Namkoong, Brian Towles |
| 2002 | ICCD | Media Processing Applications on the Imagine Stream Processor. | John D. Owens, Scott Rixner, Ujval J. Kapasi, Peter R. Mattson, Brian Towles, Ben Serebrin, William J. Dally |
| 2002 | ICCD | A Stream Processor Development Platform. | Ben Serebrin, John D. Owens, Chen H. Chen, Stephen P. Crago, Ujval J. Kapasi, Peter R. Mattson, Jinyung Namkoong, Scott Rixner, William J. Dally |
| 2002 | INFOCOM | Guaranteed Scheduling for Switches with Configuration Overhead. | Brian Towles, William J. Dally |
| 2002 | SPAA | Locality-preserving randomized oblivious routing on torus networks. | Arjun Singh, William J. Dally, Brian Towles, Amit K. Gupta |
| 2002 | SPAA | Worst-case traffic for oblivious routing functions. | Brian Towles, William J. Dally |
| 2001 | DAC | Route Packets, Not Wires: On-Chip Interconnection Networks. | William J. Dally, Brian Towles |
| 2001 | HPCA | A Delay Model and Speculative Architecture for Pipelined Routers. | Li-Shiuan Peh, William J. Dally |
| 2001 | ISCAS | Monolithic chaotic communications system. | Patrick Chiang, William J. Dally, Ming-Ju Edward Lee |
| 2000 | ASPLOS | Communication Scheduling. | Peter R. Mattson, William J. Dally, Scott Rixner, Ujval J. Kapasi, John D. Owens |
| 2000 | DAC | The role of custom design in ASIC Chips. | William J. Dally, Andrew Chang |
| 2000 | HPCA | Flit-Reservation Flow Control. | Li-Shiuan Peh, William J. Dally |
| 2000 | HPCA | Register Organization for Media Processing. | Scott Rixner, William J. Dally, Brucek Khailany, Peter R. Mattson, Ujval J. Kapasi, John D. Owens |
| 2000 | ISCA | Smart Memories: a modular reconfigurable architecture. | Ken Mai, Tim Paaske, Nuwan Jayasena, Ron Ho, William J. Dally, Mark Horowitz |
| 2000 | ISCA | Memory access scheduling. | Scott Rixner, William J. Dally, Ujval J. Kapasi, Peter R. Mattson, John D. Owens |
| 2000 | MICRO | Efficient conditional operations for data-parallel architectures. | Ujval J. Kapasi, William J. Dally, Scott Rixner, Peter R. Mattson, John D. Owens, Brucek Khailany |
| 1998 | ICCD | The effects of explicitly parallel mechanisms on the multi-ALU processor cluster pipeline. | Andrew Chang, William J. Dally, Stephen W. Keckler, Nicholas P. Carter, Whay Sing Lee |
| 1998 | ISCA | Architecture of a Message-Driven Processor. | William J. Dally, Linda Chao, Andrew A. Chien, Soha Hassoun, Waldemar Horwat, Jon Kaplan, Paul Song, Brian Totty, D. Scott Wills |
| 1998 | ISCA | Retrospective: the J-machine. | William J. Dally, Andrew A. Chien, Stuart Fiske, Waldemar Horwat, Richard A. Lethin, Michael D. Noakes, Peter R. Nuth, Ellen Spertus, Deborah A. Wallach, D. Scott Wills, Andrew Chang, John S. Keen |
| 1998 | ISCA | Exploiting Fine-grain Thread Level Parallelism on the MIT Multi-ALU Processor. | Stephen W. Keckler, William J. Dally, Daniel Maskit, Nicholas P. Carter, Andrew Chang, Whay Sing Lee |
| 1998 | MICRO | A Bandwidth-efficient Architecture for Media Processing. | Scott Rixner, William J. Dally, Ujval J. Kapasi, Brucek Khailany, Abelardo Lpez-Lagunas, Peter R. Mattson, John D. Owens |
| 1995 | HPCA | Thread Prioritization: A Thread Scheduling Mechanism for Multiple-Context Parallel Processors. | Stuart Fiske, William J. Dally |
| 1995 | HPCA | The Named-State Register File: Implementation and Performance. | Peter R. Nuth, William J. Dally |
| 1995 | MICRO | The M-Machine multicomputer. | Marco Fillo, Stephen W. Keckler, William J. Dally, Nicholas P. Carter, Andrew Chang, Yevgeny Gurevich, Whay Sing Lee |
| 1995 | PPoPP | Evaluating the Locality Benefits of Active Messages. | Ellen Spertus, William J. Dally |
| 1994 | ASPLOS | Hardware Support for Fast Capability-based Addressing. | Nicholas P. Carter, Stephen W. Keckler, William J. Dally |
| 1994 | CIKM | XEL: Extended Ephemeral Logging for Log Storage Management. | John S. Keen, William J. Dally |
| 1994 | HOTI | Architecture and implementation of the reliable router. | William J. Dally, Larry R. Dennison, David Money Harris, Kinhong Kan, Thucydides Xanthopoulos |
| 1993 | ISCA | The J-Machine Multicomputer: An Architectural Evaluation. | Michael D. Noakes, Deborah A. Wallach, William J. Dally |
| 1993 | ISCA | Evaluation of Mechanisms for Fine-Grained Parallel Programs in the J-Machine and the CM-5. | Ellen Spertus, Seth Copen Goldstein, Klaus E. Schauser, Thorsten von Eicken, David E. Culler, William J. Dally |
| 1993 | SIGMOD | Performance Evaluation of Ephemeral Logging. | John S. Keen, William J. Dally |
| 1992 | ICCD | The Message Driven Processor: An Integrated Multicomputer Processing Element. | William J. Dally, Andrew A. Chien, Stuart Fiske, Gregory A. Fyler, Waldemar Horwat, John S. Keen, Richard A. Lethin, Michael D. Noakes, Peter R. Nuth, D. Scott Wills |
| 1992 | ICCD | MDP Design Tools and Methods. | Richard A. Lethin, William J. Dally |
| 1992 | ICCD | The J-Machine Network. | Peter R. Nuth, William J. Dally |
| 1992 | ISCA | Processor Coupling: Integrating Compile Time and Runtime Scheduling for Parallelism. | Stephen W. Keckler, William J. Dally |
| 1991 | ICCD | A Mechanism for Efficient Context Switching. | Peter R. Nuth, William J. Dally |
| 1991 | ICPP | Experiences Implementing Dataflow on a General-Purpose Parallel Computer. | Ellen Spertus, William J. Dally |
| 1990 | ICCD | Simultaneous bidirectional signalling for IC systems. | Kevin Lam, Larry R. Dennison, William J. Dally |
| 1990 | ISCA | Virtual-Channel Flow Control. | William J. Dally |
| 1990 | PPoPP | Concurrent Aggregates (CA). | Andrew A. Chien, William J. Dally |
| 1989 | ASPLOS | Micro-Optimization of Floating Point Operations. | William J. Dally |
| 1989 | DAC | Algorithms for Accuracy Enhancement in a Hardware Logic Simulator. | Prathima Agrawal, Raffi Tutundjian, William J. Dally |
| 1989 | PLDI | Experience with CST: Programming and Implementation. | Waldemar Horwat, Andrew A. Chien, William J. Dally |
| 1988 | ISCA | The Reconfigurable Arithmetic Processor. | Stuart Fiske, William J. Dally |
| 1987 | DAC | Architecture and Design of the MARS Hardware Accelerator. | Prathima Agrawal, William J. Dally, Ahmed K. Ezzat, W. C. Fischer, H. V. Jagadish, A. S. Krishnakumar |
| 1987 | ISCA | Architecture of a Message-Driven Processor. | William J. Dally, Linda Chao, Andrew A. Chien, Soha Hassoun, Waldemar Horwat, Jon Kaplan, Paul Song, Brian Totty, D. Scott Wills |
| 1985 | ISCA | An Object Oriented Architecture. | William J. Dally, James T. Kajiya |