Skip to content

Toshio Endo

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

49

Venues

16

Active years

1997–2026

Best venue rank

A

Where they publish

Papers

49 indexed papers, newest first.

YearVenueTitleAuthors
2026CGOFRUGAL: Pushing GPU Applications beyond Memory Limits.Lingqi Zhang, Tengfei Wang, Jiajun Huang, Chen Zhuang, Ivan R. Ivanov, Peng Chen, Toshio Endo, Mohamed Wahib
2026ICSSHIRO: Near-Optimal Communication Strategies for Distributed Sparse Matrix Multiplication.Chen Zhuang, Lingqi Zhang, Benjamin Brock, Du Wu, Peng Chen, Toshio Endo, Satoshi Matsuoka, Mohamed Wahib
2025CCGRIDAn Optimization Technique for Hiding Communication Costs in 3D Parallel Training of Deep Learning.Ryubu Hosoki, Kento Sato, Toshio Endo, Julien Bigot, Edouard Audit
2025ICSScaling Large-scale GNN Training to Thousands of Processors on CPU-based Supercomputers.Chen Zhuang, Lingqi Zhang, Du Wu, Peng Chen, Jiajun Huang, Xin Liu, Rio Yokota, Nikoli Dryden, Toshio Endo, Satoshi Matsuoka, Mohamed Wahib
2025PPoPPA General and Scalable GCN Training Framework on CPU Supercomputers.Chen Zhuang, Peng Chen, Xin Liu, Rio Yokota, Nikoli Dryden, Lingqi Zhang, Toshio Endo, Satoshi Matsuoka, Mohamed Wahib
2025SCDynamic Thread Coarsening for CPU and GPU OpenMP Code.Ivan R. Ivanov, Jens Domke, Toshio Endo, Johannes Doerfert
2025SCPhysical System Study on Balancing Interactive and Batch Job Performance through Oversubscribing Scheduling.Shohei Minami, Toshio Endo, Akihiro Nomura, Hiroki Ohtsuji, Jun Kato, Masahiro Miwa, Eiji Yoshida
2024CGORetargeting and Respecializing GPU Workloads for Performance Portability.Ivan R. Ivanov, Oleksandr Zinenko, Jens Domke, Toshio Endo, William S. Moses
2024CLUSTERAn Optimization Pass for Training Speed-Up and Strategy Search in 3D Parallelism.Ryubu Hosoki, Kento Sato, Toshio Endo, Julien Bigot, Edouard Audit
2024CLUSTERAsynchronous I/O Optimization for X-Ray Imaging via GPUDirect Storage.Du Wu, Peng Chen, Yiyu Tan, Yusuke Tanimura, Toshio Endo, Satoshi Matsuoka, Mohamed Wahib
2024CLUSTERInvestigating Nvidia GPU Architecture Trends via Microbenchmarks.Lingqi Zhang, Ryan Barton, Peng Chen, Xiao Wang, Toshio Endo, Satoshi Matsuoka, Mohamed Wahib
2024CLUSTERCommunication Optimization for Distributed GCN Training on ABCI Supercomputer.Chen Zhuang, Peng Chen, Xin Liu, Toshio Endo, Satoshi Matsuoka, Mohamed Wahib
2024ICSReal-time High-resolution X-Ray Computed Tomography.Du Wu, Peng Chen, Xiao Wang, Isaac Lyngaas, Takaaki Miyajima, Toshio Endo, Satoshi Matsuoka, Mohamed Wahib
2023ACIVSPyramid Swin Transformer for Multi-task: Expanding to More Computer Vision Tasks.Chenyu Wang, Toshio Endo, Takahiro Hirofuchi, Tsutomu Ikegami
2023ICSPERKS: a Locality-Optimized Execution Model for Iterative Memory-bound GPU Applications.Lingqi Zhang, Mohamed Wahib, Peng Chen, Jintao Meng, Xiao Wang, Toshio Endo, Satoshi Matsuoka
2023ICSRevisiting Temporal Blocking Stencil Optimizations.Lingqi Zhang, Mohamed Wahib, Peng Chen, Jintao Meng, Xiao Wang, Toshio Endo, Satoshi Matsuoka
2023PPoPPHigh-Performance GPU-to-CPU Transpilation and Optimization via High-Level Parallel Constructs.William S. Moses, Ivan R. Ivanov, Jens Domke, Toshio Endo, Johannes Doerfert, Oleksandr Zinenko
2022DASCmdx: A Cloud Platform for Supporting Data Science and Cross-Disciplinary Research Collaborations.Toyotaro Suzumura, Akiyoshi Sugiki, Hiroyuki Takizawa, Akira Imakura, Hiroshi Nakamura, Kenjiro Taura, Tomohiro Kudoh, Toshihiro Hanawa, Yuji Sekiya, Hill Hiroki Kobayashi, Yohei Kuga, Ryo Nakamura, Renhe Jiang, Junya Kawase, Masatoshi Hanai, Hiroshi Miyazaki, Tsutomu Ishizaki, Daisuk Shimotoku, Daisuke Miyamoto, Kento Aida, Atsuko Takefusa, Takashi Kurimoto, Koji Sasayama, Naoya Kitagawa, Ikki Fujiwara, Yusuke Tanimura, Takayuki Aoki, Toshio Endo, Satoshi Ohshima, Keiichiro Fukazawa, Susumu Date, Toshihiro Uchibayashi
2022ISPAEfficient Stencil Computation with Temporal Blocking by Halide DSL.Hiroki Aikawa, Toshio Endo, Tomoya Yuki, Takahiro Hirofuchi, Tsutomu Ikegami
2022SNPDSpeed-up Single Shot Detector on GPU with CUDA.Chenyu Wang, Toshio Endo, Takahiro Hirofuchi, Tsutomu Ikegami
2021JSSPPMeasurement and Modeling of Performance of HPC Applications Towards Overcommitting Scheduling Systems.Shohei Minami, Toshio Endo, Akihiro Nomura
2020CGOAN5D: automated stencil framework for high-degree temporal blocking on GPUs.Kazuaki Matsumura, Hamid Reza Zohouri, Mohamed Wahib, Toshio Endo, Satoshi Matsuoka
2019PPoPPProfiling based out-of-core hybrid method for large neural networks: poster.Yuki Ito, Haruki Imai, Tung D. Le, Yasushi Negishi, Kiyokuni Kawachiya, Ryo Matsumiya, Toshio Endo
2018PDPCharacterizing Memory-Latency Sensitivity of Sparse Matrix Kernels.Noboru Tanabe, Toshio Endo
2017CLUSTERA Stencil Framework to Realize Large-Scale Computations Beyond Device Memory Capacity on GPU Supercomputers.Takashi Shimokawabe, Toshio Endo, Naoyuki Onodera, Takayuki Aoki
2017EuroParAn Accurate Simulator of Cache-Line Conflicts to Exploit the Underlying Cache Performance.Yukinori Sato, Toshio Endo
2017SCApplying Temporal Blocking with a Directive-based Approach.Shota Kuroda, Toshio Endo, Satoshi Matsuoka
2016CLUSTERRealizing Out-of-Core Stencil Computations Using Multi-tier Memory Hierarchy on GPGPU Clusters.Toshio Endo
2016SCPGAS Communication Runtime for Extreme Large Data Computation.Ryo Matsumiya, Toshio Endo
2015ICPADSRealizing Extremely Large-Scale Stencil Applications on GPU Supercomputers.Toshio Endo, Yuki Takasaki, Satoshi Matsuoka
2015JSSPPData Driven Scheduling Approach for the Multi-node Multi-GPU Cholesky Decomposition.Yuki Tsujita, Toshio Endo
2015OOPSLAExana: an execution-driven application analysis tool for assisting productive performance tuning.Yukinori Sato, Shimpei Sato, Toshio Endo
2015OOPSLAInvestigating potential performance benefits of memory layout optimization based on roofline model.Shimpei Sato, Yukinori Sato, Toshio Endo
2015SCThe scalable petascale data-driven approach for the Cholesky factorization with multiple GPUs.Yuki Tsujita, Toshio Endo, Katsuki Fujisawa
2014CLUSTERSoftware technologies coping with memory hierarchy of GPGPU clusters for stencil computations.Toshio Endo, Guanghao Jin
2014ICPADSTSUBAME-KFC: A modern liquid submersion cooling prototype towards exascale becoming the greenest supercomputer in the world.Toshio Endo, Akira Nukada, Satoshi Matsuoka
2013CLUSTERA parallel optimization method for stencil computation on the domain that is bigger than memory capacity of GPUs.Guanghao Jin, Toshio Endo, Satoshi Matsuoka
2012SCHigh-performance general solver for extremely large-scale semidefinite programming problems.Katsuki Fujisawa, Hitoshi Sato, Satoshi Matsuoka, Toshio Endo, Makoto Yamashita, Maho Nakata
2011SCPetaflop biofluidics simulations on a two million-core system.Massimo Bernaschi, Mauro Bisson, Toshio Endo, Satoshi Matsuoka, Massimiliano Fatica, Simone Melchionna
2011SCPeta-scale phase-field simulation for dendritic solidification on the TSUBAME 2.0 supercomputer.Takashi Shimokawabe, Takayuki Aoki, Tomohiro Takaki, Toshio Endo, Akinori Yamanaka, Naoya Maruyama, Akira Nukada, Satoshi Matsuoka
2010SCAn 80-Fold Speedup, 15.0 TFlops Full GPU Acceleration of Non-Hydrostatic Weather Model ASUCA Production Code.Takashi Shimokawabe, Takayuki Aoki, Chiashi Muroi, Junichi Ishida, Kohei Kawano, Toshio Endo, Akira Nukada, Naoya Maruyama, Satoshi Matsuoka
2009CCGRIDFile Clustering Based Replication Algorithm in a Grid Environment.Hitoshi Sato, Satoshi Matsuoka, Toshio Endo
2008CLUSTEREnvironmental-aware optimization of MPI checkpointing intervals.Hideyuki Jitsumoto, Toshio Endo, Satoshi Matsuoka
2008SCBandwidth intensive 3-D FFT kernel for GPUs using CUDA.Akira Nukada, Yasuhiko Ogata, Toshio Endo, Satoshi Matsuoka
2007CCGRIDHigh-Performance MPI Broadcast Algorithm for Grid Environments Utilizing Multi-lane NICs.Tatsuhiro Chiba, Toshio Endo, Satoshi Matsuoka
2004CCGRIDHigh performance LU factorization for non-dedicated clusters.Toshio Endo, Kenji Kaneda, Kenjiro Taura, Akinori Yonezawa
2003PPoPPPhoenix: a parallel programming model for accommodating dynamically joining/leaving resources.Kenjiro Taura, Kenji Kaneda, Toshio Endo, Akinori Yonezawa
1998MVAOn a High-Speed Hough Transform Algorithm MRHT.Kunihito Kato, Toshio Endo, Kazuhito Murakami, Takashi Toriu, Hiroyasu Koshimizu
1997SCA Scalable Mark-Sweep Garbage Collector on Large-Scale Shared-Memory Machines.Toshio Endo, Kenjiro Taura, Akinori Yonezawa