| 2025 | CGO | Accelerating LLMs using an Efficient GEMM Library and Target-Aware Optimizations on Real-World PIM Devices. | Hyeoncheol Kim, Taehoon Kim, Taehyeong Park, Donghyeon Kim, Yongseung Yu, Hanjun Kim, Yongjun Park |
| 2025 | CGO | CUrator: An Efficient LLM Execution Engine with Optimized Integration of CUDA Libraries. | Yoon Noh Lee, Yongseung Yu, Yongjun Park |
| 2024 | DATE | Discovering Efficient Fused Layer Configurations for Executing Multi-Workloads on Multi-Core NPUs. | Younghyun Lee, Hyejun Kim, Yongseung Yu, Myeongjin Cho, Jiwon Seo, Yongjun Park |
| 2023 | ICCD | Tailoring CUTLASS GEMM using Supervised Learning. | Yongseung Yu, Donghyun Son, Younghyun Lee, Sunghyun Park, Giha Ryu, Myeongjin Cho, Jiwon Seo, Yongjun Park |
| 2020 | DAC | Convergence-Aware Neural Network Training. | Hyungjun Oh, Yongseung Yu, Giha Ryu, Gunjoo Ahn, Yuri Jeong, Yongjun Park, Jiwon Seo |
| 2020 | ICDE | Optimization of GPU-based Sparse Matrix Multiplication for Large Sparse Networks. | Jeongmyung Lee, Seokwon Kang, Yongseung Yu, Yong-Yeon Jo, Sang-Wook Kim, Yongjun Park |
| 2019 | DAC | GATE: A Generalized Dataflow-level Approximation Tuning Engine For Data Parallel Architectures. | Seokwon Kang, Yongseung Yu, Jiho Kim, Yongjun Park |
| 2018 | Tencon | Runtime Profiling of OpenCL Workloads Using LLVM-based Code Instrumentation. | Yongseung Yu, Seokwon Kang, Yongjun Park |