Skip to content

Taiji Suzuki

Publication record assembled from the DBLP archive of ranked conferences.

Papers indexed

92

Venues

16

Active years

2005–2026

Best venue rank

A*

Where they publish

Papers

92 indexed papers, newest first.

YearVenueTitleAuthors
2026AAAIOn the Learning Dynamics of Two-layer Linear Networks with Label Noise SGD.Tongcheng Zhang, Zhanpeng Zhou, Mingze Wang, Andi Han, Wei Huang, Taiji Suzuki, Junchi Yan
2025AISTATSQuantifying the Optimization and Generalization Advantages of Graph Neural Networks Over Multilayer Perceptrons.Wei Huang, Yuan Cao, Haonan Wang, Xin Cao, Taiji Suzuki
2025AISTATSClustered Invariant Risk Minimization.Tomoya Murata, Atsushi Nitanda, Taiji Suzuki
2025ICLRFlow matching achieves almost minimax optimal convergence.Kenji Fukumizu, Taiji Suzuki, Noboru Isobe, Kazusato Oko, Masanori Koyama
2025ICLRDirect Distributional Optimization for Provable Alignment of Diffusion Models.Ryotaro Kawata, Kazusato Oko, Atsushi Nitanda, Taiji Suzuki
2025ICLROptimality and Adaptivity of Deep Neural Features for Instrumental Variable Regression.Juno Kim, Dimitri Meunier, Arthur Gretton, Taiji Suzuki, Zhu Li
2025ICLRTransformers Provably Solve Parity Efficiently with Chain of Thought.Juno Kim, Taiji Suzuki
2025ICLROn the Optimization and Generalization of Two-layer Transformers with Sign Gradient Descent.Bingrui Li, Wei Huang, Andi Han, Zhanpeng Zhou, Taiji Suzuki, Jun Zhu, Jianfei Chen
2025ICLRState Space Models are Provably Comparable to Transformers in Dynamic Token Selection.Naoki Nishikawa, Taiji Suzuki
2025ICLRWeighted Point Set Embedding for Multimodal Contrastive Learning Toward Optimal Similarity Metric.Toshimitsu Uesaka, Taiji Suzuki, Yuhta Takida, Chieh-Hsin Lai, Naoki Murata, Yuki Mitsufuji
2025ICMLProvable In-Context Vector Arithmetic via Retrieving Task Concepts.Dake Bu, Wei Huang, Andi Han, Atsushi Nitanda, Qingfu Zhang, Hau-San Wong, Taiji Suzuki
2025ICMLOn the Role of Label Noise in the Feature Learning Process.Andi Han, Wei Huang, Zhanpeng Zhou, Gang Niu, Wuyang Chen, Junchi Yan, Akiko Takeda, Taiji Suzuki
2025ICMLDirect Density Ratio Optimization: A Statistically Consistent Approach to Aligning Large Language Models.Rei Higuchi, Taiji Suzuki
2025ICMLMixture of Experts Provably Detect and Learn the Latent Cluster Structure in Gradient-Based Learning.Ryotaro Kawata, Kohsei Matsutani, Yuri Kinoshita, Naoki Nishikawa, Taiji Suzuki
2025ICMLMetastable Dynamics of Chain-of-Thought Reasoning: Provable Benefits of Search, RL and Distillation.Juno Kim, Denny Wu, Jason D. Lee, Taiji Suzuki
2025ICMLNonlinear transformers can perform inference-time feature learning.Naoki Nishikawa, Yujin Song, Kazusato Oko, Denny Wu, Taiji Suzuki
2025ICMLPropagation of Chaos for Mean-Field Langevin Dynamics and its Application to Model Ensemble.Atsushi Nitanda, Anzelle Lee, Damian Tan Xing Kai, Mizuki Sakaguchi, Taiji Suzuki
2025ICMLQuantifying Memory Utilization with Effective State-Size.Rom N. Parnichkun, Neehal Tumma, Armin W. Thomas, Alessandro Moro, Qi An, Taiji Suzuki, Atsushi Yamashita, Michael Poli, Stefano Massaroli
2024COLTLearning sum of diverse features: computational hardness and efficient gradient-based training for ridge combinations.Kazusato Oko, Yujin Song, Taiji Suzuki, Denny Wu
2024ICLRKoopman-based generalization bound: New aspect for full-rank weights.Yuka Hashimoto, Sho Sonoda, Isao Ishikawa, Atsushi Nitanda, Taiji Suzuki
2024ICLRUnderstanding Convergence and Generalization in Federated Learning through Feature Learning Theory.Wei Huang, Ye Shi, Zhongyi Cai, Taiji Suzuki
2024ICLRSymmetric Mean-field Langevin Dynamics for Distributional Minimax Problems.Juno Kim, Kakei Yamamoto, Kazusato Oko, Zhuoran Yang, Taiji Suzuki
2024ICLRMinimax optimality of convolutional neural networks for infinite dimensional input-output problems and separation from kernel methods.Yuto Nishimura, Taiji Suzuki
2024ICLRImproved statistical and computational complexity of the mean-field Langevin dynamics under structured data.Atsushi Nitanda, Kazusato Oko, Taiji Suzuki, Denny Wu
2024ICLROptimal criterion for feature learning of two-layer linear neural network in high dimensional interpolation regime.Keita Suzuki, Taiji Suzuki
2024ICMLProvably Neural Active Learning Succeeds via Prioritizing Perplexing Samples.Dake Bu, Wei Huang, Taiji Suzuki, Ji Cheng, Qingfu Zhang, Zhiqiang Xu, Hau-San Wong
2024ICMLHigh-Dimensional Kernel Methods under Covariate Shift: Data-Dependent Implicit Regularization.Yihang Chen, Fanghui Liu, Taiji Suzuki, Volkan Cevher
2024ICMLTransformers Learn Nonlinear Features In Context: Nonconvex Mean-field Dynamics on the Attention Landscape.Juno Kim, Taiji Suzuki
2024ICMLSILVER: Single-loop variance reduction and application to federated learning.Kazusato Oko, Shunta Akiyama, Denny Wu, Tomoya Murata, Taiji Suzuki
2024ICMLState-Free Inference of State-Space Models: The *Transfer Function* Approach.Rom N. Parnichkun, Stefano Massaroli, Alessandro Moro, Jimmy T. H. Smith, Ramin M. Hasani, Mathias Lechner, Qi An, Christopher R, Hajime Asama, Stefano Ermon, Taiji Suzuki, Michael Poli, Atsushi Yamashita
2024ICMLMechanistic Design and Scaling of Hybrid Architectures.Michael Poli, Armin W. Thomas, Eric Nguyen, Pragaash Ponnusamy, Bjrn Deiseroth, Kristian Kersting, Taiji Suzuki, Brian L. Hie, Stefano Ermon, Christopher R, Ce Zhang, Stefano Massaroli
2024ICMLHow do Transformers Perform In-Context Autoregressive Learning ?Michael Eli Sander, Raja Giryes, Taiji Suzuki, Mathieu Blondel, Gabriel Peyr
2024ICMLMean-field Analysis on Two-layer Neural Networks from a Kernel Perspective.Shokichi Takakura, Taiji Suzuki
2024ICMLMean Field Langevin Actor-Critic: Faster Convergence and Global Optimality beyond Lazy Learning.Kakei Yamamoto, Kazusato Oko, Zhuoran Yang, Taiji Suzuki
2024ICMLAGraph Polynomial Convolution Models for Node Classification of Non-Homophilous Graphs.Kishan Wimalawarne, Taro Sawaki, Motokiyo Hirayama, Takanobu Kawahara, Taiji Suzuki
2023ICLRExcess Risk of Two-Layer ReLU Neural Networks in Teacher-Student Settings and its Superiority to Kernel Methods.Shunta Akiyama, Taiji Suzuki
2023ICLRUniform-in-time propagation of chaos for the mean-field gradient Langevin dynamics.Taiji Suzuki, Atsushi Nitanda, Denny Wu
2023ICMLDIFF2: Differential Private Optimization via Gradient Differences for Nonconvex Distributed Learning.Tomoya Murata, Taiji Suzuki
2023ICMLPrimal and Dual Analysis of Entropic Fictitious Play for Finite-sum Problems.Atsushi Nitanda, Kazusato Oko, Denny Wu, Nobuhito Takenouchi, Taiji Suzuki
2023ICMLDiffusion Models are Minimax Optimal Distribution Estimators.Kazusato Oko, Shunta Akiyama, Taiji Suzuki
2023ICMLTight and fast generalization error bound of graph embedding in metric space.Atsushi Suzuki, Atsushi Nitanda, Taiji Suzuki, Jing Wang, Feng Tian, Kenji Yamanishi
2023ICMLApproximation and Estimation Ability of Transformers for Sequence-to-Sequence Functions with Infinite Dimensional Input.Shokichi Takakura, Taiji Suzuki
2023ICMLAScalable Federated Learning for Clients with Different Input Image Sizes and Numbers of Output Categories.Shuhei Nitta, Taiji Suzuki, Albert Rodrguez Mulet, Atsushi Yaguchi, Ryusuke Hirai
2023IJCNNNeural Network Module Decomposition and Recomposition with Superimposed Masks.Hiroaki Kingetsu, Kenichi Kobayashi, Taiji Suzuki
2022ACMLLayer-wise Adaptive Graph Convolution Networks Using Generalized Pagerank.Kishan Wimalawarne, Taiji Suzuki
2022AISTATSConvex Analysis of the Mean Field Langevin Dynamics.Atsushi Nitanda, Denny Wu, Taiji Suzuki
2022COLTDimension-free convergence rates for gradient Langevin dynamics in RKHS.Boris Muzellec, Kanji Sato, Mathurin Massias, Taiji Suzuki
2022ICLRUnderstanding the Variance Collapse of SVGD in High Dimensions.Jimmy Ba, Murat A. Erdogdu, Marzyeh Ghassemi, Shengyang Sun, Taiji Suzuki, Denny Wu, Tianzong Zhang
2022ICLRParticle Stochastic Dual Coordinate Ascent: Exponential convergent algorithm for mean field neural network optimization.Kazusato Oko, Taiji Suzuki, Atsushi Nitanda, Denny Wu
2022ICLRLearnability of convolutional neural networks for infinite dimensional input via mixed and anisotropic smoothness.Sho Okumoto, Taiji Suzuki
2022ICMLAData-Parallel Momentum Diagonal Empirical Fisher (DP-MDEF):Adaptive Gradient Method is Affected by Hessian Approximation and Multi-Class Data.Chenyuan Xu, Kosuke Haruki, Taiji Suzuki, Masahiro Ozawa, Kazuki Uematsu, Ryuji Sakai
2022IJCNNMSR-DARTS: Minimum Stable Rank of Differentiable Architecture Search.Kengo Machida, Kuniaki Uto, Koichi Shinoda, Taiji Suzuki
2021AISTATSGradient Descent in RKHS with Importance Labeling.Tomoya Murata, Taiji Suzuki
2021AISTATSExponential Convergence Rates of Classification Errors on Learning with SGD and Random Features.Shingo Yashima, Atsushi Nitanda, Taiji Suzuki
2021ICLRWhen does preconditioning help or hurt generalization?Shun-ichi Amari, Jimmy Ba, Roger Baker Grosse, Xuechen Li, Atsushi Nitanda, Taiji Suzuki, Denny Wu, Ji Xu
2021ICLROptimal Rates for Averaged Stochastic Gradient Descent under Neural Tangent Kernel Regime.Atsushi Nitanda, Taiji Suzuki
2021ICLRBenefit of deep learning with non-convex noisy gradient descent: Provable excess risk bound and superiority to kernel methods.Taiji Suzuki, Shunta Akiyama
2021ICMLOn Learnability via Gradient Method for Two-Layer ReLU Neural Networks in Teacher-Student Setting.Shunta Akiyama, Taiji Suzuki
2021ICMLBias-Variance Reduced Local SGD for Less Heterogeneous Federated Learning.Tomoya Murata, Taiji Suzuki
2021ICMLQuantitative Understanding of VAE as a Non-linearly Scaled Isometric Embedding.Akira Nakagawa, Keizo Kato, Taiji Suzuki
2021IJCAIDecomposable-Net: Scalable Low-Rank Compression for Neural Networks.Atsushi Yaguchi, Taiji Suzuki, Shuhei Nitta, Yukinobu Sakata, Akiyuki Tanizawa
2020AISTATSUnderstanding Generalization in Deep Learning via Tensor Methods.Jingling Li, Yanchao Sun, Jiahao Su, Taiji Suzuki, Furong Huang
2020AISTATSFunctional Gradient Boosting for Learning Residual-like Networks with Statistical Guarantees.Atsushi Nitanda, Taiji Suzuki
2020BMVCDomain Adaptation Regularization for Spectral Pruning.Laurent Dillard, Yosuke Shinya, Taiji Suzuki
2020ICLRGeneralization of Two-layer Neural Networks: An Asymptotic Viewpoint.Jimmy Ba, Murat A. Erdogdu, Taiji Suzuki, Denny Wu, Tianzong Zhang
2020ICLRGraph Neural Networks Exponentially Lose Expressive Power for Node Classification.Kenta Oono, Taiji Suzuki
2020ICLRCompression based bound for non-compressed network: unified generalization error analysis of large compressible deep neural network.Taiji Suzuki, Hiroshi Abe, Tomoaki Nishimura
2020IJCAISpectral Pruning: Compressing Deep Neural Networks via Spectral Analysis and its Generalization Error.Taiji Suzuki, Hiroshi Abe, Tomoya Murata, Shingo Horiuchi, Kotaro Ito, Tokuma Wachi, So Hirai, Masatoshi Yukishima, Tomoaki Nishimura
2019AISTATSStochastic Gradient Descent with Exponential Convergence Rates of Expected Classification Errors.Atsushi Nitanda, Taiji Suzuki
2019ECIRCross-Domain Recommendation via Deep Domain Adaptation.Heishiro Kanagawa, Hayato Kobayashi, Nobuyuki Shimizu, Yukihiro Tagami, Taiji Suzuki
2019ICDMSharp Characterization of Optimal Minibatch Size for Stochastic Finite Sum Convex Optimization.Atsushi Nitanda, Tomoya Murata, Taiji Suzuki
2019ICLRAdaptivity of deep ReLU network for learning in Besov and mixed smooth Besov spaces: optimal rate and curse of dimensionality.Taiji Suzuki
2019ICMLApproximation and non-parametric estimation of ResNet-type convolutional neural networks.Kenta Oono, Taiji Suzuki
2018AISTATSGradient Layer: Enhancing the Convergence of Adversarial Training for Generative Models.Atsushi Nitanda, Taiji Suzuki
2018AISTATSFast generalization error bound of deep learning from a kernel perspective.Taiji Suzuki
2018AISTATSIndependently Interpretable Lasso: A New Regularizer for Sparse Regression with Uncorrelated Variables.Masaaki Takada, Taiji Suzuki, Hironori Fujisawa
2018ICMLFunctional Gradient Boosting based on Residual Network Perception.Atsushi Nitanda, Taiji Suzuki
2018ICMLAAdam Induces Implicit Weight Sparsity in Rectifier Neural Networks.Atsushi Yaguchi, Taiji Suzuki, Wataru Asano, Shuhei Nitta, Yukinobu Sakata, Akiyuki Tanizawa
2017AISTATSStochastic Difference of Convex Algorithm and its Application to Training Deep Boltzmann Machines.Atsushi Nitanda, Taiji Suzuki
2016ICMLGaussian process nonparametric tensor estimator and its minimax optimality.Heishiro Kanagawa, Taiji Suzuki, Hayato Kobayashi, Nobuyuki Shimizu, Yukihiro Tagami
2016ICMLStructure Learning of Partitioned Markov Networks.Song Liu, Taiji Suzuki, Masashi Sugiyama, Kenji Fukumizu
2015AAAISupport Consistency of Direct Sparse-Change Learning in Markov Networks.Song Liu, Taiji Suzuki, Masashi Sugiyama
2015AISTATSA Consistent Method for Graph Based Anomaly Localization.Satoshi Hara, Tetsuro Morimura, Toshihiro Takahashi, Hiroki Yanagisawa, Taiji Suzuki
2015ICMLConvergence rate of Bayesian tensor estimator and its minimax optimality.Taiji Suzuki
2014ICMLStochastic Dual Coordinate Ascent with Alternating Direction Method of Multipliers.Taiji Suzuki
2013ICMLDual Averaging and Proximal Gradient Descent for Online Alternating Direction Multiplier Method.Taiji Suzuki
2012COLTPAC-Bayesian Bound for Gaussian Process Regression and Multiple Kernel Additive Model.Taiji Suzuki
2010ICMLA Fast Augmented Lagrangian Algorithm for Learning Low-Rank Matrices.Ryota Tomioka, Taiji Suzuki, Masashi Sugiyama, Hisashi Kashima
2010SDMDirect Density Ratio Estimation with Dimensionality Reduction.Masashi Sugiyama, Satoshi Hara, Paul von Bnau, Taiji Suzuki, Takafumi Kanamori, Motoaki Kawanabe
2009IDAEstimating Squared-Loss Mutual Information for Independent Component Analysis.Taiji Suzuki, Masashi Sugiyama
2009ISITMutual information approximation via maximum likelihood estimation of density ratio.Taiji Suzuki, Masashi Sugiyama, Toshiyuki Tanaka
2005ISDALearning to estimate user interest utilizing the variational Bayes estimator.Taiji Suzuki, Takamasa Koshizen, Kazuyuki Aihara, Hiroshi Tsujino