Skip to content

The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training.

Jinbo Wang, Mingze Wang, Zhanpeng Zhou, Junchi Yan, Weinan E, Lei Wu

VenueA*ICML
Year2025
ProceedingsICML

Browse the full ICML paper archive.