Skip to content

Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization.

Wenkai Yang, Shiqi Shen, Guangyao Shen, Wei Yao, Yong Liu, Gong Zhi, Yankai Lin, Ji-Rong Wen

VenueA*ICLR
Year2025
ProceedingsICLR

Browse the full ICLR paper archive.