Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization.
Wenkai Yang, Shiqi Shen, Guangyao Shen, Wei Yao, Yong Liu, Gong Zhi, Yankai Lin, Ji-Rong Wen
Browse the full ICLR paper archive.
Wenkai Yang, Shiqi Shen, Guangyao Shen, Wei Yao, Yong Liu, Gong Zhi, Yankai Lin, Ji-Rong Wen
Browse the full ICLR paper archive.