Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models.
Lillian Sun, Martin Pawelczyk, Zhenting Qi, Aounon Kumar, Himabindu Lakkaraju
Browse the full ACL paper archive.
Lillian Sun, Martin Pawelczyk, Zhenting Qi, Aounon Kumar, Himabindu Lakkaraju
Browse the full ACL paper archive.