How Can You Tell if Your Large Language Model Could Be a Closet Antisemite? An Explainability-Based Audit Framework for Implicit Bias.
Arka Dutta, Reza Fayyazi, Shanchieh Yang, Ashiqur R. KhudaBukhsh
Browse the full AAAI paper archive.
Arka Dutta, Reza Fayyazi, Shanchieh Yang, Ashiqur R. KhudaBukhsh
Browse the full AAAI paper archive.