LLM Comparator: Visual Analytics for Side-by-Side Evaluation of Large Language Models.
Minsuk Kahng, Ian Tenney, Mahima Pushkarna, Michael Xieyang Liu, James Wexler, Emily Reif, Krystal Kallarackal, Minsuk Chang, Michael Terry, Lucas Dixon
Browse the full CHI paper archive.