Skip to content

Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge.

Tianhao Wu, Weizhe Yuan, Olga Golovneva, Jing Xu, Yuandong Tian, Jiantao Jiao, Jason E. Weston, Sainbayar Sukhbaatar

VenueA*EMNLP
Year2025
ProceedingsEMNLP

Browse the full EMNLP paper archive.