Skip to content

Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback.

Jiayi Zhou, Jiaming Ji, Josef Dai, Yaodong Yang

VenueA*AAAI
Year2025
ProceedingsAAAI

Browse the full AAAI paper archive.