BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback.
Gaurav Pandey, Yatin Nandwani, Tahira Naseem, Mayank Mishra, Guangxuan Xu, Dinesh Raghu, Sachindra Joshi, Asim Munawar, Ramn Fernandez Astudillo
Browse the full ICML paper archive.