Aligning Language Models Using Follow-up Likelihood as Reward Signal.
Chen Zhang, Dading Chong, Feng Jiang, Chengguang Tang, Anningzhe Gao, Guohua Tang, Haizhou Li
Browse the full AAAI paper archive.
Chen Zhang, Dading Chong, Feng Jiang, Chengguang Tang, Anningzhe Gao, Guohua Tang, Haizhou Li
Browse the full AAAI paper archive.