Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs.
Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Yang Li, Linyang Li, Haodong Duan, Qingwen Liu, Kai Chen
Browse the full ACL paper archive.
Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Yang Li, Linyang Li, Haodong Duan, Qingwen Liu, Kai Chen
Browse the full ACL paper archive.