d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models.
Leyi Pan, Shuchang Tao, Yunpeng Zhai, Zheyu Fu, Liancheng Fang, Minghua He, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Aiwei Liu, Lijie Wen
Browse the full ACL paper archive.