I²B-LPO: Latent Policy Optimization via Iterative Information Bottleneck.
Huilin Deng, Hongchen Luo, Yue Zhu, Long Li, Zhuoyue Chen, Xinghao Zhao, Ming Li, Chuyang Zhao, Jihai Zhang, Mengchang Wang, Yang Cao, Yu Kang
Browse the full ACL paper archive.