R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning.
Qingfei Zhao, Ruobing Wang, Dingling Xu, Daren Zha, Bowen Ma, Zhichun Wang, Shijie Jia, Limin Liu, Xin Wang
Browse the full ACL paper archive.
Qingfei Zhao, Ruobing Wang, Dingling Xu, Daren Zha, Bowen Ma, Zhichun Wang, Shijie Jia, Limin Liu, Xin Wang
Browse the full ACL paper archive.