ParamΔ for Direct Mixing: Post-Train Large Language Model At Zero Cost.
Sheng Cao, Mingrui Wu, Karthik Prasad, Yuandong Tian, Zechun Liu
Browse the full ICLR paper archive.
Sheng Cao, Mingrui Wu, Karthik Prasad, Yuandong Tian, Zechun Liu
Browse the full ICLR paper archive.