Model Editing as a Double-Edged Sword: Steering Agent Behavior Toward Beneficence or Harm.
Baixiang Huang, Zhen Tan, Haoran Wang, Zijie Liu, Dawei Li, Ali Payani, Huan Liu, Tianlong Chen, Kai Shu
Browse the full AAAI paper archive.
Baixiang Huang, Zhen Tan, Haoran Wang, Zijie Liu, Dawei Li, Ali Payani, Huan Liu, Tianlong Chen, Kai Shu
Browse the full AAAI paper archive.