Skip to content

OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction.

Huang Huang, Fangchen Liu, Letian Fu, Tingfan Wu, Mustafa Mukadam, Jitendra Malik, Ken Goldberg, Pieter Abbeel

VenueA*ICML
Year2025
ProceedingsICML

Browse the full ICML paper archive.