TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models.
Chenghao Liu, Jiachen Zhang, Chengxuan Li, Zhimu Zhou, Shixin Wu, Songfang Huang, Huiling Duan
Browse the full AAAI paper archive.
Chenghao Liu, Jiachen Zhang, Chengxuan Li, Zhimu Zhou, Shixin Wu, Songfang Huang, Huiling Duan
Browse the full AAAI paper archive.