VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers.
Yating Wang, Haoyi Zhu, Mingyu Liu, Jiange Yang, Haoshu Fang, Tong He
Browse the full ICCV paper archive.
Yating Wang, Haoyi Zhu, Mingyu Liu, Jiange Yang, Haoshu Fang, Tong He
Browse the full ICCV paper archive.