Skip to content

STEP-Nav: Spatial-Temporal Efficient Visual Token Pruning for Vision-and-Language Navigation with Large Language Models.

Yantao Lu, Shiqi Sun, Ning Liu, Bo Jiang, Ying Zhang, Jinchao Chen, Chenglie Du

VenueA*AAAI
Year2026
ProceedingsAAAI

Browse the full AAAI paper archive.