2026
TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models
AAAI 2026technical
Vision-Language-Action (VLA) models process visual inputs independently at each timestep, discarding valuable temporal information inherent in robotic manipulation tasks. This frame-by-frame processing makes models vulnerable to visual noise while ignoring the substantial coherence between consecuti