← Search

Huiling Duan

1 accepted papers

2026

TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models

AAAI 2026technical

Vision-Language-Action (VLA) models process visual inputs independently at each timestep, discarding valuable temporal information inherent in robotic manipulation tasks. This frame-by-frame processing makes models vulnerable to visual noise while ignoring the substantial coherence between consecuti

Cited by 0SourcePDFScholar