← Search

Yewon Kim

4 accepted papers

2026

Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference

ICML 2026poster

Recent advancements in Multimodal Large Language Models (MLLMs) have achieved remarkable success in vision-language tasks, yet the quadratic computational complexity arising from the vast number of visual tokens creates significant memory and latency bottlenecks. While visual token reduction (VTR) s…

Cited by 0SourceScholar
2025

SoundBrush: Sound as a Brush for Visual Scene Editing

AAAI 2025technical

We propose SoundBrush, a model that uses sound as a brush to edit and manipulate visual scenes. We extend the generative capabilities of the Latent Diffusion Model (LDM) to incorporate audio information for editing visual scenes. Inspired by existing image-editing works, we frame this task as a supe…

Cited by 0SourcePDFScholar
2023

SoTTA: Robust Test-Time Adaptation on Noisy Data Streams

NeurIPS 2023poster

Test-time adaptation (TTA) aims to address distributional shifts between training and testing data using only unlabeled test data streams for continual model adaptation. However, most TTA methods assume benign test streams, while test samples could be unexpectedly diverse in the wild. For instance,…

2022

NOTE: Robust Continual Test-time Adaptation Against Temporal Correlation

NeurIPS 2022accept

Test-time adaptation (TTA) is an emerging paradigm that addresses distributional shifts between training and testing phases without additional data acquisition or labeling cost; only unlabeled test data streams are used for continual model adaptation. Previous TTA schemes assume that the test sample…