← Search

Shuhan Zhuang

2 accepted papers

2026

UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation

ICML 2026poster

Multi-modal image generation, particularly subject-driven customization, has garnered growing attention in recent years. Despite the rapid advancement of generative models, their evaluation remains largely lagging. Existing methods, whether embedding-based or Multi-modal Large Language Model (MLLM)-…

Cited by 0SourceScholar
2025

RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models

ICCV 2025poster

Unifying diverse image generation tasks within a single framework remains a fundamental challenge in visual generation. While large language models (LLMs) achieve unification through task-agnostic data and generation, existing visual generation models fail to meet these principles. Current approache…