← All conferences

ECCV 2024 Accepted Papers

The full list of 2,385 papers accepted at ECCV 2024 (European Conference on Computer Vision). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Poster: 2,185Oral: 200
  1. YOLOv9: Learning What You Want to Learn Using Programmable Gradient InformationPoster2,391 citations
  2. Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object DetectionPoster2,171 citations
  3. MMBENCH: Is Your Multi-Modal Model an All-around Player?Oral1,050 citations
  4. ShareGPT4V: Improving Large Multi-Modal Models with Better CaptionsPoster636 citations
  5. Adversarial Diffusion DistillationOral398 citations
  6. LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content CreationOral347 citations
  7. LLaMA-VID: An Image is Worth 2 Tokens in Large Language ModelsPoster327 citations
  8. MambaIR: A Simple Baseline for Image Restoration with State-Space ModelPoster323 citations
  9. "MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training"Poster276 citations
  10. CoTracker: It is Better to Track TogetherPoster258 citations
  11. DiffBIR: Toward Blind Image Restoration with Generative Diffusion PriorPoster247 citations
  12. VideoMamba: State Space Model for Efficient Video UnderstandingPoster243 citations
  13. DriveLM: Driving with Graph Visual Question AnsweringOral230 citations
  14. DynamiCrafter: Animating Open-domain Images with Video Diffusion PriorsOral227 citations
  15. Segment and Recognize Anything at Any GranularityPoster214 citations
  16. InternVideo2: Scaling Foundation Models for Multimodal Video UnderstandingPoster213 citations
  17. MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?Poster206 citations
  18. SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant TransformersPoster202 citations
  19. MobileNetV4: Universal Models for the Mobile EcosystemOral193 citations
  20. Photorealistic Video Generation with Diffusion ModelsPoster188 citations
  21. DriveDreamer: Towards Real-world-driven World Models for Autonomous DrivingPoster183 citations
  22. Gaussian Grouping: Segment and Edit Anything in 3D ScenesPoster183 citations
  23. PixArt-Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image GenerationPoster178 citations
  24. SV3D: Novel Multi-view Synthesis and 3D Generation from a Single Image using Latent Video DiffusionOral176 citations
  25. An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language ModelsOral174 citations
  26. MVSplat: Efficient 3D Gaussian Splatting from Sparse Multi-View ImagesOral173 citations
  27. PointLLM: Empowering Large Language Models to Understand Point CloudsOral170 citations
  28. FSGS: Real-Time Few-shot View Synthesis using Gaussian SplattingPoster155 citations
  29. Street Gaussians: Modeling Dynamic Urban Scenes with Gaussian SplattingPoster155 citations
  30. GRM: Large Gaussian Reconstruction Model for Efficient 3D Reconstruction and GenerationPoster150 citations
  31. BLINK: Multimodal Large Language Models Can See but Not PerceivePoster149 citations
  32. EMO: Emote Portrait Alive - Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak ConditionsPoster145 citations
  33. Agent Attention: On the Integration of Softmax and Linear AttentionPoster139 citations
  34. LLaVA-UHD: an LMM Perceiving any Aspect Ratio and High-Resolution ImagesPoster137 citations
  35. Long-CLIP: Unlocking the Long-Text Capability of CLIPPoster137 citations
  36. Pixel-Aware Stable Diffusion for Realistic Image Super-Resolution and Personalized StylizationPoster135 citations
  37. Evaluating Text-to-Visual Generation with Image-to-Text GenerationPoster133 citations
  38. LLaVA-Plus: Learning to Use Tools for Creating Multimodal AgentsPoster133 citations
  39. Relightable 3D Gaussians: Realistic Point Cloud Relighting with BRDF Decomposition and Ray TracingPoster133 citations
  40. CRM: Single Image to 3D Textured Mesh with Convolutional Reconstruction ModelPoster132 citations
  41. GRiT: A Generative Region-to-text Transformer for Object UnderstandingPoster124 citations
  42. Champ: Controllable and Consistent Human Image Animation with 3D Parametric GuidancePoster121 citations
  43. SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion ModelsPoster120 citations
  44. MotionDirector: Motion Customization of Text-to-Video Diffusion ModelsOral117 citations
  45. GS-LRM: Large Reconstruction Model for 3D Gaussian SplattingPoster115 citations
  46. Grounding Image Matching in 3D with MASt3ROral115 citations
  47. Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMsPoster109 citations
  48. GeoWizard: Unleashing the Diffusion Priors for 3D Geometry Estimation from a Single ImagePoster103 citations
  49. Vary: Scaling up the Vision Vocabulary for Large Vision-Language ModelsPoster103 citations
  50. MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language ModelsPoster99 citations
  51. DynMF: Neural Motion Factorization for Real-time Dynamic View Synthesis with 3D Gaussian SplattingPoster95 citations
  52. To Generate or Not? Safety-Driven Unlearned Diffusion Models Are Still Easy To Generate Unsafe Images ... For NowPoster95 citations
  53. EAGLES: Efficient Accelerated 3D Gaussians with Lightweight EncodingSPoster92 citations
  54. VideoAgent: Long-form Video Understanding with Large Language Model as AgentPoster91 citations
  55. ZipLoRA: Any Subject in Any Style by Effectively Merging LoRAsPoster91 citations
  56. OccWorld: Learning a 3D Occupancy World Model for Autonomous DrivingPoster88 citations
  57. CityGaussian: Real-time High-quality Large-Scale Scene Rendering with GaussiansPoster87 citations
  58. Factorizing Text-to-Video Generation by Explicit Image ConditioningPoster84 citations
  59. Motion Mamba: Efficient and Long Sequence Motion GenerationPoster84 citations
  60. HAC: Hash-grid Assisted Context for 3D Gaussian Splatting CompressionPoster81 citations
  61. Mamba-ND: Selective State Space Modeling for Multi-Dimensional DataOral78 citations
  62. ST-LLM: Large Language Models Are Effective Temporal LearnersPoster78 citations
  63. Compact 3D Scene Representation via Self-Organizing Gaussian GridsPoster76 citations
  64. DiffusionDepth: Diffusion Denoising Approach for Monocular Depth EstimationPoster76 citations
  65. DiffiT: Diffusion Vision Transformers for Image GenerationPoster72 citations
  66. Dolphins: Multimodal Language Model for DrivingPoster72 citations
  67. Global Structure-from-Motion RevisitedPoster72 citations
  68. Generative End-to-End Autonomous DrivingPoster71 citations
  69. Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language ModelsOral71 citations
  70. LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language ModelPoster71 citations
  71. LongVLM: Efficient Long Video Understanding via Large Language ModelsOral71 citations
  72. SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene UnderstandingPoster71 citations
  73. How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMsPoster70 citations
  74. SGS-SLAM: Semantic Gaussian Splatting For Neural Dense SLAMPoster70 citations
  75. A Task is Worth One Word: Learning with Task Prompts for High-Quality Versatile Image InpaintingPoster68 citations
  76. TextDiffuser-2: Unleashing the Power of Language Models for Text RenderingOral65 citations
  77. LLaVA-Grounding: Grounded Visual Chat with Large Multimodal ModelsPoster64 citations
  78. MobileDiffusion: Instant Text-to-Image Generation on Mobile DevicesPoster64 citations
  79. SCLIP: Rethinking Self-Attention for Dense Vision-Language InferencePoster64 citations
  80. VideoAgent: A Memory-augmented Multimodal Agent for Video UnderstandingPoster64 citations
  81. MotionLCM: Real-time Controllable Motion Generation via Latent Consistency ModelPoster63 citations
  82. latentSplat: Autoencoding Variational Gaussians for Fast Generalizable 3D ReconstructionPoster63 citations
  83. ShapeLLM: Universal 3D Object Understanding for Embodied InteractionPoster62 citations
  84. Concept Sliders: LoRA Adaptors for Precise Control in Diffusion ModelsPoster61 citations
  85. LITA: Language Instructed Temporal-Localization AssistantPoster61 citations
  86. Octopus: Embodied Vision-Language Programmer from Environmental FeedbackPoster61 citations
  87. Groma: Localized Visual Tokenization for Grounding Multimodal Large Language ModelsPoster60 citations
  88. MVDiffHD: A Dense High-resolution Multi-view Diffusion Model for Single or Sparse-view 3D Object ReconstructionPoster60 citations
  89. Pixel-GS Density Control with Pixel-aware Gradient for 3D Gaussian SplattingPoster59 citations
  90. UniIR: Training and Benchmarking Universal Multimodal Information RetrieversOral59 citations
  91. Controllable Human-Object Interaction SynthesisOral58 citations
  92. "EMDM: Efficient Motion Diffusion Model for Fast, High-Quality Human Motion Generation"Poster57 citations
  93. ZigMa: A DiT-style Zigzag Mamba Diffusion ModelPoster57 citations
  94. AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield PromptingPoster56 citations
  95. Drag Anything: Motion Control for Anything using Entity RepresentationPoster56 citations
  96. Mini-Splatting: Representing Scenes with a Constrained Number of GaussiansPoster56 citations
  97. BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch DiffusionPoster55 citations
  98. Deblurring 3D Gaussian SplattingPoster55 citations
  99. Towards Open-ended Visual Quality ComparisonOral54 citations
  100. Reason2Drive: Towards Interpretable and Chain-based Reasoning for Autonomous DrivingPoster53 citations
  101. DOCCI: Descriptions of Connected and Contrasting ImagesPoster52 citations
  102. ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic ManipulationPoster52 citations
  103. When Do We Not Need Larger Vision Models?Poster51 citations
  104. Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes InteractivelyPoster50 citations
  105. The All-Seeing Project V2: Towards General Relation Comprehension of the Open WorldPoster50 citations
  106. GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy PredictionPoster49 citations
  107. IRSAM: Advancing Segment Anything Model for Infrared Small Target DetectionPoster49 citations
  108. Model Breadcrumbs: Scaling Multi-Task Model Merging with Sparse MasksPoster49 citations
  109. TLControl: Trajectory and Language Control for Human Motion SynthesisPoster49 citations
  110. "Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation"Poster48 citations
  111. Revising Densification in Gaussian SplattingPoster48 citations
  112. Robo-ABC: Affordance Generalization Beyond Categories via Semantic Correspondence for Robot ManipulationPoster48 citations
  113. Customize-A-Video: One-Shot Motion Customization of Text-to-Video Diffusion ModelsPoster47 citations
  114. FreeInit: Bridging Initialization Gap in Video Diffusion ModelsPoster47 citations
  115. Gaussian in the wild: 3D Gaussian Splatting for Unconstrained Image CollectionsPoster47 citations
  116. OpenIns3D: Snap and Lookup for 3D Open-vocabulary Instance SegmentationPoster46 citations
  117. Rotary Position Embedding for Vision TransformerPoster46 citations
  118. STAG4D: Spatial-Temporal Anchored Generative 4D GaussiansPoster46 citations
  119. ScribblePrompt: Fast and Flexible Interactive Segmentation for Any Biomedical ImagePoster46 citations
  120. BAD-Gaussians: Bundle Adjusted Deblur Gaussian SplattingPoster45 citations
  121. Depicting Beyond Scores: Advancing Image Quality Assessment through Multi-modal Language ModelsPoster44 citations
  122. "SEA-RAFT: Simple, Efficient, Accurate RAFT for Optical Flow"Oral43 citations
  123. FoundPose: Unseen Object Pose Estimation with Foundation FeaturesPoster43 citations
  124. GIVT: Generative Infinite-Vocabulary TransformersPoster43 citations
  125. Lane Graph as Path: Continuity-preserving Path-wise Modeling for Online Lane Graph ConstructionPoster43 citations
  126. WoVoGen: World Volume-aware Diffusion for Controllable Multi-camera Driving Scene GenerationPoster43 citations
  127. AutoDIR: Automatic All-in-One Image Restoration with Latent DiffusionPoster42 citations
  128. BRAVE: Broadening the visual encoding of vision-language modelsOral42 citations
  129. DrivingDiffusion: Layout-Guided Multi-View Driving Scenarios Video Generation with Latent Diffusion ModelPoster41 citations
  130. PhysGen: Rigid-Body Physics-Grounded Image-to-Video GenerationPoster41 citations
  131. Receler: Reliable Concept Erasing of Text-to-Image Diffusion Models via Lightweight ErasersPoster41 citations
  132. CG-SLAM: Efficient Dense RGB-D SLAM in a Consistent Uncertainty-aware 3D Gaussian FieldPoster40 citations
  133. GaussCtrl: Multi-View Consistent Text-Driven 3D Gaussian Splatting EditingPoster40 citations
  134. Generating Human Interaction Motions in Scenes with Text ControlPoster40 citations
  135. LightenDiffusion: Unsupervised Low-Light Image Enhancement with Latent-Retinex Diffusion ModelsPoster40 citations
  136. ReNoise: Real Image Inversion Through Iterative NoisingPoster40 citations
  137. BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal ModelsPoster39 citations
  138. Common Sense Reasoning for Deep Fake DetectionPoster39 citations
  139. Distilling Diffusion Models into Conditional GANsPoster39 citations
  140. DreamScene360: Unconstrained Text-to-3D Scene Generation with Panoramic Gaussian SplattingPoster39 citations
  141. AdaCLIP: Adapting CLIP with Hybrid Learnable Prompts for Zero-Shot Anomaly DetectionPoster38 citations
  142. Attention-Challenging Multiple Instance Learning for Whole Slide Image ClassificationPoster38 citations
  143. LN3Diff: Scalable Latent Neural Fields Diffusion for Speedy 3D GenerationPoster38 citations
  144. LivePhoto: Real Image Animation with Text-guided Motion ControlPoster38 citations
  145. Per-Gaussian Embedding-Based Deformation for Deformable 3D Gaussian SplattingPoster38 citations
  146. ReMoS: 3D Motion-Conditioned Reaction Synthesis for Two-Person InteractionsPoster38 citations
  147. Scene Coordinate Reconstruction: Posing of Image Collections via Incremental Learning of a RelocalizerOral38 citations
  148. Embodied Understanding of Driving ScenariosPoster37 citations
  149. See and Think: Embodied Agent in Virtual EnvironmentPoster37 citations
  150. SkateFormer: Skeletal-Temporal Transformer for Human Action RecognitionPoster37 citations
  151. TC4D: Trajectory-Conditioned Text-to-4D GenerationPoster37 citations
  152. Think2Drive: Efficient Reinforcement Learning by Thinking with Latent World Model for Autonomous Driving (in CARLA-v2)Poster37 citations
  153. "Tracking Meets LoRA: Faster Training, Larger Model, Stronger Performance"Poster36 citations
  154. ControlLLM: Augment Language Models with Tools by Searching on GraphsPoster36 citations
  155. HeadStudio: Text to Animatable Head Avatars with 3D Gaussian SplattingPoster36 citations
  156. InstructIR: High-Quality Image Restoration Following Human InstructionsPoster36 citations
  157. T-Rex2: Towards Generic Object Detection via Text-Visual Prompt SynergyPoster36 citations
  158. HeadGaS: Real-Time Animatable Head Avatars via 3D Gaussian SplattingPoster35 citations
  159. LATTE3D: Large-scale Amortized Text-To-Enhanced3D SynthesisPoster35 citations
  160. LaRa: Efficient Large-Baseline Radiance FieldsPoster35 citations
  161. Language-Image Pre-training with Long CaptionsPoster35 citations
  162. Restoring Images in Adverse Weather Conditions via Histogram TransformerPoster35 citations
  163. Strengthening Multimodal Large Language Model with Bootstrapped Preference OptimizationOral35 citations
  164. VFusion3D: Learning Scalable 3D Generative Models from Video Diffusion ModelsPoster35 citations
  165. Watch Your Steps: Local Image and Scene Editing by Text InstructionsOral35 citations
  166. A Comprehensive Study of Multimodal Large Language Models for Image Quality AssessmentPoster34 citations
  167. CogView3: Finer and Faster Text-to-Image Generation via Relay DiffusionPoster34 citations
  168. DINO-Tracker: Taming DINO for Self-Supervised Point Tracking in a Single VideoPoster34 citations
  169. FunQA: Towards Surprising Video ComprehensionPoster34 citations
  170. MMEarth: Exploring Multi-Modal Pretext Tasks For Geospatial Representation LearningPoster34 citations
  171. MVSGaussian: Fast Generalizable Gaussian Splatting Reconstruction from Multi-View StereoPoster34 citations
  172. Reliable and Efficient Concept Erasure of Text-to-Image Diffusion ModelsPoster34 citations
  173. Segment3D: Learning Fine-Grained Class-Agnostic 3D Segmentation without Manual LabelsPoster34 citations
  174. DreamScene: 3D Gaussian-based Text-to-3D Scene Generation via Formation Pattern SamplingPoster33 citations
  175. Integer-Valued Training and Spike-driven Inference Spiking Neural Network for High-performance and Energy-efficient Object DetectionOral33 citations
  176. MapTracker: Tracking with Strided Memory Fusion for Consistent Vector HD MappingOral33 citations
  177. NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language ModelsPoster33 citations
  178. OMG: Occlusion-friendly Personalized Multi-concept Generation in Diffusion ModelsPoster33 citations
  179. V2X-Real: a Largs-Scale Dataset for Vehicle-to-Everything Cooperative PerceptionPoster33 citations
  180. "BK-SDM: A Lightweight, Fast, and Cheap Version of Stable Diffusion"Poster32 citations
  181. A Unified Anomaly Synthesis Strategy with Gradient Ascent for Industrial Anomaly Detection and LocalizationPoster32 citations
  182. Analytic-Splatting: Anti-Aliased 3D Gaussian Splatting via Analytic IntegrationOral32 citations
  183. CoherentGS: Sparse Novel View Synthesis with Coherent 3D GaussiansPoster32 citations
  184. Contrastive Region Guidance: Improving Grounding in Vision-Language Models without TrainingPoster32 citations
  185. Expressive Whole-Body 3D Gaussian AvatarPoster32 citations
  186. PSALM: Pixelwise Segmentation with Large Multi-modal ModelPoster32 citations
  187. UniDream: Unifying Diffusion Priors for Relightable Text-to-3D GenerationPoster32 citations
  188. CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentationPoster31 citations
  189. End-to-End Rate-Distortion Optimized 3D Gaussian RepresentationPoster31 citations
  190. Large-scale Reinforcement Learning for Diffusion ModelsPoster31 citations
  191. Radiative Gaussian Splatting for Efficient X-ray Novel View SynthesisPoster31 citations
  192. RealGen: Retrieval Augmented Generation for Controllable Traffic ScenariosOral31 citations
  193. TRAM: Global Trajectory and Motion of 3D Humans from in-the-wild VideosPoster31 citations
  194. AdvDiff: Generating Unrestricted Adversarial Examples using Diffusion ModelsPoster30 citations
  195. Implicit Style-Content Separation using B-LoRAPoster30 citations
  196. MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion ModelPoster30 citations
  197. Merlin: Empowering Multimodal LLMs with Foresight MindsPoster30 citations
  198. Multi-Memory Matching for Unsupervised Visible-Infrared Person Re-IdentificationPoster30 citations
  199. OneRestore: A Universal Restoration Framework for Composite DegradationPoster30 citations
  200. Rethinking Tree-Ring Watermarking for Enhanced Multi-Key IdentificationPoster30 citations
  201. VISA: Reasoning Video Object Segmentation via Large Language ModelPoster30 citations
  202. A Comparative Study of Image Restoration Networks for General Backbone Network DesignPoster29 citations
  203. AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question AnsweringPoster29 citations
  204. ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language InferencePoster29 citations
  205. EDTalk: Efficient Disentanglement for Emotional Talking Head SynthesisOral29 citations
  206. GraphBEV: Towards Robust BEV Feature Alignment for Multi-Modal 3D Object DetectionPoster29 citations
  207. Latent Guard: a Safety Framework for Text-to-image GenerationPoster29 citations
  208. Model Stock: All we need is just a few fine-tuned modelsOral29 citations
  209. Paying More Attention to Images: A Training-Free Method for Alleviating Hallucination in LVLMsPoster29 citations
  210. RGBD GS-ICP SLAMPoster29 citations
  211. UniTraj: A Unified Framework for Scalable Vehicle Trajectory PredictionPoster29 citations
  212. BAMM: Bidirectional Autoregressive Motion ModelPoster28 citations
  213. CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual ScenariosPoster28 citations
  214. CompGS: Smaller and Faster Gaussian Splatting with Vector QuantizationPoster28 citations
  215. FlashTex: Fast Relightable Mesh Texturing with LightControlNetOral28 citations
  216. GLAD: Towards Better Reconstruction with Global and Local Adaptive Diffusion Models for Unsupervised Anomaly DetectionPoster28 citations
  217. HowToCaption: Prompting LLMs to Transform Video Annotations at ScalePoster28 citations
  218. Leveraging Enhanced Queries of Point Sets for Vectorized Map ConstructionPoster28 citations
  219. OmniSat: Self-Supervised Modality Fusion for Earth ObservationPoster28 citations
  220. Online Vectorized HD Map Construction using GeometryPoster28 citations
  221. ReMamber: Referring Image Segmentation with Mamba TwisterPoster28 citations
  222. Sapiens: Foundation for Human Vision ModelsOral28 citations
  223. VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language ModelsPoster28 citations
  224. ComboVerse: Compositional 3D Assets Creation Using Spatially-Aware Diffusion GuidancePoster27 citations
  225. Exact Diffusion Inversion via Bidirectional Integration ApproximationOral27 citations
  226. Face Adapter for Pre-Trained Diffusion Models with Fine-Grained ID and Attribute ControlPoster27 citations
  227. GaussianImage: 1000 FPS Image Representation and Compression by 2D Gaussian SplattingPoster27 citations
  228. GraspXL: Generating Grasping Motions for Diverse Objects at ScalePoster27 citations
  229. Large Motion Model for Unified Multi-Modal Motion GenerationPoster27 citations
  230. Multi-HMR: Multi-Person Whole-Body Human Mesh Recovery in a Single ShotPoster27 citations
  231. PhysAvatar: Learning the Physics of Dressed 3D Avatars from Visual ObservationsPoster27 citations
  232. Repaint123: Fast and High-quality One Image to 3D Generation with Progressive Controllable RepaintingPoster27 citations
  233. SILC: Improving Vision Language Pretraining with Self-DistillationPoster27 citations
  234. VeCLIP: Improving CLIP Training via Visual-enriched CaptionsPoster27 citations
  235. Arc2Face: A Foundation Model for ID-Consistent Human FacesOral26 citations
  236. Be Yourself: Bounded Attention for Multi-Subject Text-to-Image GenerationPoster26 citations
  237. Challenging Forgets: Unveiling the Worst-Case Forget Sets in Machine UnlearningPoster26 citations
  238. DQ-DETR: DETR with Dynamic Query for Tiny Object DetectionPoster26 citations
  239. Frequency-Spatial Entanglement Learning for Camouflaged Object DetectionPoster26 citations
  240. Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text RenderingPoster26 citations
  241. HiFi-123: Towards High-fidelity One Image to 3D Content GenerationPoster26 citations
  242. ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary SegmentationPoster26 citations
  243. Adversarial Prompt Tuning for Vision-Language ModelsPoster25 citations
  244. CoR-GS: Sparse-View 3D Gaussian Splatting via Co-RegularizationPoster25 citations
  245. Context-Guided Spatial Feature Reconstruction for Efficient Semantic SegmentationPoster25 citations
  246. DragVideo: Interactive Drag-style Video EditingPoster25 citations
  247. GVGEN: Text-to-3D Generation with Volumetric RepresentationPoster25 citations
  248. GeoGaussian: Geometry-aware Gaussian Splatting for Scene RenderingPoster25 citations
  249. SceneScript: Reconstructing Scenes With An Autoregressive Structured Language ModelPoster25 citations
  250. SegPoint: Segment Any Point Cloud via Large Language ModelPoster25 citations
  251. Self-Rectifying Diffusion Sampling with Perturbed-Attention GuidancePoster25 citations
  252. TalkingGaussian: Structure-Persistent 3D Talking Head Synthesis via Gaussian SplattingPoster25 citations
  253. Tokenize Anything via PromptingPoster25 citations
  254. View-Consistent 3D Editing with Gaussian SplattingPoster25 citations
  255. BAGS: Blur Agnostic Gaussian Splatting through Multi-Scale Kernel ModelingPoster24 citations
  256. DGE: Direct Gaussian 3D Editing by Consistent Multi-view EditingPoster24 citations
  257. DGInStyle: Domain-Generalizable Semantic Segmentation with Image Diffusion Models and Stylized Semantic ControlPoster24 citations
  258. DetToolChain: A New Prompting Paradigm to Unleash Detection Ability of MLLMPoster24 citations
  259. Detecting As Labeling: Rethinking LiDAR-camera Fusion in 3D Object DetectionPoster24 citations
  260. Disentangled Clothed Avatar Generation from Text DescriptionsPoster24 citations
  261. GGRt: Towards Generalizable 3D Gaussians without Pose Priors in Real-TimePoster24 citations
  262. GenerateCT: Text-Conditional Generation of 3D Chest CT VolumesPoster24 citations
  263. LCM-Lookahead for Encoder-based Text-to-Image PersonalizationPoster24 citations
  264. Make a Cheap Scaling: A Self-Cascade Diffusion Model for Higher-Resolution AdaptationPoster24 citations
  265. Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language ModelsPoster24 citations
  266. NeuroNCAP: Photorealistic Closed-loop Safety Testing for Autonomous DrivingPoster24 citations
  267. Prompting Language-Informed Distribution for Compositional Zero-Shot LearningPoster24 citations
  268. R.A.C.E.: Robust Adversarial Concept Erasure for Secure Text-to-Image Diffusion ModelOral24 citations
  269. SC4D: Sparse-Controlled Video-to-4D Generation and Motion TransferPoster24 citations
  270. SWAG: Splatting in the Wild images with Appearance-conditioned GaussiansPoster24 citations
  271. SemiVL: Semi-Supervised Semantic Segmentation with Vision-Language GuidancePoster24 citations
  272. Stream Query Denoising for Vectorized HD-Map ConstructionPoster24 citations
  273. TIBET: Identifying and Evaluating Biases in Text-to-Image Generative ModelsPoster24 citations
  274. Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation MatchingPoster24 citations
  275. A Watermark-Conditioned Diffusion Model for IP ProtectionPoster23 citations
  276. DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTsPoster23 citations
  277. EchoScene: Indoor Scene Generation via Information Echo over Scene Graph DiffusionPoster23 citations
  278. GTP-4o: Modality-prompted Heterogeneous Graph Learning for Omni-modal Biomedical RepresentationPoster23 citations
  279. Generative Camera Dolly: Extreme Monocular Dynamic Novel View SynthesisOral23 citations
  280. Improving 2D Feature Representations by 3D-Aware Fine-TuningPoster23 citations
  281. Local All-Pair Correspondence for Point TrackingPoster23 citations
  282. MagMax: Leveraging Model Merging for Seamless Continual LearningPoster23 citations
  283. ObjectDrop: Bootstrapping Counterfactuals for Photorealistic Object Removal and InsertionPoster23 citations
  284. SMFANet: A Lightweight Self-Modulation Feature Aggregation Network for Efficient Image Super-ResolutionPoster23 citations
  285. Safe-CLIP: Removing NSFW Concepts from Vision-and-Language ModelsPoster23 citations
  286. UGG: Unified Generative GraspingOral23 citations
  287. Unifying 3D Vision-Language Understanding via Promptable QueriesPoster23 citations
  288. ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward ModelingPoster23 citations
  289. Wear-Any-Way: Manipulable Virtual Try-on via Sparse Correspondence AlignmentPoster23 citations
  290. Audio-Synchronized Visual AnimationOral22 citations
  291. IRGen: Generative Modeling for Image RetrievalPoster22 citations
  292. Leveraging Representations from Intermediate Encoder-blocks for Synthetic Image DetectionPoster22 citations
  293. OphNet: A Large-Scale Video Benchmark for Ophthalmic Surgical Workflow UnderstandingPoster22 citations
  294. Parrot: Pareto-optimal Multi-Reward Reinforcement Learning Framework for Text-to-Image GenerationOral22 citations
  295. Reconstruction and Simulation of Elastic Objects with Spring-Mass 3D GaussiansPoster22 citations
  296. Relation DETR: Exploring Explicit Position Relation Prior for Object DetectionOral22 citations
  297. Vamos: Versatile Action Models for Video UnderstandingPoster22 citations
  298. View Selection for 3D Captioning via Diffusion RankingPoster22 citations
  299. Boosting Transferability in Vision-Language Attacks via Diversification along the Intersection Region of Adversarial TrajectoryPoster21 citations
  300. EgoLifter: Open-world 3D Segmentation for Egocentric PerceptionPoster21 citations
  301. MixDQ: Memory-Efficient Few-Step Text-to-Image Diffusion Models with Metric-Decoupled Mixed Precision QuantizationPoster21 citations
  302. MoMA: Multimodal LLM Adapter for Fast Personalized Image GenerationPoster21 citations
  303. MyVLM: Personalizing VLMs for User-Specific QueriesPoster21 citations
  304. OccGen: Generative Multi-modal 3D Occupancy Prediction for Autonomous DrivingPoster21 citations
  305. Personalized Federated Domain-Incremental Learning based on Adaptive Knowledge MatchingPoster21 citations
  306. Pyramid Diffusion for Fine 3D Large Scene GenerationOral21 citations
  307. Unveiling and Mitigating Memorization in Text-to-image Diffusion Models through Cross AttentionPoster21 citations
  308. AUFormer: Vision Transformers are Parameter-Efficient Facial Action Unit DetectorsPoster20 citations
  309. DiffClass: Diffusion-Based Class Incremental LearningPoster20 citations
  310. Diffusion Reward: Learning Rewards via Conditional Video DiffusionPoster20 citations
  311. Follow the Rules: Reasoning for Video Anomaly Detection with Large Language ModelsPoster20 citations
  312. GPSFormer: A Global Perception and Local Structure Fitting-based Transformer for Point Cloud UnderstandingPoster20 citations
  313. Improving Diffusion Models for Authentic Virtual Try-on in the WildPoster20 citations
  314. MoVideo: Motion-Aware Video Generation with Diffusion ModelsPoster20 citations
  315. On the Error Analysis of 3D Gaussian Splatting and an Optimal Projection StrategyPoster20 citations
  316. PromptFusion: Decoupling Stability and Plasticity for Continual LearningPoster20 citations
  317. Reinforcement Learning Friendly Vision-Language Model for MinecraftPoster20 citations
  318. SMooDi: Stylized Motion Diffusion ModelPoster20 citations
  319. SeFlow: A Self-Supervised Scene Flow Method in Autonomous DrivingPoster20 citations
  320. TAPTR: Tracking Any Point with Transformers as DetectionPoster20 citations
  321. UDiffText: A Unified Framework for High-quality Text Synthesis in Arbitrary Images via Character-aware Diffusion ModelsPoster20 citations
  322. m&m’s: A Benchmark to Evaluate Tool-Use for multi-step multi-modal TasksPoster20 citations
  323. Alternate Diverse Teaching for Semi-supervised Medical Image SegmentationPoster19 citations
  324. Deep Patch Visual SLAMPoster19 citations
  325. EAS-SNN: End-to-End Adaptive Sampling and Representation for Event-based Detection with Recurrent Spiking Neural NetworksPoster19 citations
  326. EgoExo-Fitness: Towards Egocentric and Exocentric Full-Body Action UnderstandingPoster19 citations
  327. FineMatch: Aspect-based Fine-grained Image and Text Mismatch Detection and CorrectionPoster19 citations
  328. FreeMotion: A Unified Framework for Number-free Text-to-Motion SynthesisPoster19 citations
  329. MoAI: Mixture of All Intelligence for Large Language and Vision ModelsPoster19 citations
  330. Occupancy as Set of PointsPoster19 citations
  331. ParCo: Part-Coordinating Text-to-Motion SynthesisPoster19 citations
  332. Portrait4D-v2: Pseudo Multi-View Data Creates Better 4D Head SynthesizerPoster19 citations
  333. QUAR-VLA: Vision-Language-Action Model for Quadruped RobotsPoster19 citations
  334. RangeLDM: Fast Realistic LiDAR Point Cloud GenerationPoster19 citations
  335. SSL-Cleanse: Trojan Detection and Mitigation in Self-Supervised LearningPoster19 citations
  336. Solving Motion Planning Tasks with a Scalable Generative ModelPoster19 citations
  337. SpaRP: Fast 3D Object Reconstruction and Pose Estimation from Sparse ViewsPoster19 citations
  338. T2IShield: Defending Against Backdoors on Text-to-Image Diffusion ModelsPoster19 citations
  339. TOD3Cap: Towards 3D Dense Captioning in Outdoor ScenesPoster19 citations
  340. The First to Know: How Token Distributions Reveal Hidden Knowledge in Large Vision-Language Models?Poster19 citations
  341. Track2Act: Predicting Point Tracks from Internet Videos enables Generalizable Robot ManipulationPoster19 citations
  342. V-IRL: Grounding Virtual Intelligence in Real LifePoster19 citations
  343. Click-Gaussian: Interactive Segmentation to Any 3D GaussiansPoster18 citations
  344. Decoupling Common and Unique Representations for Multimodal Self-supervised LearningOral18 citations
  345. Denoising Vision TransformersOral18 citations
  346. Efficient Inference of Vision Instruction-Following Models with Elastic CachePoster18 citations
  347. Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic SegmentationPoster18 citations
  348. Facial Affective Behavior Analysis with Instruction TuningPoster18 citations
  349. Fully Sparse 3D Occupancy PredictionPoster18 citations
  350. Griffon: Spelling out All Object Locations at Any Granularity with Large Language ModelsPoster18 citations
  351. Learning 3D Geometry and Feature Consistent Gaussian Splatting for Object RemovalPoster18 citations
  352. Put Myself in Your Shoes: Lifting the Egocentric Perspective from Exocentric VideosPoster18 citations
  353. R^2-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal GroundingPoster18 citations
  354. SAM-guided Graph Cut for 3D Instance SegmentationPoster18 citations
  355. Spherical Linear Interpolation and Text-Anchoring for Zero-shot Composed Image RetrievalPoster18 citations
  356. Towards Multimodal Sentiment Analysis Debiasing via Bias PurificationPoster18 citations
  357. TransFusion -- A Transparency-Based Diffusion Model for Anomaly DetectionPoster18 citations
  358. Tuning-Free Image Customization with Image and Text GuidancePoster18 citations
  359. 6DGS: 6D Pose Estimation from a Single Image and a 3D Gaussian Splatting ModelPoster17 citations
  360. CLIP-DPO: Vision-Language Models as a Source of Preference for Fixing Hallucinations in LVLMsPoster17 citations
  361. Discover-then-Name: Task-Agnostic Concept Bottlenecks via Automated Concept DiscoveryPoster17 citations
  362. Dolfin: Diffusion Layout Transformers without AutoencoderPoster17 citations
  363. FouriScale: A Frequency Perspective on Training-Free High-Resolution Image SynthesisPoster17 citations
  364. FreeZe: Training-free zero-shot 6D pose estimation with geometric and vision foundation modelsPoster17 citations
  365. Generalizable Human Gaussians for Sparse View SynthesisPoster17 citations
  366. Getting it Right: Improving Spatial Consistency in Text-to-Image ModelsPoster17 citations
  367. I-MedSAM: Implicit Medical Image Segmentation with Segment AnythingPoster17 citations
  368. Infinite-ID: Identity-preserved Personalization via ID-semantics Decoupling ParadigmPoster17 citations
  369. MegaScenes: Scene-Level View Synthesis at ScalePoster17 citations
  370. Post-training Quantization with Progressive Calibration and Activation Relaxing for Text-to-Image Diffusion ModelsPoster17 citations
  371. Ray Denoising: Depth-aware Hard Negative Sampling for Multi-view 3D Object DetectionPoster17 citations
  372. SemGrasp: Semantic Grasp Generation via Language Aligned DiscretizationOral17 citations
  373. Skeleton Recall Loss for Connectivity Conserving and Resource Efficient Segmentation of Thin Tubular StructuresPoster17 citations
  374. ViewFormer: Exploring Spatiotemporal Modeling for Multi-View 3D Occupancy Perception via View-Guided TransformersPoster17 citations
  375. Weighted Ensemble Models Are Strong Continual LearnersOral17 citations
  376. XPSR: Cross-modal Priors for Diffusion-based Image Super-ResolutionPoster17 citations
  377. Agent3D-Zero: An Agent for Zero-shot 3D UnderstandingPoster16 citations
  378. CoMo: Controllable Motion Generation through Language Guided Pose Code EditingPoster16 citations
  379. Collaborative Vision-Text Representation Optimizing for Open-Vocabulary SegmentationOral16 citations
  380. FedRA: A Random Allocation Strategy for Federated Tuning to Unleash the Power of Heterogeneous ClientsPoster16 citations
  381. FlashSplat: 2D to 3D Gaussian Splatting Segmentation Solved OptimallyPoster16 citations
  382. GLARE: Low Light Image Enhancement via Generative Latent Feature based Codebook RetrievalPoster16 citations
  383. Gaussian Splatting on the Move: Blur and Rolling Shutter Compensation for Natural Camera MotionPoster16 citations
  384. HaloQuest: A Visual Hallucination Dataset for Advancing Multimodal ReasoningPoster16 citations
  385. Improving Medical Multi-modal Contrastive Learning with Expert AnnotationsPoster16 citations
  386. LLMGA: Multimodal Large Language Model based Generation AssistantOral16 citations
  387. Learning to Unlearn for Robust Machine UnlearningPoster16 citations
  388. Masked Generative Video-to-Audio Transformers with Enhanced SynchronicityPoster16 citations
  389. Motion-Guided Latent Diffusion for Temporally Consistent Real-world Video Super-resolutionPoster16 citations
  390. N2F2: Hierarchical Scene Understanding with Nested Neural Feature FieldsPoster16 citations
  391. NeRF-MAE: Masked AutoEncoders for Self-Supervised 3D Representation Learning for Neural Radiance FieldsPoster16 citations
  392. OpenSight: A Simple Open-Vocabulary Framework for LiDAR-Based Object DetectionPoster16 citations
  393. Rethinking Weakly-supervised Video Temporal Grounding From a Game PerspectivePoster16 citations
  394. SplatFields: Neural Gaussian Splats for Sparse 3D and 4D ReconstructionPoster16 citations
  395. SwapAnything: Enabling Arbitrary Object Swapping in Personalized Image EditingPoster16 citations
  396. Texture-GS: Disentangle the Geometry and Texture for 3D Gaussian Splatting EditingPoster16 citations
  397. VCP-CLIP: A visual context prompting model for zero-shot anomaly segmentationPoster16 citations
  398. Asynchronous Large Language Model Enhanced Planner for Autonomous DrivingPoster15 citations
  399. Attention Prompting on Image for Large Vision-Language ModelsPoster15 citations
  400. Bridging Different Language Models and Generative Vision Models for Text-to-Image GenerationPoster15 citations
  401. Cascade-Zero123: One Image to Highly Consistent 3D with Self-Prompted Nearby ViewsPoster15 citations
  402. DreamSampler: Unifying Diffusion Sampling and Score Distillation for Image ManipulationPoster15 citations
  403. DyFADet: Dynamic Feature Aggregation for Temporal Action DetectionPoster15 citations
  404. FairDomain: Achieving Fairness in Cross-Domain Medical Image Segmentation and ClassificationPoster15 citations
  405. GS2Mesh: Surface Reconstruction from Gaussian Splatting via Novel Stereo ViewsPoster15 citations
  406. Goldfish: Vision-Language Understanding of Arbitrarily Long VideosPoster15 citations
  407. HO-Gaussian: Hybrid Optimization of 3D Gaussian Splatting for Urban ScenesPoster15 citations
  408. HiT-SR: Hierarchical Transformer for Efficient Image Super-ResolutionOral15 citations
  409. LEGO: Learning EGOcentric Action Frame Generation via Visual Instruction TuningOral15 citations
  410. LaWa: Using Latent Space for In-Generation Image WatermarkingPoster15 citations
  411. Label-anticipated Event Disentanglement for Audio-Visual Video ParsingPoster15 citations
  412. MEVG : Multi-event Video Generation with Text-to-Video ModelsPoster15 citations
  413. Make-Your-3D: Fast and Consistent Subject-Driven 3D Content GenerationPoster15 citations
  414. Nuvo: Neural UV Mapping for Unruly 3D RepresentationsPoster15 citations
  415. ScaleDreamer: Scalable Text-to-3D Synthesis with Asynchronous Score DistillationPoster15 citations
  416. SparseLIF: High-Performance Sparse LiDAR-Camera Fusion for 3D Object DetectionPoster15 citations
  417. VideoMamba: Spatio-Temporal Selective State Space ModelPoster15 citations
  418. Zero-Shot Detection of AI-Generated ImagesOral15 citations
  419. AdaLog: Post-Training Quantization for Vision Transformers with Adaptive Logarithm QuantizerPoster14 citations
  420. An Economic Framework for 6-DoF Grasp DetectionPoster14 citations
  421. AnimatableDreamer: Text-Guided Non-rigid 3D Model Generation and Reconstruction with Canonical Score DistillationPoster14 citations
  422. BAM-DETR: Boundary-Aligned Moment Detection Transformer for Temporal Sentence Grounding in VideosPoster14 citations
  423. Dataset Distillation by Automatic Training TrajectoriesPoster14 citations
  424. Deep Reward Supervisions for Tuning Text-to-Image Diffusion ModelsPoster14 citations
  425. Diffusion Soup: Model Merging for Text-to-Image Diffusion ModelsPoster14 citations
  426. Do text-free diffusion models learn discriminative visual representations?Poster14 citations
  427. DragAPart: Learning a Part-Level Motion Prior for Articulated ObjectsPoster14 citations
  428. Efficient Diffusion Transformer with Step-wise Dynamic Attention MediatorsPoster14 citations
  429. Efficient Frequency-Domain Image Deraining with Contrastive RegularizationPoster14 citations
  430. Factorized Diffusion: Perceptual Illusions by Noise DecompositionPoster14 citations
  431. Four Ways to Improve Verbo-visual Fusion for Dense 3D Visual GroundingPoster14 citations
  432. FreestyleRet: Retrieving Images from Style-Diversified QueriesPoster14 citations
  433. GalLop: Learning global and local prompts for vision-language modelsPoster14 citations
  434. LatentEditor: Text Driven Local Editing of 3D ScenesPoster14 citations
  435. Learning Modality-agnostic Representation for Semantic Segmentation from Any ModalitiesOral14 citations
  436. MTKD: Multi-Teacher Knowledge Distillation for Image Super-ResolutionPoster14 citations
  437. MTMamba: Enhancing Multi-Task Dense Scene Understanding by Mamba-Based DecodersPoster14 citations
  438. MapDistill: Boosting Efficient Camera-based HD Map Construction via Camera-LiDAR Fusion Model DistillationPoster14 citations
  439. MeshAvatar: Learning High-quality Triangular Human Avatars from Multi-view VideosPoster14 citations
  440. MirrorGaussian: Reflecting 3D Gaussians for Reconstructing Mirror ReflectionsPoster14 citations
  441. NeuroPictor: Refining fMRI-to-Image Reconstruction via Multi-individual Pretraining and Multi-level ModulationPoster14 citations
  442. On the Viability of Monocular Depth Pre-training for Semantic SegmentationPoster14 citations
  443. One-Shot Diffusion Mimicker for Handwritten Text GenerationPoster14 citations
  444. PYRA: Parallel Yielding Re-Activation for Training-Inference Efficient Task AdaptationPoster14 citations
  445. RodinHD: High-Fidelity 3D Avatar Generation with Diffusion ModelsPoster14 citations
  446. SwiftBrush v2: Make Your One-step Diffusion Model Better Than Its TeacherPoster14 citations
  447. WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question AnsweringPoster14 citations
  448. WiMANS: A Benchmark Dataset for WiFi-based Multi-user Activity SensingPoster14 citations
  449. A Compact Dynamic 3D Gaussian Representation for Real-Time Dynamic View SynthesisPoster13 citations
  450. Bad Students Make Great Teachers: Active Learning Accelerates Large-Scale Visual UnderstandingPoster13 citations
  451. Be-Your-Outpainter: Mastering Video Outpainting through Input-Specific AdaptationPoster13 citations
  452. Class-Incremental Learning with CLIP: Adaptive Representation Adjustment and Parameter FusionPoster13 citations
  453. Cross-Domain Few-Shot Object Detection via Enhanced Open-Set Object DetectorPoster13 citations
  454. DG-PIC: Domain Generalized Point-In-Context Learning for Point Cloud UnderstandingPoster13 citations
  455. Expanding Scene Graph Boundaries: Fully Open-vocabulary Scene Graph Generation via Visual-Concept Alignment and RetentionOral13 citations
  456. Faceptor: A Generalist Model for Face PerceptionOral13 citations
  457. Fake It till You Make It: Curricular Dynamic Forgery Augmentations towards General Deepfake DetectionPoster13 citations
  458. FlexAttention for Efficient High-Resolution Vision-Language ModelsPoster13 citations
  459. Gaussian Frosting: Editable Complex Radiance Fields with Real-Time RenderingOral13 citations
  460. GeoCalib: Learning Single-image Calibration with Geometric OptimizationPoster13 citations
  461. Hierarchical Gaussian Mixture Normalizing Flow Modeling for Unified Anomaly DetectionPoster13 citations
  462. I Can't Believe It's Not Scene Flow!Poster13 citations
  463. Improving Point-based Crowd Counting and Localization Based on Auxiliary Point GuidancePoster13 citations
  464. Large-Scale Multi-Hypotheses Cell Tracking Using Ultrametric Contours MapsPoster13 citations
  465. LayoutDETR: Detection Transformer Is a Good Multimodal Layout DesignerPoster13 citations
  466. Learned Rate Control for Frame-Level Adaptive Neural Video Compression via Dynamic Neural NetworkPoster13 citations
  467. Masked Angle-Aware Autoencoder for Remote Sensing ImagesPoster13 citations
  468. Meerkat: Audio-Visual Large Language Model for Grounding in Space and TimePoster13 citations
  469. Meta-Prompting for Automating Zero-shot Visual Recognition with LLMsPoster13 citations
  470. Object-Centric Diffusion for Efficient Video EditingPoster13 citations
  471. PreciseControl: Enhancing Text-To-Image Diffusion Models with Fine-Grained Attribute ControlPoster13 citations
  472. Revisit Human-Scene Interaction via Space OccupancyPoster13 citations
  473. SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression SegmentationPoster13 citations
  474. SQ-LLaVA: Self-Questioning for Large Vision-Language AssistantPoster13 citations
  475. TrojVLM: Backdoor Attack Against Vision Language ModelsPoster13 citations
  476. Uncertainty-aware sign language video retrieval with probability distribution modelingPoster13 citations
  477. Unveiling Typographic Deceptions: Insights of the Typographic Vulnerability in Large Vision-Language ModelsPoster13 citations
  478. A Closer Look at GAN Priors: Exploiting Intermediate Features for Enhanced Model Inversion AttacksOral12 citations
  479. Beta-Tuned Timestep Diffusion ModelPoster12 citations
  480. Beyond Prompt Learning: Continual Adapter for Efficient Rehearsal-Free Continual LearningPoster12 citations
  481. CLAMP-ViT: Contrastive Data-Free Learning for Adaptive Post-Training Quantization of ViTsPoster12 citations
  482. DVLO: Deep Visual-LiDAR Odometry with Local-to-Global Feature Fusion and Bi-Directional Structure AlignmentOral12 citations
  483. Diff-Tracker: Text-to-Image Diffusion Models are Unsupervised TrackersPoster12 citations
  484. Diffusion for Natural Image MattingPoster12 citations
  485. Diffusion-Driven Data Replay: A Novel Approach to Combat Forgetting in Federated Class Continual LearningOral12 citations
  486. EditShield: Protecting Unauthorized Image Editing by Instruction-guided Diffusion ModelsPoster12 citations
  487. Explorative Inbetweening of Time and SpacePoster12 citations
  488. Few-shot Class Incremental Learning with Attention-Aware Self-Adaptive PromptPoster12 citations
  489. G3R: Gradient Guided Generalizable ReconstructionPoster12 citations
  490. GRA: Detecting Oriented Objects through Group-wise Rotating and AttentionPoster12 citations
  491. HYDRA: A Hyper Agent for Dynamic Compositional Visual ReasoningPoster12 citations
  492. Implicit Concept Removal of Diffusion ModelsPoster12 citations
  493. IntrinsicAnything: Learning Diffusion Priors for Inverse Rendering Under Unknown IlluminationPoster12 citations
  494. Isomorphic Pruning for Vision ModelsPoster12 citations
  495. LISO: Lidar-only Self-Supervised 3D Object DetectionPoster12 citations
  496. Language-Driven Physics-Based Scene Synthesis and Editing via Feature SplattingPoster12 citations
  497. Learning Natural Consistency Representation for Face Forgery Video DetectionPoster12 citations
  498. MUSES: The Multi-Sensor Semantic Perception Dataset for Driving under UncertaintyPoster12 citations
  499. Making Large Language Models Better Planners with Reasoning-Decision AlignmentOral12 citations
  500. MesonGS: Post-training Compression of 3D Gaussians via Efficient Attribute TransformationPoster12 citations
  501. Omni6DPose: A Benchmark and Model for Universal 6D Object Pose Estimation and TrackingPoster12 citations
  502. R3D-AD: Reconstruction via Diffusion for 3D Anomaly DetectionPoster12 citations
  503. SEGIC: Unleashing the Emergent Correspondence for In-Context SegmentationPoster12 citations
  504. Self-supervised Feature Adaptation for 3D Industrial Anomaly DetectionPoster12 citations
  505. StableDrag: Stable Dragging for Point-based Image EditingPoster12 citations
  506. Synchronization is All You Need: Exocentric-to-Egocentric Transfer for Temporal Action Segmentation with Unlabeled Synchronized Video PairsPoster12 citations
  507. Text to Layer-wise 3D Clothed Human GenerationPoster12 citations
  508. Text-Conditioned Resampler For Long Form Video UnderstandingPoster12 citations
  509. Towards Neuro-Symbolic Video UnderstandingOral12 citations
  510. Trackastra: Transformer-based cell tracking for live-cell microscopyPoster12 citations
  511. UMBRAE: Unified Multimodal Brain DecodingPoster12 citations
  512. UniCode : Learning a Unified Codebook for Multimodal Large Language ModelsPoster12 citations
  513. Video Editing via Factorized Diffusion DistillationOral12 citations
  514. VideoStudio: Generating Consistent-Content and Multi-Scene VideosPoster12 citations
  515. "PointNeRF++: A multi-scale, point-based Neural Radiance Field"Poster11 citations
  516. AccDiffusion: An Accurate Method for Higher-Resolution Image GenerationPoster11 citations
  517. Benchmarks and Challenges in Pose Estimation for Egocentric Hand Interactions with ObjectsPoster11 citations
  518. Better Call SAL: Towards Learning to Segment Anything in LidarPoster11 citations
  519. Beyond the Contact: Discovering Comprehensive Affordance for 3D Objects from Pre-trained 2D Diffusion ModelsOral11 citations
  520. Centering the Value of Every Modality: Towards Efficient and Resilient Modality-agnostic Semantic SegmentationPoster11 citations
  521. Cross-view image geo-localization with Panorama-BEV Co-Retrieval NetworkPoster11 citations
  522. Enhancing Semantic Fidelity in Text-to-Image Synthesis: Attention Regulation in Diffusion ModelsPoster11 citations
  523. Exemplar-free Continual Representation Learning via Learnable Drift CompensationPoster11 citations
  524. Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object SegmentationPoster11 citations
  525. FocusDiffuser: Perceiving Local Disparities for Camouflaged Object DetectionPoster11 citations
  526. Hierarchical Temporal Context Learning for Camera-based Semantic Scene CompletionPoster11 citations
  527. Keypoint Promptable Re-IdentificationPoster11 citations
  528. Knowledge Transfer with Simulated Inter-Image Erasing for Weakly Supervised Semantic SegmentationPoster11 citations
  529. Language-Driven 6-DoF Grasp Detection Using Negative Prompt GuidanceOral11 citations
  530. Lego: Learning to Disentangle and Invert Personalized Concepts Beyond Object Appearance in Text-to-Image Diffusion ModelsPoster11 citations
  531. LookupViT: Compressing visual information to a limited number of tokensPoster11 citations
  532. Lossy Image Compression with Foundation Diffusion ModelsPoster11 citations
  533. M2D2M: Multi-Motion Generation from Text with Discrete Diffusion ModelsPoster11 citations
  534. Motion-prior Contrast Maximization for Dense Continuous-Time Motion EstimationPoster11 citations
  535. Multistain Pretraining for Slide Representation Learning in PathologyPoster11 citations
  536. PALM: Predicting Actions through Language ModelsPoster11 citations
  537. PPAD: Iterative Interactions of Prediction and Planning for End-to-end Autonomous DrivingPoster11 citations
  538. Parrot Captions Teach CLIP to Spot TextOral11 citations
  539. Reliability in Semantic Segmentation: Can We Use Synthetic Data?Poster11 citations
  540. SWinGS: Sliding Windows for Dynamic 3D Gaussian SplattingPoster11 citations
  541. ScanReason: Empowering 3D Visual Grounding with Reasoning CapabilitiesPoster11 citations
  542. SceneTeller: Language-to-3D Scene GenerationPoster11 citations
  543. SegGen: Supercharging Segmentation Models with Text2Mask and Mask2Img SynthesisPoster11 citations
  544. Select and Distill: Selective Dual-Teacher Knowledge Transfer for Continual Learning on Vision-Language ModelsPoster11 citations
  545. Semantic Residual Prompts for Continual LearningPoster11 citations
  546. Teaching Tailored to Talent: Adverse Weather Restoration via Prompt Pool and Depth-Anything ConstraintPoster11 citations
  547. TetraDiffusion: Tetrahedral Diffusion Models for 3D Shape GenerationPoster11 citations
  548. TexGen: Text-Guided 3D Texture Generation with Multi-view Sampling and ResamplingPoster11 citations
  549. UniM2AE: Multi-modal Masked Autoencoders with Unified 3D Representation for 3D Perception in Autonomous DrivingPoster11 citations
  550. Visual Text Generation in the WildPoster11 citations
  551. WildVidFit: Video Virtual Try-On in the Wild via Image-Based Controlled Diffusion ModelsPoster11 citations
  552. X-Pose: Detecting Any KeypointsPoster11 citations
  553. ZeroI2V: Zero-Cost Adaptation of Pre-Trained Transformers from Image to VideoPoster11 citations
  554. milliFlow: Scene Flow Estimation on mmWave Radar Point Cloud for Human Motion SensingPoster11 citations
  555. 3D Gaussian Parametric Head ModelPoster10 citations
  556. Accelerating Image Generation with Sub-path Linear Approximation ModelOral10 citations
  557. An Incremental Unified Framework for Small Defect InspectionPoster10 citations
  558. Boosting the Power of Small Multimodal Reasoning Models to Match Larger Models with Self-Consistency TrainingPoster10 citations
  559. Bridging the Gap Between Human Motion and Action Semantics via Kinematics PhrasesPoster10 citations
  560. DreamStruct: Understanding Slides and User Interfaces via Synthetic Data GenerationPoster10 citations
  561. Efficient Image Pre-Training with Siamese Cropped Masked AutoencodersPoster10 citations
  562. F-HOI: Toward Fine-grained Semantic-Aligned 3D Human-Object InteractionsPoster10 citations
  563. Fairness-aware Vision Transformer via Debiased Self-AttentionPoster10 citations
  564. Find n' Propagate: Open-Vocabulary 3D Object Detection in Urban EnvironmentsPoster10 citations
  565. Finding Visual Task VectorsPoster10 citations
  566. Free-Editor: Zero-shot Text-driven 3D Scene EditingPoster10 citations
  567. GiT: Towards Generalist Vision Transformer through Universal Language InterfaceOral10 citations
  568. Harnessing Text-to-Image Diffusion Models for Category-Agnostic Pose EstimationOral10 citations
  569. Hybrid Video Diffusion Models with 2D Triplane and 3D Wavelet RepresentationPoster10 citations
  570. In Defense of Lazy Visual Grounding for Open-Vocabulary Semantic SegmentationPoster10 citations
  571. Inf-DiT: Upsampling any-resolution image with memory-efficient diffusion transformer.Poster10 citations
  572. LAPT: Label-driven Automated Prompt Tuning for OOD Detection with Vision-Language ModelsPoster10 citations
  573. MaxFusion: Plug&Play Multi-Modal Generation in Text-to-Image Diffusion ModelsPoster10 citations
  574. Mixture of Efficient Diffusion Experts Through Automatic Interval and Sub-Network SelectionPoster10 citations
  575. MotionChain: Conversational Motion Controllers via Multimodal PromptsPoster10 citations
  576. OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and WebPoster10 citations
  577. Open Panoramic SegmentationPoster10 citations
  578. Open-Vocabulary Camouflaged Object SegmentationPoster10 citations
  579. PILoRA: Prototype Guided Incremental LoRA for Federated Class-Incremental LearningPoster10 citations
  580. PreSight: Enhancing Autonomous Vehicle Perception with City-Scale NeRF PriorsPoster10 citations
  581. PromptIQA: Boosting the Performance and Generalization for No-Reference Image Quality Assessment via PromptsPoster10 citations
  582. Protecting NeRFs' Copyright via Plug-And-Play Watermarking Base ModelPoster10 citations
  583. Quantized Prompt for Efficient Generalization of Vision-Language ModelsPoster10 citations
  584. Salience-Based Adaptive Masking: Revisiting Token Dynamics for Enhanced Pre-trainingPoster10 citations
  585. SlimFlow: Training Smaller One-Step Diffusion Models with Rectified FlowPoster10 citations
  586. Spiking Wavelet TransformerPoster10 citations
  587. Taming Latent Diffusion Model for Neural Radiance Field InpaintingPoster10 citations
  588. Temporally Consistent Stereo MatchingPoster10 citations
  589. Towards Open Domain Text-Driven Synthesis of Multi-Person MotionsPoster10 citations
  590. Towards Open-Ended Visual Recognition with Large Language ModelsPoster10 citations
  591. UniMD: Towards Unifying Moment Retrieval and Temporal Action DetectionPoster10 citations
  592. UniProcessor: A Text-induced Unified Low-level Image ProcessorPoster10 citations
  593. Unleashing the Power of Prompt-driven Nucleus Instance SegmentationPoster10 citations
  594. ViLA: Efficient Video-Language Alignment for Video Question AnsweringPoster10 citations
  595. WHAC: World-grounded Humans and CamerasPoster10 citations
  596. WordRobe: Text-Guided Generation of Textured 3D GarmentsPoster10 citations
  597. You Only Need One Step: Fast Super-Resolution with Stable Diffusion via Scale DistillationPoster10 citations
  598. Zero-shot Object Counting with Good ExemplarsPoster10 citations
  599. A Graph-Based Approach for Category-Agnostic Pose EstimationPoster9 citations
  600. Animate Your Motion: Turning Still Images into Dynamic VideosPoster9 citations
  601. AugUndo: Scaling Up Augmentations for Monocular Depth Completion and EstimationPoster9 citations
  602. Auto-GAS: Automated Proxy Discovery for Training-free Generative Architecture SearchPoster9 citations
  603. BEAF: Observing BEfore-AFter Changes to Evaluate Hallucination in Vision-language ModelsPoster9 citations
  604. BlenderAlchemy: Editing 3D Graphics with Vision-Language ModelsPoster9 citations
  605. Caltech Aerial RGB-Thermal Dataset in the WildPoster9 citations
  606. Cascade Prompt Learning for Visual-Language Model AdaptationPoster9 citations
  607. CoDA: Instructive Chain-of-Domain Adaptation with Severity-Aware Visual Prompt TuningPoster9 citations
  608. Context Diffusion: In-Context Aware Image GenerationPoster9 citations
  609. Contourlet Residual for Prompt Learning Enhanced Infrared Image Super-ResolutionPoster9 citations
  610. DEAL: Disentangle and Localize Concept-level Explanations for VLMsPoster9 citations
  611. Dataset Enhancement with Instance-Level AugmentationsOral9 citations
  612. Deep Diffusion Image Prior for Efficient OOD Adaptation in 3D Inverse ProblemsPoster9 citations
  613. Defect Spectrum: A Granular Look of Large-scale Defect Datasets with Rich SemanticsPoster9 citations
  614. Distractors-Immune Representation Learning with Cross-modal Contrastive Regularization for Change CaptioningPoster9 citations
  615. Embracing Events and Frames with Hierarchical Feature Refinement Network for Object DetectionPoster9 citations
  616. Emergent Visual-Semantic Hierarchies in Image-Text RepresentationsOral9 citations
  617. Emerging Property of Masked Token for Effective Pre-trainingPoster9 citations
  618. Enhancing Vectorized Map Perception with Historical Rasterized MapsPoster9 citations
  619. EventBind: Learning a Unified Representation to Bind Them All for Event-based Open-world UnderstandingPoster9 citations
  620. Fast Diffusion-Based Counterfactuals for Shortcut Removal and GenerationOral9 citations
  621. FlexiEdit: Frequency-Aware Latent Refinement for Enhanced Non-Rigid EditingPoster9 citations
  622. GeneralAD: Anomaly Detection Across Domains by Attending to Distorted FeaturesPoster9 citations
  623. Grounding Language Models for Visual Entity RecognitionPoster9 citations
  624. HENet: Hybrid Encoding for End-to-end Multi-task 3D Perception from Multi-view CamerasPoster9 citations
  625. Human Hair Reconstruction with Strand-Aligned 3D GaussiansPoster9 citations
  626. Image Demoireing in RAW and sRGB DomainsPoster9 citations
  627. InfMAE: A Foundation Model in The Infrared ModalityPoster9 citations
  628. InterFusion: Text-Driven Generation of 3D Human-Object InteractionPoster9 citations
  629. Knowledge-enhanced Visual-Language Pretraining for Computational PathologyOral9 citations
  630. LLM as Copilot for Coarse-grained Vision-and-Language NavigationPoster9 citations
  631. Learning Unsigned Distance Functions from Multi-view Images with Volume Rendering PriorsPoster9 citations
  632. Mask2Map: Vectorized HD Map Construction Using Bird's Eye View Segmentation MasksOral9 citations
  633. Masked Video and Body-worn IMU Autoencoder for Egocentric Action RecognitionPoster9 citations
  634. MetaCap: Meta-learning Priors from Multi-View Imagery for Sparse-view Human Performance Capture and RenderingPoster9 citations
  635. MinD-3D: Reconstruct High-quality 3D objects in Human BrainPoster9 citations
  636. OGNI-DC: Robust Depth Completion with Optimization-Guided Neural IterationsPoster9 citations
  637. Online Zero-Shot Classification with CLIPPoster9 citations
  638. PathMMU: A Massive Multimodal Expert-Level Benchmark for Understanding and Reasoning in PathologyOral9 citations
  639. Prioritized Semantic Learning for Zero-shot Instance NavigationPoster9 citations
  640. Progressive Pretext Task Learning for Human Trajectory PredictionPoster9 citations
  641. PromptCCD: Learning Gaussian Mixture Prompt Pool for Continual Category DiscoveryPoster9 citations
  642. RadEdit: stress-testing biomedical vision models via diffusion image editingPoster9 citations
  643. Real-time 3D-aware Portrait Editing from a Single ImagePoster9 citations
  644. SAM-COD: SAM-guided Unified Framework for Weakly-Supervised Camouflaged Object DetectionPoster9 citations
  645. Safe-Sim: Safety-Critical Closed-Loop Traffic Simulation with Diffusion-Controllable AdversariesPoster9 citations
  646. Scissorhands: Scrub Data Influence via Connection Sensitivity in NetworksPoster9 citations
  647. SegVG: Transferring Object Bounding Box to Segmentation for Visual GroundingPoster9 citations
  648. SignAvatars: A Large-scale 3D Sign Language Holistic Motion Dataset and BenchmarkPoster9 citations
  649. SphereHead: Stable 3D Full-head Synthesis with Spherical Tri-plane RepresentationOral9 citations
  650. Textual Knowledge Matters: Cross-Modality Co-Teaching for Generalized Visual Class DiscoveryPoster9 citations
  651. The Nerfect Match: Exploring NeRF Features for Visual LocalizationPoster9 citations
  652. Thinking Outside the BBox: Unconstrained Generative Object CompositingPoster9 citations
  653. Turbo: Informativity-Driven Acceleration Plug-In for Vision-Language Large ModelsOral9 citations
  654. ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked AutoencodersPoster9 citations
  655. VisionTrap: Vision-Augmented Trajectory Prediction Guided by Textual DescriptionsPoster9 citations
  656. VividDreamer: Invariant Score Distillation for Hyper-Realistic Text-to-3D GenerationPoster9 citations
  657. WTS: A Pedestrian-Centric Traffic Video Dataset for Fine-grained Spatial-Temporal UnderstandingPoster9 citations
  658. "NeuSDFusion: A Spatial-Aware Generative Model for 3D Shape Completion, Reconstruction, and Generation"Poster8 citations
  659. 3D Hand Pose Estimation in Everyday Egocentric ImagesPoster8 citations
  660. 3DGazeNet: Generalizing Gaze Estimation with Weak Supervision from Synthetic ViewsPoster8 citations
  661. AMD: Automatic Multi-step Distillation of Large-scale Vision ModelsPoster8 citations
  662. AMEGO: Active Memory from long EGOcentric videosPoster8 citations
  663. Adaptive Bounding Box Uncertainties via Two-Step Conformal PredictionOral8 citations
  664. AddressCLIP: Empowering Vision-Language Models for City-wide Image Address LocalizationPoster8 citations
  665. AnyControl: Create Your Artwork with Versatile Control on Text-to-Image GenerationPoster8 citations
  666. BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual CuesPoster8 citations
  667. Benchmarking Object Detectors with COCO: A New Path ForwardPoster8 citations
  668. Connecting Consistency Distillation to Score Distillation for Text-to-3D GenerationPoster8 citations
  669. Contrasting Deepfakes Diffusion via Contrastive Learning and Global-Local SimilaritiesPoster8 citations
  670. Controllable Navigation Instruction Generation with Chain of Thought PromptingPoster8 citations
  671. Deciphering the Role of Representation Disentanglement: Investigating Compositional Generalization in CLIP ModelsPoster8 citations
  672. Diffusion Models for Open-Vocabulary SegmentationOral8 citations
  673. EGIC: Enhanced Low-Bit-Rate Generative Image Compression Guided by Semantic SegmentationPoster8 citations
  674. EMIE-MAP: Large-Scale Road Surface Reconstruction Based on Explicit Mesh and Implicit EncodingPoster8 citations
  675. Editable Image Elements for Controllable SynthesisPoster8 citations
  676. EgoCVR: An Egocentric Benchmark for Fine-Grained Composed Video RetrievalPoster8 citations
  677. EgoPoser: Robust Real-Time Egocentric Pose Estimation from Sparse and Intermittent Observations EverywherePoster8 citations
  678. Enhancing Diffusion Models with Text-Encoder Reinforcement LearningPoster8 citations
  679. Enhancing Recipe Retrieval with Foundation Models: A Data Augmentation PerspectivePoster8 citations
  680. Exploring Conditional Multi-Modal Prompts for Zero-shot HOI DetectionPoster8 citations
  681. Fast View Synthesis of Casual Videos with Soup-of-PlanesPoster8 citations
  682. Fisher Calibration for Backdoor-Robust Heterogeneous Federated LearningPoster8 citations
  683. General and Task-Oriented Video SegmentationPoster8 citations
  684. HERGen: Elevating Radiology Report Generation with Longitudinal DataPoster8 citations
  685. HYPE: Hyperbolic Entailment Filtering for Underspecified Images and TextsOral8 citations
  686. IMMA: Immunizing text-to-image Models against Malicious AdaptationPoster8 citations
  687. Improving Video Segmentation via Dynamic Anchor QueriesPoster8 citations
  688. Improving Zero-Shot Generalization for CLIP with Variational AdapterPoster8 citations
  689. InstaStyle: Inversion Noise of a Stylized Image is Secretly a Style AdviserPoster8 citations
  690. InstructGIE: Towards Generalizable Image EditingPoster8 citations
  691. Iterative Ensemble Training with Anti-Gradient Control for Mitigating Memorization in Diffusion ModelsPoster8 citations
  692. KDProR: A Knowledge-Decoupling Probabilistic Framework for Video-Text RetrievalPoster8 citations
  693. Kalman-Inspired Feature Propagation for Video Face Super-ResolutionPoster8 citations
  694. Lazy Diffusion Transformer for Interactive Image EditingPoster8 citations
  695. Learning to Adapt SAM for Segmenting Cross-domain Point CloudsPoster8 citations
  696. Listen to Look into the Future: Audio-Visual Egocentric Gaze AnticipationPoster8 citations
  697. MANIKIN: Biomechanically Accurate Neural Inverse Kinematics for Human Motion EstimationPoster8 citations
  698. MART: MultiscAle Relational Transformer Networks for Multi-agent Trajectory PredictionPoster8 citations
  699. MSD: A Benchmark Dataset for Floor Plan Generation of Building ComplexesPoster8 citations
  700. MVPGS: Excavating Multi-view Priors for Gaussian Splatting from Sparse Input ViewsPoster8 citations
  701. MarineInst: A Foundation Model for Marine Image Analysis with Instance Visual DescriptionOral8 citations
  702. Match-Stereo-Videos: Bidirectional Alignment for Consistent Dynamic Stereo MatchingPoster8 citations
  703. Meta-optimized Angular Margin Contrastive Framework for Video-Language Representation LearningPoster8 citations
  704. Mismatch Quest: Visual and Textual Feedback for Image-Text MisalignmentPoster8 citations
  705. MoE-DiffIR: Task-customized Diffusion Priors for Universal Compressed Image RestorationPoster8 citations
  706. MultiDelete for Multimodal Machine UnlearningPoster8 citations
  707. NICP: Neural ICP for 3D Human Registration at ScalePoster8 citations
  708. OV-Uni3DETR: Towards Unified Open-Vocabulary 3D Object Detection via Cycle-Modality PropagationPoster8 citations
  709. Object-Conditioned Energy-Based Attention Map Alignment in Text-to-Image Diffusion ModelsPoster8 citations
  710. OmniNOCS: A unified NOCS dataset and model for 3D lifting of 2D objectsOral8 citations
  711. On the Utility of 3D Hand Poses for Action RecognitionPoster8 citations
  712. Pathology-knowledge Enhanced Multi-instance Prompt Learning for Few-shot Whole Slide Image ClassificationPoster8 citations
  713. RAPiD-Seg: Range-Aware Pointwise Distance Distribution Networks for 3D LiDAR SegmentationOral8 citations
  714. RAW-Adapter: Adapting Pretrained Visual Model to Camera RAW ImagesPoster8 citations
  715. ReMatching: Low-Resolution Representations for Scalable Shape CorrespondencePoster8 citations
  716. Recursive Visual ProgrammingPoster8 citations
  717. RegionDrag: Fast Region-Based Image Editing with Diffusion ModelsPoster8 citations
  718. RoadPainter: Points Are Ideal Navigators for Topology transformERPoster8 citations
  719. SAFNet: Selective Alignment Fusion Network for Efficient HDR ImagingPoster8 citations
  720. SEED: A Simple and Effective 3D DETR in Point CloudsPoster8 citations
  721. SmartControl: Enhancing ControlNet for Handling Rough Visual ConditionsPoster8 citations
  722. StoryImager: A Unified and Efficient Framework for Coherent Story Visualization and CompletionPoster8 citations
  723. TF-FAS: Twofold-Element Fine-Grained Semantic Guidance for Generalizable Face Anti-SpoofingPoster8 citations
  724. Teach CLIP to Develop a Number Sense for Ordinal RegressionPoster8 citations
  725. TexDreamer: Towards Zero-Shot High-Fidelity 3D Human Texture GenerationOral8 citations
  726. Text2LiDAR: Text-guided LiDAR Point Clouds Generation via Equirectangular TransformerPoster8 citations
  727. Toward Open Vocabulary Aerial Object Detection with CLIP-Activated Student-Teacher LearningPoster8 citations
  728. Towards Multimodal Open-Set Domain Generalization and Adaptation through Self-supervisionPoster8 citations
  729. UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World UnderstandingPoster8 citations
  730. Unified Embedding Alignment for Open-Vocabulary Video Instance SegmentationPoster8 citations
  731. Unlocking the Potential of Federated Learning: The Symphony of Dataset Distillation via Deep Generative LatentsPoster8 citations
  732. VQ-HPS: Human Pose and Shape Estimation in a Vector-Quantized Latent SpacePoster8 citations
  733. WeConvene: Learned Image Compression with Wavelet-Domain Convolution and Entropy ModelPoster8 citations
  734. When Fast Fourier Transform Meets Transformer for Image RestorationPoster8 citations
  735. Where am I? Scene Retrieval with LanguagePoster8 citations
  736. WildRefer: 3D Object Localization in Large-scale Dynamic Scenes with Multi-modal Visual Data and Natural LanguagePoster8 citations
  737. ZeST: Zero-Shot Material Transfer from a Single ImagePoster8 citations
  738. "Close, But Not There: Boosting Geographic Distance Sensitivity in Visual Place Recognition"Poster7 citations
  739. "RICA^2: Rubric-Informed, Calibrated Assessment of Actions"Poster7 citations
  740. 3DEgo: 3D Editing on the Go!Poster7 citations
  741. 4Diff: 3D-Aware Diffusion Model for Third-to-First Viewpoint TranslationPoster7 citations
  742. Adapting Fine-Grained Cross-View Localization to Areas without Fine Ground TruthPoster7 citations
  743. Adaptive Multi-head Contrastive LearningPoster7 citations
  744. An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual RepresentationPoster7 citations
  745. Animal Avatars: Reconstructing Animatable 3D Animals from Casual VideosOral7 citations
  746. Bridge Past and Future: Overcoming Information Asymmetry in Incremental Object DetectionPoster7 citations
  747. CMTA: Cross-Modal Temporal Alignment for Event-guided Video DeblurringPoster7 citations
  748. CTRLorALTer: Conditional LoRAdapter for Efficient 0-Shot Control & Altering of T2I ModelsPoster7 citations
  749. CaesarNeRF: Calibrated Semantic Representation for Few-Shot Generalizable Neural RenderingPoster7 citations
  750. City-on-Web: Real-time Neural Rendering of Large-scale Scenes on the WebPoster7 citations
  751. Class-Agnostic Object Counting with Text-to-Image Diffusion ModelPoster7 citations
  752. Closed-Loop Unsupervised Representation Disentanglement with $\\beta$-VAE Distillation and Diffusion Probabilistic FeedbackPoster7 citations
  753. CoReS: Orchestrating the Dance of Reasoning and SegmentationPoster7 citations
  754. ConGeo: Robust Cross-view Geo-localization across Ground View VariationsPoster7 citations
  755. Continuous Memory Representation for Anomaly DetectionPoster7 citations
  756. Contrastive ground-level image and remote sensing pre-training improves representation learning for natural world imageryPoster7 citations
  757. ControlCap: Controllable Region-level CaptioningPoster7 citations
  758. CrossGLG: LLM Guides One-shot Skeleton-based 3D Action Recognition in a Cross-level MannerPoster7 citations
  759. DAMSDet: Dynamic Adaptive Multispectral Detection Transformer with Competitive Query Selection and Adaptive Feature FusionPoster7 citations
  760. DGR-MIL: Exploring Diverse Global Representation in Multiple Instance Learning for Whole Slide Image ClassificationPoster7 citations
  761. DIM: Dyadic Interaction Modeling for Social Behavior GenerationPoster7 citations
  762. DataDream: Few-shot Guided Dataset GenerationPoster7 citations
  763. DeTra: A Unified Model for Object Detection and Trajectory ForecastingPoster7 citations
  764. Dense Multimodal Alignment for Open-Vocabulary 3D Scene UnderstandingPoster7 citations
  765. DiffFAS: Face Anti-Spoofing via Generative Diffusion ModelsPoster7 citations
  766. Diffusion Models for Monocular Depth Estimation: Overcoming Challenging ConditionsPoster7 citations
  767. Dissolving Is Amplifying: Towards Fine-Grained Anomaly DetectionPoster7 citations
  768. DreamDissector: Learning Disentangled Text-to-3D Generation from 2D Diffusion PriorsPoster7 citations
  769. DreamMotion: Space-Time Self-Similar Score Distillation for Zero-Shot Video EditingPoster7 citations
  770. EgoPoseFormer: A Simple Baseline for Stereo Egocentric 3D Human Pose EstimationPoster7 citations
  771. EmoTalk3D: High-Fidelity Free-View Synthesis of Emotional 3D Talking HeadPoster7 citations
  772. Enhancing Perceptual Quality in Video Super-Resolution through Temporally-Consistent Detail Synthesis using Diffusion ModelsPoster7 citations
  773. EvSign: Sign Language Recognition and Translation with Streaming EventsPoster7 citations
  774. Event Camera Data Dense Pre-trainingPoster7 citations
  775. Explain via Any Concept: Concept Bottleneck Model with Open Vocabulary ConceptsPoster7 citations
  776. FRDiff : Feature Reuse for Universal Training-free Acceleration of Diffusion ModelsPoster7 citations
  777. Fast Context-Based Low-Light Image Enhancement via Neural Implicit RepresentationsPoster7 citations
  778. Forest2Seq: Revitalizing Order Prior for Sequential Indoor Scene SynthesisPoster7 citations
  779. GS-Pose: Category-Level Object Pose Estimation via Geometric and Semantic CorrespondencePoster7 citations
  780. GSD: View-Guided Gaussian Splatting Diffusion for 3D ReconstructionPoster7 citations
  781. GarmentCodeData: A Dataset of 3D Made-to-Measure Garments With Sewing PatternsPoster7 citations
  782. GenView: Enhancing View Quality with Pretrained Generative Model for Self-Supervised LearningPoster7 citations
  783. HUMOS: Human Motion Model Conditioned on Body ShapePoster7 citations
  784. IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth GenerationPoster7 citations
  785. Imaging Interiors: An Implicit Solution to Electromagnetic Inverse Scattering ProblemsPoster7 citations
  786. Improving Virtual Try-On with Garment-focused Diffusion ModelsPoster7 citations
  787. Improving Zero-shot Generalization of Learned Prompts via Unsupervised Knowledge DistillationPoster7 citations
  788. InsMapper: Exploring Inner-instance Information for Vectorized HD MappingPoster7 citations
  789. Kernel Diffusion: An Alternate Approach to Blind DeconvolutionPoster7 citations
  790. LEIA: Latent View-invariant Embeddings for Implicit 3D ArticulationPoster7 citations
  791. LPViT: Low-Power Semi-structured Pruning for Vision TransformersPoster7 citations
  792. LaPose: Laplacian Mixture Shape Modeling for RGB-Based Category-Level Object Pose EstimationPoster7 citations
  793. Latent Diffusion Prior Enhanced Deep Unfolding for Snapshot Spectral Compressive ImagingOral7 citations
  794. Learning Representations from Foundation Models for Domain Generalized Stereo MatchingPoster7 citations
  795. Learning Representations of Satellite Images From Metadata SupervisionPoster7 citations
  796. Length-Aware Motion Synthesis via Latent DiffusionPoster7 citations
  797. LiteSAM is Actually what you Need for segment EverythingPoster7 citations
  798. MAGR: Manifold-Aligned Graph Regularization for Continual Action Quality AssessmentOral7 citations
  799. MagDiff: Multi-Alignment Diffusion for High-Fidelity Video Generation and EditingPoster7 citations
  800. Missing Modality Prediction for Unpaired Multimodal Learning via Joint Embedding of Unimodal ModelsPoster7 citations
  801. Monocular Occupancy Prediction for Scalable Indoor ScenesPoster7 citations
  802. Multi-branch Collaborative Learning Network for 3D Visual GroundingPoster7 citations
  803. Navigation Instruction Generation with BEV Perception and Large Language ModelsPoster7 citations
  804. Nonverbal Interaction DetectionPoster7 citations
  805. OPEN: Object-wise Position Embedding for Multi-view 3D Object DetectionPoster7 citations
  806. OmniSSR: Zero-shot Omnidirectional Image Super-Resolution using Stable Diffusion ModelOral7 citations
  807. One-stage Prompt-based Continual LearningPoster7 citations
  808. OneVOS: Unifying Video Object Segmentation with All-in-One Transformer FrameworkPoster7 citations
  809. PixOOD: Pixel-Level Out-of-Distribution DetectionPoster7 citations
  810. PosFormer: Recognizing Complex Handwritten Mathematical Expression with Position Forest TransformerPoster7 citations
  811. Prompting Future Driven Diffusion Model for Hand Motion PredictionPoster7 citations
  812. Raindrop Clarity: A Dual-Focused Dataset for Day and Night Raindrop RemovalPoster7 citations
  813. ReLoo: Reconstructing Humans Dressed in Loose Garments from Monocular Video in the WildPoster7 citations
  814. Real-time Holistic Robot Pose Estimation with Unknown StatesPoster7 citations
  815. Ref-AVS: Refer and Segment Objects in Audio-Visual ScenesPoster7 citations
  816. Referring Atomic Video Action RecognitionPoster7 citations
  817. Reflective Instruction Tuning: Mitigating Hallucinations in Large Vision-Language ModelsPoster7 citations
  818. Region-Adaptive Transform with Segmentation Prior for Image CompressionPoster7 citations
  819. Reshaping the Online Data Buffering and Organizing Mechanism for Continual Test-Time AdaptationPoster7 citations
  820. Robust Calibration of Large Vision-Language AdaptersPoster7 citations
  821. Robust-Wide: Robust Watermarking against Instruction-driven Image EditingPoster7 citations
  822. SAGS: Structure-Aware 3D Gaussian SplattingPoster7 citations
  823. SLEDGE: Synthesizing Driving Environments with Generative Models and Rule-Based TrafficPoster7 citations
  824. ScanTalk: 3D Talking Heads from Unregistered ScansPoster7 citations
  825. Seeing the Unseen: A Frequency Prompt Guided Transformer for Image RestorationPoster7 citations
  826. Self-Adapting Large Visual-Language Models to Edge Devices across Visual ModalitiesPoster7 citations
  827. Self-Supervised Representation Learning for Adversarial Attack DetectionPoster7 citations
  828. Self-supervised visual learning from interactions with objectsPoster7 citations
  829. Skews in the Phenomenon Space Hinder Generalization in Text-to-Image GenerationPoster7 citations
  830. Source Prompt Disentangled Inversion for Boosting Image Editability with Diffusion ModelsPoster7 citations
  831. Stepping Stones: A Progressive Training Strategy for Audio-Visual Semantic SegmentationPoster7 citations
  832. StructLDM: Structured Latent Diffusion for 3D Human GenerationPoster7 citations
  833. Temporal-Mapping Photography for Event CamerasPoster7 citations
  834. Towards Real-world Event-guided Low-light Video Enhancement and DeblurringPoster7 citations
  835. TrackNeRF: Bundle Adjusting NeRF from Sparse and Noisy Views via Feature TracksPoster7 citations
  836. Training-Free Model Merging for Multi-target Domain AdaptationPoster7 citations
  837. VEON: Vocabulary-Enhanced Occupancy PredictionPoster7 citations
  838. Videoshop: Localized Semantic Video Editing with Noise-Extrapolated Diffusion InversionPoster7 citations
  839. Visible and Clear: Finding Tiny Objects in Difference MapPoster7 citations
  840. Visual Alignment Pre-training for Sign Language TranslationPoster7 citations
  841. When Pedestrian Detection Meets Multi-Modal Learning: Generalist Model and Benchmark DatasetPoster7 citations
  842. Within the Dynamic Context: Inertia-aware 3D Human Modeling with Pose SequencePoster7 citations
  843. You Only Learn One Query: Learning Unified Human Query for Single-Stage Multi-Person Multi-Task Human-Centric PerceptionPoster7 citations
  844. iMatching: Imperative Correspondence LearningPoster7 citations
  845. ∞-Brush: Controllable Large Image Synthesis with Diffusion Models in Infinite DimensionsPoster7 citations
  846. "ByteEdit: Boost, Comply and Accelerate Generative Image Editing"Poster6 citations
  847. A Simple Latent Diffusion Approach for Panoptic Segmentation and Mask InpaintingPoster6 citations
  848. AFF-ttention! Affordances and Attention models for Short-Term Object Interaction AnticipationPoster6 citations
  849. Accelerating Online Mapping and Behavior Prediction via Direct BEV Feature AttentionPoster6 citations
  850. Action2Sound: Ambient-Aware Generation of Action Sounds from Egocentric VideosOral6 citations
  851. Active Generation for Image ClassificationPoster6 citations
  852. Adaptive Compressed Sensing with Diffusion-Based Posterior SamplingPoster6 citations
  853. An Efficient and Effective Transformer Decoder-Based Framework for Multi-Task Visual GroundingPoster6 citations
  854. AttnZero: Efficient Attention Discovery for Vision TransformersPoster6 citations
  855. BeNeRF:Neural Radiance Fields from a Single Blurry Image and Event StreamPoster6 citations
  856. Betrayed by Attention: A Simple yet Effective Approach for Self-supervised Video Object SegmentationPoster6 citations
  857. Beyond MOT: Semantic Multi-Object TrackingPoster6 citations
  858. Beyond Pixels: Semi-Supervised Semantic Segmentation with a Multi-scale Patch-based Multi-Label ClassifierPoster6 citations
  859. Bridging Synthetic and Real Worlds for Pre-training Scene Text DetectorsPoster6 citations
  860. C2C: Component-to-Composition Learning for Zero-Shot Compositional Action RecognitionOral6 citations
  861. CAT-SAM: Conditional Tuning for Few-Shot Adaptation of Segment Anything ModelOral6 citations
  862. COHO: Context-Sensitive City-Scale Hierarchical Urban Layout GenerationOral6 citations
  863. CVT-Occ: Cost Volume Temporal Fusion for 3D Occupancy PredictionPoster6 citations
  864. CadVLM: Bridging Language and Vision in the Generation of Parametric CAD SketchesPoster6 citations
  865. Category Adaptation Meets Projected Distillation in Generalized Continual Category DiscoveryPoster6 citations
  866. ChEX: Interactive Localization and Region Description in Chest X-raysPoster6 citations
  867. ColorPeel: Color Prompt Learning with Diffusion Models via Color and Shape DisentanglementPoster6 citations
  868. Compress3D: a Compressed Latent Space for 3D Generation from a Single ImagePoster6 citations
  869. Crowd-SAM:SAM as a smart annotator for object detection in crowded scenesPoster6 citations
  870. DIAL: Dense Image-text ALignment for Weakly Supervised Semantic SegmentationPoster6 citations
  871. Dataset Quantization with Active Learning based Adaptive SamplingPoster6 citations
  872. DeCo: Decoupled Human-Centered Diffusion Video Editing with Motion ConsistencyPoster6 citations
  873. Deblur e-NeRF: NeRF from Motion-Blurred Events under High-speed or Low-light ConditionsPoster6 citations
  874. Diff3DETR: Agent-based Diffusion Model for Semi-supervised 3D Object DetectionPoster6 citations
  875. Direct Distillation between Different DomainsPoster6 citations
  876. Domain Shifting: A Generalized Solution for Heterogeneous Cross-Modality Person Re-IdentificationPoster6 citations
  877. DreamMesh: Jointly Manipulating and Texturing Triangle Meshes for Text-to-3D GenerationPoster6 citations
  878. DreamMover: Leveraging the Prior of Diffusion Models for Image Interpolation with Large MotionPoster6 citations
  879. EDformer: Transformer-Based Event Denoising Across Varied Noise LevelsPoster6 citations
  880. Efficient Diffusion-Driven Corruption Editor for Test-Time AdaptationPoster6 citations
  881. Eliminating Feature Ambiguity for Few-Shot SegmentationPoster6 citations
  882. Elucidating the Hierarchical Nature of Behavior with Masked AutoencodersPoster6 citations
  883. Event-Adapted Video Super-ResolutionPoster6 citations
  884. Every Pixel Has its Moments: Ultra-High-Resolution Unpaired Image-to-Image Translation via Dense NormalizationPoster6 citations
  885. Explicitly Guided Information Interaction Network for Cross-modal Point Cloud CompletionPoster6 citations
  886. External Knowledge Enhanced 3D Scene Generation from SketchPoster6 citations
  887. FSD-BEV: Foreground Self-Distillation for Multi-view 3D Object DetectionPoster6 citations
  888. Foster Adaptivity and Balance in Learning with Noisy LabelsPoster6 citations
  889. Free-VSC: Free Semantics from Visual Foundation Models for Unsupervised Video Semantic CompressionPoster6 citations
  890. FroSSL: Frobenius Norm Minimization for Efficient Multiview Self-Supervised LearningPoster6 citations
  891. GaussReg: Fast 3D Registration with Gaussian SplattingPoster6 citations
  892. Geospecific View Generation - Geometry-Context Aware High-resolution Ground View Inference from Satellite ViewsOral6 citations
  893. Good Teachers Explain: Explanation-Enhanced Knowledge DistillationPoster6 citations
  894. Graph Neural Network Causal Explanation via Neural Causal ModelsPoster6 citations
  895. Guide-and-Rescale: Self-Guidance Mechanism for Effective Tuning-Free Real Image EditingPoster6 citations
  896. Hiding Imperceptible Noise in Curvature-Aware Patches for 3D Point Cloud AttackPoster6 citations
  897. Image Compression for Machine and Human Vision With Spatial-Frequency AdaptationPoster6 citations
  898. Improving Agent Behaviors with RL Fine-tuning for Autonomous DrivingPoster6 citations
  899. Improving Feature Stability during Upsampling -- Spectral Artifacts and the Importance of Spatial ContextPoster6 citations
  900. Improving Robustness to Model Inversion Attacks via Sparse Coding ArchitecturesPoster6 citations
  901. Insect Identification in the Wild: The AMI DatasetOral6 citations
  902. LayoutFlow: Flow Matching for Layout GenerationPoster6 citations
  903. Leveraging Hierarchical Feature Sharing for Efficient Dataset CondensationPoster6 citations
  904. Lost and Found: Overcoming Detector Failures in Online Multi-Object TrackingPoster6 citations
  905. Mono-ViFI: A Unified Learning Framework for Self-supervised Single- and Multi-frame Monocular Depth EstimationPoster6 citations
  906. Motion Aware Event Representation-driven Image DeblurringPoster6 citations
  907. Multi-modal Crowd Counting via a Broker ModalityPoster6 citations
  908. Multimodal Cross-Domain Few-Shot Learning for Egocentric Action RecognitionPoster6 citations
  909. Neural Spectral Decomposition for Dataset DistillationPoster6 citations
  910. Non-Exemplar Domain Incremental Learning via Cross-Domain Concept IntegrationPoster6 citations
  911. O2V-Mapping: Online Open-Vocabulary Mapping with Neural Implicit RepresentationPoster6 citations
  912. Open-Set Recognition in the Age of Vision-Language ModelsPoster6 citations
  913. OpenPSG: Open-set Panoptic Scene Graph Generation via Large Multimodal ModelsPoster6 citations
  914. Optimizing Diffusion Models for Joint Trajectory Prediction and Controllable GenerationPoster6 citations
  915. PARE-Net: Position-Aware Rotation-Equivariant Networks for Robust Point Cloud RegistrationPoster6 citations
  916. PanoVOS: Bridging Non-panoramic and Panoramic Views with Transformer for Video SegmentationPoster6 citations
  917. PatchRefiner: Leveraging Synthetic Data for Real-Domain High-Resolution Monocular Metric Depth EstimationPoster6 citations
  918. Photorealistic Object Insertion with Diffusion-Guided Inverse RenderingPoster6 citations
  919. Pix2Gif: Motion-Guided Diffusion for GIF GenerationPoster6 citations
  920. ProTIP: Probabilistic Robustness Verification on Text-to-Image Diffusion Models against Stochastic PerturbationPoster6 citations
  921. Prompt-Driven Contrastive Learning for Transferable Adversarial AttacksOral6 citations
  922. Realistic Human Motion Generation with Cross-Diffusion ModelsPoster6 citations
  923. Reliable Spatial-Temporal Voxels For Multi-Modal Test-Time AdaptationPoster6 citations
  924. Representing Topological Self-Similarity Using Fractal Feature Maps for Accurate Segmentation of Tubular StructuresPoster6 citations
  925. Restore Anything with Masks: Leveraging Mask Image Modeling for Blind All-in-One Image RestorationPoster6 citations
  926. Rethinking Few-shot Class-incremental Learning: Learning from YourselfPoster6 citations
  927. Rethinking Video Deblurring with Wavelet-Aware Dynamic Transformer and Diffusion ModelPoster6 citations
  928. Revisiting Supervision for Continual Representation LearningPoster6 citations
  929. SAMFusion: Sensor-Adaptive Multimodal Fusion for 3D Object Detection in Adverse WeatherPoster6 citations
  930. SAVE: Protagonist Diversification with Structure Agnostic Video EditingPoster6 citations
  931. SFPNet: Sparse Focal Point Network for Semantic Segmentation on General LiDAR Point CloudsPoster6 citations
  932. SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer LearningPoster6 citations
  933. SUMix: Mixup with Semantic and Uncertain InformationPoster6 citations
  934. ScatterFormer: Efficient Voxel Transformer with Scattered Linear AttentionPoster6 citations
  935. SceneGraphLoc: Cross-Modal Coarse Visual Localization on 3D Scene GraphsPoster6 citations
  936. Score Distillation Sampling with Learned Manifold CorrectivePoster6 citations
  937. Semi-Supervised Teacher-Reference-Student Architecture for Action Quality AssessmentPoster6 citations
  938. Shape2Scene: 3D Scene Representation Learning Through Pre-training on Shape DataPoster6 citations
  939. Soft Prompt Generation for Domain GeneralizationPoster6 citations
  940. SparseCraft: Few-Shot Neural Reconstruction through Stereopsis Guided Geometric LinearizationPoster6 citations
  941. Synergy of Sight and Semantics: Visual Intention Understanding with CLIPPoster6 citations
  942. TCAN: Animating Human Images with Temporally Consistent Pose Guidance using Diffusion ModelsPoster6 citations
  943. Tackling Structural Hallucination in Image Translation with Local DiffusionOral6 citations
  944. Teddy: Efficient Large-Scale Dataset Distillation via Taylor-Approximated MatchingPoster6 citations
  945. Towards Latent Masked Image Modeling for Self-Supervised Visual Representation LearningPoster6 citations
  946. Track Everything Everywhere Fast and RobustlyPoster6 citations
  947. Training-free Video Temporal Grounding using Large-scale Pre-trained ModelsPoster6 citations
  948. TransCAD: A Hierarchical Transformer for CAD Sequence Inference from Point CloudsPoster6 citations
  949. Tri^{2}-plane: Thinking Head Avatar via Feature PyramidPoster6 citations
  950. UNIC: Universal Classification Models via Multi-teacher DistillationPoster6 citations
  951. Unified Medical Image Pre-training in Language-Guided Common Semantic SpacePoster6 citations
  952. UpFusion: Novel View Diffusion from Unposed Sparse View ObservationsPoster6 citations
  953. VEGS: View Extrapolation of Urban Scenes in 3D Gaussian Splatting using Learned PriorsPoster6 citations
  954. Vision-Language Action Knowledge Learning for Semantic-Aware Action Quality AssessmentPoster6 citations
  955. VisionLLaMA: A Unified LLaMA Backbone for Vision TasksPoster6 citations
  956. Volumetric Rendering with Baked Quadrature FieldsPoster6 citations
  957. "Clearer Frames, Anytime: Resolving Velocity Ambiguity in Video Frame Interpolation"Oral5 citations
  958. 3D Single-object Tracking in Point Clouds with High Temporal VariationPoster5 citations
  959. A Simple Background Augmentation Method for Object Detection with Diffusion ModelPoster5 citations
  960. AMES: Asymmetric and Memory-Efficient Similarity Estimation for Instance-level RetrievalPoster5 citations
  961. ARoFace: Alignment Robustness to Improve Low-quality Face RecognitionPoster5 citations
  962. AdaDistill: Adaptive Knowledge Distillation for Deep Face RecognitionPoster5 citations
  963. AdaNAT: Exploring Adaptive Policy for Token-Based Image GenerationPoster5 citations
  964. AnatoMask: Enhancing Medical Image Segmentation with Reconstruction-guided Self-maskingPoster5 citations
  965. Asymmetric Mask Scheme for Self-Supervised Real Image DenoisingPoster5 citations
  966. Attention Beats Linear for Fast Implicit Neural Representation GenerationPoster5 citations
  967. Audio-visual Generalized Zero-shot Learning the Easy WayPoster5 citations
  968. Beat-It: Beat-Synchronized Multi-Condition 3D Dance GenerationOral5 citations
  969. Bidirectional Progressive Transformer for Interaction Intention AnticipationPoster5 citations
  970. Bottom-Up Domain Prompt Tuning for Generalized Face Anti-SpoofingPoster5 citations
  971. Brain-ID: Learning Contrast-agnostic Anatomical Representations for Brain ImagingPoster5 citations
  972. CLAP: Isolating Content from Style through Contrastive Learning with Augmented PromptsPoster5 citations
  973. CLIFF: Continual Latent Diffusion for Open-Vocabulary Object DetectionOral5 citations
  974. CLIP-Guided Generative Networks for Transferable Targeted Adversarial AttacksPoster5 citations
  975. Can Textual Semantics Mitigate Sounding Object Segmentation Preference?Poster5 citations
  976. Causality-inspired Discriminative Feature Learning in Triple Domains for Gait RecognitionPoster5 citations
  977. Certifiably Robust Image WatermarkPoster5 citations
  978. CloudFixer: Test-Time Adaptation for 3D Point Clouds via Diffusion-Guided Geometric TransformationPoster5 citations
  979. Co-synthesis of Histopathology Nuclei Image-Label Pairs using a Context-Conditioned Joint Diffusion ModelPoster5 citations
  980. CoSIGN: Few-Step Guidance of ConSIstency Model to Solve General INverse ProblemsPoster5 citations
  981. ConDense: Consistent 2D-3D Pre-training for Dense and Sparse Features from Multi-View ImagesOral5 citations
  982. Cross-Platform Video Person ReID: A New Benchmark Dataset and Adaptation ApproachPoster5 citations
  983. DA-BEV: Unsupervised Domain Adaptation for Bird's Eye View PerceptionPoster5 citations
  984. DIFFender: Diffusion-Based Adversarial Defense against Patch AttacksPoster5 citations
  985. Diagnosing and Re-learning for Balanced Multimodal LearningPoster5 citations
  986. DiffusionPen: Towards Controlling the Style of Handwritten Text GenerationPoster5 citations
  987. Distill Gold from Massive Ores: Bi-level Data Pruning towards Efficient Dataset DistillationPoster5 citations
  988. Dual-level Adaptive Self-Labeling for Novel Class Discovery in Point Cloud SegmentationPoster5 citations
  989. DySeT: a Dynamic Masked Self-distillation Approach for Robust Trajectory PredictionPoster5 citations
  990. E3M: Zero-Shot Spatio-Temporal Video Grounding with Expectation-Maximization Multimodal ModulationOral5 citations
  991. Efficient Vision Transformers with Partial AttentionPoster5 citations
  992. Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RLPoster5 citations
  993. Enhancing Cross-Subject fMRI-to-Video Decoding with Global-Local Functional AlignmentPoster5 citations
  994. Enhancing Source-Free Domain Adaptive Object Detection with Low-confidence Pseudo Label DistillationPoster5 citations
  995. Exploiting Semantic Reconstruction to Mitigate Hallucinations in Vision-Language ModelsPoster5 citations
  996. FLAT: Flux-aware Imperceptible Adversarial Attacks on 3D Point CloudsPoster5 citations
  997. Fast Training of Diffusion Transformer with Extreme Masking for 3D Point Clouds GenerationPoster5 citations
  998. Few-shot NeRF by Adaptive Rendering Loss RegularizationPoster5 citations
  999. FinePseudo: Improving Pseudo-Labelling through Temporal-Alignablity for Semi-Supervised Fine-Grained Action RecognitionPoster5 citations
  1000. FisherRF: Active View Selection and Mapping with Radiance Fields using Fisher InformationOral5 citations

ECCV accepted papers in other years

Looking for submission deadlines instead? See the conference deadline calendar.

ECCV 2024 Accepted Papers · Full List of 2,385 Papers