← All conferences

CVPR 2024 Accepted Papers

The full list of 2,640 papers accepted at CVPR 2024 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Poster: 2,323Highlight: 317
  1. Improved Baselines with Visual Instruction TuningHighlight2,339 citations
  2. DETRs Beat YOLOs on Real-time Object DetectionPoster1,573 citations
  3. Depth Anything: Unleashing the Power of Large-Scale Unlabeled DataPoster858 citations
  4. MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGIPoster765 citations
  5. 4D Gaussian Splatting for Real-Time Dynamic Scene RenderingPoster586 citations
  6. LISA: Reasoning Segmentation via Large Language ModelPoster498 citations
  7. mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality CollaborationHighlight425 citations
  8. MVBench: A Comprehensive Multi-modal Video Understanding BenchmarkHighlight415 citations
  9. Wonder3D: Single Image to 3D using Cross-Domain DiffusionHighlight414 citations
  10. VILA: On Pre-training for Visual Language ModelsPoster401 citations
  11. Deformable 3D Gaussians for High-Fidelity Monocular Dynamic Scene ReconstructionPoster385 citations
  12. Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character AnimationPoster375 citations
  13. Repurposing Diffusion-Based Image Generators for Monocular Depth EstimationPoster368 citations
  14. SuGaR: Surface-Aligned Gaussian Splatting for Efficient 3D Mesh Reconstruction and High-Quality Mesh RenderingPoster368 citations
  15. VBench: Comprehensive Benchmark Suite for Video Generative ModelsHighlight348 citations
  16. Mip-Splatting: Alias-free 3D Gaussian SplattingPoster345 citations
  17. YOLO-World: Real-Time Open-Vocabulary Object DetectionPoster334 citations
  18. CogAgent: A Visual Language Model for GUI AgentsHighlight326 citations
  19. Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMsPoster320 citations
  20. DUSt3R: Geometric 3D Vision Made EasyPoster316 citations
  21. RepViT: Revisiting Mobile CNN From ViT PerspectivePoster309 citations
  22. Gaussian Splatting SLAMHighlight307 citations
  23. Point Transformer V3: Simpler Faster StrongerPoster288 citations
  24. SplaTAM: Splat Track & Map 3D Gaussians for Dense RGB-D SLAMPoster276 citations
  25. Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal ModelsHighlight273 citations
  26. InstantBooth: Personalized Text-to-Image Generation without Test-Time FinetuningPoster272 citations
  27. MovieChat: From Dense Token to Sparse Memory for Long Video UnderstandingPoster269 citations
  28. AnyDoor: Zero-shot Object-level Image CustomizationPoster268 citations
  29. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic TasksPoster265 citations
  30. Generative Multimodal Models are In-Context LearnersPoster261 citations
  31. VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion ModelsPoster256 citations
  32. Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video UnderstandingHighlight251 citations
  33. Symphonize 3D Semantic Scene Completion with Contextual Instance QueriesPoster243 citations
  34. HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language ModelsPoster236 citations
  35. pixelSplat: 3D Gaussian Splats from Image Pairs for Scalable Generalizable 3D ReconstructionPoster232 citations
  36. Text-to-3D using Gaussian SplattingPoster231 citations
  37. RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human FeedbackPoster222 citations
  38. GLaMM: Pixel Grounding Large Multimodal ModelPoster219 citations
  39. GS-SLAM: Dense Visual SLAM with 3D Gaussian SplattingHighlight216 citations
  40. Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive DecodingHighlight211 citations
  41. DragDiffusion: Harnessing Diffusion Models for Interactive Point-based Image EditingHighlight208 citations
  42. Diffusion Model Alignment Using Direct Preference OptimizationPoster205 citations
  43. MagicAnimate: Temporally Consistent Human Image Animation using Diffusion ModelPoster203 citations
  44. Video-P2P: Video Editing with Cross-attention ControlPoster202 citations
  45. One-step Diffusion with Distribution Matching DistillationPoster201 citations
  46. SEED-Bench: Benchmarking Multimodal Large Language ModelsPoster200 citations
  47. InceptionNeXt: When Inception Meets ConvNeXtPoster199 citations
  48. One-2-3-45++: Fast Single Image to 3D Objects with Consistent Multi-View Generation and 3D DiffusionPoster199 citations
  49. SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning CapabilitiesPoster198 citations
  50. Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person PerspectivesPoster197 citations
  51. Splatter Image: Ultra-Fast Single-View 3D ReconstructionPoster194 citations
  52. PhotoMaker: Customizing Realistic Human Photos via Stacked ID EmbeddingPoster193 citations
  53. TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video UnderstandingPoster192 citations
  54. UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio Video Point Cloud Time-Series and Image RecognitionPoster192 citations
  55. HyperDreamBooth: HyperNetworks for Fast Personalization of Text-to-Image ModelsPoster191 citations
  56. LangSplat: 3D Language Gaussian SplattingHighlight191 citations
  57. Compact 3D Gaussian Representation for Radiance FieldHighlight190 citations
  58. Panda-70M: Captioning 70M Videos with Multiple Cross-Modality TeachersPoster190 citations
  59. DrivingGaussian: Composite Gaussian Splatting for Surrounding Dynamic Autonomous Driving ScenesPoster189 citations
  60. Sequential Modeling Enables Scalable Learning for Large Vision ModelsPoster189 citations
  61. GaussianEditor: Swift and Controllable 3D Editing with Gaussian SplattingPoster187 citations
  62. OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-AllocationHighlight186 citations
  63. PhysGaussian: Physics-Integrated 3D Gaussians for Generative DynamicsHighlight178 citations
  64. Triplane Meets Gaussian Splatting: Fast and Generalizable Single-View 3D Reconstruction with TransformersPoster175 citations
  65. EfficientSAM: Leveraged Masked Image Pretraining for Efficient Segment AnythingHighlight168 citations
  66. FoundationPose: Unified 6D Pose Estimation and Tracking of Novel ObjectsHighlight167 citations
  67. Rewrite the StarsPoster166 citations
  68. GaussianAvatars: Photorealistic Head Avatars with Rigged 3D GaussiansHighlight161 citations
  69. Feature 3DGS: Supercharging 3D Gaussian Splatting to Enable Distilled Feature FieldsHighlight160 citations
  70. LucidDreamer: Towards High-Fidelity Text-to-3D Generation via Interval Score MatchingHighlight158 citations
  71. Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision Language Audio and ActionHighlight157 citations
  72. Florence-2: Advancing a Unified Representation for a Variety of Vision TasksPoster156 citations
  73. SC-GS: Sparse-Controlled Gaussian Splatting for Editable Dynamic ScenesPoster156 citations
  74. GeoChat: Grounded Large Vision-Language Model for Remote SensingPoster154 citations
  75. Spacetime Gaussian Feature Splatting for Real-Time Dynamic View SynthesisPoster153 citations
  76. ReconFusion: 3D Reconstruction with Diffusion PriorsPoster151 citations
  77. FreeU: Free Lunch in Diffusion U-NetPoster148 citations
  78. LMDrive: Closed-Loop End-to-End Driving with Large Language ModelsPoster148 citations
  79. Analyzing and Improving the Training Dynamics of Diffusion ModelsPoster146 citations
  80. Poly Kernel Inception Network for Remote Sensing DetectionPoster145 citations
  81. DreamAvatar: Text-and-Shape Guided 3D Human Avatar Generation via Diffusion ModelsPoster140 citations
  82. SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation ImageryPoster140 citations
  83. DeepCache: Accelerating Diffusion Models for FreePoster139 citations
  84. RoMa: Robust Dense Feature MatchingPoster139 citations
  85. Honeybee: Locality-enhanced Projector for Multimodal LLMHighlight138 citations
  86. UniDepth: Universal Monocular Metric Depth EstimationHighlight135 citations
  87. Rethinking FID: Towards a Better Evaluation Metric for Image GenerationHighlight130 citations
  88. An Edit Friendly DDPM Noise Space: Inversion and ManipulationsPoster129 citations
  89. Compressed 3D Gaussian Splatting for Accelerated Novel View SynthesisPoster128 citations
  90. SeeSR: Towards Semantics-Aware Real-World Image Super-ResolutionPoster128 citations
  91. EvalCrafter: Benchmarking and Evaluating Large Video Generation ModelsPoster126 citations
  92. MoMask: Generative Masked Modeling of 3D Human MotionsPoster125 citations
  93. ULIP-2: Towards Scalable Multimodal Pre-training for 3D UnderstandingPoster125 citations
  94. COLMAP-Free 3D Gaussian SplattingHighlight124 citations
  95. Emu Edit: Precise Image Editing via Recognition and Generation TasksHighlight124 citations
  96. MeshGPT: Generating Triangle Meshes with Decoder-Only TransformersHighlight124 citations
  97. OneLLM: One Framework to Align All Modalities with LanguagePoster124 citations
  98. 3DGS-Avatar: Animatable Avatars via Deformable 3D Gaussian SplattingPoster123 citations
  99. VTimeLLM: Empower LLM to Grasp Video MomentsHighlight123 citations
  100. HIVE: Harnessing Human Feedback for Instructional Visual EditingPoster119 citations
  101. GPS-Gaussian: Generalizable Pixel-wise 3D Gaussian Splatting for Real-time Human Novel View SynthesisHighlight118 citations
  102. OpenEQA: Embodied Question Answering in the Era of Foundation ModelsPoster118 citations
  103. Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous DrivingPoster117 citations
  104. GaussianAvatar: Towards Realistic Human Avatar Modeling from a Single Video via Animatable 3D GaussiansPoster117 citations
  105. GaussianDreamer: Fast Generation from Text to 3D Gaussians by Bridging 2D and 3D Diffusion ModelsPoster116 citations
  106. VastGaussian: Vast 3D Gaussians for Large Scene ReconstructionPoster116 citations
  107. V?: Guided Visual Search as a Core Mechanism in Multimodal LLMsPoster114 citations
  108. Logit Standardization in Knowledge DistillationHighlight113 citations
  109. DNGaussian: Optimizing Sparse-View 3D Gaussian Radiance Fields with Global-Local Depth NormalizationPoster112 citations
  110. Gaussian Head Avatar: Ultra High-fidelity Head Avatar via Dynamic GaussiansPoster112 citations
  111. HUGS: Human Gaussian SplatsPoster112 citations
  112. TransNeXt: Robust Foveal Visual Perception for Vision TransformersPoster111 citations
  113. Align Your Gaussians: Text-to-4D with Dynamic 3D Gaussians and Composed Diffusion ModelsHighlight110 citations
  114. CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic SegmentationHighlight110 citations
  115. GauHuman: Articulated Gaussian Splatting from Monocular Human VideosPoster110 citations
  116. Animatable Gaussians: Learning Pose-dependent Gaussian Maps for High-fidelity Human Avatar ModelingPoster109 citations
  117. InstructDiffusion: A Generalist Modeling Interface for Vision TasksPoster109 citations
  118. ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual PromptsPoster106 citations
  119. A Dual-Augmentor Framework for Domain Generalization in 3D Human Pose EstimationPoster105 citations
  120. GaussianEditor: Editing 3D Gaussians Delicately with Text InstructionsPoster105 citations
  121. Grounded Text-to-Image Synthesis with Attention RefocusingPoster105 citations
  122. DreamVideo: Composing Your Dream Videos with Customized Subject and MotionPoster104 citations
  123. Style Aligned Image Generation via Shared AttentionPoster104 citations
  124. MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video UnderstandingPoster103 citations
  125. Reconstructing Hands in 3D with TransformersPoster103 citations
  126. Make Pixels Dance: High-Dynamic Video GenerationPoster102 citations
  127. RMT: Retentive Networks Meet Vision TransformersPoster102 citations
  128. 4D-fy: Text-to-4D Generation Using Hybrid Score Distillation SamplingPoster101 citations
  129. Photo-SLAM: Real-time Simultaneous Localization and Photorealistic Mapping for Monocular Stereo and RGB-D CamerasPoster101 citations
  130. Style Injection in Diffusion: A Training-free Approach for Adapting Large-scale Diffusion Models for Style TransferHighlight100 citations
  131. DiffuScene: Denoising Diffusion Models for Generative Indoor Scene SynthesisPoster99 citations
  132. Gaussian-Flow: 4D Reconstruction with Dynamic 3D Gaussian ParticleHighlight99 citations
  133. UFOGen: You Forward Once Large Scale Text-to-Image Generation via Diffusion GANsHighlight99 citations
  134. Hallucination Augmented Contrastive Learning for Multimodal Large Language ModelPoster98 citations
  135. Putting the Object Back into Video Object SegmentationHighlight98 citations
  136. Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts AdaptersPoster97 citations
  137. Compositional Chain-of-Thought Prompting for Large Multimodal ModelsPoster96 citations
  138. Rich Human Feedback for Text-to-Image GenerationPoster95 citations
  139. GART: Gaussian Articulated Template ModelsHighlight94 citations
  140. Relightable Gaussian Codec AvatarsPoster94 citations
  141. SinSR: Diffusion-Based Image Super-Resolution in a Single StepPoster94 citations
  142. HumanGaussian: Text-Driven 3D Human Generation with Gaussian SplattingHighlight91 citations
  143. ZeroNVS: Zero-Shot 360-Degree View Synthesis from a Single ImagePoster90 citations
  144. GS-IR: 3D Gaussian Splatting for Inverse RenderingPoster89 citations
  145. BioCLIP: A Vision Foundation Model for the Tree of LifePoster88 citations
  146. Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision ApplicationsHighlight88 citations
  147. LL3DA: Visual Interactive Instruction Tuning for Omni-3D Understanding Reasoning and PlanningPoster88 citations
  148. Osprey: Pixel Understanding with Visual Instruction TuningPoster88 citations
  149. RichDreamer: A Generalizable Normal-Depth Diffusion Model for Detail Richness in Text-to-3DHighlight88 citations
  150. CoDeF: Content Deformation Fields for Temporally Consistent Video ProcessingHighlight87 citations
  151. Q-Instruct: Improving Low-level Visual Abilities for Multi-modality Foundation ModelsPoster87 citations
  152. DisCo: Disentangled Control for Realistic Human Dance GenerationPoster86 citations
  153. GPT-4V(ision) is a Human-Aligned Evaluator for Text-to-3D GenerationPoster86 citations
  154. SplattingAvatar: Realistic Real-Time Human Avatars with Mesh-Embedded Gaussian SplattingPoster86 citations
  155. DL3DV-10K: A Large-Scale Scene Dataset for Deep Learning-based 3D VisionPoster85 citations
  156. PixelLM: Pixel Reasoning with Large Multimodal ModelPoster84 citations
  157. Expandable Subspace Ensemble for Pre-Trained Model-Based Class-Incremental LearningPoster83 citations
  158. Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving?Poster83 citations
  159. Probing the 3D Awareness of Visual Foundation ModelsPoster83 citations
  160. SimDA: Simple Diffusion Adapter for Efficient Video GenerationPoster83 citations
  161. PanoOcc: Unified Occupancy Representation for Camera-based 3D Panoptic SegmentationPoster82 citations
  162. InstanceDiffusion: Instance-level Control for Image GenerationPoster81 citations
  163. Holodeck: Language Guided Generation of 3D Embodied AI EnvironmentsPoster80 citations
  164. Language Embedded 3D Gaussians for Open-Vocabulary Scene UnderstandingPoster80 citations
  165. CPR: Retrieval Augmented Generation for Copyright ProtectionPoster79 citations
  166. SelfOcc: Self-Supervised Vision-Based 3D Occupancy PredictionPoster79 citations
  167. HumanNorm: Learning Normal Diffusion Model for High-quality and Realistic 3D Human GenerationPoster78 citations
  168. SmartEdit: Exploring Complex Instruction-based Image Editing with Multimodal Large Language ModelsHighlight77 citations
  169. Multi-Scale 3D Gaussian Splatting for Anti-Aliased RenderingPoster76 citations
  170. OneFormer3D: One Transformer for Unified Point Cloud SegmentationPoster76 citations
  171. LEDITS++: Limitless Image Editing using Text-to-Image ModelsPoster75 citations
  172. MACE: Mass Concept Erasure in Diffusion ModelsPoster75 citations
  173. Optimal Transport Aggregation for Visual Place RecognitionPoster75 citations
  174. Using Human Feedback to Fine-tune Diffusion Models without Any Reward ModelPoster75 citations
  175. WHAM: Reconstructing World-grounded Humans with Accurate 3D MotionPoster75 citations
  176. 3DGStream: On-the-Fly Training of 3D Gaussians for Efficient Streaming of Photo-Realistic Free-Viewpoint VideosHighlight74 citations
  177. Equivariant Multi-Modality Image FusionPoster74 citations
  178. VGGSfM: Visual Geometry Grounded Deep Structure From MotionHighlight74 citations
  179. GenTron: Diffusion Transformers for Image and Video GenerationPoster73 citations
  180. Generative Image DynamicsPoster73 citations
  181. HalluciDoctor: Mitigating Hallucinatory Toxicity in Visual Instruction DataPoster73 citations
  182. Scaling Laws of Synthetic Images for Model Training ... for NowPoster73 citations
  183. ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense PredictionsHighlight73 citations
  184. MIGC: Multi-Instance Generation Controller for Text-to-Image SynthesisHighlight72 citations
  185. Multi-Modal Hallucination Control by Visual Information GroundingPoster72 citations
  186. Diffuse Attend and Segment: Unsupervised Zero-Shot Segmentation using Stable DiffusionPoster71 citations
  187. Human Gaussian Splatting: Real-time Rendering of Animatable AvatarsPoster71 citations
  188. Wavelet-based Fourier Information Interaction with Frequency Diffusion Adjustment for Underwater Image RestorationPoster70 citations
  189. BadCLIP: Dual-Embedding Guided Backdoor Attack on Multimodal Contrastive LearningHighlight69 citations
  190. Diffusion Models Without AttentionPoster69 citations
  191. Editable Scene Simulation for Autonomous Driving via Collaborative LLM-AgentsHighlight69 citations
  192. RealNet: A Feature Selection Network with Realistic Synthetic Anomaly for Anomaly DetectionPoster69 citations
  193. DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language FeedbackPoster68 citations
  194. MMA-Diffusion: MultiModal Attack on Diffusion ModelsPoster68 citations
  195. RegionPLC: Regional Point-Language Contrastive Learning for Open-World 3D Scene UnderstandingPoster68 citations
  196. PLGSLAM: Progressive Neural Scene Represenation with Local to Global Bundle AdjustmentPoster67 citations
  197. Transcending Forgery Specificity with Latent Space Augmentation for Generalizable Deepfake DetectionPoster67 citations
  198. VideoBooth: Diffusion-based Video Generation with Image PromptsPoster67 citations
  199. EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AIPoster66 citations
  200. Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video SynthesisHighlight66 citations
  201. Bayes' Rays: Uncertainty Quantification for Neural Radiance FieldsHighlight65 citations
  202. ASH: Animatable Gaussian Splats for Efficient and Photoreal Human RenderingPoster64 citations
  203. Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMsPoster64 citations
  204. EMCAD: Efficient Multi-scale Convolutional Attention Decoding for Medical Image SegmentationPoster64 citations
  205. GSVA: Generalized Segmentation via Multimodal Large Language ModelsPoster64 citations
  206. Neural Video Compression with Feature ModulationPoster64 citations
  207. Can I Trust Your Answer? Visually Grounded Video Question AnsweringHighlight63 citations
  208. OMG-Seg: Is One Model Good Enough For All Segmentation?Poster63 citations
  209. OneTracker: Unifying Visual Object Tracking with Foundation Models and Efficient TuningHighlight62 citations
  210. Generalized Predictive Model for Autonomous DrivingHighlight61 citations
  211. Modeling Dense Multimodal Interactions Between Biological Pathways and Histology for Survival PredictionPoster61 citations
  212. NeuRAD: Neural Rendering for Autonomous DrivingHighlight61 citations
  213. SAM-6D: Segment Anything Model Meets Zero-Shot 6D Object Pose EstimationPoster61 citations
  214. Text-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image FusionPoster61 citations
  215. LION: Empowering Multimodal Large Language Model with Dual-Level Visual KnowledgePoster60 citations
  216. HUGS: Holistic Urban 3D Scene Understanding via Gaussian SplattingPoster59 citations
  217. Paint3D: Paint Anything 3D with Lighting-Less Texture Diffusion ModelsPoster59 citations
  218. Prompt-Free Diffusion: Taking "Text" out of Text-to-Image Diffusion ModelsPoster59 citations
  219. Efficient LoFTR: Semi-Dense Local Feature Matching with Sparse-Like SpeedHighlight58 citations
  220. DistriFusion: Distributed Parallel Inference for High-Resolution Diffusion ModelsHighlight57 citations
  221. Learning Vision from Models Rivals Learning Vision from DataPoster57 citations
  222. OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLMPoster57 citations
  223. SSR-Encoder: Encoding Selective Subject Representation for Subject-Driven GenerationPoster57 citations
  224. SpatialTracker: Tracking Any 2D Pixels in 3D SpaceHighlight57 citations
  225. Single-Model and Any-Modality for Video Object TrackingPoster56 citations
  226. VMC: Video Motion Customization using Temporal Attention Adaption for Text-to-Video Diffusion ModelsPoster56 citations
  227. FreGS: 3D Gaussian Splatting with Progressive Frequency RegularizationPoster55 citations
  228. Noisy-Correspondence Learning for Text-to-Image Person Re-identificationPoster55 citations
  229. Rethinking Inductive Biases for Surface Normal EstimationPoster55 citations
  230. CapsFusion: Rethinking Image-Text Data at ScalePoster54 citations
  231. CoDi-2: In-Context Interleaved and Interactive Any-to-Any GenerationHighlight54 citations
  232. EditGuard: Versatile Image Watermarking for Tamper Localization and Copyright ProtectionPoster54 citations
  233. InfLoRA: Interference-Free Low-Rank Adaptation for Continual LearningPoster54 citations
  234. ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic ManipulationPoster54 citations
  235. Scaling Up Dynamic Human-Scene Interaction ModelingHighlight54 citations
  236. SyncTalk: The Devil is in the Synchronization for Talking Head SynthesisPoster54 citations
  237. VLP: Vision Language Planning for Autonomous DrivingPoster54 citations
  238. Binding Touch to Everything: Learning Unified Multimodal Tactile RepresentationsPoster53 citations
  239. Habitat Synthetic Scenes Dataset (HSSD-200): An Analysis of 3D Scene Scale and Realism Tradeoffs for ObjectGoal NavigationPoster53 citations
  240. PromptKD: Unsupervised Prompt Distillation for Vision-Language ModelsPoster53 citations
  241. Residual Denoising Diffusion ModelsPoster53 citations
  242. SNI-SLAM: Semantic Neural Implicit SLAMPoster53 citations
  243. Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent AlignersPoster53 citations
  244. Towards Large-scale 3D Representation Learning with Multi-dataset Point Prompt TrainingPoster53 citations
  245. Visual Point Cloud Forecasting enables Scalable Autonomous DrivingHighlight53 citations
  246. XCube: Large-Scale 3D Generative Modeling using Sparse Voxel HierarchiesHighlight53 citations
  247. XFeat: Accelerated Features for Lightweight Image MatchingPoster53 citations
  248. Autoregressive Queries for Adaptive Tracking with Spatio-Temporal TransformersPoster52 citations
  249. GARField: Group Anything with Radiance FieldsPoster52 citations
  250. GigaPose: Fast and Robust Novel Object Pose Estimation via One CorrespondencePoster52 citations
  251. GraphDreamer: Compositional 3D Scene Synthesis from Scene GraphsPoster52 citations
  252. Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large ModelsPoster52 citations
  253. A Unified Approach for Text- and Image-guided 4D Scene GenerationPoster51 citations
  254. Cache Me if You Can: Accelerating Diffusion Models through Block CachingPoster51 citations
  255. DEADiff: An Efficient Stylization Diffusion Model with Disentangled RepresentationsHighlight51 citations
  256. IS-Fusion: Instance-Scene Collaborative Fusion for Multimodal 3D Object DetectionHighlight51 citations
  257. One-dimensional Adapter to Rule Them All: Concepts Diffusion Models and Erasing ApplicationsHighlight51 citations
  258. PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly DetectionPoster51 citations
  259. BT-Adapter: Video Conversation is Feasible Without Video Instruction TuningPoster50 citations
  260. Forgery-aware Adaptive Transformer for Generalizable Synthetic Image DetectionPoster50 citations
  261. Intelligent Grimm - Open-ended Visual Storytelling via Latent Diffusion ModelsPoster50 citations
  262. Open3DIS: Open-Vocabulary 3D Instance Segmentation with 2D Mask GuidancePoster50 citations
  263. Panacea: Panoramic and Controllable Video Generation for Autonomous DrivingPoster50 citations
  264. SNIFFER: Multimodal Large Language Model for Explainable Out-of-Context Misinformation DetectionPoster50 citations
  265. Towards Understanding Cross and Self-Attention in Stable Diffusion for Text-Guided Image EditingPoster50 citations
  266. CG-HOI: Contact-Guided 3D Human-Object Interaction GenerationPoster49 citations
  267. Detector-Free Structure from MotionPoster49 citations
  268. Embodied Multi-Modal Agent trained by an LLM from a Parallel TextWorldPoster49 citations
  269. HIPTrack: Visual Tracking with Historical PromptsPoster49 citations
  270. HiFi4G: High-Fidelity Human Performance Rendering via Compact Gaussian SplattingPoster49 citations
  271. Language-only Training of Zero-shot Composed Image RetrievalPoster49 citations
  272. LayoutLLM: Layout Instruction Tuning with Large Language Models for Document UnderstandingPoster49 citations
  273. Real-IAD: A Real-World Multi-View Dataset for Benchmarking Versatile Industrial Anomaly DetectionPoster49 citations
  274. Scaling Up to Excellence: Practicing Model Scaling for Photo-Realistic Image Restoration In the WildPoster49 citations
  275. Self-correcting LLM-controlled Diffusion ModelsPoster49 citations
  276. Stronger Fewer & Superior: Harnessing Vision Foundation Models for Domain Generalized Semantic SegmentationPoster49 citations
  277. BlockGCN: Redefine Topology Awareness for Skeleton-Based Action RecognitionPoster48 citations
  278. CoSeR: Bridging Image and Language for Cognitive Super-ResolutionPoster48 citations
  279. ConsistNet: Enforcing 3D Consistency for Multi-view Images DiffusionPoster48 citations
  280. General Object Foundation Model for Images and Videos at ScaleHighlight48 citations
  281. MMM: Generative Masked Motion ModelHighlight48 citations
  282. Ranni: Taming Text-to-Image Diffusion for Accurate Instruction FollowingPoster48 citations
  283. VideoLLM-online: Online Video Large Language Model for Streaming VideoPoster48 citations
  284. GROUNDHOG: Grounding Large Language Models to Holistic SegmentationPoster47 citations
  285. Grounding Everything: Emerging Localization Properties in Vision-Language TransformersPoster47 citations
  286. State Space Models for Event CamerasPoster47 citations
  287. Towards Generalizable Tumor SynthesisPoster47 citations
  288. Towards Learning a Generalist Model for Embodied NavigationHighlight47 citations
  289. UniPAD: A Universal Pre-training Paradigm for Autonomous DrivingPoster47 citations
  290. 4K4D: Real-Time 4D View Synthesis at 4K ResolutionPoster46 citations
  291. COTR: Compact Occupancy TRansformer for Vision-based 3D Occupancy PredictionPoster46 citations
  292. CrossKD: Cross-Head Knowledge Distillation for Object DetectionPoster46 citations
  293. Hierarchical Diffusion Policy for Kinematics-Aware Multi-Task Robotic ManipulationPoster46 citations
  294. Infrared Small Target Detection with Scale and Location SensitivityPoster46 citations
  295. MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced TrainingPoster46 citations
  296. PeLK: Parameter-efficient Large Kernel ConvNets with Peripheral ConvolutionPoster46 citations
  297. RAVE: Randomized Noise Shuffling for Fast and Consistent Video Editing with Diffusion ModelsHighlight46 citations
  298. RCBEVDet: Radar-camera Fusion in Bird's Eye View for 3D Object DetectionPoster46 citations
  299. Upscale-A-Video: Temporal-Consistent Diffusion Model for Real-World Video Super-ResolutionHighlight46 citations
  300. VCoder: Versatile Vision Encoders for Multimodal Large Language ModelsPoster46 citations
  301. Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language ModelsPoster46 citations
  302. ChatPose: Chatting about 3D Human PosePoster45 citations
  303. DemoFusion: Democratising High-Resolution Image Generation With No $$$Poster45 citations
  304. Efficient Test-Time Adaptation of Vision-Language ModelsPoster45 citations
  305. Gaussian Shading: Provable Performance-Lossless Image Watermarking for Diffusion ModelsPoster45 citations
  306. PIA: Your Personalized Image Animator via Plug-and-Play Modules in Text-to-Image ModelsPoster45 citations
  307. PortraitBooth: A Versatile Portrait Model for Fast Identity-preserved PersonalizationPoster45 citations
  308. SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object TrackingPoster45 citations
  309. SED: A Simple Encoder-Decoder for Open-Vocabulary Semantic SegmentationPoster45 citations
  310. Selective-Stereo: Adaptive Frequency Information Selection for Stereo MatchingHighlight45 citations
  311. AM-RADIO: Agglomerative Vision Foundation Model Reduce All Domains Into OnePoster44 citations
  312. BadCLIP: Trigger-Aware Prompt Learning for Backdoor Attacks on CLIPPoster44 citations
  313. GES : Generalized Exponential Splatting for Efficient Radiance Field RenderingPoster44 citations
  314. LLaFS: When Large Language Models Meet Few-Shot SegmentationPoster44 citations
  315. Move as You Say Interact as You Can: Language-guided Human Motion Generation with Scene AffordanceHighlight44 citations
  316. NIFTY: Neural Object Interaction Fields for Guided Human Motion SynthesisPoster44 citations
  317. OmniGlue: Generalizable Feature Matching with Foundation Model GuidancePoster44 citations
  318. Paint-it: Text-to-Texture Synthesis via Deep Convolutional Texture Map Optimization and Physically-Based RenderingPoster44 citations
  319. Preserving Fairness Generalization in Deepfake DetectionPoster44 citations
  320. RTMO: Towards High-Performance One-Stage Real-Time Multi-Person Pose EstimationPoster44 citations
  321. RegionGPT: Towards Region Understanding Vision Language ModelPoster44 citations
  322. Rethinking Transformers Pre-training for Multi-Spectral Satellite ImageryPoster44 citations
  323. Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image SegmentationPoster44 citations
  324. Streaming Dense Video CaptioningPoster44 citations
  325. SwiftBrush: One-Step Text-to-Image Diffusion Model with Variational Score DistillationPoster44 citations
  326. TUMTraf V2X Cooperative Perception DatasetPoster44 citations
  327. The Neglected Tails in Vision-Language ModelsPoster44 citations
  328. Video ReCap: Recursive Captioning of Hour-Long VideosPoster44 citations
  329. WonderJourney: Going from Anywhere to EverywherePoster44 citations
  330. Adapting Visual-Language Models for Generalizable Anomaly Detection in Medical ImagesHighlight43 citations
  331. Boosting Adversarial Transferability by Block Shuffle and RotationPoster43 citations
  332. CCEdit: Creative and Controllable Video Editing via Diffusion ModelsPoster43 citations
  333. Event Stream-based Visual Object Tracking: A High-Resolution Benchmark Dataset and A Novel BaselinePoster43 citations
  334. From Audio to Photoreal Embodiment: Synthesizing Humans in ConversationsPoster43 citations
  335. GPT4Point: A Unified Framework for Point-Language Understanding and GenerationHighlight43 citations
  336. InstructVideo: Instructing Video Diffusion Models with Human FeedbackPoster43 citations
  337. Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMsPoster43 citations
  338. SODA: Bottleneck Diffusion Models for Representation LearningPoster43 citations
  339. An Aggregation-Free Federated Learning for Tackling Data HeterogeneityPoster42 citations
  340. Bridging the Gap: A Unified Video Comprehension Framework for Moment Retrieval and Highlight DetectionPoster42 citations
  341. CoGS: Controllable Gaussian SplattingPoster42 citations
  342. CorrMatch: Label Propagation via Correlation Matching for Semi-Supervised Semantic SegmentationPoster42 citations
  343. Instruct-Imagen: Image Generation with Multi-modal InstructionPoster42 citations
  344. SIFU: Side-view Conditioned Implicit Function for Real-world Usable Clothed Human ReconstructionHighlight42 citations
  345. Self-Discovering Interpretable Diffusion Latent Directions for Responsible Text-to-Image GenerationPoster42 citations
  346. SkillDiffuser: Interpretable Hierarchical Planning via Skill Abstractions in Diffusion-Based Task ExecutionPoster42 citations
  347. Space-Time Diffusion Features for Zero-Shot Text-Driven Motion TransferPoster42 citations
  348. SparseOcc: Rethinking Sparse Latent Representation for Vision-Based Semantic Occupancy PredictionPoster42 citations
  349. VidToMe: Video Token Merging for Zero-Shot Video EditingPoster42 citations
  350. EgoExoLearn: A Dataset for Bridging Asynchronous Ego- and Exo-centric View of Procedural Activities in Real WorldPoster41 citations
  351. EscherNet: A Generative Model for Scalable View SynthesisPoster41 citations
  352. FlashAvatar: High-fidelity Head Avatar with Efficient Gaussian EmbeddingPoster41 citations
  353. FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video SynthesisHighlight41 citations
  354. GAvatar: Animatable 3D Gaussian Avatars with Implicit Mesh LearningHighlight41 citations
  355. Gaussian Shell Maps for Efficient 3D Human GenerationPoster41 citations
  356. Optimizing Diffusion Noise Can Serve As Universal Motion PriorsPoster41 citations
  357. A Picture is Worth More Than 77 Text Tokens: Evaluating CLIP-Style Models on Dense CaptionsPoster40 citations
  358. AEROBLADE: Training-Free Detection of Latent Diffusion Images Using Autoencoder Reconstruction ErrorPoster40 citations
  359. Diffusion-EDFs: Bi-equivariant Denoising Generative Modeling on SE(3) for Visual Robotic ManipulationHighlight40 citations
  360. Fast ODE-based Sampling for Diffusion Models in Around 5 StepsHighlight40 citations
  361. Harnessing Large Language Models for Training-free Video Anomaly DetectionPoster40 citations
  362. LaMPilot: An Open Benchmark Dataset for Autonomous Driving with Language Model ProgramsPoster40 citations
  363. Text Is MASS: Modeling as Stochastic Embedding for Text-Video RetrievalHighlight40 citations
  364. A Closer Look at the Few-Shot Adaptation of Large Vision-Language ModelsPoster39 citations
  365. Adapt or Perish: Adaptive Sparse Transformer with Attentive Feature Refinement for Image RestorationPoster39 citations
  366. On the Robustness of Large Multimodal Models Against Image Adversarial AttacksPoster39 citations
  367. PEEKABOO: Interactive Video Generation via Masked-DiffusionPoster39 citations
  368. Text-Image Alignment for Diffusion-Based PerceptionPoster39 citations
  369. Auto MC-Reward: Automated Dense Reward Design with Large Language Models for MinecraftPoster38 citations
  370. Bidirectional Multi-Scale Implicit Neural Representations for Image DerainingPoster38 citations
  371. HouseCat6D - A Large-Scale Multi-Modal Category Level 6D Object Perception Dataset with Household Objects in Realistic ScenariosHighlight38 citations
  372. Morphological Prototyping for Unsupervised Slide Representation Learning in Computational PathologyPoster38 citations
  373. Retrieval-Augmented Egocentric Video CaptioningPoster38 citations
  374. Text2Loc: 3D Point Cloud Localization from Natural LanguagePoster38 citations
  375. A Recipe for Scaling up Text-to-Video Generation with Text-free VideosPoster37 citations
  376. CityDreamer: Compositional Generative Model of Unbounded 3D CitiesPoster37 citations
  377. Dense Optical Tracking: Connecting the DotsHighlight37 citations
  378. DiffSHEG: A Diffusion-Based Approach for Real-Time Speech-driven Holistic 3D Expression and Gesture GenerationPoster37 citations
  379. Dynamic Adapter Meets Prompt Tuning: Parameter-Efficient Transfer Learning for Point Cloud AnalysisPoster37 citations
  380. FairCLIP: Harnessing Fairness in Vision-Language LearningPoster37 citations
  381. LLMs are Good Sign Language TranslatorsPoster37 citations
  382. Loopy-SLAM: Dense Neural SLAM with Loop ClosuresPoster37 citations
  383. PARA-Drive: Parallelized Architecture for Real-time Autonomous DrivingPoster37 citations
  384. SHViT: Single-Head Vision Transformer with Memory Efficient Macro DesignPoster37 citations
  385. Self-Distilled Masked Auto-Encoders are Efficient Video Anomaly DetectorsPoster37 citations
  386. VideoSwap: Customized Video Subject Swapping with Interactive Semantic Point CorrespondencePoster37 citations
  387. ViewDiff: 3D-Consistent Image Generation with Text-to-Image ModelsPoster37 citations
  388. DreamMatcher: Appearance Matching Self-Attention for Semantically-Consistent Text-to-Image PersonalizationPoster36 citations
  389. Dynamic Graph Representation with Knowledge-aware Attention for Histopathology Whole Slide Image AnalysisPoster36 citations
  390. How to Configure Good In-Context Sequence for Visual Question AnsweringPoster36 citations
  391. Language Models as Black-Box Optimizers for Vision-Language ModelsPoster36 citations
  392. MCD: Diverse Large-Scale Multi-Campus Dataset for Robot PerceptionHighlight36 citations
  393. MuseChat: A Conversational Music Recommendation System for VideosHighlight36 citations
  394. PhyScene: Physically Interactable 3D Scene Synthesis for Embodied AIHighlight36 citations
  395. SAI3D: Segment Any Instance in 3D ScenesPoster36 citations
  396. Shadows Don't Lie and Lines Can't Bend! Generative Models don't know Projective Geometry...for nowPoster36 citations
  397. TokenHMR: Advancing Human Mesh Recovery with a Tokenized Pose RepresentationPoster36 citations
  398. Toward Generalist Anomaly Detection via In-context Residual Learning with Few-shot Sample PromptsPoster36 citations
  399. VRP-SAM: SAM with Visual Reference PromptPoster36 citations
  400. Video Interpolation with Diffusion ModelsPoster36 citations
  401. AVID: Any-Length Video Inpainting with Diffusion ModelPoster35 citations
  402. ChatScene: Knowledge-Enabled Safety-Critical Scenario Generation for Autonomous VehiclesPoster35 citations
  403. ECoDepth: Effective Conditioning of Diffusion Models for Monocular Depth EstimationPoster35 citations
  404. Free3D: Consistent Novel View Synthesis without 3D RepresentationPoster35 citations
  405. Hourglass Tokenizer for Efficient Transformer-Based 3D Human Pose EstimationHighlight35 citations
  406. Lodge: A Coarse to Fine Diffusion Network for Long Dance Generation Guided by the Characteristic Dance PrimitivesPoster35 citations
  407. MuRF: Multi-Baseline Radiance FieldsPoster35 citations
  408. On the Content Bias in Frechet Video DistancePoster35 citations
  409. SceneFun3D: Fine-Grained Functionality and Affordance Understanding in 3D ScenesPoster35 citations
  410. SpikingResformer: Bridging ResNet and Vision Transformer in Spiking Neural NetworksPoster35 citations
  411. Text Prompt with Normality Guidance for Weakly Supervised Video Anomaly DetectionPoster35 citations
  412. ViVid-1-to-3: Novel View Synthesis with Video Diffusion ModelsHighlight35 citations
  413. VoCo: A Simple-yet-Effective Volume Contrastive Learning Framework for 3D Medical Image AnalysisPoster35 citations
  414. Aligning and Prompting Everything All at Once for Universal Visual PerceptionPoster34 citations
  415. CAMixerSR: Only Details Need More "Attention"Poster34 citations
  416. CFPL-FAS: Class Free Prompt Learning for Generalizable Face Anti-spoofingHighlight34 citations
  417. CricaVPR: Cross-image Correlation-aware Representation Learning for Visual Place RecognitionPoster34 citations
  418. Describing Differences in Image Sets with Natural LanguagePoster34 citations
  419. DreamControl: Control-Based Text-to-3D Generation with 3D Self-PriorPoster34 citations
  420. End-to-End Temporal Action Detection with 1B Parameters Across 1000 FramesPoster34 citations
  421. Exploiting Style Latent Flows for Generalizing Deepfake Video DetectionPoster34 citations
  422. FINER: Flexible Spectral-bias Tuning in Implicit NEural Representation by Variable-periodic Activation FunctionsPoster34 citations
  423. Feature Re-Embedding: Towards Foundation Model-Level Performance in Computational PathologyPoster34 citations
  424. GoMAvatar: Efficient Animatable Human Modeling from Monocular Video Using Gaussians-on-MeshPoster34 citations
  425. Hierarchical Spatio-temporal Decoupling for Text-to-Video GenerationPoster34 citations
  426. Masked Autoencoders for Microscopy are Scalable Learners of Cellular BiologyHighlight34 citations
  427. MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D WorldPoster34 citations
  428. One Prompt Word is Enough to Boost Adversarial Robustness for Pre-trained Vision-Language ModelsPoster34 citations
  429. Open-Vocabulary Video Anomaly DetectionPoster34 citations
  430. Quilt-LLaVA: Visual Instruction Tuning by Extracting Localized Narratives from Open-Source Histopathology VideosPoster34 citations
  431. SAFDNet: A Simple and Effective Network for Fully Sparse 3D Object DetectionPoster34 citations
  432. SPAD: Spatially Aware Multi-View DiffusersPoster34 citations
  433. Scaling Laws for Data Filtering-- Data Curation cannot be Compute AgnosticPoster34 citations
  434. Structure-Aware Sparse-View X-ray 3D ReconstructionPoster34 citations
  435. TextureDreamer: Image-Guided Texture Synthesis Through Geometry-Aware DiffusionPoster34 citations
  436. Transcending the Limit of Local Window: Advanced Super-Resolution Transformer with Adaptive Token DictionaryPoster34 citations
  437. Vlogger: Make Your Dream A VlogPoster34 citations
  438. Zero-Reference Low-Light Enhancement via Physical Quadruple PriorsPoster34 citations
  439. ArGue: Attribute-Guided Prompt Tuning for Vision-Language ModelsPoster33 citations
  440. CLIP-KD: An Empirical Study of CLIP Model DistillationPoster33 citations
  441. Direct2.5: Diverse Text-to-3D Generation via Multi-view 2.5D DiffusionPoster33 citations
  442. Koala: Key Frame-Conditioned Long Video-LLMHighlight33 citations
  443. LLMs are Good Action RecognizersPoster33 citations
  444. NeRFiller: Completing Scenes via Generative 3D InpaintingPoster33 citations
  445. PIGEON: Predicting Image GeolocationsHighlight33 citations
  446. Telling Left from Right: Identifying Geometry-Aware Semantic CorrespondencePoster33 citations
  447. Test-Time Domain Generalization for Face Anti-SpoofingPoster33 citations
  448. Volumetric Environment Representation for Vision-Language NavigationHighlight33 citations
  449. WOUAF: Weight Modulation for User Attribution and Fingerprinting in Text-to-Image Diffusion ModelsPoster33 citations
  450. AvatarGPT: All-in-One Framework for Motion Understanding Planning Generation and BeyondPoster32 citations
  451. Consistent3D: Towards Consistent High-Fidelity Text-to-3D Generation with Deterministic Sampling PriorPoster32 citations
  452. EpiDiff: Enhancing Multi-View Synthesis via Localized Epipolar-Constrained DiffusionPoster32 citations
  453. FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head ModelsPoster32 citations
  454. HPNet: Dynamic Trajectory Forecasting with Historical Prediction AttentionPoster32 citations
  455. Jack of All Tasks Master of Many: Designing General-Purpose Coarse-to-Fine Vision-Language ModelHighlight32 citations
  456. Let's Think Outside the Box: Exploring Leap-of-Thought in Large Language Models with Creative Humor GenerationPoster32 citations
  457. MP5: A Multi-modal Open-ended Embodied System in Minecraft via Active PerceptionPoster32 citations
  458. MoReVQA: Exploring Modular Reasoning Models for Video Question AnsweringPoster32 citations
  459. MotionEditor: Editing Video Motion via Content-Aware DiffusionPoster32 citations
  460. Open-Vocabulary Segmentation with Semantic-Assisted CalibrationPoster32 citations
  461. OpenBias: Open-set Bias Detection in Text-to-Image Generative ModelsHighlight32 citations
  462. Selective Hourglass Mapping for Universal Image Restoration Based on Diffusion ModelPoster32 citations
  463. SiTH: Single-view Textured Human Reconstruction with Image-Conditioned DiffusionPoster32 citations
  464. Towards Text-guided 3D Scene CompositionPoster32 citations
  465. Visual In-Context PromptingPoster32 citations
  466. ZONE: Zero-Shot Instruction-Guided Local EditingPoster32 citations
  467. ControlRoom3D: Room Generation using Semantic Proxy RoomsPoster31 citations
  468. Depth Information Assisted Collaborative Mutual Promotion Network for Single Image DehazingPoster31 citations
  469. DiffuseMix: Label-Preserving Data Augmentation with Diffusion ModelsPoster31 citations
  470. Focus on Your Instruction: Fine-grained and Multi-instruction Image Editing by Attention ModulationPoster31 citations
  471. Learned Representation-Guided Diffusion Models for Large-Image GenerationPoster31 citations
  472. Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-IdentificationPoster31 citations
  473. ParameterNet: Parameters Are All You Need for Large-scale Visual Pretraining of Mobile NetworksPoster31 citations
  474. PatchFusion: An End-to-End Tile-Based Framework for High-Resolution Monocular Metric Depth EstimationPoster31 citations
  475. PointOBB: Learning Oriented Object Detection via Single Point SupervisionPoster31 citations
  476. Salience DETR: Enhancing Detection Transformer with Hierarchical Salience Filtering RefinementPoster31 citations
  477. SeD: Semantic-Aware Discriminator for Image Super-ResolutionPoster31 citations
  478. Smooth Diffusion: Crafting Smooth Latent Spaces in Diffusion ModelsPoster31 citations
  479. TFMQ-DM: Temporal Feature Maintenance Quantization for Diffusion ModelsHighlight31 citations
  480. Zero-TPrune: Zero-Shot Token Pruning through Leveraging of the Attention Graph in Pre-Trained TransformersPoster31 citations
  481. BEVNeXt: Reviving Dense BEV Frameworks for 3D Object DetectionPoster30 citations
  482. Bilateral Propagation Network for Depth CompletionPoster30 citations
  483. C2KD: Bridging the Modality Gap for Cross-Modal Knowledge DistillationHighlight30 citations
  484. CLIP as RNN: Segment Countless Visual Concepts without Training EndeavorPoster30 citations
  485. Cam4DOcc: Benchmark for Camera-Only 4D Occupancy Forecasting in Autonomous Driving ApplicationsPoster30 citations
  486. CommonCanvas: Open Diffusion Models Trained on Creative-Commons ImagesPoster30 citations
  487. Consistent Prompting for Rehearsal-Free Continual LearningPoster30 citations
  488. DAP: A Dynamic Adversarial Patch for Evading Person DetectorsPoster30 citations
  489. Digital Life Project: Autonomous 3D Characters with Social IntelligencePoster30 citations
  490. Driving Everywhere with Large Language Model Policy AdaptationPoster30 citations
  491. Efficient Dataset Distillation via Minimax DiffusionPoster30 citations
  492. Generative Proxemics: A Prior for 3D Social Interaction from ImagesPoster30 citations
  493. MS-DETR: Efficient DETR Training with Mixed SupervisionPoster30 citations
  494. MTLoRA: Low-Rank Adaptation Approach for Efficient Multi-Task LearningHighlight30 citations
  495. MoCha-Stereo: Motif Channel Attention Network for Stereo MatchingPoster30 citations
  496. MonoCD: Monocular 3D Object Detection with Complementary DepthsPoster30 citations
  497. Open3DSG: Open-Vocabulary 3D Scene Graphs from Point Clouds with Queryable Objects and Open-Set RelationshipsPoster30 citations
  498. Polos: Multimodal Metric Learning from Human Feedback for Image CaptioningHighlight30 citations
  499. RCooper: A Real-world Large-scale Dataset for Roadside Cooperative PerceptionPoster30 citations
  500. SceneTex: High-Quality Texture Synthesis for Indoor Scenes via Diffusion PriorsHighlight30 citations
  501. Transcriptomics-guided Slide Representation Learning in Computational PathologyPoster30 citations
  502. Tri-Perspective View Decomposition for Geometry-Aware Depth CompletionPoster30 citations
  503. UFineBench: Towards Text-based Person Retrieval with Ultra-fine GranularityPoster30 citations
  504. A Vision Check-up for Language ModelsHighlight29 citations
  505. Breathing Life Into Sketches Using Text-to-Video PriorsHighlight29 citations
  506. C3: High-Performance and Low-Complexity Neural Compression from a Single Image or VideoPoster29 citations
  507. CLOVA: A Closed-LOop Visual Assistant with Tool Usage and UpdatePoster29 citations
  508. Decoupling Static and Hierarchical Motion Perception for Referring Video SegmentationPoster29 citations
  509. Dual Memory Networks: A Versatile Adaptation Approach for Vision-Language ModelsPoster29 citations
  510. FreeControl: Training-Free Spatial Control of Any Text-to-Image Diffusion Model with Any ConditionPoster29 citations
  511. Generalized Large-Scale Data Condensation via Various Backbone and Statistical MatchingHighlight29 citations
  512. HOLD: Category-agnostic 3D Reconstruction of Interacting Hands and Objects from VideoHighlight29 citations
  513. IMPRINT: Generative Object Compositing by Learning Identity-Preserving RepresentationPoster29 citations
  514. Improving the Generalization of Segmentation Foundation Model under Distribution Shift via Weakly Supervised AdaptationPoster29 citations
  515. LAA-Net: Localized Artifact Attention Network for Quality-Agnostic and Generalizable Deepfake DetectionPoster29 citations
  516. LaRE^2: Latent Reconstruction Error Based Method for Diffusion-Generated Image DetectionPoster29 citations
  517. MMA: Multi-Modal Adapter for Vision-Language ModelsPoster29 citations
  518. MindBridge: A Cross-Subject Brain Decoding FrameworkHighlight29 citations
  519. Multimodal Representation Learning by Alternating Unimodal AdaptationPoster29 citations
  520. NeRF On-the-go: Exploiting Uncertainty for Distractor-free NeRFs in the WildPoster29 citations
  521. OA-CNNs: Omni-Adaptive Sparse CNNs for 3D Semantic SegmentationPoster29 citations
  522. On the Test-Time Zero-Shot Generalization of Vision-Language Models: Do We Really Need Prompt Learning?Poster29 citations
  523. Plug and Play Active Learning for Object DetectionPoster29 citations
  524. Seamless Human Motion Composition with Blended Positional EncodingsPoster29 citations
  525. CAT-DM: Controllable Accelerated Virtual Try-on with Diffusion ModelPoster28 citations
  526. Frequency-Adaptive Dilated Convolution for Semantic SegmentationHighlight28 citations
  527. From SAM to CAMs: Exploring Segment Anything Model for Weakly Supervised Semantic SegmentationPoster28 citations
  528. Improving Image Restoration through Removing Degradations in Textual RepresentationsPoster28 citations
  529. Inter-X: Towards Versatile Human-Human Interaction AnalysisPoster28 citations
  530. LEAP-VO: Long-term Effective Any Point Tracking for Visual OdometryPoster28 citations
  531. MGMap: Mask-Guided Learning for Online Vectorized HD Map ConstructionPoster28 citations
  532. Matching Anything by Segmenting AnythingHighlight28 citations
  533. Neural Markov Random Field for Stereo MatchingPoster28 citations
  534. OmniParser: A Unified Framework for Text Spotting Key Information Extraction and Table RecognitionPoster28 citations
  535. OmniSeg3D: Omniversal 3D Segmentation via Hierarchical Contrastive LearningPoster28 citations
  536. PEM: Prototype-based Efficient MaskFormer for Image SegmentationPoster28 citations
  537. PerceptionGPT: Effectively Fusing Visual Perception into LLMHighlight28 citations
  538. S2MAE: A Spatial-Spectral Pretraining Foundation Model for Spectral Remote Sensing DataPoster28 citations
  539. SDDGR: Stable Diffusion-based Deep Generative Replay for Class Incremental Object DetectionHighlight28 citations
  540. SVGDreamer: Text Guided SVG Generation with Diffusion ModelPoster28 citations
  541. Task-Customized Mixture of Adapters for General Image FusionPoster28 citations
  542. WorDepth: Variational Language Prior for Monocular Depth EstimationPoster28 citations
  543. DiffAvatar: Simulation-Ready Garment Optimization with Differentiable SimulationPoster27 citations
  544. DiffCast: A Unified Framework via Residual Diffusion for Precipitation NowcastingPoster27 citations
  545. DiffusionAvatars: Deferred Diffusion for High-fidelity 3D Head AvatarsPoster27 citations
  546. EGTR: Extracting Graph from Transformer for Scene Graph GenerationPoster27 citations
  547. HanDiffuser: Text-to-Image Generation With Realistic Hand AppearancesPoster27 citations
  548. Knowledge-Enhanced Dual-stream Zero-shot Composed Image RetrievalPoster27 citations
  549. MM-Narrator: Narrating Long-form Videos with Multimodal In-Context LearningHighlight27 citations
  550. MaskClustering: View Consensus based Mask Graph Clustering for Open-Vocabulary 3D Instance SegmentationPoster27 citations
  551. ModaVerse: Efficiently Transforming Modalities with LLMsPoster27 citations
  552. Multi-Task Dense Prediction via Mixture of Low-Rank ExpertsPoster27 citations
  553. NOPE: Novel Object Pose Estimation from a Single ImagePoster27 citations
  554. One-Prompt to Segment All Medical ImagesPoster27 citations
  555. SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion TransformerPoster27 citations
  556. Towards Realistic Scene Generation with LiDAR Diffusion ModelsPoster27 citations
  557. UnScene3D: Unsupervised 3D Instance Segmentation for Indoor ScenesPoster27 citations
  558. Unsupervised Universal Image SegmentationPoster27 citations
  559. VicTR: Video-conditioned Text Representations for Activity RecognitionPoster27 citations
  560. A Simple Recipe for Contrastively Pre-training Video-First Encoders Beyond 16 FramesPoster26 citations
  561. Accelerating Diffusion Sampling with Optimized Time StepsPoster26 citations
  562. Beyond First-Order Tweedie: Solving Inverse Problems using Latent DiffusionPoster26 citations
  563. Coarse-to-Fine Latent Diffusion for Pose-Guided Person Image SynthesisHighlight26 citations
  564. Correlation-aware Coarse-to-fine MLPs for Deformable Medical Image RegistrationPoster26 citations
  565. DetDiffusion: Synergizing Generative and Perceptive Models for Enhanced Data Generation and PerceptionPoster26 citations
  566. Diffusion 3D Features (Diff3F): Decorating Untextured Shapes with Distilled Semantic FeaturesPoster26 citations
  567. EMOPortraits: Emotion-enhanced Multimodal One-shot Head AvatarsPoster26 citations
  568. Gradient Reweighting: Towards Imbalanced Class-Incremental LearningPoster26 citations
  569. Grounded Question-Answering in Long Egocentric VideosPoster26 citations
  570. Hunting Attributes: Context Prototype-Aware Learning for Weakly Supervised Semantic SegmentationPoster26 citations
  571. Instruct-ReID: A Multi-purpose Person Re-identification Task with InstructionsPoster26 citations
  572. LoCoNet: Long-Short Context Network for Active Speaker DetectionPoster26 citations
  573. MRFS: Mutually Reinforcing Image Fusion and SegmentationPoster26 citations
  574. Pixel-Aligned Language ModelPoster26 citations
  575. Posterior Distillation SamplingPoster26 citations
  576. Progressive Semantic-Guided Vision Transformer for Zero-Shot LearningPoster26 citations
  577. Readout Guidance: Learning Control from Diffusion FeaturesHighlight26 citations
  578. Score-Guided Diffusion for 3D Human RecoveryPoster26 citations
  579. Shallow-Deep Collaborative Learning for Unsupervised Visible-Infrared Person Re-IdentificationPoster26 citations
  580. SingularTrajectory: Universal Trajectory Predictor Using Diffusion ModelPoster26 citations
  581. Unleashing the Potential of SAM for Medical Adaptation via Hierarchical DecodingPoster26 citations
  582. Visual Programming for Zero-shot Open-Vocabulary 3D Visual GroundingPoster26 citations
  583. Beyond Text: Frozen Large Language Models in Visual Signal ComprehensionPoster25 citations
  584. Contrastive Denoising Score for Text-guided Latent Diffusion Image EditingPoster25 citations
  585. EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World ComprehensionPoster25 citations
  586. Fairy: Fast Parallelized Instruction-Guided Video-to-Video SynthesisPoster25 citations
  587. GP-NeRF: Generalized Perception NeRF for Context-Aware 3D Scene UnderstandingHighlight25 citations
  588. Gradient Alignment for Cross-Domain Face Anti-SpoofingPoster25 citations
  589. ID-like Prompt Learning for Few-Shot Out-of-Distribution DetectionPoster25 citations
  590. Learning Transferable Negative Prompts for Out-of-Distribution DetectionPoster25 citations
  591. MeaCap: Memory-Augmented Zero-shot Image CaptioningPoster25 citations
  592. Orthogonal Adaptation for Modular Customization of Diffusion ModelsHighlight25 citations
  593. PIE-NeRF: Physics-based Interactive Elastodynamics with NeRFPoster25 citations
  594. Pre-trained Vision and Language Transformers Are Few-Shot Incremental LearnersPoster25 citations
  595. Rethinking Diffusion Model for Multi-Contrast MRI Super-ResolutionPoster25 citations
  596. SCEdit: Efficient and Controllable Image Diffusion Generation via Skip Connection EditingHighlight25 citations
  597. SD4Match: Learning to Prompt Stable Diffusion Model for Semantic MatchingPoster25 citations
  598. Unleashing Unlabeled Data: A Paradigm for Cross-View Geo-LocalizationPoster25 citations
  599. pix2gestalt: Amodal Segmentation by Synthesizing WholesHighlight25 citations
  600. Boosting Image Quality Assessment through Efficient Transformer Adaptation with Local Feature EnhancementPoster24 citations
  601. DiffusionLight: Light Probes for Free by Painting a Chrome BallPoster24 citations
  602. Frozen CLIP: A Strong Backbone for Weakly Supervised Semantic SegmentationHighlight24 citations
  603. HIMap: HybrId Representation Learning for End-to-end Vectorized HD Map ConstructionPoster24 citations
  604. Improved Zero-Shot Classification by Adapting VLMs with Text DescriptionsPoster24 citations
  605. Infinigen Indoors: Photorealistic Indoor Scenes using Procedural GenerationPoster24 citations
  606. InteractDiffusion: Interaction Control in Text-to-Image Diffusion ModelsPoster24 citations
  607. KTPFormer: Kinematics and Trajectory Prior Knowledge-Enhanced Transformer for 3D Human Pose EstimationPoster24 citations
  608. Learning Multi-Dimensional Human Preference for Text-to-Image GenerationPoster24 citations
  609. Light the Night: A Multi-Condition Diffusion Framework for Unpaired Low-Light Enhancement in Autonomous DrivingPoster24 citations
  610. Mosaic-SDF for 3D Generative ModelsPoster24 citations
  611. On Exact Inversion of DPM-SolversPoster24 citations
  612. OrCo: Towards Better Generalization via Orthogonality and Contrast for Few-Shot Class-Incremental LearningHighlight24 citations
  613. Pre-trained Model Guided Fine-Tuning for Zero-Shot Adversarial RobustnessPoster24 citations
  614. Revamping Federated Learning Security from a Defender's Perspective: A Unified Defense with Homomorphic Encrypted Data SpacePoster24 citations
  615. Segment and Caption AnythingPoster24 citations
  616. Source-Free Domain Adaptation with Frozen Multimodal Foundation ModelPoster24 citations
  617. Sparse Semi-DETR: Sparse Learnable Queries for Semi-Supervised Object DetectionPoster24 citations
  618. Text2HOI: Text-guided 3D Motion Generation for Hand-Object InteractionPoster24 citations
  619. Towards Scalable 3D Anomaly Detection and Localization: A Benchmark via 3D Anomaly Synthesis and A Self-Supervised Learning NetworkPoster24 citations
  620. ZERO-IG: Zero-Shot Illumination-Guided Joint Denoising and Adaptive Enhancement for Low-Light ImagesPoster24 citations
  621. 360DVD: Controllable Panorama Video Generation with 360-Degree Video Diffusion ModelPoster23 citations
  622. 3D Facial Expressions through Analysis-by-Neural-SynthesisPoster23 citations
  623. A Dynamic Kernel Prior Model for Unsupervised Blind Image Super-ResolutionPoster23 citations
  624. Adaptive Bidirectional Displacement for Semi-Supervised Medical Image SegmentationPoster23 citations
  625. Amodal Ground Truth and Completion in the WildPoster23 citations
  626. Atlantis: Enabling Underwater Depth Estimation with Stable DiffusionHighlight23 citations
  627. Continual Self-supervised Learning: Towards Universal Multi-modal Medical Data Representation LearningHighlight23 citations
  628. Diff-Plugin: Revitalizing Details for Diffusion-based Low-level TasksPoster23 citations
  629. ExACT: Language-guided Conceptual Reasoning and Uncertainty Estimation for Event-based Action Recognition and MoreHighlight23 citations
  630. FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video TranslationPoster23 citations
  631. Global and Local Prompts Cooperation via Optimal Transport for Federated LearningPoster23 citations
  632. Intrinsic Image Diffusion for Indoor Single-view Material EstimationPoster23 citations
  633. MAPLM: A Real-World Large-Scale Vision-Language Benchmark for Map and Traffic Scene UnderstandingPoster23 citations
  634. MatFuse: Controllable Material Generation with Diffusion ModelsPoster23 citations
  635. MemFlow: Optical Flow Estimation and Prediction with MemoryPoster23 citations
  636. Mirasol3B: A Multimodal Autoregressive Model for Time-Aligned and Contextual ModalitiesPoster23 citations
  637. Multimodal Industrial Anomaly Detection by Crossmodal Feature MappingPoster23 citations
  638. Not All Voxels Are Equal: Hardness-Aware Semantic Scene Completion with Self-DistillationPoster23 citations
  639. Physical 3D Adversarial Attacks against Monocular Depth Estimation in Autonomous DrivingPoster23 citations
  640. Question Aware Vision Transformer for Multimodal ReasoningHighlight23 citations
  641. Robust Emotion Recognition in Context DebiasingPoster23 citations
  642. SatSynth: Augmenting Image-Mask Pairs through Diffusion Models for Aerial Semantic SegmentationPoster23 citations
  643. SecondPose: SE(3)-Consistent Dual-Stream Feature Fusion for Category-Level Pose EstimationPoster23 citations
  644. Separate and Conquer: Decoupling Co-occurrence via Decomposition and Representation for Weakly Supervised Semantic SegmentationPoster23 citations
  645. SocialCircle: Learning the Angle-based Social Interaction Representation for Pedestrian Trajectory PredictionPoster23 citations
  646. Three Pillars Improving Vision Foundation Model Distillation for LidarPoster23 citations
  647. Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot LearningPoster23 citations
  648. View-decoupled Transformer for Person Re-identification under Aerial-ground Camera NetworkPoster23 citations
  649. BigGait: Learning Gait Representation You Want by Large Vision ModelsPoster22 citations
  650. Bridging Remote Sensors with Multisensor Geospatial Foundation ModelsPoster22 citations
  651. CapHuman: Capture Your Moments in Parallel UniversesPoster22 citations
  652. Control4D: Efficient 4D Portrait Editing with TextPoster22 citations
  653. Do You Remember? Dense Video Captioning with Cross-Modal Memory RetrievalPoster22 citations
  654. Drag Your Noise: Interactive Point-based Editing via Diffusion Semantic PropagationPoster22 citations
  655. ExtDM: Distribution Extrapolation Diffusion Model for Video PredictionPoster22 citations
  656. Few-Shot Object Detection with Foundation ModelsPoster22 citations
  657. From Pixels to Graphs: Open-Vocabulary Scene Graph Generation with Vision-Language ModelsPoster22 citations
  658. GenZI: Zero-Shot 3D Human-Scene Interaction GenerationPoster22 citations
  659. Hide in Thicket: Generating Imperceptible and Rational Adversarial Perturbations on 3D Point CloudsPoster22 citations
  660. Learning Object State Changes in Videos: An Open-World PerspectivePoster22 citations
  661. Learning Occupancy for Monocular 3D Object DetectionPoster22 citations
  662. Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMsPoster22 citations
  663. MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language TransformerPoster22 citations
  664. Make-Your-Anchor: A Diffusion-based 2D Avatar Generation FrameworkPoster22 citations
  665. Multi-Space Alignments Towards Universal LiDAR SegmentationPoster22 citations
  666. Neural Parametric Gaussians for Monocular Non-Rigid Object ReconstructionPoster22 citations
  667. On the Scalability of Diffusion-based Text-to-Image GenerationPoster22 citations
  668. Point Cloud Pre-training with Diffusion ModelsPoster22 citations
  669. Producing and Leveraging Online Map Uncertainty in Trajectory PredictionPoster22 citations
  670. Rethinking the Objectives of Vector-Quantized Tokenizers for Image SynthesisPoster22 citations
  671. Sieve: Multimodal Dataset Pruning using Image Captioning ModelsPoster22 citations
  672. SonicVisionLM: Playing Sound with Vision Language ModelsPoster22 citations
  673. Synthesize Diagnose and Optimize: Towards Fine-Grained Vision-Language UnderstandingPoster22 citations
  674. Tactile-Augmented Radiance FieldsPoster22 citations
  675. Taming Mode Collapse in Score Distillation for Text-to-3D GenerationPoster22 citations
  676. Towards Language-Driven Video Inpainting via Multimodal Large Language ModelsPoster22 citations
  677. UnO: Unsupervised Occupancy Fields for Perception and ForecastingPoster22 citations
  678. UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and MemoryPoster22 citations
  679. Adaptive Fusion of Single-View and Multi-View Depth for Autonomous DrivingPoster21 citations
  680. ArtAdapter: Text-to-Image Style Transfer using Multi-Level Style Encoder and Explicit AdaptationPoster21 citations
  681. As-Plausible-As-Possible: Plausibility-Aware Mesh Deformation Using 2D Diffusion PriorsPoster21 citations
  682. BoQ: A Place is Worth a Bag of Learnable QueriesPoster21 citations
  683. CONFORM: Contrast is All You Need for High-Fidelity Text-to-Image Diffusion ModelsPoster21 citations
  684. Depth-Aware Concealed Crop Detection in Dense Agricultural ScenesPoster21 citations
  685. DiffMOT: A Real-time Diffusion-based Multiple Object Tracker with Non-linear PredictionPoster21 citations
  686. Discovering and Mitigating Visual Biases through Keyword ExplanationHighlight21 citations
  687. ECLIPSE: A Resource-Efficient Text-to-Image Prior for Image GenerationsPoster21 citations
  688. Efficient Multi-scale Network with Learnable Discrete Wavelet Transform for Blind Motion DeblurringPoster21 citations
  689. Egocentric Whole-Body Motion Capture with FisheyeViT and Diffusion-Based Motion RefinementPoster21 citations
  690. EmoGen: Emotional Image Content Generation with Text-to-Image Diffusion ModelsPoster21 citations
  691. Emotional Speech-driven 3D Body Animation via Disentangled Latent DiffusionPoster21 citations
  692. End-to-End Spatio-Temporal Action Localisation with Video TransformersPoster21 citations
  693. Fair Federated Learning under Domain Skew with Local Consistency and Domain DiversityPoster21 citations
  694. FairRAG: Fair Human Generation via Fair Retrieval AugmentationPoster21 citations
  695. Frequency Decoupling for Motion Magnification via Multi-Level Isomorphic ArchitecturePoster21 citations
  696. Frequency-aware Event-based Video Deblurring for Real-World Motion BlurPoster21 citations
  697. HOIDiffusion: Generating Realistic 3D Hand-Object Interaction DataPoster21 citations
  698. HybridNeRF: Efficient Neural Rendering via Adaptive Volumetric SurfacesHighlight21 citations
  699. Image Restoration by Denoising Diffusion Models with Iteratively Preconditioned GuidancePoster21 citations
  700. Interactive Continual Learning: Fast and Slow ThinkingPoster21 citations
  701. It's All About Your Sketch: Democratising Sketch Control in Diffusion ModelsPoster21 citations
  702. Link-Context Learning for Multimodal LLMsPoster21 citations
  703. MAS: Multi-view Ancestral Sampling for 3D Motion Generation Using 2D DiffusionPoster21 citations
  704. MoPE-CLIP: Structured Pruning for Efficient Vision-Language Models with Module-wise Pruning Error MetricPoster21 citations
  705. Motion-adaptive Separable Collaborative Filters for Blind Motion DeblurringPoster21 citations
  706. Nearest is Not Dearest: Towards Practical Defense against Quantization-conditioned Backdoor AttacksPoster21 citations
  707. OMG: Towards Open-vocabulary Motion Generation via Mixture of ControllersPoster21 citations
  708. Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank ExpertsHighlight21 citations
  709. One-Shot Open Affordance Learning with Foundation ModelsPoster21 citations
  710. RadarDistill: Boosting Radar-based Object Detection Performance via Knowledge Distillation from LiDAR FeaturesPoster21 citations
  711. Scaling Diffusion Models to Real-World 3D LiDAR Scene CompletionPoster21 citations
  712. TACO: Benchmarking Generalizable Bimanual Tool-ACtion-Object UnderstandingPoster21 citations
  713. Towards Accurate Post-training Quantization for Diffusion ModelsHighlight21 citations
  714. Vision-and-Language Navigation via Causal LearningPoster21 citations
  715. Visual Anagrams: Generating Multi-View Optical Illusions with Diffusion ModelsPoster21 citations
  716. What If the TV Was Off? Examining Counterfactual Reasoning Abilities of Multi-modal Language ModelsPoster21 citations
  717. ZeroRF: Fast Sparse View 360deg Reconstruction with Zero PretrainingPoster21 citations
  718. ZeroShape: Regression-based Zero-shot Shape ReconstructionPoster21 citations
  719. 3D Paintbrush: Local Stylization of 3D Shapes with Cascaded Score DistillationPoster20 citations
  720. AiOS: All-in-One-Stage Expressive Human Pose and Shape EstimationPoster20 citations
  721. Alchemist: Parametric Control of Material Properties with Diffusion ModelsPoster20 citations
  722. AllSpark: Reborn Labeled Features from Unlabeled in Transformer for Semi-Supervised Semantic SegmentationPoster20 citations
  723. An Upload-Efficient Scheme for Transferring Knowledge From a Server-Side Pre-trained Generator to Clients in Heterogeneous Federated LearningPoster20 citations
  724. AnySkill: Learning Open-Vocabulary Physical Skill for Interactive AgentsPoster20 citations
  725. BA-SAM: Scalable Bias-Mode Attention Mask for Segment Anything ModelPoster20 citations
  726. Boosting Diffusion Models with Moving Average Sampling in Frequency DomainPoster20 citations
  727. CFAT: Unleashing Triangular Windows for Image Super-resolutionHighlight20 citations
  728. Can Language Beat Numerical Regression? Language-Based Multimodal Trajectory PredictionPoster20 citations
  729. DiffForensics: Leveraging Diffusion Prior to Image Forgery Detection and LocalizationPoster20 citations
  730. Diffusion Handles Enabling 3D Edits for Diffusion Models by Lifting Activations to 3DHighlight20 citations
  731. EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language ModelsHighlight20 citations
  732. Equivariant Plug-and-Play Image ReconstructionPoster20 citations
  733. Federated Generalized Category DiscoveryPoster20 citations
  734. FlowDiffuser: Advancing Optical Flow Estimation with Diffusion ModelsHighlight20 citations
  735. FlowVQTalker: High-Quality Emotional Talking Face Generation through Normalizing Flow and QuantizationPoster20 citations
  736. GOAT-Bench: A Benchmark for Multi-Modal Lifelong NavigationPoster20 citations
  737. HIR-Diff: Unsupervised Hyperspectral Image Restoration Via Improved Diffusion ModelsPoster20 citations
  738. HRVDA: High-Resolution Visual Document AssistantPoster20 citations
  739. HarmonyView: Harmonizing Consistency and Diversity in One-Image-to-3DPoster20 citations
  740. ICP-Flow: LiDAR Scene Flow Estimation with ICPPoster20 citations
  741. InitNO: Boosting Text-to-Image Diffusion Models via Initial Noise OptimizationPoster20 citations
  742. Intraoperative 2D/3D Image Registration via Differentiable X-ray RenderingPoster20 citations
  743. JeDi: Joint-Image Diffusion Models for Finetuning-Free Personalized Text-to-Image GenerationPoster20 citations
  744. LP++: A Surprisingly Strong Linear Probe for Few-Shot CLIPPoster20 citations
  745. Language-driven Grasp DetectionPoster20 citations
  746. Learning Diffusion Texture Priors for Image RestorationHighlight20 citations
  747. Mask Grounding for Referring Image SegmentationPoster20 citations
  748. Multi-Scale Video Anomaly Detection by Multi-Grained Spatio-Temporal Representation LearningHighlight20 citations
  749. Neural Clustering based Visual Representation LearningPoster20 citations
  750. Neural Sign Actors: A Diffusion Model for 3D Sign Language Production from TextPoster20 citations
  751. Relightable and Animatable Neural Avatar from Sparse-View VideoHighlight20 citations
  752. Resurrecting Old Classes with New Data for Exemplar-Free Continual LearningPoster20 citations
  753. Revisiting the Domain Shift and Sample Uncertainty in Multi-source Active Domain TransferPoster20 citations
  754. SPOC: Imitating Shortest Paths in Simulation Enables Effective Navigation and Manipulation in the Real WorldPoster20 citations
  755. See Say and Segment: Teaching LMMs to Overcome False PremisesPoster20 citations
  756. ViTamin: Designing Scalable Vision Models in the Vision-Language EraPoster20 citations
  757. 3D Human Pose Perception from Egocentric Stereo VideosHighlight19 citations
  758. AutoAD III: The Prequel - Back to the PixelsPoster19 citations
  759. CAGE: Controllable Articulation GEnerationPoster19 citations
  760. Class Tokens Infusion for Weakly Supervised Semantic SegmentationPoster19 citations
  761. Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion ModelPoster19 citations
  762. Collaborative Semantic Occupancy Prediction with Hybrid Feature Fusion in Connected Automated VehiclesPoster19 citations
  763. DiPrompT: Disentangled Prompt Tuning for Multiple Latent Domain Generalization in Federated LearningPoster19 citations
  764. DiffusionTrack: Point Set Diffusion Model for Visual Object TrackingPoster19 citations
  765. Dual Prototype Attention for Unsupervised Video Object SegmentationPoster19 citations
  766. Dynamic Prompt Optimizing for Text-to-Image GenerationPoster19 citations
  767. Each Test Image Deserves A Specific Prompt: Continual Test-Time Adaptation for 2D Medical Image SegmentationPoster19 citations
  768. Enhancing Multimodal Cooperation via Sample-level Modality ValuationPoster19 citations
  769. FakeInversion: Learning to Detect Images from Unseen Text-to-Image Models by Inverting Stable DiffusionPoster19 citations
  770. Generating Human Motion in 3D Scenes from Text DescriptionsPoster19 citations
  771. Gradient-based Parameter Selection for Efficient Fine-TuningPoster19 citations
  772. Image Processing GNN: Breaking Rigidity in Super-ResolutionPoster19 citations
  773. Implicit Discriminative Knowledge Learning for Visible-Infrared Person Re-IdentificationPoster19 citations
  774. Insect-Foundation: A Foundation Model and Large-scale 1M Dataset for Visual Insect UnderstandingHighlight19 citations
  775. Just Add ?! Pose Induced Video Transformers for Understanding Activities of Daily LivingPoster19 citations
  776. LEAD: Learning Decomposition for Source-free Universal Domain AdaptationPoster19 citations
  777. LEMON: Learning 3D Human-Object Interaction Relation from 2D ImagesPoster19 citations
  778. Learning Correlation Structures for Vision TransformersPoster19 citations
  779. Learning the 3D Fauna of the WebPoster19 citations
  780. MVD-Fusion: Single-view 3D via Depth-consistent Multi-view GenerationPoster19 citations
  781. MVHumanNet: A Large-scale Dataset of Multi-view Daily Dressing Human CapturesPoster19 citations
  782. Matching 2D Images in 3D: Metric Relative Pose from Metric CorrespondencesPoster19 citations
  783. Mitigating Motion Blur in Neural Radiance Fields with Events and FramesPoster19 citations
  784. MonoNPHM: Dynamic Head Reconstruction from Monocular VideosHighlight19 citations
  785. Multi-Modal Proxy Learning Towards Personalized Visual Multiple ClusteringPoster19 citations
  786. Multi-modal Instruction Tuned LLMs with Fine-grained Visual PerceptionHighlight19 citations
  787. MultiDiff: Consistent Novel View Synthesis from a Single ImagePoster19 citations
  788. Neural Redshift: Random Networks are not Random FunctionsPoster19 citations
  789. OmniViD: A Generative Framework for Universal Video UnderstandingPoster19 citations
  790. PaSCo: Urban 3D Panoptic Scene Completion with Uncertainty AwarenessPoster19 citations
  791. Portrait4D: Learning One-Shot 4D Head Avatar Synthesis using Synthetic DataPoster19 citations
  792. Prompt Highlighter: Interactive Control for Multi-Modal LLMsPoster19 citations
  793. Scene Adaptive Sparse Transformer for Event-based Object DetectionPoster19 citations
  794. SwitchLight: Co-design of Physics-driven Architecture and Pre-training Framework for Human Portrait RelightingHighlight19 citations
  795. Text-Driven Image Editing via Learnable RegionsPoster19 citations
  796. Think Twice Before Selection: Federated Evidential Active Learning for Medical Image Analysis with Domain ShiftsPoster19 citations
  797. Towards Memorization-Free Diffusion ModelsPoster19 citations
  798. Transductive Zero-Shot and Few-Shot CLIPHighlight19 citations
  799. UniVS: Unified and Universal Video Segmentation with Prompts as QueriesPoster19 citations
  800. Visual-Augmented Dynamic Semantic Prototype for Generative Zero-Shot LearningPoster19 citations
  801. When StyleGAN Meets Stable Diffusion: a W+ Adapter for Personalized Image GenerationPoster19 citations
  802. AVFF: Audio-Visual Feature Fusion for Video Deepfake DetectionPoster18 citations
  803. Adaptive Multi-Modal Cross-Entropy Loss for Stereo MatchingPoster18 citations
  804. Arbitrary-Scale Image Generation and Upsampling using Latent Diffusion Model and Implicit Neural DecoderPoster18 citations
  805. CAD-SIGNet: CAD Language Inference from Point Clouds using Layer-wise Sketch Instance Guided AttentionHighlight18 citations
  806. CRKD: Enhanced Camera-Radar Object Detection with Cross-modality Knowledge DistillationPoster18 citations
  807. Can't Make an Omelette Without Breaking Some Eggs: Plausible Action Anticipation Using Large Video-Language ModelsPoster18 citations
  808. Contextrast: Contextual Contrastive Learning for Semantic SegmentationPoster18 citations
  809. Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional UnderstandingPoster18 citations
  810. Customization Assistant for Text-to-Image GenerationPoster18 citations
  811. CyberDemo: Augmenting Simulated Human Demonstration for Real-World Dexterous ManipulationPoster18 citations
  812. D^4: Dataset Distillation via Disentangled Diffusion ModelPoster18 citations
  813. Dispel Darkness for Better Fusion: A Controllable Visual Enhancer based on Cross-modal Conditional Adversarial LearningPoster18 citations
  814. Distilling Vision-Language Models on Millions of VideosPoster18 citations
  815. Domain-Agnostic Mutual Prompting for Unsupervised Domain AdaptationPoster18 citations
  816. FACT: Frame-Action Cross-Attention Temporal Modeling for Efficient Action SegmentationPoster18 citations
  817. FedAS: Bridging Inconsistency in Personalized Federated LearningPoster18 citations
  818. FinePOSE: Fine-Grained Prompt-Driven 3D Human Pose Estimation via Diffusion ModelsHighlight18 citations
  819. Fourier Priors-Guided Diffusion for Zero-Shot Joint Low-Light Enhancement and DeblurringPoster18 citations
  820. Generalizable Whole Slide Image Classification with Fine-Grained Visual-Semantic InteractionPoster18 citations
  821. HiKER-SGG: Hierarchical Knowledge Enhanced Robust Scene Graph GenerationPoster18 citations
  822. High-fidelity Person-centric Subject-to-Image SynthesisPoster18 citations
  823. Implicit Event-RGBD Neural SLAMHighlight18 citations
  824. Instance-Adaptive and Geometric-Aware Keypoint Learning for Category-Level 6D Object Pose EstimationPoster18 citations
  825. Iterated Learning Improves Compositionality in Large Vision-Language ModelsPoster18 citations
  826. KVQ: Kwai Video Quality Assessment for Short-form VideosPoster18 citations
  827. LASO: Language-guided Affordance Segmentation on 3D ObjectPoster18 citations
  828. Leveraging Vision-Language Models for Improving Domain Generalization in Image ClassificationPoster18 citations
  829. LiDAR4D: Dynamic Neural Fields for Novel Space-time View LiDAR SynthesisPoster18 citations
  830. Localization Is All You Evaluate: Data Leakage in Online Mapping Datasets and How to Fix ItPoster18 citations
  831. MatSynth: A Modern PBR Materials DatasetPoster18 citations
  832. MemSAM: Taming Segment Anything Model for Echocardiography Video SegmentationPoster18 citations
  833. NAYER: Noisy Layer Data Generation for Efficient and Effective Data-free Knowledge DistillationPoster18 citations
  834. OAKINK2: A Dataset of Bimanual Hands-Object Manipulation in Complex Task CompletionPoster18 citations
  835. Open-Vocabulary Attention Maps with Token Optimization for Semantic Segmentation in Diffusion ModelsPoster18 citations
  836. Open-Vocabulary Semantic Segmentation with Image Embedding BalancingPoster18 citations
  837. PTQ4SAM: Post-Training Quantization for Segment AnythingPoster18 citations
  838. Privacy-Preserving Face Recognition Using Trainable Feature SubtractionPoster18 citations
  839. Rethinking Multi-domain Generalization with A General Learning ObjectivePoster18 citations
  840. Revisiting Adversarial Training at ScalePoster18 citations
  841. Sculpt3D: Multi-View Consistent Text-to-3D Generation with Sparse 3D PriorPoster18 citations
  842. Situational Awareness Matters in 3D Vision Language ReasoningPoster18 citations
  843. SmartRefine: A Scenario-Adaptive Refinement Framework for Efficient Motion PredictionPoster18 citations
  844. Taming Stable Diffusion for Text to 360 Panorama Image GenerationHighlight18 citations
  845. TeTriRF: Temporal Tri-Plane Radiance Fields for Efficient Free-Viewpoint VideoPoster18 citations
  846. Test-Time Adaptation for Depth CompletionPoster18 citations
  847. TextCraftor: Your Text Encoder Can be Image Quality ControllerPoster18 citations
  848. Towards Efficient Replay in Federated Incremental LearningPoster18 citations
  849. Towards Robust Event-guided Low-Light Image Enhancement: A Large-Scale Real-World Event-Image Dataset and Novel ApproachPoster18 citations
  850. Towards Surveillance Video-and-Language Understanding: New Dataset Baselines and ChallengesPoster18 citations
  851. Training Generative Image Super-Resolution Models by Wavelet-Domain Losses Enables Better Control of ArtifactsPoster18 citations
  852. VideoCutLER: Surprisingly Simple Unsupervised Video Instance SegmentationPoster18 citations
  853. Zero-shot Referring Expression Comprehension via Structural Similarity Between Images and CaptionsPoster18 citations
  854. Active Generalized Category DiscoveryPoster17 citations
  855. Addressing Background Context Bias in Few-Shot Segmentation through Iterative ModulationPoster17 citations
  856. Anomaly Heterogeneity Learning for Open-set Supervised Anomaly DetectionPoster17 citations
  857. Any-Shift Prompting for Generalization over DistributionsPoster17 citations
  858. Building Bridges across Spatial and Temporal Resolutions: Reference-Based Super-Resolution via Change Priors and Conditional Diffusion ModelPoster17 citations
  859. CLiC: Concept Learning in ContextHighlight17 citations
  860. Cloud-Device Collaborative Learning for Multimodal Large Language ModelsPoster17 citations
  861. Clustering Propagation for Universal Medical Image SegmentationPoster17 citations
  862. Contrastive Pre-Training with Multi-View Fusion for No-Reference Point Cloud Quality AssessmentPoster17 citations
  863. Convolutional Prompting meets Language Models for Continual LearningPoster17 citations
  864. CosmicMan: A Text-to-Image Foundation Model for HumansHighlight17 citations
  865. Delving into the Trajectory Long-tail Distribution for Muti-object TrackingPoster17 citations
  866. Diffusion Time-step Curriculum for One Image to 3D GenerationPoster17 citations
  867. DiffusionPoser: Real-time Human Motion Reconstruction From Arbitrary Sparse Sensors Using Autoregressive DiffusionPoster17 citations
  868. DuPL: Dual Student with Trustworthy Progressive Learning for Robust Weakly Supervised Semantic SegmentationPoster17 citations
  869. EMAGE: Towards Unified Holistic Co-Speech Gesture Generation via Expressive Masked Audio Gesture ModelingPoster17 citations
  870. EgoGen: An Egocentric Synthetic Data GeneratorPoster17 citations
  871. Enhance Image Classification via Inter-Class Image Mixup with Diffusion ModelPoster17 citations
  872. Exploiting Diffusion Prior for Generalizable Dense PredictionPoster17 citations
  873. FSC: Few-point Shape CompletionPoster17 citations
  874. FaceChain-ImagineID: Freely Crafting High-Fidelity Diverse Talking Faces from Disentangled AudioPoster17 citations
  875. FreeCustom: Tuning-Free Customized Image Generation for Multi-Concept CompositionPoster17 citations
  876. FreeKD: Knowledge Distillation via Semantic Frequency PromptPoster17 citations
  877. HINTED: Hard Instance Enhanced Detector with Mixed-Density Feature Fusion for Sparsely-Supervised 3D Object DetectionPoster17 citations
  878. HomoFormer: Homogenized Transformer for Image Shadow RemovalPoster17 citations
  879. Inlier Confidence Calibration for Point Cloud RegistrationPoster17 citations
  880. Learning without Exact Guidance: Updating Large-scale High-resolution Land Cover Maps from Low-resolution Historical LabelsHighlight17 citations
  881. LoSh: Long-Short Text Joint Prediction Network for Referring Video Object SegmentationPoster17 citations
  882. MetaCloak: Preventing Unauthorized Subject-driven Text-to-image Diffusion-based Synthesis via Meta-learningPoster17 citations
  883. Modality-agnostic Domain Generalizable Medical Image Segmentation by Multi-Frequency in Multi-Scale AttentionPoster17 citations
  884. NoiseCLR: A Contrastive Learning Approach for Unsupervised Discovery of Interpretable Directions in Diffusion ModelsPoster17 citations
  885. Probing Synergistic High-Order Interaction in Infrared and Visible Image FusionPoster17 citations
  886. Psychometry: An Omnifit Model for Image Reconstruction from Human Brain ActivityPoster17 citations
  887. RankMatch: Exploring the Better Consistency Regularization for Semi-supervised Semantic SegmentationPoster17 citations
  888. Rethinking Boundary Discontinuity Problem for Oriented Object DetectionPoster17 citations
  889. Rethinking the Representation in Federated Unsupervised Learning with Non-IID DataPoster17 citations
  890. SCoFT: Self-Contrastive Fine-Tuning for Equitable Image GenerationPoster17 citations
  891. SHAP-EDITOR: Instruction-Guided Latent 3D Editing in SecondsPoster17 citations
  892. SemCity: Semantic Scene Generation with Triplane DiffusionPoster17 citations
  893. SocialCounterfactuals: Probing and Mitigating Intersectional Social Biases in Vision-Language Models with Counterfactual ExamplesPoster17 citations
  894. TAMM: TriAdapter Multi-Modal Learning for 3D Shape UnderstandingPoster17 citations
  895. Text-to-3D Generation with Bidirectional Diffusion using both 2D and 3D priorsPoster17 citations
  896. Training-Free Pretrained Model MergingPoster17 citations
  897. Unified Language-driven Zero-shot Domain AdaptationPoster17 citations
  898. VP3D: Unleashing 2D Visual Prompt for Text-to-3D GenerationPoster17 citations
  899. ViLa-MIL: Dual-scale Vision-Language Multiple Instance Learning for Whole Slide Image ClassificationPoster17 citations
  900. WateRF: Robust Watermarks in Radiance Fields for Protection of CopyrightsPoster17 citations
  901. 6D-Diff: A Keypoint Diffusion Framework for 6D Object Pose EstimationPoster16 citations
  902. APSeg: Auto-Prompt Network for Cross-Domain Few-Shot Semantic SegmentationPoster16 citations
  903. AdaRevD: Adaptive Patch Exiting Reversible Decoder Pushes the Limit of Image DeblurringPoster16 citations
  904. Balancing Act: Distribution-Guided Debiasing in Diffusion ModelsPoster16 citations
  905. COCONut: Modernizing COCO SegmentationPoster16 citations
  906. Communication-Efficient Federated Learning with Accelerated Client GradientPoster16 citations
  907. Composing Object Relations and Attributes for Image-Text MatchingPoster16 citations
  908. Constructing and Exploring Intermediate Domains in Mixed Domain Semi-supervised Medical Image SegmentationPoster16 citations
  909. Context-Guided Spatio-Temporal Video GroundingPoster16 citations
  910. Context-based and Diversity-driven Specificity in Compositional Zero-Shot LearningPoster16 citations
  911. Dexterous Grasp TransformerPoster16 citations
  912. Dual-View Visual Contextualization for Web NavigationPoster16 citations
  913. Dynamic Inertial Poser (DynaIP): Part-Based Motion Dynamics Learning for Enhanced Human Pose Estimation with Sparse Inertial SensorsPoster16 citations
  914. EAGLE: Eigen Aggregation Learning for Object-Centric Unsupervised Semantic SegmentationHighlight16 citations
  915. FMA-Net: Flow-Guided Dynamic Filtering and Iterative Feature Refinement with Multi-Attention for Joint Video Super-Resolution and DeblurringPoster16 citations
  916. Fantastic Animals and Where to Find Them: Segment Any Marine Animal with Dual SAMHighlight16 citations
  917. Friendly Sharpness-Aware MinimizationPoster16 citations
  918. Generative Region-Language Pretraining for Open-Ended Object DetectionPoster16 citations
  919. How to Handle Sketch-Abstraction in Sketch-Based Image Retrieval?Poster16 citations
  920. LTGC: Long-tail Recognition via Leveraging LLMs-driven Generated ContentPoster16 citations
  921. Language-Driven Anchors for Zero-Shot Adversarial RobustnessPoster16 citations
  922. Language-driven All-in-one Adverse Weather RemovalPoster16 citations
  923. Learning Background Prompts to Discover Implicit Knowledge for Open Vocabulary Object DetectionPoster16 citations
  924. LeftRefill: Filling Right Canvas based on Left Reference through Generalized Text-to-Image Diffusion ModelPoster16 citations
  925. LightIt: Illumination Modeling and Control for Diffusion ModelsPoster16 citations
  926. Lookahead Exploration with Neural Radiance Representation for Continuous Vision-Language NavigationHighlight16 citations
  927. LowRankOcc: Tensor Decomposition and Low-Rank Recovery for Vision-based 3D Semantic Occupancy PredictionPoster16 citations
  928. MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion ModelsHighlight16 citations
  929. PI3D: Efficient Text-to-3D Generation with Pseudo-Image DiffusionPoster16 citations
  930. PointBeV: A Sparse Approach for BeV PredictionsPoster16 citations
  931. Prompt-Enhanced Multiple Instance Learning for Weakly Supervised Video Anomaly DetectionPoster16 citations
  932. Prompting Hard or Hardly Prompting: Prompt Inversion for Text-to-Image Diffusion ModelsPoster16 citations
  933. Revisiting Non-Autoregressive Transformers for Efficient Image SynthesisPoster16 citations
  934. SFOD: Spiking Fusion Object DetectorPoster16 citations
  935. SPECAT: SPatial-spEctral Cumulative-Attention Transformer for High-Resolution Hyperspectral Image ReconstructionPoster16 citations
  936. Simple Semantic-Aided Few-Shot LearningPoster16 citations
  937. Synthesize Step-by-Step: Tools Templates and LLMs as Data Generators for Reasoning-Based Chart VQAPoster16 citations
  938. THRONE: An Object-based Hallucination Benchmark for the Free-form Generations of Large Vision-Language ModelsPoster16 citations
  939. TI2V-Zero: Zero-Shot Image Conditioning for Text-to-Video Diffusion ModelsPoster16 citations
  940. Texture-Preserving Diffusion Models for High-Fidelity Virtual Try-OnPoster16 citations
  941. TokenCompose: Text-to-Image Diffusion with Token-level SupervisionPoster16 citations
  942. Training-Free Open-Vocabulary Segmentation with Offline Diffusion-Augmented Prototype GenerationPoster16 citations
  943. TransLoc4D: Transformer-based 4D Radar Place RecognitionPoster16 citations
  944. Transfer CLIP for Generalizable Image DenoisingPoster16 citations
  945. UDiFF: Generating Conditional Unsigned Distance Fields with Optimal Wavelet DiffusionPoster16 citations
  946. UniGarmentManip: A Unified Framework for Category-Level Garment Manipulation via Dense Visual CorrespondencePoster16 citations
  947. Universal Segmentation at Arbitrary Granularity with Language InstructionPoster16 citations
  948. VISTA-LLAMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual TokensPoster16 citations
  949. ViT-Lens: Towards Omni-modal RepresentationsPoster16 citations
  950. Visual Fact Checker: Enabling High-Fidelity Detailed Caption GenerationPoster16 citations
  951. You'll Never Walk Alone: A Sketch and Text Duet for Fine-Grained Image RetrievalPoster16 citations
  952. iKUN: Speak to Trackers without RetrainingPoster16 citations
  953. vid-TLDR: Training Free Token Merging for Light-weight Video TransformerPoster16 citations
  954. A Conditional Denoising Diffusion Probabilistic Model for Point Cloud UpsamplingPoster15 citations
  955. A Simple Baseline for Efficient Hand Mesh ReconstructionPoster15 citations
  956. A Simple Recipe for Language-guided Domain Generalized SegmentationPoster15 citations
  957. AIDE: An Automatic Data Engine for Object Detection in Autonomous DrivingPoster15 citations
  958. AlignSAM: Aligning Segment Anything Model to Open Context via Reinforcement LearningPoster15 citations
  959. Attention-Driven Training-Free Efficiency Enhancement of Diffusion ModelsPoster15 citations
  960. Boosting Neural Representations for Videos with a Conditional DecoderHighlight15 citations
  961. Boosting Object Detection with Zero-Shot Day-Night Domain AdaptationPoster15 citations
  962. CARZero: Cross-Attention Alignment for Radiology Zero-Shot ClassificationPoster15 citations
  963. Calibrating Multi-modal Representations: A Pursuit of Group Robustness without AnnotationsPoster15 citations
  964. Category-Level Multi-Part Multi-Joint 3D Shape AssemblyPoster15 citations
  965. Content-Adaptive Non-Local Convolution for Remote Sensing PansharpeningPoster15 citations
  966. Continual Forgetting for Pre-trained Vision ModelsPoster15 citations
  967. Correlation-Decoupled Knowledge Distillation for Multimodal Sentiment Analysis with Incomplete ModalitiesPoster15 citations
  968. DAVE - A Detect-and-Verify Paradigm for Low-Shot CountingPoster15 citations
  969. DreamPropeller: Supercharge Text-to-3D Generation with Parallel SamplingHighlight15 citations
  970. Dual DETRs for Multi-Label Temporal Action DetectionPoster15 citations
  971. EmoVIT: Revolutionizing Emotion Insights with Visual Instruction TuningPoster15 citations
  972. Enhancing Video Super-Resolution via Implicit Resampling-based AlignmentHighlight15 citations
  973. Error Detection in Egocentric Procedural Task VideosPoster15 citations
  974. Exploiting Inter-sample and Inter-feature Relations in Dataset DistillationPoster15 citations
  975. GenFlow: Generalizable Recurrent Flow for 6D Pose Refinement of Novel ObjectsPoster15 citations
  976. Generative Multi-modal Models are Good Class Incremental LearnersPoster15 citations
  977. Generative Rendering: Controllable 4D-Guided Video Generation with 2D Diffusion ModelsPoster15 citations
  978. H-ViT: A Hierarchical Vision Transformer for Deformable Image RegistrationHighlight15 citations
  979. HDRFlow: Real-Time HDR Video Reconstruction with Large MotionsPoster15 citations
  980. HOISDF: Constraining 3D Hand-Object Pose Estimation with Global Signed Distance FieldsPoster15 citations
  981. Image Sculpting: Precise Object Editing with 3D Geometry ControlPoster15 citations
  982. Image-to-Image Matching via Foundation Models: A New Perspective for Open-Vocabulary Semantic SegmentationPoster15 citations
  983. Improved Visual Grounding through Self-Consistent ExplanationsPoster15 citations
  984. Investigating and Mitigating the Side Effects of Noisy Views for Self-Supervised Clustering Algorithms in Practical Multi-View ScenariosPoster15 citations
  985. Is Vanilla MLP in Neural Radiance Field Enough for Few-shot View Synthesis?Poster15 citations
  986. LEOD: Label-Efficient Object Detection for Event CamerasPoster15 citations
  987. LiveHPS: LiDAR-based Scene-level Human Pose and Shape Estimation in Free EnvironmentHighlight15 citations
  988. Low-Res Leads the Way: Improving Generalization for Super-Resolution by Self-Supervised LearningPoster15 citations
  989. MLIP: Enhancing Medical Visual Representation with Divergence Encoder and Knowledge-guided Contrastive LearningPoster15 citations
  990. Map-Relative Pose Regression for Visual Re-LocalizationHighlight15 citations
  991. MicroCinema: A Divide-and-Conquer Approach for Text-to-Video GenerationHighlight15 citations
  992. MuGE: Multiple Granularity Edge DetectionPoster15 citations
  993. Multi-modal Learning for Geospatial Vegetation ForecastingPoster15 citations
  994. Multi-view Aggregation Network for Dichotomous Image SegmentationHighlight15 citations
  995. NetTrack: Tracking Highly Dynamic Objects with a NetPoster15 citations
  996. OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask LearningPoster15 citations
  997. Open-Vocabulary 3D Semantic Segmentation with Foundation ModelsHighlight15 citations
  998. OpenESS: Event-based Semantic Scene Understanding with Open VocabulariesHighlight15 citations
  999. Overcoming Generic Knowledge Loss with Selective Parameter UpdatePoster15 citations
  1000. Overload: Latency Attacks on Object Detection for Edge DevicesPoster15 citations

Looking for submission deadlines instead? See the conference deadline calendar.

CVPR 2024 Accepted Papers · Full List of 2,640 Papers