← All conferences

CVPR 2023 Accepted Papers

The full list of 2,307 papers accepted at CVPR 2023 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Poster: 2,085Highlight: 222
  1. YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object DetectorsPoster11,111 citations
  2. DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven GenerationPoster2,958 citations
  3. InstructPix2Pix: Learning To Follow Image Editing InstructionsHighlight1,877 citations
  4. Run, Don't Walk: Chasing Higher FLOPS for Faster Neural NetworksPoster1,536 citations
  5. Magic3D: High-Resolution Text-to-3D Content CreationHighlight1,196 citations
  6. Imagic: Text-Based Real Image Editing With Diffusion ModelsPoster1,151 citations
  7. Align Your Latents: High-Resolution Video Synthesis With Latent Diffusion ModelsPoster1,134 citations
  8. ConvNeXt V2: Co-Designing and Scaling ConvNets With Masked AutoencodersPoster1,111 citations
  9. ImageBind: One Embedding Space To Bind Them AllHighlight1,001 citations
  10. InternImage: Exploring Large-Scale Vision Foundation Models With Deformable ConvolutionsHighlight953 citations
  11. Objaverse: A Universe of Annotated 3D ObjectsPoster931 citations
  12. Activating More Pixels in Image Super-Resolution TransformerPoster908 citations
  13. NULL-Text Inversion for Editing Real Images Using Guided Diffusion ModelsPoster899 citations
  14. Multi-Concept Customization of Text-to-Image DiffusionPoster864 citations
  15. BiFormer: Vision Transformer With Bi-Level Routing AttentionPoster856 citations
  16. Reproducible Scaling Laws for Contrastive Language-Image LearningPoster855 citations
  17. MaPLe: Multi-Modal Prompt LearningPoster844 citations
  18. EVA: Exploring the Limits of Masked Visual Representation Learning at ScaleHighlight790 citations
  19. Plug-and-Play Diffusion Features for Text-Driven Image-to-Image TranslationPoster766 citations
  20. Observation-Centric SORT: Rethinking SORT for Robust Multi-Object TrackingPoster756 citations
  21. Planning-Oriented Autonomous DrivingPoster748 citations
  22. GLIGEN: Open-Set Grounded Text-to-Image GenerationPoster673 citations
  23. Image as a Foreign Language: BEiT Pretraining for Vision and Vision-Language TasksPoster621 citations
  24. Scaling Up GANs for Text-to-Image SynthesisHighlight613 citations
  25. K-Planes: Explicit Radiance Fields in Space, Time, and AppearancePoster582 citations
  26. Score Jacobian Chaining: Lifting Pretrained 2D Diffusion Models for 3D GenerationPoster547 citations
  27. On Distillation of Guided Diffusion ModelsPoster526 citations
  28. Open-Vocabulary Semantic Segmentation With Mask-Adapted CLIPPoster519 citations
  29. CDDFuse: Correlation-Driven Dual-Branch Feature Decomposition for Multi-Modality Image FusionPoster503 citations
  30. PIDNet: A Real-Time Semantic Segmentation Network Inspired by PID ControllersPoster485 citations
  31. Mask DINO: Towards a Unified Transformer-Based Framework for Object Detection and SegmentationPoster484 citations
  32. Open-Vocabulary Panoptic Segmentation With Text-to-Image Diffusion ModelsHighlight478 citations
  33. HexPlane: A Fast Representation for Dynamic ScenesPoster474 citations
  34. Latent-NeRF for Shape-Guided Generation of 3D Shapes and TexturesPoster471 citations
  35. Visual Programming: Compositional Visual Reasoning Without TrainingPoster464 citations
  36. EfficientViT: Memory Efficient Vision Transformer With Cascaded Group AttentionPoster458 citations
  37. DepGraph: Towards Any Structural PruningPoster446 citations
  38. OneFormer: One Transformer To Rule Universal Image SegmentationPoster441 citations
  39. VideoMAE V2: Scaling Video Masked Autoencoders With Dual MaskingPoster440 citations
  40. Self-Supervised Learning From Images With a Joint-Embedding Predictive ArchitecturePoster432 citations
  41. Paint by Example: Exemplar-Based Image Editing With Diffusion ModelsPoster429 citations
  42. Neuralangelo: High-Fidelity Neural Surface ReconstructionPoster423 citations
  43. SCConv: Spatial and Channel Reconstruction Convolution for Feature RedundancyPoster423 citations
  44. Neighborhood Attention TransformerPoster406 citations
  45. Generating Human Motion From Textual Descriptions With Discrete RepresentationsPoster402 citations
  46. Executing Your Commands via Motion Diffusion in Latent SpacePoster390 citations
  47. Revisiting Weak-to-Strong Consistency in Semi-Supervised Semantic SegmentationPoster380 citations
  48. MobileNeRF: Exploiting the Polygon Rasterization Pipeline for Efficient Neural Field Rendering on Mobile ArchitecturesPoster373 citations
  49. RODIN: A Generative Model for Sculpting 3D Digital Avatars Using DiffusionHighlight369 citations
  50. All Are Worth Words: A ViT Backbone for Diffusion ModelsPoster355 citations
  51. SimpleNet: A Simple Network for Image Anomaly Detection and LocalizationPoster355 citations
  52. Diffusion Art or Digital Forgery? Investigating Data Replication in Diffusion ModelsPoster341 citations
  53. OpenScene: 3D Scene Understanding With Open VocabulariesPoster341 citations
  54. Scaling Language-Image Pre-Training via MaskingPoster341 citations
  55. High-Resolution Image Reconstruction With Latent Diffusion Models From Human Brain ActivityPoster340 citations
  56. VoxelNeXt: Fully Sparse VoxelNet for 3D Object Detection and TrackingPoster331 citations
  57. Tri-Perspective View for Vision-Based 3D Semantic Occupancy PredictionPoster328 citations
  58. RealFusion: 360deg Reconstruction of Any Object From a Single ImagePoster318 citations
  59. BEVFormer v2: Adapting Modern Image Backbones to Bird's-Eye-View Recognition via Perspective SupervisionHighlight316 citations
  60. Learning a Sparse Transformer Network for Effective Image DerainingHighlight315 citations
  61. Side Adapter Network for Open-Vocabulary Semantic SegmentationHighlight314 citations
  62. MIC: Masked Image Consistency for Context-Enhanced Domain AdaptationPoster310 citations
  63. SadTalker: Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face AnimationPoster308 citations
  64. Inversion-Based Style Transfer With Diffusion ModelsPoster306 citations
  65. FreeNeRF: Improving Few-Shot Neural Rendering With Free Frequency RegularizationPoster300 citations
  66. Safe Latent Diffusion: Mitigating Inappropriate Degeneration in Diffusion ModelsPoster299 citations
  67. SeqTrack: Sequence to Sequence Learning for Visual Object TrackingPoster292 citations
  68. Images Speak in Images: A Generalist Painter for In-Context Visual LearningPoster290 citations
  69. Implicit Diffusion Models for Continuous Super-ResolutionPoster290 citations
  70. Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video CaptioningPoster288 citations
  71. WinCLIP: Zero-/Few-Shot Anomaly Classification and SegmentationPoster282 citations
  72. ULIP: Learning a Unified Representation of Language, Images, and Point Clouds for 3D UnderstandingPoster281 citations
  73. Learned Image Compression With Mixed Transformer-CNN ArchitecturesHighlight278 citations
  74. EDGE: Editable Dance Generation From MusicPoster275 citations
  75. Generalized Decoding for Pixel, Image, and LanguagePoster273 citations
  76. MobileOne: An Improved One Millisecond Mobile BackbonePoster270 citations
  77. SDFusion: Multimodal 3D Shape Completion, Reconstruction, and GenerationPoster269 citations
  78. Lite-Mono: A Lightweight CNN and Transformer Architecture for Self-Supervised Monocular Depth EstimationPoster267 citations
  79. Visual Prompt Multi-Modal TrackingPoster266 citations
  80. Camouflaged Object Detection With Feature Decomposition and Edge ReconstructionPoster260 citations
  81. DiffRF: Rendering-Guided 3D Radiance Field DiffusionHighlight260 citations
  82. Towards Universal Fake Image Detectors That Generalize Across Generative ModelsPoster259 citations
  83. Bidirectional Copy-Paste for Semi-Supervised Medical Image SegmentationPoster258 citations
  84. MAGVIT: Masked Generative Video TransformerHighlight258 citations
  85. VoxFormer: Sparse Voxel Transformer for Camera-Based 3D Semantic Scene CompletionHighlight258 citations
  86. SmartBrush: Text and Shape Guided Object Inpainting With Diffusion ModelHighlight257 citations
  87. DETRs With Hybrid MatchingPoster251 citations
  88. All in One: Exploring Unified Video-Language Pre-TrainingPoster249 citations
  89. RenderDiffusion: Image Diffusion for 3D Reconstruction, Inpainting and GenerationPoster246 citations
  90. Efficient and Explicit Modelling of Image Hierarchies for Image RestorationPoster245 citations
  91. ZegCLIP: Towards Adapting CLIP for Zero-Shot Semantic SegmentationPoster245 citations
  92. 3D Neural Field Generation Using Triplane DiffusionPoster244 citations
  93. NoPe-NeRF: Optimising Neural Radiance Field With No Pose PriorHighlight243 citations
  94. Prompting Large Language Models With Answer Heuristics for Knowledge-Based Visual Question AnsweringPoster241 citations
  95. SparseFusion: Distilling View-Conditioned Diffusion for 3D ReconstructionPoster241 citations
  96. Generative Diffusion Prior for Unified Image Restoration and EnhancementPoster240 citations
  97. Language in a Bottle: Language Model Guided Concept Bottlenecks for Interpretable Image ClassificationPoster239 citations
  98. Query-Centric Trajectory PredictionPoster235 citations
  99. Iterative Geometry Encoding Volume for Stereo MatchingPoster234 citations
  100. SpaText: Spatio-Textual Representation for Controllable Image GenerationPoster226 citations
  101. Blind Image Quality Assessment via Vision-Language Correspondence: A Multitask Learning PerspectivePoster225 citations
  102. ECON: Explicit Clothed Humans Optimized via Normal IntegrationHighlight222 citations
  103. Efficient Frequency Domain-Based Transformers for High-Quality Image DeblurringHighlight222 citations
  104. Diffusion-Based Generation, Optimization, and Planning in 3D ScenesPoster219 citations
  105. OmniObject3D: Large-Vocabulary 3D Object Dataset for Realistic Perception, Reconstruction and GenerationPoster214 citations
  106. CODA-Prompt: COntinual Decomposed Attention-Based Prompting for Rehearsal-Free Continual LearningPoster211 citations
  107. Learning Video Representations From Large Language ModelsHighlight211 citations
  108. Cross-Modal Implicit Relation Reasoning and Aligning for Text-to-Image Person RetrievalPoster210 citations
  109. Cut and Learn for Unsupervised Object Detection and Instance SegmentationPoster209 citations
  110. Co-SLAM: Joint Coordinate and Sparse Parametric Encodings for Neural Real-Time SLAMPoster208 citations
  111. Learning a Simple Low-Light Image Enhancer From Paired Low-Light InstancesPoster208 citations
  112. MM-Diffusion: Learning Multi-Modal Diffusion Models for Joint Audio and Video GenerationPoster206 citations
  113. Curricular Contrastive Regularization for Physics-Aware Single Image DehazingPoster203 citations
  114. Tensor4D: Efficient Neural 4D Decomposition for High-Fidelity Dynamic Reconstruction and RenderingHighlight201 citations
  115. UniSim: A Neural Closed-Loop Sensor SimulatorHighlight201 citations
  116. Prompt, Generate, Then Cache: Cascade of Foundation Models Makes Strong Few-Shot LearnersPoster199 citations
  117. Video Probabilistic Diffusion Models in Projected Latent SpacePoster198 citations
  118. Dream3D: Zero-Shot Text-to-3D Synthesis Using 3D Shape Prior and Text-to-Image Diffusion ModelsPoster195 citations
  119. TriDet: Temporal Action Detection With Relative Boundary ModelingPoster194 citations
  120. Universal Instance Perception As Object Discovery and RetrievalPoster194 citations
  121. Fine-Tuned CLIP Models Are Efficient Video LearnersPoster193 citations
  122. CLIP Is Also an Efficient Segmenter: A Text-Driven Approach for Weakly Supervised Semantic SegmentationPoster190 citations
  123. Dense Distinct Query for End-to-End Object DetectionPoster188 citations
  124. MOTRv2: Bootstrapping End-to-End Multi-Object Tracking by Pretrained Object DetectorsPoster187 citations
  125. Mofusion: A Framework for Denoising-Diffusion-Based Motion SynthesisHighlight187 citations
  126. Spherical Transformer for LiDAR-Based 3D RecognitionPoster187 citations
  127. GRES: Generalized Referring Expression SegmentationHighlight186 citations
  128. Imagen Editor and EditBench: Advancing and Evaluating Text-Guided Image InpaintingHighlight185 citations
  129. OpenGait: Revisiting Gait Recognition Towards Better PracticalityHighlight184 citations
  130. CLIP2Scene: Towards Label-Efficient 3D Scene Understanding by CLIPPoster183 citations
  131. SPARF: Neural Radiance Fields From Sparse and Noisy PosesHighlight182 citations
  132. SINE: SINgle Image Editing With Text-to-Image Diffusion ModelsPoster181 citations
  133. MVImgNet: A Large-Scale Dataset of Multi-View ImagesPoster180 citations
  134. V2V4Real: A Real-World Large-Scale Dataset for Vehicle-to-Vehicle Cooperative PerceptionHighlight180 citations
  135. Fake It Till You Make It: Learning Transferable Representations From Synthetic ImageNet ClonesPoster179 citations
  136. Post-Training Quantization on Diffusion ModelsPoster179 citations
  137. Virtual Sparse Convolution for Multimodal 3D Object DetectionPoster179 citations
  138. Robust Dynamic Radiance FieldsPoster178 citations
  139. ESLAM: Efficient Dense SLAM System Based on Hybrid Representation of Signed Distance FieldsHighlight177 citations
  140. LayoutDiffusion: Controllable Diffusion Model for Layout-to-Image GenerationPoster177 citations
  141. Generalized Relation Modeling for Transformer TrackingPoster176 citations
  142. CodeTalker: Speech-Driven 3D Facial Animation With Discrete Motion PriorPoster175 citations
  143. Conditional Image-to-Video Generation With Latent Flow Diffusion ModelsPoster175 citations
  144. ARCTIC: A Dataset for Dexterous Bimanual Hand-Object ManipulationPoster174 citations
  145. From Images to Textual Prompts: Zero-Shot Visual Question Answering With Frozen Large Language ModelsPoster174 citations
  146. Ambiguous Medical Image Segmentation Using Diffusion ModelsPoster172 citations
  147. Feature Shrinkage Pyramid for Camouflaged Object Detection With TransformersPoster172 citations
  148. Neural Video Compression With Diverse ContextsPoster172 citations
  149. EDICT: Exact Diffusion Inversion via Coupled TransformationsPoster171 citations
  150. GALIP: Generative Adversarial CLIPs for Text-to-Image SynthesisPoster171 citations
  151. MAGE: MAsked Generative Encoder To Unify Representation Learning and Image SynthesisPoster171 citations
  152. DeSTSeg: Segmentation Guided Denoising Student-Teacher for Anomaly DetectionPoster170 citations
  153. Benchmarking Self-Supervised Learning on Diverse Pathology DatasetsPoster169 citations
  154. Contrastive Semi-Supervised Learning for Underwater Image Restoration via Reliable BankPoster169 citations
  155. NeRDi: Single-View NeRF Synthesis With Language-Guided Diffusion As General Image PriorsPoster169 citations
  156. Hierarchical Fine-Grained Image Forgery Detection and LocalizationPoster168 citations
  157. PLA: Language-Driven Open-Vocabulary 3D Scene UnderstandingPoster168 citations
  158. MaskCLIP: Masked Self-Distillation Advances Contrastive Language-Image PretrainingPoster166 citations
  159. 3D Registration With Maximal CliquesPoster165 citations
  160. Affordances From Human Videos as a Versatile Representation for RoboticsPoster165 citations
  161. BBDM: Image-to-Image Translation With Brownian Bridge Diffusion ModelsPoster165 citations
  162. Revisiting Reverse Distillation for Anomaly DetectionPoster165 citations
  163. PoseFormerV2: Exploring Frequency Domain for Efficient and Robust 3D Human Pose EstimationPoster164 citations
  164. ReCo: Region-Controlled Text-to-Image GenerationPoster163 citations
  165. WIRE: Wavelet Implicit Neural RepresentationsPoster163 citations
  166. Revealing the Dark Secrets of Masked Image ModelingPoster162 citations
  167. Finetune Like You Pretrain: Improved Finetuning of Zero-Shot Vision ModelsPoster161 citations
  168. Interactive and Explainable Region-Guided Radiology Report GenerationPoster159 citations
  169. PointAvatar: Deformable Point-Based Head Avatars From VideosPoster159 citations
  170. BEDLAM: A Synthetic Dataset of Bodies Exhibiting Detailed Lifelike Animated MotionHighlight158 citations
  171. Token Contrast for Weakly-Supervised Semantic SegmentationPoster158 citations
  172. Learning 3D Representations From 2D Pre-Trained Models via Image-to-Point Masked AutoencodersPoster157 citations
  173. TruFor: Leveraging All-Round Clues for Trustworthy Image Forgery Detection and LocalizationPoster157 citations
  174. BundleSDF: Neural 6-DoF Tracking and 3D Reconstruction of Unknown ObjectsPoster156 citations
  175. DiffPose: Toward More Reliable 3D Pose EstimationPoster156 citations
  176. F2-NeRF: Fast Neural Radiance Field Training With Free Camera TrajectoriesHighlight156 citations
  177. Implicit Identity Leakage: The Stumbling Block to Improving Deepfake Detection GeneralizationPoster156 citations
  178. Seeing Beyond the Brain: Conditional Diffusion Model With Sparse Masked Modeling for Vision DecodingPoster156 citations
  179. CREPE: Can Vision-Language Foundation Models Reason Compositionally?Highlight154 citations
  180. Dynamic Graph Enhanced Contrastive Learning for Chest X-Ray Report GenerationPoster153 citations
  181. CoWs on Pasture: Baselines and Benchmarks for Language-Driven Zero-Shot Object NavigationPoster152 citations
  182. N-Gram in Swin Transformers for Efficient Lightweight Image Super-ResolutionPoster151 citations
  183. Query-Dependent Video Representation for Moment Retrieval and Highlight DetectionPoster151 citations
  184. CORA: Adapting CLIP for Open-Vocabulary Detection With Region Prompting and Anchor Pre-MatchingPoster150 citations
  185. DKM: Dense Kernelized Feature Matching for Geometry EstimationHighlight148 citations
  186. Learning Semantic-Aware Knowledge Guidance for Low-Light Image EnhancementPoster148 citations
  187. Leapfrog Diffusion Model for Stochastic Trajectory PredictionPoster147 citations
  188. Learning Discriminative Representations for Skeleton Based Action RecognitionPoster147 citations
  189. Recurrent Vision Transformers for Object Detection With Event CamerasPoster147 citations
  190. Instant Volumetric Head AvatarsPoster146 citations
  191. PolyFormer: Referring Image Segmentation As Sequential Polygon GenerationPoster146 citations
  192. Collaborative Diffusion for Multi-Modal Face Generation and EditingPoster145 citations
  193. Person Image Synthesis via Denoising Diffusion ModelPoster144 citations
  194. Multimodal Prompting With Missing Modalities for Visual RecognitionPoster143 citations
  195. Temporal Attention Unit: Towards Efficient Spatiotemporal Predictive LearningPoster143 citations
  196. RIDCP: Revitalizing Real Image Dehazing via High-Quality Codebook PriorsPoster142 citations
  197. Rethinking Federated Learning With Domain Shift: A Prototype ViewPoster142 citations
  198. StyleRF: Zero-Shot 3D Style Transfer of Neural Radiance FieldsPoster142 citations
  199. ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model With Knowledge-Enhanced Mixture-of-Denoising-ExpertsHighlight140 citations
  200. LoGoNet: Towards Accurate 3D Object Detection With Local-to-Global Cross-Modal FusionPoster140 citations
  201. SPIn-NeRF: Multiview Segmentation and Perceptual Inpainting With Neural Radiance FieldsPoster140 citations
  202. DSVT: Dynamic Sparse Voxel Transformer With Rotated SetsPoster139 citations
  203. Learning To Exploit Temporal Structure for Biomedical Vision-Language ProcessingPoster139 citations
  204. Robust Test-Time Adaptation in Dynamic ScenariosPoster138 citations
  205. Decoupled Multimodal Distilling for Emotion RecognitionHighlight137 citations
  206. Pic2Word: Mapping Pictures to Words for Zero-Shot Composed Image RetrievalPoster137 citations
  207. Implicit Identity Driven Deepfake Face Swapping DetectionPoster135 citations
  208. DCFace: Synthetic Face Generation With Dual Condition Diffusion ModelPoster134 citations
  209. Panoptic Lifting for 3D Scene Understanding With Neural FieldsHighlight134 citations
  210. Deep Deterministic Uncertainty: A New Simple BaselineHighlight133 citations
  211. Aligning Bag of Regions for Open-Vocabulary Object DetectionPoster132 citations
  212. Beyond Appearance: A Semantic Controllable Self-Supervised Learning Framework for Human-Centric Visual TasksPoster132 citations
  213. MotionTrack: Learning Robust Short-Term and Long-Term Motions for Multi-Object TrackingPoster132 citations
  214. Generalizing Dataset Distillation via Deep Generative PriorPoster131 citations
  215. HyperReel: High-Fidelity 6-DoF Video With Ray-Conditioned SamplingHighlight131 citations
  216. NeuralLift-360: Lifting an In-the-Wild 2D Photo to a 3D Object With 360deg ViewsHighlight131 citations
  217. Pseudo-Label Guided Contrastive Learning for Semi-Supervised Medical Image SegmentationPoster131 citations
  218. Regularized Vector Quantization for Tokenized Image SynthesisPoster131 citations
  219. TensoIR: Tensorial Inverse RenderingPoster131 citations
  220. DropMAE: Masked Autoencoders With Spatial-Attention Dropout for Tracking TasksPoster130 citations
  221. EqMotion: Equivariant Multi-Agent Motion Prediction With Invariant Interaction ReasoningPoster130 citations
  222. Omni Aggregation Networks for Lightweight Image Super-ResolutionPoster130 citations
  223. SUDS: Scalable Urban Dynamic ScenesPoster130 citations
  224. Adaptive Sparse Convolutional Networks With Global Context Enhancement for Faster Object Detection on Drone ImagesPoster129 citations
  225. Extracting Motion and Appearance via Inter-Frame Attention for Efficient Video Frame InterpolationPoster129 citations
  226. Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning With Multimodal ModelsPoster129 citations
  227. TryOnDiffusion: A Tale of Two UNetsPoster129 citations
  228. Vid2Avatar: 3D Avatar Reconstruction From Videos in the Wild via Self-Supervised Scene DecompositionPoster129 citations
  229. Delivering Arbitrary-Modal Semantic SegmentationPoster128 citations
  230. One-Stage 3D Whole-Body Mesh Recovery With Component Aware TransformerPoster128 citations
  231. PillarNeXt: Rethinking Network Designs for 3D Object Detection in LiDAR Point CloudsPoster127 citations
  232. MotionDiffuser: Controllable Multi-Agent Motion Prediction Using DiffusionHighlight126 citations
  233. Selective Structured State-Spaces for Long-Form Video UnderstandingPoster126 citations
  234. Taming Diffusion Models for Audio-Driven Co-Speech Gesture GenerationPoster126 citations
  235. Next3D: Generative Neural Texture Rasterization for 3D-Aware Head AvatarsHighlight125 citations
  236. CRAFT: Concept Recursive Activation FacTorization for ExplainabilityPoster124 citations
  237. LaserMix for Semi-Supervised LiDAR Semantic SegmentationHighlight124 citations
  238. LayoutDM: Discrete Diffusion Model for Controllable Layout GenerationPoster124 citations
  239. Solving 3D Inverse Problems Using Pre-Trained 2D Diffusion ModelsPoster124 citations
  240. Learning on Gradients: Generalized Artifacts Representation for GAN-Generated Images DetectionPoster123 citations
  241. ViP3D: End-to-End Visual Trajectory Prediction via 3D Agent QueriesPoster123 citations
  242. DiffusioNeRF: Regularizing Neural Radiance Fields With Denoising Diffusion ModelsPoster122 citations
  243. FedDM: Iterative Distribution Matching for Communication-Efficient Federated LearningPoster122 citations
  244. SVFormer: Semi-Supervised Video Transformer for Action RecognitionPoster122 citations
  245. Uncovering the Disentanglement Capability in Text-to-Image Diffusion ModelsPoster122 citations
  246. Wavelet Diffusion Models Are Fast and Scalable Image GeneratorsPoster122 citations
  247. Back to the Source: Diffusion-Driven Adaptation To Test-Time CorruptionPoster121 citations
  248. FlexiViT: One Model for All Patch SizesPoster121 citations
  249. HOLODIFFUSION: Training a 3D Diffusion Model Using 2D ImagesPoster121 citations
  250. How to Backdoor Diffusion Models?Poster121 citations
  251. InstantAvatar: Learning Avatars From Monocular Video in 60 SecondsPoster121 citations
  252. Rotation-Invariant Transformer for Point Cloud MatchingPoster121 citations
  253. Diffusion Probabilistic Model Made SlimPoster120 citations
  254. Diffusion-SDF: Text-To-Shape via Voxelized DiffusionPoster120 citations
  255. R2Former: Unified Retrieval and Reranking Transformer for Place RecognitionHighlight120 citations
  256. Cap4Video: What Can Auxiliary Captions Do for Text-Video Retrieval?Highlight119 citations
  257. CompletionFormer: Depth Completion With Convolutions and Vision TransformersPoster119 citations
  258. FlowFormer++: Masked Cost Volume Autoencoding for Pretraining Optical Flow EstimationPoster119 citations
  259. Minimizing the Accumulated Trajectory Error To Improve Dataset DistillationPoster119 citations
  260. SmallCap: Lightweight Image Captioning Prompted With Retrieval AugmentationPoster119 citations
  261. UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned PolicyPoster119 citations
  262. Hierarchical Dense Correlation Distillation for Few-Shot SegmentationHighlight118 citations
  263. Multimodal Industrial Anomaly Detection via Hybrid FusionPoster118 citations
  264. Trace and Pace: Controllable Pedestrian Animation via Guided Trajectory DiffusionPoster118 citations
  265. iDisc: Internal Discretization for Monocular Depth EstimationPoster118 citations
  266. MSMDFusion: Fusing LiDAR and Camera at Multiple Scales With Multi-Depth Seeds for 3D Object DetectionPoster117 citations
  267. Robust Mean Teacher for Continual and Gradual Test-Time AdaptationPoster117 citations
  268. Siamese Image Modeling for Self-Supervised Vision Representation LearningPoster117 citations
  269. Phase-Shifting Coder: Predicting Accurate Orientation in Oriented Object DetectionPoster116 citations
  270. RangeViT: Towards Vision Transformers for 3D Semantic Segmentation in Autonomous DrivingPoster116 citations
  271. Task Residual for Tuning Vision-Language ModelsPoster116 citations
  272. Benchmarking Robustness of 3D Object Detection to Common CorruptionsPoster115 citations
  273. Masked Video Distillation: Rethinking Masked Feature Modeling for Self-Supervised Video Representation LearningPoster115 citations
  274. ShadowDiffusion: When Degradation Prior Meets Diffusion Model for Shadow RemovalPoster115 citations
  275. Multi-Modal Learning With Missing Modality via Shared-Specific Feature ModellingPoster114 citations
  276. OmniMAE: Single Model Masked Pretraining on Images and VideosPoster113 citations
  277. V2X-Seq: A Large-Scale Sequential Dataset for Vehicle-Infrastructure Cooperative Perception and ForecastingPoster113 citations
  278. Class Attention Transfer Based Knowledge DistillationPoster112 citations
  279. FreeSeg: Unified, Universal and Open-Vocabulary Image SegmentationPoster112 citations
  280. GCFAgg: Global and Cross-View Feature Aggregation for Multi-View ClusteringPoster112 citations
  281. LargeKernel3D: Scaling Up Kernels in 3D Sparse CNNsPoster112 citations
  282. MCF: Mutual Correction Framework for Semi-Supervised Medical Image SegmentationPoster112 citations
  283. METransformer: Radiology Report Generation by Transformer With Multiple Learnable Expert TokensPoster112 citations
  284. Unifying Vision, Text, and Layout for Universal Document ProcessingHighlight112 citations
  285. Video Event Restoration Based on Keyframes for Video Anomaly DetectionPoster112 citations
  286. Consistent View Synthesis With Pose-Guided Diffusion ModelsPoster111 citations
  287. Guiding Pseudo-Labels With Uncertainty Estimation for Source-Free Unsupervised Domain AdaptationPoster111 citations
  288. Learning With Fantasy: Semantic-Aware Virtual Contrastive Constraint for Few-Shot Class-Incremental LearningPoster111 citations
  289. Sharpness-Aware Gradient Matching for Domain GeneralizationPoster111 citations
  290. Visual Language Pretrained Multiple Instance Zero-Shot Transfer for Histopathology ImagesPoster111 citations
  291. Dynamic Graph Learning With Content-Guided Spatial-Frequency Relation Reasoning for Deepfake DetectionPoster110 citations
  292. MIST: Multi-Modal Iterative Spatial-Temporal Transformer for Long-Form Video Question AnsweringPoster110 citations
  293. Omni3D: A Large Benchmark and Model for 3D Object Detection in the WildPoster110 citations
  294. Re-IQA: Unsupervised Learning for Image Quality Assessment in the WildPoster110 citations
  295. CLIP for All Things Zero-Shot Sketch-Based Image Retrieval, Fine-Grained or NotPoster109 citations
  296. Learning To Generate Text-Grounded Mask for Open-World Semantic Segmentation From Only Image-Text PairsPoster109 citations
  297. PACO: Parts and Attributes of Common ObjectsHighlight109 citations
  298. Unbiased Multiple Instance Learning for Weakly Supervised Video Anomaly DetectionPoster109 citations
  299. CR-FIQA: Face Image Quality Assessment by Learning Sample Relative ClassifiabilityPoster108 citations
  300. SINE: Semantic-Driven Image-Based NeRF Editing With Prior-Guided Editing FieldPoster108 citations
  301. CLIP the Gap: A Single Domain Generalization Approach for Object DetectionPoster107 citations
  302. CLIP2: Contrastive Language-Image-Point Pretraining From Real-World Point Cloud DataPoster107 citations
  303. Decoupling Human and Camera Motion From Videos in the WildPoster107 citations
  304. Mod-Squad: Designing Mixtures of Experts As Modular Multi-Task LearnersPoster107 citations
  305. Continuous Sign Language Recognition With Correlation NetworkPoster106 citations
  306. Interventional Bag Multi-Instance Learning on Whole-Slide Pathological ImagesHighlight106 citations
  307. Multi-Level Logit DistillationPoster106 citations
  308. Pixels, Regions, and Objects: Multiple Enhancement for Salient Object DetectionPoster106 citations
  309. Progressively Optimized Local Radiance Fields for Robust View SynthesisPoster106 citations
  310. Learning Open-Vocabulary Semantic Segmentation Models From Natural Language SupervisionPoster105 citations
  311. Learning Weather-General and Weather-Specific Features for Image Restoration Under Multiple Adverse Weather ConditionsPoster105 citations
  312. VindLU: A Recipe for Effective Video-and-Language PretrainingPoster105 citations
  313. GP-VTON: Towards General Purpose Virtual Try-On via Collaborative Local-Flow Global-Parsing LearningPoster104 citations
  314. Seeing What You Said: Talking Face Generation Guided by a Lip Reading ExpertPoster104 citations
  315. Semantic-Conditional Diffusion Networks for Image CaptioningPoster104 citations
  316. Shape-Erased Feature Learning for Visible-Infrared Person Re-IdentificationPoster104 citations
  317. AMT: All-Pairs Multi-Field Transforms for Efficient Frame InterpolationPoster103 citations
  318. Detecting Everything in the Open World: Towards Universal Object DetectionPoster103 citations
  319. Diversity-Measurable Anomaly DetectionPoster103 citations
  320. Habitat-Matterport 3D Semantics DatasetHighlight102 citations
  321. PyramidFlow: High-Resolution Defect Contrastive Localization Using Pyramid Normalizing FlowPoster102 citations
  322. Twin Contrastive Learning With Noisy LabelsPoster102 citations
  323. Avatars Grow Legs: Generating Smooth Human Motion From Sparse Tracking Inputs With Diffusion ModelPoster101 citations
  324. DeepSolo: Let Transformer Decoder With Explicit Points Solo for Text SpottingPoster101 citations
  325. Lite DETR: An Interleaved Multi-Scale Encoder for Efficient DETRPoster101 citations
  326. Micron-BERT: BERT-Based Facial Micro-Expression RecognitionPoster101 citations
  327. PanoHead: Geometry-Aware 3D Full-Head Synthesis in 360degPoster101 citations
  328. BEVHeight: A Robust Framework for Vision-Based Roadside 3D Object DetectionPoster100 citations
  329. LAVENDER: Unifying Video-Language Understanding As Masked Language ModelingPoster100 citations
  330. Vita-CLIP: Video and Text Adaptive CLIP via Multimodal PromptingPoster100 citations
  331. Bidirectional Cross-Modal Knowledge Exploration for Video Recognition With Pre-Trained Vision-Language ModelsPoster99 citations
  332. DISC: Learning From Noisy Labels via Dynamic Instance-Specific Selection and CorrectionPoster99 citations
  333. EDA: Explicit Text-Decoupling and Dense Alignment for 3D Visual GroundingPoster99 citations
  334. Federated Domain Generalization With Generalization AdjustmentPoster99 citations
  335. Good Is Bad: Causality Inspired Cloth-Debiasing for Cloth-Changing Person Re-IdentificationPoster99 citations
  336. Improved Distribution Matching for Dataset CondensationPoster99 citations
  337. MSeg3D: Multi-Modal 3D Semantic Segmentation for Autonomous DrivingPoster99 citations
  338. PC2: Projection-Conditioned Point Cloud Diffusion for Single-Image 3D ReconstructionHighlight99 citations
  339. Patch-Mix Transformer for Unsupervised Domain Adaptation: A Game PerspectiveHighlight99 citations
  340. Quality-Aware Pre-Trained Models for Blind Image Quality AssessmentPoster99 citations
  341. REVEAL: Retrieval-Augmented Visual-Language Pre-Training With Multi-Source Multimodal Knowledge MemoryHighlight99 citations
  342. TransFlow: Transformer As Flow LearnerHighlight99 citations
  343. Visual Prompt Tuning for Generative Transfer LearningPoster99 citations
  344. 3D Human Pose Estimation via Intuitive PhysicsPoster98 citations
  345. NICO++: Towards Better Benchmarking for Domain GeneralizationPoster98 citations
  346. Zero-Shot Noise2Noise: Efficient Image Denoising Without Any DataPoster98 citations
  347. EcoTTA: Memory-Efficient Continual Test-Time Adaptation via Self-Distilled RegularizationPoster97 citations
  348. AltFreezing for More General Video Face Forgery DetectionHighlight96 citations
  349. Augmentation Matters: A Simple-Yet-Effective Approach to Semi-Supervised Semantic SegmentationPoster96 citations
  350. DR2: Diffusion-Based Robust Degradation Remover for Blind Face RestorationPoster96 citations
  351. Joint Visual Grounding and Tracking With Natural Language SpecificationPoster96 citations
  352. KiUT: Knowledge-Injected U-Transformer for Radiology Report GenerationPoster96 citations
  353. PROB: Probabilistic Objectness for Open World Object DetectionPoster96 citations
  354. Think Twice Before Driving: Towards Scalable Decoders for End-to-End Autonomous DrivingPoster96 citations
  355. Constructing Deep Spiking Neural Networks From Artificial Neural Networks With Knowledge DistillationPoster95 citations
  356. Instance Relation Graph Guided Source-Free Domain Adaptive Object DetectionPoster95 citations
  357. SCPNet: Semantic Scene Completion on Point CloudHighlight95 citations
  358. Self-Positioning Point-Based Transformer for Point Cloud UnderstandingPoster95 citations
  359. Dynamic Conceptional Contrastive Learning for Generalized Category DiscoveryPoster94 citations
  360. Grid-Guided Neural Radiance Fields for Large Urban ScenesPoster94 citations
  361. Label-Free Liver Tumor SegmentationPoster94 citations
  362. MonoHuman: Animatable Human Neural Field From Monocular VideoPoster94 citations
  363. ObjectStitch: Object Compositing With Diffusion ModelPoster94 citations
  364. Open Vocabulary Semantic Segmentation With Patch Aligned Contrastive LearningHighlight94 citations
  365. Parallel Diffusion Models of Operator and Image for Blind Inverse ProblemsPoster94 citations
  366. ReasonNet: End-to-End Driving With Temporal and Global ReasoningPoster94 citations
  367. Referring Multi-Object TrackingPoster94 citations
  368. GEN: Pushing the Limits of Softmax-Based Out-of-Distribution DetectionPoster93 citations
  369. MARLIN: Masked Autoencoder for Facial Video Representation LearnINgPoster93 citations
  370. PIP-Net: Patch-Based Intuitive Prototypes for Interpretable Image ClassificationPoster93 citations
  371. PartMix: Regularization Strategy To Learn Part Discovery for Visible-Infrared Person Re-IdentificationPoster93 citations
  372. A Dynamic Multi-Scale Voxel Flow Network for Video PredictionHighlight92 citations
  373. Exploiting Completeness and Uncertainty of Pseudo Labels for Weakly Supervised Video Anomaly DetectionPoster92 citations
  374. GAPartNet: Cross-Category Domain-Generalizable Object Perception and Manipulation via Generalizable and Actionable PartsHighlight92 citations
  375. Multi-Label Compound Expression Recognition: C-EXPR Database & NetworkPoster92 citations
  376. Teaching Structured Vision & Language Concepts to Vision & Language ModelsPoster92 citations
  377. End-to-End Vectorized HD-Map Construction With Piecewise Bezier CurvePoster91 citations
  378. EventNeRF: Neural Radiance Fields From a Single Colour Event CameraPoster91 citations
  379. NeRF-DS: Neural Radiance Fields for Dynamic Specular ObjectsPoster91 citations
  380. vMAP: Vectorised Object Mapping for Neural Field SLAMPoster91 citations
  381. An Empirical Study of End-to-End Video-Language Transformers With Masked Visual ModelingPoster90 citations
  382. Contrastive Mean Teacher for Domain Adaptive Object DetectorsPoster90 citations
  383. DropKey for Vision TransformerPoster90 citations
  384. PromptCAL: Contrastive Affinity Learning via Auxiliary Prompts for Generalized Novel Category DiscoveryPoster90 citations
  385. Slide-Transformer: Hierarchical Vision Transformer With Local Self-AttentionPoster90 citations
  386. BAD-NeRF: Bundle Adjusted Deblur Neural Radiance FieldsPoster89 citations
  387. Bridging Search Region Interaction With Template for RGB-T TrackingPoster89 citations
  388. Dynamic Coarse-To-Fine Learning for Oriented Tiny Object DetectionPoster89 citations
  389. Filtering, Distillation, and Hard Negatives for Vision-Language Pre-TrainingPoster89 citations
  390. FlatFormer: Flattened Window Attention for Efficient Point Cloud TransformerPoster89 citations
  391. Identity-Preserving Talking Face Generation With Landmark and Appearance PriorsPoster89 citations
  392. Masked Image Training for Generalizable Deep Image DenoisingPoster89 citations
  393. Meta Architecture for Point Cloud AnalysisPoster89 citations
  394. Neural Fields Meet Explicit Geometric Representations for Inverse Rendering of Urban ScenesPoster89 citations
  395. Understanding and Improving Visual Prompting: A Label-Mapping PerspectivePoster89 citations
  396. Vision Transformers Are Parameter-Efficient Audio-Visual LearnersPoster89 citations
  397. Affordance Diffusion: Synthesizing Hand-Object InteractionsPoster88 citations
  398. Boundary Unlearning: Rapid Forgetting of Deep Networks via Shifting the Decision BoundaryPoster88 citations
  399. C-SFDA: A Curriculum Learning Aided Self-Training Framework for Efficient Source Free Domain AdaptationPoster88 citations
  400. DetCLIPv2: Scalable Open-Vocabulary Object Detection Pre-Training via Word-Region AlignmentPoster88 citations
  401. Multiview Compressive Coding for 3D ReconstructionPoster88 citations
  402. PCR: Proxy-Based Contrastive Replay for Online Class-Incremental Continual LearningPoster88 citations
  403. PMR: Prototypical Modal Rebalance for Multimodal LearningPoster88 citations
  404. PermutoSDF: Fast Multi-View Reconstruction With Implicit Surfaces Using Permutohedral LatticesPoster88 citations
  405. CVT-SLR: Contrastive Visual-Textual Transformation for Sign Language Recognition With Variational AlignmentHighlight87 citations
  406. Continual Detection Transformer for Incremental Object DetectionPoster87 citations
  407. HNeRV: A Hybrid Neural Representation for VideosPoster87 citations
  408. Infinite Photorealistic Worlds Using Procedural GenerationPoster87 citations
  409. Neural Kernel Surface ReconstructionHighlight87 citations
  410. Toward Verifiable and Reproducible Human Evaluation for Text-to-Image GenerationPoster87 citations
  411. High-Frequency Stereo Matching NetworkHighlight86 citations
  412. Rethinking Domain Generalization for Face Anti-Spoofing: Separability and AlignmentPoster86 citations
  413. Simple Cues Lead to a Strong Multi-Object TrackerPoster86 citations
  414. ViTs for SITS: Vision Transformers for Satellite Image Time SeriesPoster86 citations
  415. ProxyFormer: Proxy Alignment Assisted Point Cloud Completion With Missing Part Sensitive TransformerPoster85 citations
  416. Collaboration Helps Camera Overtake LiDAR in 3D DetectionPoster84 citations
  417. FFCV: Accelerating Training by Removing Data BottlenecksPoster84 citations
  418. Few-Shot Class-Incremental Learning via Class-Aware Bilateral DistillationPoster84 citations
  419. Ingredient-Oriented Multi-Degradation Learning for Image RestorationPoster84 citations
  420. Prototypical Residual Networks for Anomaly Detection and LocalizationPoster84 citations
  421. Region-Aware Pretraining for Open-Vocabulary Object Detection With Vision TransformersHighlight84 citations
  422. Turning a CLIP Model Into a Scene Text DetectorPoster84 citations
  423. Detecting and Grounding Multi-Modal Media ManipulationPoster83 citations
  424. Explicit Boundary Guided Semi-Push-Pull Contrastive Learning for Supervised Anomaly DetectionPoster83 citations
  425. GD-MAE: Generative Decoder for MAE Pre-Training on LiDAR Point CloudsPoster83 citations
  426. HouseDiffusion: Vector Floorplan Generation via a Diffusion Model With Discrete and Continuous DenoisingPoster83 citations
  427. Joint Token Pruning and Squeezing Towards More Aggressive Compression of Vision TransformersPoster83 citations
  428. MoLo: Motion-Augmented Long-Short Contrastive Learning for Few-Shot Action RecognitionPoster83 citations
  429. OmniAL: A Unified CNN Framework for Unsupervised Anomaly LocalizationPoster83 citations
  430. PD-Quant: Post-Training Quantization Based on Prediction Difference MetricPoster83 citations
  431. TrojDiff: Trojan Attacks on Diffusion Models With Diverse TargetsPoster83 citations
  432. VectorFusion: Text-to-SVG by Abstracting Pixel-Based Diffusion ModelsPoster83 citations
  433. Color Backdoor: A Robust Poisoning Attack in Color SpacePoster82 citations
  434. MP-Former: Mask-Piloted Transformer for Image SegmentationPoster82 citations
  435. VILA: Learning Image Aesthetics From User Comments With Vision-Language PretrainingPoster82 citations
  436. DA-DETR: Domain Adaptive Detection Transformer With Information FusionPoster81 citations
  437. Efficient RGB-T Tracking via Cross-Modality DistillationHighlight81 citations
  438. Human Pose As Compositional TokensPoster81 citations
  439. Learning Neural Volumetric Representations of Dynamic Humans in MinutesPoster81 citations
  440. OrienterNet: Visual Localization in 2D Public Maps With Neural MatchingPoster81 citations
  441. PiMAE: Point Cloud and Image Interactive Masked Autoencoders for 3D Object DetectionPoster81 citations
  442. Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video LearningPoster81 citations
  443. Boundary-Enhanced Co-Training for Weakly Supervised Semantic SegmentationPoster80 citations
  444. Compressing Volumetric Radiance Fields to 1 MBPoster80 citations
  445. Conflict-Based Cross-View Consistency for Semi-Supervised Semantic SegmentationPoster80 citations
  446. Hard Patches Mining for Masked Image ModelingPoster80 citations
  447. NeuralField-LDM: Scene Generation With Hierarchical Latent Diffusion ModelsPoster80 citations
  448. Task-Specific Fine-Tuning via Variational Information Bottleneck for Weakly-Supervised Pathology Whole Slide Image ClassificationPoster80 citations
  449. Actionlet-Dependent Contrastive Learning for Unsupervised Skeleton-Based Action RecognitionHighlight79 citations
  450. Directional Connectivity-Based Segmentation of Medical ImagesPoster79 citations
  451. Ego-Body Pose Estimation via Ego-Head Pose EstimationPoster79 citations
  452. Hierarchical Semantic Contrast for Scene-Aware Video Anomaly DetectionPoster79 citations
  453. Instance-Aware Domain Generalization for Face Anti-SpoofingPoster79 citations
  454. Mapping Degeneration Meets Label Evolution: Learning Infrared Small Target Detection With Single Point SupervisionPoster79 citations
  455. RobustNeRF: Ignoring Distractors With Robust LossesHighlight79 citations
  456. Spatial-Frequency Mutual Learning for Face Super-ResolutionPoster79 citations
  457. Spectral Enhanced Rectangle Transformer for Hyperspectral Image DenoisingPoster79 citations
  458. DaFKD: Domain-Aware Federated Knowledge DistillationPoster78 citations
  459. Make Landscape Flatter in Differentially Private Federated LearningPoster78 citations
  460. DP-NeRF: Deblurred Neural Radiance Field With Physical Scene PriorsPoster77 citations
  461. Freestyle Layout-to-Image SynthesisHighlight77 citations
  462. GFPose: Learning 3D Human Pose Prior With Gradient FieldsPoster77 citations
  463. Local-to-Global Registration for Bundle-Adjusting Neural Radiance FieldsPoster77 citations
  464. Prototype-Based Embedding Network for Scene Graph GenerationPoster77 citations
  465. Self-Supervised Video Forensics by Audio-Visual Anomaly DetectionHighlight77 citations
  466. 3Mformer: Multi-Order Multi-Mode Transformer for Skeletal Action RecognitionPoster76 citations
  467. Align and Attend: Multimodal Summarization With Dual Contrastive LossesPoster76 citations
  468. Comprehensive and Delicate: An Efficient Transformer for Image RestorationPoster76 citations
  469. Computationally Budgeted Continual Learning: What Does Matter?Poster76 citations
  470. Consistent-Teacher: Towards Reducing Inconsistent Pseudo-Targets in Semi-Supervised Object DetectionHighlight76 citations
  471. CrowdCLIP: Unsupervised Crowd Counting via Vision-Language ModelPoster76 citations
  472. DiffCollage: Parallel Generation of Large Content With Diffusion ModelsPoster76 citations
  473. DisWOT: Student Architecture Search for Distillation WithOut TrainingPoster76 citations
  474. Attention-Based Point Cloud Edge SamplingHighlight75 citations
  475. Best of Both Worlds: Multimodal Contrastive Learning With Tabular and Imaging DataPoster75 citations
  476. GeoMVSNet: Learning Multi-View Stereo With Geometry PerceptionPoster75 citations
  477. HOICLIP: Efficient Knowledge Transfer for HOI Detection With Vision-Language ModelsPoster75 citations
  478. Learning To Render Novel Views From Wide-Baseline Stereo PairsPoster75 citations
  479. Texts as Images in Prompt Tuning for Multi-Label Image RecognitionPoster75 citations
  480. Accelerating Dataset Distillation via Model AugmentationHighlight74 citations
  481. BUFFER: Balancing Accuracy, Efficiency, and Generalizability in Point Cloud RegistrationPoster74 citations
  482. Change-Aware Sampling and Contrastive Learning for Satellite ImagesPoster74 citations
  483. Conditional Text Image Generation With Diffusion ModelsPoster74 citations
  484. FastInst: A Simple Query-Based Model for Real-Time Instance SegmentationPoster74 citations
  485. Fine-Grained Image-Text Matching by Cross-Modal Hard Aligning NetworkPoster74 citations
  486. I2MVFormer: Large Language Model Generated Multi-View Document Supervision for Zero-Shot Image ClassificationHighlight74 citations
  487. PartSLIP: Low-Shot Part Segmentation for 3D Point Clouds via Pretrained Image-Language ModelsPoster74 citations
  488. Progressive Disentangled Representation Learning for Fine-Grained Controllable Talking Head SynthesisPoster74 citations
  489. Rethinking the Learning Paradigm for Dynamic Facial Expression RecognitionPoster74 citations
  490. UniHCP: A Unified Model for Human-Centric PerceptionsPoster74 citations
  491. Video-Text As Game Players: Hierarchical Banzhaf Interaction for Cross-Modal Representation LearningHighlight74 citations
  492. Fine-Grained Face Swapping via Regional GAN InversionPoster73 citations
  493. Object-Aware Distillation Pyramid for Open-Vocabulary Object DetectionPoster73 citations
  494. OcTr: Octree-Based Transformer for 3D Object DetectionPoster73 citations
  495. Rethinking Out-of-Distribution (OOD) Detection: Masked Image Modeling Is All You NeedPoster73 citations
  496. Transferable Adversarial Attacks on Vision Transformers With Token Gradient RegularizationPoster73 citations
  497. Unifying Short and Long-Term Tracking With Graph HierarchiesPoster73 citations
  498. Deep Incomplete Multi-View Clustering With Cross-View Partial Sample and Prototype AlignmentPoster72 citations
  499. High-Fidelity 3D GAN Inversion by Pseudo-Multi-View OptimizationPoster72 citations
  500. Multi-Realism Image Compression With a Conditional GeneratorPoster72 citations
  501. VoP: Text-Video Co-Operative Prompt Tuning for Cross-Modal RetrievalPoster72 citations
  502. X-Avatar: Expressive Human AvatarsPoster72 citations
  503. You Only Segment Once: Towards Real-Time Panoptic SegmentationPoster72 citations
  504. Dense Network Expansion for Class Incremental LearningPoster71 citations
  505. DiffSwap: High-Fidelity and Controllable Face Swapping via 3D-Aware Masked DiffusionPoster71 citations
  506. GKEAL: Gaussian Kernel Embedded Analytic Learning for Few-Shot Class Incremental TaskPoster71 citations
  507. MSINet: Twins Contrastive Search of Multi-Scale Interaction for Object ReIDPoster71 citations
  508. Natural Language-Assisted Sign Language RecognitionPoster71 citations
  509. On Data Scaling in Masked Image ModelingPoster71 citations
  510. Re-Thinking Model Inversion Attacks Against Deep Neural NetworksPoster71 citations
  511. Removing Objects From Neural Radiance FieldsPoster71 citations
  512. StyleSync: High-Fidelity Generalized and Personalized Lip Sync in Style-Based GeneratorPoster71 citations
  513. A Simple Baseline for Video Restoration With Grouped Spatial-Temporal ShiftPoster70 citations
  514. ALSO: Automotive Lidar Self-Supervision by Occupancy EstimationPoster70 citations
  515. Backdoor Defense via Adaptively Splitting Poisoned DatasetPoster70 citations
  516. Diversity-Aware Meta Visual PromptingPoster70 citations
  517. Hyperbolic Contrastive Learning for Visual Representations Beyond ObjectsPoster70 citations
  518. Learning Semantic Relationship Among Instances for Image-Text MatchingPoster70 citations
  519. LidarGait: Benchmarking 3D Gait Recognition With Point CloudsPoster70 citations
  520. ProphNet: Efficient Agent-Centric Motion Forecasting With Anchor-Informed ProposalsHighlight70 citations
  521. SeaThru-NeRF: Neural Radiance Fields in Scattering MediaPoster70 citations
  522. X-Pruner: eXplainable Pruning for Vision TransformersPoster70 citations
  523. A Whac-a-Mole Dilemma: Shortcuts Come in Multiples Where Mitigating One Amplifies OthersPoster69 citations
  524. Accelerated Coordinate Encoding: Learning to Relocalize in Minutes Using RGB and PosesHighlight69 citations
  525. Learning Bottleneck Concepts in Image ClassificationPoster69 citations
  526. NIKI: Neural Inverse Kinematics With Invertible Neural Networks for 3D Human Pose and Shape EstimationPoster69 citations
  527. AutoAD: Movie Description in ContextHighlight68 citations
  528. Global Vision Transformer Pruning With Hessian-Aware SaliencyPoster68 citations
  529. Hierarchical Video-Moment Retrieval and Step-CaptioningPoster68 citations
  530. Histopathology Whole Slide Image Analysis With Heterogeneous Graph Representation LearningPoster68 citations
  531. MagicPony: Learning Articulated 3D Animals in the WildPoster68 citations
  532. Make-a-Story: Visual Memory Conditioned Consistent Story GenerationPoster68 citations
  533. PIRLNav: Pretraining With Imitation and RL Finetuning for ObjectNavPoster68 citations
  534. Renderable Neural Radiance Map for Visual NavigationHighlight68 citations
  535. Unsupervised Deep Probabilistic Approach for Partial Point Cloud RegistrationPoster68 citations
  536. AssemblyHands: Towards Egocentric Activity Understanding via 3D Hand Pose EstimationPoster67 citations
  537. CFA: Class-Wise Calibrated Fair Adversarial TrainingPoster67 citations
  538. Extracting Class Activation Maps From Non-Discriminative Features As WellPoster67 citations
  539. GeoLayoutLM: Geometric Pre-Training for Visual Information ExtractionHighlight67 citations
  540. Grad-PU: Arbitrary-Scale Point Cloud Upsampling via Gradient Descent With Learned Distance FunctionsPoster67 citations
  541. MIME: Human-Aware 3D Scene GenerationPoster67 citations
  542. NeRF-RPN: A General Framework for Object Detection in NeRFsPoster67 citations
  543. NeuralUDF: Learning Unsigned Distance Fields for Multi-View Reconstruction of Surfaces With Arbitrary TopologiesPoster67 citations
  544. Progressive Semantic-Visual Mutual Adaption for Generalized Zero-Shot LearningHighlight67 citations
  545. Super-CLEVR: A Virtual Benchmark To Diagnose Domain Robustness in Visual ReasoningHighlight67 citations
  546. TRACE: 5D Temporal Regression of Avatars With Dynamic Cameras in 3D EnvironmentsPoster67 citations
  547. Unsupervised Visible-Infrared Person Re-Identification via Progressive Graph Matching and Alternate LearningPoster67 citations
  548. Global and Local Mixture Consistency Cumulative Learning for Long-Tailed Visual RecognitionsPoster66 citations
  549. Neural Residual Radiance Fields for Streamably Free-Viewpoint VideosPoster66 citations
  550. OVTrack: Open-Vocabulary Multiple Object TrackingPoster66 citations
  551. Revisiting Temporal Modeling for CLIP-Based Image-to-Video Knowledge TransferringPoster66 citations
  552. Text With Knowledge Graph Augmented Transformer for Video CaptioningPoster66 citations
  553. UTM: A Unified Multiple Object Tracking Model With Identity-Aware Feature EnhancementPoster66 citations
  554. Understanding the Robustness of 3D Object Detection With Bird's-Eye-View Representations in Autonomous DrivingPoster66 citations
  555. VideoTrack: Learning To Track Objects via Video TransformerPoster66 citations
  556. Zero-Shot Referring Image Segmentation With Global-Local Context FeaturesPoster66 citations
  557. BlackVIP: Black-Box Visual Prompting for Robust Transfer LearningPoster65 citations
  558. Context De-Confounded Emotion RecognitionPoster65 citations
  559. Detecting Backdoors in Pre-Trained EncodersPoster65 citations
  560. DiffusionRig: Learning Personalized Priors for Facial Appearance EditingPoster65 citations
  561. Gloss Attention for Gloss-Free Sign Language TranslationPoster65 citations
  562. Neural Map Prior for Autonomous DrivingPoster65 citations
  563. On the Stability-Plasticity Dilemma of Class-Incremental LearningPoster65 citations
  564. PHA: Patch-Wise High-Frequency Augmentation for Transformer-Based Person Re-IdentificationHighlight65 citations
  565. Positive-Augmented Contrastive Learning for Image and Video Captioning EvaluationHighlight65 citations
  566. Spring: A High-Resolution High-Detail Dataset and Benchmark for Scene Flow, Optical Flow and StereoPoster65 citations
  567. Unsupervised Object Localization: Observing the Background To Discover ObjectsPoster65 citations
  568. Class-Incremental Exemplar Compression for Class-Incremental LearningPoster64 citations
  569. Clover: Towards a Unified Video-Language Alignment and Fusion ModelPoster64 citations
  570. DeepLSD: Line Segment Detection and Refinement With Deep Image GradientsPoster64 citations
  571. DisCoScene: Spatially Disentangled Generative Radiance Fields for Controllable 3D-Aware Scene SynthesisHighlight64 citations
  572. NoisyQuant: Noisy Bias-Enhanced Post-Training Activation Quantization for Vision TransformersPoster64 citations
  573. Real-Time Neural Light Field on Mobile DevicesPoster64 citations
  574. Transductive Few-Shot Learning With Prototype-Based Label Propagation by Iterative Graph RefinementPoster64 citations
  575. TrojViT: Trojan Insertion in Vision TransformersPoster64 citations
  576. UDE: A Unified Driving Engine for Human Motion GenerationPoster64 citations
  577. ViPLO: Vision Transformer Based Pose-Conditioned Self-Loop Graph for Human-Object Interaction DetectionPoster64 citations
  578. Adaptive Sparse Pairwise Loss for Object Re-IdentificationPoster63 citations
  579. CiaoSR: Continuous Implicit Attention-in-Attention Network for Arbitrary-Scale Image Super-ResolutionPoster63 citations
  580. Deep Frequency Filtering for Domain GeneralizationPoster63 citations
  581. End-to-End 3D Dense Captioning With Vote2Cap-DETRPoster63 citations
  582. Fair Federated Medical Image Segmentation via Client Contribution EstimationPoster63 citations
  583. HOOD: Hierarchical Graphs for Generalized Modelling of Clothing DynamicsPoster63 citations
  584. LASP: Text-to-Text Optimization for Language-Aware Soft Prompting of Vision & Language ModelsPoster63 citations
  585. MIANet: Aggregating Unbiased Instance and General Information for Few-Shot Semantic SegmentationPoster63 citations
  586. Masked Image Modeling With Local Multi-Scale ReconstructionHighlight63 citations
  587. Non-Contrastive Unsupervised Learning of Physiological Signals From VideoHighlight63 citations
  588. PaletteNeRF: Palette-Based Appearance Editing of Neural Radiance FieldsPoster63 citations
  589. Slimmable Dataset CondensationHighlight63 citations
  590. UniDistill: A Universal Cross-Modality Knowledge Distillation Framework for 3D Object Detection in Bird's-Eye ViewHighlight63 citations
  591. You Do Not Need Additional Priors or Regularizers in Retinex-Based Low-Light Image EnhancementPoster63 citations
  592. Anchor3DLane: Learning To Regress 3D Anchors for Monocular 3D Lane DetectionPoster62 citations
  593. CF-Font: Content Fusion for Few-Shot Font GenerationPoster62 citations
  594. LEGO-Net: Learning Regular Rearrangements of Objects in RoomsPoster62 citations
  595. MetaPortrait: Identity-Preserving Talking Head Generation With Fast Personalized AdaptationPoster62 citations
  596. Open-Vocabulary Point-Cloud Object Detection Without 3D AnnotationPoster62 citations
  597. Revisiting Prototypical Network for Cross Domain Few-Shot LearningPoster62 citations
  598. ScaleFL: Resource-Adaptive Federated Learning With Heterogeneous ClientsPoster62 citations
  599. Super-Resolution Neural OperatorPoster62 citations
  600. DiGeo: Discriminative Geometry-Aware Learning for Generalized Few-Shot Object DetectionPoster61 citations
  601. Enhanced Training of Query-Based Object Detection via Selective Query RecollectionPoster61 citations
  602. Focus on Details: Online Multi-Object Tracking With Diverse Fine-Grained RepresentationPoster61 citations
  603. GrowSP: Unsupervised Semantic Segmentation of 3D Point CloudsPoster61 citations
  604. Improved Test-Time Adaptation for Domain GeneralizationPoster61 citations
  605. Interactive Segmentation of Radiance FieldsPoster61 citations
  606. LayoutDM: Transformer-Based Diffusion Model for Layout GenerationPoster61 citations
  607. Look Before You Match: Instance Understanding Matters in Video Object SegmentationPoster61 citations
  608. MD-VQA: Multi-Dimensional Quality Assessment for UGC Live VideosPoster61 citations
  609. Masked Wavelet Representation for Compact Neural Radiance FieldsPoster61 citations
  610. OTAvatar: One-Shot Talking Face Avatar With Controllable Tri-Plane RenderingPoster61 citations
  611. Semi-DETR: Semi-Supervised Object Detection With Detection TransformersPoster61 citations
  612. TokenHPE: Learning Orientation Tokens for Efficient Head Pose Estimation via TransformersPoster61 citations
  613. 3D Human Mesh Estimation From Virtual MarkersPoster60 citations
  614. Ambiguity-Resistant Semi-Supervised Learning for Dense Object DetectionPoster60 citations
  615. CAT: LoCalization and IdentificAtion Cascade Detection Transformer for Open-World Object DetectionPoster60 citations
  616. DF-Platter: Multi-Face Heterogeneous Deepfake DatasetPoster60 citations
  617. DeAR: Debiasing Vision-Language Models With Additive ResidualsPoster60 citations
  618. Efficient Multimodal Fusion via Interactive PromptingPoster60 citations
  619. Event-Based Frame Interpolation With Ad-Hoc DeblurringPoster60 citations
  620. Generative Semantic SegmentationPoster60 citations
  621. Harmonious Teacher for Cross-Domain Object DetectionPoster60 citations
  622. Human-Art: A Versatile Human-Centric Dataset Bridging Natural and Artificial ScenesPoster60 citations
  623. ISBNet: A 3D Point Cloud Instance Segmentation Network With Instance-Aware Sampling and Box-Aware Dynamic ConvolutionPoster60 citations
  624. Improving Cross-Modal Retrieval With Set of Diverse EmbeddingsHighlight60 citations
  625. LG-BPN: Local and Global Blind-Patch Network for Self-Supervised Real-World DenoisingPoster60 citations
  626. MixMAE: Mixed and Masked Autoencoder for Efficient Pretraining of Hierarchical Vision TransformersPoster60 citations
  627. Out-of-Candidate Rectification for Weakly Supervised Semantic SegmentationPoster60 citations
  628. PIVOT: Prompting for Video Continual LearningPoster60 citations
  629. PointDistiller: Structured Knowledge Distillation Towards Efficient and Compact 3D DetectionPoster60 citations
  630. PointVector: A Vector Representation in Point Cloud AnalysisPoster60 citations
  631. StyleAdv: Meta Style Adversarial Training for Cross-Domain Few-Shot LearningPoster60 citations
  632. 3D Concept Learning and Reasoning From Multi-View ImagesPoster59 citations
  633. A Hierarchical Representation Network for Accurate and Detailed Face Reconstruction From In-the-Wild ImagesPoster59 citations
  634. A Unified Pyramid Recurrent Network for Video Frame InterpolationPoster59 citations
  635. AdaMAE: Adaptive Masking for Efficient Spatiotemporal Learning With Masked AutoencodersPoster59 citations
  636. Efficient Movie Scene Detection Using State-Space TransformersPoster59 citations
  637. Evading DeepFake Detectors via Adversarial Statistical ConsistencyPoster59 citations
  638. GaitGCI: Generative Counterfactual Intervention for Gait RecognitionPoster59 citations
  639. Gradient Norm Aware Minimization Seeks First-Order Flatness and Improves GeneralizationHighlight59 citations
  640. Learning Customized Visual Models With Retrieval-Augmented KnowledgeHighlight59 citations
  641. Masked Autoencoders Enable Efficient Knowledge DistillersPoster59 citations
  642. PEAL: Prior-Embedded Explicit Attention Learning for Low-Overlap Point Cloud RegistrationPoster59 citations
  643. PVT-SSD: Single-Stage 3D Object Detector With Point-Voxel TransformerPoster59 citations
  644. Randomized Adversarial Training via Taylor ExpansionPoster59 citations
  645. Revisiting Residual Networks for Adversarial RobustnessPoster59 citations
  646. Standing Between Past and Future: Spatio-Temporal Modeling for Multi-Camera 3D Multi-Object TrackingPoster59 citations
  647. Temporal Interpolation Is All You Need for Dynamic Neural Radiance FieldsHighlight59 citations
  648. Understanding Imbalanced Semantic Segmentation Through Neural CollapsePoster59 citations
  649. Uni-Perceiver v2: A Generalist Model for Large-Scale Vision and Vision-Language TasksHighlight59 citations
  650. BEV-LaneDet: An Efficient 3D Lane Detection Based on Virtual Camera via Key-PointsPoster58 citations
  651. Boosting Semi-Supervised Learning by Exploiting All Unlabeled DataPoster58 citations
  652. CIRCLE: Capture in Rich Contextual EnvironmentsPoster58 citations
  653. CLIP-S4: Language-Guided Self-Supervised Semantic SegmentationHighlight58 citations
  654. CelebV-Text: A Large-Scale Facial Text-Video DatasetPoster58 citations
  655. Class-Balancing Diffusion ModelsPoster58 citations
  656. DPE: Disentanglement of Pose and Expression for General Video Portrait EditingPoster58 citations
  657. MoDi: Unconditional Motion Synthesis From Diverse DataPoster58 citations
  658. NeUDF: Leaning Neural Unsigned Distance Fields With Volume RenderingPoster58 citations
  659. On the Effects of Self-Supervision and Contrastive Alignment in Deep Multi-View ClusteringHighlight58 citations
  660. Overlooked Factors in Concept-Based Explanations: Dataset Choice, Concept Learnability, and Human CapabilityPoster58 citations
  661. Representing Volumetric Videos As Dynamic MLP MapsPoster58 citations
  662. Shifted Diffusion for Text-to-Image GenerationPoster58 citations
  663. Weakly Supervised Semantic Segmentation via Adversarial Learning of Classifier and ReconstructorPoster58 citations
  664. AnchorFormer: Point Cloud Completion From Discriminative NodesPoster57 citations
  665. Backdoor Attacks Against Deep Image Compression via Adaptive Frequency TriggerPoster57 citations
  666. Continual Semantic Segmentation With Automatic Memory Sample SelectionPoster57 citations
  667. Curvature-Balanced Feature Manifold Learning for Long-Tailed ClassificationPoster57 citations
  668. Hi4D: 4D Instance Segmentation of Close Human InteractionPoster57 citations
  669. HierVL: Learning Hierarchical Video-Language EmbeddingsHighlight57 citations
  670. Improving the Transferability of Adversarial Samples by Path-Augmented MethodPoster57 citations
  671. SDC-UDA: Volumetric Unsupervised Domain Adaptation Framework for Slice-Direction Continuous Cross-Modality Medical Image SegmentationPoster57 citations
  672. Spatially Adaptive Self-Supervised Learning for Real-World Image DenoisingPoster57 citations
  673. The Treasure Beneath Multiple Annotations: An Uncertainty-Aware Edge DetectorPoster57 citations
  674. AUNet: Learning Relations Between Action Units for Face Forgery DetectionPoster56 citations
  675. Adaptive Data-Free QuantizationPoster56 citations
  676. Audio-Visual Grouping Network for Sound Localization From MixturesPoster56 citations
  677. Contrastive Grouping With Transformer for Referring Image SegmentationPoster56 citations
  678. Deep Depth Estimation From Thermal ImagePoster56 citations
  679. Learning Conditional Attributes for Compositional Zero-Shot LearningPoster56 citations
  680. Point Cloud Forecasting as a Proxy for 4D Occupancy ForecastingPoster56 citations
  681. Relational Context Learning for Human-Object Interaction DetectionPoster56 citations
  682. SQUID: Deep Feature In-Painting for Unsupervised Anomaly DetectionPoster56 citations
  683. Scene-Aware Egocentric 3D Human Pose EstimationPoster56 citations
  684. Understanding Masked Image Modeling via Learning Occlusion Invariant FeatureHighlight56 citations
  685. A Generalized Framework for Video Instance SegmentationPoster55 citations
  686. Attribute-Preserving Face Dataset Anonymization via Latent Code OptimizationHighlight55 citations
  687. BEV-Guided Multi-Modality Fusion for Driving PerceptionPoster55 citations
  688. CLIPPO: Image-and-Language Understanding From Pixels OnlyPoster55 citations
  689. Data-Efficient Large Scale Place Recognition With Graded Similarity SupervisionPoster55 citations
  690. Generative Bias for Robust Visual Question AnsweringPoster55 citations
  691. HS-Pose: Hybrid Scope Feature Extraction for Category-Level Object Pose EstimationPoster55 citations
  692. Learning Neural Parametric Head ModelsPoster55 citations
  693. Residual Degradation Learning Unfolding Framework With Mixing Priors Across Spectral and Spatial for Compressive Spectral ImagingPoster55 citations
  694. Rethinking the Correlation in Few-Shot Segmentation: A Buoys ViewPoster55 citations
  695. SOOD: Towards Semi-Supervised Oriented Object DetectionPoster55 citations
  696. SparseViT: Revisiting Activation Sparsity for Efficient High-Resolution Vision TransformerPoster55 citations
  697. StyleRes: Transforming the Residuals for Real Image Editing With StyleGANPoster55 citations
  698. Uni3D: A Unified Baseline for Multi-Dataset 3D Object DetectionPoster55 citations
  699. Unified Keypoint-Based Action Recognition Framework via Structured Keypoint PoolingPoster55 citations
  700. Upcycling Models Under Domain and Category ShiftPoster55 citations
  701. 2PCNet: Two-Phase Consistency Training for Day-to-Night Unsupervised Domain Adaptive Object DetectionPoster54 citations
  702. CLIP-Sculptor: Zero-Shot Generation of High-Fidelity and Diverse Shapes From Natural LanguagePoster54 citations
  703. Context-Aware Alignment and Mutual Masking for 3D-Language Pre-TrainingHighlight54 citations
  704. Data-Driven Feature Tracking for Event CamerasPoster54 citations
  705. Decoupling MaxLogit for Out-of-Distribution DetectionPoster54 citations
  706. High-Fidelity Clothed Avatar Reconstruction From a Single ImagePoster54 citations
  707. Independent Component Alignment for Multi-Task LearningPoster54 citations
  708. Learning Audio-Visual Source Localization via False Negative Aware Contrastive LearningPoster54 citations
  709. Learning Federated Visual Prompt in Null Space for MRI ReconstructionPoster54 citations
  710. Learning Imbalanced Data With Vision TransformersPoster54 citations
  711. Nerflets: Local Radiance Fields for Efficient Structure-Aware 3D Scene Representation From 2D SupervisionPoster54 citations
  712. One-Shot High-Fidelity Talking-Head Synthesis With Deformable Neural Radiance FieldPoster54 citations
  713. Proposal-Based Multiple Instance Learning for Weakly-Supervised Temporal Action LocalizationPoster54 citations
  714. Real-Time Evaluation in Online Continual Learning: A New HopeHighlight54 citations
  715. Texture-Guided Saliency Distilling for Unsupervised Salient Object DetectionPoster54 citations
  716. Understanding and Constructing Latent Modality Structures in Multi-Modal Representation LearningPoster54 citations
  717. VolRecon: Volume Rendering of Signed Ray Distance Functions for Generalizable Multi-View ReconstructionPoster54 citations
  718. You Can Ground Earlier Than See: An Effective and Efficient Pipeline for Temporal Sentence Grounding in Compressed VideosPoster54 citations
  719. Zero-Shot Object CountingPoster54 citations
  720. 1% VS 100%: Parameter-Efficient Low Rank Adapter for Dense PredictionsPoster53 citations
  721. A New Comprehensive Benchmark for Semi-Supervised Video Anomaly Detection and AnticipationPoster53 citations
  722. Achieving a Better Stability-Plasticity Trade-Off via Auxiliary Networks in Continual LearningPoster53 citations
  723. Depth Estimation From Camera Image and mmWave Radar Point CloudPoster53 citations
  724. Dynamic Aggregated Network for Gait RecognitionPoster53 citations
  725. Feature Alignment and Uniformity for Test Time AdaptationPoster53 citations
  726. FedSeg: Class-Heterogeneous Federated Learning for Semantic SegmentationPoster53 citations
  727. Federated Incremental Semantic SegmentationPoster53 citations
  728. Guided Depth Super-Resolution by Deep Anisotropic DiffusionPoster53 citations
  729. Meta-Causal Learning for Single Domain GeneralizationPoster53 citations
  730. MixNeRF: Modeling a Ray With Mixture Density for Novel View Synthesis From Sparse InputsPoster53 citations
  731. NeRF in the Palm of Your Hand: Corrective Augmentation for Robotics via Novel-View SynthesisPoster53 citations
  732. Neural Volumetric Memory for Visual Locomotion ControlHighlight53 citations
  733. Semi-Supervised Domain Adaptation With Source Label AdaptationPoster53 citations
  734. Supervised Masked Knowledge Distillation for Few-Shot TransformersPoster53 citations
  735. Towards All-in-One Pre-Training via Maximizing Multi-Modal Mutual InformationPoster53 citations
  736. 3D Semantic Segmentation in the Wild: Learning Generalized Models for Adverse-Condition Point CloudsPoster52 citations
  737. Instance-Specific and Model-Adaptive Supervision for Semi-Supervised Semantic SegmentationPoster52 citations
  738. Learning Orthogonal Prototypes for Generalized Few-Shot Semantic SegmentationPoster52 citations
  739. Leveraging Hidden Positives for Unsupervised Semantic SegmentationPoster52 citations
  740. LinK: Linear Kernel for LiDAR-Based 3D PerceptionPoster52 citations
  741. OCELOT: Overlapped Cell on Tissue Dataset for HistopathologyPoster52 citations
  742. Optimization-Inspired Cross-Attention Transformer for Compressive SensingPoster52 citations
  743. PVO: Panoptic Visual OdometryPoster52 citations
  744. Perspective Fields for Single Image Camera CalibrationHighlight52 citations
  745. A Probabilistic Framework for Lifelong Test-Time AdaptationPoster51 citations
  746. Behind the Scenes: Density Fields for Single View ReconstructionPoster51 citations
  747. BoxTeacher: Exploring High-Quality Pseudo Labels for Weakly Supervised Instance SegmentationPoster51 citations
  748. CAP-VSTNet: Content Affinity Preserved Versatile Style TransferPoster51 citations
  749. CAPE: Camera View Position Embedding for Multi-View 3D Object DetectionPoster51 citations
  750. ConZIC: Controllable Zero-Shot Image Captioning by Sampling-Based PolishingPoster51 citations
  751. DNF: Decouple and Feedback Network for Seeing in the DarkHighlight51 citations
  752. Diffusion-Based Signed Distance Fields for 3D Shape GenerationPoster51 citations
  753. LOCATE: Localize and Transfer Object Parts for Weakly Supervised Affordance GroundingPoster51 citations
  754. Language Adaptive Weight Generation for Multi-Task Visual GroundingPoster51 citations
  755. Learning Spatial-Temporal Implicit Neural Representations for Event-Guided Video Super-ResolutionPoster51 citations
  756. Mixed Autoencoder for Self-Supervised Visual Representation LearningPoster51 citations
  757. NS3D: Neuro-Symbolic Grounding of 3D Objects and RelationsPoster51 citations
  758. NeAT: Learning Neural Implicit Surfaces With Arbitrary Topologies From Multi-View ImagesPoster51 citations
  759. Optimal Transport Minimization: Crowd Localization on Density Maps for Semi-Supervised CountingHighlight51 citations
  760. Picture That Sketch: Photorealistic Image Generation From Abstract SketchesPoster51 citations
  761. QuantArt: Quantizing Image Style Transfer Towards High Visual FidelityPoster51 citations
  762. Robust Outlier Rejection for 3D Registration With Variational BayesPoster51 citations
  763. SceneComposer: Any-Level Semantic Image SynthesisHighlight51 citations
  764. Specialist Diffusion: Plug-and-Play Sample-Efficient Fine-Tuning of Text-to-Image Diffusion Models To Learn Any Unseen StylePoster51 citations
  765. Visual Query Tuning: Towards Effective Usage of Intermediate Representations for Parameter and Memory Efficient Transfer LearningPoster51 citations
  766. gSDF: Geometry-Driven Signed Distance Functions for 3D Hand-Object ReconstructionPoster51 citations
  767. ACSeg: Adaptive Conceptualization for Unsupervised Semantic SegmentationHighlight50 citations
  768. High-Fidelity 3D Human Digitization From Single 2K Resolution ImagesHighlight50 citations
  769. Learning Human-to-Robot Handovers From Point CloudsHighlight50 citations
  770. OpenMix: Exploring Outlier Samples for Misclassification DetectionHighlight50 citations
  771. OvarNet: Towards Open-Vocabulary Object Attribute RecognitionPoster50 citations
  772. Panoptic Video Scene Graph GenerationPoster50 citations
  773. Putting People in Their Place: Affordance-Aware Human Insertion Into ScenesPoster50 citations
  774. Self-Supervised Non-Uniform Kernel Estimation With Flow-Based Motion Prior for Blind Image DeblurringPoster50 citations
  775. Towards Artistic Image Aesthetics Assessment: A Large-Scale Dataset and a New MethodPoster50 citations
  776. Zero-Shot Everything Sketch-Based Image Retrieval, and in Explainable StyleHighlight50 citations
  777. ACR: Attention Collaboration-Based Regressor for Arbitrary Two-Hand ReconstructionPoster49 citations
  778. Adjustment and Alignment for Unbiased Open Set Domain AdaptationPoster49 citations
  779. An In-Depth Exploration of Person Re-Identification and Gait Recognition in Cloth-Changing ConditionsPoster49 citations
  780. Block Selection Method for Using Feature Norm in Out-of-Distribution DetectionPoster49 citations
  781. Castling-ViT: Compressing Self-Attention via Switching Towards Linear-Angular Attention at Vision Transformer InferencePoster49 citations
  782. DBARF: Deep Bundle-Adjusting Generalizable Neural Radiance FieldsPoster49 citations
  783. Deep Graph ReprogrammingHighlight49 citations
  784. Devil's on the Edges: Selective Quad Attention for Scene Graph GenerationPoster49 citations
  785. Dual-Path Adaptation From Image to Video TransformersPoster49 citations
  786. Fast Point Cloud Generation With Straight FlowsPoster49 citations
  787. Fine-Grained Classification With Noisy LabelsPoster49 citations
  788. Global-to-Local Modeling for Video-Based 3D Human Pose and Shape EstimationPoster49 citations
  789. KERM: Knowledge Enhanced Reasoning for Vision-and-Language NavigationPoster49 citations
  790. Learning Sample Relationship for Exposure CorrectionPoster49 citations
  791. Look Around for Anomalies: Weakly-Supervised Anomaly Detection via Context-Motion Relational LearningPoster49 citations
  792. Perception-Oriented Single Image Super-Resolution Using Optimal Objective EstimationPoster49 citations
  793. Towards Better Gradient Consistency for Neural Signed Distance Functions via Level Set AlignmentPoster49 citations
  794. Uncurated Image-Text Datasets: Shedding Light on Demographic BiasHighlight49 citations
  795. 3DAvatarGAN: Bridging Domains for Personalized Editable AvatarsPoster48 citations
  796. A Data-Based Perspective on Transfer LearningPoster48 citations
  797. Backdoor Defense via Deconfounded Representation LearningPoster48 citations
  798. Boosting Accuracy and Robustness of Student Models via Adaptive Adversarial DistillationPoster48 citations
  799. Cascaded Local Implicit Transformer for Arbitrary-Scale Super-ResolutionPoster48 citations
  800. DIP: Dual Incongruity Perceiving Network for Sarcasm DetectionPoster48 citations
  801. ERM-KTP: Knowledge-Level Machine Unlearning via Knowledge TransferPoster48 citations
  802. GeoMAE: Masked Geometric Target Prediction for Self-Supervised Point Cloud Pre-TrainingPoster48 citations
  803. Highly Confident Local Structure Based Consensus Graph Learning for Incomplete Multi-View ClusteringPoster48 citations
  804. Learning Attention As Disentangler for Compositional Zero-Shot LearningPoster48 citations
  805. Open-World Multi-Task Control Through Goal-Aware Representation Learning and Adaptive Horizon PredictionPoster48 citations
  806. PET-NeuS: Positional Encoding Tri-Planes for Neural SurfacesPoster48 citations
  807. RIATIG: Reliable and Imperceptible Adversarial Text-to-Image Generation With Natural PromptsPoster48 citations
  808. Revisiting Multimodal Representation in Contrastive Learning: From Patch and Token Embeddings to Finite Discrete TokensPoster48 citations
  809. SLOPER4D: A Scene-Aware Dataset for Global 4D Human Pose Estimation in Urban EnvironmentsPoster48 citations
  810. Shape-Aware Text-Driven Layered Video EditingPoster48 citations
  811. Test of Time: Instilling Video-Language Models With a Sense of TimePoster48 citations
  812. Towards Realistic Long-Tailed Semi-Supervised Learning: Consistency Is All You NeedPoster48 citations
  813. What Can Human Sketches Do for Object Detection?Poster48 citations
  814. 3D-Aware Object Goal Navigation via Simultaneous Exploration and IdentificationPoster47 citations
  815. All-in-One Image Restoration for Unknown Degradations Using Adaptive Discriminative Filters for Specific DegradationsPoster47 citations
  816. CAMS: CAnonicalized Manipulation Spaces for Category-Level Functional Hand-Object Manipulation SynthesisPoster47 citations
  817. CLIPPING: Distilling CLIP-Based Models With a Student Base for Video-Language RetrievalPoster47 citations
  818. DARE-GRAM: Unsupervised Domain Adaptation Regression by Aligning Inverse Gram MatricesPoster47 citations
  819. Deep Hashing With Minimal-Distance-Separated Hash CentersPoster47 citations
  820. Distilling Cross-Temporal Contexts for Continuous Sign Language RecognitionPoster47 citations
  821. FFHQ-UV: Normalized Facial UV-Texture Dataset for 3D Face ReconstructionPoster47 citations
  822. Hand Avatar: Free-Pose Hand Animation and Rendering From Monocular VideoPoster47 citations
  823. HumanBench: Towards General Human-Centric Perception With Projector Assisted PretrainingPoster47 citations
  824. NeRF-Supervised Deep StereoPoster47 citations
  825. PosterLayout: A New Benchmark and Approach for Content-Aware Visual-Textual Presentation LayoutPoster47 citations
  826. Procedure-Aware Pretraining for Instructional Video UnderstandingPoster47 citations
  827. STAR Loss: Reducing Semantic Ambiguity in Facial Landmark DetectionPoster47 citations
  828. TinyMIM: An Empirical Study of Distilling MIM Pre-Trained ModelsPoster47 citations
  829. Towards Transferable Targeted Adversarial ExamplesPoster47 citations
  830. Uncertainty-Aware Vision-Based Metric Cross-View GeolocalizationPoster47 citations
  831. A Light Weight Model for Active Speaker DetectionPoster46 citations
  832. ALOFT: A Lightweight MLP-Like Architecture With Dynamic Low-Frequency Transform for Domain GeneralizationPoster46 citations
  833. Beyond Attentive Tokens: Incorporating Token Importance and Diversity for Efficient Vision TransformersPoster46 citations
  834. Controllable Mesh Generation Through Sparse Latent Point Diffusion ModelsPoster46 citations
  835. Data-Free Knowledge Distillation via Feature Exchange and Activation Region ConstraintPoster46 citations
  836. EVAL: Explainable Video Anomaly LocalizationPoster46 citations
  837. GradMA: A Gradient-Memory-Based Accelerated Federated Learning With Alleviated Catastrophic ForgettingHighlight46 citations
  838. High-Fidelity Generalized Emotional Talking Face Generation With Multi-Modal Emotion Space LearningPoster46 citations
  839. Less Is More: Reducing Task and Model Complexity for 3D Point Cloud Semantic SegmentationPoster46 citations
  840. Masked Motion Encoding for Self-Supervised Video Representation LearningPoster46 citations
  841. Multi-Modal Gait Recognition via Effective Spatial-Temporal Feature FusionPoster46 citations
  842. Neural Preset for Color Style TransferPoster46 citations
  843. On the Benefits of 3D Pose and Tracking for Human Action RecognitionPoster46 citations
  844. Primitive Generation and Semantic-Related Alignment for Universal Zero-Shot SegmentationPoster46 citations
  845. Tell Me What Happened: Unifying Text-Guided Video Completion via Multimodal Masked Video GenerationPoster46 citations
  846. Towards Effective Adversarial Textured 3D Meshes on Physical Face RecognitionHighlight46 citations
  847. UV Volumes for Real-Time Rendering of Editable Free-View Human PerformancePoster46 citations
  848. Visibility Aware Human-Object Interaction Tracking From Single RGB CameraPoster46 citations
  849. 3D GAN Inversion With Facial Symmetry PriorPoster45 citations
  850. Conditional Generation of Audio From Video via Foley AnalogiesPoster45 citations
  851. Decompose, Adjust, Compose: Effective Normalization by Playing With Frequency for Domain GeneralizationPoster45 citations
  852. Feature Representation Learning With Adaptive Displacement Generation and Transformer Fusion for Micro-Expression RecognitionPoster45 citations
  853. Generating Features With Increased Crop-Related Diversity for Few-Shot Object DetectionPoster45 citations
  854. Hidden Gems: 4D Radar Scene Flow Learning Using Cross-Modal SupervisionHighlight45 citations
  855. Masked Scene Contrast: A Scalable Framework for Unsupervised 3D Representation LearningPoster45 citations
  856. Scalable, Detailed and Mask-Free Universal Photometric StereoHighlight45 citations
  857. Sound to Visual Scene Generation by Audio-to-Visual Latent AlignmentPoster45 citations
  858. SparsePose: Sparse-View Camera Pose Regression and RefinementPoster45 citations
  859. Towards Scalable Neural Representation for Diverse VideosPoster45 citations
  860. Unifying Layout Generation With a Decoupled Diffusion ModelPoster45 citations
  861. 3D Line Mapping RevisitedHighlight44 citations
  862. A Simple Framework for Text-Supervised Semantic SegmentationPoster44 citations
  863. Balanced Product of Calibrated Experts for Long-Tailed RecognitionPoster44 citations
  864. DeepMAD: Mathematical Architecture Design for Deep Convolutional Neural NetworkPoster44 citations
  865. Density-Insensitive Unsupervised Domain Adaption on 3D Object DetectionPoster44 citations
  866. Efficient Hierarchical Entropy Model for Learned Point Cloud CompressionPoster44 citations
  867. Frame-Event Alignment and Fusion Network for High Frame Rate TrackingPoster44 citations
  868. Improving Zero-Shot Generalization and Robustness of Multi-Modal ModelsPoster44 citations
  869. LANA: A Language-Capable Navigator for Instruction Following and GenerationPoster44 citations
  870. LINe: Out-of-Distribution Detection by Leveraging Important NeuronsPoster44 citations
  871. LayoutFormer++: Conditional Graphic Layout Generation via Constraint Serialization and Decoding Space RestrictionPoster44 citations
  872. Learning Compact Representations for LiDAR Completion and GenerationPoster44 citations
  873. Long-Tailed Visual Recognition via Self-Heterogeneous Integration With Knowledge ExcavationPoster44 citations
  874. Multiple Instance Learning via Iterative Self-Paced Supervised Contrastive LearningPoster44 citations
  875. PlaneDepth: Self-Supervised Depth Estimation via Orthogonal PlanesPoster44 citations
  876. QPGesture: Quantization-Based and Phase-Guided Motion Matching for Natural Speech-Driven Gesture GenerationHighlight44 citations
  877. Rethinking Optical Flow From Geometric Matching Consistent PerspectivePoster44 citations
  878. Sibling-Attack: Rethinking Transferable Adversarial Attacks Against Face RecognitionPoster44 citations
  879. Sparsely Annotated Semantic Segmentation With Adaptive Gaussian MixturesPoster44 citations
  880. Unified Pose Sequence ModelingPoster44 citations
  881. 3D-Aware Conditional Image SynthesisPoster43 citations
  882. Breaking the "Object" in Video Object SegmentationPoster43 citations
  883. Burstormer: Burst Image Restoration and Enhancement TransformerPoster43 citations
  884. Class Relationship Embedded Learning for Source-Free Unsupervised Domain AdaptationPoster43 citations
  885. DATID-3D: Diversity-Preserved Domain Adaptation Using Text-to-Image Diffusion for 3D Generative ModelPoster43 citations
  886. DINER: Disorder-Invariant Implicit Neural RepresentationHighlight43 citations
  887. Detecting Backdoors During the Inference Stage Based on Corruption Robustness ConsistencyPoster43 citations
  888. Doubly Right Object Recognition: A Why Prompt for Visual RationalesPoster43 citations
  889. FAME-ViL: Multi-Tasking Vision-Language Model for Heterogeneous Fashion TasksHighlight43 citations
  890. Flow Supervision for Deformable NeRFHighlight43 citations
  891. Geometric Visual Similarity Learning in 3D Medical Image Self-Supervised Pre-TrainingPoster43 citations
  892. Hierarchical Temporal Transformer for 3D Hand Pose Estimation and Action Recognition From Egocentric RGB VideosPoster43 citations
  893. Improving Graph Representation for Point Cloud Segmentation via Attentive FilteringPoster43 citations
  894. Interactive Segmentation As Gaussion Process ClassificationHighlight43 citations
  895. Large-Capacity and Flexible Video Steganography via Invertible Neural NetworkPoster43 citations
  896. Learning Locally Editable Virtual HumansPoster43 citations
  897. MixTeacher: Mining Promising Labels With Mixed Scale Teacher for Semi-Supervised Object DetectionPoster43 citations
  898. Multivariate, Multi-Frequency and Multimodal: Rethinking Graph Neural Networks for Emotion Recognition in ConversationPoster43 citations
  899. PCT-Net: Full Resolution Image Harmonization Using Pixel-Wise Color TransformationsPoster43 citations
  900. SCOOP: Self-Supervised Correspondence and Optimization-Based Scene FlowPoster43 citations
  901. SlowLiDAR: Increasing the Latency of LiDAR-Based Detection Using Adversarial ExamplesPoster43 citations
  902. Towards Accurate Image Coding: Improved Autoregressive Image Generation With Dynamic Vector QuantizationHighlight43 citations
  903. You Are Catching My Attention: Are Vision Transformers Bad Learners Under Backdoor Attacks?Poster43 citations
  904. Active Exploration of Multimodal Complementarity for Few-Shot Action RecognitionPoster42 citations
  905. AligNeRF: High-Fidelity Neural Radiance Fields via Alignment-Aware TrainingPoster42 citations
  906. Being Comes From Not-Being: Open-Vocabulary Text-to-Motion Generation With Wordless TrainingHighlight42 citations
  907. Boosting Video Object Segmentation via Space-Time Correspondence LearningPoster42 citations
  908. CXTrack: Improving 3D Point Cloud Tracking With Contextual InformationPoster42 citations
  909. Can't Steal? Cont-Steal! Contrastive Stealing Attacks Against Image EncodersPoster42 citations
  910. Don't Lie to Me! Robust and Efficient Explainability With Verified Perturbation AnalysisPoster42 citations
  911. FLEX: Full-Body Grasping Without Full-Body GraspsPoster42 citations
  912. Gazeformer: Scalable, Effective and Fast Prediction of Goal-Directed Human AttentionPoster42 citations
  913. Generating Anomalies for Video Anomaly Detection With Prompt-Based Feature MappingPoster42 citations
  914. Hunting Sparsity: Density-Guided Contrastive Learning for Semi-Supervised Semantic SegmentationPoster42 citations
  915. Learning To Generate Language-Supervised and Open-Vocabulary Scene Graph Using Pre-Trained Visual-Semantic SpacePoster42 citations
  916. MoStGAN-V: Video Generation With Temporal Motion StylesPoster42 citations
  917. Multi-View Adversarial Discriminator: Mine the Non-Causal Factors for Object Detection in Unseen DomainsHighlight42 citations
  918. OSRT: Omnidirectional Image Super-Resolution With Distortion-Aware TransformerPoster42 citations
  919. Object Pose Estimation With Statistical Guarantees: Conformal Keypoint Detection and Geometric Uncertainty PropagationHighlight42 citations
  920. On the Effectiveness of Partial Variance Reduction in Federated Learning With Heterogeneous DataHighlight42 citations
  921. PATS: Patch Area Transportation With Subdivision for Local Feature MatchingPoster42 citations
  922. PivoTAL: Prior-Driven Supervision for Weakly-Supervised Temporal Action LocalizationPoster42 citations
  923. Reinforcement Learning-Based Black-Box Model Inversion AttacksPoster42 citations
  924. ScanDMM: A Deep Markov Model of Scanpath Prediction for 360deg ImagesPoster42 citations
  925. Skinned Motion Retargeting With Residual Perception of Motion Semantics & GeometryPoster42 citations
  926. The Enemy of My Enemy Is My Friend: Exploring Inverse Adversaries for Improving Adversarial TrainingPoster42 citations
  927. Towards Compositional Adversarial Robustness: Generalizing Adversarial Training to Composite Semantic PerturbationsPoster42 citations
  928. COT: Unsupervised Domain Adaptation With Clustering and Optimal TransportPoster41 citations
  929. Disentangling Writer and Character Styles for Handwriting GenerationPoster41 citations
  930. FREDOM: Fairness Domain Adaptation Approach to Semantic Scene UnderstandingPoster41 citations
  931. HGFormer: Hierarchical Grouping Transformer for Domain Generalized Semantic SegmentationPoster41 citations
  932. Mind the Label Shift of Augmentation-Based Graph OOD GeneralizationPoster41 citations
  933. Modeling Inter-Class and Intra-Class Constraints in Novel Class DiscoveryPoster41 citations
  934. Reconstructing Animatable Categories From VideosPoster41 citations
  935. Sampling Is Matter: Point-Guided 3D Human Mesh ReconstructionPoster41 citations
  936. TIPI: Test Time Adaptation With Transformation InvariancePoster41 citations
  937. Teaching Matters: Investigating the Role of Supervision in Vision TransformersPoster41 citations
  938. Watch or Listen: Robust Audio-Visual Speech Recognition With Visual Corruption Modeling and Reliability ScoringPoster41 citations
  939. A2J-Transformer: Anchor-to-Joint Transformer Network for 3D Interacting Hand Pose Estimation From a Single RGB ImagePoster40 citations
  940. Active Finetuning: Exploiting Annotation Budget in the Pretraining-Finetuning ParadigmPoster40 citations
  941. Adaptive Assignment for Geometry Aware Local Feature MatchingPoster40 citations
  942. Adaptive Patch Deformation for Textureless-Resilient Multi-View StereoPoster40 citations
  943. CiCo: Domain-Aware Sign Language Retrieval via Cross-Lingual Contrastive LearningPoster40 citations
  944. Connecting the Dots: Floorplan Reconstruction Using Two-Level QueriesPoster40 citations
  945. DNeRV: Modeling Inherent Dynamics via Difference Neural Representation for VideosPoster40 citations
  946. DynamicDet: A Unified Dynamic Architecture for Object DetectionPoster40 citations
  947. Egocentric Audio-Visual Object LocalizationPoster40 citations
  948. Exploring the Relationship Between Architectural Design and Adversarially Robust GeneralizationPoster40 citations
  949. Improving Table Structure Recognition With Visual-Alignment Sequential Coordinate ModelingPoster40 citations
  950. Learning the Distribution of Errors in Stereo Matching for Joint Disparity and Uncertainty EstimationPoster40 citations
  951. Local Implicit Normalizing Flow for Arbitrary-Scale Image Super-ResolutionPoster40 citations
  952. MAP: Multimodal Uncertainty-Aware Vision-Language Pre-Training ModelPoster40 citations
  953. NeuralEditor: Editing Neural Radiance Fields via Manipulating Point CloudsPoster40 citations
  954. OCTET: Object-Aware Counterfactual ExplanationsPoster40 citations
  955. Open Set Action Recognition via Multi-Label Evidential LearningPoster40 citations
  956. PartManip: Learning Cross-Category Generalizable Part Manipulation Policy From Point Cloud ObservationsPoster40 citations
  957. Position-Guided Text Prompt for Vision-Language Pre-TrainingPoster40 citations
  958. Progressive Random Convolutions for Single Domain GeneralizationPoster40 citations
  959. PyPose: A Library for Robot Learning With Physics-Based OptimizationPoster40 citations
  960. Re-Basin via Implicit Sinkhorn DifferentiationPoster40 citations
  961. RefSR-NeRF: Towards High Fidelity and Super Resolution View SynthesisPoster40 citations
  962. SFD2: Semantic-Guided Feature Detection and DescriptionPoster40 citations
  963. Style Projected Clustering for Domain Generalized Semantic SegmentationPoster40 citations
  964. TarViS: A Unified Approach for Target-Based Video SegmentationHighlight40 citations
  965. TexPose: Neural Texture Learning for Self-Supervised 6D Object Pose EstimationPoster40 citations
  966. Towards Generalisable Video Moment Retrieval: Visual-Dynamic Injection to Image-Text Pre-TrainingPoster40 citations
  967. Towards Unsupervised Object Detection From LiDAR Point CloudsPoster40 citations
  968. VLPD: Context-Aware Pedestrian Detection via Vision-Language Semantic Self-SupervisionPoster40 citations
  969. WINNER: Weakly-Supervised hIerarchical decompositioN and aligNment for Spatio-tEmporal Video gRoundingPoster40 citations
  970. A Unified HDR Imaging Method With Pixel and Patch LevelPoster39 citations
  971. Adaptive Zone-Aware Hierarchical Planner for Vision-Language NavigationPoster39 citations
  972. Blur Interpolation Transformer for Real-World Motion From BlurPoster39 citations
  973. CARTO: Category and Joint Agnostic Reconstruction of ARTiculated ObjectsPoster39 citations
  974. Distilling Self-Supervised Vision Transformers for Weakly-Supervised Few-Shot Classification & SegmentationPoster39 citations
  975. Generating Part-Aware Editable 3D Shapes Without 3D SupervisionPoster39 citations
  976. Hierarchical Prompt Learning for Multi-Task LearningPoster39 citations
  977. High-Fidelity Guided Image Synthesis With Latent Diffusion ModelsPoster39 citations
  978. Learning From Noisy Labels With Decoupled Meta Label PurifierPoster39 citations
  979. Learning Visual Representations via Language-Guided SamplingPoster39 citations
  980. MMANet: Margin-Aware Distillation and Modality-Aware Regularization for Incomplete Multimodal LearningPoster39 citations
  981. MagicNet: Semi-Supervised Multi-Organ Segmentation via Magic-Cube Partition and RecoveryPoster39 citations
  982. MixSim: A Hierarchical Framework for Mixed Reality Traffic SimulationPoster39 citations
  983. Music-Driven Group ChoreographyPoster39 citations
  984. NaQ: Leveraging Narrations As Queries To Supervise Episodic MemoryPoster39 citations
  985. NeuralDome: A Neural Modeling Pipeline on Multi-View Human-Object InteractionsPoster39 citations
  986. Open-Vocabulary Attribute DetectionPoster39 citations
  987. PointConvFormer: Revenge of the Point-Based ConvolutionPoster39 citations
  988. ReLight My NeRF: A Dataset for Novel View Synthesis and Relighting of Real World ObjectsHighlight39 citations
  989. ScaleKD: Distilling Scale-Aware Knowledge in Small Object DetectorPoster39 citations
  990. Self-Supervised 3D Scene Flow Estimation Guided by SuperpointsPoster39 citations
  991. Self-Supervised Geometry-Aware Encoder for Style-Based 3D GAN InversionPoster39 citations
  992. SkyEye: Self-Supervised Bird's-Eye-View Semantic Mapping Using Monocular Frontal View ImagesPoster39 citations
  993. Structured 3D Features for Reconstructing Controllable AvatarsPoster39 citations
  994. SurfelNeRF: Neural Surfel Radiance Fields for Online Photorealistic Reconstruction of Indoor ScenesPoster39 citations
  995. TTA-COPE: Test-Time Adaptation for Category-Level Object Pose EstimationPoster39 citations
  996. Towards Efficient Use of Multi-Scale Features in Transformer-Based Object DetectorsPoster39 citations
  997. Unbiased Scene Graph Generation in VideosPoster39 citations
  998. VL-SAT: Visual-Linguistic Semantics Assisted Training for 3D Semantic Scene Graph Prediction in Point CloudHighlight39 citations
  999. Balancing Logit Variation for Long-Tailed Semantic SegmentationPoster38 citations
  1000. Bi3D: Bi-Domain Active Learning for Cross-Domain 3D Object DetectionPoster38 citations

Looking for submission deadlines instead? See the conference deadline calendar.

CVPR 2023 Accepted Papers · Full List of 2,307 Papers