← All conferences

CVPR 2022 Accepted Papers

The full list of 2,043 papers accepted at CVPR 2022 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Poster: 1,704Oral: 339
  1. High-Resolution Image Synthesis With Latent Diffusion ModelsOral18,394 citations
  2. Masked Autoencoders Are Scalable Vision LearnersOral9,635 citations
  3. A ConvNet for the 2020sPoster7,893 citations
  4. Restormer: Efficient Transformer for High-Resolution Image RestorationOral3,074 citations
  5. Masked-Attention Mask Transformer for Universal Image SegmentationPoster2,765 citations
  6. Swin Transformer V2: Scaling Up Capacity and ResolutionPoster2,410 citations
  7. Video Swin TransformerPoster2,237 citations
  8. Uformer: A General U-Shaped Transformer for Image RestorationPoster1,992 citations
  9. Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance FieldsOral1,944 citations
  10. Conditional Prompt Learning for Vision-Language ModelsPoster1,851 citations
  11. RePaint: Inpainting Using Denoising Diffusion Probabilistic ModelsPoster1,817 citations
  12. SimMIM: A Simple Framework for Masked Image ModelingPoster1,610 citations
  13. Efficient Geometry-Aware 3D Generative Adversarial NetworksOral1,564 citations
  14. Plenoxels: Radiance Fields Without Neural NetworksOral1,546 citations
  15. Scaling Vision TransformersPoster1,372 citations
  16. CSWin Transformer: A General Vision Transformer Backbone With Cross-Shaped WindowsPoster1,346 citations
  17. Scaling Up Your Kernels to 31x31: Revisiting Large Kernel Design in CNNsPoster1,302 citations
  18. Grounded Language-Image Pre-TrainingOral1,294 citations
  19. MetaFormer Is Actually What You Need for VisionOral1,278 citations
  20. Direct Voxel Grid Optimization: Super-Fast Convergence for Radiance Fields ReconstructionOral1,232 citations
  21. Towards Total Recall in Industrial Anomaly DetectionPoster1,227 citations
  22. Ego4D: Around the World in 3,000 Hours of Egocentric VideoOral1,162 citations
  23. Blended Diffusion for Text-Driven Editing of Natural ImagesPoster1,051 citations
  24. Depth-Supervised NeRF: Fewer Views and Faster Training for FreePoster1,030 citations
  25. TrackFormer: Multi-Object Tracking With TransformersPoster1,011 citations
  26. Learning To Prompt for Continual LearningPoster979 citations
  27. Vector Quantized Diffusion Model for Text-to-Image SynthesisOral959 citations
  28. CMT: Convolutional Neural Networks Meet Vision TransformersPoster954 citations
  29. MViTv2: Improved Multiscale Vision Transformers for Classification and DetectionPoster950 citations
  30. DN-DETR: Accelerate DETR Training by Introducing Query DeNoisingOral921 citations
  31. Decoupled Knowledge DistillationPoster894 citations
  32. Block-NeRF: Scalable Large Scene Neural View SynthesisOral874 citations
  33. Revisiting Skeleton-Based Action RecognitionOral816 citations
  34. Point-BERT: Pre-Training 3D Point Cloud Transformers With Masked Point ModelingPoster812 citations
  35. Toward Fast, Flexible, and Robust Low-Light Image EnhancementOral810 citations
  36. TransFusion: Robust LiDAR-Camera Fusion for 3D Object Detection With TransformersPoster806 citations
  37. FLAVA: A Foundational Language and Vision Alignment ModelPoster796 citations
  38. Self-Supervised Pre-Training of Swin Transformers for 3D Medical Image AnalysisPoster796 citations
  39. Masked Feature Prediction for Self-Supervised Visual Pre-TrainingPoster782 citations
  40. NICE-SLAM: Neural Implicit Scalable Encoding for SLAMPoster766 citations
  41. Vision Transformer With Deformable AttentionPoster765 citations
  42. Robust Fine-Tuning of Zero-Shot ModelsOral764 citations
  43. DiffusionCLIP: Text-Guided Diffusion Models for Robust Image ManipulationPoster747 citations
  44. Target-Aware Dual Adversarial Learning and a Multi-Scenario Multi-Modality Benchmark To Fuse Infrared and Visible for Object DetectionOral733 citations
  45. MaskGIT: Masked Generative Image TransformerPoster726 citations
  46. MixFormer: End-to-End Tracking With Iterative Mixed AttentionOral715 citations
  47. Point-NeRF: Point-Based Neural Radiance FieldsOral701 citations
  48. Mobile-Former: Bridging MobileNet and TransformerOral687 citations
  49. DenseCLIP: Language-Guided Dense Prediction With Context-Aware PromptingPoster678 citations
  50. RegNeRF: Regularizing Neural Radiance Fields for View Synthesis From Sparse InputsOral677 citations
  51. Ref-NeRF: Structured View-Dependent Appearance for Neural Radiance FieldsOral667 citations
  52. RegionCLIP: Region-Based Language-Image PretrainingPoster648 citations
  53. Zero-Shot Text-Guided Object Generation With Dream FieldsPoster628 citations
  54. LiT: Zero-Shot Transfer With Locked-Image Text TuningPoster627 citations
  55. MAXIM: Multi-Axis MLP for Image ProcessingOral624 citations
  56. Anomaly Detection via Reverse Distillation From One-Class EmbeddingPoster619 citations
  57. DAFormer: Improving Network Architectures and Training Strategies for Domain-Adaptive Semantic SegmentationPoster617 citations
  58. Generating Diverse and Natural 3D Human Motions From TextPoster615 citations
  59. GroupViT: Semantic Segmentation Emerges From Text SupervisionPoster612 citations
  60. URetinex-Net: Retinex-Based Deep Unfolding Network for Low-Light Image EnhancementPoster612 citations
  61. Scaling Vision Transformers to Gigapixel Images via Hierarchical Self-Supervised LearningOral556 citations
  62. Continual Test-Time Domain AdaptationPoster551 citations
  63. HumanNeRF: Free-Viewpoint Rendering of Moving People From Monocular VideoOral550 citations
  64. Image Segmentation Using Text and Image PromptsPoster550 citations
  65. AdaFace: Quality Adaptive Margin for Face RecognitionOral544 citations
  66. BasicVSR++: Improving Video Super-Resolution With Enhanced Propagation and AlignmentPoster541 citations
  67. PointCLIP: Point Cloud Understanding by CLIPPoster524 citations
  68. Stratified Transformer for 3D Point Cloud SegmentationPoster520 citations
  69. On the Integration of Self-Attention and ConvolutionPoster517 citations
  70. Semi-Supervised Semantic Segmentation Using Unreliable Pseudo-LabelsPoster495 citations
  71. NeRF in the Dark: High Dynamic Range View Synthesis From Noisy Raw ImagesOral489 citations
  72. Neural 3D Video Synthesis From Multi-View VideoOral486 citations
  73. ST++: Make Self-Training Work Better for Semi-Supervised Semantic SegmentationPoster477 citations
  74. DeepFusion: Lidar-Camera Deep Fusion for Multi-Modal 3D Object DetectionPoster476 citations
  75. SNR-Aware Low-Light Image EnhancementPoster475 citations
  76. GMFlow: Learning Optical Flow via Global MatchingOral459 citations
  77. CLIP-NeRF: Text-and-Image Driven Manipulation of Neural Radiance FieldsPoster458 citations
  78. Diffusion Autoencoders: Toward a Meaningful and Decodable RepresentationOral456 citations
  79. Geometric Transformer for Fast and Robust Point Cloud RegistrationOral454 citations
  80. Dataset Distillation by Matching Training TrajectoriesOral451 citations
  81. CRIS: CLIP-Driven Referring Image SegmentationPoster441 citations
  82. Winoground: Probing Vision and Language Models for Visio-Linguistic CompositionalityPoster440 citations
  83. Oriented RepPoints for Aerial Object DetectionPoster435 citations
  84. An Empirical Study of Training End-to-End Vision-and-Language TransformersPoster430 citations
  85. DAIR-V2X: A Large-Scale Dataset for Vehicle-Infrastructure Cooperative 3D Object DetectionPoster428 citations
  86. Neural Window Fully-Connected CRFs for Monocular Depth EstimationPoster424 citations
  87. DyTox: Transformers for Continual Learning With DYnamic TOken eXpansionPoster420 citations
  88. MAT: Mask-Aware Transformer for Large Hole Image InpaintingOral417 citations
  89. QueryDet: Cascaded Sparse Query for Accelerating High-Resolution Small Object DetectionOral417 citations
  90. MHFormer: Multi-Hypothesis Transformer for 3D Human Pose EstimationPoster415 citations
  91. VL-Adapter: Parameter-Efficient Transfer Learning for Vision-and-Language TasksPoster415 citations
  92. Mega-NERF: Scalable Construction of Large-Scale NeRFs for Virtual Fly-ThroughsPoster414 citations
  93. Image Dehazing Transformer With Transmission-Aware 3D Position EmbeddingPoster412 citations
  94. DTFD-MIL: Double-Tier Feature Distillation Multiple Instance Learning for Histopathology Whole Slide Image ClassificationOral407 citations
  95. ViM: Out-of-Distribution With Virtual-Logit MatchingPoster405 citations
  96. Extracting Triangular 3D Models, Materials, and Lighting From ImagesOral404 citations
  97. Dense Depth Priors for Neural Radiance Fields From Sparse Input ViewsPoster402 citations
  98. Rethinking Semantic Segmentation: A Prototype ViewOral402 citations
  99. Learning To Prompt for Open-Vocabulary Object Detection With Vision-Language ModelPoster398 citations
  100. TransWeather: Transformer-Based Restoration of Images Degraded by Adverse Weather ConditionsPoster398 citations
  101. Not All Points Are Equal: Learning Highly Efficient Point-Based Detectors for 3D LiDAR Point CloudsOral389 citations
  102. Autoregressive Image Generation Using Residual QuantizationPoster386 citations
  103. On Aliased Resizing and Surprising Subtleties in GAN EvaluationPoster386 citations
  104. Text2Mesh: Text-Driven Neural Stylization for MeshesOral386 citations
  105. Fine-Tuning Global Model via Data-Free Knowledge Distillation for Non-IID Federated LearningPoster385 citations
  106. LAVT: Language-Aware Vision Transformer for Referring Image SegmentationPoster385 citations
  107. Neural RGB-D Surface ReconstructionPoster384 citations
  108. Detecting Deepfakes With Self-Blended ImagesOral381 citations
  109. Transforming Model Prediction for TrackingPoster380 citations
  110. StyTr2: Image Style Transfer With TransformersPoster379 citations
  111. A-ViT: Adaptive Tokens for Efficient Vision TransformerOral378 citations
  112. StyleSDF: High-Resolution 3D-Consistent Image and Geometry GenerationOral374 citations
  113. MPViT: Multi-Path Vision Transformer for Dense PredictionPoster360 citations
  114. Knowledge Distillation: A Good Teacher Is Patient and ConsistentOral358 citations
  115. ELIC: Efficient Learned Image Compression With Unevenly Grouped Space-Channel Contextual Adaptive CodingOral356 citations
  116. Focal and Global Knowledge Distillation for DetectorsPoster356 citations
  117. ISNet: Shape Matters for Infrared Small Target DetectionPoster353 citations
  118. All-in-One Image Restoration for Unknown CorruptionPoster351 citations
  119. Vision-Language Pre-Training With Triple Contrastive LearningPoster351 citations
  120. DF-GAN: A Simple and Effective Baseline for Text-to-Image SynthesisOral349 citations
  121. Zoom in and Out: A Mixed-Scale Triplet Network for Camouflaged Object DetectionPoster349 citations
  122. Multiview Transformers for Video RecognitionPoster348 citations
  123. Contrastive Test-Time AdaptationPoster347 citations
  124. FedDC: Federated Learning With Non-IID Data via Local Drift Decoupling and CorrectionPoster346 citations
  125. ICON: Implicit Clothed Humans Obtained From NormalsPoster343 citations
  126. Urban Radiance FieldsPoster343 citations
  127. Scaling Up Vision-Language Pre-Training for Image CaptioningPoster341 citations
  128. Prompt Distribution LearningPoster340 citations
  129. MixSTE: Seq2seq Mixed Spatio-Temporal Encoder for 3D Human Pose Estimation in VideoPoster339 citations
  130. HiVT: Hierarchical Vector Transformer for Multi-Agent Motion PredictionPoster337 citations
  131. Shunted Self-Attention via Multi-Scale Token AggregationOral335 citations
  132. Deblurring via Stochastic RefinementOral334 citations
  133. CrossPoint: Self-Supervised Cross-Modal Contrastive Learning for 3D Point Cloud UnderstandingPoster333 citations
  134. Mask-Guided Spectral-Wise Transformer for Efficient Hyperspectral Image ReconstructionPoster333 citations
  135. HyperStyle: StyleGAN Inversion With HyperNetworks for Real Image EditingPoster330 citations
  136. Decoupling Zero-Shot Semantic SegmentationPoster329 citations
  137. SwinBERT: End-to-End Transformers With Sparse Attention for Video CaptioningPoster329 citations
  138. DanceTrack: Multi-Object Tracking in Uniform Appearance and Diverse MotionPoster327 citations
  139. CLIP-Forge: Towards Zero-Shot Text-To-Shape GenerationPoster323 citations
  140. Practical Stereo Matching via Cascaded Recurrent Network With Adaptive CorrelationOral318 citations
  141. StyleSwin: Transformer-Based GAN for High-Resolution Image GenerationPoster318 citations
  142. StyleGAN-V: A Continuous Video Generator With the Price, Image Quality and Perks of StyleGAN2Poster316 citations
  143. MonoScene: Monocular 3D Semantic Scene CompletionPoster314 citations
  144. Cross-View Transformers for Real-Time Map-View Semantic SegmentationOral313 citations
  145. High-Fidelity GAN Inversion for Image Attribute EditingPoster313 citations
  146. SimVP: Simpler Yet Better Video PredictionPoster312 citations
  147. InfoGCN: Representation Learning for Human Skeleton-Based Action RecognitionPoster310 citations
  148. Multi-Level Feature Learning for Contrastive Multi-View ClusteringOral308 citations
  149. Towards Language-Free Training for Text-to-Image GenerationPoster307 citations
  150. Embracing Single Stride 3D Object Detector With Sparse TransformerPoster305 citations
  151. TopFormer: Token Pyramid Transformer for Mobile Semantic SegmentationPoster304 citations
  152. AdaViT: Adaptive Vision Transformers for Efficient Image RecognitionPoster301 citations
  153. CLIPstyler: Image Style Transfer With a Single Text ConditionPoster301 citations
  154. Multi-Class Token Transformer for Weakly Supervised Semantic SegmentationPoster301 citations
  155. End-to-End Reconstruction-Classification Learning for Face Forgery DetectionPoster299 citations
  156. Learn From Others and Be Yourself in Heterogeneous Federated LearningPoster299 citations
  157. SoftGroup for 3D Instance Segmentation on Point CloudsOral297 citations
  158. Focal Sparse Convolutional Networks for 3D Object DetectionOral295 citations
  159. Panoptic Neural Fields: A Semantic Object-Aware Neural Scene RepresentationPoster293 citations
  160. Perturbed and Strict Mean Teachers for Semi-Supervised Semantic SegmentationPoster293 citations
  161. HeadNeRF: A Real-Time NeRF-Based Parametric Head ModelPoster292 citations
  162. Forward Compatible Few-Shot Class-Incremental LearningPoster290 citations
  163. Deblur-NeRF: Neural Radiance Fields From Blurry ImagesPoster289 citations
  164. MERLOT Reserve: Neural Script Knowledge Through Vision and Language and SoundOral286 citations
  165. NeRF-Editing: Geometry Editing of Neural Radiance FieldsPoster285 citations
  166. Learning What Not To Segment: A New Perspective on Few-Shot SegmentationOral284 citations
  167. Attention Concatenation Volume for Accurate and Efficient Stereo MatchingPoster283 citations
  168. Self-Supervised Predictive Convolutional Attentive Block for Anomaly DetectionOral283 citations
  169. BEVT: BERT Pretraining of Video TransformersPoster282 citations
  170. Selective-Supervised Contrastive Learning With Noisy LabelsPoster280 citations
  171. Omnivore: A Single Model for Many Visual ModalitiesOral278 citations
  172. CAFE: Learning To Condense Dataset by Aligning FeaturesPoster277 citations
  173. VisualGPT: Data-Efficient Adaptation of Pretrained Language Models for Image CaptioningPoster277 citations
  174. Generalized Category DiscoveryPoster274 citations
  175. Multi-Scale High-Resolution Vision Transformer for Semantic SegmentationPoster274 citations
  176. Part-Based Pseudo Label Refinement for Unsupervised Person Re-IdentificationPoster274 citations
  177. SimMatch: Semi-Supervised Learning With Similarity MatchingPoster274 citations
  178. Come-Closer-Diffuse-Faster: Accelerating Conditional Diffusion Models for Inverse Problems Through Stochastic ContractionPoster273 citations
  179. Self-Supervised Learning of Adversarial Example: Towards Good Generalizations for Deepfake DetectionOral271 citations
  180. AutoSDF: Shape Priors for 3D Completion, Reconstruction and GenerationPoster268 citations
  181. GRAM: Generative Radiance Manifolds for 3D-Aware Image GenerationOral264 citations
  182. Joint Distribution Matters: Deep Brownian Distance Covariance for Few-Shot ClassificationOral264 citations
  183. Learning Affinity From Attention: End-to-End Weakly-Supervised Semantic Segmentation With TransformersPoster262 citations
  184. MeMViT: Memory-Augmented Multiscale Vision Transformer for Efficient Long-Term Video RecognitionOral261 citations
  185. REGTR: End-to-End Point Cloud Correspondences With TransformersPoster261 citations
  186. Self-Augmented Unpaired Image Dehazing via Density and Depth DecompositionPoster261 citations
  187. Balanced Contrastive Learning for Long-Tailed Visual RecognitionPoster259 citations
  188. CLRNet: Cross Layer Refinement Network for Lane DetectionPoster259 citations
  189. FaceFormer: Speech-Driven 3D Facial Animation With TransformersOral258 citations
  190. Deep Generalized Unfolding Networks for Image RestorationPoster256 citations
  191. I M Avatar: Implicit Morphable Head Avatars From VideosOral254 citations
  192. Perception Prioritized Training of Diffusion ModelsPoster254 citations
  193. Simple but Effective: CLIP Embeddings for Embodied AIPoster252 citations
  194. Stochastic Trajectory Prediction via Motion Indeterminacy DiffusionPoster252 citations
  195. Towards Robust Vision TransformerPoster252 citations
  196. Sparse Fuse Dense: Towards High Quality 3D Detection With Depth CompletionOral251 citations
  197. Class-Incremental Learning by Knowledge Distillation With Adaptive Feature ConsolidationOral249 citations
  198. Kubric: A Scalable Dataset GeneratorPoster249 citations
  199. Targeted Supervised Contrastive Learning for Long-Tailed RecognitionPoster249 citations
  200. Unified Contrastive Learning in Image-Text-Label SpacePoster249 citations
  201. PhysFormer: Facial Video-Based Physiological Measurement With Temporal Difference TransformerPoster248 citations
  202. Surface Representation for Point CloudsOral248 citations
  203. Balanced Multimodal Learning via On-the-Fly Gradient ModulationOral247 citations
  204. Cross-Image Relational Knowledge Distillation for Semantic SegmentationPoster247 citations
  205. Assembly101: A Large-Scale Multi-View Video Dataset for Understanding Procedural ActivitiesPoster246 citations
  206. Knowledge Distillation With the Reused Teacher ClassifierPoster246 citations
  207. Pushing the Limits of Simple Pipelines for Few-Shot Learning: External Data and Fine-Tuning Make a DifferencePoster246 citations
  208. Patch Slimming for Efficient Vision TransformersPoster245 citations
  209. Exact Feature Distribution Matching for Arbitrary Style Transfer and Domain GeneralizationOral244 citations
  210. FMCNet: Feature-Level Modality Compensation for Visible-Infrared Person Re-IdentificationPoster242 citations
  211. Rethinking Visual Geo-Localization for Large-Scale ApplicationsPoster242 citations
  212. OW-DETR: Open-World Detection TransformerPoster240 citations
  213. Localization Distillation for Dense Object DetectionPoster239 citations
  214. Align and Prompt: Video-and-Language Pre-Training With Entity PromptsPoster235 citations
  215. Neural Rays for Occlusion-Aware Image-Based RenderingPoster234 citations
  216. Cross-Domain Adaptive Teacher for Object DetectionPoster233 citations
  217. Layer-Wised Model Aggregation for Personalized Federated LearningPoster233 citations
  218. Thin-Plate Spline Motion Model for Image AnimationPoster233 citations
  219. Dual Cross-Attention Learning for Fine-Grained Visual Categorization and Object Re-IdentificationPoster230 citations
  220. Fast Point TransformerPoster230 citations
  221. EMOCA: Emotion Driven Monocular Face Capture and AnimationPoster229 citations
  222. Boosting Crowd Counting via Multifaceted AttentionPoster228 citations
  223. HDR-NeRF: High Dynamic Range Neural Radiance FieldsPoster228 citations
  224. HumanNeRF: Efficiently Generated Human Radiance Field From Sparse InputsPoster227 citations
  225. ABO: Dataset and Benchmarks for Real-World 3D Object UnderstandingPoster225 citations
  226. Advancing High-Resolution Video-Language Representation With Large-Scale Video TranscriptionsPoster225 citations
  227. Clothes-Changing Person Re-Identification With RGB Modality OnlyPoster225 citations
  228. InfoNeRF: Ray Entropy Minimization for Few-Shot Neural Volume RenderingPoster225 citations
  229. Rethinking Architecture Design for Tackling Data Heterogeneity in Federated LearningPoster224 citations
  230. Neural Head Avatars From Monocular RGB VideosPoster223 citations
  231. GeoNeRF: Generalizing NeRF With Geometry PriorsPoster221 citations
  232. MeMOT: Multi-Object Tracking With MemoryOral221 citations
  233. SIGMA: Semantic-Complete Graph Matching for Domain Adaptive Object DetectionOral221 citations
  234. End-to-End Generative Pretraining for Multimodal Video CaptioningPoster220 citations
  235. Point Density-Aware Voxels for LiDAR 3D Object DetectionPoster219 citations
  236. Structured Local Radiance Fields for Human Avatar ModelingPoster218 citations
  237. Bailando: 3D Dance Generation by Actor-Critic GPT With Choreographic MemoryOral217 citations
  238. Detecting Camouflaged Object in Frequency DomainPoster217 citations
  239. Local Learning Matters: Rethinking Data Heterogeneity in Federated LearningOral217 citations
  240. Multimodal Token Fusion for Vision TransformersPoster217 citations
  241. Self-Supervised Models Are Continual LearnersPoster217 citations
  242. Learning From All VehiclesPoster216 citations
  243. Modulated Contrast for Versatile Image SynthesisPoster216 citations
  244. Point-to-Voxel Knowledge Distillation for LiDAR Semantic SegmentationPoster215 citations
  245. Class Re-Activation Maps for Weakly-Supervised Semantic SegmentationPoster214 citations
  246. MonoDTR: Monocular 3D Object Detection With Depth-Aware TransformerPoster214 citations
  247. BEHAVE: Dataset and Method for Tracking Human Object InteractionsPoster213 citations
  248. Causality Inspired Representation Learning for Domain GeneralizationOral213 citations
  249. Learning With Twin Noisy Labels for Visible-Infrared Person Re-IdentificationPoster213 citations
  250. TCTrack: Temporal Contexts for Aerial TrackingPoster213 citations
  251. Local Texture Estimator for Implicit Representation FunctionPoster212 citations
  252. EDTER: Edge Detection With TransformerPoster211 citations
  253. Federated Class-Incremental LearningPoster211 citations
  254. Voxel Set Transformer: A Set-to-Set Approach to 3D Object Detection From Point CloudsPoster211 citations
  255. X-Pool: Cross-Modal Language-Video Attention for Text-Video RetrievalPoster211 citations
  256. Global Tracking TransformersPoster209 citations
  257. Scene Representation Transformer: Geometry-Free Novel View Synthesis Through Set-Latent Scene RepresentationsPoster208 citations
  258. Visible-Thermal UAV Tracking: A Large-Scale Benchmark and New BaselinePoster208 citations
  259. Segment, Magnify and Reiterate: Detecting Camouflaged Objects the Hard WayPoster207 citations
  260. Self-Sustaining Representation Expansion for Non-Exemplar Class-Incremental LearningPoster207 citations
  261. Generative Cooperative Learning for Unsupervised Video Anomaly DetectionPoster205 citations
  262. Depth-Aware Generative Adversarial Network for Talking Head Video GenerationPoster203 citations
  263. Domain Generalization via Shuffled Style Assembly for Face Anti-SpoofingPoster203 citations
  264. BANMo: Building Animatable 3D Neural Models From Many Casual VideosOral202 citations
  265. Learning Multiple Adverse Weather Removal via Two-Stage Knowledge Learning and Multi-Contrastive Regularization: Toward a Unified ModelPoster202 citations
  266. Rethinking Efficient Lane Detection via Curve ModelingPoster202 citations
  267. Incremental Transformer Structure Enhanced Image Inpainting With Masking Positional EncodingPoster201 citations
  268. Reusing the Task-Specific Classifier as a Discriminator: Discriminator-Free Adversarial Domain AdaptationPoster201 citations
  269. Physical Inertial Poser (PIP): Physics-Aware Real-Time Human Motion Tracking From Sparse Inertial SensorsPoster200 citations
  270. The Majority Can Help the Minority: Context-Rich Minority Oversampling for Long-Tailed ClassificationPoster200 citations
  271. Category Contrast for Unsupervised Domain Adaptation in Visual TasksPoster199 citations
  272. Deep Hierarchical Semantic SegmentationPoster199 citations
  273. General Facial Representation Learning in a Visual-Linguistic MannerOral199 citations
  274. Revisiting the "Video" in Video-Language UnderstandingOral199 citations
  275. ScanQA: 3D Question Answering for Spatial Scene UnderstandingOral199 citations
  276. Long-Tailed Recognition via Weight BalancingPoster197 citations
  277. Are Multimodal Transformers Robust to Missing Modality?Poster196 citations
  278. Details or Artifacts: A Locally Discriminative Learning Approach to Realistic Image Super-ResolutionOral196 citations
  279. EPro-PnP: Generalized End-to-End Probabilistic Perspective-N-Points for Monocular Object Pose EstimationOral196 citations
  280. LAS-AT: Adversarial Training With Learnable Attack StrategyOral196 citations
  281. Unpaired Deep Image Deraining Using Dual Contrastive LearningPoster196 citations
  282. Blind2Unblind: Self-Supervised Image Denoising With Visible Blind SpotsPoster195 citations
  283. Transformer Tracking With Cyclic Shifting Window AttentionPoster195 citations
  284. Regional Semantic Contrast and Aggregation for Weakly Supervised Semantic SegmentationPoster194 citations
  285. Self-Supervised Transformers for Unsupervised Object Discovery Using Normalized CutPoster194 citations
  286. Few-Shot Object Detection With Fully Cross-TransformerOral193 citations
  287. Gait Recognition in the Wild With Dense 3D Representations and a BenchmarkPoster192 citations
  288. Self-Supervised Image-Specific Prototype Exploration for Weakly Supervised Semantic SegmentationPoster192 citations
  289. Shadows Can Be Dangerous: Stealthy and Effective Physical-World Adversarial Attack by Natural PhenomenonPoster192 citations
  290. UMT: Unified Multi-Modal Transformers for Joint Video Moment Retrieval and Highlight DetectionPoster191 citations
  291. Correlation-Aware Deep TrackingPoster190 citations
  292. ObjectFormer for Image Manipulation Detection and LocalizationPoster190 citations
  293. Spiking Transformers for Event-Based Single Object TrackingPoster190 citations
  294. Deep Spectral Methods: A Surprisingly Strong Baseline for Unsupervised Semantic Segmentation and LocalizationOral188 citations
  295. HDNet: High-Resolution Dual-Domain Learning for Spectral Compressive ImagingPoster188 citations
  296. Language As Queries for Referring Video Object SegmentationPoster188 citations
  297. Neural 3D Scene Reconstruction With the Manhattan-World AssumptionOral188 citations
  298. UniCon: Combating Label Noise Through Uniform Selection and Contrastive LearningPoster188 citations
  299. Constrained Few-Shot Class-Incremental LearningPoster187 citations
  300. Parameter-Free Online Test-Time AdaptationOral187 citations
  301. DoubleField: Bridging the Neural Surface and Radiance Fields for High-Fidelity Human Reconstruction and RenderingPoster186 citations
  302. MetaFSCIL: A Meta-Learning Approach for Few-Shot Class Incremental LearningPoster186 citations
  303. Splicing ViT Features for Semantic Appearance TransferOral186 citations
  304. Towards an End-to-End Framework for Flow-Guided Video InpaintingPoster186 citations
  305. FocalClick: Towards Practical Interactive Image SegmentationPoster185 citations
  306. ZeroCap: Zero-Shot Image-to-Text Generation for Visual-Semantic ArithmeticPoster185 citations
  307. Contrastive Boundary Learning for Point Cloud SegmentationPoster184 citations
  308. Lepard: Learning Partial Point Cloud Matching in Rigid and Deformable ScenesOral184 citations
  309. SelfRecon: Self Reconstruction Your Digital Avatar From Monocular VideoOral184 citations
  310. Training High-Performance Low-Latency Spiking Neural Networks by Differentiation on Spike RepresentationPoster184 citations
  311. CLIMS: Cross Language Image Matching for Weakly Supervised Semantic SegmentationPoster183 citations
  312. HOI4D: A 4D Egocentric Dataset for Category-Level Human-Object InteractionPoster183 citations
  313. L2G: A Simple Local-to-Global Knowledge Transfer Framework for Weakly Supervised Semantic SegmentationPoster183 citations
  314. A Simple Multi-Modality Transfer Learning Baseline for Sign Language TranslationPoster182 citations
  315. Sparse Instance Activation for Real-Time Instance SegmentationPoster182 citations
  316. End-to-End Referring Video Object Segmentation With Multimodal TransformersPoster181 citations
  317. IFRNet: Intermediate Feature Refine Network for Efficient Frame InterpolationPoster181 citations
  318. Robust Federated Learning With Noisy and Heterogeneous ClientsPoster181 citations
  319. Think Global, Act Local: Dual-Scale Graph Transformer for Vision-and-Language NavigationOral181 citations
  320. TransGeo: Transformer Is All You Need for Cross-View Image Geo-LocalizationPoster181 citations
  321. Putting People in Their Place: Monocular Regression of 3D People in DepthPoster180 citations
  322. Bridging Video-Text Retrieval With Multiple Choice QuestionsOral179 citations
  323. Cloth-Changing Person Re-Identification From a Single Image With Gait Prediction and RegularizationPoster179 citations
  324. Feature Erasing and Diffusion Network for Occluded Person Re-IdentificationPoster179 citations
  325. Fourier PlenOctrees for Dynamic Radiance Field Rendering in Real-TimeOral178 citations
  326. Learning Memory-Augmented Unidirectional Metrics for Cross-Modality Person Re-IdentificationPoster178 citations
  327. PONI: Potential Functions for ObjectGoal Navigation With Interaction-Free LearningOral178 citations
  328. MSDN: Mutually Semantic Distillation Network for Zero-Shot LearningPoster177 citations
  329. UBnormal: New Benchmark for Supervised Open-Set Video Anomaly DetectionPoster177 citations
  330. Improving Adversarial Transferability via Neuron Attribution-Based AttacksPoster176 citations
  331. Protecting Celebrities From DeepFake With Identity Consistency TransformerPoster176 citations
  332. ReSTR: Convolution-Free Referring Image Segmentation Using TransformersPoster176 citations
  333. ZebraPose: Coarse To Fine Surface Encoding for 6DoF Object Pose EstimationPoster176 citations
  334. BACON: Band-Limited Coordinate Networks for Multiscale Scene RepresentationOral175 citations
  335. NFormer: Robust Person Re-Identification With Neighbor TransformerPoster175 citations
  336. NeRFReN: Neural Radiance Fields With ReflectionsPoster175 citations
  337. Keypoint Transformer: Solving Joint Identification in Challenging Hands and Object Interactions for Accurate 3D Pose EstimationOral174 citations
  338. OnePose: One-Shot Object Pose Estimation Without CAD ModelsPoster174 citations
  339. Negative-Aware Attention Framework for Image-Text MatchingPoster173 citations
  340. StylizedNeRF: Consistent 3D Scene Stylization As Stylized NeRF via 2D-3D Mutual LearningPoster172 citations
  341. Balanced MSE for Imbalanced Visual RegressionOral171 citations
  342. GroupNet: Multiscale Hypergraph Neural Networks for Trajectory Prediction With Relational ReasoningPoster171 citations
  343. P3Depth: Monocular Depth Estimation With a Piecewise Planarity PriorPoster170 citations
  344. Everything at Once - Multi-Modal Fusion Transformer for Video RetrievalPoster169 citations
  345. FENeRF: Face Editing in Neural Radiance FieldsPoster169 citations
  346. Modeling Indirect Illumination for Inverse RenderingPoster168 citations
  347. Rethinking Depth Estimation for Multi-View Stereo: A Unified RepresentationPoster168 citations
  348. Text to Image Generation With Semantic-Spatial Aware GANPoster168 citations
  349. TransVPR: Transformer-Based Place Recognition With Multi-Level Attention AggregationOral168 citations
  350. End-to-End Multi-Person Pose Estimation With TransformersOral167 citations
  351. Not All Tokens Are Equal: Human-Centric Visual Analysis via Token Clustering TransformerOral167 citations
  352. An Image Patch Is a Wave: Phase-Aware Vision MLPOral166 citations
  353. On Adversarial Robustness of Trajectory Prediction for Autonomous VehiclesPoster166 citations
  354. SC2-PCR: A Second Order Spatial Compatibility for Efficient and Robust Point Cloud RegistrationPoster166 citations
  355. SHIFT: A Synthetic Driving Dataset for Continuous Multi-Task Domain AdaptationPoster166 citations
  356. Deep Color Consistent Network for Low-Light Image EnhancementPoster165 citations
  357. EfficientNeRF Efficient Neural Radiance FieldsPoster165 citations
  358. GEN-VLKT: Simplify Association and Enhance Interaction Understanding for HOI DetectionPoster163 citations
  359. AEGNN: Asynchronous Event-Based Graph Neural NetworksPoster162 citations
  360. MiniViT: Compressing Vision Transformers With Weight MultiplexingPoster162 citations
  361. Pointly-Supervised Instance SegmentationOral162 citations
  362. MixFormer: Mixing Features Across Windows and DimensionsOral161 citations
  363. POCO: Point Convolution for Surface ReconstructionPoster161 citations
  364. Panoptic SegFormer: Delving Deeper Into Panoptic Segmentation With TransformersPoster161 citations
  365. Photorealistic Monocular 3D Reconstruction of Humans Wearing ClothingPoster161 citations
  366. Source-Free Domain Adaptation via Distribution EstimationPoster161 citations
  367. ShapeFormer: Transformer-Based Shape Completion via Sparse RepresentationPoster160 citations
  368. AP-BSN: Self-Supervised Denoising for Real-World Images via Asymmetric PD and Blind-Spot NetworkPoster159 citations
  369. PixMix: Dreamlike Pictures Comprehensively Improve Safety MeasuresPoster158 citations
  370. DETReg: Unsupervised Pretraining With Region Priors for Object DetectionPoster157 citations
  371. Deformable ProtoPNet: An Interpretable Image Classifier Using Deformable PrototypesPoster157 citations
  372. GCR: Gradient Coreset Based Replay Buffer Selection for Continual LearningPoster157 citations
  373. Generating Useful Accident-Prone Driving Scenarios via a Learned Traffic PriorPoster157 citations
  374. Learning To Answer Questions in Dynamic Audio-Visual ScenariosOral157 citations
  375. PCL: Proxy-Based Contrastive Learning for Domain GeneralizationPoster157 citations
  376. Semantic-Aware Domain Generalized SegmentationOral157 citations
  377. A Keypoint-Based Global Association Network for Lane DetectionPoster154 citations
  378. Mask Transfiner for High-Quality Instance SegmentationPoster154 citations
  379. Spatio-Temporal Relation Modeling for Few-Shot Action RecognitionPoster154 citations
  380. Light Field Neural RenderingOral153 citations
  381. HyperInverter: Improving StyleGAN Inversion via HypernetworkPoster152 citations
  382. Improving Neural Implicit Surfaces Geometry With Patch WarpingPoster152 citations
  383. Learning Non-Target Knowledge for Few-Shot Semantic SegmentationPoster152 citations
  384. Towards Efficient and Scalable Sharpness-Aware MinimizationPoster152 citations
  385. Towards Principled Disentanglement for Domain GeneralizationOral152 citations
  386. Video Frame Interpolation With TransformerPoster152 citations
  387. When Does Contrastive Visual Representation Learning Work?Poster152 citations
  388. AdaMixer: A Fast-Converging Query-Based Object DetectorOral151 citations
  389. CLIP-Event: Connecting Text and Images With Event StructuresOral151 citations
  390. Cross-Domain Few-Shot Learning With Task-Specific AdaptersPoster151 citations
  391. Lite Vision Transformer With Enhanced Self-AttentionPoster151 citations
  392. Remember Intentions: Retrospective-Memory-Based Trajectory PredictionPoster151 citations
  393. SwinTextSpotter: Scene Text Spotting via Better Synergy Between Text Detection and Text RecognitionPoster151 citations
  394. Capturing and Inferring Dense Full-Body Human-Scene ContactPoster150 citations
  395. Knowledge Distillation via the Target-Aware TransformerOral150 citations
  396. RigNeRF: Fully Controllable Neural 3D PortraitsPoster150 citations
  397. The Norm Must Go On: Dynamic Unsupervised Domain Adaptation by NormalizationPoster150 citations
  398. Leveraging Real Talking Faces via Self-Supervision for Robust Forgery DetectionPoster149 citations
  399. Time Lens++: Event-Based Frame Interpolation With Parametric Non-Linear Flow and Multi-Scale FusionPoster149 citations
  400. Expressive Talking Head Generation With Granular Audio-Visual ControlPoster148 citations
  401. b-DARTS: Beta-Decay Regularization for Differentiable Architecture SearchOral148 citations
  402. Adversarial Texture for Fooling Person Detectors in the Physical WorldOral147 citations
  403. GPV-Pose: Category-Level Object Pose Estimation via Geometry-Guided Point-Wise VotingPoster147 citations
  404. Improving Visual Grounding With Visual-Linguistic Verification and Iterative ReasoningPoster147 citations
  405. Invariant Grounding for Video Question AnsweringOral147 citations
  406. LiDAR Snowfall Simulation for Robust 3D Object DetectionOral147 citations
  407. PatchNet: A Simple Face Anti-Spoofing Framework via Fine-Grained Patch RecognitionPoster147 citations
  408. Uni-Perceiver: Pre-Training Unified Architecture for Generic Perception for Zero-Shot and Few-Shot TasksPoster147 citations
  409. Auditing Privacy Defenses in Federated Learning via Generative Gradient LeakagePoster146 citations
  410. CAT-Det: Contrastively Augmented Transformer for Multi-Modal 3D Object DetectionPoster145 citations
  411. Pastiche Master: Exemplar-Based High-Resolution Portrait Style TransferPoster145 citations
  412. Adaptive Early-Learning Correction for Segmentation From Noisy AnnotationsOral144 citations
  413. HyperTransformer: A Textural and Spectral Feature Fusion Transformer for PansharpeningPoster144 citations
  414. Style-Based Global Appearance Flow for Virtual Try-OnPoster144 citations
  415. Efficient Two-Stage Detection of Human-Object Interactions With a Novel Unary-Pairwise TransformerPoster143 citations
  416. Highly-Efficient Incomplete Large-Scale Multi-View Clustering With Consensus Bipartite GraphPoster143 citations
  417. C2AM: Contrastive Learning of Class-Agnostic Activation Map for Weakly Supervised Object Localization and Semantic SegmentationPoster142 citations
  418. Catching Both Gray and Black Swans: Open-Set Supervised Anomaly DetectionPoster142 citations
  419. Equalized Focal Loss for Dense Long-Tailed Object DetectionPoster142 citations
  420. 3D Common Corruptions and Data AugmentationOral141 citations
  421. 3D-Aware Image Synthesis via Learning Structural and Textural RepresentationsPoster141 citations
  422. Unbiased Teacher v2: Semi-Supervised Object Detection for Anchor-Free and Anchor-Based DetectorsPoster141 citations
  423. Crafting Better Contrastive Views for Siamese Representation LearningOral140 citations
  424. Hire-MLP: Vision MLP via Hierarchical RearrangementPoster140 citations
  425. Progressively Generating Better Initial Guesses Towards Next Stages for High-Quality Human Motion PredictionPoster140 citations
  426. PubTables-1M: Towards Comprehensive Table Extraction From Unstructured DocumentsPoster140 citations
  427. Stochastic Variance Reduced Ensemble Adversarial Attack for Boosting the Adversarial TransferabilityPoster140 citations
  428. Class-Aware Contrastive Semi-Supervised LearningPoster139 citations
  429. Coarse-To-Fine Q-Attention: Efficient Learning for Visual Robotic Manipulation via DiscretisationOral139 citations
  430. Lite Pose: Efficient Architecture Design for 2D Human Pose EstimationPoster139 citations
  431. FedCor: Correlation-Based Active Client Selection Strategy for Heterogeneous Federated LearningPoster138 citations
  432. Learning Hierarchical Cross-Modal Association for Co-Speech Gesture GenerationPoster138 citations
  433. SGTR: End-to-End Scene Graph Generation With TransformerPoster138 citations
  434. Simple Multi-Dataset DetectionPoster138 citations
  435. Unified Transformer Tracker for Object TrackingPoster138 citations
  436. Frequency-Driven Imperceptible Adversarial Attack on Semantic SimilarityPoster137 citations
  437. Hallucinated Neural Radiance Fields in the WildPoster137 citations
  438. Injecting Semantic Concepts Into End-to-End Image CaptioningPoster137 citations
  439. Robust Invertible Image SteganographyPoster137 citations
  440. SurfEmb: Dense and Continuous Correspondence Distributions for Object Pose Estimation With Learnt Surface EmbeddingsPoster137 citations
  441. Efficient Deep Embedded Subspace ClusteringPoster136 citations
  442. FreeSOLO: Learning To Segment Objects Without AnnotationsPoster136 citations
  443. GLAMR: Global Occlusion-Aware Human Mesh Recovery With Dynamic CamerasOral136 citations
  444. GraFormer: Graph-Oriented Transformer for 3D Pose EstimationPoster136 citations
  445. MuKEA: Multimodal Knowledge Extraction and Accumulation for Knowledge-Based Visual Question AnsweringPoster136 citations
  446. Video Frame Interpolation TransformerPoster136 citations
  447. Hyperbolic Vision Transformers: Combining Improvements in Metric LearningPoster135 citations
  448. Image-to-Lidar Self-Supervised Distillation for Autonomous Driving DataPoster135 citations
  449. Implicit Sample Extension for Unsupervised Person Re-IdentificationPoster135 citations
  450. Rope3D: The Roadside Perception Dataset for Autonomous Driving and Monocular 3D Object Detection TaskPoster135 citations
  451. Text Spotting TransformersPoster135 citations
  452. TransMix: Attend To Mix for Vision TransformersPoster135 citations
  453. CRAFT: Cross-Attentional Flow Transformer for Robust Optical FlowPoster134 citations
  454. Pyramid Grafting Network for One-Stage High Resolution Saliency DetectionPoster134 citations
  455. Backdoor Attacks on Self-Supervised LearningOral133 citations
  456. Delving Deep Into the Generalization of Vision Transformers Under Distribution ShiftsPoster133 citations
  457. HairCLIP: Design Your Hair by Text and Reference ImagePoster133 citations
  458. Interacting Attention Graph for Single Image Two-Hand ReconstructionOral133 citations
  459. Long-Tailed Visual Recognition via Gaussian Clouded Logit AdjustmentPoster133 citations
  460. Multimodal Dynamics: Dynamical Fusion for Trustworthy Multimodal ClassificationPoster133 citations
  461. Active Learning by Feature MixingPoster132 citations
  462. DINE: Domain Adaptation From Single and Multiple Black-Box PredictorsOral132 citations
  463. Debiased Learning From Naturally Imbalanced Pseudo-LabelsPoster132 citations
  464. Multi-View Transformer for 3D Visual GroundingPoster132 citations
  465. Deep Constrained Least Squares for Blind Image Super-ResolutionPoster131 citations
  466. Representation Compensation Networks for Continual Semantic SegmentationPoster131 citations
  467. Revisiting Random Channel Pruning for Neural Network CompressionPoster131 citations
  468. Self-Supervised Video TransformerOral131 citations
  469. Burst Image Restoration and EnhancementOral130 citations
  470. Discrete Cosine Transform Network for Guided Depth Map Super-ResolutionOral130 citations
  471. Protecting Facial Privacy: Generating Adversarial Identity Masks via Style-Robust Makeup TransferPoster130 citations
  472. Accelerating DETR Convergence via Semantic-Aligned MatchingPoster129 citations
  473. Comprehending and Ordering Semantics for Image CaptioningPoster129 citations
  474. Face2Exp: Combating Data Biases for Facial Expression RecognitionPoster129 citations
  475. Overcoming Catastrophic Forgetting in Incremental Object Detection via Elastic Response DistillationPoster129 citations
  476. PTTR: Relational 3D Point Cloud Object Tracking With TransformerPoster129 citations
  477. HandOccNet: Occlusion-Robust 3D Hand Mesh Estimation NetworkPoster127 citations
  478. Matching Feature Sets for Few-Shot Image ClassificationPoster127 citations
  479. Retrieval Augmented Classification for Long-Tail Visual RecognitionPoster127 citations
  480. Stacked Hybrid-Attention and Group Collaborative Learning for Unbiased Scene Graph GenerationPoster127 citations
  481. Weakly Supervised Semantic Segmentation Using Out-of-Distribution DataPoster127 citations
  482. RFNet: Unsupervised Network for Mutually Reinforcing Multi-Modal Image Registration and FusionPoster126 citations
  483. Towards Data-Free Model Stealing in a Hard Label SettingPoster126 citations
  484. Investigating Tradeoffs in Real-World Video Super-ResolutionPoster125 citations
  485. Learning Trajectory-Aware Transformer for Video Super-ResolutionOral125 citations
  486. NeRFusion: Fusing Radiance Fields for Large-Scale Scene ReconstructionOral125 citations
  487. OoD-Bench: Quantifying and Understanding Two Dimensions of Out-of-Distribution GeneralizationOral125 citations
  488. A Dual Weighting Label Assignment Scheme for Object DetectionPoster124 citations
  489. ACPL: Anti-Curriculum Pseudo-Labelling for Semi-Supervised Medical Image ClassificationPoster124 citations
  490. GOAL: Generating 4D Whole-Body Motion for Hand-Object GraspingPoster124 citations
  491. Recurring the Transformer for Video Action RecognitionPoster124 citations
  492. Rethinking Spatial Invariance of Convolutional Networks for Object CountingPoster124 citations
  493. Event-Based Video Reconstruction via Potential-Assisted Spiking Neural NetworkPoster123 citations
  494. FIBA: Frequency-Injection Based Backdoor Attack in Medical Image AnalysisPoster123 citations
  495. IterMVS: Iterative Probability Estimation for Efficient Multi-View StereoPoster123 citations
  496. Label, Verify, Correct: A Simple Few Shot Object Detection MethodPoster123 citations
  497. MAD: A Scalable Dataset for Language Grounding in Videos From Movie Audio DescriptionsPoster123 citations
  498. RestoreFormer: High-Quality Blind Face Restoration From Undegraded Key-Value PairsPoster123 citations
  499. BoostMIS: Boosting Medical Image Semi-Supervised Learning With Adaptive Pseudo Labeling and Informative Active AnnotationPoster122 citations
  500. Estimating Example Difficulty Using Variance of GradientsPoster122 citations
  501. Graph Sampling Based Deep Metric Learning for Generalizable Person Re-IdentificationPoster122 citations
  502. M2I: From Factored Marginal Trajectory Prediction to Interactive PredictionPoster122 citations
  503. Robust Optimization As Data Augmentation for Large-Scale GraphsPoster122 citations
  504. BigDatasetGAN: Synthesizing ImageNet With Pixel-Wise AnnotationsPoster121 citations
  505. Coopernaut: End-to-End Driving With Cooperative Perception for Networked VehiclesPoster121 citations
  506. Few Could Be Better Than All: Feature Sampling and Grouping for Scene Text DetectionPoster121 citations
  507. Hybrid Relation Guided Set Matching for Few-Shot Action RecognitionPoster121 citations
  508. Nested Collaborative Learning for Long-Tailed Visual RecognitionPoster121 citations
  509. Nonuniform-to-Uniform Quantization: Towards Accurate Quantization via Generalized Straight-Through EstimationPoster121 citations
  510. Semi-Supervised Semantic Segmentation With Error Localization NetworkPoster121 citations
  511. Spatio-Temporal Gating-Adjacency GCN for Human Motion PredictionPoster121 citations
  512. Task-Specific Inconsistency Alignment for Domain Adaptive Object DetectionPoster121 citations
  513. 3DJCG: A Unified Framework for Joint Dense Captioning and Visual Grounding on 3D Point CloudsOral120 citations
  514. ASM-Loc: Action-Aware Segment Modeling for Weakly-Supervised Temporal Action LocalizationPoster120 citations
  515. BppAttack: Stealthy and Efficient Trojan Attacks Against Deep Neural Networks via Image Quantization and Contrastive Adversarial LearningPoster120 citations
  516. Bridging Global Context Interactions for High-Fidelity Image CompletionPoster120 citations
  517. FashionVLP: Vision Language Transformer for Fashion Retrieval With FeedbackPoster120 citations
  518. Self-Supervised Learning of Object Parts for Semantic SegmentationPoster120 citations
  519. TubeDETR: Spatio-Temporal Video Grounding With TransformersOral120 citations
  520. Unknown-Aware Object Detection: Learning What You Don't Know From Videos in the WildOral120 citations
  521. VideoINR: Learning Video Implicit Neural Representation for Continuous Space-Time Super-ResolutionPoster120 citations
  522. DASO: Distribution-Aware Semantics-Oriented Pseudo-Label for Imbalanced Semi-Supervised LearningPoster119 citations
  523. The Devil Is in the Labels: Noisy Label Correction for Robust Scene Graph GenerationOral119 citations
  524. C-CAM: Causal CAM for Weakly Supervised Semantic Segmentation on Medical ImagePoster118 citations
  525. Exploring Patch-Wise Semantic Relation for Contrastive Learning in Image-to-Image Translation TasksPoster118 citations
  526. What Makes Transfer Learning Work for Medical Images: Feature Reuse & Other FactorsPoster118 citations
  527. FineDiving: A Fine-Grained Dataset for Procedure-Aware Action Quality AssessmentOral117 citations
  528. Habitat-Web: Learning Embodied Object-Search Strategies From Human Demonstrations at ScalePoster117 citations
  529. Learning Neural Light Fields With Ray-Space EmbeddingPoster117 citations
  530. Safe Self-Refinement for Transformer-Based Domain AdaptationPoster117 citations
  531. Unsupervised Domain Adaptation for Nighttime Aerial TrackingPoster117 citations
  532. FedCorr: Multi-Stage Federated Learning for Label Noise CorrectionPoster116 citations
  533. IRON: Inverse Rendering by Optimizing Neural SDFs and Materials From Photometric ImagesOral116 citations
  534. LOLNerf: Learn From One LookPoster116 citations
  535. Sub-Word Level Lip Reading With Visual AttentionPoster116 citations
  536. Towards Semi-Supervised Deep Facial Expression Recognition With an Adaptive Confidence MarginPoster116 citations
  537. Ditto: Building Digital Twins of Articulated Objects From InteractionOral115 citations
  538. Hyperbolic Image SegmentationPoster114 citations
  539. Voxel Field Fusion for 3D Object DetectionPoster114 citations
  540. E2EC: An End-to-End Contour-Based Method for High-Quality High-Speed Instance SegmentationPoster113 citations
  541. Hierarchical Modular Network for Video CaptioningPoster113 citations
  542. Transform-Retrieve-Generate: Natural Language-Centric Outside-Knowledge Visual Question AnsweringPoster113 citations
  543. Affine Medical Image Registration With Coarse-To-Fine Vision TransformerPoster112 citations
  544. DiRA: Discriminative, Restorative, and Adversarial Learning for Self-Supervised Medical Image AnalysisPoster112 citations
  545. QS-Attn: Query-Selected Attention for Contrastive Learning in I2I TranslationPoster112 citations
  546. WildNet: Learning Domain Generalized Semantic Segmentation From the WildPoster112 citations
  547. Class-Balanced Pixel-Level Self-Labeling for Domain Adaptive Semantic SegmentationPoster111 citations
  548. ClusterGNN: Cluster-Based Coarse-To-Fine Graph Neural Network for Efficient Feature MatchingPoster111 citations
  549. D-Grasp: Physically Plausible Dynamic Grasp Synthesis for Hand-Object InteractionsPoster111 citations
  550. Dynamic Prototype Convolution Network for Few-Shot Semantic SegmentationPoster111 citations
  551. Exploring Domain-Invariant Parameters for Source Free Domain AdaptationPoster111 citations
  552. Learning To Generate Line Drawings That Convey Geometry and SemanticsPoster111 citations
  553. MISF: Multi-Level Interactive Siamese Filtering for High-Fidelity Image InpaintingPoster111 citations
  554. Segment and Complete: Defending Object Detectors Against Adversarial Patch Attacks With Robust Patch DetectionPoster111 citations
  555. SemanticStyleGAN: Learning Compositional Generative Priors for Controllable Image Synthesis and EditingPoster111 citations
  556. Towards Fewer Annotations: Active Learning via Region Impurity and Prediction Uncertainty for Domain Adaptive Semantic SegmentationOral111 citations
  557. CMT-DeepLab: Clustering Mask Transformers for Panoptic SegmentationOral110 citations
  558. Event-Aided Direct Sparse OdometryOral110 citations
  559. FERV39k: A Large-Scale Multi-Scene Dataset for Facial Expression Recognition in VideosPoster110 citations
  560. FaceVerse: A Fine-Grained and Detail-Controllable 3D Face Morphable Model From a Hybrid DatasetPoster110 citations
  561. Beyond 3D Siamese Tracking: A Motion-Centric Paradigm for 3D Single Object Tracking in Point CloudsOral109 citations
  562. CoNeRF: Controllable Neural Radiance FieldsPoster109 citations
  563. Generalized Few-Shot Semantic SegmentationPoster109 citations
  564. LaTr: Layout-Aware Transformer for Scene-Text VQAOral109 citations
  565. Multi-Frame Self-Supervised Depth With TransformersPoster109 citations
  566. Represent, Compare, and Learn: A Similarity-Aware Framework for Class-Agnostic CountingPoster109 citations
  567. Weakly Supervised Temporal Sentence Grounding With Gaussian-Based Contrastive Proposal LearningPoster109 citations
  568. A Self-Supervised Descriptor for Image Copy DetectionPoster108 citations
  569. Capturing Humans in Motion: Temporal-Attentive 3D Human Pose and Shape Estimation From Monocular VideoPoster108 citations
  570. Evading the Simplicity Bias: Training a Diverse Set of Models Discovers Solutions With Superior OOD GeneralizationPoster108 citations
  571. M3T: Three-Dimensional Medical Image Classifier Using Multi-Plane and Multi-Slice TransformerPoster108 citations
  572. Style Neophile: Constantly Seeking Novel Styles for Domain GeneralizationPoster108 citations
  573. Towards End-to-End Unified Scene Text Detection and Layout AnalysisPoster108 citations
  574. Towards Implicit Text-Guided 3D Shape GenerationPoster108 citations
  575. Bending Reality: Distortion-Aware Transformers for Adapting to Panoramic Semantic SegmentationPoster107 citations
  576. Coarse-To-Fine Deep Video Coding With Hyperprior-Guided Mode PredictionPoster107 citations
  577. DynamicEarthNet: Daily Multi-Spectral Satellite Dataset for Semantic Change SegmentationPoster107 citations
  578. MobRecon: Mobile-Friendly Hand Mesh Reconstruction From Monocular ImagePoster107 citations
  579. Mutual Information-Driven Pan-SharpeningPoster107 citations
  580. Video K-Net: A Simple, Strong, and Unified Baseline for Video SegmentationOral107 citations
  581. Global Matching With Overlapping Attention for Optical Flow EstimationPoster106 citations
  582. Occlusion-Aware Cost Constructor for Light Field Depth EstimationPoster106 citations
  583. Open-Domain, Content-Based, Multi-Modal Fact-Checking of Out-of-Context Images via Online ResourcesPoster106 citations
  584. Open-Vocabulary One-Stage Detection With Hierarchical Visual-Language Knowledge DistillationPoster106 citations
  585. Reduce Information Loss in Transformers for Pluralistic Image InpaintingPoster106 citations
  586. WebQA: Multihop and Multimodal QAOral106 citations
  587. Differentially Private Federated Learning With Local Regularization and SparsificationPoster105 citations
  588. Joint Hand Motion and Interaction Hotspots Prediction From Egocentric VideosPoster105 citations
  589. Learning To Listen: Modeling Non-Deterministic Dyadic Facial MotionPoster105 citations
  590. MulT: An End-to-End Multitask Learning TransformerPoster105 citations
  591. Object-Region Video TransformersPoster105 citations
  592. Pix2NeRF: Unsupervised Conditional p-GAN for Single Image to Neural Radiance Fields TranslationPoster105 citations
  593. PolyWorld: Polygonal Building Extraction With Graph Neural Networks in Satellite ImagesPoster105 citations
  594. Temporal Alignment Networks for Long-Term VideoOral105 citations
  595. XYLayoutLM: Towards Layout-Aware Multimodal Networks for Visually-Rich Document UnderstandingPoster105 citations
  596. Fine-Grained Temporal Contrastive Learning for Weakly-Supervised Temporal Action LocalizationPoster104 citations
  597. HybridCR: Weakly-Supervised 3D Point Cloud Semantic Segmentation via Hybrid Contrastive RegularizationPoster104 citations
  598. Implicit Motion Handling for Video Camouflaged Object DetectionPoster104 citations
  599. Killing Two Birds With One Stone: Efficient and Robust Training of Face Recognition CNNs by Partial FCPoster104 citations
  600. Not Just Selection, but Exploration: Online Class-Incremental Continual Learning via Dual View ConsistencyPoster104 citations
  601. Open-Vocabulary Instance Segmentation via Robust Cross-Modal Pseudo-LabelingPoster104 citations
  602. Raw High-Definition Radar for Multi-Task LearningPoster104 citations
  603. Wavelet Knowledge Distillation: Towards Efficient Image-to-Image TranslationPoster104 citations
  604. Bijective Mapping Network for Shadow RemovalOral103 citations
  605. CHEX: CHannel EXploration for CNN Model CompressionPoster103 citations
  606. Deep Visual Geo-Localization BenchmarkOral103 citations
  607. GIRAFFE HD: A High-Resolution 3D-Aware Generative ModelPoster103 citations
  608. Rethinking Minimal Sufficient Representation in Contrastive LearningOral103 citations
  609. Trustworthy Long-Tailed ClassificationPoster103 citations
  610. Exploring Dual-Task Correlation for Pose Guided Person Image GenerationPoster102 citations
  611. Scribble-Supervised LiDAR Semantic SegmentationOral102 citations
  612. Use All the Labels: A Hierarchical Multi-Label Contrastive Learning FrameworkPoster102 citations
  613. What's in Your Hands? 3D Reconstruction of Generic Objects in HandsPoster102 citations
  614. Animal Kingdom: A Large and Diverse Dataset for Animal Behavior UnderstandingOral101 citations
  615. BatchFormer: Learning To Explore Sample Relationships for Robust Representation LearningPoster101 citations
  616. HCSC: Hierarchical Contrastive Selective CodingPoster101 citations
  617. High-Resolution Image Harmonization via Collaborative Dual TransformationsPoster101 citations
  618. Learning To Affiliate: Mutual Centralized Learning for Few-Shot ClassificationPoster101 citations
  619. Multi-Granularity Alignment Domain Adaptation for Object DetectionPoster101 citations
  620. No-Reference Point Cloud Quality Assessment via Domain AdaptationPoster101 citations
  621. RSTT: Real-Time Spatial Temporal Transformer for Space-Time Video Super-ResolutionPoster101 citations
  622. Single-Domain Generalized Object Detection in Urban Scene via Cyclic-Disentangled Self-DistillationPoster101 citations
  623. DEFEAT: Deep Hidden Feature Backdoor Attacks by Imperceptible Perturbation and Latent Representation ConstraintsPoster100 citations
  624. Deep Unlearning via Randomized Conditionally Independent HessiansPoster100 citations
  625. Ensembling Off-the-Shelf Models for GAN TrainingOral100 citations
  626. Generating Representative Samples for Few-Shot ClassificationPoster100 citations
  627. Large-Scale Video Panoptic Segmentation in the Wild: A BenchmarkPoster100 citations
  628. Probing Representation Forgetting in Supervised and Unsupervised Continual LearningPoster100 citations
  629. Robust Contrastive Learning Against Noisy ViewsPoster100 citations
  630. Towards General Purpose Vision Systems: An End-to-End Task-Agnostic Vision-Language ArchitectureOral100 citations
  631. Transformer-Empowered Multi-Scale Contextual Matching and Aggregation for Multi-Contrast MRI Super-ResolutionPoster100 citations
  632. VISTA: Boosting 3D Object Detection via Dual Cross-VIew SpaTial AttentionPoster100 citations
  633. CVF-SID: Cyclic Multi-Variate Function for Self-Supervised Image Denoising by Disentangling Noise From ImagePoster99 citations
  634. Contrastive Regression for Domain Adaptation on Gaze EstimationPoster99 citations
  635. Cross Modal Retrieval With Querybank NormalisationPoster99 citations
  636. DearKD: Data-Efficient Early Knowledge Distillation for Vision TransformersPoster99 citations
  637. MS-TCT: Multi-Scale Temporal ConvTransformer for Action DetectionPoster99 citations
  638. ArtiBoost: Boosting Articulated 3D Hand-Object Pose Estimation via Online Exploration and SynthesisOral98 citations
  639. B-Cos Networks: Alignment Is All We Need for InterpretabilityPoster98 citations
  640. DeepDPM: Deep Clustering With an Unknown Number of ClustersPoster98 citations
  641. Fair Contrastive Learning for Facial Attribute ClassificationPoster98 citations
  642. Learning To Estimate Robust 3D Human Mesh From In-the-Wild Crowded ScenesPoster98 citations
  643. Syntax-Aware Network for Handwritten Mathematical Expression RecognitionPoster98 citations
  644. Learning To Recognize Procedural Activities With Distant SupervisionPoster97 citations
  645. OakInk: A Large-Scale Knowledge Repository for Understanding Hand-Object InteractionPoster97 citations
  646. PatchFormer: An Efficient Point Transformer With Patch AttentionPoster97 citations
  647. Unifying Motion Deblurring and Frame Interpolation With EventsPoster97 citations
  648. Beyond Cross-View Image Retrieval: Highly Accurate Vehicle Localization Using Satellite ImagePoster96 citations
  649. EnvEdit: Environment Editing for Vision-and-Language NavigationPoster96 citations
  650. High-Resolution Face Swapping via Latent Semantics DisentanglementPoster96 citations
  651. IntraQ: Learning Synthetic Images With Intra-Class Heterogeneity for Zero-Shot Network QuantizationPoster96 citations
  652. MSG-Transformer: Exchanging Local Spatial Information by Manipulating Messenger TokensPoster96 citations
  653. Revisiting Weakly Supervised Pre-Training of Visual Perception ModelsPoster96 citations
  654. Threshold Matters in WSSS: Manipulating the Activation for the Robust and Accurate Segmentation Model Against ThresholdsPoster96 citations
  655. X-Trans2Cap: Cross-Modal Knowledge Transfer Using Transformer for 3D Dense CaptioningPoster96 citations
  656. A Structured Dictionary Perspective on Implicit Neural RepresentationsPoster95 citations
  657. AlignMixup: Improving Representations by Interpolating Aligned FeaturesPoster95 citations
  658. InOut: Diverse Image Outpainting via GAN InversionPoster95 citations
  659. Joint Global and Local Hierarchical Priors for Learned Image CompressionPoster95 citations
  660. Label Matching Semi-Supervised Object DetectionPoster95 citations
  661. Recurrent Dynamic Embedding for Video Object SegmentationPoster95 citations
  662. RepMLPNet: Hierarchical Vision MLP With Re-Parameterized LocalityPoster95 citations
  663. Surface Reconstruction From Point Clouds by Learning Predictive Context PriorsPoster95 citations
  664. TubeR: Tubelet Transformer for Video Action DetectionOral95 citations
  665. 360MonoDepth: High-Resolution 360deg Monocular Depth EstimationPoster94 citations
  666. Adaptive Trajectory Prediction via Transferable GNNPoster94 citations
  667. Class-Incremental Learning With Strong Pre-Trained ModelsPoster94 citations
  668. CycleMix: A Holistic Strategy for Medical Image Segmentation From Scribble SupervisionPoster94 citations
  669. HOP: History-and-Order Aware Pre-Training for Vision-and-Language NavigationPoster94 citations
  670. Learning With Neighbor Consistency for Noisy LabelsPoster94 citations
  671. Multi-Person Extreme Motion PredictionPoster94 citations
  672. Neural Texture Extraction and Distribution for Controllable Person Image SynthesisOral94 citations
  673. SNUG: Self-Supervised Neural Dynamic GarmentsOral94 citations
  674. The Devil Is in the Margin: Margin-Based Label Smoothing for Network CalibrationPoster94 citations
  675. Active Teacher for Semi-Supervised Object DetectionPoster93 citations
  676. Crowd Counting in the Frequency DomainPoster93 citations
  677. Exploring Structure-Aware Transformer Over Interaction Proposals for Human-Object Interaction DetectionPoster93 citations
  678. Glass Segmentation Using Intensity and Spectral Polarization CuesPoster93 citations
  679. Instance-Dependent Label-Noise Learning With Manifold-Regularized Transition Matrix EstimationPoster93 citations
  680. Integrative Few-Shot Learning for Classification and SegmentationPoster93 citations
  681. ScePT: Scene-Consistent, Policy-Based Trajectory Predictions for PlanningPoster93 citations
  682. Self-Distillation From the Last Mini-Batch for Consistency RegularizationPoster93 citations
  683. Shape-Invariant 3D Adversarial Point CloudsPoster93 citations
  684. Correlation Verification for Image RetrievalOral92 citations
  685. Disentangling Visual Embeddings for Attributes and ObjectsOral92 citations
  686. Exploring Frequency Adversarial Attacks for Face Forgery DetectionPoster92 citations
  687. FS6D: Few-Shot 6D Pose Estimation of Novel ObjectsPoster92 citations
  688. Graph-Based Spatial Transformer With Memory Replay for Multi-Future Pedestrian Trajectory PredictionPoster92 citations
  689. MatteFormer: Transformer-Based Image Matting via Prior-TokensPoster92 citations
  690. Weakly Supervised Temporal Action Localization via Representative Snippet Knowledge PropagationPoster92 citations
  691. AKB-48: A Real-World Articulated Object Knowledge BasePoster91 citations
  692. Better Trigger Inversion Optimization in Backdoor ScanningOral91 citations
  693. Cross-Domain Correlation Distillation for Unsupervised Domain Adaptation in Nighttime Semantic SegmentationPoster91 citations
  694. Learning Multi-View Aggregation in the Wild for Large-Scale 3D Semantic SegmentationOral91 citations
  695. Object-Aware Video-Language Pre-Training for RetrievalPoster91 citations
  696. OmniFusion: 360 Monocular Depth Estimation via Geometry-Aware FusionOral91 citations
  697. Online Convolutional Re-ParameterizationPoster91 citations
  698. TableFormer: Table Structure Understanding With TransformersPoster91 citations
  699. Vision Transformer Slimming: Multi-Dimension Searching in Continuous Optimization SpacePoster91 citations
  700. A Text Attention Network for Spatial Deformation Robust Scene Text Image Super-ResolutionPoster90 citations
  701. Cross Domain Object Detection by Target-Perceived Dual Branch DistillationPoster90 citations
  702. Cross-Patch Dense Contrastive Learning for Semi-Supervised Segmentation of Cellular Nuclei in Histopathologic ImagesPoster90 citations
  703. Few Shot Generative Model Adaption via Relaxed Spatial Structural AlignmentPoster90 citations
  704. Generalizable Cross-Modality Medical Image Segmentation via Style Augmentation and Dual NormalizationPoster90 citations
  705. GradViT: Gradient Inversion of Vision TransformersPoster90 citations
  706. MUSE-VAE: Multi-Scale VAE for Environment-Aware Long Term Trajectory PredictionPoster90 citations
  707. RSCFed: Random Sampling Consensus Federated Semi-Supervised LearningPoster90 citations
  708. Spectral Unsupervised Domain Adaptation for Visual RecognitionPoster90 citations
  709. Towards Diverse and Natural Scene-Aware 3D Human Motion SynthesisPoster90 citations
  710. En-Compactness: Self-Distillation Embedding & Contrastive Generation for Generalized Zero-Shot LearningPoster89 citations
  711. Label-Only Model Inversion Attacks via Boundary RepulsionPoster89 citations
  712. Mimicking the Oracle: An Initial Phase Decorrelation Approach for Class Incremental LearningPoster89 citations
  713. Occluded Human Mesh RecoveryPoster89 citations
  714. UCC: Uncertainty Guided Cross-Head Co-Training for Semi-Supervised Semantic SegmentationPoster89 citations
  715. Bridge-Prompt: Towards Ordinal Action Understanding in Instructional VideosPoster88 citations
  716. GCFSR: A Generative and Controllable Face Super Resolution Method Without Facial and GAN PriorsPoster88 citations
  717. Learning From Temporal Gradient for Semi-Supervised Action RecognitionPoster88 citations
  718. Make It Move: Controllable Image-to-Video Generation With Text DescriptionsPoster88 citations
  719. Moving Window Regression: A Novel Approach to Ordinal RegressionOral88 citations
  720. Shifting More Attention to Visual Backbone: Query-Modulated Refinement Networks for End-to-End Visual GroundingPoster88 citations
  721. A Closer Look at Few-Shot Image GenerationPoster87 citations
  722. Dense Learning Based Semi-Supervised Object DetectionPoster87 citations
  723. Fingerprinting Deep Neural Networks Globally via Universal Adversarial PerturbationsOral87 citations
  724. MM-TTA: Multi-Modal Test-Time Adaptation for 3D Semantic SegmentationPoster87 citations
  725. Multi-Object Tracking Meets Moving UAVPoster87 citations
  726. Rethinking Reconstruction Autoencoder-Based Out-of-Distribution DetectionPoster87 citations
  727. Templates for 3D Object Pose Estimation Revisited: Generalization to New Objects and Robustness to OcclusionsPoster87 citations
  728. Temporally Efficient Vision Transformer for Video Instance SegmentationOral87 citations
  729. Bridging the Gap Between Learning in Discrete and Continuous Environments for Vision-and-Language NavigationPoster86 citations
  730. ViSTA: Vision and Scene Text Aggregation for Cross-Modal RetrievalPoster86 citations
  731. DIVeR: Real-Time and Accurate Neural Radiance Fields With Deterministic Integration for Volume RenderingOral85 citations
  732. Deep Equilibrium Optical Flow EstimationPoster85 citations
  733. MSTR: Multi-Scale Transformer for End-to-End Human-Object Interaction DetectionPoster85 citations
  734. Progressive End-to-End Object Detection in Crowded ScenesPoster85 citations
  735. Robust Image Forgery Detection Over Online Social Network Shared ImagesOral85 citations
  736. An Empirical Study of End-to-End Temporal Action DetectionPoster84 citations
  737. Beyond a Pre-Trained Object Detector: Cross-Modal Textual and Visual Context for Image CaptioningPoster84 citations
  738. Cascade Transformers for End-to-End Person SearchPoster84 citations
  739. Closing the Generalization Gap of Cross-Silo Federated Medical Image SegmentationPoster84 citations
  740. Compound Domain Generalization via Meta-Knowledge EncodingPoster84 citations
  741. LAKe-Net: Topology-Aware Point Cloud Completion by Localizing Aligned KeypointsPoster84 citations
  742. LTP: Lane-Based Trajectory Prediction for Autonomous DrivingPoster84 citations
  743. Learning to Deblur Using Light Field Generated and Real Defocus ImagesOral84 citations
  744. Pseudo-Stereo for Monocular 3D Object Detection in Autonomous DrivingPoster84 citations
  745. Reconstructing Surfaces for Sparse Point Clouds With On-Surface PriorsPoster84 citations
  746. Reflash Dropout in Image Super-ResolutionPoster84 citations
  747. Task Adaptive Parameter Sharing for Multi-Task LearningPoster84 citations
  748. Zero Experience Required: Plug & Play Modular Transfer Learning for Semantic Visual NavigationPoster84 citations
  749. gDNA: Towards Generative Detailed Neural AvatarsPoster84 citations
  750. Cross-Modal Map Learning for Vision and Language NavigationPoster83 citations
  751. Lifelong Graph LearningOral83 citations
  752. OSOP: A Multi-Stage One Shot Object Pose Estimation FrameworkPoster83 citations
  753. Ranking-Based Siamese Visual TrackingPoster83 citations
  754. SAR-Net: Shape Alignment and Recovery Network for Category-Level 6D Object Pose and Size EstimationPoster83 citations
  755. Towards Robust and Reproducible Active Learning Using Neural NetworksPoster83 citations
  756. AdaInt: Learning Adaptive Intervals for 3D Lookup Tables on Real-Time Image EnhancementPoster82 citations
  757. Bayesian Invariant Risk MinimizationOral82 citations
  758. Co-Advise: Cross Inductive Bias DistillationPoster82 citations
  759. DTA: Physical Camouflage Attacks Using Differentiable Transformation NetworkPoster82 citations
  760. Expanding Low-Density Latent Regions for Open-Set Object DetectionPoster82 citations
  761. IDR: Self-Supervised Image Denoising via Iterative Data RefinementPoster82 citations
  762. Improving the Transferability of Targeted Adversarial Examples Through Object-Based Diverse InputPoster82 citations
  763. Many-to-Many Splatting for Efficient Video Frame InterpolationPoster82 citations
  764. NAN: Noise-Aware NeRFs for Burst-DenoisingPoster82 citations
  765. Neural Fields As Learnable Kernels for 3D ReconstructionPoster82 citations
  766. Neural Points: Point Cloud Representation With Neural Fields for Arbitrary UpsamplingPoster82 citations
  767. RNNPose: Recurrent 6-DoF Object Pose Refinement With Robust Correspondence Field Estimation and Pose OptimizationPoster82 citations
  768. Recurrent Variational Network: A Deep Learning Inverse Problem Solver Applied to the Task of Accelerated MRI ReconstructionPoster82 citations
  769. Subspace Adversarial TrainingOral82 citations
  770. Temporal Feature Alignment and Mutual Information Maximization for Video-Based Human Pose EstimationOral82 citations
  771. Toward Practical Monocular Indoor Depth EstimationPoster82 citations
  772. Towards Unsupervised Domain GeneralizationPoster82 citations
  773. COTS: Collaborative Two-Stream Vision-Language Pre-Training Model for Cross-Modal RetrievalPoster81 citations
  774. Entropy-Based Active Learning for Object Detection With Progressive Diversity ConstraintPoster81 citations
  775. Generalized Binary Search Network for Highly-Efficient Multi-View StereoPoster81 citations
  776. Large Loss Matters in Weakly Supervised Multi-Label ClassificationPoster81 citations
  777. Large-Scale Pre-Training for Person Re-Identification With Noisy LabelsPoster81 citations
  778. On Learning Contrastive Representations for Learning With Noisy LabelsPoster81 citations
  779. ResSFL: A Resistance Transfer Framework for Defending Model Inversion Attack in Split Federated LearningPoster81 citations
  780. Towards Practical Certifiable Patch Defense With Vision TransformerPoster81 citations
  781. CamLiFlow: Bidirectional Camera-LiDAR Fusion for Joint Optical Flow and Scene Flow EstimationOral80 citations
  782. Can Neural Nets Learn the Same Model Twice? Investigating Reproducibility and Double Descent From the Decision Boundary PerspectiveOral80 citations
  783. Compositional Temporal Grounding With Structured Variational Cross-Graph Correspondence LearningPoster80 citations
  784. ContIG: Self-Supervised Multimodal Contrastive Learning for Medical Imaging With GeneticsPoster80 citations
  785. Few-Shot Font Generation by Learning Fine-Grained Local StylesPoster80 citations
  786. HerosNet: Hyperspectral Explicable Reconstruction and Optimal Sampling Deep Network for Snapshot Compressive ImagingPoster80 citations
  787. Image Disentanglement Autoencoder for Steganography Without EmbeddingPoster80 citations
  788. Improving Subgraph Recognition With Variational Graph Information BottleneckPoster80 citations
  789. JoinABLe: Learning Bottom-Up Assembly of Parametric CAD JointsPoster80 citations
  790. LISA: Learning Implicit Shape and Appearance of HandsPoster80 citations
  791. Meta Distribution Alignment for Generalizable Person Re-IdentificationPoster80 citations
  792. Multi-Modal Alignment Using Representation CodebookPoster80 citations
  793. NPBG++: Accelerating Neural Point-Based GraphicsPoster80 citations
  794. Out-of-Distribution Generalization With Causal Invariant TransformationsPoster80 citations
  795. PNP: Robust Learning From Noisy Labels by Probabilistic Noise PredictionOral80 citations
  796. Personalized Image Aesthetics Assessment With Rich AttributesPoster80 citations
  797. Transferability Estimation Using Bhattacharyya Class SeparabilityPoster80 citations
  798. Tree Energy Loss: Towards Sparsely Annotated Semantic SegmentationPoster80 citations
  799. Unsupervised Deraining: Where Contrastive Learning Meets Self-SimilarityPoster80 citations
  800. Continual Learning With Lifelong Vision TransformerPoster79 citations
  801. Coupled Iterative Refinement for 6D Multi-Object Pose EstimationPoster79 citations
  802. DiGS: Divergence Guided Shape Implicit Neural Representation for Unoriented Point CloudsPoster79 citations
  803. Dual-AI: Dual-Path Actor Interaction Learning for Group Activity RecognitionOral79 citations
  804. FIFO: Learning Fog-Invariant Features for Foggy Scene SegmentationOral79 citations
  805. Kernelized Few-Shot Object Detection With Efficient Integral AggregationPoster79 citations
  806. Motion-Modulated Temporal Fragment Alignment Network for Few-Shot Action RecognitionPoster79 citations
  807. Revisiting Domain Generalized Stereo Matching Networks From a Feature Consistency PerspectivePoster79 citations
  808. Deformable Sprites for Unsupervised Video DecompositionOral78 citations
  809. Diversity Matters: Fully Exploiting Depth Clues for Reliable Monocular 3D Object DetectionOral78 citations
  810. Drop the GAN: In Defense of Patches Nearest Neighbors As Single Image Generative ModelsOral78 citations
  811. Fine-Grained Object Classification via Self-Supervised Pose AlignmentPoster78 citations
  812. Future Transformer for Long-Term Action AnticipationPoster78 citations
  813. GAN-Supervised Dense Visual AlignmentOral78 citations
  814. Lagrange Motion Analysis and View Embeddings for Improved Gait RecognitionPoster78 citations
  815. Marginal Contrastive Correspondence for Guided Image GenerationOral78 citations
  816. NLX-GPT: A Model for Natural Language Explanations in Vision and Vision-Language TasksOral78 citations
  817. Ray3D: Ray-Based 3D Human Pose Estimation for Monocular Absolute 3D LocalizationPoster78 citations
  818. Human-Object Interaction Detection via Disentangled TransformerPoster77 citations
  819. Learning Affordance Grounding From Exocentric ImagesPoster77 citations
  820. Multimodal Material SegmentationPoster77 citations
  821. Structural and Statistical Texture Knowledge Distillation for Semantic SegmentationPoster77 citations
  822. Towards Weakly-Supervised Text Spotting Using a Multi-Task TransformerPoster77 citations
  823. Unsupervised Learning of Accurate Siamese TrackingOral77 citations
  824. Blind Image Super-Resolution With Elaborate Degradation Modeling on Noise and KernelPoster76 citations
  825. Democracy Does Matter: Comprehensive Feature Mining for Co-Salient Object DetectionPoster76 citations
  826. Iterative Deep Homography EstimationPoster76 citations
  827. Learning Second Order Local Anomaly for General Face Forgery DetectionPoster76 citations
  828. ONCE-3DLanes: Building Monocular 3D Lane DetectionPoster76 citations
  829. OrphicX: A Causality-Inspired Latent Variable Model for Interpreting Graph Neural NetworksOral76 citations
  830. Signing at Scale: Learning to Co-Articulate Signs for Large-Scale Photo-Realistic Sign Language ProductionPoster76 citations
  831. StyleMesh: Style Transfer for Indoor 3D Scene ReconstructionsPoster76 citations
  832. Task Discrepancy Maximization for Fine-Grained Few-Shot ClassificationOral76 citations
  833. Training-Free Transformer Architecture SearchOral76 citations
  834. VGSE: Visually-Grounded Semantic Embeddings for Zero-Shot LearningPoster76 citations
  835. Coarse-To-Fine Feature Mining for Video Semantic SegmentationPoster75 citations
  836. Cross-Model Pseudo-Labeling for Semi-Supervised Action RecognitionOral75 citations
  837. DirecFormer: A Directed Attention in Transformer Approach to Robust Action RecognitionPoster75 citations
  838. Exploring Denoised Cross-Video Contrast for Weakly-Supervised Temporal Action LocalizationPoster75 citations
  839. Fairness-Aware Adversarial Perturbation Towards Bias Mitigation for Deployed Deep ModelsPoster75 citations
  840. FocusCut: Diving Into a Focus View in Interactive SegmentationOral75 citations
  841. GIFS: Neural Implicit Function for General Shape RepresentationPoster75 citations
  842. Learning Optical Flow With Kernel Patch AttentionPoster75 citations
  843. ObjectFolder 2.0: A Multisensory Object Dataset for Sim2Real TransferPoster75 citations
  844. PSTR: End-to-End One-Step Person Search With TransformersPoster75 citations
  845. RBGNet: Ray-Based Grouping for 3D Object DetectionPoster75 citations
  846. Robust Equivariant Imaging: A Fully Unsupervised Framework for Learning To Image From Noisy and Partial MeasurementsOral75 citations
  847. Certified Patch Robustness via Smoothed Vision TransformersPoster74 citations
  848. Language-Bridged Spatial-Temporal Interaction for Referring Video Object SegmentationPoster74 citations
  849. PPDL: Predicate Probability Distribution Based Loss for Unbiased Scene Graph GenerationPoster74 citations
  850. Region-Aware Face SwappingPoster74 citations
  851. Self-Supervised Material and Texture Representation Learning for Remote Sensing TasksOral74 citations
  852. Towards Layer-Wise Image VectorizationOral74 citations
  853. Towards Practical Deployment-Stage Backdoor Attack on Deep Neural NetworksOral74 citations
  854. Tracking People by Predicting 3D Appearance, Location and PoseOral74 citations
  855. Abandoning the Bayer-Filter To See in the DarkPoster73 citations
  856. CAPRI-Net: Learning Compact CAD Shapes With Adaptive Primitive AssemblyPoster73 citations
  857. Coupling Vision and Proprioception for Navigation of Legged RobotsPoster73 citations
  858. Incremental Learning in Semantic Segmentation From Image LabelsPoster73 citations
  859. Infrared Invisible Clothing: Hiding From Infrared Detectors at Multiple Angles in Real WorldOral73 citations
  860. PINA: Learning a Personalized Implicit Neural Avatar From a Single RGB-D Video SequencePoster73 citations
  861. Pseudo-Q: Generating Pseudo Language Queries for Visual GroundingPoster73 citations
  862. Quantifying Societal Bias Amplification in Image CaptioningOral73 citations
  863. TransEditor: Transformer-Based Dual-Space GAN for Highly Controllable Facial EditingPoster73 citations
  864. Unified Multivariate Gaussian Mixture for Efficient Neural Image CompressionPoster73 citations
  865. Vehicle Trajectory Prediction Works, but Not EverywherePoster73 citations
  866. Accurate 3D Body Shape Regression Using Metric and Semantic AttributesOral72 citations
  867. Audio-Visual Generalised Zero-Shot Learning With Cross-Modal Attention and LanguagePoster72 citations
  868. CD2-pFed: Cyclic Distillation-Guided Channel Decoupling for Model Personalization in Federated LearningPoster72 citations
  869. EASE: Unsupervised Discriminant Subspace Learning for Transductive Few-Shot LearningPoster72 citations
  870. Enhancing Adversarial Training With Second-Order Statistics of WeightsPoster72 citations
  871. ImFace: A Nonlinear 3D Morphable Face Model With Implicit Neural RepresentationsPoster72 citations
  872. KNN Local Attention for Image RestorationPoster72 citations
  873. Look Closer To Supervise Better: One-Shot Font Generation via Component-Based DiscriminatorOral72 citations
  874. Revisiting the Transferability of Supervised Pretraining: An MLP PerspectivePoster72 citations
  875. A Framework for Learning Ante-Hoc Explainable Models via ConceptsPoster71 citations
  876. Attribute Surrogates Learning and Spectral Tokens Pooling in Transformers for Few-Shot LearningPoster71 citations
  877. Complex Backdoor Detection by Symmetric Feature DifferencingPoster71 citations
  878. Exploiting Pseudo Labels in a Self-Supervised Learning Framework for Improved Monocular Depth EstimationPoster71 citations
  879. Exploring the Equivalence of Siamese Self-Supervised Learning via a Unified Gradient FrameworkPoster71 citations
  880. Generating High Fidelity Data From Low-Density Regions Using Diffusion ModelsPoster71 citations
  881. Motion-Aware Contrastive Video Representation Learning via Foreground-Background MergingPoster71 citations
  882. Node-Aligned Graph Convolutional Network for Whole-Slide Image Representation and ClassificationOral71 citations
  883. Recall@k Surrogate Loss With Large Batches and Similarity MixupPoster71 citations
  884. Towards Better Plasticity-Stability Trade-Off in Incremental Learning: A Simple Linear ConnectorPoster71 citations
  885. Density-Preserving Deep Point Cloud CompressionPoster70 citations
  886. E2(GO)MOTION: Motion Augmented Event Stream for Egocentric Action RecognitionPoster70 citations
  887. Human-Aware Object Placement for Visual Environment ReconstructionPoster70 citations
  888. Learning To Collaborate in Decentralized Learning of Personalized ModelsPoster70 citations
  889. Long-Short Temporal Contrastive Learning of Video TransformersPoster70 citations
  890. ProposalCLIP: Unsupervised Open-Category Object Proposal Generation via Exploiting CLIP CuesPoster70 citations
  891. TransRAC: Encoding Multi-Scale Temporal Correlation With Transformers for Repetitive Action CountingOral70 citations
  892. Unsupervised Action Segmentation by Joint Representation Learning and Online ClusteringPoster70 citations
  893. 3D-SPS: Single-Stage 3D Visual Grounding via Referred Point Progressive SelectionOral69 citations
  894. 3D-VField: Adversarial Augmentation of Point Clouds for Domain Generalization in 3D Object DetectionPoster69 citations
  895. CoSSL: Co-Learning of Representation and Classifier for Imbalanced Semi-Supervised LearningPoster69 citations
  896. Contextual Instance Decoupling for Robust Multi-Person Pose EstimationOral69 citations
  897. From Representation to Reasoning: Towards Both Evidence and Commonsense Reasoning for Video Question-AnsweringPoster69 citations
  898. InsetGAN for Full-Body Image GenerationPoster69 citations
  899. Multi-View Depth Estimation by Fusing Single-View Depth Probability With Multi-View GeometryOral69 citations
  900. Practical Evaluation of Adversarial Robustness via Adaptive Auto AttackPoster69 citations
  901. Pyramid Adversarial Training Improves ViT PerformanceOral69 citations
  902. SPAct: Self-Supervised Privacy Preservation for Action RecognitionPoster69 citations
  903. Salient-to-Broad Transition for Video Person Re-IdentificationPoster69 citations
  904. Shape From Polarization for Complex Scenes in the WildPoster69 citations
  905. Style Transformer for Image Inversion and EditingPoster69 citations
  906. TeachAugment: Data Augmentation Optimization Using Teacher KnowledgeOral69 citations
  907. Visual Abductive ReasoningPoster69 citations
  908. AutoRF: Learning 3D Object Radiance Fields From Single View ObservationsPoster68 citations
  909. Deep Rectangling for Image Stitching: A Learning BaselineOral68 citations
  910. EI-CLIP: Entity-Aware Interventional Contrastive Learning for E-Commerce Cross-Modal RetrievalPoster68 citations
  911. GuideFormer: Transformers for Image Guided Depth CompletionPoster68 citations
  912. HL-Net: Heterophily Learning Network for Scene Graph GenerationPoster68 citations
  913. Non-Probability Sampling Network for Stochastic Human Trajectory PredictionPoster68 citations
  914. On the Importance of Asymmetry for Siamese Representation LearningPoster68 citations
  915. Panoptic-PHNet: Towards Real-Time and High-Precision LiDAR Panoptic Segmentation via Clustering Pseudo HeatmapPoster68 citations
  916. Pin the Memory: Learning To Generalize Semantic SegmentationPoster68 citations
  917. Reversible Vision TransformersOral68 citations
  918. STRPM: A Spatiotemporal Residual Predictive Model for High-Resolution Video PredictionPoster68 citations
  919. Self-Supervised Global-Local Structure Modeling for Point Cloud Domain Adaptation With Reliable Voted Pseudo LabelsPoster68 citations
  920. Sketching Without Worrying: Noise-Tolerant Sketch-Based Image RetrievalPoster68 citations
  921. Source-Free Object Detection by Learning To Overlook Domain StyleOral68 citations
  922. Towards Robust and Adaptive Motion Forecasting: A Causal Representation PerspectivePoster68 citations
  923. Grounding Answers for Visual Questions Asked by Visually Impaired PeopleOral67 citations
  924. MS2DG-Net: Progressive Correspondence Learning via Multiple Sparse Semantics Dynamic GraphPoster67 citations
  925. Memory-Augmented Deep Conditional Unfolding Network for Pan-SharpeningPoster67 citations
  926. MonoJSG: Joint Semantic and Geometric Cost Volume for Monocular 3D Object DetectionPoster67 citations
  927. Neural Mean Discrepancy for Efficient Out-of-Distribution DetectionPoster67 citations
  928. PokeBNN: A Binary Pursuit of Lightweight AccuracyPoster67 citations
  929. Show, Deconfound and Tell: Image Captioning With Causal InferencePoster67 citations
  930. Structured Sparse R-CNN for Direct Scene Graph GenerationPoster67 citations
  931. ZeroWaste Dataset: Towards Deformable Object Segmentation in Cluttered ScenesPoster67 citations
  932. 3D Shape Reconstruction From 2D Images With Disentangled Attribute FlowPoster66 citations
  933. Bayesian Nonparametric Submodular Video Partition for Robust Anomaly DetectionPoster66 citations
  934. Deep Safe Multi-View Clustering: Reducing the Risk of Clustering Performance Degradation Caused by View IncreasePoster66 citations
  935. Few-Shot Learning With Noisy LabelsPoster66 citations
  936. How Many Observations Are Enough? Knowledge Distillation for Trajectory ForecastingPoster66 citations
  937. Human Mesh Recovery From Multiple ShotsPoster66 citations
  938. Learning Transferable Human-Object Interaction Detector With Natural Language SupervisionPoster66 citations
  939. Leveling Down in Computer Vision: Pareto Inefficiencies in Fair Deep ClassifiersPoster66 citations
  940. MonoGround: Detecting Monocular 3D Objects From the GroundPoster66 citations
  941. OVE6D: Object Viewpoint Encoding for Depth-Based 6D Object Pose EstimationPoster66 citations
  942. Patch-Level Representation Learning for Self-Supervised Vision TransformersOral66 citations
  943. Towards Robust Rain Removal Against Adversarial Attacks: A Comprehensive Benchmark Analysis and BeyondPoster66 citations
  944. What To Look at and Where: Semantic and Spatial Refined Transformer for Detecting Human-Object InteractionsOral66 citations
  945. Class Similarity Weighted Knowledge Distillation for Continual Semantic SegmentationPoster65 citations
  946. End-to-End Human-Gaze-Target Detection With TransformersPoster65 citations
  947. InstaFormer: Instance-Aware Image-to-Image Translation With TransformerPoster65 citations
  948. Interactiveness Field in Human-Object InteractionsPoster65 citations
  949. Learnable Lookup Table for Neural Network QuantizationPoster65 citations
  950. RM-Depth: Unsupervised Learning of Recurrent Monocular Depth in Dynamic ScenesPoster65 citations
  951. Real-Time Object Detection for Streaming PerceptionOral65 citations
  952. RigidFlow: Self-Supervised Scene Flow Learning on Point Clouds by Local Rigidity PriorPoster65 citations
  953. Surface-Aligned Neural Radiance Fields for Controllable 3D Human SynthesisPoster65 citations
  954. SwapMix: Diagnosing and Regularizing the Over-Reliance on Visual Context in Visual Question AnsweringPoster65 citations
  955. Think Twice Before Detecting GAN-Generated Fake Images From Their Spectral Domain ImprintsPoster65 citations
  956. Unbiased Subclass Regularization for Semi-Supervised Semantic SegmentationPoster65 citations
  957. Both Style and Fog Matter: Cumulative Domain Adaptation for Semantic Foggy Scene UnderstandingOral64 citations
  958. Domain Adaptation on Point Clouds via Geometry-Aware ImplicitsPoster64 citations
  959. Learning Modal-Invariant and Temporal-Memory for Video-Based Visible-Infrared Person Re-IdentificationPoster64 citations
  960. Mixed Differential Privacy in Computer VisionOral64 citations
  961. Multi-Level Representation Learning With Semantic Alignment for Referring Video Object SegmentationPoster64 citations
  962. Per-Clip Video Object SegmentationPoster64 citations
  963. Point-Level Region Contrast for Object Detection Pre-TrainingOral64 citations
  964. Point2Cyl: Reverse Engineering 3D Objects From Point Clouds to Extrusion CylindersPoster64 citations
  965. Robust Cross-Modal Representation Learning With Progressive Self-DistillationOral64 citations
  966. Self-Supervised Object Detection From Audio-Visual CorrespondencePoster64 citations
  967. Towards Discriminative Representation: Multi-View Trajectory Contrastive Learning for Online Multi-Object TrackingPoster64 citations
  968. Towards Multi-Domain Single Image Dehazing via Test-Time TrainingPoster64 citations
  969. Unsupervised Pre-Training for Temporal Action Localization TasksPoster64 citations
  970. Visual Acoustic MatchingOral64 citations
  971. A Comprehensive Study of Image Classification Model Sensitivity to Foregrounds, Backgrounds, and Visual AttributesOral63 citations
  972. AdaFocus V2: End-to-End Training of Spatial Dynamic Networks for Video RecognitionPoster63 citations
  973. Cross-Modal Background Suppression for Audio-Visual Event LocalizationPoster63 citations
  974. Fine-Grained Predicates Learning for Scene Graph GenerationPoster63 citations
  975. Investigating the Impact of Multi-LiDAR Placement on Object Detection for Autonomous DrivingPoster63 citations
  976. KG-SP: Knowledge Guided Simple Primitives for Open World Compositional Zero-Shot LearningPoster63 citations
  977. Learning Fair Classifiers With Partially Annotated Group LabelsPoster63 citations
  978. Neural Data-Dependent Transform for Learned Image CompressionPoster63 citations
  979. Omni-DETR: Omni-Supervised Object Detection With TransformersPoster63 citations
  980. Probabilistic Representations for Video Contrastive LearningPoster63 citations
  981. Self-Supervised Arbitrary-Scale Point Clouds Upsampling via Implicit Neural RepresentationPoster63 citations
  982. Counterfactual Cycle-Consistent Learning for Instruction Following and Generation in Vision-Language NavigationPoster62 citations
  983. DECORE: Deep Compression With Reinforcement LearningPoster62 citations
  984. DIFNet: Boosting Visual Information Flow for Image CaptioningPoster62 citations
  985. Generalizing Gaze Estimation With Rotation ConsistencyPoster62 citations
  986. Label Relation Graphs Enhanced Hierarchical Residual Network for Hierarchical Multi-Granularity ClassificationPoster62 citations
  987. LiDARCap: Long-Range Marker-Less 3D Human Motion Capture With LiDAR Point CloudsPoster62 citations
  988. Mix and Localize: Localizing Sound Sources in MixturesPoster62 citations
  989. Opening Up Open World TrackingOral62 citations
  990. Sparse Local Patch Transformer for Robust Face Alignment and Landmarks Inherent Relation LearningPoster62 citations
  991. Stand-Alone Inter-Frame Attention in Video ModelsPoster62 citations
  992. A Voxel Graph CNN for Object Classification With Event CamerasPoster61 citations
  993. An MIL-Derived Transformer for Weakly Supervised Point Cloud SegmentationPoster61 citations
  994. Decoupling Makes Weakly Supervised Local Feature BetterPoster61 citations
  995. FWD: Real-Time Novel View Synthesis With Forward Warping and DepthPoster61 citations
  996. Learning Local Displacements for Point Cloud CompletionPoster61 citations
  997. Less Is More: Generating Grounded Navigation Instructions From LandmarksPoster61 citations
  998. Non-Generative Generalized Zero-Shot Learning via Task-Correlated Disentanglement and Controllable Samples SynthesisPoster61 citations
  999. One Loss for Quantization: Deep Hashing With Discrete Wasserstein Distributional MatchingPoster61 citations
  1000. Online Continual Learning on a Contaminated Data Stream With Blurry Task BoundariesPoster61 citations

Looking for submission deadlines instead? See the conference deadline calendar.