← All conferences

ICCV 2021 Accepted Papers

The full list of 1,612 papers accepted at ICCV 2021 (IEEE/CVF International Conference on Computer Vision). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Poster: 1,612
  1. Swin Transformer: Hierarchical Vision Transformer Using Shifted WindowsPoster29,925 citations
  2. Emerging Properties in Self-Supervised Vision TransformersPoster6,990 citations
  3. Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction Without ConvolutionsPoster5,090 citations
  4. ViViT: A Video Vision TransformerPoster2,888 citations
  5. Point TransformerPoster2,633 citations
  6. CvT: Introducing Convolutions to Vision TransformersPoster2,598 citations
  7. Tokens-to-Token ViT: Training Vision Transformers From Scratch on ImageNetPoster2,573 citations
  8. Segmenter: Transformer for Semantic SegmentationPoster2,259 citations
  9. Vision Transformers for Dense PredictionPoster2,233 citations
  10. Mip-NeRF: A Multiscale Representation for Anti-Aliasing Neural Radiance FieldsPoster2,219 citations
  11. An Empirical Study of Training Self-Supervised Vision TransformersPoster2,178 citations
  12. CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image ClassificationPoster2,006 citations
  13. The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution GeneralizationPoster2,004 citations
  14. Multiscale Vision TransformersPoster1,664 citations
  15. Nerfies: Deformable Neural Radiance FieldsPoster1,543 citations
  16. StyleCLIP: Text-Driven Manipulation of StyleGAN ImageryPoster1,379 citations
  17. Going Deeper With Image TransformersPoster1,328 citations
  18. Frozen in Time: A Joint Video and Image Encoder for End-to-End RetrievalPoster1,303 citations
  19. PlenOctrees for Real-Time Rendering of Neural Radiance FieldsPoster1,173 citations
  20. TransReID: Transformer-Based Object Re-IdentificationPoster1,156 citations
  21. FcaNet: Frequency Channel Attention NetworksPoster1,130 citations
  22. TOOD: Task-Aligned One-Stage Object DetectionPoster1,116 citations
  23. Learning Spatio-Temporal Transformer for Visual TrackingPoster1,080 citations
  24. Oriented R-CNN for Object DetectionPoster1,021 citations
  25. MDETR - Modulated Detection for End-to-End Multi-Modal UnderstandingPoster980 citations
  26. MVSNeRF: Fast Generalizable Radiance Field Reconstruction From Multi-View StereoPoster907 citations
  27. Conformer: Local Features Coupling Global Representations for Visual RecognitionPoster890 citations
  28. Channel-Wise Topology Refinement Graph Convolution for Skeleton-Based Action RecognitionPoster872 citations
  29. UNISURF: Unifying Neural Implicit Surfaces and Radiance Fields for Multi-View ReconstructionPoster862 citations
  30. KiloNeRF: Speeding Up Neural Radiance Fields With Thousands of Tiny MLPsPoster855 citations
  31. Conditional DETR for Fast Training ConvergencePoster829 citations
  32. DRAEM - A Discriminatively Trained Reconstruction Embedding for Surface Anomaly DetectionPoster820 citations
  33. LeViT: A Vision Transformer in ConvNet's Clothing for Faster InferencePoster815 citations
  34. BARF: Bundle-Adjusting Neural Radiance FieldsPoster810 citations
  35. ILVR: Conditioning Method for Denoising Diffusion Probabilistic ModelsPoster805 citations
  36. Designing a Practical Degradation Model for Deep Blind Image Super-ResolutionPoster793 citations
  37. MUSIQ: Multi-Scale Image Quality TransformerPoster780 citations
  38. Rethinking Coarse-To-Fine Approach in Single Image DeblurringPoster770 citations
  39. Rethinking Spatial Dimensions of Vision TransformersPoster761 citations
  40. Incorporating Learnable Membrane Time Constant To Enhance Learning of Spiking Neural NetworksPoster729 citations
  41. FastNeRF: High-Fidelity Neural Rendering at 200FPSPoster697 citations
  42. Big Self-Supervised Models Advance Medical Image ClassificationPoster695 citations
  43. iMAP: Implicit Mapping and Positioning in Real-TimePoster689 citations
  44. Incorporating Convolution Designs Into Visual TransformersPoster659 citations
  45. 3D Human Pose Estimation With Spatial and Temporal TransformersPoster649 citations
  46. Exploring Cross-Image Pixel Contrast for Semantic SegmentationPoster624 citations
  47. Large Scale Interactive Motion Forecasting for Autonomous Driving: The Waymo Open Motion DatasetPoster624 citations
  48. End-to-End Semi-Supervised Object Detection With Soft TeacherPoster620 citations
  49. PoinTr: Diverse Point Cloud Completion With Geometry-Aware TransformersPoster608 citations
  50. Baking Neural Radiance Fields for Real-Time View SynthesisPoster604 citations
  51. Invisible Backdoor Attack With Sample-Specific TriggersPoster603 citations
  52. AgentFormer: Agent-Aware Transformers for Socio-Temporal Multi-Agent ForecastingPoster594 citations
  53. AI Choreographer: Music Conditioned 3D Dance Generation With AIST++Poster576 citations
  54. 3D Shape Generation and Completion Through Point-Voxel DiffusionPoster574 citations
  55. An End-to-End Transformer Model for 3D Object DetectionPoster573 citations
  56. Action-Conditioned 3D Human Motion Synthesis With Transformer VAEPoster567 citations
  57. With a Little Help From My Friends: Nearest-Neighbor Contrastive Learning of Visual RepresentationsPoster561 citations
  58. Non-Rigid Neural Radiance Fields: Reconstruction and Novel View Synthesis of a Dynamic Scene From Monocular VideoPoster557 citations
  59. Visual Saliency TransformerPoster552 citations
  60. Asymmetric Loss for Multi-Label ClassificationPoster547 citations
  61. NeRD: Neural Reflectance Decomposition From Image CollectionsPoster547 citations
  62. Putting NeRF on a Diet: Semantically Consistent Few-Shot View SynthesisPoster541 citations
  63. Voxel Transformer for 3D Object DetectionPoster532 citations
  64. DenseTNT: End-to-End Trajectory Prediction From Dense Goal SetsPoster528 citations
  65. In-Place Scene Labelling and Understanding With Implicit Scene RepresentationPoster527 citations
  66. ACDC: The Adverse Conditions Dataset With Correspondences for Semantic Driving Scene UnderstandingPoster525 citations
  67. Meta-Baseline: Exploring Simple Meta-Learning for Few-Shot LearningPoster520 citations
  68. Animatable Neural Radiance Fields for Modeling Dynamic Human BodiesPoster514 citations
  69. Understanding Robustness of Transformers for Image ClassificationPoster503 citations
  70. Common Objects in 3D: Large-Scale Learning and Evaluation of Real-Life 3D Category ReconstructionPoster491 citations
  71. PARE: Part Attention Regressor for 3D Human Body EstimationPoster480 citations
  72. Weakly-Supervised Video Anomaly Detection With Robust Temporal Feature Magnitude LearningPoster462 citations
  73. Co-Scale Conv-Attentional Image TransformersPoster461 citations
  74. AD-NeRF: Audio Driven Neural Radiance Fields for Talking Head SynthesisPoster452 citations
  75. Pixel Difference Networks for Efficient Edge DetectionPoster452 citations
  76. Dynamic View Synthesis From Dynamic Monocular VideoPoster441 citations
  77. FairNAS: Rethinking Evaluation Fairness of Weight Sharing Neural Architecture SearchPoster432 citations
  78. Rethinking and Improving Relative Position Encoding for Vision TransformerPoster430 citations
  79. Co2L: Contrastive Continual LearningPoster428 citations
  80. Rethinking Transformer-Based Set Prediction for Object DetectionPoster425 citations
  81. Hypercorrelation Squeeze for Few-Shot SegmentationPoster420 citations
  82. Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image EncodingPoster419 citations
  83. UniT: Multimodal Multitask Learning With a Unified TransformerPoster417 citations
  84. AdaAttN: Revisit Attention Mechanism in Arbitrary Neural Style TransferPoster413 citations
  85. Dynamic DETR: End-to-End Object Detection With Dynamic AttentionPoster409 citations
  86. DetCo: Unsupervised Contrastive Learning for Object DetectionPoster408 citations
  87. Learning To Estimate Hidden Motions With Global Motion AggregationPoster408 citations
  88. Mesh GraphormerPoster408 citations
  89. TransPose: Keypoint Localization via TransformerPoster408 citations
  90. TransVG: End-to-End Visual Grounding With TransformersPoster408 citations
  91. AutoFormer: Searching Transformers for Visual RecognitionPoster407 citations
  92. GLoRIA: A Multimodal Global-Local Representation Learning Framework for Label-Efficient Medical Image RecognitionPoster404 citations
  93. TAM: Temporal Adaptive Module for Video RecognitionPoster403 citations
  94. Hypersim: A Photorealistic Synthetic Dataset for Holistic Indoor Scene UnderstandingPoster395 citations
  95. ReStyle: A Residual-Based StyleGAN Encoder via Iterative RefinementPoster393 citations
  96. Generic Attention-Model Explainability for Interpreting Bi-Modal and Encoder-Decoder TransformersPoster392 citations
  97. Is Pseudo-Lidar Needed for Monocular 3D Object Detection?Poster388 citations
  98. PyMAF: 3D Human Pose and Shape Regression With Pyramidal Mesh Alignment Feedback LoopPoster386 citations
  99. TokenPose: Learning Keypoint Tokens for Human Pose EstimationPoster386 citations
  100. Fast Convergence of DETR With Spatially Modulated Co-AttentionPoster379 citations
  101. Parametric Contrastive LearningPoster377 citations
  102. TrivialAugment: Tuning-Free Yet State-of-the-Art Data AugmentationPoster371 citations
  103. Walk in the Cloud: Learning Curves for Point Clouds Shape AnalysisPoster367 citations
  104. Channel-Wise Knowledge Distillation for Dense PredictionPoster366 citations
  105. Instances As QueriesPoster365 citations
  106. Learning Self-Consistency for Deepfake DetectionPoster365 citations
  107. Rethinking Counting and Localization in Crowds: A Purely Point-Based FrameworkPoster365 citations
  108. Learning Target Candidate Association To Keep Track of What Not To TrackPoster364 citations
  109. Counterfactual Attention Learning for Fine-Grained Visual Categorization and Re-IdentificationPoster361 citations
  110. Focal Frequency Loss for Image Reconstruction and SynthesisPoster361 citations
  111. SelfReg: Self-Supervised Contrastive Regularization for Domain GeneralizationPoster360 citations
  112. Group-Free 3D Object Detection via TransformersPoster357 citations
  113. Learning Object-Compositional Neural Radiance Field for Editable Scene RenderingPoster356 citations
  114. HuMoR: 3D Human Motion Model for Robust Pose EstimationPoster354 citations
  115. CoMatch: Semi-Supervised Learning With Contrastive Graph RegularizationPoster353 citations
  116. DeFRCN: Decoupled Faster R-CNN for Few-Shot Object DetectionPoster347 citations
  117. Vector Neurons: A General Framework for SO(3)-Equivariant NetworksPoster345 citations
  118. From Goals, Waypoints & Paths to Long Term Human Trajectory ForecastingPoster343 citations
  119. DocFormer: End-to-End Transformer for Document UnderstandingPoster342 citations
  120. Fake It Till You Make It: Face Analysis in the Wild Using Synthetic Data AlonePoster339 citations
  121. Revisiting Stereo Depth Estimation From a Sequence-to-Sequence Perspective With TransformersPoster338 citations
  122. Just Ask: Learning To Answer Questions From Millions of Narrated VideosPoster337 citations
  123. Seasonal Contrast: Unsupervised Pre-Training From Uncurated Remote Sensing DataPoster336 citations
  124. RPVNet: A Deep and Efficient Range-Point-Voxel Fusion Network for LiDAR Point Cloud SegmentationPoster333 citations
  125. FIERY: Future Instance Prediction in Bird's-Eye View From Surround Monocular CamerasPoster330 citations
  126. Monocular, One-Stage, Regression of Multiple 3D PeoplePoster327 citations
  127. SnowflakeNet: Point Cloud Completion by Snowflake Point Deconvolution With Skip-TransformerPoster326 citations
  128. Generalized Source-Free Domain AdaptationPoster324 citations
  129. COTR: Correspondence Transformer for Matching Across ImagesPoster320 citations
  130. Self-Supervised Pretraining of 3D Features on Any Point-CloudPoster316 citations
  131. CondLaneNet: A Top-To-Down Lane Detection Framework Based on Conditional ConvolutionPoster315 citations
  132. Image Inpainting via Conditional Texture and Structure Dual GenerationPoster314 citations
  133. LIRA: Learnable, Imperceptible and Robust Backdoor AttacksPoster310 citations
  134. Learning To Diversify for Single Domain GeneralizationPoster307 citations
  135. Unsupervised Semantic Segmentation by Contrasting Object Mask ProposalsPoster307 citations
  136. Neural Radiance Flow for 4D View Synthesis and Video ProcessingPoster305 citations
  137. Editing Conditional Radiance FieldsPoster304 citations
  138. NerfingMVS: Guided Optimization of Neural Radiance Fields for Indoor Multi-View StereoPoster302 citations
  139. Multimodal Co-Attention Transformer for Survival Prediction in Gigapixel Whole Slide ImagesPoster301 citations
  140. RangeDet: In Defense of Range View for LiDAR-Based 3D Object DetectionPoster300 citations
  141. Unsupervised Point Cloud Pre-Training via Occlusion CompletionPoster300 citations
  142. Exploring Temporal Coherence for More General Video Face Forgery DetectionPoster299 citations
  143. Omnidata: A Scalable Pipeline for Making Multi-Task Mid-Level Vision Datasets From 3D ScansPoster299 citations
  144. Refining Activation Downsampling With SoftPoolPoster299 citations
  145. Improving 3D Object Detection With Channel-Wise TransformerPoster298 citations
  146. HiFT: Hierarchical Feature Transformer for Aerial TrackingPoster297 citations
  147. High-Fidelity Pluralistic Image Completion With TransformersPoster297 citations
  148. Vision-Language Transformer and Query Generation for Referring SegmentationPoster297 citations
  149. Channel Augmented Joint Learning for Visible-Infrared RecognitionPoster296 citations
  150. Uncertainty-Guided Transformer Reasoning for Camouflaged Object DetectionPoster296 citations
  151. 3D-FRONT: 3D Furnished Rooms With layOuts and semaNTicsPoster295 citations
  152. Gait Recognition via Effective Global-Local Feature Representation and Local Temporal AggregationPoster294 citations
  153. Geography-Aware Self-Supervised LearningPoster291 citations
  154. Admix: Enhancing the Transferability of Adversarial AttacksPoster290 citations
  155. GRF: Learning a General Radiance Field for 3D Representation and RenderingPoster290 citations
  156. Feature Importance-Aware Transferable Adversarial AttacksPoster288 citations
  157. Semi-Supervised Semantic Segmentation With Pixel-Level Contrastive Learning From a Class-Wise Memory BankPoster288 citations
  158. Continual Prototype Evolution: Learning Online From Non-Stationary Data StreamsPoster285 citations
  159. Rethinking the Backdoor Attacks' Triggers: A Frequency PerspectivePoster281 citations
  160. On the Robustness of Vision Transformers to Adversarial ExamplesPoster280 citations
  161. A Hybrid Video Anomaly Detection Framework via Memory-Augmented Flow Reconstruction and Flow-Guided Frame PredictionPoster278 citations
  162. TransFER: Learning Relation-Aware Facial Expression Representations With TransformersPoster278 citations
  163. Human Pose Regression With Residual Log-Likelihood EstimationPoster277 citations
  164. OpenGAN: Open-Set Recognition via Open Data GenerationPoster276 citations
  165. Adaptive Adversarial Network for Source-Free Domain AdaptationPoster274 citations
  166. Relational Embedding for Few-Shot ClassificationPoster274 citations
  167. Visformer: The Vision-Friendly TransformerPoster274 citations
  168. Anticipative Video TransformerPoster273 citations
  169. MVTN: Multi-View Transformation Network for 3D Shape RecognitionPoster269 citations
  170. Self-Calibrating Neural Radiance FieldsPoster268 citations
  171. ICE: Inter-Instance Contrastive Encoding for Unsupervised Person Re-IdentificationPoster266 citations
  172. Artificial Fingerprinting for Generative Models: Rooting Deepfake Attribution in Training DataPoster263 citations
  173. Geometry Uncertainty Projection Network for Monocular 3D Object DetectionPoster263 citations
  174. NEAT: Neural Attention Fields for End-to-End Autonomous DrivingPoster263 citations
  175. MSR-GCN: Multi-Scale Residual Graph Convolution Networks for Human Motion PredictionPoster262 citations
  176. Self-Knowledge Distillation With Progressive Refinement of TargetsPoster262 citations
  177. Learning To Track With Object PermanencePoster258 citations
  178. SNARF: Differentiable Forward Skinning for Animating Non-Rigid Neural Implicit ShapesPoster258 citations
  179. Specificity-Preserving RGB-D Saliency DetectionPoster256 citations
  180. TS-CAM: Token Semantic Coupled Attention Map for Weakly Supervised Object LocalizationPoster254 citations
  181. VidTr: Video Transformer Without ConvolutionsPoster253 citations
  182. HiNet: Deep Image Hiding by Invertible NetworkPoster252 citations
  183. PIRenderer: Controllable Portrait Image Generation via Semantic Neural RenderingPoster252 citations
  184. SS-IL: Separated Softmax for Incremental LearningPoster251 citations
  185. FaPN: Feature-Aligned Pyramid Network for Dense Image PredictionPoster250 citations
  186. Spatio-Temporal Self-Supervised Representation Learning for 3D Point CloudsPoster248 citations
  187. A Simple Feature Augmentation for Domain GeneralizationPoster246 citations
  188. Learning by Aligning: Visible-Infrared Person Re-Identification Using Cross-Modal CorrespondencesPoster246 citations
  189. FREE: Feature Refinement for Generalized Zero-Shot LearningPoster244 citations
  190. MeshTalk: 3D Face Animation From Speech Using Cross-Modality DisentanglementPoster241 citations
  191. Learn To Match: Automatic Matching Network Design for Visual TrackingPoster239 citations
  192. Transformer-Based Attention Networks for Continuous Pixel-Wise PredictionPoster239 citations
  193. End-to-End Dense Video Captioning With Parallel DecodingPoster238 citations
  194. CodeNeRF: Disentangled Neural Radiance Fields for Object CategoriesPoster236 citations
  195. On Feature Decorrelation in Self-Supervised LearningPoster236 citations
  196. A Unified Objective for Novel Class DiscoveryPoster235 citations
  197. Image Retrieval on Real-Life Images With Pre-Trained Vision-and-Language ModelsPoster235 citations
  198. ResRep: Lossless CNN Pruning via Decoupling Remembering and ForgettingPoster235 citations
  199. Relaxed Transformer Decoders for Direct Action Proposal GenerationPoster234 citations
  200. ALL Snow Removed: Single Image Desnowing Algorithm Using Hierarchical Dual-Tree Complex Wavelet Representation and Contradict Channel LossPoster232 citations
  201. End-to-End Urban Driving by Imitating a Reinforcement Learning CoachPoster232 citations
  202. Image Manipulation Detection by Multi-View Multi-Scale SupervisionPoster231 citations
  203. Neural Articulated Radiance FieldPoster231 citations
  204. Simpler Is Better: Few-Shot Semantic Segmentation With Classifier Weight TransformerPoster229 citations
  205. Pixel Contrastive-Consistent Semi-Supervised Semantic SegmentationPoster226 citations
  206. Temporal-Wise Attention Spiking Neural Networks for Event Streams ClassificationPoster224 citations
  207. GNeRF: GAN-Based Neural Radiance Field Without Posed CameraPoster223 citations
  208. Perception-Aware Multi-Sensor Fusion for 3D LiDAR Semantic SegmentationPoster223 citations
  209. ARCH++: Animation-Ready Clothed Human Reconstruction RevisitedPoster222 citations
  210. Always Be Dreaming: A New Approach for Data-Free Class-Incremental LearningPoster219 citations
  211. ID-Reveal: Identity-Aware DeepFake Video DetectionPoster219 citations
  212. Episodic Transformer for Vision-and-Language NavigationPoster214 citations
  213. Cross-Modality Person Re-Identification via Modality Confusion and Center AggregationPoster213 citations
  214. Score-Based Point Cloud DenoisingPoster211 citations
  215. XVFI: eXtreme Video Frame InterpolationPoster210 citations
  216. Contrastive Learning for Label Efficient Semantic SegmentationPoster209 citations
  217. Pixel-Perfect Structure-From-Motion With Featuremetric RefinementPoster209 citations
  218. Joint Audio-Visual Deepfake DetectionPoster207 citations
  219. OMNet: Learning Overlapping Mask for Partial-to-Partial Point Cloud RegistrationPoster207 citations
  220. H2O: Two Hands Manipulating Objects for First Person Interaction RecognitionPoster205 citations
  221. Panoptic Segmentation of Satellite Image Time Series With Convolutional Temporal Attention NetworksPoster204 citations
  222. Synthesis of Compositional Animations From Textual DescriptionsPoster202 citations
  223. Where2Act: From Pixels to Actions for Articulated 3D ObjectsPoster202 citations
  224. Pyramid R-CNN: Towards Better Performance and Adaptability for 3D Object DetectionPoster201 citations
  225. TF-Blender: Temporal Feature Blender for Video Object DetectionPoster200 citations
  226. Influence-Balanced Loss for Imbalanced Visual ClassificationPoster199 citations
  227. ShapeConv: Shape-Aware Convolutional Layer for Indoor RGB-D Semantic SegmentationPoster199 citations
  228. SPG: Unsupervised Domain Adaptation for 3D Object Detection via Semantic Point GenerationPoster198 citations
  229. Space-Time-Separable Graph Convolutional Network for Pose ForecastingPoster197 citations
  230. Residual Attention: A Simple but Effective Method for Multi-Label RecognitionPoster196 citations
  231. AA-RMVSNet: Adaptive Aggregation Recurrent Multi-View Stereo NetworkPoster195 citations
  232. Divide-and-Assemble: Learning Block-Wise Memory for Unsupervised Anomaly DetectionPoster193 citations
  233. Hierarchical Aggregation for 3D Instance SegmentationPoster193 citations
  234. OVANet: One-vs-All Network for Universal Domain AdaptationPoster193 citations
  235. Naturalistic Physical Adversarial Patch for Object DetectorsPoster192 citations
  236. HiT: Hierarchical Transformer With Momentum Contrast for Video-Text RetrievalPoster191 citations
  237. Semi-Supervised Learning of Visual Features by Non-Parametrically Predicting View Assignments With Support SamplesPoster191 citations
  238. Evidential Deep Learning for Open Set Action RecognitionPoster190 citations
  239. Leveraging Auxiliary Tasks With Affinity Learning for Weakly Supervised Semantic SegmentationPoster190 citations
  240. Stochastic Scene-Aware Motion PredictionPoster190 citations
  241. Adaptive Graph Convolution for Point Cloud AnalysisPoster189 citations
  242. Hand-Object Contact Consistency Reasoning for Human Grasps GenerationPoster189 citations
  243. Visual Alignment Constraint for Continuous Sign Language RecognitionPoster189 citations
  244. Probabilistic Modeling for Human Mesh RecoveryPoster188 citations
  245. Efficient Visual Pretraining With Contrastive DetectionPoster187 citations
  246. Scalable Vision Transformers With Hierarchical PoolingPoster186 citations
  247. ACE: Ally Complementary Experts for Solving Long-Tailed Recognition in One-ShotPoster185 citations
  248. Fog Simulation on Real LiDAR Point Clouds for 3D Object Detection in Adverse WeatherPoster185 citations
  249. Self-Supervised Video Object Segmentation by Motion GroupingPoster185 citations
  250. Asymmetric Bilateral Motion Estimation for Video Frame InterpolationPoster184 citations
  251. From Two to One: A New Scene Text Recognizer With Visual Language Modeling NetworkPoster184 citations
  252. LayoutTransformer: Layout Generation and Completion With Self-AttentionPoster184 citations
  253. Video Self-Stitching Graph Network for Temporal Action LocalizationPoster184 citations
  254. Zen-NAS: A Zero-Shot NAS for High-Performance Image RecognitionPoster184 citations
  255. Gait Recognition in the Wild: A BenchmarkPoster182 citations
  256. Large-Scale Robust Deep AUC Maximization: A New Surrogate Loss and Empirical Studies on Medical Image ClassificationPoster181 citations
  257. 3DVG-Transformer: Relation Modeling for Visual Grounding on Point CloudsPoster180 citations
  258. Full-Duplex Strategy for Video Object SegmentationPoster180 citations
  259. CrackFormer: Transformer Network for Fine-Grained Crack DetectionPoster179 citations
  260. FuseFormer: Fusing Fine-Grained Information in Transformers for Video InpaintingPoster179 citations
  261. Modulated Graph Convolutional Network for 3D Human Pose EstimationPoster179 citations
  262. DeepCAD: A Deep Generative Network for Computer-Aided Design ModelsPoster178 citations
  263. Explaining in Style: Training a GAN To Explain a Classifier in StyleSpacePoster178 citations
  264. Syncretic Modality Collaborative Learning for Visible Infrared Person Re-IdentificationPoster178 citations
  265. Learnable Boundary Guided Adversarial TrainingPoster177 citations
  266. Better Aggregation in Test-Time AugmentationPoster176 citations
  267. Spatial-Temporal Transformer for Dynamic Scene Graph GenerationPoster175 citations
  268. Active Domain Adaptation via Clustering Uncertainty-Weighted EmbeddingsPoster173 citations
  269. GAN-Control: Explicitly Controllable GANsPoster173 citations
  270. Complementary Patch for Weakly Supervised Semantic SegmentationPoster172 citations
  271. CrossCLR: Cross-Modal Contrastive Learning for Multi-Modal Video RepresentationsPoster172 citations
  272. MINE: Towards Continuous Depth MPI With NeRF for Novel View SynthesisPoster171 citations
  273. Entropy Maximization and Meta Classification for Out-of-Distribution Detection in Semantic SegmentationPoster170 citations
  274. Learning To Resize Images for Computer Vision TasksPoster170 citations
  275. SENTRY: Selective Entropy Optimization via Committee Consistency for Unsupervised Domain AdaptationPoster170 citations
  276. Semantically Coherent Out-of-Distribution DetectionPoster170 citations
  277. Airbert: In-Domain Pretraining for Vision-and-Language NavigationPoster169 citations
  278. Context-Sensitive Temporal Feature Learning for Gait RecognitionPoster169 citations
  279. Domain Adaptive Semantic Segmentation With Self-Supervised Depth EstimationPoster169 citations
  280. Infinite Nature: Perpetual View Generation of Natural Scenes From a Single ImagePoster169 citations
  281. Geometry-Based Distance Decomposition for Monocular 3D Object DetectionPoster168 citations
  282. DOLG: Single-Stage Image Retrieval With Deep Orthogonal Fusion of Local and Global FeaturesPoster167 citations
  283. Graph Contrastive ClusteringPoster167 citations
  284. Reconstructing Hand-Object Interactions in the WildPoster167 citations
  285. TeachText: CrossModal Generalized Distillation for Text-Video RetrievalPoster167 citations
  286. AutoShape: Real-Time Shape-Aware Monocular 3D Object DetectionPoster165 citations
  287. Meta-Learning With Task-Adaptive Loss Function for Few-Shot LearningPoster165 citations
  288. IDM: An Intermediate Domain Module for Domain Adaptive Person Re-IDPoster164 citations
  289. Predicting With Confidence on Unseen DistributionsPoster164 citations
  290. Learning Skeletal Graph Neural Networks for Hard 3D Pose EstimationPoster163 citations
  291. Mining Latent Classes for Few-Shot SegmentationPoster162 citations
  292. Modulated Periodic Activations for Generalizable Local Functional RepresentationsPoster162 citations
  293. Perturbed Self-Distillation: Weakly Supervised Large-Scale Point Cloud Semantic SegmentationPoster162 citations
  294. Re-Distributing Biased Pseudo Labels for Semi-Supervised Semantic Segmentation: A Baseline InvestigationPoster162 citations
  295. Active Learning for Deep Object Detection via Probabilistic ModelingPoster161 citations
  296. FACIAL: Synthesizing Dynamic Talking Face With Implicit Attribute LearningPoster161 citations
  297. Unlocking the Potential of Ordinary Classifier: Class-Specific Adversarial Erasing Framework for Weakly Supervised Semantic SegmentationPoster161 citations
  298. Guided Point Contrastive Learning for Semi-Supervised Point Cloud Semantic SegmentationPoster160 citations
  299. Multi-VAE: Learning Disentangled View-Common and View-Peculiar Visual Representations for Multi-View ClusteringPoster160 citations
  300. SO-Pose: Exploiting Self-Occlusion for Direct 6D Pose EstimationPoster160 citations
  301. SPEC: Seeing People in the Wild With an Estimated CameraPoster160 citations
  302. Unconstrained Scene Generation With Locally Conditioned Radiance FieldsPoster160 citations
  303. CM-NAS: Cross-Modality Neural Architecture Search for Visible-Infrared Person Re-IdentificationPoster159 citations
  304. CR-Fill: Generative Image Inpainting With Auxiliary Contextual ReconstructionPoster159 citations
  305. MOTSynth: How Can Synthetic Data Help Pedestrian Detection and Tracking?Poster159 citations
  306. TACo: Token-Aware Cascade Contrastive Learning for Video-Text AlignmentPoster159 citations
  307. RECALL: Replay-Based Continual Learning in Semantic SegmentationPoster158 citations
  308. GroupFormer: Group Activity Recognition With Clustered Spatial-Temporal TransformerPoster157 citations
  309. SGPA: Structure-Guided Prior Adaptation for Category-Level 6D Object Pose EstimationPoster156 citations
  310. DualPoseNet: Category-Level 6D Object Pose and Size Estimation Using Dual Pose Network With Refined Learning of Pose ConsistencyPoster155 citations
  311. Single-Shot Hyperspectral-Depth Imaging With Learned Diffractive OpticsPoster155 citations
  312. Spatially-Adaptive Image Restoration Using Distortion-Guided NetworksPoster155 citations
  313. Multitask AET With Orthogonal Tangent Regularity for Dark Object DetectionPoster154 citations
  314. OadTR: Online Action Detection With TransformersPoster154 citations
  315. SynFace: Face Recognition With Synthetic DataPoster154 citations
  316. Fourier Space Losses for Efficient Perceptual Image Super-ResolutionPoster153 citations
  317. Context Decoupling Augmentation for Weakly Supervised Semantic SegmentationPoster152 citations
  318. DC-ShadowNet: Single-Image Hard and Soft Shadow Removal Using Unsupervised Domain-Classifier Guided NetworkPoster152 citations
  319. Understanding and Evaluating Racial Biases in Image CaptioningPoster152 citations
  320. Weakly Supervised Contrastive LearningPoster152 citations
  321. Broaden Your Views for Self-Supervised Video LearningPoster151 citations
  322. Recurrent Mask Refinement for Few-Shot Medical Image SegmentationPoster151 citations
  323. A Simple Baseline for Semi-Supervised Semantic Segmentation With Strong Data AugmentationPoster150 citations
  324. Hierarchical Memory Matching Network for Video Object SegmentationPoster149 citations
  325. Learning Meta-Class Memory for Few-Shot Semantic SegmentationPoster149 citations
  326. Query Adaptive Few-Shot Object Detection With Heterogeneous Graph Convolutional NetworksPoster149 citations
  327. Unidentified Video Objects: A Benchmark for Dense, Open-World SegmentationPoster149 citations
  328. Enriching Local and Global Contexts for Temporal Action LocalizationPoster148 citations
  329. Ensemble Attention Distillation for Privacy-Preserving Federated LearningPoster148 citations
  330. FASA: Feature Augmentation and Sampling Adaptation for Long-Tailed Instance SegmentationPoster148 citations
  331. InstanceRefer: Cooperative Holistic Understanding for Visual Grounding on Point Clouds Through Instance Multi-Level Contextual ReferringPoster147 citations
  332. KoDF: A Large-Scale Korean DeepFake Detection DatasetPoster147 citations
  333. Spatially Conditioned Graphs for Detecting Human-Object InteractionsPoster147 citations
  334. Z-Score Normalization, Hubness, and Few-Shot LearningPoster147 citations
  335. DAE-GAN: Dynamic Aspect-Aware GAN for Text-to-Image SynthesisPoster146 citations
  336. Densely Guided Knowledge Distillation Using Multiple Teacher AssistantsPoster146 citations
  337. Universal-Prototype Enhancing for Few-Shot Object DetectionPoster146 citations
  338. Learning a Single Network for Scale-Arbitrary Super-ResolutionPoster145 citations
  339. Probabilistic Monocular 3D Human Pose Estimation With Normalizing FlowsPoster145 citations
  340. R-MSFM: Recurrent Multi-Scale Feature Modulation for Monocular Depth EstimatingPoster145 citations
  341. Learning Multi-Scene Absolute Pose Regression With TransformersPoster144 citations
  342. LookOut: Diverse Multi-Future Prediction and Planning for Self-DrivingPoster144 citations
  343. Structure-Preserving Deraining With Residue Channel Prior GuidancePoster144 citations
  344. Instance Segmentation in 3D Scenes Using Semantic Superpoint Tree NetworksPoster143 citations
  345. MG-GAN: A Multi-Generator Model Preventing Out-of-Distribution Samples in Pedestrian Trajectory PredictionPoster143 citations
  346. Region-Aware Contrastive Learning for Semantic SegmentationPoster143 citations
  347. Black-Box Detection of Backdoor Attacks With Limited Information and DataPoster142 citations
  348. BossNAS: Exploring Hybrid CNN-Transformers With Block-Wisely Self-Supervised Neural Architecture SearchPoster142 citations
  349. Generalize Then Adapt: Source-Free Domain Adaptive Semantic SegmentationPoster142 citations
  350. Interpretable Image Recognition by Constructing Transparent Embedding SpacePoster142 citations
  351. Learning To Match Features With Seeded Graph Matching NetworkPoster142 citations
  352. Pyramid Point Cloud Transformer for Large-Scale Place RecognitionPoster142 citations
  353. CPF: Learning a Contact Potential Field To Model the Hand-Object InteractionPoster141 citations
  354. High-Performance Discriminative Tracking With TransformersPoster141 citations
  355. Mutual Affine Network for Spatially Variant Kernel Estimation in Blind Image Super-ResolutionPoster141 citations
  356. Talk-To-Edit: Fine-Grained Facial Editing via DialogPoster141 citations
  357. Occlude Them All: Occlusion-Aware Attention Network for Occluded Person Re-IDPoster140 citations
  358. RGB-D Saliency Detection via Cascaded Mutual Information MinimizationPoster139 citations
  359. Region Similarity Representation LearningPoster139 citations
  360. Social NCE: Contrastive Learning of Socially-Aware Motion RepresentationsPoster139 citations
  361. RFNet: Region-Aware Fusion Network for Incomplete Multi-Modal Brain Tumor SegmentationPoster138 citations
  362. Semantics Disentangling for Generalized Zero-Shot LearningPoster138 citations
  363. Change Is Everywhere: Single-Temporal Supervised Object Change Detection in Remote Sensing ImageryPoster137 citations
  364. Crossover Learning for Fast Online Video Instance SegmentationPoster137 citations
  365. ECS-Net: Improving Weakly Supervised Semantic Segmentation by Using Connections Between Class Activation MapsPoster137 citations
  366. EPP-MVSNet: Epipolar-Assembling Based Depth Prediction for Multi-View StereoPoster137 citations
  367. Learning To Drive From a World on RailsPoster137 citations
  368. Deep Hough Voting for Robust Global RegistrationPoster136 citations
  369. Distributional Robustness Loss for Long-Tail LearningPoster136 citations
  370. GraphFPN: Graph Feature Pyramid Network for Object DetectionPoster136 citations
  371. Rethinking the Truly Unsupervised Image-to-Image TranslationPoster136 citations
  372. SAT: 2D Semantics Assisted Training for 3D Visual GroundingPoster136 citations
  373. Structured Bird's-Eye-View Traffic Scene Understanding From Onboard ImagesPoster136 citations
  374. Towards Real-World X-Ray Security Inspection: A High-Quality Benchmark and Lateral Inhibition Module for Prohibited Items DetectionPoster136 citations
  375. Vector-Decomposed Disentanglement for Domain-Invariant Object DetectionPoster136 citations
  376. HeadGAN: One-Shot Neural Head Synthesis and EditingPoster135 citations
  377. Self-Mutual Distillation Learning for Continuous Sign Language RecognitionPoster135 citations
  378. 3D Local Convolutional Neural Networks for Gait RecognitionPoster134 citations
  379. Separable Flow: Learning Motion Cost Volumes for Optical Flow EstimationPoster134 citations
  380. Fine-Grained Semantics-Aware Representation Enhancement for Self-Supervised Monocular Depth EstimationPoster133 citations
  381. HRegNet: A Hierarchical Network for Large-Scale Outdoor LiDAR Point Cloud RegistrationPoster133 citations
  382. Online Knowledge Distillation for Efficient Pose EstimationPoster133 citations
  383. The Way to My Heart Is Through Contrastive Learning: Remote Photoplethysmography From Unlabelled VideoPoster133 citations
  384. ELF-VC: Efficient Learned Flexible-Rate Video CodingPoster132 citations
  385. Elaborative Rehearsal for Zero-Shot Action RecognitionPoster132 citations
  386. Learning From Noisy Data With Robust Representation LearningPoster132 citations
  387. WaveFill: A Wavelet-Based Generation Network for Image InpaintingPoster132 citations
  388. GANcraft: Unsupervised 3D Neural Rendering of Minecraft WorldsPoster131 citations
  389. GLiT: Neural Architecture Search for Global and Local Image TransformerPoster131 citations
  390. Knowledge-Enriched Distributional Model Inversion AttacksPoster131 citations
  391. Saliency-Associated Object TrackingPoster131 citations
  392. Adaptive Unfolding Total Variation Network for Low-Light Image EnhancementPoster130 citations
  393. Audio2Gestures: Generating Diverse Gestures From Speech Audio With Conditional Variational AutoencodersPoster130 citations
  394. Clothing Status Awareness for Long-Term Person Re-IdentificationPoster130 citations
  395. Distilling Virtual Examples for Long-Tailed RecognitionPoster130 citations
  396. Fast Video Moment RetrievalPoster130 citations
  397. SOTR: Segmenting Objects With TransformersPoster130 citations
  398. LIGA-Stereo: Learning LiDAR Geometry Aware Representations for Stereo-Based 3D DetectorPoster129 citations
  399. Towards Flexible Blind JPEG Artifacts RemovalPoster129 citations
  400. Causal Attention for Unbiased Visual RecognitionPoster128 citations
  401. Dynamic Context-Sensitive Filtering Network for Video Salient Object DetectionPoster128 citations
  402. Neural-GIF: Neural Generalized Implicit Functions for Animating People in ClothingPoster128 citations
  403. Amplitude-Phase Recombination: Rethinking Robustness of Convolutional Neural Networks in Frequency DomainPoster127 citations
  404. Collaborative Unsupervised Visual Representation Learning From Decentralized DataPoster127 citations
  405. Estimating and Exploiting the Aleatoric Uncertainty in Surface Normal EstimationPoster127 citations
  406. Multi-View 3D Reconstruction With TransformersPoster126 citations
  407. Revisiting Adversarial Robustness Distillation: Robust Soft Labels Make Student BetterPoster126 citations
  408. Self-Supervised Neural Networks for Spectral Snapshot Compressive ImagingPoster126 citations
  409. Vision Transformer With Progressive SamplingPoster126 citations
  410. AdvDrop: Adversarial Attack to DNNs by Dropping InformationPoster125 citations
  411. Exploring Inter-Channel Correlation for Diversity-Preserved Knowledge DistillationPoster125 citations
  412. Hierarchical Conditional Flow: A Unified Framework for Image Super-Resolution and Image RescalingPoster125 citations
  413. Self Supervision to Distillation for Long-Tailed Visual RecognitionPoster125 citations
  414. Unshuffling Data for Improved Generalization in Visual Question AnsweringPoster125 citations
  415. Exploring Classification Equilibrium in Long-Tailed Object DetectionPoster124 citations
  416. MultiSports: A Multi-Person Video Dataset of Spatio-Temporally Localized Sports ActionsPoster124 citations
  417. Group-Aware Contrastive Regression for Action Quality AssessmentPoster123 citations
  418. Skeleton Cloud Colorization for Unsupervised 3D Action Representation LearningPoster123 citations
  419. Spatial Uncertainty-Aware Semi-Supervised Crowd CountingPoster123 citations
  420. StyleFormer: Real-Time Arbitrary Style Transfer via Parametric Style CompositionPoster123 citations
  421. Video Instance Segmentation With a Propose-Reduce ParadigmPoster123 citations
  422. Box-Aware Feature Enhancement for Single Object Tracking on Point CloudsPoster122 citations
  423. Joint Inductive and Transductive Learning for Video Object SegmentationPoster122 citations
  424. Adaptive Boundary Proposal Network for Arbitrary Shape Text DetectionPoster121 citations
  425. Adaptive Focus for Efficient Video RecognitionPoster121 citations
  426. Understanding and Mitigating Annotation Bias in Facial Expression RecognitionPoster121 citations
  427. imGHUM: Implicit Generative Models of 3D Human Shape and Articulated PosePoster121 citations
  428. A Broad Study on the Transferability of Visual Representations With Contrastive LearningPoster120 citations
  429. Graspness Discovery in Clutters for Fast and Accurate Grasp DetectionPoster120 citations
  430. STAR: A Structure-Aware Lightweight Transformer for Real-Time Image EnhancementPoster120 citations
  431. TRAR: Routing the Attention Spans in Transformer for Visual Question AnsweringPoster120 citations
  432. Towards Face Encryption by Generating Adversarial Identity MasksPoster120 citations
  433. Transformer-Based Dual Relation Graph for Multi-Label Image RecognitionPoster120 citations
  434. Uncertainty-Aware Pseudo Label Refinery for Domain Adaptive Semantic SegmentationPoster120 citations
  435. Online Pseudo Label Generation by Hierarchical Cluster Dynamics for Adaptive Person Re-IdentificationPoster119 citations
  436. Pseudo-Mask Matters in Weakly-Supervised Semantic SegmentationPoster119 citations
  437. The Power of Points for Modeling Humans in ClothingPoster119 citations
  438. Towards Vivid and Diverse Image Colorization With Generative Color PriorPoster119 citations
  439. Universal Representation Learning From Multiple Domains for Few-Shot ClassificationPoster119 citations
  440. Variable-Rate Deep Image Compression Through Spatially-Adaptive Feature TransformPoster119 citations
  441. Deep Co-Training With Task Decomposition for Semi-Supervised Domain AdaptationPoster118 citations
  442. NPMs: Neural Parametric Models for 3D Deformable ShapesPoster118 citations
  443. Rehearsal Revealed: The Limits and Merits of Revisiting Samples in Continual LearningPoster118 citations
  444. Single Image Defocus Deblurring Using Kernel-Sharing Parallel Atrous ConvolutionsPoster118 citations
  445. 4DComplete: Non-Rigid Motion Estimation Beyond the Observable SurfacePoster117 citations
  446. A-SDF: Learning Disentangled Signed Distance Functions for Articulated Shape RepresentationPoster117 citations
  447. DRB-GAN: A Dynamic ResBlock Generative Adversarial Network for Artistic Style TransferPoster117 citations
  448. Multi-Task Self-Training for Learning General RepresentationsPoster117 citations
  449. Seeing Dynamic Scene in the Dark: A High-Quality Video Dataset With Mechatronic AlignmentPoster117 citations
  450. Semantic Concentration for Domain AdaptationPoster117 citations
  451. Student Customized Knowledge Distillation: Bridging the Gap Between Student and TeacherPoster117 citations
  452. Conditional Diffusion for Interactive SegmentationPoster116 citations
  453. Dressing in Order: Recurrent Person Image Generation for Pose Transfer, Virtual Try-On and Outfit EditingPoster116 citations
  454. Learning Motion Priors for 4D Human Body Capture in 3D ScenesPoster116 citations
  455. Preservational Learning Improves Self-Supervised Medical Image Models by Reconstructing Diverse ContextsPoster116 citations
  456. Towards Real-World Prohibited Item Detection: A Large-Scale X-Ray BenchmarkPoster116 citations
  457. Dynamic Attentive Graph Learning for Image RestorationPoster115 citations
  458. Equivariant Imaging: Learning Beyond the Range SpacePoster115 citations
  459. FloW: A Dataset and Benchmark for Floating Waste Detection in Inland WatersPoster115 citations
  460. PnP-DETR: Towards Efficient Visual Analysis With TransformersPoster115 citations
  461. CAPTRA: CAtegory-Level Pose Tracking for Rigid and Articulated Objects From Point CloudsPoster114 citations
  462. ReCU: Reviving the Dead Weights in Binary Neural NetworksPoster114 citations
  463. Rethinking Self-Supervised Correspondence Learning: A Video Frame-Level Similarity PerspectivePoster114 citations
  464. Binocular Mutual Learning for Improving Few-Shot ClassificationPoster113 citations
  465. LOKI: Long Term and Key Intentions for Trajectory PredictionPoster113 citations
  466. Motion Deblurring With Real EventsPoster113 citations
  467. One-Pass Multi-View Clustering for Large-Scale DataPoster113 citations
  468. SLIM: Self-Supervised LiDAR Scene Flow and Motion SegmentationPoster113 citations
  469. Standardized Max Logits: A Simple yet Effective Approach for Identifying Unexpected Road Obstacles in Urban-Scene SegmentationPoster113 citations
  470. Exploiting Explanations for Model Inversion AttacksPoster112 citations
  471. Learning Fast Sample Re-Weighting Without Reward DataPoster112 citations
  472. Object Tracking by Jointly Exploiting Frame and Event DomainPoster112 citations
  473. Sparse Needlets for Lighting Estimation With Spherical Transport LossPoster112 citations
  474. Spatio-Temporal Dynamic Inference Network for Group Activity RecognitionPoster112 citations
  475. CANet: A Context-Aware Network for Shadow RemovalPoster111 citations
  476. E-ViL: A Dataset and Benchmark for Natural Language Explanations in Vision-Language TasksPoster111 citations
  477. Event-Based Video Reconstruction Using TransformerPoster111 citations
  478. Influence Selection for Active LearningPoster111 citations
  479. Interacting Two-Hand 3D Pose and Shape Reconstruction From Single Color ImagePoster111 citations
  480. Seeking Similarities Over Differences: Similarity-Based Domain Alignment for Adaptive Object DetectionPoster111 citations
  481. DeepMultiCap: Performance Capture of Multiple Characters Using Sparse Multiview CamerasPoster110 citations
  482. Graph-Based Asynchronous Event Processing for Rapid Object RecognitionPoster110 citations
  483. Instance-Level Image Retrieval Using Reranking TransformersPoster110 citations
  484. Learning of Visual Relations: The Devil Is in the TailsPoster110 citations
  485. Location-Aware Single Image Reflection RemovalPoster110 citations
  486. Mean Shift for Self-Supervised LearningPoster110 citations
  487. Multimodal Clustering Networks for Self-Supervised Learning From Unlabeled VideosPoster110 citations
  488. Physics-Based Human Motion Estimation and Synthesis From VideosPoster110 citations
  489. A Hierarchical Transformation-Discriminating Generative Model for Few Shot Anomaly DetectionPoster109 citations
  490. Auxiliary Tasks and Exploration Enable ObjectGoal NavigationPoster109 citations
  491. Dynamic High-Pass Filtering and Multi-Spectral Attention for Image Super-ResolutionPoster109 citations
  492. Excavating the Potential Capacity of Self-Supervised Monocular Depth EstimationPoster109 citations
  493. Exploring Simple 3D Multi-Object Tracking for Autonomous DrivingPoster109 citations
  494. C2N: Practical Generative Noise Modeling for Real-World DenoisingPoster108 citations
  495. Unsupervised Depth Completion With Calibrated Backprojection LayersPoster108 citations
  496. A Latent Transformer for Disentangled Face Editing in Images and VideosPoster107 citations
  497. NGC: A Unified Framework for Learning With Open-World Noisy DataPoster107 citations
  498. Pyramid Spatial-Temporal Aggregation for Video-Based Person Re-IdentificationPoster107 citations
  499. Disentangled High Quality Salient Object DetectionPoster106 citations
  500. Divide and Contrast: Self-Supervised Learning From Uncurated DataPoster106 citations
  501. Enhanced Boundary Learning for Glass-Like Object SegmentationPoster106 citations
  502. Frequency Domain Image Translation: More Photo-Realistic, Better Identity-PreservingPoster106 citations
  503. Generative Layout Modeling Using Constraint GraphsPoster106 citations
  504. IntraTomo: Self-Supervised Learning-Based Tomography via Sinogram Synthesis and PredictionPoster106 citations
  505. Learning Signed Distance Field for Multi-View Surface ReconstructionPoster106 citations
  506. Online Continual Learning With Natural Distribution Shifts: An Empirical Study With Visual DataPoster106 citations
  507. Domain Generalization via Gradient SurgeryPoster105 citations
  508. From General to Specific: Informative Scene Graph Generation via Balance AdjustmentPoster105 citations
  509. Mining Contextual Information Beyond Image for Semantic SegmentationPoster105 citations
  510. Mixture-Based Feature Space Learning for Few-Shot Image ClassificationPoster105 citations
  511. N-ImageNet: Towards Robust, Fine-Grained Object Recognition With Event CamerasPoster105 citations
  512. Encoder-Decoder With Multi-Level Attention for 3D Human Shape and Pose EstimationPoster104 citations
  513. H3D-Net: Few-Shot High-Fidelity 3D Head ReconstructionPoster104 citations
  514. Improving Contrastive Learning by Visualizing Feature TransformationPoster104 citations
  515. Instance-Wise Hard Negative Example Generation for Contrastive Learning in Unpaired Image-to-Image TranslationPoster104 citations
  516. SignBERT: Pre-Training of Hand-Model-Aware Representation for Sign Language RecognitionPoster104 citations
  517. Towards Better Explanations of Class Activation MappingPoster104 citations
  518. Generating Smooth Pose Sequences for Diverse Human Motion PredictionPoster103 citations
  519. Representative Color Transform for Image EnhancementPoster103 citations
  520. Video-Based Person Re-Identification With Spatial and Temporal Memory NetworksPoster103 citations
  521. Beyond Question-Based Biases: Assessing Multimodal Shortcut Learning in Visual Question AnsweringPoster102 citations
  522. BiaSwap: Removing Dataset Bias With Bias-Tailored Swapping AugmentationPoster102 citations
  523. Geometry-Free View Synthesis: Transformers and No 3D PriorsPoster102 citations
  524. Meta Gradient Adversarial AttackPoster102 citations
  525. MicroNet: Improving Image Recognition With Extremely Low FLOPsPoster102 citations
  526. BAPA-Net: Boundary Adaptation and Prototype Alignment for Cross-Domain Semantic SegmentationPoster101 citations
  527. HIRE-SNN: Harnessing the Inherent Robustness of Energy-Efficient Deep Spiking Neural Networks by Training With Crafted Input NoisePoster101 citations
  528. Compressing Visual-Linguistic Model via Knowledge DistillationPoster100 citations
  529. Free-Form Description Guided 3D Visual Graph Network for Object Grounding in Point CloudPoster100 citations
  530. Multiple Heads Are Better Than One: Few-Shot Font Generation With Multiple Localized ExpertsPoster100 citations
  531. RePOSE: Fast 6D Object Pose Refinement via Deep Texture RenderingPoster100 citations
  532. Deep Metric Learning for Open World Semantic SegmentationPoster99 citations
  533. Labels4Free: Unsupervised Segmentation Using StyleGANPoster99 citations
  534. Learning Action Completeness From Points for Weakly-Supervised Temporal Action LocalizationPoster99 citations
  535. Multi-Instance Pose Networks: Rethinking Top-Down Pose EstimationPoster99 citations
  536. OpenForensics: Large-Scale Challenging Dataset for Multi-Face Forgery Detection and Segmentation In-the-WildPoster99 citations
  537. Pano-AVQA: Grounded Audio-Visual Question Answering on 360deg VideosPoster99 citations
  538. Vision-Language Navigation With Random Environmental MixupPoster99 citations
  539. C3-SemiSeg: Contrastive Semi-Supervised Segmentation via Cross-Set Learning and Dynamic Class-BalancingPoster98 citations
  540. Context-Aware Scene Graph Generation With Seq2Seq TransformersPoster98 citations
  541. High-Resolution Optical Flow From 1D Attention and CorrelationPoster98 citations
  542. Real-Time Image Enhancer via Learnable Spatial-Aware 3D Lookup TablesPoster98 citations
  543. Unsupervised Domain Adaptive 3D Detection With Multi-Level ConsistencyPoster98 citations
  544. DeepGaze IIE: Calibrated Prediction in and Out-of-Domain for State-of-the-Art Saliency ModelingPoster97 citations
  545. Exploring Relational Context for Multi-Task Dense PredictionPoster97 citations
  546. Foreground-Action Consistency Network for Weakly Supervised Temporal Action LocalizationPoster97 citations
  547. Omniscient Video Super-ResolutionPoster97 citations
  548. ProFlip: Targeted Trojan Attack With Progressive Bit FlipsPoster97 citations
  549. ReDAL: Region-Based and Diversity-Aware Active Learning for Point Cloud Semantic SegmentationPoster97 citations
  550. Adversarial Unsupervised Domain Adaptation With Conditional and Label Shift: Infer, Align and IteratePoster96 citations
  551. DiscoBox: Weakly Supervised Instance Segmentation and Semantic Correspondence From Box SupervisionPoster96 citations
  552. Domain-Invariant Disentangled Network for Generalizable Object DetectionPoster96 citations
  553. MonoIndoor: Towards Good Practice of Self-Supervised Monocular Depth Estimation for Indoor EnvironmentsPoster96 citations
  554. SSH: A Self-Supervised Framework for Image HarmonizationPoster96 citations
  555. Multi-View Radar Semantic SegmentationPoster95 citations
  556. Orthogonal Projection LossPoster95 citations
  557. A Backdoor Attack Against 3D Point Cloud ClassifiersPoster94 citations
  558. Accelerating Atmospheric Turbulence Simulation via Learned Phase-to-Space TransformPoster94 citations
  559. Federated Learning for Non-IID Data via Unified Feature Learning and Optimization Objective AlignmentPoster94 citations
  560. Human Trajectory Prediction via Counterfactual AnalysisPoster94 citations
  561. Learning Cross-Modal Contrastive Features for Video Domain AdaptationPoster94 citations
  562. Partner-Assisted Learning for Few-Shot Image ClassificationPoster94 citations
  563. Point-Set Distances for Learning Representations of 3D Point CloudsPoster94 citations
  564. Waypoint Models for Instruction-Guided Navigation in Continuous EnvironmentsPoster94 citations
  565. Do Image Classifiers Generalize Across Time?Poster93 citations
  566. Paint Transformer: Feed Forward Neural Painting With Stroke PredictionPoster93 citations
  567. Spatio-Temporal Representation Factorization for Video-Based Person Re-IdentificationPoster93 citations
  568. Aligning Latent and Image Spaces To Connect the UnconnectablePoster92 citations
  569. DepthTrack: Unveiling the Power of RGBD TrackingPoster92 citations
  570. Exploiting a Joint Embedding Space for Generalized Zero-Shot Semantic SegmentationPoster92 citations
  571. Gradient Normalization for Generative Adversarial NetworksPoster92 citations
  572. On Generating Transferable Targeted PerturbationsPoster92 citations
  573. Prototypical Matching and Open Set Rejection for Zero-Shot Semantic SegmentationPoster92 citations
  574. Sketch Your Own GANPoster92 citations
  575. Zero-Shot Day-Night Domain Adaptation With a Physics PriorPoster92 citations
  576. Collaborative Optimization and Aggregation for Decentralized Domain Generalization and AdaptationPoster91 citations
  577. ISNet: Integrate Image-Level and Semantic-Level Context for Semantic SegmentationPoster91 citations
  578. Image Harmonization With TransformerPoster91 citations
  579. MGSampler: An Explainable Sampling Strategy for Video Action RecognitionPoster91 citations
  580. Progressive Correspondence Pruning by Consensus LearningPoster91 citations
  581. Regularizing Nighttime Weirdness: Efficient Self-Supervised Monocular Depth Estimation in the DarkPoster91 citations
  582. THDA: Treasure Hunt Data Augmentation for Semantic NavigationPoster91 citations
  583. Learning To Stylize Novel ViewsPoster90 citations
  584. Local Temperature Scaling for Probability CalibrationPoster90 citations
  585. Context Reasoning Attention Network for Image Super-ResolutionPoster89 citations
  586. Iterative Label Cleaning for Transductive and Semi-Supervised Few-Shot LearningPoster89 citations
  587. LapsCore: Language-Guided Person Search via Color ReasoningPoster89 citations
  588. Neural Image Compression via Attentional Multi-Scale Back Projection and Frequency DecompositionPoster89 citations
  589. Self-Supervised Product Quantization for Deep Unsupervised Image RetrievalPoster89 citations
  590. Three Steps to Multimodal Trajectory Prediction: Modality Clustering, Classification and SynthesisPoster89 citations
  591. Dynamic CT Reconstruction From Limited Views With Implicit Neural Representations and Parametric Motion FieldsPoster88 citations
  592. PixelSynth: Generating a 3D-Consistent Experience From a Single ImagePoster88 citations
  593. Pri3D: Can 3D Priors Help 2D Representation Learning?Poster88 citations
  594. Grafit: Learning Fine-Grained Image Representations With Coarse LabelsPoster87 citations
  595. Joint Visual and Audio Learning for Video Highlight DetectionPoster87 citations
  596. Learning To Generate Scene Graph From Natural Language SupervisionPoster87 citations
  597. Learning Unsupervised Metaformer for Anomaly DetectionPoster87 citations
  598. SA-ConvONet: Sign-Agnostic Optimization of Convolutional Occupancy NetworksPoster87 citations
  599. Semi-Supervised Active Learning With Temporal Output DiscrepancyPoster87 citations
  600. Sketch2Mesh: Reconstructing and Editing 3D Shapes From SketchesPoster87 citations
  601. The Road To Know-Where: An Object-and-Room Informed Sequential BERT for Indoor Vision-Language NavigationPoster87 citations
  602. Exploring Geometry-Aware Contrast and Clustering Harmonization for Self-Supervised 3D Object DetectionPoster86 citations
  603. Few-Shot Semantic Segmentation With Cyclic Memory NetworkPoster86 citations
  604. Learning To Know Where To See: A Visibility-Aware Approach for Occluded Person Re-IdentificationPoster86 citations
  605. RDA: Robust Domain Adaptation via Fourier Adversarial AttackingPoster86 citations
  606. Self-Supervised Monocular Depth Estimation for All Day Images Using Domain SeparationPoster86 citations
  607. Synthesized Feature Based Few-Shot Class-Incremental Learning on a Mixture of SubspacesPoster86 citations
  608. Towards Discriminative Representation Learning for Unsupervised Person Re-IdentificationPoster86 citations
  609. 4D-Net for Learned Multi-Modal AlignmentPoster85 citations
  610. CryoDRGN2: Ab Initio Neural Reconstruction of 3D Protein Structures From Real Cryo-EM ImagesPoster85 citations
  611. Graph-to-3D: End-to-End Generation and Manipulation of 3D Scenes Using Scene GraphsPoster85 citations
  612. Hierarchical Object-to-Zone Graph for Object NavigationPoster85 citations
  613. Self-Supervised 3D Hand Pose Estimation From Monocular RGB via Contrastive LearningPoster85 citations
  614. Shallow Bayesian Meta Learning for Real-World Few-Shot RecognitionPoster85 citations
  615. Worldsheet: Wrapping the World in a 3D Sheet for View Synthesis From a Single ImagePoster85 citations
  616. Bifold and Semantic Reasoning for Pedestrian Behavior PredictionPoster84 citations
  617. Generic Event Boundary Detection: A Benchmark for Event SegmentationPoster84 citations
  618. Learning Frequency-Aware Dynamic Network for Efficient Super-ResolutionPoster84 citations
  619. Class Semantics-Based Attention for Action DetectionPoster83 citations
  620. Contrastive Multimodal Fusion With TupleInfoNCEPoster83 citations
  621. Estimating Egocentric 3D Human Pose in Global SpacePoster83 citations
  622. Motion Guided Region Message Passing for Video CaptioningPoster83 citations
  623. Point Cloud Augmentation With Weighted Local TransformationsPoster83 citations
  624. THUNDR: Transformer-Based 3D Human Reconstruction With MarkersPoster83 citations
  625. Towards Accurate Alignment in Real-Time 3D Hand-Mesh ReconstructionPoster83 citations
  626. Cross-Sentence Temporal and Semantic Relations in Video Activity LocalisationPoster82 citations
  627. Dual Path Learning for Domain Adaptation of Semantic SegmentationPoster82 citations
  628. Geometry-Aware Self-Training for Unsupervised Domain Adaptation on Object Point CloudsPoster82 citations
  629. Interactive Prototype Learning for Egocentric Action RecognitionPoster82 citations
  630. MFNet: Multi-Filter Directive Network for Weakly Supervised Salient Object DetectionPoster82 citations
  631. Pathdreamer: A World Model for Indoor NavigationPoster82 citations
  632. Speech Drives Templates: Co-Speech Gesture Synthesis With Learned TemplatesPoster82 citations
  633. Task-Aware Part Mining Network for Few-Shot LearningPoster82 citations
  634. Adversarial VQA: A New Benchmark for Evaluating the Robustness of VQA ModelsPoster81 citations
  635. Learning Indoor Inverse Rendering With 3D Spatially-Varying LightingPoster81 citations
  636. Rethinking Noise Synthesis and Modeling in Raw DenoisingPoster81 citations
  637. Road Anomaly Detection by Partial Image Reconstruction With Segmentation CouplingPoster81 citations
  638. Unsupervised Deep Video DenoisingPoster81 citations
  639. Visual Graph Memory With Unsupervised Representation for Visual NavigationPoster81 citations
  640. A Unified 3D Human Motion Synthesis Model via Conditional Variational Auto-EncoderPoster80 citations
  641. Distilling Holistic Knowledge With Graph Neural NetworksPoster80 citations
  642. Image Synthesis From Layout With Locality-Aware Mask AdaptionPoster80 citations
  643. Joint Visual Semantic Reasoning: Multi-Stage Decoder for Text RecognitionPoster80 citations
  644. Learning Inner-Group Relations on Point CloudsPoster80 citations
  645. Learning With Noisy Labels via Sparse RegularizationPoster80 citations
  646. Parallel Rectangle Flip Attack: A Query-Based Black-Box Attack Against Object DetectionPoster80 citations
  647. Personalized and Invertible Face De-Identification by Disentangled Identity Information ManipulationPoster80 citations
  648. Self-Supervised 3D Skeleton Action Representation Learning With Motion Consistency and ContinuityPoster80 citations
  649. Target Adaptive Context Aggregation for Video Scene Graph GenerationPoster80 citations
  650. Where Are You Heading? Dynamic Trajectory Prediction With Expert Goal ExamplesPoster80 citations
  651. Boosting the Generalization Capability in Cross-Domain Few-Shot Learning via Noise-Enhanced Supervised AutoencoderPoster79 citations
  652. How To Train Neural Networks for Flare RemovalPoster79 citations
  653. Joint Representation Learning and Novel Category Discovery on Single- and Multi-Modal DataPoster79 citations
  654. LoFGAN: Fusing Local Representations for Few-Shot Image GenerationPoster79 citations
  655. Robust Small Object Detection on the Water Surface Through Fusion of Camera and Millimeter Wave RadarPoster79 citations
  656. Solving Inefficiency of Self-Supervised Representation LearningPoster79 citations
  657. Spatial and Semantic Consistency Regularizations for Pedestrian Attribute RecognitionPoster79 citations
  658. Transporting Causal Mechanisms for Unsupervised Domain AdaptationPoster79 citations
  659. Voxel-Based Network for Shape Completion by Leveraging Edge GenerationPoster79 citations
  660. Data-Free Universal Adversarial Perturbation and Black-Box AttackPoster78 citations
  661. Greedy Gradient Ensemble for Robust Visual Question AnsweringPoster78 citations
  662. Learning Motion-Appearance Co-Attention for Zero-Shot Video Object SegmentationPoster78 citations
  663. Mitigating Intensity Bias in Shadow Detection via Feature Decomposition and ReweightingPoster78 citations
  664. MixMo: Mixing Multiple Inputs for Multiple Outputs via Deep SubnetworksPoster78 citations
  665. Online Refinement of Low-Level Feature Based Activation Map for Weakly Supervised Object LocalizationPoster78 citations
  666. StructDepth: Leveraging the Structural Regularities for Self-Supervised Indoor Depth EstimationPoster78 citations
  667. Watch Only Once: An End-to-End Video Action Detection FrameworkPoster78 citations
  668. Contrast and Order Representations for Video Self-Supervised LearningPoster77 citations
  669. GAN Inversion for Out-of-Range Images With Geometric TransformationsPoster77 citations
  670. Generalized and Incremental Few-Shot Learning by Explicit Learning and Calibration Without ForgettingPoster77 citations
  671. LatentCLR: A Contrastive Learning Approach for Unsupervised Discovery of Interpretable DirectionsPoster77 citations
  672. M3D-VTON: A Monocular-to-3D Virtual Try-On NetworkPoster77 citations
  673. STVGBert: A Visual-Linguistic Transformer Based Framework for Spatio-Temporal Video GroundingPoster77 citations
  674. Towards Mixed-Precision Quantization of Neural Networks via Constrained OptimizationPoster77 citations
  675. Track Without Appearance: Learn Box and Tracklet Embedding With Local and Global Motion Patterns for Vehicle TrackingPoster77 citations
  676. ZFlow: Gated Appearance Flow-Based Virtual Try-On With 3D PriorsPoster77 citations
  677. Boundary-Sensitive Pre-Training for Temporal Localization in VideosPoster76 citations
  678. Class-Incremental Learning for Action Recognition in VideosPoster76 citations
  679. D2-Net: Weakly-Supervised Action Localization via Discriminative Embeddings and Denoised ActivationsPoster76 citations
  680. Domain-Aware Universal Style TransferPoster76 citations
  681. ECACL: A Holistic Framework for Semi-Supervised Domain AdaptationPoster76 citations
  682. Hierarchical Kinematic Probability Distributions for 3D Human Shape and Pose Estimation From Images in the WildPoster76 citations
  683. Trash To Treasure: Harvesting OOD Data With Cross-Modal Matching for Open-Set Semi-Supervised LearningPoster76 citations
  684. Variational Feature Disentangling for Fine-Grained Few-Shot ClassificationPoster76 citations
  685. 3DStyleNet: Creating 3D Shapes With Geometric and Texture Style VariationsPoster75 citations
  686. On the Limits of Pseudo Ground Truth in Visual Camera Re-LocalisationPoster75 citations
  687. Product1M: Towards Weakly Supervised Instance-Level Product Retrieval via Cross-Modal PretrainingPoster75 citations
  688. Scene Context-Aware Salient Object DetectionPoster75 citations
  689. Tune It the Right Way: Unsupervised Validation of Domain Adaptation via Soft Neighborhood DensityPoster75 citations
  690. VMNet: Voxel-Mesh Network for Geodesic-Aware 3D Semantic SegmentationPoster75 citations
  691. Webly Supervised Fine-Grained Recognition: Benchmark Datasets and an ApproachPoster75 citations
  692. Adversarial Example Detection Using Latent Neighborhood GraphPoster74 citations
  693. Attention Is Not Enough: Mitigating the Distribution Discrepancy in Asynchronous Multimodal Sequence FusionPoster74 citations
  694. Deep Reparametrization of Multi-Frame Super-Resolution and DenoisingPoster74 citations
  695. Dynamic Cross Feature Fusion for Remote Sensing PansharpeningPoster74 citations
  696. Foreground Activation Maps for Weakly Supervised Object LocalizationPoster74 citations
  697. HDR Video Reconstruction: A Coarse-To-Fine Network and a Real-World Benchmark DatasetPoster74 citations
  698. Handwriting TransformersPoster74 citations
  699. Bringing Events Into Video Deblurring With Non-Consecutively Blurry FramesPoster73 citations
  700. CrossNorm and SelfNorm for Generalization Under Distribution ShiftsPoster73 citations
  701. I2UV-HandNet: Image-to-UV Prediction Network for Accurate and High-Fidelity 3D Hand Mesh ModelingPoster73 citations
  702. On Compositions of Transformations in Contrastive Self-Supervised LearningPoster73 citations
  703. Patch Craft: Video Denoising by Deep Modeling and Patch MatchingPoster73 citations
  704. Relating Adversarially Robust Generalization to Flat MinimaPoster73 citations
  705. Adaptive Surface Normal Constraint for Depth EstimationPoster72 citations
  706. Beyond Trivial Counterfactual Explanations With Diverse Valuable ExplanationsPoster72 citations
  707. Dense Deep Unfolding Network With 3D-CNN Prior for Snapshot Compressive ImagingPoster72 citations
  708. Image Synthesis via Semantic CompositionPoster72 citations
  709. Minimal Adversarial Examples for Deep Learning on 3D Point CloudsPoster72 citations
  710. Orthogonal Jacobian Regularization for Unsupervised Disentanglement in Image GenerationPoster72 citations
  711. Summarize and Search: Learning Consensus-Aware Dynamic Convolution for Co-Saliency DetectionPoster72 citations
  712. Tripartite Information Mining and Integration for Image MattingPoster72 citations
  713. A General Recurrent Tracking Framework Without Real DataPoster71 citations
  714. Adversarial Attacks on Multi-Agent CommunicationPoster71 citations
  715. Curvature Generation in Curved Spaces for Few-Shot LearningPoster71 citations
  716. Dual Contrastive Loss and Attention for GANsPoster71 citations
  717. Generalizing Gaze Estimation With Outlier-Guided Collaborative AdaptationPoster71 citations
  718. Gradient Distribution Alignment Certificates Better Adversarial Domain AdaptationPoster71 citations
  719. PCAM: Product of Cross-Attention Matrices for Rigid Registration of Point CloudsPoster71 citations
  720. Pseudo-Loss Confidence Metric for Semi-Supervised Few-Shot LearningPoster71 citations
  721. Striking a Balance Between Stability and Plasticity for Class-Incremental LearningPoster71 citations
  722. Time-Equivariant Contrastive Video Representation LearningPoster71 citations
  723. Towards Discovery and Attribution of Open-World GAN Generated ImagesPoster71 citations
  724. Deep Symmetric Network for Underexposed Image Enhancement With Recurrent Attentional LearningPoster70 citations
  725. Digging Into Uncertainty in Self-Supervised Multi-View StereoPoster70 citations
  726. Energy-Based Open-World Uncertainty Modeling for Confidence CalibrationPoster70 citations
  727. Learning To Reduce Defocus Blur by Realistically Modeling Dual-Pixel DataPoster70 citations
  728. Motion Basis Learning for Unsupervised Deep Homography Estimation With Subspace ProjectionPoster70 citations
  729. Robust Watermarking for Deep Neural Networks via Bi-Level OptimizationPoster70 citations
  730. ADNet: Leveraging Error-Bias Towards Normal Direction in Face AlignmentPoster69 citations
  731. Full-Body Motion From a Single Head-Mounted Device: Generating SMPL Poses From Partial ObservationsPoster69 citations
  732. Heterogeneous Relational Complement for Vehicle Re-IdentificationPoster69 citations
  733. Knowledge Mining and Transferring for Domain Adaptive Object DetectionPoster69 citations
  734. Learning a Sketch Tensor Space for Image Inpainting of Man-Made ScenesPoster69 citations
  735. Mixed SIGNals: Sign Language Production via a Mixture of Motion PrimitivesPoster69 citations
  736. Occluded Person Re-Identification With Single-Scale Global RepresentationsPoster69 citations
  737. PX-NET: Simple and Efficient Pixel-Wise Training of Photometric Stereo NetworksPoster69 citations
  738. Parsing Table Structures in the WildPoster69 citations
  739. Refining Action Segmentation With Hierarchical Video RepresentationsPoster69 citations
  740. TGRNet: A Table Graph Reconstruction Network for Table Structure RecognitionPoster69 citations
  741. A New Journey From SDRTV to HDRTVPoster68 citations
  742. Dual Bipartite Graph Learning: A General Approach for Domain Adaptive Object DetectionPoster68 citations
  743. Learning Privacy-Preserving Optics for Human Pose EstimationPoster68 citations
  744. VENet: Voting Enhancement Network for 3D Object DetectionPoster68 citations
  745. Wanderlust: Online Continual Object Detection in the Real WorldPoster68 citations
  746. AdaSGN: Adapting Joint Number and Model Size for Efficient Skeleton-Based Action RecognitionPoster67 citations
  747. Deep Transport Network for Unsupervised Video Object SegmentationPoster67 citations
  748. Dense Interaction Learning for Video-Based Person Re-IdentificationPoster67 citations
  749. Stochastic Partial Swap: Enhanced Model Generalization and Interpretability for Fine-Grained RecognitionPoster67 citations
  750. Conditional Variational Capsule Network for Open Set RecognitionPoster66 citations
  751. Fooling LiDAR Perception via Adversarial Trajectory PerturbationPoster66 citations
  752. GarmentNets: Category-Level Pose Estimation for Garments via Canonical Space Shape CompletionPoster66 citations
  753. Graph-Based 3D Multi-Person Pose Estimation Using Multi-View ImagesPoster66 citations
  754. ISD: Self-Supervised Learning by Iterative Similarity DistillationPoster66 citations
  755. MLVSNet: Multi-Level Voting Siamese Network for 3D Visual TrackingPoster66 citations
  756. Sparse-to-Dense Feature Matching: Intra and Inter Domain Cross-Modal Learning in Domain Adaptation for 3D Semantic SegmentationPoster66 citations
  757. Vi2CLR: Video and Image for Visual Contrastive Learning of RepresentationPoster66 citations
  758. WarpedGANSpace: Finding Non-Linear RBF Paths in GAN Latent SpacePoster66 citations
  759. AdaMML: Adaptive Multi-Modal Learning for Efficient Video RecognitionPoster65 citations
  760. Dance With Self-Attention: A New Look of Conditional Random Fields on Anomaly Detection in VideosPoster65 citations
  761. Describing and Localizing Multiple Changes With TransformersPoster65 citations
  762. EigenGAN: Layer-Wise Eigen-Learning for GANsPoster65 citations
  763. GDP: Stabilized Neural Network Pruning via Gates With Differentiable PolarizationPoster65 citations
  764. Learning To Regress Bodies From Images Using Differentiable Semantic RenderingPoster65 citations
  765. Learning To Track Objects From Unlabeled VideosPoster65 citations
  766. MEDIRL: Predicting the Visual Attention of Drivers via Maximum Entropy Deep Inverse Reinforcement LearningPoster65 citations
  767. MultiSiam: Self-Supervised Multi-Instance Siamese Representation Learning for Autonomous DrivingPoster65 citations
  768. RINDNet: Edge Detection for Discontinuity in Reflectance, Illumination, Normal and DepthPoster65 citations
  769. RandomRooms: Unsupervised Pre-Training From Synthetic Shapes and Randomized Layouts for 3D Object DetectionPoster65 citations
  770. TransForensics: Image Forgery Localization With Dense Self-AttentionPoster65 citations
  771. Unsupervised Layered Image Decomposition Into Object PrototypesPoster65 citations
  772. DeePSD: Automatic Deep Skinning and Pose Space Deformation for 3D Garment AnimationPoster64 citations
  773. GistNet: A Geometric Structure Transfer Network for Long-Tailed RecognitionPoster64 citations
  774. Lightweight Multi-Person Total Motion Capture Using Sparse Multi-View CamerasPoster64 citations
  775. MAAS: Multi-Modal Assignation for Active Speaker DetectionPoster64 citations
  776. Motion Prediction Using Trajectory CuesPoster64 citations
  777. PointBA: Towards Backdoor Attacks in 3D Point CloudPoster64 citations
  778. SIGN: Spatial-Information Incorporated Generative Network for Generalized Zero-Shot Semantic SegmentationPoster64 citations
  779. TRiPOD: Human Trajectory and Pose Dynamics Forecasting in the WildPoster64 citations
  780. Task Switching Network for Multi-Task LearningPoster64 citations
  781. The Benefit of Distraction: Denoising Camera-Based Physiological Measurements Using Inverse AttentionPoster64 citations
  782. When Do GANs Replicate? On the Choice of Dataset SizePoster64 citations
  783. Achieving On-Mobile Real-Time Super-Resolution With Neural Architecture and Pruning SearchPoster63 citations
  784. Attentional Pyramid Pooling of Salient Visual Residuals for Place RecognitionPoster63 citations
  785. Contrasting Contrastive Self-Supervised Representation Learning PipelinesPoster63 citations
  786. Deep Blind Video Super-ResolutionPoster63 citations
  787. Diagonal Attention and Style-Based GAN for Content-Style Disentanglement in Image Generation and TranslationPoster63 citations
  788. Dynamic Surface Function Networks for Clothed Human BodiesPoster63 citations
  789. Efficient Video Compression via Content-Adaptive Super-ResolutionPoster63 citations
  790. GP-S3Net: Graph-Based Panoptic Sparse Semantic Segmentation NetworkPoster63 citations
  791. Hand Image Understanding via Deep Multi-Task LearningPoster63 citations
  792. Multiview Pseudo-Labeling for Semi-Supervised Learning From VideoPoster63 citations
  793. Personalized Trajectory Prediction via Distribution DiscriminationPoster63 citations
  794. Rethinking Deep Image Prior for DenoisingPoster63 citations
  795. Towards a Universal Model for Cross-Dataset Crowd CountingPoster63 citations
  796. VIL-100: A New Dataset and a Baseline Model for Video Instance Lane DetectionPoster63 citations
  797. VolumeFusion: Deep Depth Fusion for 3D Scene ReconstructionPoster63 citations
  798. A Closer Look at Rotation-Invariant Deep Point Cloud AnalysisPoster62 citations
  799. Building-GAN: Graph-Conditioned Architectural Volumetric Design GenerationPoster62 citations
  800. Cross-Category Video Highlight Detection via Set-Based LearningPoster62 citations
  801. EventHands: Real-Time Neural 3D Hand Pose Estimation From an Event StreamPoster62 citations
  802. HAIR: Hierarchical Visual-Semantic Relational Reasoning for Video Question AnsweringPoster62 citations
  803. How To Design a Three-Stage Architecture for Audio-Visual Active Speaker Detection in the WildPoster62 citations
  804. Learning Conditional Knowledge Distillation for Degraded-Reference Image Quality AssessmentPoster62 citations
  805. P2-Net: Joint Description and Detection of Local Features for Pixel and Point MatchingPoster62 citations
  806. Rank & Sort Loss for Object Detection and Instance SegmentationPoster62 citations
  807. Real-World Video Super-Resolution: A Benchmark Dataset and a Decomposition Based Learning SchemePoster62 citations
  808. Toward Human-Like Grasp: Dexterous Grasping via Semantic Representation of Object-HandPoster62 citations
  809. Zero-Shot Natural Language Video LocalizationPoster62 citations
  810. CanvasVAE: Learning To Generate Vector Graphic DocumentsPoster61 citations
  811. Image2Reverb: Cross-Modal Reverb Impulse Response SynthesisPoster61 citations
  812. Self-Supervised Vessel Segmentation via Adversarial LearningPoster61 citations
  813. SimROD: A Simple Adaptation Method for Robust Object DetectionPoster61 citations
  814. Stochastic Transformer Networks With Linear Competing Units: Application To End-to-End SL TranslationPoster61 citations
  815. Temporal Cue Guided Video Highlight Detection With Low-Rank Audio-Visual FusionPoster61 citations
  816. Towards Interpretable Deep Metric Learning With Structural MatchingPoster61 citations
  817. Unsupervised Real-World Super-Resolution: A Domain Adaptation PerspectivePoster61 citations
  818. Boosting Weakly Supervised Object Detection via Learning Bounding Box AdjustersPoster60 citations
  819. CDNet: Centripetal Direction Network for Nuclear Instance SegmentationPoster60 citations
  820. Continual Learning on Noisy Data Streams via Self-Purified ReplayPoster60 citations
  821. Cross-Camera Convolutional Color ConstancyPoster60 citations
  822. HAA500: Human-Centric Atomic Action Dataset With Curated VideosPoster60 citations
  823. Learning To Adversarially Blur Visual Object TrackingPoster60 citations
  824. Manifold Alignment for Semantically Aligned Style TransferPoster60 citations
  825. Meta Navigator: Search for a Good Adaptation Policy for Few-Shot LearningPoster60 citations
  826. Multi-Anchor Active Domain Adaptation for Semantic SegmentationPoster60 citations
  827. RobustNav: Towards Benchmarking Robustness in Embodied NavigationPoster60 citations
  828. Self-Supervised Geometric Features Discovery via Interpretable Attention for Vehicle Re-Identification and BeyondPoster60 citations
  829. Adversarial Attacks Are Reversible With Natural SupervisionPoster59 citations
  830. DRIVE: Deep Reinforced Accident Anticipation With Visual ExplanationPoster59 citations
  831. Deep Relational Metric LearningPoster59 citations
  832. Discriminative Region-Based Multi-Label Zero-Shot LearningPoster59 citations
  833. Extending Neural P-Frame Codecs for B-Frame CodingPoster59 citations
  834. From Contexts to Locality: Ultra-High Resolution Image Segmentation via Locality-Aware Contextual CorrelationPoster59 citations
  835. The Center of Attention: Center-Keypoint Grouping via Attention for Multi-Person Pose EstimationPoster59 citations
  836. Unpaired Learning for Deep Image Deraining With Rain Direction RegularizerPoster59 citations
  837. Collaborative and Adversarial Learning of Focused and Dispersive Representations for Semi-Supervised Polyp SegmentationPoster58 citations
  838. DecentLaM: Decentralized Momentum SGD for Large-Batch Deep TrainingPoster58 citations
  839. EventHPE: Event-Based 3D Human Pose and Shape EstimationPoster58 citations
  840. Hybrid Neural Fusion for Full-Frame Video StabilizationPoster58 citations
  841. Improving Neural Network Efficiency via Post-Training Quantization With Adaptive Floating-PointPoster58 citations
  842. Learning Attribute-Driven Disentangled Representations for Interactive Fashion RetrievalPoster58 citations
  843. Low Curvature Activations Reduce Overfitting in Adversarial TrainingPoster58 citations
  844. SCOUTER: Slot Attention-Based Classifier for Explainable Image RecognitionPoster58 citations
  845. STEM: An Approach to Multi-Source Domain Adaptation With GuaranteesPoster58 citations
  846. Shape Self-Correction for Unsupervised Point Cloud UnderstandingPoster58 citations
  847. The Devil Is in the Task: Exploiting Reciprocal Appearance-Localization Features for Monocular 3D Object DetectionPoster58 citations
  848. Triggering Failures: Out-of-Distribution Detection by Learning From Local Adversarial Attacks in Semantic SegmentationPoster58 citations
  849. Video Pose Distillation for Few-Shot, Fine-Grained Sports Action RecognitionPoster58 citations
  850. Audio-Visual Floorplan ReconstructionPoster57 citations
  851. CDS: Cross-Domain Self-Supervised Pre-TrainingPoster57 citations
  852. Crowd Counting With Partial Annotations in an ImagePoster57 citations
  853. Domain Adaptive Video Segmentation via Temporal Consistency RegularizationPoster57 citations
  854. Explainable Person Re-Identification With Attribute-Guided Metric DistillationPoster57 citations
  855. ORBIT: A Real-World Few-Shot Dataset for Teachable Object RecognitionPoster57 citations
  856. On Exposing the Challenging Long Tail in Future Prediction of Traffic ActorsPoster57 citations
  857. Shape-Aware Multi-Person Pose Estimation From Multi-View ImagesPoster57 citations
  858. T-SVDNet: Exploring High-Order Prototypical Correlations for Multi-Source Domain AdaptationPoster57 citations
  859. Transductive Few-Shot Classification on the Oblique ManifoldPoster57 citations
  860. Variational Attention: Propagating Domain-Specific Knowledge for Multi-Domain Learning in Crowd CountingPoster57 citations
  861. ASCNet: Self-Supervised Video Representation Learning With Appearance-Speed ConsistencyPoster56 citations
  862. AdaFit: Rethinking Learning-Based Normal Estimation on Point CloudsPoster56 citations
  863. Clustering by Maximizing Mutual Information Across ViewsPoster56 citations
  864. Discover the Unknown Biased Attribute of an Image ClassifierPoster56 citations
  865. Dynamic Network Quantization for Efficient Video InferencePoster56 citations
  866. Else-Net: Elastic Semantic Network for Continual Action Recognition From Skeleton DataPoster56 citations
  867. End-to-End Detection and Pose Estimation of Two Interacting HandsPoster56 citations
  868. HPNet: Deep Primitive Segmentation Using Hybrid RepresentationsPoster56 citations
  869. HandFoldingNet: A 3D Hand Pose Estimation Network Using Multiscale-Feature Guided Folding of a 2D Hand SkeletonPoster56 citations
  870. Learning Generative Models of Textured 3D Meshes From Real-World ImagesPoster56 citations
  871. Learning Self-Similarity in Space and Time As Generalized Motion for Video Action RecognitionPoster56 citations
  872. NAS-OoD: Neural Architecture Search for Out-of-Distribution GeneralizationPoster56 citations
  873. NeuSpike-Net: High Speed Video Reconstruction via Bio-Inspired Neuromorphic CamerasPoster56 citations
  874. Online Multi-Granularity Distillation for GAN CompressionPoster56 citations
  875. Stacked Homography Transformations for Multi-View Pedestrian DetectionPoster56 citations
  876. Towards High Fidelity Monocular Face Reconstruction With Rich Reflectance Using Self-Supervised Learning and Ray TracingPoster56 citations
  877. ACAV100M: Automatic Curation of Large-Scale Datasets for Audio-Visual Video Representation LearningPoster55 citations
  878. Distilling Optimal Neural Networks: Rapid Search in Diverse SpacesPoster55 citations
  879. Evolving Search Space for Neural Architecture SearchPoster55 citations
  880. LabOR: Labeling Only if Required for Domain Adaptive Semantic SegmentationPoster55 citations
  881. Learning Anchored Unsigned Distance Functions With Gradient Direction Alignment for Single-View Garment ReconstructionPoster55 citations
  882. Learning With Noisy Labels for Robust Point Cloud SegmentationPoster55 citations
  883. Move2Hear: Active Audio-Visual Source SeparationPoster55 citations
  884. Procedure Planning in Instructional Videos via Contextual Modeling and Model-Based Policy LearningPoster55 citations
  885. Unified Graph Structured Models for Video UnderstandingPoster55 citations
  886. Divide and Conquer for Single-Frame Temporal Action LocalizationPoster54 citations
  887. Dual-Camera Super-Resolution With Aligned Attention ModulesPoster54 citations
  888. EvIntSR-Net: Event Guided Multiple Latent Frames Reconstruction and Super-ResolutionPoster54 citations
  889. Explain Me the Painting: Multi-Topic Knowledgeable Art Description GenerationPoster54 citations
  890. Joint Topology-Preserving and Feature-Refinement Network for Curvilinear Structure SegmentationPoster54 citations
  891. LocalTrans: A Multiscale Local Transformer Network for Cross-Resolution Homography EstimationPoster54 citations
  892. A Style and Semantic Memory Mechanism for Domain GeneralizationPoster53 citations
  893. AINet: Association Implantation for Superpixel SegmentationPoster53 citations
  894. Augmented Lagrangian Adversarial AttacksPoster53 citations
  895. Batch Normalization Increases Adversarial Vulnerability and Decreases Adversarial Transferability: A Non-Robust Feature PerspectivePoster53 citations
  896. Deep Implicit Surface Point Prediction NetworksPoster53 citations
  897. Generative Adversarial Registration for Improved Conditional Deformable TemplatesPoster53 citations
  898. In Defense of Scene Graphs for Image CaptioningPoster53 citations
  899. Learning Hierarchical Graph Neural Networks for Image ClusteringPoster53 citations
  900. PARTS: Unsupervised Segmentation With Slots, Attention and Independence MaximizationPoster53 citations
  901. SIGNET: Efficient Neural Representation for Light FieldsPoster53 citations
  902. Support-Set Based Cross-Supervision for Video GroundingPoster53 citations
  903. The Surprising Effectiveness of Visual Odometry Techniques for Embodied PointGoal NavigationPoster53 citations
  904. VideoLT: Large-Scale Long-Tailed Video RecognitionPoster53 citations
  905. AdvRush: Searching for Adversarially Robust Neural ArchitecturesPoster52 citations
  906. Contextually Plausible and Diverse 3D Human Motion PredictionPoster52 citations
  907. Learning RAW-to-sRGB Mappings With Inaccurately Aligned SupervisionPoster52 citations
  908. Meta-Aggregator: Learning To Aggregate for 1-Bit Graph Neural NetworksPoster52 citations
  909. Multi-Modality Associative Bridging Through Memory: Speech Sound Recollected From Face VideoPoster52 citations
  910. Multi-Source Domain Adaptation for Object DetectionPoster52 citations
  911. Multiresolution Deep Implicit Functions for 3D Shape RepresentationPoster52 citations
  912. Robust Small-Scale Pedestrian Detection With Cued Recall via Memory LearningPoster52 citations
  913. SLAMP: Stochastic Latent Appearance and Motion PredictionPoster52 citations
  914. Self-Supervised Video Representation Learning With Meta-Contrastive NetworkPoster52 citations
  915. Cloud Transformers: A Universal Approach to Point Cloud Processing TasksPoster51 citations
  916. Fast Light-Field Disparity Estimation With Multi-Disparity-Scale Cost AggregationPoster51 citations
  917. Kernel Methods in Hyperbolic SpacesPoster51 citations
  918. MGNet: Monocular Geometric Scene Understanding for Autonomous DrivingPoster51 citations
  919. Meta Pairwise Relationship Distillation for Unsupervised Person Re-IdentificationPoster51 citations
  920. PlaneTR: Structure-Guided Transformers for 3D Plane RecoveryPoster51 citations
  921. SLIDE: Single Image 3D Photography With Soft Layering and Depth-Aware InpaintingPoster51 citations
  922. StarEnhancer: Learning Real-Time and Style-Aware Image EnhancementPoster51 citations
  923. Visual Distant Supervision for Scene Graph GenerationPoster51 citations
  924. Warp Consistency for Unsupervised Learning of Dense CorrespondencesPoster51 citations
  925. Act the Part: Learning Interaction Strategies for Articulated Object Part DiscoveryPoster50 citations
  926. Auto Graph Encoder-Decoder for Neural Network PruningPoster50 citations
  927. CSG-Stump: A Learning Friendly CSG-Like Representation for Interpretable Shape ParsingPoster50 citations
  928. Concept Generalization in Visual Representation LearningPoster50 citations
  929. DRINet: A Dual-Representation Iterative Learning Network for Point Cloud SegmentationPoster50 citations
  930. Detection and Continual Learning of Novel Face Presentation AttacksPoster50 citations
  931. Direct Differentiable Augmentation SearchPoster50 citations
  932. FloorPlanCAD: A Large-Scale CAD Drawing Dataset for Panoptic Symbol SpottingPoster50 citations
  933. Hyperspectral Image Denoising With Realistic DataPoster50 citations
  934. Internal Video Inpainting by Implicit Long-Range PropagationPoster50 citations
  935. Learning Bias-Invariant Representation by Cross-Sample Mutual Information MinimizationPoster50 citations
  936. Localized Simple Multiple Kernel K-MeansPoster50 citations
  937. MosaicOS: A Simple and Effective Use of Object-Centric Images for Long-Tailed Object DetectionPoster50 citations
  938. Multi-Scale Matching Networks for Semantic CorrespondencePoster50 citations
  939. PASS: Protected Attribute Suppression System for Mitigating Bias in Face RecognitionPoster50 citations
  940. von Mises-Fisher Loss: An Exploration of Embedding Geometries for Supervised LearningPoster50 citations
  941. BuildingNet: Learning To Label 3D BuildingsPoster49 citations
  942. CTRL-C: Camera Calibration TRansformer With Line-ClassificationPoster49 citations
  943. Can Scale-Consistent Monocular Depth Be Learned in a Self-Supervised Scale-Invariant Manner?Poster49 citations
  944. Differentiable Surface Rendering via Non-Differentiable SamplingPoster49 citations
  945. Diverse Image Style Transfer via Invertible Cross-Space MappingPoster49 citations
  946. Dynamic Divide-and-Conquer Adversarial Training for Robust Semantic SegmentationPoster49 citations
  947. Learned Spatial Representations for Few-Shot Talking-Head SynthesisPoster49 citations
  948. Learning an Augmented RGB Representation With Cross-Modal Knowledge Distillation for Action DetectionPoster49 citations
  949. RAIN: Reinforced Hybrid Attention Inference Network for Motion ForecastingPoster49 citations
  950. SUNet: Symmetric Undistortion Network for Rolling Shutter CorrectionPoster49 citations
  951. Scribble-Supervised Semantic Segmentation InferencePoster49 citations
  952. Self-Supervised Visual Representations Learning by Contrastive Mask PredictionPoster49 citations
  953. StereOBJ-1M: Large-Scale Stereo Image Dataset for 6D Object Pose EstimationPoster49 citations
  954. Towards Alleviating the Modeling Ambiguity of Unsupervised Monocular 3D Human Pose EstimationPoster49 citations
  955. Uniformity in Heterogeneity: Diving Deep Into Count Interval Partition for Crowd CountingPoster49 citations
  956. 3D Human Texture Estimation From a Single Image With TransformersPoster48 citations
  957. Adaptive Curriculum LearningPoster48 citations
  958. COMISR: Compression-Informed Video Super-ResolutionPoster48 citations
  959. Geometric Unsupervised Domain Adaptation for Semantic SegmentationPoster48 citations
  960. Improving Robustness Against Common Corruptions With Frequency Biased ModelsPoster48 citations
  961. Learning Compatible EmbeddingsPoster48 citations
  962. Light Field Saliency Detection With Dual Local Graph Learning and Reciprocative GuidancePoster48 citations
  963. PR-GCN: A Deep Graph Convolutional Network With Point Refinement for 6D Pose EstimationPoster48 citations
  964. PU-EVA: An Edge-Vector Based Approximation Solution for Flexible-Scale Point Cloud UpsamplingPoster48 citations
  965. Pyramid Architecture Search for Real-Time Image DeblurringPoster48 citations
  966. RFNet: Recurrent Forward Network for Dense Point Cloud CompletionPoster48 citations
  967. Scribble-Supervised Semantic Segmentation by Uncertainty Reduction on Neural Representation and Self-Supervision on Neural EigenspacePoster48 citations
  968. Visual Relationship Detection Using Part-and-Sum Transformers With Composite QueriesPoster48 citations
  969. Hypergraph Neural Networks for Hypergraph MatchingPoster47 citations
  970. Impact of Aliasing on Generalization in Deep Convolutional NetworksPoster47 citations
  971. Improving Low-Precision Network Quantization via Bin RegularizationPoster47 citations
  972. Motion-Focused Contrastive Learning of Video RepresentationsPoster47 citations
  973. Neural Video Portrait Relighting in Real-Time via Consistency ModelingPoster47 citations
  974. On the Importance of Distractors for Few-Shot ClassificationPoster47 citations
  975. Once Quantization-Aware Training: High Performance Extremely Low-Bit Architecture SearchPoster47 citations
  976. Towards Novel Target Discovery Through Open-Set Domain AdaptationPoster47 citations
  977. Unsupervised Learning of Fine Structure Generation for 3D Point Clouds by 2D Projections MatchingPoster47 citations
  978. Unsupervised Non-Rigid Image Distortion Removal via Grid DeformationPoster47 citations
  979. Adversarial Robustness for Unsupervised Domain AdaptationPoster46 citations
  980. An Asynchronous Kalman Filter for Hybrid Event CamerasPoster46 citations
  981. Continual Neural Mapping: Learning an Implicit Scene Representation From Sequential ObservationsPoster46 citations
  982. DCT-SNN: Using DCT To Distribute Spatial Information Over Time for Low-Latency Spiking Neural NetworksPoster46 citations
  983. Distance-Aware QuantizationPoster46 citations
  984. From Continuity to Editability: Inverting GANs With Consecutive ImagesPoster46 citations
  985. Global Pooling, More Than Meets the Eye: Position Information Is Encoded Channel-Wise in CNNsPoster46 citations
  986. Light Source Guided Single-Image Flare Removal From Unpaired DataPoster46 citations
  987. SGMNet: Learning Rotation-Invariant Point Cloud Representations via Sorted Gram MatrixPoster46 citations
  988. Self-Regulation for Semantic SegmentationPoster46 citations
  989. Self-Supervised Representation Learning From Flow EquivariancePoster46 citations
  990. Semantic Diversity Learning for Zero-Shot Multi-Label ClassificationPoster46 citations
  991. Semi-Supervised Active Learning for Semi-Supervised Models: Exploit Adversarial Examples With Graph-Based Virtual LabelsPoster46 citations
  992. The Right To Talk: An Audio-Visual Transformer ApproachPoster46 citations
  993. YouRefIt: Embodied Reference Understanding With Language and GesturePoster46 citations
  994. BN-NAS: Neural Architecture Search With Batch NormalizationPoster45 citations
  995. COOKIE: Contrastive Cross-Modal Knowledge Sharing Pre-Training for Vision-Language RepresentationPoster45 citations
  996. Defocus Map Estimation and Deblurring From a Single Dual-Pixel ImagePoster45 citations
  997. Detecting Human-Object Relationships in VideosPoster45 citations
  998. Detecting Invisible PeoplePoster45 citations
  999. Exploring Robustness of Unsupervised Domain Adaptation in Semantic SegmentationPoster45 citations
  1000. Few-Shot Image Classification: Just Use a Library of Pre-Trained Feature Extractors and a Simple ClassifierPoster45 citations

Looking for submission deadlines instead? See the conference deadline calendar.