CVPR 2021 Accepted Papers
The full list of 1,659 papers accepted at CVPR 2021 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 1,659
- Coordinate Attention for Efficient Mobile Network DesignPoster5,358 citations
- Exploring Simple Siamese Representation LearningPoster5,117 citations
- Rethinking Semantic Segmentation From a Sequence-to-Sequence Perspective With TransformersPoster4,009 citations
- Taming Transformers for High-Resolution Image SynthesisPoster3,220 citations
- RepVGG: Making VGG-Style ConvNets Great AgainPoster2,490 citations
- Pre-Trained Image Processing TransformerPoster2,279 citations
- Center-Based 3D Object Detection and TrackingPoster2,110 citations
- Multi-Stage Progressive Image RestorationPoster2,028 citations
- Scaled-YOLOv4: Scaling Cross Stage Partial NetworkPoster1,960 citations
- pixelNeRF: Neural Radiance Fields From One or Few ImagesPoster1,894 citations
- Natural Adversarial ExamplesPoster1,777 citations
- NeRF in the Wild: Neural Radiance Fields for Unconstrained Photo CollectionsPoster1,742 citations
- D-NeRF: Neural Radiance Fields for Dynamic ScenesPoster1,585 citations
- LoFTR: Detector-Free Local Feature Matching With TransformersPoster1,526 citations
- Sparse R-CNN: End-to-End Object Detection With Learnable ProposalsPoster1,491 citations
- Model-Contrastive Federated LearningPoster1,470 citations
- Bottleneck Transformers for Visual RecognitionPoster1,453 citations
- Transformer TrackingPoster1,430 citations
- Encoding in Style: A StyleGAN Encoder for Image-to-Image TranslationPoster1,395 citations
- Simple Copy-Paste Is a Strong Data Augmentation Method for Instance SegmentationPoster1,267 citations
- Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual ConceptsPoster1,186 citations
- Semi-Supervised Semantic Segmentation With Cross Pseudo SupervisionPoster1,158 citations
- VinVL: Revisiting Visual Representations in Vision-Language ModelsPoster1,156 citations
- DetectoRS: Detecting Objects With Recursive Feature Pyramid and Switchable Atrous ConvolutionPoster1,121 citations
- AdaBins: Depth Estimation Using Adaptive BinsPoster1,113 citations
- CutPaste: Self-Supervised Learning for Anomaly Detection and LocalizationPoster1,095 citations
- VarifocalNet: An IoU-Aware Dense Object DetectorPoster1,075 citations
- GIRAFFE: Representing Scenes As Compositional Generative Neural Feature FieldsPoster1,063 citations
- Pi-GAN: Periodic Implicit Generative Adversarial Networks for 3D-Aware Image SynthesisPoster1,038 citations
- Transformer Interpretability Beyond Attention VisualizationPoster957 citations
- IBRNet: Learning Multi-View Image-Based RenderingPoster956 citations
- Meta Pseudo LabelsPoster928 citations
- Understanding the Behaviour of Contrastive LossPoster892 citations
- Multi-Attentional Deepfake DetectionPoster885 citations
- Retinex-Inspired Unrolling With Cooperative Prior Architecture Search for Low-Light Image EnhancementPoster884 citations
- Contrastive Learning for Compact Single Image DehazingPoster876 citations
- Dynamic Head: Unifying Object Detection Heads With AttentionsPoster870 citations
- Transformer Meets Tracker: Exploiting Temporal Context for Robust Visual TrackingPoster865 citations
- Neural Body: Implicit Neural Representations With Structured Latent Codes for Novel View Synthesis of Dynamic HumansPoster862 citations
- Neural Scene Flow Fields for Space-Time View Synthesis of Dynamic ScenesPoster862 citations
- Dense Contrastive Learning for Self-Supervised Visual Pre-TrainingPoster856 citations
- End-to-End Video Instance Segmentation With TransformersPoster854 citations
- DER: Dynamically Expandable Representation for Class Incremental LearningPoster834 citations
- Diffusion Probabilistic Models for 3D Point Cloud GenerationPoster828 citations
- Learning Continuous Image Representation With Local Implicit Image FunctionPoster828 citations
- You Only Look One-Level FeaturePoster820 citations
- Rethinking BiSeNet for Real-Time Semantic SegmentationPoster814 citations
- End-to-End Human Pose and Mesh Reconstruction with TransformersPoster812 citations
- Dual-Stream Multiple Instance Learning Network for Whole Slide Image Classification With Self-Supervised Contrastive LearningPoster811 citations
- Less Is More: ClipBERT for Video-and-Language Learning via Sparse SamplingPoster771 citations
- ReDet: A Rotation-Equivariant Detector for Aerial Object DetectionPoster751 citations
- MagFace: A Universal Representation for Face Recognition and Quality AssessmentPoster690 citations
- Closed-Form Factorization of Latent Semantics in GANsPoster688 citations
- Cylindrical and Asymmetrical 3D Convolution Networks for LiDAR SegmentationPoster675 citations
- NeRV: Neural Reflectance and Visibility Fields for Relighting and View SynthesisPoster653 citations
- MaX-DeepLab: End-to-End Panoptic Segmentation With Mask TransformersPoster651 citations
- Multi-Modal Fusion Transformer for End-to-End Autonomous DrivingPoster649 citations
- Predator: Registration of 3D Point Clouds With Low OverlapPoster646 citations
- UP-DETR: Unsupervised Pre-Training for Object Detection With TransformersPoster643 citations
- Dynamic Neural Radiance Fields for Monocular 4D Facial Avatar ReconstructionPoster638 citations
- Prototypical Pseudo Label Denoising and Target Structure Learning for Domain Adaptive Semantic SegmentationPoster631 citations
- Towards Open World Object DetectionPoster630 citations
- Categorical Depth Distribution Network for Monocular 3D Object DetectionPoster621 citations
- Image Super-Resolution With Non-Local Sparse AttentionPoster614 citations
- Spatiotemporal Contrastive Video Representation LearningPoster614 citations
- BasicVSR: The Search for Essential Components in Video Super-Resolution and BeyondPoster598 citations
- Multiresolution Knowledge Distillation for Anomaly DetectionPoster589 citations
- See Through Gradients: Image Batch Recovery via GradInversionPoster588 citations
- Towards Real-World Blind Face Restoration With Generative Facial PriorPoster588 citations
- FedDG: Federated Domain Generalization on Medical Image Segmentation via Episodic Learning in Continuous Frequency SpacePoster586 citations
- Distilling Knowledge via Knowledge ReviewPoster580 citations
- OTA: Optimal Transport Assignment for Object DetectionPoster579 citations
- A Fourier-Based Framework for Domain GeneralizationPoster563 citations
- PAConv: Position Adaptive Convolution With Dynamic Kernel Assembling on Point CloudsPoster555 citations
- TDN: Temporal Difference Networks for Efficient Action RecognitionPoster545 citations
- Neural Geometric Level of Detail: Real-Time Rendering With Implicit 3D ShapesPoster543 citations
- StyleSpace Analysis: Disentangled Controls for StyleGAN Image GenerationPoster537 citations
- FSCE: Few-Shot Object Detection via Contrastive Proposal EncodingPoster531 citations
- Scaling Local Self-Attention for Parameter Efficient Visual BackbonesPoster528 citations
- Spatial-Phase Shallow Learning: Rethinking Face Forgery Detection in Frequency DomainPoster517 citations
- Lips Don't Lie: A Generalisable and Robust Approach To Face Forgery DetectionPoster515 citations
- Enhancing the Transferability of Adversarial Attacks Through Variance TuningPoster511 citations
- Graph Attention TrackingPoster511 citations
- VirTex: Learning Visual Representations From Textual AnnotationsPoster505 citations
- One-Shot Free-View Neural Talking-Head Synthesis for Video ConferencingPoster504 citations
- Lite-HRNet: A Lightweight High-Resolution NetworkPoster503 citations
- Propagate Yourself: Exploring Pixel-Level Consistency for Unsupervised Visual Representation LearningPoster498 citations
- Camouflaged Object Segmentation With Distraction MiningPoster495 citations
- Quasi-Dense Similarity Learning for Multiple Object TrackingPoster492 citations
- Counterfactual VQA: A Cause-Effect Look at Language BiasPoster491 citations
- 3D Object Detection With PointformerPoster488 citations
- Prototype Augmentation and Self-Supervision for Incremental LearningPoster486 citations
- Space-Time Neural Irradiance Fields for Free-Viewpoint VideoPoster485 citations
- Open-Vocabulary Object Detection Using CaptionsPoster484 citations
- Keep Your Eyes on the Lane: Real-Time Attention-Guided Lane DetectionPoster482 citations
- Multimodal Motion Prediction With Stacked TransformersPoster481 citations
- Generalizing Face Forgery Detection With High-Frequency FeaturesPoster478 citations
- Adaptive Prototype Learning and Allocation for Few-Shot SegmentationPoster473 citations
- Simultaneously Localize, Segment and Rank the Camouflaged ObjectsPoster472 citations
- TediGAN: Text-Guided Diverse Face Image Generation and ManipulationPoster472 citations
- HybrIK: A Hybrid Analytical-Neural Inverse Kinematics Solution for 3D Human Pose and Shape EstimationPoster469 citations
- Involution: Inverting the Inherence of Convolution for Visual RecognitionPoster468 citations
- Reducing Domain Gap by Reducing Style BiasPoster464 citations
- NExT-QA: Next Phase of Question-Answering to Explaining Temporal ActionsPoster463 citations
- Patch-NetVLAD: Multi-Scale Fusion of Locally-Global Descriptors for Place RecognitionPoster463 citations
- PointAugmenting: Cross-Modal Augmentation for 3D Object DetectionPoster463 citations
- GDR-Net: Geometry-Guided Direct Regression Network for Monocular 6D Object Pose EstimationPoster462 citations
- Read Like Humans: Autonomous, Bidirectional and Iterative Language Modeling for Scene Text RecognitionPoster461 citations
- Diverse Branch Block: Building a Convolution as an Inception-Like UnitPoster460 citations
- SE-SSD: Self-Ensembling Single-Stage Object Detector From Point CloudPoster460 citations
- Track To Detect and Segment: An Online Multi-Object TrackerPoster452 citations
- Neighbor2Neighbor: Self-Supervised Denoising From Single Noisy ImagesPoster451 citations
- Rainbow Memory: Continual Learning With a Memory of Diverse SamplesPoster451 citations
- Cross-Modal Contrastive Learning for Text-to-Image GenerationPoster434 citations
- Diverse Part Discovery: Occluded Person Re-Identification With Part-Aware TransformerPoster433 citations
- Pose-Controllable Talking Face Generation by Implicitly Modularized Audio-Visual RepresentationPoster433 citations
- Unsupervised Degradation Representation Learning for Blind Super-ResolutionPoster429 citations
- COMPLETER: Incomplete Multi-View Clustering via Contrastive PredictionPoster424 citations
- Boundary IoU: Improving Object-Centric Image Segmentation EvaluationPoster405 citations
- Bottom-Up Human Pose Estimation via Disentangled Keypoint RegressionPoster401 citations
- Improving Calibration for Long-Tailed RecognitionPoster398 citations
- Few-Shot Incremental Learning With Continually Evolved ClassifiersPoster395 citations
- DatasetGAN: Efficient Labeled Data Factory With Minimal Human EffortPoster393 citations
- Exploring and Distilling Posterior and Prior Knowledge for Radiology Report GenerationPoster393 citations
- PatchmatchNet: Learned Multi-View Patchmatch StereoPoster391 citations
- General Multi-Label Image Classification With TransformersPoster387 citations
- Anomaly Detection in Video via Self-Supervised and Multi-Task LearningPoster383 citations
- SpinNet: Learning a General Surface Descriptor for 3D Point Cloud RegistrationPoster380 citations
- CoCosNet v2: Full-Resolution Correspondence Learning for Image TranslationPoster371 citations
- Unbiased Mean Teacher for Cross-Domain Object DetectionPoster371 citations
- Flow-Guided One-Shot Talking Face Generation With a High-Resolution Audio-Visual DatasetPoster368 citations
- Distribution Alignment: A Unified Framework for Long-Tail Visual RecognitionPoster365 citations
- PhySG: Inverse Rendering With Spherical Gaussians for Physics-Based Material Editing and RelightingPoster365 citations
- FFB6D: A Full Flow Bidirectional Fusion Network for 6D Pose EstimationPoster364 citations
- STMTrack: Template-Free Visual Tracking With Space-Time Memory NetworksPoster364 citations
- Function4D: Real-Time Human Volumetric Capture From Very Sparse Consumer RGBD SensorsPoster361 citations
- NeuralRecon: Real-Time Coherent 3D Reconstruction From Monocular VideoPoster358 citations
- Few-Shot Classification With Feature Map Reconstruction NetworksPoster357 citations
- PointDSC: Robust Point Cloud Registration Using Deep Spatial ConsistencyPoster355 citations
- Dense Label Encoding for Boundary Discontinuity Free Rotation DetectionPoster350 citations
- CReST: A Class-Rebalancing Self-Training Framework for Imbalanced Semi-Supervised LearningPoster349 citations
- Deep Stable Learning for Out-of-Distribution GeneralizationPoster347 citations
- GAN Prior Embedded Network for Blind Face Restoration in the WildPoster347 citations
- CFNet: Cascade and Fused Cost Volume for Robust Stereo MatchingPoster346 citations
- Contrastive Learning Based Hybrid Networks for Long-Tailed Image ClassificationPoster346 citations
- The Temporal Opportunist: Self-Supervised Multi-Frame Monocular DepthPoster346 citations
- RobustNet: Improving Domain Generalization in Urban-Scene Segmentation via Instance Selective WhiteningPoster343 citations
- MIST: Multiple Instance Self-Training Framework for Video Anomaly DetectionPoster342 citations
- Learning Salient Boundary Feature for Anchor-free Temporal Action LocalizationPoster341 citations
- HOTR: End-to-End Human-Object Interaction Detection With TransformersPoster339 citations
- Mutual Graph Learning for Camouflaged Object DetectionPoster338 citations
- CausalVAE: Disentangled Representation Learning via Neural Structural Causal ModelsPoster337 citations
- How Well Do Self-Supervised Models Transfer?Poster336 citations
- PANDA: Adapting Pretrained Features for Anomaly Detection and SegmentationPoster336 citations
- Checkerboard Context Model for Efficient Learned Image CompressionPoster334 citations
- Exploring Data-Efficient 3D Scene Understanding With Contrastive Scene ContextsPoster334 citations
- PSD: Principled Synthetic-to-Real Dehazing Guided by Physical PriorsPoster334 citations
- Frequency-Aware Discriminative Feature Learning Supervised by Single-Center Loss for Face Forgery DetectionPoster333 citations
- Learned Initializations for Optimizing Coordinate-Based Neural RepresentationsPoster331 citations
- Audio-Visual Instance Discrimination with Cross-Modal AgreementPoster329 citations
- Neural Prototype Trees for Interpretable Fine-Grained Image RecognitionPoster327 citations
- Objects Are Different: Flexible Monocular 3D Object DetectionPoster327 citations
- SGCN: Sparse Graph Convolution Network for Pedestrian Trajectory PredictionPoster327 citations
- clDice - A Novel Topology-Preserving Loss Function for Tubular Structure SegmentationPoster327 citations
- HITNet: Hierarchical Iterative Tile Refinement Network for Real-time Stereo MatchingPoster326 citations
- Seesaw Loss for Long-Tailed Instance SegmentationPoster326 citations
- A Large-Scale Study on Unsupervised Spatiotemporal Representation LearningPoster324 citations
- Generalized Focal Loss V2: Learning Reliable Localization Quality Estimation for Dense Object DetectionPoster324 citations
- MoViNets: Mobile Video Networks for Efficient Video RecognitionPoster324 citations
- BoxInst: High-Performance Instance Segmentation With Box AnnotationsPoster323 citations
- Source-Free Domain Adaptation for Semantic SegmentationPoster322 citations
- NeX: Real-Time View Synthesis With Neural Basis ExpansionPoster320 citations
- VLN BERT: A Recurrent Vision-and-Language BERT for NavigationPoster319 citations
- GLEAN: Generative Latent Bank for Large-Factor Image Super-ResolutionPoster315 citations
- Motion Representations for Articulated AnimationPoster315 citations
- DexYCB: A Benchmark for Capturing Hand Grasping of ObjectsPoster314 citations
- Contrastive Embedding for Generalized Zero-Shot LearningPoster313 citations
- WebFace260M: A Benchmark Unveiling the Power of Million-Scale Deep Face RecognitionPoster313 citations
- Adaptive Aggregation Networks for Class-Incremental LearningPoster312 citations
- Disentangling Label Distribution for Long-Tailed Visual RecognitionPoster312 citations
- Neural Scene Graphs for Dynamic ScenesPoster312 citations
- Exploring Sparsity in Image Super-Resolution for Efficient InferencePoster311 citations
- Interpreting Super-Resolution Networks With Local Attribution MapsPoster311 citations
- Railroad Is Not a Train: Saliency As Pseudo-Pixel Supervision for Weakly Supervised Semantic SegmentationPoster309 citations
- FSDR: Frequency Space Domain Randomization for Domain GeneralizationPoster308 citations
- Anti-Adversarially Manipulated Attributions for Weakly and Semi-Supervised Semantic SegmentationPoster307 citations
- Pose Recognition With Cascade TransformersPoster307 citations
- Uncertainty-Aware Joint Salient Object and Camouflaged Object DetectionPoster307 citations
- PLOP: Learning Without Forgetting for Continual Semantic SegmentationPoster305 citations
- Seeing Out of the Box: End-to-End Pre-Training for Vision-Language Representation LearningPoster305 citations
- Robust Point Cloud Registration Framework Based on Deep Graph MatchingPoster303 citations
- SCF-Net: Learning Spatial Contextual Features for Large-Scale Point Cloud SegmentationPoster303 citations
- Self-Supervised Augmentation Consistency for Adapting Semantic SegmentationPoster302 citations
- VITON-HD: High-Resolution Virtual Try-On via Misalignment-Aware NormalizationPoster302 citations
- Back to the Feature: Learning Robust Camera Localization From Pixels To PosePoster301 citations
- Graph Stacked Hourglass Networks for 3D Human Pose EstimationPoster301 citations
- (AF)2-S3Net: Attentive Feature Fusion With Adaptive Feature Selection for Sparse Semantic Segmentation NetworkPoster300 citations
- Fourier Contour Embedding for Arbitrary-Shaped Text DetectionPoster298 citations
- Fashion IQ: A New Dataset Towards Retrieving Images by Natural Language FeedbackPoster297 citations
- Learning the Best Pooling Strategy for Visual Semantic EmbeddingPoster296 citations
- FVC: A New Framework Towards Deep Video Compression in Feature SpacePoster295 citations
- VideoMoCo: Contrastive Video Representation Learning With Temporally Adversarial ExamplesPoster295 citations
- Few-Shot Image Generation via Cross-Domain CorrespondencePoster294 citations
- Calibrated RGB-D Salient Object DetectionPoster293 citations
- Dive Into Ambiguity: Latent Distribution Mining and Pairwise Uncertainty Estimation for Facial Expression RecognitionPoster291 citations
- Semantic Segmentation for Real Point Cloud Scenes via Bilateral Augmentation and Adaptive FusionPoster291 citations
- FixBi: Bridging Domain Spaces for Unsupervised Domain AdaptationPoster290 citations
- Distilling Object Detectors via Decoupled FeaturesPoster288 citations
- MOS: Towards Scaling Out-of-Distribution Detection for Large Semantic SpacePoster288 citations
- PD-GAN: Probabilistic Diverse GAN for Image InpaintingPoster287 citations
- Discover Cross-Modality Nuances for Visible-Infrared Person Re-IdentificationPoster286 citations
- RSTNet: Captioning With Adaptive Attention on Visual and Non-Visual WordsPoster286 citations
- Learning To Recover 3D Scene Shape From a Single ImagePoster284 citations
- Learning Placeholders for Open-Set RecognitionPoster283 citations
- Real-Time High-Resolution Background MattingPoster282 citations
- AutoInt: Automatic Integration for Fast Neural Volume RenderingPoster281 citations
- Bipartite Graph Network With Adaptive Message Passing for Unbiased Scene Graph GenerationPoster281 citations
- LiDAR R-CNN: An Efficient and Universal 3D Object DetectorPoster281 citations
- HyperSeg: Patch-Wise Hypernetwork for Real-Time Semantic SegmentationPoster280 citations
- NBNet: Noise Basis Learning for Image Denoising With Subspace ProjectionPoster280 citations
- Semi-Supervised Semantic Segmentation With Directional Context-Aware ConsistencyPoster277 citations
- Probabilistic Embeddings for Cross-Modal RetrievalPoster275 citations
- Generating Diverse Structure for Image Inpainting With Hierarchical VQ-VAEPoster274 citations
- MP3: A Unified Model To Map, Perceive, Predict and PlanPoster274 citations
- Delving Into Localization Errors for Monocular 3D Object DetectionPoster272 citations
- PU-GCN: Point Cloud Upsampling Using Graph Convolutional NetworksPoster271 citations
- Representative Forgery Mining for Fake Face DetectionPoster271 citations
- End-to-End Object Detection With Fully Convolutional NetworkPoster269 citations
- General Instance Distillation for Object DetectionPoster269 citations
- Alpha-Refine: Boosting Tracking Performance by Precise Bounding Box EstimationPoster268 citations
- UAV-Human: A Large Benchmark for Human Behavior Understanding With Unmanned Aerial VehiclesPoster268 citations
- ACTION-Net: Multipath Excitation for Action RecognitionPoster266 citations
- End-to-End Human Object Interaction Detection With HOI TransformerPoster266 citations
- Learning to Generalize Unseen Domains via Memory-based Multi-Source Meta-Learning for Person Re-IdentificationPoster266 citations
- TrafficSim: Learning To Simulate Realistic Multi-Agent BehaviorsPoster266 citations
- QPIC: Query-Based Pairwise Human-Object Interaction Detection With Image-Wide Contextual InformationPoster265 citations
- SCANimate: Weakly Supervised Learning of Skinned Clothed Avatar NetworksPoster264 citations
- Stereo Radiance Fields (SRF): Learning View Synthesis for Sparse Views of Novel ScenesPoster261 citations
- Convolutional Neural Network Pruning With Structural Redundancy ReductionPoster260 citations
- ArtFlow: Unbiased Image Style Transfer via Reversible Neural FlowsPoster258 citations
- Beyond Static Features for Temporally Consistent 3D Human Pose and Shape From a VideoPoster257 citations
- Distilling Causal Effect of Data in Class-Incremental LearningPoster257 citations
- How2Sign: A Large-Scale Multimodal Dataset for Continuous American Sign LanguagePoster257 citations
- Large-Capacity Image Steganography Based on Invertible Neural NetworksPoster257 citations
- Modular Interactive Video Object Segmentation: Interaction-to-Mask, Propagation and Difference-Aware FusionPoster256 citations
- Dual Attention Suppression Attack: Generate Adversarial Camouflage in Physical WorldPoster255 citations
- Instant-Teaching: An End-to-End Semi-Supervised Object Detection FrameworkPoster254 citations
- Audio-Driven Emotional Video PortraitsPoster253 citations
- Variational Relational Point Completion NetworkPoster253 citations
- Counterfactual Zero-Shot and Open-Set Visual RecognitionPoster251 citations
- Neural Feature Search for RGB-Infrared Person Re-IdentificationPoster251 citations
- Improving Sign Language Translation With Monolingual Data by Sign Back-TranslationPoster249 citations
- ST3D: Self-Training for Unsupervised Domain Adaptation on 3D Object DetectionPoster249 citations
- Backdoor Attacks Against Deep Learning Systems in the Physical WorldPoster248 citations
- DeRF: Decomposed Radiance FieldsPoster248 citations
- Non-Salient Region Object Mining for Weakly Supervised Semantic SegmentationPoster248 citations
- Ultra-High-Definition Image Dehazing via Multi-Guided Bilateral LearningPoster248 citations
- Data-Free Model ExtractionPoster247 citations
- KRISP: Integrating Implicit and Symbolic Knowledge for Open-Domain Knowledge-Based VQAPoster247 citations
- Semantic Relation Reasoning for Shot-Stable Few-Shot Object DetectionPoster247 citations
- AGORA: Avatars in Geography Optimized for Regression AnalysisPoster245 citations
- Patch2Pix: Epipolar-Guided Pixel-Level CorrespondencesPoster244 citations
- A Generalized Loss Function for Crowd Counting and LocalizationPoster243 citations
- Multiple Object Tracking With Correlation LearningPoster243 citations
- Recorrupted-to-Recorrupted: Unsupervised Deep Learning for Image DenoisingPoster242 citations
- Intra-Inter Camera Similarity for Unsupervised Person Re-IdentificationPoster241 citations
- Learning Multi-Scale Photo Exposure CorrectionPoster241 citations
- LightTrack: Finding Lightweight Neural Networks for Object Tracking via One-Shot Architecture SearchPoster241 citations
- Parser-Free Virtual Try-On via Distilling Appearance FlowsPoster241 citations
- SG-Net: Spatial Granularity Network for One-Stage Video Instance SegmentationPoster241 citations
- Semantic Segmentation With Generative Models: Semi-Supervised Learning and Strong Out-of-Domain GeneralizationPoster241 citations
- Semantic-Aware Knowledge Distillation for Few-Shot Class-Incremental LearningPoster241 citations
- 3D Human Action Representation Learning via Cross-View Consistency PursuitPoster240 citations
- Few-Shot Segmentation Without Meta-Learning: A Good Transductive Inference Is All You Need?Poster240 citations
- MeGA-CDA: Memory Guided Attention for Category-Aware Unsupervised Domain Adaptive Object DetectionPoster240 citations
- PiCIE: Unsupervised Semantic Segmentation Using Invariance and Equivariance in ClusteringPoster238 citations
- Domain Adaptation With Auxiliary Target Domain-Oriented ClassifierPoster237 citations
- BABEL: Bodies, Action and Behavior With English LabelsPoster236 citations
- Towards Semantic Segmentation of Urban-Scale 3D Point Clouds: A Dataset, Benchmarks and ChallengesPoster236 citations
- PMP-Net: Point Cloud Completion by Learning Multi-Step Point Moving PathsPoster235 citations
- Unbalanced Feature Transport for Exemplar-Based Image TranslationPoster235 citations
- Localizing Visual Sounds the Hard WayPoster234 citations
- Time Lens: Event-Based Video Frame InterpolationPoster234 citations
- Deep Occlusion-Aware Instance Segmentation With Overlapping BiLayersPoster233 citations
- BBAM: Bounding Box Attribution Map for Weakly Supervised Semantic and Instance SegmentationPoster232 citations
- Dense Relation Distillation With Context-Aware Aggregation for Few-Shot Object DetectionPoster232 citations
- Reconsidering Representation Alignment for Multi-View ClusteringPoster232 citations
- Group-aware Label Transfer for Domain Adaptive Person Re-identificationPoster231 citations
- Objectron: A Large Scale Dataset of Object-Centric Videos in the Wild With Pose AnnotationsPoster231 citations
- Boosting Monocular Depth Estimation Models to High-Resolution via Content-Adaptive Multi-Resolution MergingPoster230 citations
- Offboard 3D Object Detection From Point Cloud SequencesPoster226 citations
- Unsupervised Pre-Training for Person Re-IdentificationPoster226 citations
- Self-Guided and Cross-Guided Learning for Few-Shot SegmentationPoster225 citations
- Fully Convolutional Networks for Panoptic SegmentationPoster223 citations
- Stable View SynthesisPoster223 citations
- Beyond Bounding-Box: Convex-Hull Feature Adaptation for Oriented and Densely Packed Object DetectionPoster222 citations
- Humble Teachers Teach Better Students for Semi-Supervised Object DetectionPoster221 citations
- T2VLAD: Global-Local Sequence Alignment for Text-Video RetrievalPoster221 citations
- Joint Generative and Contrastive Learning for Unsupervised Person Re-IdentificationPoster220 citations
- Towards More Flexible and Accurate Object Tracking With Natural Language: Algorithms and BenchmarkPoster220 citations
- Adaptive Consistency Prior Based Deep Network for Image DenoisingPoster219 citations
- Generalized Few-Shot Object Detection Without ForgettingPoster219 citations
- Learning Normal Dynamics in Videos With Meta Prototype NetworkPoster219 citations
- Rethinking the Heatmap Regression for Bottom-Up Human Pose EstimationPoster219 citations
- SMPLicit: Topology-Aware Generative Model for Clothed PeoplePoster219 citations
- Feature Decomposition and Reconstruction Learning for Effective Facial Expression RecognitionPoster218 citations
- ClassSR: A General Framework to Accelerate Super-Resolution Networks by Data CharacteristicPoster217 citations
- SSTVOS: Sparse Spatiotemporal Transformers for Video Object SegmentationPoster217 citations
- SwiftNet: Real-Time Video Object SegmentationPoster216 citations
- Beyond Max-Margin: Class Margin Equilibrium for Few-Shot Object DetectionPoster215 citations
- Multimodal Contrastive Training for Visual Representation LearningPoster215 citations
- Temporal-Relational CrossTransformers for Few-Shot Action RecognitionPoster215 citations
- Deep RGB-D Saliency Detection With Depth-Sensitive Attention and Automatic Multi-Modal FusionPoster214 citations
- Dynamic Weighted Learning for Unsupervised Domain AdaptationPoster214 citations
- Point 4D Transformer Networks for Spatio-Temporal Modeling in Point Cloud VideosPoster214 citations
- Cross-Domain Gradient Discrepancy Minimization for Unsupervised Domain AdaptationPoster212 citations
- House-GAN++: Generative Adversarial Layout Refinement Network towards Intelligent Computational Agent for Professional ArchitectsPoster212 citations
- Equalization Loss v2: A New Gradient Balance Approach for Long-Tailed Object DetectionPoster211 citations
- TextOCR: Towards Large-Scale End-to-End Reasoning for Arbitrary-Shaped Scene TextPoster211 citations
- VisualVoice: Audio-Visual Speech Separation With Cross-Modal ConsistencyPoster211 citations
- Activate or Not: Learning Customized ActivationPoster208 citations
- DoDNet: Learning To Segment Multi-Organ and Tumors From Multiple Partially Labeled DatasetsPoster208 citations
- PoseAug: A Differentiable Pose Augmentation Framework for 3D Human Pose EstimationPoster207 citations
- SimPLE: Similar Pseudo Label Exploitation for Semi-Supervised ClassificationPoster207 citations
- Fine-Grained Shape-Appearance Mutual Learning for Cloth-Changing Person Re-IdentificationPoster206 citations
- Patch-VQ: 'Patching Up' the Video Quality ProblemPoster206 citations
- Prototypical Cross-Domain Self-Supervised Learning for Few-Shot Unsupervised Domain AdaptationPoster206 citations
- Actor-Context-Actor Relation Network for Spatio-Temporal Action LocalizationPoster204 citations
- DANNet: A One-Stage Domain Adaptation Network for Unsupervised Nighttime Semantic SegmentationPoster204 citations
- RSN: Range Sparse Net for Efficient, Accurate LiDAR 3D Object DetectionPoster204 citations
- Soteria: Provable Defense Against Privacy Leakage in Federated Learning From Representation PerspectivePoster204 citations
- MAZE: Data-Free Model Stealing Attack Using Zeroth-Order Gradient EstimationPoster203 citations
- Self-Promoted Prototype Refinement for Few-Shot Class-Incremental LearningPoster203 citations
- Open Domain Generalization with Domain-Augmented Meta-LearningPoster202 citations
- ArtEmis: Affective Language for Visual ArtPoster201 citations
- MetaSAug: Meta Semantic Augmentation for Long-Tailed Visual RecognitionPoster201 citations
- On Feature Normalization and Data AugmentationPoster201 citations
- VIGOR: Cross-View Image Geo-Localization Beyond One-to-One RetrievalPoster201 citations
- Invertible Denoising Network: A Light Solution for Real Noise RemovalPoster200 citations
- Unsupervised Multi-Source Domain Adaptation Without Access to Source DataPoster200 citations
- Fair Attribute Classification Through Latent Space De-BiasingPoster199 citations
- Learning Graph Embeddings for Compositional Zero-Shot LearningPoster199 citations
- Adversarial Generation of Continuous ImagesPoster198 citations
- Pulsar: Efficient Sphere-Based Neural RenderingPoster198 citations
- Causal Attention for Vision-Language TasksPoster197 citations
- FS-Net: Fast Shape-Based Network for Category-Level 6D Object Pose Estimation With Decoupled Rotation MechanismPoster197 citations
- MotionRNN: A Flexible Model for Video Prediction With Spacetime-Varying MotionsPoster197 citations
- One Shot Face Swapping on MegapixelsPoster197 citations
- Encoder Fusion Network With Co-Attention Embedding for Referring Image SegmentationPoster196 citations
- Energy-Based Learning for Scene Graph GenerationPoster196 citations
- Scale-Aware Graph Neural Network for Few-Shot Semantic SegmentationPoster196 citations
- Progressive Semantic-Aware Style Transformation for Blind Face RestorationPoster195 citations
- Semi-Supervised 3D Hand-Object Poses Estimation With Interactions in TimePoster195 citations
- AdvSim: Generating Safety-Critical Scenarios for Self-Driving VehiclesPoster194 citations
- Deep Gradient Projection Networks for Pan-sharpeningPoster194 citations
- Continual Semantic Segmentation via Repulsion-Attraction of Sparse and Disentangled Latent RepresentationsPoster193 citations
- Progressive Domain Expansion Network for Single Domain GeneralizationPoster193 citations
- Robust Multimodal Vehicle Detection in Foggy Weather Using Complementary Lidar and Radar SignalsPoster193 citations
- Exploiting Spatial Dimensions of Latent in GAN for Real-Time Image EditingPoster192 citations
- Multi-Institutional Collaborations for Improving Deep Learning-Based Magnetic Resonance Image Reconstruction Using Federated LearningPoster192 citations
- TAP: Text-Aware Pre-Training for Text-VQA and Text-CaptionPoster192 citations
- Benchmarking Representation Learning for Natural World Image CollectionsPoster191 citations
- Dynamic Slimmable NetworkPoster191 citations
- Mixed-Privacy Forgetting in Deep NetworksPoster191 citations
- Jo-SRC: A Contrastive Approach for Combating Noisy LabelsPoster190 citations
- Neighborhood Contrastive Learning for Novel Class DiscoveryPoster190 citations
- Refine Myself by Teaching Myself: Feature Refinement via Self-Knowledge DistillationPoster190 citations
- SiamMOT: Siamese Multi-Object TrackingPoster190 citations
- Fast End-to-End Learning on Protein SurfacesPoster189 citations
- MobileDets: Searching for Object Detection Architectures for Mobile AcceleratorsPoster189 citations
- SOE-Net: A Self-Attention and Orientation Encoding Network for Point Cloud Based Place RecognitionPoster189 citations
- SelfDoc: Self-Supervised Document Representation LearningPoster189 citations
- Task-Aware Variational Adversarial Active LearningPoster189 citations
- Dual-GAN: Joint BVP and Noise Modeling for Remote Physiological MeasurementPoster188 citations
- Efficient Regional Memory Network for Video Object SegmentationPoster188 citations
- Learning Calibrated Medical Image Segmentation via Multi-Rater Agreement ModelingPoster188 citations
- Image Generators With Conditionally-Independent Pixel SynthesisPoster187 citations
- Robust Consistent Video Depth EstimationPoster187 citations
- VoxelContext-Net: An Octree Based Framework for Point Cloud CompressionPoster187 citations
- SceneGraphFusion: Incremental 3D Scene Graph Prediction From RGB-D SequencesPoster186 citations
- Deep Gaussian Scale Mixture Prior for Spectral Compressive ImagingPoster185 citations
- Meta Batch-Instance Normalization for Generalizable Person Re-IdentificationPoster185 citations
- CoLA: Weakly-Supervised Temporal Action Localization With Snippet Contrastive LearningPoster184 citations
- Re-Labeling ImageNet: From Single to Multi-Labels, From Global to Localized LabelsPoster183 citations
- Combined Depth Space Based Architecture Search for Person Re-IdentificationPoster182 citations
- Reformulating HOI Detection As Adaptive Set PredictionPoster182 citations
- TPCN: Temporal Point Cloud Networks for Motion ForecastingPoster179 citations
- VIP-DeepLab: Learning Visual Perception With Depth-Aware Video Panoptic SegmentationPoster179 citations
- ABMDRNet: Adaptive-Weighted Bi-Directional Modality Difference Reduction Network for RGB-T Semantic SegmentationPoster178 citations
- AdCo: Adversarial Contrast for Efficient Learning of Unsupervised Representations From Self-Trained Negative AdversariesPoster178 citations
- Embedded Discriminative Attention Mechanism for Weakly Supervised Semantic SegmentationPoster178 citations
- ForgeryNet: A Versatile Benchmark for Comprehensive Forgery AnalysisPoster178 citations
- MASA-SR: Matching Acceleration and Spatial Adaptation for Reference-Based Image Super-ResolutionPoster178 citations
- Learning Statistical Texture for Semantic SegmentationPoster177 citations
- Removing Raindrops and Rain Streaks in One GoPoster177 citations
- Complete & Label: A Domain Adaptation Approach to Semantic Segmentation of LiDAR Point CloudsPoster176 citations
- Context-Aware Biaffine Localizing Network for Temporal Sentence GroundingPoster176 citations
- Flow-Based Kernel Prior With Application to Blind Super-ResolutionPoster176 citations
- HoHoNet: 360 Indoor Holistic Understanding With Latent Horizontal FeaturesPoster176 citations
- Learning To Count EverythingPoster176 citations
- Regularizing Generative Adversarial Networks Under Limited DataPoster176 citations
- Deformed Implicit Field: Modeling 3D Shapes With Learned Dense CorrespondencePoster175 citations
- KeepAugment: A Simple Information-Preserving Data Augmentation ApproachPoster175 citations
- Auto-Exposure Fusion for Single-Image Shadow RemovalPoster174 citations
- Interventional Video Grounding With Dual Contrastive LearningPoster174 citations
- Towards Long-Form Video UnderstandingPoster174 citations
- Training Networks in Null Space of Feature Covariance for Continual LearningPoster174 citations
- Adversarial Laser Beam: Effective Physical-World Attack to DNNs in a BlinkPoster173 citations
- Coming Down to Earth: Satellite-to-Street View Synthesis for Geo-LocalizationPoster173 citations
- Improving the Efficiency and Robustness of Deepfakes Detection Through Precise Geometric FeaturesPoster173 citations
- Pixel-Wise Anomaly Detection in Complex Driving ScenesPoster173 citations
- Goal-Oriented Gaze Estimation for Zero-Shot LearningPoster172 citations
- STaR: Self-Supervised Tracking and Reconstruction of Rigid Objects in Motion With Neural RenderingPoster172 citations
- Human POSEitioning System (HPS): 3D Human Pose Estimation and Self-Localization in Large Scenes From Body-Mounted SensorsPoster171 citations
- One Thing One Click: A Self-Training Approach for Weakly Supervised 3D Semantic SegmentationPoster171 citations
- img2pose: Face Alignment and Detection via 6DoF, Face Pose EstimationPoster171 citations
- Instance Localization for Self-Supervised Detection PretrainingPoster170 citations
- Interactive Self-Training With Mean Teachers for Semi-Supervised Object DetectionPoster170 citations
- Partially View-Aligned Representation Learning With Noise-Robust Contrastive LossPoster170 citations
- Point Cloud Upsampling via Disentangled RefinementPoster170 citations
- Uncertainty Reduction for Model Adaptation in Semantic SegmentationPoster170 citations
- Unsupervised Real-World Image Super Resolution via Domain-Distance Aware TrainingPoster170 citations
- HVPR: Hybrid Voxel-Point Representation for Single-Stage 3D Object DetectionPoster169 citations
- Domain Consensus Clustering for Universal Domain AdaptationPoster168 citations
- Dynamic Region-Aware ConvolutionPoster168 citations
- Focus on Local: Detecting Lane Marker From Bottom Up via Key PointPoster168 citations
- Multiple Instance Active Learning for Object DetectionPoster168 citations
- Open World Compositional Zero-Shot LearningPoster168 citations
- RAFT-3D: Scene Flow Using Rigid-Motion EmbeddingsPoster168 citations
- Populating 3D Scenes by Learning Human-Scene InteractionPoster167 citations
- Progressive Modality Reinforcement for Human Multimodal Emotion Recognition From Unaligned Multimodal SequencesPoster167 citations
- Refining Pseudo Labels With Clustering Consensus Over Generations for Unsupervised Object Re-IdentificationPoster167 citations
- Deep Dual Consecutive Network for Human Pose EstimationPoster166 citations
- Scan2Cap: Context-Aware Dense Captioning in RGB-D ScansPoster166 citations
- Temporal Context Aggregation Network for Temporal Action Proposal RefinementPoster166 citations
- Visual Room RearrangementPoster166 citations
- We Are More Than Our Joints: Predicting How 3D Bodies MovePoster166 citations
- Cross-Modal Collaborative Representation Learning and a Large-Scale RGBT Benchmark for Crowd CountingPoster165 citations
- Farewell to Mutual Information: Variational Distillation for Cross-Modal Person Re-IdentificationPoster165 citations
- Learning Temporal Consistency for Low Light Video Enhancement From Single ImagesPoster165 citations
- Network Pruning via Performance MaximizationPoster165 citations
- On Robustness and Transferability of Convolutional Neural NetworksPoster165 citations
- Transferable Semantic Augmentation for Domain AdaptationPoster165 citations
- Unsupervised 3D Shape Completion Through GAN InversionPoster164 citations
- Iterative Filter Adaptive Network for Single Image Defocus DeblurringPoster163 citations
- SimPoE: Simulated Character Control for 3D Human Pose EstimationPoster163 citations
- Asymmetric Gained Deep Image Compression With Continuous Rate AdaptationPoster162 citations
- Locate Then Segment: A Strong Pipeline for Referring Image SegmentationPoster162 citations
- Sequence-to-Sequence Contrastive Learning for Text RecognitionPoster162 citations
- Adversarially Adaptive Normalization for Single Domain GeneralizationPoster161 citations
- On Learning the Geodesic Path for Incremental LearningPoster161 citations
- Prototype Completion With Primitive Knowledge for Few-Shot LearningPoster161 citations
- An Alternative Probabilistic Interpretation of the Huber LossPoster160 citations
- Facial Action Unit Detection With TransformersPoster160 citations
- Generalizable Person Re-Identification With Relevance-Aware Mixture of ExpertsPoster160 citations
- PixMatch: Unsupervised Domain Adaptation via Pixelwise Consistency TrainingPoster160 citations
- Thinking Fast and Slow: Efficient Text-to-Visual Retrieval With TransformersPoster160 citations
- Are Labels Always Necessary for Classifier Accuracy Evaluation?Poster159 citations
- Exploring Complementary Strengths of Invariant and Equivariant Representations for Few-Shot LearningPoster159 citations
- Image-to-Image Translation via Hierarchical Style DisentanglementPoster159 citations
- Multi-Objective Interpolation Training for Robustness To Label NoisePoster159 citations
- Variational Transformer Networks for Layout GenerationPoster159 citations
- Back to Event Basics: Self-Supervised Learning of Image Reconstruction for Event Cameras via Photometric ConstancyPoster158 citations
- Decoupled Dynamic Filter NetworksPoster158 citations
- Deep Burst Super-ResolutionPoster158 citations
- Cross-Domain Adaptive Clustering for Semi-Supervised Domain AdaptationPoster157 citations
- Improving Multiple Pedestrian Tracking by Track Management and Occlusion HandlingPoster157 citations
- Sequential Graph Convolutional Network for Active LearningPoster157 citations
- A Second-Order Approach to Learning With Instance-Dependent Label NoisePoster156 citations
- Depth-Conditioned Dynamic Message Propagation for Monocular 3D Object DetectionPoster156 citations
- Learnable Graph Matching: Incorporating Graph Partitioning With Deep Feature Learning for Multiple Object TrackingPoster156 citations
- MonoRUn: Monocular 3D Object Detection by Reconstruction and Uncertainty PropagationPoster156 citations
- PISE: Person Image Synthesis and Editing With Decoupled GANPoster156 citations
- 3DIoUMatch: Leveraging IoU Prediction for Semi-Supervised 3D Object DetectionPoster155 citations
- Face Forensics in the WildPoster154 citations
- Kaleido-BERT: Vision-Language Pre-Training on Fashion DomainPoster154 citations
- RefineMask: Towards High-Quality Instance Segmentation With Fine-Grained FeaturesPoster154 citations
- When Age-Invariant Face Recognition Meets Face Age Synthesis: A Multi-Task Learning FrameworkPoster154 citations
- Joint Noise-Tolerant Learning and Meta Camera Shift Adaptation for Unsupervised Person Re-IdentificationPoster153 citations
- Mask Guided Matting via Progressive Refinement NetworkPoster153 citations
- Pareto Self-Supervised Training for Few-Shot LearningPoster153 citations
- Augmentation Strategies for Learning With Noisy LabelsPoster152 citations
- CoSMo: Content-Style Modulation for Image Retrieval With Text FeedbackPoster152 citations
- OpenMix: Reviving Known Knowledge for Discovering Novel Visual Categories in an Open WorldPoster152 citations
- Scene Text Telescope: Text-Focused Scene Image Super-ResolutionPoster152 citations
- HistoGAN: Controlling Colors of GAN-Generated and Real Images via Color HistogramsPoster151 citations
- DG-Font: Deformable Generative Networks for Unsupervised Font GenerationPoster150 citations
- Exponential Moving Average Normalization for Self-Supervised and Semi-Supervised LearningPoster150 citations
- Learning Dynamic Alignment via Meta-Filter for Few-Shot LearningPoster150 citations
- MOOD: Multi-Level Out-of-Distribution DetectionPoster150 citations
- Cross-Iteration Batch NormalizationPoster149 citations
- Learning Accurate Dense Correspondences and When To Trust ThemPoster149 citations
- Panoptic-PolarNet: Proposal-Free LiDAR Point Cloud Panoptic SegmentationPoster149 citations
- The Spatially-Correlative Loss for Various Image Translation TasksPoster149 citations
- Black-Box Explanation of Object Detectors via Saliency MapsPoster148 citations
- Hallucination Improves Few-Shot Object DetectionPoster148 citations
- Improving Multiple Object Tracking With Single Object TrackingPoster148 citations
- LaPred: Lane-Aware Prediction of Multi-Modal Future Trajectories of Dynamic AgentsPoster148 citations
- Neural Lumigraph RenderingPoster148 citations
- Bidirectional Projection Network for Cross Dimension Scene UnderstandingPoster147 citations
- ContactOpt: Optimizing Contact To Improve GraspsPoster147 citations
- Generalizable Pedestrian Detection: The Elephant in the RoomPoster147 citations
- InverseForm: A Loss Function for Structured Boundary-Aware SegmentationPoster147 citations
- Learning 3D Shape Feature for Texture-Insensitive Person Re-IdentificationPoster147 citations
- ManipulaTHOR: A Framework for Visual Object ManipulationPoster147 citations
- Pixel Codec AvatarsPoster147 citations
- The Lottery Tickets Hypothesis for Supervised and Self-Supervised Pre-Training in Computer Vision ModelsPoster147 citations
- High-Resolution Photorealistic Image Translation in Real-Time: A Laplacian Pyramid Translation NetworkPoster146 citations
- LEAP: Learning Articulated Occupancy of PeoplePoster146 citations
- Learning To Filter: Siamese Relation Network for Robust TrackingPoster146 citations
- Video Prediction Recalling Long-Term Motion Context via Memory Alignment LearningPoster146 citations
- Synthesizing Long-Term 3D Human Motion and Interaction in 3D ScenesPoster145 citations
- Your "Flamingo" is My "Bird": Fine-Grained, or NotPoster145 citations
- Region-Aware Adaptive Instance Normalization for Image HarmonizationPoster144 citations
- StyleMix: Separating Content and Style for Enhanced Data AugmentationPoster144 citations
- XProtoNet: Diagnosis in Chest Radiography With Global and Local ExplanationsPoster144 citations
- Anchor-Free Person SearchPoster143 citations
- CanonPose: Self-Supervised Monocular 3D Human Pose Estimation in the WildPoster143 citations
- EnD: Entangling and Disentangling Deep Representations for Bias CorrectionPoster143 citations
- Network Quantization With Element-Wise Gradient ScalingPoster143 citations
- From Shadow Generation To Shadow RemovalPoster142 citations
- SuperMix: Supervising the Mixing Data AugmentationPoster142 citations
- Fast and Accurate Model ScalingPoster141 citations
- Learning High Fidelity Depths of Dressed Humans by Watching Social Media Dance VideosPoster141 citations
- Progressive Contour Regression for Arbitrary-Shape Scene Text DetectionPoster141 citations
- Learning a Proposal Classifier for Multiple Object TrackingPoster140 citations
- Line Segment Detection Using Transformers Without EdgesPoster140 citations
- SDD-FIQA: Unsupervised Face Image Quality Assessment With Similarity Distribution DistancePoster140 citations
- Affordance Transfer Learning for Human-Object Interaction DetectionPoster139 citations
- Deep Analysis of CNN-Based Spatio-Temporal Representations for Action RecognitionPoster139 citations
- i3DMM: Deep Implicit 3D Morphable Model of Human HeadsPoster139 citations
- Guided Integrated Gradients: An Adaptive Path Method for Removing NoisePoster137 citations
- Lesion-Aware Transformers for Diabetic Retinopathy GradingPoster137 citations
- MetaAlign: Coordinating Domain Alignment and Classification for Unsupervised Domain AdaptationPoster137 citations
- 3D AffordanceNet: A Benchmark for Visual Object Affordance UnderstandingPoster136 citations
- DCNAS: Densely Connected Neural Architecture Search for Semantic Image SegmentationPoster136 citations
- Deep Implicit Templates for 3D Shape RepresentationPoster136 citations
- Im2Vec: Synthesizing Vector Graphics Without Vector SupervisionPoster136 citations
- Structured Scene Memory for Vision-Language NavigationPoster136 citations
- VSPW: A Large-scale Dataset for Video Scene Parsing in the WildPoster136 citations
- AttentiveNAS: Improving Neural Architecture Search via Attentive SamplingPoster135 citations
- Few-Shot 3D Point Cloud Semantic SegmentationPoster135 citations
- Invertible Image Signal ProcessingPoster135 citations
- TesseTrack: End-to-End Learnable Multi-Person Articulated 3D Pose TrackingPoster135 citations
- Cycle4Completion: Unpaired Point Cloud Completion Using Cycle Transformation With Missing Region CodingPoster134 citations
- Learning Position and Target Consistency for Memory-Based Video Object SegmentationPoster134 citations
- Semi-Supervised Action Recognition With Temporal Contrastive LearningPoster134 citations
- Detection, Tracking, and Counting Meets Drones in Crowds: A BenchmarkPoster133 citations
- FBNetV3: Joint Architecture-Recipe Search Using Predictor PretrainingPoster133 citations
- Fully Convolutional Scene Graph GenerationPoster133 citations
- Multi-Label Learning From Single Positive LabelsPoster133 citations
- PointFlow: Flowing Semantics Through Points for Aerial Image SegmentationPoster133 citations
- AutoFlow: Learning a Better Training Set for Optical FlowPoster132 citations
- Deep Implicit Moving Least-Squares Functions for 3D ReconstructionPoster132 citations
- Disentangled Cycle Consistency for Highly-Realistic Virtual Try-OnPoster132 citations
- Equivariant Point Network for 3D Point Cloud AnalysisPoster132 citations
- Glance and Gaze: Inferring Action-Aware Points for One-Stage Human-Object Interaction DetectionPoster132 citations
- Learning To Predict Visual Attributes in the WildPoster132 citations
- Greedy Hierarchical Variational Autoencoders for Large-Scale Video PredictionPoster131 citations
- Manifold Regularized Dynamic Network PruningPoster131 citations
- Memory Oriented Transfer Learning for Semi-Supervised Image DerainingPoster131 citations
- SOON: Scenario Oriented Object Navigation With Graph-Based ExplorationPoster131 citations
- Robust Audio-Visual Instance DiscriminationPoster130 citations
- AGQA: A Benchmark for Compositional Spatio-Temporal ReasoningPoster129 citations
- Holistic 3D Scene Understanding From a Single Image With Implicit RepresentationPoster129 citations
- LASR: Learning Articulated Shape Reconstruction From a Monocular VideoPoster129 citations
- Leveraging Line-Point Consistence To Preserve Structures for Wide Parallax Image StitchingPoster129 citations
- The Translucent Patch: A Physical and Universal Attack on Object DetectorsPoster129 citations
- Topological Planning With Transformers for Vision-and-Language NavigationPoster129 citations
- 3D-MAN: 3D Multi-Frame Attention Network for Object DetectionPoster128 citations
- Adaptive Class Suppression Loss for Long-Tail Object DetectionPoster128 citations
- Improving Transferability of Adversarial Patches on Face Recognition With Generative ModelsPoster128 citations
- M3P: Learning Universal Representations via Multitask Multilingual Multimodal Pre-TrainingPoster128 citations
- RSG: A Simple but Effective Module for Learning Imbalanced DatasetsPoster128 citations
- SurFree: A Fast Surrogate-Free Black-Box AttackPoster128 citations
- Wasserstein Contrastive Representation DistillationPoster128 citations
- Deep Convolutional Dictionary Learning for Image DenoisingPoster127 citations
- Information Bottleneck Disentanglement for Identity SwappingPoster127 citations
- Nearest Neighbor Matching for Deep ClusteringPoster127 citations
- Positive Sample Propagation Along the Audio-Visual Event LinePoster127 citations
- Progressive Semantic SegmentationPoster127 citations
- StyleMeUp: Towards Style-Agnostic Sketch-Based Image RetrievalPoster127 citations
- Back-Tracing Representative Points for Voting-Based 3D Object Detection in Point CloudsPoster126 citations
- BiCnet-TKS: Learning Efficient Spatial-Temporal Representation for Video Person Re-IdentificationPoster126 citations
- Face Forgery Detection by 3D DecompositionPoster126 citations
- FlowStep3D: Model Unrolling for Self-Supervised Scene Flow EstimationPoster126 citations
- Exploring Heterogeneous Clues for Weakly-Supervised Audio-Visual Video ParsingPoster125 citations
- Improving Unsupervised Image Clustering With Robust LearningPoster125 citations
- OBoW: Online Bag-of-Visual-Words Generation for Self-Supervised LearningPoster125 citations
- Open-Book Video Captioning With Retrieve-Copy-Generate NetworkPoster125 citations
- Rethinking Channel Dimensions for Efficient Model DesignPoster125 citations
- Improving the Transferability of Adversarial Samples With Adversarial TransformationsPoster124 citations
- Model-Based 3D Hand Reconstruction via Self-Supervised LearningPoster124 citations
- What if We Only Use Real Datasets for Scene Text Recognition? Toward Scene Text Recognition With Fewer LabelsPoster124 citations
- Adaptive Consistency Regularization for Semi-Supervised Transfer LearningPoster123 citations
- Generative Hierarchical Features From Synthesizing ImagesPoster123 citations
- Neural Parts: Learning Expressive 3D Shape Abstractions With Invertible Neural NetworksPoster123 citations
- RPN Prototype Alignment for Domain Adaptive Object DetectorPoster123 citations
- Semantic Audio-Visual NavigationPoster123 citations
- A2-FPN: Attention Aggregation Based Feature Pyramid Network for Instance SegmentationPoster122 citations
- Look Before You Leap: Learning Landmark Features for One-Stage Visual GroundingPoster122 citations
- Background-Aware Pooling and Noise-Aware Loss for Weakly-Supervised Semantic SegmentationPoster121 citations
- Deep Animation Video Interpolation in the WildPoster121 citations
- Graph-Based High-Order Relation Discovery for Fine-Grained RecognitionPoster121 citations
- Right for the Right Concept: Revising Neuro-Symbolic Concepts by Interacting With Their ExplanationsPoster121 citations
- Amalgamating Knowledge From Heterogeneous Graph Neural NetworksPoster120 citations
- From Synthetic to Real: Unsupervised Domain Adaptation for Animal Pose EstimationPoster120 citations
- Image Inpainting Guided by Coherence Priors of Semantics and TexturesPoster120 citations
- LipSync3D: Data-Efficient Learning of Personalized 3D Talking Faces From Video Using Pose and Lighting NormalizationPoster120 citations
- CDFI: Compression-Driven Network Design for Frame InterpolationPoster119 citations
- Drafting and Revision: Laplacian Pyramid Network for Fast High-Quality Artistic Style TransferPoster119 citations
- DriveGAN: Towards a Controllable High-Quality Neural SimulationPoster119 citations
- MetaCorrection: Domain-Aware Meta Loss Correction for Unsupervised Domain Adaptation in Semantic SegmentationPoster119 citations
- Bridge To Answer: Structure-Aware Graph Interaction Network for Video Question AnsweringPoster118 citations
- DeepVideoMVS: Multi-View Stereo on Video With Recurrent Spatio-Temporal FusionPoster118 citations
- Depth Completion With Twin Surface Extrapolation at Occlusion BoundariesPoster118 citations
- Detecting Human-Object Interaction via Fabricated Compositional LearningPoster118 citations
- PV-RAFT: Point-Voxel Correlation Fields for Scene Flow Estimation of Point CloudsPoster118 citations
- SceneGen: Learning To Generate Realistic Traffic ScenesPoster118 citations
- Semantic Image MattingPoster118 citations
- Watching You: Global-Guided Reciprocal Learning for Video-Based Person Re-IdentificationPoster118 citations
- MOST: A Multi-Oriented Scene Text Detector With Localization RefinementPoster117 citations
- Shallow Feature Matters for Weakly Supervised Object LocalizationPoster117 citations
- Spatially Consistent Representation LearningPoster117 citations
- iMiGUE: An Identity-Free Video Dataset for Micro-Gesture Understanding and Emotion AnalysisPoster117 citations
- BRepNet: A Topological Message Passing System for Solid ModelsPoster116 citations
- Bilateral Grid Learning for Stereo Matching NetworksPoster116 citations
- Cross Modal Focal Loss for RGBD Face Anti-SpoofingPoster116 citations
- DiNTS: Differentiable Neural Network Topology Search for 3D Medical Image SegmentationPoster116 citations
- NeuTex: Neural Texture Mapping for Volumetric Neural RenderingPoster116 citations
- On Self-Contact and Human PosePoster116 citations
- Regularizing Neural Networks via Adversarial Model PerturbationPoster116 citations
- AdderSR: Towards Energy Efficient Image Super-ResolutionPoster115 citations
- DyCo3D: Robust Instance Segmentation of 3D Point Clouds Through Dynamic ConvolutionPoster115 citations
- Group Collaborative Learning for Co-Salient Object DetectionPoster115 citations
- Learning Cross-Modal Retrieval With Noisy LabelsPoster115 citations
- Lifelong Person Re-Identification via Adaptive Knowledge AccumulationPoster115 citations
- Permuted AdaIN: Reducing the Bias Towards Global Statistics in Image ClassificationPoster115 citations
- Projecting Your View Attentively: Monocular Road Scene Layout Estimation via Cross-View TransformationPoster115 citations
- Rethinking and Improving the Robustness of Image Style TransferPoster115 citations
- Three Ways To Improve Semantic Segmentation With Self-Supervised Depth EstimationPoster115 citations
- Transformation Invariant Few-Shot Object DetectionPoster115 citations
- LiDAR-Based Panoptic Segmentation via Dynamic Shifting NetworkPoster114 citations
- Look Closer To Segment Better: Boundary Patch Refinement for Instance SegmentationPoster114 citations
- SCALE: Modeling Clothed Humans with a Surface Codec of Articulated Local ElementsPoster114 citations
- Towards Compact CNNs via Collaborative CompressionPoster114 citations
- Weakly Supervised Learning of Rigid 3D Scene FlowPoster114 citations
- Adaptive Methods for Real-World Domain GeneralizationPoster113 citations
- Diversifying Sample Generation for Accurate Data-Free QuantizationPoster113 citations
- Mitigating Face Recognition Bias via Group Adaptive ClassifierPoster113 citations
- Monocular 3D Object Detection: An Extrinsic Parameter Free ApproachPoster113 citations
- Nutrition5k: Towards Automatic Nutritional Understanding of Generic FoodPoster113 citations
- Temporal Modulation Network for Controllable Space-Time Video Super-ResolutionPoster113 citations
- Trajectory Prediction With Latent Belief Energy-Based ModelPoster113 citations
- Camera-Space Hand Mesh Recovery via Semantic Aggregation and Adaptive 2D-1D RegistrationPoster112 citations
- Complementary Relation Contrastive DistillationPoster112 citations
- From Rain Generation to Rain RemovalPoster112 citations
- Removing the Background by Adding the Background: Towards Background Robust Self-Supervised Video Representation LearningPoster112 citations
- Repurposing GANs for One-Shot Semantic Part SegmentationPoster112 citations
- Roses Are Red, Violets Are Blue... but Should VQA Expect Them To?Poster112 citations
- Stylized Neural PaintingPoster112 citations
- Unsupervised Multi-Source Domain Adaptation for Person Re-IdentificationPoster112 citations
- Differentiable Patch Selection for Image RecognitionPoster111 citations
- Learning Invariant Representations and Risks for Semi-Supervised Domain AdaptationPoster111 citations
- UPFlow: Upsampling Pyramid for Unsupervised Optical Flow LearningPoster111 citations
- GrooMeD-NMS: Grouped Mathematically Differentiable NMS for Monocular 3D Object DetectionPoster110 citations
- Points As Queries: Weakly Semi-Supervised Object Detection by PointsPoster110 citations
- Probabilistic Tracklet Scoring and Inpainting for Multiple Object TrackingPoster110 citations
- Unveiling the Potential of Structure Preserving for Weakly Supervised Object LocalizationPoster110 citations
- Multi-Shot Temporal Event Localization: A BenchmarkPoster109 citations
- Self-Supervised Collision Handling via Generative 3D Garment Models for Virtual Try-OnPoster109 citations
- SliceNet: Deep Dense Depth Estimation From a Single Indoor Panorama Using a Slice-Based RepresentationPoster109 citations
- Temporal Query Networks for Fine-Grained Video UnderstandingPoster109 citations
- Image Restoration for Under-Display CameraPoster108 citations
- Multi-Target Domain Adaptation With Collaborative Consistency LearningPoster108 citations
- Person Re-Identification Using Heterogeneous Local Graph Attention NetworksPoster108 citations
- Polygonal Building Extraction by Frame Field LearningPoster108 citations
- Positional Encoding As Spatial Inductive Bias in GANsPoster108 citations
- Robust Representation Learning With Feedback for Single Image DerainingPoster108 citations
- Closing the Loop: Joint Rain Generation and Removal via Disentangled Image TranslationPoster107 citations
- Intrinsic Image HarmonizationPoster107 citations
- MR Image Super-Resolution With Squeeze and Excitation Reasoning Attention NetworkPoster107 citations
- Masksembles for Uncertainty EstimationPoster107 citations
- Quantifying Explainers of Graph Neural Networks in Computational PathologyPoster107 citations
- Reciprocal Transformations for Unsupervised Video Object SegmentationPoster107 citations
- Tracking Pedestrian Heads in Dense CrowdPoster107 citations
- Action Unit Memory Network for Weakly Supervised Temporal Action LocalizationPoster106 citations
- GeoSim: Realistic Video Simulation via Geometry-Aware Composition for Self-DrivingPoster106 citations
- Multi-Source Domain Adaptation With Collaborative Learning for Semantic SegmentationPoster106 citations
- ReNAS: Relativistic Evaluation of Neural Architecture SearchPoster106 citations
- SUTD-TrafficQA: A Question Answering Benchmark and an Efficient Network for Video Reasoning Over Traffic EventsPoster106 citations
- Style-Based Point Generator With Adversarial Rendering for Point Cloud CompletionPoster106 citations
- Temporal Action Segmentation From Timestamp SupervisionPoster106 citations
- Test-Time Fast Adaptation for Dynamic Scene Deblurring via Meta-Auxiliary LearningPoster106 citations
- Adversarial Robustness Under Long-Tailed DistributionPoster105 citations
- MonoRec: Semi-Supervised Dense Reconstruction in Dynamic Environments From a Single Moving CameraPoster105 citations
- Rich Features for Perceptual Quality Assessment of UGC VideosPoster105 citations
- Robust Reference-Based Super-Resolution via C2-MatchingPoster105 citations
- Spatially-Adaptive Pixelwise Networks for Fast Image TranslationPoster105 citations
- Uncertainty Guided Collaborative Training for Weakly Supervised Temporal Action DetectionPoster105 citations
- Long-Tailed Multi-Label Visual Recognition by Collaborative Training on Uniform and Re-Balanced SamplingsPoster104 citations
- Truly Shift-Invariant Convolutional Neural NetworksPoster104 citations
- Wide-Depth-Range 6D Object Pose Estimation in SpacePoster104 citations
- DeepI2P: Image-to-Point Cloud Registration via Deep ClassificationPoster103 citations
- Domain-Specific Suppression for Adaptive Object DetectionPoster103 citations
- Dynamic Transfer for Multi-Source Domain AdaptationPoster103 citations
- Learning To Restore Hazy Video: A New Real-World Dataset and a New MethodPoster103 citations
- Data-Free Knowledge Distillation for Image Super-ResolutionPoster102 citations
- FrameExit: Conditional Early Exiting for Efficient Video RecognitionPoster102 citations
- High-Fidelity and Arbitrary Face EditingPoster102 citations
- Out-of-Distribution Detection Using Union of 1-Dimensional SubspacesPoster102 citations
- Primitive Representation Learning for Scene Text RecognitionPoster102 citations
- Sketch2Model: View-Aware 3D Modeling From Single Free-Hand SketchesPoster102 citations
- Structured Multi-Level Interaction Network for Video Moment Localization via Language QueryPoster102 citations
- Towards Efficient Tensor Decomposition-Based DNN Model Compression With Optimization FrameworkPoster102 citations
- Bottom-Up Shift and Reasoning for Referring Image SegmentationPoster101 citations
- CASTing Your Model: Learning To Localize Improves Self-Supervised RepresentationsPoster101 citations
- DI-Fusion: Online Implicit 3D Reconstruction With Deep PriorsPoster101 citations
- Data-Uncertainty Guided Multi-Phase Learning for Semi-Supervised Object DetectionPoster101 citations
- Learning Compositional Radiance Fields of Dynamic Human HeadsPoster101 citations
- Learning Optical Flow From a Few MatchesPoster101 citations
- Regularization Strategy for Point Cloud via Rigidly Mixed SamplePoster101 citations
- SMURF: Self-Teaching Multi-Frame Unsupervised RAFT With Full-Image WarpingPoster101 citations
- UC2: Universal Cross-Lingual Cross-Modal Vision-and-Language Pre-TrainingPoster101 citations
- A Multi-Task Network for Joint Specular Highlight Detection and RemovalPoster100 citations
- Dual Contradistinctive Generative AutoencoderPoster100 citations
- M3DSSD: Monocular 3D Single Stage Object DetectorPoster100 citations
- Robust and Accurate Object Detection via Adversarial LearningPoster100 citations
- SetVAE: Learning Hierarchical Composition for Generative Modeling of Set-Structured DataPoster100 citations
- Towards Fast and Accurate Real-World Depth Super-Resolution: Benchmark Dataset and BaselinePoster100 citations
- Variational Prototype Learning for Deep Face RecognitionPoster100 citations
- View-Guided Point Cloud CompletionPoster100 citations
- A Closer Look at Fourier Spectrum Discrepancies for CNN-Generated Images DetectionPoster99 citations
- Every Annotation Counts: Multi-Label Deep Supervision for Medical Image SegmentationPoster99 citations
- Learnable Companding Quantization for Accurate Low-Bit Neural NetworksPoster99 citations
- PointGuard: Provably Robust 3D Point Cloud ClassificationPoster99 citations
- Unsupervised Feature Learning by Cross-Level Instance-Group DiscriminationPoster99 citations
- Ego-Exo: Transferring Visual Representations From Third-Person to First-Person VideosPoster98 citations
- End-to-End Learning for Joint Image Demosaicing, Denoising and Super-ResolutionPoster98 citations
- Few-Shot Object Detection via Classification Refinement and Distractor RetreatmentPoster98 citations
- Hierarchical Layout-Aware Graph Convolutional Network for Unified Aesthetics AssessmentPoster98 citations
- Learning Dynamics via Graph Neural Networks for Human Pose Estimation and TrackingPoster98 citations
- Multi-Stage Aggregated Transformer Network for Temporal Language Localization in VideosPoster98 citations
- On the Difficulty of Membership Inference AttacksPoster98 citations
- RGB-D Local Implicit Function for Depth Completion of Transparent ObjectsPoster98 citations
- The Multi-Temporal Urban Development SpaceNet DatasetPoster98 citations
- Context Modeling in 3D Human Pose Estimation: A Unified PerspectivePoster97 citations
- CorrNet3D: Unsupervised End-to-End Learning of Dense Correspondence for 3D Point CloudsPoster97 citations
- Global2Local: Efficient Structure Search for Video Action SegmentationPoster97 citations
- Learning To Fuse Asymmetric Feature Maps in Siamese TrackersPoster97 citations
- ORDisCo: Effective and Efficient Usage of Incremental Unlabeled Data for Semi-Supervised Continual LearningPoster97 citations
- SOLD2: Self-Supervised Occlusion-Aware Line Description and DetectionPoster97 citations
- There Is More Than Meets the Eye: Self-Supervised Multi-Object Detection and Tracking With Sound by Distilling Multimodal KnowledgePoster97 citations
- A Hyperbolic-to-Hyperbolic Graph Convolutional NetworkPoster96 citations
- Continual Adaptation of Visual Representations via Domain Randomization and Meta-LearningPoster96 citations
- Discriminative Appearance Modeling With Multi-Track Pooling for Real-Time Multi-Object TrackingPoster96 citations
- Fair Feature Distillation for Visual RecognitionPoster96 citations
- SMD-Nets: Stereo Mixture Density NetworksPoster96 citations
- Visual Navigation With Spatial AttentionPoster96 citations
- Distilling Audio-Visual Knowledge by Compositional Contrastive LearningPoster95 citations
- Instance Level Affinity-Based Transfer for Unsupervised Domain AdaptationPoster94 citations
- Protecting Intellectual Property of Generative Adversarial Networks From Ambiguity AttacksPoster94 citations
- Relevance-CAM: Your Model Already Knows Where To LookPoster94 citations
- Safe Local Motion Planning With Self-Supervised Freespace ForecastingPoster94 citations
- Slimmable Compressive Autoencoders for Practical Neural Image CompressionPoster94 citations
- Differentiable Multi-Granularity Human Representation Learning for Instance-Aware Human Semantic ParsingPoster93 citations
- Memory-Efficient Network for Large-Scale Video Compressive SensingPoster93 citations
- OpenRooms: An Open Framework for Photorealistic Indoor Scene DatasetsPoster93 citations
- RfD-Net: Point Scene Understanding by Semantic Instance ReconstructionPoster93 citations
- Shelf-Supervised Mesh Prediction in the WildPoster93 citations
- Siamese Natural Language Tracker: Tracking by Natural Language Descriptions With Siamese TrackersPoster93 citations
- Weakly Supervised Video Salient Object DetectionPoster93 citations
- Zero-Shot Adversarial QuantizationPoster93 citations
- AIFit: Automatic 3D Human-Interpretable Feedback Models for Fitness TrainingPoster92 citations
- KOALAnet: Blind Super-Resolution Using Kernel-Oriented Adaptive Local AdjustmentPoster92 citations
- Learning a Facial Expression Embedding Disentangled From IdentityPoster92 citations
- Radar-Camera Pixel Depth Association for Depth CompletionPoster92 citations
- Spherical Confidence Learning for Face RecognitionPoster92 citations
- 4D Panoptic LiDAR SegmentationPoster91 citations
- AdaStereo: A Simple and Efficient Approach for Adaptive Stereo MatchingPoster91 citations
- Capturing Omni-Range Context for Omnidirectional SegmentationPoster91 citations
- Cross-View Regularization for Domain Adaptive Panoptic SegmentationPoster91 citations
- Dual Attention Guided Gaze Target Detection in the WildPoster91 citations
- Generative PointNet: Deep Energy-Based Learning on Unordered Point Sets for 3D Generation, Reconstruction and ClassificationPoster91 citations
- I3Net: Implicit Instance-Invariant Network for Adapting One-Stage Object DetectorsPoster91 citations
- Lifting 2D StyleGAN for 3D-Aware Face GenerationPoster91 citations
- Multiple Instance Captioning: Learning Representations From Histopathology Textbooks and ArticlesPoster91 citations
- Online Multiple Object Tracking With Cross-Task SynergyPoster91 citations
- Practical Single-Image Super-Resolution Using Look-Up TablePoster91 citations
- Rich Context Aggregation With Reflection Prior for Glass Surface DetectionPoster91 citations
- Room-and-Object Aware Knowledge Reasoning for Remote Embodied Referring ExpressionPoster91 citations
- Transferable Query Selection for Active Domain AdaptationPoster91 citations
- Coarse-To-Fine Domain Adaptive Semantic Segmentation With Photometric Alignment and Category-Center RegularizationPoster90 citations
- CondenseNet V2: Sparse Feature Reactivation for Deep NetworksPoster90 citations
- Deep Learning in Latent Space for Video Prediction and CompressionPoster90 citations
- Delving into Data: Effectively Substitute Training for Black-box AttackPoster90 citations
- Efficient Feature Transformations for Discriminative and Generative Continual LearningPoster90 citations
- Home Action Genome: Cooperative Compositional Action UnderstandingPoster90 citations
- Incremental Few-Shot Instance SegmentationPoster90 citations
- Invisible Perturbations: Physical Adversarial Examples Exploiting the Rolling Shutter EffectPoster90 citations
- Cyclic Co-Learning of Sounding Object Visual Grounding and Sound SeparationPoster89 citations
- Densely Connected Multi-Dilated Convolutional Networks for Dense Prediction TasksPoster89 citations
- Post-Hoc Uncertainty Calibration for Domain Drift ScenariosPoster89 citations
- Shared Cross-Modal Trajectory Prediction for Autonomous DrivingPoster89 citations
- Uncertainty-Guided Model Generalization to Unseen DomainsPoster89 citations
- Anycost GANs for Interactive Image Synthesis and EditingPoster88 citations
- Cascaded Prediction Network via Segment Tree for Temporal Video GroundingPoster88 citations
- DCT-Mask: Discrete Cosine Transform Mask Representation for Instance SegmentationPoster88 citations
- Interpolation-Based Semi-Supervised Learning for Object DetectionPoster88 citations
- Look Before You Speak: Visually Contextualized UtterancesPoster88 citations
- Multi-view Depth Estimation using Epipolar Spatio-Temporal NetworksPoster88 citations
- Revamping Cross-Modal Recipe Retrieval With Hierarchical Transformers and Self-Supervised LearningPoster88 citations
- TransFill: Reference-Guided Image Inpainting by Merging Multiple Color and Spatial TransformationsPoster88 citations
- UnrealPerson: An Adaptive Pipeline Towards Costless Person Re-IdentificationPoster88 citations
- Contrastive Neural Architecture Search With Neural Architecture ComparatorsPoster87 citations
- Joint Negative and Positive Learning for Noisy LabelsPoster87 citations
- PointNetLK RevisitedPoster87 citations
- Shot Contrastive Self-Supervised Learning for Scene Boundary DetectionPoster87 citations
- Spatio-temporal Contrastive Domain Adaptation for Action RecognitionPoster87 citations
- To the Point: Efficient 3D Object Detection in the Range Image With Graph Convolution KernelsPoster87 citations
- Towards Unified Surgical Skill AssessmentPoster87 citations
- Understanding Failures of Deep Networks via Robust Feature ExtractionPoster87 citations
- Deep Polarization Imaging for 3D Shape and SVBRDF AcquisitionPoster86 citations
- Diverse Semantic Image Synthesis via Probability Distribution ModelingPoster86 citations
- Dogfight: Detecting Drones From Drones VideosPoster86 citations
- Jigsaw Clustering for Unsupervised Visual Representation LearningPoster86 citations
- L2M-GAN: Learning To Manipulate Latent Space Semantics for Facial Attribute EditingPoster86 citations
- Learning From the Master: Distilling Cross-Modal Advanced Knowledge for Lip ReadingPoster86 citations
- Learning by Aligning Videos in TimePoster86 citations
- Multi-Modal Relational Graph for Cross-Modal Video Moment RetrievalPoster86 citations
- OTCE: A Transferability Metric for Cross-Domain Cross-Task RepresentationsPoster86 citations
- Semi-Supervised Video Deraining With Dynamical Rain GeneratorPoster86 citations
- Sewer-ML: A Multi-Label Sewer Defect Classification Dataset and BenchmarkPoster86 citations
- Simulating Unknown Target Models for Query-Efficient Black-Box AttacksPoster86 citations
- Sketch, Ground, and Refine: Top-Down Dense Video CaptioningPoster86 citations
- Sparse Auxiliary Networks for Unified Monocular Depth Prediction and CompletionPoster86 citations
- Spoken Moments: Learning Joint Audio-Visual Representations From Video DescriptionsPoster86 citations
- StylePeople: A Generative Model of Fullbody Human AvatarsPoster86 citations
- DRANet: Disentangling Representation and Adaptation Networks for Unsupervised Cross-Domain AdaptationPoster85 citations
- EvDistill: Asynchronous Events To End-Task Learning via Bidirectional Reconstruction-Guided Cross-Modal Knowledge DistillationPoster85 citations
- Explore Image Deblurring via Encoded Blur Kernel SpacePoster85 citations
- Glancing at the Patch: Anomaly Localization With Global and Local Feature ComparisonPoster85 citations
- HLA-Face: Joint High-Low Adaptation for Low Light Face DetectionPoster85 citations
- Human-Like Controllable Image Captioning With Verb-Specific Semantic RolesPoster85 citations
- Learning the Predictability of the FuturePoster85 citations
- More Photos Are All You Need: Semi-Supervised Learning for Fine-Grained Sketch Based Image RetrievalPoster85 citations
- Rethinking Text Segmentation: A Novel Dataset and a Text-Specific Refinement ApproachPoster85 citations
- S3: Neural Shape, Skeleton, and Skinning Fields for 3D Human ModelingPoster85 citations
- Towards Bridging Event Captioner and Sentence Localizer for Weakly Supervised Dense Event CaptioningPoster85 citations
- UV-Net: Learning From Boundary RepresentationsPoster85 citations
- Adaptive Image Transformer for One-Shot Object DetectionPoster84 citations
- Curriculum Graph Co-Teaching for Multi-Target Domain AdaptationPoster84 citations
- Improving Weakly Supervised Visual Grounding by Contrastive Knowledge DistillationPoster84 citations
- Navigating the GAN Parameter Space for Semantic Image EditingPoster84 citations
- Semantic Scene Completion via Integrating Instances and Scene In-the-LoopPoster84 citations
- StickyPillars: Robust and Efficient Feature Matching on Point Clouds Using Graph Neural NetworksPoster84 citations
- Towards Accurate Text-Based Image Captioning With Content Diversity ExplorationPoster84 citations
- ARVo: Learning All-Range Volumetric Correspondence for Video DeblurringPoster83 citations
- Layerwise Optimization by Gradient Decomposition for Continual LearningPoster83 citations
- Neural Deformation Graphs for Globally-Consistent Non-Rigid ReconstructionPoster83 citations
- On Semantic Similarity in Video RetrievalPoster83 citations
- PML: Progressive Margin Loss for Long-Tailed Age ClassificationPoster83 citations
- Spk2ImgNet: Learning To Reconstruct Dynamic Scene From Continuous Spike StreamPoster83 citations
- Towards Accurate 3D Human Motion Prediction From Incomplete ObservationsPoster83 citations
- Cross-View Cross-Scene Multi-View Crowd CountingPoster82 citations
- DualAST: Dual Style-Learning Networks for Artistic Style TransferPoster82 citations
- Effective Sparsification of Neural Networks With Global Sparsity ConstraintPoster82 citations
- EventZoom: Learning To Denoise and Super Resolve Neuromorphic EventsPoster82 citations
- MaxUp: Lightweight Adversarial Training With Data Augmentation Improves Neural Network TrainingPoster82 citations
- Modeling Multi-Label Action Dependencies for Temporal Action LocalizationPoster82 citations
- Restoring Extremely Dark Images in Real TimePoster82 citations
- Self-Supervised Learning for Semi-Supervised Temporal Action ProposalPoster82 citations
- Single Image Depth Prediction With Wavelet DecompositionPoster82 citations
- StereoPIFu: Depth Aware Clothed Human Digitization via Stereo VisionPoster82 citations
- TransNAS-Bench-101: Improving Transferability and Generalizability of Cross-Task Neural Architecture SearchPoster82 citations
- When Human Pose Estimation Meets Robustness: Adversarial Algorithms and BenchmarksPoster82 citations
- Adaptive Convolutions for Structure-Aware Style TransferPoster81 citations
- FCPose: Fully Convolutional Multi-Person Pose Estimation With Dynamic Instance-Aware ConvolutionsPoster81 citations
- Learning Semantic Person Image Generation by Region-Adaptive NormalizationPoster81 citations
- NeuroMorph: Unsupervised Shape Interpolation and Correspondence in One GoPoster81 citations
- PWCLO-Net: Deep LiDAR Odometry in 3D Point Clouds Using Hierarchical Embedding Mask OptimizationPoster81 citations
- Probabilistic Modeling of Semantic Ambiguity for Scene Graph GenerationPoster81 citations
- Regressive Domain Adaptation for Unsupervised Keypoint DetectionPoster81 citations
- Representative Batch Normalization With Feature CalibrationPoster81 citations
- Rethinking Class Relations: Absolute-Relative Supervised and Unsupervised Few-Shot LearningPoster81 citations
- Rethinking Style Transfer: From Pixels to Parameterized BrushstrokesPoster81 citations
- Spatial-Temporal Correlation and Topology Learning for Person Re-Identification in VideosPoster81 citations
- Temporally-Weighted Hierarchical Clustering for Unsupervised Action SegmentationPoster81 citations
- Unsupervised Learning of 3D Object Categories From Videos in the WildPoster81 citations
- Learning Probabilistic Ordinal Embeddings for Uncertainty-Aware RegressionPoster80 citations
- Multi-Scale Aligned Distillation for Low-Resolution DetectionPoster80 citations
- ProSelfLC: Progressive Self Label Correction for Training Robust Deep Neural NetworksPoster80 citations
- Self-Supervised Pillar Motion Learning for Autonomous DrivingPoster80 citations
- Visual Semantic Role Labeling for Video UnderstandingPoster80 citations
- Visualizing Adapted Knowledge in Domain TransferPoster80 citations
- A Self-Boosting Framework for Automated Radiographic Report GenerationPoster79 citations
- Body Meshes as PointsPoster79 citations
- Differentiable SLAM-Net: Learning Particle SLAM for Visual NavigationPoster79 citations
- Divide-and-Conquer for Lane-Aware Diverse Trajectory PredictionPoster79 citations
- Interpretable Social Anchors for Human Trajectory Forecasting in CrowdsPoster79 citations
- Introvert: Human Trajectory Prediction via Conditional 3D AttentionPoster79 citations
- Neural Architecture Search With Random LabelsPoster79 citations
- RangeIoUDet: Range Image Based Real-Time 3D Object Detector Optimized by Intersection Over UnionPoster79 citations
- Scalability vs. Utility: Do We Have To Sacrifice One for the Other in Data Importance Quantification?Poster79 citations
- Semi-Supervised Domain Adaptation Based on Dual-Level Domain Mixing for Semantic SegmentationPoster79 citations
- Coarse-To-Fine Person Re-Identification With Auxiliary-Domain Classification and Second-Order Information BottleneckPoster78 citations
- Exploiting Semantic Embedding and Visual Feature for Facial Action Unit DetectionPoster78 citations
- Joint Deep Model-Based MR Image and Coil Sensitivity Reconstruction Network (Joint-ICNet) for Fast MRIPoster78 citations
- Learning To Segment Rigid Motions From Two FramesPoster78 citations
- LiBRe: A Practical Bayesian Approach to Adversarial DetectionPoster78 citations
- Light Field Super-Resolution With Zero-Shot LearningPoster78 citations
- Neural Splines: Fitting 3D Surfaces With Infinitely-Wide Neural NetworksPoster78 citations
- Person30K: A Dual-Meta Generalization Network for Person Re-IdentificationPoster78 citations
- Spatially-Invariant Style-Codes Controlled Makeup TransferPoster78 citations
- A Sliced Wasserstein Loss for Neural Texture SynthesisPoster77 citations
- Cross-Modal Center Loss for 3D Cross-Modal RetrievalPoster77 citations
- ECKPN: Explicit Class Knowledge Propagation Network for Transductive Few-Shot LearningPoster77 citations
- Image Inpainting With External-Internal Learning and Monochromic BottleneckPoster77 citations
- Lipstick Ain't Enough: Beyond Color Matching for In-the-Wild Makeup TransferPoster77 citations
- Multi-View Multi-Person 3D Pose Estimation With Plane Sweep StereoPoster77 citations
- Part-Aware Panoptic SegmentationPoster77 citations
- Pose-Guided Human Animation From a Single Image in the WildPoster77 citations
- Scene-Aware Generative Network for Human Motion SynthesisPoster77 citations
- Strengthen Learning Tolerance for Weakly Supervised Object LocalizationPoster77 citations
- User-Guided Line Art Flat Filling With Split Filling MechanismPoster77 citations
- Vx2Text: End-to-End Learning of Video-Based Text Generation From Multimodal InputsPoster77 citations
- 3D Spatial Recognition Without Spatially Labeled 3DPoster76 citations
- Anticipating Human Actions by Correlating Past With the Future With Jaccard Similarity MeasuresPoster76 citations
- Convolutional Hough Matching NetworksPoster76 citations
- IoU Attack: Towards Temporally Coherent Black-Box Adversarial Attack for Visual Object TrackingPoster76 citations
- Learning a Self-Expressive Network for Subspace ClusteringPoster76 citations
- Point Cloud Instance Segmentation Using Probabilistic EmbeddingsPoster76 citations
- Scalable Differential Privacy With Sparse Network FinetuningPoster76 citations
- The Lottery Ticket Hypothesis for Object RecognitionPoster76 citations
- ATSO: Asynchronous Teacher-Student Optimization for Semi-Supervised Image SegmentationPoster75 citations
- Abstract Spatial-Temporal Reasoning via Probabilistic Abduction and ExecutionPoster75 citations
- Accurate Few-Shot Object Detection With Support-Query Mutual Guidance and Hybrid LossPoster75 citations
- Inferring CAD Modeling Sequences Using Zone GraphsPoster75 citations
- LiDAR-Aug: A General Rendering-Based Augmentation Framework for 3D Object DetectionPoster75 citations
- Neural Descent for Visual 3D Human Pose and ShapePoster75 citations
- Revisiting Superpixels for Active Learning in Semantic Segmentation With Realistic Annotation CostsPoster75 citations
- Zillow Indoor Dataset: Annotated Floor Plans With 360deg Panoramas and 3D Room LayoutsPoster75 citations
- Content-Aware GAN CompressionPoster74 citations
- Dictionary-Guided Scene Text RecognitionPoster74 citations
- Ensembling With Deep Generative ViewsPoster74 citations
- HR-NAS: Searching Efficient High-Resolution Neural Architectures With Lightweight TransformersPoster74 citations
- Progressive Temporal Feature Alignment Network for Video InpaintingPoster74 citations
- Removing Diffraction Image Artifacts in Under-Display Camera via Dynamic Skip Connection NetworkPoster74 citations
- Self-Supervised Learning on 3D Point Clouds by Learning Discrete Generative ModelsPoster74 citations
- ViPNAS: Efficient Video Pose Estimation via Neural Architecture SearchPoster74 citations
- Zero-Shot Single Image Restoration Through Controlled Perturbation of Koschmieder's ModelPoster74 citations
- Efficient Multi-Stage Video Denoising With Recurrent Spatio-Temporal FusionPoster73 citations
- High-Speed Image Reconstruction Through Short-Term Plasticity for Spiking CamerasPoster73 citations
- Normalized Avatar Synthesis Using StyleGAN and Perceptual RefinementPoster73 citations
- Spatial Feature Calibration and Temporal Fusion for Effective One-Stage Video Instance SegmentationPoster73 citations
- Teachers Do More Than Teach: Compressing Image-to-Image ModelsPoster73 citations
- CLCC: Contrastive Learning for Color ConstancyPoster72 citations
- DOTS: Decoupling Operation and Topology in Differentiable Architecture SearchPoster72 citations
- Deep Lucas-Kanade Homography for Multimodal Image AlignmentPoster72 citations
- Depth-Aware Mirror SegmentationPoster72 citations
- IQDet: Instance-Wise Quality Distribution Sampling for Object DetectionPoster72 citations
- Monocular Real-Time Full Body Capture With Inter-Part CorrelationsPoster72 citations
- OPANAS: One-Shot Path Aggregation Network Architecture Search for Object DetectionPoster72 citations
- Probabilistic 3D Human Shape and Pose Estimation From Multiple Unconstrained Images in the WildPoster72 citations
- Prototype-Guided Saliency Feature Learning for Person SearchPoster72 citations
- Reconstructing 3D Human Pose by Watching Humans in the MirrorPoster72 citations
- All Labels Are Not Created Equal: Enhancing Semi-Supervision via Label Grouping and Co-TrainingPoster71 citations
- Conditional Bures Metric for Domain AdaptationPoster71 citations
- Convolutional Dynamic Alignment Networks for Interpretable ClassificationsPoster71 citations
- DyGLIP: A Dynamic Graph Model With Link Prediction for Accurate Multi-Camera Multiple Object TrackingPoster71 citations
- Faster Meta Update Strategy for Noise-Robust Deep LearningPoster71 citations
- HDMapGen: A Hierarchical Graph Generative Model of High Definition MapsPoster71 citations
- Representation Learning via Global Temporal Alignment and Cycle-ConsistencyPoster71 citations
- ANR: Articulated Neural Rendering for Virtual AvatarsPoster70 citations
- Enriching ImageNet With Human Similarity Judgments and Psychological EmbeddingsPoster70 citations
- Few-Shot Open-Set Recognition by Transformation ConsistencyPoster70 citations
- Fine-Grained Angular Contrastive Learning With Coarse LabelsPoster70 citations
- Hybrid Message Passing With Performance-Driven Structures for Facial Action Unit DetectionPoster70 citations
- KeypointDeformer: Unsupervised 3D Keypoint Discovery for Shape ControlPoster70 citations
- Learning To Relate Depth and Semantics for Unsupervised Domain AdaptationPoster70 citations
- Mutual CRF-GNN for Few-Shot LearningPoster70 citations
- Point2Skeleton: Learning Skeletal Representations from Point CloudsPoster70 citations
- SelfAugment: Automatic Augmentation Policies for Self-Supervised LearningPoster70 citations
- 3D Shape Generation With Grid-Based Implicit FunctionsPoster69 citations
- Animating Pictures With Eulerian Motion FieldsPoster69 citations
- CAMERAS: Enhanced Resolution and Sanity Preserving Class Activation Mapping for Image SaliencyPoster69 citations
- Combinatorial Learning of Graph Edit Distance via Dynamic EmbeddingPoster69 citations
- Learnable Motion Coherence for Correspondence PruningPoster69 citations
- Learning To Reconstruct High Speed and High Dynamic Range Videos From EventsPoster69 citations
- Residential Floor Plan Recognition and ReconstructionPoster69 citations
- Self-Supervised Learning of Depth Inference for Multi-View StereoPoster69 citations
- Vectorization and Rasterization: Self-Supervised Learning for Sketch and HandwritingPoster69 citations
- GAIA: A Transfer Learning System of Object Detection That Fits Your NeedsPoster68 citations
- Learning Affinity-Aware Upsampling for Deep Image MattingPoster68 citations
- MetaSCI: Scalable and Adaptive Reconstruction for Video Compressive SensingPoster68 citations
- Nighttime Visibility Enhancement by Increasing the Dynamic Range and Suppression of Light EffectsPoster68 citations
- Relation-aware Instance Refinement for Weakly Supervised Visual GroundingPoster68 citations
- UnsupervisedR&R: Unsupervised Point Cloud Registration via Differentiable RenderingPoster68 citations
- WOAD: Weakly Supervised Online Action Detection in Untrimmed VideosPoster68 citations
- Weakly Supervised Action Selection Learning in VideoPoster68 citations
CVPR accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.