ICCV 2021 Accepted Papers
The full list of 1,612 papers accepted at ICCV 2021 (IEEE/CVF International Conference on Computer Vision). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 1,612
- Swin Transformer: Hierarchical Vision Transformer Using Shifted WindowsPoster29,925 citations
- Emerging Properties in Self-Supervised Vision TransformersPoster6,990 citations
- Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction Without ConvolutionsPoster5,090 citations
- ViViT: A Video Vision TransformerPoster2,888 citations
- Point TransformerPoster2,633 citations
- CvT: Introducing Convolutions to Vision TransformersPoster2,598 citations
- Tokens-to-Token ViT: Training Vision Transformers From Scratch on ImageNetPoster2,573 citations
- Segmenter: Transformer for Semantic SegmentationPoster2,259 citations
- Vision Transformers for Dense PredictionPoster2,233 citations
- Mip-NeRF: A Multiscale Representation for Anti-Aliasing Neural Radiance FieldsPoster2,219 citations
- An Empirical Study of Training Self-Supervised Vision TransformersPoster2,178 citations
- CrossViT: Cross-Attention Multi-Scale Vision Transformer for Image ClassificationPoster2,006 citations
- The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution GeneralizationPoster2,004 citations
- Multiscale Vision TransformersPoster1,664 citations
- Nerfies: Deformable Neural Radiance FieldsPoster1,543 citations
- StyleCLIP: Text-Driven Manipulation of StyleGAN ImageryPoster1,379 citations
- Going Deeper With Image TransformersPoster1,328 citations
- Frozen in Time: A Joint Video and Image Encoder for End-to-End RetrievalPoster1,303 citations
- PlenOctrees for Real-Time Rendering of Neural Radiance FieldsPoster1,173 citations
- TransReID: Transformer-Based Object Re-IdentificationPoster1,156 citations
- FcaNet: Frequency Channel Attention NetworksPoster1,130 citations
- TOOD: Task-Aligned One-Stage Object DetectionPoster1,116 citations
- Learning Spatio-Temporal Transformer for Visual TrackingPoster1,080 citations
- Oriented R-CNN for Object DetectionPoster1,021 citations
- MDETR - Modulated Detection for End-to-End Multi-Modal UnderstandingPoster980 citations
- MVSNeRF: Fast Generalizable Radiance Field Reconstruction From Multi-View StereoPoster907 citations
- Conformer: Local Features Coupling Global Representations for Visual RecognitionPoster890 citations
- Channel-Wise Topology Refinement Graph Convolution for Skeleton-Based Action RecognitionPoster872 citations
- UNISURF: Unifying Neural Implicit Surfaces and Radiance Fields for Multi-View ReconstructionPoster862 citations
- KiloNeRF: Speeding Up Neural Radiance Fields With Thousands of Tiny MLPsPoster855 citations
- Conditional DETR for Fast Training ConvergencePoster829 citations
- DRAEM - A Discriminatively Trained Reconstruction Embedding for Surface Anomaly DetectionPoster820 citations
- LeViT: A Vision Transformer in ConvNet's Clothing for Faster InferencePoster815 citations
- BARF: Bundle-Adjusting Neural Radiance FieldsPoster810 citations
- ILVR: Conditioning Method for Denoising Diffusion Probabilistic ModelsPoster805 citations
- Designing a Practical Degradation Model for Deep Blind Image Super-ResolutionPoster793 citations
- MUSIQ: Multi-Scale Image Quality TransformerPoster780 citations
- Rethinking Coarse-To-Fine Approach in Single Image DeblurringPoster770 citations
- Rethinking Spatial Dimensions of Vision TransformersPoster761 citations
- Incorporating Learnable Membrane Time Constant To Enhance Learning of Spiking Neural NetworksPoster729 citations
- FastNeRF: High-Fidelity Neural Rendering at 200FPSPoster697 citations
- Big Self-Supervised Models Advance Medical Image ClassificationPoster695 citations
- iMAP: Implicit Mapping and Positioning in Real-TimePoster689 citations
- Incorporating Convolution Designs Into Visual TransformersPoster659 citations
- 3D Human Pose Estimation With Spatial and Temporal TransformersPoster649 citations
- Exploring Cross-Image Pixel Contrast for Semantic SegmentationPoster624 citations
- Large Scale Interactive Motion Forecasting for Autonomous Driving: The Waymo Open Motion DatasetPoster624 citations
- End-to-End Semi-Supervised Object Detection With Soft TeacherPoster620 citations
- PoinTr: Diverse Point Cloud Completion With Geometry-Aware TransformersPoster608 citations
- Baking Neural Radiance Fields for Real-Time View SynthesisPoster604 citations
- Invisible Backdoor Attack With Sample-Specific TriggersPoster603 citations
- AgentFormer: Agent-Aware Transformers for Socio-Temporal Multi-Agent ForecastingPoster594 citations
- AI Choreographer: Music Conditioned 3D Dance Generation With AIST++Poster576 citations
- 3D Shape Generation and Completion Through Point-Voxel DiffusionPoster574 citations
- An End-to-End Transformer Model for 3D Object DetectionPoster573 citations
- Action-Conditioned 3D Human Motion Synthesis With Transformer VAEPoster567 citations
- With a Little Help From My Friends: Nearest-Neighbor Contrastive Learning of Visual RepresentationsPoster561 citations
- Non-Rigid Neural Radiance Fields: Reconstruction and Novel View Synthesis of a Dynamic Scene From Monocular VideoPoster557 citations
- Visual Saliency TransformerPoster552 citations
- Asymmetric Loss for Multi-Label ClassificationPoster547 citations
- NeRD: Neural Reflectance Decomposition From Image CollectionsPoster547 citations
- Putting NeRF on a Diet: Semantically Consistent Few-Shot View SynthesisPoster541 citations
- Voxel Transformer for 3D Object DetectionPoster532 citations
- DenseTNT: End-to-End Trajectory Prediction From Dense Goal SetsPoster528 citations
- In-Place Scene Labelling and Understanding With Implicit Scene RepresentationPoster527 citations
- ACDC: The Adverse Conditions Dataset With Correspondences for Semantic Driving Scene UnderstandingPoster525 citations
- Meta-Baseline: Exploring Simple Meta-Learning for Few-Shot LearningPoster520 citations
- Animatable Neural Radiance Fields for Modeling Dynamic Human BodiesPoster514 citations
- Understanding Robustness of Transformers for Image ClassificationPoster503 citations
- Common Objects in 3D: Large-Scale Learning and Evaluation of Real-Life 3D Category ReconstructionPoster491 citations
- PARE: Part Attention Regressor for 3D Human Body EstimationPoster480 citations
- Weakly-Supervised Video Anomaly Detection With Robust Temporal Feature Magnitude LearningPoster462 citations
- Co-Scale Conv-Attentional Image TransformersPoster461 citations
- AD-NeRF: Audio Driven Neural Radiance Fields for Talking Head SynthesisPoster452 citations
- Pixel Difference Networks for Efficient Edge DetectionPoster452 citations
- Dynamic View Synthesis From Dynamic Monocular VideoPoster441 citations
- FairNAS: Rethinking Evaluation Fairness of Weight Sharing Neural Architecture SearchPoster432 citations
- Rethinking and Improving Relative Position Encoding for Vision TransformerPoster430 citations
- Co2L: Contrastive Continual LearningPoster428 citations
- Rethinking Transformer-Based Set Prediction for Object DetectionPoster425 citations
- Hypercorrelation Squeeze for Few-Shot SegmentationPoster420 citations
- Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image EncodingPoster419 citations
- UniT: Multimodal Multitask Learning With a Unified TransformerPoster417 citations
- AdaAttN: Revisit Attention Mechanism in Arbitrary Neural Style TransferPoster413 citations
- Dynamic DETR: End-to-End Object Detection With Dynamic AttentionPoster409 citations
- DetCo: Unsupervised Contrastive Learning for Object DetectionPoster408 citations
- Learning To Estimate Hidden Motions With Global Motion AggregationPoster408 citations
- Mesh GraphormerPoster408 citations
- TransPose: Keypoint Localization via TransformerPoster408 citations
- TransVG: End-to-End Visual Grounding With TransformersPoster408 citations
- AutoFormer: Searching Transformers for Visual RecognitionPoster407 citations
- GLoRIA: A Multimodal Global-Local Representation Learning Framework for Label-Efficient Medical Image RecognitionPoster404 citations
- TAM: Temporal Adaptive Module for Video RecognitionPoster403 citations
- Hypersim: A Photorealistic Synthetic Dataset for Holistic Indoor Scene UnderstandingPoster395 citations
- ReStyle: A Residual-Based StyleGAN Encoder via Iterative RefinementPoster393 citations
- Generic Attention-Model Explainability for Interpreting Bi-Modal and Encoder-Decoder TransformersPoster392 citations
- Is Pseudo-Lidar Needed for Monocular 3D Object Detection?Poster388 citations
- PyMAF: 3D Human Pose and Shape Regression With Pyramidal Mesh Alignment Feedback LoopPoster386 citations
- TokenPose: Learning Keypoint Tokens for Human Pose EstimationPoster386 citations
- Fast Convergence of DETR With Spatially Modulated Co-AttentionPoster379 citations
- Parametric Contrastive LearningPoster377 citations
- TrivialAugment: Tuning-Free Yet State-of-the-Art Data AugmentationPoster371 citations
- Walk in the Cloud: Learning Curves for Point Clouds Shape AnalysisPoster367 citations
- Channel-Wise Knowledge Distillation for Dense PredictionPoster366 citations
- Instances As QueriesPoster365 citations
- Learning Self-Consistency for Deepfake DetectionPoster365 citations
- Rethinking Counting and Localization in Crowds: A Purely Point-Based FrameworkPoster365 citations
- Learning Target Candidate Association To Keep Track of What Not To TrackPoster364 citations
- Counterfactual Attention Learning for Fine-Grained Visual Categorization and Re-IdentificationPoster361 citations
- Focal Frequency Loss for Image Reconstruction and SynthesisPoster361 citations
- SelfReg: Self-Supervised Contrastive Regularization for Domain GeneralizationPoster360 citations
- Group-Free 3D Object Detection via TransformersPoster357 citations
- Learning Object-Compositional Neural Radiance Field for Editable Scene RenderingPoster356 citations
- HuMoR: 3D Human Motion Model for Robust Pose EstimationPoster354 citations
- CoMatch: Semi-Supervised Learning With Contrastive Graph RegularizationPoster353 citations
- DeFRCN: Decoupled Faster R-CNN for Few-Shot Object DetectionPoster347 citations
- Vector Neurons: A General Framework for SO(3)-Equivariant NetworksPoster345 citations
- From Goals, Waypoints & Paths to Long Term Human Trajectory ForecastingPoster343 citations
- DocFormer: End-to-End Transformer for Document UnderstandingPoster342 citations
- Fake It Till You Make It: Face Analysis in the Wild Using Synthetic Data AlonePoster339 citations
- Revisiting Stereo Depth Estimation From a Sequence-to-Sequence Perspective With TransformersPoster338 citations
- Just Ask: Learning To Answer Questions From Millions of Narrated VideosPoster337 citations
- Seasonal Contrast: Unsupervised Pre-Training From Uncurated Remote Sensing DataPoster336 citations
- RPVNet: A Deep and Efficient Range-Point-Voxel Fusion Network for LiDAR Point Cloud SegmentationPoster333 citations
- FIERY: Future Instance Prediction in Bird's-Eye View From Surround Monocular CamerasPoster330 citations
- Monocular, One-Stage, Regression of Multiple 3D PeoplePoster327 citations
- SnowflakeNet: Point Cloud Completion by Snowflake Point Deconvolution With Skip-TransformerPoster326 citations
- Generalized Source-Free Domain AdaptationPoster324 citations
- COTR: Correspondence Transformer for Matching Across ImagesPoster320 citations
- Self-Supervised Pretraining of 3D Features on Any Point-CloudPoster316 citations
- CondLaneNet: A Top-To-Down Lane Detection Framework Based on Conditional ConvolutionPoster315 citations
- Image Inpainting via Conditional Texture and Structure Dual GenerationPoster314 citations
- LIRA: Learnable, Imperceptible and Robust Backdoor AttacksPoster310 citations
- Learning To Diversify for Single Domain GeneralizationPoster307 citations
- Unsupervised Semantic Segmentation by Contrasting Object Mask ProposalsPoster307 citations
- Neural Radiance Flow for 4D View Synthesis and Video ProcessingPoster305 citations
- Editing Conditional Radiance FieldsPoster304 citations
- NerfingMVS: Guided Optimization of Neural Radiance Fields for Indoor Multi-View StereoPoster302 citations
- Multimodal Co-Attention Transformer for Survival Prediction in Gigapixel Whole Slide ImagesPoster301 citations
- RangeDet: In Defense of Range View for LiDAR-Based 3D Object DetectionPoster300 citations
- Unsupervised Point Cloud Pre-Training via Occlusion CompletionPoster300 citations
- Exploring Temporal Coherence for More General Video Face Forgery DetectionPoster299 citations
- Omnidata: A Scalable Pipeline for Making Multi-Task Mid-Level Vision Datasets From 3D ScansPoster299 citations
- Refining Activation Downsampling With SoftPoolPoster299 citations
- Improving 3D Object Detection With Channel-Wise TransformerPoster298 citations
- HiFT: Hierarchical Feature Transformer for Aerial TrackingPoster297 citations
- High-Fidelity Pluralistic Image Completion With TransformersPoster297 citations
- Vision-Language Transformer and Query Generation for Referring SegmentationPoster297 citations
- Channel Augmented Joint Learning for Visible-Infrared RecognitionPoster296 citations
- Uncertainty-Guided Transformer Reasoning for Camouflaged Object DetectionPoster296 citations
- 3D-FRONT: 3D Furnished Rooms With layOuts and semaNTicsPoster295 citations
- Gait Recognition via Effective Global-Local Feature Representation and Local Temporal AggregationPoster294 citations
- Geography-Aware Self-Supervised LearningPoster291 citations
- Admix: Enhancing the Transferability of Adversarial AttacksPoster290 citations
- GRF: Learning a General Radiance Field for 3D Representation and RenderingPoster290 citations
- Feature Importance-Aware Transferable Adversarial AttacksPoster288 citations
- Semi-Supervised Semantic Segmentation With Pixel-Level Contrastive Learning From a Class-Wise Memory BankPoster288 citations
- Continual Prototype Evolution: Learning Online From Non-Stationary Data StreamsPoster285 citations
- Rethinking the Backdoor Attacks' Triggers: A Frequency PerspectivePoster281 citations
- On the Robustness of Vision Transformers to Adversarial ExamplesPoster280 citations
- A Hybrid Video Anomaly Detection Framework via Memory-Augmented Flow Reconstruction and Flow-Guided Frame PredictionPoster278 citations
- TransFER: Learning Relation-Aware Facial Expression Representations With TransformersPoster278 citations
- Human Pose Regression With Residual Log-Likelihood EstimationPoster277 citations
- OpenGAN: Open-Set Recognition via Open Data GenerationPoster276 citations
- Adaptive Adversarial Network for Source-Free Domain AdaptationPoster274 citations
- Relational Embedding for Few-Shot ClassificationPoster274 citations
- Visformer: The Vision-Friendly TransformerPoster274 citations
- Anticipative Video TransformerPoster273 citations
- MVTN: Multi-View Transformation Network for 3D Shape RecognitionPoster269 citations
- Self-Calibrating Neural Radiance FieldsPoster268 citations
- ICE: Inter-Instance Contrastive Encoding for Unsupervised Person Re-IdentificationPoster266 citations
- Artificial Fingerprinting for Generative Models: Rooting Deepfake Attribution in Training DataPoster263 citations
- Geometry Uncertainty Projection Network for Monocular 3D Object DetectionPoster263 citations
- NEAT: Neural Attention Fields for End-to-End Autonomous DrivingPoster263 citations
- MSR-GCN: Multi-Scale Residual Graph Convolution Networks for Human Motion PredictionPoster262 citations
- Self-Knowledge Distillation With Progressive Refinement of TargetsPoster262 citations
- Learning To Track With Object PermanencePoster258 citations
- SNARF: Differentiable Forward Skinning for Animating Non-Rigid Neural Implicit ShapesPoster258 citations
- Specificity-Preserving RGB-D Saliency DetectionPoster256 citations
- TS-CAM: Token Semantic Coupled Attention Map for Weakly Supervised Object LocalizationPoster254 citations
- VidTr: Video Transformer Without ConvolutionsPoster253 citations
- HiNet: Deep Image Hiding by Invertible NetworkPoster252 citations
- PIRenderer: Controllable Portrait Image Generation via Semantic Neural RenderingPoster252 citations
- SS-IL: Separated Softmax for Incremental LearningPoster251 citations
- FaPN: Feature-Aligned Pyramid Network for Dense Image PredictionPoster250 citations
- Spatio-Temporal Self-Supervised Representation Learning for 3D Point CloudsPoster248 citations
- A Simple Feature Augmentation for Domain GeneralizationPoster246 citations
- Learning by Aligning: Visible-Infrared Person Re-Identification Using Cross-Modal CorrespondencesPoster246 citations
- FREE: Feature Refinement for Generalized Zero-Shot LearningPoster244 citations
- MeshTalk: 3D Face Animation From Speech Using Cross-Modality DisentanglementPoster241 citations
- Learn To Match: Automatic Matching Network Design for Visual TrackingPoster239 citations
- Transformer-Based Attention Networks for Continuous Pixel-Wise PredictionPoster239 citations
- End-to-End Dense Video Captioning With Parallel DecodingPoster238 citations
- CodeNeRF: Disentangled Neural Radiance Fields for Object CategoriesPoster236 citations
- On Feature Decorrelation in Self-Supervised LearningPoster236 citations
- A Unified Objective for Novel Class DiscoveryPoster235 citations
- Image Retrieval on Real-Life Images With Pre-Trained Vision-and-Language ModelsPoster235 citations
- ResRep: Lossless CNN Pruning via Decoupling Remembering and ForgettingPoster235 citations
- Relaxed Transformer Decoders for Direct Action Proposal GenerationPoster234 citations
- ALL Snow Removed: Single Image Desnowing Algorithm Using Hierarchical Dual-Tree Complex Wavelet Representation and Contradict Channel LossPoster232 citations
- End-to-End Urban Driving by Imitating a Reinforcement Learning CoachPoster232 citations
- Image Manipulation Detection by Multi-View Multi-Scale SupervisionPoster231 citations
- Neural Articulated Radiance FieldPoster231 citations
- Simpler Is Better: Few-Shot Semantic Segmentation With Classifier Weight TransformerPoster229 citations
- Pixel Contrastive-Consistent Semi-Supervised Semantic SegmentationPoster226 citations
- Temporal-Wise Attention Spiking Neural Networks for Event Streams ClassificationPoster224 citations
- GNeRF: GAN-Based Neural Radiance Field Without Posed CameraPoster223 citations
- Perception-Aware Multi-Sensor Fusion for 3D LiDAR Semantic SegmentationPoster223 citations
- ARCH++: Animation-Ready Clothed Human Reconstruction RevisitedPoster222 citations
- Always Be Dreaming: A New Approach for Data-Free Class-Incremental LearningPoster219 citations
- ID-Reveal: Identity-Aware DeepFake Video DetectionPoster219 citations
- Episodic Transformer for Vision-and-Language NavigationPoster214 citations
- Cross-Modality Person Re-Identification via Modality Confusion and Center AggregationPoster213 citations
- Score-Based Point Cloud DenoisingPoster211 citations
- XVFI: eXtreme Video Frame InterpolationPoster210 citations
- Contrastive Learning for Label Efficient Semantic SegmentationPoster209 citations
- Pixel-Perfect Structure-From-Motion With Featuremetric RefinementPoster209 citations
- Joint Audio-Visual Deepfake DetectionPoster207 citations
- OMNet: Learning Overlapping Mask for Partial-to-Partial Point Cloud RegistrationPoster207 citations
- H2O: Two Hands Manipulating Objects for First Person Interaction RecognitionPoster205 citations
- Panoptic Segmentation of Satellite Image Time Series With Convolutional Temporal Attention NetworksPoster204 citations
- Synthesis of Compositional Animations From Textual DescriptionsPoster202 citations
- Where2Act: From Pixels to Actions for Articulated 3D ObjectsPoster202 citations
- Pyramid R-CNN: Towards Better Performance and Adaptability for 3D Object DetectionPoster201 citations
- TF-Blender: Temporal Feature Blender for Video Object DetectionPoster200 citations
- Influence-Balanced Loss for Imbalanced Visual ClassificationPoster199 citations
- ShapeConv: Shape-Aware Convolutional Layer for Indoor RGB-D Semantic SegmentationPoster199 citations
- SPG: Unsupervised Domain Adaptation for 3D Object Detection via Semantic Point GenerationPoster198 citations
- Space-Time-Separable Graph Convolutional Network for Pose ForecastingPoster197 citations
- Residual Attention: A Simple but Effective Method for Multi-Label RecognitionPoster196 citations
- AA-RMVSNet: Adaptive Aggregation Recurrent Multi-View Stereo NetworkPoster195 citations
- Divide-and-Assemble: Learning Block-Wise Memory for Unsupervised Anomaly DetectionPoster193 citations
- Hierarchical Aggregation for 3D Instance SegmentationPoster193 citations
- OVANet: One-vs-All Network for Universal Domain AdaptationPoster193 citations
- Naturalistic Physical Adversarial Patch for Object DetectorsPoster192 citations
- HiT: Hierarchical Transformer With Momentum Contrast for Video-Text RetrievalPoster191 citations
- Semi-Supervised Learning of Visual Features by Non-Parametrically Predicting View Assignments With Support SamplesPoster191 citations
- Evidential Deep Learning for Open Set Action RecognitionPoster190 citations
- Leveraging Auxiliary Tasks With Affinity Learning for Weakly Supervised Semantic SegmentationPoster190 citations
- Stochastic Scene-Aware Motion PredictionPoster190 citations
- Adaptive Graph Convolution for Point Cloud AnalysisPoster189 citations
- Hand-Object Contact Consistency Reasoning for Human Grasps GenerationPoster189 citations
- Visual Alignment Constraint for Continuous Sign Language RecognitionPoster189 citations
- Probabilistic Modeling for Human Mesh RecoveryPoster188 citations
- Efficient Visual Pretraining With Contrastive DetectionPoster187 citations
- Scalable Vision Transformers With Hierarchical PoolingPoster186 citations
- ACE: Ally Complementary Experts for Solving Long-Tailed Recognition in One-ShotPoster185 citations
- Fog Simulation on Real LiDAR Point Clouds for 3D Object Detection in Adverse WeatherPoster185 citations
- Self-Supervised Video Object Segmentation by Motion GroupingPoster185 citations
- Asymmetric Bilateral Motion Estimation for Video Frame InterpolationPoster184 citations
- From Two to One: A New Scene Text Recognizer With Visual Language Modeling NetworkPoster184 citations
- LayoutTransformer: Layout Generation and Completion With Self-AttentionPoster184 citations
- Video Self-Stitching Graph Network for Temporal Action LocalizationPoster184 citations
- Zen-NAS: A Zero-Shot NAS for High-Performance Image RecognitionPoster184 citations
- Gait Recognition in the Wild: A BenchmarkPoster182 citations
- Large-Scale Robust Deep AUC Maximization: A New Surrogate Loss and Empirical Studies on Medical Image ClassificationPoster181 citations
- 3DVG-Transformer: Relation Modeling for Visual Grounding on Point CloudsPoster180 citations
- Full-Duplex Strategy for Video Object SegmentationPoster180 citations
- CrackFormer: Transformer Network for Fine-Grained Crack DetectionPoster179 citations
- FuseFormer: Fusing Fine-Grained Information in Transformers for Video InpaintingPoster179 citations
- Modulated Graph Convolutional Network for 3D Human Pose EstimationPoster179 citations
- DeepCAD: A Deep Generative Network for Computer-Aided Design ModelsPoster178 citations
- Explaining in Style: Training a GAN To Explain a Classifier in StyleSpacePoster178 citations
- Syncretic Modality Collaborative Learning for Visible Infrared Person Re-IdentificationPoster178 citations
- Learnable Boundary Guided Adversarial TrainingPoster177 citations
- Better Aggregation in Test-Time AugmentationPoster176 citations
- Spatial-Temporal Transformer for Dynamic Scene Graph GenerationPoster175 citations
- Active Domain Adaptation via Clustering Uncertainty-Weighted EmbeddingsPoster173 citations
- GAN-Control: Explicitly Controllable GANsPoster173 citations
- Complementary Patch for Weakly Supervised Semantic SegmentationPoster172 citations
- CrossCLR: Cross-Modal Contrastive Learning for Multi-Modal Video RepresentationsPoster172 citations
- MINE: Towards Continuous Depth MPI With NeRF for Novel View SynthesisPoster171 citations
- Entropy Maximization and Meta Classification for Out-of-Distribution Detection in Semantic SegmentationPoster170 citations
- Learning To Resize Images for Computer Vision TasksPoster170 citations
- SENTRY: Selective Entropy Optimization via Committee Consistency for Unsupervised Domain AdaptationPoster170 citations
- Semantically Coherent Out-of-Distribution DetectionPoster170 citations
- Airbert: In-Domain Pretraining for Vision-and-Language NavigationPoster169 citations
- Context-Sensitive Temporal Feature Learning for Gait RecognitionPoster169 citations
- Domain Adaptive Semantic Segmentation With Self-Supervised Depth EstimationPoster169 citations
- Infinite Nature: Perpetual View Generation of Natural Scenes From a Single ImagePoster169 citations
- Geometry-Based Distance Decomposition for Monocular 3D Object DetectionPoster168 citations
- DOLG: Single-Stage Image Retrieval With Deep Orthogonal Fusion of Local and Global FeaturesPoster167 citations
- Graph Contrastive ClusteringPoster167 citations
- Reconstructing Hand-Object Interactions in the WildPoster167 citations
- TeachText: CrossModal Generalized Distillation for Text-Video RetrievalPoster167 citations
- AutoShape: Real-Time Shape-Aware Monocular 3D Object DetectionPoster165 citations
- Meta-Learning With Task-Adaptive Loss Function for Few-Shot LearningPoster165 citations
- IDM: An Intermediate Domain Module for Domain Adaptive Person Re-IDPoster164 citations
- Predicting With Confidence on Unseen DistributionsPoster164 citations
- Learning Skeletal Graph Neural Networks for Hard 3D Pose EstimationPoster163 citations
- Mining Latent Classes for Few-Shot SegmentationPoster162 citations
- Modulated Periodic Activations for Generalizable Local Functional RepresentationsPoster162 citations
- Perturbed Self-Distillation: Weakly Supervised Large-Scale Point Cloud Semantic SegmentationPoster162 citations
- Re-Distributing Biased Pseudo Labels for Semi-Supervised Semantic Segmentation: A Baseline InvestigationPoster162 citations
- Active Learning for Deep Object Detection via Probabilistic ModelingPoster161 citations
- FACIAL: Synthesizing Dynamic Talking Face With Implicit Attribute LearningPoster161 citations
- Unlocking the Potential of Ordinary Classifier: Class-Specific Adversarial Erasing Framework for Weakly Supervised Semantic SegmentationPoster161 citations
- Guided Point Contrastive Learning for Semi-Supervised Point Cloud Semantic SegmentationPoster160 citations
- Multi-VAE: Learning Disentangled View-Common and View-Peculiar Visual Representations for Multi-View ClusteringPoster160 citations
- SO-Pose: Exploiting Self-Occlusion for Direct 6D Pose EstimationPoster160 citations
- SPEC: Seeing People in the Wild With an Estimated CameraPoster160 citations
- Unconstrained Scene Generation With Locally Conditioned Radiance FieldsPoster160 citations
- CM-NAS: Cross-Modality Neural Architecture Search for Visible-Infrared Person Re-IdentificationPoster159 citations
- CR-Fill: Generative Image Inpainting With Auxiliary Contextual ReconstructionPoster159 citations
- MOTSynth: How Can Synthetic Data Help Pedestrian Detection and Tracking?Poster159 citations
- TACo: Token-Aware Cascade Contrastive Learning for Video-Text AlignmentPoster159 citations
- RECALL: Replay-Based Continual Learning in Semantic SegmentationPoster158 citations
- GroupFormer: Group Activity Recognition With Clustered Spatial-Temporal TransformerPoster157 citations
- SGPA: Structure-Guided Prior Adaptation for Category-Level 6D Object Pose EstimationPoster156 citations
- DualPoseNet: Category-Level 6D Object Pose and Size Estimation Using Dual Pose Network With Refined Learning of Pose ConsistencyPoster155 citations
- Single-Shot Hyperspectral-Depth Imaging With Learned Diffractive OpticsPoster155 citations
- Spatially-Adaptive Image Restoration Using Distortion-Guided NetworksPoster155 citations
- Multitask AET With Orthogonal Tangent Regularity for Dark Object DetectionPoster154 citations
- OadTR: Online Action Detection With TransformersPoster154 citations
- SynFace: Face Recognition With Synthetic DataPoster154 citations
- Fourier Space Losses for Efficient Perceptual Image Super-ResolutionPoster153 citations
- Context Decoupling Augmentation for Weakly Supervised Semantic SegmentationPoster152 citations
- DC-ShadowNet: Single-Image Hard and Soft Shadow Removal Using Unsupervised Domain-Classifier Guided NetworkPoster152 citations
- Understanding and Evaluating Racial Biases in Image CaptioningPoster152 citations
- Weakly Supervised Contrastive LearningPoster152 citations
- Broaden Your Views for Self-Supervised Video LearningPoster151 citations
- Recurrent Mask Refinement for Few-Shot Medical Image SegmentationPoster151 citations
- A Simple Baseline for Semi-Supervised Semantic Segmentation With Strong Data AugmentationPoster150 citations
- Hierarchical Memory Matching Network for Video Object SegmentationPoster149 citations
- Learning Meta-Class Memory for Few-Shot Semantic SegmentationPoster149 citations
- Query Adaptive Few-Shot Object Detection With Heterogeneous Graph Convolutional NetworksPoster149 citations
- Unidentified Video Objects: A Benchmark for Dense, Open-World SegmentationPoster149 citations
- Enriching Local and Global Contexts for Temporal Action LocalizationPoster148 citations
- Ensemble Attention Distillation for Privacy-Preserving Federated LearningPoster148 citations
- FASA: Feature Augmentation and Sampling Adaptation for Long-Tailed Instance SegmentationPoster148 citations
- InstanceRefer: Cooperative Holistic Understanding for Visual Grounding on Point Clouds Through Instance Multi-Level Contextual ReferringPoster147 citations
- KoDF: A Large-Scale Korean DeepFake Detection DatasetPoster147 citations
- Spatially Conditioned Graphs for Detecting Human-Object InteractionsPoster147 citations
- Z-Score Normalization, Hubness, and Few-Shot LearningPoster147 citations
- DAE-GAN: Dynamic Aspect-Aware GAN for Text-to-Image SynthesisPoster146 citations
- Densely Guided Knowledge Distillation Using Multiple Teacher AssistantsPoster146 citations
- Universal-Prototype Enhancing for Few-Shot Object DetectionPoster146 citations
- Learning a Single Network for Scale-Arbitrary Super-ResolutionPoster145 citations
- Probabilistic Monocular 3D Human Pose Estimation With Normalizing FlowsPoster145 citations
- R-MSFM: Recurrent Multi-Scale Feature Modulation for Monocular Depth EstimatingPoster145 citations
- Learning Multi-Scene Absolute Pose Regression With TransformersPoster144 citations
- LookOut: Diverse Multi-Future Prediction and Planning for Self-DrivingPoster144 citations
- Structure-Preserving Deraining With Residue Channel Prior GuidancePoster144 citations
- Instance Segmentation in 3D Scenes Using Semantic Superpoint Tree NetworksPoster143 citations
- MG-GAN: A Multi-Generator Model Preventing Out-of-Distribution Samples in Pedestrian Trajectory PredictionPoster143 citations
- Region-Aware Contrastive Learning for Semantic SegmentationPoster143 citations
- Black-Box Detection of Backdoor Attacks With Limited Information and DataPoster142 citations
- BossNAS: Exploring Hybrid CNN-Transformers With Block-Wisely Self-Supervised Neural Architecture SearchPoster142 citations
- Generalize Then Adapt: Source-Free Domain Adaptive Semantic SegmentationPoster142 citations
- Interpretable Image Recognition by Constructing Transparent Embedding SpacePoster142 citations
- Learning To Match Features With Seeded Graph Matching NetworkPoster142 citations
- Pyramid Point Cloud Transformer for Large-Scale Place RecognitionPoster142 citations
- CPF: Learning a Contact Potential Field To Model the Hand-Object InteractionPoster141 citations
- High-Performance Discriminative Tracking With TransformersPoster141 citations
- Mutual Affine Network for Spatially Variant Kernel Estimation in Blind Image Super-ResolutionPoster141 citations
- Talk-To-Edit: Fine-Grained Facial Editing via DialogPoster141 citations
- Occlude Them All: Occlusion-Aware Attention Network for Occluded Person Re-IDPoster140 citations
- RGB-D Saliency Detection via Cascaded Mutual Information MinimizationPoster139 citations
- Region Similarity Representation LearningPoster139 citations
- Social NCE: Contrastive Learning of Socially-Aware Motion RepresentationsPoster139 citations
- RFNet: Region-Aware Fusion Network for Incomplete Multi-Modal Brain Tumor SegmentationPoster138 citations
- Semantics Disentangling for Generalized Zero-Shot LearningPoster138 citations
- Change Is Everywhere: Single-Temporal Supervised Object Change Detection in Remote Sensing ImageryPoster137 citations
- Crossover Learning for Fast Online Video Instance SegmentationPoster137 citations
- ECS-Net: Improving Weakly Supervised Semantic Segmentation by Using Connections Between Class Activation MapsPoster137 citations
- EPP-MVSNet: Epipolar-Assembling Based Depth Prediction for Multi-View StereoPoster137 citations
- Learning To Drive From a World on RailsPoster137 citations
- Deep Hough Voting for Robust Global RegistrationPoster136 citations
- Distributional Robustness Loss for Long-Tail LearningPoster136 citations
- GraphFPN: Graph Feature Pyramid Network for Object DetectionPoster136 citations
- Rethinking the Truly Unsupervised Image-to-Image TranslationPoster136 citations
- SAT: 2D Semantics Assisted Training for 3D Visual GroundingPoster136 citations
- Structured Bird's-Eye-View Traffic Scene Understanding From Onboard ImagesPoster136 citations
- Towards Real-World X-Ray Security Inspection: A High-Quality Benchmark and Lateral Inhibition Module for Prohibited Items DetectionPoster136 citations
- Vector-Decomposed Disentanglement for Domain-Invariant Object DetectionPoster136 citations
- HeadGAN: One-Shot Neural Head Synthesis and EditingPoster135 citations
- Self-Mutual Distillation Learning for Continuous Sign Language RecognitionPoster135 citations
- 3D Local Convolutional Neural Networks for Gait RecognitionPoster134 citations
- Separable Flow: Learning Motion Cost Volumes for Optical Flow EstimationPoster134 citations
- Fine-Grained Semantics-Aware Representation Enhancement for Self-Supervised Monocular Depth EstimationPoster133 citations
- HRegNet: A Hierarchical Network for Large-Scale Outdoor LiDAR Point Cloud RegistrationPoster133 citations
- Online Knowledge Distillation for Efficient Pose EstimationPoster133 citations
- The Way to My Heart Is Through Contrastive Learning: Remote Photoplethysmography From Unlabelled VideoPoster133 citations
- ELF-VC: Efficient Learned Flexible-Rate Video CodingPoster132 citations
- Elaborative Rehearsal for Zero-Shot Action RecognitionPoster132 citations
- Learning From Noisy Data With Robust Representation LearningPoster132 citations
- WaveFill: A Wavelet-Based Generation Network for Image InpaintingPoster132 citations
- GANcraft: Unsupervised 3D Neural Rendering of Minecraft WorldsPoster131 citations
- GLiT: Neural Architecture Search for Global and Local Image TransformerPoster131 citations
- Knowledge-Enriched Distributional Model Inversion AttacksPoster131 citations
- Saliency-Associated Object TrackingPoster131 citations
- Adaptive Unfolding Total Variation Network for Low-Light Image EnhancementPoster130 citations
- Audio2Gestures: Generating Diverse Gestures From Speech Audio With Conditional Variational AutoencodersPoster130 citations
- Clothing Status Awareness for Long-Term Person Re-IdentificationPoster130 citations
- Distilling Virtual Examples for Long-Tailed RecognitionPoster130 citations
- Fast Video Moment RetrievalPoster130 citations
- SOTR: Segmenting Objects With TransformersPoster130 citations
- LIGA-Stereo: Learning LiDAR Geometry Aware Representations for Stereo-Based 3D DetectorPoster129 citations
- Towards Flexible Blind JPEG Artifacts RemovalPoster129 citations
- Causal Attention for Unbiased Visual RecognitionPoster128 citations
- Dynamic Context-Sensitive Filtering Network for Video Salient Object DetectionPoster128 citations
- Neural-GIF: Neural Generalized Implicit Functions for Animating People in ClothingPoster128 citations
- Amplitude-Phase Recombination: Rethinking Robustness of Convolutional Neural Networks in Frequency DomainPoster127 citations
- Collaborative Unsupervised Visual Representation Learning From Decentralized DataPoster127 citations
- Estimating and Exploiting the Aleatoric Uncertainty in Surface Normal EstimationPoster127 citations
- Multi-View 3D Reconstruction With TransformersPoster126 citations
- Revisiting Adversarial Robustness Distillation: Robust Soft Labels Make Student BetterPoster126 citations
- Self-Supervised Neural Networks for Spectral Snapshot Compressive ImagingPoster126 citations
- Vision Transformer With Progressive SamplingPoster126 citations
- AdvDrop: Adversarial Attack to DNNs by Dropping InformationPoster125 citations
- Exploring Inter-Channel Correlation for Diversity-Preserved Knowledge DistillationPoster125 citations
- Hierarchical Conditional Flow: A Unified Framework for Image Super-Resolution and Image RescalingPoster125 citations
- Self Supervision to Distillation for Long-Tailed Visual RecognitionPoster125 citations
- Unshuffling Data for Improved Generalization in Visual Question AnsweringPoster125 citations
- Exploring Classification Equilibrium in Long-Tailed Object DetectionPoster124 citations
- MultiSports: A Multi-Person Video Dataset of Spatio-Temporally Localized Sports ActionsPoster124 citations
- Group-Aware Contrastive Regression for Action Quality AssessmentPoster123 citations
- Skeleton Cloud Colorization for Unsupervised 3D Action Representation LearningPoster123 citations
- Spatial Uncertainty-Aware Semi-Supervised Crowd CountingPoster123 citations
- StyleFormer: Real-Time Arbitrary Style Transfer via Parametric Style CompositionPoster123 citations
- Video Instance Segmentation With a Propose-Reduce ParadigmPoster123 citations
- Box-Aware Feature Enhancement for Single Object Tracking on Point CloudsPoster122 citations
- Joint Inductive and Transductive Learning for Video Object SegmentationPoster122 citations
- Adaptive Boundary Proposal Network for Arbitrary Shape Text DetectionPoster121 citations
- Adaptive Focus for Efficient Video RecognitionPoster121 citations
- Understanding and Mitigating Annotation Bias in Facial Expression RecognitionPoster121 citations
- imGHUM: Implicit Generative Models of 3D Human Shape and Articulated PosePoster121 citations
- A Broad Study on the Transferability of Visual Representations With Contrastive LearningPoster120 citations
- Graspness Discovery in Clutters for Fast and Accurate Grasp DetectionPoster120 citations
- STAR: A Structure-Aware Lightweight Transformer for Real-Time Image EnhancementPoster120 citations
- TRAR: Routing the Attention Spans in Transformer for Visual Question AnsweringPoster120 citations
- Towards Face Encryption by Generating Adversarial Identity MasksPoster120 citations
- Transformer-Based Dual Relation Graph for Multi-Label Image RecognitionPoster120 citations
- Uncertainty-Aware Pseudo Label Refinery for Domain Adaptive Semantic SegmentationPoster120 citations
- Online Pseudo Label Generation by Hierarchical Cluster Dynamics for Adaptive Person Re-IdentificationPoster119 citations
- Pseudo-Mask Matters in Weakly-Supervised Semantic SegmentationPoster119 citations
- The Power of Points for Modeling Humans in ClothingPoster119 citations
- Towards Vivid and Diverse Image Colorization With Generative Color PriorPoster119 citations
- Universal Representation Learning From Multiple Domains for Few-Shot ClassificationPoster119 citations
- Variable-Rate Deep Image Compression Through Spatially-Adaptive Feature TransformPoster119 citations
- Deep Co-Training With Task Decomposition for Semi-Supervised Domain AdaptationPoster118 citations
- NPMs: Neural Parametric Models for 3D Deformable ShapesPoster118 citations
- Rehearsal Revealed: The Limits and Merits of Revisiting Samples in Continual LearningPoster118 citations
- Single Image Defocus Deblurring Using Kernel-Sharing Parallel Atrous ConvolutionsPoster118 citations
- 4DComplete: Non-Rigid Motion Estimation Beyond the Observable SurfacePoster117 citations
- A-SDF: Learning Disentangled Signed Distance Functions for Articulated Shape RepresentationPoster117 citations
- DRB-GAN: A Dynamic ResBlock Generative Adversarial Network for Artistic Style TransferPoster117 citations
- Multi-Task Self-Training for Learning General RepresentationsPoster117 citations
- Seeing Dynamic Scene in the Dark: A High-Quality Video Dataset With Mechatronic AlignmentPoster117 citations
- Semantic Concentration for Domain AdaptationPoster117 citations
- Student Customized Knowledge Distillation: Bridging the Gap Between Student and TeacherPoster117 citations
- Conditional Diffusion for Interactive SegmentationPoster116 citations
- Dressing in Order: Recurrent Person Image Generation for Pose Transfer, Virtual Try-On and Outfit EditingPoster116 citations
- Learning Motion Priors for 4D Human Body Capture in 3D ScenesPoster116 citations
- Preservational Learning Improves Self-Supervised Medical Image Models by Reconstructing Diverse ContextsPoster116 citations
- Towards Real-World Prohibited Item Detection: A Large-Scale X-Ray BenchmarkPoster116 citations
- Dynamic Attentive Graph Learning for Image RestorationPoster115 citations
- Equivariant Imaging: Learning Beyond the Range SpacePoster115 citations
- FloW: A Dataset and Benchmark for Floating Waste Detection in Inland WatersPoster115 citations
- PnP-DETR: Towards Efficient Visual Analysis With TransformersPoster115 citations
- CAPTRA: CAtegory-Level Pose Tracking for Rigid and Articulated Objects From Point CloudsPoster114 citations
- ReCU: Reviving the Dead Weights in Binary Neural NetworksPoster114 citations
- Rethinking Self-Supervised Correspondence Learning: A Video Frame-Level Similarity PerspectivePoster114 citations
- Binocular Mutual Learning for Improving Few-Shot ClassificationPoster113 citations
- LOKI: Long Term and Key Intentions for Trajectory PredictionPoster113 citations
- Motion Deblurring With Real EventsPoster113 citations
- One-Pass Multi-View Clustering for Large-Scale DataPoster113 citations
- SLIM: Self-Supervised LiDAR Scene Flow and Motion SegmentationPoster113 citations
- Standardized Max Logits: A Simple yet Effective Approach for Identifying Unexpected Road Obstacles in Urban-Scene SegmentationPoster113 citations
- Exploiting Explanations for Model Inversion AttacksPoster112 citations
- Learning Fast Sample Re-Weighting Without Reward DataPoster112 citations
- Object Tracking by Jointly Exploiting Frame and Event DomainPoster112 citations
- Sparse Needlets for Lighting Estimation With Spherical Transport LossPoster112 citations
- Spatio-Temporal Dynamic Inference Network for Group Activity RecognitionPoster112 citations
- CANet: A Context-Aware Network for Shadow RemovalPoster111 citations
- E-ViL: A Dataset and Benchmark for Natural Language Explanations in Vision-Language TasksPoster111 citations
- Event-Based Video Reconstruction Using TransformerPoster111 citations
- Influence Selection for Active LearningPoster111 citations
- Interacting Two-Hand 3D Pose and Shape Reconstruction From Single Color ImagePoster111 citations
- Seeking Similarities Over Differences: Similarity-Based Domain Alignment for Adaptive Object DetectionPoster111 citations
- DeepMultiCap: Performance Capture of Multiple Characters Using Sparse Multiview CamerasPoster110 citations
- Graph-Based Asynchronous Event Processing for Rapid Object RecognitionPoster110 citations
- Instance-Level Image Retrieval Using Reranking TransformersPoster110 citations
- Learning of Visual Relations: The Devil Is in the TailsPoster110 citations
- Location-Aware Single Image Reflection RemovalPoster110 citations
- Mean Shift for Self-Supervised LearningPoster110 citations
- Multimodal Clustering Networks for Self-Supervised Learning From Unlabeled VideosPoster110 citations
- Physics-Based Human Motion Estimation and Synthesis From VideosPoster110 citations
- A Hierarchical Transformation-Discriminating Generative Model for Few Shot Anomaly DetectionPoster109 citations
- Auxiliary Tasks and Exploration Enable ObjectGoal NavigationPoster109 citations
- Dynamic High-Pass Filtering and Multi-Spectral Attention for Image Super-ResolutionPoster109 citations
- Excavating the Potential Capacity of Self-Supervised Monocular Depth EstimationPoster109 citations
- Exploring Simple 3D Multi-Object Tracking for Autonomous DrivingPoster109 citations
- C2N: Practical Generative Noise Modeling for Real-World DenoisingPoster108 citations
- Unsupervised Depth Completion With Calibrated Backprojection LayersPoster108 citations
- A Latent Transformer for Disentangled Face Editing in Images and VideosPoster107 citations
- NGC: A Unified Framework for Learning With Open-World Noisy DataPoster107 citations
- Pyramid Spatial-Temporal Aggregation for Video-Based Person Re-IdentificationPoster107 citations
- Disentangled High Quality Salient Object DetectionPoster106 citations
- Divide and Contrast: Self-Supervised Learning From Uncurated DataPoster106 citations
- Enhanced Boundary Learning for Glass-Like Object SegmentationPoster106 citations
- Frequency Domain Image Translation: More Photo-Realistic, Better Identity-PreservingPoster106 citations
- Generative Layout Modeling Using Constraint GraphsPoster106 citations
- IntraTomo: Self-Supervised Learning-Based Tomography via Sinogram Synthesis and PredictionPoster106 citations
- Learning Signed Distance Field for Multi-View Surface ReconstructionPoster106 citations
- Online Continual Learning With Natural Distribution Shifts: An Empirical Study With Visual DataPoster106 citations
- Domain Generalization via Gradient SurgeryPoster105 citations
- From General to Specific: Informative Scene Graph Generation via Balance AdjustmentPoster105 citations
- Mining Contextual Information Beyond Image for Semantic SegmentationPoster105 citations
- Mixture-Based Feature Space Learning for Few-Shot Image ClassificationPoster105 citations
- N-ImageNet: Towards Robust, Fine-Grained Object Recognition With Event CamerasPoster105 citations
- Encoder-Decoder With Multi-Level Attention for 3D Human Shape and Pose EstimationPoster104 citations
- H3D-Net: Few-Shot High-Fidelity 3D Head ReconstructionPoster104 citations
- Improving Contrastive Learning by Visualizing Feature TransformationPoster104 citations
- Instance-Wise Hard Negative Example Generation for Contrastive Learning in Unpaired Image-to-Image TranslationPoster104 citations
- SignBERT: Pre-Training of Hand-Model-Aware Representation for Sign Language RecognitionPoster104 citations
- Towards Better Explanations of Class Activation MappingPoster104 citations
- Generating Smooth Pose Sequences for Diverse Human Motion PredictionPoster103 citations
- Representative Color Transform for Image EnhancementPoster103 citations
- Video-Based Person Re-Identification With Spatial and Temporal Memory NetworksPoster103 citations
- Beyond Question-Based Biases: Assessing Multimodal Shortcut Learning in Visual Question AnsweringPoster102 citations
- BiaSwap: Removing Dataset Bias With Bias-Tailored Swapping AugmentationPoster102 citations
- Geometry-Free View Synthesis: Transformers and No 3D PriorsPoster102 citations
- Meta Gradient Adversarial AttackPoster102 citations
- MicroNet: Improving Image Recognition With Extremely Low FLOPsPoster102 citations
- BAPA-Net: Boundary Adaptation and Prototype Alignment for Cross-Domain Semantic SegmentationPoster101 citations
- HIRE-SNN: Harnessing the Inherent Robustness of Energy-Efficient Deep Spiking Neural Networks by Training With Crafted Input NoisePoster101 citations
- Compressing Visual-Linguistic Model via Knowledge DistillationPoster100 citations
- Free-Form Description Guided 3D Visual Graph Network for Object Grounding in Point CloudPoster100 citations
- Multiple Heads Are Better Than One: Few-Shot Font Generation With Multiple Localized ExpertsPoster100 citations
- RePOSE: Fast 6D Object Pose Refinement via Deep Texture RenderingPoster100 citations
- Deep Metric Learning for Open World Semantic SegmentationPoster99 citations
- Labels4Free: Unsupervised Segmentation Using StyleGANPoster99 citations
- Learning Action Completeness From Points for Weakly-Supervised Temporal Action LocalizationPoster99 citations
- Multi-Instance Pose Networks: Rethinking Top-Down Pose EstimationPoster99 citations
- OpenForensics: Large-Scale Challenging Dataset for Multi-Face Forgery Detection and Segmentation In-the-WildPoster99 citations
- Pano-AVQA: Grounded Audio-Visual Question Answering on 360deg VideosPoster99 citations
- Vision-Language Navigation With Random Environmental MixupPoster99 citations
- C3-SemiSeg: Contrastive Semi-Supervised Segmentation via Cross-Set Learning and Dynamic Class-BalancingPoster98 citations
- Context-Aware Scene Graph Generation With Seq2Seq TransformersPoster98 citations
- High-Resolution Optical Flow From 1D Attention and CorrelationPoster98 citations
- Real-Time Image Enhancer via Learnable Spatial-Aware 3D Lookup TablesPoster98 citations
- Unsupervised Domain Adaptive 3D Detection With Multi-Level ConsistencyPoster98 citations
- DeepGaze IIE: Calibrated Prediction in and Out-of-Domain for State-of-the-Art Saliency ModelingPoster97 citations
- Exploring Relational Context for Multi-Task Dense PredictionPoster97 citations
- Foreground-Action Consistency Network for Weakly Supervised Temporal Action LocalizationPoster97 citations
- Omniscient Video Super-ResolutionPoster97 citations
- ProFlip: Targeted Trojan Attack With Progressive Bit FlipsPoster97 citations
- ReDAL: Region-Based and Diversity-Aware Active Learning for Point Cloud Semantic SegmentationPoster97 citations
- Adversarial Unsupervised Domain Adaptation With Conditional and Label Shift: Infer, Align and IteratePoster96 citations
- DiscoBox: Weakly Supervised Instance Segmentation and Semantic Correspondence From Box SupervisionPoster96 citations
- Domain-Invariant Disentangled Network for Generalizable Object DetectionPoster96 citations
- MonoIndoor: Towards Good Practice of Self-Supervised Monocular Depth Estimation for Indoor EnvironmentsPoster96 citations
- SSH: A Self-Supervised Framework for Image HarmonizationPoster96 citations
- Multi-View Radar Semantic SegmentationPoster95 citations
- Orthogonal Projection LossPoster95 citations
- A Backdoor Attack Against 3D Point Cloud ClassifiersPoster94 citations
- Accelerating Atmospheric Turbulence Simulation via Learned Phase-to-Space TransformPoster94 citations
- Federated Learning for Non-IID Data via Unified Feature Learning and Optimization Objective AlignmentPoster94 citations
- Human Trajectory Prediction via Counterfactual AnalysisPoster94 citations
- Learning Cross-Modal Contrastive Features for Video Domain AdaptationPoster94 citations
- Partner-Assisted Learning for Few-Shot Image ClassificationPoster94 citations
- Point-Set Distances for Learning Representations of 3D Point CloudsPoster94 citations
- Waypoint Models for Instruction-Guided Navigation in Continuous EnvironmentsPoster94 citations
- Do Image Classifiers Generalize Across Time?Poster93 citations
- Paint Transformer: Feed Forward Neural Painting With Stroke PredictionPoster93 citations
- Spatio-Temporal Representation Factorization for Video-Based Person Re-IdentificationPoster93 citations
- Aligning Latent and Image Spaces To Connect the UnconnectablePoster92 citations
- DepthTrack: Unveiling the Power of RGBD TrackingPoster92 citations
- Exploiting a Joint Embedding Space for Generalized Zero-Shot Semantic SegmentationPoster92 citations
- Gradient Normalization for Generative Adversarial NetworksPoster92 citations
- On Generating Transferable Targeted PerturbationsPoster92 citations
- Prototypical Matching and Open Set Rejection for Zero-Shot Semantic SegmentationPoster92 citations
- Sketch Your Own GANPoster92 citations
- Zero-Shot Day-Night Domain Adaptation With a Physics PriorPoster92 citations
- Collaborative Optimization and Aggregation for Decentralized Domain Generalization and AdaptationPoster91 citations
- ISNet: Integrate Image-Level and Semantic-Level Context for Semantic SegmentationPoster91 citations
- Image Harmonization With TransformerPoster91 citations
- MGSampler: An Explainable Sampling Strategy for Video Action RecognitionPoster91 citations
- Progressive Correspondence Pruning by Consensus LearningPoster91 citations
- Regularizing Nighttime Weirdness: Efficient Self-Supervised Monocular Depth Estimation in the DarkPoster91 citations
- THDA: Treasure Hunt Data Augmentation for Semantic NavigationPoster91 citations
- Learning To Stylize Novel ViewsPoster90 citations
- Local Temperature Scaling for Probability CalibrationPoster90 citations
- Context Reasoning Attention Network for Image Super-ResolutionPoster89 citations
- Iterative Label Cleaning for Transductive and Semi-Supervised Few-Shot LearningPoster89 citations
- LapsCore: Language-Guided Person Search via Color ReasoningPoster89 citations
- Neural Image Compression via Attentional Multi-Scale Back Projection and Frequency DecompositionPoster89 citations
- Self-Supervised Product Quantization for Deep Unsupervised Image RetrievalPoster89 citations
- Three Steps to Multimodal Trajectory Prediction: Modality Clustering, Classification and SynthesisPoster89 citations
- Dynamic CT Reconstruction From Limited Views With Implicit Neural Representations and Parametric Motion FieldsPoster88 citations
- PixelSynth: Generating a 3D-Consistent Experience From a Single ImagePoster88 citations
- Pri3D: Can 3D Priors Help 2D Representation Learning?Poster88 citations
- Grafit: Learning Fine-Grained Image Representations With Coarse LabelsPoster87 citations
- Joint Visual and Audio Learning for Video Highlight DetectionPoster87 citations
- Learning To Generate Scene Graph From Natural Language SupervisionPoster87 citations
- Learning Unsupervised Metaformer for Anomaly DetectionPoster87 citations
- SA-ConvONet: Sign-Agnostic Optimization of Convolutional Occupancy NetworksPoster87 citations
- Semi-Supervised Active Learning With Temporal Output DiscrepancyPoster87 citations
- Sketch2Mesh: Reconstructing and Editing 3D Shapes From SketchesPoster87 citations
- The Road To Know-Where: An Object-and-Room Informed Sequential BERT for Indoor Vision-Language NavigationPoster87 citations
- Exploring Geometry-Aware Contrast and Clustering Harmonization for Self-Supervised 3D Object DetectionPoster86 citations
- Few-Shot Semantic Segmentation With Cyclic Memory NetworkPoster86 citations
- Learning To Know Where To See: A Visibility-Aware Approach for Occluded Person Re-IdentificationPoster86 citations
- RDA: Robust Domain Adaptation via Fourier Adversarial AttackingPoster86 citations
- Self-Supervised Monocular Depth Estimation for All Day Images Using Domain SeparationPoster86 citations
- Synthesized Feature Based Few-Shot Class-Incremental Learning on a Mixture of SubspacesPoster86 citations
- Towards Discriminative Representation Learning for Unsupervised Person Re-IdentificationPoster86 citations
- 4D-Net for Learned Multi-Modal AlignmentPoster85 citations
- CryoDRGN2: Ab Initio Neural Reconstruction of 3D Protein Structures From Real Cryo-EM ImagesPoster85 citations
- Graph-to-3D: End-to-End Generation and Manipulation of 3D Scenes Using Scene GraphsPoster85 citations
- Hierarchical Object-to-Zone Graph for Object NavigationPoster85 citations
- Self-Supervised 3D Hand Pose Estimation From Monocular RGB via Contrastive LearningPoster85 citations
- Shallow Bayesian Meta Learning for Real-World Few-Shot RecognitionPoster85 citations
- Worldsheet: Wrapping the World in a 3D Sheet for View Synthesis From a Single ImagePoster85 citations
- Bifold and Semantic Reasoning for Pedestrian Behavior PredictionPoster84 citations
- Generic Event Boundary Detection: A Benchmark for Event SegmentationPoster84 citations
- Learning Frequency-Aware Dynamic Network for Efficient Super-ResolutionPoster84 citations
- Class Semantics-Based Attention for Action DetectionPoster83 citations
- Contrastive Multimodal Fusion With TupleInfoNCEPoster83 citations
- Estimating Egocentric 3D Human Pose in Global SpacePoster83 citations
- Motion Guided Region Message Passing for Video CaptioningPoster83 citations
- Point Cloud Augmentation With Weighted Local TransformationsPoster83 citations
- THUNDR: Transformer-Based 3D Human Reconstruction With MarkersPoster83 citations
- Towards Accurate Alignment in Real-Time 3D Hand-Mesh ReconstructionPoster83 citations
- Cross-Sentence Temporal and Semantic Relations in Video Activity LocalisationPoster82 citations
- Dual Path Learning for Domain Adaptation of Semantic SegmentationPoster82 citations
- Geometry-Aware Self-Training for Unsupervised Domain Adaptation on Object Point CloudsPoster82 citations
- Interactive Prototype Learning for Egocentric Action RecognitionPoster82 citations
- MFNet: Multi-Filter Directive Network for Weakly Supervised Salient Object DetectionPoster82 citations
- Pathdreamer: A World Model for Indoor NavigationPoster82 citations
- Speech Drives Templates: Co-Speech Gesture Synthesis With Learned TemplatesPoster82 citations
- Task-Aware Part Mining Network for Few-Shot LearningPoster82 citations
- Adversarial VQA: A New Benchmark for Evaluating the Robustness of VQA ModelsPoster81 citations
- Learning Indoor Inverse Rendering With 3D Spatially-Varying LightingPoster81 citations
- Rethinking Noise Synthesis and Modeling in Raw DenoisingPoster81 citations
- Road Anomaly Detection by Partial Image Reconstruction With Segmentation CouplingPoster81 citations
- Unsupervised Deep Video DenoisingPoster81 citations
- Visual Graph Memory With Unsupervised Representation for Visual NavigationPoster81 citations
- A Unified 3D Human Motion Synthesis Model via Conditional Variational Auto-EncoderPoster80 citations
- Distilling Holistic Knowledge With Graph Neural NetworksPoster80 citations
- Image Synthesis From Layout With Locality-Aware Mask AdaptionPoster80 citations
- Joint Visual Semantic Reasoning: Multi-Stage Decoder for Text RecognitionPoster80 citations
- Learning Inner-Group Relations on Point CloudsPoster80 citations
- Learning With Noisy Labels via Sparse RegularizationPoster80 citations
- Parallel Rectangle Flip Attack: A Query-Based Black-Box Attack Against Object DetectionPoster80 citations
- Personalized and Invertible Face De-Identification by Disentangled Identity Information ManipulationPoster80 citations
- Self-Supervised 3D Skeleton Action Representation Learning With Motion Consistency and ContinuityPoster80 citations
- Target Adaptive Context Aggregation for Video Scene Graph GenerationPoster80 citations
- Where Are You Heading? Dynamic Trajectory Prediction With Expert Goal ExamplesPoster80 citations
- Boosting the Generalization Capability in Cross-Domain Few-Shot Learning via Noise-Enhanced Supervised AutoencoderPoster79 citations
- How To Train Neural Networks for Flare RemovalPoster79 citations
- Joint Representation Learning and Novel Category Discovery on Single- and Multi-Modal DataPoster79 citations
- LoFGAN: Fusing Local Representations for Few-Shot Image GenerationPoster79 citations
- Robust Small Object Detection on the Water Surface Through Fusion of Camera and Millimeter Wave RadarPoster79 citations
- Solving Inefficiency of Self-Supervised Representation LearningPoster79 citations
- Spatial and Semantic Consistency Regularizations for Pedestrian Attribute RecognitionPoster79 citations
- Transporting Causal Mechanisms for Unsupervised Domain AdaptationPoster79 citations
- Voxel-Based Network for Shape Completion by Leveraging Edge GenerationPoster79 citations
- Data-Free Universal Adversarial Perturbation and Black-Box AttackPoster78 citations
- Greedy Gradient Ensemble for Robust Visual Question AnsweringPoster78 citations
- Learning Motion-Appearance Co-Attention for Zero-Shot Video Object SegmentationPoster78 citations
- Mitigating Intensity Bias in Shadow Detection via Feature Decomposition and ReweightingPoster78 citations
- MixMo: Mixing Multiple Inputs for Multiple Outputs via Deep SubnetworksPoster78 citations
- Online Refinement of Low-Level Feature Based Activation Map for Weakly Supervised Object LocalizationPoster78 citations
- StructDepth: Leveraging the Structural Regularities for Self-Supervised Indoor Depth EstimationPoster78 citations
- Watch Only Once: An End-to-End Video Action Detection FrameworkPoster78 citations
- Contrast and Order Representations for Video Self-Supervised LearningPoster77 citations
- GAN Inversion for Out-of-Range Images With Geometric TransformationsPoster77 citations
- Generalized and Incremental Few-Shot Learning by Explicit Learning and Calibration Without ForgettingPoster77 citations
- LatentCLR: A Contrastive Learning Approach for Unsupervised Discovery of Interpretable DirectionsPoster77 citations
- M3D-VTON: A Monocular-to-3D Virtual Try-On NetworkPoster77 citations
- STVGBert: A Visual-Linguistic Transformer Based Framework for Spatio-Temporal Video GroundingPoster77 citations
- Towards Mixed-Precision Quantization of Neural Networks via Constrained OptimizationPoster77 citations
- Track Without Appearance: Learn Box and Tracklet Embedding With Local and Global Motion Patterns for Vehicle TrackingPoster77 citations
- ZFlow: Gated Appearance Flow-Based Virtual Try-On With 3D PriorsPoster77 citations
- Boundary-Sensitive Pre-Training for Temporal Localization in VideosPoster76 citations
- Class-Incremental Learning for Action Recognition in VideosPoster76 citations
- D2-Net: Weakly-Supervised Action Localization via Discriminative Embeddings and Denoised ActivationsPoster76 citations
- Domain-Aware Universal Style TransferPoster76 citations
- ECACL: A Holistic Framework for Semi-Supervised Domain AdaptationPoster76 citations
- Hierarchical Kinematic Probability Distributions for 3D Human Shape and Pose Estimation From Images in the WildPoster76 citations
- Trash To Treasure: Harvesting OOD Data With Cross-Modal Matching for Open-Set Semi-Supervised LearningPoster76 citations
- Variational Feature Disentangling for Fine-Grained Few-Shot ClassificationPoster76 citations
- 3DStyleNet: Creating 3D Shapes With Geometric and Texture Style VariationsPoster75 citations
- On the Limits of Pseudo Ground Truth in Visual Camera Re-LocalisationPoster75 citations
- Product1M: Towards Weakly Supervised Instance-Level Product Retrieval via Cross-Modal PretrainingPoster75 citations
- Scene Context-Aware Salient Object DetectionPoster75 citations
- Tune It the Right Way: Unsupervised Validation of Domain Adaptation via Soft Neighborhood DensityPoster75 citations
- VMNet: Voxel-Mesh Network for Geodesic-Aware 3D Semantic SegmentationPoster75 citations
- Webly Supervised Fine-Grained Recognition: Benchmark Datasets and an ApproachPoster75 citations
- Adversarial Example Detection Using Latent Neighborhood GraphPoster74 citations
- Attention Is Not Enough: Mitigating the Distribution Discrepancy in Asynchronous Multimodal Sequence FusionPoster74 citations
- Deep Reparametrization of Multi-Frame Super-Resolution and DenoisingPoster74 citations
- Dynamic Cross Feature Fusion for Remote Sensing PansharpeningPoster74 citations
- Foreground Activation Maps for Weakly Supervised Object LocalizationPoster74 citations
- HDR Video Reconstruction: A Coarse-To-Fine Network and a Real-World Benchmark DatasetPoster74 citations
- Handwriting TransformersPoster74 citations
- Bringing Events Into Video Deblurring With Non-Consecutively Blurry FramesPoster73 citations
- CrossNorm and SelfNorm for Generalization Under Distribution ShiftsPoster73 citations
- I2UV-HandNet: Image-to-UV Prediction Network for Accurate and High-Fidelity 3D Hand Mesh ModelingPoster73 citations
- On Compositions of Transformations in Contrastive Self-Supervised LearningPoster73 citations
- Patch Craft: Video Denoising by Deep Modeling and Patch MatchingPoster73 citations
- Relating Adversarially Robust Generalization to Flat MinimaPoster73 citations
- Adaptive Surface Normal Constraint for Depth EstimationPoster72 citations
- Beyond Trivial Counterfactual Explanations With Diverse Valuable ExplanationsPoster72 citations
- Dense Deep Unfolding Network With 3D-CNN Prior for Snapshot Compressive ImagingPoster72 citations
- Image Synthesis via Semantic CompositionPoster72 citations
- Minimal Adversarial Examples for Deep Learning on 3D Point CloudsPoster72 citations
- Orthogonal Jacobian Regularization for Unsupervised Disentanglement in Image GenerationPoster72 citations
- Summarize and Search: Learning Consensus-Aware Dynamic Convolution for Co-Saliency DetectionPoster72 citations
- Tripartite Information Mining and Integration for Image MattingPoster72 citations
- A General Recurrent Tracking Framework Without Real DataPoster71 citations
- Adversarial Attacks on Multi-Agent CommunicationPoster71 citations
- Curvature Generation in Curved Spaces for Few-Shot LearningPoster71 citations
- Dual Contrastive Loss and Attention for GANsPoster71 citations
- Generalizing Gaze Estimation With Outlier-Guided Collaborative AdaptationPoster71 citations
- Gradient Distribution Alignment Certificates Better Adversarial Domain AdaptationPoster71 citations
- PCAM: Product of Cross-Attention Matrices for Rigid Registration of Point CloudsPoster71 citations
- Pseudo-Loss Confidence Metric for Semi-Supervised Few-Shot LearningPoster71 citations
- Striking a Balance Between Stability and Plasticity for Class-Incremental LearningPoster71 citations
- Time-Equivariant Contrastive Video Representation LearningPoster71 citations
- Towards Discovery and Attribution of Open-World GAN Generated ImagesPoster71 citations
- Deep Symmetric Network for Underexposed Image Enhancement With Recurrent Attentional LearningPoster70 citations
- Digging Into Uncertainty in Self-Supervised Multi-View StereoPoster70 citations
- Energy-Based Open-World Uncertainty Modeling for Confidence CalibrationPoster70 citations
- Learning To Reduce Defocus Blur by Realistically Modeling Dual-Pixel DataPoster70 citations
- Motion Basis Learning for Unsupervised Deep Homography Estimation With Subspace ProjectionPoster70 citations
- Robust Watermarking for Deep Neural Networks via Bi-Level OptimizationPoster70 citations
- ADNet: Leveraging Error-Bias Towards Normal Direction in Face AlignmentPoster69 citations
- Full-Body Motion From a Single Head-Mounted Device: Generating SMPL Poses From Partial ObservationsPoster69 citations
- Heterogeneous Relational Complement for Vehicle Re-IdentificationPoster69 citations
- Knowledge Mining and Transferring for Domain Adaptive Object DetectionPoster69 citations
- Learning a Sketch Tensor Space for Image Inpainting of Man-Made ScenesPoster69 citations
- Mixed SIGNals: Sign Language Production via a Mixture of Motion PrimitivesPoster69 citations
- Occluded Person Re-Identification With Single-Scale Global RepresentationsPoster69 citations
- PX-NET: Simple and Efficient Pixel-Wise Training of Photometric Stereo NetworksPoster69 citations
- Parsing Table Structures in the WildPoster69 citations
- Refining Action Segmentation With Hierarchical Video RepresentationsPoster69 citations
- TGRNet: A Table Graph Reconstruction Network for Table Structure RecognitionPoster69 citations
- A New Journey From SDRTV to HDRTVPoster68 citations
- Dual Bipartite Graph Learning: A General Approach for Domain Adaptive Object DetectionPoster68 citations
- Learning Privacy-Preserving Optics for Human Pose EstimationPoster68 citations
- VENet: Voting Enhancement Network for 3D Object DetectionPoster68 citations
- Wanderlust: Online Continual Object Detection in the Real WorldPoster68 citations
- AdaSGN: Adapting Joint Number and Model Size for Efficient Skeleton-Based Action RecognitionPoster67 citations
- Deep Transport Network for Unsupervised Video Object SegmentationPoster67 citations
- Dense Interaction Learning for Video-Based Person Re-IdentificationPoster67 citations
- Stochastic Partial Swap: Enhanced Model Generalization and Interpretability for Fine-Grained RecognitionPoster67 citations
- Conditional Variational Capsule Network for Open Set RecognitionPoster66 citations
- Fooling LiDAR Perception via Adversarial Trajectory PerturbationPoster66 citations
- GarmentNets: Category-Level Pose Estimation for Garments via Canonical Space Shape CompletionPoster66 citations
- Graph-Based 3D Multi-Person Pose Estimation Using Multi-View ImagesPoster66 citations
- ISD: Self-Supervised Learning by Iterative Similarity DistillationPoster66 citations
- MLVSNet: Multi-Level Voting Siamese Network for 3D Visual TrackingPoster66 citations
- Sparse-to-Dense Feature Matching: Intra and Inter Domain Cross-Modal Learning in Domain Adaptation for 3D Semantic SegmentationPoster66 citations
- Vi2CLR: Video and Image for Visual Contrastive Learning of RepresentationPoster66 citations
- WarpedGANSpace: Finding Non-Linear RBF Paths in GAN Latent SpacePoster66 citations
- AdaMML: Adaptive Multi-Modal Learning for Efficient Video RecognitionPoster65 citations
- Dance With Self-Attention: A New Look of Conditional Random Fields on Anomaly Detection in VideosPoster65 citations
- Describing and Localizing Multiple Changes With TransformersPoster65 citations
- EigenGAN: Layer-Wise Eigen-Learning for GANsPoster65 citations
- GDP: Stabilized Neural Network Pruning via Gates With Differentiable PolarizationPoster65 citations
- Learning To Regress Bodies From Images Using Differentiable Semantic RenderingPoster65 citations
- Learning To Track Objects From Unlabeled VideosPoster65 citations
- MEDIRL: Predicting the Visual Attention of Drivers via Maximum Entropy Deep Inverse Reinforcement LearningPoster65 citations
- MultiSiam: Self-Supervised Multi-Instance Siamese Representation Learning for Autonomous DrivingPoster65 citations
- RINDNet: Edge Detection for Discontinuity in Reflectance, Illumination, Normal and DepthPoster65 citations
- RandomRooms: Unsupervised Pre-Training From Synthetic Shapes and Randomized Layouts for 3D Object DetectionPoster65 citations
- TransForensics: Image Forgery Localization With Dense Self-AttentionPoster65 citations
- Unsupervised Layered Image Decomposition Into Object PrototypesPoster65 citations
- DeePSD: Automatic Deep Skinning and Pose Space Deformation for 3D Garment AnimationPoster64 citations
- GistNet: A Geometric Structure Transfer Network for Long-Tailed RecognitionPoster64 citations
- Lightweight Multi-Person Total Motion Capture Using Sparse Multi-View CamerasPoster64 citations
- MAAS: Multi-Modal Assignation for Active Speaker DetectionPoster64 citations
- Motion Prediction Using Trajectory CuesPoster64 citations
- PointBA: Towards Backdoor Attacks in 3D Point CloudPoster64 citations
- SIGN: Spatial-Information Incorporated Generative Network for Generalized Zero-Shot Semantic SegmentationPoster64 citations
- TRiPOD: Human Trajectory and Pose Dynamics Forecasting in the WildPoster64 citations
- Task Switching Network for Multi-Task LearningPoster64 citations
- The Benefit of Distraction: Denoising Camera-Based Physiological Measurements Using Inverse AttentionPoster64 citations
- When Do GANs Replicate? On the Choice of Dataset SizePoster64 citations
- Achieving On-Mobile Real-Time Super-Resolution With Neural Architecture and Pruning SearchPoster63 citations
- Attentional Pyramid Pooling of Salient Visual Residuals for Place RecognitionPoster63 citations
- Contrasting Contrastive Self-Supervised Representation Learning PipelinesPoster63 citations
- Deep Blind Video Super-ResolutionPoster63 citations
- Diagonal Attention and Style-Based GAN for Content-Style Disentanglement in Image Generation and TranslationPoster63 citations
- Dynamic Surface Function Networks for Clothed Human BodiesPoster63 citations
- Efficient Video Compression via Content-Adaptive Super-ResolutionPoster63 citations
- GP-S3Net: Graph-Based Panoptic Sparse Semantic Segmentation NetworkPoster63 citations
- Hand Image Understanding via Deep Multi-Task LearningPoster63 citations
- Multiview Pseudo-Labeling for Semi-Supervised Learning From VideoPoster63 citations
- Personalized Trajectory Prediction via Distribution DiscriminationPoster63 citations
- Rethinking Deep Image Prior for DenoisingPoster63 citations
- Towards a Universal Model for Cross-Dataset Crowd CountingPoster63 citations
- VIL-100: A New Dataset and a Baseline Model for Video Instance Lane DetectionPoster63 citations
- VolumeFusion: Deep Depth Fusion for 3D Scene ReconstructionPoster63 citations
- A Closer Look at Rotation-Invariant Deep Point Cloud AnalysisPoster62 citations
- Building-GAN: Graph-Conditioned Architectural Volumetric Design GenerationPoster62 citations
- Cross-Category Video Highlight Detection via Set-Based LearningPoster62 citations
- EventHands: Real-Time Neural 3D Hand Pose Estimation From an Event StreamPoster62 citations
- HAIR: Hierarchical Visual-Semantic Relational Reasoning for Video Question AnsweringPoster62 citations
- How To Design a Three-Stage Architecture for Audio-Visual Active Speaker Detection in the WildPoster62 citations
- Learning Conditional Knowledge Distillation for Degraded-Reference Image Quality AssessmentPoster62 citations
- P2-Net: Joint Description and Detection of Local Features for Pixel and Point MatchingPoster62 citations
- Rank & Sort Loss for Object Detection and Instance SegmentationPoster62 citations
- Real-World Video Super-Resolution: A Benchmark Dataset and a Decomposition Based Learning SchemePoster62 citations
- Toward Human-Like Grasp: Dexterous Grasping via Semantic Representation of Object-HandPoster62 citations
- Zero-Shot Natural Language Video LocalizationPoster62 citations
- CanvasVAE: Learning To Generate Vector Graphic DocumentsPoster61 citations
- Image2Reverb: Cross-Modal Reverb Impulse Response SynthesisPoster61 citations
- Self-Supervised Vessel Segmentation via Adversarial LearningPoster61 citations
- SimROD: A Simple Adaptation Method for Robust Object DetectionPoster61 citations
- Stochastic Transformer Networks With Linear Competing Units: Application To End-to-End SL TranslationPoster61 citations
- Temporal Cue Guided Video Highlight Detection With Low-Rank Audio-Visual FusionPoster61 citations
- Towards Interpretable Deep Metric Learning With Structural MatchingPoster61 citations
- Unsupervised Real-World Super-Resolution: A Domain Adaptation PerspectivePoster61 citations
- Boosting Weakly Supervised Object Detection via Learning Bounding Box AdjustersPoster60 citations
- CDNet: Centripetal Direction Network for Nuclear Instance SegmentationPoster60 citations
- Continual Learning on Noisy Data Streams via Self-Purified ReplayPoster60 citations
- Cross-Camera Convolutional Color ConstancyPoster60 citations
- HAA500: Human-Centric Atomic Action Dataset With Curated VideosPoster60 citations
- Learning To Adversarially Blur Visual Object TrackingPoster60 citations
- Manifold Alignment for Semantically Aligned Style TransferPoster60 citations
- Meta Navigator: Search for a Good Adaptation Policy for Few-Shot LearningPoster60 citations
- Multi-Anchor Active Domain Adaptation for Semantic SegmentationPoster60 citations
- RobustNav: Towards Benchmarking Robustness in Embodied NavigationPoster60 citations
- Self-Supervised Geometric Features Discovery via Interpretable Attention for Vehicle Re-Identification and BeyondPoster60 citations
- Adversarial Attacks Are Reversible With Natural SupervisionPoster59 citations
- DRIVE: Deep Reinforced Accident Anticipation With Visual ExplanationPoster59 citations
- Deep Relational Metric LearningPoster59 citations
- Discriminative Region-Based Multi-Label Zero-Shot LearningPoster59 citations
- Extending Neural P-Frame Codecs for B-Frame CodingPoster59 citations
- From Contexts to Locality: Ultra-High Resolution Image Segmentation via Locality-Aware Contextual CorrelationPoster59 citations
- The Center of Attention: Center-Keypoint Grouping via Attention for Multi-Person Pose EstimationPoster59 citations
- Unpaired Learning for Deep Image Deraining With Rain Direction RegularizerPoster59 citations
- Collaborative and Adversarial Learning of Focused and Dispersive Representations for Semi-Supervised Polyp SegmentationPoster58 citations
- DecentLaM: Decentralized Momentum SGD for Large-Batch Deep TrainingPoster58 citations
- EventHPE: Event-Based 3D Human Pose and Shape EstimationPoster58 citations
- Hybrid Neural Fusion for Full-Frame Video StabilizationPoster58 citations
- Improving Neural Network Efficiency via Post-Training Quantization With Adaptive Floating-PointPoster58 citations
- Learning Attribute-Driven Disentangled Representations for Interactive Fashion RetrievalPoster58 citations
- Low Curvature Activations Reduce Overfitting in Adversarial TrainingPoster58 citations
- SCOUTER: Slot Attention-Based Classifier for Explainable Image RecognitionPoster58 citations
- STEM: An Approach to Multi-Source Domain Adaptation With GuaranteesPoster58 citations
- Shape Self-Correction for Unsupervised Point Cloud UnderstandingPoster58 citations
- The Devil Is in the Task: Exploiting Reciprocal Appearance-Localization Features for Monocular 3D Object DetectionPoster58 citations
- Triggering Failures: Out-of-Distribution Detection by Learning From Local Adversarial Attacks in Semantic SegmentationPoster58 citations
- Video Pose Distillation for Few-Shot, Fine-Grained Sports Action RecognitionPoster58 citations
- Audio-Visual Floorplan ReconstructionPoster57 citations
- CDS: Cross-Domain Self-Supervised Pre-TrainingPoster57 citations
- Crowd Counting With Partial Annotations in an ImagePoster57 citations
- Domain Adaptive Video Segmentation via Temporal Consistency RegularizationPoster57 citations
- Explainable Person Re-Identification With Attribute-Guided Metric DistillationPoster57 citations
- ORBIT: A Real-World Few-Shot Dataset for Teachable Object RecognitionPoster57 citations
- On Exposing the Challenging Long Tail in Future Prediction of Traffic ActorsPoster57 citations
- Shape-Aware Multi-Person Pose Estimation From Multi-View ImagesPoster57 citations
- T-SVDNet: Exploring High-Order Prototypical Correlations for Multi-Source Domain AdaptationPoster57 citations
- Transductive Few-Shot Classification on the Oblique ManifoldPoster57 citations
- Variational Attention: Propagating Domain-Specific Knowledge for Multi-Domain Learning in Crowd CountingPoster57 citations
- ASCNet: Self-Supervised Video Representation Learning With Appearance-Speed ConsistencyPoster56 citations
- AdaFit: Rethinking Learning-Based Normal Estimation on Point CloudsPoster56 citations
- Clustering by Maximizing Mutual Information Across ViewsPoster56 citations
- Discover the Unknown Biased Attribute of an Image ClassifierPoster56 citations
- Dynamic Network Quantization for Efficient Video InferencePoster56 citations
- Else-Net: Elastic Semantic Network for Continual Action Recognition From Skeleton DataPoster56 citations
- End-to-End Detection and Pose Estimation of Two Interacting HandsPoster56 citations
- HPNet: Deep Primitive Segmentation Using Hybrid RepresentationsPoster56 citations
- HandFoldingNet: A 3D Hand Pose Estimation Network Using Multiscale-Feature Guided Folding of a 2D Hand SkeletonPoster56 citations
- Learning Generative Models of Textured 3D Meshes From Real-World ImagesPoster56 citations
- Learning Self-Similarity in Space and Time As Generalized Motion for Video Action RecognitionPoster56 citations
- NAS-OoD: Neural Architecture Search for Out-of-Distribution GeneralizationPoster56 citations
- NeuSpike-Net: High Speed Video Reconstruction via Bio-Inspired Neuromorphic CamerasPoster56 citations
- Online Multi-Granularity Distillation for GAN CompressionPoster56 citations
- Stacked Homography Transformations for Multi-View Pedestrian DetectionPoster56 citations
- Towards High Fidelity Monocular Face Reconstruction With Rich Reflectance Using Self-Supervised Learning and Ray TracingPoster56 citations
- ACAV100M: Automatic Curation of Large-Scale Datasets for Audio-Visual Video Representation LearningPoster55 citations
- Distilling Optimal Neural Networks: Rapid Search in Diverse SpacesPoster55 citations
- Evolving Search Space for Neural Architecture SearchPoster55 citations
- LabOR: Labeling Only if Required for Domain Adaptive Semantic SegmentationPoster55 citations
- Learning Anchored Unsigned Distance Functions With Gradient Direction Alignment for Single-View Garment ReconstructionPoster55 citations
- Learning With Noisy Labels for Robust Point Cloud SegmentationPoster55 citations
- Move2Hear: Active Audio-Visual Source SeparationPoster55 citations
- Procedure Planning in Instructional Videos via Contextual Modeling and Model-Based Policy LearningPoster55 citations
- Unified Graph Structured Models for Video UnderstandingPoster55 citations
- Divide and Conquer for Single-Frame Temporal Action LocalizationPoster54 citations
- Dual-Camera Super-Resolution With Aligned Attention ModulesPoster54 citations
- EvIntSR-Net: Event Guided Multiple Latent Frames Reconstruction and Super-ResolutionPoster54 citations
- Explain Me the Painting: Multi-Topic Knowledgeable Art Description GenerationPoster54 citations
- Joint Topology-Preserving and Feature-Refinement Network for Curvilinear Structure SegmentationPoster54 citations
- LocalTrans: A Multiscale Local Transformer Network for Cross-Resolution Homography EstimationPoster54 citations
- A Style and Semantic Memory Mechanism for Domain GeneralizationPoster53 citations
- AINet: Association Implantation for Superpixel SegmentationPoster53 citations
- Augmented Lagrangian Adversarial AttacksPoster53 citations
- Batch Normalization Increases Adversarial Vulnerability and Decreases Adversarial Transferability: A Non-Robust Feature PerspectivePoster53 citations
- Deep Implicit Surface Point Prediction NetworksPoster53 citations
- Generative Adversarial Registration for Improved Conditional Deformable TemplatesPoster53 citations
- In Defense of Scene Graphs for Image CaptioningPoster53 citations
- Learning Hierarchical Graph Neural Networks for Image ClusteringPoster53 citations
- PARTS: Unsupervised Segmentation With Slots, Attention and Independence MaximizationPoster53 citations
- SIGNET: Efficient Neural Representation for Light FieldsPoster53 citations
- Support-Set Based Cross-Supervision for Video GroundingPoster53 citations
- The Surprising Effectiveness of Visual Odometry Techniques for Embodied PointGoal NavigationPoster53 citations
- VideoLT: Large-Scale Long-Tailed Video RecognitionPoster53 citations
- AdvRush: Searching for Adversarially Robust Neural ArchitecturesPoster52 citations
- Contextually Plausible and Diverse 3D Human Motion PredictionPoster52 citations
- Learning RAW-to-sRGB Mappings With Inaccurately Aligned SupervisionPoster52 citations
- Meta-Aggregator: Learning To Aggregate for 1-Bit Graph Neural NetworksPoster52 citations
- Multi-Modality Associative Bridging Through Memory: Speech Sound Recollected From Face VideoPoster52 citations
- Multi-Source Domain Adaptation for Object DetectionPoster52 citations
- Multiresolution Deep Implicit Functions for 3D Shape RepresentationPoster52 citations
- Robust Small-Scale Pedestrian Detection With Cued Recall via Memory LearningPoster52 citations
- SLAMP: Stochastic Latent Appearance and Motion PredictionPoster52 citations
- Self-Supervised Video Representation Learning With Meta-Contrastive NetworkPoster52 citations
- Cloud Transformers: A Universal Approach to Point Cloud Processing TasksPoster51 citations
- Fast Light-Field Disparity Estimation With Multi-Disparity-Scale Cost AggregationPoster51 citations
- Kernel Methods in Hyperbolic SpacesPoster51 citations
- MGNet: Monocular Geometric Scene Understanding for Autonomous DrivingPoster51 citations
- Meta Pairwise Relationship Distillation for Unsupervised Person Re-IdentificationPoster51 citations
- PlaneTR: Structure-Guided Transformers for 3D Plane RecoveryPoster51 citations
- SLIDE: Single Image 3D Photography With Soft Layering and Depth-Aware InpaintingPoster51 citations
- StarEnhancer: Learning Real-Time and Style-Aware Image EnhancementPoster51 citations
- Visual Distant Supervision for Scene Graph GenerationPoster51 citations
- Warp Consistency for Unsupervised Learning of Dense CorrespondencesPoster51 citations
- Act the Part: Learning Interaction Strategies for Articulated Object Part DiscoveryPoster50 citations
- Auto Graph Encoder-Decoder for Neural Network PruningPoster50 citations
- CSG-Stump: A Learning Friendly CSG-Like Representation for Interpretable Shape ParsingPoster50 citations
- Concept Generalization in Visual Representation LearningPoster50 citations
- DRINet: A Dual-Representation Iterative Learning Network for Point Cloud SegmentationPoster50 citations
- Detection and Continual Learning of Novel Face Presentation AttacksPoster50 citations
- Direct Differentiable Augmentation SearchPoster50 citations
- FloorPlanCAD: A Large-Scale CAD Drawing Dataset for Panoptic Symbol SpottingPoster50 citations
- Hyperspectral Image Denoising With Realistic DataPoster50 citations
- Internal Video Inpainting by Implicit Long-Range PropagationPoster50 citations
- Learning Bias-Invariant Representation by Cross-Sample Mutual Information MinimizationPoster50 citations
- Localized Simple Multiple Kernel K-MeansPoster50 citations
- MosaicOS: A Simple and Effective Use of Object-Centric Images for Long-Tailed Object DetectionPoster50 citations
- Multi-Scale Matching Networks for Semantic CorrespondencePoster50 citations
- PASS: Protected Attribute Suppression System for Mitigating Bias in Face RecognitionPoster50 citations
- von Mises-Fisher Loss: An Exploration of Embedding Geometries for Supervised LearningPoster50 citations
- BuildingNet: Learning To Label 3D BuildingsPoster49 citations
- CTRL-C: Camera Calibration TRansformer With Line-ClassificationPoster49 citations
- Can Scale-Consistent Monocular Depth Be Learned in a Self-Supervised Scale-Invariant Manner?Poster49 citations
- Differentiable Surface Rendering via Non-Differentiable SamplingPoster49 citations
- Diverse Image Style Transfer via Invertible Cross-Space MappingPoster49 citations
- Dynamic Divide-and-Conquer Adversarial Training for Robust Semantic SegmentationPoster49 citations
- Learned Spatial Representations for Few-Shot Talking-Head SynthesisPoster49 citations
- Learning an Augmented RGB Representation With Cross-Modal Knowledge Distillation for Action DetectionPoster49 citations
- RAIN: Reinforced Hybrid Attention Inference Network for Motion ForecastingPoster49 citations
- SUNet: Symmetric Undistortion Network for Rolling Shutter CorrectionPoster49 citations
- Scribble-Supervised Semantic Segmentation InferencePoster49 citations
- Self-Supervised Visual Representations Learning by Contrastive Mask PredictionPoster49 citations
- StereOBJ-1M: Large-Scale Stereo Image Dataset for 6D Object Pose EstimationPoster49 citations
- Towards Alleviating the Modeling Ambiguity of Unsupervised Monocular 3D Human Pose EstimationPoster49 citations
- Uniformity in Heterogeneity: Diving Deep Into Count Interval Partition for Crowd CountingPoster49 citations
- 3D Human Texture Estimation From a Single Image With TransformersPoster48 citations
- Adaptive Curriculum LearningPoster48 citations
- COMISR: Compression-Informed Video Super-ResolutionPoster48 citations
- Geometric Unsupervised Domain Adaptation for Semantic SegmentationPoster48 citations
- Improving Robustness Against Common Corruptions With Frequency Biased ModelsPoster48 citations
- Learning Compatible EmbeddingsPoster48 citations
- Light Field Saliency Detection With Dual Local Graph Learning and Reciprocative GuidancePoster48 citations
- PR-GCN: A Deep Graph Convolutional Network With Point Refinement for 6D Pose EstimationPoster48 citations
- PU-EVA: An Edge-Vector Based Approximation Solution for Flexible-Scale Point Cloud UpsamplingPoster48 citations
- Pyramid Architecture Search for Real-Time Image DeblurringPoster48 citations
- RFNet: Recurrent Forward Network for Dense Point Cloud CompletionPoster48 citations
- Scribble-Supervised Semantic Segmentation by Uncertainty Reduction on Neural Representation and Self-Supervision on Neural EigenspacePoster48 citations
- Visual Relationship Detection Using Part-and-Sum Transformers With Composite QueriesPoster48 citations
- Hypergraph Neural Networks for Hypergraph MatchingPoster47 citations
- Impact of Aliasing on Generalization in Deep Convolutional NetworksPoster47 citations
- Improving Low-Precision Network Quantization via Bin RegularizationPoster47 citations
- Motion-Focused Contrastive Learning of Video RepresentationsPoster47 citations
- Neural Video Portrait Relighting in Real-Time via Consistency ModelingPoster47 citations
- On the Importance of Distractors for Few-Shot ClassificationPoster47 citations
- Once Quantization-Aware Training: High Performance Extremely Low-Bit Architecture SearchPoster47 citations
- Towards Novel Target Discovery Through Open-Set Domain AdaptationPoster47 citations
- Unsupervised Learning of Fine Structure Generation for 3D Point Clouds by 2D Projections MatchingPoster47 citations
- Unsupervised Non-Rigid Image Distortion Removal via Grid DeformationPoster47 citations
- Adversarial Robustness for Unsupervised Domain AdaptationPoster46 citations
- An Asynchronous Kalman Filter for Hybrid Event CamerasPoster46 citations
- Continual Neural Mapping: Learning an Implicit Scene Representation From Sequential ObservationsPoster46 citations
- DCT-SNN: Using DCT To Distribute Spatial Information Over Time for Low-Latency Spiking Neural NetworksPoster46 citations
- Distance-Aware QuantizationPoster46 citations
- From Continuity to Editability: Inverting GANs With Consecutive ImagesPoster46 citations
- Global Pooling, More Than Meets the Eye: Position Information Is Encoded Channel-Wise in CNNsPoster46 citations
- Light Source Guided Single-Image Flare Removal From Unpaired DataPoster46 citations
- SGMNet: Learning Rotation-Invariant Point Cloud Representations via Sorted Gram MatrixPoster46 citations
- Self-Regulation for Semantic SegmentationPoster46 citations
- Self-Supervised Representation Learning From Flow EquivariancePoster46 citations
- Semantic Diversity Learning for Zero-Shot Multi-Label ClassificationPoster46 citations
- Semi-Supervised Active Learning for Semi-Supervised Models: Exploit Adversarial Examples With Graph-Based Virtual LabelsPoster46 citations
- The Right To Talk: An Audio-Visual Transformer ApproachPoster46 citations
- YouRefIt: Embodied Reference Understanding With Language and GesturePoster46 citations
- BN-NAS: Neural Architecture Search With Batch NormalizationPoster45 citations
- COOKIE: Contrastive Cross-Modal Knowledge Sharing Pre-Training for Vision-Language RepresentationPoster45 citations
- Defocus Map Estimation and Deblurring From a Single Dual-Pixel ImagePoster45 citations
- Detecting Human-Object Relationships in VideosPoster45 citations
- Detecting Invisible PeoplePoster45 citations
- Exploring Robustness of Unsupervised Domain Adaptation in Semantic SegmentationPoster45 citations
- Few-Shot Image Classification: Just Use a Library of Pre-Trained Feature Extractors and a Simple ClassifierPoster45 citations
ICCV accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.