CVPR 2022 Accepted Papers
The full list of 2,043 papers accepted at CVPR 2022 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 1,704Oral: 339
- High-Resolution Image Synthesis With Latent Diffusion ModelsOral18,394 citations
- Masked Autoencoders Are Scalable Vision LearnersOral9,635 citations
- A ConvNet for the 2020sPoster7,893 citations
- Restormer: Efficient Transformer for High-Resolution Image RestorationOral3,074 citations
- Masked-Attention Mask Transformer for Universal Image SegmentationPoster2,765 citations
- Swin Transformer V2: Scaling Up Capacity and ResolutionPoster2,410 citations
- Video Swin TransformerPoster2,237 citations
- Uformer: A General U-Shaped Transformer for Image RestorationPoster1,992 citations
- Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance FieldsOral1,944 citations
- Conditional Prompt Learning for Vision-Language ModelsPoster1,851 citations
- RePaint: Inpainting Using Denoising Diffusion Probabilistic ModelsPoster1,817 citations
- SimMIM: A Simple Framework for Masked Image ModelingPoster1,610 citations
- Efficient Geometry-Aware 3D Generative Adversarial NetworksOral1,564 citations
- Plenoxels: Radiance Fields Without Neural NetworksOral1,546 citations
- Scaling Vision TransformersPoster1,372 citations
- CSWin Transformer: A General Vision Transformer Backbone With Cross-Shaped WindowsPoster1,346 citations
- Scaling Up Your Kernels to 31x31: Revisiting Large Kernel Design in CNNsPoster1,302 citations
- Grounded Language-Image Pre-TrainingOral1,294 citations
- MetaFormer Is Actually What You Need for VisionOral1,278 citations
- Direct Voxel Grid Optimization: Super-Fast Convergence for Radiance Fields ReconstructionOral1,232 citations
- Towards Total Recall in Industrial Anomaly DetectionPoster1,227 citations
- Ego4D: Around the World in 3,000 Hours of Egocentric VideoOral1,162 citations
- Blended Diffusion for Text-Driven Editing of Natural ImagesPoster1,051 citations
- Depth-Supervised NeRF: Fewer Views and Faster Training for FreePoster1,030 citations
- TrackFormer: Multi-Object Tracking With TransformersPoster1,011 citations
- Learning To Prompt for Continual LearningPoster979 citations
- Vector Quantized Diffusion Model for Text-to-Image SynthesisOral959 citations
- CMT: Convolutional Neural Networks Meet Vision TransformersPoster954 citations
- MViTv2: Improved Multiscale Vision Transformers for Classification and DetectionPoster950 citations
- DN-DETR: Accelerate DETR Training by Introducing Query DeNoisingOral921 citations
- Decoupled Knowledge DistillationPoster894 citations
- Block-NeRF: Scalable Large Scene Neural View SynthesisOral874 citations
- Revisiting Skeleton-Based Action RecognitionOral816 citations
- Point-BERT: Pre-Training 3D Point Cloud Transformers With Masked Point ModelingPoster812 citations
- Toward Fast, Flexible, and Robust Low-Light Image EnhancementOral810 citations
- TransFusion: Robust LiDAR-Camera Fusion for 3D Object Detection With TransformersPoster806 citations
- FLAVA: A Foundational Language and Vision Alignment ModelPoster796 citations
- Self-Supervised Pre-Training of Swin Transformers for 3D Medical Image AnalysisPoster796 citations
- Masked Feature Prediction for Self-Supervised Visual Pre-TrainingPoster782 citations
- NICE-SLAM: Neural Implicit Scalable Encoding for SLAMPoster766 citations
- Vision Transformer With Deformable AttentionPoster765 citations
- Robust Fine-Tuning of Zero-Shot ModelsOral764 citations
- DiffusionCLIP: Text-Guided Diffusion Models for Robust Image ManipulationPoster747 citations
- Target-Aware Dual Adversarial Learning and a Multi-Scenario Multi-Modality Benchmark To Fuse Infrared and Visible for Object DetectionOral733 citations
- MaskGIT: Masked Generative Image TransformerPoster726 citations
- MixFormer: End-to-End Tracking With Iterative Mixed AttentionOral715 citations
- Point-NeRF: Point-Based Neural Radiance FieldsOral701 citations
- Mobile-Former: Bridging MobileNet and TransformerOral687 citations
- DenseCLIP: Language-Guided Dense Prediction With Context-Aware PromptingPoster678 citations
- RegNeRF: Regularizing Neural Radiance Fields for View Synthesis From Sparse InputsOral677 citations
- Ref-NeRF: Structured View-Dependent Appearance for Neural Radiance FieldsOral667 citations
- RegionCLIP: Region-Based Language-Image PretrainingPoster648 citations
- Zero-Shot Text-Guided Object Generation With Dream FieldsPoster628 citations
- LiT: Zero-Shot Transfer With Locked-Image Text TuningPoster627 citations
- MAXIM: Multi-Axis MLP for Image ProcessingOral624 citations
- Anomaly Detection via Reverse Distillation From One-Class EmbeddingPoster619 citations
- DAFormer: Improving Network Architectures and Training Strategies for Domain-Adaptive Semantic SegmentationPoster617 citations
- Generating Diverse and Natural 3D Human Motions From TextPoster615 citations
- GroupViT: Semantic Segmentation Emerges From Text SupervisionPoster612 citations
- URetinex-Net: Retinex-Based Deep Unfolding Network for Low-Light Image EnhancementPoster612 citations
- Scaling Vision Transformers to Gigapixel Images via Hierarchical Self-Supervised LearningOral556 citations
- Continual Test-Time Domain AdaptationPoster551 citations
- HumanNeRF: Free-Viewpoint Rendering of Moving People From Monocular VideoOral550 citations
- Image Segmentation Using Text and Image PromptsPoster550 citations
- AdaFace: Quality Adaptive Margin for Face RecognitionOral544 citations
- BasicVSR++: Improving Video Super-Resolution With Enhanced Propagation and AlignmentPoster541 citations
- PointCLIP: Point Cloud Understanding by CLIPPoster524 citations
- Stratified Transformer for 3D Point Cloud SegmentationPoster520 citations
- On the Integration of Self-Attention and ConvolutionPoster517 citations
- Semi-Supervised Semantic Segmentation Using Unreliable Pseudo-LabelsPoster495 citations
- NeRF in the Dark: High Dynamic Range View Synthesis From Noisy Raw ImagesOral489 citations
- Neural 3D Video Synthesis From Multi-View VideoOral486 citations
- ST++: Make Self-Training Work Better for Semi-Supervised Semantic SegmentationPoster477 citations
- DeepFusion: Lidar-Camera Deep Fusion for Multi-Modal 3D Object DetectionPoster476 citations
- SNR-Aware Low-Light Image EnhancementPoster475 citations
- GMFlow: Learning Optical Flow via Global MatchingOral459 citations
- CLIP-NeRF: Text-and-Image Driven Manipulation of Neural Radiance FieldsPoster458 citations
- Diffusion Autoencoders: Toward a Meaningful and Decodable RepresentationOral456 citations
- Geometric Transformer for Fast and Robust Point Cloud RegistrationOral454 citations
- Dataset Distillation by Matching Training TrajectoriesOral451 citations
- CRIS: CLIP-Driven Referring Image SegmentationPoster441 citations
- Winoground: Probing Vision and Language Models for Visio-Linguistic CompositionalityPoster440 citations
- Oriented RepPoints for Aerial Object DetectionPoster435 citations
- An Empirical Study of Training End-to-End Vision-and-Language TransformersPoster430 citations
- DAIR-V2X: A Large-Scale Dataset for Vehicle-Infrastructure Cooperative 3D Object DetectionPoster428 citations
- Neural Window Fully-Connected CRFs for Monocular Depth EstimationPoster424 citations
- DyTox: Transformers for Continual Learning With DYnamic TOken eXpansionPoster420 citations
- MAT: Mask-Aware Transformer for Large Hole Image InpaintingOral417 citations
- QueryDet: Cascaded Sparse Query for Accelerating High-Resolution Small Object DetectionOral417 citations
- MHFormer: Multi-Hypothesis Transformer for 3D Human Pose EstimationPoster415 citations
- VL-Adapter: Parameter-Efficient Transfer Learning for Vision-and-Language TasksPoster415 citations
- Mega-NERF: Scalable Construction of Large-Scale NeRFs for Virtual Fly-ThroughsPoster414 citations
- Image Dehazing Transformer With Transmission-Aware 3D Position EmbeddingPoster412 citations
- DTFD-MIL: Double-Tier Feature Distillation Multiple Instance Learning for Histopathology Whole Slide Image ClassificationOral407 citations
- ViM: Out-of-Distribution With Virtual-Logit MatchingPoster405 citations
- Extracting Triangular 3D Models, Materials, and Lighting From ImagesOral404 citations
- Dense Depth Priors for Neural Radiance Fields From Sparse Input ViewsPoster402 citations
- Rethinking Semantic Segmentation: A Prototype ViewOral402 citations
- Learning To Prompt for Open-Vocabulary Object Detection With Vision-Language ModelPoster398 citations
- TransWeather: Transformer-Based Restoration of Images Degraded by Adverse Weather ConditionsPoster398 citations
- Not All Points Are Equal: Learning Highly Efficient Point-Based Detectors for 3D LiDAR Point CloudsOral389 citations
- Autoregressive Image Generation Using Residual QuantizationPoster386 citations
- On Aliased Resizing and Surprising Subtleties in GAN EvaluationPoster386 citations
- Text2Mesh: Text-Driven Neural Stylization for MeshesOral386 citations
- Fine-Tuning Global Model via Data-Free Knowledge Distillation for Non-IID Federated LearningPoster385 citations
- LAVT: Language-Aware Vision Transformer for Referring Image SegmentationPoster385 citations
- Neural RGB-D Surface ReconstructionPoster384 citations
- Detecting Deepfakes With Self-Blended ImagesOral381 citations
- Transforming Model Prediction for TrackingPoster380 citations
- StyTr2: Image Style Transfer With TransformersPoster379 citations
- A-ViT: Adaptive Tokens for Efficient Vision TransformerOral378 citations
- StyleSDF: High-Resolution 3D-Consistent Image and Geometry GenerationOral374 citations
- MPViT: Multi-Path Vision Transformer for Dense PredictionPoster360 citations
- Knowledge Distillation: A Good Teacher Is Patient and ConsistentOral358 citations
- ELIC: Efficient Learned Image Compression With Unevenly Grouped Space-Channel Contextual Adaptive CodingOral356 citations
- Focal and Global Knowledge Distillation for DetectorsPoster356 citations
- ISNet: Shape Matters for Infrared Small Target DetectionPoster353 citations
- All-in-One Image Restoration for Unknown CorruptionPoster351 citations
- Vision-Language Pre-Training With Triple Contrastive LearningPoster351 citations
- DF-GAN: A Simple and Effective Baseline for Text-to-Image SynthesisOral349 citations
- Zoom in and Out: A Mixed-Scale Triplet Network for Camouflaged Object DetectionPoster349 citations
- Multiview Transformers for Video RecognitionPoster348 citations
- Contrastive Test-Time AdaptationPoster347 citations
- FedDC: Federated Learning With Non-IID Data via Local Drift Decoupling and CorrectionPoster346 citations
- ICON: Implicit Clothed Humans Obtained From NormalsPoster343 citations
- Urban Radiance FieldsPoster343 citations
- Scaling Up Vision-Language Pre-Training for Image CaptioningPoster341 citations
- Prompt Distribution LearningPoster340 citations
- MixSTE: Seq2seq Mixed Spatio-Temporal Encoder for 3D Human Pose Estimation in VideoPoster339 citations
- HiVT: Hierarchical Vector Transformer for Multi-Agent Motion PredictionPoster337 citations
- Shunted Self-Attention via Multi-Scale Token AggregationOral335 citations
- Deblurring via Stochastic RefinementOral334 citations
- CrossPoint: Self-Supervised Cross-Modal Contrastive Learning for 3D Point Cloud UnderstandingPoster333 citations
- Mask-Guided Spectral-Wise Transformer for Efficient Hyperspectral Image ReconstructionPoster333 citations
- HyperStyle: StyleGAN Inversion With HyperNetworks for Real Image EditingPoster330 citations
- Decoupling Zero-Shot Semantic SegmentationPoster329 citations
- SwinBERT: End-to-End Transformers With Sparse Attention for Video CaptioningPoster329 citations
- DanceTrack: Multi-Object Tracking in Uniform Appearance and Diverse MotionPoster327 citations
- CLIP-Forge: Towards Zero-Shot Text-To-Shape GenerationPoster323 citations
- Practical Stereo Matching via Cascaded Recurrent Network With Adaptive CorrelationOral318 citations
- StyleSwin: Transformer-Based GAN for High-Resolution Image GenerationPoster318 citations
- StyleGAN-V: A Continuous Video Generator With the Price, Image Quality and Perks of StyleGAN2Poster316 citations
- MonoScene: Monocular 3D Semantic Scene CompletionPoster314 citations
- Cross-View Transformers for Real-Time Map-View Semantic SegmentationOral313 citations
- High-Fidelity GAN Inversion for Image Attribute EditingPoster313 citations
- SimVP: Simpler Yet Better Video PredictionPoster312 citations
- InfoGCN: Representation Learning for Human Skeleton-Based Action RecognitionPoster310 citations
- Multi-Level Feature Learning for Contrastive Multi-View ClusteringOral308 citations
- Towards Language-Free Training for Text-to-Image GenerationPoster307 citations
- Embracing Single Stride 3D Object Detector With Sparse TransformerPoster305 citations
- TopFormer: Token Pyramid Transformer for Mobile Semantic SegmentationPoster304 citations
- AdaViT: Adaptive Vision Transformers for Efficient Image RecognitionPoster301 citations
- CLIPstyler: Image Style Transfer With a Single Text ConditionPoster301 citations
- Multi-Class Token Transformer for Weakly Supervised Semantic SegmentationPoster301 citations
- End-to-End Reconstruction-Classification Learning for Face Forgery DetectionPoster299 citations
- Learn From Others and Be Yourself in Heterogeneous Federated LearningPoster299 citations
- SoftGroup for 3D Instance Segmentation on Point CloudsOral297 citations
- Focal Sparse Convolutional Networks for 3D Object DetectionOral295 citations
- Panoptic Neural Fields: A Semantic Object-Aware Neural Scene RepresentationPoster293 citations
- Perturbed and Strict Mean Teachers for Semi-Supervised Semantic SegmentationPoster293 citations
- HeadNeRF: A Real-Time NeRF-Based Parametric Head ModelPoster292 citations
- Forward Compatible Few-Shot Class-Incremental LearningPoster290 citations
- Deblur-NeRF: Neural Radiance Fields From Blurry ImagesPoster289 citations
- MERLOT Reserve: Neural Script Knowledge Through Vision and Language and SoundOral286 citations
- NeRF-Editing: Geometry Editing of Neural Radiance FieldsPoster285 citations
- Learning What Not To Segment: A New Perspective on Few-Shot SegmentationOral284 citations
- Attention Concatenation Volume for Accurate and Efficient Stereo MatchingPoster283 citations
- Self-Supervised Predictive Convolutional Attentive Block for Anomaly DetectionOral283 citations
- BEVT: BERT Pretraining of Video TransformersPoster282 citations
- Selective-Supervised Contrastive Learning With Noisy LabelsPoster280 citations
- Omnivore: A Single Model for Many Visual ModalitiesOral278 citations
- CAFE: Learning To Condense Dataset by Aligning FeaturesPoster277 citations
- VisualGPT: Data-Efficient Adaptation of Pretrained Language Models for Image CaptioningPoster277 citations
- Generalized Category DiscoveryPoster274 citations
- Multi-Scale High-Resolution Vision Transformer for Semantic SegmentationPoster274 citations
- Part-Based Pseudo Label Refinement for Unsupervised Person Re-IdentificationPoster274 citations
- SimMatch: Semi-Supervised Learning With Similarity MatchingPoster274 citations
- Come-Closer-Diffuse-Faster: Accelerating Conditional Diffusion Models for Inverse Problems Through Stochastic ContractionPoster273 citations
- Self-Supervised Learning of Adversarial Example: Towards Good Generalizations for Deepfake DetectionOral271 citations
- AutoSDF: Shape Priors for 3D Completion, Reconstruction and GenerationPoster268 citations
- GRAM: Generative Radiance Manifolds for 3D-Aware Image GenerationOral264 citations
- Joint Distribution Matters: Deep Brownian Distance Covariance for Few-Shot ClassificationOral264 citations
- Learning Affinity From Attention: End-to-End Weakly-Supervised Semantic Segmentation With TransformersPoster262 citations
- MeMViT: Memory-Augmented Multiscale Vision Transformer for Efficient Long-Term Video RecognitionOral261 citations
- REGTR: End-to-End Point Cloud Correspondences With TransformersPoster261 citations
- Self-Augmented Unpaired Image Dehazing via Density and Depth DecompositionPoster261 citations
- Balanced Contrastive Learning for Long-Tailed Visual RecognitionPoster259 citations
- CLRNet: Cross Layer Refinement Network for Lane DetectionPoster259 citations
- FaceFormer: Speech-Driven 3D Facial Animation With TransformersOral258 citations
- Deep Generalized Unfolding Networks for Image RestorationPoster256 citations
- I M Avatar: Implicit Morphable Head Avatars From VideosOral254 citations
- Perception Prioritized Training of Diffusion ModelsPoster254 citations
- Simple but Effective: CLIP Embeddings for Embodied AIPoster252 citations
- Stochastic Trajectory Prediction via Motion Indeterminacy DiffusionPoster252 citations
- Towards Robust Vision TransformerPoster252 citations
- Sparse Fuse Dense: Towards High Quality 3D Detection With Depth CompletionOral251 citations
- Class-Incremental Learning by Knowledge Distillation With Adaptive Feature ConsolidationOral249 citations
- Kubric: A Scalable Dataset GeneratorPoster249 citations
- Targeted Supervised Contrastive Learning for Long-Tailed RecognitionPoster249 citations
- Unified Contrastive Learning in Image-Text-Label SpacePoster249 citations
- PhysFormer: Facial Video-Based Physiological Measurement With Temporal Difference TransformerPoster248 citations
- Surface Representation for Point CloudsOral248 citations
- Balanced Multimodal Learning via On-the-Fly Gradient ModulationOral247 citations
- Cross-Image Relational Knowledge Distillation for Semantic SegmentationPoster247 citations
- Assembly101: A Large-Scale Multi-View Video Dataset for Understanding Procedural ActivitiesPoster246 citations
- Knowledge Distillation With the Reused Teacher ClassifierPoster246 citations
- Pushing the Limits of Simple Pipelines for Few-Shot Learning: External Data and Fine-Tuning Make a DifferencePoster246 citations
- Patch Slimming for Efficient Vision TransformersPoster245 citations
- Exact Feature Distribution Matching for Arbitrary Style Transfer and Domain GeneralizationOral244 citations
- FMCNet: Feature-Level Modality Compensation for Visible-Infrared Person Re-IdentificationPoster242 citations
- Rethinking Visual Geo-Localization for Large-Scale ApplicationsPoster242 citations
- OW-DETR: Open-World Detection TransformerPoster240 citations
- Localization Distillation for Dense Object DetectionPoster239 citations
- Align and Prompt: Video-and-Language Pre-Training With Entity PromptsPoster235 citations
- Neural Rays for Occlusion-Aware Image-Based RenderingPoster234 citations
- Cross-Domain Adaptive Teacher for Object DetectionPoster233 citations
- Layer-Wised Model Aggregation for Personalized Federated LearningPoster233 citations
- Thin-Plate Spline Motion Model for Image AnimationPoster233 citations
- Dual Cross-Attention Learning for Fine-Grained Visual Categorization and Object Re-IdentificationPoster230 citations
- Fast Point TransformerPoster230 citations
- EMOCA: Emotion Driven Monocular Face Capture and AnimationPoster229 citations
- Boosting Crowd Counting via Multifaceted AttentionPoster228 citations
- HDR-NeRF: High Dynamic Range Neural Radiance FieldsPoster228 citations
- HumanNeRF: Efficiently Generated Human Radiance Field From Sparse InputsPoster227 citations
- ABO: Dataset and Benchmarks for Real-World 3D Object UnderstandingPoster225 citations
- Advancing High-Resolution Video-Language Representation With Large-Scale Video TranscriptionsPoster225 citations
- Clothes-Changing Person Re-Identification With RGB Modality OnlyPoster225 citations
- InfoNeRF: Ray Entropy Minimization for Few-Shot Neural Volume RenderingPoster225 citations
- Rethinking Architecture Design for Tackling Data Heterogeneity in Federated LearningPoster224 citations
- Neural Head Avatars From Monocular RGB VideosPoster223 citations
- GeoNeRF: Generalizing NeRF With Geometry PriorsPoster221 citations
- MeMOT: Multi-Object Tracking With MemoryOral221 citations
- SIGMA: Semantic-Complete Graph Matching for Domain Adaptive Object DetectionOral221 citations
- End-to-End Generative Pretraining for Multimodal Video CaptioningPoster220 citations
- Point Density-Aware Voxels for LiDAR 3D Object DetectionPoster219 citations
- Structured Local Radiance Fields for Human Avatar ModelingPoster218 citations
- Bailando: 3D Dance Generation by Actor-Critic GPT With Choreographic MemoryOral217 citations
- Detecting Camouflaged Object in Frequency DomainPoster217 citations
- Local Learning Matters: Rethinking Data Heterogeneity in Federated LearningOral217 citations
- Multimodal Token Fusion for Vision TransformersPoster217 citations
- Self-Supervised Models Are Continual LearnersPoster217 citations
- Learning From All VehiclesPoster216 citations
- Modulated Contrast for Versatile Image SynthesisPoster216 citations
- Point-to-Voxel Knowledge Distillation for LiDAR Semantic SegmentationPoster215 citations
- Class Re-Activation Maps for Weakly-Supervised Semantic SegmentationPoster214 citations
- MonoDTR: Monocular 3D Object Detection With Depth-Aware TransformerPoster214 citations
- BEHAVE: Dataset and Method for Tracking Human Object InteractionsPoster213 citations
- Causality Inspired Representation Learning for Domain GeneralizationOral213 citations
- Learning With Twin Noisy Labels for Visible-Infrared Person Re-IdentificationPoster213 citations
- TCTrack: Temporal Contexts for Aerial TrackingPoster213 citations
- Local Texture Estimator for Implicit Representation FunctionPoster212 citations
- EDTER: Edge Detection With TransformerPoster211 citations
- Federated Class-Incremental LearningPoster211 citations
- Voxel Set Transformer: A Set-to-Set Approach to 3D Object Detection From Point CloudsPoster211 citations
- X-Pool: Cross-Modal Language-Video Attention for Text-Video RetrievalPoster211 citations
- Global Tracking TransformersPoster209 citations
- Scene Representation Transformer: Geometry-Free Novel View Synthesis Through Set-Latent Scene RepresentationsPoster208 citations
- Visible-Thermal UAV Tracking: A Large-Scale Benchmark and New BaselinePoster208 citations
- Segment, Magnify and Reiterate: Detecting Camouflaged Objects the Hard WayPoster207 citations
- Self-Sustaining Representation Expansion for Non-Exemplar Class-Incremental LearningPoster207 citations
- Generative Cooperative Learning for Unsupervised Video Anomaly DetectionPoster205 citations
- Depth-Aware Generative Adversarial Network for Talking Head Video GenerationPoster203 citations
- Domain Generalization via Shuffled Style Assembly for Face Anti-SpoofingPoster203 citations
- BANMo: Building Animatable 3D Neural Models From Many Casual VideosOral202 citations
- Learning Multiple Adverse Weather Removal via Two-Stage Knowledge Learning and Multi-Contrastive Regularization: Toward a Unified ModelPoster202 citations
- Rethinking Efficient Lane Detection via Curve ModelingPoster202 citations
- Incremental Transformer Structure Enhanced Image Inpainting With Masking Positional EncodingPoster201 citations
- Reusing the Task-Specific Classifier as a Discriminator: Discriminator-Free Adversarial Domain AdaptationPoster201 citations
- Physical Inertial Poser (PIP): Physics-Aware Real-Time Human Motion Tracking From Sparse Inertial SensorsPoster200 citations
- The Majority Can Help the Minority: Context-Rich Minority Oversampling for Long-Tailed ClassificationPoster200 citations
- Category Contrast for Unsupervised Domain Adaptation in Visual TasksPoster199 citations
- Deep Hierarchical Semantic SegmentationPoster199 citations
- General Facial Representation Learning in a Visual-Linguistic MannerOral199 citations
- Revisiting the "Video" in Video-Language UnderstandingOral199 citations
- ScanQA: 3D Question Answering for Spatial Scene UnderstandingOral199 citations
- Long-Tailed Recognition via Weight BalancingPoster197 citations
- Are Multimodal Transformers Robust to Missing Modality?Poster196 citations
- Details or Artifacts: A Locally Discriminative Learning Approach to Realistic Image Super-ResolutionOral196 citations
- EPro-PnP: Generalized End-to-End Probabilistic Perspective-N-Points for Monocular Object Pose EstimationOral196 citations
- LAS-AT: Adversarial Training With Learnable Attack StrategyOral196 citations
- Unpaired Deep Image Deraining Using Dual Contrastive LearningPoster196 citations
- Blind2Unblind: Self-Supervised Image Denoising With Visible Blind SpotsPoster195 citations
- Transformer Tracking With Cyclic Shifting Window AttentionPoster195 citations
- Regional Semantic Contrast and Aggregation for Weakly Supervised Semantic SegmentationPoster194 citations
- Self-Supervised Transformers for Unsupervised Object Discovery Using Normalized CutPoster194 citations
- Few-Shot Object Detection With Fully Cross-TransformerOral193 citations
- Gait Recognition in the Wild With Dense 3D Representations and a BenchmarkPoster192 citations
- Self-Supervised Image-Specific Prototype Exploration for Weakly Supervised Semantic SegmentationPoster192 citations
- Shadows Can Be Dangerous: Stealthy and Effective Physical-World Adversarial Attack by Natural PhenomenonPoster192 citations
- UMT: Unified Multi-Modal Transformers for Joint Video Moment Retrieval and Highlight DetectionPoster191 citations
- Correlation-Aware Deep TrackingPoster190 citations
- ObjectFormer for Image Manipulation Detection and LocalizationPoster190 citations
- Spiking Transformers for Event-Based Single Object TrackingPoster190 citations
- Deep Spectral Methods: A Surprisingly Strong Baseline for Unsupervised Semantic Segmentation and LocalizationOral188 citations
- HDNet: High-Resolution Dual-Domain Learning for Spectral Compressive ImagingPoster188 citations
- Language As Queries for Referring Video Object SegmentationPoster188 citations
- Neural 3D Scene Reconstruction With the Manhattan-World AssumptionOral188 citations
- UniCon: Combating Label Noise Through Uniform Selection and Contrastive LearningPoster188 citations
- Constrained Few-Shot Class-Incremental LearningPoster187 citations
- Parameter-Free Online Test-Time AdaptationOral187 citations
- DoubleField: Bridging the Neural Surface and Radiance Fields for High-Fidelity Human Reconstruction and RenderingPoster186 citations
- MetaFSCIL: A Meta-Learning Approach for Few-Shot Class Incremental LearningPoster186 citations
- Splicing ViT Features for Semantic Appearance TransferOral186 citations
- Towards an End-to-End Framework for Flow-Guided Video InpaintingPoster186 citations
- FocalClick: Towards Practical Interactive Image SegmentationPoster185 citations
- ZeroCap: Zero-Shot Image-to-Text Generation for Visual-Semantic ArithmeticPoster185 citations
- Contrastive Boundary Learning for Point Cloud SegmentationPoster184 citations
- Lepard: Learning Partial Point Cloud Matching in Rigid and Deformable ScenesOral184 citations
- SelfRecon: Self Reconstruction Your Digital Avatar From Monocular VideoOral184 citations
- Training High-Performance Low-Latency Spiking Neural Networks by Differentiation on Spike RepresentationPoster184 citations
- CLIMS: Cross Language Image Matching for Weakly Supervised Semantic SegmentationPoster183 citations
- HOI4D: A 4D Egocentric Dataset for Category-Level Human-Object InteractionPoster183 citations
- L2G: A Simple Local-to-Global Knowledge Transfer Framework for Weakly Supervised Semantic SegmentationPoster183 citations
- A Simple Multi-Modality Transfer Learning Baseline for Sign Language TranslationPoster182 citations
- Sparse Instance Activation for Real-Time Instance SegmentationPoster182 citations
- End-to-End Referring Video Object Segmentation With Multimodal TransformersPoster181 citations
- IFRNet: Intermediate Feature Refine Network for Efficient Frame InterpolationPoster181 citations
- Robust Federated Learning With Noisy and Heterogeneous ClientsPoster181 citations
- Think Global, Act Local: Dual-Scale Graph Transformer for Vision-and-Language NavigationOral181 citations
- TransGeo: Transformer Is All You Need for Cross-View Image Geo-LocalizationPoster181 citations
- Putting People in Their Place: Monocular Regression of 3D People in DepthPoster180 citations
- Bridging Video-Text Retrieval With Multiple Choice QuestionsOral179 citations
- Cloth-Changing Person Re-Identification From a Single Image With Gait Prediction and RegularizationPoster179 citations
- Feature Erasing and Diffusion Network for Occluded Person Re-IdentificationPoster179 citations
- Fourier PlenOctrees for Dynamic Radiance Field Rendering in Real-TimeOral178 citations
- Learning Memory-Augmented Unidirectional Metrics for Cross-Modality Person Re-IdentificationPoster178 citations
- PONI: Potential Functions for ObjectGoal Navigation With Interaction-Free LearningOral178 citations
- MSDN: Mutually Semantic Distillation Network for Zero-Shot LearningPoster177 citations
- UBnormal: New Benchmark for Supervised Open-Set Video Anomaly DetectionPoster177 citations
- Improving Adversarial Transferability via Neuron Attribution-Based AttacksPoster176 citations
- Protecting Celebrities From DeepFake With Identity Consistency TransformerPoster176 citations
- ReSTR: Convolution-Free Referring Image Segmentation Using TransformersPoster176 citations
- ZebraPose: Coarse To Fine Surface Encoding for 6DoF Object Pose EstimationPoster176 citations
- BACON: Band-Limited Coordinate Networks for Multiscale Scene RepresentationOral175 citations
- NFormer: Robust Person Re-Identification With Neighbor TransformerPoster175 citations
- NeRFReN: Neural Radiance Fields With ReflectionsPoster175 citations
- Keypoint Transformer: Solving Joint Identification in Challenging Hands and Object Interactions for Accurate 3D Pose EstimationOral174 citations
- OnePose: One-Shot Object Pose Estimation Without CAD ModelsPoster174 citations
- Negative-Aware Attention Framework for Image-Text MatchingPoster173 citations
- StylizedNeRF: Consistent 3D Scene Stylization As Stylized NeRF via 2D-3D Mutual LearningPoster172 citations
- Balanced MSE for Imbalanced Visual RegressionOral171 citations
- GroupNet: Multiscale Hypergraph Neural Networks for Trajectory Prediction With Relational ReasoningPoster171 citations
- P3Depth: Monocular Depth Estimation With a Piecewise Planarity PriorPoster170 citations
- Everything at Once - Multi-Modal Fusion Transformer for Video RetrievalPoster169 citations
- FENeRF: Face Editing in Neural Radiance FieldsPoster169 citations
- Modeling Indirect Illumination for Inverse RenderingPoster168 citations
- Rethinking Depth Estimation for Multi-View Stereo: A Unified RepresentationPoster168 citations
- Text to Image Generation With Semantic-Spatial Aware GANPoster168 citations
- TransVPR: Transformer-Based Place Recognition With Multi-Level Attention AggregationOral168 citations
- End-to-End Multi-Person Pose Estimation With TransformersOral167 citations
- Not All Tokens Are Equal: Human-Centric Visual Analysis via Token Clustering TransformerOral167 citations
- An Image Patch Is a Wave: Phase-Aware Vision MLPOral166 citations
- On Adversarial Robustness of Trajectory Prediction for Autonomous VehiclesPoster166 citations
- SC2-PCR: A Second Order Spatial Compatibility for Efficient and Robust Point Cloud RegistrationPoster166 citations
- SHIFT: A Synthetic Driving Dataset for Continuous Multi-Task Domain AdaptationPoster166 citations
- Deep Color Consistent Network for Low-Light Image EnhancementPoster165 citations
- EfficientNeRF Efficient Neural Radiance FieldsPoster165 citations
- GEN-VLKT: Simplify Association and Enhance Interaction Understanding for HOI DetectionPoster163 citations
- AEGNN: Asynchronous Event-Based Graph Neural NetworksPoster162 citations
- MiniViT: Compressing Vision Transformers With Weight MultiplexingPoster162 citations
- Pointly-Supervised Instance SegmentationOral162 citations
- MixFormer: Mixing Features Across Windows and DimensionsOral161 citations
- POCO: Point Convolution for Surface ReconstructionPoster161 citations
- Panoptic SegFormer: Delving Deeper Into Panoptic Segmentation With TransformersPoster161 citations
- Photorealistic Monocular 3D Reconstruction of Humans Wearing ClothingPoster161 citations
- Source-Free Domain Adaptation via Distribution EstimationPoster161 citations
- ShapeFormer: Transformer-Based Shape Completion via Sparse RepresentationPoster160 citations
- AP-BSN: Self-Supervised Denoising for Real-World Images via Asymmetric PD and Blind-Spot NetworkPoster159 citations
- PixMix: Dreamlike Pictures Comprehensively Improve Safety MeasuresPoster158 citations
- DETReg: Unsupervised Pretraining With Region Priors for Object DetectionPoster157 citations
- Deformable ProtoPNet: An Interpretable Image Classifier Using Deformable PrototypesPoster157 citations
- GCR: Gradient Coreset Based Replay Buffer Selection for Continual LearningPoster157 citations
- Generating Useful Accident-Prone Driving Scenarios via a Learned Traffic PriorPoster157 citations
- Learning To Answer Questions in Dynamic Audio-Visual ScenariosOral157 citations
- PCL: Proxy-Based Contrastive Learning for Domain GeneralizationPoster157 citations
- Semantic-Aware Domain Generalized SegmentationOral157 citations
- A Keypoint-Based Global Association Network for Lane DetectionPoster154 citations
- Mask Transfiner for High-Quality Instance SegmentationPoster154 citations
- Spatio-Temporal Relation Modeling for Few-Shot Action RecognitionPoster154 citations
- Light Field Neural RenderingOral153 citations
- HyperInverter: Improving StyleGAN Inversion via HypernetworkPoster152 citations
- Improving Neural Implicit Surfaces Geometry With Patch WarpingPoster152 citations
- Learning Non-Target Knowledge for Few-Shot Semantic SegmentationPoster152 citations
- Towards Efficient and Scalable Sharpness-Aware MinimizationPoster152 citations
- Towards Principled Disentanglement for Domain GeneralizationOral152 citations
- Video Frame Interpolation With TransformerPoster152 citations
- When Does Contrastive Visual Representation Learning Work?Poster152 citations
- AdaMixer: A Fast-Converging Query-Based Object DetectorOral151 citations
- CLIP-Event: Connecting Text and Images With Event StructuresOral151 citations
- Cross-Domain Few-Shot Learning With Task-Specific AdaptersPoster151 citations
- Lite Vision Transformer With Enhanced Self-AttentionPoster151 citations
- Remember Intentions: Retrospective-Memory-Based Trajectory PredictionPoster151 citations
- SwinTextSpotter: Scene Text Spotting via Better Synergy Between Text Detection and Text RecognitionPoster151 citations
- Capturing and Inferring Dense Full-Body Human-Scene ContactPoster150 citations
- Knowledge Distillation via the Target-Aware TransformerOral150 citations
- RigNeRF: Fully Controllable Neural 3D PortraitsPoster150 citations
- The Norm Must Go On: Dynamic Unsupervised Domain Adaptation by NormalizationPoster150 citations
- Leveraging Real Talking Faces via Self-Supervision for Robust Forgery DetectionPoster149 citations
- Time Lens++: Event-Based Frame Interpolation With Parametric Non-Linear Flow and Multi-Scale FusionPoster149 citations
- Expressive Talking Head Generation With Granular Audio-Visual ControlPoster148 citations
- b-DARTS: Beta-Decay Regularization for Differentiable Architecture SearchOral148 citations
- Adversarial Texture for Fooling Person Detectors in the Physical WorldOral147 citations
- GPV-Pose: Category-Level Object Pose Estimation via Geometry-Guided Point-Wise VotingPoster147 citations
- Improving Visual Grounding With Visual-Linguistic Verification and Iterative ReasoningPoster147 citations
- Invariant Grounding for Video Question AnsweringOral147 citations
- LiDAR Snowfall Simulation for Robust 3D Object DetectionOral147 citations
- PatchNet: A Simple Face Anti-Spoofing Framework via Fine-Grained Patch RecognitionPoster147 citations
- Uni-Perceiver: Pre-Training Unified Architecture for Generic Perception for Zero-Shot and Few-Shot TasksPoster147 citations
- Auditing Privacy Defenses in Federated Learning via Generative Gradient LeakagePoster146 citations
- CAT-Det: Contrastively Augmented Transformer for Multi-Modal 3D Object DetectionPoster145 citations
- Pastiche Master: Exemplar-Based High-Resolution Portrait Style TransferPoster145 citations
- Adaptive Early-Learning Correction for Segmentation From Noisy AnnotationsOral144 citations
- HyperTransformer: A Textural and Spectral Feature Fusion Transformer for PansharpeningPoster144 citations
- Style-Based Global Appearance Flow for Virtual Try-OnPoster144 citations
- Efficient Two-Stage Detection of Human-Object Interactions With a Novel Unary-Pairwise TransformerPoster143 citations
- Highly-Efficient Incomplete Large-Scale Multi-View Clustering With Consensus Bipartite GraphPoster143 citations
- C2AM: Contrastive Learning of Class-Agnostic Activation Map for Weakly Supervised Object Localization and Semantic SegmentationPoster142 citations
- Catching Both Gray and Black Swans: Open-Set Supervised Anomaly DetectionPoster142 citations
- Equalized Focal Loss for Dense Long-Tailed Object DetectionPoster142 citations
- 3D Common Corruptions and Data AugmentationOral141 citations
- 3D-Aware Image Synthesis via Learning Structural and Textural RepresentationsPoster141 citations
- Unbiased Teacher v2: Semi-Supervised Object Detection for Anchor-Free and Anchor-Based DetectorsPoster141 citations
- Crafting Better Contrastive Views for Siamese Representation LearningOral140 citations
- Hire-MLP: Vision MLP via Hierarchical RearrangementPoster140 citations
- Progressively Generating Better Initial Guesses Towards Next Stages for High-Quality Human Motion PredictionPoster140 citations
- PubTables-1M: Towards Comprehensive Table Extraction From Unstructured DocumentsPoster140 citations
- Stochastic Variance Reduced Ensemble Adversarial Attack for Boosting the Adversarial TransferabilityPoster140 citations
- Class-Aware Contrastive Semi-Supervised LearningPoster139 citations
- Coarse-To-Fine Q-Attention: Efficient Learning for Visual Robotic Manipulation via DiscretisationOral139 citations
- Lite Pose: Efficient Architecture Design for 2D Human Pose EstimationPoster139 citations
- FedCor: Correlation-Based Active Client Selection Strategy for Heterogeneous Federated LearningPoster138 citations
- Learning Hierarchical Cross-Modal Association for Co-Speech Gesture GenerationPoster138 citations
- SGTR: End-to-End Scene Graph Generation With TransformerPoster138 citations
- Simple Multi-Dataset DetectionPoster138 citations
- Unified Transformer Tracker for Object TrackingPoster138 citations
- Frequency-Driven Imperceptible Adversarial Attack on Semantic SimilarityPoster137 citations
- Hallucinated Neural Radiance Fields in the WildPoster137 citations
- Injecting Semantic Concepts Into End-to-End Image CaptioningPoster137 citations
- Robust Invertible Image SteganographyPoster137 citations
- SurfEmb: Dense and Continuous Correspondence Distributions for Object Pose Estimation With Learnt Surface EmbeddingsPoster137 citations
- Efficient Deep Embedded Subspace ClusteringPoster136 citations
- FreeSOLO: Learning To Segment Objects Without AnnotationsPoster136 citations
- GLAMR: Global Occlusion-Aware Human Mesh Recovery With Dynamic CamerasOral136 citations
- GraFormer: Graph-Oriented Transformer for 3D Pose EstimationPoster136 citations
- MuKEA: Multimodal Knowledge Extraction and Accumulation for Knowledge-Based Visual Question AnsweringPoster136 citations
- Video Frame Interpolation TransformerPoster136 citations
- Hyperbolic Vision Transformers: Combining Improvements in Metric LearningPoster135 citations
- Image-to-Lidar Self-Supervised Distillation for Autonomous Driving DataPoster135 citations
- Implicit Sample Extension for Unsupervised Person Re-IdentificationPoster135 citations
- Rope3D: The Roadside Perception Dataset for Autonomous Driving and Monocular 3D Object Detection TaskPoster135 citations
- Text Spotting TransformersPoster135 citations
- TransMix: Attend To Mix for Vision TransformersPoster135 citations
- CRAFT: Cross-Attentional Flow Transformer for Robust Optical FlowPoster134 citations
- Pyramid Grafting Network for One-Stage High Resolution Saliency DetectionPoster134 citations
- Backdoor Attacks on Self-Supervised LearningOral133 citations
- Delving Deep Into the Generalization of Vision Transformers Under Distribution ShiftsPoster133 citations
- HairCLIP: Design Your Hair by Text and Reference ImagePoster133 citations
- Interacting Attention Graph for Single Image Two-Hand ReconstructionOral133 citations
- Long-Tailed Visual Recognition via Gaussian Clouded Logit AdjustmentPoster133 citations
- Multimodal Dynamics: Dynamical Fusion for Trustworthy Multimodal ClassificationPoster133 citations
- Active Learning by Feature MixingPoster132 citations
- DINE: Domain Adaptation From Single and Multiple Black-Box PredictorsOral132 citations
- Debiased Learning From Naturally Imbalanced Pseudo-LabelsPoster132 citations
- Multi-View Transformer for 3D Visual GroundingPoster132 citations
- Deep Constrained Least Squares for Blind Image Super-ResolutionPoster131 citations
- Representation Compensation Networks for Continual Semantic SegmentationPoster131 citations
- Revisiting Random Channel Pruning for Neural Network CompressionPoster131 citations
- Self-Supervised Video TransformerOral131 citations
- Burst Image Restoration and EnhancementOral130 citations
- Discrete Cosine Transform Network for Guided Depth Map Super-ResolutionOral130 citations
- Protecting Facial Privacy: Generating Adversarial Identity Masks via Style-Robust Makeup TransferPoster130 citations
- Accelerating DETR Convergence via Semantic-Aligned MatchingPoster129 citations
- Comprehending and Ordering Semantics for Image CaptioningPoster129 citations
- Face2Exp: Combating Data Biases for Facial Expression RecognitionPoster129 citations
- Overcoming Catastrophic Forgetting in Incremental Object Detection via Elastic Response DistillationPoster129 citations
- PTTR: Relational 3D Point Cloud Object Tracking With TransformerPoster129 citations
- HandOccNet: Occlusion-Robust 3D Hand Mesh Estimation NetworkPoster127 citations
- Matching Feature Sets for Few-Shot Image ClassificationPoster127 citations
- Retrieval Augmented Classification for Long-Tail Visual RecognitionPoster127 citations
- Stacked Hybrid-Attention and Group Collaborative Learning for Unbiased Scene Graph GenerationPoster127 citations
- Weakly Supervised Semantic Segmentation Using Out-of-Distribution DataPoster127 citations
- RFNet: Unsupervised Network for Mutually Reinforcing Multi-Modal Image Registration and FusionPoster126 citations
- Towards Data-Free Model Stealing in a Hard Label SettingPoster126 citations
- Investigating Tradeoffs in Real-World Video Super-ResolutionPoster125 citations
- Learning Trajectory-Aware Transformer for Video Super-ResolutionOral125 citations
- NeRFusion: Fusing Radiance Fields for Large-Scale Scene ReconstructionOral125 citations
- OoD-Bench: Quantifying and Understanding Two Dimensions of Out-of-Distribution GeneralizationOral125 citations
- A Dual Weighting Label Assignment Scheme for Object DetectionPoster124 citations
- ACPL: Anti-Curriculum Pseudo-Labelling for Semi-Supervised Medical Image ClassificationPoster124 citations
- GOAL: Generating 4D Whole-Body Motion for Hand-Object GraspingPoster124 citations
- Recurring the Transformer for Video Action RecognitionPoster124 citations
- Rethinking Spatial Invariance of Convolutional Networks for Object CountingPoster124 citations
- Event-Based Video Reconstruction via Potential-Assisted Spiking Neural NetworkPoster123 citations
- FIBA: Frequency-Injection Based Backdoor Attack in Medical Image AnalysisPoster123 citations
- IterMVS: Iterative Probability Estimation for Efficient Multi-View StereoPoster123 citations
- Label, Verify, Correct: A Simple Few Shot Object Detection MethodPoster123 citations
- MAD: A Scalable Dataset for Language Grounding in Videos From Movie Audio DescriptionsPoster123 citations
- RestoreFormer: High-Quality Blind Face Restoration From Undegraded Key-Value PairsPoster123 citations
- BoostMIS: Boosting Medical Image Semi-Supervised Learning With Adaptive Pseudo Labeling and Informative Active AnnotationPoster122 citations
- Estimating Example Difficulty Using Variance of GradientsPoster122 citations
- Graph Sampling Based Deep Metric Learning for Generalizable Person Re-IdentificationPoster122 citations
- M2I: From Factored Marginal Trajectory Prediction to Interactive PredictionPoster122 citations
- Robust Optimization As Data Augmentation for Large-Scale GraphsPoster122 citations
- BigDatasetGAN: Synthesizing ImageNet With Pixel-Wise AnnotationsPoster121 citations
- Coopernaut: End-to-End Driving With Cooperative Perception for Networked VehiclesPoster121 citations
- Few Could Be Better Than All: Feature Sampling and Grouping for Scene Text DetectionPoster121 citations
- Hybrid Relation Guided Set Matching for Few-Shot Action RecognitionPoster121 citations
- Nested Collaborative Learning for Long-Tailed Visual RecognitionPoster121 citations
- Nonuniform-to-Uniform Quantization: Towards Accurate Quantization via Generalized Straight-Through EstimationPoster121 citations
- Semi-Supervised Semantic Segmentation With Error Localization NetworkPoster121 citations
- Spatio-Temporal Gating-Adjacency GCN for Human Motion PredictionPoster121 citations
- Task-Specific Inconsistency Alignment for Domain Adaptive Object DetectionPoster121 citations
- 3DJCG: A Unified Framework for Joint Dense Captioning and Visual Grounding on 3D Point CloudsOral120 citations
- ASM-Loc: Action-Aware Segment Modeling for Weakly-Supervised Temporal Action LocalizationPoster120 citations
- BppAttack: Stealthy and Efficient Trojan Attacks Against Deep Neural Networks via Image Quantization and Contrastive Adversarial LearningPoster120 citations
- Bridging Global Context Interactions for High-Fidelity Image CompletionPoster120 citations
- FashionVLP: Vision Language Transformer for Fashion Retrieval With FeedbackPoster120 citations
- Self-Supervised Learning of Object Parts for Semantic SegmentationPoster120 citations
- TubeDETR: Spatio-Temporal Video Grounding With TransformersOral120 citations
- Unknown-Aware Object Detection: Learning What You Don't Know From Videos in the WildOral120 citations
- VideoINR: Learning Video Implicit Neural Representation for Continuous Space-Time Super-ResolutionPoster120 citations
- DASO: Distribution-Aware Semantics-Oriented Pseudo-Label for Imbalanced Semi-Supervised LearningPoster119 citations
- The Devil Is in the Labels: Noisy Label Correction for Robust Scene Graph GenerationOral119 citations
- C-CAM: Causal CAM for Weakly Supervised Semantic Segmentation on Medical ImagePoster118 citations
- Exploring Patch-Wise Semantic Relation for Contrastive Learning in Image-to-Image Translation TasksPoster118 citations
- What Makes Transfer Learning Work for Medical Images: Feature Reuse & Other FactorsPoster118 citations
- FineDiving: A Fine-Grained Dataset for Procedure-Aware Action Quality AssessmentOral117 citations
- Habitat-Web: Learning Embodied Object-Search Strategies From Human Demonstrations at ScalePoster117 citations
- Learning Neural Light Fields With Ray-Space EmbeddingPoster117 citations
- Safe Self-Refinement for Transformer-Based Domain AdaptationPoster117 citations
- Unsupervised Domain Adaptation for Nighttime Aerial TrackingPoster117 citations
- FedCorr: Multi-Stage Federated Learning for Label Noise CorrectionPoster116 citations
- IRON: Inverse Rendering by Optimizing Neural SDFs and Materials From Photometric ImagesOral116 citations
- LOLNerf: Learn From One LookPoster116 citations
- Sub-Word Level Lip Reading With Visual AttentionPoster116 citations
- Towards Semi-Supervised Deep Facial Expression Recognition With an Adaptive Confidence MarginPoster116 citations
- Ditto: Building Digital Twins of Articulated Objects From InteractionOral115 citations
- Hyperbolic Image SegmentationPoster114 citations
- Voxel Field Fusion for 3D Object DetectionPoster114 citations
- E2EC: An End-to-End Contour-Based Method for High-Quality High-Speed Instance SegmentationPoster113 citations
- Hierarchical Modular Network for Video CaptioningPoster113 citations
- Transform-Retrieve-Generate: Natural Language-Centric Outside-Knowledge Visual Question AnsweringPoster113 citations
- Affine Medical Image Registration With Coarse-To-Fine Vision TransformerPoster112 citations
- DiRA: Discriminative, Restorative, and Adversarial Learning for Self-Supervised Medical Image AnalysisPoster112 citations
- QS-Attn: Query-Selected Attention for Contrastive Learning in I2I TranslationPoster112 citations
- WildNet: Learning Domain Generalized Semantic Segmentation From the WildPoster112 citations
- Class-Balanced Pixel-Level Self-Labeling for Domain Adaptive Semantic SegmentationPoster111 citations
- ClusterGNN: Cluster-Based Coarse-To-Fine Graph Neural Network for Efficient Feature MatchingPoster111 citations
- D-Grasp: Physically Plausible Dynamic Grasp Synthesis for Hand-Object InteractionsPoster111 citations
- Dynamic Prototype Convolution Network for Few-Shot Semantic SegmentationPoster111 citations
- Exploring Domain-Invariant Parameters for Source Free Domain AdaptationPoster111 citations
- Learning To Generate Line Drawings That Convey Geometry and SemanticsPoster111 citations
- MISF: Multi-Level Interactive Siamese Filtering for High-Fidelity Image InpaintingPoster111 citations
- Segment and Complete: Defending Object Detectors Against Adversarial Patch Attacks With Robust Patch DetectionPoster111 citations
- SemanticStyleGAN: Learning Compositional Generative Priors for Controllable Image Synthesis and EditingPoster111 citations
- Towards Fewer Annotations: Active Learning via Region Impurity and Prediction Uncertainty for Domain Adaptive Semantic SegmentationOral111 citations
- CMT-DeepLab: Clustering Mask Transformers for Panoptic SegmentationOral110 citations
- Event-Aided Direct Sparse OdometryOral110 citations
- FERV39k: A Large-Scale Multi-Scene Dataset for Facial Expression Recognition in VideosPoster110 citations
- FaceVerse: A Fine-Grained and Detail-Controllable 3D Face Morphable Model From a Hybrid DatasetPoster110 citations
- Beyond 3D Siamese Tracking: A Motion-Centric Paradigm for 3D Single Object Tracking in Point CloudsOral109 citations
- CoNeRF: Controllable Neural Radiance FieldsPoster109 citations
- Generalized Few-Shot Semantic SegmentationPoster109 citations
- LaTr: Layout-Aware Transformer for Scene-Text VQAOral109 citations
- Multi-Frame Self-Supervised Depth With TransformersPoster109 citations
- Represent, Compare, and Learn: A Similarity-Aware Framework for Class-Agnostic CountingPoster109 citations
- Weakly Supervised Temporal Sentence Grounding With Gaussian-Based Contrastive Proposal LearningPoster109 citations
- A Self-Supervised Descriptor for Image Copy DetectionPoster108 citations
- Capturing Humans in Motion: Temporal-Attentive 3D Human Pose and Shape Estimation From Monocular VideoPoster108 citations
- Evading the Simplicity Bias: Training a Diverse Set of Models Discovers Solutions With Superior OOD GeneralizationPoster108 citations
- M3T: Three-Dimensional Medical Image Classifier Using Multi-Plane and Multi-Slice TransformerPoster108 citations
- Style Neophile: Constantly Seeking Novel Styles for Domain GeneralizationPoster108 citations
- Towards End-to-End Unified Scene Text Detection and Layout AnalysisPoster108 citations
- Towards Implicit Text-Guided 3D Shape GenerationPoster108 citations
- Bending Reality: Distortion-Aware Transformers for Adapting to Panoramic Semantic SegmentationPoster107 citations
- Coarse-To-Fine Deep Video Coding With Hyperprior-Guided Mode PredictionPoster107 citations
- DynamicEarthNet: Daily Multi-Spectral Satellite Dataset for Semantic Change SegmentationPoster107 citations
- MobRecon: Mobile-Friendly Hand Mesh Reconstruction From Monocular ImagePoster107 citations
- Mutual Information-Driven Pan-SharpeningPoster107 citations
- Video K-Net: A Simple, Strong, and Unified Baseline for Video SegmentationOral107 citations
- Global Matching With Overlapping Attention for Optical Flow EstimationPoster106 citations
- Occlusion-Aware Cost Constructor for Light Field Depth EstimationPoster106 citations
- Open-Domain, Content-Based, Multi-Modal Fact-Checking of Out-of-Context Images via Online ResourcesPoster106 citations
- Open-Vocabulary One-Stage Detection With Hierarchical Visual-Language Knowledge DistillationPoster106 citations
- Reduce Information Loss in Transformers for Pluralistic Image InpaintingPoster106 citations
- WebQA: Multihop and Multimodal QAOral106 citations
- Differentially Private Federated Learning With Local Regularization and SparsificationPoster105 citations
- Joint Hand Motion and Interaction Hotspots Prediction From Egocentric VideosPoster105 citations
- Learning To Listen: Modeling Non-Deterministic Dyadic Facial MotionPoster105 citations
- MulT: An End-to-End Multitask Learning TransformerPoster105 citations
- Object-Region Video TransformersPoster105 citations
- Pix2NeRF: Unsupervised Conditional p-GAN for Single Image to Neural Radiance Fields TranslationPoster105 citations
- PolyWorld: Polygonal Building Extraction With Graph Neural Networks in Satellite ImagesPoster105 citations
- Temporal Alignment Networks for Long-Term VideoOral105 citations
- XYLayoutLM: Towards Layout-Aware Multimodal Networks for Visually-Rich Document UnderstandingPoster105 citations
- Fine-Grained Temporal Contrastive Learning for Weakly-Supervised Temporal Action LocalizationPoster104 citations
- HybridCR: Weakly-Supervised 3D Point Cloud Semantic Segmentation via Hybrid Contrastive RegularizationPoster104 citations
- Implicit Motion Handling for Video Camouflaged Object DetectionPoster104 citations
- Killing Two Birds With One Stone: Efficient and Robust Training of Face Recognition CNNs by Partial FCPoster104 citations
- Not Just Selection, but Exploration: Online Class-Incremental Continual Learning via Dual View ConsistencyPoster104 citations
- Open-Vocabulary Instance Segmentation via Robust Cross-Modal Pseudo-LabelingPoster104 citations
- Raw High-Definition Radar for Multi-Task LearningPoster104 citations
- Wavelet Knowledge Distillation: Towards Efficient Image-to-Image TranslationPoster104 citations
- Bijective Mapping Network for Shadow RemovalOral103 citations
- CHEX: CHannel EXploration for CNN Model CompressionPoster103 citations
- Deep Visual Geo-Localization BenchmarkOral103 citations
- GIRAFFE HD: A High-Resolution 3D-Aware Generative ModelPoster103 citations
- Rethinking Minimal Sufficient Representation in Contrastive LearningOral103 citations
- Trustworthy Long-Tailed ClassificationPoster103 citations
- Exploring Dual-Task Correlation for Pose Guided Person Image GenerationPoster102 citations
- Scribble-Supervised LiDAR Semantic SegmentationOral102 citations
- Use All the Labels: A Hierarchical Multi-Label Contrastive Learning FrameworkPoster102 citations
- What's in Your Hands? 3D Reconstruction of Generic Objects in HandsPoster102 citations
- Animal Kingdom: A Large and Diverse Dataset for Animal Behavior UnderstandingOral101 citations
- BatchFormer: Learning To Explore Sample Relationships for Robust Representation LearningPoster101 citations
- HCSC: Hierarchical Contrastive Selective CodingPoster101 citations
- High-Resolution Image Harmonization via Collaborative Dual TransformationsPoster101 citations
- Learning To Affiliate: Mutual Centralized Learning for Few-Shot ClassificationPoster101 citations
- Multi-Granularity Alignment Domain Adaptation for Object DetectionPoster101 citations
- No-Reference Point Cloud Quality Assessment via Domain AdaptationPoster101 citations
- RSTT: Real-Time Spatial Temporal Transformer for Space-Time Video Super-ResolutionPoster101 citations
- Single-Domain Generalized Object Detection in Urban Scene via Cyclic-Disentangled Self-DistillationPoster101 citations
- DEFEAT: Deep Hidden Feature Backdoor Attacks by Imperceptible Perturbation and Latent Representation ConstraintsPoster100 citations
- Deep Unlearning via Randomized Conditionally Independent HessiansPoster100 citations
- Ensembling Off-the-Shelf Models for GAN TrainingOral100 citations
- Generating Representative Samples for Few-Shot ClassificationPoster100 citations
- Large-Scale Video Panoptic Segmentation in the Wild: A BenchmarkPoster100 citations
- Probing Representation Forgetting in Supervised and Unsupervised Continual LearningPoster100 citations
- Robust Contrastive Learning Against Noisy ViewsPoster100 citations
- Towards General Purpose Vision Systems: An End-to-End Task-Agnostic Vision-Language ArchitectureOral100 citations
- Transformer-Empowered Multi-Scale Contextual Matching and Aggregation for Multi-Contrast MRI Super-ResolutionPoster100 citations
- VISTA: Boosting 3D Object Detection via Dual Cross-VIew SpaTial AttentionPoster100 citations
- CVF-SID: Cyclic Multi-Variate Function for Self-Supervised Image Denoising by Disentangling Noise From ImagePoster99 citations
- Contrastive Regression for Domain Adaptation on Gaze EstimationPoster99 citations
- Cross Modal Retrieval With Querybank NormalisationPoster99 citations
- DearKD: Data-Efficient Early Knowledge Distillation for Vision TransformersPoster99 citations
- MS-TCT: Multi-Scale Temporal ConvTransformer for Action DetectionPoster99 citations
- ArtiBoost: Boosting Articulated 3D Hand-Object Pose Estimation via Online Exploration and SynthesisOral98 citations
- B-Cos Networks: Alignment Is All We Need for InterpretabilityPoster98 citations
- DeepDPM: Deep Clustering With an Unknown Number of ClustersPoster98 citations
- Fair Contrastive Learning for Facial Attribute ClassificationPoster98 citations
- Learning To Estimate Robust 3D Human Mesh From In-the-Wild Crowded ScenesPoster98 citations
- Syntax-Aware Network for Handwritten Mathematical Expression RecognitionPoster98 citations
- Learning To Recognize Procedural Activities With Distant SupervisionPoster97 citations
- OakInk: A Large-Scale Knowledge Repository for Understanding Hand-Object InteractionPoster97 citations
- PatchFormer: An Efficient Point Transformer With Patch AttentionPoster97 citations
- Unifying Motion Deblurring and Frame Interpolation With EventsPoster97 citations
- Beyond Cross-View Image Retrieval: Highly Accurate Vehicle Localization Using Satellite ImagePoster96 citations
- EnvEdit: Environment Editing for Vision-and-Language NavigationPoster96 citations
- High-Resolution Face Swapping via Latent Semantics DisentanglementPoster96 citations
- IntraQ: Learning Synthetic Images With Intra-Class Heterogeneity for Zero-Shot Network QuantizationPoster96 citations
- MSG-Transformer: Exchanging Local Spatial Information by Manipulating Messenger TokensPoster96 citations
- Revisiting Weakly Supervised Pre-Training of Visual Perception ModelsPoster96 citations
- Threshold Matters in WSSS: Manipulating the Activation for the Robust and Accurate Segmentation Model Against ThresholdsPoster96 citations
- X-Trans2Cap: Cross-Modal Knowledge Transfer Using Transformer for 3D Dense CaptioningPoster96 citations
- A Structured Dictionary Perspective on Implicit Neural RepresentationsPoster95 citations
- AlignMixup: Improving Representations by Interpolating Aligned FeaturesPoster95 citations
- InOut: Diverse Image Outpainting via GAN InversionPoster95 citations
- Joint Global and Local Hierarchical Priors for Learned Image CompressionPoster95 citations
- Label Matching Semi-Supervised Object DetectionPoster95 citations
- Recurrent Dynamic Embedding for Video Object SegmentationPoster95 citations
- RepMLPNet: Hierarchical Vision MLP With Re-Parameterized LocalityPoster95 citations
- Surface Reconstruction From Point Clouds by Learning Predictive Context PriorsPoster95 citations
- TubeR: Tubelet Transformer for Video Action DetectionOral95 citations
- 360MonoDepth: High-Resolution 360deg Monocular Depth EstimationPoster94 citations
- Adaptive Trajectory Prediction via Transferable GNNPoster94 citations
- Class-Incremental Learning With Strong Pre-Trained ModelsPoster94 citations
- CycleMix: A Holistic Strategy for Medical Image Segmentation From Scribble SupervisionPoster94 citations
- HOP: History-and-Order Aware Pre-Training for Vision-and-Language NavigationPoster94 citations
- Learning With Neighbor Consistency for Noisy LabelsPoster94 citations
- Multi-Person Extreme Motion PredictionPoster94 citations
- Neural Texture Extraction and Distribution for Controllable Person Image SynthesisOral94 citations
- SNUG: Self-Supervised Neural Dynamic GarmentsOral94 citations
- The Devil Is in the Margin: Margin-Based Label Smoothing for Network CalibrationPoster94 citations
- Active Teacher for Semi-Supervised Object DetectionPoster93 citations
- Crowd Counting in the Frequency DomainPoster93 citations
- Exploring Structure-Aware Transformer Over Interaction Proposals for Human-Object Interaction DetectionPoster93 citations
- Glass Segmentation Using Intensity and Spectral Polarization CuesPoster93 citations
- Instance-Dependent Label-Noise Learning With Manifold-Regularized Transition Matrix EstimationPoster93 citations
- Integrative Few-Shot Learning for Classification and SegmentationPoster93 citations
- ScePT: Scene-Consistent, Policy-Based Trajectory Predictions for PlanningPoster93 citations
- Self-Distillation From the Last Mini-Batch for Consistency RegularizationPoster93 citations
- Shape-Invariant 3D Adversarial Point CloudsPoster93 citations
- Correlation Verification for Image RetrievalOral92 citations
- Disentangling Visual Embeddings for Attributes and ObjectsOral92 citations
- Exploring Frequency Adversarial Attacks for Face Forgery DetectionPoster92 citations
- FS6D: Few-Shot 6D Pose Estimation of Novel ObjectsPoster92 citations
- Graph-Based Spatial Transformer With Memory Replay for Multi-Future Pedestrian Trajectory PredictionPoster92 citations
- MatteFormer: Transformer-Based Image Matting via Prior-TokensPoster92 citations
- Weakly Supervised Temporal Action Localization via Representative Snippet Knowledge PropagationPoster92 citations
- AKB-48: A Real-World Articulated Object Knowledge BasePoster91 citations
- Better Trigger Inversion Optimization in Backdoor ScanningOral91 citations
- Cross-Domain Correlation Distillation for Unsupervised Domain Adaptation in Nighttime Semantic SegmentationPoster91 citations
- Learning Multi-View Aggregation in the Wild for Large-Scale 3D Semantic SegmentationOral91 citations
- Object-Aware Video-Language Pre-Training for RetrievalPoster91 citations
- OmniFusion: 360 Monocular Depth Estimation via Geometry-Aware FusionOral91 citations
- Online Convolutional Re-ParameterizationPoster91 citations
- TableFormer: Table Structure Understanding With TransformersPoster91 citations
- Vision Transformer Slimming: Multi-Dimension Searching in Continuous Optimization SpacePoster91 citations
- A Text Attention Network for Spatial Deformation Robust Scene Text Image Super-ResolutionPoster90 citations
- Cross Domain Object Detection by Target-Perceived Dual Branch DistillationPoster90 citations
- Cross-Patch Dense Contrastive Learning for Semi-Supervised Segmentation of Cellular Nuclei in Histopathologic ImagesPoster90 citations
- Few Shot Generative Model Adaption via Relaxed Spatial Structural AlignmentPoster90 citations
- Generalizable Cross-Modality Medical Image Segmentation via Style Augmentation and Dual NormalizationPoster90 citations
- GradViT: Gradient Inversion of Vision TransformersPoster90 citations
- MUSE-VAE: Multi-Scale VAE for Environment-Aware Long Term Trajectory PredictionPoster90 citations
- RSCFed: Random Sampling Consensus Federated Semi-Supervised LearningPoster90 citations
- Spectral Unsupervised Domain Adaptation for Visual RecognitionPoster90 citations
- Towards Diverse and Natural Scene-Aware 3D Human Motion SynthesisPoster90 citations
- En-Compactness: Self-Distillation Embedding & Contrastive Generation for Generalized Zero-Shot LearningPoster89 citations
- Label-Only Model Inversion Attacks via Boundary RepulsionPoster89 citations
- Mimicking the Oracle: An Initial Phase Decorrelation Approach for Class Incremental LearningPoster89 citations
- Occluded Human Mesh RecoveryPoster89 citations
- UCC: Uncertainty Guided Cross-Head Co-Training for Semi-Supervised Semantic SegmentationPoster89 citations
- Bridge-Prompt: Towards Ordinal Action Understanding in Instructional VideosPoster88 citations
- GCFSR: A Generative and Controllable Face Super Resolution Method Without Facial and GAN PriorsPoster88 citations
- Learning From Temporal Gradient for Semi-Supervised Action RecognitionPoster88 citations
- Make It Move: Controllable Image-to-Video Generation With Text DescriptionsPoster88 citations
- Moving Window Regression: A Novel Approach to Ordinal RegressionOral88 citations
- Shifting More Attention to Visual Backbone: Query-Modulated Refinement Networks for End-to-End Visual GroundingPoster88 citations
- A Closer Look at Few-Shot Image GenerationPoster87 citations
- Dense Learning Based Semi-Supervised Object DetectionPoster87 citations
- Fingerprinting Deep Neural Networks Globally via Universal Adversarial PerturbationsOral87 citations
- MM-TTA: Multi-Modal Test-Time Adaptation for 3D Semantic SegmentationPoster87 citations
- Multi-Object Tracking Meets Moving UAVPoster87 citations
- Rethinking Reconstruction Autoencoder-Based Out-of-Distribution DetectionPoster87 citations
- Templates for 3D Object Pose Estimation Revisited: Generalization to New Objects and Robustness to OcclusionsPoster87 citations
- Temporally Efficient Vision Transformer for Video Instance SegmentationOral87 citations
- Bridging the Gap Between Learning in Discrete and Continuous Environments for Vision-and-Language NavigationPoster86 citations
- ViSTA: Vision and Scene Text Aggregation for Cross-Modal RetrievalPoster86 citations
- DIVeR: Real-Time and Accurate Neural Radiance Fields With Deterministic Integration for Volume RenderingOral85 citations
- Deep Equilibrium Optical Flow EstimationPoster85 citations
- MSTR: Multi-Scale Transformer for End-to-End Human-Object Interaction DetectionPoster85 citations
- Progressive End-to-End Object Detection in Crowded ScenesPoster85 citations
- Robust Image Forgery Detection Over Online Social Network Shared ImagesOral85 citations
- An Empirical Study of End-to-End Temporal Action DetectionPoster84 citations
- Beyond a Pre-Trained Object Detector: Cross-Modal Textual and Visual Context for Image CaptioningPoster84 citations
- Cascade Transformers for End-to-End Person SearchPoster84 citations
- Closing the Generalization Gap of Cross-Silo Federated Medical Image SegmentationPoster84 citations
- Compound Domain Generalization via Meta-Knowledge EncodingPoster84 citations
- LAKe-Net: Topology-Aware Point Cloud Completion by Localizing Aligned KeypointsPoster84 citations
- LTP: Lane-Based Trajectory Prediction for Autonomous DrivingPoster84 citations
- Learning to Deblur Using Light Field Generated and Real Defocus ImagesOral84 citations
- Pseudo-Stereo for Monocular 3D Object Detection in Autonomous DrivingPoster84 citations
- Reconstructing Surfaces for Sparse Point Clouds With On-Surface PriorsPoster84 citations
- Reflash Dropout in Image Super-ResolutionPoster84 citations
- Task Adaptive Parameter Sharing for Multi-Task LearningPoster84 citations
- Zero Experience Required: Plug & Play Modular Transfer Learning for Semantic Visual NavigationPoster84 citations
- gDNA: Towards Generative Detailed Neural AvatarsPoster84 citations
- Cross-Modal Map Learning for Vision and Language NavigationPoster83 citations
- Lifelong Graph LearningOral83 citations
- OSOP: A Multi-Stage One Shot Object Pose Estimation FrameworkPoster83 citations
- Ranking-Based Siamese Visual TrackingPoster83 citations
- SAR-Net: Shape Alignment and Recovery Network for Category-Level 6D Object Pose and Size EstimationPoster83 citations
- Towards Robust and Reproducible Active Learning Using Neural NetworksPoster83 citations
- AdaInt: Learning Adaptive Intervals for 3D Lookup Tables on Real-Time Image EnhancementPoster82 citations
- Bayesian Invariant Risk MinimizationOral82 citations
- Co-Advise: Cross Inductive Bias DistillationPoster82 citations
- DTA: Physical Camouflage Attacks Using Differentiable Transformation NetworkPoster82 citations
- Expanding Low-Density Latent Regions for Open-Set Object DetectionPoster82 citations
- IDR: Self-Supervised Image Denoising via Iterative Data RefinementPoster82 citations
- Improving the Transferability of Targeted Adversarial Examples Through Object-Based Diverse InputPoster82 citations
- Many-to-Many Splatting for Efficient Video Frame InterpolationPoster82 citations
- NAN: Noise-Aware NeRFs for Burst-DenoisingPoster82 citations
- Neural Fields As Learnable Kernels for 3D ReconstructionPoster82 citations
- Neural Points: Point Cloud Representation With Neural Fields for Arbitrary UpsamplingPoster82 citations
- RNNPose: Recurrent 6-DoF Object Pose Refinement With Robust Correspondence Field Estimation and Pose OptimizationPoster82 citations
- Recurrent Variational Network: A Deep Learning Inverse Problem Solver Applied to the Task of Accelerated MRI ReconstructionPoster82 citations
- Subspace Adversarial TrainingOral82 citations
- Temporal Feature Alignment and Mutual Information Maximization for Video-Based Human Pose EstimationOral82 citations
- Toward Practical Monocular Indoor Depth EstimationPoster82 citations
- Towards Unsupervised Domain GeneralizationPoster82 citations
- COTS: Collaborative Two-Stream Vision-Language Pre-Training Model for Cross-Modal RetrievalPoster81 citations
- Entropy-Based Active Learning for Object Detection With Progressive Diversity ConstraintPoster81 citations
- Generalized Binary Search Network for Highly-Efficient Multi-View StereoPoster81 citations
- Large Loss Matters in Weakly Supervised Multi-Label ClassificationPoster81 citations
- Large-Scale Pre-Training for Person Re-Identification With Noisy LabelsPoster81 citations
- On Learning Contrastive Representations for Learning With Noisy LabelsPoster81 citations
- ResSFL: A Resistance Transfer Framework for Defending Model Inversion Attack in Split Federated LearningPoster81 citations
- Towards Practical Certifiable Patch Defense With Vision TransformerPoster81 citations
- CamLiFlow: Bidirectional Camera-LiDAR Fusion for Joint Optical Flow and Scene Flow EstimationOral80 citations
- Can Neural Nets Learn the Same Model Twice? Investigating Reproducibility and Double Descent From the Decision Boundary PerspectiveOral80 citations
- Compositional Temporal Grounding With Structured Variational Cross-Graph Correspondence LearningPoster80 citations
- ContIG: Self-Supervised Multimodal Contrastive Learning for Medical Imaging With GeneticsPoster80 citations
- Few-Shot Font Generation by Learning Fine-Grained Local StylesPoster80 citations
- HerosNet: Hyperspectral Explicable Reconstruction and Optimal Sampling Deep Network for Snapshot Compressive ImagingPoster80 citations
- Image Disentanglement Autoencoder for Steganography Without EmbeddingPoster80 citations
- Improving Subgraph Recognition With Variational Graph Information BottleneckPoster80 citations
- JoinABLe: Learning Bottom-Up Assembly of Parametric CAD JointsPoster80 citations
- LISA: Learning Implicit Shape and Appearance of HandsPoster80 citations
- Meta Distribution Alignment for Generalizable Person Re-IdentificationPoster80 citations
- Multi-Modal Alignment Using Representation CodebookPoster80 citations
- NPBG++: Accelerating Neural Point-Based GraphicsPoster80 citations
- Out-of-Distribution Generalization With Causal Invariant TransformationsPoster80 citations
- PNP: Robust Learning From Noisy Labels by Probabilistic Noise PredictionOral80 citations
- Personalized Image Aesthetics Assessment With Rich AttributesPoster80 citations
- Transferability Estimation Using Bhattacharyya Class SeparabilityPoster80 citations
- Tree Energy Loss: Towards Sparsely Annotated Semantic SegmentationPoster80 citations
- Unsupervised Deraining: Where Contrastive Learning Meets Self-SimilarityPoster80 citations
- Continual Learning With Lifelong Vision TransformerPoster79 citations
- Coupled Iterative Refinement for 6D Multi-Object Pose EstimationPoster79 citations
- DiGS: Divergence Guided Shape Implicit Neural Representation for Unoriented Point CloudsPoster79 citations
- Dual-AI: Dual-Path Actor Interaction Learning for Group Activity RecognitionOral79 citations
- FIFO: Learning Fog-Invariant Features for Foggy Scene SegmentationOral79 citations
- Kernelized Few-Shot Object Detection With Efficient Integral AggregationPoster79 citations
- Motion-Modulated Temporal Fragment Alignment Network for Few-Shot Action RecognitionPoster79 citations
- Revisiting Domain Generalized Stereo Matching Networks From a Feature Consistency PerspectivePoster79 citations
- Deformable Sprites for Unsupervised Video DecompositionOral78 citations
- Diversity Matters: Fully Exploiting Depth Clues for Reliable Monocular 3D Object DetectionOral78 citations
- Drop the GAN: In Defense of Patches Nearest Neighbors As Single Image Generative ModelsOral78 citations
- Fine-Grained Object Classification via Self-Supervised Pose AlignmentPoster78 citations
- Future Transformer for Long-Term Action AnticipationPoster78 citations
- GAN-Supervised Dense Visual AlignmentOral78 citations
- Lagrange Motion Analysis and View Embeddings for Improved Gait RecognitionPoster78 citations
- Marginal Contrastive Correspondence for Guided Image GenerationOral78 citations
- NLX-GPT: A Model for Natural Language Explanations in Vision and Vision-Language TasksOral78 citations
- Ray3D: Ray-Based 3D Human Pose Estimation for Monocular Absolute 3D LocalizationPoster78 citations
- Human-Object Interaction Detection via Disentangled TransformerPoster77 citations
- Learning Affordance Grounding From Exocentric ImagesPoster77 citations
- Multimodal Material SegmentationPoster77 citations
- Structural and Statistical Texture Knowledge Distillation for Semantic SegmentationPoster77 citations
- Towards Weakly-Supervised Text Spotting Using a Multi-Task TransformerPoster77 citations
- Unsupervised Learning of Accurate Siamese TrackingOral77 citations
- Blind Image Super-Resolution With Elaborate Degradation Modeling on Noise and KernelPoster76 citations
- Democracy Does Matter: Comprehensive Feature Mining for Co-Salient Object DetectionPoster76 citations
- Iterative Deep Homography EstimationPoster76 citations
- Learning Second Order Local Anomaly for General Face Forgery DetectionPoster76 citations
- ONCE-3DLanes: Building Monocular 3D Lane DetectionPoster76 citations
- OrphicX: A Causality-Inspired Latent Variable Model for Interpreting Graph Neural NetworksOral76 citations
- Signing at Scale: Learning to Co-Articulate Signs for Large-Scale Photo-Realistic Sign Language ProductionPoster76 citations
- StyleMesh: Style Transfer for Indoor 3D Scene ReconstructionsPoster76 citations
- Task Discrepancy Maximization for Fine-Grained Few-Shot ClassificationOral76 citations
- Training-Free Transformer Architecture SearchOral76 citations
- VGSE: Visually-Grounded Semantic Embeddings for Zero-Shot LearningPoster76 citations
- Coarse-To-Fine Feature Mining for Video Semantic SegmentationPoster75 citations
- Cross-Model Pseudo-Labeling for Semi-Supervised Action RecognitionOral75 citations
- DirecFormer: A Directed Attention in Transformer Approach to Robust Action RecognitionPoster75 citations
- Exploring Denoised Cross-Video Contrast for Weakly-Supervised Temporal Action LocalizationPoster75 citations
- Fairness-Aware Adversarial Perturbation Towards Bias Mitigation for Deployed Deep ModelsPoster75 citations
- FocusCut: Diving Into a Focus View in Interactive SegmentationOral75 citations
- GIFS: Neural Implicit Function for General Shape RepresentationPoster75 citations
- Learning Optical Flow With Kernel Patch AttentionPoster75 citations
- ObjectFolder 2.0: A Multisensory Object Dataset for Sim2Real TransferPoster75 citations
- PSTR: End-to-End One-Step Person Search With TransformersPoster75 citations
- RBGNet: Ray-Based Grouping for 3D Object DetectionPoster75 citations
- Robust Equivariant Imaging: A Fully Unsupervised Framework for Learning To Image From Noisy and Partial MeasurementsOral75 citations
- Certified Patch Robustness via Smoothed Vision TransformersPoster74 citations
- Language-Bridged Spatial-Temporal Interaction for Referring Video Object SegmentationPoster74 citations
- PPDL: Predicate Probability Distribution Based Loss for Unbiased Scene Graph GenerationPoster74 citations
- Region-Aware Face SwappingPoster74 citations
- Self-Supervised Material and Texture Representation Learning for Remote Sensing TasksOral74 citations
- Towards Layer-Wise Image VectorizationOral74 citations
- Towards Practical Deployment-Stage Backdoor Attack on Deep Neural NetworksOral74 citations
- Tracking People by Predicting 3D Appearance, Location and PoseOral74 citations
- Abandoning the Bayer-Filter To See in the DarkPoster73 citations
- CAPRI-Net: Learning Compact CAD Shapes With Adaptive Primitive AssemblyPoster73 citations
- Coupling Vision and Proprioception for Navigation of Legged RobotsPoster73 citations
- Incremental Learning in Semantic Segmentation From Image LabelsPoster73 citations
- Infrared Invisible Clothing: Hiding From Infrared Detectors at Multiple Angles in Real WorldOral73 citations
- PINA: Learning a Personalized Implicit Neural Avatar From a Single RGB-D Video SequencePoster73 citations
- Pseudo-Q: Generating Pseudo Language Queries for Visual GroundingPoster73 citations
- Quantifying Societal Bias Amplification in Image CaptioningOral73 citations
- TransEditor: Transformer-Based Dual-Space GAN for Highly Controllable Facial EditingPoster73 citations
- Unified Multivariate Gaussian Mixture for Efficient Neural Image CompressionPoster73 citations
- Vehicle Trajectory Prediction Works, but Not EverywherePoster73 citations
- Accurate 3D Body Shape Regression Using Metric and Semantic AttributesOral72 citations
- Audio-Visual Generalised Zero-Shot Learning With Cross-Modal Attention and LanguagePoster72 citations
- CD2-pFed: Cyclic Distillation-Guided Channel Decoupling for Model Personalization in Federated LearningPoster72 citations
- EASE: Unsupervised Discriminant Subspace Learning for Transductive Few-Shot LearningPoster72 citations
- Enhancing Adversarial Training With Second-Order Statistics of WeightsPoster72 citations
- ImFace: A Nonlinear 3D Morphable Face Model With Implicit Neural RepresentationsPoster72 citations
- KNN Local Attention for Image RestorationPoster72 citations
- Look Closer To Supervise Better: One-Shot Font Generation via Component-Based DiscriminatorOral72 citations
- Revisiting the Transferability of Supervised Pretraining: An MLP PerspectivePoster72 citations
- A Framework for Learning Ante-Hoc Explainable Models via ConceptsPoster71 citations
- Attribute Surrogates Learning and Spectral Tokens Pooling in Transformers for Few-Shot LearningPoster71 citations
- Complex Backdoor Detection by Symmetric Feature DifferencingPoster71 citations
- Exploiting Pseudo Labels in a Self-Supervised Learning Framework for Improved Monocular Depth EstimationPoster71 citations
- Exploring the Equivalence of Siamese Self-Supervised Learning via a Unified Gradient FrameworkPoster71 citations
- Generating High Fidelity Data From Low-Density Regions Using Diffusion ModelsPoster71 citations
- Motion-Aware Contrastive Video Representation Learning via Foreground-Background MergingPoster71 citations
- Node-Aligned Graph Convolutional Network for Whole-Slide Image Representation and ClassificationOral71 citations
- Recall@k Surrogate Loss With Large Batches and Similarity MixupPoster71 citations
- Towards Better Plasticity-Stability Trade-Off in Incremental Learning: A Simple Linear ConnectorPoster71 citations
- Density-Preserving Deep Point Cloud CompressionPoster70 citations
- E2(GO)MOTION: Motion Augmented Event Stream for Egocentric Action RecognitionPoster70 citations
- Human-Aware Object Placement for Visual Environment ReconstructionPoster70 citations
- Learning To Collaborate in Decentralized Learning of Personalized ModelsPoster70 citations
- Long-Short Temporal Contrastive Learning of Video TransformersPoster70 citations
- ProposalCLIP: Unsupervised Open-Category Object Proposal Generation via Exploiting CLIP CuesPoster70 citations
- TransRAC: Encoding Multi-Scale Temporal Correlation With Transformers for Repetitive Action CountingOral70 citations
- Unsupervised Action Segmentation by Joint Representation Learning and Online ClusteringPoster70 citations
- 3D-SPS: Single-Stage 3D Visual Grounding via Referred Point Progressive SelectionOral69 citations
- 3D-VField: Adversarial Augmentation of Point Clouds for Domain Generalization in 3D Object DetectionPoster69 citations
- CoSSL: Co-Learning of Representation and Classifier for Imbalanced Semi-Supervised LearningPoster69 citations
- Contextual Instance Decoupling for Robust Multi-Person Pose EstimationOral69 citations
- From Representation to Reasoning: Towards Both Evidence and Commonsense Reasoning for Video Question-AnsweringPoster69 citations
- InsetGAN for Full-Body Image GenerationPoster69 citations
- Multi-View Depth Estimation by Fusing Single-View Depth Probability With Multi-View GeometryOral69 citations
- Practical Evaluation of Adversarial Robustness via Adaptive Auto AttackPoster69 citations
- Pyramid Adversarial Training Improves ViT PerformanceOral69 citations
- SPAct: Self-Supervised Privacy Preservation for Action RecognitionPoster69 citations
- Salient-to-Broad Transition for Video Person Re-IdentificationPoster69 citations
- Shape From Polarization for Complex Scenes in the WildPoster69 citations
- Style Transformer for Image Inversion and EditingPoster69 citations
- TeachAugment: Data Augmentation Optimization Using Teacher KnowledgeOral69 citations
- Visual Abductive ReasoningPoster69 citations
- AutoRF: Learning 3D Object Radiance Fields From Single View ObservationsPoster68 citations
- Deep Rectangling for Image Stitching: A Learning BaselineOral68 citations
- EI-CLIP: Entity-Aware Interventional Contrastive Learning for E-Commerce Cross-Modal RetrievalPoster68 citations
- GuideFormer: Transformers for Image Guided Depth CompletionPoster68 citations
- HL-Net: Heterophily Learning Network for Scene Graph GenerationPoster68 citations
- Non-Probability Sampling Network for Stochastic Human Trajectory PredictionPoster68 citations
- On the Importance of Asymmetry for Siamese Representation LearningPoster68 citations
- Panoptic-PHNet: Towards Real-Time and High-Precision LiDAR Panoptic Segmentation via Clustering Pseudo HeatmapPoster68 citations
- Pin the Memory: Learning To Generalize Semantic SegmentationPoster68 citations
- Reversible Vision TransformersOral68 citations
- STRPM: A Spatiotemporal Residual Predictive Model for High-Resolution Video PredictionPoster68 citations
- Self-Supervised Global-Local Structure Modeling for Point Cloud Domain Adaptation With Reliable Voted Pseudo LabelsPoster68 citations
- Sketching Without Worrying: Noise-Tolerant Sketch-Based Image RetrievalPoster68 citations
- Source-Free Object Detection by Learning To Overlook Domain StyleOral68 citations
- Towards Robust and Adaptive Motion Forecasting: A Causal Representation PerspectivePoster68 citations
- Grounding Answers for Visual Questions Asked by Visually Impaired PeopleOral67 citations
- MS2DG-Net: Progressive Correspondence Learning via Multiple Sparse Semantics Dynamic GraphPoster67 citations
- Memory-Augmented Deep Conditional Unfolding Network for Pan-SharpeningPoster67 citations
- MonoJSG: Joint Semantic and Geometric Cost Volume for Monocular 3D Object DetectionPoster67 citations
- Neural Mean Discrepancy for Efficient Out-of-Distribution DetectionPoster67 citations
- PokeBNN: A Binary Pursuit of Lightweight AccuracyPoster67 citations
- Show, Deconfound and Tell: Image Captioning With Causal InferencePoster67 citations
- Structured Sparse R-CNN for Direct Scene Graph GenerationPoster67 citations
- ZeroWaste Dataset: Towards Deformable Object Segmentation in Cluttered ScenesPoster67 citations
- 3D Shape Reconstruction From 2D Images With Disentangled Attribute FlowPoster66 citations
- Bayesian Nonparametric Submodular Video Partition for Robust Anomaly DetectionPoster66 citations
- Deep Safe Multi-View Clustering: Reducing the Risk of Clustering Performance Degradation Caused by View IncreasePoster66 citations
- Few-Shot Learning With Noisy LabelsPoster66 citations
- How Many Observations Are Enough? Knowledge Distillation for Trajectory ForecastingPoster66 citations
- Human Mesh Recovery From Multiple ShotsPoster66 citations
- Learning Transferable Human-Object Interaction Detector With Natural Language SupervisionPoster66 citations
- Leveling Down in Computer Vision: Pareto Inefficiencies in Fair Deep ClassifiersPoster66 citations
- MonoGround: Detecting Monocular 3D Objects From the GroundPoster66 citations
- OVE6D: Object Viewpoint Encoding for Depth-Based 6D Object Pose EstimationPoster66 citations
- Patch-Level Representation Learning for Self-Supervised Vision TransformersOral66 citations
- Towards Robust Rain Removal Against Adversarial Attacks: A Comprehensive Benchmark Analysis and BeyondPoster66 citations
- What To Look at and Where: Semantic and Spatial Refined Transformer for Detecting Human-Object InteractionsOral66 citations
- Class Similarity Weighted Knowledge Distillation for Continual Semantic SegmentationPoster65 citations
- End-to-End Human-Gaze-Target Detection With TransformersPoster65 citations
- InstaFormer: Instance-Aware Image-to-Image Translation With TransformerPoster65 citations
- Interactiveness Field in Human-Object InteractionsPoster65 citations
- Learnable Lookup Table for Neural Network QuantizationPoster65 citations
- RM-Depth: Unsupervised Learning of Recurrent Monocular Depth in Dynamic ScenesPoster65 citations
- Real-Time Object Detection for Streaming PerceptionOral65 citations
- RigidFlow: Self-Supervised Scene Flow Learning on Point Clouds by Local Rigidity PriorPoster65 citations
- Surface-Aligned Neural Radiance Fields for Controllable 3D Human SynthesisPoster65 citations
- SwapMix: Diagnosing and Regularizing the Over-Reliance on Visual Context in Visual Question AnsweringPoster65 citations
- Think Twice Before Detecting GAN-Generated Fake Images From Their Spectral Domain ImprintsPoster65 citations
- Unbiased Subclass Regularization for Semi-Supervised Semantic SegmentationPoster65 citations
- Both Style and Fog Matter: Cumulative Domain Adaptation for Semantic Foggy Scene UnderstandingOral64 citations
- Domain Adaptation on Point Clouds via Geometry-Aware ImplicitsPoster64 citations
- Learning Modal-Invariant and Temporal-Memory for Video-Based Visible-Infrared Person Re-IdentificationPoster64 citations
- Mixed Differential Privacy in Computer VisionOral64 citations
- Multi-Level Representation Learning With Semantic Alignment for Referring Video Object SegmentationPoster64 citations
- Per-Clip Video Object SegmentationPoster64 citations
- Point-Level Region Contrast for Object Detection Pre-TrainingOral64 citations
- Point2Cyl: Reverse Engineering 3D Objects From Point Clouds to Extrusion CylindersPoster64 citations
- Robust Cross-Modal Representation Learning With Progressive Self-DistillationOral64 citations
- Self-Supervised Object Detection From Audio-Visual CorrespondencePoster64 citations
- Towards Discriminative Representation: Multi-View Trajectory Contrastive Learning for Online Multi-Object TrackingPoster64 citations
- Towards Multi-Domain Single Image Dehazing via Test-Time TrainingPoster64 citations
- Unsupervised Pre-Training for Temporal Action Localization TasksPoster64 citations
- Visual Acoustic MatchingOral64 citations
- A Comprehensive Study of Image Classification Model Sensitivity to Foregrounds, Backgrounds, and Visual AttributesOral63 citations
- AdaFocus V2: End-to-End Training of Spatial Dynamic Networks for Video RecognitionPoster63 citations
- Cross-Modal Background Suppression for Audio-Visual Event LocalizationPoster63 citations
- Fine-Grained Predicates Learning for Scene Graph GenerationPoster63 citations
- Investigating the Impact of Multi-LiDAR Placement on Object Detection for Autonomous DrivingPoster63 citations
- KG-SP: Knowledge Guided Simple Primitives for Open World Compositional Zero-Shot LearningPoster63 citations
- Learning Fair Classifiers With Partially Annotated Group LabelsPoster63 citations
- Neural Data-Dependent Transform for Learned Image CompressionPoster63 citations
- Omni-DETR: Omni-Supervised Object Detection With TransformersPoster63 citations
- Probabilistic Representations for Video Contrastive LearningPoster63 citations
- Self-Supervised Arbitrary-Scale Point Clouds Upsampling via Implicit Neural RepresentationPoster63 citations
- Counterfactual Cycle-Consistent Learning for Instruction Following and Generation in Vision-Language NavigationPoster62 citations
- DECORE: Deep Compression With Reinforcement LearningPoster62 citations
- DIFNet: Boosting Visual Information Flow for Image CaptioningPoster62 citations
- Generalizing Gaze Estimation With Rotation ConsistencyPoster62 citations
- Label Relation Graphs Enhanced Hierarchical Residual Network for Hierarchical Multi-Granularity ClassificationPoster62 citations
- LiDARCap: Long-Range Marker-Less 3D Human Motion Capture With LiDAR Point CloudsPoster62 citations
- Mix and Localize: Localizing Sound Sources in MixturesPoster62 citations
- Opening Up Open World TrackingOral62 citations
- Sparse Local Patch Transformer for Robust Face Alignment and Landmarks Inherent Relation LearningPoster62 citations
- Stand-Alone Inter-Frame Attention in Video ModelsPoster62 citations
- A Voxel Graph CNN for Object Classification With Event CamerasPoster61 citations
- An MIL-Derived Transformer for Weakly Supervised Point Cloud SegmentationPoster61 citations
- Decoupling Makes Weakly Supervised Local Feature BetterPoster61 citations
- FWD: Real-Time Novel View Synthesis With Forward Warping and DepthPoster61 citations
- Learning Local Displacements for Point Cloud CompletionPoster61 citations
- Less Is More: Generating Grounded Navigation Instructions From LandmarksPoster61 citations
- Non-Generative Generalized Zero-Shot Learning via Task-Correlated Disentanglement and Controllable Samples SynthesisPoster61 citations
- One Loss for Quantization: Deep Hashing With Discrete Wasserstein Distributional MatchingPoster61 citations
- Online Continual Learning on a Contaminated Data Stream With Blurry Task BoundariesPoster61 citations
CVPR accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.