CVPR 2023 Accepted Papers
The full list of 2,307 papers accepted at CVPR 2023 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 2,085Highlight: 222
- YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object DetectorsPoster11,111 citations
- DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven GenerationPoster2,958 citations
- InstructPix2Pix: Learning To Follow Image Editing InstructionsHighlight1,877 citations
- Run, Don't Walk: Chasing Higher FLOPS for Faster Neural NetworksPoster1,536 citations
- Magic3D: High-Resolution Text-to-3D Content CreationHighlight1,196 citations
- Imagic: Text-Based Real Image Editing With Diffusion ModelsPoster1,151 citations
- Align Your Latents: High-Resolution Video Synthesis With Latent Diffusion ModelsPoster1,134 citations
- ConvNeXt V2: Co-Designing and Scaling ConvNets With Masked AutoencodersPoster1,111 citations
- ImageBind: One Embedding Space To Bind Them AllHighlight1,001 citations
- InternImage: Exploring Large-Scale Vision Foundation Models With Deformable ConvolutionsHighlight953 citations
- Objaverse: A Universe of Annotated 3D ObjectsPoster931 citations
- Activating More Pixels in Image Super-Resolution TransformerPoster908 citations
- NULL-Text Inversion for Editing Real Images Using Guided Diffusion ModelsPoster899 citations
- Multi-Concept Customization of Text-to-Image DiffusionPoster864 citations
- BiFormer: Vision Transformer With Bi-Level Routing AttentionPoster856 citations
- Reproducible Scaling Laws for Contrastive Language-Image LearningPoster855 citations
- MaPLe: Multi-Modal Prompt LearningPoster844 citations
- EVA: Exploring the Limits of Masked Visual Representation Learning at ScaleHighlight790 citations
- Plug-and-Play Diffusion Features for Text-Driven Image-to-Image TranslationPoster766 citations
- Observation-Centric SORT: Rethinking SORT for Robust Multi-Object TrackingPoster756 citations
- Planning-Oriented Autonomous DrivingPoster748 citations
- GLIGEN: Open-Set Grounded Text-to-Image GenerationPoster673 citations
- Image as a Foreign Language: BEiT Pretraining for Vision and Vision-Language TasksPoster621 citations
- Scaling Up GANs for Text-to-Image SynthesisHighlight613 citations
- K-Planes: Explicit Radiance Fields in Space, Time, and AppearancePoster582 citations
- Score Jacobian Chaining: Lifting Pretrained 2D Diffusion Models for 3D GenerationPoster547 citations
- On Distillation of Guided Diffusion ModelsPoster526 citations
- Open-Vocabulary Semantic Segmentation With Mask-Adapted CLIPPoster519 citations
- CDDFuse: Correlation-Driven Dual-Branch Feature Decomposition for Multi-Modality Image FusionPoster503 citations
- PIDNet: A Real-Time Semantic Segmentation Network Inspired by PID ControllersPoster485 citations
- Mask DINO: Towards a Unified Transformer-Based Framework for Object Detection and SegmentationPoster484 citations
- Open-Vocabulary Panoptic Segmentation With Text-to-Image Diffusion ModelsHighlight478 citations
- HexPlane: A Fast Representation for Dynamic ScenesPoster474 citations
- Latent-NeRF for Shape-Guided Generation of 3D Shapes and TexturesPoster471 citations
- Visual Programming: Compositional Visual Reasoning Without TrainingPoster464 citations
- EfficientViT: Memory Efficient Vision Transformer With Cascaded Group AttentionPoster458 citations
- DepGraph: Towards Any Structural PruningPoster446 citations
- OneFormer: One Transformer To Rule Universal Image SegmentationPoster441 citations
- VideoMAE V2: Scaling Video Masked Autoencoders With Dual MaskingPoster440 citations
- Self-Supervised Learning From Images With a Joint-Embedding Predictive ArchitecturePoster432 citations
- Paint by Example: Exemplar-Based Image Editing With Diffusion ModelsPoster429 citations
- Neuralangelo: High-Fidelity Neural Surface ReconstructionPoster423 citations
- SCConv: Spatial and Channel Reconstruction Convolution for Feature RedundancyPoster423 citations
- Neighborhood Attention TransformerPoster406 citations
- Generating Human Motion From Textual Descriptions With Discrete RepresentationsPoster402 citations
- Executing Your Commands via Motion Diffusion in Latent SpacePoster390 citations
- Revisiting Weak-to-Strong Consistency in Semi-Supervised Semantic SegmentationPoster380 citations
- MobileNeRF: Exploiting the Polygon Rasterization Pipeline for Efficient Neural Field Rendering on Mobile ArchitecturesPoster373 citations
- RODIN: A Generative Model for Sculpting 3D Digital Avatars Using DiffusionHighlight369 citations
- All Are Worth Words: A ViT Backbone for Diffusion ModelsPoster355 citations
- SimpleNet: A Simple Network for Image Anomaly Detection and LocalizationPoster355 citations
- Diffusion Art or Digital Forgery? Investigating Data Replication in Diffusion ModelsPoster341 citations
- OpenScene: 3D Scene Understanding With Open VocabulariesPoster341 citations
- Scaling Language-Image Pre-Training via MaskingPoster341 citations
- High-Resolution Image Reconstruction With Latent Diffusion Models From Human Brain ActivityPoster340 citations
- VoxelNeXt: Fully Sparse VoxelNet for 3D Object Detection and TrackingPoster331 citations
- Tri-Perspective View for Vision-Based 3D Semantic Occupancy PredictionPoster328 citations
- RealFusion: 360deg Reconstruction of Any Object From a Single ImagePoster318 citations
- BEVFormer v2: Adapting Modern Image Backbones to Bird's-Eye-View Recognition via Perspective SupervisionHighlight316 citations
- Learning a Sparse Transformer Network for Effective Image DerainingHighlight315 citations
- Side Adapter Network for Open-Vocabulary Semantic SegmentationHighlight314 citations
- MIC: Masked Image Consistency for Context-Enhanced Domain AdaptationPoster310 citations
- SadTalker: Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face AnimationPoster308 citations
- Inversion-Based Style Transfer With Diffusion ModelsPoster306 citations
- FreeNeRF: Improving Few-Shot Neural Rendering With Free Frequency RegularizationPoster300 citations
- Safe Latent Diffusion: Mitigating Inappropriate Degeneration in Diffusion ModelsPoster299 citations
- SeqTrack: Sequence to Sequence Learning for Visual Object TrackingPoster292 citations
- Images Speak in Images: A Generalist Painter for In-Context Visual LearningPoster290 citations
- Implicit Diffusion Models for Continuous Super-ResolutionPoster290 citations
- Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video CaptioningPoster288 citations
- WinCLIP: Zero-/Few-Shot Anomaly Classification and SegmentationPoster282 citations
- ULIP: Learning a Unified Representation of Language, Images, and Point Clouds for 3D UnderstandingPoster281 citations
- Learned Image Compression With Mixed Transformer-CNN ArchitecturesHighlight278 citations
- EDGE: Editable Dance Generation From MusicPoster275 citations
- Generalized Decoding for Pixel, Image, and LanguagePoster273 citations
- MobileOne: An Improved One Millisecond Mobile BackbonePoster270 citations
- SDFusion: Multimodal 3D Shape Completion, Reconstruction, and GenerationPoster269 citations
- Lite-Mono: A Lightweight CNN and Transformer Architecture for Self-Supervised Monocular Depth EstimationPoster267 citations
- Visual Prompt Multi-Modal TrackingPoster266 citations
- Camouflaged Object Detection With Feature Decomposition and Edge ReconstructionPoster260 citations
- DiffRF: Rendering-Guided 3D Radiance Field DiffusionHighlight260 citations
- Towards Universal Fake Image Detectors That Generalize Across Generative ModelsPoster259 citations
- Bidirectional Copy-Paste for Semi-Supervised Medical Image SegmentationPoster258 citations
- MAGVIT: Masked Generative Video TransformerHighlight258 citations
- VoxFormer: Sparse Voxel Transformer for Camera-Based 3D Semantic Scene CompletionHighlight258 citations
- SmartBrush: Text and Shape Guided Object Inpainting With Diffusion ModelHighlight257 citations
- DETRs With Hybrid MatchingPoster251 citations
- All in One: Exploring Unified Video-Language Pre-TrainingPoster249 citations
- RenderDiffusion: Image Diffusion for 3D Reconstruction, Inpainting and GenerationPoster246 citations
- Efficient and Explicit Modelling of Image Hierarchies for Image RestorationPoster245 citations
- ZegCLIP: Towards Adapting CLIP for Zero-Shot Semantic SegmentationPoster245 citations
- 3D Neural Field Generation Using Triplane DiffusionPoster244 citations
- NoPe-NeRF: Optimising Neural Radiance Field With No Pose PriorHighlight243 citations
- Prompting Large Language Models With Answer Heuristics for Knowledge-Based Visual Question AnsweringPoster241 citations
- SparseFusion: Distilling View-Conditioned Diffusion for 3D ReconstructionPoster241 citations
- Generative Diffusion Prior for Unified Image Restoration and EnhancementPoster240 citations
- Language in a Bottle: Language Model Guided Concept Bottlenecks for Interpretable Image ClassificationPoster239 citations
- Query-Centric Trajectory PredictionPoster235 citations
- Iterative Geometry Encoding Volume for Stereo MatchingPoster234 citations
- SpaText: Spatio-Textual Representation for Controllable Image GenerationPoster226 citations
- Blind Image Quality Assessment via Vision-Language Correspondence: A Multitask Learning PerspectivePoster225 citations
- ECON: Explicit Clothed Humans Optimized via Normal IntegrationHighlight222 citations
- Efficient Frequency Domain-Based Transformers for High-Quality Image DeblurringHighlight222 citations
- Diffusion-Based Generation, Optimization, and Planning in 3D ScenesPoster219 citations
- OmniObject3D: Large-Vocabulary 3D Object Dataset for Realistic Perception, Reconstruction and GenerationPoster214 citations
- CODA-Prompt: COntinual Decomposed Attention-Based Prompting for Rehearsal-Free Continual LearningPoster211 citations
- Learning Video Representations From Large Language ModelsHighlight211 citations
- Cross-Modal Implicit Relation Reasoning and Aligning for Text-to-Image Person RetrievalPoster210 citations
- Cut and Learn for Unsupervised Object Detection and Instance SegmentationPoster209 citations
- Co-SLAM: Joint Coordinate and Sparse Parametric Encodings for Neural Real-Time SLAMPoster208 citations
- Learning a Simple Low-Light Image Enhancer From Paired Low-Light InstancesPoster208 citations
- MM-Diffusion: Learning Multi-Modal Diffusion Models for Joint Audio and Video GenerationPoster206 citations
- Curricular Contrastive Regularization for Physics-Aware Single Image DehazingPoster203 citations
- Tensor4D: Efficient Neural 4D Decomposition for High-Fidelity Dynamic Reconstruction and RenderingHighlight201 citations
- UniSim: A Neural Closed-Loop Sensor SimulatorHighlight201 citations
- Prompt, Generate, Then Cache: Cascade of Foundation Models Makes Strong Few-Shot LearnersPoster199 citations
- Video Probabilistic Diffusion Models in Projected Latent SpacePoster198 citations
- Dream3D: Zero-Shot Text-to-3D Synthesis Using 3D Shape Prior and Text-to-Image Diffusion ModelsPoster195 citations
- TriDet: Temporal Action Detection With Relative Boundary ModelingPoster194 citations
- Universal Instance Perception As Object Discovery and RetrievalPoster194 citations
- Fine-Tuned CLIP Models Are Efficient Video LearnersPoster193 citations
- CLIP Is Also an Efficient Segmenter: A Text-Driven Approach for Weakly Supervised Semantic SegmentationPoster190 citations
- Dense Distinct Query for End-to-End Object DetectionPoster188 citations
- MOTRv2: Bootstrapping End-to-End Multi-Object Tracking by Pretrained Object DetectorsPoster187 citations
- Mofusion: A Framework for Denoising-Diffusion-Based Motion SynthesisHighlight187 citations
- Spherical Transformer for LiDAR-Based 3D RecognitionPoster187 citations
- GRES: Generalized Referring Expression SegmentationHighlight186 citations
- Imagen Editor and EditBench: Advancing and Evaluating Text-Guided Image InpaintingHighlight185 citations
- OpenGait: Revisiting Gait Recognition Towards Better PracticalityHighlight184 citations
- CLIP2Scene: Towards Label-Efficient 3D Scene Understanding by CLIPPoster183 citations
- SPARF: Neural Radiance Fields From Sparse and Noisy PosesHighlight182 citations
- SINE: SINgle Image Editing With Text-to-Image Diffusion ModelsPoster181 citations
- MVImgNet: A Large-Scale Dataset of Multi-View ImagesPoster180 citations
- V2V4Real: A Real-World Large-Scale Dataset for Vehicle-to-Vehicle Cooperative PerceptionHighlight180 citations
- Fake It Till You Make It: Learning Transferable Representations From Synthetic ImageNet ClonesPoster179 citations
- Post-Training Quantization on Diffusion ModelsPoster179 citations
- Virtual Sparse Convolution for Multimodal 3D Object DetectionPoster179 citations
- Robust Dynamic Radiance FieldsPoster178 citations
- ESLAM: Efficient Dense SLAM System Based on Hybrid Representation of Signed Distance FieldsHighlight177 citations
- LayoutDiffusion: Controllable Diffusion Model for Layout-to-Image GenerationPoster177 citations
- Generalized Relation Modeling for Transformer TrackingPoster176 citations
- CodeTalker: Speech-Driven 3D Facial Animation With Discrete Motion PriorPoster175 citations
- Conditional Image-to-Video Generation With Latent Flow Diffusion ModelsPoster175 citations
- ARCTIC: A Dataset for Dexterous Bimanual Hand-Object ManipulationPoster174 citations
- From Images to Textual Prompts: Zero-Shot Visual Question Answering With Frozen Large Language ModelsPoster174 citations
- Ambiguous Medical Image Segmentation Using Diffusion ModelsPoster172 citations
- Feature Shrinkage Pyramid for Camouflaged Object Detection With TransformersPoster172 citations
- Neural Video Compression With Diverse ContextsPoster172 citations
- EDICT: Exact Diffusion Inversion via Coupled TransformationsPoster171 citations
- GALIP: Generative Adversarial CLIPs for Text-to-Image SynthesisPoster171 citations
- MAGE: MAsked Generative Encoder To Unify Representation Learning and Image SynthesisPoster171 citations
- DeSTSeg: Segmentation Guided Denoising Student-Teacher for Anomaly DetectionPoster170 citations
- Benchmarking Self-Supervised Learning on Diverse Pathology DatasetsPoster169 citations
- Contrastive Semi-Supervised Learning for Underwater Image Restoration via Reliable BankPoster169 citations
- NeRDi: Single-View NeRF Synthesis With Language-Guided Diffusion As General Image PriorsPoster169 citations
- Hierarchical Fine-Grained Image Forgery Detection and LocalizationPoster168 citations
- PLA: Language-Driven Open-Vocabulary 3D Scene UnderstandingPoster168 citations
- MaskCLIP: Masked Self-Distillation Advances Contrastive Language-Image PretrainingPoster166 citations
- 3D Registration With Maximal CliquesPoster165 citations
- Affordances From Human Videos as a Versatile Representation for RoboticsPoster165 citations
- BBDM: Image-to-Image Translation With Brownian Bridge Diffusion ModelsPoster165 citations
- Revisiting Reverse Distillation for Anomaly DetectionPoster165 citations
- PoseFormerV2: Exploring Frequency Domain for Efficient and Robust 3D Human Pose EstimationPoster164 citations
- ReCo: Region-Controlled Text-to-Image GenerationPoster163 citations
- WIRE: Wavelet Implicit Neural RepresentationsPoster163 citations
- Revealing the Dark Secrets of Masked Image ModelingPoster162 citations
- Finetune Like You Pretrain: Improved Finetuning of Zero-Shot Vision ModelsPoster161 citations
- Interactive and Explainable Region-Guided Radiology Report GenerationPoster159 citations
- PointAvatar: Deformable Point-Based Head Avatars From VideosPoster159 citations
- BEDLAM: A Synthetic Dataset of Bodies Exhibiting Detailed Lifelike Animated MotionHighlight158 citations
- Token Contrast for Weakly-Supervised Semantic SegmentationPoster158 citations
- Learning 3D Representations From 2D Pre-Trained Models via Image-to-Point Masked AutoencodersPoster157 citations
- TruFor: Leveraging All-Round Clues for Trustworthy Image Forgery Detection and LocalizationPoster157 citations
- BundleSDF: Neural 6-DoF Tracking and 3D Reconstruction of Unknown ObjectsPoster156 citations
- DiffPose: Toward More Reliable 3D Pose EstimationPoster156 citations
- F2-NeRF: Fast Neural Radiance Field Training With Free Camera TrajectoriesHighlight156 citations
- Implicit Identity Leakage: The Stumbling Block to Improving Deepfake Detection GeneralizationPoster156 citations
- Seeing Beyond the Brain: Conditional Diffusion Model With Sparse Masked Modeling for Vision DecodingPoster156 citations
- CREPE: Can Vision-Language Foundation Models Reason Compositionally?Highlight154 citations
- Dynamic Graph Enhanced Contrastive Learning for Chest X-Ray Report GenerationPoster153 citations
- CoWs on Pasture: Baselines and Benchmarks for Language-Driven Zero-Shot Object NavigationPoster152 citations
- N-Gram in Swin Transformers for Efficient Lightweight Image Super-ResolutionPoster151 citations
- Query-Dependent Video Representation for Moment Retrieval and Highlight DetectionPoster151 citations
- CORA: Adapting CLIP for Open-Vocabulary Detection With Region Prompting and Anchor Pre-MatchingPoster150 citations
- DKM: Dense Kernelized Feature Matching for Geometry EstimationHighlight148 citations
- Learning Semantic-Aware Knowledge Guidance for Low-Light Image EnhancementPoster148 citations
- Leapfrog Diffusion Model for Stochastic Trajectory PredictionPoster147 citations
- Learning Discriminative Representations for Skeleton Based Action RecognitionPoster147 citations
- Recurrent Vision Transformers for Object Detection With Event CamerasPoster147 citations
- Instant Volumetric Head AvatarsPoster146 citations
- PolyFormer: Referring Image Segmentation As Sequential Polygon GenerationPoster146 citations
- Collaborative Diffusion for Multi-Modal Face Generation and EditingPoster145 citations
- Person Image Synthesis via Denoising Diffusion ModelPoster144 citations
- Multimodal Prompting With Missing Modalities for Visual RecognitionPoster143 citations
- Temporal Attention Unit: Towards Efficient Spatiotemporal Predictive LearningPoster143 citations
- RIDCP: Revitalizing Real Image Dehazing via High-Quality Codebook PriorsPoster142 citations
- Rethinking Federated Learning With Domain Shift: A Prototype ViewPoster142 citations
- StyleRF: Zero-Shot 3D Style Transfer of Neural Radiance FieldsPoster142 citations
- ERNIE-ViLG 2.0: Improving Text-to-Image Diffusion Model With Knowledge-Enhanced Mixture-of-Denoising-ExpertsHighlight140 citations
- LoGoNet: Towards Accurate 3D Object Detection With Local-to-Global Cross-Modal FusionPoster140 citations
- SPIn-NeRF: Multiview Segmentation and Perceptual Inpainting With Neural Radiance FieldsPoster140 citations
- DSVT: Dynamic Sparse Voxel Transformer With Rotated SetsPoster139 citations
- Learning To Exploit Temporal Structure for Biomedical Vision-Language ProcessingPoster139 citations
- Robust Test-Time Adaptation in Dynamic ScenariosPoster138 citations
- Decoupled Multimodal Distilling for Emotion RecognitionHighlight137 citations
- Pic2Word: Mapping Pictures to Words for Zero-Shot Composed Image RetrievalPoster137 citations
- Implicit Identity Driven Deepfake Face Swapping DetectionPoster135 citations
- DCFace: Synthetic Face Generation With Dual Condition Diffusion ModelPoster134 citations
- Panoptic Lifting for 3D Scene Understanding With Neural FieldsHighlight134 citations
- Deep Deterministic Uncertainty: A New Simple BaselineHighlight133 citations
- Aligning Bag of Regions for Open-Vocabulary Object DetectionPoster132 citations
- Beyond Appearance: A Semantic Controllable Self-Supervised Learning Framework for Human-Centric Visual TasksPoster132 citations
- MotionTrack: Learning Robust Short-Term and Long-Term Motions for Multi-Object TrackingPoster132 citations
- Generalizing Dataset Distillation via Deep Generative PriorPoster131 citations
- HyperReel: High-Fidelity 6-DoF Video With Ray-Conditioned SamplingHighlight131 citations
- NeuralLift-360: Lifting an In-the-Wild 2D Photo to a 3D Object With 360deg ViewsHighlight131 citations
- Pseudo-Label Guided Contrastive Learning for Semi-Supervised Medical Image SegmentationPoster131 citations
- Regularized Vector Quantization for Tokenized Image SynthesisPoster131 citations
- TensoIR: Tensorial Inverse RenderingPoster131 citations
- DropMAE: Masked Autoencoders With Spatial-Attention Dropout for Tracking TasksPoster130 citations
- EqMotion: Equivariant Multi-Agent Motion Prediction With Invariant Interaction ReasoningPoster130 citations
- Omni Aggregation Networks for Lightweight Image Super-ResolutionPoster130 citations
- SUDS: Scalable Urban Dynamic ScenesPoster130 citations
- Adaptive Sparse Convolutional Networks With Global Context Enhancement for Faster Object Detection on Drone ImagesPoster129 citations
- Extracting Motion and Appearance via Inter-Frame Attention for Efficient Video Frame InterpolationPoster129 citations
- Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning With Multimodal ModelsPoster129 citations
- TryOnDiffusion: A Tale of Two UNetsPoster129 citations
- Vid2Avatar: 3D Avatar Reconstruction From Videos in the Wild via Self-Supervised Scene DecompositionPoster129 citations
- Delivering Arbitrary-Modal Semantic SegmentationPoster128 citations
- One-Stage 3D Whole-Body Mesh Recovery With Component Aware TransformerPoster128 citations
- PillarNeXt: Rethinking Network Designs for 3D Object Detection in LiDAR Point CloudsPoster127 citations
- MotionDiffuser: Controllable Multi-Agent Motion Prediction Using DiffusionHighlight126 citations
- Selective Structured State-Spaces for Long-Form Video UnderstandingPoster126 citations
- Taming Diffusion Models for Audio-Driven Co-Speech Gesture GenerationPoster126 citations
- Next3D: Generative Neural Texture Rasterization for 3D-Aware Head AvatarsHighlight125 citations
- CRAFT: Concept Recursive Activation FacTorization for ExplainabilityPoster124 citations
- LaserMix for Semi-Supervised LiDAR Semantic SegmentationHighlight124 citations
- LayoutDM: Discrete Diffusion Model for Controllable Layout GenerationPoster124 citations
- Solving 3D Inverse Problems Using Pre-Trained 2D Diffusion ModelsPoster124 citations
- Learning on Gradients: Generalized Artifacts Representation for GAN-Generated Images DetectionPoster123 citations
- ViP3D: End-to-End Visual Trajectory Prediction via 3D Agent QueriesPoster123 citations
- DiffusioNeRF: Regularizing Neural Radiance Fields With Denoising Diffusion ModelsPoster122 citations
- FedDM: Iterative Distribution Matching for Communication-Efficient Federated LearningPoster122 citations
- SVFormer: Semi-Supervised Video Transformer for Action RecognitionPoster122 citations
- Uncovering the Disentanglement Capability in Text-to-Image Diffusion ModelsPoster122 citations
- Wavelet Diffusion Models Are Fast and Scalable Image GeneratorsPoster122 citations
- Back to the Source: Diffusion-Driven Adaptation To Test-Time CorruptionPoster121 citations
- FlexiViT: One Model for All Patch SizesPoster121 citations
- HOLODIFFUSION: Training a 3D Diffusion Model Using 2D ImagesPoster121 citations
- How to Backdoor Diffusion Models?Poster121 citations
- InstantAvatar: Learning Avatars From Monocular Video in 60 SecondsPoster121 citations
- Rotation-Invariant Transformer for Point Cloud MatchingPoster121 citations
- Diffusion Probabilistic Model Made SlimPoster120 citations
- Diffusion-SDF: Text-To-Shape via Voxelized DiffusionPoster120 citations
- R2Former: Unified Retrieval and Reranking Transformer for Place RecognitionHighlight120 citations
- Cap4Video: What Can Auxiliary Captions Do for Text-Video Retrieval?Highlight119 citations
- CompletionFormer: Depth Completion With Convolutions and Vision TransformersPoster119 citations
- FlowFormer++: Masked Cost Volume Autoencoding for Pretraining Optical Flow EstimationPoster119 citations
- Minimizing the Accumulated Trajectory Error To Improve Dataset DistillationPoster119 citations
- SmallCap: Lightweight Image Captioning Prompted With Retrieval AugmentationPoster119 citations
- UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned PolicyPoster119 citations
- Hierarchical Dense Correlation Distillation for Few-Shot SegmentationHighlight118 citations
- Multimodal Industrial Anomaly Detection via Hybrid FusionPoster118 citations
- Trace and Pace: Controllable Pedestrian Animation via Guided Trajectory DiffusionPoster118 citations
- iDisc: Internal Discretization for Monocular Depth EstimationPoster118 citations
- MSMDFusion: Fusing LiDAR and Camera at Multiple Scales With Multi-Depth Seeds for 3D Object DetectionPoster117 citations
- Robust Mean Teacher for Continual and Gradual Test-Time AdaptationPoster117 citations
- Siamese Image Modeling for Self-Supervised Vision Representation LearningPoster117 citations
- Phase-Shifting Coder: Predicting Accurate Orientation in Oriented Object DetectionPoster116 citations
- RangeViT: Towards Vision Transformers for 3D Semantic Segmentation in Autonomous DrivingPoster116 citations
- Task Residual for Tuning Vision-Language ModelsPoster116 citations
- Benchmarking Robustness of 3D Object Detection to Common CorruptionsPoster115 citations
- Masked Video Distillation: Rethinking Masked Feature Modeling for Self-Supervised Video Representation LearningPoster115 citations
- ShadowDiffusion: When Degradation Prior Meets Diffusion Model for Shadow RemovalPoster115 citations
- Multi-Modal Learning With Missing Modality via Shared-Specific Feature ModellingPoster114 citations
- OmniMAE: Single Model Masked Pretraining on Images and VideosPoster113 citations
- V2X-Seq: A Large-Scale Sequential Dataset for Vehicle-Infrastructure Cooperative Perception and ForecastingPoster113 citations
- Class Attention Transfer Based Knowledge DistillationPoster112 citations
- FreeSeg: Unified, Universal and Open-Vocabulary Image SegmentationPoster112 citations
- GCFAgg: Global and Cross-View Feature Aggregation for Multi-View ClusteringPoster112 citations
- LargeKernel3D: Scaling Up Kernels in 3D Sparse CNNsPoster112 citations
- MCF: Mutual Correction Framework for Semi-Supervised Medical Image SegmentationPoster112 citations
- METransformer: Radiology Report Generation by Transformer With Multiple Learnable Expert TokensPoster112 citations
- Unifying Vision, Text, and Layout for Universal Document ProcessingHighlight112 citations
- Video Event Restoration Based on Keyframes for Video Anomaly DetectionPoster112 citations
- Consistent View Synthesis With Pose-Guided Diffusion ModelsPoster111 citations
- Guiding Pseudo-Labels With Uncertainty Estimation for Source-Free Unsupervised Domain AdaptationPoster111 citations
- Learning With Fantasy: Semantic-Aware Virtual Contrastive Constraint for Few-Shot Class-Incremental LearningPoster111 citations
- Sharpness-Aware Gradient Matching for Domain GeneralizationPoster111 citations
- Visual Language Pretrained Multiple Instance Zero-Shot Transfer for Histopathology ImagesPoster111 citations
- Dynamic Graph Learning With Content-Guided Spatial-Frequency Relation Reasoning for Deepfake DetectionPoster110 citations
- MIST: Multi-Modal Iterative Spatial-Temporal Transformer for Long-Form Video Question AnsweringPoster110 citations
- Omni3D: A Large Benchmark and Model for 3D Object Detection in the WildPoster110 citations
- Re-IQA: Unsupervised Learning for Image Quality Assessment in the WildPoster110 citations
- CLIP for All Things Zero-Shot Sketch-Based Image Retrieval, Fine-Grained or NotPoster109 citations
- Learning To Generate Text-Grounded Mask for Open-World Semantic Segmentation From Only Image-Text PairsPoster109 citations
- PACO: Parts and Attributes of Common ObjectsHighlight109 citations
- Unbiased Multiple Instance Learning for Weakly Supervised Video Anomaly DetectionPoster109 citations
- CR-FIQA: Face Image Quality Assessment by Learning Sample Relative ClassifiabilityPoster108 citations
- SINE: Semantic-Driven Image-Based NeRF Editing With Prior-Guided Editing FieldPoster108 citations
- CLIP the Gap: A Single Domain Generalization Approach for Object DetectionPoster107 citations
- CLIP2: Contrastive Language-Image-Point Pretraining From Real-World Point Cloud DataPoster107 citations
- Decoupling Human and Camera Motion From Videos in the WildPoster107 citations
- Mod-Squad: Designing Mixtures of Experts As Modular Multi-Task LearnersPoster107 citations
- Continuous Sign Language Recognition With Correlation NetworkPoster106 citations
- Interventional Bag Multi-Instance Learning on Whole-Slide Pathological ImagesHighlight106 citations
- Multi-Level Logit DistillationPoster106 citations
- Pixels, Regions, and Objects: Multiple Enhancement for Salient Object DetectionPoster106 citations
- Progressively Optimized Local Radiance Fields for Robust View SynthesisPoster106 citations
- Learning Open-Vocabulary Semantic Segmentation Models From Natural Language SupervisionPoster105 citations
- Learning Weather-General and Weather-Specific Features for Image Restoration Under Multiple Adverse Weather ConditionsPoster105 citations
- VindLU: A Recipe for Effective Video-and-Language PretrainingPoster105 citations
- GP-VTON: Towards General Purpose Virtual Try-On via Collaborative Local-Flow Global-Parsing LearningPoster104 citations
- Seeing What You Said: Talking Face Generation Guided by a Lip Reading ExpertPoster104 citations
- Semantic-Conditional Diffusion Networks for Image CaptioningPoster104 citations
- Shape-Erased Feature Learning for Visible-Infrared Person Re-IdentificationPoster104 citations
- AMT: All-Pairs Multi-Field Transforms for Efficient Frame InterpolationPoster103 citations
- Detecting Everything in the Open World: Towards Universal Object DetectionPoster103 citations
- Diversity-Measurable Anomaly DetectionPoster103 citations
- Habitat-Matterport 3D Semantics DatasetHighlight102 citations
- PyramidFlow: High-Resolution Defect Contrastive Localization Using Pyramid Normalizing FlowPoster102 citations
- Twin Contrastive Learning With Noisy LabelsPoster102 citations
- Avatars Grow Legs: Generating Smooth Human Motion From Sparse Tracking Inputs With Diffusion ModelPoster101 citations
- DeepSolo: Let Transformer Decoder With Explicit Points Solo for Text SpottingPoster101 citations
- Lite DETR: An Interleaved Multi-Scale Encoder for Efficient DETRPoster101 citations
- Micron-BERT: BERT-Based Facial Micro-Expression RecognitionPoster101 citations
- PanoHead: Geometry-Aware 3D Full-Head Synthesis in 360degPoster101 citations
- BEVHeight: A Robust Framework for Vision-Based Roadside 3D Object DetectionPoster100 citations
- LAVENDER: Unifying Video-Language Understanding As Masked Language ModelingPoster100 citations
- Vita-CLIP: Video and Text Adaptive CLIP via Multimodal PromptingPoster100 citations
- Bidirectional Cross-Modal Knowledge Exploration for Video Recognition With Pre-Trained Vision-Language ModelsPoster99 citations
- DISC: Learning From Noisy Labels via Dynamic Instance-Specific Selection and CorrectionPoster99 citations
- EDA: Explicit Text-Decoupling and Dense Alignment for 3D Visual GroundingPoster99 citations
- Federated Domain Generalization With Generalization AdjustmentPoster99 citations
- Good Is Bad: Causality Inspired Cloth-Debiasing for Cloth-Changing Person Re-IdentificationPoster99 citations
- Improved Distribution Matching for Dataset CondensationPoster99 citations
- MSeg3D: Multi-Modal 3D Semantic Segmentation for Autonomous DrivingPoster99 citations
- PC2: Projection-Conditioned Point Cloud Diffusion for Single-Image 3D ReconstructionHighlight99 citations
- Patch-Mix Transformer for Unsupervised Domain Adaptation: A Game PerspectiveHighlight99 citations
- Quality-Aware Pre-Trained Models for Blind Image Quality AssessmentPoster99 citations
- REVEAL: Retrieval-Augmented Visual-Language Pre-Training With Multi-Source Multimodal Knowledge MemoryHighlight99 citations
- TransFlow: Transformer As Flow LearnerHighlight99 citations
- Visual Prompt Tuning for Generative Transfer LearningPoster99 citations
- 3D Human Pose Estimation via Intuitive PhysicsPoster98 citations
- NICO++: Towards Better Benchmarking for Domain GeneralizationPoster98 citations
- Zero-Shot Noise2Noise: Efficient Image Denoising Without Any DataPoster98 citations
- EcoTTA: Memory-Efficient Continual Test-Time Adaptation via Self-Distilled RegularizationPoster97 citations
- AltFreezing for More General Video Face Forgery DetectionHighlight96 citations
- Augmentation Matters: A Simple-Yet-Effective Approach to Semi-Supervised Semantic SegmentationPoster96 citations
- DR2: Diffusion-Based Robust Degradation Remover for Blind Face RestorationPoster96 citations
- Joint Visual Grounding and Tracking With Natural Language SpecificationPoster96 citations
- KiUT: Knowledge-Injected U-Transformer for Radiology Report GenerationPoster96 citations
- PROB: Probabilistic Objectness for Open World Object DetectionPoster96 citations
- Think Twice Before Driving: Towards Scalable Decoders for End-to-End Autonomous DrivingPoster96 citations
- Constructing Deep Spiking Neural Networks From Artificial Neural Networks With Knowledge DistillationPoster95 citations
- Instance Relation Graph Guided Source-Free Domain Adaptive Object DetectionPoster95 citations
- SCPNet: Semantic Scene Completion on Point CloudHighlight95 citations
- Self-Positioning Point-Based Transformer for Point Cloud UnderstandingPoster95 citations
- Dynamic Conceptional Contrastive Learning for Generalized Category DiscoveryPoster94 citations
- Grid-Guided Neural Radiance Fields for Large Urban ScenesPoster94 citations
- Label-Free Liver Tumor SegmentationPoster94 citations
- MonoHuman: Animatable Human Neural Field From Monocular VideoPoster94 citations
- ObjectStitch: Object Compositing With Diffusion ModelPoster94 citations
- Open Vocabulary Semantic Segmentation With Patch Aligned Contrastive LearningHighlight94 citations
- Parallel Diffusion Models of Operator and Image for Blind Inverse ProblemsPoster94 citations
- ReasonNet: End-to-End Driving With Temporal and Global ReasoningPoster94 citations
- Referring Multi-Object TrackingPoster94 citations
- GEN: Pushing the Limits of Softmax-Based Out-of-Distribution DetectionPoster93 citations
- MARLIN: Masked Autoencoder for Facial Video Representation LearnINgPoster93 citations
- PIP-Net: Patch-Based Intuitive Prototypes for Interpretable Image ClassificationPoster93 citations
- PartMix: Regularization Strategy To Learn Part Discovery for Visible-Infrared Person Re-IdentificationPoster93 citations
- A Dynamic Multi-Scale Voxel Flow Network for Video PredictionHighlight92 citations
- Exploiting Completeness and Uncertainty of Pseudo Labels for Weakly Supervised Video Anomaly DetectionPoster92 citations
- GAPartNet: Cross-Category Domain-Generalizable Object Perception and Manipulation via Generalizable and Actionable PartsHighlight92 citations
- Multi-Label Compound Expression Recognition: C-EXPR Database & NetworkPoster92 citations
- Teaching Structured Vision & Language Concepts to Vision & Language ModelsPoster92 citations
- End-to-End Vectorized HD-Map Construction With Piecewise Bezier CurvePoster91 citations
- EventNeRF: Neural Radiance Fields From a Single Colour Event CameraPoster91 citations
- NeRF-DS: Neural Radiance Fields for Dynamic Specular ObjectsPoster91 citations
- vMAP: Vectorised Object Mapping for Neural Field SLAMPoster91 citations
- An Empirical Study of End-to-End Video-Language Transformers With Masked Visual ModelingPoster90 citations
- Contrastive Mean Teacher for Domain Adaptive Object DetectorsPoster90 citations
- DropKey for Vision TransformerPoster90 citations
- PromptCAL: Contrastive Affinity Learning via Auxiliary Prompts for Generalized Novel Category DiscoveryPoster90 citations
- Slide-Transformer: Hierarchical Vision Transformer With Local Self-AttentionPoster90 citations
- BAD-NeRF: Bundle Adjusted Deblur Neural Radiance FieldsPoster89 citations
- Bridging Search Region Interaction With Template for RGB-T TrackingPoster89 citations
- Dynamic Coarse-To-Fine Learning for Oriented Tiny Object DetectionPoster89 citations
- Filtering, Distillation, and Hard Negatives for Vision-Language Pre-TrainingPoster89 citations
- FlatFormer: Flattened Window Attention for Efficient Point Cloud TransformerPoster89 citations
- Identity-Preserving Talking Face Generation With Landmark and Appearance PriorsPoster89 citations
- Masked Image Training for Generalizable Deep Image DenoisingPoster89 citations
- Meta Architecture for Point Cloud AnalysisPoster89 citations
- Neural Fields Meet Explicit Geometric Representations for Inverse Rendering of Urban ScenesPoster89 citations
- Understanding and Improving Visual Prompting: A Label-Mapping PerspectivePoster89 citations
- Vision Transformers Are Parameter-Efficient Audio-Visual LearnersPoster89 citations
- Affordance Diffusion: Synthesizing Hand-Object InteractionsPoster88 citations
- Boundary Unlearning: Rapid Forgetting of Deep Networks via Shifting the Decision BoundaryPoster88 citations
- C-SFDA: A Curriculum Learning Aided Self-Training Framework for Efficient Source Free Domain AdaptationPoster88 citations
- DetCLIPv2: Scalable Open-Vocabulary Object Detection Pre-Training via Word-Region AlignmentPoster88 citations
- Multiview Compressive Coding for 3D ReconstructionPoster88 citations
- PCR: Proxy-Based Contrastive Replay for Online Class-Incremental Continual LearningPoster88 citations
- PMR: Prototypical Modal Rebalance for Multimodal LearningPoster88 citations
- PermutoSDF: Fast Multi-View Reconstruction With Implicit Surfaces Using Permutohedral LatticesPoster88 citations
- CVT-SLR: Contrastive Visual-Textual Transformation for Sign Language Recognition With Variational AlignmentHighlight87 citations
- Continual Detection Transformer for Incremental Object DetectionPoster87 citations
- HNeRV: A Hybrid Neural Representation for VideosPoster87 citations
- Infinite Photorealistic Worlds Using Procedural GenerationPoster87 citations
- Neural Kernel Surface ReconstructionHighlight87 citations
- Toward Verifiable and Reproducible Human Evaluation for Text-to-Image GenerationPoster87 citations
- High-Frequency Stereo Matching NetworkHighlight86 citations
- Rethinking Domain Generalization for Face Anti-Spoofing: Separability and AlignmentPoster86 citations
- Simple Cues Lead to a Strong Multi-Object TrackerPoster86 citations
- ViTs for SITS: Vision Transformers for Satellite Image Time SeriesPoster86 citations
- ProxyFormer: Proxy Alignment Assisted Point Cloud Completion With Missing Part Sensitive TransformerPoster85 citations
- Collaboration Helps Camera Overtake LiDAR in 3D DetectionPoster84 citations
- FFCV: Accelerating Training by Removing Data BottlenecksPoster84 citations
- Few-Shot Class-Incremental Learning via Class-Aware Bilateral DistillationPoster84 citations
- Ingredient-Oriented Multi-Degradation Learning for Image RestorationPoster84 citations
- Prototypical Residual Networks for Anomaly Detection and LocalizationPoster84 citations
- Region-Aware Pretraining for Open-Vocabulary Object Detection With Vision TransformersHighlight84 citations
- Turning a CLIP Model Into a Scene Text DetectorPoster84 citations
- Detecting and Grounding Multi-Modal Media ManipulationPoster83 citations
- Explicit Boundary Guided Semi-Push-Pull Contrastive Learning for Supervised Anomaly DetectionPoster83 citations
- GD-MAE: Generative Decoder for MAE Pre-Training on LiDAR Point CloudsPoster83 citations
- HouseDiffusion: Vector Floorplan Generation via a Diffusion Model With Discrete and Continuous DenoisingPoster83 citations
- Joint Token Pruning and Squeezing Towards More Aggressive Compression of Vision TransformersPoster83 citations
- MoLo: Motion-Augmented Long-Short Contrastive Learning for Few-Shot Action RecognitionPoster83 citations
- OmniAL: A Unified CNN Framework for Unsupervised Anomaly LocalizationPoster83 citations
- PD-Quant: Post-Training Quantization Based on Prediction Difference MetricPoster83 citations
- TrojDiff: Trojan Attacks on Diffusion Models With Diverse TargetsPoster83 citations
- VectorFusion: Text-to-SVG by Abstracting Pixel-Based Diffusion ModelsPoster83 citations
- Color Backdoor: A Robust Poisoning Attack in Color SpacePoster82 citations
- MP-Former: Mask-Piloted Transformer for Image SegmentationPoster82 citations
- VILA: Learning Image Aesthetics From User Comments With Vision-Language PretrainingPoster82 citations
- DA-DETR: Domain Adaptive Detection Transformer With Information FusionPoster81 citations
- Efficient RGB-T Tracking via Cross-Modality DistillationHighlight81 citations
- Human Pose As Compositional TokensPoster81 citations
- Learning Neural Volumetric Representations of Dynamic Humans in MinutesPoster81 citations
- OrienterNet: Visual Localization in 2D Public Maps With Neural MatchingPoster81 citations
- PiMAE: Point Cloud and Image Interactive Masked Autoencoders for 3D Object DetectionPoster81 citations
- Rethinking Video ViTs: Sparse Video Tubes for Joint Image and Video LearningPoster81 citations
- Boundary-Enhanced Co-Training for Weakly Supervised Semantic SegmentationPoster80 citations
- Compressing Volumetric Radiance Fields to 1 MBPoster80 citations
- Conflict-Based Cross-View Consistency for Semi-Supervised Semantic SegmentationPoster80 citations
- Hard Patches Mining for Masked Image ModelingPoster80 citations
- NeuralField-LDM: Scene Generation With Hierarchical Latent Diffusion ModelsPoster80 citations
- Task-Specific Fine-Tuning via Variational Information Bottleneck for Weakly-Supervised Pathology Whole Slide Image ClassificationPoster80 citations
- Actionlet-Dependent Contrastive Learning for Unsupervised Skeleton-Based Action RecognitionHighlight79 citations
- Directional Connectivity-Based Segmentation of Medical ImagesPoster79 citations
- Ego-Body Pose Estimation via Ego-Head Pose EstimationPoster79 citations
- Hierarchical Semantic Contrast for Scene-Aware Video Anomaly DetectionPoster79 citations
- Instance-Aware Domain Generalization for Face Anti-SpoofingPoster79 citations
- Mapping Degeneration Meets Label Evolution: Learning Infrared Small Target Detection With Single Point SupervisionPoster79 citations
- RobustNeRF: Ignoring Distractors With Robust LossesHighlight79 citations
- Spatial-Frequency Mutual Learning for Face Super-ResolutionPoster79 citations
- Spectral Enhanced Rectangle Transformer for Hyperspectral Image DenoisingPoster79 citations
- DaFKD: Domain-Aware Federated Knowledge DistillationPoster78 citations
- Make Landscape Flatter in Differentially Private Federated LearningPoster78 citations
- DP-NeRF: Deblurred Neural Radiance Field With Physical Scene PriorsPoster77 citations
- Freestyle Layout-to-Image SynthesisHighlight77 citations
- GFPose: Learning 3D Human Pose Prior With Gradient FieldsPoster77 citations
- Local-to-Global Registration for Bundle-Adjusting Neural Radiance FieldsPoster77 citations
- Prototype-Based Embedding Network for Scene Graph GenerationPoster77 citations
- Self-Supervised Video Forensics by Audio-Visual Anomaly DetectionHighlight77 citations
- 3Mformer: Multi-Order Multi-Mode Transformer for Skeletal Action RecognitionPoster76 citations
- Align and Attend: Multimodal Summarization With Dual Contrastive LossesPoster76 citations
- Comprehensive and Delicate: An Efficient Transformer for Image RestorationPoster76 citations
- Computationally Budgeted Continual Learning: What Does Matter?Poster76 citations
- Consistent-Teacher: Towards Reducing Inconsistent Pseudo-Targets in Semi-Supervised Object DetectionHighlight76 citations
- CrowdCLIP: Unsupervised Crowd Counting via Vision-Language ModelPoster76 citations
- DiffCollage: Parallel Generation of Large Content With Diffusion ModelsPoster76 citations
- DisWOT: Student Architecture Search for Distillation WithOut TrainingPoster76 citations
- Attention-Based Point Cloud Edge SamplingHighlight75 citations
- Best of Both Worlds: Multimodal Contrastive Learning With Tabular and Imaging DataPoster75 citations
- GeoMVSNet: Learning Multi-View Stereo With Geometry PerceptionPoster75 citations
- HOICLIP: Efficient Knowledge Transfer for HOI Detection With Vision-Language ModelsPoster75 citations
- Learning To Render Novel Views From Wide-Baseline Stereo PairsPoster75 citations
- Texts as Images in Prompt Tuning for Multi-Label Image RecognitionPoster75 citations
- Accelerating Dataset Distillation via Model AugmentationHighlight74 citations
- BUFFER: Balancing Accuracy, Efficiency, and Generalizability in Point Cloud RegistrationPoster74 citations
- Change-Aware Sampling and Contrastive Learning for Satellite ImagesPoster74 citations
- Conditional Text Image Generation With Diffusion ModelsPoster74 citations
- FastInst: A Simple Query-Based Model for Real-Time Instance SegmentationPoster74 citations
- Fine-Grained Image-Text Matching by Cross-Modal Hard Aligning NetworkPoster74 citations
- I2MVFormer: Large Language Model Generated Multi-View Document Supervision for Zero-Shot Image ClassificationHighlight74 citations
- PartSLIP: Low-Shot Part Segmentation for 3D Point Clouds via Pretrained Image-Language ModelsPoster74 citations
- Progressive Disentangled Representation Learning for Fine-Grained Controllable Talking Head SynthesisPoster74 citations
- Rethinking the Learning Paradigm for Dynamic Facial Expression RecognitionPoster74 citations
- UniHCP: A Unified Model for Human-Centric PerceptionsPoster74 citations
- Video-Text As Game Players: Hierarchical Banzhaf Interaction for Cross-Modal Representation LearningHighlight74 citations
- Fine-Grained Face Swapping via Regional GAN InversionPoster73 citations
- Object-Aware Distillation Pyramid for Open-Vocabulary Object DetectionPoster73 citations
- OcTr: Octree-Based Transformer for 3D Object DetectionPoster73 citations
- Rethinking Out-of-Distribution (OOD) Detection: Masked Image Modeling Is All You NeedPoster73 citations
- Transferable Adversarial Attacks on Vision Transformers With Token Gradient RegularizationPoster73 citations
- Unifying Short and Long-Term Tracking With Graph HierarchiesPoster73 citations
- Deep Incomplete Multi-View Clustering With Cross-View Partial Sample and Prototype AlignmentPoster72 citations
- High-Fidelity 3D GAN Inversion by Pseudo-Multi-View OptimizationPoster72 citations
- Multi-Realism Image Compression With a Conditional GeneratorPoster72 citations
- VoP: Text-Video Co-Operative Prompt Tuning for Cross-Modal RetrievalPoster72 citations
- X-Avatar: Expressive Human AvatarsPoster72 citations
- You Only Segment Once: Towards Real-Time Panoptic SegmentationPoster72 citations
- Dense Network Expansion for Class Incremental LearningPoster71 citations
- DiffSwap: High-Fidelity and Controllable Face Swapping via 3D-Aware Masked DiffusionPoster71 citations
- GKEAL: Gaussian Kernel Embedded Analytic Learning for Few-Shot Class Incremental TaskPoster71 citations
- MSINet: Twins Contrastive Search of Multi-Scale Interaction for Object ReIDPoster71 citations
- Natural Language-Assisted Sign Language RecognitionPoster71 citations
- On Data Scaling in Masked Image ModelingPoster71 citations
- Re-Thinking Model Inversion Attacks Against Deep Neural NetworksPoster71 citations
- Removing Objects From Neural Radiance FieldsPoster71 citations
- StyleSync: High-Fidelity Generalized and Personalized Lip Sync in Style-Based GeneratorPoster71 citations
- A Simple Baseline for Video Restoration With Grouped Spatial-Temporal ShiftPoster70 citations
- ALSO: Automotive Lidar Self-Supervision by Occupancy EstimationPoster70 citations
- Backdoor Defense via Adaptively Splitting Poisoned DatasetPoster70 citations
- Diversity-Aware Meta Visual PromptingPoster70 citations
- Hyperbolic Contrastive Learning for Visual Representations Beyond ObjectsPoster70 citations
- Learning Semantic Relationship Among Instances for Image-Text MatchingPoster70 citations
- LidarGait: Benchmarking 3D Gait Recognition With Point CloudsPoster70 citations
- ProphNet: Efficient Agent-Centric Motion Forecasting With Anchor-Informed ProposalsHighlight70 citations
- SeaThru-NeRF: Neural Radiance Fields in Scattering MediaPoster70 citations
- X-Pruner: eXplainable Pruning for Vision TransformersPoster70 citations
- A Whac-a-Mole Dilemma: Shortcuts Come in Multiples Where Mitigating One Amplifies OthersPoster69 citations
- Accelerated Coordinate Encoding: Learning to Relocalize in Minutes Using RGB and PosesHighlight69 citations
- Learning Bottleneck Concepts in Image ClassificationPoster69 citations
- NIKI: Neural Inverse Kinematics With Invertible Neural Networks for 3D Human Pose and Shape EstimationPoster69 citations
- AutoAD: Movie Description in ContextHighlight68 citations
- Global Vision Transformer Pruning With Hessian-Aware SaliencyPoster68 citations
- Hierarchical Video-Moment Retrieval and Step-CaptioningPoster68 citations
- Histopathology Whole Slide Image Analysis With Heterogeneous Graph Representation LearningPoster68 citations
- MagicPony: Learning Articulated 3D Animals in the WildPoster68 citations
- Make-a-Story: Visual Memory Conditioned Consistent Story GenerationPoster68 citations
- PIRLNav: Pretraining With Imitation and RL Finetuning for ObjectNavPoster68 citations
- Renderable Neural Radiance Map for Visual NavigationHighlight68 citations
- Unsupervised Deep Probabilistic Approach for Partial Point Cloud RegistrationPoster68 citations
- AssemblyHands: Towards Egocentric Activity Understanding via 3D Hand Pose EstimationPoster67 citations
- CFA: Class-Wise Calibrated Fair Adversarial TrainingPoster67 citations
- Extracting Class Activation Maps From Non-Discriminative Features As WellPoster67 citations
- GeoLayoutLM: Geometric Pre-Training for Visual Information ExtractionHighlight67 citations
- Grad-PU: Arbitrary-Scale Point Cloud Upsampling via Gradient Descent With Learned Distance FunctionsPoster67 citations
- MIME: Human-Aware 3D Scene GenerationPoster67 citations
- NeRF-RPN: A General Framework for Object Detection in NeRFsPoster67 citations
- NeuralUDF: Learning Unsigned Distance Fields for Multi-View Reconstruction of Surfaces With Arbitrary TopologiesPoster67 citations
- Progressive Semantic-Visual Mutual Adaption for Generalized Zero-Shot LearningHighlight67 citations
- Super-CLEVR: A Virtual Benchmark To Diagnose Domain Robustness in Visual ReasoningHighlight67 citations
- TRACE: 5D Temporal Regression of Avatars With Dynamic Cameras in 3D EnvironmentsPoster67 citations
- Unsupervised Visible-Infrared Person Re-Identification via Progressive Graph Matching and Alternate LearningPoster67 citations
- Global and Local Mixture Consistency Cumulative Learning for Long-Tailed Visual RecognitionsPoster66 citations
- Neural Residual Radiance Fields for Streamably Free-Viewpoint VideosPoster66 citations
- OVTrack: Open-Vocabulary Multiple Object TrackingPoster66 citations
- Revisiting Temporal Modeling for CLIP-Based Image-to-Video Knowledge TransferringPoster66 citations
- Text With Knowledge Graph Augmented Transformer for Video CaptioningPoster66 citations
- UTM: A Unified Multiple Object Tracking Model With Identity-Aware Feature EnhancementPoster66 citations
- Understanding the Robustness of 3D Object Detection With Bird's-Eye-View Representations in Autonomous DrivingPoster66 citations
- VideoTrack: Learning To Track Objects via Video TransformerPoster66 citations
- Zero-Shot Referring Image Segmentation With Global-Local Context FeaturesPoster66 citations
- BlackVIP: Black-Box Visual Prompting for Robust Transfer LearningPoster65 citations
- Context De-Confounded Emotion RecognitionPoster65 citations
- Detecting Backdoors in Pre-Trained EncodersPoster65 citations
- DiffusionRig: Learning Personalized Priors for Facial Appearance EditingPoster65 citations
- Gloss Attention for Gloss-Free Sign Language TranslationPoster65 citations
- Neural Map Prior for Autonomous DrivingPoster65 citations
- On the Stability-Plasticity Dilemma of Class-Incremental LearningPoster65 citations
- PHA: Patch-Wise High-Frequency Augmentation for Transformer-Based Person Re-IdentificationHighlight65 citations
- Positive-Augmented Contrastive Learning for Image and Video Captioning EvaluationHighlight65 citations
- Spring: A High-Resolution High-Detail Dataset and Benchmark for Scene Flow, Optical Flow and StereoPoster65 citations
- Unsupervised Object Localization: Observing the Background To Discover ObjectsPoster65 citations
- Class-Incremental Exemplar Compression for Class-Incremental LearningPoster64 citations
- Clover: Towards a Unified Video-Language Alignment and Fusion ModelPoster64 citations
- DeepLSD: Line Segment Detection and Refinement With Deep Image GradientsPoster64 citations
- DisCoScene: Spatially Disentangled Generative Radiance Fields for Controllable 3D-Aware Scene SynthesisHighlight64 citations
- NoisyQuant: Noisy Bias-Enhanced Post-Training Activation Quantization for Vision TransformersPoster64 citations
- Real-Time Neural Light Field on Mobile DevicesPoster64 citations
- Transductive Few-Shot Learning With Prototype-Based Label Propagation by Iterative Graph RefinementPoster64 citations
- TrojViT: Trojan Insertion in Vision TransformersPoster64 citations
- UDE: A Unified Driving Engine for Human Motion GenerationPoster64 citations
- ViPLO: Vision Transformer Based Pose-Conditioned Self-Loop Graph for Human-Object Interaction DetectionPoster64 citations
- Adaptive Sparse Pairwise Loss for Object Re-IdentificationPoster63 citations
- CiaoSR: Continuous Implicit Attention-in-Attention Network for Arbitrary-Scale Image Super-ResolutionPoster63 citations
- Deep Frequency Filtering for Domain GeneralizationPoster63 citations
- End-to-End 3D Dense Captioning With Vote2Cap-DETRPoster63 citations
- Fair Federated Medical Image Segmentation via Client Contribution EstimationPoster63 citations
- HOOD: Hierarchical Graphs for Generalized Modelling of Clothing DynamicsPoster63 citations
- LASP: Text-to-Text Optimization for Language-Aware Soft Prompting of Vision & Language ModelsPoster63 citations
- MIANet: Aggregating Unbiased Instance and General Information for Few-Shot Semantic SegmentationPoster63 citations
- Masked Image Modeling With Local Multi-Scale ReconstructionHighlight63 citations
- Non-Contrastive Unsupervised Learning of Physiological Signals From VideoHighlight63 citations
- PaletteNeRF: Palette-Based Appearance Editing of Neural Radiance FieldsPoster63 citations
- Slimmable Dataset CondensationHighlight63 citations
- UniDistill: A Universal Cross-Modality Knowledge Distillation Framework for 3D Object Detection in Bird's-Eye ViewHighlight63 citations
- You Do Not Need Additional Priors or Regularizers in Retinex-Based Low-Light Image EnhancementPoster63 citations
- Anchor3DLane: Learning To Regress 3D Anchors for Monocular 3D Lane DetectionPoster62 citations
- CF-Font: Content Fusion for Few-Shot Font GenerationPoster62 citations
- LEGO-Net: Learning Regular Rearrangements of Objects in RoomsPoster62 citations
- MetaPortrait: Identity-Preserving Talking Head Generation With Fast Personalized AdaptationPoster62 citations
- Open-Vocabulary Point-Cloud Object Detection Without 3D AnnotationPoster62 citations
- Revisiting Prototypical Network for Cross Domain Few-Shot LearningPoster62 citations
- ScaleFL: Resource-Adaptive Federated Learning With Heterogeneous ClientsPoster62 citations
- Super-Resolution Neural OperatorPoster62 citations
- DiGeo: Discriminative Geometry-Aware Learning for Generalized Few-Shot Object DetectionPoster61 citations
- Enhanced Training of Query-Based Object Detection via Selective Query RecollectionPoster61 citations
- Focus on Details: Online Multi-Object Tracking With Diverse Fine-Grained RepresentationPoster61 citations
- GrowSP: Unsupervised Semantic Segmentation of 3D Point CloudsPoster61 citations
- Improved Test-Time Adaptation for Domain GeneralizationPoster61 citations
- Interactive Segmentation of Radiance FieldsPoster61 citations
- LayoutDM: Transformer-Based Diffusion Model for Layout GenerationPoster61 citations
- Look Before You Match: Instance Understanding Matters in Video Object SegmentationPoster61 citations
- MD-VQA: Multi-Dimensional Quality Assessment for UGC Live VideosPoster61 citations
- Masked Wavelet Representation for Compact Neural Radiance FieldsPoster61 citations
- OTAvatar: One-Shot Talking Face Avatar With Controllable Tri-Plane RenderingPoster61 citations
- Semi-DETR: Semi-Supervised Object Detection With Detection TransformersPoster61 citations
- TokenHPE: Learning Orientation Tokens for Efficient Head Pose Estimation via TransformersPoster61 citations
- 3D Human Mesh Estimation From Virtual MarkersPoster60 citations
- Ambiguity-Resistant Semi-Supervised Learning for Dense Object DetectionPoster60 citations
- CAT: LoCalization and IdentificAtion Cascade Detection Transformer for Open-World Object DetectionPoster60 citations
- DF-Platter: Multi-Face Heterogeneous Deepfake DatasetPoster60 citations
- DeAR: Debiasing Vision-Language Models With Additive ResidualsPoster60 citations
- Efficient Multimodal Fusion via Interactive PromptingPoster60 citations
- Event-Based Frame Interpolation With Ad-Hoc DeblurringPoster60 citations
- Generative Semantic SegmentationPoster60 citations
- Harmonious Teacher for Cross-Domain Object DetectionPoster60 citations
- Human-Art: A Versatile Human-Centric Dataset Bridging Natural and Artificial ScenesPoster60 citations
- ISBNet: A 3D Point Cloud Instance Segmentation Network With Instance-Aware Sampling and Box-Aware Dynamic ConvolutionPoster60 citations
- Improving Cross-Modal Retrieval With Set of Diverse EmbeddingsHighlight60 citations
- LG-BPN: Local and Global Blind-Patch Network for Self-Supervised Real-World DenoisingPoster60 citations
- MixMAE: Mixed and Masked Autoencoder for Efficient Pretraining of Hierarchical Vision TransformersPoster60 citations
- Out-of-Candidate Rectification for Weakly Supervised Semantic SegmentationPoster60 citations
- PIVOT: Prompting for Video Continual LearningPoster60 citations
- PointDistiller: Structured Knowledge Distillation Towards Efficient and Compact 3D DetectionPoster60 citations
- PointVector: A Vector Representation in Point Cloud AnalysisPoster60 citations
- StyleAdv: Meta Style Adversarial Training for Cross-Domain Few-Shot LearningPoster60 citations
- 3D Concept Learning and Reasoning From Multi-View ImagesPoster59 citations
- A Hierarchical Representation Network for Accurate and Detailed Face Reconstruction From In-the-Wild ImagesPoster59 citations
- A Unified Pyramid Recurrent Network for Video Frame InterpolationPoster59 citations
- AdaMAE: Adaptive Masking for Efficient Spatiotemporal Learning With Masked AutoencodersPoster59 citations
- Efficient Movie Scene Detection Using State-Space TransformersPoster59 citations
- Evading DeepFake Detectors via Adversarial Statistical ConsistencyPoster59 citations
- GaitGCI: Generative Counterfactual Intervention for Gait RecognitionPoster59 citations
- Gradient Norm Aware Minimization Seeks First-Order Flatness and Improves GeneralizationHighlight59 citations
- Learning Customized Visual Models With Retrieval-Augmented KnowledgeHighlight59 citations
- Masked Autoencoders Enable Efficient Knowledge DistillersPoster59 citations
- PEAL: Prior-Embedded Explicit Attention Learning for Low-Overlap Point Cloud RegistrationPoster59 citations
- PVT-SSD: Single-Stage 3D Object Detector With Point-Voxel TransformerPoster59 citations
- Randomized Adversarial Training via Taylor ExpansionPoster59 citations
- Revisiting Residual Networks for Adversarial RobustnessPoster59 citations
- Standing Between Past and Future: Spatio-Temporal Modeling for Multi-Camera 3D Multi-Object TrackingPoster59 citations
- Temporal Interpolation Is All You Need for Dynamic Neural Radiance FieldsHighlight59 citations
- Understanding Imbalanced Semantic Segmentation Through Neural CollapsePoster59 citations
- Uni-Perceiver v2: A Generalist Model for Large-Scale Vision and Vision-Language TasksHighlight59 citations
- BEV-LaneDet: An Efficient 3D Lane Detection Based on Virtual Camera via Key-PointsPoster58 citations
- Boosting Semi-Supervised Learning by Exploiting All Unlabeled DataPoster58 citations
- CIRCLE: Capture in Rich Contextual EnvironmentsPoster58 citations
- CLIP-S4: Language-Guided Self-Supervised Semantic SegmentationHighlight58 citations
- CelebV-Text: A Large-Scale Facial Text-Video DatasetPoster58 citations
- Class-Balancing Diffusion ModelsPoster58 citations
- DPE: Disentanglement of Pose and Expression for General Video Portrait EditingPoster58 citations
- MoDi: Unconditional Motion Synthesis From Diverse DataPoster58 citations
- NeUDF: Leaning Neural Unsigned Distance Fields With Volume RenderingPoster58 citations
- On the Effects of Self-Supervision and Contrastive Alignment in Deep Multi-View ClusteringHighlight58 citations
- Overlooked Factors in Concept-Based Explanations: Dataset Choice, Concept Learnability, and Human CapabilityPoster58 citations
- Representing Volumetric Videos As Dynamic MLP MapsPoster58 citations
- Shifted Diffusion for Text-to-Image GenerationPoster58 citations
- Weakly Supervised Semantic Segmentation via Adversarial Learning of Classifier and ReconstructorPoster58 citations
- AnchorFormer: Point Cloud Completion From Discriminative NodesPoster57 citations
- Backdoor Attacks Against Deep Image Compression via Adaptive Frequency TriggerPoster57 citations
- Continual Semantic Segmentation With Automatic Memory Sample SelectionPoster57 citations
- Curvature-Balanced Feature Manifold Learning for Long-Tailed ClassificationPoster57 citations
- Hi4D: 4D Instance Segmentation of Close Human InteractionPoster57 citations
- HierVL: Learning Hierarchical Video-Language EmbeddingsHighlight57 citations
- Improving the Transferability of Adversarial Samples by Path-Augmented MethodPoster57 citations
- SDC-UDA: Volumetric Unsupervised Domain Adaptation Framework for Slice-Direction Continuous Cross-Modality Medical Image SegmentationPoster57 citations
- Spatially Adaptive Self-Supervised Learning for Real-World Image DenoisingPoster57 citations
- The Treasure Beneath Multiple Annotations: An Uncertainty-Aware Edge DetectorPoster57 citations
- AUNet: Learning Relations Between Action Units for Face Forgery DetectionPoster56 citations
- Adaptive Data-Free QuantizationPoster56 citations
- Audio-Visual Grouping Network for Sound Localization From MixturesPoster56 citations
- Contrastive Grouping With Transformer for Referring Image SegmentationPoster56 citations
- Deep Depth Estimation From Thermal ImagePoster56 citations
- Learning Conditional Attributes for Compositional Zero-Shot LearningPoster56 citations
- Point Cloud Forecasting as a Proxy for 4D Occupancy ForecastingPoster56 citations
- Relational Context Learning for Human-Object Interaction DetectionPoster56 citations
- SQUID: Deep Feature In-Painting for Unsupervised Anomaly DetectionPoster56 citations
- Scene-Aware Egocentric 3D Human Pose EstimationPoster56 citations
- Understanding Masked Image Modeling via Learning Occlusion Invariant FeatureHighlight56 citations
- A Generalized Framework for Video Instance SegmentationPoster55 citations
- Attribute-Preserving Face Dataset Anonymization via Latent Code OptimizationHighlight55 citations
- BEV-Guided Multi-Modality Fusion for Driving PerceptionPoster55 citations
- CLIPPO: Image-and-Language Understanding From Pixels OnlyPoster55 citations
- Data-Efficient Large Scale Place Recognition With Graded Similarity SupervisionPoster55 citations
- Generative Bias for Robust Visual Question AnsweringPoster55 citations
- HS-Pose: Hybrid Scope Feature Extraction for Category-Level Object Pose EstimationPoster55 citations
- Learning Neural Parametric Head ModelsPoster55 citations
- Residual Degradation Learning Unfolding Framework With Mixing Priors Across Spectral and Spatial for Compressive Spectral ImagingPoster55 citations
- Rethinking the Correlation in Few-Shot Segmentation: A Buoys ViewPoster55 citations
- SOOD: Towards Semi-Supervised Oriented Object DetectionPoster55 citations
- SparseViT: Revisiting Activation Sparsity for Efficient High-Resolution Vision TransformerPoster55 citations
- StyleRes: Transforming the Residuals for Real Image Editing With StyleGANPoster55 citations
- Uni3D: A Unified Baseline for Multi-Dataset 3D Object DetectionPoster55 citations
- Unified Keypoint-Based Action Recognition Framework via Structured Keypoint PoolingPoster55 citations
- Upcycling Models Under Domain and Category ShiftPoster55 citations
- 2PCNet: Two-Phase Consistency Training for Day-to-Night Unsupervised Domain Adaptive Object DetectionPoster54 citations
- CLIP-Sculptor: Zero-Shot Generation of High-Fidelity and Diverse Shapes From Natural LanguagePoster54 citations
- Context-Aware Alignment and Mutual Masking for 3D-Language Pre-TrainingHighlight54 citations
- Data-Driven Feature Tracking for Event CamerasPoster54 citations
- Decoupling MaxLogit for Out-of-Distribution DetectionPoster54 citations
- High-Fidelity Clothed Avatar Reconstruction From a Single ImagePoster54 citations
- Independent Component Alignment for Multi-Task LearningPoster54 citations
- Learning Audio-Visual Source Localization via False Negative Aware Contrastive LearningPoster54 citations
- Learning Federated Visual Prompt in Null Space for MRI ReconstructionPoster54 citations
- Learning Imbalanced Data With Vision TransformersPoster54 citations
- Nerflets: Local Radiance Fields for Efficient Structure-Aware 3D Scene Representation From 2D SupervisionPoster54 citations
- One-Shot High-Fidelity Talking-Head Synthesis With Deformable Neural Radiance FieldPoster54 citations
- Proposal-Based Multiple Instance Learning for Weakly-Supervised Temporal Action LocalizationPoster54 citations
- Real-Time Evaluation in Online Continual Learning: A New HopeHighlight54 citations
- Texture-Guided Saliency Distilling for Unsupervised Salient Object DetectionPoster54 citations
- Understanding and Constructing Latent Modality Structures in Multi-Modal Representation LearningPoster54 citations
- VolRecon: Volume Rendering of Signed Ray Distance Functions for Generalizable Multi-View ReconstructionPoster54 citations
- You Can Ground Earlier Than See: An Effective and Efficient Pipeline for Temporal Sentence Grounding in Compressed VideosPoster54 citations
- Zero-Shot Object CountingPoster54 citations
- 1% VS 100%: Parameter-Efficient Low Rank Adapter for Dense PredictionsPoster53 citations
- A New Comprehensive Benchmark for Semi-Supervised Video Anomaly Detection and AnticipationPoster53 citations
- Achieving a Better Stability-Plasticity Trade-Off via Auxiliary Networks in Continual LearningPoster53 citations
- Depth Estimation From Camera Image and mmWave Radar Point CloudPoster53 citations
- Dynamic Aggregated Network for Gait RecognitionPoster53 citations
- Feature Alignment and Uniformity for Test Time AdaptationPoster53 citations
- FedSeg: Class-Heterogeneous Federated Learning for Semantic SegmentationPoster53 citations
- Federated Incremental Semantic SegmentationPoster53 citations
- Guided Depth Super-Resolution by Deep Anisotropic DiffusionPoster53 citations
- Meta-Causal Learning for Single Domain GeneralizationPoster53 citations
- MixNeRF: Modeling a Ray With Mixture Density for Novel View Synthesis From Sparse InputsPoster53 citations
- NeRF in the Palm of Your Hand: Corrective Augmentation for Robotics via Novel-View SynthesisPoster53 citations
- Neural Volumetric Memory for Visual Locomotion ControlHighlight53 citations
- Semi-Supervised Domain Adaptation With Source Label AdaptationPoster53 citations
- Supervised Masked Knowledge Distillation for Few-Shot TransformersPoster53 citations
- Towards All-in-One Pre-Training via Maximizing Multi-Modal Mutual InformationPoster53 citations
- 3D Semantic Segmentation in the Wild: Learning Generalized Models for Adverse-Condition Point CloudsPoster52 citations
- Instance-Specific and Model-Adaptive Supervision for Semi-Supervised Semantic SegmentationPoster52 citations
- Learning Orthogonal Prototypes for Generalized Few-Shot Semantic SegmentationPoster52 citations
- Leveraging Hidden Positives for Unsupervised Semantic SegmentationPoster52 citations
- LinK: Linear Kernel for LiDAR-Based 3D PerceptionPoster52 citations
- OCELOT: Overlapped Cell on Tissue Dataset for HistopathologyPoster52 citations
- Optimization-Inspired Cross-Attention Transformer for Compressive SensingPoster52 citations
- PVO: Panoptic Visual OdometryPoster52 citations
- Perspective Fields for Single Image Camera CalibrationHighlight52 citations
- A Probabilistic Framework for Lifelong Test-Time AdaptationPoster51 citations
- Behind the Scenes: Density Fields for Single View ReconstructionPoster51 citations
- BoxTeacher: Exploring High-Quality Pseudo Labels for Weakly Supervised Instance SegmentationPoster51 citations
- CAP-VSTNet: Content Affinity Preserved Versatile Style TransferPoster51 citations
- CAPE: Camera View Position Embedding for Multi-View 3D Object DetectionPoster51 citations
- ConZIC: Controllable Zero-Shot Image Captioning by Sampling-Based PolishingPoster51 citations
- DNF: Decouple and Feedback Network for Seeing in the DarkHighlight51 citations
- Diffusion-Based Signed Distance Fields for 3D Shape GenerationPoster51 citations
- LOCATE: Localize and Transfer Object Parts for Weakly Supervised Affordance GroundingPoster51 citations
- Language Adaptive Weight Generation for Multi-Task Visual GroundingPoster51 citations
- Learning Spatial-Temporal Implicit Neural Representations for Event-Guided Video Super-ResolutionPoster51 citations
- Mixed Autoencoder for Self-Supervised Visual Representation LearningPoster51 citations
- NS3D: Neuro-Symbolic Grounding of 3D Objects and RelationsPoster51 citations
- NeAT: Learning Neural Implicit Surfaces With Arbitrary Topologies From Multi-View ImagesPoster51 citations
- Optimal Transport Minimization: Crowd Localization on Density Maps for Semi-Supervised CountingHighlight51 citations
- Picture That Sketch: Photorealistic Image Generation From Abstract SketchesPoster51 citations
- QuantArt: Quantizing Image Style Transfer Towards High Visual FidelityPoster51 citations
- Robust Outlier Rejection for 3D Registration With Variational BayesPoster51 citations
- SceneComposer: Any-Level Semantic Image SynthesisHighlight51 citations
- Specialist Diffusion: Plug-and-Play Sample-Efficient Fine-Tuning of Text-to-Image Diffusion Models To Learn Any Unseen StylePoster51 citations
- Visual Query Tuning: Towards Effective Usage of Intermediate Representations for Parameter and Memory Efficient Transfer LearningPoster51 citations
- gSDF: Geometry-Driven Signed Distance Functions for 3D Hand-Object ReconstructionPoster51 citations
- ACSeg: Adaptive Conceptualization for Unsupervised Semantic SegmentationHighlight50 citations
- High-Fidelity 3D Human Digitization From Single 2K Resolution ImagesHighlight50 citations
- Learning Human-to-Robot Handovers From Point CloudsHighlight50 citations
- OpenMix: Exploring Outlier Samples for Misclassification DetectionHighlight50 citations
- OvarNet: Towards Open-Vocabulary Object Attribute RecognitionPoster50 citations
- Panoptic Video Scene Graph GenerationPoster50 citations
- Putting People in Their Place: Affordance-Aware Human Insertion Into ScenesPoster50 citations
- Self-Supervised Non-Uniform Kernel Estimation With Flow-Based Motion Prior for Blind Image DeblurringPoster50 citations
- Towards Artistic Image Aesthetics Assessment: A Large-Scale Dataset and a New MethodPoster50 citations
- Zero-Shot Everything Sketch-Based Image Retrieval, and in Explainable StyleHighlight50 citations
- ACR: Attention Collaboration-Based Regressor for Arbitrary Two-Hand ReconstructionPoster49 citations
- Adjustment and Alignment for Unbiased Open Set Domain AdaptationPoster49 citations
- An In-Depth Exploration of Person Re-Identification and Gait Recognition in Cloth-Changing ConditionsPoster49 citations
- Block Selection Method for Using Feature Norm in Out-of-Distribution DetectionPoster49 citations
- Castling-ViT: Compressing Self-Attention via Switching Towards Linear-Angular Attention at Vision Transformer InferencePoster49 citations
- DBARF: Deep Bundle-Adjusting Generalizable Neural Radiance FieldsPoster49 citations
- Deep Graph ReprogrammingHighlight49 citations
- Devil's on the Edges: Selective Quad Attention for Scene Graph GenerationPoster49 citations
- Dual-Path Adaptation From Image to Video TransformersPoster49 citations
- Fast Point Cloud Generation With Straight FlowsPoster49 citations
- Fine-Grained Classification With Noisy LabelsPoster49 citations
- Global-to-Local Modeling for Video-Based 3D Human Pose and Shape EstimationPoster49 citations
- KERM: Knowledge Enhanced Reasoning for Vision-and-Language NavigationPoster49 citations
- Learning Sample Relationship for Exposure CorrectionPoster49 citations
- Look Around for Anomalies: Weakly-Supervised Anomaly Detection via Context-Motion Relational LearningPoster49 citations
- Perception-Oriented Single Image Super-Resolution Using Optimal Objective EstimationPoster49 citations
- Towards Better Gradient Consistency for Neural Signed Distance Functions via Level Set AlignmentPoster49 citations
- Uncurated Image-Text Datasets: Shedding Light on Demographic BiasHighlight49 citations
- 3DAvatarGAN: Bridging Domains for Personalized Editable AvatarsPoster48 citations
- A Data-Based Perspective on Transfer LearningPoster48 citations
- Backdoor Defense via Deconfounded Representation LearningPoster48 citations
- Boosting Accuracy and Robustness of Student Models via Adaptive Adversarial DistillationPoster48 citations
- Cascaded Local Implicit Transformer for Arbitrary-Scale Super-ResolutionPoster48 citations
- DIP: Dual Incongruity Perceiving Network for Sarcasm DetectionPoster48 citations
- ERM-KTP: Knowledge-Level Machine Unlearning via Knowledge TransferPoster48 citations
- GeoMAE: Masked Geometric Target Prediction for Self-Supervised Point Cloud Pre-TrainingPoster48 citations
- Highly Confident Local Structure Based Consensus Graph Learning for Incomplete Multi-View ClusteringPoster48 citations
- Learning Attention As Disentangler for Compositional Zero-Shot LearningPoster48 citations
- Open-World Multi-Task Control Through Goal-Aware Representation Learning and Adaptive Horizon PredictionPoster48 citations
- PET-NeuS: Positional Encoding Tri-Planes for Neural SurfacesPoster48 citations
- RIATIG: Reliable and Imperceptible Adversarial Text-to-Image Generation With Natural PromptsPoster48 citations
- Revisiting Multimodal Representation in Contrastive Learning: From Patch and Token Embeddings to Finite Discrete TokensPoster48 citations
- SLOPER4D: A Scene-Aware Dataset for Global 4D Human Pose Estimation in Urban EnvironmentsPoster48 citations
- Shape-Aware Text-Driven Layered Video EditingPoster48 citations
- Test of Time: Instilling Video-Language Models With a Sense of TimePoster48 citations
- Towards Realistic Long-Tailed Semi-Supervised Learning: Consistency Is All You NeedPoster48 citations
- What Can Human Sketches Do for Object Detection?Poster48 citations
- 3D-Aware Object Goal Navigation via Simultaneous Exploration and IdentificationPoster47 citations
- All-in-One Image Restoration for Unknown Degradations Using Adaptive Discriminative Filters for Specific DegradationsPoster47 citations
- CAMS: CAnonicalized Manipulation Spaces for Category-Level Functional Hand-Object Manipulation SynthesisPoster47 citations
- CLIPPING: Distilling CLIP-Based Models With a Student Base for Video-Language RetrievalPoster47 citations
- DARE-GRAM: Unsupervised Domain Adaptation Regression by Aligning Inverse Gram MatricesPoster47 citations
- Deep Hashing With Minimal-Distance-Separated Hash CentersPoster47 citations
- Distilling Cross-Temporal Contexts for Continuous Sign Language RecognitionPoster47 citations
- FFHQ-UV: Normalized Facial UV-Texture Dataset for 3D Face ReconstructionPoster47 citations
- Hand Avatar: Free-Pose Hand Animation and Rendering From Monocular VideoPoster47 citations
- HumanBench: Towards General Human-Centric Perception With Projector Assisted PretrainingPoster47 citations
- NeRF-Supervised Deep StereoPoster47 citations
- PosterLayout: A New Benchmark and Approach for Content-Aware Visual-Textual Presentation LayoutPoster47 citations
- Procedure-Aware Pretraining for Instructional Video UnderstandingPoster47 citations
- STAR Loss: Reducing Semantic Ambiguity in Facial Landmark DetectionPoster47 citations
- TinyMIM: An Empirical Study of Distilling MIM Pre-Trained ModelsPoster47 citations
- Towards Transferable Targeted Adversarial ExamplesPoster47 citations
- Uncertainty-Aware Vision-Based Metric Cross-View GeolocalizationPoster47 citations
- A Light Weight Model for Active Speaker DetectionPoster46 citations
- ALOFT: A Lightweight MLP-Like Architecture With Dynamic Low-Frequency Transform for Domain GeneralizationPoster46 citations
- Beyond Attentive Tokens: Incorporating Token Importance and Diversity for Efficient Vision TransformersPoster46 citations
- Controllable Mesh Generation Through Sparse Latent Point Diffusion ModelsPoster46 citations
- Data-Free Knowledge Distillation via Feature Exchange and Activation Region ConstraintPoster46 citations
- EVAL: Explainable Video Anomaly LocalizationPoster46 citations
- GradMA: A Gradient-Memory-Based Accelerated Federated Learning With Alleviated Catastrophic ForgettingHighlight46 citations
- High-Fidelity Generalized Emotional Talking Face Generation With Multi-Modal Emotion Space LearningPoster46 citations
- Less Is More: Reducing Task and Model Complexity for 3D Point Cloud Semantic SegmentationPoster46 citations
- Masked Motion Encoding for Self-Supervised Video Representation LearningPoster46 citations
- Multi-Modal Gait Recognition via Effective Spatial-Temporal Feature FusionPoster46 citations
- Neural Preset for Color Style TransferPoster46 citations
- On the Benefits of 3D Pose and Tracking for Human Action RecognitionPoster46 citations
- Primitive Generation and Semantic-Related Alignment for Universal Zero-Shot SegmentationPoster46 citations
- Tell Me What Happened: Unifying Text-Guided Video Completion via Multimodal Masked Video GenerationPoster46 citations
- Towards Effective Adversarial Textured 3D Meshes on Physical Face RecognitionHighlight46 citations
- UV Volumes for Real-Time Rendering of Editable Free-View Human PerformancePoster46 citations
- Visibility Aware Human-Object Interaction Tracking From Single RGB CameraPoster46 citations
- 3D GAN Inversion With Facial Symmetry PriorPoster45 citations
- Conditional Generation of Audio From Video via Foley AnalogiesPoster45 citations
- Decompose, Adjust, Compose: Effective Normalization by Playing With Frequency for Domain GeneralizationPoster45 citations
- Feature Representation Learning With Adaptive Displacement Generation and Transformer Fusion for Micro-Expression RecognitionPoster45 citations
- Generating Features With Increased Crop-Related Diversity for Few-Shot Object DetectionPoster45 citations
- Hidden Gems: 4D Radar Scene Flow Learning Using Cross-Modal SupervisionHighlight45 citations
- Masked Scene Contrast: A Scalable Framework for Unsupervised 3D Representation LearningPoster45 citations
- Scalable, Detailed and Mask-Free Universal Photometric StereoHighlight45 citations
- Sound to Visual Scene Generation by Audio-to-Visual Latent AlignmentPoster45 citations
- SparsePose: Sparse-View Camera Pose Regression and RefinementPoster45 citations
- Towards Scalable Neural Representation for Diverse VideosPoster45 citations
- Unifying Layout Generation With a Decoupled Diffusion ModelPoster45 citations
- 3D Line Mapping RevisitedHighlight44 citations
- A Simple Framework for Text-Supervised Semantic SegmentationPoster44 citations
- Balanced Product of Calibrated Experts for Long-Tailed RecognitionPoster44 citations
- DeepMAD: Mathematical Architecture Design for Deep Convolutional Neural NetworkPoster44 citations
- Density-Insensitive Unsupervised Domain Adaption on 3D Object DetectionPoster44 citations
- Efficient Hierarchical Entropy Model for Learned Point Cloud CompressionPoster44 citations
- Frame-Event Alignment and Fusion Network for High Frame Rate TrackingPoster44 citations
- Improving Zero-Shot Generalization and Robustness of Multi-Modal ModelsPoster44 citations
- LANA: A Language-Capable Navigator for Instruction Following and GenerationPoster44 citations
- LINe: Out-of-Distribution Detection by Leveraging Important NeuronsPoster44 citations
- LayoutFormer++: Conditional Graphic Layout Generation via Constraint Serialization and Decoding Space RestrictionPoster44 citations
- Learning Compact Representations for LiDAR Completion and GenerationPoster44 citations
- Long-Tailed Visual Recognition via Self-Heterogeneous Integration With Knowledge ExcavationPoster44 citations
- Multiple Instance Learning via Iterative Self-Paced Supervised Contrastive LearningPoster44 citations
- PlaneDepth: Self-Supervised Depth Estimation via Orthogonal PlanesPoster44 citations
- QPGesture: Quantization-Based and Phase-Guided Motion Matching for Natural Speech-Driven Gesture GenerationHighlight44 citations
- Rethinking Optical Flow From Geometric Matching Consistent PerspectivePoster44 citations
- Sibling-Attack: Rethinking Transferable Adversarial Attacks Against Face RecognitionPoster44 citations
- Sparsely Annotated Semantic Segmentation With Adaptive Gaussian MixturesPoster44 citations
- Unified Pose Sequence ModelingPoster44 citations
- 3D-Aware Conditional Image SynthesisPoster43 citations
- Breaking the "Object" in Video Object SegmentationPoster43 citations
- Burstormer: Burst Image Restoration and Enhancement TransformerPoster43 citations
- Class Relationship Embedded Learning for Source-Free Unsupervised Domain AdaptationPoster43 citations
- DATID-3D: Diversity-Preserved Domain Adaptation Using Text-to-Image Diffusion for 3D Generative ModelPoster43 citations
- DINER: Disorder-Invariant Implicit Neural RepresentationHighlight43 citations
- Detecting Backdoors During the Inference Stage Based on Corruption Robustness ConsistencyPoster43 citations
- Doubly Right Object Recognition: A Why Prompt for Visual RationalesPoster43 citations
- FAME-ViL: Multi-Tasking Vision-Language Model for Heterogeneous Fashion TasksHighlight43 citations
- Flow Supervision for Deformable NeRFHighlight43 citations
- Geometric Visual Similarity Learning in 3D Medical Image Self-Supervised Pre-TrainingPoster43 citations
- Hierarchical Temporal Transformer for 3D Hand Pose Estimation and Action Recognition From Egocentric RGB VideosPoster43 citations
- Improving Graph Representation for Point Cloud Segmentation via Attentive FilteringPoster43 citations
- Interactive Segmentation As Gaussion Process ClassificationHighlight43 citations
- Large-Capacity and Flexible Video Steganography via Invertible Neural NetworkPoster43 citations
- Learning Locally Editable Virtual HumansPoster43 citations
- MixTeacher: Mining Promising Labels With Mixed Scale Teacher for Semi-Supervised Object DetectionPoster43 citations
- Multivariate, Multi-Frequency and Multimodal: Rethinking Graph Neural Networks for Emotion Recognition in ConversationPoster43 citations
- PCT-Net: Full Resolution Image Harmonization Using Pixel-Wise Color TransformationsPoster43 citations
- SCOOP: Self-Supervised Correspondence and Optimization-Based Scene FlowPoster43 citations
- SlowLiDAR: Increasing the Latency of LiDAR-Based Detection Using Adversarial ExamplesPoster43 citations
- Towards Accurate Image Coding: Improved Autoregressive Image Generation With Dynamic Vector QuantizationHighlight43 citations
- You Are Catching My Attention: Are Vision Transformers Bad Learners Under Backdoor Attacks?Poster43 citations
- Active Exploration of Multimodal Complementarity for Few-Shot Action RecognitionPoster42 citations
- AligNeRF: High-Fidelity Neural Radiance Fields via Alignment-Aware TrainingPoster42 citations
- Being Comes From Not-Being: Open-Vocabulary Text-to-Motion Generation With Wordless TrainingHighlight42 citations
- Boosting Video Object Segmentation via Space-Time Correspondence LearningPoster42 citations
- CXTrack: Improving 3D Point Cloud Tracking With Contextual InformationPoster42 citations
- Can't Steal? Cont-Steal! Contrastive Stealing Attacks Against Image EncodersPoster42 citations
- Don't Lie to Me! Robust and Efficient Explainability With Verified Perturbation AnalysisPoster42 citations
- FLEX: Full-Body Grasping Without Full-Body GraspsPoster42 citations
- Gazeformer: Scalable, Effective and Fast Prediction of Goal-Directed Human AttentionPoster42 citations
- Generating Anomalies for Video Anomaly Detection With Prompt-Based Feature MappingPoster42 citations
- Hunting Sparsity: Density-Guided Contrastive Learning for Semi-Supervised Semantic SegmentationPoster42 citations
- Learning To Generate Language-Supervised and Open-Vocabulary Scene Graph Using Pre-Trained Visual-Semantic SpacePoster42 citations
- MoStGAN-V: Video Generation With Temporal Motion StylesPoster42 citations
- Multi-View Adversarial Discriminator: Mine the Non-Causal Factors for Object Detection in Unseen DomainsHighlight42 citations
- OSRT: Omnidirectional Image Super-Resolution With Distortion-Aware TransformerPoster42 citations
- Object Pose Estimation With Statistical Guarantees: Conformal Keypoint Detection and Geometric Uncertainty PropagationHighlight42 citations
- On the Effectiveness of Partial Variance Reduction in Federated Learning With Heterogeneous DataHighlight42 citations
- PATS: Patch Area Transportation With Subdivision for Local Feature MatchingPoster42 citations
- PivoTAL: Prior-Driven Supervision for Weakly-Supervised Temporal Action LocalizationPoster42 citations
- Reinforcement Learning-Based Black-Box Model Inversion AttacksPoster42 citations
- ScanDMM: A Deep Markov Model of Scanpath Prediction for 360deg ImagesPoster42 citations
- Skinned Motion Retargeting With Residual Perception of Motion Semantics & GeometryPoster42 citations
- The Enemy of My Enemy Is My Friend: Exploring Inverse Adversaries for Improving Adversarial TrainingPoster42 citations
- Towards Compositional Adversarial Robustness: Generalizing Adversarial Training to Composite Semantic PerturbationsPoster42 citations
- COT: Unsupervised Domain Adaptation With Clustering and Optimal TransportPoster41 citations
- Disentangling Writer and Character Styles for Handwriting GenerationPoster41 citations
- FREDOM: Fairness Domain Adaptation Approach to Semantic Scene UnderstandingPoster41 citations
- HGFormer: Hierarchical Grouping Transformer for Domain Generalized Semantic SegmentationPoster41 citations
- Mind the Label Shift of Augmentation-Based Graph OOD GeneralizationPoster41 citations
- Modeling Inter-Class and Intra-Class Constraints in Novel Class DiscoveryPoster41 citations
- Reconstructing Animatable Categories From VideosPoster41 citations
- Sampling Is Matter: Point-Guided 3D Human Mesh ReconstructionPoster41 citations
- TIPI: Test Time Adaptation With Transformation InvariancePoster41 citations
- Teaching Matters: Investigating the Role of Supervision in Vision TransformersPoster41 citations
- Watch or Listen: Robust Audio-Visual Speech Recognition With Visual Corruption Modeling and Reliability ScoringPoster41 citations
- A2J-Transformer: Anchor-to-Joint Transformer Network for 3D Interacting Hand Pose Estimation From a Single RGB ImagePoster40 citations
- Active Finetuning: Exploiting Annotation Budget in the Pretraining-Finetuning ParadigmPoster40 citations
- Adaptive Assignment for Geometry Aware Local Feature MatchingPoster40 citations
- Adaptive Patch Deformation for Textureless-Resilient Multi-View StereoPoster40 citations
- CiCo: Domain-Aware Sign Language Retrieval via Cross-Lingual Contrastive LearningPoster40 citations
- Connecting the Dots: Floorplan Reconstruction Using Two-Level QueriesPoster40 citations
- DNeRV: Modeling Inherent Dynamics via Difference Neural Representation for VideosPoster40 citations
- DynamicDet: A Unified Dynamic Architecture for Object DetectionPoster40 citations
- Egocentric Audio-Visual Object LocalizationPoster40 citations
- Exploring the Relationship Between Architectural Design and Adversarially Robust GeneralizationPoster40 citations
- Improving Table Structure Recognition With Visual-Alignment Sequential Coordinate ModelingPoster40 citations
- Learning the Distribution of Errors in Stereo Matching for Joint Disparity and Uncertainty EstimationPoster40 citations
- Local Implicit Normalizing Flow for Arbitrary-Scale Image Super-ResolutionPoster40 citations
- MAP: Multimodal Uncertainty-Aware Vision-Language Pre-Training ModelPoster40 citations
- NeuralEditor: Editing Neural Radiance Fields via Manipulating Point CloudsPoster40 citations
- OCTET: Object-Aware Counterfactual ExplanationsPoster40 citations
- Open Set Action Recognition via Multi-Label Evidential LearningPoster40 citations
- PartManip: Learning Cross-Category Generalizable Part Manipulation Policy From Point Cloud ObservationsPoster40 citations
- Position-Guided Text Prompt for Vision-Language Pre-TrainingPoster40 citations
- Progressive Random Convolutions for Single Domain GeneralizationPoster40 citations
- PyPose: A Library for Robot Learning With Physics-Based OptimizationPoster40 citations
- Re-Basin via Implicit Sinkhorn DifferentiationPoster40 citations
- RefSR-NeRF: Towards High Fidelity and Super Resolution View SynthesisPoster40 citations
- SFD2: Semantic-Guided Feature Detection and DescriptionPoster40 citations
- Style Projected Clustering for Domain Generalized Semantic SegmentationPoster40 citations
- TarViS: A Unified Approach for Target-Based Video SegmentationHighlight40 citations
- TexPose: Neural Texture Learning for Self-Supervised 6D Object Pose EstimationPoster40 citations
- Towards Generalisable Video Moment Retrieval: Visual-Dynamic Injection to Image-Text Pre-TrainingPoster40 citations
- Towards Unsupervised Object Detection From LiDAR Point CloudsPoster40 citations
- VLPD: Context-Aware Pedestrian Detection via Vision-Language Semantic Self-SupervisionPoster40 citations
- WINNER: Weakly-Supervised hIerarchical decompositioN and aligNment for Spatio-tEmporal Video gRoundingPoster40 citations
- A Unified HDR Imaging Method With Pixel and Patch LevelPoster39 citations
- Adaptive Zone-Aware Hierarchical Planner for Vision-Language NavigationPoster39 citations
- Blur Interpolation Transformer for Real-World Motion From BlurPoster39 citations
- CARTO: Category and Joint Agnostic Reconstruction of ARTiculated ObjectsPoster39 citations
- Distilling Self-Supervised Vision Transformers for Weakly-Supervised Few-Shot Classification & SegmentationPoster39 citations
- Generating Part-Aware Editable 3D Shapes Without 3D SupervisionPoster39 citations
- Hierarchical Prompt Learning for Multi-Task LearningPoster39 citations
- High-Fidelity Guided Image Synthesis With Latent Diffusion ModelsPoster39 citations
- Learning From Noisy Labels With Decoupled Meta Label PurifierPoster39 citations
- Learning Visual Representations via Language-Guided SamplingPoster39 citations
- MMANet: Margin-Aware Distillation and Modality-Aware Regularization for Incomplete Multimodal LearningPoster39 citations
- MagicNet: Semi-Supervised Multi-Organ Segmentation via Magic-Cube Partition and RecoveryPoster39 citations
- MixSim: A Hierarchical Framework for Mixed Reality Traffic SimulationPoster39 citations
- Music-Driven Group ChoreographyPoster39 citations
- NaQ: Leveraging Narrations As Queries To Supervise Episodic MemoryPoster39 citations
- NeuralDome: A Neural Modeling Pipeline on Multi-View Human-Object InteractionsPoster39 citations
- Open-Vocabulary Attribute DetectionPoster39 citations
- PointConvFormer: Revenge of the Point-Based ConvolutionPoster39 citations
- ReLight My NeRF: A Dataset for Novel View Synthesis and Relighting of Real World ObjectsHighlight39 citations
- ScaleKD: Distilling Scale-Aware Knowledge in Small Object DetectorPoster39 citations
- Self-Supervised 3D Scene Flow Estimation Guided by SuperpointsPoster39 citations
- Self-Supervised Geometry-Aware Encoder for Style-Based 3D GAN InversionPoster39 citations
- SkyEye: Self-Supervised Bird's-Eye-View Semantic Mapping Using Monocular Frontal View ImagesPoster39 citations
- Structured 3D Features for Reconstructing Controllable AvatarsPoster39 citations
- SurfelNeRF: Neural Surfel Radiance Fields for Online Photorealistic Reconstruction of Indoor ScenesPoster39 citations
- TTA-COPE: Test-Time Adaptation for Category-Level Object Pose EstimationPoster39 citations
- Towards Efficient Use of Multi-Scale Features in Transformer-Based Object DetectorsPoster39 citations
- Unbiased Scene Graph Generation in VideosPoster39 citations
- VL-SAT: Visual-Linguistic Semantics Assisted Training for 3D Semantic Scene Graph Prediction in Point CloudHighlight39 citations
- Balancing Logit Variation for Long-Tailed Semantic SegmentationPoster38 citations
- Bi3D: Bi-Domain Active Learning for Cross-Domain 3D Object DetectionPoster38 citations
CVPR accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.