CVPR 2023 Accepted Papers
The full list of 2,307 papers accepted at CVPR 2023 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 2,085Highlight: 222
- Bias Mimicking: A Simple Sampling Approach for Bias MitigationPoster38 citations
- Boost Vision Transformer With GPU-Friendly Sparsity and QuantizationPoster38 citations
- Class-Conditional Sharpness-Aware Minimization for Deep Long-Tailed RecognitionPoster38 citations
- Discovering the Real Association: Multimodal Causal Reasoning in Video Question AnsweringPoster38 citations
- Elastic Aggregation for Federated OptimizationPoster38 citations
- Enhancing the Self-Universality for Transferable Targeted AttacksPoster38 citations
- Handwritten Text Generation From Visual ArchetypesPoster38 citations
- HumanGen: Generating Human Radiance Fields With Explicit PriorsPoster38 citations
- Layout-Based Causal Inference for Object NavigationPoster38 citations
- Learning To Fuse Monocular and Multi-View Cues for Multi-Frame Depth Estimation in Dynamic ScenesPoster38 citations
- M6Doc: A Large-Scale Multi-Format, Multi-Type, Multi-Layout, Multi-Language, Multi-Annotation Category Dataset for Modern Document Layout AnalysisPoster38 citations
- MV-JAR: Masked Voxel Jigsaw and Reconstruction for LiDAR-Based Self-Supervised Pre-TrainingPoster38 citations
- Multi-Mode Online Knowledge Distillation for Self-Supervised Visual Representation LearningPoster38 citations
- PLIKS: A Pseudo-Linear Inverse Kinematic Solver for 3D Human Body EstimationHighlight38 citations
- PMatch: Paired Masked Image Modeling for Dense Geometric MatchingPoster38 citations
- Prompt-Guided Zero-Shot Anomaly Action Recognition Using Pretrained Deep Skeleton FeaturesPoster38 citations
- RA-CLIP: Retrieval Augmented Contrastive Language-Image Pre-TrainingPoster38 citations
- Rethinking Feature-Based Knowledge Distillation for Face RecognitionPoster38 citations
- SelfME: Self-Supervised Motion Learning for Micro-Expression RecognitionPoster38 citations
- Top-Down Visual Attention From Analysis by SynthesisHighlight38 citations
- Trainable Projected Gradient Method for Robust Fine-TuningPoster38 citations
- Understanding Masked Autoencoders via Hierarchical Latent Variable ModelsHighlight38 citations
- VQACL: A Novel Visual Question Answering Continual Learning SettingPoster38 citations
- Video Dehazing via a Multi-Range Temporal Alignment Network With Physical PriorPoster38 citations
- A Strong Baseline for Generalized Few-Shot Semantic SegmentationPoster37 citations
- Camouflaged Instance Segmentation via Explicit De-CamouflagingHighlight37 citations
- Collecting Cross-Modal Presence-Absence Evidence for Weakly-Supervised Audio-Visual Event PerceptionPoster37 citations
- Deep Graph-Based Spatial Consistency for Robust Non-Rigid Point Cloud RegistrationPoster37 citations
- DynamicStereo: Consistent Dynamic Depth From Stereo VideosPoster37 citations
- Dynamically Instance-Guided Adaptation: A Backward-Free Approach for Test-Time Domain Adaptive Semantic SegmentationPoster37 citations
- Exploring Structured Semantic Prior for Multi Label Recognition With Incomplete LabelsPoster37 citations
- GradICON: Approximate Diffeomorphisms via Gradient Inverse ConsistencyPoster37 citations
- Improving Vision-and-Language Navigation by Generating Future-View Image SemanticsPoster37 citations
- IterativePFN: True Iterative Point Cloud FilteringPoster37 citations
- LOGO: A Long-Form Video Dataset for Group Action Quality AssessmentPoster37 citations
- Learning Multi-Modal Class-Specific Tokens for Weakly Supervised Dense Object LocalizationPoster37 citations
- Learning To Retain While Acquiring: Combating Distribution-Shift in Adversarial Data-Free Knowledge DistillationPoster37 citations
- Localized Semantic Feature Mixers for Efficient Pedestrian Detection in Autonomous DrivingPoster37 citations
- MobileVOS: Real-Time Video Object Segmentation Contrastive Learning Meets Knowledge DistillationPoster37 citations
- Multispectral Video Semantic Segmentation: A Benchmark Dataset and BaselinePoster37 citations
- NeFII: Inverse Rendering for Reflectance Decomposition With Near-Field Indirect IlluminationPoster37 citations
- Physical-World Optical Adversarial Attacks on 3D Face RecognitionPoster37 citations
- RIFormer: Keep Your Vision Backbone Effective but Removing Token MixerPoster37 citations
- STMixer: A One-Stage Sparse Action DetectorPoster37 citations
- Sample-Level Multi-View Graph ClusteringPoster37 citations
- SliceMatch: Geometry-Guided Aggregation for Cross-View Pose EstimationPoster37 citations
- TeSLA: Test-Time Self-Learning With Automatic Adversarial AugmentationPoster37 citations
- Uncovering the Missing Pattern: Unified Framework Towards Trajectory Imputation and PredictionPoster37 citations
- Adversarial Counterfactual Visual ExplanationsPoster36 citations
- Balanced Energy Regularization Loss for Out-of-Distribution DetectionPoster36 citations
- Bi-Level Meta-Learning for Few-Shot Domain GeneralizationPoster36 citations
- Black-Box Sparse Adversarial Attack via Multi-Objective OptimisationPoster36 citations
- Both Style and Distortion Matter: Dual-Path Unsupervised Domain Adaptation for Panoramic Semantic SegmentationPoster36 citations
- Bringing Inputs to Shared Domains for 3D Interacting Hands Recovery in the WildPoster36 citations
- DexArt: Benchmarking Generalizable Dexterous Manipulation With Articulated ObjectsPoster36 citations
- DiGA: Distil To Generalize and Then Adapt for Domain Adaptive Semantic SegmentationPoster36 citations
- DistilPose: Tokenized Pose Regression With Heatmap DistillationPoster36 citations
- DoNet: Deep De-Overlapping Network for Cytology Instance SegmentationPoster36 citations
- DrapeNet: Garment Generation and Self-Supervised DrapingPoster36 citations
- High-Fidelity and Freely Controllable Talking Head Video GenerationPoster36 citations
- JRDB-Pose: A Large-Scale Dataset for Multi-Person Pose Estimation and TrackingPoster36 citations
- LipFormer: High-Fidelity and Generalizable Talking Face Generation With a Pre-Learned Facial CodebookPoster36 citations
- Neural Fourier Filter BankPoster36 citations
- Novel-View Acoustic SynthesisPoster36 citations
- RGBD2: Generative Scene Synthesis via Incremental View Inpainting Using RGBD Diffusion ModelsPoster36 citations
- Robust Generalization Against Photon-Limited Corruptions via Worst-Case Sharpness MinimizationPoster36 citations
- SCADE: NeRFs from Space Carving With Ambiguity-Aware Depth EstimatesPoster36 citations
- Self-Guided Diffusion ModelsPoster36 citations
- Semi-Supervised Learning Made Simple With Self-Supervised ClusteringPoster36 citations
- Temporal Consistent 3D LiDAR Representation Learning for Semantic Perception in Autonomous DrivingPoster36 citations
- Unpaired Image-to-Image Translation With Shortest Path RegularizationPoster36 citations
- ALTO: Alternating Latent Topologies for Implicit 3D ReconstructionPoster35 citations
- BiCro: Noisy Correspondence Rectification for Multi-Modality Data via Bi-Directional Cross-Modal Similarity ConsistencyPoster35 citations
- Class Balanced Adaptive Pseudo Labeling for Federated Semi-Supervised LearningPoster35 citations
- CutMIB: Boosting Light Field Super-Resolution via Multi-View Image BlendingPoster35 citations
- EditableNeRF: Editing Topologically Varying Neural Radiance Fields by Key PointsPoster35 citations
- FJMP: Factorized Joint Multi-Agent Motion Prediction Over Learned Directed Acyclic Interaction GraphsPoster35 citations
- FitMe: Deep Photorealistic 3D Morphable Model AvatarsPoster35 citations
- GM-NeRF: Learning Generalizable Model-Based Neural Radiance Fields From Multi-View ImagesPoster35 citations
- H2ONet: Hand-Occlusion-and-Orientation-Aware Network for Real-Time 3D Hand Mesh ReconstructionPoster35 citations
- I2-SDF: Intrinsic Indoor Scene Reconstruction and Editing via Raytracing in Neural SDFsPoster35 citations
- Iterative Proposal Refinement for Weakly-Supervised Video GroundingPoster35 citations
- Learning Event Guided High Dynamic Range Video ReconstructionPoster35 citations
- NIRVANA: Neural Implicit Representations of Videos With Adaptive Networks and Autoregressive Patch-Wise ModelingPoster35 citations
- Neural Koopman Pooling: Control-Inspired Temporal Dynamics Encoding for Skeleton-Based Action RecognitionPoster35 citations
- PDPP:Projected Diffusion for Procedure Planning in Instructional VideosHighlight35 citations
- PSVT: End-to-End Multi-Person 3D Pose and Shape Estimation With Progressive Video TransformersPoster35 citations
- RankMix: Data Augmentation for Weakly Supervised Learning of Classifying Whole Slide Images With Diverse Sizes and Imbalanced CategoriesPoster35 citations
- ResFormer: Scaling ViTs With Multi-Resolution TrainingPoster35 citations
- Self-Supervised Image-to-Point Distillation via Semantically Tolerant Contrastive LossPoster35 citations
- Shape, Pose, and Appearance From a Single Image via Bootstrapped Radiance Field InversionPoster35 citations
- Towards Effective Visual Representations for Partial-Label LearningPoster35 citations
- Video Test-Time Adaptation for Action RecognitionPoster35 citations
- X3KD: Knowledge Distillation Across Modalities, Tasks and Stages for Multi-Camera 3D Object DetectionPoster35 citations
- Bi-LRFusion: Bi-Directional LiDAR-Radar Fusion for 3D Dynamic Object DetectionPoster34 citations
- BiFormer: Learning Bilateral Motion Estimation via Bilateral Transformer for 4K Video Frame InterpolationPoster34 citations
- CIGAR: Cross-Modality Graph Reasoning for Domain Adaptive Object DetectionPoster34 citations
- Detecting Human-Object Contact in ImagesPoster34 citations
- Diffusion Video Autoencoders: Toward Temporally Consistent Face Video Editing via Disentangled Video EncodingPoster34 citations
- Dual-Bridging With Adversarial Noise Generation for Domain Adaptive rPPG EstimationPoster34 citations
- FEND: A Future Enhanced Distribution-Aware Contrastive Learning Framework for Long-Tail Trajectory PredictionPoster34 citations
- HAAV: Hierarchical Aggregation of Augmented Views for Image CaptioningPoster34 citations
- Incrementer: Transformer for Class-Incremental Semantic Segmentation With Knowledge Distillation Focusing on Old ClassHighlight34 citations
- Indiscernible Object Counting in Underwater ScenesPoster34 citations
- Learning Procedure-Aware Video Representation From Instructional Videos and Their NarrationsPoster34 citations
- Making Vision Transformers Efficient From a Token Sparsification ViewPoster34 citations
- Meta Compositional Referring Expression SegmentationPoster34 citations
- MetaCLUE: Towards Comprehensive Visual Metaphors ResearchPoster34 citations
- Nighttime Smartphone Reflective Flare Removal Using Optical Center Symmetry PriorHighlight34 citations
- Orthogonal Annotation Benefits Barely-Supervised Medical Image SegmentationPoster34 citations
- Referring Image MattingPoster34 citations
- Robust Unsupervised StyleGAN Image RestorationPoster34 citations
- Single Domain Generalization for LiDAR Semantic SegmentationPoster34 citations
- Sliced Optimal Partial TransportPoster34 citations
- Stitchable Neural NetworksHighlight34 citations
- The Differentiable Lens: Compound Lens Search Over Glass Surfaces and Materials for Object DetectionPoster34 citations
- Transformer Scale Gate for Semantic SegmentationPoster34 citations
- Unsupervised Inference of Signed Distance Functions From Single Sparse Point Clouds Without Learning PriorsPoster34 citations
- Zero-Shot Generative Model Adaptation via Image-Specific Prompt LearningPoster34 citations
- itKD: Interchange Transfer-Based Knowledge Distillation for 3D Object DetectionPoster34 citations
- A Large-Scale Robustness Analysis of Video Action Recognition ModelsPoster33 citations
- CLIP2Protect: Protecting Facial Privacy Using Text-Guided Makeup via Adversarial Latent SearchPoster33 citations
- Coaching a Teachable StudentHighlight33 citations
- Discriminative Co-Saliency and Background Mining Transformer for Co-Salient Object DetectionPoster33 citations
- Event-Based Video Frame Interpolation With Cross-Modal Asymmetric Bidirectional Motion FieldsHighlight33 citations
- Feature Separation and Recalibration for Adversarial RobustnessHighlight33 citations
- GeneCIS: A Benchmark for General Conditional Image SimilarityHighlight33 citations
- Generalized Deep 3D Shape Prior via Part-Discretized Diffusion ProcessPoster33 citations
- NeRFLix: High-Quality Neural View Synthesis by Learning a Degradation-Driven Inter-Viewpoint MiXerPoster33 citations
- Noisy Correspondence Learning With Meta Similarity CorrectionPoster33 citations
- Regularizing Second-Order Influences for Continual LearningPoster33 citations
- Robust Multiview Point Cloud Registration With Reliable Pose Graph Initialization and History ReweightingPoster33 citations
- Self-Supervised Implicit Glyph Attention for Text RecognitionPoster33 citations
- Stare at What You See: Masked Image Modeling Without ReconstructionPoster33 citations
- Structured Sparsity Learning for Efficient Video Super-ResolutionPoster33 citations
- TAPS3D: Text-Guided 3D Textured Shape Generation From Pseudo SupervisionPoster33 citations
- Text-Visual Prompting for Efficient 2D Temporal Video GroundingPoster33 citations
- Towards Better Stability and Adaptability: Improve Online Self-Training for Model Adaptation in Semantic SegmentationHighlight33 citations
- Towards Modality-Agnostic Person Re-Identification With Descriptive QueryPoster33 citations
- Ultra-High Resolution Segmentation With Ultra-Rich Context: A Novel BenchmarkPoster33 citations
- Unsupervised Sampling Promoting for Stochastic Human Trajectory PredictionPoster33 citations
- ConQueR: Query Contrast Voxel-DETR for 3D Object DetectionHighlight32 citations
- EfficientSCI: Densely Connected Network With Space-Time Factorization for Large-Scale Video Snapshot Compressive ImagingPoster32 citations
- HRDFuse: Monocular 360deg Depth Estimation by Collaboratively Learning Holistic-With-Regional Depth DistributionsPoster32 citations
- Hierarchical Supervision and Shuffle Data Augmentation for 3D Semi-Supervised Object DetectionPoster32 citations
- High-Fidelity 3D Face Generation From Natural Language DescriptionsPoster32 citations
- Jedi: Entropy-Based Localization and Removal of Adversarial PatchesPoster32 citations
- Learning To Detect and Segment for Open Vocabulary Object DetectionPoster32 citations
- Multilateral Semantic Relations Modeling for Image Text RetrievalPoster32 citations
- Physically Realizable Natural-Looking Clothing Textures Evade Person Detectors via 3D ModelingPoster32 citations
- RUST: Latent Neural Scene Representations From Unposed ImageryHighlight32 citations
- Re2TAL: Rewiring Pretrained Video Backbones for Reversible Temporal Action LocalizationPoster32 citations
- SceneTrilogy: On Human Scene-Sketch and Its Complementarity With Photo and TextPoster32 citations
- SeSDF: Self-Evolved Signed Distance Field for Implicit 3D Clothed Human ReconstructionPoster32 citations
- SplineCam: Exact Visualization and Characterization of Deep Network Geometry and Decision BoundariesHighlight32 citations
- The Devil Is in the Points: Weakly Semi-Supervised Instance Segmentation via Point-Guided Mask RepresentationPoster32 citations
- Towards Trustable Skin Cancer Diagnosis via Rewriting Model's DecisionPoster32 citations
- Two-Way Multi-Label LossHighlight32 citations
- A New Path: Scaling Vision-and-Language Navigation With Synthetic Instructions and Imitation LearningPoster31 citations
- Are Deep Neural Networks SMARTer Than Second Graders?Poster31 citations
- Category Query Learning for Human-Object Interaction ClassificationPoster31 citations
- Defining and Quantifying the Emergence of Sparse Concepts in DNNsPoster31 citations
- DynaMask: Dynamic Mask Selection for Instance SegmentationPoster31 citations
- FLAG3D: A 3D Fitness Activity Dataset With Language InstructionPoster31 citations
- Graph Transformer GANs for Graph-Constrained House GenerationPoster31 citations
- HARP: Personalized Hand Reconstruction From a Monocular RGB VideoPoster31 citations
- HaLP: Hallucinating Latent Positives for Skeleton-Based Self-Supervised Learning of ActionsPoster31 citations
- Hierarchical Neural Memory Network for Low Latency Event ProcessingPoster31 citations
- Integrally Pre-Trained Transformer Pyramid NetworksPoster31 citations
- Joint HDR Denoising and Fusion: A Real-World Mobile HDR Image DatasetPoster31 citations
- OT-Filter: An Optimal Transport Filter for Learning With Noisy LabelsPoster31 citations
- Progressive Neighbor Consistency Mining for Correspondence PruningPoster31 citations
- Ref-NPR: Reference-Based Non-Photorealistic Radiance Fields for Controllable Scene StylizationPoster31 citations
- Revisiting Self-Similarity: Structural Embedding for Image RetrievalPoster31 citations
- TBP-Former: Learning Temporal Bird's-Eye-View Pyramid for Joint Perception and Prediction in Vision-Centric Autonomous DrivingPoster31 citations
- The ObjectFolder Benchmark: Multisensory Learning With Neural and Real ObjectsPoster31 citations
- Towards Robust Tampered Text Detection in Document Image: New Dataset and New SolutionPoster31 citations
- Weakly Supervised Temporal Sentence Grounding With Uncertainty-Guided Self-TrainingPoster31 citations
- ActMAD: Activation Matching To Align Distributions for Test-Time-TrainingPoster30 citations
- AeDet: Azimuth-Invariant Multi-View 3D Object DetectionPoster30 citations
- Affordance Grounding From Demonstration Video To Target ImagePoster30 citations
- BEV@DC: Bird's-Eye View Assisted Training for Depth CompletionPoster30 citations
- Backdoor Cleansing With Unlabeled DataPoster30 citations
- BiasAdv: Bias-Adversarial Augmentation for Model DebiasingPoster30 citations
- Boosting Weakly-Supervised Temporal Action Localization With Text InformationPoster30 citations
- CIMI4D: A Large Multimodal Climbing Motion Dataset Under Human-Scene InteractionsPoster30 citations
- CUDA: Convolution-Based Unlearnable DatasetsPoster30 citations
- Confidence-Aware Personalized Federated Learning via Variational Expectation MaximizationPoster30 citations
- Context-Aware Pretraining for Efficient Blind Image DecompositionPoster30 citations
- Decoupling-and-Aggregating for Image Exposure CorrectionPoster30 citations
- Dense-Localizing Audio-Visual Events in Untrimmed Videos: A Large-Scale Benchmark and BaselinePoster30 citations
- DynaFed: Tackling Client Data Heterogeneity With Global DynamicsPoster30 citations
- Exploring and Exploiting Uncertainty for Incomplete Multi-View ClassificationPoster30 citations
- Fine-Grained Audible Video DescriptionPoster30 citations
- Fuzzy Positive Learning for Semi-Supervised Semantic SegmentationPoster30 citations
- Generalizable Implicit Neural Representations via Instance Pattern ComposersHighlight30 citations
- Hi-LASSIE: High-Fidelity Articulated Shape and Skeleton Discovery From Sparse Image EnsemblePoster30 citations
- IS-GGT: Iterative Scene Graph Generation With Generative TransformersPoster30 citations
- Implicit Occupancy Flow Fields for Perception and Prediction in Self-DrivingHighlight30 citations
- Improving Visual Grounding by Encouraging Consistent Gradient-Based ExplanationsPoster30 citations
- LVQAC: Lattice Vector Quantization Coupled With Spatially Adaptive Companding for Efficient Learned Image CompressionPoster30 citations
- Language-Guided Music Recommendation for Video via Prompt AnalogiesHighlight30 citations
- Learning Generative Structure Prior for Blind Text Image Super-ResolutionPoster30 citations
- Learning To Dub Movies via Hierarchical Prosody ModelsPoster30 citations
- Learning To Generate Image Embeddings With User-Level Differential PrivacyPoster30 citations
- Local Implicit Ray Function for Generalizable Radiance Field RepresentationPoster30 citations
- MMG-Ego4D: Multimodal Generalization in Egocentric Action RecognitionPoster30 citations
- Meta-Learning With a Geometry-Adaptive PreconditionerPoster30 citations
- NeRFInvertor: High Fidelity NeRF-GAN Inversion for Single-Shot Real Image AnimationPoster30 citations
- Neumann Network With Recursive Kernels for Single Image Defocus DeblurringPoster30 citations
- On Calibrating Semantic Segmentation Models: Analyses and an AlgorithmPoster30 citations
- Persistent Nature: A Generative Model of Unbounded 3D WorldsPoster30 citations
- Physics-Driven Diffusion Models for Impact Sound Synthesis From VideosPoster30 citations
- Q-DETR: An Efficient Low-Bit Quantized Detection TransformerHighlight30 citations
- Recognizability Embedding Enhancement for Very Low-Resolution Face Recognition and Quality EstimationPoster30 citations
- Recognizing Rigid Patterns of Unlabeled Point Clouds by Complete and Continuous Isometry Invariants With No False Negatives and No False PositivesPoster30 citations
- Starting From Non-Parametric Networks for 3D Point Cloud AnalysisPoster30 citations
- StyLess: Boosting the Transferability of Adversarial ExamplesPoster30 citations
- Towards Unified Scene Text Spotting Based on Sequence GenerationPoster30 citations
- Annealing-Based Label-Transfer Learning for Open World Object DetectionPoster29 citations
- BITE: Beyond Priors for Improved Three-D Dog Pose EstimationPoster29 citations
- Deformable Mesh Transformer for 3D Human Mesh RecoveryPoster29 citations
- Delving StyleGAN Inversion for Image Editing: A Foundation Latent Space ViewpointPoster29 citations
- Distilling Vision-Language Pre-Training To Collaborate With Weakly-Supervised Temporal Action LocalizationPoster29 citations
- DualRefine: Self-Supervised Depth and Pose Estimation Through Iterative Epipolar Sampling and Refinement Toward EquilibriumPoster29 citations
- DyLiN: Making Light Field Networks DynamicPoster29 citations
- Generating Aligned Pseudo-Supervision From Non-Aligned Data for Image Restoration in Under-Display CameraPoster29 citations
- HandNeRF: Neural Radiance Fields for Animatable Interacting HandsPoster29 citations
- Hubs and Hyperspheres: Reducing Hubness and Improving Transductive Few-Shot Learning With Hyperspherical EmbeddingsPoster29 citations
- KD-DLGAN: Data Limited Image Generation via Knowledge DistillationPoster29 citations
- LSTFE-Net:Long Short-Term Feature Enhancement Network for Video Small Object DetectionPoster29 citations
- Learning Distortion Invariant Representation for Image Restoration From a Causality PerspectivePoster29 citations
- Learning and Aggregating Lane Graphs for Urban Automated DrivingPoster29 citations
- Local 3D Editing via 3D Distillation of CLIP KnowledgePoster29 citations
- Masked Representation Learning for Domain Generalized Stereo MatchingPoster29 citations
- Modality-Agnostic Debiasing for Single Domain GeneralizationPoster29 citations
- MonoATT: Online Monocular 3D Object Detection With Adaptive Token TransformerPoster29 citations
- NLOST: Non-Line-of-Sight Imaging With TransformerPoster29 citations
- NUWA-LIP: Language-Guided Image Inpainting With Defect-Free VQGANPoster29 citations
- Neuro-Modulated Hebbian Learning for Fully Test-Time AdaptationPoster29 citations
- OmniAvatar: Geometry-Guided Controllable 3D Head SynthesisPoster29 citations
- ProtoCon: Pseudo-Label Refinement via Online Clustering and Prototypical Consistency for Efficient Semi-Supervised LearningHighlight29 citations
- Reliability in Semantic Segmentation: Are We on the Right Track?Poster29 citations
- Rethinking Gradient Projection Continual Learning: Stability / Plasticity Feature Space DecouplingPoster29 citations
- SCOTCH and SODA: A Transformer Video Shadow Detection FrameworkPoster29 citations
- Semantic-Promoted Debiasing and Background Disambiguation for Zero-Shot Instance SegmentationPoster29 citations
- StepFormer: Self-Supervised Step Discovery and Localization in Instructional VideosPoster29 citations
- SunStage: Portrait Reconstruction and Relighting Using the Sun as a Light StagePoster29 citations
- Token Turing MachinesPoster29 citations
- Towards Fast Adaptation of Pretrained Contrastive Models for Multi-Channel Video-Language RetrievalPoster29 citations
- Two-Stream Networks for Weakly-Supervised Temporal Action Localization With Semantic-Aware MechanismsPoster29 citations
- Why Is the Winner the Best?Poster29 citations
- 3D-POP - An Automated Annotation Approach to Facilitate Markerless 2D-3D Tracking of Freely Moving Birds With Marker-Based Motion CapturePoster28 citations
- A-La-Carte Prompt Tuning (APT): Combining Distinct Data via Composable PromptingPoster28 citations
- BEV-SAN: Accurate BEV 3D Object Detection via Slice Attention NetworksPoster28 citations
- Blind Video Deflickering by Neural Filtering With a Flawed AtlasPoster28 citations
- CloSET: Modeling Clothed Humans on Continuous Surface With Explicit Template DecompositionPoster28 citations
- ConStruct-VL: Data-Free Continual Structured VL Concepts LearningPoster28 citations
- Dealing With Cross-Task Class Discrimination in Online Continual LearningPoster28 citations
- Devil Is in the Queries: Advancing Mask Transformers for Real-World Medical Image Segmentation and Out-of-Distribution LocalizationHighlight28 citations
- DivClust: Controlling Diversity in Deep ClusteringPoster28 citations
- FrustumFormer: Adaptive Instance-Aware Resampling for Multi-View 3D DetectionPoster28 citations
- Hard Sample Matters a Lot in Zero-Shot QuantizationPoster28 citations
- Human Pose Estimation in Extremely Low-Light ConditionsPoster28 citations
- L-CoIns: Language-Based Colorization With Instance AwarenessPoster28 citations
- Learning Dynamic Style Kernels for Artistic Style TransferPoster28 citations
- Learning Emotion Representations From Verbal and Nonverbal CommunicationPoster28 citations
- Learning Neural Duplex Radiance Fields for Real-Time View SynthesisPoster28 citations
- Learning Rotation-Equivariant Features for Visual CorrespondencePoster28 citations
- MaLP: Manipulation Localization Using a Proactive SchemePoster28 citations
- MaskSketch: Unpaired Structure-Guided Masked Image GenerationHighlight28 citations
- NIPQ: Noise Proxy-Based Integrated Pseudo-QuantizationPoster28 citations
- NerVE: Neural Volumetric Edges for Parametric Curve Extraction From Point CloudPoster28 citations
- Non-Contrastive Learning Meets Language-Image Pre-TrainingPoster28 citations
- Not All Image Regions Matter: Masked Vector Quantization for Autoregressive Image GenerationPoster28 citations
- PaCa-ViT: Learning Patch-to-Cluster Attention in Vision TransformersPoster28 citations
- Polynomial Implicit Neural Representations for Large Diverse DatasetsHighlight28 citations
- Pruning Parameterization With Bi-Level Optimization for Efficient Semantic Segmentation on the EdgePoster28 citations
- Realistic Saliency Guided Image EnhancementPoster28 citations
- Self-Supervised Learning for Multimodal Non-Rigid 3D Shape MatchingHighlight28 citations
- Shape-Constraint Recurrent Flow for 6D Object Pose EstimationPoster28 citations
- TimeBalance: Temporally-Invariant and Temporally-Distinctive Video Representations for Semi-Supervised Action RecognitionPoster28 citations
- Toward RAW Object Detection: A New Benchmark and a New ModelPoster28 citations
- Unknown Sniffer for Object Detection: Don't Turn a Blind Eye to Unknown ObjectsPoster28 citations
- Weakly Supervised Posture Mining for Fine-Grained ClassificationPoster28 citations
- 3D Cinemagraphy From a Single ImagePoster27 citations
- 3D Highlighter: Localizing Regions on 3D Shapes via Text DescriptionsHighlight27 citations
- Bi-Directional Distribution Alignment for Transductive Zero-Shot LearningPoster27 citations
- Bootstrap Your Own Prior: Towards Distribution-Agnostic Novel Class DiscoveryPoster27 citations
- Catch Missing Details: Image Reconstruction With Frequency Augmented Variational AutoencoderPoster27 citations
- Divide and Adapt: Active Domain Adaptation via Customized LearningHighlight27 citations
- E2PN: Efficient SE(3)-Equivariant Point NetworkPoster27 citations
- Event-Based Shape From PolarizationPoster27 citations
- Ham2Pose: Animating Sign Language Notation Into Pose SequencesPoster27 citations
- High-Fidelity Facial Avatar Reconstruction From Monocular Video With Generative PriorsPoster27 citations
- Improving Image Recognition by Retrieving From Web-Scale Image-Text DataPoster27 citations
- Learning Analytical Posterior Probability for Human Mesh RecoveryPoster27 citations
- MELTR: Meta Loss Transformer for Learning To Fine-Tune Video Foundation ModelsPoster27 citations
- Mask-Free Video Instance SegmentationPoster27 citations
- MethaneMapper: Spectral Absorption Aware Hyperspectral Transformer for Methane DetectionHighlight27 citations
- Object Pop-Up: Can We Infer 3D Objects and Their Poses From Human Interactions Alone?Poster27 citations
- Object-Goal Visual Navigation via Effective Exploration of Relations Among Historical Navigation StatesPoster27 citations
- One-to-Few Label Assignment for End-to-End Dense DetectionPoster27 citations
- PEFAT: Boosting Semi-Supervised Medical Image Classification via Pseudo-Loss Estimation and Feature Adversarial TrainingHighlight27 citations
- ProD: Prompting-To-Disentangle Domain Knowledge for Cross-Domain Few-Shot Image ClassificationPoster27 citations
- Proximal Splitting Adversarial Attack for Semantic SegmentationPoster27 citations
- Reliable and Interpretable Personalized Federated LearningPoster27 citations
- Semi-Supervised Parametric Real-World Image HarmonizationPoster27 citations
- Shortcomings of Top-Down Randomization-Based Sanity Checks for Evaluations of Deep Neural Network ExplanationsPoster27 citations
- Source-Free Adaptive Gaze Estimation by Uncertainty ReductionPoster27 citations
- SynthVSR: Scaling Up Visual Speech Recognition With Synthetic SupervisionPoster27 citations
- Transfer Knowledge From Head to Tail: Uncertainty Calibration Under Long-Tailed DistributionPoster27 citations
- Unified Mask Embedding and Correspondence Learning for Self-Supervised Video SegmentationPoster27 citations
- Unlearnable Clusters: Towards Label-Agnostic Unlearnable ExamplesPoster27 citations
- Vision Transformers Are Good Mask Auto-LabelersPoster27 citations
- Visual Atoms: Pre-Training Vision Transformers With Sinusoidal WavesPoster27 citations
- Where We Are and What We're Looking At: Query Based Worldwide Image Geo-Localization Using Hierarchies and ScenesPoster27 citations
- A New Benchmark: On the Utility of Synthetic Data With Blender for Bare Supervised Learning and Downstream Domain AdaptationPoster26 citations
- Balanced Spherical Grid for Egocentric View SynthesisPoster26 citations
- CoMFormer: Continual Learning in Semantic and Panoptic SegmentationPoster26 citations
- Connecting Vision and Language With Video Localized NarrativesHighlight26 citations
- Content-Aware Token Sharing for Efficient Semantic Segmentation With Vision TransformersPoster26 citations
- DINER: Depth-Aware Image-Based NEural Radiance FieldsPoster26 citations
- Detection Hub: Unifying Object Detection Datasets via Query Adaptation on Language EmbeddingPoster26 citations
- Domain Generalized Stereo Matching via Hierarchical Visual TransformationPoster26 citations
- Exploiting Unlabelled Photos for Stronger Fine-Grained SBIRPoster26 citations
- Exploring Motion Ambiguity and Alignment for High-Quality Video Frame InterpolationPoster26 citations
- FeatureBooster: Boosting Feature Descriptors With a Lightweight Neural NetworkPoster26 citations
- Focused and Collaborative Feedback Integration for Interactive Image SegmentationPoster26 citations
- Geometry and Uncertainty-Aware 3D Point Cloud Class-Incremental Semantic SegmentationPoster26 citations
- HairStep: Transfer Synthetic to Real Using Strand and Depth Maps for Single-View 3D Hair ModelingHighlight26 citations
- ImageNet-E: Benchmarking Neural Network Robustness via Attribute EditingPoster26 citations
- Latency Matters: Real-Time Action Forecasting TransformerHighlight26 citations
- Learning 3D Scene Priors With 2D SupervisionPoster26 citations
- MammalNet: A Large-Scale Video Benchmark for Mammal Recognition and Behavior UnderstandingPoster26 citations
- Meta-Tuning Loss Functions and Data Augmentation for Few-Shot Object DetectionPoster26 citations
- Modeling Video As Stochastic Processes for Fine-Grained Video Representation LearningHighlight26 citations
- Open-Category Human-Object Interaction Pre-Training via Language Modeling FrameworkPoster26 citations
- Probabilistic Debiasing of Scene GraphsPoster26 citations
- RONO: Robust Discriminative Learning With Noisy Labels for 2D-3D Cross-Modal RetrievalPoster26 citations
- Robust Model-Based Face Reconstruction Through Weakly-Supervised Outlier SegmentationPoster26 citations
- SIM: Semantic-Aware Instance Mask Generation for Box-Supervised Instance SegmentationPoster26 citations
- Single Image Depth Prediction Made Better: A Multivariate Gaussian TakePoster26 citations
- Spatio-Temporal Pixel-Level Contrastive Learning-Based Source-Free Domain Adaptation for Video Semantic SegmentationPoster26 citations
- Trajectory-Aware Body Interaction Transformer for Multi-Person Pose ForecastingPoster26 citations
- VNE: An Effective Method for Improving Deep Representation by Manipulating Eigenvalue DistributionPoster26 citations
- Viewpoint Equivariance for Multi-View 3D Object DetectionPoster26 citations
- Weakly Supervised Video Emotion Detection and Prediction via Cross-Modal Temporal Erasing NetworkPoster26 citations
- A Probabilistic Attention Model With Occlusion-Aware Texture Regression for 3D Hand Reconstruction From a Single RGB ImagePoster25 citations
- Adversarially Robust Neural Architecture Search for Graph Neural NetworksPoster25 citations
- BAEFormer: Bi-Directional and Early Interaction Transformers for Bird's Eye View Semantic SegmentationPoster25 citations
- Biomechanics-Guided Facial Action Unit Detection Through Force ModelingPoster25 citations
- Complete-to-Partial 4D Distillation for Self-Supervised Point Cloud Sequence Representation LearningPoster25 citations
- Compression-Aware Video Super-ResolutionPoster25 citations
- DeepVecFont-v2: Exploiting Transformers To Synthesize Vector Fonts With Higher QualityPoster25 citations
- DegAE: A New Pretraining Paradigm for Low-Level VisionHighlight25 citations
- Distribution Shift Inversion for Out-of-Distribution PredictionPoster25 citations
- DualRel: Semi-Supervised Mitochondria Segmentation From a Prototype PerspectivePoster25 citations
- Exploring Incompatible Knowledge Transfer in Few-Shot Image GenerationPoster25 citations
- Glocal Energy-Based Learning for Few-Shot Open-Set RecognitionPoster25 citations
- Harmonious Feature Learning for Interactive Hand-Object Pose EstimationPoster25 citations
- Incremental 3D Semantic Scene Graph Prediction From RGB SequencesPoster25 citations
- Masked Jigsaw Puzzle: A Versatile Position Embedding for Vision TransformersPoster25 citations
- NeurOCS: Neural NOCS Supervision for Monocular 3D Object LocalizationPoster25 citations
- Neural Vector Fields: Implicit Representation by Explicit LearningPoster25 citations
- RMLVQA: A Margin Loss Approach for Visual Question Answering With Language BiasesPoster25 citations
- Re-Thinking Federated Active Learning Based on Inter-Class DiversityPoster25 citations
- Recurrent Homography Estimation Using Homography-Guided Image Warping and Focus TransformerPoster25 citations
- SemiCVT: Semi-Supervised Convolutional Vision Transformer for Semantic SegmentationPoster25 citations
- Sketch2Saliency: Learning To Detect Salient Objects From Human DrawingsPoster25 citations
- SteerNeRF: Accelerating NeRF Rendering via Smooth Viewpoint TrajectoryPoster25 citations
- Towards Benchmarking and Assessing Visual Naturalness of Physical World Adversarial AttacksPoster25 citations
- Towards Domain Generalization for Multi-View 3D Object Detection in Bird-Eye-ViewPoster25 citations
- Towards High-Quality and Efficient Video Super-Resolution via Spatial-Temporal Data OverfittingHighlight25 citations
- Transformer-Based Learned OptimizationPoster25 citations
- Turning Strengths Into Weaknesses: A Certified Robustness Inspired Attack Framework Against Graph Neural NetworksPoster25 citations
- Unsupervised Volumetric AnimationPoster25 citations
- Weakly Supervised Segmentation With Point Annotations for Histopathology Images via Contrast-Based Variational ModelPoster25 citations
- ZBS: Zero-Shot Background Subtraction via Instance-Level Background Modeling and Foreground SelectionPoster25 citations
- Zero-Shot Text-to-Parameter Translation for Game Character Auto-CreationPoster25 citations
- iQuery: Instruments As Queries for Audio-Visual Sound SeparationPoster25 citations
- ARKitTrack: A New Diverse Dataset for Tracking Using Mobile RGB-D DataPoster24 citations
- Bridging the Gap Between Model Explanations in Partially Annotated Multi-Label ClassificationPoster24 citations
- Co-Salient Object Detection With Uncertainty-Aware Group Exchange-MaskingPoster24 citations
- ContraNeRF: Generalizable Neural Radiance Fields for Synthetic-to-Real Novel View Synthesis via Contrastive LearningPoster24 citations
- DART: Diversify-Aggregate-Repeat Training Improves Generalization of Neural NetworksPoster24 citations
- Data-Free Sketch-Based Image RetrievalPoster24 citations
- Delving Into Shape-Aware Zero-Shot Semantic SegmentationPoster24 citations
- Dual Alignment Unsupervised Domain Adaptation for Video-Text RetrievalPoster24 citations
- FCC: Feature Clusters Compression for Long-Tailed Visual RecognitionPoster24 citations
- Hierarchical Semantic Correspondence Networks for Video Paragraph GroundingPoster24 citations
- In-Hand 3D Object Scanning From an RGB SequencePoster24 citations
- Markerless Camera-to-Robot Pose Estimation via Self-Supervised Sim-to-Real TransferPoster24 citations
- Multi-Space Neural Radiance FieldsPoster24 citations
- Mutual Information-Based Temporal Difference Learning for Human Pose Estimation in VideoPoster24 citations
- NEF: Neural Edge Fields for 3D Parametric Curve Reconstruction From Multi-View ImagesPoster24 citations
- Novel Class Discovery for 3D Point Cloud Semantic SegmentationPoster24 citations
- OPE-SR: Orthogonal Position Encoding for Designing a Parameter-Free Upsampling Module in Arbitrary-Scale Image Super-ResolutionPoster24 citations
- Physics-Guided ISO-Dependent Sensor Noise Modeling for Extreme Low-Light PhotographyPoster24 citations
- REC-MV: REconstructing 3D Dynamic Cloth From Monocular VideosPoster24 citations
- Spectral Bayesian Uncertainty for Image Super-ResolutionPoster24 citations
- StructVPR: Distill Structural Knowledge With Weighting Samples for Visual Place RecognitionPoster24 citations
- Visual-Tactile Sensing for In-Hand Object ReconstructionPoster24 citations
- iCLIP: Bridging Image Classification and Contrastive Language-Image Pre-Training for Visual RecognitionPoster24 citations
- Adaptive Plasticity Improvement for Continual LearningPoster23 citations
- Architectural Backdoors in Neural NetworksPoster23 citations
- AutoLabel: CLIP-Based Framework for Open-Set Video Domain AdaptationPoster23 citations
- Boosting Low-Data Instance Segmentation by Unsupervised Pre-Training With Saliency PromptPoster23 citations
- Box-Level Active DetectionHighlight23 citations
- Decompose More and Aggregate Better: Two Closer Looks at Frequency Representation Learning for Human Motion PredictionPoster23 citations
- Detection of Out-of-Distribution Samples Using Binary Neuron Activation PatternsPoster23 citations
- Dynamic Focus-Aware Positional Queries for Semantic SegmentationPoster23 citations
- Dynamic Generative Targeted Attacks With Pattern InjectionPoster23 citations
- Efficient On-Device Training via Gradient FilteringPoster23 citations
- Egocentric Auditory Attention Localization in ConversationsPoster23 citations
- Exact-NeRF: An Exploration of a Precise Volumetric Parameterization for Neural Radiance FieldsPoster23 citations
- FaceLit: Neural 3D Relightable FacesPoster23 citations
- IDGI: A Framework To Eliminate Explanation Noise From Integrated GradientsPoster23 citations
- Im2Hands: Learning Attentive Implicit Representation of Interacting Two-Hand ShapesPoster23 citations
- Improving Robustness of Vision Transformers by Reducing Sensitivity To Patch CorruptionsPoster23 citations
- LEMaRT: Label-Efficient Masked Region Transform for Image HarmonizationPoster23 citations
- Learning Expressive Prompting With Residuals for Vision TransformersPoster23 citations
- Leverage Interactive Affinity for Affordance LearningPoster23 citations
- MHPL: Minimum Happy Points Learning for Active Source Free Domain AdaptationPoster23 citations
- MSF: Motion-Guided Sequential Fusion for Efficient 3D Object Detection From Point Cloud SequencesPoster23 citations
- Masked and Adaptive Transformer for Exemplar Based Image TranslationPoster23 citations
- Modeling the Distributional Uncertainty for Salient Object Detection ModelsPoster23 citations
- Object Discovery From Motion-Guided TokensPoster23 citations
- Occlusion-Free Scene Recovery via Neural Radiance FieldsPoster23 citations
- PersonNeRF: Personalized Reconstruction From Photo CollectionsPoster23 citations
- Probabilistic Prompt Learning for Dense PredictionPoster23 citations
- Rate Gradient Approximation Attack Threats Deep Spiking Neural NetworksPoster23 citations
- SMPConv: Self-Moving Point Representations for Continuous ConvolutionPoster23 citations
- ScaleDet: A Scalable Multi-Dataset Object DetectorPoster23 citations
- Self-Supervised Representation Learning for CADPoster23 citations
- SmartAssign: Learning a Smart Knowledge Assignment Strategy for Deraining and DesnowingPoster23 citations
- Sparse Multi-Modal Graph Transformer With Shared-Context Processing for Representation Learning of Giga-Pixel ImagesPoster23 citations
- Spatiotemporal Self-Supervised Learning for Point Clouds in the WildPoster23 citations
- System-Status-Aware Adaptive Network for Online Streaming Video UnderstandingPoster23 citations
- TempSAL - Uncovering Temporal Information for Deep Saliency PredictionPoster23 citations
- The Dark Side of Dynamic Routing Neural Networks: Towards Efficiency Backdoor InjectionPoster23 citations
- Toward Accurate Post-Training Quantization for Image Super ResolutionPoster23 citations
- Trade-Off Between Robustness and Accuracy of Vision TransformersPoster23 citations
- Uncertainty-Aware Optimal Transport for Semantically Coherent Out-of-Distribution DetectionPoster23 citations
- Understanding and Improving Features Learned in Deep Functional MapsHighlight23 citations
- Visual Recognition-Driven Image Restoration for Multiple Degradation With Intrinsic Semantics RecoveryPoster23 citations
- WeatherStream: Light Transport Automation of Single Image DeweatheringPoster23 citations
- ACL-SPC: Adaptive Closed-Loop System for Self-Supervised Point Cloud CompletionPoster22 citations
- ASPnet: Action Segmentation With Shared-Private Representation of Multiple Data SourcesPoster22 citations
- Adaptive Graph Convolutional Subspace ClusteringPoster22 citations
- Binary Latent DiffusionPoster22 citations
- Class Adaptive Network CalibrationPoster22 citations
- Cross-Domain Image Captioning With Discriminative FinetuningPoster22 citations
- Decomposed Cross-Modal Distillation for RGB-Based Temporal Action DetectionPoster22 citations
- Deep Random Projector: Accelerated Deep Image PriorPoster22 citations
- EFEM: Equivariant Neural Field Expectation Maximization for 3D Object Segmentation Without Scene SupervisionPoster22 citations
- FashionSAP: Symbols and Attributes Prompt for Fine-Grained Fashion Vision-Language Pre-TrainingPoster22 citations
- HDR Imaging With Spatially Varying Signal-to-Noise RatiosPoster22 citations
- High Fidelity 3D Hand Shape Reconstruction via Scalable Graph Frequency DecompositionPoster22 citations
- Improving Weakly Supervised Temporal Action Localization by Bridging Train-Test Gap in Pseudo LabelsPoster22 citations
- Introducing Competition To Boost the Transferability of Targeted Adversarial Examples Through Clean Feature MixupPoster22 citations
- Iterative Vision-and-Language NavigationPoster22 citations
- LiDAR2Map: In Defense of LiDAR-Based Semantic Map Construction Using Online Camera DistillationPoster22 citations
- MED-VT: Multiscale Encoder-Decoder Video Transformer With Application To Object SegmentationPoster22 citations
- MarS3D: A Plug-and-Play Motion-Aware Model for Semantic Segmentation on Multi-Scan 3D Point CloudsPoster22 citations
- Masked Images Are Counterfactual Samples for Robust Fine-TuningPoster22 citations
- Matching Is Not Enough: A Two-Stage Framework for Category-Agnostic Pose EstimationHighlight22 citations
- Multiscale Tensor Decomposition and Rendering Equation Encoding for View SynthesisPoster22 citations
- NVTC: Nonlinear Vector Transform CodingPoster22 citations
- NeuDA: Neural Deformable Anchor for High-Fidelity Implicit Surface ReconstructionPoster22 citations
- NeuMap: Neural Coordinate Mapping by Auto-Transdecoder for Camera LocalizationPoster22 citations
- On the Convergence of IRLS and Its Variants in Outlier-Robust EstimationHighlight22 citations
- Open-Set Fine-Grained Retrieval via Prompting Vision-Language EvaluatorPoster22 citations
- PixHt-Lab: Pixel Height Based Light Effect Generation for Image CompositingHighlight22 citations
- Privacy-Preserving Adversarial Facial FeaturesPoster22 citations
- Progressive Open Space Expansion for Open-Set Model AttributionPoster22 citations
- Rawgment: Noise-Accounted RAW Augmentation Enables Recognition in a Wide Variety of EnvironmentsPoster22 citations
- Rebalancing Batch Normalization for Exemplar-Based Class-Incremental LearningPoster22 citations
- Rigidity-Aware Detection for 6D Object Pose EstimationPoster22 citations
- Robust Single Image Reflection Removal Against Adversarial AttacksPoster22 citations
- ShapeClipper: Scalable 3D Shape Learning From Single-View Images via Geometric and CLIP-Based ConsistencyPoster22 citations
- The Best Defense Is a Good Offense: Adversarial Augmentation Against Adversarial AttacksPoster22 citations
- Towards a Smaller Student: Capacity Dynamic Distillation for Efficient Image RetrievalPoster22 citations
- Video Compression With Entropy-Constrained Neural RepresentationsPoster22 citations
- Weakly Supervised Monocular 3D Object Detection Using Multi-View Projection and Direction ConsistencyPoster22 citations
- A New Dataset Based on Images Taken by Blind People for Testing the Robustness of Image Classification Models Trained for ImageNet CategoriesPoster21 citations
- Bias-Eliminating Augmentation Learning for Debiased Federated LearningPoster21 citations
- Bit-Shrinking: Limiting Instantaneous Sharpness for Improving Post-Training QuantizationPoster21 citations
- Boosting Detection in Crowd Analysis via Underutilized Output FeaturesPoster21 citations
- CASP-Net: Rethinking Video Saliency Prediction From an Audio-Visual Consistency Perceptual PerspectivePoster21 citations
- CP3: Channel Pruning Plug-In for Point-Based NetworksPoster21 citations
- Cascade Evidential Learning for Open-World Weakly-Supervised Temporal Action LocalizationPoster21 citations
- Continuous Pseudo-Label Rectified Domain Adaptive Semantic Segmentation With Implicit Neural RepresentationsPoster21 citations
- Deep Fair Clustering via Maximizing and Minimizing Mutual Information: Theory, Algorithm and MetricPoster21 citations
- Defending Against Patch-Based Backdoor Attacks on Self-Supervised LearningPoster21 citations
- Fast Contextual Scene Graph Generation With Unbiased Context AugmentationPoster21 citations
- FlexNeRF: Photorealistic Free-Viewpoint Rendering of Moving Humans From Sparse ViewsPoster21 citations
- GINA-3D: Learning To Generate Implicit Neural Assets in the WildPoster21 citations
- HelixSurf: A Robust and Efficient Neural Implicit Surface Learning of Indoor Scenes With Iterative Intertwined RegularizationPoster21 citations
- Instant Multi-View Head Capture Through Learnable RegistrationPoster21 citations
- Instant-NVR: Instant Neural Volumetric Rendering for Human-Object Interactions From Monocular RGBD StreamPoster21 citations
- Learnable Skeleton-Aware 3D Point Cloud SamplingPoster21 citations
- Learning 3D-Aware Image Synthesis With Unknown Pose DistributionPoster21 citations
- Learning Situation Hyper-Graphs for Video Question AnsweringPoster21 citations
- Learning To Detect Mirrors From Videos via Dual CorrespondencesPoster21 citations
- Motion Information Propagation for Neural Video CompressionPoster21 citations
- Multi-View Inverse Rendering for Large-Scale Real-World Indoor ScenesPoster21 citations
- NeuralPCI: Spatio-Temporal Neural Field for 3D Point Cloud Multi-Frame Non-Linear InterpolationPoster21 citations
- ORCa: Glossy Objects As Radiance-Field CamerasPoster21 citations
- PAniC-3D: Stylized Single-View 3D Reconstruction From Portraits of Anime CharactersPoster21 citations
- Poly-PC: A Polyhedral Network for Multiple Point Cloud Tasks at OncePoster21 citations
- Q: How To Specialize Large Vision-Language Models to Data-Scarce VQA Tasks? A: Self-Train on Unlabeled Images!Poster21 citations
- ReVISE: Self-Supervised Speech Resynthesis With Visual Input for Universal and Generalized Speech RegenerationPoster21 citations
- Relightable Neural Human Assets From Multi-View Gradient IlluminationsPoster21 citations
- SHS-Net: Learning Signed Hyper Surfaces for Oriented Normal Estimation of Point CloudsPoster21 citations
- Seasoning Model Soups for Robustness to Adversarial and Natural Distribution ShiftsPoster21 citations
- Soft Augmentation for Image ClassificationPoster21 citations
- TWINS: A Fine-Tuning Framework for Improved Transferability of Adversarial Robustness and GeneralizationPoster21 citations
- Two-Shot Video Object SegmentationPoster21 citations
- UMat: Uncertainty-Aware Single Image High Resolution Material CapturePoster21 citations
- Use Your Head: Improving Long-Tail Video RecognitionPoster21 citations
- Visual Exemplar Driven Task-Prompting for Unified Perception in Autonomous DrivingPoster21 citations
- Visual Localization Using Imperfect 3D Models From the InternetPoster21 citations
- Weakly-Supervised Domain Adaptive Semantic Segmentation With Prototypical Contrastive LearningPoster21 citations
- Where Is My Spot? Few-Shot Image Generation via Latent Subspace OptimizationPoster21 citations
- You Need Multiple Exiting: Dynamic Early Exiting for Accelerating Unified Vision Language ModelPoster21 citations
- 3D-Aware Face SwappingPoster20 citations
- A Unified Spatial-Angular Structured Light for Single-View Acquisition of Shape and ReflectancePoster20 citations
- Adaptive Channel Sparsity for Federated Learning Under System HeterogeneityPoster20 citations
- AsyFOD: An Asymmetric Adaptation Paradigm for Few-Shot Domain Adaptive Object DetectionPoster20 citations
- Bridging Precision and Confidence: A Train-Time Loss for Calibrating Object DetectionPoster20 citations
- Class Prototypes Based Contrastive Learning for Classifying Multi-Label and Fine-Grained Educational VideosPoster20 citations
- Cloud-Device Collaborative Adaptation to Continual Changing Environments in the Real-WorldPoster20 citations
- Difficulty-Based Sampling for Debiased Contrastive Representation LearningPoster20 citations
- DualVector: Unsupervised Vector Font Synthesis With Dual-Part RepresentationPoster20 citations
- Evolved Part Masking for Self-Supervised LearningPoster20 citations
- Federated Learning With Data-Agnostic Distribution FusionPoster20 citations
- Fusing Pre-Trained Language Models With Multimodal Prompts Through Reinforcement LearningPoster20 citations
- GANHead: Towards Generative Animatable Neural Head AvatarsPoster20 citations
- HIER: Metric Learning Beyond Class Labels via Hierarchical RegularizationPoster20 citations
- Hierarchical B-Frame Video Coding Using Two-Layer CANF Without Motion CodingHighlight20 citations
- HuManiFlow: Ancestor-Conditioned Normalising Flows on SO(3) Manifolds for Human Pose and Shape Distribution EstimationPoster20 citations
- Human Guided Ground-Truth Generation for Realistic Image Super-ResolutionPoster20 citations
- HypLiLoc: Towards Effective LiDAR Pose Regression With Hyperbolic FusionPoster20 citations
- IFSeg: Image-Free Semantic Segmentation via Vision-Language ModelPoster20 citations
- Improving Commonsense in Vision-Language Models via Knowledge Graph RiddlesHighlight20 citations
- Improving Selective Visual Question Answering by Learning From Your PeersPoster20 citations
- Learning Personalized High Quality Volumetric Head Avatars From Monocular RGB VideosPoster20 citations
- Level-S$^2$fM: Structure From Motion on Neural Level Set of Implicit SurfacesPoster20 citations
- MOSO: Decomposing MOtion, Scene and Object for Video PredictionPoster20 citations
- Masked Auto-Encoders Meet Generative Adversarial Networks and BeyondPoster20 citations
- Master: Meta Style Transformer for Controllable Zero-Shot and Few-Shot Artistic Style TransferPoster20 citations
- Meta-Explore: Exploratory Hierarchical Vision-and-Language Navigation Using Scene Object Spectrum GroundingPoster20 citations
- No One Left Behind: Improving the Worst Categories in Long-Tailed LearningPoster20 citations
- One-Shot Model for Mixed-Precision QuantizationPoster20 citations
- Open-Set Likelihood Maximization for Few-Shot LearningPoster20 citations
- Parametric Implicit Face Representation for Audio-Driven Facial ReenactmentPoster20 citations
- Partial Network CloningPoster20 citations
- Point2Pix: Photo-Realistic Point Cloud Rendering via Neural Radiance FieldsPoster20 citations
- Pointersect: Neural Rendering With Cloud-Ray IntersectionPoster20 citations
- Raw Image Reconstruction With Learned Compact MetadataPoster20 citations
- Re-GAN: Data-Efficient GANs Training via Architectural ReconfigurationPoster20 citations
- RefCLIP: A Universal Teacher for Weakly Supervised Referring Expression ComprehensionPoster20 citations
- Revisiting the P3P ProblemPoster20 citations
- STMT: A Spatial-Temporal Mesh Transformer for MoCap-Based Action RecognitionPoster20 citations
- SViTT: Temporal Learning of Sparse Video-Text TransformersPoster20 citations
- ShadowNeuS: Neural SDF Reconstruction by Shadow Ray SupervisionPoster20 citations
- Towards Open-World Segmentation of PartsPoster20 citations
- Where Is My Wallet? Modeling Object Proposal Sets for Egocentric Visual Query LocalizationPoster20 citations
- Zero-Shot Model DiagnosisPoster20 citations
- 3D-Aware Facial Landmark Detection via Multi-View Consistent Training on Synthetic DataPoster19 citations
- Advancing Visual Grounding With Scene Knowledge: Benchmark and MethodPoster19 citations
- Context-Based Trit-Plane Coding for Progressive Image CompressionPoster19 citations
- Crossing the Gap: Domain Generalization for Image CaptioningPoster19 citations
- DIFu: Depth-Guided Implicit Function for Clothed Human ReconstructionPoster19 citations
- Decoupling Learning and Remembering: A Bilevel Memory Framework With Knowledge Projection for Task-Incremental LearningPoster19 citations
- Demystifying Causal Features on Adversarial Examples and Causal Inoculation for Robust Network by Adversarial Instrumental Variable RegressionPoster19 citations
- Discrete Point-Wise Attack Is Not Enough: Generalized Manifold Adversarial Attack for Face RecognitionPoster19 citations
- Ensemble-Based Blackbox Attacks on Dense PredictionPoster19 citations
- From Node Interaction To Hop Interaction: New Effective and Scalable Graph Learning ParadigmPoster19 citations
- GazeNeRF: 3D-Aware Gaze Redirection With Neural Radiance FieldsPoster19 citations
- HGNet: Learning Hierarchical Geometry From Points, Edges, and SurfacesPoster19 citations
- How Can Objects Help Action Recognition?Poster19 citations
- How To Prevent the Poor Performance Clients for Personalized Federated Learning?Poster19 citations
- IPCC-TP: Utilizing Incremental Pearson Correlation Coefficient for Joint Multi-Agent Trajectory PredictionPoster19 citations
- Language-Guided Audio-Visual Source Separation via Trimodal ConsistencyPoster19 citations
- Learning Visibility Field for Detailed 3D Human Reconstruction and RelightingPoster19 citations
- Leveraging Inter-Rater Agreement for Classification in the Presence of Noisy LabelsPoster19 citations
- Listening Human Behavior: 3D Human Pose Estimation With Acoustic SignalsPoster19 citations
- Looking Through the Glass: Neural Surface Reconstruction Against High Specular ReflectionsPoster19 citations
- MarginMatch: Improving Semi-Supervised Learning with Pseudo-MarginsHighlight19 citations
- Mask-Free OVIS: Open-Vocabulary Instance Segmentation Without Manual Mask AnnotationsPoster19 citations
- MeMaHand: Exploiting Mesh-Mano Interaction for Single Image Two-Hand ReconstructionPoster19 citations
- Mitigating Task Interference in Multi-Task Learning via Explicit Task Routing With Non-Learnable PrimitivesPoster19 citations
- MixPHM: Redundancy-Aware Parameter-Efficient Tuning for Low-Resource Visual Question AnsweringPoster19 citations
- Model Barrier: A Compact Un-Transferable Isolation Domain for Model Intellectual Property ProtectionPoster19 citations
- Model-Agnostic Gender Debiased Image CaptioningPoster19 citations
- Movies2Scenes: Using Movie Metadata To Learn Scene RepresentationPoster19 citations
- Multiclass Confidence and Localization Calibration for Object DetectionPoster19 citations
- NoisyTwins: Class-Consistent and Diverse Image Generation Through StyleGANsPoster19 citations
- OmniCity: Omnipotent City Understanding With Multi-Level and Multi-View ImagesPoster19 citations
- Optimal Proposal Learning for Deployable End-to-End Pedestrian DetectionPoster19 citations
- Out-of-Distributed Semantic Pruning for Robust Semi-Supervised LearningPoster19 citations
- PanoSwin: A Pano-Style Swin Transformer for Panorama UnderstandingPoster19 citations
- Pose-Disentangled Contrastive Learning for Self-Supervised Facial RepresentationPoster19 citations
- Probability-Based Global Cross-Modal Upsampling for PansharpeningPoster19 citations
- Quantum-Inspired Spectral-Spatial Pyramid Network for Hyperspectral Image ClassificationPoster19 citations
- Real-Time Controllable Denoising for Image and VideoPoster19 citations
- SMAE: Few-Shot Learning for HDR Deghosting With Saturation-Aware Masked AutoencodersPoster19 citations
- Self-Correctable and Adaptable Inference for Generalizable Human Pose EstimationPoster19 citations
- Semantic Scene Completion With Cleaner SelfPoster19 citations
- ShapeTalk: A Language Dataset and Framework for 3D Shape Edits and DeformationsPoster19 citations
- Solving Oscillation Problem in Post-Training Quantization Through a Theoretical PerspectivePoster19 citations
- Sparsifiner: Learning Sparse Instance-Dependent Attention for Efficient Vision TransformersPoster19 citations
- Task Difficulty Aware Parameter Allocation & Regularization for Lifelong LearningPoster19 citations
- TriVol: Point Cloud Rendering via Triple VolumesPoster19 citations
- Unite and Conquer: Plug & Play Multi-Modal Synthesis Using Diffusion ModelsPoster19 citations
- Unsupervised Domain Adaption With Pixel-Level Discriminator for Image-Aware Layout GenerationPoster19 citations
- VIVE3D: Viewpoint-Independent Video Editing Using 3D-Aware GANsPoster19 citations
- WildLight: In-the-Wild Inverse Rendering With a FlashlightPoster19 citations
- Affection: Learning Affective Explanations for Real-World Visual DataPoster18 citations
- An Erudite Fine-Grained Visual Classification ModelPoster18 citations
- Are We Ready for Vision-Centric Driving Streaming Perception? The ASAP BenchmarkPoster18 citations
- AutoRecon: Automated 3D Object Discovery and ReconstructionHighlight18 citations
- Collaborative Static and Dynamic Vision-Language Streams for Spatio-Temporal Video GroundingPoster18 citations
- Consistent Direct Time-of-Flight Video Depth Super-ResolutionPoster18 citations
- DeGPR: Deep Guided Posterior Regularization for Multi-Class Cell Detection and CountingPoster18 citations
- Deep Arbitrary-Scale Image Super-Resolution via Scale-Equivariance PursuitPoster18 citations
- DeepMapping2: Self-Supervised Large-Scale LiDAR Map OptimizationPoster18 citations
- DyNCA: Real-Time Dynamic Texture Synthesis Using Neural Cellular AutomataPoster18 citations
- FAC: 3D Representation Learning via Foreground Aware Feature ContrastPoster18 citations
- Fantastic Breaks: A Dataset of Paired 3D Scans of Real-World Broken Objects and Their Complete CounterpartsPoster18 citations
- Few-Shot Learning With Visual Distribution Calibration and Cross-Modal Distribution AlignmentPoster18 citations
- Image Quality-Aware Diagnosis via Meta-Knowledge Co-EmbeddingPoster18 citations
- Knowledge Distillation for 6D Pose Estimation by Aligning Distributions of Local PredictionsPoster18 citations
- Learning To Name Classes for Vision and Language ModelsPoster18 citations
- Lift3D: Synthesize 3D Training Data by Lifting 2D GAN to 3D Generative Radiance FieldPoster18 citations
- MMVC: Learned Multi-Mode Video Compression With Block-Based Prediction Mode Selection and Density-Adaptive Entropy CodingPoster18 citations
- Multi-View Stereo Representation Revist: Region-Aware MVSNetPoster18 citations
- Normalizing Flow Based Feature Synthesis for Outlier-Aware Object DetectionHighlight18 citations
- Open-Set Semantic Segmentation for Point Clouds via Adversarial Prototype FrameworkPoster18 citations
- PanelNet: Understanding 360 Indoor Environment via Panel RepresentationPoster18 citations
- Phone2Proc: Bringing Robust Robots Into Our Chaotic WorldPoster18 citations
- PointCMP: Contrastive Mask Prediction for Self-Supervised Learning on Point Cloud VideosPoster18 citations
- PoseExaminer: Automated Testing of Out-of-Distribution Robustness in Human Pose and Shape EstimationPoster18 citations
- Progressive Spatio-Temporal Alignment for Efficient Event-Based Motion EstimationPoster18 citations
- SAP-DETR: Bridging the Gap Between Salient Points and Queries-Based Transformer Detector for Fast Model ConvergencyPoster18 citations
- Semi-Supervised Video Inpainting With Cycle Consistency ConstraintsPoster18 citations
- Shepherding Slots to Objects: Towards Stable and Robust Object-Centric LearningPoster18 citations
- Streaming Video ModelPoster18 citations
- SuperDisco: Super-Class Discovery Improves Visual Recognition for the Long-TailPoster18 citations
- Symmetric Shape-Preserving Autoencoder for Unsupervised Real Scene Point Cloud CompletionPoster18 citations
- The Dialog Must Go On: Improving Visual Dialog via Generative Self-TrainingPoster18 citations
- The Resource Problem of Using Linear Layer Leakage Attack in Federated LearningPoster18 citations
- TopNet: Transformer-Based Object Placement Network for Image CompositingPoster18 citations
- Training Debiased Subnetworks With Contrastive Weight PruningPoster18 citations
- Transformer-Based Unified Recognition of Two Hands Manipulating ObjectsPoster18 citations
- Uncertainty-Aware Unsupervised Image Deblurring With Deep Residual PriorPoster18 citations
- VDN-NeRF: Resolving Shape-Radiance Ambiguity via View-Dependence NormalizationPoster18 citations
- Visual Recognition by RequestPoster18 citations
- 3D Human Keypoints Estimation From Point Clouds in the Wild Without Human LabelsPoster17 citations
- A Rotation-Translation-Decoupled Solution for Robust and Efficient Visual-Inertial InitializationPoster17 citations
- ANetQA: A Large-Scale Benchmark for Fine-Grained Compositional Reasoning Over Untrimmed VideosPoster17 citations
- AnyFlow: Arbitrary Scale Optical Flow With Implicit Neural RepresentationHighlight17 citations
- Bilateral Memory Consolidation for Continual LearningPoster17 citations
- CLOTH4D: A Dataset for Clothed Human ReconstructionPoster17 citations
- Common Pets in 3D: Dynamic New-View Synthesis of Real-Life Deformable CategoriesHighlight17 citations
- CrOC: Cross-View Online Clustering for Dense Visual Representation LearningPoster17 citations
- DETR With Additional Global Aggregation for Cross-Domain Weakly Supervised Object DetectionPoster17 citations
- Deep Factorized Metric LearningPoster17 citations
- Distilling Focal Knowledge From Imperfect Expert for 3D Object DetectionPoster17 citations
- Diverse 3D Hand Gesture Prediction From Body Dynamics by Bilateral Hand DisentanglementPoster17 citations
- Domain Expansion of Image GeneratorsPoster17 citations
- EC2: Emergent Communication for Embodied ControlPoster17 citations
- EXCALIBUR: Encouraging and Evaluating Embodied ExplorationPoster17 citations
- Efficient Mask Correction for Click-Based Interactive Image SegmentationPoster17 citations
- Equivalent Transformation and Dual Stream Network Construction for Mobile Image Super-ResolutionPoster17 citations
- Event-Based Blurry Frame Interpolation Under Blind ExposurePoster17 citations
- Event-Guided Person Re-Identification via Sparse-Dense Complementary LearningPoster17 citations
- Feature Aggregated Queries for Transformer-Based Video Object DetectorsPoster17 citations
- GIVL: Improving Geographical Inclusivity of Vision-Language Models With Pre-Training MethodsPoster17 citations
- GLeaD: Improving GANs With a Generator-Leading TaskPoster17 citations
- Generalist: Decoupling Natural and Robust GeneralizationHighlight17 citations
- Handy: Towards a High Fidelity 3D Hand Shape and Appearance ModelPoster17 citations
- Hierarchical Discriminative Learning Improves Visual Representations of Biomedical MicroscopyHighlight17 citations
- High-Res Facial Appearance Capture From Polarized Smartphone ImagesPoster17 citations
- Implicit 3D Human Mesh Recovery Using Consistency With Pose and Shape From Unseen-ViewPoster17 citations
- Improving Generalization of Meta-Learning With Inverted Regularization at Inner-LevelPoster17 citations
- Knowledge Combination To Learn Rotated Detection Without Rotated AnnotationPoster17 citations
- MOT: Masked Optimal Transport for Partial Domain AdaptationPoster17 citations
- NeuFace: Realistic 3D Neural Face Rendering From Multi-View ImagesPoster17 citations
- Non-Line-of-Sight Imaging With Signal Superresolution NetworkPoster17 citations
- Octree Guided Unoriented Surface ReconstructionPoster17 citations
- Promoting Semantic Connectivity: Dual Nearest Neighbors Contrastive Learning for Unsupervised Domain GeneralizationPoster17 citations
- Recurrence Without Recurrence: Stable Video Landmark Detection With Deep Equilibrium ModelsPoster17 citations
- RefTeacher: A Strong Baseline for Semi-Supervised Referring Expression ComprehensionPoster17 citations
- RelightableHands: Efficient Neural Relighting of Articulated Hand ModelsPoster17 citations
- Rethinking Few-Shot Medical Segmentation: A Vector Quantization ViewPoster17 citations
- Rethinking the Approximation Error in 3D Surface Fitting for Point Cloud Normal EstimationPoster17 citations
- Revisiting Rotation Averaging: Uncertainties and Robust LossesPoster17 citations
- Robot Structure Prior Guided Temporal Attention for Camera-to-Robot Pose Estimation From Image SequencePoster17 citations
- SE-ORNet: Self-Ensembling Orientation-Aware Network for Unsupervised Point Cloud Shape CorrespondencePoster17 citations
- ScarceNet: Animal Pose Estimation With Scarce AnnotationsPoster17 citations
- SegLoc: Learning Segmentation-Based Representations for Privacy-Preserving Visual LocalizationPoster17 citations
- Semantic Human Parsing via Scalable Semantic Transfer Over Multiple Label DomainsPoster17 citations
- Stimulus Verification Is a Universal and Effective Sampler in Multi-Modal Human Trajectory PredictionPoster17 citations
- Therbligs in Action: Video Understanding Through Motion PrimitivesPoster17 citations
- Towards Practical Plug-and-Play Diffusion ModelsPoster17 citations
- Tracking Through Containers and Occluders in the WildPoster17 citations
- Trap Attention: Monocular Depth Estimation With Manual TrapsPoster17 citations
- Unbalanced Optimal Transport: A Unified Framework for Object DetectionPoster17 citations
- Unsupervised 3D Point Cloud Representation Learning by Triangle Constrained Contrast for Autonomous DrivingPoster17 citations
- Unsupervised Continual Semantic Adaptation Through Neural RenderingPoster17 citations
- Visual Dependency Transformers: Dependency Tree Emerges From Reversed AttentionPoster17 citations
- Weakly Supervised Video Representation Learning With Unaligned Text for Sequential VideosPoster17 citations
- An Actor-Centric Causality Graph for Asynchronous Temporal Inference in Group ActivityPoster16 citations
- Asymmetric Feature Fusion for Image RetrievalPoster16 citations
- Blowing in the Wind: CycleNet for Human Cinemagraphs From Still ImagesPoster16 citations
- Breaching FedMD: Image Recovery via Paired-Logits Inversion AttackPoster16 citations
- Complete 3D Human Reconstruction From a Single Incomplete ImagePoster16 citations
- CoralStyleCLIP: Co-Optimized Region and Layer Selection for Image EditingPoster16 citations
- Correlational Image Modeling for Self-Supervised Visual Pre-TrainingPoster16 citations
- DANI-Net: Uncalibrated Photometric Stereo by Differentiable Shadow Handling, Anisotropic Reflectance Modeling, and Neural Inverse RenderingPoster16 citations
- Differentiable Architecture Search With Random FeaturesPoster16 citations
- DisCo-CLIP: A Distributed Contrastive Loss for Memory Efficient CLIP TrainingHighlight16 citations
- Disentangling Orthogonal Planes for Indoor Panoramic Room Layout Estimation With Cross-Scale Distortion AwarenessPoster16 citations
- Document Image Shadow Removal Guided by Color-Aware BackgroundPoster16 citations
- Effective Ambiguity Attack Against Passport-Based DNN Intellectual Property Protection Schemes Through Fully Connected Layer SubstitutionPoster16 citations
- Efficient Semantic Segmentation by Altering Resolutions for Compressed VideosPoster16 citations
- Egocentric Video Task TranslationHighlight16 citations
- Enhanced Multimodal Representation Learning With Cross-Modal KDPoster16 citations
- Genie: Show Me the Data for QuantizationPoster16 citations
- Gradient-Based Uncertainty Attribution for Explainable Bayesian Deep LearningPoster16 citations
- Hybrid Active Learning via Deep Clustering for Video Action DetectionPoster16 citations
- IMP: Iterative Matching and Pose Estimation With Adaptive PoolingPoster16 citations
- Indescribable Multi-Modal Spatial EvaluatorPoster16 citations
- Instant Domain Augmentation for LiDAR Semantic SegmentationPoster16 citations
- Is BERT Blind? Exploring the Effect of Vision-and-Language Pretraining on Visual Language UnderstandingPoster16 citations
- Learning a Practical SDR-to-HDRTV Up-Conversion Using New Dataset and Degradation ModelsPoster16 citations
- Logical Consistency and Greater Descriptive Power for Facial Hair Attribute LearningPoster16 citations
- Long-Term Visual Localization With Mobile SensorsPoster16 citations
- MAESTER: Masked Autoencoder Guided Segmentation at Pixel Resolution for Accurate, Self-Supervised Subcellular Structure RecognitionHighlight16 citations
- MEGANE: Morphable Eyeglass and Avatar NetworkPoster16 citations
- Mask3D: Pre-Training 2D Vision Transformers by Learning Masked 3D PriorsPoster16 citations
- NIFF: Alleviating Forgetting in Generalized Few-Shot Object Detection via Neural Instance Feature ForgingPoster16 citations
- NeuWigs: A Neural Dynamic Model for Volumetric Hair Capture and AnimationPoster16 citations
- Neural Congealing: Aligning Images to a Joint Semantic AtlasPoster16 citations
- Neuralizer: General Neuroimage Analysis Without Re-TrainingPoster16 citations
- On the Pitfall of Mixup for Uncertainty CalibrationPoster16 citations
- On-the-Fly Category DiscoveryPoster16 citations
- SGLoc: Scene Geometry Encoding for Outdoor LiDAR LocalizationPoster16 citations
- Self-Supervised Blind Motion Deblurring With Deep Expectation MaximizationPoster16 citations
- SinGRAF: Learning a 3D Generative Radiance Field for a Single ScenePoster16 citations
- TINC: Tree-Structured Implicit Neural CompressionPoster16 citations
- Towards Flexible Multi-Modal Document ModelsHighlight16 citations
- Towards Unbiased Volume Rendering of Neural Implicit Surfaces With Geometry PriorsPoster16 citations
- Transforming Radiance Field With Lipschitz Network for Photorealistic 3D Scene StylizationHighlight16 citations
- VectorFloorSeg: Two-Stream Graph Attention Network for Vectorized Roughcast Floorplan SegmentationHighlight16 citations
- Zero-Shot Dual-Lens Super-ResolutionPoster16 citations
- AVFormer: Injecting Vision Into Frozen Speech Models for Zero-Shot AV-ASRPoster15 citations
- Accidental Light ProbesPoster15 citations
- Adversarially Masking Synthetic To Mimic Real: Adaptive Noise Injection for Point Cloud Segmentation AdaptationPoster15 citations
- BKinD-3D: Self-Supervised 3D Keypoint Discovery From Multi-View VideosPoster15 citations
- Bootstrapping Objectness From Videos by Relaxed Common Fate and Visual GroupingPoster15 citations
- CCuantuMM: Cycle-Consistent Quantum-Hybrid Matching of Multiple ShapesPoster15 citations
- Complexity-Guided Slimmable Decoder for Efficient Deep Video CompressionPoster15 citations
- Cross-Domain 3D Hand Pose Estimation With Dual ModalitiesPoster15 citations
- DSFNet: Dual Space Fusion Network for Occlusion-Robust 3D Dense Face AlignmentPoster15 citations
- DeCo: Decomposition and Reconstruction for Compositional Temporal Grounding via Coarse-To-Fine Contrastive RankingPoster15 citations
- Delving Into Discrete Normalizing Flows on SO(3) Manifold for Probabilistic Rotation ModelingPoster15 citations
- EXIF As Language: Learning Cross-Modal Associations Between Images and Camera MetadataHighlight15 citations
- Foundation Model Drives Weakly Incremental Learning for Semantic SegmentationPoster15 citations
- Frame Interpolation Transformer and Uncertainty GuidancePoster15 citations
- Fully Self-Supervised Depth Estimation From Defocus CluePoster15 citations
- GarmentTracking: Category-Level Garment Pose TrackingPoster15 citations
- GeoNet: Benchmarking Unsupervised Adaptation Across GeographiesPoster15 citations
- Guided Recommendation for Model Fine-TuningPoster15 citations
- Hybrid Neural Rendering for Large-Scale Scenes With Motion BlurPoster15 citations
- JAWS: Just a Wild Shot for Cinematic Transfer in Neural Radiance FieldsPoster15 citations
- LANIT: Language-Driven Image-to-Image Translation for Unlabeled DataPoster15 citations
- Learning Partial Correlation Based Deep Visual Representation for Image ClassificationPoster15 citations
- Learning a Depth Covariance FunctionPoster15 citations
- Mask-Guided Matting in the WildPoster15 citations
- MaskCon: Masked Contrastive Learning for Coarse-Labelled DatasetPoster15 citations
- MetaMix: Towards Corruption-Robust Continual Learning With Temporally Self-Adaptive Data TransformationPoster15 citations
- MetaViewer: Towards a Unified Multi-View RepresentationPoster15 citations
- MoDAR: Using Motion Forecasting for 3D Object Detection in Point Cloud SequencesPoster15 citations
- Modeling Entities As Semantic Points for Visual Information Extraction in the WildPoster15 citations
- Modernizing Old Photos Using Multiple References via Photorealistic Style TransferPoster15 citations
- Neural Intrinsic Embedding for Non-Rigid Point Cloud MatchingPoster15 citations
- Neural Rate Estimator and Unsupervised Learning for Efficient Distributed Image Analytics in Split-DNN ModelsPoster15 citations
- Normal-Guided Garment UV Prediction for Human Re-TexturingHighlight15 citations
- OSAN: A One-Stage Alignment Network To Unify Multimodal Alignment and Unsupervised Domain AdaptationPoster15 citations
- Prefix Conditioning Unifies Language and Label SupervisionPoster15 citations
- Preserving Linear Separability in Continual Learning by Backward Feature ProjectionPoster15 citations
- ProTeGe: Untrimmed Pretraining for Video Temporal Grounding by Video Temporal GroundingPoster15 citations
- Probabilistic Knowledge Distillation of Face EnsemblesPoster15 citations
- Progressive Backdoor Erasing via Connecting Backdoor and Adversarial AttacksPoster15 citations
- Reconstructing Signing Avatars From Video Using Linguistic PriorsPoster15 citations
- Rethinking Image Super Resolution From Long-Tailed Distribution Learning PerspectivePoster15 citations
- Robust and Scalable Gaussian Process Regression and Its ApplicationsPoster15 citations
- Text2Scene: Text-Driven Indoor Scene Stylization With Part-Aware DetailsHighlight15 citations
- Topology-Guided Multi-Class Cell Context Generation for Digital PathologyPoster15 citations
- Towards Building Self-Aware Object Detectors via Reliable Uncertainty Quantification and CalibrationPoster15 citations
- Unsupervised Cumulative Domain Adaptation for Foggy Scene Optical FlowPoster15 citations
- 3D Spatial Multimodal Knowledge Accumulation for Scene Graph Prediction in Point CloudPoster14 citations
- Adversarial Robustness via Random Projection FiltersPoster14 citations
- An Image Quality Assessment Dataset for PortraitsPoster14 citations
- Architecture, Dataset and Model-Scale Agnostic Data-Free Meta-LearningPoster14 citations
- Are Data-Driven Explanations Robust Against Out-of-Distribution Data?Poster14 citations
- AutoFocusFormer: Image Segmentation off the GridPoster14 citations
- Azimuth Super-Resolution for FMCW Radar in Autonomous DrivingPoster14 citations
- Bias in Pruned Vision Models: In-Depth Analysis and CountermeasuresPoster14 citations
- Binarizing Sparse Convolutional Networks for Efficient Point Cloud AnalysisPoster14 citations
- Continuous Intermediate Token Learning With Implicit Motion Manifold for Keyframe Based Motion InterpolationPoster14 citations
- Coreset Sampling From Open-Set for Fine-Grained Self-Supervised LearningPoster14 citations
- Cross-Guided Optimization of Radiance Fields With Multi-View Image Super-Resolution for High-Resolution Novel View SynthesisPoster14 citations
- DAA: A Delta Age AdaIN Operation for Age Estimation via Binary Code TransformerPoster14 citations
- DKT: Diverse Knowledge Transfer Transformer for Class Incremental LearningPoster14 citations
- DeFeeNet: Consecutive 3D Human Motion Prediction With Deviation FeedbackPoster14 citations
- Discriminator-Cooperated Feature Map Distillation for GAN CompressionPoster14 citations
- Flexible-Cm GAN: Towards Precise 3D Dose Prediction in RadiotherapyPoster14 citations
- Gated Multi-Resolution Transfer Network for Burst Restoration and EnhancementPoster14 citations
- How You Feelin'? Learning Emotions and Mental States in Movie ScenesPoster14 citations
- Humans As Light Bulbs: 3D Human Reconstruction From Thermal ReflectionPoster14 citations
- Inverting the Imaging Process by Learning an Implicit Camera ModelPoster14 citations
- Joint Appearance and Motion Learning for Efficient Rolling Shutter CorrectionPoster14 citations
- Joint Video Multi-Frame Interpolation and Deblurring Under Unknown Exposure TimePoster14 citations
- Large-Scale Training Data Search for Object Re-IdentificationPoster14 citations
- Learning From Unique Perspectives: User-Aware Saliency ModelingPoster14 citations
- Learning Human Mesh Recovery in 3D ScenesPoster14 citations
- LightPainter: Interactive Portrait Relighting With Freehand ScribblePoster14 citations
- MDL-NAS: A Joint Multi-Domain Learning Framework for Vision TransformerPoster14 citations
- Marching-Primitives: Shape Abstraction From Signed Distance FunctionHighlight14 citations
- Masked Autoencoding Does Not Help Natural Language Supervision at ScalePoster14 citations
- MobileBrick: Building LEGO for 3D Reconstruction on Mobile DevicesPoster14 citations
- Neural Lens ModelingPoster14 citations
- Object Detection With Self-Supervised Scene AdaptationPoster14 citations
- PA&DA: Jointly Sampling Path and Data for Consistent NASPoster14 citations
- POEM: Reconstructing Hand in a Point Embedded Multi-View StereoPoster14 citations
- Parts2Words: Learning Joint Embedding of Point Clouds and Texts by Bidirectional Matching Between Parts and WordsPoster14 citations
- PointClustering: Unsupervised Point Cloud Pre-Training Using Transformation Invariance in ClusteringHighlight14 citations
- Principles of Forgetting in Domain-Incremental Semantic Segmentation in Adverse Weather ConditionsPoster14 citations
- RGB No More: Minimally-Decoded JPEG Vision TransformersPoster14 citations
- Recovering 3D Hand Mesh Sequence From a Single Blurry Image: A New Dataset and Temporal UnfoldingPoster14 citations
- Regularization of Polynomial Networks for Image RecognitionPoster14 citations
- Relational Space-Time Query in Long-Form VideosHighlight14 citations
- SCoDA: Domain Adaptive Shape Completion for Real ScansPoster14 citations
- STDLens: Model Hijacking-Resilient Federated Learning for Object DetectionPoster14 citations
- Seeing Through the Glass: Neural 3D Reconstruction of Object Inside a Transparent ContainerPoster14 citations
- TOPLight: Lightweight Neural Networks With Task-Oriented Pretraining for Visible-Infrared RecognitionPoster14 citations
- Target-Referenced Reactive Grasping for Dynamic ObjectsPoster14 citations
- The Wisdom of Crowds: Temporal Progressive Attention for Early Action PredictionPoster14 citations
- Towards Bridging the Performance Gaps of Joint Energy-Based ModelsPoster14 citations
- Tracking Multiple Deformable Objects in Egocentric VideosPoster14 citations
- ViLEM: Visual-Language Error Modeling for Image-Text RetrievalPoster14 citations
- VisFusion: Visibility-Aware Online 3D Scene Reconstruction From VideosPoster14 citations
- (ML)$^2$P-Encoder: On Exploration of Channel-Class Correlation for Multi-Label Zero-Shot LearningPoster13 citations
- 3D Video Object Detection With Learnable Object-Centric Global OptimizationPoster13 citations
- Abstract Visual Reasoning: An Algebraic Approach for Solving Raven's Progressive MatricesPoster13 citations
- Accelerating Vision-Language Pretraining With Free Language ModelingPoster13 citations
- AdaptiveMix: Improving GAN Training via Feature Space ShrinkagePoster13 citations
- Building Rearticulable Models for Arbitrary 3D Objects From 4D Point CloudsPoster13 citations
- Conjugate Product Graphs for Globally Optimal 2D-3D Shape MatchingPoster13 citations
- Crowd3D: Towards Hundreds of People Reconstruction From a Single ImagePoster13 citations
- Curricular Object Manipulation in LiDAR-Based Object DetectionPoster13 citations
- DC2: Dual-Camera Defocus Control by Learning To RefocusPoster13 citations
- DartBlur: Privacy Preservation With Detection Artifact SuppressionPoster13 citations
- Deep Learning of Partial Graph Matching via Differentiable Top-KPoster13 citations
- Deep Stereo Video InpaintingPoster13 citations
- Distilling Neural Fields for Real-Time Articulated Shape ReconstructionPoster13 citations
- Enhancing Deformable Local Features by Jointly Learning To Detect and Describe KeypointsPoster13 citations
- Few-Shot Geometry-Aware Keypoint LocalizationPoster13 citations
- Frequency-Modulated Point Cloud Rendering With Easy EditingHighlight13 citations
- HOTNAS: Hierarchical Optimal Transport for Neural Architecture SearchPoster13 citations
- Integral Neural NetworksPoster13 citations
- JacobiNeRF: NeRF Shaping With Mutual Information GradientsPoster13 citations
- LP-DIF: Learning Local Pattern-Specific Deep Implicit Function for 3D Objects and ScenesPoster13 citations
- Learning Anchor Transformations for 3D Garment AnimationPoster13 citations
- Learning Instance-Level Representation for Large-Scale Multi-Modal Pretraining in E-CommercePoster13 citations
- MAGVLT: Masked Generative Vision-and-Language TransformerPoster13 citations
- Meta-Personalizing Vision-Language Models To Find Named Instances in VideoPoster13 citations
- NeRFVS: Neural Radiance Fields for Free View Synthesis via Geometry ScaffoldsPoster13 citations
- OmniVidar: Omnidirectional Depth Estimation From Multi-Fisheye ImagesPoster13 citations
- On the Importance of Accurate Geometry Data for Dense 3D Vision TasksPoster13 citations
- PlenVDB: Memory Efficient VDB-Based Radiance Fields for Fast Training and RenderingPoster13 citations
- Policy Adaptation From Foundation Model FeedbackPoster13 citations
- Post-Processing Temporal Action DetectionPoster13 citations
- Quantum Multi-Model FittingHighlight13 citations
- Seeing What You Miss: Vision-Language Pre-Training With Semantic Completion LearningPoster13 citations
- Self-Supervised Pre-Training With Masked Shape Prediction for 3D Scene UnderstandingPoster13 citations
- Simulated Annealing in Early Layers Leads to Better GeneralizationPoster13 citations
- Source-Free Video Domain Adaptation With Spatial-Temporal-Historical Consistency LearningPoster13 citations
- Test Time Adaptation With Regularized Loss for Weakly Supervised Salient Object DetectionPoster13 citations
- Unsupervised 3D Shape Reconstruction by Part Retrieval and AssemblyPoster13 citations
- ViewNet: A Novel Projection-Based Backbone With View Pooling for Few-Shot Point Cloud ClassificationPoster13 citations
- Visual DNA: Representing and Comparing Images Using Distributions of Neuron ActivationsPoster13 citations
- "Seeing" Electric Network Frequency From EventsPoster12 citations
- A Bag-of-Prototypes Representation for Dataset-Level ApplicationsPoster12 citations
- A Large-Scale Homography BenchmarkPoster12 citations
- ABLE-NeRF: Attention-Based Rendering With Learnable Embeddings for Neural Radiance FieldPoster12 citations
- Alias-Free Convnets: Fractional Shift Invariance via Polynomial ActivationsPoster12 citations
- AttentionShift: Iteratively Estimated Part-Based Attention Map for Pointly Supervised Instance SegmentationPoster12 citations
- Boundary-Aware Backward-Compatible Representation via Adversarial Learning in Image RetrievalPoster12 citations
- Co-Training 2L Submodels for Visual RecognitionPoster12 citations
- Compositor: Bottom-Up Clustering and Compositing for Robust Part and Object SegmentationPoster12 citations
- Continuous Landmark Detection With 3D QueriesPoster12 citations
- Controllable Light Diffusion for PortraitsPoster12 citations
- Critical Learning Periods for Multisensory Integration in Deep NetworksHighlight12 citations
- FlowGrad: Controlling the Output of Generative ODEs With GradientsPoster12 citations
- GANmouflage: 3D Object Nondetection With Texture FieldsPoster12 citations
- Image Cropping With Spatial-Aware Feature and Rank ConsistencyPoster12 citations
- Implicit Neural Head Synthesis via Controllable Local Deformation FieldsPoster12 citations
- Improving Generalization With Domain Convex GamePoster12 citations
- K3DN: Disparity-Aware Kernel Estimation for Dual-Pixel Defocus DeblurringPoster12 citations
- Label Information Bottleneck for Label EnhancementPoster12 citations
- Learning Accurate 3D Shape Based on Stereo Polarimetric ImagingPoster12 citations
- Learning Adaptive Dense Event Stereo From the Image DomainPoster12 citations
- Learning Attribute and Class-Specific Representation Duet for Fine-Grained Fashion AnalysisPoster12 citations
- Learning Detailed Radiance Manifolds for High-Fidelity and 3D-Consistent Portrait Synthesis From Monocular ImagePoster12 citations
- Learning To Segment Every Referring Object Point by PointPoster12 citations
- Learning a Deep Color Difference Metric for Photographic ImagesPoster12 citations
- Logical Implications for Visual Question Answering ConsistencyPoster12 citations
- MDQE: Mining Discriminative Query Embeddings To Segment Occluded Instances on Challenging VideosPoster12 citations
- MM-3DScene: 3D Scene Understanding by Customizing Masked Modeling With Informative-Preserved Reconstruction and Self-Distilled ConsistencyPoster12 citations
- Multi-Sensor Large-Scale Dataset for Multi-View 3D ReconstructionPoster12 citations
- Plateau-Reduced Differentiable Path TracingPoster12 citations
- Progressive Transformation Learning for Leveraging Virtual Images in TrainingHighlight12 citations
- RIAV-MVS: Recurrent-Indexing an Asymmetric Volume for Multi-View StereoPoster12 citations
- Real-Time Multi-Person Eyeblink Detection in the Wild for Untrimmed VideoPoster12 citations
- SIEDOB: Semantic Image Editing by Disentangling Object and BackgroundHighlight12 citations
- SMOC-Net: Leveraging Camera Pose for Self-Supervised Monocular Object Pose EstimationHighlight12 citations
- Search-Map-Search: A Frame Selection Paradigm for Action RecognitionPoster12 citations
- Siamese DETRPoster12 citations
- Simultaneously Short- and Long-Term Temporal Modeling for Semi-Supervised Video Semantic SegmentationPoster12 citations
- StyleIPSB: Identity-Preserving Semantic Basis of StyleGAN for High Fidelity Face SwappingPoster12 citations
- Toward Stable, Interpretable, and Lightweight Hyperspectral Super-ResolutionPoster12 citations
- Weakly-Supervised Single-View Image RelightingPoster12 citations
- AShapeFormer: Semantics-Guided Object-Level Active Shape Encoding for 3D Object Detection via TransformersPoster11 citations
- Adapting Shortcut With Normalizing Flow: An Efficient Tuning Framework for Visual RecognitionPoster11 citations
- B-Spline Texture Coefficients Estimator for Screen Content Image Super-ResolutionHighlight11 citations
- Bi-Directional Feature Fusion Generative Adversarial Network for Ultra-High Resolution Pathological Image Virtual Re-StainingPoster11 citations
- Bitstream-Corrupted JPEG Images Are Restorable: Two-Stage Compensation and Alignment Framework for Image RestorationPoster11 citations
- Boosting Verified Training for Robust Image Classifications via AbstractionPoster11 citations
- CABM: Content-Aware Bit Mapping for Single Image Super-Resolution Network With Large InputPoster11 citations
- CUF: Continuous Upsampling FiltersPoster11 citations
- CaPriDe Learning: Confidential and Private Decentralized Learning Based on Encryption-Friendly Distillation LossPoster11 citations
- Clothed Human Performance Capture With a Double-Layer Neural Radiance FieldsPoster11 citations
- Command-Driven Articulated Object Understanding and ManipulationPoster11 citations
- Context-Aware Relative Object Queries To Unify Video Instance and Panoptic SegmentationPoster11 citations
- Deep Polarization Reconstruction With PDAVIS EventsPoster11 citations
- Discriminating Known From Unknown Objects via Structure-Enhanced Recurrent Variational AutoEncoderPoster11 citations
- DistractFlow: Improving Optical Flow Estimation via Realistic Distractions and Pseudo-LabelingPoster11 citations
- EMT-NAS:Transferring Architectural Knowledge Between Tasks From Different DatasetsPoster11 citations
- End-to-End Video Matting With Trimap PropagationPoster11 citations
- Exploring Data Geometry for Continual LearningPoster11 citations
- Few-Shot Non-Line-of-Sight Imaging With Signal-Surface Collaborative RegularizationPoster11 citations
- Few-Shot Semantic Image Synthesis With Class Affinity TransferPoster11 citations
- Frame Flexible NetworkPoster11 citations
- GraVoS: Voxel Selection for 3D Point-Cloud DetectionPoster11 citations
- Grounding Counterfactual Explanation of Image Classifiers to Textual Concept SpacePoster11 citations
- Heterogeneous Continual LearningHighlight11 citations
- Hyperspherical Embedding for Point Cloud CompletionPoster11 citations
- Learning Correspondence Uncertainty via Differentiable Nonlinear Least SquaresPoster11 citations
- Learning Joint Latent Space EBM Prior Model for Multi-Layer GeneratorPoster11 citations
- Learning Steerable Function for Efficient Image ResamplingPoster11 citations
- Learning Transformation-Predictive Representations for Detection and Description of Local FeaturesPoster11 citations
- LightedDepth: Video Depth Estimation in Light of Limited Inference View AnglesPoster11 citations
- Modular Memorability: Tiered Representations for Video Memorability PredictionPoster11 citations
- Multi-Object Manipulation via Object-Centric Neural Scattering FunctionsPoster11 citations
- Multiplicative Fourier Level of DetailHighlight11 citations
- Network Expansion for Practical Training AccelerationPoster11 citations
- Neural Texture Synthesis With Guided CorrespondencePoster11 citations
- Neural Transformation Fields for Arbitrary-Styled Font GenerationPoster11 citations
- NewsNet: A Novel Dataset for Hierarchical Temporal SegmentationPoster11 citations
- PointCert: Point Cloud Classification With Deterministic Certified Robustness GuaranteesPoster11 citations
- Regularize Implicit Neural Representation by ItselfHighlight11 citations
- Seeing a Rose in Five Thousand WaysPoster11 citations
- Self-Supervised Super-Plane for Neural 3D ReconstructionPoster11 citations
- Semi-Weakly Supervised Object Kinematic Motion PredictionPoster11 citations
- Shakes on a Plane: Unsupervised Depth Estimation From Unstabilized PhotographyPoster11 citations
- Similarity Maps for Self-Training Weakly-Supervised Phrase GroundingPoster11 citations
- Similarity Metric Learning for RGB-Infrared Group Re-IdentificationPoster11 citations
- Single Image Backdoor Inversion via Robust Smoothed ClassifiersPoster11 citations
- SketchXAI: A First Look at Explainability for Human SketchesPoster11 citations
- TMO: Textured Mesh Acquisition of Objects With a Mobile Device by Using Differentiable RenderingPoster11 citations
- Tree Instance Segmentation With Temporal Contour GraphPoster11 citations
- Ultrahigh Resolution Image/Video Matting With Spatio-Temporal SparsityPoster11 citations
- Weakly Supervised Class-Agnostic Motion Prediction for Autonomous DrivingPoster11 citations
- Zero-Shot Pose Transfer for Unrigged Stylized 3D CharactersPoster11 citations
- A Meta-Learning Approach to Predicting Performance and Data RequirementsPoster10 citations
- Adaptive Global Decay Process for Event CamerasPoster10 citations
- Automatic High Resolution Wire Segmentation and RemovalPoster10 citations
- Beyond mAP: Towards Better Evaluation of Instance SegmentationHighlight10 citations
- CNVid-3.5M: Build, Filter, and Pre-Train the Large-Scale Public Chinese Video-Text DatasetPoster10 citations
- D2Former: Jointly Learning Hierarchical Detectors and Contextual Descriptors via Agent-Based TransformersHighlight10 citations
- DejaVu: Conditional Regenerative Learning To Enhance Dense PredictionPoster10 citations
- Equiangular Basis VectorsPoster10 citations
- EvShutter: Transforming Events for Unconstrained Rolling Shutter CorrectionPoster10 citations
- Four-View Geometry With Unknown Radial DistortionPoster10 citations
CVPR accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.