CVPR 2024 Accepted Papers
The full list of 2,640 papers accepted at CVPR 2024 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 2,323Highlight: 317
- Reg-PTQ: Regression-specialized Post-training Quantization for Fully Quantized Object DetectorPoster5 citations
- Revisiting Counterfactual Problems in Referring Expression ComprehensionPoster5 citations
- Robust Distillation via Untargeted and Targeted Intermediate Adversarial SamplesPoster5 citations
- Robust Overfitting Does Matter: Test-Time Adversarial Purification With FGSMPoster5 citations
- SCULPT: Shape-Conditioned Unpaired Learning of Pose-dependent Clothed and Textured Human MeshesPoster5 citations
- SG-PGM: Partial Graph Matching Network with Semantic Geometric Fusion for 3D Scene Graph Alignment and Its Downstream TasksPoster5 citations
- SURE: SUrvey REcipes for building reliable and robust deep networksPoster5 citations
- SVDinsTN: A Tensor Network Paradigm for Efficient Structure Search from Regularized Modeling PerspectiveHighlight5 citations
- ScoreHypo: Probabilistic Human Mesh Estimation with Hypothesis ScoringPoster5 citations
- Segment Any Event Streams via Weighted Adaptation of Pivotal TokensPoster5 citations
- Semantics-aware Motion Retargeting with Vision-Language ModelsPoster5 citations
- Sharingan: A Transformer Architecture for Multi-Person Gaze FollowingPoster5 citations
- Stable Neighbor Denoising for Source-free Domain Adaptive SegmentationPoster5 citations
- Step Differences in Instructional VideoPoster5 citations
- Strong Transferable Adversarial Attacks via Ensembled Asymptotically Normal Distribution LearningHighlight5 citations
- Summarize the Past to Predict the Future: Natural Language Descriptions of Context Boost Multimodal Object Interaction AnticipationPoster5 citations
- Task-Adaptive Saliency Guidance for Exemplar-free Class Incremental LearningPoster5 citations
- TexVocab: Texture Vocabulary-conditioned Human AvatarsPoster5 citations
- TextNeRF: A Novel Scene-Text Image Synthesis Method based on Neural Radiance FieldsPoster5 citations
- The Unreasonable Effectiveness of Pre-Trained Features for Camera Pose RefinementHighlight5 citations
- Total-Decom: Decomposed 3D Scene Reconstruction with Minimal InteractionHighlight5 citations
- Towards Fairness-Aware Adversarial LearningPoster5 citations
- Tri-Modal Motion Retrieval by Learning a Joint Embedding SpaceHighlight5 citations
- TurboSL: Dense Accurate and Fast 3D by Neural Inverse Structured LightPoster5 citations
- USE: Universal Segment Embeddings for Open-Vocabulary Image SegmentationPoster5 citations
- Uncertainty-Aware Source-Free Adaptive Image Super-Resolution with Wavelet Augmentation TransformerPoster5 citations
- Unexplored Faces of Robustness and Out-of-Distribution: Covariate Shifts in Environment and Sensor DomainsPoster5 citations
- Ungeneralizable ExamplesPoster5 citations
- Unleashing Network Potentials for Semantic Scene CompletionPoster5 citations
- VA3: Virtually Assured Amplification Attack on Probabilistic Copyright Protection for Text-to-Image Generative ModelsHighlight5 citations
- Vanishing-Point-Guided Video Semantic Segmentation of Driving ScenesHighlight5 citations
- Video Recognition in Portrait ModePoster5 citations
- View From Above: Orthogonal-View aware Cross-view LocalizationPoster5 citations
- ViewFusion: Towards Multi-View Consistency via Interpolated DenoisingPoster5 citations
- Visual Layout Composer: Image-Vector Dual Diffusion Model for Design Layout GenerationPoster5 citations
- Weak-to-Strong 3D Object Detection with X-Ray DistillationPoster5 citations
- When Visual Grounding Meets Gigapixel-level Large-scale Scenes: Benchmark and ApproachPoster5 citations
- YolOOD: Utilizing Object Detection Concepts for Multi-Label Out-of-Distribution DetectionPoster5 citations
- 2S-UDF: A Novel Two-stage UDF Learning Method for Robust Non-watertight Model Reconstruction from Multi-view ImagesPoster4 citations
- A&B BNN: Add&Bit-Operation-Only Hardware-Friendly Binary Neural NetworkPoster4 citations
- ACT-Diffusion: Efficient Adversarial Consistency Training for One-step Diffusion ModelsPoster4 citations
- Active Domain Adaptation with False Negative Prediction for Object DetectionHighlight4 citations
- Active Open-Vocabulary Recognition: Let Intelligent Moving Mitigate CLIP LimitationsPoster4 citations
- Align and Aggregate: Compositional Reasoning with Video Alignment and Answer Aggregation for Video Question-AnsweringPoster4 citations
- Anatomically Constrained Implicit Face ModelsPoster4 citations
- Artist-Friendly Relightable and Animatable Neural HeadsPoster4 citations
- Atom-Level Optical Chemical Structure Recognition with Limited SupervisionPoster4 citations
- BerfScene: Bev-conditioned Equivariant Radiance Fields for Infinite 3D Scene GenerationPoster4 citations
- Boosting Adversarial Training via Fisher-Rao Norm-based RegularizationPoster4 citations
- Building a Strong Pre-Training Baseline for Universal 3D Large-Scale PerceptionPoster4 citations
- CAMEL: CAusal Motion Enhancement Tailored for Lifting Text-driven Video EditingPoster4 citations
- CN-RMA: Combined Network with Ray Marching Aggregation for 3D Indoor Object Detection from Multi-view ImagesPoster4 citations
- CPR-Coach: Recognizing Composite Error Actions based on Single-class TrainingPoster4 citations
- CaKDP: Category-aware Knowledge Distillation and Pruning Framework for Lightweight 3D Object DetectionPoster4 citations
- Content-Style Decoupling for Unsupervised Makeup Transfer without Generating Pseudo Ground TruthPoster4 citations
- Cross Initialization for Face Personalization of Text-to-Image ModelsPoster4 citations
- CustomListener: Text-guided Responsive Interaction for User-friendly Listening Head GenerationPoster4 citations
- DMR: Decomposed Multi-Modality Representations for Frames and Events Fusion in Visual Reinforcement LearningPoster4 citations
- DUDF: Differentiable Unsigned Distance Fields with Hyperbolic ScalingPoster4 citations
- DYSON: Dynamic Feature Space Self-Organization for Online Task-Free Class Incremental LearningPoster4 citations
- Deep Imbalanced Regression via Hierarchical Classification AdjustmentPoster4 citations
- Density-Guided Semi-Supervised 3D Semantic Segmentation with Dual-Space Hardness SamplingPoster4 citations
- Design2Cloth: 3D Cloth Generation from 2D MasksPoster4 citations
- Device-Wise Federated Network PruningPoster4 citations
- DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language ModelPoster4 citations
- Discriminability-Driven Channel Selection for Out-of-Distribution DetectionPoster4 citations
- Discriminative Pattern Calibration Mechanism for Source-Free Domain AdaptationPoster4 citations
- Distilling ODE Solvers of Diffusion Models into Smaller StepsPoster4 citations
- Don't Look into the Dark: Latent Codes for Pluralistic Image InpaintingPoster4 citations
- Dr2Net: Dynamic Reversible Dual-Residual Networks for Memory-Efficient FinetuningPoster4 citations
- Dual-Consistency Model Inversion for Non-Exemplar Class Incremental LearningPoster4 citations
- Dual-Scale Transformer for Large-Scale Single-Pixel ImagingPoster4 citations
- EFHQ: Multi-purpose ExtremePose-Face-HQ datasetPoster4 citations
- ESCAPE: Encoding Super-keypoints for Category-Agnostic Pose EstimationPoster4 citations
- EarthLoc: Astronaut Photography Localization by Indexing Earth from SpacePoster4 citations
- Edge-Aware 3D Instance Segmentation Network with Intelligent Semantic PriorPoster4 citations
- Edit One for All: Interactive Batch Image EditingPoster4 citations
- Efficient Stitchable Task AdaptationPoster4 citations
- Efficient and Effective Weakly-Supervised Action Segmentation via Action-Transition-Aware Boundary AlignmentPoster4 citations
- Ensemble Diversity Facilitates Adversarial TransferabilityPoster4 citations
- Entangled View-Epipolar Information Aggregation for Generalizable Neural Radiance FieldsPoster4 citations
- Entity-NeRF: Detecting and Removing Moving Entities in Urban ScenesPoster4 citations
- Exact Fusion via Feature Distribution Matching for Few-shot Image GenerationPoster4 citations
- Exploring Pose-Aware Human-Object Interaction via Hybrid LearningPoster4 citations
- FAR: Flexible Accurate and Robust 6DoF Relative Camera Pose EstimationHighlight4 citations
- FaceChain-SuDe: Building Derived Class to Inherit Category Attributes for One-shot Subject-Driven GenerationPoster4 citations
- Fixed Point Diffusion ModelsPoster4 citations
- Fully Geometric Panoramic LocalizationPoster4 citations
- GOV-NeSF: Generalizable Open-Vocabulary Neural Semantic FieldsPoster4 citations
- Gear-NeRF: Free-Viewpoint Rendering and Tracking with Motion-aware Spatio-Temporal SamplingHighlight4 citations
- Generalizable Novel-View Synthesis using a Stereo CameraPoster4 citations
- Generalized Event CamerasPoster4 citations
- Generate Like Experts: Multi-Stage Font Generation by Incorporating Font Transfer Process into Diffusion ModelsPoster4 citations
- GeoReF: Geometric Alignment Across Shape Variation for Category-level Object Pose RefinementPoster4 citations
- HDQMF: Holographic Feature Decomposition Using Quantum AlgorithmsPoster4 citations
- HandDiff: 3D Hand Pose Estimation with Diffusion on Image-Point CloudHighlight4 citations
- Hearing Anything AnywherePoster4 citations
- HumanNeRF-SE: A Simple yet Effective Approach to Animate HumanNeRF with Diverse PosesPoster4 citations
- Hybrid Proposal Refiner: Revisiting DETR Series from the Faster R-CNN PerspectivePoster4 citations
- Improving Physics-Augmented Continuum Neural Radiance Field-Based Geometry-Agnostic System Identification with Lagrangian Particle OptimizationPoster4 citations
- In Search of a Data Transformation That Accelerates Neural Field TrainingPoster4 citations
- Instance Tracking in 3D Scenes from Egocentric VideosPoster4 citations
- Integrating Efficient Optimal Transport and Functional Maps For Unsupervised Shape Correspondence LearningPoster4 citations
- JointSQ: Joint Sparsification-Quantization for Distributed LearningPoster4 citations
- LASA: Instance Reconstruction from Real Scans using A Large-scale Aligned Shape Annotation DatasetPoster4 citations
- LUWA Dataset: Learning Lithic Use-Wear Analysis on Microscopic ImagesHighlight4 citations
- Language-conditioned Detection TransformerPoster4 citations
- Leak and Learn: An Attacker's Cookbook to Train Using Leaked Data from Federated LearningPoster4 citations
- Learning Adaptive Spatial Coherent Correlations for Speech-Preserving Facial Expression ManipulationHighlight4 citations
- Learning Degradation-unaware Representation with Prior-based Latent Transformations for Blind Face RestorationPoster4 citations
- Learning Discriminative Dynamics with Label Corruption for Noisy Label DetectionPoster4 citations
- Learning from Synthetic Human Group ActivitiesPoster4 citations
- Learning with Structural Labels for Learning with Noisy LabelsPoster4 citations
- Learning with Unreliability: Fast Few-shot Voxel Radiance Fields with Relative Geometric ConsistencyPoster4 citations
- Looking Similar Sounding Different: Leveraging Counterfactual Cross-Modal Pairs for Audiovisual Representation LearningPoster4 citations
- Low-Rank Knowledge Decomposition for Medical Foundation ModelsPoster4 citations
- MAFA: Managing False Negatives for Vision-Language Pre-trainingPoster4 citations
- MAGICK: A Large-scale Captioned Dataset from Matting Generated Images using Chroma KeyingPoster4 citations
- MAP: MAsk-Pruning for Source-Free Model Intellectual Property ProtectionPoster4 citations
- MMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of VideosHighlight4 citations
- MaskINT: Video Editing via Interpolative Non-autoregressive Masked TransformersPoster4 citations
- MaskPLAN: Masked Generative Layout Planning from Partial InputPoster4 citations
- Masked AutoDecoder is Effective Multi-Task Vision GeneralistPoster4 citations
- Memory-Scalable and Simplified Functional Map LearningPoster4 citations
- Meta-Point Learning and Refining for Category-Agnostic Pose EstimationPoster4 citations
- Motion Diversification NetworksPoster4 citations
- Multi-agent Collaborative Perception via Motion-aware Robust Communication NetworkPoster4 citations
- Multiview Aerial Visual RECognition (MAVREC): Can Multi-view Improve Aerial Visual Perception?Poster4 citations
- Navigating Beyond Dropout: An Intriguing Solution towards Generalizable Image Super ResolutionPoster4 citations
- NeLF-Pro: Neural Light Field Probes for Multi-Scale Novel View SynthesisPoster4 citations
- Neural Visibility Field for Uncertainty-Driven Active MappingPoster4 citations
- OVFoodSeg: Elevating Open-Vocabulary Food Image Segmentation via Image-Informed Textual RepresentationPoster4 citations
- OVMR: Open-Vocabulary Recognition with Multi-Modal ReferencesPoster4 citations
- OmniLocalRF: Omnidirectional Local Radiance Fields from Dynamic VideosPoster4 citations
- OmniSDF: Scene Reconstruction using Omnidirectional Signed Distance Functions and Adaptive BinoctreesPoster4 citations
- On the Robustness of Language Guidance for Low-Level Vision Tasks: Findings from Depth EstimationPoster4 citations
- Open Vocabulary Semantic Scene Sketch UnderstandingPoster4 citations
- OpticalDR: A Deep Optical Imaging Model for Privacy-Protective Depression RecognitionPoster4 citations
- PEGASUS: Personalized Generative 3D Avatars with Composable AttributesPoster4 citations
- PanoPose: Self-supervised Relative Pose Estimation for Panoramic ImagesHighlight4 citations
- PeerAiD: Improving Adversarial Distillation from a Specialized Peer TutorPoster4 citations
- Perceptual Assessment and Optimization of HDR Image RenderingPoster4 citations
- Physics-Aware Hand-Object Interaction DenoisingPoster4 citations
- Relational Matching for Weakly Semi-Supervised Oriented Object DetectionPoster4 citations
- Resolution Limit of Single-Photon LiDARPoster4 citations
- Restoration by Generation with Constrained PriorsHighlight4 citations
- Robust Depth Enhancement via Polarization Prompt Fusion TuningPoster4 citations
- S-DyRF: Reference-Based Stylized Radiance Fields for Dynamic ScenesPoster4 citations
- SDPose: Tokenized Pose Estimation via Circulation-Guide Self-DistillationPoster4 citations
- SHiNe: Semantic Hierarchy Nexus for Open-vocabulary Object DetectionHighlight4 citations
- SPU-PMD: Self-Supervised Point Cloud Upsampling via Progressive Mesh DeformationPoster4 citations
- Selective Interpretable and Motion Consistent Privacy Attribute Obfuscation for Action RecognitionPoster4 citations
- Self-supervised Debiasing Using Low Rank RegularizationPoster4 citations
- Siamese Learning with Joint Alignment and Regression for Weakly-Supervised Video Paragraph GroundingPoster4 citations
- Single View Refractive Index Tomography with Neural FieldsPoster4 citations
- Solving Masked Jigsaw Puzzles with Diffusion Vision TransformersPoster4 citations
- Stratified Avatar Generation from Sparse ObservationsPoster4 citations
- StreamingFlow: Streaming Occupancy Forecasting with Asynchronous Multi-modal Data Streams via Neural Ordinary Differential EquationHighlight4 citations
- Super-Resolution Reconstruction from Bayer-Pattern Spike StreamsPoster4 citations
- SurroundSDF: Implicit 3D Scene Understanding Based on Signed Distance FieldHighlight4 citations
- SynFog: A Photo-realistic Synthetic Fog Dataset based on End-to-end Imaging Simulation for Advancing Real-World Defogging in Autonomous DrivingPoster4 citations
- Task-Conditioned Adaptation of Visual Features in Multi-Task Policy LearningPoster4 citations
- Text2QR: Harmonizing Aesthetic Customization and Scanning Robustness for Text-Guided QR Code GenerationPoster4 citations
- The Mirrored Influence Hypothesis: Efficient Data Influence Estimation by Harnessing Forward PassesPoster4 citations
- Total Selfie: Generating Full-Body SelfiesHighlight4 citations
- Towards CLIP-driven Language-free 3D Visual Grounding via 2D-3D Relational Enhancement and ConsistencyPoster4 citations
- Towards Generalizing to Unseen Domains with Few LabelsPoster4 citations
- Towards More Accurate Diffusion Model Acceleration with A Timestep TunerPoster4 citations
- Tumor Micro-environment Interactions Guided Graph Learning for Survival Analysis of Human Cancers from Whole-slide Pathological ImagesPoster4 citations
- UFORecon: Generalizable Sparse-View Surface Reconstruction from Arbitrary and Unfavorable SetsPoster4 citations
- UltrAvatar: A Realistic Animatable 3D Avatar Diffusion Model with Authenticity Guided TexturesPoster4 citations
- UnSAMFlow: Unsupervised Optical Flow Guided by Segment Anything ModelPoster4 citations
- Uncertainty-Guided Never-Ending Learning to DrivePoster4 citations
- Unlocking the Potential of Pre-trained Vision Transformers for Few-Shot Semantic Segmentation through Relationship DescriptorsPoster4 citations
- Unsegment Anything by Simulating DeformationPoster4 citations
- Unsupervised Deep Unrolling Networks for Phase UnwrappingPoster4 citations
- Unsupervised Feature Learning with Emergent Data-Driven PrototypicalityPoster4 citations
- Unsupervised Template-assisted Point Cloud Shape Correspondence NetworkPoster4 citations
- Unveiling the Unknown: Unleashing the Power of Unknown to Known in Open-Set Source-Free Domain AdaptationPoster4 citations
- VSRD: Instance-Aware Volumetric Silhouette Rendering for Weakly Supervised 3D Object DetectionPoster4 citations
- Validating Privacy-Preserving Face Recognition under a Minimum AssumptionPoster4 citations
- VidLA: Video-Language Alignment at ScalePoster4 citations
- Visual Objectification in Films: Towards a New AI Task for Video InterpretationHighlight4 citations
- What Sketch Explainability Really Means for Downstream Tasks?Poster4 citations
- Zero-Painter: Training-Free Layout Control for Text-to-Image SynthesisPoster4 citations
- 3D Feature Tracking via Event CameraPoster3 citations
- 3D-Aware Face Editing via Warping-Guided Latent Direction LearningPoster3 citations
- A Backpack Full of Skills: Egocentric Video Understanding with Diverse Task PerspectivesPoster3 citations
- A Theory of Joint Light and Heat Transport for Lambertian ScenesPoster3 citations
- A Versatile Framework for Continual Test-Time Domain Adaptation: Balancing Discriminability and GeneralizabilityPoster3 citations
- AHIVE: Anatomy-aware Hierarchical Vision Encoding for Interactive Radiology Report RetrievalPoster3 citations
- Activity-Biometrics: Person Identification from Daily ActivitiesPoster3 citations
- Adversarial Text to Continuous Image GenerationPoster3 citations
- Adversarially Robust Few-shot Learning via Parameter Co-distillation of Similarity and Class Concept LearnersPoster3 citations
- An Asymmetric Augmented Self-Supervised Learning Method for Unsupervised Fine-Grained Image HashingPoster3 citations
- An Interactive Navigation Method with Effect-oriented AffordancePoster3 citations
- Anomaly Score: Evaluating Generative Models and Individual Generated Images based on Complexity and VulnerabilityPoster3 citations
- BANF: Band-Limited Neural Fields for Levels of Detail ReconstructionPoster3 citations
- BEHAVIOR Vision Suite: Customizable Dataset Generation via SimulationHighlight3 citations
- BOTH2Hands: Inferring 3D Hands from Both Text Prompts and Body DynamicsPoster3 citations
- BSNet: Box-Supervised Simulation-assisted Mean Teacher for 3D Instance SegmentationPoster3 citations
- Bayesian Exploration of Pre-trained Models for Low-shot Image ClassificationPoster3 citations
- Beyond Image Super-Resolution for Image Recognition with Task-Driven Perceptual LossPoster3 citations
- Bezier Everywhere All at Once: Learning Drivable Lanes as Bezier GraphsPoster3 citations
- Boosting Order-Preserving and Transferability for Neural Architecture Search: a Joint Architecture Refined Search and Fine-tuning ApproachPoster3 citations
- Bootstrapping Autonomous Driving Radars with Self-Supervised LearningPoster3 citations
- BrainWash: A Poisoning Attack to Forget in Continual LearningPoster3 citations
- Building Optimal Neural Architectures using Interpretable KnowledgePoster3 citations
- CAM Back Again: Large Kernel CNNs from a Weakly Supervised Object Localization PerspectivePoster3 citations
- CNC-Net: Self-Supervised Learning for CNC Machining OperationsPoster3 citations
- CausalPC: Improving the Robustness of Point Cloud Classification by Causal Effect IdentificationPoster3 citations
- Circuit Design and Efficient Simulation of Quantum Inner Product and Empirical Studies of Its Effect on Near-Term Hybrid Quantum-Classic Machine LearningPoster3 citations
- DIEM: Decomposition-Integration Enhancing Multimodal InsightsPoster3 citations
- DIOD: Self-Distillation Meets Object DiscoveryPoster3 citations
- Data-Free Quantization via Pseudo-label FilteringPoster3 citations
- DeCoTR: Enhancing Depth Completion with 2D and 3D AttentionsPoster3 citations
- DeMatch: Deep Decomposition of Motion Field for Two-View Correspondence LearningPoster3 citations
- Deep Single Image Camera Calibration by Heatmap Regression to Recover Fisheye Images Under Manhattan World AssumptionPoster3 citations
- Deep-TROJ: An Inference Stage Trojan Insertion Algorithm through Efficient Weight Replacement AttackPoster3 citations
- DiG-IN: Diffusion Guidance for Investigating Networks - Uncovering Classifier Differences Neuron Visualisations and Visual Counterfactual ExplanationsPoster3 citations
- DiaLoc: An Iterative Approach to Embodied Dialog LocalizationPoster3 citations
- Differentiable Display Photometric StereoPoster3 citations
- Diffusion Reflectance Map: Single-Image Stochastic Inverse Rendering of Illumination and ReflectanceHighlight3 citations
- DiffusionRegPose: Enhancing Multi-Person Pose Estimation using a Diffusion-Based End-to-End Regression ApproachPoster3 citations
- Discriminative Sample-Guided and Parameter-Efficient Feature Space Adaptation for Cross-Domain Few-Shot LearningPoster3 citations
- Distilled Datamodel with Reverse Gradient MatchingPoster3 citations
- Domain-Specific Block Selection and Paired-View Pseudo-Labeling for Online Test-Time AdaptationPoster3 citations
- Don't Drop Your Samples! Coherence-Aware Training Benefits Conditional DiffusionHighlight3 citations
- DreamSalon: A Staged Diffusion Framework for Preserving Identity-Context in Editable Face GenerationPoster3 citations
- Dual Pose-invariant Embeddings: Learning Category and Object-specific Discriminative Representations for Recognition and RetrievalPoster3 citations
- Enhancing Quality of Compressed Images by Mitigating Enhancement Bias Towards Compression DomainPoster3 citations
- Enhancing the Power of OOD Detection via Sample-Aware Model SelectionPoster3 citations
- ExMap: Leveraging Explainability Heatmaps for Unsupervised Group Robustness to Spurious CorrelationsPoster3 citations
- ExtraNeRF: Visibility-Aware View Extrapolation of Neural Radiance Fields with Diffusion ModelsPoster3 citations
- FADES: Fair Disentanglement with Sensitive RelevancePoster3 citations
- Fusing Personal and Environmental Cues for Identification and Segmentation of First-Person Camera Wearers in Third-Person ViewsPoster3 citations
- FutureHuman3D: Forecasting Complex Long-Term 3D Human Behavior from Video ObservationsPoster3 citations
- Generating Illustrated InstructionsPoster3 citations
- GigaTraj: Predicting Long-term Trajectories of Hundreds of Pedestrians in Gigapixel Complex ScenesPoster3 citations
- HIT: Estimating Internal Human Implicit Tissues from the Body SurfacePoster3 citations
- HOIST-Former: Hand-held Objects Identification Segmentation and Tracking in the WildPoster3 citations
- HUNTER: Unsupervised Human-centric 3D Detection via Transferring Knowledge from Synthetic Instances to Real ScenesPoster3 citations
- HyperSDFusion: Bridging Hierarchical Structures in Language and Geometry for Enhanced 3D Text2Shape GenerationPoster3 citations
- Improving Distant 3D Object Detection Using 2D Box SupervisionPoster3 citations
- Improving Generalization via Meta-Learning on Hard SamplesPoster3 citations
- Improving Generalized Zero-Shot Learning by Exploring the Diverse Semantics from External Class NamesPoster3 citations
- In-N-Out: Faithful 3D GAN Inversion with Volumetric Decomposition for Face EditingPoster3 citations
- Incorporating Geo-Diverse Knowledge into Prompting for Increased Geographical Robustness in Object RecognitionPoster3 citations
- Incremental Nuclei Segmentation from Histopathological Images via Future-class Awareness and Compatibility-inspired DistillationPoster3 citations
- Infrared Adversarial Car StickersPoster3 citations
- Insights from the Use of Previously Unseen Neural Architecture Search DatasetsPoster3 citations
- KITRO: Refining Human Mesh by 2D Clues and Kinematic-tree RotationPoster3 citations
- Kernel Adaptive Convolution for Scene Text Detection via Distance Map PredictionPoster3 citations
- L-MAGIC: Language Model Assisted Generation of Images with CoherencePoster3 citations
- L2B: Learning to Bootstrap Robust Models for Combating Label NoisePoster3 citations
- LLaMA-Excitor: General Instruction Tuning via Indirect Feature InteractionPoster3 citations
- Language Model Guided Interpretable Video Action ReasoningPoster3 citations
- Language-aware Visual Semantic Distillation for Video Question AnsweringPoster3 citations
- Learned Scanpaths Aid Blind Panoramic Video Quality AssessmentPoster3 citations
- Learning Coupled Dictionaries from Unpaired Data for Image Super-ResolutionPoster3 citations
- Learning from One Continuous Video StreamPoster3 citations
- Learning to Navigate Efficiently and Precisely in Real EnvironmentsPoster3 citations
- Locally Adaptive Neural 3D Morphable ModelsPoster3 citations
- Looking 3D: Anomaly Detection with 2D-3D AlignmentPoster3 citations
- Low-Latency Neural Stereo StreamingPoster3 citations
- MFP: Making Full Use of Probability Maps for Interactive Image SegmentationPoster3 citations
- MICap: A Unified Model for Identity-Aware Movie DescriptionsPoster3 citations
- MMCert: Provable Defense against Adversarial Attacks to Multi-modal ModelsPoster3 citations
- MMVP: A Multimodal MoCap Dataset with Vision and Pressure SensorsPoster3 citations
- Mind Artist: Creating Artistic Snapshots with Human ThoughtPoster3 citations
- Minimal Perspective AutocalibrationPoster3 citations
- Monocular Identity-Conditioned Facial Reflectance ReconstructionPoster3 citations
- Multiplane Prior Guided Few-Shot Aerial Scene RenderingPoster3 citations
- NICE: Neurogenesis Inspired Contextual Encoding for Replay-free Class Incremental LearningPoster3 citations
- NeRFDeformer: NeRF Transformation from a Single View via 3D Scene FlowsPoster3 citations
- Not All Classes Stand on Same Embeddings: Calibrating a Semantic Distance with Metric TensorPoster3 citations
- Novel View Synthesis with View-Dependent Effects from a Single ImagePoster3 citations
- OCAI: Improving Optical Flow Estimation by Occlusion and Consistency Aware InterpolationPoster3 citations
- Omni-Q: Omni-Directional Scene Understanding for Unsupervised Visual GroundingPoster3 citations
- One More Step: A Versatile Plug-and-Play Module for Rectifying Diffusion Schedule Flaws and Enhancing Low-Frequency ControlsPoster3 citations
- POCE: Primal Policy Optimization with Conservative Estimation for Multi-constraint Offline Reinforcement LearningPoster3 citations
- PanoRecon: Real-Time Panoptic 3D Reconstruction from Monocular VideoPoster3 citations
- Patch2Self2: Self-supervised Denoising on Coresets via Matrix SketchingPoster3 citations
- PeVL: Pose-Enhanced Vision-Language Model for Fine-Grained Human Action RecognitionPoster3 citations
- PoseIRM: Enhance 3D Human Pose Estimation on Unseen Camera Settings via Invariant Risk MinimizationPoster3 citations
- PostureHMR: Posture Transformation for 3D Human Mesh RecoveryPoster3 citations
- RAM-Avatar: Real-time Photo-Realistic Avatar from Monocular Videos with Full-body ControlPoster3 citations
- Random Entangled Tokens for Adversarially Robust Vision TransformerPoster3 citations
- Real-World Mobile Image Denoising Dataset with Efficient BaselinesPoster3 citations
- SIRA: Scalable Inter-frame Relation and Association for Radar PerceptionPoster3 citations
- SPIDeRS: Structured Polarization for Invisible Depth and Reflectance SensingPoster3 citations
- Seeing the Unseen: Visual Common Sense for Semantic PlacementPoster3 citations
- Seeing the World through Your EyesPoster3 citations
- Self-Supervised Class-Agnostic Motion Prediction with Spatial and Temporal Consistency RegularizationsPoster3 citations
- Semantic Human Mesh Reconstruction with TexturesPoster3 citations
- Semantic Shield: Defending Vision-Language Models Against Backdooring and Poisoning via Fine-grained Knowledge AlignmentPoster3 citations
- ShapeMatcher: Self-Supervised Joint Shape Canonicalization Segmentation Retrieval and DeformationPoster3 citations
- ShapeWalk: Compositional Shape Editing Through Language-Guided ChainsPoster3 citations
- SlowFormer: Adversarial Attack on Compute and Energy Consumption of Efficient Vision TransformersPoster3 citations
- Small Steps and Level Sets: Fitting Neural Surface Models with Point GuidancePoster3 citations
- Soften to Defend: Towards Adversarial Robustness via Self-Guided Label RefinementPoster3 citations
- Spectral and Polarization Vision: Spectro-polarimetric Real-world DatasetHighlight3 citations
- Specularity Factorization for Low-Light EnhancementPoster3 citations
- Spin-UP: Spin Light for Natural Light Uncalibrated Photometric StereoPoster3 citations
- Synergistic Global-space Camera and Human Reconstruction from VideosPoster3 citations
- Teeth-SEG: An Efficient Instance Segmentation Framework for Orthodontic Treatment based on Multi-Scale Aggregation and Anthropic Prior KnowledgePoster3 citations
- Text-Conditioned Generative Model of 3D Strand-based Human HairstylesPoster3 citations
- TiNO-Edit: Timestep and Noise Optimization for Robust Diffusion-Based Image EditingPoster3 citations
- Time-Efficient Light-Field Acquisition Using Coded Aperture and EventsPoster3 citations
- Towards Automated Movie Trailer GenerationPoster3 citations
- Towards HDR and HFR Video from Rolling-Mixed-Bit SpikingsPoster3 citations
- Towards a Perceptual Evaluation Framework for Lighting EstimationPoster3 citations
- Unifying Automatic and Interactive Matting with Pretrained ViTsPoster3 citations
- Universal Robustness via Median Randomized Smoothing for Real-World Super-ResolutionPoster3 citations
- Unmixing Before Fusion: A Generalized Paradigm for Multi-Source-based Hyperspectral Image SynthesisPoster3 citations
- Unsupervised Gaze Representation Learning from Multi-view Face ImagesPoster3 citations
- VINECS: Video-based Neural Character SkinningPoster3 citations
- VS: Reconstructing Clothed 3D Human from Single Image via Vertex ShiftPoster3 citations
- WildlifeMapper: Aerial Image Analysis for Multi-Species Detection and IdentificationPoster3 citations
- Your Student is Better Than Expected: Adaptive Teacher-Student Collaboration for Text-Conditional Diffusion ModelsPoster3 citations
- Zero-Shot Structure-Preserving Diffusion Model for High Dynamic Range Tone MappingHighlight3 citations
- 3D Face Tracking from 2D Video through Iterative Dense UV to Image FlowPoster2 citations
- 3DFIRES: Few Image 3D REconstruction for Scenes with Hidden SurfacesPoster2 citations
- 3DToonify: Creating Your High-Fidelity 3D Stylized Avatar Easily from 2D Portrait ImagesPoster2 citations
- A Category Agnostic Model for Visual RearrangmentPoster2 citations
- A Subspace-Constrained Tyler's Estimator and its Applications to Structure from MotionPoster2 citations
- A Unified Framework for Human-centric Point Cloud Video UnderstandingPoster2 citations
- A-Teacher: Asymmetric Network for 3D Semi-Supervised Object DetectionPoster2 citations
- A2XP: Towards Private Domain GeneralizationPoster2 citations
- ADFactory: An Effective Framework for Generalizing Optical Flow with NeRFPoster2 citations
- AETTA: Label-Free Accuracy Estimation for Test-Time AdaptationPoster2 citations
- AUEditNet: Dual-Branch Facial Action Unit Intensity Manipulation with Implicit DisentanglementPoster2 citations
- Absolute Pose from One or Two Scaled and Oriented FeaturesHighlight2 citations
- Accurate Training Data for Occupancy Map Prediction in Automated Driving Using Evidence TheoryPoster2 citations
- ActiveDC: Distribution Calibration for Active FinetuningPoster2 citations
- Adversarial Distillation Based on Slack Matching and Attribution Region AlignmentPoster2 citations
- Aerial Lifting: Neural Urban Semantic and Building Instance Lifting from Aerial ImageryPoster2 citations
- Attack To Defend: Exploiting Adversarial Attacks for Detecting Poisoned ModelsPoster2 citations
- Benchmarking Segmentation Models with Mask-Preserved Attribute EditingPoster2 citations
- Benchmarking the Robustness of Temporal Action Detection Models Against Temporal CorruptionsPoster2 citations
- BiTT: Bi-directional Texture Reconstruction of Interacting Two Hands from a Single ImagePoster2 citations
- Boosting Self-Supervision for Single-View Scene Completion via Knowledge DistillationPoster2 citations
- Bridging the Gap Between End-to-End and Two-Step Text SpottingPoster2 citations
- C3Net: Compound Conditioned ControlNet for Multimodal Content GenerationPoster2 citations
- CAPE: CAM as a Probabilistic Ensemble for Enhanced DNN InterpretationPoster2 citations
- CMA: A Chromaticity Map Adapter for Robust Detection of Screen-Recapture Document ImagesPoster2 citations
- Close Imitation of Expert Retouching for Black-and-White PhotographyPoster2 citations
- CodedEvents: Optimal Point-Spread-Function Engineering for 3D-Tracking with Event CamerasPoster2 citations
- Compositional Video Understanding with Spatiotemporal Structure-based TransformersPoster2 citations
- ConCon-Chi: Concept-Context Chimera Benchmark for Personalized Vision-Language TasksPoster2 citations
- Cross-spectral Gated-RGB Stereo Depth EstimationHighlight2 citations
- CurveCloudNet: Processing Point Clouds with 1D StructurePoster2 citations
- CycleINR: Cycle Implicit Neural Representation for Arbitrary-Scale Volumetric Super-Resolution of Medical DataPoster2 citations
- DPMesh: Exploiting Diffusion Prior for Occluded Human Mesh RecoveryPoster2 citations
- Density-guided Translator Boosts Synthetic-to-Real Unsupervised Domain Adaptive Segmentation of 3D Point CloudsPoster2 citations
- Differentiable Point-based Inverse RenderingPoster2 citations
- Dispersed Structured Light for Hyperspectral 3D ImagingPoster2 citations
- Domain Separation Graph Neural Networks for Saliency Object RankingPoster2 citations
- Dr.Hair: Reconstructing Scalp-Connected Hair Strands without Pre-Training via Differentiable Rendering of Line SegmentsHighlight2 citations
- EFormer: Enhanced Transformer towards Semantic-Contour Features of Foreground for Portraits MattingPoster2 citations
- ES3: Evolving Self-Supervised Learning of Robust Audio-Visual Speech RepresentationsPoster2 citations
- EVS-assisted Joint Deblurring Rolling-Shutter Correction and Video Frame Interpolation through Sensor Inverse ModelingPoster2 citations
- Efficient Multitask Dense Predictor via BinarizationPoster2 citations
- Efficient Privacy-Preserving Visual Localization Using 3D Ray CloudsPoster2 citations
- FaceLift: Semi-supervised 3D Facial Landmark LocalizationPoster2 citations
- Fine-Grained Bipartite Concept Factorization for ClusteringPoster2 citations
- Flexible Biometrics Recognition: Bridging the Multimodality Gap through Attention Alignment and Prompt TuningPoster2 citations
- Flexible Depth Completion for Sparse and Varying Point DensitiesPoster2 citations
- Flow-Guided Online Stereo Rectification for Wide Baseline StereoPoster2 citations
- FreeMan: Towards Benchmarking 3D Human Pose Estimation under Real-World ConditionsPoster2 citations
- From Activation to Initialization: Scaling Insights for Optimizing Neural FieldsHighlight2 citations
- From Variance to Veracity: Unbundling and Mitigating Gradient Variance in Differentiable Bundle Adjustment LayersPoster2 citations
- Fully Convolutional Slice-to-Volume Reconstruction for Single-Stack MRIPoster2 citations
- G-FARS: Gradient-Field-based Auto-Regressive Sampling for 3D Part GroupingPoster2 citations
- Generating Non-Stationary Textures using Self-RectificationPoster2 citations
- Harnessing Meta-Learning for Improving Full-Frame Video StabilizationPoster2 citations
- Hierarchical Histogram Threshold Segmentation - Auto-terminating High-detail OversegmentationPoster2 citations
- Hierarchical Intra-modal Correlation Learning for Label-free 3D Semantic SegmentationPoster2 citations
- How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?Poster2 citations
- Human Motion Prediction Under Unexpected PerturbationHighlight2 citations
- IBD-SLAM: Learning Image-Based Depth Fusion for Generalizable SLAMPoster2 citations
- ICON: Incremental CONfidence for Joint Pose and Radiance Field OptimizationPoster2 citations
- Implicit Motion FunctionPoster2 citations
- Improving Subject-Driven Image Synthesis with Subject-Agnostic GuidancePoster2 citations
- Improving Visual Recognition with Hyperbolical Visual Hierarchy MappingPoster2 citations
- In-distribution Public Data Synthesis with Diffusion Models for Differentially Private Image ClassificationPoster2 citations
- Infer from What You Have Seen Before: Temporally-dependent Classifier for Semi-supervised Video SegmentationPoster2 citations
- Instance-aware Contrastive Learning for Occluded Human Mesh ReconstructionPoster2 citations
- Intensity-Robust Autofocus for Spike CameraPoster2 citations
- Interpretable Measures of Conceptual Similarity by Complexity-Constrained Descriptive Auto-EncodingPoster2 citations
- Intriguing Properties of Diffusion Models: An Empirical Study of the Natural Attack Capability in Text-to-Image Generative ModelsPoster2 citations
- JRDB-PanoTrack: An Open-world Panoptic Segmentation and Tracking Robotic Dataset in Crowded Human EnvironmentsPoster2 citations
- KP-RED: Exploiting Semantic Keypoints for Joint 3D Shape Retrieval and DeformationPoster2 citations
- LayoutFormer: Hierarchical Text Detection Towards Scene Text UnderstandingPoster2 citations
- LeGO: Leveraging a Surface Deformation Network for Animatable Stylized Face Generation with One ExampleHighlight2 citations
- Learning Group Activity Features Through Person Attribute PredictionPoster2 citations
- Learning SO(3)-Invariant Semantic Correspondence via Local Shape TransformPoster2 citations
- Learning to Produce Semi-dense Correspondences for Visual LocalizationPoster2 citations
- Learning to Select Views for Efficient Multi-View UnderstandingPoster2 citations
- Leveraging Frame Affinity for sRGB-to-RAW Video De-renderingPoster2 citations
- LidaRF: Delving into Lidar for Neural Radiance Field on Street ScenesHighlight2 citations
- MVCPS-NeuS: Multi-view Constrained Photometric Stereo for Neural Surface ReconstructionPoster2 citations
- MarkovGen: Structured Prediction for Efficient Text-to-Image GenerationPoster2 citations
- Masked Spatial Propagation Network for Sparsity-Adaptive Depth RefinementPoster2 citations
- MeshPose: Unifying DensePose and 3D Body Mesh ReconstructionPoster2 citations
- MirageRoom: 3D Scene Segmentation with 2D Pre-trained Models by Mirage ProjectionHighlight2 citations
- MoML: Online Meta Adaptation for 3D Human Motion PredictionPoster2 citations
- MorpheuS: Neural Dynamic 360deg Surface Reconstruction from Monocular RGB-D VideoPoster2 citations
- Motion Blur Decomposition with Cross-shutter GuidancePoster2 citations
- Multi-Session SLAM with Differentiable Wide-Baseline Pose OptimizationPoster2 citations
- Multi-View Attentive Contextualization for Multi-View 3D Object DetectionPoster2 citations
- NB-GTR: Narrow-Band Guided Turbulence RemovalPoster2 citations
- NC-SDF: Enhancing Indoor Scene Reconstruction Using Neural SDFs with View-Dependent Normal CompensationPoster2 citations
- Neural Exposure Fusion for High-Dynamic Range Object DetectionPoster2 citations
- Neural Super-Resolution for Real-time Rendering with Radiance DemodulationPoster2 citations
- Noisy One-point Homographies are Surprisingly GoodPoster2 citations
- Non-autoregressive Sequence-to-Sequence Vision-Language ModelsPoster2 citations
- Normalizing Flows on the Product Space of SO(3) Manifolds for Probabilistic Human Pose ModelingPoster2 citations
- Observation-Guided Diffusion Probabilistic ModelsPoster2 citations
- PAPR in Motion: Seamless Point-level 3D Scene InterpolationHighlight2 citations
- PNeRV: Enhancing Spatial Consistency via Pyramidal Neural Representation for VideosPoster2 citations
- Passive Snapshot Coded Aperture Dual-Pixel RGB-D ImagingPoster2 citations
- Positive-Unlabeled Learning by Latent Group-Aware Meta DisambiguationPoster2 citations
- Pre-training Vision Models with Mandelbulb VariationsPoster2 citations
- Prompt Augmentation for Self-supervised Text-guided Image ManipulationPoster2 citations
- Quantifying Uncertainty in Motion Prediction with Variational Bayesian MixturePoster2 citations
- READ: Retrieval-Enhanced Asymmetric Diffusion for Motion PlanningPoster2 citations
- Ranking Distillation for Open-Ended Video Question Answering with Insufficient LabelsPoster2 citations
- Real-Time Neural BRDF with Spherically Distributed PrimitivesPoster2 citations
- Reconstruction-free Cascaded Adaptive Compressive SensingPoster2 citations
- Regularized Parameter Uncertainty for Improving Generalization in Reinforcement LearningPoster2 citations
- Rethinking Human Motion Prediction with Symplectic IntegralPoster2 citations
- Rolling Shutter Correction with Intermediate Distortion Flow EstimationPoster2 citations
- SCINeRF: Neural Radiance Fields from a Snapshot Compressive ImageHighlight2 citations
- SaCo Loss: Sample-wise Affinity Consistency for Vision-Language Pre-trainingPoster2 citations
- SeNM-VAE: Semi-Supervised Noise Modeling with Hierarchical Variational AutoencoderPoster2 citations
- Self-Calibrating Vicinal Risk Minimisation for Model CalibrationPoster2 citations
- SleepVST: Sleep Staging from Near-Infrared Video Signals using Pre-Trained TransformersHighlight2 citations
- Spatial-Aware Regression for Keypoint LocalizationHighlight2 citations
- Spike-guided Motion Deblurring with Unknown Modal Spatiotemporal AlignmentPoster2 citations
- Stationary Representations: Optimally Approximating Compatibility and Implications for Improved Model ReplacementsHighlight2 citations
- Steganographic Passport: An Owner and User Verifiable Credential for Deep Model IP Protection Without RetrainingPoster2 citations
- Structured Gradient-based Interpretations via Norm-Regularized Adversarial TrainingPoster2 citations
- StyleCineGAN: Landscape Cinemagraph Generation using a Pre-trained StyleGANPoster2 citations
- TULIP: Multi-camera 3D Precision Assessment of Parkinson's DiseasePoster2 citations
- Task-aligned Part-aware Panoptic Segmentation through Joint Object-Part RepresentationsPoster2 citations
- The More You See in 2D the More You Perceive in 3DHighlight2 citations
- ToonerGAN: Reinforcing GANs for Obfuscating Automated Facial IndexingPoster2 citations
- Towards Accurate and Robust Architectures via Neural Architecture SearchPoster2 citations
- Towards Better Vision-Inspired Vision-Language ModelsPoster2 citations
- Towards Robust Learning to Optimize with Theoretical GuaranteesPoster2 citations
- Traffic Scene Parsing through the TSP6K DatasetPoster2 citations
- Transferable and Principled Efficiency for Open-Vocabulary SegmentationPoster2 citations
- Tune-An-Ellipse: CLIP Has Potential to Find What You WantHighlight2 citations
- Tuning Stable Rank Shrinkage: Aiming at the Overlooked Structural Risk in Fine-tuningPoster2 citations
- Uncertainty Visualization via Low-Dimensional Posterior ProjectionsPoster2 citations
- Unsupervised Learning of Category-Level 3D Pose from Object-Centric VideosPoster2 citations
- Versatile Navigation Under Partial Observability via Value-guided Diffusion PolicyPoster2 citations
- WALT3D: Generating Realistic Training Data from Time-Lapse Imagery for Reconstructing Dynamic Objects Under OcclusionPoster2 citations
- WaveMo: Learning Wavefront Modulations to See Through ScatteringPoster2 citations
- Weakly Supervised Video Individual CountingPoster2 citations
- WinSyn: : A High Resolution Testbed for Synthetic DataPoster2 citations
- X-MIC: Cross-Modal Instance Conditioning for Egocentric Action GeneralizationPoster2 citations
- XFibrosis: Explicit Vessel-Fiber Modeling for Fibrosis Staging from Liver Pathology ImagesPoster2 citations
- XScale-NVS: Cross-Scale Novel View Synthesis with Hash Featurized ManifoldPoster2 citations
- Your Transferability Barrier is Fragile: Free-Lunch for Transferring the Non-Transferable LearningHighlight2 citations
- AdaShift: Learning Discriminative Self-Gated Neural Feature Activation With an Adaptive Shift FactorPoster1 citations
- Adaptive Random Feature Regularization on Fine-tuning Deep Neural NetworksPoster1 citations
- AirPlanes: Accurate Plane Estimation via 3D-Consistent EmbeddingsPoster1 citations
- All Rivers Run to the Sea: Private Learning with Asymmetric FlowsPoster1 citations
- Animating General Image with Large Visual Motion ModelPoster1 citations
- AnyScene: Customized Image Synthesis with Composited ForegroundPoster1 citations
- Bayesian Differentiable Physics for Cloth DigitalizationPoster1 citations
- Behind the Veil: Enhanced Indoor 3D Scene Reconstruction with Occluded Surfaces CompletionPoster1 citations
- Benchmarking Audio Visual Segmentation for Long-Untrimmed VideosPoster1 citations
- Brush2Prompt: Contextual Prompt Generator for Object InpaintingPoster1 citations
- CLIPtone: Unsupervised Learning for Text-based Image Tone AdjustmentPoster1 citations
- Capturing Closely Interacted Two-Person Motions with Reaction PriorsPoster1 citations
- CoDe: An Explicit Content Decoupling Framework for Image RestorationPoster1 citations
- Combining Frame and GOP Embeddings for Neural Video RepresentationPoster1 citations
- Continual Learning for Motion Prediction Model via Meta-Representation Learning and Optimal Memory Buffer Retention StrategyPoster1 citations
- CosalPure: Learning Concept from Group Images for Robust Co-Saliency DetectionPoster1 citations
- Coupled Laplacian Eigenmaps for Locally-Aware 3D Rigid Point Cloud MatchingPoster1 citations
- DIMAT: Decentralized Iterative Merging-And-Training for Deep Learning ModelsPoster1 citations
- DITTO: Dual and Integrated Latent Topologies for Implicit 3D ReconstructionPoster1 citations
- Deep Generative Model based Rate-Distortion for Image Downscaling AssessmentPoster1 citations
- Degrees of Freedom Matter: Inferring Dynamics from Point TrajectoriesPoster1 citations
- Density-Adaptive Model Based on Motif Matrix for Multi-Agent Trajectory PredictionPoster1 citations
- DiffPerformer: Iterative Learning of Consistent Latent Guidance for Diffusion-based Human Video GenerationPoster1 citations
- Differentiable Micro-Mesh ConstructionPoster1 citations
- Differentiable Neural Surface Refinement for Modeling Transparent ObjectsPoster1 citations
- Discontinuity-preserving Normal Integration with Auxiliary EdgesPoster1 citations
- ESR-NeRF: Emissive Source Reconstruction Using LDR Multi-view ImagesPoster1 citations
- Efficient Detection of Long Consistent Cycles and its Application to Distributed SynchronizationPoster1 citations
- Efficient Solution of Point-Line Absolute PoseHighlight1 citations
- Enhancing 3D Fidelity of Text-to-3D using Cross-View CorrespondencesPoster1 citations
- Explaining the Implicit Neural Canvas: Connecting Pixels to Neurons by Tracing their ContributionsPoster1 citations
- FISBe: A Real-World Benchmark Dataset for Instance Segmentation of Long-Range Thin Filamentous StructuresPoster1 citations
- FlowerFormer: Empowering Neural Architecture Encoding using a Flow-aware Graph TransformerPoster1 citations
- Fooling Polarization-Based Vision using Locally Controllable Polarizing ProjectionPoster1 citations
- From Correspondences to Pose: Non-minimal Certifiably Optimal Relative Pose without DisambiguationHighlight1 citations
- G-NeRF: Geometry-enhanced Novel View Synthesis from Single-View ImagesPoster1 citations
- GLiDR: Topologically Regularized Graph Generative Network for Sparse LiDAR Point CloudsPoster1 citations
- Generalizable Face Landmarking Guided by Conditional Face WarpingPoster1 citations
- Generating Handwritten Mathematical Expressions From Symbol Graphs: An End-to-End PipelinePoster1 citations
- HardMo: A Large-Scale Hardcase Dataset for Motion CapturePoster1 citations
- IDGuard: Robust General Identity-centric POI Proactive Defense Against Face Editing AbusePoster1 citations
- IPoD: Implicit Field Learning with Point Diffusion for Generalizable 3D Object Reconstruction from Single RGB-D ImagesHighlight1 citations
- IReNe: Instant Recoloring of Neural Radiance FieldsPoster1 citations
- Identifying Important Group of Pixels using InteractionsPoster1 citations
- Ink Dot-Oriented Differentiable Optimization for Neural Image HalftoningPoster1 citations
- Instantaneous Perception of Moving Objects in 3DPoster1 citations
- JDEC: JPEG Decoding via Enhanced Continuous Cosine CoefficientsPoster1 citations
- JoAPR: Cleaning the Lens of Prompt Learning for Vision-Language ModelsPoster1 citations
- Joint-Task Regularization for Partially Labeled Multi-Task LearningPoster1 citations
- LAENeRF: Local Appearance Editing for Neural Radiance FieldsPoster1 citations
- LPSNet: End-to-End Human Pose and Shape Estimation with Lensless ImagingPoster1 citations
- Label-Efficient Group Robustness via Out-of-Distribution Concept CurationPoster1 citations
- Learning Large-Factor EM Image Super-Resolution with Generative PriorsPoster1 citations
- Learning by Correction: Efficient Tuning Task for Zero-Shot Generative Vision-Language ReasoningPoster1 citations
- Learning to Count without AnnotationsPoster1 citations
- Learning to Rank Patches for Unbiased Image Redundancy ReductionPoster1 citations
- LightOctree: Lightweight 3D Spatially-Coherent Indoor Lighting EstimationPoster1 citations
- MPOD123: One Image to 3D Content Generation Using Mask-enhanced Progressive Outline-to-Detail OptimizationPoster1 citations
- MTMMC: A Large-Scale Real-World Multi-Modal Camera Tracking BenchmarkPoster1 citations
- Mean-Shift Feature TransformerPoster1 citations
- Molecular Data Programming: Towards Molecule Pseudo-labeling with Systematic Weak SupervisionPoster1 citations
- Mudslide: A Universal Nuclear Instance Segmentation MethodHighlight1 citations
- Named Entity Driven Zero-Shot Image ManipulationPoster1 citations
- Neighbor Relations Matter in Video Scene DetectionPoster1 citations
- Neural Fields as Distributions: Signal Processing Beyond Euclidean SpacePoster1 citations
- NightCC: Nighttime Color Constancy via Adaptive Channel MaskingPoster1 citations
- Non-Rigid Structure-from-Motion: Temporally-Smooth Procrustean Alignment and Spatially-Variant Deformation ModelingPoster1 citations
- PaReNeRF: Toward Fast Large-scale Dynamic NeRF with Patch-based ReferencePoster1 citations
- PairDETR : Joint Detection and Association of Human Bodies and FacesPoster1 citations
- Pick-or-Mix: Dynamic Channel Sampling for ConvNetsPoster1 citations
- PikeLPN: Mitigating Overlooked Inefficiencies of Low-Precision Neural NetworksPoster1 citations
- PolarRec: Improving Radio Interferometric Data Reconstruction Using Polar CoordinatesPoster1 citations
- Polarization Wavefront Lidar: Learning Large Scene Reconstruction from Polarized WavefrontsPoster1 citations
- Pose-Guided Self-Training with Two-Stage Clustering for Unsupervised Landmark DiscoveryHighlight1 citations
- Pose-Transformed Equivariant Network for 3D Point Trajectory PredictionPoster1 citations
- Practical Measurements of Translucent Materials with Inter-Pixel Translucency PriorPoster1 citations
- Previously on ... From Recaps to Story SummarizationPoster1 citations
- Probabilistic Sampling of Balanced K-Means using Adiabatic Quantum ComputingPoster1 citations
- Projecting Trackable Thermal Patterns for Dynamic Computer VisionPoster1 citations
- Prompt3D: Random Prompt Assisted Weakly-Supervised 3D Object DetectionPoster1 citations
- Revisiting Global Translation Estimation with Feature TracksPoster1 citations
- Robust Self-calibration of Focal Lengths from the Fundamental MatrixPoster1 citations
- SCE-MAE: Selective Correspondence Enhancement with Masked Autoencoder for Self-Supervised Landmark EstimationPoster1 citations
- SNED: Superposition Network Architecture Search for Efficient Video Diffusion ModelPoster1 citations
- SVDTree: Semantic Voxel Diffusion for Single Image Tree ReconstructionPoster1 citations
- Seg2Reg: Differentiable 2D Segmentation to 1D Regression Rendering for 360 Room Layout ReconstructionPoster1 citations
- Self-Supervised Dual ContouringHighlight1 citations
- Self-Supervised Representation Learning from Arbitrary ScenariosPoster1 citations
- Sheared Backpropagation for Fine-tuning Foundation ModelsPoster1 citations
- Snapshot Lidar: Fourier Embedding of Amplitude and Phase for Single-Image Depth ReconstructionPoster1 citations
- StrokeFaceNeRF: Stroke-based Facial Appearance Editing in Neural Radiance FieldPoster1 citations
- Taming the Tail in Class-Conditional GANs: Knowledge Sharing via Unconditional Training at Lower ResolutionsPoster1 citations
- TexOct: Generating Textures of 3D Models with Octree-based DiffusionPoster1 citations
- Text Grouping Adapter: Adapting Pre-trained Text Detector for Layout AnalysisPoster1 citations
- Towards High-fidelity Artistic Image Vectorization via Texture-Encapsulated Shape ParameterizationPoster1 citations
- Towards Robust 3D Pose Transfer with Adversarial LearningPoster1 citations
- Transferable Structural Sparse Adversarial Attack Via Exact Group Sparsity TrainingPoster1 citations
- Unbiased Estimator for Distorted Conics in Camera CalibrationHighlight1 citations
- Unsupervised Salient Instance DetectionPoster1 citations
- VRetouchEr: Learning Cross-frame Feature Interdependence with Imperfection Flow for Face Retouching in VideosPoster1 citations
- Weakly-Supervised Audio-Visual Video Parsing with Prototype-based Pseudo-LabelingPoster1 citations
- A Bayesian Approach to OOD Robustness in Image ClassificationPoster
- Aligning Logits Generatively for Principled Black-Box Knowledge DistillationPoster
- Alpha Invariance: On Inverse Scaling Between Distance and Volume Density in Neural Radiance FieldsPoster
- Beyond Seen Primitive Concepts and Attribute-Object Compositional LearningPoster
- Bootstrapping SparseFormers from Vision Foundation ModelsPoster
- CLOAF: CoLlisiOn-Aware Human FlowPoster
- CORE-MPI: Consistency Object Removal with Embedding MultiPlane ImagePoster
- CURSOR: Scalable Mixed-Order Hypergraph Matching with CUR DecompositionPoster
- Coherence As Texture - Passive Textureless 3D Reconstruction by Self-interferenceHighlight
- Construct to Associate: Cooperative Context Learning for Domain Adaptive Point Cloud SegmentationPoster
- Deep Video Inverse Tone Mapping Based on Temporal CluesPoster
- DiVAS: Video and Audio Synchronization with Dynamic Frame RatesPoster
- Efficient Model Stealing Defense with Noise Transition MatrixPoster
- Efficient Scene Recovery Using Luminous Flux PriorPoster
- Enhancing Intrinsic Features for Debiasing via Investigating Class-Discerning Common Attributes in Bias-Contrastive PairPoster
- Estimating Extreme 3D Image Rotations using Cascaded AttentionPoster
- EvDiG: Event-guided Direct and Global Components SeparationPoster
- Evaluating Transferability in Retrieval Tasks: An Approach Using MMD and Kernel MethodsPoster
- FC-GNN: Recovering Reliable and Accurate Correspondences from InterferencesPoster
- FaceCom: Towards High-fidelity 3D Facial Shape Completion via Optimization and Inpainting GuidancePoster
- Fitting Flats to FlatsPoster
- FocSAM: Delving Deeply into Focused Objects in Segmenting AnythingPoster
- G-HOP: Generative Hand-Object Prior for Interaction Reconstruction and Grasp SynthesisPoster
- GLOW: Global Layout Aware Attacks on Object DetectionPoster
- Gated Fields: Learning Scene Reconstruction from Gated VideosPoster
- Generative Quanta Color ImagingPoster
- HashPoint: Accelerated Point Searching and Sampling for Neural RenderingHighlight
- Hyper-MD: Mesh Denoising with Customized Parameters Aware of Noise Intensity and Geometric CharacteristicsPoster
- Improving Unsupervised Hierarchical Representation with Reinforcement LearningPoster
- In-Context MattingHighlight
- L4D-Track: Language-to-4D Modeling Towards 6-DoF Tracking and Shape Reconstruction in 3D Point Cloud StreamPoster
- LEAD: Exploring Logit Space Evolution for Model SelectionPoster
- Learning for Transductive Threshold Calibration in Open-World RecognitionPoster
- Learning to Remove Wrinkled Transparent Film with Polarized PriorPoster
- Leveraging Camera Triplets for Efficient and Accurate Structure-from-MotionPoster
- MSU-4S - The Michigan State University Four Seasons DatasetPoster
- Mask4Align: Aligned Entity Prompting with Color Masks for Multi-Entity Localization ProblemsPoster
- MaxQ: Multi-Axis Query for N:M Sparsity NetworkPoster
- MoSAR: Monocular Semi-Supervised Model for Avatar Reconstruction using Differentiable ShadingPoster
- Model Adaptation for Time Constrained Embodied ControlPoster
- Neural 3D Strokes: Creating Stylized 3D Scenes with Vectorized 3D StrokesPoster
- Neural Modes: Self-supervised Learning of Nonlinear Modal SubspacesPoster
- Object Dynamics Modeling with Hierarchical Point Cloud-based RepresentationsPoster
- Outdoor Scene Extrapolation with Hierarchical Generative Cellular AutomataHighlight
- Person in Place: Generating Associative Skeleton-Guidance Maps for Human-Object Interaction Image EditingPoster
- Pixel-level Semantic Correspondence through Layout-aware Representation Learning and Multi-scale Matching IntegrationPoster
- Point-VOS: Pointing Up Video Object SegmentationPoster
- PolarMatte: Fully Computational Ground-Truth-Quality Alpha Matte Extraction for Images and Video using Polarized Screen MattingPoster
- PredToken: Predicting Unknown Tokens and Beyond with Coarse-to-Fine Iterative DecodingPoster
- QUADify: Extracting Meshes with Pixel-level Details and Materials from ImagesHighlight
- Real-time Acquisition and Reconstruction of Dynamic Volumes with Neural Structured IlluminationPoster
- RepAn: Enhanced Annealing through Re-parameterizationPoster
- SRTube: Video-Language Pre-Training with Action-Centric Video Tube Features and Semantic Role LabelingPoster
- Selective Nonlinearities Removal from Digital SignalsPoster
- Semantic Line Combination DetectorPoster
- Semantic-Aware Multi-Label Adversarial AttacksPoster
- Structured Model Probing: Empowering Efficient Transfer Learning by Structured RegularizationPoster
- SuperPrimitive: Scene Reconstruction at a Primitive LevelPoster
- SynSP: Synergy of Smoothness and Precision in Pose Sequences RefinementPoster
- Task-Driven Wavelets using Constrained Empirical Risk MinimizationPoster
- Task2Box: Box Embeddings for Modeling Asymmetric Task RelationshipsHighlight
- Text-conditional Attribute Alignment across Latent Spaces for 3D Controllable Face Image SynthesisPoster
- ToNNO: Tomographic Reconstruction of a Neural Network's Output for Weakly Supervised Segmentation of 3D Medical ImagesPoster
- Towards Co-Evaluation of Cameras HDR and Algorithms for Industrial-Grade 6DoF Pose EstimationPoster
- Towards General Robustness Verification of MaxPool-based Convolutional Neural Networks via Tightening Linear ApproximationPoster
- TutteNet: Injective 3D Deformations by Composition of 2D Mesh DeformationsHighlight
- Universal Semi-Supervised Domain Adaptation by Mitigating Common-Class BiasPoster
- Unsupervised 3D Structure Inference from Category-Specific Image CollectionsPoster
- VMINer: Versatile Multi-view Inverse Rendering with Near- and Far-field Light SourcesHighlight
- Video Harmonization with Triplet Spatio-Temporal Variation PatternsPoster
- Viewpoint-Aware Visual Grounding in 3D ScenesPoster
- Your Image is My Video: Reshaping the Receptive Field via Image-To-Video Differentiable AutoAugmentation and FusionPoster
- iToF-flow-based High Frame Rate Depth ImagingPoster
CVPR accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.