CVPR 2024 Accepted Papers
The full list of 2,640 papers accepted at CVPR 2024 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 2,323Highlight: 317
- PACER+: On-Demand Pedestrian Animation Controller in Driving ScenariosPoster15 citations
- PRDP: Proximal Reward Difference Prediction for Large-Scale Reward Finetuning of Diffusion ModelsPoster15 citations
- Permutation Equivariance of Transformers and Its ApplicationsPoster15 citations
- Person-in-WiFi 3D: End-to-End Multi-Person 3D Pose Estimation with Wi-FiPoster15 citations
- Prompt Learning via Meta-RegularizationPoster15 citations
- RankED: Addressing Imbalance and Uncertainty in Edge Detection Using Ranking-based LossesPoster15 citations
- ReGenNet: Towards Human Action-Reaction SynthesisPoster15 citations
- RealCustom: Narrowing Real Text Word for Real-Time Open-Domain Text-to-Image CustomizationPoster15 citations
- RecDiffusion: Rectangling for Image Stitching with Diffusion ModelsPoster15 citations
- Relaxed Contrastive Learning for Federated LearningPoster15 citations
- Relightful Harmonization: Lighting-aware Portrait Background ReplacementPoster15 citations
- Rethinking Prior Information Generation with CLIP for Few-Shot SegmentationPoster15 citations
- Retrieval-Augmented Embodied AgentsPoster15 citations
- Retrieval-Augmented Layout Transformer for Content-Aware Layout GenerationPoster15 citations
- RoHM: Robust Human Motion Reconstruction via DiffusionPoster15 citations
- SUGAR: Pre-training 3D Visual Representations for RoboticsPoster15 citations
- Scaled Decoupled DistillationPoster15 citations
- SelfPose3d: Self-Supervised Multi-Person Multi-View 3d Pose EstimationPoster15 citations
- SimAC: A Simple Anti-Customization Method for Protecting Face Privacy against Text-to-Image Synthesis of Diffusion ModelsPoster15 citations
- StegoGAN: Leveraging Steganography for Non-Bijective Image-to-Image TranslationPoster15 citations
- Text-Guided Variational Image Generation for Industrial Anomaly Detection and SegmentationPoster15 citations
- Time- Memory- and Parameter-Efficient Visual AdaptationHighlight15 citations
- Towards Transferable Targeted 3D Adversarial Attack in the Physical WorldPoster15 citations
- UniMODE: Unified Monocular 3D Object DetectionHighlight15 citations
- Unsupervised Occupancy Learning from Sparse Point CloudHighlight15 citations
- 3D Face Reconstruction with the Geometric Guidance of Facial Part SegmentationHighlight14 citations
- APISR: Anime Production Inspired Real-World Anime Super-ResolutionPoster14 citations
- AV-RIR: Audio-Visual Room Impulse Response EstimationPoster14 citations
- Accurate Spatial Gene Expression Prediction by Integrating Multi-Resolution FeaturesPoster14 citations
- Adapting to Length Shift: FlexiLength Network for Trajectory PredictionPoster14 citations
- Attention Calibration for Disentangled Text-to-Image PersonalizationPoster14 citations
- Can Biases in ImageNet Models Explain Generalization?Poster14 citations
- Can Protective Perturbation Safeguard Personal Data from Being Exploited by Stable Diffusion?Poster14 citations
- Communication-Efficient Collaborative Perception via Information Filling with CodebookPoster14 citations
- Contrastive Mean-Shift Learning for Generalized Category DiscoveryPoster14 citations
- Customize your NeRF: Adaptive Source Driven 3D Scene Editing via Local-Global Iterative TrainingPoster14 citations
- D3still: Decoupled Differential Distillation for Asymmetric Image RetrievalPoster14 citations
- De-Diffusion Makes Text a Strong Cross-Modal InterfacePoster14 citations
- Decomposing Disease Descriptions for Enhanced Pathology Detection: A Multi-Aspect Vision-Language Pre-training FrameworkPoster14 citations
- DifFlow3D: Toward Robust Uncertainty-Aware Scene Flow Estimation with Iterative Diffusion-Based RefinementPoster14 citations
- DiffusionGAN3D: Boosting Text-guided 3D Generation and Domain Adaptation by Combining 3D GANs and Diffusion PriorsPoster14 citations
- ElasticDiffusion: Training-free Arbitrary Size Image Generation through Global-Local Content SeparationPoster14 citations
- Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language ModelsPoster14 citations
- Face2Diffusion for Fast and Editable Face PersonalizationPoster14 citations
- Flatten Long-Range Loss Landscapes for Cross-Domain Few-Shot LearningPoster14 citations
- FreeDrag: Feature Dragging for Reliable Point-based Image EditingPoster14 citations
- From Isolated Islands to Pangea: Unifying Semantic Space for Human Action UnderstandingHighlight14 citations
- GlitchBench: Can Large Multimodal Models Detect Video Game Glitches?Poster14 citations
- GroupContrast: Semantic-aware Self-supervised Representation Learning for 3D UnderstandingPoster14 citations
- HIG: Hierarchical Interlacement Graph Approach to Scene Graph Generation in Video UnderstandingPoster14 citations
- Learning to Rematch Mismatched Pairs for Robust Cross-Modal RetrievalPoster14 citations
- LoS: Local Structure-Guided Stereo MatchingPoster14 citations
- MESA: Matching Everything by Segmenting AnythingPoster14 citations
- MoDE: CLIP Data Experts via ClusteringPoster14 citations
- Mocap Everyone Everywhere: Lightweight Motion Capture With Smartwatches and a Head-Mounted CameraPoster14 citations
- Model Inversion Robustness: Can Transfer Learning Help?Poster14 citations
- Modular Blind Video Quality AssessmentPoster14 citations
- No Time to Train: Empowering Non-Parametric Networks for Few-shot 3D Scene SegmentationHighlight14 citations
- Point Segment and Count: A Generalized Framework for Object CountingPoster14 citations
- Point2CAD: Reverse Engineering CAD Models from 3D Point CloudsHighlight14 citations
- Point2RBox: Combine Knowledge from Synthetic Visual Patterns for End-to-end Oriented Object Detection with Single Point SupervisionPoster14 citations
- ProMark: Proactive Diffusion Watermarking for Causal AttributionPoster14 citations
- ProS: Prompting-to-simulate Generalized knowledge for Universal Cross-Domain RetrievalPoster14 citations
- Probabilistic Speech-Driven 3D Facial Motion Synthesis: New Benchmarks Methods and ApplicationsPoster14 citations
- Referring Image Editing: Object-level Image Editing via Referring ExpressionsPoster14 citations
- Rethinking Few-shot 3D Point Cloud Semantic SegmentationPoster14 citations
- RobustSAM: Segment Anything Robustly on Degraded ImagesHighlight14 citations
- SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language ModelsPoster14 citations
- SPIN: Simultaneous Perception Interaction and NavigationPoster14 citations
- SPOT: Self-Training with Patch-Order Permutation for Object-Centric Learning with Autoregressive TransformersHighlight14 citations
- SchurVINS: Schur Complement-Based Lightweight Visual Inertial Navigation SystemPoster14 citations
- Seeing Motion at Nighttime with an Event CameraPoster14 citations
- Semantics Distortion and Style Matter: Towards Source-free UDA for Panoramic SegmentationPoster14 citations
- Single Domain Generalization for Crowd CountingPoster14 citations
- Sparse Global Matching for Video Frame Interpolation with Large MotionPoster14 citations
- Structure-Guided Adversarial Training of Diffusion ModelsPoster14 citations
- Style Blind Domain Generalized Semantic Segmentation via Covariance Alignment and Semantic Consistence Contrastive LearningPoster14 citations
- Template Free Reconstruction of Human-object Interaction with Procedural Interaction GenerationHighlight14 citations
- Theoretically Achieving Continuous Representation of Oriented Bounding BoxesPoster14 citations
- UniMix: Towards Domain Adaptive and Generalizable LiDAR Semantic Segmentation in Adverse WeatherPoster14 citations
- Unleashing Channel Potential: Space-Frequency Selection Convolution for SAR Object DetectionPoster14 citations
- Unmixing Diffusion for Self-Supervised Hyperspectral Image DenoisingPoster14 citations
- Unveiling Parts Beyond Objects: Towards Finer-Granularity Referring Expression SegmentationPoster14 citations
- Visual Delta Generator with Large Multi-modal Models for Semi-supervised Composed Image RetrievalPoster14 citations
- Z*: Zero-shot Style Transfer via Attention ReweightingPoster14 citations
- ZePT: Zero-Shot Pan-Tumor Segmentation via Query-Disentangling and Self-PromptingPoster14 citations
- 3DInAction: Understanding Human Actions in 3D Point CloudsHighlight13 citations
- 3DiffTection: 3D Object Detection with Geometry-Aware Diffusion FeaturesPoster13 citations
- Are Conventional SNNs Really Efficient? A Perspective from Network QuantizationHighlight13 citations
- Auto-Train-Once: Controller Network Guided Automatic Network Pruning from ScratchPoster13 citations
- Blur-aware Spatio-temporal Sparse Transformer for Video DeblurringPoster13 citations
- Bridging the Synthetic-to-Authentic Gap: Distortion-Guided Unsupervised Domain Adaptation for Blind Image Quality AssessmentPoster13 citations
- CAD: Photorealistic 3D Generation via Adversarial DistillationPoster13 citations
- CPLIP: Zero-Shot Learning for Histopathology with Comprehensive Vision-Language AlignmentPoster13 citations
- Class Incremental Learning with Multi-Teacher DistillationPoster13 citations
- CoDi: Conditional Diffusion Distillation for Higher-Fidelity and Faster Image GenerationPoster13 citations
- Comparing the Decision-Making Mechanisms by Transformers and CNNs via Explanation MethodsPoster13 citations
- CrowdDiff: Multi-hypothesis Crowd Density Estimation using Diffusion ModelsPoster13 citations
- DeIL: Direct-and-Inverse CLIP for Open-World Few-Shot LearningPoster13 citations
- Deep Equilibrium Diffusion Restoration with Parallel SamplingPoster13 citations
- DiffAM: Diffusion-based Adversarial Makeup Transfer for Facial Privacy ProtectionPoster13 citations
- DiffAssemble: A Unified Graph-Diffusion Model for 2D and 3D ReassemblyPoster13 citations
- Domain Prompt Learning with Quaternion NetworksHighlight13 citations
- Enhancing Post-training Quantization Calibration through Contrastive LearningPoster13 citations
- FCS: Feature Calibration and Separation for Non-Exemplar Class Incremental LearningPoster13 citations
- FastMAC: Stochastic Spectral Sampling of Correspondence GraphPoster13 citations
- GLACE: Global Local Accelerated Coordinate EncodingPoster13 citations
- Generating Content for HDR Deghosting from Frequency ViewPoster13 citations
- Generative Latent Coding for Ultra-Low Bitrate Image CompressionPoster13 citations
- Higher-order Relational Reasoning for Pedestrian Trajectory PredictionPoster13 citations
- How Far Can We Compress Instant-NGP-Based NeRF?Poster13 citations
- Improving Depth Completion via Depth Feature UpsamplingPoster13 citations
- Improving Plasticity in Online Continual Learning via Collaborative LearningPoster13 citations
- InstaGen: Enhancing Object Detection by Training on Synthetic DatasetPoster13 citations
- InterHandGen: Two-Hand Interaction Generation via Cascaded Reverse DiffusionPoster13 citations
- Inversion-Free Image Editing with Language-Guided Diffusion ModelsPoster13 citations
- Learning Continual Compatible Representation for Re-indexing Free Lifelong Person Re-identificationPoster13 citations
- Learning Equi-angular Representations for Online Continual LearningPoster13 citations
- Learning Structure-from-Motion with Graph Attention NetworksPoster13 citations
- MVIP-NeRF: Multi-view 3D Inpainting on NeRF Scenes via Diffusion PriorPoster13 citations
- Mind Marginal Non-Crack Regions: Clustering-Inspired Representation Learning for Crack SegmentationPoster13 citations
- NARUTO: Neural Active Reconstruction from Uncertain Target ObservationsPoster13 citations
- NC-TTT: A Noise Constrastive Approach for Test-Time TrainingHighlight13 citations
- Neural Refinement for Absolute Pose Regression with Feature SynthesisPoster13 citations
- Neural Spline Fields for Burst Image Fusion and Layer SeparationPoster13 citations
- NoiseCollage: A Layout-Aware Text-to-Image Diffusion Model Based on Noise Cropping and MergingPoster13 citations
- Not All Prompts Are Secure: A Switchable Backdoor Attack Against Pre-trained Vision TransfomersPoster13 citations
- PIN: Positional Insert Unlocks Object Localisation Abilities in VLMsPoster13 citations
- PTT: Point-Trajectory Transformer for Efficient Temporal 3D Object DetectionPoster13 citations
- Progressive Divide-and-Conquer via Subsampling Decomposition for Accelerated MRIHighlight13 citations
- ProxyCap: Real-time Monocular Full-body Capture in World Space via Human-Centric Proxy-to-Motion LearningPoster13 citations
- RTracker: Recoverable Tracking via PN Tree Structured MemoryPoster13 citations
- Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and BenchmarkHighlight13 citations
- Real-Time Exposure Correction via Collaborative Transformations and Adaptive SamplingPoster13 citations
- RepKPU: Point Cloud Upsampling with Kernel Point Representation and DeformationPoster13 citations
- Rethinking Interactive Image Segmentation with Low Latency High Quality and Diverse PromptsPoster13 citations
- Retrieval-Augmented Open-Vocabulary Object DetectionPoster13 citations
- Riemannian Multinomial Logistics Regression for SPD Neural NetworksPoster13 citations
- S2MVTC: a Simple yet Efficient Scalable Multi-View Tensor ClusteringPoster13 citations
- Scaling Up Video Summarization Pretraining with Large Language ModelsPoster13 citations
- Self-Supervised Facial Representation Learning with Facial Region AwarenessPoster13 citations
- Towards Generalizable Multi-Object TrackingPoster13 citations
- Towards Progressive Multi-Frequency Representation for Image WarpingPoster13 citations
- Towards Variable and Coordinated Holistic Co-Speech Motion GenerationPoster13 citations
- Towards the Uncharted: Density-Descending Feature Perturbation for Semi-supervised Semantic SegmentationPoster13 citations
- UniBind: LLM-Augmented Unified and Balanced Representation Space to Bind Them AllPoster13 citations
- UniGS: Unified Representation for Image Generation and SegmentationPoster13 citations
- Unknown Prompt the only Lacuna: Unveiling CLIP's Potential for Open Domain GeneralizationPoster13 citations
- Unveiling the Power of Audio-Visual Early Fusion Transformers with Dense Interactions through Masked ModelingPoster13 citations
- VOODOO 3D: Volumetric Portrait Disentanglement For One-Shot 3D Head ReenactmentPoster13 citations
- Video Prediction by Modeling Videos as Continuous Multi-Dimensional ProcessesPoster13 citations
- VideoCon: Robust Video-Language Alignment via Contrast CaptionsPoster13 citations
- VideoGrounding-DINO: Towards Open-Vocabulary Spatio-Temporal Video GroundingPoster13 citations
- VideoRF: Rendering Dynamic Radiance Fields as 2D Feature Video StreamsPoster13 citations
- Watermark-embedded Adversarial Examples for Copyright Protection against Diffusion ModelsPoster13 citations
- X-3D: Explicit 3D Structure Modeling for Point Cloud RecognitionPoster13 citations
- 4D-DRESS: A 4D Dataset of Real-World Human Clothing With Semantic AnnotationsHighlight12 citations
- A Pedestrian is Worth One Prompt: Towards Language Guidance Person Re-IdentificationHighlight12 citations
- A Simple and Effective Point-based Network for Event Camera 6-DOFs Pose RelocalizationPoster12 citations
- ADA-Track: End-to-End Multi-Camera 3D Multi-Object Tracking with Alternating Detection and AssociationPoster12 citations
- ASAM: Boosting Segment Anything Model with Adversarial TuningPoster12 citations
- Abductive Ego-View Accident Video Understanding for Safe Driving PerceptionHighlight12 citations
- All in One Framework for Multimodal Re-identification in the WildPoster12 citations
- Arbitrary Motion Style Transfer with Multi-condition Motion Latent Diffusion ModelPoster12 citations
- Clustering for Protein Representation LearningPoster12 citations
- Concept Weaver: Enabling Multi-Concept Fusion in Text-to-Image ModelsPoster12 citations
- Consistency and Uncertainty: Identifying Unreliable Responses From Black-Box Vision-Language Models for Selective Visual Question AnsweringPoster12 citations
- ConvoFusion: Multi-Modal Conversational Diffusion for Co-Speech Gesture SynthesisPoster12 citations
- Cooperation Does Matter: Exploring Multi-Order Bilateral Relations for Audio-Visual SegmentationHighlight12 citations
- Data Poisoning based Backdoor Attacks to Contrastive LearningPoster12 citations
- DetCLIPv3: Towards Versatile Generative Open-vocabulary Object DetectionPoster12 citations
- DiffLoc: Diffusion Model for Outdoor LiDAR LocalizationPoster12 citations
- DiffPortrait3D: Controllable Diffusion for Zero-Shot Portrait View SynthesisHighlight12 citations
- Discriminative Probing and Tuning for Text-to-Image GenerationPoster12 citations
- Distilling CLIP with Dual Guidance for Learning Discriminative Human Body Shape RepresentationPoster12 citations
- Distribution-aware Knowledge Prototyping for Non-exemplar Lifelong Person Re-identificationPoster12 citations
- Diversified and Personalized Multi-rater Medical Image SegmentationHighlight12 citations
- Do Vision and Language Encoders Represent the World Similarly?Poster12 citations
- Doodle Your 3D: From Abstract Freehand Sketches to Precise 3D ShapesPoster12 citations
- DynVideo-E: Harnessing Dynamic NeRF for Large-Scale Motion- and View-Change Human-Centric Video EditingPoster12 citations
- Dynamic LiDAR Re-simulation using Compositional Neural FieldsHighlight12 citations
- ECLIPSE: Efficient Continual Learning in Panoptic Segmentation with Visual Prompt TuningPoster12 citations
- Event-assisted Low-Light Video Object SegmentationPoster12 citations
- EventPS: Real-Time Photometric Stereo Using an Event CameraPoster12 citations
- Exploring Regional Clues in CLIP for Zero-Shot Semantic SegmentationPoster12 citations
- FineParser: A Fine-grained Spatio-temporal Action Parser for Human-centric Action Quality AssessmentPoster12 citations
- From Coarse to Fine-Grained Open-Set RecognitionPoster12 citations
- From-Ground-To-Objects: Coarse-to-Fine Self-supervised Monocular Depth Estimation of Dynamic Objects with Ground Contact PriorPoster12 citations
- GRAM: Global Reasoning for Multi-Page VQAPoster12 citations
- GenN2N: Generative NeRF2NeRF TranslationPoster12 citations
- Genuine Knowledge from Practice: Diffusion Test-Time Adaptation for Video Adverse Weather RemovalPoster12 citations
- Guided Slot Attention for Unsupervised Video Object SegmentationPoster12 citations
- HOI-M^3: Capture Multiple Humans and Objects Interaction within Contextual EnvironmentHighlight12 citations
- Hierarchical Correlation Clustering and Tree Preserving EmbeddingPoster12 citations
- Holo-Relighting: Controllable Volumetric Portrait Relighting from a Single ImagePoster12 citations
- IIRP-Net: Iterative Inference Residual Pyramid Network for Enhanced Image RegistrationPoster12 citations
- Improved Implicit Neural Representation with Fourier Reparameterized TrainingPoster12 citations
- Improving Semantic Correspondence with Viewpoint-Guided Spherical MapsPoster12 citations
- Improving Training Efficiency of Diffusion Models via Multi-Stage Framework and Tailored Multi-Decoder ArchitecturePoster12 citations
- IntrinsicAvatar: Physically Based Inverse Rendering of Dynamic Humans from Monocular Videos via Explicit Ray TracingPoster12 citations
- Joint Reconstruction of 3D Human and Object via Contact-Based Refinement TransformerPoster12 citations
- LDP: Language-driven Dual-Pixel Image Defocus Deblurring NetworkPoster12 citations
- LQMFormer: Language-aware Query Mask Transformer for Referring Image SegmentationPoster12 citations
- LSK3DNet: Towards Effective and Efficient 3D Perception with Large Sparse KernelsPoster12 citations
- Learning to Transform Dynamically for Better Adversarial TransferabilityPoster12 citations
- M3-UDA: A New Benchmark for Unsupervised Domain Adaptive Fetal Cardiac Structure DetectionPoster12 citations
- MANUS: Markerless Grasp Capture using Articulated 3D GaussiansPoster12 citations
- MLP Can Be A Good Transformer LearnerPoster12 citations
- MULDE: Multiscale Log-Density Estimation via Denoising Score Matching for Video Anomaly DetectionPoster12 citations
- Modality-Agnostic Structural Image Representation Learning for Deformable Multi-Modality Medical Image RegistrationHighlight12 citations
- MonoDiff: Monocular 3D Object Detection and Pose Estimation with Diffusion ModelsPoster12 citations
- Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision TransformersPoster12 citations
- ODCR: Orthogonal Decoupling Contrastive Regularization for Unpaired Image DehazingPoster12 citations
- OED: Towards One-stage End-to-End Dynamic Scene Graph GenerationPoster12 citations
- Open-World Human-Object Interaction Detection via Multi-modal PromptsPoster12 citations
- PartDistill: 3D Shape Part Segmentation by Vision-Language Model DistillationPoster12 citations
- Perception-Oriented Video Frame Interpolation via Asymmetric BlendingPoster12 citations
- Perturbing Attention Gives You More Bang for the Buck: Subtle Imaging Perturbations That Efficiently Fool Customized Diffusion ModelsPoster12 citations
- Physical Property Understanding from Language-Embedded Feature FieldsPoster12 citations
- PracticalDG: Perturbation Distillation on Vision-Language Models for Hybrid Domain GeneralizationPoster12 citations
- Progress-Aware Online Action Segmentation for Egocentric Procedural Task VideosPoster12 citations
- Prompt-Driven Dynamic Object-Centric Learning for Single Domain GeneralizationPoster12 citations
- Prompt-Driven Referring Image Segmentation with Instance ContrastingPoster12 citations
- Promptable Behaviors: Personalizing Multi-Objective Rewards from Human PreferencesPoster12 citations
- Purified and Unified Steganographic NetworkPoster12 citations
- REACTO: Reconstructing Articulated Objects from a Single VideoPoster12 citations
- RMem: Restricted Memory Banks Improve Video Object SegmentationPoster12 citations
- Rethinking Generalizable Face Anti-spoofing via Hierarchical Prototype-guided Distribution Refinement in Hyperbolic SpaceHighlight12 citations
- Rethinking the Spatial Inconsistency in Classifier-Free Diffusion GuidancePoster12 citations
- Revisiting Adversarial Training Under Long-Tailed DistributionsPoster12 citations
- Revisiting Single Image Reflection Removal In the WildPoster12 citations
- SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World KnowledgePoster12 citations
- Semantic-aware SAM for Point-Prompted Instance SegmentationHighlight12 citations
- Shadow Generation for Composite Image Using Diffusion ModelPoster12 citations
- Spherical Mask: Coarse-to-Fine 3D Point Cloud Instance Segmentation with Spherical RepresentationPoster12 citations
- T4P: Test-Time Training of Trajectory Prediction via Masked Autoencoder and Actor-specific Token MemoryPoster12 citations
- TEA: Test-time Energy AdaptationPoster12 citations
- The Devil is in the Fine-Grained Details: Evaluating Open-Vocabulary Object Detectors for Fine-Grained UnderstandingHighlight12 citations
- The Manga Whisperer: Automatically Generating Transcriptions for ComicsPoster12 citations
- Towards More Unified In-context Visual UnderstandingPoster12 citations
- Towards Robust 3D Object Detection with LiDAR and 4D Radar Fusion in Various Weather ConditionsPoster12 citations
- Unifying Top-down and Bottom-up Scanpath Prediction Using TransformersPoster12 citations
- Video2Game: Real-time Interactive Realistic and Browser-Compatible Environment from a Single VideoPoster12 citations
- VideoMAC: Video Masked Autoencoders Meet ConvNetsPoster12 citations
- WANDR: Intention-guided Human Motion GenerationPoster12 citations
- 3DSFLabelling: Boosting 3D Scene Flow Estimation by Pseudo Auto-labellingPoster11 citations
- AMU-Tuning: Effective Logit Bias for CLIP-based Few-shot LearningPoster11 citations
- Action Scene Graphs for Long-Form Understanding of Egocentric VideosPoster11 citations
- BIVDiff: A Training-Free Framework for General-Purpose Video Synthesis via Bridging Image and Video Diffusion ModelsPoster11 citations
- CAT: Exploiting Inter-Class Dynamics for Domain Adaptive Object DetectionPoster11 citations
- CLIP-BEVFormer: Enhancing Multi-View Image-Based BEV Detector with Ground Truth FlowPoster11 citations
- Check Locate Rectify: A Training-Free Layout Calibration System for Text-to-Image GenerationPoster11 citations
- Codebook Transfer with Part-of-Speech for Vector-Quantized Image ModelingPoster11 citations
- Contextual Augmented Global Contrast for Multimodal Intent RecognitionPoster11 citations
- Continual-MAE: Adaptive Distribution Masked Autoencoders for Continual Test-Time AdaptationPoster11 citations
- DiverGen: Improving Instance Segmentation by Learning Wider Data Distribution with More Diverse Generative DataPoster11 citations
- DocRes: A Generalist Model Toward Unifying Document Image Restoration TasksPoster11 citations
- Endow SAM with Keen Eyes: Temporal-spatial Prompt Learning for Video Camouflaged Object DetectionPoster11 citations
- EventDance: Unsupervised Source-free Cross-modal Adaptation for Event-based Object RecognitionPoster11 citations
- Exploring the Potential of Large Foundation Models for Open-Vocabulary HOI DetectionPoster11 citations
- Faces that Speak: Jointly Synthesising Talking Face and Speech from TextPoster11 citations
- Feedback-Guided Autonomous DrivingHighlight11 citations
- Garment Recovery with Shape and Deformation PriorsPoster11 citations
- Generate Subgoal Images before Act: Unlocking the Chain-of-Thought Reasoning in Diffusion Model for Robot Manipulation with Multimodal PromptsPoster11 citations
- GenesisTex: Adapting Image Denoising Diffusion to Texture SpacePoster11 citations
- HOIAnimator: Generating Text-prompt Human-object Animations using Novel Perceptive Diffusion ModelsPoster11 citations
- Hierarchical Patch Diffusion Models for High-Resolution Video GenerationPoster11 citations
- ImageNet-D: Benchmarking Neural Network Robustness on Diffusion Synthetic ObjectHighlight11 citations
- Imagine Before Go: Self-Supervised Generative Map for Object Goal NavigationPoster11 citations
- KPConvX: Modernizing Kernel Point Convolution with Kernel AttentionPoster11 citations
- LED: A Large-scale Real-world Paired Dataset for Event Camera DenoisingPoster11 citations
- Learn from View Correlation: An Anchor Enhancement Strategy for Multi-view ClusteringPoster11 citations
- Learning Disentangled Identifiers for Action-Customized Text-to-Image GenerationPoster11 citations
- Learning Visual Prompt for Gait RecognitionPoster11 citations
- Low-Rank Approximation for Sparse Attention in Multi-Modal LLMsPoster11 citations
- Low-power Continuous Remote Behavioral Localization with Event CamerasPoster11 citations
- M&M VTO: Multi-Garment Virtual Try-On and EditingHighlight11 citations
- MOHO: Learning Single-view Hand-held Object Reconstruction with Multi-view Occlusion-Aware SupervisionPoster11 citations
- MimicDiffusion: Purifying Adversarial Perturbation via Mimicking Clean Diffusion ModelPoster11 citations
- Multiway Point Cloud Mosaicking with Diffusion and Global OptimizationPoster11 citations
- NRDF: Neural Riemannian Distance Fields for Learning Articulated Pose PriorsHighlight11 citations
- Narrative Action Evaluation with Prompt-Guided Multimodal InteractionPoster11 citations
- NeRFCodec: Neural Feature Compression Meets Neural Radiance Fields for Memory-Efficient Scene RepresentationPoster11 citations
- Neural Underwater Scene RepresentationPoster11 citations
- OTE: Exploring Accurate Scene Text Recognition Using One TokenPoster11 citations
- Open-Set Domain Adaptation for Semantic SegmentationPoster11 citations
- Orchestrate Latent Expertise: Advancing Online Continual Learning with Multi-Level Supervision and Reverse Self-DistillationPoster11 citations
- PLACE: Adaptive Layout-Semantic Fusion for Semantic Image SynthesisHighlight11 citations
- PanoContext-Former: Panoramic Total Scene Understanding with a TransformerPoster11 citations
- Parameter Efficient Fine-tuning via Cross Block Orchestration for Segment Anything ModelPoster11 citations
- PerAda: Parameter-Efficient Federated Learning Personalization with Generalization GuaranteesPoster11 citations
- Robust Synthetic-to-Real Transfer for Stereo MatchingPoster11 citations
- SG-BEV: Satellite-Guided BEV Fusion for Cross-View Semantic SegmentationHighlight11 citations
- Self-Adaptive Reality-Guided Diffusion for Artifact-Free Super-ResolutionPoster11 citations
- Shadow-Enlightened Image OutpaintingPoster11 citations
- SignGraph: A Sign Sequence is Worth Graphs of NodesPoster11 citations
- Single-to-Dual-View Adaptation for Egocentric 3D Hand Pose EstimationPoster11 citations
- SketchINR: A First Look into Sketches as Implicit Neural RepresentationsPoster11 citations
- Spanning Training Progress: Temporal Dual-Depth Scoring (TDDS) for Enhanced Dataset PruningPoster11 citations
- SportsHHI: A Dataset for Human-Human Interaction Detection in Sports VideosPoster11 citations
- StyLitGAN: Image-Based Relighting via Latent ControlPoster11 citations
- T-VSL: Text-Guided Visual Sound Source Localization in MixturesPoster11 citations
- Taming Self-Training for Open-Vocabulary Object DetectionPoster11 citations
- Task-Driven Exploration: Decoupling and Inter-Task Feedback for Joint Moment Retrieval and Highlight DetectionPoster11 citations
- Text-to-Image Diffusion Models are Great Sketch-Photo MatchmakersPoster11 citations
- Towards Modern Image Manipulation Localization: A Large-Scale Dataset and Novel MethodsPoster11 citations
- Traceable Federated Continual LearningPoster11 citations
- Tyche: Stochastic In-Context Learning for Medical Image SegmentationHighlight11 citations
- URHand: Universal Relightable HandsPoster11 citations
- UV-IDM: Identity-Conditioned Latent Diffusion Model for Face UV-Texture GenerationPoster11 citations
- Uncertainty-aware Action Decoupling Transformer for Action AnticipationHighlight11 citations
- UniHuman: A Unified Model For Editing Human Images in the WildPoster11 citations
- Unified Entropy Optimization for Open-Set Test-Time AdaptationPoster11 citations
- Unlocking Pre-trained Image Backbones for Semantic Image SynthesisPoster11 citations
- Unraveling Instance Associations: A Closer Look for Audio-Visual SegmentationPoster11 citations
- Would Deep Generative Models Amplify Bias in Future Models?Poster11 citations
- A Call to Reflect on Evaluation Practices for Age Estimation: Comparative Analysis of the State-of-the-Art and a Unified BenchmarkPoster10 citations
- A Noisy Elephant in the Room: Is Your Out-of-Distribution Detector Robust to Label Noise?Poster10 citations
- AZ-NAS: Assembling Zero-Cost Proxies for Network Architecture SearchPoster10 citations
- Accept the Modality Gap: An Exploration in the Hyperbolic SpaceHighlight10 citations
- Active Prompt Learning in Vision Language ModelsPoster10 citations
- Adversarial Backdoor Attack by Naturalistic Data Poisoning on Trajectory Prediction in Autonomous DrivingPoster10 citations
- AlignMiF: Geometry-Aligned Multimodal Implicit Field for LiDAR-Camera Joint SynthesisHighlight10 citations
- An Empirical Study of the Generalization Ability of Lidar 3D Object Detectors to Unseen DomainsPoster10 citations
- Audio-Visual Segmentation via Unlabeled Frame ExploitationPoster10 citations
- BEVSpread: Spread Voxel Pooling for Bird's-Eye-View Representation in Vision-based Roadside 3D Object DetectionPoster10 citations
- Bayesian Diffusion Models for 3D Shape ReconstructionPoster10 citations
- Boosting Image Restoration via Priors from Pre-trained ModelsPoster10 citations
- Brain Decodes Deep NetsHighlight10 citations
- CA-Jaccard: Camera-aware Jaccard Distance for Person Re-identificationPoster10 citations
- CPGA: Coding Priors-Guided Aggregation Network for Compressed Video Quality EnhancementPoster10 citations
- CSTA: CNN-based Spatiotemporal Attention for Video SummarizationPoster10 citations
- CaDeT: a Causal Disentanglement Approach for Robust Trajectory Prediction in Autonomous DrivingPoster10 citations
- ChAda-ViT : Channel Adaptive Attention for Joint Representation Learning of Heterogeneous Microscopy ImagesPoster10 citations
- Color Shift Estimation-and-Correction for Image EnhancementPoster10 citations
- Commonsense Prototype for Outdoor Unsupervised 3D Object DetectionPoster10 citations
- Composed Video Retrieval via Enriched Context and Discriminative EmbeddingsPoster10 citations
- DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online RefinementPoster10 citations
- Desigen: A Pipeline for Controllable Design Template GenerationPoster10 citations
- Diffusion-driven GAN Inversion for Multi-Modal Face Image GenerationPoster10 citations
- Doubly Abductive Counterfactual Inference for Text-based Image EditingPoster10 citations
- Draw Step by Step: Reconstructing CAD Construction Sequences from Point Clouds via Multimodal Diffusion.Poster10 citations
- Driving-Video Dehazing with Non-Aligned Regularization for Safety AssistancePoster10 citations
- DyBluRF: Dynamic Neural Radiance Fields from Blurry Monocular VideoPoster10 citations
- Emergent Open-Vocabulary Semantic Segmentation from Off-the-shelf Vision-Language ModelsPoster10 citations
- En3D: An Enhanced Generative Model for Sculpting 3D Humans from 2D Synthetic DataPoster10 citations
- Enhancing Vision-Language Pre-training with Rich SupervisionsHighlight10 citations
- Exploring Efficient Asymmetric Blind-Spots for Self-Supervised Denoising in Real-World ScenariosPoster10 citations
- FedSOL: Stabilized Orthogonal Learning with Proximal Restrictions in Federated LearningPoster10 citations
- FocusMAE: Gallbladder Cancer Detection from Ultrasound Videos with Focused Masked AutoencodersPoster10 citations
- GEARS: Local Geometry-aware Hand-object Interaction SynthesisPoster10 citations
- Gaussian Shadow Casting for Neural CharactersPoster10 citations
- Geometry Transfer for Stylizing Radiance FieldsPoster10 citations
- GraCo: Granularity-Controllable Interactive SegmentationHighlight10 citations
- GreedyViG: Dynamic Axial Graph Construction for Efficient Vision GNNsPoster10 citations
- HumanRef: Single Image to 3D Human Generation via Reference-Guided DiffusionPoster10 citations
- In2SET: Intra-Inter Similarity Exploiting Transformer for Dual-Camera Compressive Hyperspectral ImagingPoster10 citations
- LAKE-RED: Camouflaged Images Generation by Latent Background Knowledge Retrieval-Augmented DiffusionPoster10 citations
- LASIL: Learner-Aware Supervised Imitation Learning For Long-term Microscopic Traffic SimulationPoster10 citations
- Label Propagation for Zero-shot Classification with Vision-Language ModelsPoster10 citations
- Language-guided Image Reflection SeparationPoster10 citations
- Learning Continuous 3D Words for Text-to-Image GenerationPoster10 citations
- Learning Instance-Aware Correspondences for Robust Multi-Instance Point Cloud Registration in Cluttered ScenesPoster10 citations
- Living Scenes: Multi-object Relocalization and Reconstruction in Changing 3D EnvironmentsHighlight10 citations
- Long-Tailed Anomaly Detection with Learnable Class NamesPoster10 citations
- MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image GenerationPoster10 citations
- MaskCLR: Attention-Guided Contrastive Learning for Robust Action Representation LearningPoster10 citations
- MatchU: Matching Unseen Objects for 6D Pose Estimation from RGB-D ImagesPoster10 citations
- Material Palette: Extraction of Materials from a Single ImagePoster10 citations
- Mixed-Precision Quantization for Federated Learning on Resource-Constrained Heterogeneous DevicesPoster10 citations
- Multi-Level Neural Scene Graphs for Dynamic Urban EnvironmentsPoster10 citations
- NEAT: Distilling 3D Wireframes from Neural Attraction FieldsPoster10 citations
- NeRF Analogies: Example-Based Visual Attribute Transfer for NeRFsPoster10 citations
- Neural Directional Encoding for Efficient and Accurate View-Dependent Appearance ModelingHighlight10 citations
- OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video RecognitionPoster10 citations
- One-Shot Structure-Aware Stylized Image SynthesisPoster10 citations
- PSDPM: Prototype-based Secondary Discriminative Pixels Mining for Weakly Supervised Semantic SegmentationPoster10 citations
- Part-aware Unified Representation of Language and Skeleton for Zero-shot Action RecognitionPoster10 citations
- Plug-and-Play Diffusion DistillationPoster10 citations
- PointInfinity: Resolution-Invariant Point Diffusion ModelsPoster10 citations
- RGBD Objects in the Wild: Scaling Real-World 3D Object Learning from RGB-D VideosPoster10 citations
- ReCoRe: Regularized Contrastive Representation Learning of World ModelPoster10 citations
- Referring Expression CountingHighlight10 citations
- SOAC: Spatio-Temporal Overlap-Aware Multi-Sensor Calibration using Neural Radiance FieldsPoster10 citations
- ScanFormer: Referring Expression Comprehension by Iteratively ScanningPoster10 citations
- SeaBird: Segmentation in Bird's View with Dice Loss Improves Monocular 3D Detection of Large ObjectsPoster10 citations
- Single-View Scene Point Cloud Human Grasp GenerationPoster10 citations
- Small Scale Data-Free Knowledge DistillationPoster10 citations
- SnAG: Scalable and Accurate Video GroundingPoster10 citations
- Spatio-Temporal Turbulence Mitigation: A Translational PerspectivePoster10 citations
- Spectral Meets Spatial: Harmonising 3D Shape Matching and InterpolationPoster10 citations
- TTA-EVF: Test-Time Adaptation for Event-based Video Frame Interpolation via Reliable Pixel and Sample EstimationPoster10 citations
- Tackling the Singularities at the Endpoints of Time Intervals in Diffusion ModelsHighlight10 citations
- Tailored Visions: Enhancing Text-to-Image Generation with Personalized Prompt RewritingPoster10 citations
- Targeted Representation Alignment for Open-World Semi-Supervised LearningPoster10 citations
- Test-Time Linear Out-of-Distribution DetectionPoster10 citations
- Text-Guided 3D Face Synthesis - From Generation to EditingPoster10 citations
- Towards 3D Vision with Low-Cost Single-Photon CamerasPoster10 citations
- Training Diffusion Models Towards Diverse Image Generation with Reinforcement LearningPoster10 citations
- UVEB: A Large-scale Benchmark and Baseline Towards Real-World Underwater Video EnhancementPoster10 citations
- UnionFormer: Unified-Learning Transformer with Multi-View Representation for Image Manipulation Detection and LocalizationPoster10 citations
- Unlocking the Potential of Prompt-Tuning in Bridging Generalized and Personalized Federated LearningPoster10 citations
- Unsupervised Blind Image Deblurring Based on Self-EnhancementPoster10 citations
- Video-Based Human Pose Regression via Decoupled Space-Time AggregationPoster10 citations
- VkD: Improving Knowledge Distillation using Orthogonal ProjectionsPoster10 citations
- What Do You See in Vehicle? Comprehensive Vision Solution for In-Vehicle Gaze EstimationPoster10 citations
- X-Adapter: Adding Universal Compatibility of Plugins for Upgraded Diffusion ModelPoster10 citations
- 360+x: A Panoptic Multi-modal Scene Understanding DatasetPoster9 citations
- A Unified Framework for Microscopy Defocus Deblur with Multi-Pyramid Transformer and Contrastive LearningPoster9 citations
- Align Before Adapt: Leveraging Entity-to-Region Alignments for Generalizable Video Action RecognitionPoster9 citations
- An N-Point Linear Solver for Line and Motion Estimation with Event CamerasPoster9 citations
- Anchor-based Robust Finetuning of Vision-Language ModelsPoster9 citations
- Asymmetric Masked Distillation for Pre-Training Small Foundation ModelsPoster9 citations
- AttriHuman-3D: Editable 3D Human Avatar Generation with Attribute Decomposition and IndexingPoster9 citations
- Attribute-Guided Pedestrian Retrieval: Bridging Person Re-ID with Internal Attribute VariabilityPoster9 citations
- Automatic Controllable Colorization via ImaginationPoster9 citations
- Back to 3D: Few-Shot 3D Keypoint Detection with Back-Projected 2D FeaturesPoster9 citations
- Batch Normalization Alleviates the Spectral Bias in Coordinate NetworksPoster9 citations
- Blind Image Quality Assessment Based on Geometric Order LearningPoster9 citations
- CDMAD: Class-Distribution-Mismatch-Aware Debiasing for Class-Imbalanced Semi-Supervised LearningPoster9 citations
- Carve3D: Improving Multi-view Reconstruction Consistency for Diffusion Models with RL FinetuningPoster9 citations
- Causal Mode Multiplexer: A Novel Framework for Unbiased Multispectral Pedestrian DetectionPoster9 citations
- Characteristics Matching Based Hash Codes Generation for Efficient Fine-grained Image RetrievalPoster9 citations
- Collaborating Foundation Models for Domain Generalized Semantic SegmentationPoster9 citations
- Condition-Aware Neural Network for Controlled Image GenerationPoster9 citations
- ConsistDreamer: 3D-Consistent 2D Diffusion for High-Fidelity Scene EditingPoster9 citations
- Cross-Domain Few-Shot Segmentation via Iterative Support-Query Correspondence MiningPoster9 citations
- Cyclic Learning for Binaural Audio Generation and LocalizationPoster9 citations
- DSL-FIQA: Assessing Facial Image Quality via Dual-Set Degradation Learning and Landmark-Guided TransformerPoster9 citations
- DaReNeRF: Direction-aware Representation for Dynamic ScenesPoster9 citations
- Data Valuation and Detections in Federated LearningPoster9 citations
- DeiT-LT: Distillation Strikes Back for Vision Transformer Training on Long-Tailed DatasetsPoster9 citations
- DemoCaricature: Democratising Caricature Generation with a Rough SketchPoster9 citations
- Detours for Navigating Instructional VideosHighlight9 citations
- Differentiable Information Bottleneck for Deterministic Multi-view ClusteringPoster9 citations
- Disentangled Prompt Representation for Domain GeneralizationPoster9 citations
- DreamComposer: Controllable 3D Object Generation via Multi-View ConditionsPoster9 citations
- DriveTrack: A Benchmark for Long-Range Point Tracking in Real-World VideosPoster9 citations
- Eclipse: Disambiguating Illumination and Materials using Unintended ShadowsPoster9 citations
- Efficiently Assemble Normalization Layers and Regularization for Federated Domain GeneralizationPoster9 citations
- Elite360D: Towards Efficient 360 Depth Estimation via Semantic- and Distance-Aware Bi-Projection FusionPoster9 citations
- EventEgo3D: 3D Human Motion Capture from Egocentric Event StreamsPoster9 citations
- Extend Your Own Correspondences: Unsupervised Distant Point Cloud Registration by Progressive Distance ExtensionPoster9 citations
- Few-shot Learner Parameterization by Diffusion Time-stepsPoster9 citations
- FineSports: A Multi-person Hierarchical Sports Video Dataset for Fine-grained Action UnderstandingPoster9 citations
- FlowTrack: Revisiting Optical Flow for Long-Range Dense TrackingPoster9 citations
- Fourier-basis Functions to Bridge Augmentation Gap: Rethinking Frequency Augmentation in Image ClassificationPoster9 citations
- Frozen Feature Augmentation for Few-Shot Image ClassificationPoster9 citations
- GenNBV: Generalizable Next-Best-View Policy for Active 3D ReconstructionPoster9 citations
- Generating Enhanced Negatives for Training Language-Based Object DetectorsPoster9 citations
- Generative Unlearning for Any IdentityPoster9 citations
- Grid Diffusion Models for Text-to-Video GenerationPoster9 citations
- HandBooster: Boosting 3D Hand-Mesh Reconstruction by Conditional Synthesis and Sampling of Hand-Object InteractionsPoster9 citations
- Holoported Characters: Real-time Free-viewpoint Rendering of Humans from Sparse RGB CamerasPoster9 citations
- How to Train Neural Field Representations: A Comprehensive Study and BenchmarkPoster9 citations
- Image-Text Co-Decomposition for Text-Supervised Semantic SegmentationPoster9 citations
- Improving Single Domain-Generalized Object Detection: A Focus on Diversification and AlignmentPoster9 citations
- InNeRF360: Text-Guided 3D-Consistent Object Inpainting on 360-degree Neural Radiance FieldsPoster9 citations
- Initialization Matters for Adversarial Transfer LearningPoster9 citations
- Instruct 4D-to-4D: Editing 4D Scenes as Pseudo-3D Scenes Using 2D DiffusionPoster9 citations
- Interactive3D: Create What You Want by Interactive 3D GenerationPoster9 citations
- KeyPoint Relative Position Encoding for Face RecognitionPoster9 citations
- LAN: Learning to Adapt Noise for Image DenoisingPoster9 citations
- LLM4SGG: Large Language Models for Weakly Supervised Scene Graph GenerationPoster9 citations
- Lane2Seq: Towards Unified Lane Detection via Sequence GenerationPoster9 citations
- LaneCPP: Continuous 3D Lane Detection using Physical PriorsPoster9 citations
- Latency Correction for Event-guided Deblurring and Frame InterpolationPoster9 citations
- Learning CNN on ViT: A Hybrid Model to Explicitly Class-specific Boundaries for Domain AdaptationPoster9 citations
- Learning Dynamic Tetrahedra for High-Quality Talking Head SynthesisPoster9 citations
- Learning Intra-view and Cross-view Geometric Knowledge for Stereo MatchingPoster9 citations
- Learning to Predict Activity Progress by Self-Supervised Video AlignmentPoster9 citations
- Loose Inertial Poser: Motion Capture with IMU-attached Loose-Wear JacketPoster9 citations
- Low-Rank Rescaled Vision Transformer Fine-Tuning: A Residual Design ApproachPoster9 citations
- MAPSeg: Unified Unsupervised Domain Adaptation for Heterogeneous Medical Image Segmentation Based on 3D Masked Autoencoding and Pseudo-LabelingPoster9 citations
- MART: Masked Affective RepresenTation Learning via Masked Temporal Distribution DistillationPoster9 citations
- Making Vision Transformers Truly Shift-EquivariantPoster9 citations
- MoST: Multi-Modality Scene Tokenization for Motion PredictionPoster9 citations
- Morphable Diffusion: 3D-Consistent Diffusion for Single-image Avatar CreationPoster9 citations
- Motion2VecSets: 4D Latent Vector Set Diffusion for Non-rigid Shape Reconstruction and TrackingPoster9 citations
- MultiPly: Reconstruction of Multiple People from Monocular Video in the WildPoster9 citations
- Multimodal Pathway: Improve Transformers with Irrelevant Data from Other ModalitiesPoster9 citations
- NViST: In the Wild New View Synthesis from a Single Image with TransformersPoster9 citations
- OHTA: One-shot Hand Avatar via Data-driven Implicit PriorsPoster9 citations
- Objects as Volumes: A Stochastic Geometry View of Opaque SolidsPoster9 citations
- On the Road to Portability: Compressing End-to-End Motion Planner for Autonomous DrivingPoster9 citations
- OpenStreetView-5M: The Many Roads to Global Visual GeolocationPoster9 citations
- ParamISP: Learned Forward and Inverse ISPs using Camera ParametersPoster9 citations
- Parameter Efficient Self-Supervised Geospatial Domain AdaptationPoster9 citations
- PrPSeg: Universal Proposition Learning for Panoramic Renal Pathology SegmentationPoster9 citations
- Predicated Diffusion: Predicate Logic-Based Attention Guidance for Text-to-Image Diffusion ModelsHighlight9 citations
- Pseudo Label Refinery for Unsupervised Domain Adaptation on Cross-dataset 3D Object DetectionPoster9 citations
- QN-Mixer: A Quasi-Newton MLP-Mixer Model for Sparse-View CT ReconstructionPoster9 citations
- Real-time 3D-aware Portrait Video RelightingHighlight9 citations
- Regressor-Segmenter Mutual Prompt Learning for Crowd CountingPoster9 citations
- SLICE: Stabilized LIME for Consistent Explanations for Image ClassificationHighlight9 citations
- SNIDA: Unlocking Few-Shot Object Detection with Non-linear Semantic Decoupling AugmentationPoster9 citations
- Segment Every Out-of-Distribution ObjectPoster9 citations
- Separating the "Chirp" from the "Chat": Self-supervised Visual Grounding of Sound and LanguagePoster9 citations
- SmartMask: Context Aware High-Fidelity Mask Generation for Fine-grained Object Insertion and Layout ControlPoster9 citations
- SpecNeRF: Gaussian Directional Encoding for Specular ReflectionsHighlight9 citations
- SpikeNeRF: Learning Neural Radiance Fields from Continuous Spike StreamPoster9 citations
- SyncMask: Synchronized Attentional Masking for Fashion-centric Vision-Language PretrainingPoster9 citations
- TIM: A Time Interval Machine for Audio-Visual Action RecognitionPoster9 citations
- TRINS: Towards Multimodal Language Models that Can ReadPoster9 citations
- TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion ModelsPoster9 citations
- TeMO: Towards Text-Driven 3D Stylization for Multi-Object MeshesPoster9 citations
- Temporally Consistent Unbalanced Optimal Transport for Unsupervised Action SegmentationPoster9 citations
- Text-Enhanced Data-free Approach for Federated Class-Incremental LearningPoster9 citations
- Text-guided Explorable Image Super-resolutionPoster9 citations
- Token Transformation Matters: Towards Faithful Post-hoc Explanation for Vision TransformerPoster9 citations
- Towards Effective Usage of Human-Centric Priors in Diffusion Models for Text-based Human Image GenerationPoster9 citations
- Training Like a Medical Resident: Context-Prior Learning Toward Universal Medical Image SegmentationPoster9 citations
- Unbiased Faster R-CNN for Single-source Domain Generalized Object DetectionHighlight9 citations
- Unsupervised Keypoints from Pretrained Diffusion ModelsHighlight9 citations
- VAREN: Very Accurate and Realistic Equine NetworkPoster9 citations
- VecFusion: Vector Font Generation with DiffusionHighlight9 citations
- Versatile Medical Image Segmentation Learned from Multi-Source Datasets via Model Self-DisambiguationPoster9 citations
- Visual Prompting for Generalized Few-shot Segmentation: A Multi-scale ApproachPoster9 citations
- Why Not Use Your Textbook? Knowledge-Enhanced Procedure Planning of Instructional VideosPoster9 citations
- 3D Neural Edge ReconstructionPoster8 citations
- 3D-SceneDreamer: Text-Driven 3D-Consistent Scene GenerationPoster8 citations
- A Physics-informed Low-rank Deep Neural Network for Blind and Universal Lens Aberration CorrectionPoster8 citations
- A Video is Worth 256 Bases: Spatial-Temporal Expectation-Maximization Inversion for Zero-Shot Video EditingPoster8 citations
- ANIM: Accurate Neural Implicit Model for Human Reconstruction from a single RGB-D ImagePoster8 citations
- Action Detection via an Image Diffusion ProcessPoster8 citations
- Adapting Short-Term Transformers for Action Detection in Untrimmed VideosPoster8 citations
- Adaptive VIO: Deep Visual-Inertial Odometry with Online Continual LearningPoster8 citations
- Attention-Propagation Network for Egocentric Heatmap to 3D Pose LiftingHighlight8 citations
- Beyond Average: Individualized Visual Scanpath PredictionPoster8 citations
- Bi-SSC: Geometric-Semantic Bidirectional Fusion for Camera-based 3D Semantic Scene CompletionPoster8 citations
- Bidirectional Autoregessive Diffusion Model for Dance GenerationPoster8 citations
- Building Vision-Language Models on Solid Foundations with Masked DistillationPoster8 citations
- CLIB-FIQA: Face Image Quality Assessment with Confidence CalibrationPoster8 citations
- CLIP-Driven Open-Vocabulary 3D Scene Graph Generation via Cross-Modality Contrastive LearningHighlight8 citations
- C^2RV: Cross-Regional and Cross-View Learning for Sparse-View CBCT ReconstructionPoster8 citations
- Clockwork Diffusion: Efficient Generation With Model-Step DistillationHighlight8 citations
- Collaborative Learning of Anomalies with Privacy (CLAP) for Unsupervised Video Anomaly Detection: A New BaselinePoster8 citations
- Complementing Event Streams and RGB Frames for Hand Mesh ReconstructionPoster8 citations
- Contrastive Learning for DeepFake Classification and Localization via Multi-Label RankingPoster8 citations
- CoralSCOP: Segment any COral Image on this PlanetHighlight8 citations
- CroSel: Cross Selection of Confident Pseudo Labels for Partial-Label LearningPoster8 citations
- CuVLER: Enhanced Unsupervised Object Discoveries through Exhaustive Self-Supervised TransformersPoster8 citations
- Curriculum Point Prompting for Weakly-Supervised Referring Image SegmentationPoster8 citations
- DIRECT-3D: Learning Direct Text-to-3D Generation on Massive Noisy 3D DataPoster8 citations
- DS-NeRV: Implicit Neural Video Representation with Decomposed Static and Dynamic CodesPoster8 citations
- Decentralized Directed Collaboration for Personalized Federated LearningPoster8 citations
- Decompose-and-Compose: A Compositional Approach to Mitigating Spurious CorrelationPoster8 citations
- DiSR-NeRF: Diffusion-Guided View-Consistent Super-Resolution NeRFPoster8 citations
- DiffSCI: Zero-Shot Snapshot Compressive Imaging via Iterative Spectral Diffusion ModelPoster8 citations
- Diffusion-based Blind Text Image Super-ResolutionPoster8 citations
- DiffusionMTL: Learning Multi-Task Denoising Diffusion Model from Partially Annotated DataPoster8 citations
- Distributionally Generative Augmentation for Fair Facial Attribute ClassificationPoster8 citations
- Dr. Bokeh: DiffeRentiable Occlusion-aware Bokeh RenderingPoster8 citations
- Dynamic Cues-Assisted Transformer for Robust Point Cloud RegistrationHighlight8 citations
- Efficient Meshflow and Optical Flow Estimation from Event CamerasPoster8 citations
- Efficient Vision-Language Pre-training by Cluster MaskingPoster8 citations
- Embracing Unimodal Aleatoric Uncertainty for Robust Multimodal FusionPoster8 citations
- Estimating Noisy Class Posterior with Part-level Labels for Noisy Label LearningPoster8 citations
- Fast Adaptation for Human Pose Estimation via Meta-OptimizationPoster8 citations
- FedSelect: Personalized Federated Learning with Customized Selection of Parameters for Fine-TuningPoster8 citations
- Federated Online Adaptation for Deep StereoPoster8 citations
- Finsler-Laplace-Beltrami Operators with Application to Shape AnalysisPoster8 citations
- FlashEval: Towards Fast and Accurate Evaluation of Text-to-image Diffusion Generative ModelsPoster8 citations
- GDA: Generalized Diffusion for Robust Test-time AdaptationPoster8 citations
- GPLD3D: Latent Diffusion of 3D Shape Generative Models by Enforcing Geometric and Physical PriorsPoster8 citations
- GSNeRF: Generalizable Semantic Neural Radiance Fields with Enhanced 3D Scene UnderstandingPoster8 citations
- G^3-LQ: Marrying Hyperbolic Alignment with Explicit Semantic-Geometric Modeling for 3D Visual GroundingPoster8 citations
- GenH2R: Learning Generalizable Human-to-Robot Handover via Scalable Simulation Demonstration and ImitationPoster8 citations
- GeneAvatar: Generic Expression-Aware Volumetric Head Avatar Editing from a Single ImagePoster8 citations
- HiLo: Detailed and Robust 3D Clothed Human Reconstruction with High-and Low-Frequency Information of Parametric ModelsPoster8 citations
- HiPose: Hierarchical Binary Surface Encoding and Correspondence Pruning for RGB-D 6DoF Object Pose EstimationPoster8 citations
- Holistic Features are almost Sufficient for Text-to-Video RetrievalPoster8 citations
- ID-Blau: Image Deblurring by Implicit Diffusion-based reBLurring AUgmentationPoster8 citations
- Instance-Aware Group Quantization for Vision TransformersPoster8 citations
- Instance-level Expert Knowledge and Aggregate Discriminative Attention for Radiology Report GenerationPoster8 citations
- KD-DETR: Knowledge Distillation for Detection Transformer with Consistent Distillation Points SamplingPoster8 citations
- Kandinsky Conformal Prediction: Efficient Calibration of Image Segmentation AlgorithmsPoster8 citations
- Learn to Rectify the Bias of CLIP for Unsupervised Semantic SegmentationPoster8 citations
- Learned Lossless Image Compression based on Bit Plane SlicingPoster8 citations
- Learning Degradation-Independent Representations for Camera ISP PipelinesPoster8 citations
- Learning Inclusion Matching for Animation Paint Bucket ColorizationPoster8 citations
- Learning from Observer Gaze: Zero-Shot Attention Prediction Oriented by Human-Object Interaction RecognitionPoster8 citations
- LiDAR-Net: A Real-scanned 3D Point Cloud Dataset for Indoor ScenesPoster8 citations
- Linguistic-Aware Patch Slimming Framework for Fine-grained Cross-Modal AlignmentPoster8 citations
- LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language ModelHighlight8 citations
- Low-Resource Vision Challenges for Foundation ModelsPoster8 citations
- MRFP: Learning Generalizable Semantic Segmentation from Sim-2-Real with Multi-Resolution Feature PerturbationPoster8 citations
- MV-Adapter: Multimodal Video Transfer Learning for Video Text RetrievalPoster8 citations
- MaGGIe: Masked Guided Gradual Human Instance MattingPoster8 citations
- Make Me a BNN: A Simple Strategy for Estimating Bayesian Uncertainty from Pre-trained ModelsPoster8 citations
- MedBN: Robust Test-Time Adaptation against Malicious Test SamplesPoster8 citations
- MicroDiffusion: Implicit Representation-Guided Diffusion for 3D Reconstruction from Limited 2D Microscopy ProjectionsPoster8 citations
- MoST: Motion Style Transformer Between Diverse Action ContentsPoster8 citations
- Modeling Collaborator: Enabling Subjective Vision Classification With Minimal Human Effort via LLM Tool-UsePoster8 citations
- Multiscale Vision Transformers Meet Bipartite Matching for Efficient Single-stage Action LocalizationPoster8 citations
- NAPGuard: Towards Detecting Naturalistic Adversarial PatchesPoster8 citations
- NTO3D: Neural Target Object 3D Reconstruction with Segment AnythingPoster8 citations
- NeISF: Neural Incident Stokes Field for Geometry and Material EstimationHighlight8 citations
- NeRF-HuGS: Improved Neural Radiance Fields in Non-static Scenes Using Heuristics-Guided SegmentationPoster8 citations
- Neural Implicit Morphing of Face ImagesPoster8 citations
- OVER-NAV: Elevating Iterative Vision-and-Language Navigation with Open-Vocabulary Detection and StructurEd RepresentationPoster8 citations
- Object Pose Estimation via the Aggregation of Diffusion FeaturesHighlight8 citations
- On Scaling Up a Multilingual Vision and Language ModelPoster8 citations
- One-Class Face Anti-spoofing via Spoof Cue Map-Guided Feature LearningPoster8 citations
- Open-Vocabulary Object 6D Pose EstimationHighlight8 citations
- Open-World Semantic Segmentation Including Class SimilarityPoster8 citations
- OrthCaps: An Orthogonal CapsNet with Sparse Attention Routing and PruningPoster8 citations
- PICTURE: PhotorealistIC virtual Try-on from UnconstRained dEsignsPoster8 citations
- PhysPT: Physics-aware Pretrained Transformer for Estimating Human Dynamics from Monocular VideosPoster8 citations
- Puff-Net: Efficient Style Transfer with Pure Content and Style Feature Fusion NetworkPoster8 citations
- RELI11D: A Comprehensive Multimodal Human Motion Dataset and MethodPoster8 citations
- Real-Time Simulated Avatar from Head-Mounted SensorsHighlight8 citations
- Representing Part-Whole Hierarchies in Foundation Models by Learning Localizability Composability and Decomposability from Anatomy via Self SupervisionPoster8 citations
- Rethinking Multi-view Representation Learning via Distilled DisentanglingPoster8 citations
- Rethinking the Evaluation Protocol of Domain GeneralizationPoster8 citations
- Retraining-Free Model Quantization via One-Shot Weight-Coupling LearningPoster8 citations
- SEAS: ShapE-Aligned Supervision for Person Re-IdentificationPoster8 citations
- SI-MIL: Taming Deep MIL for Self-Interpretability in Gigapixel HistopathologyPoster8 citations
- SIGNeRF: Scene Integrated Generation for Neural Radiance FieldsPoster8 citations
- Scalable 3D Registration via Truncated Entry-wise Absolute ResidualsPoster8 citations
- SeMoLi: What Moves Together Belongs TogetherPoster8 citations
- Self-Training Large Language Models for Improved Visual Program Synthesis With Visual ReinforcementPoster8 citations
- Solving the Catastrophic Forgetting Problem in Generalized Category DiscoveryPoster8 citations
- SoundingActions: Learning How Actions Sound from Narrated Egocentric VideosPoster8 citations
- Steerers: A Framework for Rotation Equivariant Keypoint DescriptorsPoster8 citations
- Supervised Anomaly Detection for Complex Industrial ImagesPoster8 citations
- Systematic Comparison of Semi-supervised and Self-supervised Learning for Medical Image ClassificationPoster8 citations
- TetraSphere: A Neural Descriptor for O(3)-Invariant Point Cloud AnalysisPoster8 citations
- The Audio-Visual Conversational Graph: From an Egocentric-Exocentric PerspectivePoster8 citations
- The STVchrono Dataset: Towards Continuous Change Recognition in TimePoster8 citations
- Towards Calibrated Multi-label Deep Neural NetworksPoster8 citations
- Towards Real-World HDR Video Reconstruction: A Large-Scale Benchmark Dataset and A Two-Stage Alignment NetworkPoster8 citations
- Understanding and Improving Source-free Domain Adaptation from a Theoretical PerspectivePoster8 citations
- VTQA: Visual Text Question Answering via Entity Alignment and Cross-Media ReasoningPoster8 citations
- Visual Concept Connectome (VCC): Open World Concept Discovery and their Interlayer Connections in Deep ModelsHighlight8 citations
- WWW: A Unified Framework for Explaining What Where and Why of Neural Networks by Interpretation of Neuron ConceptsPoster8 citations
- Weakly-Supervised Emotion Transition Learning for Diverse 3D Co-speech Gesture GenerationPoster8 citations
- What When and Where? Self-Supervised Spatio-Temporal Grounding in Untrimmed Multi-Action Videos from Narrated InstructionsPoster8 citations
- What You See is What You GAN: Rendering Every Pixel for High-Fidelity Geometry in 3D GANsPoster8 citations
- You Only Need Less Attention at Each Stage in Vision TransformersPoster8 citations
- eTraM: Event-based Traffic Monitoring DatasetHighlight8 citations
- 360Loc: A Dataset and Benchmark for Omnidirectional Visual Localization with Cross-device QueriesPoster7 citations
- 3D Building Reconstruction from Monocular Remote Sensing Images with Multi-level SupervisionsPoster7 citations
- AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech RepresentationHighlight7 citations
- Adapt Before Comparison: A New Perspective on Cross-Domain Few-Shot SegmentationPoster7 citations
- Adapters Strike BackPoster7 citations
- Adaptive Slot Attention: Object Discovery with Dynamic Slot NumberPoster7 citations
- Adversarial Score Distillation: When score distillation meets GANPoster7 citations
- AssistGUI: Task-Oriented PC Graphical User Interface AutomationPoster7 citations
- BEM: Balanced and Entropy-based Mix for Long-Tailed Semi-Supervised LearningPoster7 citations
- Backpropagation-free Network for 3D Test-time AdaptationPoster7 citations
- BiPer: Binary Neural Networks using a Periodic FunctionPoster7 citations
- Binarized Low-light Raw Video EnhancementPoster7 citations
- Byzantine-robust Decentralized Federated Learning via Dual-domain Clustering and Trust BootstrappingPoster7 citations
- CPP-Net: Embracing Multi-Scale Feature Fusion into Deep Unfolding CP-PPA Network for Compressive SensingPoster7 citations
- Closely Interactive Human Reconstruction with Proxemics and Physics-Guided AdaptionPoster7 citations
- Countering Personalized Text-to-Image Generation with Influence WatermarksPoster7 citations
- D3T: Distinctive Dual-Domain Teacher Zigzagging Across RGB-Thermal Gap for Domain-Adaptive Object DetectionPoster7 citations
- DGC-GNN: Leveraging Geometry and Color Cues for Visual Descriptor-Free 2D-3D MatchingPoster7 citations
- DanceCamera3D: 3D Camera Movement Synthesis with Music and DancePoster7 citations
- Decoupled Pseudo-labeling for Semi-Supervised Monocular 3D Object DetectionPoster7 citations
- Defense Against Adversarial Attacks on No-Reference Image Quality Models with Gradient Norm RegularizationPoster7 citations
- Discover and Mitigate Multiple Biased Subgroups in Image ClassifiersPoster7 citations
- Domain Gap Embeddings for Generative Dataset AugmentationPoster7 citations
- Domain-Rectifying Adapter for Cross-Domain Few-Shot SegmentationPoster7 citations
- Effective Video Mirror Detection with Inconsistent Motion CuesPoster7 citations
- Efficient Hyperparameter Optimization with Adaptive Fidelity IdentificationPoster7 citations
- EfficientDreamer: High-Fidelity and Robust 3D Creation via Orthogonal-view Diffusion PriorsPoster7 citations
- Epistemic Uncertainty Quantification For Pre-Trained Neural NetworksPoster7 citations
- Explaining CLIP's Performance Disparities on Data from Blind/Low Vision UsersPoster7 citations
- Exploring the Transferability of Visual Prompting for Multimodal Large Language ModelsHighlight7 citations
- F3Loc: Fusion and Filtering for Floorplan LocalizationHighlight7 citations
- FSRT: Facial Scene Representation Transformer for Face Reenactment from Factorized Appearance Head-pose and Facial Expression FeaturesPoster7 citations
- Fair-VPT: Fair Visual Prompt Tuning for Image ClassificationPoster7 citations
- FedUV: Uniformity and Variance for Heterogeneous Federated LearningPoster7 citations
- Forecasting of 3D Whole-body Human Poses with Grasping ObjectsPoster7 citations
- Fun with Flags: Robust Principal Directions via Flag ManifoldsPoster7 citations
- GAFusion: Adaptive Fusing LiDAR and Camera with Multiple Guidance for 3D Object DetectionPoster7 citations
- GALA: Generating Animatable Layered Assets from a Single ScanPoster7 citations
- Generative 3D Part Assembly via Part-Whole-Hierarchy Message PassingPoster7 citations
- GeoAuxNet: Towards Universal 3D Representation Learning for Multi-sensor Point CloudsPoster7 citations
- Global Latent Neural RenderingPoster7 citations
- GoodSAM: Bridging Domain and Capacity Gaps via Segment Anything Model for Distortion-aware Panoramic Semantic SegmentationPoster7 citations
- HHMR: Holistic Hand Mesh Recovery by Enhancing the Multimodal Controllability of Graph Diffusion ModelsHighlight7 citations
- HMD-Poser: On-Device Real-time Human Motion Tracking from Scalable Sparse ObservationsPoster7 citations
- HumMUSS: Human Motion Understanding using State Space ModelsPoster7 citations
- Hyperbolic Anomaly DetectionPoster7 citations
- I'M HOI: Inertia-aware Monocular Capture of 3D Human-Object InteractionsPoster7 citations
- IQ-VFI: Implicit Quadratic Motion Estimation for Video Frame InterpolationPoster7 citations
- Improving Out-of-Distribution Generalization in Graphs via Hierarchical Semantic EnvironmentsPoster7 citations
- Inverse Rendering of Glossy Objects via the Neural Plenoptic Function and Radiance FieldsPoster7 citations
- Know Your Neighbors: Improving Single-View Reconstruction via Spatial Vision-Language ReasoningPoster7 citations
- L0-Sampler: An L0 Model Guided Volume Sampling for NeRFPoster7 citations
- LAFS: Landmark-based Facial Self-supervised Learning for Face RecognitionPoster7 citations
- LTM: Lightweight Textured Mesh Extraction and Refinement of Large Unbounded Scenes for Efficient Storage and Real-time RenderingPoster7 citations
- Language-driven Object Fusion into Neural Radiance Fields with Pose-Conditioned Dataset UpdatesPoster7 citations
- Large Language Models are Good Prompt Learners for Low-Shot Image ClassificationPoster7 citations
- Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-ResolutionPoster7 citations
- Leveraging Predicate and Triplet Learning for Scene Graph GenerationPoster7 citations
- LiSA: LiDAR Localization with Semantic AwarenessHighlight7 citations
- Logarithmic Lenses: Exploring Log RGB Data for Image ClassificationPoster7 citations
- MCNet: Rethinking the Core Ingredients for Accurate and Efficient Homography EstimationPoster7 citations
- MRC-Net: 6-DoF Pose Estimation with MultiScale Residual CorrelationPoster7 citations
- MS-MANO: Enabling Hand Pose Tracking with Biomechanical ConstraintsPoster7 citations
- Masked and Shuffled Blind Spot Denoising for Real-World ImagesPoster7 citations
- Misalignment-Robust Frequency Distribution Loss for Image TransformationPoster7 citations
- Modeling Multimodal Social Interactions: New Challenges and Baselines with Densely Aligned RepresentationsPoster7 citations
- Move Anything with Layered Scene DiffusionPoster7 citations
- Multi-Object Tracking in the DarkPoster7 citations
- Multi-agent Long-term 3D Human Pose Forecasting via Interaction-aware Trajectory ConditioningHighlight7 citations
- Naturally Supervised 3D Visual Grounding with Language-Regularized Concept LearnersPoster7 citations
- NeRSP: Neural 3D Reconstruction for Reflective Objects with Sparse Polarized ImagesPoster7 citations
- Neural Point Cloud Diffusion for Disentangled 3D Shape and Appearance GenerationPoster7 citations
- Novel Class Discovery for Ultra-Fine-Grained Visual CategorizationHighlight7 citations
- ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and SpottingPoster7 citations
- OmniMotionGPT: Animal Motion Generation with Limited DataPoster7 citations
- On Train-Test Class Overlap and Detection for Image RetrievalPoster7 citations
- On the Estimation of Image-matching Uncertainty in Visual Place RecognitionHighlight7 citations
- PAD: Patch-Agnostic Defense against Adversarial Patch AttacksPoster7 citations
- PH-Net: Semi-Supervised Breast Lesion Segmentation via Patch-wise HardnessPoster7 citations
- Partial-to-Partial Shape Matching with Geometric ConsistencyPoster7 citations
- Personalized Residuals for Concept-Driven Text-to-Image GenerationPoster7 citations
- Pose Adapted Shape Learning for Large-Pose Face ReenactmentPoster7 citations
- Privacy-Preserving Optics for Enhancing Protection in Face De-IdentificationPoster7 citations
- ProMotion: Prototypes As Motion LearnersPoster7 citations
- QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic DecompositionPoster7 citations
- RILA: Reflective and Imaginative Language Agent for Zero-Shot Semantic Audio-Visual NavigationPoster7 citations
- RNb-NeuS: Reflectance and Normal-based Multi-View 3D ReconstructionPoster7 citations
- RadSimReal: Bridging the Gap Between Synthetic and Real Data in Radar Object Detection With SimulationPoster7 citations
- Region-Based Representations RevisitedPoster7 citations
- Revisiting Spatial-Frequency Information Integration from a Hierarchical Perspective for Panchromatic and Multi-Spectral Image FusionPoster7 citations
- Robust Image Denoising through Adversarial Frequency MixupPoster7 citations
- Rotation-Agnostic Image Representation Learning for Digital PathologyPoster7 citations
- SAOR: Single-View Articulated Object ReconstructionPoster7 citations
- Sculpting Holistic 3D Representation in Contrastive Language-Image-3D Pre-trainingPoster7 citations
- Self-Supervised Multi-Object Tracking with Path ConsistencyHighlight7 citations
- Single Mesh Diffusion Models with Field Latents for Texture GenerationPoster7 citations
- Slice3D: Multi-Slice Occlusion-Revealing Single View 3D ReconstructionPoster7 citations
- Spectrum AUC Difference (SAUCD): Human-aligned 3D Shape EvaluationPoster7 citations
- SpiderMatch: 3D Shape Matching with Global Optimality and Geometric ConsistencyPoster7 citations
- StraightPCF: Straight Point Cloud FilteringPoster7 citations
- SurMo: Surface-based 4D Motion Modeling for Dynamic Human RenderingPoster7 citations
- TE-TAD: Towards Full End-to-End Temporal Action Detection via Time-Aligned Coordinate ExpressionPoster7 citations
- TIGER: Time-Varying Denoising Model for 3D Point Cloud Generation with Diffusion ProcessPoster7 citations
- Task-Aware Encoder Control for Deep Video CompressionPoster7 citations
- Test-Time Zero-Shot Temporal Action LocalizationPoster7 citations
- The Devil is in the Details: StyleFeatureEditor for Detail-Rich StyleGAN Inversion and High Quality Image EditingPoster7 citations
- Turb-Seg-Res: A Segment-then-Restore Pipeline for Dynamic Videos with Atmospheric TurbulencePoster7 citations
- UFC-Net: Unrolling Fixed-point Continuous Network for Deep Compressive SensingPoster7 citations
- Unsigned Orthogonal Distance Fields: An Accurate Neural Implicit Representation for Diverse 3D ShapesPoster7 citations
- Weakly Supervised Monocular 3D Detection with a Single-View ImagePoster7 citations
- Weakly Supervised Point Cloud Semantic Segmentation via Artificial OraclePoster7 citations
- 1-Lipschitz Layers Compared: Memory Speed and Certifiable RobustnessPoster6 citations
- 3D LiDAR Mapping in Dynamic Environments using a 4D Implicit Neural RepresentationPoster6 citations
- 3D Multi-frame Fusion for Video StabilizationPoster6 citations
- A General and Efficient Training for Transformer via Token ExpansionPoster6 citations
- A Generative Approach for Wikipedia-Scale Visual Entity RecognitionPoster6 citations
- A Study of Dropout-Induced Modality Bias on Robustness to Missing Video Frames for Audio-Visual Speech RecognitionPoster6 citations
- ALGM: Adaptive Local-then-Global Token Merging for Efficient Semantic Segmentation with Plain Vision TransformersPoster6 citations
- Action-slot: Visual Action-centric Representations for Multi-label Atomic Activity Recognition in Traffic ScenesPoster6 citations
- AdaBM: On-the-Fly Adaptive Bit Mapping for Image Super-ResolutionPoster6 citations
- Adaptive Hyper-graph Aggregation for Modality-Agnostic Federated LearningPoster6 citations
- Affine Equivariant Networks Based on Differential InvariantsPoster6 citations
- Attentive Illumination Decomposition Model for Multi-Illuminant White BalancingPoster6 citations
- Backdoor Defense via Test-Time Detecting and RepairingPoster6 citations
- Benchmarking Implicit Neural Representation and Geometric Rendering in Real-Time RGB-D SLAMPoster6 citations
- Beyond Textual Constraints: Learning Novel Diffusion Conditions with Fewer ExamplesPoster6 citations
- Bilateral Adaptation for Human-Object Interaction Detection with Occlusion-RobustnessPoster6 citations
- Blur2Blur: Blur Conversion for Unsupervised Image Deblurring on Unknown DomainsPoster6 citations
- Boosting Spike Camera Image Reconstruction from a Perspective of Dealing with Spike FluctuationsPoster6 citations
- Bring Event into RGB and LiDAR: Hierarchical Visual-Motion Fusion for Scene FlowPoster6 citations
- CADTalk: An Algorithm and Benchmark for Semantic Commenting of CAD ProgramsHighlight6 citations
- CDFormer: When Degradation Prediction Embraces Diffusion Model for Blind Image Super-ResolutionPoster6 citations
- CGI-DM: Digital Copyright Authentication for Diffusion Models via Contrasting Gradient InversionPoster6 citations
- CHAIN: Enhancing Generalization in Data-Efficient GANs via lipsCHitz continuity constrAIned NormalizationPoster6 citations
- CORES: Convolutional Response-based Score for Out-of-distribution DetectionPoster6 citations
- CVT-xRF: Contrastive In-Voxel Transformer for 3D Consistent Radiance Fields from Sparse InputsPoster6 citations
- Cinematic Behavior Transfer via NeRF-based Differentiable FilmingPoster6 citations
- Classes Are Not Equal: An Empirical Study on Image Recognition FairnessPoster6 citations
- CoG-DQA: Chain-of-Guiding Learning with Large Language Models for Diagram Question AnsweringPoster6 citations
- ColorPCR: Color Point Cloud Registration with Multi-Stage Geometric-Color FusionPoster6 citations
- ConTex-Human: Free-View Rendering of Human from a Single Image with Texture-Consistent SynthesisPoster6 citations
- Constrained Layout Generation with Factor GraphsPoster6 citations
- Continual Segmentation with Disentangled Objectness Learning and Class RecognitionPoster6 citations
- Correcting Diffusion Generation through ResamplingHighlight6 citations
- DART: Implicit Doppler Tomography for Radar Novel View SynthesisPoster6 citations
- DPHMs: Diffusion Parametric Head Models for Depth-based TrackingPoster6 citations
- DREAM: Diffusion Rectification and Estimation-Adaptive ModelsPoster6 citations
- DSGG: Dense Relation Transformer for an End-to-end Scene Graph GenerationPoster6 citations
- Dancing with Still Images: Video Distillation via Static-Dynamic DisentanglementPoster6 citations
- De-confounded Data-free Knowledge Distillation for Handling Distribution ShiftsPoster6 citations
- Depth Prompting for Sensor-Agnostic Depth EstimationPoster6 citations
- DiVa-360: The Dynamic Visual Dataset for Immersive Neural FieldsHighlight6 citations
- DiffSal: Joint Audio and Video Learning for Diffusion Saliency PredictionPoster6 citations
- Diffusion-ES: Gradient-free Planning with Diffusion for Autonomous and Instruction-guided DrivingPoster6 citations
- Dual Prior Unfolding for Snapshot Compressive ImagingPoster6 citations
- Dynamic Policy-Driven Adaptive Multi-Instance Learning for Whole Slide Image ClassificationHighlight6 citations
- ERMVP: Communication-Efficient and Collaboration-Robust Multi-Vehicle Perception in Challenging EnvironmentsPoster6 citations
- EasyDrag: Efficient Point-based Manipulation on Diffusion ModelsPoster6 citations
- Enhancing 3D Object Detection with 2D Detection-Guided Query AnchorsPoster6 citations
- Evidential Active Recognition: Intelligent and Prudent Open-World Embodied PerceptionPoster6 citations
- Exploring Orthogonality in Open World Object DetectionPoster6 citations
- Exploring Region-Word Alignment in Built-in Detector for Open-Vocabulary Object DetectionPoster6 citations
- FLHetBench: Benchmarking Device and State Heterogeneity in Federated LearningPoster6 citations
- FairDeDup: Detecting and Mitigating Vision-Language Fairness Disparities in Semantic Dataset DeduplicationPoster6 citations
- FedHCA2: Towards Hetero-Client Federated Multi-Task LearningPoster6 citations
- FedMef: Towards Memory-efficient Federated Dynamic PruningPoster6 citations
- Flattening the Parent Bias: Hierarchical Semantic Segmentation in the Poincare BallPoster6 citations
- Focus on Hiders: Exploring Hidden Threats for Enhancing Adversarial TrainingPoster6 citations
- Functional DiffusionPoster6 citations
- General Point Model Pretraining with Autoencoding and AutoregressivePoster6 citations
- Generalizing 6-DoF Grasp Detection via Domain Prior KnowledgePoster6 citations
- Grounding and Enhancing Grid-based Models for Neural FieldsPoster6 citations
- Groupwise Query Specialization and Quality-Aware Multi-Assignment for Transformer-based Visual Relationship DetectionPoster6 citations
- Guess The Unseen: Dynamic 3D Scene Reconstruction from Partial 2D GlimpsesPoster6 citations
- HoloVIC: Large-scale Dataset and Benchmark for Multi-Sensor Holographic Intersection and Vehicle-Infrastructure CooperativePoster6 citations
- Hyperbolic Learning with Synthetic Captions for Open-World DetectionPoster6 citations
- Image Neural Field Diffusion ModelsHighlight6 citations
- Improving Bird's Eye View Semantic Segmentation by Task DecompositionPoster6 citations
- Improving Transferable Targeted Adversarial Attacks with Model Self-EnhancementPoster6 citations
- Instance-aware Exploration-Verification-Exploitation for Instance ImageGoal NavigationPoster6 citations
- Investigating Compositional Challenges in Vision-Language Models for Visual GroundingHighlight6 citations
- Joint2Human: High-Quality 3D Human Generation via Compact Spherical Embedding of 3D JointsPoster6 citations
- Learning Spatial Features from Audio-Visual Correspondence in Egocentric VideosPoster6 citations
- Learning to Segment Referred Objects from Narrated Egocentric VideosPoster6 citations
- Lift3D: Zero-Shot Lifting of Any 2D Vision Model to 3DPoster6 citations
- Look-Up Table Compression for Efficient Image RestorationHighlight6 citations
- MCPNet: An Interpretable Classifier via Multi-Level Concept PrototypesPoster6 citations
- MR-VNet: Media Restoration using Volterra NetworksPoster6 citations
- Make-It-Vivid: Dressing Your Animatable Biped Cartoon Characters from TextPoster6 citations
- Makeup Prior Models for 3D Facial Makeup Estimation and ApplicationsPoster6 citations
- Making Visual Sense of Oracle Bones for You and MePoster6 citations
- Mitigating Noisy Correspondence by Geometrical Structure Consistency LearningPoster6 citations
- Modality-Collaborative Test-Time Adaptation for Action RecognitionPoster6 citations
- Multiagent Multitraversal Multimodal Self-Driving: Open MARS DatasetPoster6 citations
- Multimodal Sense-Informed Forecasting of 3D Human MotionsPoster6 citations
- NECA: Neural Customizable Human AvatarPoster6 citations
- NIVeL: Neural Implicit Vector Layers for Text-to-Vector GenerationPoster6 citations
- Navigate Beyond Shortcuts: Debiased Learning Through the Lens of Neural CollapseHighlight6 citations
- NeRF Director: Revisiting View Selection in Neural Volume RenderingPoster6 citations
- Neural LineagePoster6 citations
- ODIN: A Single Model for 2D and 3D SegmentationHighlight6 citations
- Object Recognition as Next Token PredictionHighlight6 citations
- Once for Both: Single Stage of Importance and Sparsity Search for Vision Transformer CompressionPoster6 citations
- PDF: A Probability-Driven Framework for Open World 3D Point Cloud Semantic SegmentationPoster6 citations
- PELA: Learning Parameter-Efficient Models with Low-Rank ApproximationPoster6 citations
- PFStorer: Personalized Face Restoration and Super-ResolutionPoster6 citations
- PKU-DyMVHumans: A Multi-View Video Benchmark for High-Fidelity Dynamic Human ModelingPoster6 citations
- POPDG: Popular 3D Dance Generation with PopDanceSetPoster6 citations
- PairAug: What Can Augmented Image-Text Pairs Do for Radiology?Poster6 citations
- PixelRNN: In-pixel Recurrent Neural Networks for End-to-end-optimized Perception with Neural SensorsPoster6 citations
- PlatoNeRF: 3D Reconstruction in Plato's Cave via Single-View Two-Bounce LidarPoster6 citations
- R-Cyclic Diffuser: Reductive and Cyclic Latent Diffusion for 3D Clothed Human DigitalizationPoster6 citations
- Realigning Confidence with Temporal Saliency Information for Point-Level Weakly-Supervised Temporal Action LocalizationPoster6 citations
- Relation Rectification in Diffusion ModelPoster6 citations
- Resource-Efficient Transformer Pruning for Finetuning of Large ModelsPoster6 citations
- Revisiting Sampson Approximations for Geometric Estimation ProblemsPoster6 citations
- RoDLA: Benchmarking the Robustness of Document Layout Analysis ModelsPoster6 citations
- Robust Noisy Correspondence Learning with Equivariant Similarity ConsistencyPoster6 citations
- SANeRF-HQ: Segment Anything for NeRF in High QualityPoster6 citations
- SD2Event:Self-supervised Learning of Dynamic Detectors and Contextual Descriptors for Event CamerasPoster6 citations
- SHINOBI: Shape and Illumination using Neural Object Decomposition via BRDF Optimization In-the-wildPoster6 citations
- Seeing Unseen: Discover Novel Biomedical Concepts via Geometry-Constrained Probabilistic ModelingPoster6 citations
- Selectively Informative Description can Reduce Undesired Embedding Entanglements in Text-to-Image PersonalizationPoster6 citations
- Sparse Views Near Light: A Practical Paradigm for Uncalibrated Point-light Photometric StereoPoster6 citations
- Split to Merge: Unifying Separated Modalities for Unsupervised Domain AdaptationPoster6 citations
- SuperNormal: Neural Surface Reconstruction via Multi-View Normal IntegrationPoster6 citations
- TASeg: Temporal Aggregation Network for LiDAR Semantic SegmentationPoster6 citations
- TULIP: Transformer for Upsampling of LiDAR Point CloudsPoster6 citations
- TexTile: A Differentiable Metric for Texture TileabilityPoster6 citations
- Towards Backward-Compatible Continual Learning of Image CompressionPoster6 citations
- Towards Understanding and Improving Adversarial Robustness of Vision TransformersPoster6 citations
- Training Vision Transformers for Semi-Supervised Semantic SegmentationPoster6 citations
- Understanding Video Transformers via Universal Concept DiscoveryHighlight6 citations
- Unifying Correspondence Pose and NeRF for Generalized Pose-Free Novel View SynthesisHighlight6 citations
- Universal Novelty Detection Through Adaptive Contrastive LearningPoster6 citations
- Unsupervised Semantic Segmentation Through Depth-Guided Feature Correlation and SamplingPoster6 citations
- Unsupervised Video Domain Adaptation with Masked Pre-Training and Collaborative Self-TrainingPoster6 citations
- Utility-Fairness Trade-Offs and How to Find ThemPoster6 citations
- Video Frame Interpolation via Direct Synthesis with the Event-based ReferencePoster6 citations
- View-Category Interactive Sharing Transformer for Incomplete Multi-View Multi-Label LearningHighlight6 citations
- Virtual Immunohistochemistry Staining for Histological Images Assisted by Weakly-supervised LearningPoster6 citations
- WaveFace: Authentic Face Restoration with Efficient Frequency RecoveryPoster6 citations
- Weakly Misalignment-free Adaptive Feature Alignment for UAVs-based Multimodal Object DetectionPoster6 citations
- What How and When Should Object Detectors Update in Continually Changing Test Domains?Poster6 citations
- Wired Perspectives: Multi-View Wire Art Embraces Generative AIPoster6 citations
- 3D-LFM: Lifting Foundation ModelPoster5 citations
- A Stealthy Wrongdoer: Feature-Oriented Reconstruction Attack against Split LearningPoster5 citations
- A Unified Diffusion Framework for Scene-aware Human Motion Estimation from Sparse SignalsPoster5 citations
- A Unified and Interpretable Emotion Representation and Expression GenerationPoster5 citations
- AAMDM: Accelerated Auto-regressive Motion Diffusion ModelPoster5 citations
- Accelerating Neural Field Training via Soft MiningPoster5 citations
- Active Object Detection with Knowledge Aggregation and Distillation from Large ModelsPoster5 citations
- Adaptive Softassign via Hadamard-Equipped SinkhornPoster5 citations
- Advancing Saliency Ranking with Human Fixations: Dataset Models and BenchmarksPoster5 citations
- An Empirical Study of Scaling Law for Scene Text RecognitionPoster5 citations
- Authentic Hand Avatar from a Phone Scan via Universal Hand ModelPoster5 citations
- Bilateral Event Mining and Complementary for Event Stream Super-ResolutionPoster5 citations
- BilevelPruning: Unified Dynamic and Static Channel Pruning for Convolutional Neural NetworksPoster5 citations
- BodyMAP - Jointly Predicting Body Mesh and 3D Applied Pressure Map for People in BedPoster5 citations
- Boosting Flow-based Generative Super-Resolution Models via Learned PriorPoster5 citations
- Bootstrapping Chest CT Image Understanding by Distilling Knowledge from X-ray Expert ModelsPoster5 citations
- Causal-CoG: A Causal-Effect Look at Context Generation for Boosting Multi-modal Language ModelsHighlight5 citations
- Coherent Temporal Synthesis for Incremental Action SegmentationPoster5 citations
- Confronting Ambiguity in 6D Object Pose Estimation via Score-Based Diffusion on SE(3)Poster5 citations
- Continuous Optical Zooming: A Benchmark for Arbitrary-Scale Image Super-Resolution in Real WorldPoster5 citations
- Continuous Pose for Monocular Cameras in Neural Implicit RepresentationPoster5 citations
- Correspondence-Free Non-Rigid Point Set Registration Using Unsupervised Clustering AnalysisHighlight5 citations
- Cross-Dimension Affinity Distillation for 3D EM Neuron SegmentationPoster5 citations
- Cross-view and Cross-pose Completion for 3D Human UnderstandingPoster5 citations
- CrossMAE: Cross-Modality Masked Autoencoders for Region-Aware Audio-Visual Pre-TrainingPoster5 citations
- DVMNet: Computing Relative Pose for Unseen Objects Beyond HypothesesPoster5 citations
- Data-Efficient Multimodal Fusion on a Single GPUHighlight5 citations
- Data-Efficient Unsupervised Interpolation Without Any Intermediate Frame for 4D Medical ImagesPoster5 citations
- Day-Night Cross-domain Vehicle Re-identificationPoster5 citations
- Deciphering 'What' and 'Where' Visual Pathways from Spectral Clustering of Layer-Distributed Neural RepresentationsHighlight5 citations
- DeconfuseTrack: Dealing with Confusion for Multi-Object TrackingPoster5 citations
- Deformable One-shot Face Stylization via DINO Semantic GuidancePoster5 citations
- Dense Vision Transformer Compression with Few SamplesPoster5 citations
- Descriptor and Word Soups: Overcoming the Parameter Efficiency Accuracy Tradeoff for Out-of-Distribution Few-shot LearningPoster5 citations
- DiLiGenRT: A Photometric Stereo Dataset with Quantified Roughness and TranslucencyPoster5 citations
- DiffHuman: Probabilistic Photorealistic 3D Reconstruction of HumansPoster5 citations
- DiffInDScene: Diffusion-based High-Quality 3D Indoor Scene GenerationPoster5 citations
- Diffeomorphic Template Registration for Atmospheric Turbulence MitigationHighlight5 citations
- Diffusion-FOF: Single-View Clothed Human Reconstruction via Diffusion-Based Fourier Occupancy FieldPoster5 citations
- Discovering Syntactic Interaction Clues for Human-Object Interaction DetectionPoster5 citations
- Distraction is All You Need: Memory-Efficient Image Immunization against Diffusion-Based Image EditingHighlight5 citations
- Diversity-aware Channel Pruning for StyleGAN CompressionPoster5 citations
- DualAD: Disentangling the Dynamic and Static World for End-to-End DrivingPoster5 citations
- E-GPS: Explainable Geometry Problem Solving via Top-Down Solver and Bottom-Up GeneratorPoster5 citations
- EASE-DETR: Easing the Competition among Object QueriesPoster5 citations
- Efficient 3D Implicit Head Avatar with Mesh-anchored Hash Table BlendshapesPoster5 citations
- Enhanced Motion-Text Alignment for Image-to-Video Transfer LearningPoster5 citations
- Enhancing Visual Continual Learning with Language-Guided SupervisionPoster5 citations
- Event-based Structure-from-OrbitHighlight5 citations
- Exploring Vision Transformers for 3D Human Motion-Language Models with Motion PatchesPoster5 citations
- Extreme Point Supervised Instance SegmentationPoster5 citations
- FFF: Fixing Flawed Foundations in Contrastive Pre-Training Results in Very Strong Vision-Language ModelsPoster5 citations
- Finding Lottery Tickets in Vision Models via Data-driven Spectral Foresight PruningPoster5 citations
- FreePoint: Unsupervised Point Cloud Instance SegmentationPoster5 citations
- From Feature to Gaze: A Generalizable Replacement of Linear Layer for Gaze EstimationHighlight5 citations
- Fully Exploiting Every Real Sample: SuperPixel Sample Gradient Model StealingPoster5 citations
- G3DR: Generative 3D Reconstruction in ImageNetPoster5 citations
- GLID: Pre-training a Generalist Encoder-Decoder Vision ModelPoster5 citations
- Generative Powers of TenHighlight5 citations
- Geometrically-driven Aggregation for Zero-shot 3D Point Cloud UnderstandingHighlight5 citations
- Global and Hierarchical Geometry Consistency Priors for Few-shot NeRFs in Indoor ScenesPoster5 citations
- Going Beyond Multi-Task Dense Prediction with Synergy Embedding ModelsPoster5 citations
- HEAL-SWIN: A Vision Transformer On The SpherePoster5 citations
- HPL-ESS: Hybrid Pseudo-Labeling for Unsupervised Event-based Semantic SegmentationPoster5 citations
- Hybrid Functional Maps for Crease-Aware Non-Isometric Shape MatchingPoster5 citations
- Hyperspherical Classification with Dynamic Label-to-Prototype AssignmentPoster5 citations
- Improved Self-Training for Test-Time AdaptationPoster5 citations
- Improving Graph Contrastive Learning via Adaptive Positive SamplingPoster5 citations
- Improving Spectral Snapshot Reconstruction with Spectral-Spatial RectificationPoster5 citations
- Instance-based Max-margin for Practical Few-shot RecognitionPoster5 citations
- JRDB-Social: A Multifaceted Robotic Dataset for Understanding of Context and Dynamics of Human Interactions Within Social GroupsPoster5 citations
- Jointly Training and Pruning CNNs via Learnable Agent Guidance and AlignmentPoster5 citations
- LAMP: Learn A Motion Pattern for Few-Shot Video GenerationPoster5 citations
- LORS: Low-rank Residual Structure for Parameter-Efficient Network StackingHighlight5 citations
- LOTUS: Evasive and Resilient Backdoor Attacks through Sub-PartitioningPoster5 citations
- LTA-PCS: Learnable Task-Agnostic Point Cloud SamplingPoster5 citations
- Laplacian-guided Entropy Model in Neural Codec with Blur-dissipated SynthesisPoster5 citations
- Layout-Agnostic Scene Text Image Synthesis with Diffusion ModelsPoster5 citations
- Learnable Earth Parser: Discovering 3D Prototypes in Aerial ScansPoster5 citations
- Learned Trajectory Embedding for Subspace ClusteringPoster5 citations
- Learning to Control Camera Exposure via Reinforcement LearningPoster5 citations
- Learning to Visually Localize Sound Sources from Mixtures without Prior Source KnowledgePoster5 citations
- Local-consistent Transformation Learning for Rotation-invariant Point Cloud AnalysisPoster5 citations
- Long-Tail Class Incremental Learning via Independent Sub-prototype ConstructionPoster5 citations
- MULTIFLOW: Shifting Towards Task-Agnostic Vision-Language PruningPoster5 citations
- ManiFPT: Defining and Analyzing Fingerprints of Generative ModelsPoster5 citations
- MemoNav: Working Memory Model for Visual NavigationHighlight5 citations
- Memory-based Adapters for Online 3D Scene PerceptionPoster5 citations
- MiKASA: Multi-Key-Anchor & Scene-Aware Transformer for 3D Visual GroundingPoster5 citations
- Mind The Edge: Refining Depth Edges in Sparsely-Supervised Monocular Depth EstimationPoster5 citations
- Mining Supervision for Dynamic Regions in Self-Supervised Monocular Depth EstimationPoster5 citations
- Mitigating Object Dependencies: Improving Point Cloud Self-Supervised Learning through Object ExchangePoster5 citations
- MonoHair: High-Fidelity Hair Modeling from a Monocular VideoPoster5 citations
- MultiPhys: Multi-Person Physics-aware 3D Motion EstimationPoster5 citations
- Multiple View Geometry Transformers for 3D Human Pose EstimationPoster5 citations
- No More Ambiguity in 360deg Room Layout via Bi-Layout EstimationPoster5 citations
- OOSTraj: Out-of-Sight Trajectory Prediction With Vision-Positioning DenoisingPoster5 citations
- On the Faithfulness of Vision Transformer ExplanationsPoster5 citations
- PAIR Diffusion: A Comprehensive Multimodal Object-Level Image EditorPoster5 citations
- PBWR: Parametric-Building-Wireframe Reconstruction from Aerial LiDAR Point CloudsPoster5 citations
- PREGO: Online Mistake Detection in PRocedural EGOcentric VideosPoster5 citations
- PTM-VQA: Efficient Video Quality Assessment Leveraging Diverse PreTrained Models from the WildPoster5 citations
- Physics-guided Shape-from-Template: Monocular Video Perception through Neural Surrogate ModelsPoster5 citations
- PoNQ: a Neural QEM-based Mesh RepresentationPoster5 citations
- ProTeCt: Prompt Tuning for Taxonomic Open Set ClassificationPoster5 citations
- Programmable Motion Generation for Open-Set Motion Control TasksHighlight5 citations
- PromptCoT: Align Prompt Distribution via Adapted Chain-of-ThoughtPoster5 citations
- Prompting Vision Foundation Models for Pathology Image AnalysisPoster5 citations
- Quantifying Task Priority for Multi-Task OptimizationPoster5 citations
- Querying as Prompt: Parameter-Efficient Learning for Multimodal Language ModelPoster5 citations
- Rapid 3D Model Generation with Intuitive 3D InputHighlight5 citations
- Rapid Motor Adaptation for Robotic Manipulator ArmsPoster5 citations
- Re-thinking Data Availability Attacks Against Deep Neural NetworksPoster5 citations
- Real-World Efficient Blind Motion Deblurring via Blur Pixel DiscretizationPoster5 citations
CVPR accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.