ECCV 2024 Accepted Papers
The full list of 2,385 papers accepted at ECCV 2024 (European Conference on Computer Vision). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 2,185Oral: 200
- Flash Cache: Reducing Bias in Radiance Cache Based Inverse RenderingOral5 citations
- Flying with Photons: Rendering Novel Views of Propagating LightOral5 citations
- Fully Authentic Visual Question Answering Dataset from Online CommunitiesPoster5 citations
- FutureDepth: Learning to Predict the Future Improves Video Depth EstimationPoster5 citations
- GRIDS: Grouped Multiple-Degradation Restoration with Image Degradation SimilarityPoster5 citations
- GarmentAligner: Text-to-Garment Generation via Retrieval-augmented Multi-level CorrectionsPoster5 citations
- GeometrySticker: Enabling Ownership Claim of Recolorized Neural Radiance FieldsPoster5 citations
- HGL: Hierarchical Geometry Learning for Test-time Adaptation in 3D Point Cloud SegmentationOral5 citations
- HPFF: Hierarchical Locally Supervised Learning with Patch Feature FusionPoster5 citations
- HiDiffusion: Unlocking Higher-Resolution Creativity and Efficiency in Pretrained Diffusion ModelsPoster5 citations
- High-Fidelity 3D Textured Shapes Generation by Sparse Encoding and Adversarial DecodingPoster5 citations
- Idea2Img: Iterative Self-Refinement with GPT-4V for Automatic Image Design and GenerationPoster5 citations
- Implicit Filtering for Learning Neural Signed Distance Functions from 3D Point CloudsPoster5 citations
- Improving Knowledge Distillation via Regularizing Feature Direction and NormOral5 citations
- Instant 3D Human Avatar Generation using Image Diffusion ModelsPoster5 citations
- Is Retain Set All You Need in Machine Unlearning? Restoring Performance of Unlearned Models with Out-Of-Distribution ImagesPoster5 citations
- JointDreamer: Ensuring Geometry Consistency and Text Congruence in Text-to-3D Generation via Joint Score DistillationPoster5 citations
- LG-Gaze: Learning Geometry-aware Continuous Prompts for Language-Guided Gaze EstimationPoster5 citations
- LLM as Dataset Analyst: Subpopulation Structure Discovery with Large Language ModelPoster5 citations
- Learn from the Learnt: Source-Free Active Domain Adaptation via Contrastive Sampling and Visual PersistencePoster5 citations
- Learning Semantic Latent Directions for Accurate and Controllable Human Motion PredictionPoster5 citations
- Learning Video Context as Interleaved Multimodal SequencesPoster5 citations
- Leveraging Near-Field Lighting for Monocular Depth Estimation from Endoscopy VideosPoster5 citations
- Leveraging Thermal Modality to Enhance Reconstruction in Low-Light ConditionsPoster5 citations
- Leveraging temporal contextualization for video action recognitionPoster5 citations
- LiFT: A Surprisingly Simple Lightweight Feature Transform for Dense ViT DescriptorsPoster5 citations
- Localization and Expansion: A Decoupled Framework for Point Cloud Few-shot Semantic SegmentationPoster5 citations
- Look Around and Learn: Self-Training Object Detection by ExplorationPoster5 citations
- MMVR: Millimeter-wave Multi-View Radar Dataset and Benchmark for Indoor PerceptionPoster5 citations
- MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text AlignmentPoster5 citations
- MasterWeaver: Taming Editability and Face Identity for Personalized Text-to-Image GenerationPoster5 citations
- Merging and Splitting Diffusion Paths for Semantically Coherent PanoramasPoster5 citations
- MeshSegmenter: Zero-Shot Mesh Segmentation via Texture SynthesisPoster5 citations
- Momentum Auxiliary Network for Supervised Local LearningOral5 citations
- Motion and Structure from Event-based Normal FlowPoster5 citations
- Multi-Label Cluster Discrimination for Visual Representation LearningPoster5 citations
- NOVUM: Neural Object Volumes for Robust Object ClassificationPoster5 citations
- Norface: Improving Facial Expression Analysis by Identity NormalizationPoster5 citations
- OTSeg: Multi-prompt Sinkhorn Attention for Zero-Shot Semantic SegmentationPoster5 citations
- Osmosis: RGBD Diffusion Prior for Underwater Image RestorationPoster5 citations
- PQ-SAM: Post-training Quantization for Segment Anything ModelPoster5 citations
- PanGu-Draw: Advancing Resource-Efficient Text-to-Image Synthesis with Time-Decoupled Training and Reusable Coop-DiffusionPoster5 citations
- PiTe: Pixel-Temporal Alignment for Large Video-Language ModelOral5 citations
- PosterLlama: Bridging Design Ability of Langauge Model to Content-Aware Layout GenerationPoster5 citations
- PredBench: Benchmarking Spatio-Temporal Prediction across Diverse DisciplinesPoster5 citations
- Projecting Points to Axes: Oriented Object Detection via Point-Axis RepresentationOral5 citations
- REVISION: Rendering Tools Enable Spatial Fidelity in Vision-Language ModelsPoster5 citations
- RGNet: A Unified Clip Retrieval and Grounding Network for Long VideosPoster5 citations
- RT-Pose: A 4D Radar-Tensor based 3D Human Pose Estimation and Localization BenchmarkPoster5 citations
- Raising the Ceiling: Conflict-Free Local Feature Matching with Dynamic View SwitchingPoster5 citations
- RealViformer: Investigating Attention for Real-World Video Super-ResolutionPoster5 citations
- Reinforcement Learning Meets Visual OdometryPoster5 citations
- Rethinking Data Augmentation for Robust LiDAR Semantic Segmentation in Adverse WeatherOral5 citations
- Revisit Anything: Visual Place Recognition via Image Segment RetrievalPoster5 citations
- Revisiting Adaptive Cellular Recognition Under Domain Shifts: A Contextual Correspondence ViewOral5 citations
- RoomTex: Texturing Compositional Indoor Scenes via Iterative InpaintingPoster5 citations
- Safeguard Text-to-Image Diffusion Models with Human Feedback InversionPoster5 citations
- Self-Guided Generation of Minority Samples Using Diffusion ModelsPoster5 citations
- Siamese Vision Transformers are Scalable Audio-visual LearnersPoster5 citations
- Simplifying Source-Free Domain Adaptation for Object Detection: Effective Self-Training Strategies and Performance InsightsPoster5 citations
- Sparse Beats Dense: Rethinking Supervision in Radar-Camera Depth CompletionPoster5 citations
- StyleTokenizer: Defining Image Style by a Single Instance for Controlling Diffusion ModelsPoster5 citations
- SuperGaussian: Repurposing Video Models for 3D Super ResolutionPoster5 citations
- Sur^2f: A Hybrid Representation for High-Quality and Efficient Surface Reconstruction from Multi-view ImagesPoster5 citations
- Surface Reconstruction for 3D Gaussian Splatting via Local Structural HintsPoster5 citations
- T-MAE: Temporal Masked Autoencoders for Point Cloud Representation LearningPoster5 citations
- Temporal Event Stereo via Joint Learning with Stereoscopic FlowPoster5 citations
- Text-to-Sticker: Style Tailoring Latent Diffusion Models for Human ExpressionPoster5 citations
- The Hard Positive Truth about Vision-Language CompositionalityPoster5 citations
- Token Compensator: Altering Inference Cost of Vision Transformer without Re-TuningPoster5 citations
- Towards Multi-modal Transformers in Federated LearningPoster5 citations
- Towards Scene Graph AnticipationOral5 citations
- Training A Small Emotional Vision Language Model for Visual Art ComprehensionPoster5 citations
- Unlocking Textual and Visual Wisdom: Open-Vocabulary 3D Object Detection Enhanced by Comprehensive Guidance from Text and ImagePoster5 citations
- VQA-Diff: Exploiting VQA and Diffusion for Zero-Shot Image-to-3D Vehicle Asset Generation in Autonomous DrivingPoster5 citations
- Weakly Supervised 3D Object Detection via Multi-Level Visual GuidancePoster5 citations
- Which Model Generated This Image? A Model-Agnostic Approach for Origin AttributionPoster5 citations
- WorldPose: A World Cup Dataset for Global 3D Human Pose EstimationPoster5 citations
- iHuman: Instant Animatable Digital Humans From Monocular VideosPoster5 citations
- "BlinkVision: A Benchmark for Optical Flow, Scene Flow and Point Tracking Estimation using RGB Frames and Events"Poster4 citations
- "On Calibration of Object Detectors: Pitfalls, Evaluation and Baselines"Oral4 citations
- "ProCreate, Don't Reproduce! Propulsive Energy Diffusion for Creative Generation"Poster4 citations
- 3D Small Object Detection with Dynamic Spatial PruningPoster4 citations
- 3D-GOI: 3D GAN Omni-Inversion for Multifaceted and Multi-object EditingPoster4 citations
- 3iGS: Factorised Tensorial Illumination for 3D Gaussian SplattingPoster4 citations
- 4D Contrastive Superflows are Dense 3D Representation LearnersPoster4 citations
- A Geometric Distortion Immunized Deep Watermarking Framework with Robustness GeneralizabilityOral4 citations
- A New Dataset and Framework for Real-World Blurred Images Super-ResolutionPoster4 citations
- A Simple Baseline for Spoken Language to Sign Language Translation with 3D AvatarsOral4 citations
- ABC Easy as 123: A Blind Counter for Exemplar-Free Multi-Class Class-agnostic CountingOral4 citations
- ActionVOS: Actions as Prompts for Video Object SegmentationOral4 citations
- AdaDiffSR: Adaptive Region-aware Dynamic acceleration Diffusion Model for Real-World Image Super-ResolutionPoster4 citations
- AdaGlimpse: Active Visual Exploration with Arbitrary Glimpse Position and ScalePoster4 citations
- Adaptive High-Frequency Transformer for Diverse Wildlife Re-IdentificationPoster4 citations
- Adaptive Human Trajectory Prediction via Latent CorridorsPoster4 citations
- AddBiomechanics Dataset: Capturing the Physics of Human Motion at ScalePoster4 citations
- Affective Visual Dialog: A Large-Scale Benchmark for Emotional Reasoning Based on Visually Grounded ConversationsPoster4 citations
- Affine steerers for structured keypoint descriptionPoster4 citations
- AlignDiff: Aligning Diffusion Models for General Few-Shot SegmentationOral4 citations
- AlignZeg: Mitigating Objective Misalignment for Zero-shot Semantic SegmentationPoster4 citations
- Any Target Can be Offense: Adversarial Example Generation via Generalized Latent InfectionPoster4 citations
- Auto-DAS: Automated Proxy Discovery for Training-free Distillation-aware Architecture SearchPoster4 citations
- BKDSNN: Enhancing the Performance of Learning-based Spiking Neural Networks Training with Blurred Knowledge DistillationPoster4 citations
- Background Adaptation with Residual Modeling for Exemplar-Free Class-Incremental Semantic SegmentationPoster4 citations
- Bi-directional Contextual Attention for 3D Dense CaptioningOral4 citations
- Bidirectional Stereo Image Compression with Cross-Dimensional Entropy ModelPoster4 citations
- CMD: A Cross Mechanism Domain Adaptation Dataset for 3D Object DetectionPoster4 citations
- COIN: Control-Inpainting Diffusion Prior for Human and Camera Motion EstimationPoster4 citations
- Camera-LiDAR Cross-modality Gait RecognitionPoster4 citations
- CardiacNet: Learning to Reconstruct Abnormalities for Cardiac Disease Assessment from Echocardiogram VideosOral4 citations
- Chat-Edit-3D: Interactive 3D Scene Editing via Text PromptsPoster4 citations
- Click Prompt Learning with Optimal Transport for Interactive SegmentationPoster4 citations
- Concept Arithmetics for Circumventing Concept Inhibition in Diffusion ModelsOral4 citations
- Conceptual Codebook Learning for Vision-Language ModelsPoster4 citations
- Cross-Domain Learning for Video Anomaly Detection with Limited SupervisionPoster4 citations
- Cross-Domain Semantic Segmentation on Inconsistent Taxonomy using VLMsPoster4 citations
- DATENeRF: Depth-Aware Text-based Editing of NeRFsPoster4 citations
- DGD: Dynamic 3D Gaussians DistillationPoster4 citations
- DPA-Net: Structured 3D Abstraction from Sparse Views via Differentiable Primitive AssemblyPoster4 citations
- DailyDVS-200: A Comprehensive Benchmark Dataset for Event-Based Action RecognitionPoster4 citations
- Depth-Aware Blind Image Decomposition for Real-World Adverse Weather RecoveryPoster4 citations
- DiffuMatting: Synthesizing Arbitrary Objects with Matting-level AnnotationPoster4 citations
- Diffusion-Guided Weakly Supervised Semantic SegmentationPoster4 citations
- DiscoMatch: Fast Discrete Optimisation for Geometrically Consistent 3D Shape MatchingPoster4 citations
- Dissecting Dissonance: Benchmarking Large Multimodal Models Against Self-Contradictory InstructionsPoster4 citations
- Domain Generalization of 3D Object Detection by Density-ResamplingPoster4 citations
- Domain-Adaptive 2D Human Pose Estimation via Dual Teachers in Extremely Low-Light ConditionsPoster4 citations
- DoughNet: A Visual Predictive Model for Topological Manipulation of Deformable ObjectsPoster4 citations
- Dual-Rain: Video Rain Removal using Assertive and Gentle TeachersPoster4 citations
- Dual-stage Hyperspectral Image Classification Model with Spectral SupertokenPoster4 citations
- DualBEV: Unifying Dual View Transformation with Probabilistic CorrespondencesPoster4 citations
- EAFormer: Scene Text Segmentation with Edge-Aware TransformersPoster4 citations
- Efficient Few-Shot Action Recognition via Multi-Level Post-ReasoningPoster4 citations
- EgoBody3M: Egocentric Body Tracking on a VR Headset using a Diverse DatasetPoster4 citations
- EgoPet: Egomotion and Interaction Data from an Animal's PerspectivePoster4 citations
- Eliminating Warping Shakes for Unsupervised Online Video StitchingPoster4 citations
- Eta Inversion: Designing an Optimal Eta Function for Diffusion-based Real Image EditingPoster4 citations
- Event Trojan: Asynchronous Event-based Backdoor AttacksPoster4 citations
- Event-Aided Time-To-Collision Estimation for Autonomous DrivingPoster4 citations
- Event-Based Motion MagnificationPoster4 citations
- Event-based Mosaicing Bundle AdjustmentPoster4 citations
- Exploring Reliable Matching with Phase Enhancement for Night-time Semantic SegmentationPoster4 citations
- FALIP: Visual Prompt as Foveal Attention Boosts CLIP Zero-Shot PerformancePoster4 citations
- Few-Shot Anomaly-Driven Generation for Anomaly Classification and SegmentationPoster4 citations
- Finding a needle in a haystack: A Black-Box Approach to Invisible Watermark DetectionPoster4 citations
- FipTR: A Simple yet Effective Transformer Framework for Future Instance Prediction in Autonomous DrivingPoster4 citations
- FontStudio: Shape-Adaptive Diffusion Model for Coherent and Consistent Font Effect GenerationPoster4 citations
- FrePolad: Frequency-Rectified Point Latent Diffusion for Point Cloud GenerationPoster4 citations
- GTPT: Group-based Token Pruning Transformer for Efficient Human Pose EstimationPoster4 citations
- GazeXplain: Learning to Predict Natural Language Explanations of Visual ScanpathsOral4 citations
- Global Counterfactual DirectionsPoster4 citations
- HARIVO: Harnessing Text-to-Image Models for Video GenerationPoster4 citations
- HPE-Li: WiFi-enabled Lightweight Dual Selective Kernel Convolution for Human Pose EstimationPoster4 citations
- How to Train the Teacher Model for Effective Knowledge DistillationPoster4 citations
- HumanRefiner: Benchmarking Abnormal Human Generation and Refining with Coarse-to-fine Pose-Reversible GuidancePoster4 citations
- INTRA: Interaction Relationship-aware Weakly Supervised Affordance GroundingPoster4 citations
- Improving Adversarial Transferability via Model AlignmentPoster4 citations
- Improving Hyperbolic Representations via Gromov-Wasserstein RegularizationPoster4 citations
- Improving Text-guided Object Inpainting with Semantic Pre-inpaintingPoster4 citations
- Interleaving One-Class and Weakly-Supervised Models with Adaptive Thresholding for Unsupervised Video Anomaly DetectionPoster4 citations
- ItTakesTwo: Leveraging Peer Representations for Semi-supervised LiDAR Semantic SegmentationPoster4 citations
- Just a Hint: Point-Supervised Camouflaged Object DetectionPoster4 citations
- KMTalk: Speech-Driven 3D Facial Animation with Key Motion EmbeddingPoster4 citations
- L-DiffER: Single Image Reflection Removal with Language-based Diffusion ModelPoster4 citations
- LMT-GP: Combined Latent Mean-Teacher and Gaussian Process for Semi-supervised Low-light Image EnhancementPoster4 citations
- LabelDistill: Label-guided Cross-modal Knowledge Distillation for Camera-based 3D Object DetectionPoster4 citations
- LayerDiff: Exploring Text-guided Multi-layered Composable Image Synthesis via Layer-Collaborative Diffusion ModelPoster4 citations
- LayeredFlow: A Real-World Benchmark for Non-Lambertian Multi-Layer Optical FlowPoster4 citations
- Learning Camouflaged Object Detection from Noisy Pseudo LabelPoster4 citations
- Learning Neural Volumetric Pose Features for Camera LocalizationPoster4 citations
- Learning Unified Reference Representation for Unsupervised Multi-class Anomaly DetectionPoster4 citations
- Learning the Unlearned: Mitigating Feature Suppression in Contrastive LearningPoster4 citations
- Learning to Detect Multi-class Anomalies with Just One Normal Image PromptPoster4 citations
- Learning to Generate Conditional Tri-plane for 3D-aware Expression Controllable Portrait AnimationPoster4 citations
- Long-term Temporal Context Gathering for Neural Video CompressionPoster4 citations
- MAP-ADAPT: Real-Time Quality-Adaptive Semantic 3D MapsPoster4 citations
- MICDrop: Masking Image and Depth Features via Complementary Dropout for Domain-Adaptive Semantic SegmentationPoster4 citations
- MVDD: Multi-View Depth Diffusion ModelsPoster4 citations
- MagicEraser: Erasing Any Objects via Semantics-Aware ControlPoster4 citations
- Mesh2NeRF: Direct Mesh Supervision for Neural Radiance Field Representation and GenerationPoster4 citations
- MeshVPR: Citywide Visual Place Recognition Using 3D MeshesPoster4 citations
- NePhi: Neural Deformation Fields for Approximately Diffeomorphic Medical Image RegistrationPoster4 citations
- Noise-assisted Prompt Learning for Image Forgery Detection and LocalizationPoster4 citations
- Omni6D: Large-Vocabulary 3D Object Dataset for Category-Level 6D Object Pose EstimationPoster4 citations
- Open-Vocabulary 3D Semantic Segmentation with Text-to-Image Diffusion ModelsPoster4 citations
- PISR: Polarimetric Neural Implicit Surface Reconstruction for Textureless and Specular ObjectsPoster4 citations
- PLOT: Text-based Person Search with Part Slot Attention for Corresponding Part DiscoveryPoster4 citations
- Pairwise Distance Distillation for Unsupervised Real-World Image Super-ResolutionPoster4 citations
- PanoFree: Tuning-Free Holistic Multi-view Image Generation with Cross-view Self-GuidancePoster4 citations
- Parameter-Efficient and Memory-Efficient Tuning for Vision Transformer: A Disentangled ApproachPoster4 citations
- PetFace: A Large-Scale Dataset and Benchmark for Animal IdentificationOral4 citations
- Physical-Based Event Camera SimulatorPoster4 citations
- Placing Objects in Context via Inpainting for Out-of-distribution SegmentationPoster4 citations
- Platypus: A Generalized Specialist Model for Reading Text in Various FormsPoster4 citations
- PointRegGPT: Boosting 3D Point Cloud Registration using Generative Point-Cloud Pairs for TrainingPoster4 citations
- Pre-trained Visual Dynamics Representations for Efficient Policy LearningPoster4 citations
- Preventing Catastrophic Forgetting through Memory Networks in Continuous DetectionPoster4 citations
- Quality Assured: Rethinking Annotation Strategies in Imaging AIPoster4 citations
- RCS-Prompt: Learning Prompt to Rearrange Class Space for Prompt-based Continual LearningPoster4 citations
- Rate-Distortion-Cognition Controllable Versatile Neural Image CompressionPoster4 citations
- Rawformer: Unpaired Raw-to-Raw Translation for Learnable Camera ISPsPoster4 citations
- ReSyncer: Rewiring Style-based Generator for Unified Audio-Visually Synced Facial PerformerOral4 citations
- Rectify the Regression Bias in Long-Tailed Object DetectionPoster4 citations
- Relightable Neural Actor with Intrinsic Decomposition and Pose ControlPoster4 citations
- Rethinking Deep Unrolled Model for Accelerated MRI ReconstructionOral4 citations
- Revisit Event Generation Model: Self-Supervised Learning of Event-to-Video Reconstruction with Implicit Neural RepresentationsPoster4 citations
- RoGUENeRF: A Robust Geometry-Consistent Universal Enhancer for NeRFPoster4 citations
- Robust Incremental Structure-from-Motion with Hybrid FeaturesPoster4 citations
- Robust Multimodal Learning via Representation DecouplingPoster4 citations
- S-JEPA: A Joint Embedding Predictive Architecture for Skeletal Action RecognitionPoster4 citations
- SAFARI: Adaptive Sequence Transformer for Weakly Supervised Referring Expression SegmentationPoster4 citations
- SAIR: Learning Semantic-aware Implicit RepresentationPoster4 citations
- SLIM: Spuriousness Mitigation with Minimal Human AnnotationsPoster4 citations
- SNeRV: Spectra-preserving Neural Representation for VideoPoster4 citations
- SPARO: Selective Attention for Robust and Compositional Transformer Encodings for VisionPoster4 citations
- SPIRE: Semantic Prompt-Driven Image RestorationPoster4 citations
- STAMP: Outlier-Aware Test-Time Adaptation with Stable Memory ReplayPoster4 citations
- Scene-Graph ViT: End-to-End Open-Vocabulary Visual Relationship DetectionPoster4 citations
- SelEx: Self-Expertise in Fine-Grained Generalized Category DiscoveryPoster4 citations
- Self-Cooperation Knowledge Distillation for Novel Class DiscoveryPoster4 citations
- Self-Supervised Audio-Visual Soundscape StylizationPoster4 citations
- Self-Supervised Video Desmoking for Laparoscopic SurgeryOral4 citations
- Semantically Guided Representation Learning For Action AnticipationPoster4 citations
- Situated Instruction FollowingPoster4 citations
- Spherical World-Locking for Audio-Visual Localization in Egocentric VideosPoster4 citations
- Style-Extracting Diffusion Models for Semi-Supervised Histopathology SegmentationPoster4 citations
- Subspace Prototype Guidance for Mitigating Class Imbalance in Point Cloud Semantic SegmentationPoster4 citations
- Switch Diffusion Transformer: Synergizing Denoising Tasks with Sparse Mixture-of-ExpertsPoster4 citations
- TIP: Tabular-Image Pre-training for Multimodal Classification with Incomplete DataPoster4 citations
- TP2O: Creative Text Pair-to-Object Generation using Balance Swap-SamplingPoster4 citations
- Taming CLIP for Fine-grained and Structured Visual Understanding of Museum ExhibitsPoster4 citations
- Text-Anchored Score Composition: Tackling Condition Misalignment in Text-to-Image Diffusion ModelsPoster4 citations
- Text-Guided Video Masked AutoencoderPoster4 citations
- Text2Place: Affordance-aware Text Guided Human PlacementPoster4 citations
- The Devil is in the Statistics: Mitigating and Exploiting Statistics Difference for Generalizable Semi-supervised Medical Image SegmentationPoster4 citations
- The Fabrication of Reality and Fantasy: Scene Generation with LLM-Assisted Prompt InterpretationPoster4 citations
- The Lottery Ticket Hypothesis in Denoising: Towards Semantic-Driven InitializationPoster4 citations
- The Sky's the Limit: Relightable Outdoor Scenes via a Sky-pixel Constrained Illumination Prior and Outside-In VisibilityPoster4 citations
- Thermal3D-GS: Physics-induced 3D Gaussians for Thermal Infrared Novel-view SynthesisPoster4 citations
- TimeCraft: Navigate Weakly-Supervised Temporal Grounded Video Question Answering via Bi-directional ReasoningPoster4 citations
- Timestep-Aware Correction for Quantized Diffusion ModelsPoster4 citations
- Tiny Models are the Computational Saver for Large ModelsPoster4 citations
- Towards Reliable Advertising Image Generation Using Human FeedbackPoster4 citations
- Towards Unified Representation of Invariant-Specific Features in Missing Modality Face Anti-SpoofingPoster4 citations
- Tree-D Fusion: Simulation-Ready Tree Dataset from Single Images with Diffusion PriorsPoster4 citations
- UDA-Bench: Revisiting Common Assumptions in Unsupervised Domain Adaptation Using a Standardized FrameworkPoster4 citations
- Unsupervised Dense Prediction using Differentiable Normalized CutsPoster4 citations
- VLAD-BuFF: Burst-aware Fast Feature Aggregation for Visual Place RecognitionPoster4 citations
- Video Question Answering with Procedural ProgramsPoster4 citations
- WBP: Training-time Backdoor Attacks through Hardware-based Weight Bit PoisoningPoster4 citations
- WRIM-Net: Wide-Ranging Information Mining Network for Visible-Infrared Person Re-IdentificationPoster4 citations
- Walker: Self-supervised Multiple Object Tracking by Walking on Temporal Object Appearance GraphsPoster4 citations
- Weakly-supervised Camera Localization by Ground-to-satellite Image RegistrationPoster4 citations
- Zero-Shot Image Feature Consensus with Deep Functional MapsPoster4 citations
- "Category-level Object Detection, Pose Estimation and Reconstruction from Stereo Images"Poster3 citations
- "FARSE-CNN: Fully Asynchronous, Recurrent and Sparse Event-Based CNN"Poster3 citations
- "Hyperion – A fast, versatile symbolic Gaussian Belief Propagation framework for Continuous-Time SLAM"Poster3 citations
- "SLAck: Semantic, Location, and Appearance Aware Open-Vocabulary Tracking"Poster3 citations
- "Segment, Lift and Fit: Automatic 3D Shape Labeling from 2D Prompts"Poster3 citations
- "UniINR: Event-guided Unified Rolling Shutter Correction, Deblurring, and Interpolation"Poster3 citations
- "X-InstructBLIP: A Framework for Aligning Image, 3D, Audio, Video to LLMs and its Emergent Cross-modal Reasoning"Poster3 citations
- 3D Open-Vocabulary Panoptic Segmentation with 2D-3D Vision-Language DistillationPoster3 citations
- A Multimodal Benchmark Dataset and Model for Crop Disease DiagnosisPoster3 citations
- A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive PropertiesPoster3 citations
- Active Coarse-to-Fine Segmentation of Moveable Parts from Real ImagesPoster3 citations
- AdaDiff: Accelerating Diffusion Models through Step-Wise Adaptive ComputationPoster3 citations
- Adaptive Multi-modal Fusion of Spatially Variant Kernel Refinement with Diffusion Model for Blind Image Super-ResolutionPoster3 citations
- Anytime Continual Learning for Open Vocabulary ClassificationOral3 citations
- Appearance-based Refinement for Object-Centric Motion SegmentationPoster3 citations
- Arbitrary-Scale Video Super-Resolution with Structural and Textural PriorsPoster3 citations
- AttentionHand: Text-driven Controllable Hand Image Generation for 3D Hand Reconstruction in the WildOral3 citations
- Augmented Neural Fine-tuning for Efficient Backdoor PurificationPoster3 citations
- Avatar Fingerprinting for Authorized Use of Synthetic Talking-Head VideosPoster3 citations
- BI-MDRG: Bridging Image History in Multimodal Dialogue Response GenerationPoster3 citations
- Benchmarking Spurious Bias in Few-Shot Image ClassifiersPoster3 citations
- BeyondScene: Higher-Resolution Human-Centric Scene Generation With Pretrained DiffusionPoster3 citations
- Bidirectional Uncertainty-Based Active Learning for Open-Set AnnotationPoster3 citations
- Boost Your NeRF: A Model-Agnostic Mixture of Experts Framework for High Quality and Efficient RenderingPoster3 citations
- Boosting 3D Single Object Tracking with 2D Matching Distillation and 3D Pre-trainingPoster3 citations
- BurstM: Deep Burst Multi-scale SR using Fourier Space with Optical FlowPoster3 citations
- CLOSER: Towards Better Representation Learning for Few-Shot Class-Incremental LearningPoster3 citations
- COD: Learning Conditional Invariant Representation for Domain Adaptation RegressionOral3 citations
- COMO: Compact Mapping and OdometryOral3 citations
- COMPOSE: Comprehensive Portrait Shadow EditingPoster3 citations
- Camera Calibration using a Collimator SystemOral3 citations
- Can OOD Object Detectors Learn from Foundation Models?Poster3 citations
- Canonical Shape Projection is All You Need for 3D Few-shot Class Incremental LearningPoster3 citations
- CarFormer: Self-Driving with Learned Object-Centric RepresentationsPoster3 citations
- Chameleon: A Data-Efficient Generalist for Dense Visual Prediction in the WildOral3 citations
- Chronologically Accurate Retrieval for Temporal Grounding of Motion-Language ModelsPoster3 citations
- ClusteringSDF: Self-Organized Neural Implicit Surfaces for 3D DecompositionPoster3 citations
- CoLA: Conditional Dropout and Language-driven Robust Dual-modal Salient Object DetectionPoster3 citations
- CoMusion: Towards Consistent Stochastic Human Motion Prediction via Motion DiffusionPoster3 citations
- ColorMNet: A Memory-based Deep Spatial-Temporal Feature Propagation Network for Video ColorizationPoster3 citations
- ConceptExpress: Harnessing Diffusion Models for Single-image Unsupervised Concept ExtractionOral3 citations
- Concise Plane Arrangements for Low-Poly Surface and Volume ModellingPoster3 citations
- Confidence Self-Calibration for Multi-Label Class-Incremental LearningPoster3 citations
- Content-Aware Radiance Fields: Aligning Model Complexity with Scene Intricacy Through Learned Bitwidth QuantizationPoster3 citations
- Continual Learning for Remote Physiological Measurement: Minimize Forgetting and Simplify InferencePoster3 citations
- Continuity Preserving Online CenterLine Graph LearningPoster3 citations
- ControlNet-XS: Rethinking the Control of Text-to-Image Diffusion Models as Feedback-Control SystemsOral3 citations
- Controlling the World by Sleight of HandOral3 citations
- CountFormer: Multi-View Crowd Counting TransformerPoster3 citations
- DECIDER: Leveraging Foundation Model Priors for Improved Model Failure Detection and ExplanationPoster3 citations
- DECap: Towards Generalized Explicit Caption Editing via Diffusion MechanismPoster3 citations
- DHR: Dual Features-Driven Hierarchical Rebalancing in Inter- and Intra-Class Regions for Weakly-Supervised Semantic SegmentationPoster3 citations
- Dataset GrowthPoster3 citations
- Decomposition Betters Tracking Everything EverywherePoster3 citations
- Deep Online Probability Aggregation ClusteringPoster3 citations
- Dense Hand-Object(HO) GraspNet with Full Grasping Taxonomy and DynamicsPoster3 citations
- Depth on Demand: Streaming Dense Depth from a Low Frame Rate Active SensorPoster3 citations
- Diff-Reg: Diffusion Model in Doubly Stochastic Matrix Space for Registration ProblemPoster3 citations
- DiffuX2CT: Diffusion Learning to Reconstruct CT Images from Biplanar X-RaysPoster3 citations
- Diffusion Model is a Good Pose Estimator from 3D RF-VisionPoster3 citations
- Diffusion Models are Geometry Critics: Single Image 3D Editing Using Pre-Trained Diffusion PriorsPoster3 citations
- Diffusion Models as Data Mining ToolsPoster3 citations
- Diffusion-Based Image-to-Image Translation by Noise Correction via Prompt InterpolationPoster3 citations
- Distribution Alignment for Fully Test-Time Adaptation with Dynamic Online Data StreamsPoster3 citations
- Diverse Text-to-3D Synthesis with Augmented Text EmbeddingPoster3 citations
- Domain-adaptive Video Deblurring via Test-time BlurringPoster3 citations
- DreamDiffusion: High-Quality EEG-to-Image Generation with Temporal Masked Signal Modeling and CLIP AlignmentPoster3 citations
- Dual-Camera Smooth Zoom on Mobile PhonesPoster3 citations
- DualDn: Dual-domain Denoising via Differentiable ISPPoster3 citations
- Dynamic Guidance Adversarial Distillation with Enhanced Teacher KnowledgePoster3 citations
- Dynamic Neural Radiance Field From Defocused Monocular VideoPoster3 citations
- Dynamic Retraining-Updating Mean Teacher for Source-Free Object DetectionPoster3 citations
- DynoSurf: Neural Deformation-based Temporally Consistent Dynamic Surface ReconstructionPoster3 citations
- E.T. the Exceptional Trajectory: Text-to-camera-trajectory generation with character awarenessPoster3 citations
- EA-VTR: Event-Aware Video-Text RetrievalPoster3 citations
- Effective Lymph Nodes Detection in CT Scans Using Location Debiased Query Selection and Contrastive Query Representation in TransformerPoster3 citations
- Efficient and Versatile Robust Fine-Tuning of Zero-shot ModelsPoster3 citations
- Embedding-Free Transformer with Inference Spatial Reduction for Efficient Semantic SegmentationPoster3 citations
- Encapsulating Knowledge in One PromptPoster3 citations
- Equi-GSPR: Equivariant SE(3) Graph Network Model for Sparse Point Cloud RegistrationOral3 citations
- Exploring Phrase-Level Grounding with Text-to-Image Diffusion ModelPoster3 citations
- FYI: Flip Your Images for Dataset DistillationPoster3 citations
- FedTSA: A Cluster-based Two-Stage Aggregation Method for Model-heterogeneous Federated LearningPoster3 citations
- Few-Shot Image Generation by Conditional Relaxing Diffusion InversionPoster3 citations
- Few-shot Defect Image Generation based on Consistency ModelingPoster3 citations
- Flash-Splat: 3D Reflection Removal with Flash Cues and Gaussian SplatsPoster3 citations
- Free Lunch for Gait Recognition: A Novel Relation DescriptorPoster3 citations
- FreeDiff: Progressive Frequency Truncation for Image Editing with Diffusion ModelsPoster3 citations
- Fundamental Matrix Estimation Using Relative DepthsPoster3 citations
- GKGNet: Group K-Nearest Neighbor based Graph Convolutional Network for Multi-Label Image RecognitionPoster3 citations
- Gated Temporal Diffusion for Stochastic Long-term Dense AnticipationPoster3 citations
- Generalizable Facial Expression RecognitionPoster3 citations
- Generating Physically Realistic and Directable Human Motions from Multi-Modal InputsPoster3 citations
- GroCo: Ground Constraint for Metric Self-Supervised Monocular DepthPoster3 citations
- HAT: History-Augmented Anchor Transformer for Online Temporal Action LocalizationPoster3 citations
- HIMO: A New Benchmark for Full-Body Human Interacting with Multiple ObjectsPoster3 citations
- HSR: Holistic 3D Human-Scene Reconstruction from Monocular VideosPoster3 citations
- HandDAGT: A Denoising Adaptive Graph Transformer for 3D Hand Pose EstimationPoster3 citations
- Heterogeneous Graph Learning for Scene Graph Prediction in 3D Point CloudsPoster3 citations
- High-Fidelity and Transferable NeRF Editing by Frequency DecompositionPoster3 citations
- High-Quality Mesh Blendshape Generation from Face Videos via Neural Inverse RenderingPoster3 citations
- IG Captioner: Information Gain Captioners are Strong Zero-shot ClassifiersPoster3 citations
- IVTP: Instruction-guided Visual Token Pruning for Large Vision-Language ModelsPoster3 citations
- Improving Geo-diversity of Generated Images with Contextualized Vendi Score GuidancePoster3 citations
- Improving Neural Surface Reconstruction with Feature Priors from Multi-View ImagesPoster3 citations
- InfoNorm: Mutual Information Shaping of Normals for Sparse-View ReconstructionPoster3 citations
- Instruction Tuning-free Visual Token Complement for Multimodal LLMsPoster3 citations
- Intrinsic Single-Image HDR ReconstructionPoster3 citations
- Invertible Neural Warp for NeRFPoster3 citations
- KFD-NeRF: Rethinking Dynamic NeRF with Kalman FilterPoster3 citations
- KeypointDETR: An End-to-End 3D Keypoint DetectorOral3 citations
- Kinetic Typography Diffusion ModelPoster3 citations
- Labeled Data Selection for Category DiscoveryPoster3 citations
- Layer-Wise Relevance Propagation with Conservation Property for ResNetPoster3 citations
- Learn to Preserve and Diversify: Parameter-Efficient Group with Orthogonal Regularization for Domain GeneralizationPoster3 citations
- Learning Cross-hand Policies of High-DOF Reaching and GraspingPoster3 citations
- Learning Diffusion Models for Multi-View Anomaly DetectionPoster3 citations
- Learning Local Pattern Modularization for Point Cloud Reconstruction from Unseen ClassesPoster3 citations
- Learning Scalable Model Soup on a Single GPU: An Efficient Subspace Training StrategyPoster3 citations
- Learning by Aligning 2D Skeleton Sequences and Multi-Modality FusionPoster3 citations
- Learning to Complement and to Defer to Multiple UsersPoster3 citations
- Learning to Obstruct Few-Shot Image Classification over Restricted ClassesPoster3 citations
- LiDAR-based All-weather 3D Object Detection via Prompting and Distilling 4D RadarPoster3 citations
- Linearly Controllable GAN: Unsupervised Feature Categorization and Decomposition for Image Generation and ManipulationPoster3 citations
- Local Action-Guided Motion Diffusion Model for Text-to-Motion GenerationPoster3 citations
- M^2Depth: Self-supervised Two-Frame Multi-camera Metric Depth EstimationOral3 citations
- MagicMirror: Fast and High-Quality Avatar Generation with Constrained Search SpacePoster3 citations
- Make Your ViT-based Multi-view 3D Detectors Faster via Token CompressionPoster3 citations
- Markov Knowledge Distillation: Make Nasty Teachers trained by Self-undermining Knowledge Distillation Fully DistillablePoster3 citations
- MarvelOVD: Marrying Object Recognition and Vision-Language Models for Robust Open-Vocabulary Object DetectionPoster3 citations
- MemBN: Robust Test-Time Adaptation via Batch Norm with Statistics MemoryPoster3 citations
- Memory-Efficient Fine-Tuning for Quantized Diffusion ModelPoster3 citations
- Minimalist Vision with Freeform PixelsOral3 citations
- Mitigating Perspective Distortion-induced Shape Ambiguity in Image CropsPoster3 citations
- MoEAD: A Parameter-efficient Model for Multi-class Anomaly DetectionPoster3 citations
- Modeling and Driving Human Body Soundfields through Acoustic PrimitivesPoster3 citations
- Modelling Competitive Behaviors in Autonomous Driving Under Generative World ModelPoster3 citations
- MonoTTA: Fully Test-Time Adaptation for Monocular 3D Object DetectionPoster3 citations
- Motion-Oriented Compositional Neural Radiance Fields for Monocular Dynamic Human ModelingPoster3 citations
- Multiscale Sliced Wasserstein Distances as Perceptual Color Difference MeasuresPoster3 citations
- Möbius Transform for Mitigating Perspective Distortions in Representation LearningPoster3 citations
- Neural Volumetric World Models for Autonomous DrivingPoster3 citations
- Object-Aware Query Perturbation for Cross-Modal Image-Text RetrievalPoster3 citations
- Occluded Gait Recognition with Mixture of Experts: An Action Detection PerspectivePoster3 citations
- Open Vocabulary 3D Scene Understanding via Geometry Guided Self-DistillationPoster3 citations
- Open-Set Biometrics: Beyond Good Closed-Set ModelsPoster3 citations
- OpenKD: Opening Prompt Diversity for Zero- and Few-shot Keypoint DetectionPoster3 citations
- Operational Open-Set Recognition and PostMax RefinementPoster3 citations
- Optimizing Illuminant Estimation in Dual-Exposure HDR ImagingPoster3 citations
- Overcome Modal Bias in Multi-modal Federated Learning via Balanced Modality SelectionPoster3 citations
- Overcoming Distribution Mismatch in Quantizing Image Super-Resolution NetworksPoster3 citations
- PARIS3D: Reasoning-based 3D Part Segmentation Using Large Multimodal ModelPoster3 citations
- PCF-Lift: Panoptic Lifting by Probabilistic Contrastive FusionPoster3 citations
- PEA-Diffusion: Parameter-Efficient Adapter with Knowledge Distillation in non-English Text-to-Image GenerationPoster3 citations
- PRET: Planning with Directed Fidelity Trajectory for Vision and Language NavigationPoster3 citations
- Parameterized Quasi-Physical Simulators for Dexterous Manipulations TransferPoster3 citations
- PartCraft: Crafting Creative Objects by PartsPoster3 citations
- PartGLEE: A Foundation Model for Recognizing and Parsing Any ObjectsPoster3 citations
- PartImageNet++ Dataset: Scaling up Part-based Models for Robust RecognitionPoster3 citations
- PartSTAD: 2D-to-3D Part Segmentation Task AdaptationPoster3 citations
- Ponymation: Learning Articulated 3D Animal Motions from Unlabeled Online VideosPoster3 citations
- Pose-Aware Self-Supervised Learning with Viewpoint Trajectory RegularizationOral3 citations
- Power Variable Projection for Initialization-Free Large-Scale Bundle AdjustmentPoster3 citations
- Powerful and Flexible: Personalized Text-to-Image Generation via Reinforcement LearningPoster3 citations
- Preventing Catastrophic Overfitting in Fast Adversarial Training: A Bi-level Optimization PerspectivePoster3 citations
- ProMerge: Prompt and Merge for Unsupervised Instance SegmentationPoster3 citations
- Progressive Classifier and Feature Extractor Adaptation for Unsupervised Domain Adaptation on Point CloudsPoster3 citations
- Prompt-Based Test-Time Real Image Dehazing: A Novel PipelinePoster3 citations
- Pseudo-RIS: Distinctive Pseudo-supervision Generation for Referring Image SegmentationPoster3 citations
- Pseudo-keypoint RKHS Learning for Self-supervised 6DoF Pose EstimationPoster3 citations
- Q&A Prompts: Discovering Rich Visual Clues through Mining Question-Answer Prompts for VQA requiring Diverse World KnowledgePoster3 citations
- RISurConv: Rotation Invariant Surface Attention-Augmented Convolutions for 3D Point Cloud Classification and SegmentationOral3 citations
- R^2-Bench: Benchmarking the Robustness of Referring Perception Models under PerturbationsPoster3 citations
- Rasterized Edge Gradients: Handling Discontinuities DifferentiallyOral3 citations
- ReCON: Training-Free Acceleration for Text-to-Image Synthesis with Retrieval of Concept Prompt TrajectoriesPoster3 citations
- Real Appearance Modeling for More General Deepfake DetectionPoster3 citations
- Responsible Visual EditingPoster3 citations
- Rethinking and Improving Visual Prompt Selection for In-Context Learning Segmentation FrameworkPoster3 citations
- RoScenes: A Large-scale Multi-view 3D Dataset for Roadside PerceptionPoster3 citations
- Robust Zero-Shot Crowd Counting and Localization with Adaptive Resolution SAMPoster3 citations
- SA-DVAE: Improving Zero-Shot Skeleton-Based Action Recognition by Disentangled Variational AutoencodersPoster3 citations
- SCOD: From Heuristics to TheoryPoster3 citations
- SCP-Diff: Spatial-Categorical Joint Prior for Diffusion Based Semantic Image SynthesisPoster3 citations
- SHIC: Shape-Image Correspondences with no Keypoint SupervisionPoster3 citations
- STSP: Spatial-Temporal Subspace Projection for Video Class-incremental LearningPoster3 citations
- S^3D-NeRF: Single-Shot Speech-Driven Neural Radiance Field for High Fidelity Talking Head SynthesisPoster3 citations
- Self-supervised co-salient object detection via feature correspondences at multiple scalesPoster3 citations
- SelfGeo: Self-supervised and Geodesic-consistent Estimation of Keypoints on Deformable ShapesPoster3 citations
- SemanticHuman-HD: High Resolution Semantic disentangled 3D Human GenerationPoster3 citations
- Semi-supervised Segmentation of Histopathology Images with Noise-Aware Topological ConsistencyPoster3 citations
- Semicalibrated Relative Pose from an Affine Correspondence and MonodepthPoster3 citations
- Similarity of Neural Architectures using Adversarial Attack TransferabilityPoster3 citations
- Skeleton-based Group Activity Recognition via Spatial-Temporal Panoramic GraphPoster3 citations
- SlotLifter: Slot-guided Feature Lifting for Learning Object-Centric Radiance FieldsPoster3 citations
- Strike a Balance in Continual Panoptic SegmentationPoster3 citations
- StyleCity: Large-Scale 3D Urban Scenes StylizationPoster3 citations
- TPA3D: Triplane Attention for Fast Text-to-3D GenerationPoster3 citations
- Take A Step Back: Rethinking the Two Stages in Visual ReasoningPoster3 citations
- Test-Time Stain Adaptation with Diffusion Models for Histopathology Image ClassificationPoster3 citations
- Text Motion Translator: A Bi-Directional Model for Enhanced 3D Human Motion Generation from Open-Vocabulary DescriptionsPoster3 citations
- Textual Query-Driven Mask Transformer for Domain Generalized SegmentationPoster3 citations
- Three Things We Need to Know About Transferring Stable Diffusion to Visual Dense Prediciton TasksPoster3 citations
- Towards Image Ambient Lighting NormalizationPoster3 citations
- Towards Physical World Backdoor Attacks against Skeleton Action RecognitionPoster3 citations
- Towards Real-World Adverse Weather Image Restoration: Enhancing Clearness and Semantics with Vision-Language ModelsPoster3 citations
- Towards Robust Event-based Networks for Nighttime via Unpaired Day-to-Night Event TranslationPoster3 citations
- Towards Stable 3D Object DetectionPoster3 citations
- U-COPE: Taking a Further Step to Universal 9D Category-level Object Pose EstimationPoster3 citations
- UCIP: A Universal Framework for Compressed Image Super-Resolution using Dynamic PromptPoster3 citations
- UMERegRobust – Universal Manifold Embedding Compatible Features for Robust Point Cloud RegistrationPoster3 citations
- Un-EVIMO: Unsupervised Event-based Independent Motion SegmentationPoster3 citations
- Understanding and Mitigating Human-Labelling Errors in Supervised Contrastive LearningPoster3 citations
- UniCal: Unified Neural Sensor CalibrationPoster3 citations
- UniTalker: Scaling up Audio-Driven 3D Facial Animation through A Unified ModelPoster3 citations
- Unlocking Attributes' Contribution to Successful Camouflage: A Combined Textual and Visual Analysis StrategyPoster3 citations
- Unmasking Bias in Diffusion Model TrainingPoster3 citations
- Unsupervised Moving Object Segmentation with Atmospheric TurbulencePoster3 citations
- VCD-Texture: Variance Alignment based 3D-2D Co-Denoising for Text-Guided TexturingPoster3 citations
- Viewpoint textual inversion: discovering scene representations and 3D view control in 2D diffusion modelsPoster3 citations
- Visual Grounding for Object-Level Generalization in Reinforcement LearningPoster3 citations
- WAVE: Warping DDIM Inversion Features for Zero-shot Text-to-Video EditingPoster3 citations
- WPS-SAM: Towards Weakly-Supervised Part Segmentation with Foundation ModelsOral3 citations
- Weakly Supervised Co-training with Swapping Assignments for Semantic SegmentationPoster3 citations
- WebRPG: Automatic Web Rendering Parameters Generation for Visual PresentationPoster3 citations
- iNeMo: Incremental Neural Mesh Models for Robust Class-Incremental LearningPoster3 citations
- nuCraft: Crafting High Resolution 3D Semantic Occupancy for Unified 3D Scene UnderstandingPoster3 citations
- "DECOLLAGE: 3D Detailization by Controllable, Localized, and Learned Geometry Enhancement"Poster2 citations
- "Not Just Change the Labels, Learn the Features: Watermarking Deep Neural Networks with Multi-View Data"Poster2 citations
- "Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos"Oral2 citations
- "SPHINX: A Mixer of Weights, Visual Embeddings and Image Scales for Multi-modal Large Language Models"Poster2 citations
- 2S-ODIS: Two-Stage Omni-Directional Image Synthesis by Geometric Distortion CorrectionPoster2 citations
- 3D Hand Sequence Recovery from Real Blurry Images and Event StreamPoster2 citations
- 3D Reconstruction of Objects in Hands without Real World 3D SupervisionPoster2 citations
- 3D Weakly Supervised Semantic Segmentation with 2D Vision-Language GuidancePoster2 citations
- 3R-INN: How to be climate friendly while consuming/delivering videos?Poster2 citations
- 3x2: 3D Object Part Segmentation by 2D Semantic CorrespondencesPoster2 citations
- A Cephalometric Landmark Regression Method based on Dual-encoder for High-resolution X-ray ImagePoster2 citations
- A Direct Approach to Viewing Graph SolvabilityOral2 citations
- A Simple Low-bit Quantization Framework for Video Snapshot Compressive ImagingOral2 citations
- AFreeCA: Annotation-Free Counting for AllPoster2 citations
- Accelerating Image Super-Resolution Networks with Pixel-Level ClassificationPoster2 citations
- AdaIFL: Adaptive Image Forgery Localization via a Dynamic and Importance-aware Transformer NetworkPoster2 citations
- Adapt without Forgetting: Distill Proximity from Dual Teachers in Vision-Language ModelsPoster2 citations
- Adapt2Reward: Adapting Video-Language Models to Generalizable Robotic Rewards via Failure PromptsPoster2 citations
- Adaptive Parametric ActivationOral2 citations
- AddMe: Zero-shot Group-photo Synthesis by Inserting People into ScenesPoster2 citations
- AdversariaLeak: External Information Leakage Attack Using Adversarial Samples on Face Recognition SystemsPoster2 citations
- Adversarially Robust Distillation by Reducing the Student-Teacher Variance GapPoster2 citations
- AnimateMe: 4D Facial Expressions via Diffusion ModelsPoster2 citations
- Approaching Outside: Scaling Unsupervised 3D Object Detection from 2D ScenePoster2 citations
- Are Synthetic Data Useful for Egocentric Hand-Object Interaction Detection?Poster2 citations
- ArtVLM: Attribute Recognition Through Vision-Based Prefix Language ModelingPoster2 citations
- Assessing Sample Quality via the Latent Space of Generative ModelsPoster2 citations
- AugDETR: Improving Multi-scale Learning for Detection TransformerPoster2 citations
- AvatarPose: Avatar-guided 3D Pose Estimation of Close Human Interaction from Sparse Multi-view VideosPoster2 citations
- Better Regression Makes Better Test-time Adaptive 3D Object DetectionPoster2 citations
- Bi-TTA: Bidirectional Test-Time Adapter for Remote Physiological MeasurementPoster2 citations
- Boosting Gaze Object Prediction via Pixel-level Supervision from Vision Foundation ModelPoster2 citations
- Brain Netflix: Scaling Data to Reconstruct Videos from Brain SignalsPoster2 citations
- Bucketed Ranking-based Losses for Efficient Training of Object DetectorsPoster2 citations
- CARFF: Conditional Auto-encoded Radiance Field for 3D Scene ForecastingPoster2 citations
- CC-SAM: Enhancing SAM with Cross-feature Attention and Context for Ultrasound Image SegmentationPoster2 citations
- CONDA: Condensed Deep Association Learning for Co-Salient Object Detection.Poster2 citations
- CPM: Class-conditional Prompting Machine for Audio-visual SegmentationPoster2 citations
- Camera Height Doesn't Change: Unsupervised Training for Metric Monocular Road-Scene Depth EstimationPoster2 citations
- CamoTeacher: Dual-Rotation Consistency Learning for Semi-Supervised Camouflaged Object DetectionPoster2 citations
- CatchBackdoor: Backdoor Detection via Critical Trojan Neural Path FuzzingPoster2 citations
- CipherDM: Secure Three-Party Inference for Diffusion Model SamplingPoster2 citations
- CityGuessr: City-Level Video Geo-Localization on a Global ScalePoster2 citations
- Clean & Compact: Efficient Data-Free Backdoor Defense with Model CompactnessPoster2 citations
- CoLeaF: A Contrastive-Collaborative Learning Framework for Weakly Supervised Audio-Visual Video ParsingPoster2 citations
- CoPT: Unsupervised Domain Adaptive Segmentation using Domain-Agnostic Text EmbeddingsPoster2 citations
- Collaborative Control for Geometry-Conditioned PBR Image GenerationPoster2 citations
- ColorMAE: Exploring data-independent masking strategies in Masked AutoEncodersPoster2 citations
- Compensation Sampling for Improved Convergence in Diffusion ModelsPoster2 citations
- Compositional Substitutivity of Visual Reasoning for Visual Question AnsweringPoster2 citations
- Comprehensive Attribution: Inherently Explainable Vision Model with Feature DetectorPoster2 citations
- Contrastive Learning with Synthetic PositivesPoster2 citations
- Contribution-based Low-Rank Adaptation with Pre-training Model for Real Image RestorationPoster2 citations
- CroMo-Mixup: Augmenting Cross-Model Representations for Continual Self-Supervised LearningPoster2 citations
- Customized Generation Reimagined: Fidelity and Editability HarmonizedPoster2 citations
- D-SCo: Dual-Stream Conditional Diffusion for Monocular Hand-Held Object ReconstructionPoster2 citations
- DCDM: Diffusion-Conditioned-Diffusion Model for Scene Text Image Super-ResolutionPoster2 citations
- DEVIAS: Learning Disentangled Video Representations of Action and SceneOral2 citations
- DISCO: Embodied Navigation and Interaction via Differentiable Scene Semantics and Dual-level ControlPoster2 citations
- DNI: Dilutional Noise Initialization for Diffusion Video EditingPoster2 citations
- Data Augmentation via Latent Diffusion for Saliency PredictionPoster2 citations
- De-confounded Gaze EstimationPoster2 citations
- Decomposed Vector-Quantized Variational Autoencoder for Human Grasp GenerationPoster2 citations
- Dependency-aware Differentiable Neural Architecture SearchPoster2 citations
- Differentiable Product Quantization for Memory Efficient Camera RelocalizationPoster2 citations
- Diffusion Model for Robust Multi-Sensor Fusion in 3D Object Detection and BEV SegmentationPoster2 citations
- Diffusion Prior-Based Amortized Variational Inference for Noisy Inverse ProblemsOral2 citations
- Diffusion for Out-of-Distribution Detection on Road Scenes and BeyondPoster2 citations
- Discovering Novel Actions from Open World Egocentric Videos with Object-Grounded Visual Commonsense ReasoningPoster2 citations
- Divide and Fuse: Body Part Mesh Recovery from Partially Visible Human ImagesPoster2 citations
- Do Generalised Classifiers really work on Human Drawn Sketches?Poster2 citations
- DomainFusion: Generalizing To Unseen Domains with Latent Diffusion ModelsPoster2 citations
- DreamDrone: Text-to-Image Diffusion Models are Zero-shot Perpetual View GeneratorsPoster2 citations
- DreamView: Injecting View-specific Text Guidance into Text-to-3D GenerationPoster2 citations
- EBDM: Exemplar-guided Image Translation with Brownian-bridge Diffusion ModelsPoster2 citations
- EINet: Point Cloud Completion via Extrapolation and InterpolationPoster2 citations
- Early Preparation Pays Off: New Classifier Pre-tuning for Class Incremental Semantic SegmentationPoster2 citations
- Efficient Bias Mitigation Without Privileged InformationOral2 citations
- Efficient Learning of Event-based Dense Representation using Hierarchical Memories with Adaptive UpdatePoster2 citations
- Elegantly Written: Disentangling Writer and Character Styles for Enhancing Online Chinese HandwritingPoster2 citations
- Elevating All Zero-Shot Sketch-Based Image Retrieval Through Multimodal Prompt LearningPoster2 citations
- Enhanced Motion Forecasting with Visual Relation ReasoningPoster2 citations
- Enhanced Sparsification via Stimulative TrainingPoster2 citations
- Enhancing Plausibility Evaluation for Generated Designs with Denoising AutoencoderPoster2 citations
- Enhancing Tampered Text Detection through Frequency Feature Fusion and DecompositionPoster2 citations
- Enriching Information and Preserving Semantic Consistency in Expanding Curvilinear Object Segmentation DatasetsPoster2 citations
- EntAugment: Entropy-Driven Adaptive Data Augmentation Framework for Image ClassificationPoster2 citations
- EraseDraw : Learning to Insert Objects by Erasing Them from ImagesPoster2 citations
- Event-based Head Pose Estimation: Benchmark and MethodPoster2 citations
- Exploring Vulnerabilities in Spiking Neural Networks: Direct Adversarial Attacks on Raw Event DataPoster2 citations
- FREST: Feature RESToration for Semantic Segmentation under Multiple Adverse ConditionsPoster2 citations
- FastCAD: Real-Time CAD Retrieval and Alignment from Scans and VideosPoster2 citations
- FastPCI: Motion-Structure Guided Fast Point Cloud Frame InterpolationPoster2 citations
- FedVAD: Enhancing Federated Video Anomaly Detection with GPT-Driven Semantic DistillationPoster2 citations
- Finding Meaning in Points: Weakly Supervised Semantic Segmentation for Event CamerasPoster2 citations
- Flowed Time of Flight Radiance FieldsPoster2 citations
- From Fake to Real: Pretraining on Balanced Synthetic Images to Prevent Spurious Correlations in Image RecognitionOral2 citations
- G2fR: Frequency Regularization in Grid-based Feature Encoding Neural Radiance FieldsPoster2 citations
- GAMMA-FACE: GAussian Mixture Models Amend Diffusion Models for Bias Mitigation in Face ImagesPoster2 citations
- GRACE: Graph-Based Contextual Debiasing for Fair Visual Question AnsweringPoster2 citations
- GenQ: Quantization in Low Data Regimes with Generative Synthetic DataPoster2 citations
- GenRC: Generative 3D Room Completion from Sparse Image CollectionsPoster2 citations
- Generalized Coverage for More Robust Low-Budget Active LearningPoster2 citations
- Geometry Fidelity for Spherical ImagesPoster2 citations
- Global-Local Collaborative Inference with LLM for Lidar-Based Open-Vocabulary DetectionPoster2 citations
- Gradient-Aware for Class-Imbalanced Semi-supervised Medical Image SegmentationPoster2 citations
- H-V2X: A Large Scale Highway Dataset for BEV PerceptionOral2 citations
- HVCLIP: High-dimensional Vector in CLIP for Unsupervised Domain AdaptationPoster2 citations
- HandDGP: Camera-Space Hand Mesh Prediction with Differentiable Global PositioningPoster2 citations
- HiEI: A Universal Framework for Generating High-quality Emerging Images from Natural ImagesPoster2 citations
- HyTAS: A Hyperspectral Image Transformer Architecture Search Benchmark and AnalysisPoster2 citations
- HybridBooth: Hybrid Prompt Inversion for Efficient Subject-Driven GenerationPoster2 citations
- I2-SLAM: Inverting Imaging Process for Robust Photorealistic Dense SLAMPoster2 citations
- IFTR: An Instance-Level Fusion Transformer for Visual Collaborative PerceptionPoster2 citations
- Image Manipulation Detection With Implicit Neural Representation and Limited SupervisionPoster2 citations
- Implicit Neural Models to Extract Heart Rate from VideoPoster2 citations
- Improving Vision and Language Concepts Understanding with Multimodal Counterfactual SamplesPoster2 citations
- Introducing Routing Functions to Vision-Language Parameter-Efficient Fine-Tuning with Low-Rank BottlenecksPoster2 citations
- LNL+K: Enhancing Learning with Noisy Labels Through Noise Source Knowledge IntegrationPoster2 citations
- LaMI-DETR: Open-Vocabulary Detection with Language Model InstructionPoster2 citations
- Latent-INR: A Flexible Framework for Implicit Representations of Videos with Discriminative SemanticsPoster2 citations
- Layout-Corrector: Alleviating Layout Sticking Phenomenon in Discrete Diffusion ModelPoster2 citations
- Learned Neural Physics Simulation for Articulated 3D Human Pose ReconstructionPoster2 citations
- Learning Anomalies with Normality Prior for Unsupervised Video Anomaly DetectionPoster2 citations
- Learning Differentially Private Diffusion Models via Stochastic Adversarial DistillationPoster2 citations
- Learning Multimodal Latent Generative Models with Energy-Based PriorOral2 citations
- Learning Pseudo 3D Guidance for View-consistent Texturing with 2D DiffusionPoster2 citations
- Learning Representation for Multitask Learning through Self-Supervised Auxiliary LearningPoster2 citations
- Learning Trimodal Relation for Audio-Visual Question Answering with Missing ModalityPoster2 citations
- Learning from the Web: Language Drives Weakly-Supervised Incremental Learning for Semantic SegmentationPoster2 citations
- Learning to Enhance Aperture Phasor Field for Non-Line-of-Sight ImagingPoster2 citations
- Learning to Localize Actions in Instructional Videos with LLM-Based Multi-Pathway Text-Video AlignmentPoster2 citations
- Learning to Make Keypoints Sub-Pixel AccuratePoster2 citations
- Learning with Unmasked Tokens Drives Stronger Vision LearnersPoster2 citations
- LiDAR-Event Stereo Fusion with HallucinationsPoster2 citations
- Light-in-Flight for a World-in-MotionPoster2 citations
- LineFit: A Geometric Approach for Fitting Line Segments in ImagesPoster2 citations
- LiveHPS++: Robust and Coherent Motion Capture in Dynamic Free EnvironmentOral2 citations
- LogoSticker: Inserting Logos into Diffusion Models for Customized GenerationPoster2 citations
- Long-Tail Temporal Action Segmentation with Group-wise Temporal Logit AdjustmentPoster2 citations
- Long-range Turbulence Mitigation: A Large-scale Dataset and A Coarse-to-fine FrameworkPoster2 citations
- Look Hear: Gaze Prediction for Speech-directed Human AttentionPoster2 citations
- ML-SemReg: Boosting Point Cloud Registration with Multi-level Semantic ConsistencyPoster2 citations
- MO-EMT-NAS: Multi-Objective Continuous Transfer of Architectural Knowledge Between Tasks from Different DatasetsPoster2 citations
- Made to Order: Discovering monotonic temporal changes via self-supervised video orderingOral2 citations
- Mahalanobis Distance-based Multi-view Optimal Transport for Multi-view Crowd LocalizationPoster2 citations
- Mask as Supervision: Leveraging Unified Mask Information for Unsupervised 3D Pose EstimationPoster2 citations
- MedRAT: Unpaired Medical Report Generation via Auxiliary TasksPoster2 citations
- MeshFeat: Multi-Resolution Features for Neural Fields on MeshesPoster2 citations
- Mitigating Background Shift in Class-Incremental Semantic SegmentationPoster2 citations
- MonoWAD: Weather-Adaptive Diffusion Model for Robust Monocular 3D Object DetectionPoster2 citations
- Multi-Modal Video Dialog State Tracking in the WildPoster2 citations
- Multi-Sentence Grounding for Long-term Instructional VideoPoster2 citations
- NAMER: Non-Autoregressive Modeling for Handwritten Mathematical Expression RecognitionPoster2 citations
- NL2Contact: Natural Language Guided 3D Hand-Object Contact Modeling with Diffusion ModelOral2 citations
- Navigating Text-to-Image Generative Bias across Indic LanguagesPoster2 citations
- Neural MetamorphosisPoster2 citations
- Nickel and Diming Your GAN: A Dual-Method Approach to Enhancing GAN Efficiency via Knowledge DistillationPoster2 citations
- Non-transferable PruningPoster2 citations
- OMR: Occlusion-Aware Memory-Based Refinement for Video Lane DetectionPoster2 citations
- OP-Align: Object-level and Part-level Alignment for Self-supervised Category-level Articulated Object Pose EstimationOral2 citations
- Occlusion-Aware Seamless SegmentationPoster2 citations
- Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training ModelsOral2 citations
- On Learning Discriminative Features from Synthesized Data for Self-Supervised Fine-Grained Visual RecognitionPoster2 citations
- On Pretraining Data Diversity for Self-Supervised LearningPoster2 citations
- On the Approximation Risk of Few-Shot Class-Incremental LearningPoster2 citations
- On the Vulnerability of Skip Connections to Model Inversion AttacksPoster2 citations
- OneTrack: Demystifying the Conflict Between Detection and Tracking in End-to-End 3D TrackersPoster2 citations
- Open Vocabulary Multi-Label Video ClassificationPoster2 citations
- Open-World Dynamic Prompt and Continual Visual Representation LearningPoster2 citations
- Optimization-based Uncertainty Attribution Via Learning Informative PerturbationsPoster2 citations
- PMT: Progressive Mean Teacher via Exploring Temporal Consistency for Semi-Supervised Medical Image SegmentationPoster2 citations
- POA: Pre-training Once for Models of All SizesPoster2 citations
- PaPr: Training-Free One-Step Patch Pruning with Lightweight ConvNets for Faster InferencePoster2 citations
- PapMOT: Exploring Adversarial Patch Attack against Multiple Object TrackingPoster2 citations
- Personalized Privacy Protection Mask Against Unauthorized Facial RecognitionPoster2 citations
- Pick-a-back: Selective Device-to-Device Knowledge Transfer in Federated Continual LearningPoster2 citations
- Plain-Det: A Plain Multi-Dataset Object DetectorPoster2 citations
- Plug and Play: A Representation Enhanced Domain Adapter for Collaborative PerceptionPoster2 citations
- PolyRoom: Room-aware Transformer for Floorplan ReconstructionPoster2 citations
- PreLAR: World Model Pre-training with Learnable Action RepresentationPoster2 citations
- Prediction Exposes Your Face: Black-box Model Inversion via Prediction AlignmentPoster2 citations
- Quantization-Friendly Winograd Transformations for Convolutional Neural NetworksPoster2 citations
- QueryCDR: Query-based Controllable Distortion Rectification Network for Fisheye ImagesPoster2 citations
- RAVE: Residual Vector Embedding for CLIP-Guided Backlit Image EnhancementPoster2 citations
- Ray-Distance Volume Rendering for Neural Scene ReconstructionPoster2 citations
- ReALFRED: An Embodied Instruction Following Benchmark in Photo-Realistic EnvironmentsPoster2 citations
- RePOSE: 3D Human Pose Estimation via Spatio-Temporal Depth Relational ConsistencyPoster2 citations
- Region-Aware Sequence-to-Sequence Learning for Hyperspectral DenoisingPoster2 citations
- Regulating Model Reliance on Non-Robust Features by Smoothing Input Marginal DensityPoster2 citations
- RepVF: A Unified Vector Fields Representation for Multi-task 3D PerceptionPoster2 citations
- Retargeting Visual Data with Deformation FieldsPoster2 citations
- Rethinking Image Super Resolution from Training Data PerspectivesPoster2 citations
- Rethinking Image-to-Video Adaptation: An Object-centric PerspectivePoster2 citations
- Rethinking LiDAR Domain Generalization: Single Source as Multiple Density DomainsPoster2 citations
- Rethinking Video-Text Understanding: Retrieval from Counterfactually Augmented DataPoster2 citations
- SAFT: Towards Out-of-Distribution Generalization in Fine-TuningPoster2 citations
- SCAPE: A Simple and Strong Category-Agnostic Pose EstimatorPoster2 citations
- SCOMatch: Alleviating Overtrusting in Open-set Semi-supervised LearningPoster2 citations
- SENC: Handling Self-collision in Neural Cloth SimulationPoster2 citations
- SG-NeRF: Neural Surface Reconstruction with Scene Graph OptimizationPoster2 citations
- SIGMA: Sinkhorn-Guided Masked Video ModelingPoster2 citations
- SINDER: Repairing the Singular Defects of DINOv2Oral2 citations
- SMILe: Leveraging Submodular Mutual Information For Robust Few-Shot Object DetectionPoster2 citations
- SPIN: Hierarchical Segmentation with Subpart Granularity in Natural ImagesPoster2 citations
- SPVLoc: Semantic Panoramic Viewport Matching for 6D Camera Localization in Unseen EnvironmentsOral2 citations
- SUP-NeRF: A Streamlined Unification of Pose Estimation and NeRF for Monocular 3D Object ReconstructionPoster2 citations
- Scaling Backwards: Minimal Synthetic Pre-training?Poster2 citations
- Seeing Faces in Things: A Model and Dataset for PareidoliaPoster2 citations
- Self-Supervised Any-Point Tracking by Contrastive Random WalksPoster2 citations
- Self-Training Room Layout via Geometry-aware Ray-castingPoster2 citations
- SelfSwapper: Self-Supervised Face Swapping via Shape Agnostic Masked AutoEncoderPoster2 citations
- SemReg: Semantics Constrained Point Cloud RegistrationPoster2 citations
- Semantic Diversity-aware Prototype-based Learning for Unbiased Scene Graph GenerationPoster2 citations
- Shape-guided Configuration-aware Learning for Endoscopic-image-based Pose Estimation of Flexible Robotic InstrumentsPoster2 citations
- ShoeModel: Learning to Wear on the User-specified Shoes via Diffusion ModelPoster2 citations
- SignGen: End-to-End Sign Language Video Generation with Latent DiffusionPoster2 citations
- SimPB: A Single Model for 2D and 3D Object Detection from Multiple CamerasPoster2 citations
- Six-Point Method for Multi-Camera Systems with Reduced Solution SpaceOral2 citations
- SkyMask: Attack-agnostic Robust Federated Learning with Fine-grained Learnable MasksPoster2 citations
- SkyScenes: A Synthetic Dataset for Aerial Scene UnderstandingPoster2 citations
- Source-Free Domain-Invariant Performance PredictionPoster2 citations
- Sparse Refinement for Efficient High-Resolution Semantic SegmentationPoster2 citations
- Spatial-Temporal Multi-level Association for Video Object SegmentationPoster2 citations
- Spatially-Variant Degradation Model for Dataset-free Super-resolutionPoster2 citations
- Spike-Temporal Latent Representation for Energy-Efficient Event-to-Video ReconstructionPoster2 citations
- Statewide Visual Geolocalization in the WildPoster2 citations
- Structured-NeRF: Hierarchical Scene Graph with Neural RepresentationPoster2 citations
- SuperFedNAS: Cost-Efficient Federated Neural Architecture Search for On-Device InferencePoster2 citations
- Superpixel-informed Implicit Neural Representation for Multi-Dimensional DataPoster2 citations
- Synchronization of Projective TransformationsPoster2 citations
- TCLC-GS: Tightly Coupled LiDAR-Camera Gaussian Splatting for Autonomous DrivingPoster2 citations
- TTD: Text-Tag Self-Distillation Enhancing Image-Text Alignment in CLIP to Alleviate Single Tag BiasPoster2 citations
- TTT-MIM: Test-Time Training with Masked Image Modeling for Denoising Distribution ShiftsPoster2 citations
- Taming Lookup Tables for Efficient Image RetouchingPoster2 citations
- Task-Driven Uncertainty Quantification in Inverse Problems via Conformal PredictionPoster2 citations
- Temporal Residual Guided Diffusion Framework for Event-Driven Video ReconstructionOral2 citations
- Temporal Residual Jacobians for Rig-free Motion TransferPoster2 citations
- Tendency-driven Mutual Exclusivity for Weakly Supervised Incremental Semantic SegmentationPoster2 citations
- Test-time Model Adaptation for Image Reconstruction Using Self-supervised Adaptive LayersPoster2 citations
- This Probably Looks Exactly Like That: An Invertible Prototypical NetworkPoster2 citations
- Topo4D: Topology-Preserving Gaussian Splatting for High-Fidelity 4D Head CapturePoster2 citations
- Toward Tiny and High-quality Facial Makeup with Data Amplify LearningPoster2 citations
- Towards Adaptive Pseudo-label Learning for Semi-Supervised Temporal Action LocalizationPoster2 citations
- Towards More Practical Group Activity Detection: A New Benchmark and ModelPoster2 citations
- Towards Open-World Object-based Anomaly Detection via Self-Supervised Outlier SynthesisPoster2 citations
- Trajectory-aligned Space-time Tokens for Few-shot Action RecognitionPoster2 citations
- TriNeRFLet: A Wavelet Based Triplane NeRF RepresentationPoster2 citations
- Two-Stage Video Shadow Detection via Temporal-Spatial AdaptionPoster2 citations
- UL-VIO: Ultra-lightweight Visual-Inertial Odometry with Noise Robust Test-time AdaptationPoster2 citations
- UNIKD: UNcertainty-Filtered Incremental Knowledge Distillation for Neural Implicit RepresentationPoster2 citations
- UniFS: Universal Few-shot Instance Perception with Point RepresentationsPoster2 citations
- Unsupervised Exposure CorrectionPoster2 citations
- VSViG: Real-time Video-based Seizure Detection via Skeleton-based Spatiotemporal ViGPoster2 citations
- VisFocus: Prompt-Guided Vision Encoders for OCR-Free Dense Document UnderstandingPoster2 citations
- Vision-Language Dual-Pattern Matching for Out-of-Distribution DetectionPoster2 citations
- Vista3D: unravel the 3d darkside of a single imagePoster2 citations
- WaSt-3D: Wasserstein-2 Distance for Scene-to-Scene Stylization on 3D GaussiansPoster2 citations
- Weakly-Supervised Spatio-Temporal Video Grounding with Variational Cross-Modal AlignmentPoster2 citations
- Weighting Pseudo-Labels via High-Activation Feature Index Similarity and Object Detection for Semi-Supervised SegmentationPoster2 citations
- X-Former: Unifying Contrastive and Reconstruction Learning for MLLMsPoster2 citations
- Zero-Shot Adaptation for Approximate Posterior Sampling of Diffusion Models in Inverse ProblemsPoster2 citations
- Zero-shot Text-guided Infinite Image Synthesis with LLM guidancePoster2 citations
- denoiSplit: a method for joint microscopy image splitting and unsupervised denoisingPoster2 citations
- "Plan, Posture and Go: Towards Open-vocabulary Text-to-Motion Generation"Poster1 citations
- "PoseEmbroider: Towards a 3D, Visual, Semantic-aware Human Pose Representation"Poster1 citations
- "SIMBA: Split Inference - Mechanisms, Benchmarks and Attacks"Poster1 citations
- "Smoothness, Synthesis, and Sampling: Re-thinking Unsupervised Multi-View Stereo with DIV Loss"Oral1 citations
- "Towards Dual Transparent Liquid Level Estimation in Biomedical Lab: Dataset, Methods and Practice"Poster1 citations
- 6DoF Head Pose Estimation through Explicit Bidirectional Interaction with Face GeometryPoster1 citations
- A Diffusion Model for Simulation Ready Coronary Anatomy with Morpho-skeletal ControlPoster1 citations
- A Fair Ranking and New Model for Panoptic Scene Graph GenerationOral1 citations
- A Riemannian Approach for Spatiotemporal Analysis and Generation of 4D Tree-shaped StructuresOral1 citations
- A high-quality robust diffusion framework for corrupted datasetPoster1 citations
- AD3: Introducing a score for Anomaly Detection Dataset Difficulty assessment using VIADUCT datasetPoster1 citations
- ADMap: Anti-disturbance Framework for Vectorized HD Map ConstructionPoster1 citations
- ADen: Adaptive Density Representations for Sparse-view Camera Pose EstimationOral1 citations
- AEDNet: Adaptive Embedding and Multiview-Aware Disentanglement for Point Cloud CompletionPoster1 citations
- Adapting to Shifting Correlations with Unlabeled Data CalibrationPoster1 citations
- Adaptive Annealing for Robust AveragingPoster1 citations
- Adaptive Correspondence Scoring for Unsupervised Medical Image RegistrationOral1 citations
- Adaptive Multi-task Learning for Few-shot Object DetectionPoster1 citations
- Adaptive Selection of Sampling-Reconstruction in Fourier Compressed SensingPoster1 citations
- Adversarial Robustification via Text-to-Image Diffusion ModelsOral1 citations
- Agglomerative Token ClusteringPoster1 citations
- Alignist: CAD-Informed Orientation Distribution Estimation by Fusing Shape and CorrespondencesPoster1 citations
- An accurate detection is not all you need to combat label noise in web-noisy datasetsPoster1 citations
- Analysis-by-Synthesis Transformer for Single-View 3D ReconstructionPoster1 citations
- Attention Decomposition for Cross-Domain Semantic SegmentationPoster1 citations
- Audio-driven Talking Face Generation with Stabilized Synchronization LossPoster1 citations
- BAFFLE: A Baseline of Backpropagation-Free Federated LearningPoster1 citations
- Bayesian Evidential Deep Learning for Online Action DetectionPoster1 citations
- Benchmarking the Robustness of Cross-view Geo-localization ModelsPoster1 citations
- Beyond Viewpoint: Robust 3D Object Recognition under Arbitrary Views through Joint Multi-Part RepresentationPoster1 citations
- BugNIST - a Large Volumetric Dataset for Detection under Domain ShiftPoster1 citations
- CIC-BART-SSA: : Controllable Image Captioning with Structured Semantic AugmentationPoster1 citations
- Catastrophic Overfitting: A Potential Blessing in DisguisePoster1 citations
- Chains of Diffusion ModelsPoster1 citations
- CliffPhys: Camera-based Respiratory Measurement using Clifford Neural NetworksPoster1 citations
- Co-speech Gesture Video Generation with 3D Human MeshesPoster1 citations
- Coarse-to-Fine Implicit Representation Learning for 3D Hand-Object Reconstruction from a Single RGB-D ImagePoster1 citations
- ComFusion: Enhancing Personalized Generation by Instance-Scene Compositing and FusionPoster1 citations
- Commonly Interesting ImagesPoster1 citations
- Context-Aware Action Recognition: Introducing a Comprehensive Dataset for Behavior ContrastPoster1 citations
- Controllable Contextualized Image Captioning: Directing the Visual Narrative through User-Defined HighlightsPoster1 citations
- Correspondence-Free SE(3) Point Cloud Registration in RKHS via Unsupervised Equivariant LearningPoster1 citations
- CriSp: Leveraging Tread Depth Maps for Enhanced Crime-Scene Shoeprint MatchingPoster1 citations
- Cross-Input Certified Training for Universal PerturbationsPoster1 citations
- Cs2K: Class-specific and Class-shared Knowledge Guidance for Incremental Semantic SegmentationPoster1 citations
- Curved Diffusion: A Generative Model With Optical Geometry ControlPoster1 citations
- Cut out the Middleman: Revisiting Pose-based Gait RecognitionPoster1 citations
- D4-VTON: Dynamic Semantics Disentangling for Differential Diffusion based Virtual Try-OnPoster1 citations
- DC-Solver: Improving Predictor-Corrector Diffusion Sampler via Dynamic CompensationPoster1 citations
- DEPICT: Diffusion-Enabled Permutation Importance for Image Classification TasksPoster1 citations
- DSMix: Distortion-Induced Saliency Map Based Pre-training for No-Reference Image Quality AssessmentPoster1 citations
- Data Collection-free Masked Video ModelingPoster1 citations
- Data Poisoning Quantization Backdoor AttackPoster1 citations
- Data-to-Model Distillation: Data-Efficient Learning FrameworkPoster1 citations
- DatasetNeRF: Efficient 3D-aware Data Factory with Generative Radiance FieldsPoster1 citations
- De-Confusing Pseudo-Labels in Source-Free Domain AdaptationPoster1 citations
- Deep Nets with Subsampling Layers Unwittingly Discard Useful Activations at Test-TimePoster1 citations
- Deep Polarization Cues for Single-shot Shape and Subsurface Scattering EstimationPoster1 citations
- Delving Deep into Engagement Prediction of Short VideosPoster1 citations
- Delving into Adversarial Robustness on Document Tampering LocalizationPoster1 citations
- Depth-guided NeRF Training via Earth Mover’s DistancePoster1 citations
- DiffCD: A Symmetric Differentiable Chamfer Distance for Neural Implicit Surface FittingPoster1 citations
- Diffusion Models as Optimizers for Efficient Planning in Offline RLPoster1 citations
- Disentangled Generation and Aggregation for Robust Radiance FieldsPoster1 citations
- Disentangling Masked Autoencoders for Unsupervised Domain GeneralizationPoster1 citations
- Distribution-Aware Robust Learning from Long-Tailed Data with Noisy LabelsPoster1 citations
- Distributionally Robust Loss for Long-Tailed Multi-Label Image ClassificationPoster1 citations
- DoubleTake: Geometry Guided Depth EstimationPoster1 citations
- Dropout Mixture Low-Rank Adaptation for Visual Parameters-Efficient Fine-TuningPoster1 citations
- Dual-Path Adversarial Lifting for Domain Shift Correction in Online Test-time AdaptationPoster1 citations
- Dyn-Adapter: Towards Disentangled Representation for Efficient Visual RecognitionPoster1 citations
- Early Anticipation of Driving ManeuversPoster1 citations
- Easing 3D Pattern Reasoning with Side-view Features for Semantic Scene CompletionPoster1 citations
- EcoMatcher: Efficient Clustering Oriented Matcher for Detector-free Image MatchingPoster1 citations
- Edge-Guided Fusion and Motion Augmentation for Event-Image StereoPoster1 citations
- Efficient Cascaded Multiscale Adaptive Network for Image RestorationPoster1 citations
- Efficient Depth-Guided Urban View SynthesisPoster1 citations
- Efficient NeRF Optimization - Not All Samples Remain Equally HardPoster1 citations
- Enhancing Tracking Robustness with Auxiliary Adversarial Defense NetworksPoster1 citations
- Equivariant Spatio-Temporal Self-Supervision for LiDAR Object DetectionPoster1 citations
- Evaluating the Adversarial Robustness of Semantic Segmentation: Trying Harder Pays OffPoster1 citations
- Ex2Eg-MAE: A Framework for Adaptation of Exocentric Video Masked Autoencoders for Egocentric Social Role UnderstandingPoster1 citations
- Exploiting Dual-Correlation for Multi-frame Time-of-Flight DenoisingPoster1 citations
- Exploring Active Learning in Meta-Learning: Enhancing Context Set LabelingPoster1 citations
- FAFA: Frequency-Aware Flow-Aided Self-Supervision for Underwater Object Pose EstimationPoster1 citations
- Fast Encoding and Decoding for Implicit Video RepresentationPoster1 citations
- Fast Point Cloud Geometry Compression with Context-based Residual Coding and INR-based RefinementPoster1 citations
- Fast Registration of Photorealistic Avatars for VR Facial AnimationPoster1 citations
- Fast Sprite Decomposition from Animated GraphicsPoster1 citations
- Feature Diversification and Adaptation for Federated Domain GeneralizationPoster1 citations
- Federated Learning with Local Openset Noisy LabelsPoster1 citations
- Flexible Distribution Alignment: Towards Long-tailed Semi-supervised Learning with Proper CalibrationPoster1 citations
- Flow-Assisted Motion Learning Network for Weakly-Supervised Group Activity RecognitionPoster1 citations
- Forget More to Learn More: Domain-specific Feature Unlearning for Semi-supervised and Unsupervised Domain AdaptationPoster1 citations
- Formula-Supervised Visual-Geometric Pre-trainingPoster1 citations
- FreeCompose: Generic Zero-Shot Image Composition with Diffusion PriorPoster1 citations
- FreeMotion: MoCap-Free Human Motion Synthesis with Multimodal Large Language ModelsPoster1 citations
- From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global AggregationPoster1 citations
- Frontier-enhanced Topological Memory with Improved Exploration Awareness for Embodied Visual NavigationPoster1 citations
- Frugal 3D Point Cloud Model Training via Progressive Near Point Filtering and Fused AggregationPoster1 citations
- Functional Transform-Based Low-Rank Tensor Factorization for Multi-Dimensional Data RecoveryPoster1 citations
- GAReT: Cross-view Video Geolocalization with Adapters and Auto-Regressive TransformersPoster1 citations
- GMM-IKRS: Gaussian Mixture Models for Interpretable Keypoint Refinement and ScoringPoster1 citations
- GMT: Enhancing Generalizable Neural Rendering via Geometry-Driven Multi-Reference Texture TransferPoster1 citations
- General Geometry-aware Weakly Supervised 3D Object DetectionPoster1 citations
- Generating 3D House Wireframes with SemanticsPoster1 citations
- Gravity-aligned Rotation Averaging with Circular RegressionPoster1 citations
- Grid-Attention: Enhancing Computational Efficiency of Large Vision Models without Fine-TuningPoster1 citations
- GroundUp: Rapid Sketch-Based 3D City MassingPoster1 citations
- Handling The Non-Smooth Challenge in Tensor SVD: A Multi-Objective Tensor Recovery FrameworkPoster1 citations
- Head360: Learning a Parametric 3D Full-Head for Free-View Synthesis in 360°Poster1 citations
- Hetecooper: Feature Collaboration Graph for Heterogeneous Collaborative PerceptionPoster1 citations
- HiFi-Score: Fine-grained Image Description Evaluation with Hierarchical Parsing GraphsPoster1 citations
- Hierarchical Unsupervised Relation Distillation for Source Free Domain AdaptationPoster1 citations
- High-Precision Self-Supervised Monocular Depth Estimation with Rich-Resource PriorPoster1 citations
- HoloADMM: High-Quality Holographic Complex Field RecoveryPoster1 citations
- Holodepth: Programmable Depth-Varying Projection via Computer-Generated HolographyPoster1 citations
- Human Motion Forecasting in Dynamic Domain Shifts: A Homeostatic Continual Test-time Adaptation FrameworkPoster1 citations
- HyperSpaceX: Radial and Angular Exploration of HyperSpherical DimensionsPoster1 citations
- Hypernetworks for Generalizable BRDF RepresentationPoster1 citations
- IGNORE: Information Gap-based False Negative Loss Rejection for Single Positive Multi-Label LearningPoster1 citations
- Idempotent Unsupervised Representation Learning for Skeleton-Based Action RecognitionPoster1 citations
- Identity-Consistent Diffusion Network for Grading Knee Osteoarthritis Progression in Radiographic ImagingPoster1 citations
- Image-Feature Weak-to-Strong Consistency: An Enhanced Paradigm for Semi-Supervised LearningPoster1 citations
- Image-adaptive 3D Lookup Tables for Real-time Image Enhancement with Bilateral GridsPoster1 citations
- Image-to-Lidar Relational Distillation for Autonomous Driving DataPoster1 citations
- Imaging with Confidence: Uncertainty Quantification for High-dimensional Undersampled MR ImagesPoster1 citations
- Improving Domain Generalization in Self-Supervised Monocular Depth Estimation via Stabilized Adversarial TrainingPoster1 citations
- Improving Intervention Efficacy via Concept Realignment in Concept Bottleneck ModelsPoster1 citations
- Improving Unsupervised Domain Adaptation: A Pseudo-Candidate Set ApproachPoster1 citations
- Improving image synthesis with diffusion-negative samplingPoster1 citations
- Instant Uncertainty Calibration of NeRFs Using a Meta-CalibratorPoster1 citations
- Integrating Markov Blanket Discovery into Causal Representation Learning for Domain GeneralizationPoster1 citations
- Integration of Global and Local Representations for Fine-grained Cross-modal AlignmentPoster1 citations
- Is user feedback always informative? Retrieval Latent Defending for Semi-Supervised Domain Adaptation without Source DataPoster1 citations
- JDT3D: Addressing the Gaps in LiDAR-Based Tracking-by-AttentionPoster1 citations
- LLMCO4MR: LLMs-aided Neural Combinatorial Optimization for Ancient Manuscript Restoration from Fragments with Case Studies on DunhuangPoster1 citations
- Label-free Neural Semantic Image SynthesisPoster1 citations
- Lagrangian Hashing for Compressed Neural Field RepresentationsPoster1 citations
- Language-Assisted Skeleton Action Understanding for Skeleton-Based Temporal Action SegmentationPoster1 citations
- Layered Rendering Diffusion Model for Controllable Zero-Shot Image SynthesisPoster1 citations
- Learn to Memorize and to Forget: A Continual Learning Perspective of Dynamic SLAMPoster1 citations
- Learned HDR Image Compression for Perceptually Optimal Storage and DisplayPoster1 citations
- Learning 3D-aware GANs from Unposed Images with Template Feature FieldOral1 citations
- Learning Chain of Counterfactual Thought for Bias-Robust Vision-Language ReasoningPoster1 citations
- Learning High-resolution Vector Representation from Multi-Camera Images for 3D Object DetectionPoster1 citations
- Learning Where to Look: Self-supervised Viewpoint Selection for Active Localization using Geometrical InformationPoster1 citations
- Learning to Distinguish Samples for Generalized Category DiscoveryPoster1 citations
- Learning to Drive via Asymmetric Self-PlayPoster1 citations
- LetsMap: Unsupervised Representation Learning for Label-Efficient Semantic BEV MappingPoster1 citations
- Leveraging Imperfect Restoration for Data Availability AttackPoster1 citations
- Local Occupancy-Enhanced Object Grasping with Multiple Triplanar ProjectionPoster1 citations
- Local and Global Flatness for Federated Domain GeneralizationPoster1 citations
- Lost in Translation: Latent Concept Misalignment in Text-to-Image Diffusion ModelsPoster1 citations
- Lost in Translation: Modern Neural Networks Still Struggle With Small Realistic Image TransformationsPoster1 citations
- MAD-DR: Map Compression for Visual Localization with Matchness Aware Descriptor Dimension ReductionPoster1 citations
- MARs: Multi-view Attention Regularizations for Patch-based Feature Recognition of Space TerrainPoster1 citations
- MERLiN: Single-Shot Material Estimation and Relighting for Photometric StereoPoster1 citations
- MIGS: Multi-Identity Gaussian Splatting via Tensor DecompositionOral1 citations
- MLPHand: Real Time Multi-View 3D Hand Reconstruction via MLP ModelingPoster1 citations
- MONTAGE: Monitoring Training for Attribution of Generative Diffusion ModelsPoster1 citations
- MacDiff: Unified Skeleton Modeling with Masked Conditional DiffusionPoster1 citations
- Make a Strong Teacher with Label Assistance: A Novel Knowledge Distillation Approach for Semantic SegmentationPoster1 citations
- Masked Motion Prediction with Semantic Contrast for Point Cloud Sequence LearningPoster1 citations
- MaxMI: A Maximal Mutual Information Criterion for Manipulation Concept DiscoveryOral1 citations
- Modality Translation for Object Detection Adaptation without forgetting prior knowledgePoster1 citations
- Multi-Person Pose Forecasting with Individual Interaction Perceptron and Prior LearningPoster1 citations
- Multi-RoI Human Mesh Recovery with Camera Consistency and Contrastive LossesPoster1 citations
- Multi-Task Domain Adaptation for Language Grounding with 3D ObjectsPoster1 citations
- MutDet: Mutually Optimizing Pre-training for Remote Sensing Object DetectionPoster1 citations
- Mutual Learning for Acoustic Matching and Dereverberation via Visual Scene-driven DiffusionPoster1 citations
- NVS-Adapter: Plug-and-Play Novel View Synthesis from a Single ImagePoster1 citations
- Neural Surface Detection for Unsigned Distance FieldsPoster1 citations
- Non-Line-of-Sight Estimation of Fast Human Motion with Slow Scanning ImagersPoster1 citations
- Norma: A Noise Robust Memory-Augmented Framework for Whole Slide Image ClassificationPoster1 citations
- OAPT: Offset-Aware Partition Transformer for Double JPEG Artifacts RemovalPoster1 citations
- OAT: Object-Level Attention Transformer for Gaze Scanpath PredictionPoster1 citations
- Object-Oriented Anchoring and Modal Alignment in Multimodal LearningPoster1 citations
- Occlusion Handling in 3D Human Pose Estimation with Perturbed Positional EncodingPoster1 citations
- Online Video Quality Enhancement with Spatial-Temporal Look-up TablesPoster1 citations
- Optimizing Factorized Encoder Models: Time and Memory Reduction for Scalable and Efficient Action RecognitionPoster1 citations
- Out-of-Bounding-Box Triggers: A Stealthy Approach to Cheat Object DetectorsPoster1 citations
- OvSW: Overcoming Silent Weights for Accurate Binary Neural NetworksPoster1 citations
- PDT Uav Target Detection Dataset for Pests and Diseases TreePoster1 citations
- PDiscoFormer: Relaxing Part Discovery Constraints with Vision TransformersOral1 citations
- PFGS: High Fidelity Point Cloud Rendering via Feature SplattingPoster1 citations
- PFedEdit: Personalized Federated Learning via Automated Model EditingPoster1 citations
- POET: Prompt Offset Tuning for Continual Human Action AdaptationOral1 citations
- PairingNet: A Learning-based Pair-searching and -matching Network for Image FragmentsPoster1 citations
- Parameterization-driven Neural Surface Reconstruction for Object-oriented Editing in Neural RenderingPoster1 citations
- Part2Object: Hierarchical Unsupervised 3D Instance SegmentationPoster1 citations
- Pathformer3D: A 3D Scanpath Transformer for 360° ImagesPoster1 citations
- Perceptual Evaluation of Audio-Visual Synchrony Grounded in Viewers’ Opinion ScoresPoster1 citations
- Personalized Video Relighting With an At-Home Light StagePoster1 citations
- Physics-Based Interaction with 3D Objects via Video GenerationOral1 citations
- Physics-Free Spectrally Multiplexed Photometric Stereo under Unknown Spectral CompositionOral1 citations
- Physics-informed Knowledge Transfer for Underwater Monocular Depth EstimationPoster1 citations
- Plug-and-Play Learned Proximal Trajectory for 3D Sparse-View X-Ray Computed TomographyPoster1 citations
- Pose Guided Fine-Grained Sign Language Video GenerationPoster1 citations
- PoseAugment: Generative Human Pose Data Augmentation with Physical Plausibility for IMU-based Motion CapturePoster1 citations
- PoseCrafter: One-Shot Personalized Video Synthesis Following Flexible Pose ControlPoster1 citations
- Pro2SAM: Mask Prompt to SAM with Grid Points for Weakly Supervised Object LocalizationPoster1 citations
- ProDepth: Boosting Self-Supervised Multi-Frame Monocular Depth with Probabilistic FusionPoster1 citations
- ProSub: Probabilistic Open-Set Semi-Supervised Learning with Subspace-Based Out-of-Distribution DetectionPoster1 citations
- Probabilistic Weather Forecasting with Deterministic Guidance-based Diffusion ModelPoster1 citations
- Quanta Video RestorationPoster1 citations
- R3DS: Reality-linked 3D Scenes for Panoramic Scene UnderstandingPoster1 citations
- RAP: Retrieval-Augmented Planner for Adaptive Procedure Planning in Instructional VideosPoster1 citations
- REDIR: Refocus-free Event-based De-occlusion Image ReconstructionPoster1 citations
- RPBG: Towards Robust Neural Point-based Graphics in the WildOral1 citations
- RS-NeRF: Neural Radiance Fields from Rolling Shutter ImagesPoster1 citations
- RSL-BA: Rolling Shutter Line Bundle AdjustmentPoster1 citations
- RaFE: Generative Radiance Fields RestorationOral1 citations
- Random Walk on Pixel Manifolds for Anomaly Segmentation of Complex Driving ScenesPoster1 citations
- ReGround: Improving Textual and Spatial Grounding at No CostPoster1 citations
- Real-data-driven 2000 FPS Color Video from Mosaicked Chromatic SpikesPoster1 citations
- Rebalancing Using Estimated Class Distribution for Imbalanced Semi-Supervised Learning under Class Distribution MismatchPoster1 citations
- RecurrentBEV: A Long-term Temporal Fusion Framework for Multi-view 3D DetectionPoster1 citations
- Region-centric Image-Language Pretraining for Open-Vocabulary DetectionPoster1 citations
- Reinforcement Learning via Auxillary Task DistillationPoster1 citations
- Rejection Sampling IMLE: Designing Priors for Better Few-Shot Image SynthesisPoster1 citations
- Removing Distributional Discrepancies in Captions Improves Image-Text AlignmentPoster1 citations
- Reprojection Errors as Prompts for Efficient Scene Coordinate RegressionPoster1 citations
- Resilience of Entropy Model in Distributed Neural NetworksPoster1 citations
- Rethinking Unsupervised Outlier Detection via Multiple ThresholdingPoster1 citations
- Revisiting Calibration of Wide-Angle Radially Symmetric CamerasPoster1 citations
- Revisiting Domain-Adaptive Object Detection in Adverse Weather by the Generation and Composition of High-Quality Pseudo-LabelsPoster1 citations
- Risk-Aware Self-Consistent Imitation Learning for Trajectory Planning in Autonomous DrivingPoster1 citations
- RoDUS: Robust Decomposition of Static and Dynamic Elements in Urban ScenesPoster1 citations
- Robust Nearest Neighbors for Source-Free Domain Adaptation under Class Distribution ShiftPoster1 citations
- Robustness Tokens: Towards Adversarial Robustness of TransformersPoster1 citations
- RoofDiffusion: Constructing Roofs from Severely Corrupted Point Data via DiffusionPoster1 citations
- SEDiff: Structure Extraction for Domain Adaptive Depth Estimation via Denoising Diffusion ModelsPoster1 citations
- SOS: Segment Object System for Open-World Instance Segmentation With Object PriorsPoster1 citations
- SPAMming Labels: Efficient Annotations for the Trackers of TomorrowPoster1 citations
- SRPose: Two-view Relative Pose Estimation with Sparse KeypointsPoster1 citations
- Scalable Group Choreography via Variational Phase Manifold LearningPoster1 citations
- Scene-Conditional 3D Object Stylization and CompositionPoster1 citations
- Scene-aware Human Motion Forecasting via Mutual Distance PredictionPoster1 citations
- Self-Supervised Underwater Caustics Removal and Descattering via Deep Monocular SLAMPoster1 citations
- SemTrack: A Large-scale Dataset for Semantic Tracking in the WildPoster1 citations
- Semi-Supervised Video Desnowing Network via Temporal Decoupling Experts and Distribution-Driven Contrastive RegularizationPoster1 citations
- Sequential Representation Learning via Static-Dynamic Conditional DisentanglementPoster1 citations
- Shape from Heat ConductionOral1 citations
- Shedding More Light on Robust Classifiers under the lens of Energy-based ModelsPoster1 citations
- Shifted Autoencoders for Point Annotation Restoration in Object CountingPoster1 citations
- Simple Unsupervised Knowledge Distillation With Space SimilarityPoster1 citations
- Single-Mask Inpainting for Voxel-based Neural Radiance FieldsPoster1 citations
- Snuffy: Efficient Whole Slide Image ClassifierPoster1 citations
- SpaceJAM: a Lightweight and Regularization-free Method for Fast Joint Alignment of ImagesPoster1 citations
- SparseSSP: 3D Subcellular Structure Prediction from Sparse-View Transmitted Light ImagesOral1 citations
- SpecFormer: Guarding Vision Transformer Robustness via Maximum Singular Value PenalizationPoster1 citations
- Stable Video PortraitsPoster1 citations
- Stitched ViTs are Flexible Vision BackbonesPoster1 citations
- Straightforward Layer-wise Pruning for More Efficient Visual AdaptationPoster1 citations
- Surf-D: Generating High-Quality Surfaces of Arbitrary Topologies Using Diffusion ModelsPoster1 citations
ECCV accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.