ICCV 2023 Accepted Papers
The full list of 2,156 papers accepted at ICCV 2023 (IEEE/CVF International Conference on Computer Vision). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 2,005Oral: 145
- LiDAR-Camera Panoptic Segmentation via Geometry-Consistent and Semantic-Aware AlignmentPoster21 citations
- MRM: Masked Relation Modeling for Medical Image Pre-Training with GeneticsPoster21 citations
- PhaseMP: Robust 3D Pose Estimation via Phase-conditioned Human Motion PriorPoster21 citations
- Point-TTA: Test-Time Adaptation for Point Cloud Registration Using Multitask Meta-Auxiliary LearningPoster21 citations
- Privacy-Preserving Face Recognition Using Random Frequency ComponentsPoster21 citations
- R-Pred: Two-Stage Motion Prediction Via Tube-Query Attention-Based Trajectory RefinementPoster21 citations
- Re-ReND: Real-Time Rendering of NeRFs across DevicesPoster21 citations
- ReNeRF: Relightable Neural Radiance Fields with Nearfield LightingPoster21 citations
- SCANet: Scene Complexity Aware Network for Weakly-Supervised Video Moment RetrievalPoster21 citations
- ScatterNeRF: Seeing Through Fog with Physically-Based Inverse Neural RenderingPoster21 citations
- Scenimefy: Learning to Craft Anime Scene via Semi-Supervised Image-to-Image TranslationPoster21 citations
- Search for or Navigate to? Dual Adaptive Thinking for Object NavigationPoster21 citations
- SegPrompt: Boosting Open-World Segmentation via Category-Level Prompt LearningPoster21 citations
- Semi-supervised Semantics-guided Adversarial Training for Robust Trajectory PredictionPoster21 citations
- Skill Transformer: A Monolithic Policy for Mobile ManipulationPoster21 citations
- Time Does Tell: Self-Supervised Time-Tuning of Dense Image RepresentationsPoster21 citations
- Unified Data-Free Compression: Pruning and Quantization without Fine-TuningPoster21 citations
- Video Adverse-Weather-Component Suppression Network via Weather Messenger and Adversarial BackpropagationPoster21 citations
- Vision Relation Transformer for Unbiased Scene Graph GenerationPoster21 citations
- Audio-Enhanced Text-to-Video Retrieval using Text-Conditioned Feature AlignmentOral20 citations
- Beyond Skin Tone: A Multidimensional Measure of Apparent Skin ColorPoster20 citations
- End-to-end 3D Tracking with Decoupled QueriesPoster20 citations
- Enhancing Modality-Agnostic Representations via Meta-Learning for Brain Tumor SegmentationPoster20 citations
- Event-Guided Procedure Planning from Instructional Videos with Text SupervisionPoster20 citations
- Generalized Lightness Adaptation with Channel Selective NormalizationPoster20 citations
- How to Boost Face Recognition with StyleGAN?Poster20 citations
- Hybrid Spectral Denoising Transformer with Guided AttentionPoster20 citations
- LFS-GAN: Lifelong Few-Shot Image GenerationPoster20 citations
- Learning Depth Estimation for Transparent and Mirror SurfacesPoster20 citations
- Learning Symmetry-Aware Geometry Correspondences for 6D Object Pose EstimationPoster20 citations
- Learning Unified Decompositional and Compositional NeRF for Editable Novel View SynthesisPoster20 citations
- Learning to Ground Instructional Articles in Videos through NarrationsPoster20 citations
- LexLIP: Lexicon-Bottlenecked Language-Image Pre-Training for Large-Scale Image-Text Sparse RetrievalPoster20 citations
- MAS: Towards Resource-Efficient Federated Multiple-Task LearningPoster20 citations
- MATE: Masked Autoencoders are Online 3D Test-Time LearnersPoster20 citations
- Multi-Frequency Representation Enhancement with Privilege Information for Video Super-ResolutionPoster20 citations
- Multi-Modal Continual Test-Time Adaptation for 3D Semantic SegmentationPoster20 citations
- Novel Scenes & Classes: Towards Adaptive Open-set Object DetectionOral20 citations
- PolicyCleanse: Backdoor Detection and Mitigation for Competitive Reinforcement LearningPoster20 citations
- Representation Uncertainty in Self-Supervised Learning as Variational InferencePoster20 citations
- Self-Evolved Dynamic Expansion Model for Task-Free Continual LearningPoster20 citations
- Self-supervised Image Denoising with Downsampled Invariance Loss and Conditional Blind-Spot NetworkPoster20 citations
- SimFIR: A Simple Framework for Fisheye Image Rectification with Self-supervised Representation LearningPoster20 citations
- Social Diffusion: Long-term Multiple Human Motion AnticipationPoster20 citations
- Total-Recon: Deformable Scene Reconstruction for Embodied View SynthesisPoster20 citations
- Adaptive Template Transformer for Mitochondria Segmentation in Electron Microscopy ImagesPoster19 citations
- Adversarial Bayesian Augmentation for Single-Source Domain GeneralizationPoster19 citations
- Black-Box Unsupervised Domain Adaptation with Bi-Directional Atkinson-Shiffrin MemoryPoster19 citations
- Boosting Novel Category Discovery Over Domains with Soft Contrastive Learning and All in One ClassifierOral19 citations
- Bootstrap Motion Forecasting With Self-Consistent ConstraintsPoster19 citations
- Boundary-Aware Divide and Conquer: A Diffusion-Based Solution for Unsupervised Shadow RemovalPoster19 citations
- DETR Does Not Need Multi-Scale or Locality DesignPoster19 citations
- DiffV2S: Diffusion-Based Video-to-Speech Synthesis with Vision-Guided Speaker EmbeddingPoster19 citations
- Distilling Coarse-to-Fine Semantic Matching Knowledge for Weakly Supervised 3D Visual GroundingPoster19 citations
- Doppelgangers: Learning to Disambiguate Images of Similar StructuresOral19 citations
- Dual Learning with Dynamic Knowledge Distillation for Partially Relevant Video RetrievalPoster19 citations
- Estimator Meets Equilibrium Perspective: A Rectified Straight Through Estimator for Binary Neural Networks TrainingPoster19 citations
- Exploring the Benefits of Visual Prompting in Differential PrivacyPoster19 citations
- Few Shot Font Generation Via Transferring Similarity Guided Global Style and Quantization Local StylePoster19 citations
- Generating Dynamic Kernels via Transformers for Lane DetectionPoster19 citations
- Hierarchical Point-based Active Learning for Semi-supervised Point Cloud Semantic SegmentationPoster19 citations
- HopFIR: Hop-wise GraphFormer with Intragroup Joint Refinement for 3D Human Pose EstimationPoster19 citations
- Improving CLIP Fine-tuning PerformancePoster19 citations
- JOTR: 3D Joint Contrastive Learning with Transformers for Occluded Human Mesh RecoveryPoster19 citations
- KECOR: Kernel Coding Rate Maximization for Active 3D Object DetectionPoster19 citations
- Learning Optical Flow from Event Camera with Rendered DatasetPoster19 citations
- LiveHand: Real-time and Photorealistic Neural Hand RenderingPoster19 citations
- MEFLUT: Unsupervised 1D Lookup Tables for Multi-exposure Image FusionPoster19 citations
- MixReorg: Cross-Modal Mixed Patch Reorganization is a Good Mask Learner for Open-World Semantic SegmentationPoster19 citations
- Multi-Label Self-Supervised Learning with Scene ImagesPoster19 citations
- Multi-Object Navigation with Dynamically Learned Neural Implicit RepresentationsPoster19 citations
- Neural Interactive Keypoint DetectionPoster19 citations
- Non-Coaxial Event-Guided Motion Deblurring with Spatial AlignmentPoster19 citations
- One-bit Flip is All You Need: When Bit-flip Attack Meets Model TrainingPoster19 citations
- PIDRo: Parallel Isomeric Attention with Dynamic Routing for Text-Video RetrievalPoster19 citations
- Pluralistic Aging Diffusion AutoencoderPoster19 citations
- RenderIH: A Large-Scale Synthetic Dataset for 3D Interacting Hand Pose EstimationPoster19 citations
- Rethinking the Role of Pre-Trained Networks in Source-Free Domain AdaptationPoster19 citations
- Revisiting Foreground and Background Separation in Weakly-supervised Temporal Action Localization: A Clustering-based ApproachPoster19 citations
- SILT: Shadow-Aware Iterative Label Tuning for Learning to Detect Shadows from Noisy LabelsPoster19 citations
- Scratch Each Other's Back: Incomplete Multi-Modal Brain Tumor Segmentation via Category Aware Group Self-Support LearningPoster19 citations
- Semantics Meets Temporal Correspondence: Self-supervised Object-centric Learning in VideosPoster19 citations
- Sparse Instance Conditioned Multimodal Trajectory PredictionPoster19 citations
- StyleInV: A Temporal Style Modulated Inversion Network for Unconditional Video GenerationPoster19 citations
- SupFusion: Supervised LiDAR-Camera Fusion for 3D Object DetectionPoster19 citations
- TCOVIS: Temporally Consistent Online Video Instance SegmentationPoster19 citations
- The Devil is in the Upsampling: Architectural Decisions Made Simpler for Denoising with Deep Image PriorPoster19 citations
- The Euclidean Space is Evil: Hyperbolic Attribute Editing for Few-shot Image GenerationPoster19 citations
- Uncertainty-aware State Space Transformer for Egocentric 3D Hand Trajectory ForecastingPoster19 citations
- VL-PET: Vision-and-Language Parameter-Efficient Tuning via Granularity ControlPoster19 citations
- VLN-PETL: Parameter-Efficient Transfer Learning for Vision-and-Language NavigationPoster19 citations
- Weakly-Supervised Action Segmentation and Unseen Error Detection in Anomalous Instructional VideosPoster19 citations
- Why Is Prompt Tuning for Vision-Language Models Robust to Noisy Labels?Poster19 citations
- zPROBE: Zero Peek Robustness Checks for Federated LearningPoster19 citations
- 2D3D-MATR: 2D-3D Matching Transformer for Detection-Free Registration Between Images and Point CloudsPoster18 citations
- 4D Panoptic Segmentation as Invariant and Equivariant Field PredictionPoster18 citations
- Active Self-Supervised Learning: A Few Low-Cost Relationships Are All You NeedPoster18 citations
- Agglomerative Transformer for Human-Object Interaction DetectionPoster18 citations
- CHAMPAGNE: Learning Real-world Conversation from Large-Scale Web VideosPoster18 citations
- Chop & Learn: Recognizing and Generating Object-State CompositionsPoster18 citations
- Communication-Efficient Vertical Federated Learning with Limited Overlapping SamplesPoster18 citations
- DDG-Net: Discriminability-Driven Graph Network for Weakly-supervised Temporal Action LocalizationPoster18 citations
- DQS3D: Densely-matched Quantization-aware Semi-supervised 3D DetectionPoster18 citations
- Domain Generalization via Balancing Training Difficulty and Model CapabilityPoster18 citations
- Explicit Motion Disentangling for Efficient Optical Flow EstimationPoster18 citations
- FDViT: Improve the Hierarchical Architecture of Vision TransformerPoster18 citations
- Human Part-wise 3D Motion Context Learning for Sign Language RecognitionPoster18 citations
- ICE-NeRF: Interactive Color Editing of NeRFs via Decomposition-Aware Weight OptimizationPoster18 citations
- Knowledge Restore and Transfer for Multi-Label Class-Incremental LearningPoster18 citations
- LIMITR: Leveraging Local Information for Medical Image-Text RepresentationPoster18 citations
- Label-Efficient Online Continual Object Detection in Streaming VideoPoster18 citations
- Learning Rain Location Prior for Nighttime DerainingPoster18 citations
- Lip Reading for Low-resource Languages by Learning and Combining General Speech Knowledge and Language-specific KnowledgePoster18 citations
- LoTE-Animal: A Long Time-span Dataset for Endangered Animal Behavior UnderstandingPoster18 citations
- Locally Stylized Neural Radiance FieldsPoster18 citations
- Manipulate by Seeing: Creating Manipulation Controllers from Pre-Trained RepresentationsOral18 citations
- Masked Spatio-Temporal Structure Prediction for Self-supervised Learning on Point Cloud VideosPoster18 citations
- Minimum Latency Deep Online Video StabilizationPoster18 citations
- Mitigating and Evaluating Static Bias of Action Representations in the Background and the ForegroundOral18 citations
- Rendering Humans from Object-Occluded Monocular VideosPoster18 citations
- S-VolSDF: Sparse Multi-View Stereo Regularization of Neural Implicit SurfacesPoster18 citations
- SOAR: Scene-debiasing Open-set Action RecognitionPoster18 citations
- Scanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long VideosPoster18 citations
- Seal-3D: Interactive Pixel-Level Editing for Neural Radiance FieldsPoster18 citations
- Sound Source Localization is All about Cross-Modal AlignmentPoster18 citations
- Space Engage: Collaborative Space Supervision for Contrastive-Based Semi-Supervised Semantic SegmentationPoster18 citations
- Spatial Self-Distillation for Object Detection with Inaccurate Bounding BoxesPoster18 citations
- Structural Alignment for Network Pruning through Partial RegularizationPoster18 citations
- Synchronize Feature Extracting and Matching: A Single Branch Framework for 3D Object TrackingPoster18 citations
- Towards High-Fidelity Text-Guided 3D Face Generation and Manipulation Using only ImagesPoster18 citations
- Towards Robust and Smooth 3D Multi-Person Pose Estimation from Monocular Videos in the WildPoster18 citations
- Towards Semi-supervised Learning with Non-random Missing LabelsPoster18 citations
- Towards Zero Domain Gap: A Comprehensive Study of Realistic LiDAR Simulation for Autonomy TestingPoster18 citations
- Uncertainty-guided Learning for Improving Image Manipulation DetectionPoster18 citations
- Unified Visual Relationship Detection with Vision and Language ModelsPoster18 citations
- When to Learn What: Model-Adaptive Data Augmentation CurriculumPoster18 citations
- Ada3D : Exploiting the Spatial Redundancy with Adaptive Inference for Efficient 3D Object DetectionPoster17 citations
- Automatic Network Pruning via Hilbert-Schmidt Independence Criterion Lasso under Information Bottleneck PrinciplePoster17 citations
- BEV-DG: Cross-Modal Learning under Bird's-Eye View for Domain Generalization of 3D Semantic SegmentationPoster17 citations
- Bidirectional Alignment for Domain Adaptive Detection with TransformersPoster17 citations
- C2ST: Cross-Modal Contextualized Sequence Transduction for Continuous Sign Language RecognitionPoster17 citations
- CLNeRF: Continual Learning Meets NeRFPoster17 citations
- ConSlide: Asynchronous Hierarchical Interaction Transformer with Breakup-Reorganize Rehearsal for Continual Whole Slide Image AnalysisPoster17 citations
- Constraining Depth Map Geometry for Multi-View Stereo: A Dual-Depth Approach with Saddle-shaped Depth CellsPoster17 citations
- Cumulative Spatial Knowledge Distillation for Vision TransformersPoster17 citations
- DARTH: Holistic Test-time Adaptation for Multiple Object TrackingPoster17 citations
- Deep Geometrized Cartoon Line InbetweeningPoster17 citations
- DiffCloth: Diffusion Based Garment Synthesis and Manipulation via Structural Cross-modal Semantic AlignmentPoster17 citations
- Distilled Reverse Attention Network for Open-world Compositional Zero-Shot LearningPoster17 citations
- Distilling DETR with Visual-Linguistic Knowledge for Open-Vocabulary Object DetectionPoster17 citations
- Distribution Shift Matters for Knowledge Distillation with Webly Collected ImagesPoster17 citations
- ETran: Energy-Based Transferability EstimationPoster17 citations
- Event-based Temporally Dense Optical Flow Estimation with Sequential LearningPoster17 citations
- FrozenRecon: Pose-free 3D Scene Reconstruction with Frozen Depth ModelsPoster17 citations
- GlobalMapper: Arbitrary-Shaped Urban Layout GenerationPoster17 citations
- GraphEcho: Graph-Driven Unsupervised Domain Adaptation for Echocardiogram Video SegmentationOral17 citations
- Hard No-Box Adversarial Attack on Skeleton-Based Human Action Recognition with Skeleton-Motion-Informed GradientPoster17 citations
- ImbSAM: A Closer Look at Sharpness-Aware Minimization in Class-Imbalanced RecognitionPoster17 citations
- Integrating Boxes and Masks: A Multi-Object Framework for Unified Visual Tracking and SegmentationPoster17 citations
- Is Imitation All You Need? Generalized Decision-Making with Dual-Phase TrainingPoster17 citations
- Label-Guided Knowledge Distillation for Continual Semantic Segmentation on 2D Images and 3D Point CloudsPoster17 citations
- Learning in Imperfect Environment: Multi-Label Classification with Long-Tailed Distribution and Partial LabelsPoster17 citations
- Long-Range Grouping Transformer for Multi-View 3D ReconstructionPoster17 citations
- M2T: Masking Transformers Twice for Faster DecodingPoster17 citations
- MAMo: Leveraging Memory and Attention for Monocular Video Depth EstimationPoster17 citations
- MRN: Multiplexed Routing Network for Incremental Multilingual Text RecognitionPoster17 citations
- MVPSNet: Fast Generalizable Multi-view Photometric StereoPoster17 citations
- Masked Autoencoders are Efficient Class Incremental LearnersPoster17 citations
- MemorySeg: Online LiDAR Semantic Segmentation with a Latent MemoryPoster17 citations
- MoTIF: Learning Motion Trajectories with Local Implicit Neural Functions for Continuous Space-Time Video Super-ResolutionPoster17 citations
- Multi-Scale Bidirectional Recurrent Network with Hybrid Correlation for Point Cloud Based Scene Flow EstimationPoster17 citations
- Multi-label Affordance Mapping from Egocentric VisionPoster17 citations
- Probabilistic Modeling of Inter- and Intra-observer Variability in Medical Image SegmentationPoster17 citations
- Proxy Anchor-based Unsupervised Learning for Continuous Generalized Category DiscoveryPoster17 citations
- Query6DoF: Learning Sparse Queries as Implicit Shape Prior for Category-Level 6DoF Pose EstimationPoster17 citations
- RefEgo: Referring Expression Comprehension Dataset from First-Person Perception of Ego4DPoster17 citations
- Sat2Density: Faithful Density Learning from Satellite-Ground Image PairsPoster17 citations
- Similarity Min-Max: Zero-Shot Day-Night Domain AdaptationOral17 citations
- Single Image Defocus Deblurring via Implicit Neural Inverse KernelsPoster17 citations
- Speech2Lip: High-fidelity Speech to Lip Generation by Learning from a Short VideoPoster17 citations
- Tangent Model Composition for Ensembling and Continual Fine-tuningPoster17 citations
- Tem-Adapter: Adapting Image-Text Pretraining for Video Question AnswerPoster17 citations
- The Making and Breaking of CamouflagePoster17 citations
- TiDAL: Learning Training Dynamics for Active LearningPoster17 citations
- Towards Authentic Face Restoration with Iterative Diffusion Models and BeyondPoster17 citations
- Towards Understanding the Generalization of Deepfake Detectors from a Game-Theoretical ViewPoster17 citations
- Towards Universal Image Embeddings: A Large-Scale Dataset and Challenge for Generic Image RepresentationsPoster17 citations
- Unsupervised Domain Adaptation for Training Event-Based Networks Using Contrastive Learning and Uncorrelated ConditioningPoster17 citations
- UrbanGIRAFFE: Representing Urban Scenes as Compositional Generative Neural Feature FieldsPoster17 citations
- Video OWL-ViT: Temporally-consistent Open-world Localization in VideoPoster17 citations
- Weakly Supervised Referring Image Segmentation with Intra-Chunk and Inter-Chunk ConsistencyPoster17 citations
- XiNet: Efficient Neural Networks for tinyMLPoster17 citations
- 2D-3D Interlaced Transformer for Point Cloud Segmentation with Scene-Level SupervisionPoster16 citations
- 3D Implicit Transporter for Temporally Consistent Keypoint DiscoveryOral16 citations
- Beating Backdoor Attack at Its Own GamePoster16 citations
- Breaking The Limits of Text-conditioned 3D Motion Synthesis with Elaborative DescriptionsPoster16 citations
- CFCG: Semi-Supervised Semantic Segmentation via Cross-Fusion and Contour Guidance SupervisionPoster16 citations
- CL-MVSNet: Unsupervised Multi-View Stereo with Dual-Level Contrastive LearningPoster16 citations
- ClothesNet: An Information-Rich 3D Garment Model Repository with Simulated Clothes EnvironmentPoster16 citations
- ClusT3: Information Invariant Test-Time TrainingPoster16 citations
- Contrastive Model Adaptation for Cross-Condition Robustness in Semantic SegmentationPoster16 citations
- DIFFGUARD: Semantic Mismatch-Guided Out-of-Distribution Detection Using Pre-Trained Diffusion ModelsPoster16 citations
- Deep Feature Deblurring Diffusion for Detecting Out-of-Distribution ObjectsPoster16 citations
- Differentiable Transportation PruningPoster16 citations
- Efficient Converted Spiking Neural Network for 3D and 2D ClassificationPoster16 citations
- FaceCLIPNeRF: Text-driven 3D Face Manipulation using Deformable Neural Radiance FieldsPoster16 citations
- GeoMIM: Towards Better 3D Knowledge Transfer via Masked Image Modeling for Multi-view 3D UnderstandingPoster16 citations
- Guiding Image Captioning Models Toward More Specific CaptionsPoster16 citations
- HaMuCo: Hand Pose Estimation via Multiview Collaborative Self-Supervised LearningPoster16 citations
- Hierarchical Prior Mining for Non-local Multi-View StereoPoster16 citations
- Image-Free Classifier Injection for Zero-Shot ClassificationPoster16 citations
- Iterative Denoiser and Noise Estimator for Self-Supervised Image DenoisingPoster16 citations
- Learn TAROT with MENTOR: A Meta-Learned Self-Supervised Approach for Trajectory PredictionPoster16 citations
- MDCS: More Diverse Experts with Consistency Self-distillation for Long-tailed RecognitionPoster16 citations
- MagicFusion: Boosting Text-to-Image Generation Performance by Fusing Diffusion ModelsPoster16 citations
- Mimic3D: Thriving 3D-Aware GANs via 3D-to-2D ImitationPoster16 citations
- Motion-Guided Masking for Spatiotemporal Representation LearningPoster16 citations
- Novel-View Synthesis and Pose Estimation for Hand-Object Interaction from Sparse ViewsPoster16 citations
- Object-Centric Multiple Object TrackingPoster16 citations
- Optimizing the Placement of Roadside LiDARs for Autonomous DrivingPoster16 citations
- Order-preserving Consistency Regularization for Domain Adaptation and GeneralizationPoster16 citations
- PDiscoNet: Semantically consistent part discovery for fine-grained recognitionPoster16 citations
- Physics-Augmented Autoencoder for 3D Skeleton-Based Gait RecognitionPoster16 citations
- RecRecNet: Rectangling Rectified Wide-Angle Images by Thin-Plate Spline Model and DoF-based Curriculum LearningPoster16 citations
- Reconstructing Groups of People with Hypergraph Relational ReasoningPoster16 citations
- Rethinking Data Distillation: Do Not Overlook CalibrationPoster16 citations
- SMAUG: Sparse Masked Autoencoder for Efficient Video-Language Pre-TrainingPoster16 citations
- Seeing Beyond the Patch: Scale-Adaptive Semantic Segmentation of High-resolution Remote Sensing Imagery based on Reinforcement LearningPoster16 citations
- Towards Attack-tolerant Federated Learning via Critical Parameter AnalysisPoster16 citations
- Towards Effective Instance Discrimination Contrastive Loss for Unsupervised Domain AdaptationPoster16 citations
- Towards General Low-Light Raw Noise Synthesis and ModelingPoster16 citations
- Towards Real-World Burst Image Super-Resolution: Benchmark and MethodPoster16 citations
- TrackFlow: Multi-Object tracking with Normalizing FlowsPoster16 citations
- Uncertainty-aware Unsupervised Multi-Object TrackingPoster16 citations
- Understanding the Feature Norm for Out-of-Distribution DetectionPoster16 citations
- Unified Out-Of-Distribution Detection: A Model-Specific PerspectivePoster16 citations
- Variational Causal Inference Network for Explanatory Visual Question AnsweringPoster16 citations
- WaveNeRF: Wavelet-based Generalizable Neural Radiance FieldsPoster16 citations
- A Skeletonization Algorithm for Gradient-Based OptimizationPoster15 citations
- A step towards understanding why classification helps regression15 citations
- Adaptive Illumination Mapping for Shadow Detection in Raw ImagesPoster15 citations
- Affine-Consistent Transformer for Multi-Class Cell Nuclei DetectionPoster15 citations
- Alignment Before Aggregation: Trajectory Memory Retrieval Network for Video Object SegmentationPoster15 citations
- Alleviating Catastrophic Forgetting of Incremental Object Detection via Within-Class and Between-Class Knowledge DistillationPoster15 citations
- Attention Discriminant Sampling for Point CloudsPoster15 citations
- Attention Where It Matters: Rethinking Visual Document Understanding with Selective Region ConcentrationPoster15 citations
- Benchmarking Algorithmic Bias in Face Recognition: An Experimental Approach Using Synthetic Faces and Human EvaluationPoster15 citations
- CHORD: Category-level Hand-held Object Reconstruction via Shape DeformationPoster15 citations
- CHORUS : Learning Canonicalized 3D Human-Object Spatial Relations from Unbounded Synthesized ImagesOral15 citations
- CLR: Channel-wise Lightweight Reprogramming for Continual LearningPoster15 citations
- CaPhy: Capturing Physical Properties for Animatable Human AvatarsPoster15 citations
- Category-aware Allocation Transformer for Weakly Supervised Object LocalizationPoster15 citations
- Class Prior-Free Positive-Unlabeled Learning with Taylor Variational Loss for Hyperspectral Remote Sensing ImageryPoster15 citations
- Clusterformer: Cluster-based Transformer for 3D Object Detection in Point CloudsPoster15 citations
- Confidence-based Visual Dispersal for Few-shot Unsupervised Domain AdaptationPoster15 citations
- CrossMatch: Source-Free Domain Adaptive Semantic Segmentation via Cross-Modal Consistency TrainingPoster15 citations
- D3G: Exploring Gaussian Prior for Temporal Sentence Grounding with Glance AnnotationPoster15 citations
- DG-Recon: Depth-Guided Neural 3D Scene ReconstructionPoster15 citations
- DPS-Net: Deep Polarimetric Stereo Depth EstimationPoster15 citations
- Deep Active Contours for Real-time 6-DoF Object TrackingPoster15 citations
- Delving into Motion-Aware Matching for Monocular 3D Object TrackingPoster15 citations
- Domain-Specificity Inducing Transformers for Source-Free Domain AdaptationPoster15 citations
- Exploiting Proximity-Aware Tasks for Embodied Social NavigationPoster15 citations
- Exploring Group Video Captioning with Efficient Relational ApproximationPoster15 citations
- Few-shot Continual Infomax LearningPoster15 citations
- GPA-3D: Geometry-aware Prototype Alignment for Unsupervised Domain Adaptive 3D Object Detection from Point CloudsPoster15 citations
- Harvard Glaucoma Detection and Progression: A Multimodal Multitask Dataset and Generalization-Reinforced Semi-Supervised LearningPoster15 citations
- Isomer: Isomerous Transformer for Zero-shot Video Object SegmentationPoster15 citations
- Joint Demosaicing and Deghosting of Time-Varying Exposures for Single-Shot HDR ImagingPoster15 citations
- Late Stopping: Avoiding Confidently Learning from Mislabeled ExamplesPoster15 citations
- Learning Image-Adaptive Codebooks for Class-Agnostic Image RestorationPoster15 citations
- Learning from Semantic Alignment between Unpaired Multiviews for Egocentric Video RecognitionPoster15 citations
- MV-DeepSDF: Implicit Modeling with Multi-Sweep Point Clouds for 3D Vehicle Reconstruction in Autonomous DrivingPoster15 citations
- Measuring Asymmetric Gradient Discrepancy in Parallel Continual LearningPoster15 citations
- Muscles in ActionPoster15 citations
- NSF: Neural Surface Fields for Human Modeling from Monocular DepthPoster15 citations
- Noise2Info: Noisy Image to Information of Noise for Self-Supervised Image Denoising15 citations
- PanFlowNet: A Flow-Based Deep Network for Pan-SharpeningPoster15 citations
- Probabilistic Triangulation for Uncalibrated Multi-View 3D Human Pose EstimationPoster15 citations
- REAP: A Large-Scale Realistic Adversarial Patch BenchmarkPoster15 citations
- Retro-FPN: Retrospective Feature Pyramid Network for Point Cloud Semantic SegmentationPoster15 citations
- SMMix: Self-Motivated Image Mixing for Vision TransformersPoster15 citations
- SSB: Simple but Strong Baseline for Boosting Performance of Open-Set Semi-Supervised LearningPoster15 citations
- Score Priors Guided Deep Variational Inference for Unsupervised Real-World Single Image DenoisingPoster15 citations
- Semantic Attention Flow Fields for Monocular Dynamic Scene DecompositionPoster15 citations
- Sequential Texts Driven Cohesive Motions Synthesis with Natural TransitionsPoster15 citations
- Task-aware Adaptive Learning for Cross-domain Few-shot LearningPoster15 citations
- Taxonomy Adaptive Cross-Domain Adaptation in Medical Imaging via Optimization Trajectory DistillationPoster15 citations
- Towards Models that Can See and ReadPoster15 citations
- Towards Viewpoint Robustness in Bird's Eye View SegmentationPoster15 citations
- TrajectoryFormer: 3D Object Tracking Transformer with Predictive Trajectory HypothesesPoster15 citations
- Two-in-One Depth: Bridging the Gap Between Monocular and Binocular Self-Supervised Depth EstimationPoster15 citations
- Under-Display Camera Image Restoration with Scattering EffectPoster15 citations
- UnitedHuman: Harnessing Multi-Source Data for High-Resolution Human GenerationPoster15 citations
- Visual Traffic Knowledge Graph Generation from Scene ImagesPoster15 citations
- VoroMesh: Learning Watertight Surface Meshes with Voronoi DiagramsPoster15 citations
- Walking Your LiDOG: A Journey Through Multiple Domains for LiDAR Semantic SegmentationPoster15 citations
- What can Discriminator do? Towards Box-free Ownership Verification of Generative Adversarial NetworksPoster15 citations
- Window-Based Early-Exit Cascades for Uncertainty Estimation: When Deep Ensembles are More Efficient than Single ModelsPoster15 citations
- A Large-scale Study of Spatiotemporal Representation Learning with a New Benchmark on Action RecognitionPoster14 citations
- Achievement-Based Training Progress Balancing for Multi-Task LearningPoster14 citations
- Affective Image Filter: Reflecting Emotions from Text to ImagesPoster14 citations
- Agile Modeling: From Concept to Classifier in MinutesPoster14 citations
- Anomaly Detection using Score-based Perturbation ResiliencePoster14 citations
- Boosting Whole Slide Image Classification from the Perspectives of Distribution, Correlation and MagnificationPoster14 citations
- CDFSL-V: Cross-Domain Few-Shot Learning for VideosPoster14 citations
- CSDA: Learning Category-Scale Joint Feature for Domain Adaptive Object DetectionPoster14 citations
- CheckerPose: Progressive Dense Keypoint Localization for Object Pose Estimation with Graph Neural NetworkPoster14 citations
- Computation and Data Efficient Backdoor AttacksPoster14 citations
- Contactless Pulse Estimation Leveraging Pseudo Labels and Self-SupervisionPoster14 citations
- DReg-NeRF: Deep Registration for Neural Radiance FieldsPoster14 citations
- Dec-Adapter: Exploring Efficient Decoder-Side Adapter for Bridging Screen Content and Natural Image CompressionPoster14 citations
- DeformToon3D: Deformable Neural Radiance Fields for 3D ToonificationPoster14 citations
- Divide&Classify: Fine-Grained Classification for City-Wide Visual Geo-LocalizationPoster14 citations
- Dynamic Hyperbolic Attention Network for Fine Hand-object ReconstructionPoster14 citations
- EDAPS: Enhanced Domain-Adaptive Panoptic SegmentationPoster14 citations
- Factorized Inverse Path Tracing for Efficient and Accurate Material-Lighting EstimationOral14 citations
- FemtoDet: An Object Detection Baseline for Energy Versus Performance TradeoffsPoster14 citations
- Generalizing Neural Human Fitting to Unseen Poses With Articulated SE(3) EquivarianceOral14 citations
- Geometrized Transformer for Self-Supervised Homography EstimationPoster14 citations
- Global Balanced Experts for Federated Long-Tailed LearningPoster14 citations
- HMD-NeMo: Online 3D Avatar Motion Generation From Sparse ObservationsPoster14 citations
- Holistic Label Correction for Noisy Multi-Label ClassificationPoster14 citations
- Homeomorphism Alignment for Unsupervised Domain AdaptationPoster14 citations
- Inducing Neural Collapse to a Fixed Hierarchy-Aware Frame for Reducing Mistake SeverityPoster14 citations
- LAC - Latent Action Composition for Skeleton-based Action SegmentationPoster14 citations
- LAW-Diffusion: Complex Scene Generation by Diffusion with LayoutsPoster14 citations
- MapPrior: Bird's-Eye View Map Layout Estimation with Generative ModelsPoster14 citations
- Monocular 3D Object Detection with Bounding Box Denoising in 3D by PerceiverPoster14 citations
- MosaiQ: Quantum Generative Adversarial Networks for Image Generation on NISQ ComputersPoster14 citations
- Multi-Event Video-Text RetrievalPoster14 citations
- NAPA-VQ: Neighborhood-Aware Prototype Augmentation with Vector Quantization for Continual LearningPoster14 citations
- On the Effectiveness of Spectral Discriminators for Perceptual Quality ImprovementPoster14 citations
- Open-Vocabulary Object Detection With an Open CorpusPoster14 citations
- PADDLES: Phase-Amplitude Spectrum Disentangled Early Stopping for Learning with Noisy LabelsPoster14 citations
- PODIA-3D: Domain Adaptation of 3D Generative Model Across Large Domain Gap Using Pose-Preserved Text-to-Image DiffusionPoster14 citations
- Phasic Content Fusing Diffusion Model with Directional Distribution Consistency for Few-Shot Model AdaptionPoster14 citations
- RSFNet: A White-Box Image Retouching Approach using Region-Specific Color FiltersPoster14 citations
- RankMatch: Fostering Confidence and Consistency in Learning with Noisy LabelsPoster14 citations
- RankMixup: Ranking-Based Mixup Training for Network CalibrationPoster14 citations
- Reinforced Disentanglement for Face Swapping without Skip ConnectionPoster14 citations
- SGAligner: 3D Scene Alignment with Scene GraphsPoster14 citations
- SPANet: Frequency-balancing Token Mixer using Spectral Pooling Aggregation ModulationPoster14 citations
- Scene Graph Contrastive Learning for Embodied NavigationPoster14 citations
- Self-similarity Driven Scale-invariant Learning for Weakly Supervised Person SearchPoster14 citations
- Semi-Supervised Semantic Segmentation under Label Noise via Diverse Learning GroupsPoster14 citations
- Studying How to Efficiently and Effectively Guide Models with ExplanationsPoster14 citations
- StylerDALLE: Language-Guided Style Transfer Using a Vector-Quantized Tokenizer of a Large-Scale Generative ModelPoster14 citations
- The Perils of Learning From Unlabeled Data: Backdoor Attacks on Semi-supervised LearningPoster14 citations
- Towards High-Quality Specular Highlight Removal by Leveraging Large-Scale Synthetic DataPoster14 citations
- Tracking by Natural Language Specification with Long Short-term Context DecouplingPoster14 citations
- UMIFormer: Mining the Correlations between Similar Tokens for Multi-View 3D ReconstructionPoster14 citations
- Understanding 3D Object Interaction from a Single ImagePoster14 citations
- Uni-3D: A Universal Model for Panoptic 3D Scene ReconstructionPoster14 citations
- Unsupervised Compositional Concepts Discovery with Text-to-Image Generative ModelsPoster14 citations
- Unsupervised Manifold Linearizing and ClusteringPoster14 citations
- Video State-Changing Object SegmentationPoster14 citations
- What Can Simple Arithmetic Operations Do for Temporal Modeling?Poster14 citations
- 3D VR Sketch Guided 3D Shape Prototyping and ExplorationPoster13 citations
- 3DHumanGAN: 3D-Aware Human Image Generation with 3D Pose MappingPoster13 citations
- Beyond the Pixel: a Photometrically Calibrated HDR Dataset for Luminance and Color PredictionOral13 citations
- Coarse-to-Fine: Learning Compact Discriminative Representation for Single-Stage Image RetrievalPoster13 citations
- DPM-OT: A New Diffusion Probabilistic Model Based on Optimal TransportPoster13 citations
- Deep Optics for Video Snapshot Compressive ImagingPoster13 citations
- Do DALL-E and Flamingo Understand Each Other?Poster13 citations
- Downscaled Representation Matters: Improving Image Rescaling with Collaborative Downscaled ImagesPoster13 citations
- Dynamic PlenOctree for Adaptive Sampling Refinement in Explicit NeRFPoster13 citations
- EPiC: Ensemble of Partial Point Clouds for Robust ClassificationPoster13 citations
- EQ-Net: Elastic Quantization Neural NetworksPoster13 citations
- EgoPCA: A New Framework for Egocentric Hand-Object Interaction UnderstandingPoster13 citations
- Environment-Invariant Curriculum Relation Learning for Fine-Grained Scene Graph GenerationPoster13 citations
- Eventful Transformers: Leveraging Temporal Redundancy in Vision TransformersPoster13 citations
- Fast Adversarial Training with Smooth ConvergencePoster13 citations
- Few-Shot Video Classification via Representation Fusion and Promotion LearningPoster13 citations
- Generative Gradient Inversion via Over-Parameterized Networks in Federated LearningPoster13 citations
- GlowGAN: Unsupervised Learning of HDR Images from LDR Images in the WildPoster13 citations
- Gradient-based Sampling for Class Imbalanced Semi-supervised Object DetectionPoster13 citations
- HollowNeRF: Pruning Hashgrid-Based NeRFs with Trainable Collision MitigationPoster13 citations
- HybridAugment++: Unified Frequency Spectra Perturbations for Model RobustnessPoster13 citations
- INSTA-BNN: Binary Neural Network with INSTAnce-aware ThresholdPoster13 citations
- Improving Adversarial Robustness of Masked Autoencoders via Test-time Frequency-domain PromptingPoster13 citations
- Improving Unsupervised Visual Program Inference with Code Rewriting FamiliesOral13 citations
- Invariant Training 2D-3D Joint Hard Samples for Few-Shot Point Cloud RecognitionPoster13 citations
- Joint Metrics Matter: A Better Standard for Trajectory ForecastingPoster13 citations
- Joint-Relation Transformer for Multi-Person Motion PredictionPoster13 citations
- LPFF: A Portrait Dataset for Face Generators Across Large PosesPoster13 citations
- Learning a Room with the Occ-SDF Hybrid: Signed Distance Function Mingled with Occupancy Aids Scene RepresentationPoster13 citations
- Locating Noise is Halfway Denoising for Semi-Supervised SegmentationPoster13 citations
- NLOS-NeuS: Non-line-of-sight Neural Implicit SurfacePoster13 citations
- PGFed: Personalize Each Client's Global Objective for Federated LearningOral13 citations
- ProtoFL: Unsupervised Federated Learning via Prototypical DistillationPoster13 citations
- Prototypical Kernel Learning and Open-set Foreground Perception for Generalized Few-shot Semantic SegmentationPoster13 citations
- RICO: Regularizing the Unobservable for Indoor Compositional ReconstructionPoster13 citations
- SegRCDB: Semantic Segmentation via Formula-Driven Supervised LearningPoster13 citations
- Semantically Structured Image Compression via Irregular Group-Based DecouplingPoster13 citations
- SimMatchV2: Semi-Supervised Learning with Graph ConsistencyPoster13 citations
- SparseDet: Improving Sparsely Annotated Object Detection with Pseudo-positive MiningPoster13 citations
- Spatial-Aware Token for Weakly Supervised Object LocalizationPoster13 citations
- Steered Diffusion: A Generalized Framework for Plug-and-Play Conditional Image SynthesisPoster13 citations
- Strip-MLP: Efficient Token Interaction for Vision MLPPoster13 citations
- StyleLipSync: Style-based Personalized Lip-sync Video GenerationPoster13 citations
- To Adapt or Not to Adapt? Real-Time Adaptation for Semantic SegmentationPoster13 citations
- ToonTalker: Cross-Domain Face ReenactmentPoster13 citations
- Towards Multi-Layered 3D Garments AnimationPoster13 citations
- Tubelet-Contrastive Self-Supervision for Video-Efficient GeneralizationPoster13 citations
- Two Birds, One Stone: A Unified Framework for Joint Learning of Image and Video Style TransfersPoster13 citations
- ViLTA: Enhancing Vision-Language Pre-training through Textual AugmentationPoster13 citations
- Weakly-Supervised Text-Driven Contrastive Learning for Facial Behavior UnderstandingPoster13 citations
- 3D-aware Blending with Generative NeRFsPoster12 citations
- A Benchmark for Chinese-English Scene Text Image Super-ResolutionPoster12 citations
- A Parse-Then-Place Approach for Generating Graphic Layouts from Textual DescriptionsPoster12 citations
- Adaptive Superpixel for Active Learning in Semantic SegmentationPoster12 citations
- All4One: Symbiotic Neighbour Contrastive Learning via Self-Attention and Redundancy ReductionPoster12 citations
- AssetField: Assets Mining and Reconfiguration in Ground Feature Plane RepresentationPoster12 citations
- Audio-Visual Deception Detection: DOLOS Dataset and Parameter-Efficient Crossmodal LearningPoster12 citations
- CLIP-Cluster: CLIP-Guided Attribute Hallucination for Face ClusteringPoster12 citations
- CancerUniT: Towards a Single Unified Model for Effective Detection, Segmentation, and Diagnosis of Eight Major Cancers Using a Large Collection of CT ScansPoster12 citations
- Center-Based Decoupled Point-cloud Registration for 6D Object Pose EstimationPoster12 citations
- Class-incremental Continual Learning for Instance Segmentation with Image-level Weak SupervisionPoster12 citations
- Communication-efficient Federated Learning with Single-Step Synthetic Features Compressor for Faster ConvergencePoster12 citations
- Confidence-aware Pseudo-label Learning for Weakly Supervised Visual GroundingPoster12 citations
- Cyclic-Bootstrap Labeling for Weakly Supervised Object DetectionPoster12 citations
- DEDRIFT: Robust Similarity Search under Content DriftPoster12 citations
- Deep Image Harmonization with Globally Guided Feature Transformation and Relation DistillationPoster12 citations
- DiLiGenT-Pi: Photometric Stereo for Planar Surfaces with Rich Details - Benchmark Dataset and BeyondPoster12 citations
- DynaMITe: Dynamic Query Bootstrapping for Multi-object Interactive Segmentation TransformerPoster12 citations
- FBLNet: FeedBack Loop Network for Driver Attention PredictionPoster12 citations
- Fast Full-frame Video Stabilization with Iterative OptimizationPoster12 citations
- Focus on Your Target: A Dual Teacher-Student Framework for Domain-Adaptive Semantic SegmentationPoster12 citations
- FreeCOS: Self-Supervised Learning from Fractals and Unlabeled Images for Curvilinear Object SegmentationPoster12 citations
- Hiding Visual Information via Obfuscating Adversarial PerturbationsPoster12 citations
- Keep It SimPool: Who Said Supervised Transformers Suffer from Attention Deficit?Poster12 citations
- LAN-HDR: Luminance-based Alignment Network for High Dynamic Range Video ReconstructionPoster12 citations
- LEA2: A Lightweight Ensemble Adversarial Attack via Non-overlapping Vulnerable Frequency RegionsPoster12 citations
- Learning by Sorting: Self-supervised Learning with Group Ordering ConstraintsPoster12 citations
- Learning to Distill Global Representation for Sparse-View CTPoster12 citations
- Learning to Generate Semantic Layouts for Higher Text-Image Correspondence in Text-to-Image SynthesisPoster12 citations
- Learning to Identify Critical States for Reinforcement Learning from VideosPoster12 citations
- Luminance-aware Color Transform for Multiple Exposure CorrectionPoster12 citations
- MOST: Multiple Object Localization with Self-Supervised Transformers for Object DiscoveryOral12 citations
- NCHO: Unsupervised Learning for Neural 3D Composition of Humans and ObjectsPoster12 citations
- NEMTO: Neural Environment Matting for Novel View and Relighting Synthesis of Transparent ObjectsPoster12 citations
- NeRF-MS: Neural Radiance Fields with Multi-SequencePoster12 citations
- NeRFrac: Neural Radiance Fields through Refractive SurfacePoster12 citations
- NeTO:Neural Reconstruction of Transparent Objects with Self-Occlusion Aware Refraction-TracingPoster12 citations
- Neural Implicit Surface EvolutionPoster12 citations
- Neural Reconstruction of Relightable Human Model from Monocular VideoPoster12 citations
- Not All Steps are Created Equal: Selective Diffusion Distillation for Image ManipulationPoster12 citations
- One-Shot Recognition of Any Material Anywhere Using Contrastive Learning with Physics-Based RenderingPoster12 citations
- PRANC: Pseudo RAndom Networks for Compacting Deep ModelsPoster12 citations
- Point Contrastive Prediction with Semantic Clustering for Self-Supervised Learning on Point Cloud VideosPoster12 citations
- ProtoTransfer: Cross-Modal Prototype Transfer for Point Cloud SegmentationPoster12 citations
- Pseudo Flow Consistency for Self-Supervised 6D Object Pose EstimationPoster12 citations
- ROME: Robustifying Memory-Efficient NAS via Topology Disentanglement and Gradient AccumulationPoster12 citations
- RPG-Palm: Realistic Pseudo-data Generation for Palmprint RecognitionPoster12 citations
- Regularized Mask Tuning: Uncovering Hidden Knowledge in Pre-Trained Vision-Language ModelsPoster12 citations
- Rethinking Point Cloud Registration as Masking and ReconstructionPoster12 citations
- Rethinking Safe Semi-supervised Learning: Transferring the Open-set Problem to A Close-set OnePoster12 citations
- SC3K: Self-supervised and Coherent 3D Keypoints Estimation from Rotated, Noisy, and Decimated Point Cloud DataPoster12 citations
- Segment Every Reference Object in Spatial and Temporal SpacesPoster12 citations
- Self-Organizing Pathway Expansion for Non-Exemplar Class-Incremental LearningPoster12 citations
- ShapeScaffolder: Structure-Aware 3D Shape Generation from TextPoster12 citations
- SimNP: Learning Self-Similarity Priors Between Neural PointsPoster12 citations
- Simulating Fluids in Real-World Still ImagesOral12 citations
- Skip-Plan: Procedure Planning in Instructional Videos via Condensed Action Space LearningPoster12 citations
- SoDaCam: Software-defined Cameras via Single-Photon ImagingOral12 citations
- StageInteractor: Query-based Object Detector with Cross-stage InteractionPoster12 citations
- TIJO: Trigger Inversion with Joint Optimization for Defending Multimodal Backdoored ModelsOral12 citations
- TextPSG: Panoptic Scene Graph Generation from Textual DescriptionsPoster12 citations
- Towards Deeply Unified Depth-aware Panoptic Segmentation with Bi-directional Guidance LearningOral12 citations
- Towards Realistic Evaluation of Industrial Continual Learning Scenarios with an Emphasis on Energy Consumption and Computational FootprintPoster12 citations
- Understanding Hessian Alignment for Domain GeneralizationPoster12 citations
- VAPCNet: Viewpoint-Aware 3D Point Cloud CompletionPoster12 citations
- Vision Transformer Adapters for Generalizable Multitask LearningPoster12 citations
- Why do networks have inhibitory/negative connections?Poster12 citations
- Zero-guidance Segmentation Using Zero Segment LabelsPoster12 citations
- A 5-Point Minimal Solver for Event Camera Relative Motion EstimationOral11 citations
- AGG-Net: Attention Guided Gated-Convolutional Network for Depth Image CompletionPoster11 citations
- Active Stereo Without Pattern ProjectorPoster11 citations
- Body Knowledge and Uncertainty Modeling for Monocular 3D Human Body ReconstructionPoster11 citations
- Boosting Semantic Segmentation from the Perspective of Explicit Class EmbeddingsPoster11 citations
- Building Bridge Across the Time: Disruption and Restoration of Murals In the WildPoster11 citations
- CLIPTrans: Transferring Visual Knowledge with Pre-trained Models for Multimodal Machine TranslationPoster11 citations
- Clutter Detection and Removal in 3D Scenes with View-Consistent InpaintingPoster11 citations
- Collecting The Puzzle Pieces: Disentangled Self-Driven Human Pose Transfer by Permuting TexturesPoster11 citations
- DELFlow: Dense Efficient Learning of Scene Flow for Large-Scale Point CloudsPoster11 citations
- Deep Incubation: Training Large Models by Divide-and-ConqueringPoster11 citations
- Deformable Model-Driven Neural Rendering for High-Fidelity 3D Reconstruction of Human Heads Under Low-View SettingsPoster11 citations
- Disentangle then Parse: Night-time Semantic Segmentation with Illumination DisentanglementPoster11 citations
- E2E-LOAD: End-to-End Long-form Online Action DetectionPoster11 citations
- E3Sym: Leveraging E(3) Invariance for Unsupervised 3D Planar Reflective Symmetry DetectionPoster11 citations
- Enhancing Sample Utilization through Sample Adaptive Augmentation in Semi-Supervised LearningOral11 citations
- Few-Shot Dataset Distillation via Translative Pre-TrainingPoster11 citations
- GePSAn: Generative Procedure Step Anticipation in Cooking VideosPoster11 citations
- ImGeoNet: Image-induced Geometry-aware Voxel Representation for Multi-view 3D Object DetectionPoster11 citations
- Improving Transformer-based Image Matching by Cascaded Capturing Spatially Informative KeypointsPoster11 citations
- Invariant Feature Regularization for Fair Face RecognitionPoster11 citations
- LDP-Feat: Image Features with Local Differential PrivacyPoster11 citations
- Lecture Presentations Multimodal Dataset: Towards Understanding Multimodality in Educational VideosPoster11 citations
- Mitigating Adversarial Vulnerability through Causal Parameter Estimation by Adversarial Double Machine LearningPoster11 citations
- Movement Enhancement toward Multi-Scale Video Feature Representation for Temporal Action DetectionPoster11 citations
- Multi-Task Learning with Knowledge Distillation for Dense PredictionPoster11 citations
- Multi-grained Temporal Prototype Learning for Few-shot Video Object SegmentationPoster11 citations
- Multiple Planar Object TrackingPoster11 citations
- Multiscale Representation for Real-Time Anti-Aliasing Neural RenderingPoster11 citations
- NaviNeRF: NeRF-based 3D Representation Disentanglement by Latent Semantic NavigationPoster11 citations
- OFVL-MS: Once for Visual Localization across Multiple Indoor ScenesPoster11 citations
- Ordinal Label Distribution LearningPoster11 citations
- OxfordTVG-HIC: Can Machine Make Humorous Captions from Images?Poster11 citations
- PC-Adapter: Topology-Aware Adapter for Efficient Domain Adaption on Point Clouds with Rectified Pseudo-labelPoster11 citations
- PVT++: A Simple End-to-End Latency-Aware Visual Tracking FrameworkPoster11 citations
- Parallel Attention Interaction Network for Few-Shot Skeleton-Based Action RecognitionPoster11 citations
- Pose-Free Neural Radiance Fields via Implicit Pose RegularizationPoster11 citations
- QD-BEV : Quantization-aware View-guided Distillation for Multi-view 3D Object DetectionPoster11 citations
- Randomized Quantization: A Generic Augmentation for Data Agnostic Self-supervised LearningPoster11 citations
- Reinforce Data, Multiply Impact: Improved Model Accuracy and Robustness with Dataset ReinforcementPoster11 citations
- SSDA: Secure Source-Free Domain AdaptationPoster11 citations
- STEPs: Self-Supervised Key Step Extraction and Localization from Unlabeled Procedural VideosPoster11 citations
- Self-Supervised Burst Super-ResolutionPoster11 citations
- Sound Localization from Motion: Jointly Learning Sound Direction and Camera RotationPoster11 citations
- Space-time Prompting for Video Class-incremental LearningOral11 citations
- Supervised Homography Learning with Realistic Dataset GenerationPoster11 citations
- TRM-UAP: Enhancing the Transferability of Data-Free Universal Adversarial Perturbation via Truncated Ratio MaximizationPoster11 citations
- The Unreasonable Effectiveness of Large Language-Vision Models for Source-Free Video Domain AdaptationPoster11 citations
- Towards Inadequately Pre-trained Models in Transfer LearningPoster11 citations
- Towards Robust Model Watermark via Reducing Parametric VulnerabilityPoster11 citations
- Towards Viewpoint-Invariant Visual Recognition via Adversarial TrainingPoster11 citations
- TrajPAC: Towards Robustness Verification of Pedestrian Trajectory Prediction ModelsPoster11 citations
- Transparent Shape from a Single View Polarization ImagePoster11 citations
- UHDNeRF: Ultra-High-Definition Neural Radiance FieldsPoster11 citations
- Unsupervised Video Deraining with An Event CameraPoster11 citations
- Unsupervised Video Object Segmentation with Online Adversarial Self-TuningPoster11 citations
- Video Action Recognition with Attentive Semantic UnitsPoster11 citations
- When Do Curricula Work in Federated Learning?Poster11 citations
- iDAG: Invariant DAG Searching for Domain GeneralizationPoster11 citations
- 360VOT: A New Benchmark Dataset for Omnidirectional Visual Object TrackingPoster10 citations
- 3D Distillation: Improving Self-Supervised Monocular Depth Estimation on Reflective SurfacesPoster10 citations
- 3D Human Mesh Recovery with Sequentially Global Rotation EstimationPoster10 citations
- A Multidimensional Analysis of Social Biases in Vision TransformersPoster10 citations
- AdVerb: Visually Guided Audio DereverberationPoster10 citations
- Advancing Example Exploitation Can Alleviate Critical Challenges in Adversarial TrainingOral10 citations
- Automatic Animation of Hair Blowing in Still Portrait PhotosPoster10 citations
- BoMD: Bag of Multi-label Descriptors for Noisy Chest X-ray ClassificationPoster10 citations
- Boosting Single Image Super-Resolution via Partial Channel ShiftingPoster10 citations
- C2F2NeUS: Cascade Cost Frustum Fusion for High Fidelity and Generalizable Neural Surface ReconstructionPoster10 citations
- Chasing Clouds: Differentiable Volumetric Rasterisation of Point Clouds as a Highly Efficient and Accurate Loss for Large-Scale Deformable 3D RegistrationOral10 citations
- Coordinate Quantized Neural Implicit Representations for Multi-view ReconstructionPoster10 citations
- Cross-modal Scalable Hyperbolic Hierarchical ClusteringPoster10 citations
- DDIT: Semantic Scene Completion via Deformable Deep Implicit TemplatesPoster10 citations
- DOT: A Distillation-Oriented TrainerPoster10 citations
- Discriminative Class Tokens for Text-to-Image Diffusion ModelsPoster10 citations
- EGC: Image Generation and Classification via a Diffusion Energy-Based ModelPoster10 citations
- EP2P-Loc: End-to-End 3D Point to 2D Pixel Localization for Large-Scale Visual LocalizationPoster10 citations
- Editable Image Geometric Abstraction via Neural Primitive AssemblyPoster10 citations
- Enhancing Non-line-of-sight Imaging via Learnable Inverse Kernel and Attention MechanismsPoster10 citations
- Environment Agnostic Representation for Visual Reinforcement LearningPoster10 citations
- Exploring Transformers for Open-world Instance SegmentationPoster10 citations
- F&F Attack: Adversarial Attack against Multiple Object Trackers by Inducing False Negatives and False PositivesPoster10 citations
- FULLER: Unified Multi-modality Multi-task 3D Perception via Multi-level Gradient CalibrationPoster10 citations
- Federated Learning Over Images: Vertical Decompositions and Pre-Trained Backbones Are Difficult to BeatPoster10 citations
- Foreground and Text-lines Aware Document Image RectificationPoster10 citations
- INT2: Interactive Trajectory Prediction at IntersectionsPoster10 citations
- Innovating Real Fisheye Image Correction with Dual Diffusion ArchitecturePoster10 citations
- Iterative Superquadric Recomposition of 3D Objects from Multiple ViewsPoster10 citations
- Knowledge-Spreader: Learning Semi-Supervised Facial Action Dynamics by Consistifying Knowledge GranularityPoster10 citations
- LaPE: Layer-adaptive Position Embedding for Vision Transformers with Independent Layer NormalizationPoster10 citations
- Large-Scale Land Cover Mapping with Fine-Grained Classes via Class-Aware Semi-Supervised Semantic SegmentationPoster10 citations
- Learned Image Reasoning Prior Penetrates Deep Unfolding Network for Panchromatic and Multi-spectral Image FusionPoster10 citations
- Learning Continuous Exposure Value Representations for Single-Image HDR ReconstructionPoster10 citations
- Learning Neural Eigenfunctions for Unsupervised Semantic SegmentationPoster10 citations
- Learning from Noisy Data for Semi-Supervised 3D Object DetectionPoster10 citations
- Learning from Noisy Pseudo Labels for Semi-Supervised Temporal Action LocalizationPoster10 citations
- Local or Global: Selective Knowledge Assimilation for Federated Learning with Limited LabelsPoster10 citations
- Long-range Multimodal Pretraining for Movie UnderstandingPoster10 citations
- MAGI: Multi-Annotated Explanation-Guided LearningPoster10 citations
- MUVA: A New Large-Scale Benchmark for Multi-View Amodal Instance Segmentation in the Shopping ScenarioPoster10 citations
- Masked Autoencoders Are Stronger Knowledge DistillersPoster10 citations
- Most Important Person-Guided Dual-Branch Cross-Patch Attention for Group Affect RecognitionPoster10 citations
- Multi-granularity Interaction Simulation for Unsupervised Interactive SegmentationPoster10 citations
- Neural Fields for Structured LightingPoster10 citations
- Neural Radiance Field with LiDAR mapsPoster10 citations
- P1AC: Revisiting Absolute Pose From a Single Affine CorrespondenceOral10 citations
- PARTNER: Level up the Polar Representation for LiDAR 3D Object DetectionPoster10 citations
- Parametric Depth Based Feature Representation Learning for Object Detection and Segmentation in Bird's-Eye ViewPoster10 citations
- Partition Speeds Up Learning Implicit Neural Representations Based on Exponential-Increase HypothesisPoster10 citations
- PointDC: Unsupervised Semantic Segmentation of 3D Point Clouds via Cross-Modal Distillation and Super-Voxel ClusteringPoster10 citations
- Pre-training Vision Transformers with Very Limited Synthesized ImagesPoster10 citations
- Re:PolyWorld - A Graph Neural Network for Polygonal Scene ParsingPoster10 citations
- Recursive Video Lane DetectionPoster10 citations
- Representation Disparity-aware Distillation for 3D Object DetectionPoster10 citations
- Robust One-Shot Face Video Re-enactment using Hybrid Latent Spaces of StyleGAN2Poster10 citations
- SIGMA: Scale-Invariant Global Sparse Shape MatchingPoster10 citations
- SVQNet: Sparse Voxel-Adjacent Query Network for 4D Spatio-Temporal LiDAR Semantic SegmentationPoster10 citations
- Sample-wise Label Confidence Incorporation for Learning with Noisy LabelsPoster10 citations
- Segmenting Known Objects and Unseen Unknowns without Prior KnowledgePoster10 citations
- SeiT: Storage-Efficient Vision Training with Tokens Using 1% of Pixel StoragePoster10 citations
- Sentence Attention Blocks for Answer GroundingPoster10 citations
- Spacetime Surface Regularization for Neural Dynamic Scene ReconstructionPoster10 citations
- Speech4Mesh: Speech-Assisted Monocular 3D Facial Reconstruction for Speech-Driven 3D Facial AnimationPoster10 citations
- TextManiA: Enriching Visual Feature by Text-driven Manifold AugmentationPoster10 citations
- Towards Building More Robust Models with Frequency BiasPoster10 citations
- Unilaterally Aggregated Contrastive Learning with Hierarchical Augmentation for Anomaly DetectionPoster10 citations
- VLSlice: Interactive Vision-and-Language Slice DiscoveryPoster10 citations
- ViLLA: Fine-Grained Vision-Language Representation Learning from Real-World DataPoster10 citations
- BaRe-ESA: A Riemannian Framework for Unregistered Human Body ShapesPoster9 citations
- Be Everywhere - Hear Everything (BEE): Audio Scene Reconstruction by Sparse Audio-Visual SamplesPoster9 citations
- Beyond Object Recognition: A New Benchmark towards Object Concept LearningPoster9 citations
- Boosting Positive Segments for Weakly-Supervised Audio-Visual Video ParsingPoster9 citations
- CAME: Contrastive Automated Model EvaluationPoster9 citations
- CIRI: Curricular Inactivation for Residue-aware One-shot Video InpaintingPoster9 citations
- CVSformer: Cross-View Synthesis Transformer for Semantic Scene CompletionPoster9 citations
- Canonical Factors for Hybrid Neural FieldsPoster9 citations
- Collaborative Tracking Learning for Frame-Rate-Insensitive Multi-Object TrackingPoster9 citations
- Controllable Visual-Tactile SynthesisPoster9 citations
- Counterfactual-based Saliency Map: Towards Visual Contrastive Explanations for Neural NetworksPoster9 citations
- DPF-Net: Combining Explicit Shape Priors in Deformable Primitive Field for Unsupervised Structural Reconstruction of 3D ObjectsPoster9 citations
- Data-Free Class-Incremental Hand Gesture RecognitionPoster9 citations
- ENTL: Embodied Navigation Trajectory LearnerPoster9 citations
- EgoTV: Egocentric Task Verification from Natural Language Task DescriptionsPoster9 citations
- Emotional Listener Portrait: Neural Listener Head Generation with EmotionPoster9 citations
- Energy-based Self-Training and Normalization for Unsupervised Domain AdaptationPoster9 citations
- Exploring Model Transferability through the Lens of Potential EnergyPoster9 citations
- FashionNTM: Multi-turn Fashion Image Retrieval via Cascaded MemoryPoster9 citations
- Fcaformer: Forward Cross Attention in Hybrid Vision TransformerPoster9 citations
- Fine-grained Visible Watermark RemovalPoster9 citations
- Foreground-Background Separation through Concept Distillation from Generative Image Foundation ModelsPoster9 citations
- Generalized Few-Shot Point Cloud Segmentation via Geometric WordsPoster9 citations
- Improving Online Lane Graph Extraction by Object-Lane ClusteringPoster9 citations
- Informative Data Mining for One-Shot Cross-Domain Semantic SegmentationPoster9 citations
- Inverse Problem Regularization with Hierarchical Variational AutoencodersPoster9 citations
- Learning Global-aware Kernel for Image HarmonizationPoster9 citations
- Learning Spatial-context-aware Global Visual Feature Representation for Instance Image RetrievalPoster9 citations
- LiDAR-UDA: Self-ensembling Through Time for Unsupervised LiDAR Domain AdaptationOral9 citations
- Lip2Vec: Efficient and Robust Visual Speech Recognition via Latent-to-Latent Visual to Audio Representation MappingPoster9 citations
- MHCN: A Hyperbolic Neural Network Model for Multi-view Hierarchical ClusteringPoster9 citations
- Meta-ZSDETR: Zero-shot DETR with Meta-learningPoster9 citations
- MixSynthFormer: A Transformer Encoder-like Structure with Mixed Synthetic Self-attention for Efficient Human Pose EstimationPoster9 citations
- MolGrapher: Graph-based Visual Recognition of Chemical StructuresPoster9 citations
- Multi-Object Discovery by Low-Dimensional Object MotionPoster9 citations
- Multi-View Active Fine-Grained Visual RecognitionPoster9 citations
- Multi-view Self-supervised Disentanglement for General Image DenoisingPoster9 citations
- Narrator: Towards Natural Control of Human-Scene Interaction Generation via Relationship ReasoningPoster9 citations
- OmniLabel: A Challenging Benchmark for Language-Based Object DetectionOral9 citations
- OmniZoomer: Learning to Move and Zoom in on Sphere at High-ResolutionPoster9 citations
- On the Robustness of Normalizing Flows for Inverse Problems in ImagingPoster9 citations
- Pairwise Similarity Learning is SimPLEPoster9 citations
- Pixel-Aligned Recurrent Queries for Multi-View 3D Object DetectionPoster9 citations
- PlaneRecTR: Unified Query Learning for 3D Plane Recovery from a Single ViewPoster9 citations
- Pyramid Dual Domain Injection Network for Pan-sharpeningPoster9 citations
- Reconciling Object-Level and Global-Level Objectives for Long-Tail DetectionPoster9 citations
- Root Pose Decomposition Towards Generic Non-rigid 3D Reconstruction with Monocular VideosPoster9 citations
- S-TREK: Sequential Translation and Rotation Equivariant Keypoints for Local Feature ExtractionPoster9 citations
- Scene Matters: Model-based Deep Video CompressionPoster9 citations
- Self-Ordering Point CloudsOral9 citations
- Self-Supervised Object Detection from Egocentric VideosPoster9 citations
- Self-supervised Learning of Implicit Shape Representation with Dense Correspondence for Deformable ObjectsPoster9 citations
- Self-supervised Pre-training for Mirror DetectionPoster9 citations
- Semi-Supervised Learning via Weight-Aware Distillation under Class Distribution MismatchPoster9 citations
- ShiftNAS: Improving One-shot NAS via Probability ShiftPoster9 citations
- Story Visualization by Online Text Augmentation with Context MemoryPoster9 citations
- StyleDomain: Efficient and Lightweight Parameterizations of StyleGAN for One-shot and Few-shot Domain AdaptationPoster9 citations
- Template Inversion Attack against Face Recognition Systems using 3D Face ReconstructionPoster9 citations
- Troubleshooting Ethnic Quality Bias with Curriculum Domain Adaptation for Face Image Quality AssessmentPoster9 citations
- UniKD: Universal Knowledge Distillation for Mimicking Homogeneous or Heterogeneous Object DetectorsPoster9 citations
- Unsupervised Domain Adaptive Detection with Network Stability AnalysisPoster9 citations
- Unsupervised Prompt Tuning for Text-Driven Object DetectionPoster9 citations
- VeRi3D: Generative Vertex-based Radiance Fields for 3D Controllable Human Image SynthesisPoster9 citations
- Zero-Shot Point Cloud Segmentation by Semantic-Visual Aware SynthesisPoster9 citations
- ASAG: Building Strong One-Decoder-Layer Sparse Detectors via Adaptive Sparse Anchor GenerationPoster8 citations
- Activate and Reject: Towards Safe Domain Generalization under Category ShiftPoster8 citations
- Adaptive Calibrator Ensemble: Navigating Test Set Difficulty in Out-of-Distribution ScenariosPoster8 citations
- Adaptive Positional Encoding for Bundle-Adjusting Neural Radiance FieldsPoster8 citations
- Anchor-Intermediate Detector: Decoupling and Coupling Bounding Boxes for Accurate Object DetectionPoster8 citations
- BANSAC: A Dynamic BAyesian Network for Adaptive SAmple ConsensusPoster8 citations
- Borrowing Knowledge From Pre-trained Language Model: A New Data-efficient Visual Learning ParadigmPoster8 citations
- Box-based Refinement for Weakly Supervised and Unsupervised Localization TasksPoster8 citations
- Conditional 360-degree Image Synthesis for Immersive Indoor Scene DecorationPoster8 citations
- Curvature-Aware Training for Coordinate NetworksPoster8 citations
- DRAW: Defending Camera-shooted RAW Against Image ManipulationPoster8 citations
- Dark Side Augmentation: Generating Diverse Night Examples for Metric LearningPoster8 citations
- DeFormer: Integrating Transformers with Deformable Models for 3D Shape Abstraction from a Single ImagePoster8 citations
- Deep Homography Mixture for Single Image Rolling Shutter CorrectionPoster8 citations
- Deep Image Harmonization with Learnable AugmentationPoster8 citations
- Deep Multitask Learning with Progressive Parameter SharingOral8 citations
- Diffuse3D: Wide-Angle 3D Photography via Bilateral DiffusionPoster8 citations
- Efficient Transformer-based 3D Object Detection with Dynamic Token HaltingPoster8 citations
- Efficient Unified Demosaicing for Bayer and Non-Bayer Patterned Image SensorsPoster8 citations
- Exemplar-Free Continual Transformer with ConvolutionsPoster8 citations
- FSAR: Federated Skeleton-based Action Recognition with Adaptive Topology Structure and Knowledge DistillationPoster8 citations
- FedPD: Federated Open Set Recognition with Parameter DisentanglementPoster8 citations
- Few-Shot Physically-Aware Articulated Mesh Generation via Hierarchical DeformationPoster8 citations
- Frequency-aware GAN for Adversarial Manipulation GenerationPoster8 citations
- Fully Attentional Networks with Self-emerging Token LabelingPoster8 citations
- Generating Realistic Images from In-the-wild SoundsPoster8 citations
- Grounded Image Text Matching with Mismatched Relation ReasoningPoster8 citations
- HandR2N2: Iterative 3D Hand Pose Estimation Using a Residual Recurrent Neural NetworkPoster8 citations
- Householder Projector for Unsupervised Latent Semantics DiscoveryPoster8 citations
- Landscape Learning for Neural Network InversionPoster8 citations
- Learning Cross-Representation Affinity Consistency for Sparsely Supervised Biomedical Instance SegmentationPoster8 citations
- Learning Hierarchical Features with Joint Latent Space Energy-Based PriorPoster8 citations
- Learning Image Harmonization in the Linear Color SpacePoster8 citations
- Learning Robust Representations with Information Bottleneck and Memory Network for RGB-D-based Gesture RecognitionPoster8 citations
- Learning with Diversity: Self-Expanded Equalization for Better Generalized Deep Metric LearningPoster8 citations
- LightDepth: Single-View Depth Self-Supervision from Illumination DeclinePoster8 citations
- Linear-Covariance Loss for End-to-End Learning of 6D Pose EstimationPoster8 citations
- MULLER: Multilayer Laplacian Resizer for VisionPoster8 citations
- MapFormer: Boosting Change Detection by Using Pre-change InformationPoster8 citations
- Meta OOD Learning For Continuously Adaptive OOD DetectionPoster8 citations
- Minimal Solutions to Generalized Three-View Relative Pose ProblemOral8 citations
- Misalign, Contrast then Distill: Rethinking Misalignments in Language-Image Pre-trainingPoster8 citations
- MixBag: Bag-Level Data Augmentation for Learning from Label ProportionsPoster8 citations
- Multi-view Spectral Polarization Propagation for Video Glass SegmentationPoster8 citations
- OPERA: Omni-Supervised Representation Learning with Hierarchical SupervisionsPoster8 citations
- Omnidirectional Information Gathering for Knowledge Transfer-Based Audio-Visual NavigationPoster8 citations
- Ord2Seq: Regarding Ordinal Regression as Label Sequence PredictionPoster8 citations
- OrthoPlanes: A Novel Representation for Better 3D-Awareness of GANsPoster8 citations
- ParCNetV2: Oversized Kernel with Enhanced AttentionPoster8 citations
- Predict to Detect: Prediction-guided 3D Object Detection using Sequential ImagesPoster8 citations
- RIGID: Recurrent GAN Inversion and Editing of Real Face VideosPoster8 citations
- Sample-adaptive Augmentation for Point Cloud Recognition Against Real-world CorruptionsPoster8 citations
- SemARFlow: Injecting Semantics into Unsupervised Optical Flow Estimation for Autonomous DrivingPoster8 citations
- Simple Baselines for Interactive Video Retrieval with Questions and AnswersPoster8 citations
- Sparse Point Guided 3D Lane DetectionPoster8 citations
- Surface Extraction from Neural Unsigned Distance FieldsPoster8 citations
- Text-Driven Generative Domain Adaptation with Spectral Consistency RegularizationPoster8 citations
- Towards Better Robustness against Common Corruptions for Unsupervised Domain AdaptationPoster8 citations
- Towards Nonlinear-Motion-Aware and Occlusion-Robust Rolling Shutter CorrectionPoster8 citations
- Tracking without Label: Unsupervised Multiple Object Tracking via Contrastive Similarity LearningPoster8 citations
- Translating Images to Road Network: A Non-Autoregressive Sequence-to-Sequence ApproachOral8 citations
- Tuning Pre-trained Model via Moment ProbingPoster8 citations
- Unsupervised Feature Representation Learning for Domain-generalized Cross-domain Image RetrievalPoster8 citations
- VQA Therapy: Exploring Answer Differences by Visually Grounding AnswersPoster8 citations
- WALDO: Future Video Synthesis Using Object Layer Decomposition and Parametric Flow PredictionPoster8 citations
- 3D Motion Magnification: Visualizing Subtle Motions from Time-Varying Radiance FieldsPoster7 citations
- A Fast Unified System for 3D Object Detection and TrackingPoster7 citations
- A Retrospect to Multi-prompt Learning across Vision and LanguagePoster7 citations
- Adaptive Image Anonymization in the Context of Image Classification with Neural NetworksPoster7 citations
- Adaptive Nonlinear Latent Transformation for Conditional Face EditingPoster7 citations
- Adversarial Finetuning with Latent Representation Constraint to Mitigate Accuracy-Robustness TradeoffPoster7 citations
- Augmenting and Aligning Snippets for Few-Shot Video Domain AdaptationPoster7 citations
- BUS: Efficient and Effective Vision-Language Pre-Training with Bottom-Up Patch Summarization.Poster7 citations
- BallGAN: 3D-aware Image Synthesis with a Spherical BackgroundPoster7 citations
- BiFF: Bi-level Future Fusion with Polyline-based Coordinate for Interactive Trajectory PredictionPoster7 citations
- Building Vision Transformers with Hierarchy Aware Feature AggregationPoster7 citations
- CAD-Estate: Large-scale CAD Model Annotation in RGB VideosPoster7 citations
- CO-Net: Learning Multiple Point Cloud Tasks at Once with A Cohesive NetworkPoster7 citations
- COOP: Decoupling and Coupling of Whole-Body Grasping Pose GenerationPoster7 citations
- Chordal Averaging on Flag Manifolds and Its ApplicationsOral7 citations
- Compatibility of Fundamental Matrices for Complete Viewing GraphsPoster7 citations
- Convex Decomposition of Indoor ScenesPoster7 citations
- Convolutional Networks with Oriented 1D KernelsPoster7 citations
- Creative Birds: Self-Supervised Single-View 3D Style TransferPoster7 citations
- CrossLoc3D: Aerial-Ground Cross-Source 3D Place RecognitionPoster7 citations
- DR-Tune: Improving Fine-tuning of Pretrained Visual Models by Distribution Regularization with Semantic CalibrationPoster7 citations
- DandelionNet: Domain Composition with Instance Adaptive Classification for Domain GeneralizationPoster7 citations
- Data-free Knowledge Distillation for Fine-grained Visual CategorizationPoster7 citations
- Deep Equilibrium Object DetectionPoster7 citations
- Dense 2D-3D Indoor Prediction with Sound via Aligned Cross-Modal DistillationPoster7 citations
- Exploring Positional Characteristics of Dual-Pixel Data for Camera AutofocusPoster7 citations
- Fast and Accurate Transferability Measurement by Evaluating Intra-class Feature VariancePoster7 citations
- Few-Shot Common Action Localization via Cross-Attentional Fusion of Context and Temporal DynamicsPoster7 citations
- General Planar Motion from a Pair of 3D CorrespondencesOral7 citations
- Gram-based Attentive Neural Ordinary Differential Equations Network for Video Nystagmography ClassificationPoster7 citations
- Growing a Brain with Sparsity-Inducing Generation for Continual LearningPoster7 citations
- HairNeRF: Geometry-Aware Image Synthesis for Hairstyle TransferPoster7 citations
- Handwritten and Printed Text Segmentation: A Signature Case StudyPoster7 citations
- Hashing Neural Video Decomposition with Multiplicative Residuals in Space-TimePoster7 citations
- Human-Inspired Facial Sketch Synthesis with Dynamic AdaptationPoster7 citations
- IHNet: Iterative Hierarchical Network Guided by High-Resolution Estimated Information for Scene Flow EstimationPoster7 citations
- Identity-Consistent Aggregation for Video Object DetectionPoster7 citations
- Improved Visual Fine-tuning with Natural Language SupervisionOral7 citations
- Interactive Class-Agnostic Object CountingPoster7 citations
- Learning Adaptive Neighborhoods for Graph Neural NetworksPoster7 citations
- Learning Fine-Grained Features for Pixel-Wise Video CorrespondencesPoster7 citations
- Learning Point Cloud Completion without Complete Point Clouds: A Pose-Aware ApproachPoster7 citations
- Leveraging Intrinsic Properties for Non-Rigid Garment AlignmentPoster7 citations
- Local Context-Aware Active Domain AdaptationPoster7 citations
- MHEntropy: Entropy Meets Multiple Hypotheses for Pose and Shape RecoveryPoster7 citations
- MetaF2N: Blind Image Super-Resolution by Learning Efficient Model Adaptation from FacesPoster7 citations
- OCHID-Fi: Occlusion-Robust Hand Pose Estimation in 3D via RF-VisionPoster7 citations
- OmnimatteRF: Robust Omnimatte with 3D Background ModelingPoster7 citations
- Open-vocabulary Video Question Answering: A New Benchmark for Evaluating the Generalizability of Video Question Answering ModelsPoster7 citations
- PARF: Primitive-Aware Radiance Fusion for Indoor Scene Novel View SynthesisPoster7 citations
- Passive Ultra-Wideband Single-Photon ImagingOral7 citations
- Plausible Uncertainties for Human Pose RegressionPoster7 citations
- Replay: Multi-modal Multi-view Acted Videos for Casual HolographyPoster7 citations
- Revisit PCA-based Technique for Out-of-Distribution DetectionPoster7 citations
- SUMMIT: Source-Free Adaptation of Uni-Modal Models to Multi-Modal TargetsPoster7 citations
- Semantics-Consistent Feature Search for Self-Supervised Visual Representation LearningPoster7 citations
- Shift from Texture-bias to Shape-bias: Edge Deformation-based Augmentation for Robust Object RecognitionPoster7 citations
- Single Depth-image 3D Reflection Symmetry and Shape PredictionPoster7 citations
- Test-time Personalizable Forecasting of 3D Human PosesPoster7 citations
- Theoretical and Numerical Analysis of 3D Reconstruction Using Point and Line IncidencesPoster7 citations
- Towards Universal LiDAR-Based 3D Object Detection by Multi-Domain Knowledge TransferPoster7 citations
- Unaligned 2D to 3D Translation with Conditional Vector-Quantized Code Diffusion using TransformersPoster7 citations
- Unfolding Framework with Prior of Convolution-Transformer Mixture and Uncertainty Estimation for Video Snapshot Compressive ImagingPoster7 citations
- Unsupervised Open-Vocabulary Object Localization in VideosPoster7 citations
- Video Task Decathlon: Unifying Image and Video Tasks in Autonomous DrivingPoster7 citations
- WDiscOOD: Out-of-Distribution Detection via Whitened Linear Discriminant AnalysisPoster7 citations
- WaveIPT: Joint Attention and Flow Alignment in the Wavelet domain for Pose TransferPoster7 citations
- Weakly-supervised 3D Pose Transfer with KeypointsPoster7 citations
- 3D Instance Segmentation via Enhanced Spatial and Semantic SupervisionPoster6 citations
- A Complete Recipe for Diffusion Generative ModelsOral6 citations
- A2Q: Accumulator-Aware Quantization with Guaranteed Overflow AvoidancePoster6 citations
- ASM: Adaptive Skinning Model for High-Quality 3D Face ModelingPoster6 citations
- Audio-Visual Glance Network for Efficient Video RecognitionPoster6 citations
- BT^2: Backward-compatible Training with Basis TransformationPoster6 citations
- Both Diverse and Realism Matter: Physical Attribute and Style Alignment for Rainy Image GenerationPoster6 citations
- Breaking Temporal Consistency: Generating Video Universal Adversarial Perturbations Using Image ModelsPoster6 citations
- Building a Winning Team: Selecting Source Model Ensembles using a Submodular Transferability Estimation ApproachPoster6 citations
- CO-PILOT: Dynamic Top-Down Point Cloud with Conditional Neighborhood Aggregation for Multi-Gigapixel Histopathology Image RepresentationPoster6 citations
- Causal-DFQ: Causality Guided Data-Free Network QuantizationPoster6 citations
- ClothPose: A Real-world Benchmark for Visual Analysis of Garment Pose via An Indirect Recording SolutionOral6 citations
- Consistent Depth Prediction for Transparent Object Reconstruction from RGB-D CameraPoster6 citations
- Continual Learning for Personalized Co-speech Gesture GenerationPoster6 citations
- Continual Zero-Shot Learning through Semantically Guided Generative Random WalksPoster6 citations
- Contrastive Continuity on Augmentation Stability Rehearsal for Continual Self-Supervised LearningPoster6 citations
- DarSwin: Distortion Aware Radial Swin TransformerPoster6 citations
- Democratising 2D Sketch to 3D Shape Retrieval Through PivotingPoster6 citations
- Efficient Controllable Multi-Task ArchitecturesPoster6 citations
- Efficient Discovery and Effective Evaluation of Visual Perceptual Similarity: A Benchmark and BeyondPoster6 citations
- Extensible and Efficient Proxy for Neural Architecture SearchPoster6 citations
- Foreground Object Search by Distilling Composite Image FeaturePoster6 citations
- Geometry-guided Feature Learning and Fusion for Indoor Scene ReconstructionPoster6 citations
- HSE: Hybrid Species Embedding for Deep Metric LearningPoster6 citations
- Heterogeneous Diversity Driven Active Learning for Multi-Object TrackingPoster6 citations
- HiVLP: Hierarchical Interactive Video-Language Pre-TrainingPoster6 citations
- Hierarchical Contrastive Learning for Pattern-Generalizable Image Corruption Detection6 citations
- ICD-Face: Intra-class Compactness Distillation for Face RecognitionPoster6 citations
- Improving Representation Learning for Histopathologic Images with Cluster ConstraintsPoster6 citations
- Interaction-aware Joint Attention Estimation Using People AttributesPoster6 citations
- Knowledge Proxy Intervention for Deconfounded Video Question AnsweringPoster6 citations
- LeaF: Learning Frames for 4D Point Cloud Sequence UnderstandingPoster6 citations
- Learning Trajectory-Word Alignments for Video-Language TasksPoster6 citations
- Lossy and Lossless (L2) Post-training Model Size CompressionPoster6 citations
- MPI-Flow: Learning Realistic Optical Flow with Multiplane ImagesPoster6 citations
- MixCycle: Mixup Assisted Semi-Supervised 3D Single Object Tracking with Cycle ConsistencyPoster6 citations
- Multi-body Depth and Camera Pose Estimation from Multiple ViewsPoster6 citations
- Neural Deformable Models for 3D Bi-Ventricular Heart Shape Reconstruction and Modeling from 2D Sparse Cardiac Magnetic Resonance ImagingPoster6 citations
- Online Continual Learning on Hierarchical Label ExpansionPoster6 citations
- PHRIT: Parametric Hand Representation with Implicit TemplatePoster6 citations
- Personalized Image Generation for Color Vision Deficiency PopulationPoster6 citations
- Physically-Plausible Illumination Distribution EstimationPoster6 citations
- PourIt!: Weakly-Supervised Liquid Perception from a Single Image for Visual Closed-Loop Robotic PouringPoster6 citations
- Preserving Modality Structure Improves Multi-Modal LearningPoster6 citations
- Preserving Tumor Volumes for Unsupervised Medical Image RegistrationPoster6 citations
- RLSAC: Reinforcement Learning Enhanced Sample Consensus for End-to-End Robust EstimationPoster6 citations
- Ray Conditioning: Trading Photo-consistency for Photo-realism in Multi-view Image GenerationPoster6 citations
- ReactioNet: Learning High-Order Facial Behavior from Universal Stimulus-Reaction by Dyadic Relation ReasoningPoster6 citations
- Rethinking Video Frame Interpolation from Shutter Mode Induced DegradationPoster6 citations
- Revisiting Vision Transformer from the View of Path EnsembleOral6 citations
- Robust Geometry-Preserving Depth Estimation Using Differentiable RenderingPoster6 citations
- SSF: Accelerating Training of Spiking Neural Networks with Stabilized Spiking FlowPoster6 citations
- Semantic-Aware Dynamic Parameter for Video Inpainting TransformerPoster6 citations
- Semantify: Simplifying the Control of 3D Morphable Models Using CLIPPoster6 citations
- Single Image Deblurring with Row-dependent Blur MagnitudePoster6 citations
- SlaBins: Fisheye Depth Estimation using Slanted Bins on Road EnvironmentsPoster6 citations
- Task-Oriented Multi-Modal Mutual Leaning for Vision-Language ModelsPoster6 citations
- Tiled Multiplane Images for Practical 3D PhotographyPoster6 citations
- Token-Label Alignment for Vision TransformersPoster6 citations
- Towards Fairness-aware Adversarial Network PruningPoster6 citations
- Unleashing the Power of Gradient Signal-to-Noise Ratio for Zero-Shot NASPoster6 citations
- Unsupervised Self-Driving Attention Prediction via Uncertainty Mining and Knowledge EmbeddingPoster6 citations
- VertexSerum: Poisoning Graph Neural Networks for Link InferencePoster6 citations
- Video Action Segmentation via Contextually Refined Temporal KeypointsPoster6 citations
- Video Object Segmentation-aware Video Frame InterpolationPoster6 citations
- Viewing Graph Solvability in PracticeOral6 citations
- Workie-Talkie: Accelerating Federated Learning by Overlapping Computing and Communications via Contrastive RegularizationPoster6 citations
- Yes, we CANN: Constrained Approximate Nearest Neighbors for Local Feature-Based Visual LocalizationPoster6 citations
- iVS-Net: Learning Human View Synthesis from Internet VideosPoster6 citations
- 3D-Aware Generative Model for Improved Side-View Image SynthesisPoster5 citations
- 4D Myocardium Reconstruction with Decoupled Motion and Shape ModelPoster5 citations
- Algebraically Rigorous Quaternion Framework for the Neural Network Pose Estimation ProblemPoster5 citations
- Atmospheric Transmission and Thermal Inertia Induced Blind Road Segmentation with a Large-Scale Dataset TBRSDPoster5 citations
- Backpropagation Path Search On Adversarial TransferabilityPoster5 citations
- Benchmarking and Analyzing Robust Point Cloud Recognition: Bag of Tricks for Defending Adversarial ExamplesPoster5 citations
- Better May Not Be Fairer: A Study on Subgroup Discrepancy in Image ClassificationPoster5 citations
- BlindHarmony: "Blind" Harmonization for MR Images via Flow ModelPoster5 citations
- Boosting Long-tailed Object Detection via Step-wise Learning on Smooth-tail DataPoster5 citations
- COMPASS: High-Efficiency Deep Image Compression with Arbitrary-scale Spatial ScalabilityPoster5 citations
- Conceptual and Hierarchical Latent Space Decomposition for Face EditingPoster5 citations
- Coordinate Transformer: Achieving Single-stage Multi-person Mesh Recovery from VideosPoster5 citations
- DMNet: Delaunay Meshing Network for 3D Shape RepresentationPoster5 citations
- DeePoint: Visual Pointing Recognition and Direction EstimationPoster5 citations
- Domain Generalization Guided by Gradient Signal to Noise Ratio of ParametersPoster5 citations
- Efficient Deep Space Filling CurvePoster5 citations
- Efficiently Robustify Pre-Trained ModelsPoster5 citations
- Enhancing Adversarial Robustness in Low-Label Regime via Adaptively Weighted Regularization and Knowledge DistillationPoster5 citations
- Essential Matrix Estimation using Convex Relaxations in Orthogonal SpacePoster5 citations
- Exploring the Sim2Real Gap Using Digital TwinsPoster5 citations
- FCCNs: Fully Complex-valued Convolutional Networks using Complex-valued Color Model and Loss FunctionPoster5 citations
- Flexible Visual Recognition by Evidential Modeling of Confusion and IgnorancePoster5 citations
- GeT: Generative Target Structure Debiasing for Domain AdaptationPoster5 citations
- Generalized Sum Pooling for Metric LearningPoster5 citations
- Gramian Attention Heads are Strong yet Efficient Vision LearnersPoster5 citations
- GrowCLIP: Data-Aware Automatic Model Growing for Large-scale Contrastive Language-Image Pre-TrainingPoster5 citations
- Homography Guided Temporal Fusion for Road Line and Marking SegmentationPoster5 citations
- Iterative Soft Shrinkage Learning for Efficient Image Super-ResolutionPoster5 citations
- Joint Implicit Neural Representation for High-fidelity and Compact Vector FontsPoster5 citations
- Learning Data-Driven Vector-Quantized Degradation Model for Animation Video Super-ResolutionPoster5 citations
- Learning to Learn: How to Continuously Teach Humans and MachinesPoster5 citations
- MIMO-NeRF: Fast Neural Rendering with Multi-input Multi-output Neural Radiance FieldsPoster5 citations
- Mining bias-target Alignment from Voronoi CellsPoster5 citations
- ModelGiF: Gradient Fields for Model Functional DistancePoster5 citations
- MoreauGrad: Sparse and Robust Interpretation of Neural Networks via Moreau EnvelopePoster5 citations
- MotionDeltaCNN: Sparse CNN Inference of Frame Differences in Moving Camera Videos with Spherical Buffers and Padded ConvolutionsPoster5 citations
- Multi-task View Synthesis with Neural Radiance FieldsPoster5 citations
- Multimodal High-order Relation Transformer for Scene Boundary DetectionPoster5 citations
- Neglected Free Lunch - Learning Image Classifiers Using Annotation ByproductsPoster5 citations
- Not Every Side Is Equal: Localization Uncertainty Estimation for Semi-Supervised 3D Object DetectionPoster5 citations
- ORC: Network Group-based Knowledge Distillation using Online Role ChangePoster5 citations
- Objects Do Not Disappear: Video Object Detection by Single-Frame Object Location AnticipationPoster5 citations
- Open Set Video HOI detection from Action-Centric Chain-of-Look PromptingPoster5 citations
- Ordered Atomic Activity for Fine-grained Interactive Traffic Scenario UnderstandingPoster5 citations
- PIRNet: Privacy-Preserving Image Restoration Network via Wavelet LiftingPoster5 citations
- Pixel-Wise Contrastive DistillationPoster5 citations
- PlanarTrack: A Large-scale Challenging Benchmark for Planar Object TrackingPoster5 citations
- PlankAssembly: Robust 3D Reconstruction from Three Orthographic Views with Learnt Shape ProgramsPoster5 citations
- Probabilistic Precision and Recall Towards Reliable Evaluation of Generative ModelsPoster5 citations
- Prototypical Mixing and Retrieval-Based Refinement for Label Noise-Resistant Image RetrievalPoster5 citations
- RCA-NOC: Relative Contrastive Alignment for Novel Object CaptioningPoster5 citations
- Recovering a Molecule's 3D Dynamics from Liquid-phase Electron Microscopy MoviesPoster5 citations
- RecursiveDet: End-to-End Region-Based Recursive Object DetectionPoster5 citations
- Regularized Primitive Graph Learning for Unified Vector MappingPoster5 citations
- SEFD: Learning to Distill Complex Pose and OcclusionPoster5 citations
- SEMPART: Self-supervised Multi-resolution Partitioning of Image SemanticsPoster5 citations
- SFHarmony: Source Free Domain Adaptation for Distributed Neuroimaging AnalysisPoster5 citations
- SIDGAN: High-Resolution Dubbed Video Generation via Shift-Invariant LearningPoster5 citations
- SINC: Self-Supervised In-Context Learning for Vision-Language TasksPoster5 citations
- SYENet: A Simple Yet Effective Network for Multiple Low-Level Vision Tasks with Real-Time Performance on Mobile DevicePoster5 citations
- Self-supervised Learning to Bring Dual Reversed Rolling Shutter Images AlivePoster5 citations
- Shape Anchor Guided Holistic Indoor Scene UnderstandingPoster5 citations
- SpaceEvo: Hardware-Friendly Search Space Design for Efficient INT8 InferencePoster5 citations
- SparseMAE: Sparse Training Meets Masked AutoencodersPoster5 citations
- Spatio-temporal Prompting Network for Robust Video Feature ExtractionPoster5 citations
- Text-Conditioned Sampling Framework for Text-to-Image Generation with Masked Generative ModelsPoster5 citations
- The Victim and The Beneficiary: Exploiting a Poisoned Model to Train a Clean Model on Poisoned DataOral5 citations
- Time-to-Contact Map by Joint Estimation of Up-to-Scale Inverse Depth and Global Motion using a Single Event CameraPoster5 citations
- Tracing the Origin of Adversarial Attack for Forensic Investigation and DeterrencePoster5 citations
- VADER: Video Alignment Differencing and RetrievalPoster5 citations
- VL-Match: Enhancing Vision-Language Pretraining with Token-Level and Instance-Level MatchingPoster5 citations
- View Consistent Purification for Accurate Cross-View LocalizationPoster5 citations
- You Never Get a Second Chance To Make a Good First Impression: Seeding Active Learning for 3D Semantic SegmentationPoster5 citations
- 3D Neural Embedding Likelihood: Probabilistic Inverse Graphics for Robust 6D Pose EstimationPoster4 citations
- Aperture Diffraction for Compact Snapshot Spectral ImagingPoster4 citations
- Beyond the Limitation of Monocular 3D Detector via Knowledge DistillationPoster4 citations
- Chaotic World: A Large and Challenging Benchmark for Human Behavior Understanding in Chaotic EventsPoster4 citations
- Cloth2Body: Generating 3D Human Body Mesh from 2D ClothingPoster4 citations
- Complementary Domain Adaptation and Generalization for Unsupervised Continual Domain Shift LearningPoster4 citations
- Cross-modal Latent Space Alignment for Image to Avatar TranslationPoster4 citations
- Cross-view Semantic Alignment for Livestreaming Product RecognitionPoster4 citations
- DCPB: Deformable Convolution Based on the Poincare Ball for Top-view Fisheye CamerasPoster4 citations
- DISeR: Designing Imaging Systems with Reinforcement LearningPoster4 citations
- DeLiRa: Self-Supervised Depth, Light, and Radiance FieldsPoster4 citations
- DetermiNet: A Large-Scale Diagnostic Dataset for Complex Visually-Grounded Referencing using DeterminersPoster4 citations
- Distributed Bundle Adjustment with Block-Based Sparse Matrix Compression for Super Large Scale DatasetsPoster4 citations
- Domain Adaptive Few-Shot Open-Set LearningPoster4 citations
- Efficient LiDAR Point Cloud Oversegmentation NetworkPoster4 citations
- Exploring Temporal Concurrency for Video-Language Representation LearningPoster4 citations
- Fan-Beam Binarization Difference Projection (FB-BDP): A Novel Local Object Descriptor for Fine-Grained Leaf Image RetrievalPoster4 citations
- GACE: Geometry Aware Confidence Enhancement for Black-Box 3D Object Detectors on LiDAR-DataPoster4 citations
- GaPro: Box-Supervised 3D Point Cloud Instance Segmentation Using Gaussian Processes as Pseudo LabelersPoster4 citations
- Generalizable Neural Fields as Partially Observed Neural ProcessesPoster4 citations
- Guiding Local Feature Matching with Surface CurvaturePoster4 citations
- HDG-ODE: A Hierarchical Continuous-Time Model for Human Pose ForecastingPoster4 citations
- IIEU: Rethinking Neural Feature Activation from Decision-MakingPoster4 citations
- Improved Knowledge Transfer for Semi-Supervised Domain Adaptation via Trico Training StrategyPoster4 citations
- In-Style: Bridging Text and Uncurated Videos with Style Transfer for Text-Video RetrievalPoster4 citations
- LIST: Learning Implicitly from Spatial Transformers for Single-View 3D ReconstructionPoster4 citations
- Learned Compressive Representations for Single-Photon 3D ImagingPoster4 citations
- LivePose: Online 3D Reconstruction from Monocular Video with Dynamic Camera PosesOral4 citations
- MEGA: Multimodal Alignment Aggregation and Distillation For Cinematic Video SegmentationPoster4 citations
- MST-compression: Compressing and Accelerating Binary Neural Networks with Minimum Spanning TreePoster4 citations
- Markov Game Video Augmentation for Action SegmentationPoster4 citations
- Model Calibration in Dense Classification with Adaptive Label PerturbationPoster4 citations
- Moment Detection in Long Tutorial VideosPoster4 citations
- NeSS-ST: Detecting Good and Stable Keypoints with a Neural Stability Score and the Shi-Tomasi detectorPoster4 citations
- Occ^2Net: Robust Image Matching Based on 3D Occupancy Estimation for Occluded RegionsPoster4 citations
- Order-Prompted Tag Sequence Generation for Video TaggingPoster4 citations
- Out-of-Distribution Detection for Monocular Depth EstimationPoster4 citations
- Out-of-Domain GAN Inversion via Invertibility Decomposition for Photo-Realistic Human Face ManipulationPoster4 citations
- Overcoming Forgetting Catastrophe in Quantization-Aware TrainingPoster4 citations
- Panoramas from PhotonsPoster4 citations
- Preparing the Future for Continual Semantic SegmentationOral4 citations
- Privacy Preserving Localization via Coordinate PermutationsPoster4 citations
- Prototype-based Dataset ComparisonPoster4 citations
- RED-PSM: Regularization by Denoising of Partially Separable Models for Dynamic ImagingPoster4 citations
- RFD-ECNet: Extreme Underwater Image Compression with Reference to Feature DictionaryPoster4 citations
- Rapid Network Adaptation: Learning to Adapt Neural Networks Using Test-Time FeedbackPoster4 citations
- ResQ: Residual Quantization for Video PerceptionPoster4 citations
- Rethinking Amodal Video Segmentation from Learning Supervised Signals with Object-centric RepresentationPoster4 citations
- SOCS: Semantically-Aware Object Coordinate Space for Category-Level 6D Object Pose Estimation under Large Shape VariationsPoster4 citations
- Segmentation of Tubular Structures Using Iterative Training with Tailored SamplesPoster4 citations
- Semantic-Aware Implicit Template Learning via Part Deformation ConsistencyPoster4 citations
- Simple and Effective Out-of-Distribution Detection via Cosine-based Softmax LossPoster4 citations
- Smoothness Similarity Regularization for Few-Shot GAN AdaptationPoster4 citations
- Spatio-Temporal Crop Aggregation for Video Representation LearningPoster4 citations
- Spectral Graphormer: Spectral Graph-Based Transformer for Egocentric Two-Hand Reconstruction using Multi-View Color ImagesPoster4 citations
- Stabilizing Visual Reinforcement Learning via Asymmetric Interactive CooperationPoster4 citations
- Strata-NeRF : Neural Radiance Fields for Stratified ScenesPoster4 citations
ICCV accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.