ICCV 2023 Accepted Papers
The full list of 2,156 papers accepted at ICCV 2023 (IEEE/CVF International Conference on Computer Vision). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 2,005Oral: 145
- Segment AnythingPoster10,304 citations
- Adding Conditional Control to Text-to-Image Diffusion ModelsPoster4,423 citations
- Scalable Diffusion Models with TransformersOral2,255 citations
- Zero-1-to-3: Zero-shot One Image to 3D ObjectPoster1,020 citations
- Sigmoid Loss for Language Image Pre-TrainingOral1,002 citations
- Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video GenerationPoster853 citations
- Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video GeneratorsOral578 citations
- LLM-Planner: Few-Shot Grounded Planning for Embodied Agents with Large Language ModelsPoster577 citations
- DiffusionDet: Diffusion Model for Object DetectionOral570 citations
- Fantasia3D: Disentangling Geometry and Appearance for High-quality Text-to-3D Content CreationPoster565 citations
- Zip-NeRF: Anti-Aliased Grid-Based Neural Radiance FieldsPoster558 citations
- Structure and Content-Guided Video Synthesis with Diffusion ModelsPoster551 citations
- LightGlue: Local Feature Matching at Light SpeedPoster540 citations
- ViperGPT: Visual Inference via Python Execution for ReasoningOral476 citations
- Large Selective Kernel Network for Remote Sensing Object DetectionPoster467 citations
- MasaCtrl: Tuning-Free Mutual Self-Attention Control for Consistent Image Synthesis and EditingPoster455 citations
- DETRs with Collaborative Hybrid Assignments TrainingPoster444 citations
- Instruct-NeRF2NeRF: Editing 3D Scenes with InstructionsOral429 citations
- Retinexformer: One-stage Retinex-based Transformer for Low-light Image EnhancementPoster410 citations
- LERF: Language Embedded Radiance FieldsOral405 citations
- PETRv2: A Unified Framework for 3D Perception from Multi-Camera ImagesPoster397 citations
- ELITE: Encoding Visual Concepts into Textual Embeddings for Customized Text-to-Image GenerationOral361 citations
- Erasing Concepts from Diffusion ModelsPoster356 citations
- Prompt-aligned Gradient for Prompt TuningPoster354 citations
- FateZero: Fusing Attentions for Zero-shot Text-based Video EditingOral338 citations
- Dynamic Snake Convolution Based on Topological Geometric Constraints for Tubular Structure SegmentationPoster333 citations
- Make-It-3D: High-fidelity 3D Creation from A Single Image with Diffusion PriorPoster301 citations
- DiffIR: Efficient Diffusion Model for Image RestorationPoster291 citations
- What Does a Platypus Look Like? Generating Customized Prompts for Zero-Shot Image ClassificationPoster286 citations
- Dual Aggregation Transformer for Image Super-ResolutionPoster285 citations
- NeuS2: Fast Learning of Neural Implicit Surfaces for Multi-view ReconstructionPoster276 citations
- PhysDiff: Physics-Guided Human Motion Diffusion ModelOral272 citations
- SVDiff: Compact Parameter Space for Diffusion Fine-TuningPoster271 citations
- Your Diffusion Model is Secretly a Zero-Shot ClassifierPoster267 citations
- Preserve Your Own Correlation: A Noise Prior for Video Diffusion ModelsPoster262 citations
- SurroundOcc: Multi-camera 3D Occupancy Prediction for Autonomous DrivingPoster260 citations
- Learning to Upsample by Learning to SamplePoster256 citations
- Pix2Video: Video Editing using Image DiffusionPoster254 citations
- Rethinking Vision Transformers for MobileNet Size and SpeedPoster242 citations
- PointCLIP V2: Prompting CLIP and GPT for Powerful 3D Open-world LearningPoster241 citations
- FLatten Transformer: Vision Transformer using Focused Linear AttentionPoster239 citations
- The Stable Signature: Rooting Watermarks in Latent Diffusion ModelsPoster239 citations
- ScanNet++: A High-Fidelity Dataset of 3D Indoor ScenesOral236 citations
- Exploring Object-Centric Temporal Modeling for Efficient Multi-View 3D Object DetectionPoster235 citations
- Generative Novel View Synthesis with 3D-Aware Diffusion ModelsOral235 citations
- VAD: Vectorized Scene Representation for Efficient Autonomous DrivingPoster233 citations
- FastViT: A Fast Hybrid Vision Transformer Using Structural ReparameterizationPoster231 citations
- CLIP-Driven Universal Model for Organ Segmentation and Tumor DetectionPoster230 citations
- Unleashing Text-to-Image Diffusion Models for Visual PerceptionPoster229 citations
- SparseNeRF: Distilling Depth Ranking for Few-shot Novel View SynthesisPoster227 citations
- Hierarchically Decomposed Graph Convolutional Networks for Skeleton-Based Action RecognitionPoster222 citations
- DIRE for Diffusion-Generated Image DetectionPoster221 citations
- Humans in 4D: Reconstructing and Tracking Humans with TransformersPoster221 citations
- SRFormer: Permuted Self-Attention for Single Image Super-ResolutionPoster216 citations
- MotionBERT: A Unified Perspective on Learning Human Motion RepresentationsPoster215 citations
- Ablating Concepts in Text-to-Image Diffusion ModelsPoster212 citations
- DreamBooth3D: Subject-Driven Text-to-3D GenerationPoster211 citations
- DDFM: Denoising Diffusion Model for Multi-Modality Image FusionOral210 citations
- OccFormer: Dual-path Transformer for Vision-based 3D Semantic Occupancy PredictionPoster207 citations
- Self-regulating Prompts: Foundational Model Adaptation without ForgettingPoster205 citations
- TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question AnsweringPoster203 citations
- Scale-MAE: A Scale-Aware Masked Autoencoder for Multiscale Geospatial Representation LearningOral201 citations
- BoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained DiffusionPoster200 citations
- DALL-Eval: Probing the Reasoning Skills and Social Biases of Text-to-Image Generation ModelsPoster198 citations
- Q-Diffusion: Quantizing Diffusion ModelsPoster195 citations
- DiffuMask: Synthesizing Images with Pixel-level Annotations for Semantic Segmentation Using Diffusion ModelsPoster189 citations
- Metric3D: Towards Zero-shot Metric 3D Prediction from A Single ImagePoster189 citations
- Unmasked Teacher: Towards Training-Efficient Video Foundation ModelsOral189 citations
- Versatile Diffusion: Text, Images and Variations All in One Diffusion ModelPoster187 citations
- Text2Room: Extracting Textured 3D Meshes from 2D Text-to-Image ModelsPoster186 citations
- Rethinking Mobile Block for Efficient Attention-based ModelsPoster180 citations
- MonoDETR: Depth-guided Transformer for Monocular 3D Object DetectionPoster179 citations
- Text2Tex: Text-driven Texture Synthesis via Diffusion ModelsPoster179 citations
- OpenOccupancy: A Large Scale Benchmark for Surrounding Semantic Occupancy PerceptionPoster177 citations
- A Simple Framework for Open-Vocabulary Segmentation and DetectionPoster176 citations
- NDC-Scene: Boost Monocular 3D Semantic Scene Completion in Normalized Device Coordinates SpacePoster174 citations
- StableVideo: Text-driven Consistency-aware Diffusion Video EditingPoster174 citations
- Tracking Anything with Decoupled Video SegmentationPoster174 citations
- Rethinking Range View Representation for LiDAR SegmentationPoster173 citations
- Multi-interactive Feature Learning and a Full-time Multi-modality Benchmark for Image Fusion and SegmentationOral172 citations
- Tracking Everything Everywhere All at OnceOral170 citations
- CLIP2Point: Transfer CLIP to Point Cloud Classification with Image-Depth Pre-TrainingPoster167 citations
- ReMoDiffuse: Retrieval-Augmented Motion Diffusion ModelPoster167 citations
- Exploring Video Quality Assessment on User Generated Contents from Aesthetic and Technical PerspectivesPoster162 citations
- Group DETR: Fast DETR Training with Group-Wise One-to-Many AssignmentPoster160 citations
- TAPIR: Tracking Any Point with Per-Frame Initialization and Temporal RefinementPoster160 citations
- UniverSeg: Universal Medical Image SegmentationPoster157 citations
- Single-Stage Diffusion NeRF: A Unified Approach to 3D Generation and ReconstructionPoster156 citations
- Point-SLAM: Dense Neural Point Cloud-based SLAMPoster153 citations
- What does CLIP know about a red circle? Visual prompt engineering for VLMsOral153 citations
- FreeDoM: Training-Free Energy-Guided Conditional Diffusion ModelPoster152 citations
- Efficient Diffusion Training via Min-SNR Weighting StrategyPoster149 citations
- UniVTG: Towards Unified Video-Language Temporal GroundingPoster149 citations
- MOSE: A New Dataset for Video Object Segmentation in Complex ScenesPoster148 citations
- SLCA: Slow Learner with Classifier Alignment for Continual Learning on a Pre-trained ModelPoster148 citations
- Implicit Neural Representation for Cooperative Low-light Image EnhancementPoster146 citations
- Scene as OccupancyPoster144 citations
- PointOdyssey: A Large-Scale Synthetic Dataset for Long-Term Point TrackingOral143 citations
- SwiftFormer: Efficient Additive Attention for Transformer-based Real-time Mobile Vision ApplicationsPoster143 citations
- SimpleClick: Interactive Image Segmentation with Simple Vision TransformersPoster142 citations
- Spatially-Adaptive Feature Modulation for Efficient Image Super-ResolutionPoster142 citations
- Tri-MipRF: Tri-Mip Representation for Efficient Anti-Aliasing Neural Radiance FieldsOral142 citations
- Diff-Retinex: Rethinking Low-light Image Enhancement with A Generative Diffusion ModelPoster141 citations
- DDP: Diffusion Model for Dense Visual PredictionPoster140 citations
- Iterative Prompt Learning for Unsupervised Backlit Image EnhancementOral140 citations
- StyleDiffusion: Controllable Disentangled Style Transfer via Diffusion ModelsPoster136 citations
- UCF: Uncovering Common Features for Generalizable Deepfake DetectionPoster136 citations
- EfficientViT: Lightweight Multi-Scale Attention for High-Resolution Dense PredictionPoster135 citations
- GO-SLAM: Global Optimization for Consistent 3D Instant ReconstructionPoster135 citations
- SatlasPretrain: A Large-Scale Dataset for Remote Sensing Image UnderstandingPoster133 citations
- SuS-X: Training-Free Name-Only Transfer of Vision-Language ModelsPoster133 citations
- Masked Diffusion Transformer is a Strong Image SynthesizerPoster130 citations
- 3D-VisTA: Pre-trained Transformer for 3D Vision and Text AlignmentPoster129 citations
- HyperDiffusion: Generating Implicit Neural Fields with Weight-Space DiffusionPoster128 citations
- Anti-DreamBooth: Protecting Users from Personalized Text-to-image SynthesisPoster127 citations
- Focal Network for Image RestorationPoster127 citations
- SparseBEV: High-Performance Sparse 3D Object Detection from Multi-Camera VideosPoster127 citations
- Guided Motion Diffusion for Controllable Human Motion SynthesisPoster126 citations
- Zero-Shot Composed Image Retrieval with Textual InversionPoster126 citations
- CLIPN for Zero-Shot OOD Detection: Teaching CLIP to Say NoPoster125 citations
- Dense Text-to-Image Generation with Attention ModulationPoster125 citations
- Diffusion-Based 3D Human Pose Estimation with Multi-Hypothesis AggregationPoster125 citations
- MedKLIP: Medical Knowledge Enhanced Language-Image Pre-Training for X-ray DiagnosisPoster125 citations
- MB-TaylorFormer: Multi-Branch Efficient Transformer Expanded by Taylor Formula for Image DehazingPoster124 citations
- A Generalist Framework for Panoptic Segmentation of Images and VideosPoster123 citations
- Localizing Object-Level Shape Variations with Text-to-Image Diffusion ModelsPoster123 citations
- Robo3D: Towards Robust and Reliable 3D Perception against CorruptionsPoster123 citations
- Diffusion-SDF: Conditional Generative Modeling of Signed Distance FunctionsPoster122 citations
- Human Preference Score: Better Aligning Text-to-Image Models with Human PreferencePoster122 citations
- I-ViT: Integer-only Quantization for Efficient Vision Transformer InferencePoster121 citations
- Scale-Aware Modulation Meet TransformerPoster121 citations
- Delicate Textured Mesh Recovery from NeRF via Adaptive Surface RefinementPoster120 citations
- Delta Denoising ScorePoster119 citations
- A Unified Continual Learning Framework with General Parameter-Efficient TuningPoster118 citations
- Cross Modal Transformer: Towards Fast and Robust 3D Object DetectionPoster118 citations
- Adaptive Rotated Convolution for Rotated Object DetectionPoster117 citations
- EmoTalk: Speech-Driven Emotional Disentanglement for 3D Face AnimationPoster117 citations
- NerfAcc: Efficient Sampling Accelerates NeRFsPoster117 citations
- InterDiff: Generating 3D Human-Object Interactions with Physics-Informed DiffusionPoster116 citations
- Source-free Domain Adaptive Human Pose EstimationPoster113 citations
- From Knowledge Distillation to Self-Knowledge Distillation: A Unified Approach with Normalized Loss and Customized Soft LabelsPoster111 citations
- MeViS: A Large-scale Benchmark for Video Segmentation with Motion ExpressionsPoster110 citations
- RepQ-ViT: Scale Reparameterization for Post-Training Quantization of Vision TransformersPoster105 citations
- MotionLM: Multi-Agent Motion Forecasting as Language ModelingPoster104 citations
- ProPainter: Improving Propagation and Transformer for Video InpaintingPoster104 citations
- SegGPT: Towards Segmenting Everything in ContextPoster104 citations
- VideoFlow: Exploiting Temporal Cues for Multi-frame Optical Flow EstimationPoster104 citations
- SportsMOT: A Large Multi-Object Tracking Dataset in Multiple Sports ScenesPoster103 citations
- BeLFusion: Latent Diffusion for Behavior-Driven Human Motion PredictionPoster102 citations
- Deep Directly-Trained Spiking Neural Networks for Object DetectionPoster102 citations
- GameFormer: Game-theoretic Modeling and Learning of Transformer-based Interactive Prediction and Planning for Autonomous DrivingOral101 citations
- CroCo v2: Improved Cross-view Completion Pre-training for Stereo Matching and Optical FlowPoster100 citations
- Preventing Zero-Shot Transfer Degradation in Continual Learning of Vision-Language ModelsPoster100 citations
- TF-ICON: Diffusion-Based Training-Free Cross-Domain Image CompositionPoster99 citations
- TexFusion: Synthesizing 3D Textures with Text-Guided Image Diffusion ModelsOral99 citations
- A Latent Space of Stochastic Diffusion Models for Zero-Shot Image Editing and GuidancePoster98 citations
- EgoVLPv2: Egocentric Video-Language Pre-training with Fusion in the BackbonePoster98 citations
- Editing Implicit Assumptions in Text-to-Image Diffusion ModelsPoster97 citations
- FB-BEV: BEV Representation from Forward-Backward View TransformationsPoster97 citations
- CRN: Camera Radar Net for Accurate, Robust, Efficient 3D PerceptionPoster96 citations
- Improving Sample Quality of Diffusion Models Using Self-Attention GuidancePoster96 citations
- Robust Object Modeling for Visual TrackingPoster96 citations
- Viewset Diffusion: (0-)Image-Conditioned 3D Generative Models from 2D DataPoster96 citations
- Diffusion Action SegmentationPoster95 citations
- Less is More: Focus Attention for Efficient DETRPoster94 citations
- Parametric Classification for Generalized Category Discovery: A Baseline StudyPoster94 citations
- Diverse Data Augmentation with Diffusions for Effective Test-time Prompt TuningPoster93 citations
- Teaching CLIP to Count to TenPoster93 citations
- DREAM: Efficient Dataset Distillation by Representative MatchingPoster91 citations
- HumanSD: A Native Skeleton-Guided Diffusion Model for Human Image GenerationOral90 citations
- E^2VPT: An Effective and Efficient Approach for Visual Prompt TuningPoster89 citations
- Not All Features Matter: Enhancing Few-shot CLIP with Adaptive Prior RefinementPoster89 citations
- Towards Geospatial Foundation Models via Continual PretrainingPoster89 citations
- DOLCE: A Model-Based Probabilistic Diffusion Framework for Limited-Angle CT ReconstructionPoster88 citations
- UniDexGrasp++: Improving Dexterous Grasping Policy Learning via Geometry-Aware Curriculum and Iterative Generalist-Specialist LearningOral88 citations
- EigenPlaces: Training Viewpoint Robust Models for Visual Place RecognitionPoster87 citations
- HiTeA: Hierarchical Temporal-Aware Video-Language Pre-trainingPoster87 citations
- MeMOTR: Long-Term Memory-Augmented Transformer for Multi-Object TrackingPoster87 citations
- Expressive Text-to-Image Generation with Rich TextPoster86 citations
- Waffling Around for Performance: Visual Classification with Random Words and Broad ConceptsPoster86 citations
- PNI : Industrial Anomaly Detection using Position and Neighborhood InformationPoster85 citations
- Perpetual Humanoid Control for Real-time Simulated AvatarsPoster85 citations
- Score-Based Diffusion Models as Principled Priors for Inverse ImagingPoster85 citations
- Efficient Region-Aware Neural Radiance Fields for High-Fidelity Talking Portrait SynthesisPoster84 citations
- PivotNet: Vectorized Pivot Learning for End-to-end HD Map ConstructionPoster84 citations
- PoseDiffusion: Solving Pose Estimation via Diffusion-aided Bundle AdjustmentPoster83 citations
- ATT3D: Amortized Text-to-3D Object SynthesisPoster82 citations
- Deep Multiview Clustering by Contrasting Cluster AssignmentsPoster82 citations
- HumanMAC: Masked Motion Completion for Human Motion PredictionPoster82 citations
- NeuRBF: A Neural Fields Representation with Adaptive Radial Basis FunctionsOral82 citations
- SHERF: Generalizable Human NeRF from a Single ImagePoster82 citations
- Towards Zero-Shot Scale-Aware Monocular Depth EstimationPoster82 citations
- Verbs in Action: Improving Verb Understanding in Video-Language ModelsPoster82 citations
- AvatarCraft: Transforming Text into Neural Human Avatars with Parameterized Shape and Pose ControlPoster81 citations
- Efficient 3D Semantic Segmentation with Superpoint TransformerPoster81 citations
- GRAM-HD: 3D-Consistent Image Generation at High Resolution with Generative Radiance ManifoldsPoster81 citations
- Learning Concise and Descriptive Attributes for Visual RecognitionPoster81 citations
- Zenseact Open Dataset: A Large-Scale and Diverse Multimodal Dataset for Autonomous DrivingPoster81 citations
- DiffPose: Multi-hypothesis Human Pose Estimation using Diffusion ModelsOral80 citations
- GLA-GCN: Global-local Adaptive Graph Convolutional Network for 3D Human Pose Estimation from Monocular VideoPoster80 citations
- Scaling Data Generation in Vision-and-Language NavigationOral80 citations
- Vox-E: Text-Guided Voxel Editing of 3D ObjectsPoster80 citations
- Feature Modulation Transformer: Cross-Refinement of Global Representation via High-Frequency Prior for Image Super-ResolutionPoster79 citations
- FocalFormer3D: Focusing on Hard Instance for 3D Object DetectionPoster79 citations
- MatrixCity: A Large-scale City Dataset for City-scale Neural Rendering and BeyondPoster78 citations
- Multi3DRefer: Grounding Text Description to Multiple 3D ObjectsPoster78 citations
- No Fear of Classifier Biases: Neural Collapse Inspired Federated Learning with Synthetic and Fixed ClassifierPoster78 citations
- TMR: Text-to-Motion Retrieval Using Contrastive 3D Human Motion SynthesisPoster78 citations
- Trajectory Unified Transformer for Pedestrian Trajectory PredictionPoster78 citations
- UniTR: A Unified and Efficient Multi-Modal Transformer for Bird's-Eye-View RepresentationPoster78 citations
- Forecast-MAE: Self-supervised Pre-training for Motion Forecasting with Masked AutoencodersPoster77 citations
- Multiscale Structure Guided Diffusion for Image DeblurringPoster77 citations
- Part-Aware Transformer for Generalizable Person Re-identificationPoster77 citations
- SparseFusion: Fusing Multi-Modal Sparse Representations for Multi-Sensor 3D Object DetectionPoster77 citations
- Unsupervised Surface Anomaly Detection with Diffusion Probabilistic ModelPoster77 citations
- Hidden Biases of End-to-End Driving ModelsPoster76 citations
- Diffusion Model as Representation LearnerPoster75 citations
- Multimodal Garment Designer: Human-Centric Latent Diffusion Models for Fashion Image EditingPoster75 citations
- NeRF-LOAM: Neural Implicit Representation for Large-Scale Incremental LiDAR Odometry and MappingPoster75 citations
- Structure Invariant Transformation for better Adversarial TransferabilityPoster75 citations
- SwinLSTM: Improving Spatiotemporal Prediction Accuracy using Swin Transformer and LSTMPoster75 citations
- ActFormer: A GAN-based Transformer towards General Action-Conditioned 3D Human Motion GenerationPoster74 citations
- GlueStick: Robust Image Matching by Sticking Points and Lines TogetherPoster74 citations
- Bridging Vision and Language Encoders: Parameter-Efficient Tuning for Referring Image SegmentationPoster73 citations
- DiffFit: Unlocking Transferability of Large Diffusion Models via Simple Parameter-efficient Fine-TuningOral73 citations
- HRS-Bench: Holistic, Reliable and Scalable Benchmark for Text-to-Image ModelsPoster73 citations
- IDiff-Face: Synthetic-based Face Recognition through Fizzy Identity-Conditioned Diffusion ModelPoster73 citations
- SKED: Sketch-guided Text-based 3D EditingPoster73 citations
- Denoising Diffusion Autoencoders are Unified Self-supervised LearnersOral72 citations
- DiffusionRet: Generative Text-Video Retrieval with Diffusion ModelPoster72 citations
- Mixed Neural Voxels for Fast Multi-view Video SynthesisOral72 citations
- Small Object Detection via Coarse-to-fine Proposal Generation and Imitation LearningPoster72 citations
- AttT2M: Text-Driven Human Motion Generation with Multi-Perspective Attention MechanismPoster71 citations
- Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional ImagesPoster71 citations
- End-to-End Diffusion Latent Optimization Improves Classifier GuidancePoster71 citations
- Multiple Instance Learning Framework with Masked Hard Instance Mining for Whole Slide Image ClassificationOral71 citations
- PADCLIP: Pseudo-labeling with Adaptive Debiasing in CLIP for Unsupervised Domain AdaptationPoster71 citations
- Sample4Geo: Hard Negative Sampling For Cross-View Geo-LocalisationPoster71 citations
- Exploring Lightweight Hierarchical Vision Transformers for Efficient Visual TrackingPoster70 citations
- Source-free Depth for Object Pop-outPoster70 citations
- Zero-Shot Contrastive Loss for Text-Guided Diffusion Image Style TransferPoster70 citations
- Zero-Shot Spatial Layout Conditioning for Text-to-Image Diffusion ModelsPoster70 citations
- Adaptive Frequency Filters As Efficient Global Token MixersPoster69 citations
- ESSAformer: Efficient Transformer for Hyperspectral Image Super-resolutionPoster69 citations
- Learning Non-Local Spatial-Angular Correlation for Light Field Image Super-ResolutionPoster69 citations
- Learning Semi-supervised Gaussian Mixture Models for Generalized Category DiscoveryPoster69 citations
- TM2D: Bimodality Driven 3D Dance Generation via Music-Text IntegrationPoster69 citations
- Unleashing Vanilla Vision Transformer with Masked Image Modeling for Object DetectionPoster69 citations
- ADAPT: Efficient Multi-Agent Trajectory Prediction with AdaptationPoster68 citations
- CASSPR: Cross Attention Single Scan Place RecognitionPoster68 citations
- Normalizing Flows for Human Pose Anomaly DetectionPoster68 citations
- Prompt Tuning Inversion for Text-driven Image Editing Using Diffusion ModelsPoster68 citations
- Spatio-Temporal Domain Awareness for Multi-Agent Collaborative PerceptionPoster68 citations
- TALL: Thumbnail Layout for Deepfake Video DetectionPoster68 citations
- The Effectiveness of MAE Pre-Pretraining for Billion-Scale PretrainingPoster68 citations
- Document Understanding Dataset and Evaluation (DUDE)Poster67 citations
- Masked Spiking TransformerPoster67 citations
- Towards Memory- and Time-Efficient Backpropagation for Training Spiking Neural NetworksPoster67 citations
- Enhancing Fine-Tuning Based Backdoor Defense with Sharpness-Aware MinimizationPoster66 citations
- ITI-GEN: Inclusive Text-to-Image GenerationOral66 citations
- Robust Evaluation of Diffusion-Based Adversarial PurificationOral66 citations
- SiLK: Simple Learned KeypointsPoster66 citations
- StegaNeRF: Embedding Invisible Information within Neural Radiance FieldsPoster66 citations
- Synthesizing Diverse Human Motions in 3D Indoor ScenesPoster66 citations
- Cross-Modal Translation and Alignment for Survival AnalysisPoster65 citations
- Dataset QuantizationPoster65 citations
- ExposureDiffusion: Learning to Expose for Low-light Image EnhancementPoster65 citations
- Generative Action Description Prompts for Skeleton-based Action RecognitionPoster65 citations
- Implicit Autoencoder for Point-Cloud Self-Supervised Representation LearningPoster65 citations
- Multimodal Optimal Transport-based Co-Attention Transformer with Global Structure Consistency for Survival PredictionPoster65 citations
- Open-domain Visual Entity Recognition: Towards Recognizing Millions of Wikipedia EntitiesOral65 citations
- Set-level Guidance Attack: Boosting Adversarial Transferability of Vision-Language Pre-training ModelsOral65 citations
- TinyCLIP: CLIP Distillation via Affinity Mimicking and Weight InheritancePoster65 citations
- DDColor: Towards Photo-Realistic Image Colorization via Dual DecodersPoster64 citations
- DataDAM: Efficient Dataset Distillation with Attention MatchingPoster64 citations
- GPFL: Simultaneously Learning Global and Personalized Feature Information for Personalized Federated LearningPoster64 citations
- Knowing Where to Focus: Event-aware Transformer for Video GroundingPoster64 citations
- Read-only Prompt Optimization for Vision-Language Few-shot LearningPoster64 citations
- UATVR: Uncertainty-Adaptive Text-Video RetrievalPoster64 citations
- V3Det: Vast Vocabulary Visual Detection DatasetOral64 citations
- ViewRefer: Grasp the Multi-view Knowledge for 3D Visual GroundingPoster64 citations
- HM-ViT: Hetero-Modal Vehicle-to-Vehicle Cooperative Perception with Vision TransformerPoster63 citations
- NDDepth: Normal-Distance Assisted Monocular Depth EstimationOral63 citations
- Online Prototype Learning for Online Continual LearningPoster63 citations
- PRIOR: Prototype Representation Joint Learning from Medical Images and ReportsPoster63 citations
- Sensitivity-Aware Visual Parameter-Efficient Fine-TuningOral63 citations
- AdvDiffuser: Natural Adversarial Example Synthesis with Diffusion ModelsPoster62 citations
- DLGSANet: Lightweight Dynamic Local and Global Self-Attention Networks for Image Super-ResolutionPoster62 citations
- Gloss-Free Sign Language Translation: Improving from Visual-Language PretrainingPoster62 citations
- PODA: Prompt-driven Zero-shot Domain AdaptationPoster62 citations
- Ref-NeuS: Ambiguity-Reduced Neural Implicit Surface Learning for Multi-View Reconstruction with ReflectionOral62 citations
- TARGET: Federated Class-Continual Learning via Exemplar-Free DistillationPoster62 citations
- DNA-Rendering: A Diverse Neural Actor Repository for High-Fidelity Human-Centric RenderingPoster61 citations
- Nerfbusters: Removing Ghostly Artifacts from Casually Captured NeRFsPoster61 citations
- Neural LiDAR Fields for Novel View SynthesisPoster61 citations
- PromptStyler: Prompt-driven Style Generation for Source-free Domain GeneralizationPoster61 citations
- UnLoc: A Unified Framework for Video Localization TasksPoster61 citations
- AG3D: Learning to Generate 3D Avatars from 2D Image CollectionsPoster60 citations
- Efficient Emotional Adaptation for Audio-Driven Talking-Head GenerationPoster60 citations
- Imitator: Personalized Speech-driven 3D Facial AnimationPoster60 citations
- LVOS: A Benchmark for Long-term Video Object SegmentationPoster60 citations
- Open-vocabulary Object Segmentation with Diffusion ModelsPoster60 citations
- Parallax-Tolerant Unsupervised Deep Image StitchingPoster60 citations
- Robust Monocular Depth Estimation under Challenging Conditions60 citations
- UniT3D: A Unified Transformer for 3D Dense Captioning and Visual GroundingPoster60 citations
- 3D-aware Image Generation using 2D Diffusion ModelsPoster59 citations
- DVIS: Decoupled Video Instance Segmentation FrameworkPoster59 citations
- Diffusion Models as Masked AutoencodersPoster59 citations
- DriveAdapter: Breaking the Coupling Barrier of Perception and Planning in End-to-End Autonomous DrivingOral59 citations
- Full-Body Articulated Human-Object InteractionPoster59 citations
- GridMM: Grid Memory Map for Vision-and-Language NavigationPoster59 citations
- PromptCap: Prompt-Guided Image Captioning for VQA with GPT-3Poster59 citations
- SkeletonMAE: Graph-based Masked Autoencoder for Skeleton Sequence Pre-trainingPoster59 citations
- CleanCLIP: Mitigating Data Poisoning Attacks in Multimodal Contrastive LearningOral58 citations
- FastRecon: Few-shot Industrial Anomaly Detection via Fast Feature ReconstructionPoster58 citations
- Feature Prediction Diffusion Model for Video Anomaly DetectionPoster58 citations
- FineDance: A Fine-grained Choreography Dataset for 3D Full Body Dance GenerationPoster58 citations
- IntrinsicNeRF: Learning Intrinsic Neural Radiance Fields for Editable Novel View SynthesisPoster58 citations
- Modality Unifying Network for Visible-Infrared Person Re-IdentificationPoster58 citations
- Point-Query Quadtree for Crowd Counting, Localization, and MorePoster58 citations
- RegFormer: An Efficient Projection-Aware Transformer Network for Large-Scale Point Cloud RegistrationPoster58 citations
- UniFormerV2: Unlocking the Potential of Image ViTs for Video UnderstandingPoster58 citations
- Unified Coarse-to-Fine Alignment for Video-Text RetrievalPoster58 citations
- Audiovisual Masked AutoencodersPoster57 citations
- Bird's-Eye-View Scene Graph for Vision-Language NavigationPoster57 citations
- CauSSL: Causality-inspired Semi-supervised Learning for Medical Image SegmentationPoster57 citations
- FLIP: Cross-domain Face Anti-spoofing with Language GuidancePoster57 citations
- InfiniCity: Infinite-Scale City SynthesisPoster57 citations
- Revisiting Scene Text Recognition: A Data PerspectivePoster57 citations
- Text2Performer: Text-Driven Human Video GenerationPoster57 citations
- Traj-MAE: Masked Autoencoders for Trajectory PredictionPoster57 citations
- XNet: Wavelet-Based Low and High Frequency Fusion Networks for Fully- and Semi-Supervised Semantic Segmentation of Biomedical ImagesPoster57 citations
- CLIPascene: Scene Sketching with Different Types and Levels of AbstractionOral56 citations
- DiffRate : Differentiable Compression Rate for Efficient Vision TransformersPoster56 citations
- First Session Adaptation: A Strong Replay-Free Baseline for Class-Incremental LearningPoster56 citations
- Introducing Language Guidance in Prompt-based Continual LearningPoster56 citations
- NeILF++: Inter-Reflectable Light Fields for Geometry and Material EstimationPoster56 citations
- Tube-Link: A Flexible Cross Tube Framework for Universal Video SegmentationPoster56 citations
- AdaMV-MoE: Adaptive Multi-Task Vision Mixture-of-ExpertsPoster55 citations
- DreamPose: Fashion Video Synthesis with Stable DiffusionPoster55 citations
- Global Knowledge Calibration for Fast Open-Vocabulary SegmentationPoster55 citations
- HoloAssist: an Egocentric Human Interaction Dataset for Interactive AI Assistants in the Real WorldPoster55 citations
- LRRU: Long-short Range Recurrent Updating Networks for Depth CompletionPoster55 citations
- OnlineRefer: A Simple Online Baseline for Referring Video Object SegmentationPoster55 citations
- Visible-Infrared Person Re-Identification via Semantic Alignment and Affinity InferencePoster55 citations
- Will Large-scale Generative Models Corrupt Future Datasets?Poster55 citations
- AIDE: A Vision-Driven Multi-View, Multi-Modal, Multi-Tasking Dataset for Assistive Driving PerceptionPoster54 citations
- ALIP: Adaptive Language-Image Pre-Training with Synthetic CaptionPoster54 citations
- Pixel Adaptive Deep Unfolding Transformer for Hyperspectral Image ReconstructionPoster54 citations
- Spectrum-guided Multi-granularity Referring Video Object SegmentationPoster54 citations
- Combating Noisy Labels with Sample Selection by Mining High-Discrepancy ExamplesPoster53 citations
- Content-Aware Local GAN for Photo-Realistic Super-ResolutionPoster53 citations
- Fg-T2M: Fine-Grained Text-Driven Human Motion Generation via Diffusion ModelPoster53 citations
- Generating Instance-level Prompts for Rehearsal-free Continual LearningOral53 citations
- High Quality Entity SegmentationOral53 citations
- Perceptual Grouping in Contrastive Vision-Language ModelsPoster53 citations
- SceneRF: Self-Supervised Monocular 3D Scene Reconstruction with Radiance FieldsPoster53 citations
- Transferable Decoding with Visual Entities for Zero-Shot Image CaptioningPoster53 citations
- UniFusion: Unified Multi-View Fusion Transformer for Spatial-Temporal Representation in Bird's-Eye-ViewPoster53 citations
- Aria Digital Twin: A New Benchmark Dataset for Egocentric 3D Machine PerceptionPoster52 citations
- EMDB: The Electromagnetic Database of Global 3D Human Pose and Shape in the WildPoster52 citations
- EmoSet: A Large-scale Visual Emotion Dataset with Rich AttributesPoster52 citations
- G2L: Semantically Aligned and Uniform Video Grounding via Geodesic and Game TheoryOral52 citations
- ICL-D3IE: In-Context Learning with Diverse Demonstrations Updating for Document Information ExtractionPoster52 citations
- Priority-Centric Human Motion Generation in Discrete Latent SpacePoster52 citations
- SG-Former: Self-guided Transformer with Evolving Token ReallocationPoster52 citations
- Tetra-NeRF: Representing Neural Radiance Fields Using TetrahedraPoster52 citations
- Towards Grand Unified Representation Learning for Unsupervised Visible-Infrared Person Re-IdentificationPoster52 citations
- An Embarrassingly Simple Backdoor Attack on Self-supervised LearningPoster51 citations
- CiteTracker: Correlating Image and Text for Visual TrackingPoster51 citations
- ENVIDR: Implicit Differentiable Renderer with Neural Environment LightingOral51 citations
- GPGait: Generalized Pose-based Gait RecognitionPoster51 citations
- Going Beyond Nouns With Vision & Language Models Using Synthetic DataPoster51 citations
- NeRF-Det: Learning Geometry-Aware Volumetric Representation for Multi-View 3D Object DetectionPoster51 citations
- STEERER: Resolving Scale Variations for Counting and Localization via Selective Inheritance LearningPoster51 citations
- Self-Calibrated Cross Attention Network for Few-Shot SegmentationPoster51 citations
- TORE: Token Reduction for Efficient Human Mesh Recovery with TransformerPoster51 citations
- Exploring Predicate Visual Context in Detecting of Human-Object InteractionsPoster50 citations
- LayoutDiffusion: Improving Graphic Layout Generation by Discrete Diffusion Probabilistic ModelsPoster50 citations
- MAtch, eXpand and Improve: Unsupervised Finetuning for Zero-Shot Action Recognition with Language KnowledgePoster50 citations
- Multimodal Motion Conditioned Diffusion Model for Skeleton-based Video Anomaly DetectionPoster50 citations
- Object as Query: Lifting Any 2D Object Detector to 3D DetectionPoster50 citations
- One-Shot Generative Domain AdaptationPoster50 citations
- Sparse Sampling Transformer with Uncertainty-Driven Ranking for Unified Removal of Raindrops and Rain StreaksPoster50 citations
- When Prompt-based Incremental Learning Does Not Meet Strong PretrainingPoster50 citations
- Frequency Guidance Matters in Few-Shot LearningPoster49 citations
- High-Resolution Document Shadow Removal via A Large-Scale Real-World Dataset and A Frequency-Aware Shadow Erasing NetPoster49 citations
- IntentQA: Context-aware Video Intent ReasoningOral49 citations
- Membrane Potential Batch Normalization for Spiking Neural NetworksPoster49 citations
- Online Clustered CodebookPoster49 citations
- SALAD: Part-Level Latent Diffusion for 3D Shape Generation and ManipulationPoster49 citations
- All in Tokens: Unifying Output Space of Visual Tasks via Soft TokenOral48 citations
- BlendFace: Re-designing Identity Encoders for Face-SwappingPoster48 citations
- COOL-CHIC: Coordinate-based Low Complexity Hierarchical Image CodecPoster48 citations
- CORE: Cooperative Reconstruction for Multi-Agent PerceptionPoster48 citations
- DyGait: Exploiting Dynamic Representations for High-performance Gait RecognitionPoster48 citations
- Forward Flow for Novel View Synthesis of Dynamic ScenesOral48 citations
- General Image-to-Image Translation with One-Shot Image GuidancePoster48 citations
- Going Denser with Open-Vocabulary Part SegmentationPoster48 citations
- Improving 3D Imaging with Pre-Trained Perpendicular 2D Diffusion ModelsPoster48 citations
- Instance-aware Dynamic Prompt Tuning for Pre-trained Point Cloud ModelsPoster48 citations
- Open-Vocabulary Semantic Segmentation with Decoupled One-Pass NetworkPoster48 citations
- Remembering Normality: Memory-guided Knowledge Distillation for Unsupervised Anomaly DetectionPoster48 citations
- SINC: Spatial Composition of 3D Human Motions for Simultaneous Action GenerationPoster48 citations
- SynBody: Synthetic Dataset with Layered Human Models for 3D Human Perception and ModelingPoster48 citations
- Using a Waffle Iron for Automotive Point Cloud Semantic SegmentationPoster48 citations
- AREA: Adaptive Reweighting via Effective Area for Long-Tailed ClassificationPoster47 citations
- AerialVLN: Vision-and-Language Navigation for UAVsPoster47 citations
- AffordPose: A Large-Scale Dataset of Hand-Object Interactions with Affordance-Driven Hand PosePoster47 citations
- An Adaptive Model Ensemble Adversarial Attack for Boosting Adversarial TransferabilityPoster47 citations
- AutoAD II: The Sequel - Who, When, and What in Movie Audio DescriptionPoster47 citations
- Automated Knowledge Distillation via Monte Carlo Tree SearchPoster47 citations
- Black Box Few-Shot Adaptation for Vision-Language ModelsPoster47 citations
- CDUL: CLIP-Driven Unsupervised Learning for Multi-Label Image ClassificationPoster47 citations
- Diffusion-Guided Reconstruction of Everyday Hand-Object Interaction ClipsOral47 citations
- Distribution-Consistent Modal Recovering for Incomplete Multimodal LearningPoster47 citations
- EdaDet: Open-Vocabulary Object Detection Using Early Dense AlignmentPoster47 citations
- Global Features are All You Need for Image Retrieval and RerankingPoster47 citations
- HSR-Diff: Hyperspectral Image Super-Resolution via Conditional Diffusion ModelsPoster47 citations
- MatrixVT: Efficient Multi-Camera to BEV Transformation for 3D PerceptionPoster47 citations
- Multi-Modal Gated Mixture of Local-to-Global Experts for Dynamic Image FusionPoster47 citations
- NeO 360: Neural Fields for Sparse View Synthesis of Outdoor ScenesPoster47 citations
- Neural Video Depth StabilizerPoster47 citations
- RLIPv2: Fast Scaling of Relational Language-Image Pre-TrainingPoster47 citations
- SPACE: Speech-driven Portrait Animation with Controllable ExpressionPoster47 citations
- Self-supervised Monocular Depth Estimation: Let's Talk About The WeatherPoster47 citations
- BEVPlace: Learning LiDAR-based Place Recognition using Bird's Eye View ImagesPoster46 citations
- Beyond One-to-One: Rethinking the Referring Image SegmentationOral46 citations
- CTVIS: Consistent Training for Online Video Instance SegmentationPoster46 citations
- Detection Transformer with Stable MatchingPoster46 citations
- E2NeRF: Event Enhanced Neural Radiance Fields from Blurry ImagesPoster46 citations
- Efficient Model Personalization in Federated Learning via Client-Specific Prompt GenerationPoster46 citations
- Empowering Low-Light Image Enhancer through Customized Learnable PriorsPoster46 citations
- FACET: Fairness in Computer Vision Evaluation BenchmarkPoster46 citations
- FPR: False Positive Rectification for Weakly Supervised Semantic SegmentationPoster46 citations
- FeatureNeRF: Learning Generalizable NeRFs by Distilling Foundation ModelsPoster46 citations
- GET: Group Event Transformer for Event-Based VisionPoster46 citations
- Generalized Differentiable RANSACPoster46 citations
- LogicSeg: Parsing Visual Semantics with Neural Logic Learning and ReasoningOral46 citations
- Masked Motion Predictors are Strong 3D Action Representation LearnersPoster46 citations
- Nearest Neighbor Guidance for Out-of-Distribution DetectionPoster46 citations
- Progressive Spatio-Temporal Prototype Matching for Text-Video RetrievalOral46 citations
- Rickrolling the Artist: Injecting Backdoors into Text Encoders for Text-to-Image SynthesisPoster46 citations
- UniSeg: A Unified Multi-Modal LiDAR Segmentation Network and the OpenPCSeg CodebasePoster46 citations
- Adaptive Testing of Computer Vision ModelsOral45 citations
- DomainDrop: Suppressing Domain-Sensitive Channels for Domain GeneralizationPoster45 citations
- GraphAlign: Enhancing Accurate Feature Alignment by Graph matching for Multi-Modal 3D Object DetectionPoster45 citations
- Harnessing the Spatial-Temporal Attention of Diffusion Models for High-Fidelity Text-to-Image SynthesisPoster45 citations
- Implicit Identity Representation Conditioned Memory Compensation Network for Talking Head video GenerationPoster45 citations
- Implicit Temporal Modeling with Learnable Alignment for Video RecognitionOral45 citations
- MMST-ViT: Climate Change-aware Crop Yield Prediction via Multi-Modal Spatial-Temporal Vision TransformerPoster45 citations
- RbA: Segmenting Unknown Regions Rejected by AllPoster45 citations
- Residual Pattern Learning for Pixel-Wise Out-of-Distribution Detection in Semantic SegmentationPoster45 citations
- Texture Generation on 3D Meshes with Point-UV DiffusionOral45 citations
- Unified Pre-Training with Pseudo Texts for Text-To-Image Person Re-IdentificationPoster45 citations
- Unmasking Anomalies in Road-Scene SegmentationOral45 citations
- A-STAR: Test-time Attention Segregation and Retention for Text-to-image SynthesisPoster44 citations
- Anomaly Detection Under Distribution ShiftPoster44 citations
- BiViT: Extremely Compressed Binary Vision TransformersPoster44 citations
- CC3D: Layout-Conditioned Generation of Compositional 3D ScenesPoster44 citations
- Compositional Feature Augmentation for Unbiased Scene Graph GenerationPoster44 citations
- DDS2M: Self-Supervised Denoising Diffusion Spatio-Spectral Model for Hyperspectral Image RestorationPoster44 citations
- DeepChange: A Long-Term Person Re-Identification Benchmark with Clothes ChangePoster44 citations
- Effective Real Image Editing with Accelerated Iterative Diffusion InversionOral44 citations
- IST-Net: Prior-Free Category-Level Pose Estimation with Implicit Space TransformationPoster44 citations
- Make-An-Animation: Large-Scale Text-conditional 3D Human Motion GenerationPoster44 citations
- Ponder: Point Cloud Pre-training via Neural RenderingPoster44 citations
- SVDFormer: Complementing Point Cloud via Self-view Augmentation and Self-structure Dual-generatorPoster44 citations
- Urban Radiance Field Representation with Deformable Neural Mesh PrimitivesPoster44 citations
- CopyRNeRF: Protecting the CopyRight of Neural Radiance FieldsPoster43 citations
- DiffPose: SpatioTemporal Diffusion Model for Video-Based Human Pose EstimationPoster43 citations
- DiffTAD: Temporal Action Detection with Proposal Denoising DiffusionPoster43 citations
- From Chaos Comes Order: Ordering Event Representations for Object Recognition and DetectionPoster43 citations
- HyperReenact: One-Shot Reenactment via Jointly Learning to Refine and Retarget FacesPoster43 citations
- Hyperbolic Chamfer Distance for Point Cloud CompletionPoster43 citations
- I Can't Believe There's No Images! Learning Visual Tasks Using only Language SupervisionPoster43 citations
- MasQCLIP for Open-Vocabulary Universal Image SegmentationPoster43 citations
- Memory-and-Anticipation Transformer for Online Action UnderstandingPoster43 citations
- MetaBEV: Solving Sensor Failures for 3D Detection and Map SegmentationPoster43 citations
- MonoNeRF: Learning a Generalizable Dynamic Radiance Field from Monocular VideosPoster43 citations
- PG-RCNN: Semantic Surface Point Generation for 3D Object DetectionPoster43 citations
- Towards Unsupervised Domain Generalization for Face Anti-SpoofingPoster43 citations
- 3D-Aware Neural Body Fitting for Occlusion Robust 3D Human Pose EstimationPoster42 citations
- A Low-Shot Object Counting Network With Iterative Prototype AdaptationPoster42 citations
- AesPA-Net: Aesthetic Pattern-Aware Style Transfer NetworksPoster42 citations
- Bayesian Prompt Learning for Image-Language Model GeneralizationPoster42 citations
- Deep Fusion Transformer Network with Weighted Vector-Wise Keypoints Voting for Robust 6D Object Pose EstimationPoster42 citations
- Dual Pseudo-Labels Interactive Self-Training for Semi-Supervised Visible-Infrared Person Re-IdentificationPoster42 citations
- FS-DETR: Few-Shot DEtection TRansformer with Prompting and without Re-TrainingPoster42 citations
- Graph Matching with Bi-level Noisy CorrespondencePoster42 citations
- Instance Neural Radiance FieldPoster42 citations
- LATR: 3D Lane Detection from Monocular Images with TransformerOral42 citations
- Logic-induced Diagnostic Reasoning for Semi-supervised Semantic SegmentationPoster42 citations
- Make Encoder Great Again in 3D GAN Inversion through Geometry and Occlusion-Aware EncodingPoster42 citations
- Monte Carlo Linear Clustering with Single-Point Supervision is Enough for Infrared Small Target DetectionPoster42 citations
- Multimodal Variational Auto-encoder based Audio-Visual SegmentationPoster42 citations
- Prototype Reminiscence and Augmented Asymmetric Knowledge Aggregation for Non-Exemplar Class-Incremental LearningPoster42 citations
- Reference-guided Controllable Inpainting of Neural Radiance FieldsPoster42 citations
- Unify, Align and Refine: Multi-Level Semantic Alignment for Radiology Report GenerationPoster42 citations
- VQA-GNN: Reasoning with Multimodal Knowledge via Graph Neural Networks for Visual Question AnsweringPoster42 citations
- Vision HGNN: An Image is More than a Graph of NodesOral42 citations
- Adverse Weather Removal with Codebook PriorsPoster41 citations
- AutoReP: Automatic ReLU Replacement for Fast Private Network InferencePoster41 citations
- Auxiliary Tasks Benefit 3D Skeleton-based Human Motion PredictionPoster41 citations
- Diffusion in StylePoster41 citations
- Enhanced Soft Label for Semi-Supervised Semantic SegmentationPoster41 citations
- Group Pose: A Simple Baseline for End-to-End Multi-Person Pose EstimationPoster41 citations
- Multi-Scale Residual Low-Pass Filter Network for Image DeblurringPoster41 citations
- Navigating to Objects Specified by ImagesPoster41 citations
- One-shot Implicit Animatable Avatars with Model-based PriorsPoster41 citations
- Talking Head Generation with Probabilistic Audio-to-Visual Diffusion PriorsPoster41 citations
- Transferable Adversarial Attack for Both Vision Transformers and Convolutional Networks via Momentum Integrated GradientsPoster41 citations
- X-Mesh: Towards Fast and Accurate Text-driven 3D Stylization via Dynamic Textual GuidancePoster41 citations
- All-to-Key Attention for Arbitrary Style TransferPoster40 citations
- Audio-Visual Class-Incremental LearningPoster40 citations
- Boosting Adversarial Transferability via Gradient Relevance AttackPoster40 citations
- Camera-Driven Representation Learning for Unsupervised Domain Adaptive Person Re-identificationPoster40 citations
- CuNeRF: Cube-Based Neural Radiance Field for Zero-Shot Medical Image Arbitrary-Scale Super ResolutionPoster40 citations
- Fast Neural Scene FlowPoster40 citations
- GIFD: A Generative Gradient Inversion Method with Feature Domain OptimizationPoster40 citations
- HoloFusion: Towards Photo-realistic 3D Generative ModelingPoster40 citations
- Prompt Switch: Efficient CLIP Adaptation for Text-Video RetrievalPoster40 citations
- SATR: Zero-Shot Semantic Segmentation of 3D ShapesPoster40 citations
- UMC: A Unified Bandwidth-efficient and Multi-resolution based Collaborative Perception FrameworkPoster40 citations
- Cascade-DETR: Delving into High-Quality Universal Object DetectionPoster39 citations
- DETRDistill: A Universal Knowledge Distillation Framework for DETR-familiesPoster39 citations
- Discrepant and Multi-Instance Proxies for Unsupervised Person Re-IdentificationPoster39 citations
- Does Physical Adversarial Example Really Matter to Autonomous Driving? Towards System-Level Effect of Adversarial Object Evasion AttackPoster39 citations
- EMMN: Emotional Motion Memory Network for Audio-driven Emotional Talking Face GenerationPoster39 citations
- EMQ: Evolving Training-free Proxies for Automated Mixed Precision QuantizationPoster39 citations
- EfficientTrain: Exploring Generalized Curriculum Learning for Training Visual BackbonesPoster39 citations
- Ego-Humans: An Ego-Centric 3D Multi-Human BenchmarkOral39 citations
- Event Camera Data Pre-trainingPoster39 citations
- FRAug: Tackling Federated Learning with Non-IID Features via Representation AugmentationPoster39 citations
- FlipNeRF: Flipped Reflection Rays for Few-shot Novel View SynthesisPoster39 citations
- How Much Temporal Long-Term Context is Needed for Action Segmentation?Poster39 citations
- Inspecting the Geographical Representativeness of Images from Text-to-Image ModelsPoster39 citations
- Latent-OFER: Detect, Mask, and Reconstruct with Latent Vectors for Occluded Facial Expression RecognitionPoster39 citations
- Learning Clothing and Pose Invariant 3D Shape Representation for Long-Term Person Re-IdentificationPoster39 citations
- Locomotion-Action-Manipulation: Synthesizing Human-Scene Interactions in Complex 3D EnvironmentsPoster39 citations
- Long-Term Photometric Consistent Novel View Synthesis with Diffusion ModelsPoster39 citations
- MGMAE: Motion Guided Masking for Video Masked AutoencodingPoster39 citations
- March in Chat: Interactive Prompting for Remote Embodied Referring ExpressionPoster39 citations
- ObjectSDF++: Improved Object-Compositional Neural Implicit SurfacesPoster39 citations
- Robust e-NeRF: NeRF from Sparse & Noisy Events under Non-Uniform MotionPoster39 citations
- Scratching Visual Transformer's Back with Uniform AttentionPoster39 citations
- Towards Unifying Medical Vision-and-Language Pre-Training via Soft PromptsPoster39 citations
- Zolly: Zoom Focal Length Correctly for Perspective-Distorted Human Mesh ReconstructionOral39 citations
- A Sentence Speaks a Thousand Images: Domain Generalization through Distilling CLIP with Language GuidancePoster38 citations
- Adaptive and Background-Aware Vision Transformer for Real-Time UAV TrackingPoster38 citations
- CMDA: Cross-Modality Domain Adaptation for Nighttime Semantic SegmentationPoster38 citations
- Continuously Masked Transformer for Image InpaintingPoster38 citations
- DREAMWALKER: Mental Planning for Continuous Vision-Language NavigationPoster38 citations
- DiffDreamer: Towards Consistent Unsupervised Single-view Scene Extrapolation with Conditional Diffusion ModelsPoster38 citations
- Diverse Inpainting and Editing with GAN InversionPoster38 citations
- Encyclopedic VQA: Visual Questions About Detailed Properties of Fine-Grained CategoriesPoster38 citations
- Foreground-Background Distribution Modeling Transformer for Visual Object TrackingPoster38 citations
- LD-ZNet: A Latent Diffusion Approach for Text-Based Image SegmentationOral38 citations
- ObjectFusion: Multi-modal 3D Object Detection with Object-Centric FusionPoster38 citations
- Practical Membership Inference Attacks Against Large-Scale Multi-Modal Models: A Pilot StudyPoster38 citations
- Pre-Training-Free Image Manipulation Localization through Non-Mutually Exclusive Contrastive LearningPoster38 citations
- The Power of Sound (TPoS): Audio Reactive Video Generation with Stable DiffusionPoster38 citations
- Video Background Music Generation: Dataset, Method and EvaluationPoster38 citations
- Vision Grid Transformer for Document Layout AnalysisPoster38 citations
- Accurate and Fast Compressed Video CaptioningPoster37 citations
- Boosting Few-shot Action Recognition with Graph-guided Hybrid MatchingPoster37 citations
- ESTextSpotter: Towards Better Scene Text Spotting with Explicit Synergy in TransformerPoster37 citations
- EigenTrajectory: Low-Rank Descriptors for Multi-Modal Trajectory ForecastingPoster37 citations
- Fast Inference and Update of Probabilistic Density Estimation on Trajectory PredictionPoster37 citations
- Generative Prompt Model for Weakly Supervised Object LocalizationPoster37 citations
- Improving Continuous Sign Language Recognition with Cross-Lingual SignsPoster37 citations
- Knowledge-Aware Prompt Tuning for Generalizable Vision-Language ModelsPoster37 citations
- Learning Concordant Attention via Target-aware Alignment for Visible-Infrared Person Re-identificationPoster37 citations
- Lighting up NeRF via Unsupervised Decomposition and EnhancementPoster37 citations
- Low-Light Image Enhancement with Illumination-Aware Gamma Correction and Complete Image Modelling NetworkPoster37 citations
- MixPath: A Unified Approach for One-shot Neural Architecture SearchPoster37 citations
- S3IM: Stochastic Structural SIMilarity and Its Unreasonable Effectiveness for Neural FieldsPoster37 citations
- SAFE: Sensitivity-Aware Features for Out-of-Distribution Object DetectionPoster37 citations
- Temporal Enhanced Training of Multi-view 3D Object Detector via Historical Object PredictionPoster37 citations
- A Good Student is Cooperative and Reliable: CNN-Transformer Collaborative Learning for Semantic SegmentationPoster36 citations
- Betrayed by Captions: Joint Caption Grounding and Generation for Open Vocabulary Instance SegmentationPoster36 citations
- Cross-Modal Orthogonal High-Rank Augmentation for RGB-Event Transformer-TrackersPoster36 citations
- DistillBEV: Boosting Multi-Camera 3D Object Detection with Cross-Modal Knowledge DistillationPoster36 citations
- Distilling Large Vision-Language Model with Out-of-Distribution GeneralizabilityPoster36 citations
- Dynamic Perceiver for Efficient Visual RecognitionPoster36 citations
- Gender Artifacts in Visual DatasetsPoster36 citations
- Integrally Migrating Pre-trained Transformer Encoder-decoders for Visual Object DetectionPoster36 citations
- Overwriting Pretrained Bias with Finetuning DataOral36 citations
- PARIS: Part-level Reconstruction and Motion Analysis for Articulated ObjectsPoster36 citations
- Real-Time Neural Rasterization for Large ScenesPoster36 citations
- Removing Anomalies as Noises for Industrial Defect LocalizationPoster36 citations
- SKiT: a Fast Key Information Video Transformer for Online Surgical Phase RecognitionPoster36 citations
- Self-supervised Cross-view Representation Reconstruction for Change CaptioningPoster36 citations
- TaskExpert: Dynamically Assembling Multi-Task Representations with Memorial Mixture-of-ExpertsPoster36 citations
- Towards Open-Vocabulary Video Instance SegmentationOral36 citations
- USAGE: A Unified Seed Area Generation Paradigm for Weakly Supervised Semantic SegmentationPoster36 citations
- Video Anomaly Detection via Sequentially Learning Multiple Pretext TasksPoster36 citations
- 3DMOTFormer: Graph Transformer for Online 3D Multi-Object TrackingPoster35 citations
- Boosting 3-DoF Ground-to-Satellite Camera Localization Accuracy via Geometry-Guided Cross-View TransformerPoster35 citations
- Clustering based Point Cloud Representation Learning for 3D AnalysisPoster35 citations
- Cross-Modal Learning with 3D Deformable Attention for Action RecognitionPoster35 citations
- DetZero: Rethinking Offboard 3D Object Detection with Long-term Sequential Point CloudsPoster35 citations
- DiFaReli: Diffusion Face RelightingPoster35 citations
- DomainAdaptor: A Novel Approach to Test-time AdaptationPoster35 citations
- FeatEnHancer: Enhancing Hierarchical Features for Object Detection and Beyond Under Low-Light VisionPoster35 citations
- ICICLE: Interpretable Class Incremental Continual LearningPoster35 citations
- Improving Pixel-based MIM by Reducing Wasted Modeling CapabilityPoster35 citations
- MetaGCD: Learning to Continually Learn in Generalized Category DiscoveryPoster35 citations
- MonoNeRD: NeRF-like Representations for Monocular 3D Object DetectionPoster35 citations
- RFLA: A Stealthy Reflected Light Adversarial Attack in the Physical WorldPoster35 citations
- Robust Referring Video Object Segmentation with Cyclic Structural ConsensusPoster35 citations
- SkeleTR: Towards Skeleton-based Action Recognition in the WildPoster35 citations
- Spherical Space Feature Decomposition for Guided Depth Map Super-ResolutionPoster35 citations
- Stochastic Segmentation with Conditional Categorical Diffusion ModelsPoster35 citations
- Visually-Prompted Language Model for Fine-Grained Scene Graph Generation in an Open WorldPoster35 citations
- WaterMask: Instance Segmentation for Underwater ImageryPoster35 citations
- Computationally-Efficient Neural Image Compression with Shallow DecodersPoster34 citations
- Efficient Video Prediction via Sparsely Conditioned Flow MatchingPoster34 citations
- Equivariant Similarity for Vision-Language Foundation ModelsOral34 citations
- FishNet: A Large-scale Dataset and Benchmark for Fish Recognition, Detection, and Functional Trait PredictionPoster34 citations
- Grounding 3D Object Affordance from 2D Interactions in ImagesPoster34 citations
- Hierarchical Generation of Human-Object Interactions with Diffusion Probabilistic ModelsPoster34 citations
- LU-NeRF: Scene and Pose Estimation by Synchronizing Local Unposed NeRFsPoster34 citations
- Lightweight Image Super-Resolution with Superpixel Token InteractionPoster34 citations
- MMVP: Motion-Matrix-Based Video PredictionOral34 citations
- Open-vocabulary Panoptic Segmentation with Embedding ModulationPoster34 citations
- RMP-Loss: Regularizing Membrane Potential Distribution for Spiking Neural NetworksPoster34 citations
- Referring Image Segmentation Using Text SupervisionPoster34 citations
- Revisiting the Parameter Efficiency of Adapters from the Perspective of Precision RedundancyPoster34 citations
- SA-BEV: Generating Semantic-Aware Bird's-Eye-View Feature for Multi-view 3D Object DetectionPoster34 citations
- Template-guided Hierarchical Feature Restoration for Anomaly DetectionPoster34 citations
- Temporal-Coded Spiking Neural Networks with Dynamic Firing Threshold: Learning with Event-Driven BackpropagationPoster34 citations
- TransFace: Calibrating Transformer Training for Face Recognition from a Data-Centric PerspectivePoster34 citations
- VI-Net: Boosting Category-level 6D Object Pose Estimation via Learning Decoupled Rotations on the Spherical RepresentationsPoster34 citations
- Action Sensitivity Learning for Temporal Action LocalizationPoster33 citations
- Among Us: Adversarially Robust Collaborative Perception by ConsensusPoster33 citations
- CTP:Towards Vision-Language Continual Pretraining via Compatible Momentum Contrast and Topology PreservationPoster33 citations
- DINAR: Diffusion Inpainting of Neural Textures for One-Shot Human AvatarsPoster33 citations
- Domain Generalization of 3D Semantic Segmentation in Autonomous DrivingPoster33 citations
- Evaluating Data Attribution for Text-to-Image ModelsPoster33 citations
- Exploring Open-Vocabulary Semantic Segmentation from CLIP Vision Encoder Distillation OnlyPoster33 citations
- From Sky to the Ground: A Large-scale Benchmark and Simple Baseline Towards Real Rain RemovalPoster33 citations
- Learning a More Continuous Zero Level Set in Unsigned Distance Fields through Level Set ProjectionPoster33 citations
- Linear Spaces of Meanings: Compositional Structures in Vision-Language ModelsPoster33 citations
- MI-GAN: A Simple Baseline for Image Inpainting on Mobile DevicesPoster33 citations
- Random Sub-Samples Generation for Self-Supervised Real Image DenoisingPoster33 citations
- Rethinking Fast Fourier Convolution in Image InpaintingPoster33 citations
- Robust Mixture-of-Expert Training for Convolutional Neural NetworksOral33 citations
- See More and Know More: Zero-shot Point Cloud Segmentation via Multi-modal Visual DataPoster33 citations
- SeeABLE: Soft Discrepancies and Bounded Contrastive Learning for Exposing DeepfakesPoster33 citations
- Self-Supervised Character-to-Character Distillation for Text RecognitionPoster33 citations
- TransTIC: Transferring Transformer-based Image Compression from Human Perception to Machine PerceptionPoster33 citations
- When Epipolar Constraint Meets Non-Local Operators in Multi-View StereoPoster33 citations
- XMem++: Production-level Video Segmentation From Few Annotated FramesPoster33 citations
- Augmented Box Replay: Overcoming Foreground Shift for Incremental Object DetectionPoster32 citations
- Blending-NeRF: Text-Driven Localized Editing in Neural Radiance FieldsPoster32 citations
- Bold but Cautious: Unlocking the Potential of Personalized Federated Learning through Cautiously Aggressive CollaborationPoster32 citations
- Building3D: A Urban-Scale Dataset and Benchmarks for Learning Roof Structures from Point CloudsPoster32 citations
- Class-Aware Patch Embedding Adaptation for Few-Shot Image ClassificationPoster32 citations
- ClimateNeRF: Extreme Weather Synthesis in Neural Radiance FieldPoster32 citations
- Coherent Event Guided Low-Light Video EnhancementPoster32 citations
- Context-Aware Planning and Environment-Aware Memory for Instruction Following Embodied AgentsPoster32 citations
- D-IF: Uncertainty-aware Human Digitization via Implicit Distribution FieldPoster32 citations
- Degradation-Resistant Unfolding Network for Heterogeneous Image FusionPoster32 citations
- Diffusion-based Image Translation with Label Guidance for Domain Adaptive Semantic SegmentationPoster32 citations
- Divide and Conquer: 3D Point Cloud Instance Segmentation With Point-Wise BinarizationPoster32 citations
- Dynamic Point FieldsOral32 citations
- Dynamic Residual Classifier for Class Incremental LearningPoster32 citations
- GAFlow: Incorporating Gaussian Attention into Optical FlowPoster32 citations
- GEDepth: Ground Embedding for Monocular Depth EstimationPoster32 citations
- IOMatch: Simplifying Open-Set Semi-Supervised Learning with Joint Inliers and Outliers UtilizationOral32 citations
- Improving Generalization of Adversarial Training via Robust Critical Fine-TuningPoster32 citations
- LA-Net: Landmark-Aware Learning for Reliable Facial Expression Recognition under Label NoisePoster32 citations
- Learning Correction Filter via Degradation-Adaptive Regression for Blind Single Image Super-ResolutionPoster32 citations
- MSI: Maximize Support-Set Information for Few-Shot SegmentationPoster32 citations
- Multi-Modal Neural Radiance Field for Monocular Dense SLAM with a Light-Weight ToF SensorPoster32 citations
- Multimodal Distillation for Egocentric Action RecognitionPoster32 citations
- Physics-Driven Turbulence Image Restoration with Stochastic RefinementPoster32 citations
- Query Refinement Transformer for 3D Instance SegmentationPoster32 citations
- ReFit: Recurrent Fitting Network for 3D Human RecoveryPoster32 citations
- Role-Aware Interaction Generation from Textual DescriptionOral32 citations
- SAFARI: Versatile and Efficient Evaluations for Robustness of InterpretabilityPoster32 citations
- Single Image Reflection Separation via Component SynergyPoster32 citations
- Sketch and Text Guided Diffusion Model for Colored Point Cloud GenerationPoster32 citations
- Stable Cluster Discrimination for Deep ClusteringPoster32 citations
- Subclass-balancing Contrastive Learning for Long-tailed RecognitionPoster32 citations
- Unified Adversarial Patch for Cross-Modal Attacks in the Physical WorldPoster32 citations
- Unsupervised Image Denoising in Real-World Scenarios via Self-Collaboration Parallel Generative Adversarial BranchesPoster32 citations
- Virtual Try-On with Pose-Garment Keypoints Guided InpaintingPoster32 citations
- ADNet: Lane Shape Prediction via Anchor DecompositionPoster31 citations
- Alignment-free HDR Deghosting with Semantics Consistent TransformerPoster31 citations
- Bridging Cross-task Protocol Inconsistency for Distillation in Dense Object DetectionPoster31 citations
- CPCM: Contextual Point Cloud Modeling for Weakly-supervised Point Cloud Semantic SegmentationPoster31 citations
- CROSSFIRE: Camera Relocalization On Self-Supervised Features from an Implicit RepresentationPoster31 citations
- HOSNeRF: Dynamic Human-Object-Scene Neural Radiance Fields from a Single VideoPoster31 citations
- Learning Foresightful Dense Visual Affordance for Deformable Object ManipulationPoster31 citations
- Learning Navigational Visual Representations with Semantic Map SupervisionPoster31 citations
- Learning Vision-and-Language Navigation from YouTube VideosPoster31 citations
- Mask-Attention-Free Transformer for 3D Instance SegmentationPoster31 citations
- Masked Retraining Teacher-Student Framework for Domain Adaptive Object DetectionPoster31 citations
- Multi-weather Image Restoration via Domain TranslationPoster31 citations
- PPR: Physically Plausible Reconstruction from Monocular VideosOral31 citations
- ProbVLM: Probabilistic Adapter for Frozen Vison-Language ModelsPoster31 citations
- Re-mine, Learn and Reason: Exploring the Cross-modal Semantic Correlations for Language-guided HOI detectionPoster31 citations
- Scene-Aware Label Graph Learning for Multi-Label Image ClassificationPoster31 citations
- TMA: Temporal Motion Aggregation for Event-based Optical FlowPoster31 citations
- TransIFF: An Instance-Level Feature Fusion Framework for Vehicle-Infrastructure Cooperative 3D Detection with TransformersPoster31 citations
- Unsupervised 3D Perception with 2D Vision-Language Distillation for Autonomous DrivingPoster31 citations
- eP-ALM: Efficient Perceptual Augmentation of Language ModelsPoster31 citations
- AutoDiffusion: Training-Free Optimization of Time Steps and Architectures for Automated Diffusion Model AccelerationPoster30 citations
- BoxSnake: Polygonal Instance Segmentation with Box SupervisionPoster30 citations
- Chinese Text Recognition with A Pre-Trained CLIP-Like Model Through Image-IDS AligningOral30 citations
- ContactGen: Generative Contact Modeling for Grasp GenerationPoster30 citations
- Cross-view Topology Based Consistent and Complementary Information for Deep Multi-view ClusteringPoster30 citations
- DETA: Denoised Task Adaptation for Few-Shot LearningPoster30 citations
- Deformable Neural Radiance Fields using RGB and Event CamerasPoster30 citations
- Diverse Cotraining Makes Strong Semi-Supervised SegmentorPoster30 citations
- Downstream-agnostic Adversarial ExamplesPoster30 citations
- Enhancing Generalization of Universal Adversarial Perturbation through Gradient AggregationPoster30 citations
- Flatness-Aware Minimization for Domain GeneralizationPoster30 citations
- Global Adaptation Meets Local Generalization: Unsupervised Domain Adaptation for 3D Human Pose EstimationPoster30 citations
- Gradient-Regulated Meta-Prompt Learning for Generalizable Vision-Language ModelsPoster30 citations
- HTML: Hybrid Temporal-scale Multimodal Learning Framework for Referring Video Object SegmentationPoster30 citations
- Incremental Generalized Category DiscoveryPoster30 citations
- Learning Support and Trivial Prototypes for Interpretable Image ClassificationPoster30 citations
- LinkGAN: Linking GAN Latents to Pixels for Controllable Image SynthesisPoster30 citations
- Neural-PBIR Reconstruction of Shape, Material, and IlluminationPoster30 citations
- Object-aware Gaze Target DetectionPoster30 citations
- PASTA: Proportional Amplitude Spectrum Training Augmentation for Syn-to-Real Domain GeneralizationPoster30 citations
- Probabilistic Human Mesh Recovery in 3D Scenes from Egocentric ViewsOral30 citations
- Quality-Agnostic Deepfake Detection with Intra-model Collaborative LearningPoster30 citations
- R3D3: Dense 3D Reconstruction of Dynamic Scenes from Multiple CamerasPoster30 citations
- Revisiting Domain-Adaptive 3D Object Detection by Reliable, Diverse and Class-balanced Pseudo-LabelingPoster30 citations
- Robust Heterogeneous Federated Learning under Data CorruptionPoster30 citations
- SHACIRA: Scalable HAsh-grid Compression for Implicit Neural RepresentationsPoster30 citations
- Scalable Video Object Segmentation with Simplified FrameworkPoster30 citations
- Spurious Features Everywhere - Large-Scale Detection of Harmful Spurious Features in ImageNetPoster30 citations
- VQ3D: Learning a 3D-Aware Generative Model on ImageNetOral30 citations
- 3D Segmentation of Humans in Point Clouds with Synthetic DataPoster29 citations
- A Large-Scale Outdoor Multi-Modal Dataset and Benchmark for Novel View Synthesis and Implicit Scene ReconstructionPoster29 citations
- A Simple Vision Transformer for Weakly Semi-supervised 3D Object DetectionPoster29 citations
- ARNOLD: A Benchmark for Language-Grounded Task Learning with Continuous States in Realistic 3D ScenesPoster29 citations
- Anatomical Invariance Modeling and Semantic Alignment for Self-supervised Learning in 3D Medical Image AnalysisOral29 citations
- Boosting Multi-modal Model Performance with Adaptive Gradient ModulationPoster29 citations
- Class-Incremental Grouping Network for Continual Audio-Visual LearningPoster29 citations
- Decoupled Iterative Refinement Framework for Interacting Hands Reconstruction from a Single RGB ImageOral29 citations
- DiffFacto: Controllable Part-Based 3D Point Cloud Generation with Cross DiffusionPoster29 citations
- Disentangling Spatial and Temporal Learning for Efficient Image-to-Video Transfer LearningPoster29 citations
- Distribution-Aware Prompt Tuning for Vision-Language ModelsPoster29 citations
- Efficient Joint Optimization of Layer-Adaptive Weight Pruning in Deep Neural NetworksPoster29 citations
- Ego-Only: Egocentric Action Detection without Exocentric TransferringPoster29 citations
- ExBluRF: Efficient Radiance Fields for Extreme Motion Blurred ImagesPoster29 citations
- Generalizing Event-Based Motion Deblurring in Real-World ScenariosPoster29 citations
- Heterogeneous Forgetting Compensation for Class-Incremental LearningPoster29 citations
- LISTER: Neighbor Decoding for Length-Insensitive Scene Text RecognitionPoster29 citations
- Leveraging Spatio-Temporal Dependency for Skeleton-Based Action RecognitionPoster29 citations
- MBPTrack: Improving 3D Point Cloud Tracking with Memory Networks and Box PriorsPoster29 citations
- NPC: Neural Point Characters from VideoPoster29 citations
- P2C: Self-Supervised Point Cloud Completion from Single Partial CloudsPoster29 citations
- Parametric Information Maximization for Generalized Category DiscoveryPoster29 citations
- PoseFix: Correcting 3D Human Poses with Natural LanguagePoster29 citations
- Random Boxes Are Open-world Object DetectorsPoster29 citations
- Robustifying Token Attention for Vision TransformersPoster29 citations
- SAFE: Machine Unlearning With Shard GraphsPoster29 citations
- Self-Feedback DETR for Temporal Action DetectionPoster29 citations
- Towards Generic Image Manipulation Detection with Weakly-Supervised Self-Consistency LearningPoster29 citations
- Treating Pseudo-labels Generation as Image Matting for Weakly Supervised Semantic SegmentationPoster29 citations
- UniFace: Unified Cross-Entropy Loss for Deep Face RecognitionPoster29 citations
- CiT: Curation in Training for Effective Vision-Language DataPoster28 citations
- Controllable Guide-Space for Generalizable Face Forgery DetectionPoster28 citations
- Dynamic Token Pruning in Plain Vision Transformers for Semantic SegmentationPoster28 citations
- FunnyBirds: A Synthetic Vision Dataset for a Part-Based Analysis of Explainable AI MethodsOral28 citations
- Identity-Seeking Self-Supervised Representation Learning for Generalizable Person Re-IdentificationOral28 citations
- LaRS: A Diverse Panoptic Maritime Obstacle Detection Dataset and BenchmarkPoster28 citations
- Leveraging Inpainting for Single-Image Shadow RemovalPoster28 citations
- ReST: A Reconfigurable Spatial-Temporal Graph Model for Multi-Camera Multi-Object TrackingPoster28 citations
- Realistic Full-Body Tracking from Sparse Observations via Joint-Level ModelingPoster28 citations
- Relightify: Relightable 3D Faces from a Single Image via Diffusion ModelsPoster28 citations
- Rethinking Pose Estimation in Crowds: Overcoming the Detection Information Bottleneck and AmbiguityPoster28 citations
- Size Does Matter: Size-aware Virtual Try-on via Clothing-oriented Transformation Try-on NetworkPoster28 citations
- TeD-SPAD: Temporal Distinctiveness for Self-Supervised Privacy-Preservation for Video Anomaly DetectionPoster28 citations
- Universal Domain Adaptation via Compressive Attention MatchingPoster28 citations
- Video-FocalNets: Spatio-Temporal Focal Modulation for Video Action RecognitionPoster28 citations
- CoIn: Contrastive Instance Feature Mining for Outdoor 3D Object Detection with Very Limited AnnotationsPoster27 citations
- CoSign: Exploring Co-occurrence Signals in Skeleton-based Continuous Sign Language RecognitionPoster27 citations
- CoinSeg: Contrast Inter- and Intra- Class Representations for Incremental SegmentationPoster27 citations
- Decomposition-Based Variational Network for Multi-Contrast MRI Super-Resolution and ReconstructionPoster27 citations
- Discovering Spatio-Temporal Rationales for Video Question AnsweringPoster27 citations
- End2End Multi-View Feature Matching with Differentiable Pose OptimizationPoster27 citations
- FineRecon: Depth-aware Feed-forward Network for Detailed 3D ReconstructionPoster27 citations
- Focus the Discrepancy: Intra- and Inter-Correlation Learning for Image Anomaly DetectionPoster27 citations
- Generating Visual Scenes from TouchPoster27 citations
- GeoUDF: Surface Reconstruction from 3D Point Clouds via Geometry-guided Distance RepresentationPoster27 citations
- Learning Gabor Texture Features for Fine-Grained RecognitionPoster27 citations
- LoGoPrompt: Synthetic Text Images Can Be Good Visual Prompts for Vision-Language ModelsPoster27 citations
- MARS: Model-agnostic Biased Object Removal without Additional Supervision for Weakly-Supervised Semantic SegmentationPoster27 citations
- MODA: Mapping-Once Audio-driven Portrait Animation with Dual AttentionsPoster27 citations
- MUter: Machine Unlearning on Adversarially Trained ModelsPoster27 citations
- Neural Microfacet Fields for Inverse RenderingPoster27 citations
- Non-Semantics Suppressed Mask Learning for Unsupervised Video Semantic CompressionPoster27 citations
- Online Class Incremental Learning on Stochastic Blurry Task Boundary via Mask and Visual Prompt TuningPoster27 citations
- PEANUT: Predicting and Navigating to Unseen TargetsPoster27 citations
- Point2Mask: Point-supervised Panoptic Segmentation via Optimal TransportPoster27 citations
- PreSTU: Pre-Training for Scene-Text UnderstandingPoster27 citations
- RANA: Relightable Articulated Neural AvatarsPoster27 citations
- Reconstructing Interacting Hands with Interaction Prior from Monocular ImagesPoster27 citations
- Rosetta Neurons: Mining the Common Units in a Model ZooPoster27 citations
- SAFL-Net: Semantic-Agnostic Feature Learning Network with Auxiliary Plugins for Image Manipulation DetectionPoster27 citations
- SAL-ViT: Towards Latency Efficient Private Inference on ViT using Selective Attention Search with a Learnable Softmax ApproximationPoster27 citations
- Spatially and Spectrally Consistent Deep Functional MapsPoster27 citations
- Temporal Collection and Distribution for Referring Video Object SegmentationPoster27 citations
- ACLS: Adaptive and Conditional Label Smoothing for Network CalibrationOral26 citations
- Active Neural MappingPoster26 citations
- Attentive Mask CLIPPoster26 citations
- Bidirectionally Deformable Motion Modulation For Video-based Human Pose TransferPoster26 citations
- CBA: Improving Online Continual Learning via Continual Bias AdaptorPoster26 citations
- Contrastive Feature Masking Open-Vocabulary Vision TransformerPoster26 citations
- Cross Contrasting Feature Perturbation for Domain GeneralizationPoster26 citations
- Cross-Ray Neural Radiance Fields for Novel-View Synthesis from Unconstrained Image CollectionsOral26 citations
- DVGaze: Dual-View Gaze EstimationPoster26 citations
- Domain Generalization via Rationale InvariancePoster26 citations
- ELFNet: Evidential Local-global Fusion for Stereo MatchingPoster26 citations
- Efficient Video Action Detection with Token Dropout and Context RefinementPoster26 citations
- EgoObjects: A Large-Scale Egocentric Dataset for Fine-Grained Object UnderstandingPoster26 citations
- Evaluation and Improvement of Interpretability for Self-Explainable Part-Prototype NetworksPoster26 citations
- GlueGen: Plug and Play Multi-modal Encoders for X-to-image GenerationPoster26 citations
- GridPull: Towards Scalability in Learning Implicit Representations from 3D Point CloudsPoster26 citations
- Helping Hands: An Object-Aware Ego-Centric Video Recognition ModelPoster26 citations
- Human-centric Scene Understanding for 3D Large-scale ScenariosPoster26 citations
- Improving Lens Flare Removal with General-Purpose Pipeline and Multiple Light Sources RecoveryPoster26 citations
- Inherent Redundancy in Spiking Neural NetworksPoster26 citations
- LivelySpeaker: Towards Semantic-Aware Co-Speech Gesture GenerationPoster26 citations
- Localizing Moments in Long Video Via Multimodal GuidancePoster26 citations
- Low-Light Image Enhancement with Multi-Stage Residue Quantization and Brightness-Aware AttentionPoster26 citations
- NeMF: Inverse Volume Rendering with Neural Microflake FieldPoster26 citations
- Neural Haircut: Prior-Guided Strand-Based Hair ReconstructionOral26 citations
- Prior-guided Source-free Domain Adaptation for Human Pose EstimationPoster26 citations
- Scalable Multi-Temporal Remote Sensing Change Data Generation via Simulating Stochastic Change ProcessPoster26 citations
- Strivec: Sparse Tri-Vector Radiance FieldsPoster26 citations
- StyleGANEX: StyleGAN-Based Manipulation Beyond Cropped Aligned FacesPoster26 citations
- TEMPO: Efficient Multi-View Pose Estimation, Tracking, and ForecastingPoster26 citations
- Towards Open-Set Test-Time Adaptation Utilizing the Wisdom of Crowds in Entropy MinimizationPoster26 citations
- What do neural networks learn in image classification? A frequency shortcut perspectivePoster26 citations
- 3DPPE: 3D Point Positional Encoding for Transformer-based Multi-Camera 3D Object DetectionPoster25 citations
- ACTIVE: Towards Highly Transferable 3D Physical Camouflage for Universal and Robust Vehicle EvasionPoster25 citations
- ActorsNeRF: Animatable Few-shot Human Rendering with Generalizable NeRFsPoster25 citations
- AdaNIC: Towards Practical Neural Image Compression via Dynamic Transform RoutingPoster25 citations
- Anchor Structure Regularization Induced Multi-view Subspace Clustering via Enhanced Tensor Rank MinimizationPoster25 citations
- CAFA: Class-Aware Feature Alignment for Test-Time AdaptationPoster25 citations
- Chupa: Carving 3D Clothed Humans from Skinned Shape Priors using 2D Diffusion Probabilistic ModelsOral25 citations
- Controllable Person Image Synthesis with Pose-Constrained Latent DiffusionPoster25 citations
- DECO: Dense Estimation of 3D Human-Scene Contact In The WildOral25 citations
- DS-Fusion: Artistic Typography via Discriminated and Stylized DiffusionPoster25 citations
- Distribution-Aligned Diffusion for Human Mesh RecoveryPoster25 citations
- ElasticViT: Conflict-aware Supernet Training for Deploying Fast Vision Transformer on Diverse Mobile DevicesPoster25 citations
- EverLight: Indoor-Outdoor Editable HDR Lighting EstimationPoster25 citations
- GECCO: Geometrically-Conditioned Point Diffusion ModelsPoster25 citations
- GasMono: Geometry-Aided Self-Supervised Monocular Depth Estimation for Indoor ScenesPoster25 citations
- Generalizable Decision Boundaries: Dualistic Meta-Learning for Open Set Domain GeneralizationPoster25 citations
- HiFace: High-Fidelity 3D Face Reconstruction by Learning Static and Dynamic DetailsPoster25 citations
- Improving Generalization in Visual Reinforcement Learning via Conflict-aware Gradient Agreement AugmentationPoster25 citations
- InterFormer: Real-time Interactive Image SegmentationPoster25 citations
- Jumping through Local Minima: Quantization in the Loss Landscape of Vision TransformersPoster25 citations
- Knowledge-Aware Federated Active Learning with Non-IID DataPoster25 citations
- L-DAWA: Layer-wise Divergence Aware Weight Aggregation in Federated Self-Supervised Visual Representation LearningPoster25 citations
- Label-Noise Learning with Intrinsically Long-Tailed DataPoster25 citations
- Large-Scale Person Detection and Localization Using Overhead Fisheye CamerasOral25 citations
- Local and Global Logit Adjustments for Long-Tailed LearningPoster25 citations
- Look at the Neighbor: Distortion-aware Unsupervised Domain Adaptation for Panoramic Semantic SegmentationPoster25 citations
- MV-Map: Offboard HD-Map Generation with Multi-view ConsistencyPoster25 citations
- MixSpeech: Cross-Modality Self-Learning with Audio-Visual Stream Mixup for Visual Speech Translation and RecognitionPoster25 citations
- Modeling the Relative Visual Tempo for Self-supervised Skeleton-based Action RecognitionPoster25 citations
- Multi-Metrics Adaptively Identifies Backdoors in Federated LearningPoster25 citations
- Once Detected, Never Lost: Surpassing Human Performance in Offline LiDAR based 3D Object DetectionOral25 citations
- Poincare ResNetPoster25 citations
- Rehearsal-Free Domain Continual Face Anti-Spoofing: Generalize More and Forget LessOral25 citations
- Self-Supervised Monocular Depth Estimation by Direction-aware Cumulative Convolution NetworkPoster25 citations
- Taming Contrast Maximization for Learning Sequential, Low-latency, Event-based Optical FlowPoster25 citations
- Texture Learning Domain Randomization for Domain Generalized SegmentationPoster25 citations
- Too Large; Data Reduction for Vision-Language Pre-TrainingPoster25 citations
- TopoSeg: Topology-Aware Nuclear Instance SegmentationPoster25 citations
- TransHuman: A Transformer-based Human Representation for Generalizable Neural Human RenderingPoster25 citations
- When Noisy Labels Meet Long Tail Dilemmas: A Representation Calibration MethodOral25 citations
- A Soft Nearest-Neighbor Framework for Continual Semi-Supervised LearningOral24 citations
- AccFlow: Backward Accumulation for Long-Range Optical FlowPoster24 citations
- Animal3D: A Comprehensive Dataset of 3D Animal Pose and ShapePoster24 citations
- Can Language Models Learn to Listen?Poster24 citations
- CoTDet: Affordance Knowledge Prompting for Task Driven Object DetectionPoster24 citations
- Coarse-to-Fine Amodal Segmentation with Shape PriorPoster24 citations
- Cyclic Test-Time Adaptation on Monocular Video for 3D Human Mesh ReconstructionPoster24 citations
- DFA3D: 3D Deformable Attention For 2D-to-3D Feature LiftingPoster24 citations
- Data Augmented Flatness-aware Gradient Projection for Continual LearningPoster24 citations
- Decouple Before Interact: Multi-Modal Prompt Learning for Continual Visual Question AnsweringPoster24 citations
- Efficient Adaptive Human-Object Interaction Detection with Concept-guided MemoryPoster24 citations
- Fine-grained Unsupervised Domain Adaptation for Gait RecognitionPoster24 citations
- Get3DHuman: Lifting StyleGAN-Human into a 3D Generative Model Using Pixel-Aligned Reconstruction PriorsPoster24 citations
- Hallucination Improves the Performance of Unsupervised Visual Representation LearningPoster24 citations
- Multi-Label Knowledge DistillationPoster24 citations
- Noise-Aware Learning from Web-Crawled Image-Text Data for Image CaptioningPoster24 citations
- Prune Spatio-temporal Tokens by Semantic-aware Temporal AccumulationPoster24 citations
- RPEFlow: Multimodal Fusion of RGB-PointCloud-Event for Joint Optical Flow and Scene Flow EstimationPoster24 citations
- STPrivacy: Spatio-Temporal Privacy-Preserving Action RecognitionPoster24 citations
- Self-supervised Monocular Underwater Depth Recovery, Image Restoration, and a Real-sea Video DatasetPoster24 citations
- Shrinking Class Space for Enhanced Certainty in Semi-Supervised LearningPoster24 citations
- Test Time Adaptation for Blind Image Quality AssessmentPoster24 citations
- The Devil is in the Crack Orientation: A New Perspective for Crack DetectionPoster24 citations
- Uncertainty Guided Adaptive Warping for Robust and Efficient Stereo MatchingPoster24 citations
- Understanding Self-attention Mechanism via Dynamical System PerspectivePoster24 citations
- Visual Explanations via Iterated Integrated AttributionsPoster24 citations
- XVO: Generalized Visual Odometry via Cross-Modal Self-TrainingPoster24 citations
- Accurate 3D Face Reconstruction with Facial Component TokensPoster23 citations
- Aggregating Feature Point Cloud for Depth CompletionPoster23 citations
- COCO-O: A Benchmark for Object Detectors under Natural Distribution ShiftsPoster23 citations
- ChildPlay: A New Benchmark for Understanding Children's Gaze BehaviourPoster23 citations
- Contrastive Pseudo Learning for Open-World DeepFake AttributionPoster23 citations
- Decoupled DETR: Spatially Disentangling Localization and Classification for Improved End-to-End Object DetectionPoster23 citations
- Deep Geometry-Aware Camera Self-Calibration from VideoPoster23 citations
- DocTr: Document Transformer for Structured Information Extraction in DocumentsPoster23 citations
- DreamTeacher: Pretraining Image Backbones with Deep Generative ModelsPoster23 citations
- Dynamic Mesh-Aware Radiance FieldsPoster23 citations
- EGformer: Equirectangular Geometry-biased Transformer for 360 Depth EstimationPoster23 citations
- Efficient Decision-based Black-box Patch Attacks on Video RecognitionPoster23 citations
- FACTS: First Amplify Correlations and Then Slice to Discover BiasPoster23 citations
- GETAvatar: Generative Textured Meshes for Animatable Human AvatarsPoster23 citations
- H3WB: Human3.6M 3D WholeBody Dataset and BenchmarkPoster23 citations
- HiLo: Exploiting High Low Frequency Relations for Unbiased Panoptic Scene Graph GenerationPoster23 citations
- How Far Pre-trained Models Are from Neural Collapse on the Target Dataset Informs their TransferabilityPoster23 citations
- Inter-Realization Channels: Unsupervised Anomaly Detection Beyond One-Class ClassificationPoster23 citations
- LMR: A Large-Scale Multi-Reference Dataset for Reference-Based Super-ResolutionPoster23 citations
- Learning Human Dynamics in Autonomous Driving ScenariosPoster23 citations
- Learning Pseudo-Relations for Cross-domain Semantic SegmentationPoster23 citations
- Lighting Every Darkness in Two Pairs: A Calibration-Free Pipeline for RAW DenoisingPoster23 citations
- MPCViT: Searching for Accurate and Efficient MPC-Friendly Vision Transformer with Heterogeneous AttentionPoster23 citations
- Mesh2Tex: Generating Mesh Textures from Image QueriesPoster23 citations
- On the Robustness of Open-World Test-Time Training: Self-Training with Dynamic Prototype ExpansionOral23 citations
- Parameterized Cost Volume for Stereo MatchingPoster23 citations
- Perceptual Artifacts Localization for Image Synthesis TasksPoster23 citations
- Periodically Exchange Teacher-Student for Source-Free Object DetectionPoster23 citations
- Pretrained Language Models as Visual Planners for Human AssistancePoster23 citations
- Prototypes-oriented Transductive Few-shot Learning with Conditional TransportPoster23 citations
- Sign Language Translation with Iterative PrototypePoster23 citations
- Take-A-Photo: 3D-to-2D Generative Pre-training of Point Cloud ModelsPoster23 citations
- Unleashing the Potential of Spiking Neural Networks with Dynamic ConfidencePoster23 citations
- With a Little Help from Your Own Past: Prototypical Memory Networks for Image CaptioningPoster23 citations
- ALWOD: Active Learning for Weakly-Supervised Object DetectionPoster22 citations
- Advancing Referring Expression Segmentation Beyond Single ImagePoster22 citations
- AlignDet: Aligning Pre-training and Fine-tuning in Object DetectionPoster22 citations
- CDAC: Cross-domain Attention Consistency in Transformer for Domain Adaptive Semantic SegmentationPoster22 citations
- CGBA: Curvature-aware Geometric Black-box AttackOral22 citations
- CLIPTER: Looking at the Bigger Picture in Scene Text RecognitionPoster22 citations
- CVRecon: Rethinking 3D Geometric Feature Learning For Neural ReconstructionPoster22 citations
- Co-Evolution of Pose and Mesh for 3D Human Body Estimation from VideoPoster22 citations
- Density-invariant Features for Distant Point Cloud RegistrationPoster22 citations
- Divide and Conquer: a Two-Step Method for High Quality Face De-identification with Model ExplainabilityPoster22 citations
- Efficient-VQGAN: Towards High-Resolution Image Generation with Efficient Vision TransformersPoster22 citations
- FSI: Frequency and Spatial Interactive Learning for Image Restoration in Under-Display CamerasPoster22 citations
- FedPerfix: Towards Partial Model Personalization of Vision Transformers in Federated LearningPoster22 citations
- HairCLIPv2: Unifying Hair Editing via Proxy Feature BlendingPoster22 citations
- Hierarchical Spatio-Temporal Representation Learning for Gait RecognitionPoster22 citations
- Hierarchical Visual Primitive Experts for Compositional Zero-Shot LearningPoster22 citations
- Hyperbolic Audio-visual Zero-shot LearningPoster22 citations
- Identification of Systematic Errors of Image Classifiers on Rare SubgroupsPoster22 citations
- LNPL-MIL: Learning from Noisy Pseudo Labels for Promoting Multiple Instance Learning in Whole Slide ImagePoster22 citations
- Label Shift Adapter for Test-Time Adaptation under Covariate and Label ShiftsPoster22 citations
- MAP: Towards Balanced Generalization of IID and OOD through Model-Agnostic AdaptersOral22 citations
- MiniROAD: Minimal RNN Framework for Online Action DetectionPoster22 citations
- PatchCT: Aligning Patch Set and Label Set with Conditional Transport for Multi-Label Image ClassificationPoster22 citations
- Person Re-Identification without Identification via Event anonymizationPoster22 citations
- PointMBF: A Multi-scale Bidirectional Fusion Network for Unsupervised RGB-D Point Cloud RegistrationPoster22 citations
- Preface: A Data-driven Volumetric Prior for Few-shot Ultra High-resolution Face SynthesisPoster22 citations
- Pseudo-label Alignment for Semi-supervised Instance SegmentationPoster22 citations
- RawHDR: High Dynamic Range Image Reconstruction from a Single Raw ImagePoster22 citations
- Reconstructed Convolution Module Based Look-Up Tables for Efficient Image Super-ResolutionPoster22 citations
- Rethinking Multi-Contrast MRI Super-Resolution: Rectangle-Window Cross-Attention Transformer and Arbitrary-Scale UpsamplingPoster22 citations
- SIRA-PCR: Sim-to-Real Adaptation for 3D Point Cloud RegistrationPoster22 citations
- Shatter and Gather: Learning Referring Image Segmentation with Text SupervisionPoster22 citations
- Snow Removal in Video: A New Dataset and A Novel MethodPoster22 citations
- Thinking Image Color Aesthetics Assessment: Models, Datasets and BenchmarksPoster22 citations
- Towards Instance-adaptive Inference for Federated LearningPoster22 citations
- What Can a Cook in Italy Teach a Mechanic in India? Action Recognition Generalisation Over Scenarios and LocationsPoster22 citations
- 3DHacker: Spectrum-based Decision Boundary Generation for Hard-label 3D Point Cloud AttackPoster21 citations
- ASIC: Aligning Sparse in-the-wild Image CollectionsOral21 citations
- Calibrating Uncertainty for Semi-Supervised Crowd CountingPoster21 citations
- ChartReader: A Unified Framework for Chart Derendering and Comprehension without Heuristic RulesPoster21 citations
- Class-relation Knowledge Distillation for Novel Class DiscoveryPoster21 citations
- Continual Segment: Towards a Single, Unified and Non-forgetting Continual Segmentation Model of 143 Whole-body Organs in CT ScansPoster21 citations
- Counting Crowds in Bad WeatherPoster21 citations
- DIME-FM : DIstilling Multimodal and Efficient Foundation ModelsPoster21 citations
- DLT: Conditioned layout generation with Joint Discrete-Continuous Diffusion Layout TransformerPoster21 citations
- Dancing in the Dark: A Benchmark towards General Low-light Video EnhancementPoster21 citations
- Deformer: Dynamic Fusion Transformer for Robust Hand Pose EstimationPoster21 citations
- Distracting Downpour: Adversarial Weather Attacks for Motion EstimationPoster21 citations
- DynamicISP: Dynamically Controlled Image Signal Processor for Image RecognitionPoster21 citations
- EgoLoc: Revisiting 3D Object Localization from Egocentric Videos with Visual QueriesOral21 citations
- Enhancing NeRF akin to Enhancing LLMs: Generalizable NeRF Transformer with Mixture-of-View-ExpertsPoster21 citations
- Exploring Temporal Frequency Spectrum in Deep Video DeblurringPoster21 citations
- Grounded Entity-Landmark Adaptive Pre-Training for Vision-and-Language NavigationOral21 citations
- Kick Back & Relax: Learning to Reconstruct the World by Watching SlowTVPoster21 citations
- Label-Free Event-based Object Recognition via Joint Learning with Image Reconstruction from EventsOral21 citations
- Leveraging SE(3) Equivariance for Learning 3D Geometric Shape AssemblyPoster21 citations
ICCV accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.