ECCV 2022 Accepted Papers
The full list of 1,645 papers accepted at ECCV 2022 (European Conference on Computer Vision). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 1,645
- Visual Prompt TuningPoster2,137 citations
- ByteTrack: Multi-Object Tracking by Associating Every Detection BoxPoster2,128 citations
- TensoRF: Tensorial Radiance FieldsPoster1,570 citations
- Simple Baselines for Image RestorationPoster1,219 citations
- Exploring Plain Vision Transformer Backbones for Object DetectionPoster1,063 citations
- MaxViT: Multi-axis Vision TransformerPoster916 citations
- MOTR: End-to-End Multiple-Object Tracking with TRansformerPoster715 citations
- Detecting Twenty-Thousand Classes Using Image-Level SupervisionPoster704 citations
- PETR: Position Embedding Transformation for Multi-View 3D Object DetectionPoster688 citations
- Joint Feature Learning and Relation Modeling for Tracking: A One-Stream FrameworkPoster657 citations
- DualPrompt: Complementary Prompting for Rehearsal-Free Continual LearningPoster646 citations
- Extract Free Dense Labels from CLIPPoster633 citations
- Masked Autoencoders for Point Cloud Self-Supervised LearningPoster620 citations
- Make-a-Scene: Scene-Based Text-to-Image Generation with Human PriorsPoster575 citations
- SLIP: Self-Supervision Meets Language-Image Pre-trainingPoster559 citations
- A-OKVQA: A Benchmark for Visual Question Answering Using World KnowledgePoster538 citations
- Scaling Open-Vocabulary Image Segmentation with Image-Level LabelsPoster515 citations
- Efficient Long-Range Attention Network for Image Super-ResolutionPoster512 citations
- Compositional Visual Generation with Composable Diffusion ModelsPoster503 citations
- DeiT III: Revenge of the ViTPoster499 citations
- ActionFormer: Localizing Moments of Actions with TransformersPoster486 citations
- XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory ModelPoster480 citations
- Prompting Visual-Language Models for Efficient Video UnderstandingPoster479 citations
- VQGAN-CLIP: Open Domain Image Generation and Editing with Natural Language GuidancePoster478 citations
- V2X-ViT: Vehicle-to-Everything Cooperative Perception with Vision TransformerPoster466 citations
- Real-Time Intermediate Flow Estimation for Video Frame InterpolationPoster452 citations
- OCR-Free Document Understanding TransformerPoster437 citations
- TEMOS: Generating Diverse Human Motions from Textual DescriptionsPoster427 citations
- Tip-Adapter: Training-Free Adaption of CLIP for Few-Shot ClassificationPoster426 citations
- DaViT: Dual Attention Vision TransformersPoster424 citations
- SPot-the-Difference Self-Supervised Pre-training for Anomaly Detection and SegmentationPoster423 citations
- MotionCLIP: Exposing Human Motion Generation to CLIP SpacePoster392 citations
- Masked Siamese Networks for Label-Efficient LearningPoster390 citations
- Expanding Language-Image Pretrained Models for General Video RecognitionPoster389 citations
- FlowFormer: A Transformer Architecture for Optical FlowPoster387 citations
- FOSTER: Feature Boosting and Compression for Class-Incremental LearningPoster381 citations
- Text2LIVE: Text-Driven Layered Image and Video EditingPoster364 citations
- NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtionPoster350 citations
- TinyViT: Fast Pretraining Distillation for Small Vision TransformersPoster340 citations
- AiATrack: Attention in Attention for Transformer Visual TrackingPoster332 citations
- 2DPASS: 2D Priors Assisted Semantic Segmentation on LiDAR Point CloudsPoster316 citations
- MultiMAE: Multi-modal Multi-task Masked AutoencodersPoster316 citations
- Making the Most of Text Semantics to Improve Biomedical Vision-Language ProcessingPoster306 citations
- HRDA: Context-Aware High-Resolution Domain-Adaptive Semantic SegmentationPoster305 citations
- ST-P3: End-to-End Vision-Based Autonomous Driving via Spatial-Temporal Feature LearningPoster287 citations
- Backbone Is All Your Need: A Simplified Architecture for Visual Object TrackingPoster284 citations
- CLIFF: Carrying Location Information in Full Frames into Human Pose and Shape EstimationPoster280 citations
- A Simple Baseline for Open-Vocabulary Semantic Segmentation with Pre-trained Vision-Language ModelPoster279 citations
- Decoupled Contrastive LearningPoster268 citations
- TM2T: Stochastic and Tokenized Modeling for the Reciprocal Generation of 3D Human Motions and TextsPoster268 citations
- BungeeNeRF: Progressive Neural Radiance Field for Extreme Multi-Scale Scene RenderingPoster267 citations
- Frozen CLIP Models Are Efficient Video LearnersPoster266 citations
- ARF: Artistic Radiance FieldsPoster265 citations
- EdgeViTs: Competing Light-Weight CNNs on Mobile Devices with Vision TransformersPoster260 citations
- Long Video Generation with Time-Agnostic VQGAN and Time-Sensitive TransformerPoster258 citations
- Masked Generative DistillationPoster257 citations
- Stripformer: Strip Transformer for Fast Image DeblurringPoster251 citations
- SPViT: Enabling Faster Vision Transformers via Latency-Aware Soft Token PruningPoster247 citations
- NeuMan: Neural Human Radiance Field from a Single VideoPoster241 citations
- Open-Vocabulary DETR with Conditional MatchingPoster241 citations
- Scene Text Recognition with Permuted Autoregressive Sequence ModelsPoster241 citations
- Adaptive Token Sampling for Efficient Vision TransformersPoster231 citations
- DICE: Leveraging Sparsification for Out-of-Distribution DetectionPoster229 citations
- ASpanFormer: Detector-Free Image Matching with Adaptive Span TransformerPoster227 citations
- PillarNet: Real-Time and High-Performance Pillar-Based 3D Object DetectionPoster223 citations
- Learn from All: Erasing Attention Consistency for Noisy Label Facial Expression RecognitionPoster220 citations
- DexMV: Imitation Learning for Dexterous Manipulation from Human VideosPoster210 citations
- RFLA: Gaussian Receptive Field Based Label Assignment for Tiny Object DetectionPoster210 citations
- FAST-VQA: Efficient End-to-End Video Quality Assessment with Fragment SamplingPoster209 citations
- PersFormer: 3D Lane Detection via Perspective Transformer and the OpenLane BenchmarkPoster209 citations
- Wave-ViT: Unifying Wavelet and Transformers for Visual Representation LearningPoster209 citations
- StyleHEAT: One-Shot High-Resolution Editable Talking Face Generation via Pre-trained StyleGANPoster203 citations
- SinNeRF: Training Neural Radiance Fields on Complex Scenes from a Single ImagePoster202 citations
- Language-Grounded Indoor 3D Semantic Segmentation in the WildPoster200 citations
- Self-Support Few-Shot Semantic SegmentationPoster199 citations
- FILM: Frame Interpolation for Large MotionPoster198 citations
- SparseNeuS: Fast Generalizable Neural Surface Reconstruction from Sparse ViewsPoster195 citations
- Uncertainty Inspired Underwater Image EnhancementPoster195 citations
- Implicit Neural Representations for Image CompressionPoster194 citations
- Natural Synthetic Anomalies for Self-Supervised Anomaly Detection and LocalizationPoster194 citations
- Frequency Domain Model Augmentation for Adversarial AttackPoster193 citations
- P-STMO: Pre-trained Spatial Temporal Many-to-One Model for 3D Human Pose EstimationPoster192 citations
- Registration Based Few-Shot Anomaly DetectionPoster192 citations
- SimCC: A Simple Coordinate Classification Perspective for Human Pose EstimationPoster191 citations
- Towards Grand Unification of Object TrackingPoster189 citations
- Masked Discrimination for Self-Supervised Learning on Point CloudsPoster187 citations
- CenterFormer: Center-based Transformer for 3D Object DetectionPoster184 citations
- Particle Video Revisited: Tracking through Occlusions Using Point TrajectoriesPoster183 citations
- PromptDet: Towards Open-Vocabulary Detection Using Uncurated ImagesPoster181 citations
- BEAT: A Large-Scale Semantic and Emotional Multi-modal Dataset for Conversational Gestures SynthesisPoster179 citations
- StyleGAN-Human: A Data-Centric Odyssey of Human GenerationPoster179 citations
- SeqTR: A Simple Yet Universal Network for Visual GroundingPoster177 citations
- PTQ4ViT: Post-Training Quantization for Vision Transformers with Twin Uniform QuantizationPoster176 citations
- SeedFormer: Patch Seeds Based Point Cloud Completion with Upsample TransformerPoster174 citations
- Audio—Visual SegmentationPoster173 citations
- Cost Aggregation with 4D Convolutional Swin Transformer for Few-Shot SegmentationPoster173 citations
- Event-Based Fusion for Motion Deblurring with Cross-Modal AttentionPoster173 citations
- Towards Metrical Reconstruction of Human FacesPoster173 citations
- An End-to-End Transformer Model for Crowd LocalizationPoster172 citations
- High-Resolution Virtual Try-On with Misalignment and Occlusion-Handled ConditionsPoster172 citations
- CelebV-HQ: A Large-Scale Video Facial Attributes DatasetPoster170 citations
- Domain Generalization by Mutual-Information Regularization with Pre-trained ModelsPoster170 citations
- Unsupervised Night Image Enhancement: When Layer Decomposition Meets Light-Effects SuppressionPoster170 citations
- Perceiving and Modeling Density for Image DehazingPoster169 citations
- Coarse-to-Fine Sparse Transformer for Hyperspectral Image ReconstructionPoster165 citations
- Deep Fourier-Based Exposure Correction Network with Spatial-Frequency InteractionPoster164 citations
- TS2-Net: Token Shift and Selection Transformer for Text-Video RetrievalPoster161 citations
- NeuMesh: Learning Disentangled Neural Mesh-Based Implicit Field for Geometry and Texture EditingPoster158 citations
- Factorizing Knowledge in Neural NetworksPoster156 citations
- Multimodal Object Detection via Probabilistic EnsemblingPoster155 citations
- Semantic-Aware Implicit Neural Audio-Driven Video Portrait GenerationPoster154 citations
- Cross-Attention of Disentangled Modalities for 3D Human Mesh Recovery with TransformersPoster153 citations
- FCAF3D: Fully Convolutional Anchor-Free 3D Object DetectionPoster153 citations
- Three Things Everyone Should Know about Vision TransformersPoster153 citations
- GRIT: Faster and Better Image Captioning Transformer Using Dual Visual FeaturesPoster152 citations
- TAVA: Template-Free Animatable Volumetric ActorsPoster151 citations
- ARAH: Animatable Volume Rendering of Articulated Human SDFsPoster150 citations
- NeRF for Outdoor Scene RelightingPoster150 citations
- VQFR: Blind Face Restoration with Vector-Quantized Dictionary and Parallel DecoderPoster150 citations
- RigNet: Repetitive Image Guided Network for Depth CompletionPoster149 citations
- DSR – A Dual Subspace Re-Projection Network for Surface Anomaly DetectionPoster148 citations
- Deformable Feature Aggregation for Dynamic Multi-modal 3D Object DetectionPoster147 citations
- What to Hide from Your Students: Attention-Guided Masked Image ModelingPoster146 citations
- Improving Generalization in Federated Learning by Seeking Flat MinimaPoster145 citations
- In Defense of Online Models for Video Instance SegmentationPoster145 citations
- Panoptic Scene Graph GenerationPoster145 citations
- Dress Code: High-Resolution Multi-Category Virtual Try-OnPoster144 citations
- Frequency and Spatial Dual Guidance for Image DehazingPoster144 citations
- LEDNet: Joint Low-Light Enhancement and Deblurring in the DarkPoster144 citations
- Highly Accurate Dichotomous Image SegmentationPoster143 citations
- Human Trajectory Prediction via Neural Social PhysicsPoster143 citations
- ProposalContrast: Unsupervised Pre-training for LiDAR-Based 3D Object DetectionPoster143 citations
- SQN: Weakly-Supervised Semantic Segmentation of Large-Scale 3D Point CloudsPoster142 citations
- TALLFormer: Temporal Action Localization with a Long-Memory TransformerPoster142 citations
- Beyond Periodicity: Towards a Unifying Framework for Activations in Coordinate-MLPsPoster140 citations
- Dense Cross-Query-and-Support Attention Weighted Mask Aggregation for Few-Shot SegmentationPoster140 citations
- Fusion from Decomposition: A Self-Supervised Decomposition Approach for Image FusionPoster140 citations
- SWFormer: Sparse Window Transformer for 3D Object Detection in Point CloudsPoster140 citations
- AvatarPoser: Articulated Full-Body Pose Tracking from Sparse Motion SensingPoster137 citations
- Data-Free Backdoor Removal Based on Channel LipschitznessPoster137 citations
- KVT: k-NN Attention for Boosting Vision TransformersPoster136 citations
- ReCoNet: Recurrent Correction Network for Fast and Efficient Multi-Modality Image FusionPoster135 citations
- PseCo: Pseudo Labeling and Consistency Training for Semi-Supervised Object DetectionPoster134 citations
- Gaussian Activated Neural Radiance Fields for High Fidelity Reconstruction & Pose EstimationPoster133 citations
- Learning Dynamic Facial Radiance Fields for Few-Shot Talking Head SynthesisPoster130 citations
- LocalBins: Improving Depth Estimation by Learning Local DistributionsPoster130 citations
- ActiveNeRF: Learning Where to See with Uncertainty EstimationPoster129 citations
- Few-Shot Class-Incremental Learning from an Open-Set PerspectivePoster128 citations
- Gen6D: Generalizable Model-Free 6-DoF Object Pose Estimation from RGB ImagesPoster128 citations
- SeqFormer: Sequential Transformer for Video Instance SegmentationPoster128 citations
- Generalizable Patch-Based Neural RenderingPoster127 citations
- HIVE: Evaluating the Human Interpretability of Visual ExplanationsPoster127 citations
- Latency-Aware Collaborative PerceptionPoster127 citations
- SimpleRecon: 3D Reconstruction without 3D ConvolutionsPoster127 citations
- UniTAB: Unifying Text and Box Outputs for Grounded Vision-Language ModelingPoster127 citations
- Dense Teacher: Dense Pseudo-Labels for Semi-Supervised Object DetectionPoster126 citations
- Self-Supervised Sparse Representation for Video Anomaly DetectionPoster126 citations
- 3D Face Reconstruction with Dense LandmarksPoster125 citations
- HuMMan: Multi-modal 4D Human Dataset for Versatile Sensing and ModelingPoster125 citations
- "PartImageNet: A Large, High-Quality Dataset of Parts"Poster124 citations
- Auto-Regressive Image Synthesis with Integrated QuantizationPoster124 citations
- AutoMix: Unveiling the Power of Mixup for Stronger ClassifiersPoster123 citations
- Improving Vision Transformers by Revisiting High-Frequency ComponentsPoster123 citations
- Neural Architecture Search for Spiking Neural NetworksPoster123 citations
- MVSTER: Epipolar Transformer for Efficient Multi-View StereoPoster122 citations
- PointMixer: MLP-Mixer for Point Cloud UnderstandingPoster122 citations
- Interpretable Image Classification with Differentiable Prototypes AssignmentPoster121 citations
- Long Movie Clip Classification with State-Space Video ModelsPoster121 citations
- Physical Attack on Monocular Depth Estimation with Optimal Adversarial PatchesPoster121 citations
- SocialVAE: Human Trajectory Prediction Using Timewise LatentsPoster121 citations
- UIA-ViT: Unsupervised Inconsistency-Aware Method Based on Vision Transformer for Face Forgery DetectionPoster121 citations
- Exploiting Unlabeled Data with Vision and Language Models for Object DetectionPoster120 citations
- Neuromorphic Data Augmentation for Training Spiking Neural NetworksPoster120 citations
- Prototypical Contrast Adaptation for Domain Adaptive Semantic SegmentationPoster120 citations
- Few-Shot Class-Incremental Learning via Entropy-Regularized Data-Free ReplayPoster117 citations
- Poseur: Direct Human Pose Regression with TransformersPoster117 citations
- Video Graph Transformer for Video Question AnsweringPoster117 citations
- CODA: A Real-World Road Corner Case Dataset for Object Detection in Autonomous DrivingPoster116 citations
- Class-Agnostic Object Detection with Multi-modal TransformerPoster116 citations
- Improving Image Restoration by Revisiting Global Information AggregationPoster116 citations
- MVP: Multimodality-Guided Visual Pre-trainingPoster116 citations
- Efficient and Degradation-Adaptive Network for Real-World Image Super-ResolutionPoster115 citations
- Video Anomaly Detection by Solving Decoupled Spatio-Temporal Jigsaw PuzzlesPoster114 citations
- NeuRIS: Neural Reconstruction of Indoor Scenes Using Normal PriorsPoster113 citations
- Bottom Up Top down Detection Transformers for Language Grounding in Images and Point CloudsPoster112 citations
- EgoBody: Human Body Shape and Motion of Interacting People from Head-Mounted DevicesPoster112 citations
- CCPL: Contrastive Coherence Preserving Loss for Versatile Style TransferPoster111 citations
- Cross-Modal Prototype Driven Network for Radiology Report GenerationPoster111 citations
- NeILF: Neural Incident Light Field for Physically-Based Material EstimationPoster111 citations
- Rethinking Keypoint Representations: Modeling Keypoints and Poses as Objects for Multi-Person Human Pose EstimationPoster111 citations
- Fine-Grained Scene Graph Generation with Data TransferPoster110 citations
- Pose-NDF: Modeling Human Pose Manifolds with Neural Distance FieldsPoster110 citations
- ViTAS: Vision Transformer Architecture SearchPoster110 citations
- KING: Generating Safety-Critical Driving Scenarios for Robust Imitation via Kinematics GradientsPoster109 citations
- Learning Audio-Video Modalities from Image CaptionsPoster109 citations
- Secrets of Event-Based Optical FlowPoster109 citations
- COUCH: Towards Controllable Human-Chair InteractionsPoster108 citations
- Style-Hallucinated Dual Consistency Learning for Domain Generalized Semantic SegmentationPoster108 citations
- MoFaNeRF: Morphable Facial Neural Radiance FieldPoster107 citations
- Inverted Pyramid Multi-task Transformer for Dense Scene UnderstandingPoster106 citations
- Realistic One-Shot Mesh-Based Head AvatarsPoster106 citations
- Graph R-CNN: Towards Accurate 3D Object Detection with Semantic-Decorated Local GraphPoster105 citations
- Object Discovery and Representation NetworksPoster105 citations
- Unified Fully and Timestamp Supervised Temporal Action Segmentation via Sequence to Sequence TranslationPoster105 citations
- Contrast-Phys: Unsupervised Video-Based Remote Physiological Measurement via Spatiotemporal ContrastPoster104 citations
- Deforming Radiance Fields with CagesPoster103 citations
- SPSN: Superpixel Prototype Sampling Network for RGB-D Salient Object DetectionPoster103 citations
- MPPNet: Multi-Frame Feature Intertwining with Proxy Points for 3D Temporal Object DetectionPoster102 citations
- Robust Visual Tracking by SegmentationPoster102 citations
- Spatial-Frequency Domain Information Integration for Pan-SharpeningPoster102 citations
- Few-Shot Classification with Contrastive LearningPoster100 citations
- Multimodal Conditional Image Synthesis with Product-of-Experts GANsPoster100 citations
- Open Vocabulary Object Detection with Pseudo Bounding-Box LabelsPoster100 citations
- An Invisible Black-Box Backdoor Attack through Frequency DomainPoster99 citations
- Joint Learning of Localized Representations from Medical Images and ReportsPoster99 citations
- Cross-Modality Transformer for Visible-Infrared Person Re-identificationPoster98 citations
- DiffuseMorph: Unsupervised Deformable Image Registration Using Diffusion ModelPoster98 citations
- PCW-Net: Pyramid Combination and Warping Cost Volume for Stereo MatchingPoster98 citations
- Pixel-Wise Energy-Biased Abstention Learning for Anomaly Segmentation on Complex Urban Driving ScenesPoster98 citations
- R-DFCIL: Relation-Guided Representation Learning for Data-Free Class Incremental LearningPoster98 citations
- R2L: Distilling Neural Radiance Field to Neural Light Field for Efficient Novel View SynthesisPoster98 citations
- "Capturing, Reconstructing, and Simulating: The UrbanScene3D Dataset"Poster97 citations
- ESS: Learning Event-Based Semantic Segmentation from Still ImagesPoster97 citations
- SegPGD: An Effective and Efficient Adversarial Attack for Evaluating and Boosting Segmentation RobustnessPoster97 citations
- Single Stage Virtual Try-On via Deformable Attention FlowsPoster97 citations
- Ghost-Free High Dynamic Range Imaging with Context-Aware TransformerPoster96 citations
- Adaptive Transformers for Robust Few-Shot Cross-Domain Face Anti-SpoofingPoster95 citations
- PASS: Part-Aware Self-Supervised Pre-training for Person Re-identificationPoster95 citations
- PanoFormer: Panorama Transformer for Indoor 360° Depth EstimationPoster95 citations
- Social-Implicit: Rethinking Trajectory Prediction Evaluation and the Effectiveness of Implicit Maximum Likelihood EstimationPoster95 citations
- "“This Is My Unicorn, Fluffy”: Personalizing Frozen Vision-Language Representations"Poster94 citations
- Object-Compositional Neural Implicit SurfacesPoster94 citations
- RelPose: Predicting Probabilistic Relative Rotation for Single Objects in the WildPoster94 citations
- Cross-Modality Knowledge Distillation Network for Monocular 3D Object DetectionPoster93 citations
- Reference-Based Image Super-Resolution with Deformable Attention TransformerPoster93 citations
- A Broad Study of Pre-training for Domain Generalization and AdaptationPoster92 citations
- GaitEdge: Beyond Plain End-to-End Gait Recognition for Better PracticalityPoster92 citations
- KeypointNeRF: Generalizing Image-Based Volumetric Avatars Using Relative Spatial Encoding of KeypointsPoster92 citations
- Semi-Supervised 3D Object Detection with Proficient TeachersPoster92 citations
- Unified Implicit Neural StylizationPoster92 citations
- Image2Point: 3D Point-Cloud Understanding with 2D Image Pretrained ModelsPoster90 citations
- Localizing Visual Sounds the Easy WayPoster90 citations
- Mixed-Precision Neural Network Quantization via Learned Layer-Wise ImportancePoster90 citations
- ReAct: Temporal Action Detection with Relational QueriesPoster90 citations
- SdAE: Self-Distillated Masked AutoencoderPoster90 citations
- Subspace Diffusion Generative ModelsPoster90 citations
- Uncertainty-Guided Source-Free Domain AdaptationPoster90 citations
- AdaNeRF: Adaptive Sampling for Real-Time Rendering of Neural Radiance FieldsPoster89 citations
- AdvDO: Realistic Adversarial Attacks for Trajectory PredictionPoster89 citations
- DID-M3D: Decoupling Instance Depth for Monocular 3D Object DetectionPoster89 citations
- Flow-Guided Transformer for Video InpaintingPoster89 citations
- LaMAR: Benchmarking Localization and Mapping for Augmented RealityPoster89 citations
- Local Color Distributions Prior for Image EnhancementPoster89 citations
- Contextformer: A Transformer with Spatio-Channel Attention for Context Modeling in Learned Image CompressionPoster88 citations
- DEVIANT: Depth EquiVarIAnt NeTwork for Monocular 3D Object DetectionPoster88 citations
- MeshUDF: Fast and Differentiable Meshing of Unsigned Distance Field NetworksPoster88 citations
- PoseGPT: Quantization-Based 3D Human Motion Generation and ForecastingPoster88 citations
- Efficient Video Transformers with Spatial-Temporal Token SelectionPoster87 citations
- GIMO: Gaze-Informed Human Motion Prediction in ContextPoster87 citations
- Hierarchical Feature Alignment Network for Unsupervised Video Object SegmentationPoster87 citations
- MINER: Multiscale Implicit Neural RepresentationPoster87 citations
- PS-NeRF: Neural Inverse Rendering for Multi-View Photometric StereoPoster87 citations
- StoryDALL-E: Adapting Pretrained Text-to-Image Transformers for Story ContinuationPoster87 citations
- Towards Data-Efficient Detection TransformersPoster87 citations
- VL-LTR: Learning Class-Wise Visual-Linguistic Representation for Long-Tailed Visual RecognitionPoster87 citations
- "Fine-Grained Egocentric Hand-Object Segmentation: Dataset, Model, and Applications"Poster86 citations
- BLT: Bidirectional Layout Transformer for Controllable Layout GenerationPoster86 citations
- Generative Multiplane Images: Making a 2D GAN 3D-AwarePoster86 citations
- Multi-modal Text Recognition Networks: Interactive Enhancements between Visual and Semantic FeaturesPoster86 citations
- Unleashing Transformers: Parallel Token Prediction with Discrete Absorbing Diffusion for Fast High-Resolution Image Generation from Vector-Quantized CodesPoster86 citations
- ViewFormer: NeRF-Free Neural Rendering from Few Images Using TransformersPoster86 citations
- Are Vision Transformers Robust to Patch Perturbations?Poster85 citations
- JoJoGAN: One Shot Face StylizationPoster85 citations
- SAGA: Stochastic Whole-Body Grasping with ContactPoster85 citations
- Bootstrapped Masked Autoencoders for Vision BERT PretrainingPoster84 citations
- LiDAR Distillation: Bridging the Beam-Induced Domain Gap for 3D Object DetectionPoster84 citations
- SmoothNet: A Plug-and-Play Network for Refining Human Poses in VideosPoster84 citations
- Detecting Generated Images by Real ImagesPoster83 citations
- Learning Degradation Representations for Image DeblurringPoster83 citations
- Multi-Granularity Prediction for Scene Text RecognitionPoster83 citations
- OSFormer: One-Stage Camouflaged Instance Segmentation with TransformersPoster83 citations
- Category-Level 6D Object Pose and Size Estimation Using Self-Supervised Deep Prior Deformation NetworksPoster82 citations
- ObjectBox: From Centers to Boxes for Anchor-Free Object DetectionPoster82 citations
- Open-World Semantic Segmentation via Contrasting and Clustering Vision-Language EmbeddingPoster82 citations
- Box-Supervised Instance Segmentation with Level Set EvolutionPoster81 citations
- DFNet: Enhance Absolute Pose Regression with Direct Feature MatchingPoster81 citations
- Housekeep: Tidying Virtual Households Using Commonsense ReasoningPoster81 citations
- Zero-Shot Temporal Action Detection via Vision-Language PromptingPoster81 citations
- k-Means Mask TransformerPoster81 citations
- 3D Siamese Transformer Network for Single Object Tracking on Point CloudsPoster80 citations
- Dual-Evidential Learning for Weakly-Supervised Temporal Action LocalizationPoster80 citations
- FedX: Unsupervised Federated Learning with Cross Knowledge DistillationPoster80 citations
- ParC-Net: Position Aware Circular Convolution with Merits from ConvNets and TransformerPoster80 citations
- TokenMix: Rethinking Image Mixing for Data Augmentation in Vision TransformersPoster80 citations
- Towards Efficient and Scale-Robust Ultra-High-Definition Image DemoiréingPoster80 citations
- Disentangling Object Motion and Occlusion for Unsupervised Multi-Frame Monocular DepthPoster79 citations
- LESS: Label-Efficient Semantic Segmentation for LiDAR Point CloudsPoster79 citations
- Toward Understanding WordArt: Corner-Guided Transformer for Scene Text RecognitionPoster79 citations
- UniMiSS: Universal Medical Self-Supervised Learning via Breaking Dimensionality BarrierPoster79 citations
- View Vertically: A Hierarchical Network for Trajectory Prediction via Fourier SpectrumsPoster79 citations
- "CHORE: Contact, Human and Object REconstruction from a Single RGB Image"Poster78 citations
- DenseHybrid: Hybrid Anomaly Detection for Dense Open-Set RecognitionPoster78 citations
- Generative Domain Adaptation for Face Anti-SpoofingPoster78 citations
- Image Inpainting with Cascaded Modulation GAN and Object-Aware TrainingPoster78 citations
- Improving Test-Time Adaptation via Shift-Agnostic Weight Regularization and Nearest Source PrototypesPoster78 citations
- Unsupervised Learning of Efficient Geometry-Aware Neural Articulated RepresentationsPoster78 citations
- WaveGAN: Frequency-Aware GAN for High-Fidelity Few-Shot Image GenerationPoster78 citations
- Compositional Human-Scene Interaction Synthesis with Semantic ControlPoster77 citations
- Harmonizer: Learning to Perform White-Box Image and Video HarmonizationPoster77 citations
- Max Pooling with Vision Transformers Reconciles Class and Shape in Weakly Supervised Semantic SegmentationPoster77 citations
- Real-Time Online Video Detection with Temporal Smoothing TransformersPoster77 citations
- UC-OWOD: Unknown-Classified Open World Object DetectionPoster77 citations
- AdaBin: Improving Binary Neural Networks with Adaptive Binary SetsPoster76 citations
- Box2Mask: Weakly Supervised 3D Semantic Instance Segmentation Using Bounding BoxesPoster76 citations
- CANF-VC: Conditional Augmented Normalizing Flows for Video CompressionPoster76 citations
- Differentiable Raycasting for Self-Supervised Occupancy ForecastingPoster76 citations
- Self-Regulated Feature Learning via Teacher-Free Feature DistillationPoster76 citations
- Any-Resolution Training for High-Resolution Image SynthesisPoster75 citations
- Learning Graph Neural Networks for Image Style TransferPoster75 citations
- Monocular 3D Object Detection with Depth from MotionPoster75 citations
- PPT: Token-Pruned Pose Transformer for Monocular and Multi-View Human Pose EstimationPoster75 citations
- RA-Depth: Resolution Adaptive Self-Supervised Monocular Depth EstimationPoster75 citations
- LocVTP: Video-Text Pre-training for Temporal LocalizationPoster74 citations
- Skeleton-Parted Graph Scattering Networks for 3D Human Motion PredictionPoster74 citations
- VSA: Learning Varied-Size Window Attention in Vision TransformersPoster74 citations
- DCCF: Deep Comprehensible Color Filter Learning Framework for High-Resolution Image HarmonizationPoster73 citations
- Texturify: Generating Textures on 3D Shape SurfacesPoster73 citations
- "On Multi-Domain Long-Tailed Recognition, Imbalanced Domain Generalization and Beyond"Poster72 citations
- A Dataset for Interactive Vision-Language Navigation with Unknown Command FeasibilityPoster72 citations
- Learning to Generate Realistic LiDAR Point CloudsPoster72 citations
- MixSKD: Self-Knowledge Distillation from Mixup for Image RecognitionPoster72 citations
- RC-MVSNet: Unsupervised Multi-View Stereo with Neural RenderingPoster72 citations
- Single Frame Atmospheric Turbulence Mitigation: A Benchmark Study and a New Physics-Inspired Transformer ModelPoster72 citations
- Adversarial Feature Augmentation for Cross-Domain Few-Shot ClassificationPoster71 citations
- Few-Shot Action Recognition with Hierarchical Matching and Contrastive LearningPoster71 citations
- ScalableViT: Rethinking the Context-Oriented Generalization of Vision TransformerPoster71 citations
- Triangle Attack: A Query-Efficient Decision-Based Adversarial AttackPoster71 citations
- "ShAPO: Implicit Representations for Multi-Object Shape, Appearance, and Pose Optimization"Poster70 citations
- Cross Attention Based Style Distribution for Controllable Person Image SynthesisPoster70 citations
- Emotion Recognition for Multiple Context AwarenessPoster70 citations
- Grasp’D: Differentiable Contact-Rich Grasp Synthesis for Multi-Fingered HandsPoster70 citations
- Bi-PointFlowNet: Bidirectional Learning for Point Cloud Based Scene Flow EstimationPoster69 citations
- CT2: Colorization Transformer via Color TokensPoster69 citations
- CoSMix: Compositional Semantic Mix for Domain Adaptation in 3D LiDAR SegmentationPoster69 citations
- E-NeRV: Expedite Neural Video Representation with Disentangled Spatial-Temporal ContextPoster69 citations
- Implicit Neural Representations for Variable Length Human Motion GenerationPoster69 citations
- Invariant Feature Learning for Generalized Long-Tailed ClassificationPoster69 citations
- Map-Free Visual Relocalization: Metric Pose Relative to a Single ImagePoster69 citations
- OpenLDN: Learning to Discover Novel Classes for Open-World Semi-Supervised LearningPoster69 citations
- PseudoClick: Interactive Image Segmentation with Click ImitationPoster69 citations
- Relationformer: A Unified Framework for Image-to-Graph GenerationPoster69 citations
- Transformers As Meta-Learners for Implicit Neural RepresentationsPoster69 citations
- "FEAR: Fast, Efficient, Accurate and Robust Visual Tracker"Poster68 citations
- AdaAfford: Learning to Adapt Manipulation Affordance for 3D Articulated Objects via Few-Shot InteractionsPoster68 citations
- BigColor: Colorization Using a Generative Color Prior for Natural ImagesPoster68 citations
- DiffuStereo: High Quality Human Reconstruction via Diffusion-Based Stereo Using Sparse CamerasPoster68 citations
- Motion Inspired Unsupervised Perception and Prediction in Autonomous DrivingPoster68 citations
- Proposal-Free Temporal Action Detection via Global Segmentation Mask LearningPoster68 citations
- Towards Realistic Semi-Supervised LearningPoster68 citations
- "Translation, Scale and Rotation: Cross-Modal Alignment Meets RGB-Infrared Vehicle Detection"Poster67 citations
- 4DContrast: Contrastive Learning with Dynamic Correspondences for 3D Scene UnderstandingPoster67 citations
- A Simple and Robust Correlation Filtering Method for Text-Based Person SearchPoster67 citations
- AlignSDF: Pose-Aligned Signed Distance Fields for Hand-Object ReconstructionPoster67 citations
- BMD: A General Class-Balanced Multicentric Dynamic Prototype Strategy for Source-Free Domain AdaptationPoster67 citations
- Homogeneous Multi-modal Feature Fusion and Interaction for 3D Object DetectionPoster67 citations
- MTFormer: Multi-task Learning via Transformer and Cross-Task ReasoningPoster67 citations
- MTTrans: Cross-Domain Object Detection with Mean Teacher TransformerPoster67 citations
- MeshLoc: Mesh-Based Visual LocalizationPoster67 citations
- Rethinking Data Augmentation for Robust Visual Question AnsweringPoster67 citations
- Waymo Open Dataset: Panoramic Video Panoptic SegmentationPoster67 citations
- When Counting Meets HMER: Counting-Aware Network for Handwritten Mathematical Expression RecognitionPoster67 citations
- A Fast Knowledge Distillation Framework for Visual RecognitionPoster66 citations
- Class-Incremental Novel Class DiscoveryPoster66 citations
- DisCo: Remedying Self-Supervised Learning on Lightweight Models with Distilled Contrastive LearningPoster66 citations
- Learning Pedestrian Group Representations for Multi-modal Trajectory PredictionPoster66 citations
- PoseScript: 3D Human Poses from Natural LanguagePoster66 citations
- Shape Matters: Deformable Patch AttackPoster66 citations
- Temporal Lift Pooling for Continuous Sign Language RecognitionPoster66 citations
- A Simple Single-Scale Vision Transformer for Object Detection and Instance SegmentationPoster65 citations
- An Impartial Take to the CNN vs Transformer Robustness ContestPoster65 citations
- Conditional-Flow NeRF: Accurate 3D Modelling with Reliable Uncertainty QuantificationPoster65 citations
- DeciWatch: A Simple Baseline for 10× Efficient 2D and 3D Pose EstimationPoster65 citations
- Few-Shot Object Counting and DetectionPoster65 citations
- TAPE: Task-Agnostic Prior Embedding for Image RestorationPoster65 citations
- Training Vision Transformers with Only 2040 ImagesPoster65 citations
- ColorFormer: Image Colorization via Color Memory Assisted Hybrid-Attention TransformerPoster64 citations
- FS-COCO: Towards Understanding of Freehand Sketches of Common Objects in ContextPoster64 citations
- Global-Local Motion Transformer for Unsupervised Skeleton-Based Action LearningPoster64 citations
- Learning Implicit Feature Alignment Function for Semantic SegmentationPoster64 citations
- Learning to Detect Every Thing in an Open WorldPoster64 citations
- Learning to Weight Samples for Dynamic Early-Exiting NetworksPoster64 citations
- Lidar Point Cloud Guided Monocular 3D Object DetectionPoster64 citations
- Optimal Transport for Label-Efficient Visible-Infrared Person Re-identificationPoster64 citations
- Patch Similarity Aware Data-Free Quantization for Vision TransformersPoster64 citations
- Point-to-Box Network for Accurate Object Detection via Single Point SupervisionPoster64 citations
- Quantized GAN for Complex Music Generation from Dance VideosPoster64 citations
- BlobGAN: Spatially Disentangled Scene RepresentationsPoster63 citations
- Explaining Deepfake Detection by Analysing Image MatchingPoster63 citations
- Exploring Lottery Ticket Hypothesis in Spiking Neural NetworksPoster63 citations
- Learning Ego 3D Representation As Ray TracingPoster63 citations
- Locality Guidance for Improving Vision Transformers on Tiny DatasetsPoster63 citations
- Modality Synergy Complement Learning with Cascaded Aggregation for Visible-Infrared Person Re-identificationPoster63 citations
- Self-Filtering: A Noise-Aware Sample Selection for Label Noise with Confidence PenalizationPoster63 citations
- Webly Supervised Concept Expansion for General Purpose Vision ModelsPoster63 citations
- Zero-Shot Category-Level Object Pose EstimationPoster63 citations
- Auto-FedRL: Federated Hyperparameter Optimization for Multi-Institutional Medical Image SegmentationPoster62 citations
- DecoupleNet: Decoupled Network for Domain Adaptive Semantic SegmentationPoster62 citations
- Domain Randomization-Enhanced Depth Simulation and Restoration for Perceiving and Grasping Specular and Transparent ObjectsPoster62 citations
- ParticleSfM: Exploiting Dense Point Trajectories for Localizing Moving Cameras in the WildPoster62 citations
- What Matters for 3D Scene Flow NetworkPoster62 citations
- CoSCL: Cooperation of Small Continual Learners Is Stronger than a Big OnePoster61 citations
- CramNet: Camera-Radar Fusion with Ray-Constrained Cross-Attention for Robust 3D Object DetectionPoster61 citations
- Faster VoxelPose: Real-Time 3D Human Pose Estimation by Orthographic ProjectionPoster61 citations
- Physically-Based Editing of Indoor Scene Lighting from a Single ImagePoster61 citations
- Realistic Blur Synthesis for Learning Image DeblurringPoster61 citations
- Action Quality Assessment with Temporal Parsing TransformerPoster60 citations
- Discover and Mitigate Unknown Biases with Debiasing Alternate NetworksPoster60 citations
- Exploring Disentangled Content Information for Face Forgery DetectionPoster60 citations
- GLASS: Global to Local Attention for Scene-Text SpottingPoster60 citations
- InfiniteNature-Zero: Learning Perpetual View Generation of Natural Scenes from Single ImagesPoster60 citations
- Responsive Listening Head Generation: A Benchmark Dataset and BaselinePoster60 citations
- Rethinking IoU-Based Optimization for Single-Stage 3D Object DetectionPoster60 citations
- Tracking Objects As Pixel-Wise DistributionsPoster60 citations
- Adaptive Cross-Domain Learning for Generalizable Person Re-identificationPoster59 citations
- Contrastive Deep SupervisionPoster59 citations
- Difficulty-Aware Simulator for Open Set RecognitionPoster59 citations
- FashionViL: Fashion-Focused Vision-and-Language Representation LearningPoster59 citations
- Learning Quality-Aware Dynamic Memory for Video Object SegmentationPoster59 citations
- MeshMAE: Masked Autoencoders for 3D Mesh Data AnalysisPoster59 citations
- My View Is the Best View: Procedure Learning from Egocentric VideosPoster59 citations
- Reliable Visual Question Answering: Abstain Rather Than Answer IncorrectlyPoster59 citations
- Rethinking Confidence Calibration for Failure PredictionPoster59 citations
- S3C: Self-Supervised Stochastic Classifiers for Few-Shot Class-Incremental LearningPoster59 citations
- Self-Supervision Can Be a Good Few-Shot LearnerPoster59 citations
- Towards Open-Vocabulary Scene Graph Generation with Prompt-Based FinetuningPoster59 citations
- X-DETR: A Versatile Architecture for Instance-Wise Vision-Language TasksPoster59 citations
- CMD: Self-Supervised 3D Action Representation Learning with Cross-Modal Mutual DistillationPoster58 citations
- ClearPose: Large-Scale Transparent Object Dataset and BenchmarkPoster58 citations
- Compound Prototype Matching for Few-Shot Action RecognitionPoster58 citations
- Dynamic 3D Scene Analysis by Point Cloud AccumulationPoster58 citations
- Language-Driven Artistic Style TransferPoster58 citations
- Learning Topological Interactions for Multi-Class Medical Image SegmentationPoster58 citations
- Learning from Unlabeled 3D Environments for Vision-and-Language NavigationPoster58 citations
- Switchable Online Knowledge DistillationPoster58 citations
- The Challenges of Continuous Self-Supervised LearningPoster58 citations
- Visual Cross-View Metric Localization with Dense Uncertainty EstimatesPoster58 citations
- 3D Clothed Human Reconstruction in the WildPoster57 citations
- ConMatch: Semi-Supervised Learning with Confidence-Guided Consistency RegularizationPoster57 citations
- Multiview Stereo with Cascaded Epipolar RAFTPoster57 citations
- Not Just Streaks: Towards Ground Truth for Single Image DerainingPoster57 citations
- PRIME: A Few Primitives Can Boost Robustness to Common CorruptionsPoster57 citations
- PolarMOT: How Far Can Geometric Relations Take Us in 3D Multi-Object Tracking?Poster57 citations
- RBP-Pose: Residual Bounding Box Projection for Category-Level Pose EstimationPoster57 citations
- STEEX: Steering Counterfactual Explanations with SemanticsPoster57 citations
- Transfer without ForgettingPoster57 citations
- 3D Instances as 1D KernelsPoster56 citations
- Learning Visual Representation from Modality-Shared Contrastive Language-Image Pre-trainingPoster56 citations
- PRIF: Primary Ray-Based Implicit FunctionPoster56 citations
- SepLUT: Separable Image-Adaptive Lookup Tables for Real-Time Image EnhancementPoster56 citations
- Source-Free Domain Adaptation with Contrastive Domain Alignment and Self-Supervised Exploration for Face Anti-SpoofingPoster56 citations
- Spike Transformer: Monocular Depth Estimation for Spiking CameraPoster56 citations
- Style-Guided Shadow RemovalPoster56 citations
- TOCH: Spatio-Temporal Object-to-Hand Correspondence for Motion RefinementPoster56 citations
- Vote from the Center: 6 DoF Pose Estimation in RGB-D Images by Radial Keypoint VotingPoster56 citations
- Adversarial Erasing Framework via Triplet with Gated Pyramid Pooling Layer for Weakly Supervised Semantic SegmentationPoster55 citations
- Autoregressive 3D Shape Generation via Canonical MappingPoster55 citations
- Generalizable Medical Image Segmentation via Random Amplitude Mixup and Domain-Specific Image RestorationPoster55 citations
- OOD-CV: A Benchmark for Robustness to Out-of-Distribution Shifts of Individual Nuisances in Natural ImagesPoster55 citations
- PTSEFormer: Progressive Temporal-Spatial Enhanced TransFormer towards Video Object DetectionPoster55 citations
- StretchBEV: Stretching Future Instance Prediction Spatially and TemporallyPoster55 citations
- Uncertainty-DTW for Time Series and SequencesPoster55 citations
- 3D Interacting Hand Pose Estimation by Hand De-Occlusion and RemovalPoster54 citations
- Diverse Human Motion Prediction Guided by Multi-level Spatial-Temporal AnchorsPoster54 citations
- Dynamic Local Aggregation Network with Adaptive Clusterer for Anomaly DetectionPoster54 citations
- FBNet: Feedback Network for Point Cloud CompletionPoster54 citations
- Metric Learning Based Interactive Modulation for Real-World Super-ResolutionPoster54 citations
- Prototype-Guided Continual Adaptation for Class-Incremental Unsupervised Domain AdaptationPoster54 citations
- StyleLight: HDR Panorama Generation for Lighting Estimation and EditingPoster54 citations
- StyleSwap: Style-Based Generator Empowers Robust Face SwappingPoster54 citations
- UnrealEgo: A New Dataset for Robust Egocentric 3D Human Motion CapturePoster54 citations
- Detecting and Recovering Sequential DeepFake ManipulationPoster53 citations
- Global Spectral Filter Memory Network for Video Object SegmentationPoster53 citations
- Knowledge Condensation DistillationPoster53 citations
- Learning Long-Term Spatial-Temporal Graphs for Active Speaker DetectionPoster53 citations
- Long-Tailed Class Incremental LearningPoster53 citations
- PANDORA: Polarization-Aided Neural Decomposition of RadiancePoster53 citations
- Panoptic-PartFormer: Learning a Unified Model for Panoptic Part SegmentationPoster53 citations
- The Abduction of Sherlock Holmes: A Dataset for Visual Abductive ReasoningPoster53 citations
- Attention Diversification for Domain GeneralizationPoster52 citations
- Bi-Level Feature Alignment for Versatile Image Translation and ManipulationPoster52 citations
- CLIP-Actor: Text-Driven Recommendation and Stylization for Animating Human MeshesPoster52 citations
- ECCV Caption: Correcting False Negatives by Collecting Machine-and-Human-Verified Image-Caption Associations for MS-COCOPoster52 citations
- Levenshtein OCRPoster52 citations
- MORE: Multi-Order RElation Mining for Dense Captioning in 3D ScenesPoster52 citations
- MVDG: A Unified Multi-View Framework for Domain GeneralizationPoster52 citations
- Novel Class Discovery without ForgettingPoster52 citations
- Perspective Flow Aggregation for Data-Limited 6D Object Pose EstimationPoster52 citations
- Towards Efficient Adversarial Training on Vision TransformersPoster52 citations
- Tracking Every Thing in the WildPoster52 citations
- TransFGU: A Top-down Approach to Fine-Grained Unsupervised Semantic SegmentationPoster52 citations
- Unsupervised Domain Adaptation for Monocular 3D Object Detection via Self-TrainingPoster52 citations
- A Level Set Theory for Neural Implicit Evolution under Explicit FlowsPoster51 citations
- Counterfactual Intervention Feature Transfer for Visible-Infrared Person Re-identificationPoster51 citations
- Differentiable Zooming for Multiple Instance Learning on Whole-Slide ImagesPoster51 citations
- DynaST: Dynamic Sparse Transformer for Exemplar-Guided Image GenerationPoster51 citations
- Dynamically Transformed Instance Normalization Network for Generalizable Person Re-identificationPoster51 citations
- FairGRAPE: Fairness-Aware GRAdient Pruning mEthod for Face Attribute ClassificationPoster51 citations
- Hierarchical Contrastive Inconsistency Learning for Deepfake Video DetectionPoster51 citations
- LGV: Boosting Adversarial Example Transferability from Large Geometric VicinityPoster51 citations
- Neural Video Compression Using GANs for Detail Synthesis and PropagationPoster51 citations
- AlphaVC: High-Performance and Efficient Learned Video CompressionPoster50 citations
- Improved Masked Image Generation with Token-CriticPoster50 citations
- Is Geometry Enough for Matching in Visual Localization?Poster50 citations
- Learning Implicit Templates for Point-Based Clothed Human ModelingPoster50 citations
- Learning with Recoverable ForgettingPoster50 citations
- Mimic Embedding via Adaptive Aggregation: Learning Generalizable Person Re-identificationPoster50 citations
- Neural Radiance Transfer Fields for Relightable Novel-View Synthesis with Global IlluminationPoster50 citations
- PT4AL: Using Self-Supervised Pretext Tasks for Active LearningPoster50 citations
- Studying Bias in GANs through the Lens of RacePoster50 citations
- TIDEE: Tidying Up Novel Rooms Using Visuo-Semantic Commonsense PriorsPoster50 citations
- CoMER: Modeling Coverage for Transformer-Based Handwritten Mathematical Expression RecognitionPoster49 citations
- Contrastive Positive Mining for Unsupervised 3D Action Representation LearningPoster49 citations
- DVS-Voltmeter: Stochastic Process-Based Event Simulator for Dynamic Vision SensorsPoster49 citations
- Deep Hash Distillation for Image RetrievalPoster49 citations
- Geometry-Guided Progressive NeRF for Generalizable and Efficient Neural Human RenderingPoster49 citations
- MILES: Visual BERT Pre-training with Injected Language Semantics for Video-Text RetrievalPoster49 citations
- Multi-Domain Learning for Updating Face Anti-Spoofing ModelsPoster49 citations
- Multi-faceted Distillation of Base-Novel Commonality for Few-Shot Object DetectionPoster49 citations
- Pose for Everything: Towards Category-Agnostic Pose EstimationPoster49 citations
- Shap-CAM: Visual Explanations for Convolutional Neural Networks Based on Shapley ValuePoster49 citations
- Sim-2-Sim Transfer for Vision-and-Language Navigation in Continuous EnvironmentsPoster49 citations
- Towards Sequence-Level Training for Visual TrackingPoster49 citations
- A Large-Scale Multiple-Objective Method for Black-Box Attack against Object DetectionPoster48 citations
- Approximate Differentiable Rendering with Algebraic SurfacesPoster48 citations
- Balancing Stability and Plasticity through Advanced Null Space in Continual LearningPoster48 citations
- ECLIPSE: Efficient Long-Range Video Retrieval Using Sight and SoundPoster48 citations
- FADE: Fusing the Assets of Decoder and Encoder for Task-Agnostic UpsamplingPoster48 citations
- IGFormer: Interaction Graph Transformer for Skeleton-Based Human Interaction RecognitionPoster48 citations
- Mining Cross-Person Cues for Body-Part Interactiveness Learning in HOI DetectionPoster48 citations
- Neighborhood Collective Estimation for Noisy Label Identification and CorrectionPoster48 citations
- Privacy-Preserving Face Recognition with Learnable Privacy Budgets in Frequency DomainPoster48 citations
- Relighting4D: Neural Relightable Human from VideosPoster48 citations
- Shift-tolerant Perceptual Similarity MetricPoster48 citations
- StARformer: Transformer with State-Action-Reward Representations for Visual Reinforcement LearningPoster48 citations
- Weakly Supervised 3D Scene Segmentation with Region-Level Boundary Awareness and Instance DiscriminationPoster48 citations
- Weakly Supervised Object Localization via Transformer with Implicit Spatial CalibrationPoster48 citations
- Adaptive Agent Transformer for Few-Shot SegmentationPoster47 citations
- Hierarchically Self-Supervised Transformer for Human Skeleton Representation LearningPoster47 citations
- Prior-Guided Adversarial Initialization for Fast Adversarial TrainingPoster47 citations
- Spatio-Temporal Deformable Attention Network for Video DeblurringPoster47 citations
- Teaching Where to Look: Attention Similarity Knowledge Distillation for Low Resolution Face RecognitionPoster47 citations
- VecGAN: Image-to-Image Translation with Interpretable Latent DirectionsPoster47 citations
- "Towards Scale-Aware, Robust, and Generalizable Unsupervised Monocular Depth Estimation by Integrating IMU Motion Dynamics"Poster46 citations
- "UniNet: Unified Architecture Search with Convolution, Transformer, and MLP"Poster46 citations
- Controllable and Guided Face Synthesis for Unconstrained Face RecognitionPoster46 citations
- Enhanced Accuracy and Robustness via Multi-Teacher Adversarial DistillationPoster46 citations
- Graph Neural Network for Cell Tracking in Microscopy VideosPoster46 citations
- Interclass Prototype Relation for Few-Shot SegmentationPoster46 citations
- Learning Spatiotemporal Frequency-Transformer for Compressed Video Super-ResolutionPoster46 citations
- MetaGait: Learning to Learn an Omni Sample Adaptive Representation for Gait RecognitionPoster46 citations
- Multi-Exit Semantic Segmentation NetworksPoster46 citations
- Spatial-Separated Curve Rendering Network for Efficient and High-Resolution Image HarmonizationPoster46 citations
- A Unified Framework for Domain Adaptive Pose EstimationPoster45 citations
- Almost-Orthogonal Layers for Efficient General-Purpose Lipschitz NetworksPoster45 citations
- Black-Box Dissector: Towards Erasing-Based Hard-Label Model Stealing AttackPoster45 citations
- Boosting Transferability of Targeted Adversarial Examples via Hierarchical Generative NetworksPoster45 citations
- CADyQ: Content-Aware Dynamic Quantization for Image Super-ResolutionPoster45 citations
- DANBO: Disentangled Articulated Neural Body Representations via Graph Neural NetworksPoster45 citations
- Designing One Unified Framework for High-Fidelity Face Reenactment and SwappingPoster45 citations
- ExtrudeNet: Unsupervised Inverse Sketch-and-Extrude for Shape ParsingPoster45 citations
- Learn2Augment: Learning to Composite Videos for Data Augmentation in Action RecognitionPoster45 citations
- Mc-BEiT: Multi-Choice Discretization for Image BERT Pre-trainingPoster45 citations
- Parameterized Temperature Scaling for Boosting the Expressive Power in Post-Hoc Uncertainty CalibrationPoster45 citations
- Prune Your Model before Distill ItPoster45 citations
- RadioTransformer: A Cascaded Global-Focal Transformer for Visual Attention-Guided Disease ClassificationPoster45 citations
- Self-Promoted Supervision for Few-Shot TransformerPoster45 citations
- Semi-Supervised Vision TransformersPoster45 citations
- Unpaired Deep Image Dehazing Using Contrastive Disentanglement LearningPoster45 citations
- "Spotting Temporally Precise, Fine-Grained Events in Video"Poster44 citations
- Acknowledging the Unknown for Multi-Label Learning with Single Positive LabelsPoster44 citations
- Class-Incremental Learning with Cross-Space Clustering and Controlled TransferPoster44 citations
- Context-Enhanced Stereo TransformerPoster44 citations
- CryoAI: Amortized Inference of Poses for Ab Initio Reconstruction of 3D Molecular Volumes from Real Cryo-EM ImagesPoster44 citations
- Dual Contrastive Learning with Anatomical Auxiliary Supervision for Few-Shot Medical Image SegmentationPoster44 citations
- Efficient Deep Visual and Inertial Odometry with Adaptive Visual Modality SelectionPoster44 citations
- Grounding Visual Representations with Texts for Domain GeneralizationPoster44 citations
- HDR-Plenoxels: Self-Calibrating High Dynamic Range Radiance FieldsPoster44 citations
- Image Coding for Machines with Omnipotent Feature LearningPoster44 citations
- Lightweight Attentional Feature Fusion: A New Baseline for Text-to-Video RetrievalPoster44 citations
- MVSalNet:Multi-View Augmentation for RGB-D Salient Object DetectionPoster44 citations
- Monitored Distillation for Positive Congruent Depth CompletionPoster44 citations
- Neural Strands: Learning Hair Geometry and Appearance from Multi-View ImagesPoster44 citations
- Object Discovery via Contrastive Learning for Weakly Supervised Object DetectionPoster44 citations
- PolyphonicFormer: Unified Query Learning for Depth-Aware Video Panoptic SegmentationPoster44 citations
- Real Spike: Learning Real-Valued Spikes for Spiking Neural NetworksPoster44 citations
- Scale-Aware Spatio-Temporal Relation Learning for Video Anomaly DetectionPoster44 citations
- Sem2NeRF: Converting Single-View Semantic Masks to Neural Radiance FieldsPoster44 citations
- Source-Free Video Domain Adaptation by Learning Temporal Consistency for Action RecognitionPoster44 citations
- D&D: Learning Human Dynamics from Dynamic CameraPoster43 citations
- DeltaGAN: Towards Diverse Few-Shot Image Generation with Sample-Specific DeltaPoster43 citations
- Image-Based CLIP-Guided Essence TransferPoster43 citations
- Language Matters: A Weakly Supervised Vision-Language Pre-training Approach for Scene Text Detection and SpottingPoster43 citations
- Learning Invariant Visual Representations for Compositional Zero-Shot LearningPoster43 citations
- Learning Prior Feature and Attention Enhanced Image InpaintingPoster43 citations
- Learning to Drive by Watching YouTube Videos: Action-Conditioned Contrastive Policy PretrainingPoster43 citations
- Online Continual Learning with Contrastive Vision TransformerPoster43 citations
- Prediction-Guided Distillation for Dense Object DetectionPoster43 citations
- Reducing Information Loss for Spiking Neural NetworksPoster43 citations
- Spatiotemporal Self-Attention Modeling with Temporal Patch Shift for Action RecognitionPoster43 citations
- TALISMAN: Targeted Active Learning for Object Detection with Rare Classes and Slices Using Submodular Mutual InformationPoster43 citations
- An Information Theoretic Approach for Attention-Driven Face Forgery DetectionPoster42 citations
- Blind Image DecompositionPoster42 citations
- Constructing Balance from Imbalance for Long-Tailed Image RecognitionPoster42 citations
- Cross-Domain Ensemble Distillation for Domain GeneralizationPoster42 citations
- Densely Constrained Depth Estimator for Monocular 3D Object DetectionPoster42 citations
- EleGANt: Exquisite and Locally Editable GAN for Makeup TransferPoster42 citations
- Inductive and Transductive Few-Shot Video Classification via Appearance and Temporal AlignmentsPoster42 citations
- Making Heads or Tails: Towards Semantically Consistent Visual CounterfactualsPoster42 citations
- Mining Relations among Cross-Frame Affinities for Video Semantic SegmentationPoster42 citations
- Pose Forecasting in Industrial Human-Robot CollaborationPoster42 citations
- Pre-training Strategies and Datasets for Facial Representation LearningPoster42 citations
- Self-Calibrating Photometric Stereo by Neural Inverse RenderingPoster42 citations
- Structure and Motion from Casual VideosPoster42 citations
- Tackling Background Distraction in Video Object SegmentationPoster42 citations
- Tree Structure-Aware Few-Shot Image Classification via Hierarchical AggregationPoster42 citations
- Bilateral Normal IntegrationPoster41 citations
- CLASTER: Clustering with Reinforcement Learning for Zero-Shot Action RecognitionPoster41 citations
- Doubly Deformable Aggregation of Covariance Matrices for Few-Shot SegmentationPoster41 citations
- Eliminating Gradient Conflict in Reference-Based Line-Art ColorizationPoster41 citations
- Event-Guided Deblurring of Unknown Exposure Time VideosPoster41 citations
- Gradient-Based Uncertainty for Monocular Depth EstimationPoster41 citations
- MorphMLP: An Efficient MLP-Like Backbone for Spatial-Temporal Representation LearningPoster41 citations
- Neural Light Field Estimation for Street Scenes with Differentiable Virtual Object InsertionPoster41 citations
- Prior Knowledge Guided Unsupervised Domain AdaptationPoster41 citations
- REALY: Rethinking the Evaluation of 3D Face ReconstructionPoster41 citations
- RepMix: Representation Mixing for Robust Attribution of Synthesized ImagesPoster41 citations
- Skeleton-Free Pose Transfer for Stylized 3D CharactersPoster41 citations
- Understanding Collapse in Non-Contrastive Siamese Representation LearningPoster41 citations
- Unsupervised Selective Labeling for More Effective Semi-Supervised LearningPoster41 citations
- You Should Look at All ObjectsPoster41 citations
- "Fashionformer: A Simple, Effective and Unified Baseline for Human Fashion Segmentation and Recognition"Poster40 citations
- 3D-Aware Semantic-Guided Generative Model for Human SynthesisPoster40 citations
- An Efficient Spatio-Temporal Pyramid Transformer for Action DetectionPoster40 citations
- AvatarCap: Animatable Avatar Conditioned Monocular Human Volumetric CapturePoster40 citations
- CATRE: Iterative Point Clouds Alignment for Category-Level Object Pose RefinementPoster40 citations
- Cross-Domain Few-Shot Semantic SegmentationPoster40 citations
- Learned Vertex Descent: A New Direction for 3D Human Model FittingPoster40 citations
- PreTraM: Self-Supervised Pre-training via Connecting Trajectory and MapPoster40 citations
- Sound-Guided Semantic Video GenerationPoster40 citations
- Towards Hard-Positive Query Mining for DETR-Based Human-Object Interaction DetectionPoster40 citations
- Towards Ultra Low Latency Spiking Neural Networks for Vision and Sequential Tasks Using Temporal PruningPoster40 citations
- Where in the World Is This Image? Transformer-Based Geo-Localization in the WildPoster40 citations
- A Sketch Is Worth a Thousand Words: Image Retrieval with Text and SketchPoster39 citations
- Action-Based Contrastive Learning for Trajectory PredictionPoster39 citations
- COMPOSER: Compositional Reasoning of Group Activity in Videos with Keypoint-Only ModalityPoster39 citations
- CP2: Copy-Paste Contrastive Pretraining for Semantic SegmentationPoster39 citations
- FLEX: Extrinsic Parameters-Free Multi-View 3D Human Motion ReconstructionPoster39 citations
- GeoAug: Data Augmentation for Few-Shot NeRF with Geometry ConstraintsPoster39 citations
- Hunting Group Clues with Transformers for Social Group Activity RecognitionPoster39 citations
- Label2Label: A Language Modeling Framework for Multi-Attribute LearningPoster39 citations
- Latent Partition Implicit with Surface Codes for 3D RepresentationPoster39 citations
- MuLUT: Cooperating Multiple Look-Up Tables for Efficient Image Super-ResolutionPoster39 citations
- PREF: Predictability Regularized Neural Motion FieldsPoster39 citations
- Personalizing Federated Medical Image Segmentation via Local CalibrationPoster39 citations
- Rethinking Closed-Loop Training for Autonomous DrivingPoster39 citations
- Teaching with Soft Label Smoothing for Mitigating Noisy Labels in Facial ExpressionsPoster39 citations
- Unstructured Feature Decoupling for Vehicle Re-identificationPoster39 citations
- ARM: Any-Time Super-Resolution MethodPoster38 citations
- AcroFOD: An Adaptive Method for Cross-Domain Few-Shot Object DetectionPoster38 citations
- Adversarially-Aware Robust Object DetectorPoster38 citations
- D3Net: A Unified Speaker-Listener Architecture for 3D Dense Captioning and Visual GroundingPoster38 citations
- DevNet: Self-Supervised Monocular Depth Learning via Density Volume ConstructionPoster38 citations
- Error Compensation Framework for Flow-Guided Video InpaintingPoster38 citations
- GraphCSPN: Geometry-Aware Depth Completion via Dynamic GCNsPoster38 citations
- Helpful or Harmful: Inter-Task Association in Continual LearningPoster38 citations
- High-Fidelity GAN Inversion with Padding SpacePoster38 citations
- IntegratedPIFu: Integrated Pixel Aligned Implicit Function for Single-View Human ReconstructionPoster38 citations
- Multimodal Transformer with Variable-Length Memory for Vision-and-Language NavigationPoster38 citations
- Not All Models Are Equal: Predicting Model Transferability in a Self-Challenging Fisher SpacePoster38 citations
- OPD: Single-View 3D Openable Part DetectionPoster38 citations
- PD-Flow: A Point Cloud Denoising Framework with Normalizing FlowsPoster38 citations
- PalGAN: Image Colorization with Palette Generative Adversarial NetworksPoster38 citations
- Self-Supervised Classification NetworkPoster38 citations
- Semi-Supervised Keypoint Detector and Descriptor for Retinal Image MatchingPoster38 citations
- The Anatomy of Video Editing: A Dataset and Benchmark Suite for AI-Assisted Video EditingPoster38 citations
- UCTNet: Uncertainty-Aware Cross-Modal Transformer Network for Indoor RGB-D Semantic SegmentationPoster38 citations
- Unsupervised Deep Multi-Shape MatchingPoster38 citations
- Video Mask Transfiner for High-Quality Video Instance SegmentationPoster38 citations
- 3D-Aware Indoor Scene Synthesis with Depth PriorsPoster37 citations
- BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object SegmentationPoster37 citations
- CODER: Coupled Diversity-Sensitive Momentum Contrastive Learning for Image-Text RetrievalPoster37 citations
- Can Shuffling Video Benefit Temporal Bias Problem: A Novel Training Framework for Temporal GroundingPoster37 citations
- Completely Self-Supervised Crowd Counting via Distribution MatchingPoster37 citations
- Dense Gaussian Processes for Few-Shot SegmentationPoster37 citations
- Dual Adaptive Transformations for Weakly Supervised Point Cloud SegmentationPoster37 citations
- Explicit Occlusion Reasoning for Multi-Person 3D Human Pose EstimationPoster37 citations
- Face2Faceρ: Real-Time High-Resolution One-Shot Face ReenactmentPoster37 citations
- FakeCLR: Exploring Contrastive Learning for Solving Latent Discontinuity in Data-Efficient GANsPoster37 citations
- Improving the Perceptual Quality of 2D Animation InterpolationPoster37 citations
- L-CoDer: Language-Based Colorization with Color-Object Decoupling TransformerPoster37 citations
- LaTeRF: Label and Text Driven Object Radiance FieldsPoster37 citations
- Learning Algebraic Representation for Systematic Generalization in Abstract ReasoningPoster37 citations
- Learning Efficient Multi-agent Cooperative Visual ExplorationPoster37 citations
- Open-World Semantic Segmentation for LIDAR Point CloudsPoster37 citations
- Point Cloud Domain Adaptation via Masked Local 3D Structure PredictionPoster37 citations
- PoseTrans: A Simple yet Effective Pose Transformation Augmentation for Human Pose EstimationPoster37 citations
- Scaling Adversarial Training to Large Perturbation BoundsPoster37 citations
- Self-Slimmed Vision TransformerPoster37 citations
- Social ODE: Multi-agent Trajectory Forecasting with Neural Ordinary Differential EquationsPoster37 citations
- Temporal and Cross-Modal Attention for Audio-Visual Zero-Shot LearningPoster37 citations
- The Caltech Fish Counting Dataset: A Benchmark for Multiple-Object Tracking and CountingPoster37 citations
- AudioScopeV2: Audio-Visual Attention Architectures for Calibrated Open-Domain On-Screen Sound SeparationPoster36 citations
- Disentangling Architecture and Training for Optical FlowPoster36 citations
- Efficient One Pass Self-Distillation with Zipf’s Label SmoothingPoster36 citations
- End-to-End Active Speaker DetectionPoster36 citations
- High-Fidelity Image Inpainting with GAN InversionPoster36 citations
- Improving the Intra-Class Long-Tail in 3D Detection via Rare Example MiningPoster36 citations
- Joint-Modal Label Denoising for Weakly-Supervised Audio-Visual Video ParsingPoster36 citations
- KD-MVS: Knowledge Distillation Based Self-Supervised Learning for Multi-View StereoPoster36 citations
- KXNet: A Model-Driven Deep Neural Network for Blind Super-ResolutionPoster36 citations
- OIMNet++: Prototypical Normalization and Localization-Aware Learning for Person SearchPoster36 citations
- On the Versatile Uses of Partial Distance Correlation in Deep LearningPoster36 citations
- Out-of-Distribution Detection with Semantic Mismatch under MaskingPoster36 citations
- PACTran: PAC-Bayesian Metrics for Estimating the Transferability of Pretrained Models to Classification TasksPoster36 citations
- Self-Distillation for Robust LiDAR Semantic Segmentation in Autonomous DrivingPoster36 citations
- Share with Thy Neighbors: Single-View Reconstruction by Cross-Instance ConsistencyPoster36 citations
- Unsupervised Visual Representation Learning by Synchronous Momentum GroupingPoster36 citations
- Where to Focus: Investigating Hierarchical Attention Relationship for Fine-Grained Visual ClassificationPoster36 citations
- 3D Object Detection with a Self-Supervised Lidar Scene Flow BackbonePoster35 citations
- Adaptive Face Forgery Detection in Cross DomainPoster35 citations
- Adaptive Spatial-BCE Loss for Weakly Supervised Semantic SegmentationPoster35 citations
- BRNet: Exploring Comprehensive Features for Monocular Depth EstimationPoster35 citations
- Bi-directional Contrastive Learning for Domain Adaptive Semantic SegmentationPoster35 citations
- Compiler-Aware Neural Architecture Search for On-Mobile Real-Time Super-ResolutionPoster35 citations
- Contrastive Vision-Language Pre-training with Limited ResourcesPoster35 citations
- DetMatch: Two Teachers Are Better than One for Joint 2D and 3D Semi-Supervised Object DetectionPoster35 citations
- Efficient Video Deblurring Guided by Motion MagnitudePoster35 citations
- FingerprintNet: Synthesized Fingerprints for Generated Image DetectionPoster35 citations
- GitNet: Geometric Prior-Based Transformation for Birds-Eye-View SegmentationPoster35 citations
- Improving Fine-Grained Visual Recognition in Low Data Regimes via Self-Boosting Attention MechanismPoster35 citations
- Multi-modal Masked Pre-training for Monocular Panoramic Depth CompletionPoster35 citations
- Neural-Sim: Learning to Generate Training Data with NeRFPoster35 citations
- Temporally Consistent Semantic Video EditingPoster35 citations
- Towards Racially Unbiased Skin Tone Estimation via Scene DisambiguationPoster35 citations
- Unifying Event Detection and Captioning as Sequence Generation via Pre-trainingPoster35 citations
- BA-Net: Bridge Attention for Deep Convolutional Neural NetworksPoster34 citations
- Benchmarking Omni-Vision Representation through the Lens of Visual RealmsPoster34 citations
- Cross-Modal 3D Shape Generation and ManipulationPoster34 citations
- EAutoDet: Efficient Architecture Search for Object DetectionPoster34 citations
- Ensemble Learning Priors Driven Deep Unfolding for Scalable Video Snapshot Compressive ImagingPoster34 citations
- Geometry-Aware Single-Image Full-Body Human RelightingPoster34 citations
- Hardly Perceptible Trojan Attack against Neural Networks with Bit FlipsPoster34 citations
- Look Both Ways: Self-Supervising Driver Gaze Estimation and Road Scene SaliencyPoster34 citations
- MovieCuts: A New Dataset and Benchmark for Cut Type RecognitionPoster34 citations
- Object Level Depth Reconstruction for Category Level 6D Object Pose Estimation from Monocular RGB ImagePoster34 citations
- Optimal Boxes: Boosting End-to-End Scene Text Recognition by Adjusting Annotated Bounding Boxes via Reinforcement LearningPoster34 citations
- PCR-CG: Point Cloud Registration via Deep Explicit Color and GeometryPoster34 citations
- Pairwise Contrastive Learning Network for Action Quality AssessmentPoster34 citations
- Pointly-Supervised Panoptic SegmentationPoster34 citations
- Rethinking Learning Approaches for Long-Term Action AnticipationPoster34 citations
- Revisiting Point Cloud Simplification: A Learnable Feature Preserving ApproachPoster34 citations
- Robust Object Detection with Inaccurate Bounding BoxesPoster34 citations
- Self-Distilled Feature Aggregation for Self-Supervised Monocular Depth EstimationPoster34 citations
- Social-SSL: Self-Supervised Cross-Sequence Representation Learning Based on Transformers for Multi-agent Trajectory PredictionPoster34 citations
- Towards High-Fidelity Single-View Holistic Reconstruction of Indoor ScenesPoster34 citations
- "Contributions of Shape, Texture, and Color in Visual Recognition"Poster33 citations
- A Closer Look at Invariances in Self-Supervised Pre-training for 3D VisionPoster33 citations
- AssistQ: Affordance-Centric Question-Driven Task Completion for Egocentric AssistantPoster33 citations
- Contrastive Vicinal Space for Unsupervised Domain AdaptationPoster33 citations
- DLME: Deep Local-Flatness Manifold EmbeddingPoster33 citations
- Decoupled Adversarial Contrastive Learning for Self-Supervised Adversarial RobustnessPoster33 citations
- Depth Map Decomposition for Monocular Depth EstimationPoster33 citations
- Exploring the Devil in Graph Spectral Domain for 3D Point Cloud AttacksPoster33 citations
- GIPSO: Geometrically Informed Propagation for Online Adaptation in 3D LiDAR SegmentationPoster33 citations
- Geometric Representation Learning for Document Image RectificationPoster33 citations
- Learning Series-Parallel Lookup Tables for Efficient Image Super-ResolutionPoster33 citations
- LiDAL: Inter-Frame Uncertainty Based Active Learning for 3D LiDAR Semantic SegmentationPoster33 citations
- Polarimetric Pose PredictionPoster33 citations
- Predicting Is Not Understanding: Recognizing and Addressing Underspecification in Machine LearningPoster33 citations
- Revisiting a kNN-based Image Classification System with High-capacity StoragePoster33 citations
- SUPR: A Sparse Unified Part-Based Human RepresentationPoster33 citations
- Sliced Recursive TransformerPoster33 citations
- Towards Open Set Video Anomaly DetectionPoster33 citations
- Towards Unbiased Label Distribution Learning for Facial Pose Estimation Using Anisotropic Spherical GaussianPoster33 citations
- AirDet: Few-Shot Detection without Fine-Tuning for Autonomous ExplorationPoster32 citations
- Camera Pose Auto-Encoders for Improving Pose RegressionPoster32 citations
- Discovering Transferable Forensic Features for CNN-Generated Images DetectionPoster32 citations
- Fast-Vid2Vid: Spatial-Temporal Compression for Video-to-Video SynthesisPoster32 citations
- InAction: Interpretable Action Decision Making for Autonomous DrivingPoster32 citations
- Meta Spatio-Temporal Debiasing for Video Scene Graph GenerationPoster32 citations
- Network Binarization via Contrastive LearningPoster32 citations
- Point Primitive Transformer for Long-Term 4D Point Cloud Video UnderstandingPoster32 citations
- PrivHAR: Recognizing Human Actions from Privacy-Preserving LensPoster32 citations
- RCLane: Relay Chain Prediction for Lane DetectionPoster32 citations
- SGBANet: Semantic GAN and Balanced Attention Network for Arbitrarily Oriented Scene Text RecognitionPoster32 citations
- TAFIM: Targeted Adversarial Attacks against Facial Image ManipulationsPoster32 citations
- Unpaired Image Translation via Vector Symbolic ArchitecturesPoster32 citations
- A Style-Based GAN Encoder for High Fidelity Reconstruction of Images and VideosPoster31 citations
- Active Learning Strategies for Weakly-Supervised Object DetectionPoster31 citations
- Adaptive Image Transformations for Transfer-Based Adversarial AttackPoster31 citations
- Adaptive Patch Exiting for Scalable Single Image Super-ResolutionPoster31 citations
- DELTAR: Depth Estimation from a Light-Weight ToF Sensor and RGB ImagePoster31 citations
- Dynamic Temporal Filtering In Video ModelsPoster31 citations
- Exploring Resolution and Degradation Clues As Self-Supervised Signal for Low Quality Object DetectionPoster31 citations
- Fast-MoCo: Boost Momentum-Based Contrastive Learning with Combinatorial PatchesPoster31 citations
- HULC: 3D HUman Motion Capture with Pose Manifold SampLing and Dense Contact GuidancePoster31 citations
- Hierarchical Memory Learning for Fine-Grained Scene Graph GenerationPoster31 citations
- MUGEN: A Playground for Video-Audio-Text Multimodal Understanding and GENerationPoster31 citations
- RBC: Rectifying the Biased Context in Continual Semantic SegmentationPoster31 citations
- Sim-to-Real 6D Object Pose Estimation via Iterative Self-Training for Robotic Bin PickingPoster31 citations
- SphereFed: Hyperspherical Federated LearningPoster31 citations
- Static and Dynamic Concepts for Self-Supervised Video Representation LearningPoster31 citations
- Video Activity Localisation with Uncertainties in Temporal BoundaryPoster31 citations
- Watermark Vaccine: Adversarial Attacks to Prevent Watermark RemovalPoster31 citations
- 3D Random Occlusion and Multi-layer Projection for Deep Multi-Camera Pedestrian LocalizationPoster30 citations
- 3D-FM GAN: Towards 3D-Controllable Face ManipulationPoster30 citations
- A Dense Material Segmentation Dataset for Indoor and Outdoor Scene ParsingPoster30 citations
- A Transformer-Based Decoder for Semantic Segmentation with Multi-level Context MiningPoster30 citations
- Adaptive Fine-Grained Sketch-Based Image RetrievalPoster30 citations
- Controllable Shadow Generation Using Pixel Height MapsPoster30 citations
- Custom Structure Preservation in Face AgingPoster30 citations
- Domain Knowledge-Informed Self-Supervised Representations for Workout Form AssessmentPoster30 citations
- DoodleFormer: Creative Sketch Drawing with TransformersPoster30 citations
- Dynamic Dual Trainable Bounds for Ultra-Low Precision Super-Resolution NetworksPoster30 citations
- Dynamic Spatio-Temporal Specialization Learning for Fine-Grained Action RecognitionPoster30 citations
- IS-MVSNet: Importance Sampling-Based MVSNetPoster30 citations
- Online Domain Adaptation for Semantic Segmentation in Ever-Changing ConditionsPoster30 citations
- Open-Set Semi-Supervised Object DetectionPoster30 citations
- Point Scene Understanding via Disentangled Instance Mesh ReconstructionPoster30 citations
- Radatron: Accurate Detection Using Multi-Resolution Cascaded MIMO RadarPoster30 citations
- Robust Category-Level 6D Pose Estimation with Coarse-to-Fine Rendering of Neural FeaturesPoster30 citations
- Salient Object Detection for Point CloudsPoster30 citations
- Self-Supervised Learning for Real-World Super-Resolution from Dual Zoomed ObservationsPoster30 citations
- Semi-Supervised Temporal Action Detection with Proposal-Free MaskingPoster30 citations
- SpatialDETR: Robust Scalable Transformer-Based 3D Object Detection from Multi-View Camera Images with Global Cross-Sensor AttentionPoster30 citations
- Unsupervised Segmentation in Real-World Images via Spelke Object InferencePoster30 citations
- 3D Human Pose Estimation Using Möbius Graph Convolutional NetworksPoster29 citations
- Anti-Retroactive Interference for Lifelong LearningPoster29 citations
- Bagging Regional Classification Activation Maps for Weakly Supervised Object LocalizationPoster29 citations
- BayesCap: Bayesian Identity Cap for Calibrated Uncertainty in Frozen Neural NetworksPoster29 citations
- Centrality and Consistency: Two-Stage Clean Samples Identification for Learning with Instance-Dependent Noisy LabelsPoster29 citations
- Concurrent Subsidiary Supervision for Unsupervised Source-Free Domain AdaptationPoster29 citations
- Convolutional Embedding Makes Hierarchical Vision Transformer StrongerPoster29 citations
- CostDCNet: Cost Volume Based Depth Completion for a Single RGB-D ImagePoster29 citations
- DualFormer: Local-Global Stratified Transformer for Efficient Video RecognitionPoster29 citations
- ERA: Expert Retrieval and Assembly for Early Action PredictionPoster29 citations
- Hierarchical Feature Embedding for Visual TrackingPoster29 citations
- Injecting 3D Perception of Controllable NeRF-GAN into StyleGAN for Editable Portrait Image SynthesisPoster29 citations
- Learning Spatial-Preserved Skeleton Representations for Few-Shot Action RecognitionPoster29 citations
- Multi-Query Video RetrievalPoster29 citations
- Neural Correspondence Field for Object Pose EstimationPoster29 citations
- No Token Left Behind: Explainability-Aided Image Classification and GenerationPoster29 citations
- Panoramic Human Activity RecognitionPoster29 citations
- Pure Transformer with Integrated Experts for Scene Text RecognitionPoster29 citations
- SAFA: Sample-Adaptive Feature Augmentation for Long-Tailed Image ClassificationPoster29 citations
- SEMICON: A Learning-to-Hash Solution for Large-Scale Fine-Grained Image RetrievalPoster29 citations
- Selective TransHDR: Transformer-Based Selective HDR Imaging Using Ghost Region MaskPoster29 citations
- Target-Absent Human AttentionPoster29 citations
- Time-rEversed diffusioN tEnsor Transformer: A New TENET of Few-Shot Object DetectionPoster29 citations
- TransMatting: Enhancing Transparent Objects Matting with TransformersPoster29 citations
- Unsupervised Domain Adaptation for One-Stage Object Detector Using Offsets to Bounding BoxPoster29 citations
- tSF: Transformer-Based Semantic Filter for Few-Shot LearningPoster29 citations
- A Comparative Study of Graph Matching Algorithms in Computer VisionPoster28 citations
- A Generalized & Robust Framework for Timestamp Supervision in Temporal Action SegmentationPoster28 citations
- Accelerating Score-Based Generative Models with Preconditioned Diffusion SamplingPoster28 citations
- Audio-Driven Stylized Gesture Generation with Flow-Based ModelPoster28 citations
- CAViT: Contextual Alignment Vision Transformer for Video Object Re-identificationPoster28 citations
- Class-Agnostic Object Counting Robust to Intraclass DiversityPoster28 citations
- Equivariance and Invariance Inductive Bias for Learning from Insufficient DataPoster28 citations
- Fast and High Quality Image Denoising via Malleable ConvolutionPoster28 citations
- Filter Pruning via Feature Discrimination in Deep Neural NetworksPoster28 citations
- Hierarchical Latent Structure for Multi-modal Vehicle Trajectory ForecastingPoster28 citations
- Improving GANs for Long-Tailed Data through Group Spectral RegularizationPoster28 citations
- Iwin: Human-Object Interaction Detection via Transformer with Irregular WindowsPoster28 citations
- Learning with Noisy Labels by Efficient Transition Matrix Estimation to Combat Label MiscorrectionPoster28 citations
- Lipschitz Continuity Retained Binary Neural NetworkPoster28 citations
- Neural Capture of Animatable 3D Human from Monocular VideoPoster28 citations
- RealFlow: EM-Based Realistic Optical Flow Dataset Generation from VideosPoster28 citations
- SketchSampler: Sketch-Based 3D Reconstruction via View-Dependent Depth SamplingPoster28 citations
- The One Where They Reconstructed 3D Humans and Environments in TV ShowsPoster28 citations
- Unbiased Multi-Modality Guidance for Image InpaintingPoster28 citations
- Adversarial Contrastive Learning via Asymmetric InfoNCEPoster27 citations
- CMT: Context-Matching-Guided Transformer for 3D Tracking in Point CloudsPoster27 citations
- Detecting Tampered Scene Text in the WildPoster27 citations
- Drive&Segment: Unsupervised Semantic Segmentation of Urban Scenes via Cross-Modal DistillationPoster27 citations
- ECO-TR: Efficient Correspondences Finding via Coarse-to-Fine RefinementPoster27 citations
- Egocentric Activity Recognition and Localization on a 3D MapPoster27 citations
- FairStyle: Debiasing StyleGAN2 with Style Channel ManipulationsPoster27 citations
- Feature Representation Learning for Unsupervised Cross-Domain Image RetrievalPoster27 citations
- Few-Shot Object Detection with Model CalibrationPoster27 citations
- How Severe Is Benchmark-Sensitivity in Video Self-Supervised Learning?Poster27 citations
- Identifying Hard Noise in Long-Tailed Sample DistributionPoster27 citations
- Learning Object Placement via Dual-Path Graph CompletionPoster27 citations
- Panoramic Vision Transformer for Saliency Detection in 360° VideosPoster27 citations
- Rethinking Zero-Shot Action Recognition: Learning from Latent Atomic ActionsPoster27 citations
- Selective Query-Guided Debiasing for Video Corpus Moment RetrievalPoster27 citations
- "BodySLAM: Joint Camera Localisation, Mapping, and Human Motion Tracking"Poster26 citations
- 3D Equivariant Graph Implicit FunctionsPoster26 citations
- AdaBest: Minimizing Client Drift in Federated Learning via Adaptive Bias EstimationPoster26 citations
- DODA: Data-Oriented Sim-to-Real Domain Adaptation for 3D Semantic SegmentationPoster26 citations
- Domain Adaptive Person SearchPoster26 citations
- EAGAN: Efficient Two-Stage Evolutionary Architecture Search for GANsPoster26 citations
- Efficient Point Cloud Segmentation with Geometry-Aware Sparse NetworksPoster26 citations
- Exploring Hierarchical Graph Representation for Large-Scale Zero-Shot Image ClassificationPoster26 citations
- Few-Shot Image Generation with Mixup-Based Distance LearningPoster26 citations
- FrequencyLowCut Pooling – Plug & Play against Catastrophic OverfittingPoster26 citations
- Generative Negative Text Replay for Continual Vision-Language PretrainingPoster26 citations
- Learning Semantic Correspondence with Sparse AnnotationsPoster26 citations
- Non-uniform Step Size Quantization for Accurate Post-Training QuantizationPoster26 citations
- Outpainting by QueriesPoster26 citations
- PlaneFormers: From Sparse View Planes to 3D ReconstructionPoster26 citations
- PressureVision: Estimating Hand Pressure from a Single RGB ImagePoster26 citations
- Primitive-Based Shape Abstraction via Nonparametric Bayesian InferencePoster26 citations
- SiRi: A Simple Selective Retraining Mechanism for Transformer-Based Visual GroundingPoster26 citations
- Speaker-Adaptive Lip Reading with User-Dependent PaddingPoster26 citations
- StyleFace: Towards Identity-Disentangled Face Generation on MegapixelsPoster26 citations
- Word-Level Fine-Grained Story VisualizationPoster26 citations
- Active Audio-Visual Separation of Dynamic Sound SourcesPoster25 citations
- Animation from Blur: Multi-modal Blur Decomposition with Motion GuidancePoster25 citations
- Augmenting Deep Classifiers with Polynomial Neural NetworksPoster25 citations
- Aware of the History: Trajectory Forecasting with the Local Behavior DataPoster25 citations
- Combating Label Distribution Shift for Active Domain AdaptationPoster25 citations
- DeMFI: Deep Joint Deblurring and Multi-Frame Interpolation with Flow-Guided Attentive Correlation and Recursive BoostingPoster25 citations
- Discrete-Constrained Regression for Local Counting ModelsPoster25 citations
- Efficient Decoder-Free Object Detection with TransformersPoster25 citations
- Few ‘Zero Level Set’-Shot Learning of Shape Signed Distance Functions in Feature SpacePoster25 citations
- Generating Natural Images with Direct Patch Distributions MatchingPoster25 citations
- HEAD: HEtero-Assists Distillation for Heterogeneous Object DetectorsPoster25 citations
- How Stable Are Transferability Metrics Evaluations?Poster25 citations
- Improving RGB-D Point Cloud Registration by Learning Multi-Scale Local Linear TransformationPoster25 citations
- Learning Visibility for Robust Dense Human Body EstimationPoster25 citations
- Learning Visual Styles from Audio-Visual AssociationsPoster25 citations
- Long-Tailed Instance Segmentation Using Gumbel Optimized LossPoster25 citations
- TempFormer: Temporally Consistent Transformer for Video DenoisingPoster25 citations
- Vector Quantized Image-to-Image TranslationPoster25 citations
- Weakly-Supervised Stitching Network for Real-World Panoramic Image GenerationPoster25 citations
- "GEB+: A Benchmark for Generic Event Boundary Captioning, Grounding and Retrieval"Poster24 citations
- 3DG-STFM: 3D Geometric Guided Student-Teacher Feature MatchingPoster24 citations
- A Perturbation-Constrained Adversarial Attack for Evaluating the Robustness of Optical FlowPoster24 citations
- Automatic Dense Annotation of Large-Vocabulary Sign Language VideosPoster24 citations
- Black-Box Few-Shot Knowledge DistillationPoster24 citations
- ConCL: Concept Contrastive Learning for Dense Prediction Pre-training in Pathology ImagesPoster24 citations
- CoupleFace: Relation Matters for Face Recognition DistillationPoster24 citations
- Deep 360° Optical Flow Estimation Based on Multi-Projection FusionPoster24 citations
- Dense Siamese Network for Dense Unsupervised LearningPoster24 citations
- Domain Adaptive Video Segmentation via Temporal Pseudo SupervisionPoster24 citations
- Dual-Stream Knowledge-Preserving Hashing for Unsupervised Video RetrievalPoster24 citations
- Entropy-Driven Sampling and Training Scheme for Conditional Diffusion GenerationPoster24 citations
- FAR: Fourier Aerial Video RecognitionPoster24 citations
- GraphFit: Learning Multi-Scale Graph-Convolutional Representation for Point Cloud Normal EstimationPoster24 citations
- Image Super-Resolution with Deep DictionaryPoster24 citations
- Improving Closed and Open-Vocabulary Attribute Prediction Using TransformersPoster24 citations
- Intrinsic Neural Fields: Learning Functions on ManifoldsPoster24 citations
- Learning Hierarchy Aware Features for Reducing Mistake SeverityPoster24 citations
- Learning Semantic Segmentation from Multiple Datasets with Label ShiftsPoster24 citations
- Learning-Based Point Cloud Registration for 6D Object Pose Estimation in the Real WorldPoster24 citations
- Long-Tail Detection with Effective Class-MarginsPoster24 citations
- Multi-Person 3D Pose and Shape Estimation via Inverse Kinematics and RefinementPoster24 citations
- NSNet: Non-Saliency Suppression Sampler for Efficient Video RecognitionPoster24 citations
- Privacy-Preserving Action Recognition via Motion Difference QuantizationPoster24 citations
- RamGAN: Region Attentive Morphing GAN for Region-Level Makeup TransferPoster24 citations
- Rethinking Few-Shot Object Detection on a Multi-Domain BenchmarkPoster24 citations
- Robust Multi-Object Tracking by Marginal InferencePoster24 citations
- Streamable Neural FieldsPoster24 citations
- Style Your Hair: Latent Optimization for Pose-Invariant Hairstyle Transfer via Local-Style-Aware Hair AlignmentPoster24 citations
- Temporal Saliency Query Network for Efficient Video RecognitionPoster24 citations
- Towards Interpretable Video Super-Resolution via Alternating OptimizationPoster24 citations
- Trading Positional Complexity vs Deepness in Coordinate NetworksPoster24 citations
- Uncertainty-Aware Multi-modal Learning via Cross-Modal Random Network PredictionPoster24 citations
- Video Question Answering with Iterative Video-Text Co-TokenizationPoster24 citations
- l∞-Robustness and Beyond: Unleashing Efficient Adversarial TrainingPoster24 citations
- Continual Variational Autoencoder Learning via Online Cooperative MemorizationPoster23 citations
- D2HNet: Joint Denoising and Deblurring with Hierarchical Network for Robust Night Image RestorationPoster23 citations
- DAS: Densely-Anchored Sampling for Deep Metric LearningPoster23 citations
- Domain Adaptive Hand Keypoint and Pixel Localization in the WildPoster23 citations
- FH-Net: A Fast Hierarchical Network for Scene Flow Estimation on Real-World Point CloudsPoster23 citations
- Federated Self-Supervised Learning for Video UnderstandingPoster23 citations
- Hourglass Attention Network for Image InpaintingPoster23 citations
- Interpretations Steered Network Pruning via Amortized Inferred Saliency MapsPoster23 citations
- Latent Discriminant Deterministic UncertaintyPoster23 citations
- Online Task-Free Continual Learning with Dynamic Sparse Distributed MemoryPoster23 citations
- PointInst3D: Segmenting 3D Instances by PointsPoster23 citations
- Recurrent Bilinear Optimization for Binary Neural NetworksPoster23 citations
- Selection and Cross Similarity for Event-Image Deep StereoPoster23 citations
- SiamDoGe: Domain Generalizable Semantic Segmentation Using Siamese NetworkPoster23 citations
- Towards Comprehensive Representation Enhancement in Semantics-Guided Self-Supervised Monocular Depth EstimationPoster23 citations
- VoViT: Low Latency Graph-Based Audio-Visual Voice Separation TransformerPoster23 citations
- A Non-Isotropic Probabilistic Take On Proxy-Based Deep Metric LearningPoster22 citations
- ASSISTER: Assistive Navigation via Conditional Instruction GenerationPoster22 citations
- AdaFocusV3: On Unified Spatial-Temporal Dynamic Video RecognitionPoster22 citations
- COO: Comic Onomatopoeia Dataset for Recognizing Arbitrary or Truncated TextsPoster22 citations
- Coarse-to-Fine Incremental Few-Shot LearningPoster22 citations
- Content Adaptive Latents and Decoder for Neural Image CompressionPoster22 citations
- D2ADA: Dynamic Density-Aware Active Domain Adaptation for Semantic SegmentationPoster22 citations
- Discovering Human-Object Interaction Concepts via Self-Compositional LearningPoster22 citations
- INT: Towards Infinite-Frames 3D Detection with an Efficient FrameworkPoster22 citations
- Latent Space Smoothing for Individually Fair RepresentationsPoster22 citations
- Learning Where to Look – Generative NAS Is Surprisingly EfficientPoster22 citations
- Learning from Multiple Annotator Noisy Labels via Sample-Wise Label FusionPoster22 citations
- Learning to Fit Morphable ModelsPoster22 citations
ECCV accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.