← All conferences

ECCV 2022 Accepted Papers

The full list of 1,645 papers accepted at ECCV 2022 (European Conference on Computer Vision). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Poster: 1,645
  1. Visual Prompt TuningPoster2,137 citations
  2. ByteTrack: Multi-Object Tracking by Associating Every Detection BoxPoster2,128 citations
  3. TensoRF: Tensorial Radiance FieldsPoster1,570 citations
  4. Simple Baselines for Image RestorationPoster1,219 citations
  5. Exploring Plain Vision Transformer Backbones for Object DetectionPoster1,063 citations
  6. MaxViT: Multi-axis Vision TransformerPoster916 citations
  7. MOTR: End-to-End Multiple-Object Tracking with TRansformerPoster715 citations
  8. Detecting Twenty-Thousand Classes Using Image-Level SupervisionPoster704 citations
  9. PETR: Position Embedding Transformation for Multi-View 3D Object DetectionPoster688 citations
  10. Joint Feature Learning and Relation Modeling for Tracking: A One-Stream FrameworkPoster657 citations
  11. DualPrompt: Complementary Prompting for Rehearsal-Free Continual LearningPoster646 citations
  12. Extract Free Dense Labels from CLIPPoster633 citations
  13. Masked Autoencoders for Point Cloud Self-Supervised LearningPoster620 citations
  14. Make-a-Scene: Scene-Based Text-to-Image Generation with Human PriorsPoster575 citations
  15. SLIP: Self-Supervision Meets Language-Image Pre-trainingPoster559 citations
  16. A-OKVQA: A Benchmark for Visual Question Answering Using World KnowledgePoster538 citations
  17. Scaling Open-Vocabulary Image Segmentation with Image-Level LabelsPoster515 citations
  18. Efficient Long-Range Attention Network for Image Super-ResolutionPoster512 citations
  19. Compositional Visual Generation with Composable Diffusion ModelsPoster503 citations
  20. DeiT III: Revenge of the ViTPoster499 citations
  21. ActionFormer: Localizing Moments of Actions with TransformersPoster486 citations
  22. XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory ModelPoster480 citations
  23. Prompting Visual-Language Models for Efficient Video UnderstandingPoster479 citations
  24. VQGAN-CLIP: Open Domain Image Generation and Editing with Natural Language GuidancePoster478 citations
  25. V2X-ViT: Vehicle-to-Everything Cooperative Perception with Vision TransformerPoster466 citations
  26. Real-Time Intermediate Flow Estimation for Video Frame InterpolationPoster452 citations
  27. OCR-Free Document Understanding TransformerPoster437 citations
  28. TEMOS: Generating Diverse Human Motions from Textual DescriptionsPoster427 citations
  29. Tip-Adapter: Training-Free Adaption of CLIP for Few-Shot ClassificationPoster426 citations
  30. DaViT: Dual Attention Vision TransformersPoster424 citations
  31. SPot-the-Difference Self-Supervised Pre-training for Anomaly Detection and SegmentationPoster423 citations
  32. MotionCLIP: Exposing Human Motion Generation to CLIP SpacePoster392 citations
  33. Masked Siamese Networks for Label-Efficient LearningPoster390 citations
  34. Expanding Language-Image Pretrained Models for General Video RecognitionPoster389 citations
  35. FlowFormer: A Transformer Architecture for Optical FlowPoster387 citations
  36. FOSTER: Feature Boosting and Compression for Class-Incremental LearningPoster381 citations
  37. Text2LIVE: Text-Driven Layered Image and Video EditingPoster364 citations
  38. NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtionPoster350 citations
  39. TinyViT: Fast Pretraining Distillation for Small Vision TransformersPoster340 citations
  40. AiATrack: Attention in Attention for Transformer Visual TrackingPoster332 citations
  41. 2DPASS: 2D Priors Assisted Semantic Segmentation on LiDAR Point CloudsPoster316 citations
  42. MultiMAE: Multi-modal Multi-task Masked AutoencodersPoster316 citations
  43. Making the Most of Text Semantics to Improve Biomedical Vision-Language ProcessingPoster306 citations
  44. HRDA: Context-Aware High-Resolution Domain-Adaptive Semantic SegmentationPoster305 citations
  45. ST-P3: End-to-End Vision-Based Autonomous Driving via Spatial-Temporal Feature LearningPoster287 citations
  46. Backbone Is All Your Need: A Simplified Architecture for Visual Object TrackingPoster284 citations
  47. CLIFF: Carrying Location Information in Full Frames into Human Pose and Shape EstimationPoster280 citations
  48. A Simple Baseline for Open-Vocabulary Semantic Segmentation with Pre-trained Vision-Language ModelPoster279 citations
  49. Decoupled Contrastive LearningPoster268 citations
  50. TM2T: Stochastic and Tokenized Modeling for the Reciprocal Generation of 3D Human Motions and TextsPoster268 citations
  51. BungeeNeRF: Progressive Neural Radiance Field for Extreme Multi-Scale Scene RenderingPoster267 citations
  52. Frozen CLIP Models Are Efficient Video LearnersPoster266 citations
  53. ARF: Artistic Radiance FieldsPoster265 citations
  54. EdgeViTs: Competing Light-Weight CNNs on Mobile Devices with Vision TransformersPoster260 citations
  55. Long Video Generation with Time-Agnostic VQGAN and Time-Sensitive TransformerPoster258 citations
  56. Masked Generative DistillationPoster257 citations
  57. Stripformer: Strip Transformer for Fast Image DeblurringPoster251 citations
  58. SPViT: Enabling Faster Vision Transformers via Latency-Aware Soft Token PruningPoster247 citations
  59. NeuMan: Neural Human Radiance Field from a Single VideoPoster241 citations
  60. Open-Vocabulary DETR with Conditional MatchingPoster241 citations
  61. Scene Text Recognition with Permuted Autoregressive Sequence ModelsPoster241 citations
  62. Adaptive Token Sampling for Efficient Vision TransformersPoster231 citations
  63. DICE: Leveraging Sparsification for Out-of-Distribution DetectionPoster229 citations
  64. ASpanFormer: Detector-Free Image Matching with Adaptive Span TransformerPoster227 citations
  65. PillarNet: Real-Time and High-Performance Pillar-Based 3D Object DetectionPoster223 citations
  66. Learn from All: Erasing Attention Consistency for Noisy Label Facial Expression RecognitionPoster220 citations
  67. DexMV: Imitation Learning for Dexterous Manipulation from Human VideosPoster210 citations
  68. RFLA: Gaussian Receptive Field Based Label Assignment for Tiny Object DetectionPoster210 citations
  69. FAST-VQA: Efficient End-to-End Video Quality Assessment with Fragment SamplingPoster209 citations
  70. PersFormer: 3D Lane Detection via Perspective Transformer and the OpenLane BenchmarkPoster209 citations
  71. Wave-ViT: Unifying Wavelet and Transformers for Visual Representation LearningPoster209 citations
  72. StyleHEAT: One-Shot High-Resolution Editable Talking Face Generation via Pre-trained StyleGANPoster203 citations
  73. SinNeRF: Training Neural Radiance Fields on Complex Scenes from a Single ImagePoster202 citations
  74. Language-Grounded Indoor 3D Semantic Segmentation in the WildPoster200 citations
  75. Self-Support Few-Shot Semantic SegmentationPoster199 citations
  76. FILM: Frame Interpolation for Large MotionPoster198 citations
  77. SparseNeuS: Fast Generalizable Neural Surface Reconstruction from Sparse ViewsPoster195 citations
  78. Uncertainty Inspired Underwater Image EnhancementPoster195 citations
  79. Implicit Neural Representations for Image CompressionPoster194 citations
  80. Natural Synthetic Anomalies for Self-Supervised Anomaly Detection and LocalizationPoster194 citations
  81. Frequency Domain Model Augmentation for Adversarial AttackPoster193 citations
  82. P-STMO: Pre-trained Spatial Temporal Many-to-One Model for 3D Human Pose EstimationPoster192 citations
  83. Registration Based Few-Shot Anomaly DetectionPoster192 citations
  84. SimCC: A Simple Coordinate Classification Perspective for Human Pose EstimationPoster191 citations
  85. Towards Grand Unification of Object TrackingPoster189 citations
  86. Masked Discrimination for Self-Supervised Learning on Point CloudsPoster187 citations
  87. CenterFormer: Center-based Transformer for 3D Object DetectionPoster184 citations
  88. Particle Video Revisited: Tracking through Occlusions Using Point TrajectoriesPoster183 citations
  89. PromptDet: Towards Open-Vocabulary Detection Using Uncurated ImagesPoster181 citations
  90. BEAT: A Large-Scale Semantic and Emotional Multi-modal Dataset for Conversational Gestures SynthesisPoster179 citations
  91. StyleGAN-Human: A Data-Centric Odyssey of Human GenerationPoster179 citations
  92. SeqTR: A Simple Yet Universal Network for Visual GroundingPoster177 citations
  93. PTQ4ViT: Post-Training Quantization for Vision Transformers with Twin Uniform QuantizationPoster176 citations
  94. SeedFormer: Patch Seeds Based Point Cloud Completion with Upsample TransformerPoster174 citations
  95. Audio—Visual SegmentationPoster173 citations
  96. Cost Aggregation with 4D Convolutional Swin Transformer for Few-Shot SegmentationPoster173 citations
  97. Event-Based Fusion for Motion Deblurring with Cross-Modal AttentionPoster173 citations
  98. Towards Metrical Reconstruction of Human FacesPoster173 citations
  99. An End-to-End Transformer Model for Crowd LocalizationPoster172 citations
  100. High-Resolution Virtual Try-On with Misalignment and Occlusion-Handled ConditionsPoster172 citations
  101. CelebV-HQ: A Large-Scale Video Facial Attributes DatasetPoster170 citations
  102. Domain Generalization by Mutual-Information Regularization with Pre-trained ModelsPoster170 citations
  103. Unsupervised Night Image Enhancement: When Layer Decomposition Meets Light-Effects SuppressionPoster170 citations
  104. Perceiving and Modeling Density for Image DehazingPoster169 citations
  105. Coarse-to-Fine Sparse Transformer for Hyperspectral Image ReconstructionPoster165 citations
  106. Deep Fourier-Based Exposure Correction Network with Spatial-Frequency InteractionPoster164 citations
  107. TS2-Net: Token Shift and Selection Transformer for Text-Video RetrievalPoster161 citations
  108. NeuMesh: Learning Disentangled Neural Mesh-Based Implicit Field for Geometry and Texture EditingPoster158 citations
  109. Factorizing Knowledge in Neural NetworksPoster156 citations
  110. Multimodal Object Detection via Probabilistic EnsemblingPoster155 citations
  111. Semantic-Aware Implicit Neural Audio-Driven Video Portrait GenerationPoster154 citations
  112. Cross-Attention of Disentangled Modalities for 3D Human Mesh Recovery with TransformersPoster153 citations
  113. FCAF3D: Fully Convolutional Anchor-Free 3D Object DetectionPoster153 citations
  114. Three Things Everyone Should Know about Vision TransformersPoster153 citations
  115. GRIT: Faster and Better Image Captioning Transformer Using Dual Visual FeaturesPoster152 citations
  116. TAVA: Template-Free Animatable Volumetric ActorsPoster151 citations
  117. ARAH: Animatable Volume Rendering of Articulated Human SDFsPoster150 citations
  118. NeRF for Outdoor Scene RelightingPoster150 citations
  119. VQFR: Blind Face Restoration with Vector-Quantized Dictionary and Parallel DecoderPoster150 citations
  120. RigNet: Repetitive Image Guided Network for Depth CompletionPoster149 citations
  121. DSR – A Dual Subspace Re-Projection Network for Surface Anomaly DetectionPoster148 citations
  122. Deformable Feature Aggregation for Dynamic Multi-modal 3D Object DetectionPoster147 citations
  123. What to Hide from Your Students: Attention-Guided Masked Image ModelingPoster146 citations
  124. Improving Generalization in Federated Learning by Seeking Flat MinimaPoster145 citations
  125. In Defense of Online Models for Video Instance SegmentationPoster145 citations
  126. Panoptic Scene Graph GenerationPoster145 citations
  127. Dress Code: High-Resolution Multi-Category Virtual Try-OnPoster144 citations
  128. Frequency and Spatial Dual Guidance for Image DehazingPoster144 citations
  129. LEDNet: Joint Low-Light Enhancement and Deblurring in the DarkPoster144 citations
  130. Highly Accurate Dichotomous Image SegmentationPoster143 citations
  131. Human Trajectory Prediction via Neural Social PhysicsPoster143 citations
  132. ProposalContrast: Unsupervised Pre-training for LiDAR-Based 3D Object DetectionPoster143 citations
  133. SQN: Weakly-Supervised Semantic Segmentation of Large-Scale 3D Point CloudsPoster142 citations
  134. TALLFormer: Temporal Action Localization with a Long-Memory TransformerPoster142 citations
  135. Beyond Periodicity: Towards a Unifying Framework for Activations in Coordinate-MLPsPoster140 citations
  136. Dense Cross-Query-and-Support Attention Weighted Mask Aggregation for Few-Shot SegmentationPoster140 citations
  137. Fusion from Decomposition: A Self-Supervised Decomposition Approach for Image FusionPoster140 citations
  138. SWFormer: Sparse Window Transformer for 3D Object Detection in Point CloudsPoster140 citations
  139. AvatarPoser: Articulated Full-Body Pose Tracking from Sparse Motion SensingPoster137 citations
  140. Data-Free Backdoor Removal Based on Channel LipschitznessPoster137 citations
  141. KVT: k-NN Attention for Boosting Vision TransformersPoster136 citations
  142. ReCoNet: Recurrent Correction Network for Fast and Efficient Multi-Modality Image FusionPoster135 citations
  143. PseCo: Pseudo Labeling and Consistency Training for Semi-Supervised Object DetectionPoster134 citations
  144. Gaussian Activated Neural Radiance Fields for High Fidelity Reconstruction & Pose EstimationPoster133 citations
  145. Learning Dynamic Facial Radiance Fields for Few-Shot Talking Head SynthesisPoster130 citations
  146. LocalBins: Improving Depth Estimation by Learning Local DistributionsPoster130 citations
  147. ActiveNeRF: Learning Where to See with Uncertainty EstimationPoster129 citations
  148. Few-Shot Class-Incremental Learning from an Open-Set PerspectivePoster128 citations
  149. Gen6D: Generalizable Model-Free 6-DoF Object Pose Estimation from RGB ImagesPoster128 citations
  150. SeqFormer: Sequential Transformer for Video Instance SegmentationPoster128 citations
  151. Generalizable Patch-Based Neural RenderingPoster127 citations
  152. HIVE: Evaluating the Human Interpretability of Visual ExplanationsPoster127 citations
  153. Latency-Aware Collaborative PerceptionPoster127 citations
  154. SimpleRecon: 3D Reconstruction without 3D ConvolutionsPoster127 citations
  155. UniTAB: Unifying Text and Box Outputs for Grounded Vision-Language ModelingPoster127 citations
  156. Dense Teacher: Dense Pseudo-Labels for Semi-Supervised Object DetectionPoster126 citations
  157. Self-Supervised Sparse Representation for Video Anomaly DetectionPoster126 citations
  158. 3D Face Reconstruction with Dense LandmarksPoster125 citations
  159. HuMMan: Multi-modal 4D Human Dataset for Versatile Sensing and ModelingPoster125 citations
  160. "PartImageNet: A Large, High-Quality Dataset of Parts"Poster124 citations
  161. Auto-Regressive Image Synthesis with Integrated QuantizationPoster124 citations
  162. AutoMix: Unveiling the Power of Mixup for Stronger ClassifiersPoster123 citations
  163. Improving Vision Transformers by Revisiting High-Frequency ComponentsPoster123 citations
  164. Neural Architecture Search for Spiking Neural NetworksPoster123 citations
  165. MVSTER: Epipolar Transformer for Efficient Multi-View StereoPoster122 citations
  166. PointMixer: MLP-Mixer for Point Cloud UnderstandingPoster122 citations
  167. Interpretable Image Classification with Differentiable Prototypes AssignmentPoster121 citations
  168. Long Movie Clip Classification with State-Space Video ModelsPoster121 citations
  169. Physical Attack on Monocular Depth Estimation with Optimal Adversarial PatchesPoster121 citations
  170. SocialVAE: Human Trajectory Prediction Using Timewise LatentsPoster121 citations
  171. UIA-ViT: Unsupervised Inconsistency-Aware Method Based on Vision Transformer for Face Forgery DetectionPoster121 citations
  172. Exploiting Unlabeled Data with Vision and Language Models for Object DetectionPoster120 citations
  173. Neuromorphic Data Augmentation for Training Spiking Neural NetworksPoster120 citations
  174. Prototypical Contrast Adaptation for Domain Adaptive Semantic SegmentationPoster120 citations
  175. Few-Shot Class-Incremental Learning via Entropy-Regularized Data-Free ReplayPoster117 citations
  176. Poseur: Direct Human Pose Regression with TransformersPoster117 citations
  177. Video Graph Transformer for Video Question AnsweringPoster117 citations
  178. CODA: A Real-World Road Corner Case Dataset for Object Detection in Autonomous DrivingPoster116 citations
  179. Class-Agnostic Object Detection with Multi-modal TransformerPoster116 citations
  180. Improving Image Restoration by Revisiting Global Information AggregationPoster116 citations
  181. MVP: Multimodality-Guided Visual Pre-trainingPoster116 citations
  182. Efficient and Degradation-Adaptive Network for Real-World Image Super-ResolutionPoster115 citations
  183. Video Anomaly Detection by Solving Decoupled Spatio-Temporal Jigsaw PuzzlesPoster114 citations
  184. NeuRIS: Neural Reconstruction of Indoor Scenes Using Normal PriorsPoster113 citations
  185. Bottom Up Top down Detection Transformers for Language Grounding in Images and Point CloudsPoster112 citations
  186. EgoBody: Human Body Shape and Motion of Interacting People from Head-Mounted DevicesPoster112 citations
  187. CCPL: Contrastive Coherence Preserving Loss for Versatile Style TransferPoster111 citations
  188. Cross-Modal Prototype Driven Network for Radiology Report GenerationPoster111 citations
  189. NeILF: Neural Incident Light Field for Physically-Based Material EstimationPoster111 citations
  190. Rethinking Keypoint Representations: Modeling Keypoints and Poses as Objects for Multi-Person Human Pose EstimationPoster111 citations
  191. Fine-Grained Scene Graph Generation with Data TransferPoster110 citations
  192. Pose-NDF: Modeling Human Pose Manifolds with Neural Distance FieldsPoster110 citations
  193. ViTAS: Vision Transformer Architecture SearchPoster110 citations
  194. KING: Generating Safety-Critical Driving Scenarios for Robust Imitation via Kinematics GradientsPoster109 citations
  195. Learning Audio-Video Modalities from Image CaptionsPoster109 citations
  196. Secrets of Event-Based Optical FlowPoster109 citations
  197. COUCH: Towards Controllable Human-Chair InteractionsPoster108 citations
  198. Style-Hallucinated Dual Consistency Learning for Domain Generalized Semantic SegmentationPoster108 citations
  199. MoFaNeRF: Morphable Facial Neural Radiance FieldPoster107 citations
  200. Inverted Pyramid Multi-task Transformer for Dense Scene UnderstandingPoster106 citations
  201. Realistic One-Shot Mesh-Based Head AvatarsPoster106 citations
  202. Graph R-CNN: Towards Accurate 3D Object Detection with Semantic-Decorated Local GraphPoster105 citations
  203. Object Discovery and Representation NetworksPoster105 citations
  204. Unified Fully and Timestamp Supervised Temporal Action Segmentation via Sequence to Sequence TranslationPoster105 citations
  205. Contrast-Phys: Unsupervised Video-Based Remote Physiological Measurement via Spatiotemporal ContrastPoster104 citations
  206. Deforming Radiance Fields with CagesPoster103 citations
  207. SPSN: Superpixel Prototype Sampling Network for RGB-D Salient Object DetectionPoster103 citations
  208. MPPNet: Multi-Frame Feature Intertwining with Proxy Points for 3D Temporal Object DetectionPoster102 citations
  209. Robust Visual Tracking by SegmentationPoster102 citations
  210. Spatial-Frequency Domain Information Integration for Pan-SharpeningPoster102 citations
  211. Few-Shot Classification with Contrastive LearningPoster100 citations
  212. Multimodal Conditional Image Synthesis with Product-of-Experts GANsPoster100 citations
  213. Open Vocabulary Object Detection with Pseudo Bounding-Box LabelsPoster100 citations
  214. An Invisible Black-Box Backdoor Attack through Frequency DomainPoster99 citations
  215. Joint Learning of Localized Representations from Medical Images and ReportsPoster99 citations
  216. Cross-Modality Transformer for Visible-Infrared Person Re-identificationPoster98 citations
  217. DiffuseMorph: Unsupervised Deformable Image Registration Using Diffusion ModelPoster98 citations
  218. PCW-Net: Pyramid Combination and Warping Cost Volume for Stereo MatchingPoster98 citations
  219. Pixel-Wise Energy-Biased Abstention Learning for Anomaly Segmentation on Complex Urban Driving ScenesPoster98 citations
  220. R-DFCIL: Relation-Guided Representation Learning for Data-Free Class Incremental LearningPoster98 citations
  221. R2L: Distilling Neural Radiance Field to Neural Light Field for Efficient Novel View SynthesisPoster98 citations
  222. "Capturing, Reconstructing, and Simulating: The UrbanScene3D Dataset"Poster97 citations
  223. ESS: Learning Event-Based Semantic Segmentation from Still ImagesPoster97 citations
  224. SegPGD: An Effective and Efficient Adversarial Attack for Evaluating and Boosting Segmentation RobustnessPoster97 citations
  225. Single Stage Virtual Try-On via Deformable Attention FlowsPoster97 citations
  226. Ghost-Free High Dynamic Range Imaging with Context-Aware TransformerPoster96 citations
  227. Adaptive Transformers for Robust Few-Shot Cross-Domain Face Anti-SpoofingPoster95 citations
  228. PASS: Part-Aware Self-Supervised Pre-training for Person Re-identificationPoster95 citations
  229. PanoFormer: Panorama Transformer for Indoor 360° Depth EstimationPoster95 citations
  230. Social-Implicit: Rethinking Trajectory Prediction Evaluation and the Effectiveness of Implicit Maximum Likelihood EstimationPoster95 citations
  231. "“This Is My Unicorn, Fluffy”: Personalizing Frozen Vision-Language Representations"Poster94 citations
  232. Object-Compositional Neural Implicit SurfacesPoster94 citations
  233. RelPose: Predicting Probabilistic Relative Rotation for Single Objects in the WildPoster94 citations
  234. Cross-Modality Knowledge Distillation Network for Monocular 3D Object DetectionPoster93 citations
  235. Reference-Based Image Super-Resolution with Deformable Attention TransformerPoster93 citations
  236. A Broad Study of Pre-training for Domain Generalization and AdaptationPoster92 citations
  237. GaitEdge: Beyond Plain End-to-End Gait Recognition for Better PracticalityPoster92 citations
  238. KeypointNeRF: Generalizing Image-Based Volumetric Avatars Using Relative Spatial Encoding of KeypointsPoster92 citations
  239. Semi-Supervised 3D Object Detection with Proficient TeachersPoster92 citations
  240. Unified Implicit Neural StylizationPoster92 citations
  241. Image2Point: 3D Point-Cloud Understanding with 2D Image Pretrained ModelsPoster90 citations
  242. Localizing Visual Sounds the Easy WayPoster90 citations
  243. Mixed-Precision Neural Network Quantization via Learned Layer-Wise ImportancePoster90 citations
  244. ReAct: Temporal Action Detection with Relational QueriesPoster90 citations
  245. SdAE: Self-Distillated Masked AutoencoderPoster90 citations
  246. Subspace Diffusion Generative ModelsPoster90 citations
  247. Uncertainty-Guided Source-Free Domain AdaptationPoster90 citations
  248. AdaNeRF: Adaptive Sampling for Real-Time Rendering of Neural Radiance FieldsPoster89 citations
  249. AdvDO: Realistic Adversarial Attacks for Trajectory PredictionPoster89 citations
  250. DID-M3D: Decoupling Instance Depth for Monocular 3D Object DetectionPoster89 citations
  251. Flow-Guided Transformer for Video InpaintingPoster89 citations
  252. LaMAR: Benchmarking Localization and Mapping for Augmented RealityPoster89 citations
  253. Local Color Distributions Prior for Image EnhancementPoster89 citations
  254. Contextformer: A Transformer with Spatio-Channel Attention for Context Modeling in Learned Image CompressionPoster88 citations
  255. DEVIANT: Depth EquiVarIAnt NeTwork for Monocular 3D Object DetectionPoster88 citations
  256. MeshUDF: Fast and Differentiable Meshing of Unsigned Distance Field NetworksPoster88 citations
  257. PoseGPT: Quantization-Based 3D Human Motion Generation and ForecastingPoster88 citations
  258. Efficient Video Transformers with Spatial-Temporal Token SelectionPoster87 citations
  259. GIMO: Gaze-Informed Human Motion Prediction in ContextPoster87 citations
  260. Hierarchical Feature Alignment Network for Unsupervised Video Object SegmentationPoster87 citations
  261. MINER: Multiscale Implicit Neural RepresentationPoster87 citations
  262. PS-NeRF: Neural Inverse Rendering for Multi-View Photometric StereoPoster87 citations
  263. StoryDALL-E: Adapting Pretrained Text-to-Image Transformers for Story ContinuationPoster87 citations
  264. Towards Data-Efficient Detection TransformersPoster87 citations
  265. VL-LTR: Learning Class-Wise Visual-Linguistic Representation for Long-Tailed Visual RecognitionPoster87 citations
  266. "Fine-Grained Egocentric Hand-Object Segmentation: Dataset, Model, and Applications"Poster86 citations
  267. BLT: Bidirectional Layout Transformer for Controllable Layout GenerationPoster86 citations
  268. Generative Multiplane Images: Making a 2D GAN 3D-AwarePoster86 citations
  269. Multi-modal Text Recognition Networks: Interactive Enhancements between Visual and Semantic FeaturesPoster86 citations
  270. Unleashing Transformers: Parallel Token Prediction with Discrete Absorbing Diffusion for Fast High-Resolution Image Generation from Vector-Quantized CodesPoster86 citations
  271. ViewFormer: NeRF-Free Neural Rendering from Few Images Using TransformersPoster86 citations
  272. Are Vision Transformers Robust to Patch Perturbations?Poster85 citations
  273. JoJoGAN: One Shot Face StylizationPoster85 citations
  274. SAGA: Stochastic Whole-Body Grasping with ContactPoster85 citations
  275. Bootstrapped Masked Autoencoders for Vision BERT PretrainingPoster84 citations
  276. LiDAR Distillation: Bridging the Beam-Induced Domain Gap for 3D Object DetectionPoster84 citations
  277. SmoothNet: A Plug-and-Play Network for Refining Human Poses in VideosPoster84 citations
  278. Detecting Generated Images by Real ImagesPoster83 citations
  279. Learning Degradation Representations for Image DeblurringPoster83 citations
  280. Multi-Granularity Prediction for Scene Text RecognitionPoster83 citations
  281. OSFormer: One-Stage Camouflaged Instance Segmentation with TransformersPoster83 citations
  282. Category-Level 6D Object Pose and Size Estimation Using Self-Supervised Deep Prior Deformation NetworksPoster82 citations
  283. ObjectBox: From Centers to Boxes for Anchor-Free Object DetectionPoster82 citations
  284. Open-World Semantic Segmentation via Contrasting and Clustering Vision-Language EmbeddingPoster82 citations
  285. Box-Supervised Instance Segmentation with Level Set EvolutionPoster81 citations
  286. DFNet: Enhance Absolute Pose Regression with Direct Feature MatchingPoster81 citations
  287. Housekeep: Tidying Virtual Households Using Commonsense ReasoningPoster81 citations
  288. Zero-Shot Temporal Action Detection via Vision-Language PromptingPoster81 citations
  289. k-Means Mask TransformerPoster81 citations
  290. 3D Siamese Transformer Network for Single Object Tracking on Point CloudsPoster80 citations
  291. Dual-Evidential Learning for Weakly-Supervised Temporal Action LocalizationPoster80 citations
  292. FedX: Unsupervised Federated Learning with Cross Knowledge DistillationPoster80 citations
  293. ParC-Net: Position Aware Circular Convolution with Merits from ConvNets and TransformerPoster80 citations
  294. TokenMix: Rethinking Image Mixing for Data Augmentation in Vision TransformersPoster80 citations
  295. Towards Efficient and Scale-Robust Ultra-High-Definition Image DemoiréingPoster80 citations
  296. Disentangling Object Motion and Occlusion for Unsupervised Multi-Frame Monocular DepthPoster79 citations
  297. LESS: Label-Efficient Semantic Segmentation for LiDAR Point CloudsPoster79 citations
  298. Toward Understanding WordArt: Corner-Guided Transformer for Scene Text RecognitionPoster79 citations
  299. UniMiSS: Universal Medical Self-Supervised Learning via Breaking Dimensionality BarrierPoster79 citations
  300. View Vertically: A Hierarchical Network for Trajectory Prediction via Fourier SpectrumsPoster79 citations
  301. "CHORE: Contact, Human and Object REconstruction from a Single RGB Image"Poster78 citations
  302. DenseHybrid: Hybrid Anomaly Detection for Dense Open-Set RecognitionPoster78 citations
  303. Generative Domain Adaptation for Face Anti-SpoofingPoster78 citations
  304. Image Inpainting with Cascaded Modulation GAN and Object-Aware TrainingPoster78 citations
  305. Improving Test-Time Adaptation via Shift-Agnostic Weight Regularization and Nearest Source PrototypesPoster78 citations
  306. Unsupervised Learning of Efficient Geometry-Aware Neural Articulated RepresentationsPoster78 citations
  307. WaveGAN: Frequency-Aware GAN for High-Fidelity Few-Shot Image GenerationPoster78 citations
  308. Compositional Human-Scene Interaction Synthesis with Semantic ControlPoster77 citations
  309. Harmonizer: Learning to Perform White-Box Image and Video HarmonizationPoster77 citations
  310. Max Pooling with Vision Transformers Reconciles Class and Shape in Weakly Supervised Semantic SegmentationPoster77 citations
  311. Real-Time Online Video Detection with Temporal Smoothing TransformersPoster77 citations
  312. UC-OWOD: Unknown-Classified Open World Object DetectionPoster77 citations
  313. AdaBin: Improving Binary Neural Networks with Adaptive Binary SetsPoster76 citations
  314. Box2Mask: Weakly Supervised 3D Semantic Instance Segmentation Using Bounding BoxesPoster76 citations
  315. CANF-VC: Conditional Augmented Normalizing Flows for Video CompressionPoster76 citations
  316. Differentiable Raycasting for Self-Supervised Occupancy ForecastingPoster76 citations
  317. Self-Regulated Feature Learning via Teacher-Free Feature DistillationPoster76 citations
  318. Any-Resolution Training for High-Resolution Image SynthesisPoster75 citations
  319. Learning Graph Neural Networks for Image Style TransferPoster75 citations
  320. Monocular 3D Object Detection with Depth from MotionPoster75 citations
  321. PPT: Token-Pruned Pose Transformer for Monocular and Multi-View Human Pose EstimationPoster75 citations
  322. RA-Depth: Resolution Adaptive Self-Supervised Monocular Depth EstimationPoster75 citations
  323. LocVTP: Video-Text Pre-training for Temporal LocalizationPoster74 citations
  324. Skeleton-Parted Graph Scattering Networks for 3D Human Motion PredictionPoster74 citations
  325. VSA: Learning Varied-Size Window Attention in Vision TransformersPoster74 citations
  326. DCCF: Deep Comprehensible Color Filter Learning Framework for High-Resolution Image HarmonizationPoster73 citations
  327. Texturify: Generating Textures on 3D Shape SurfacesPoster73 citations
  328. "On Multi-Domain Long-Tailed Recognition, Imbalanced Domain Generalization and Beyond"Poster72 citations
  329. A Dataset for Interactive Vision-Language Navigation with Unknown Command FeasibilityPoster72 citations
  330. Learning to Generate Realistic LiDAR Point CloudsPoster72 citations
  331. MixSKD: Self-Knowledge Distillation from Mixup for Image RecognitionPoster72 citations
  332. RC-MVSNet: Unsupervised Multi-View Stereo with Neural RenderingPoster72 citations
  333. Single Frame Atmospheric Turbulence Mitigation: A Benchmark Study and a New Physics-Inspired Transformer ModelPoster72 citations
  334. Adversarial Feature Augmentation for Cross-Domain Few-Shot ClassificationPoster71 citations
  335. Few-Shot Action Recognition with Hierarchical Matching and Contrastive LearningPoster71 citations
  336. ScalableViT: Rethinking the Context-Oriented Generalization of Vision TransformerPoster71 citations
  337. Triangle Attack: A Query-Efficient Decision-Based Adversarial AttackPoster71 citations
  338. "ShAPO: Implicit Representations for Multi-Object Shape, Appearance, and Pose Optimization"Poster70 citations
  339. Cross Attention Based Style Distribution for Controllable Person Image SynthesisPoster70 citations
  340. Emotion Recognition for Multiple Context AwarenessPoster70 citations
  341. Grasp’D: Differentiable Contact-Rich Grasp Synthesis for Multi-Fingered HandsPoster70 citations
  342. Bi-PointFlowNet: Bidirectional Learning for Point Cloud Based Scene Flow EstimationPoster69 citations
  343. CT2: Colorization Transformer via Color TokensPoster69 citations
  344. CoSMix: Compositional Semantic Mix for Domain Adaptation in 3D LiDAR SegmentationPoster69 citations
  345. E-NeRV: Expedite Neural Video Representation with Disentangled Spatial-Temporal ContextPoster69 citations
  346. Implicit Neural Representations for Variable Length Human Motion GenerationPoster69 citations
  347. Invariant Feature Learning for Generalized Long-Tailed ClassificationPoster69 citations
  348. Map-Free Visual Relocalization: Metric Pose Relative to a Single ImagePoster69 citations
  349. OpenLDN: Learning to Discover Novel Classes for Open-World Semi-Supervised LearningPoster69 citations
  350. PseudoClick: Interactive Image Segmentation with Click ImitationPoster69 citations
  351. Relationformer: A Unified Framework for Image-to-Graph GenerationPoster69 citations
  352. Transformers As Meta-Learners for Implicit Neural RepresentationsPoster69 citations
  353. "FEAR: Fast, Efficient, Accurate and Robust Visual Tracker"Poster68 citations
  354. AdaAfford: Learning to Adapt Manipulation Affordance for 3D Articulated Objects via Few-Shot InteractionsPoster68 citations
  355. BigColor: Colorization Using a Generative Color Prior for Natural ImagesPoster68 citations
  356. DiffuStereo: High Quality Human Reconstruction via Diffusion-Based Stereo Using Sparse CamerasPoster68 citations
  357. Motion Inspired Unsupervised Perception and Prediction in Autonomous DrivingPoster68 citations
  358. Proposal-Free Temporal Action Detection via Global Segmentation Mask LearningPoster68 citations
  359. Towards Realistic Semi-Supervised LearningPoster68 citations
  360. "Translation, Scale and Rotation: Cross-Modal Alignment Meets RGB-Infrared Vehicle Detection"Poster67 citations
  361. 4DContrast: Contrastive Learning with Dynamic Correspondences for 3D Scene UnderstandingPoster67 citations
  362. A Simple and Robust Correlation Filtering Method for Text-Based Person SearchPoster67 citations
  363. AlignSDF: Pose-Aligned Signed Distance Fields for Hand-Object ReconstructionPoster67 citations
  364. BMD: A General Class-Balanced Multicentric Dynamic Prototype Strategy for Source-Free Domain AdaptationPoster67 citations
  365. Homogeneous Multi-modal Feature Fusion and Interaction for 3D Object DetectionPoster67 citations
  366. MTFormer: Multi-task Learning via Transformer and Cross-Task ReasoningPoster67 citations
  367. MTTrans: Cross-Domain Object Detection with Mean Teacher TransformerPoster67 citations
  368. MeshLoc: Mesh-Based Visual LocalizationPoster67 citations
  369. Rethinking Data Augmentation for Robust Visual Question AnsweringPoster67 citations
  370. Waymo Open Dataset: Panoramic Video Panoptic SegmentationPoster67 citations
  371. When Counting Meets HMER: Counting-Aware Network for Handwritten Mathematical Expression RecognitionPoster67 citations
  372. A Fast Knowledge Distillation Framework for Visual RecognitionPoster66 citations
  373. Class-Incremental Novel Class DiscoveryPoster66 citations
  374. DisCo: Remedying Self-Supervised Learning on Lightweight Models with Distilled Contrastive LearningPoster66 citations
  375. Learning Pedestrian Group Representations for Multi-modal Trajectory PredictionPoster66 citations
  376. PoseScript: 3D Human Poses from Natural LanguagePoster66 citations
  377. Shape Matters: Deformable Patch AttackPoster66 citations
  378. Temporal Lift Pooling for Continuous Sign Language RecognitionPoster66 citations
  379. A Simple Single-Scale Vision Transformer for Object Detection and Instance SegmentationPoster65 citations
  380. An Impartial Take to the CNN vs Transformer Robustness ContestPoster65 citations
  381. Conditional-Flow NeRF: Accurate 3D Modelling with Reliable Uncertainty QuantificationPoster65 citations
  382. DeciWatch: A Simple Baseline for 10× Efficient 2D and 3D Pose EstimationPoster65 citations
  383. Few-Shot Object Counting and DetectionPoster65 citations
  384. TAPE: Task-Agnostic Prior Embedding for Image RestorationPoster65 citations
  385. Training Vision Transformers with Only 2040 ImagesPoster65 citations
  386. ColorFormer: Image Colorization via Color Memory Assisted Hybrid-Attention TransformerPoster64 citations
  387. FS-COCO: Towards Understanding of Freehand Sketches of Common Objects in ContextPoster64 citations
  388. Global-Local Motion Transformer for Unsupervised Skeleton-Based Action LearningPoster64 citations
  389. Learning Implicit Feature Alignment Function for Semantic SegmentationPoster64 citations
  390. Learning to Detect Every Thing in an Open WorldPoster64 citations
  391. Learning to Weight Samples for Dynamic Early-Exiting NetworksPoster64 citations
  392. Lidar Point Cloud Guided Monocular 3D Object DetectionPoster64 citations
  393. Optimal Transport for Label-Efficient Visible-Infrared Person Re-identificationPoster64 citations
  394. Patch Similarity Aware Data-Free Quantization for Vision TransformersPoster64 citations
  395. Point-to-Box Network for Accurate Object Detection via Single Point SupervisionPoster64 citations
  396. Quantized GAN for Complex Music Generation from Dance VideosPoster64 citations
  397. BlobGAN: Spatially Disentangled Scene RepresentationsPoster63 citations
  398. Explaining Deepfake Detection by Analysing Image MatchingPoster63 citations
  399. Exploring Lottery Ticket Hypothesis in Spiking Neural NetworksPoster63 citations
  400. Learning Ego 3D Representation As Ray TracingPoster63 citations
  401. Locality Guidance for Improving Vision Transformers on Tiny DatasetsPoster63 citations
  402. Modality Synergy Complement Learning with Cascaded Aggregation for Visible-Infrared Person Re-identificationPoster63 citations
  403. Self-Filtering: A Noise-Aware Sample Selection for Label Noise with Confidence PenalizationPoster63 citations
  404. Webly Supervised Concept Expansion for General Purpose Vision ModelsPoster63 citations
  405. Zero-Shot Category-Level Object Pose EstimationPoster63 citations
  406. Auto-FedRL: Federated Hyperparameter Optimization for Multi-Institutional Medical Image SegmentationPoster62 citations
  407. DecoupleNet: Decoupled Network for Domain Adaptive Semantic SegmentationPoster62 citations
  408. Domain Randomization-Enhanced Depth Simulation and Restoration for Perceiving and Grasping Specular and Transparent ObjectsPoster62 citations
  409. ParticleSfM: Exploiting Dense Point Trajectories for Localizing Moving Cameras in the WildPoster62 citations
  410. What Matters for 3D Scene Flow NetworkPoster62 citations
  411. CoSCL: Cooperation of Small Continual Learners Is Stronger than a Big OnePoster61 citations
  412. CramNet: Camera-Radar Fusion with Ray-Constrained Cross-Attention for Robust 3D Object DetectionPoster61 citations
  413. Faster VoxelPose: Real-Time 3D Human Pose Estimation by Orthographic ProjectionPoster61 citations
  414. Physically-Based Editing of Indoor Scene Lighting from a Single ImagePoster61 citations
  415. Realistic Blur Synthesis for Learning Image DeblurringPoster61 citations
  416. Action Quality Assessment with Temporal Parsing TransformerPoster60 citations
  417. Discover and Mitigate Unknown Biases with Debiasing Alternate NetworksPoster60 citations
  418. Exploring Disentangled Content Information for Face Forgery DetectionPoster60 citations
  419. GLASS: Global to Local Attention for Scene-Text SpottingPoster60 citations
  420. InfiniteNature-Zero: Learning Perpetual View Generation of Natural Scenes from Single ImagesPoster60 citations
  421. Responsive Listening Head Generation: A Benchmark Dataset and BaselinePoster60 citations
  422. Rethinking IoU-Based Optimization for Single-Stage 3D Object DetectionPoster60 citations
  423. Tracking Objects As Pixel-Wise DistributionsPoster60 citations
  424. Adaptive Cross-Domain Learning for Generalizable Person Re-identificationPoster59 citations
  425. Contrastive Deep SupervisionPoster59 citations
  426. Difficulty-Aware Simulator for Open Set RecognitionPoster59 citations
  427. FashionViL: Fashion-Focused Vision-and-Language Representation LearningPoster59 citations
  428. Learning Quality-Aware Dynamic Memory for Video Object SegmentationPoster59 citations
  429. MeshMAE: Masked Autoencoders for 3D Mesh Data AnalysisPoster59 citations
  430. My View Is the Best View: Procedure Learning from Egocentric VideosPoster59 citations
  431. Reliable Visual Question Answering: Abstain Rather Than Answer IncorrectlyPoster59 citations
  432. Rethinking Confidence Calibration for Failure PredictionPoster59 citations
  433. S3C: Self-Supervised Stochastic Classifiers for Few-Shot Class-Incremental LearningPoster59 citations
  434. Self-Supervision Can Be a Good Few-Shot LearnerPoster59 citations
  435. Towards Open-Vocabulary Scene Graph Generation with Prompt-Based FinetuningPoster59 citations
  436. X-DETR: A Versatile Architecture for Instance-Wise Vision-Language TasksPoster59 citations
  437. CMD: Self-Supervised 3D Action Representation Learning with Cross-Modal Mutual DistillationPoster58 citations
  438. ClearPose: Large-Scale Transparent Object Dataset and BenchmarkPoster58 citations
  439. Compound Prototype Matching for Few-Shot Action RecognitionPoster58 citations
  440. Dynamic 3D Scene Analysis by Point Cloud AccumulationPoster58 citations
  441. Language-Driven Artistic Style TransferPoster58 citations
  442. Learning Topological Interactions for Multi-Class Medical Image SegmentationPoster58 citations
  443. Learning from Unlabeled 3D Environments for Vision-and-Language NavigationPoster58 citations
  444. Switchable Online Knowledge DistillationPoster58 citations
  445. The Challenges of Continuous Self-Supervised LearningPoster58 citations
  446. Visual Cross-View Metric Localization with Dense Uncertainty EstimatesPoster58 citations
  447. 3D Clothed Human Reconstruction in the WildPoster57 citations
  448. ConMatch: Semi-Supervised Learning with Confidence-Guided Consistency RegularizationPoster57 citations
  449. Multiview Stereo with Cascaded Epipolar RAFTPoster57 citations
  450. Not Just Streaks: Towards Ground Truth for Single Image DerainingPoster57 citations
  451. PRIME: A Few Primitives Can Boost Robustness to Common CorruptionsPoster57 citations
  452. PolarMOT: How Far Can Geometric Relations Take Us in 3D Multi-Object Tracking?Poster57 citations
  453. RBP-Pose: Residual Bounding Box Projection for Category-Level Pose EstimationPoster57 citations
  454. STEEX: Steering Counterfactual Explanations with SemanticsPoster57 citations
  455. Transfer without ForgettingPoster57 citations
  456. 3D Instances as 1D KernelsPoster56 citations
  457. Learning Visual Representation from Modality-Shared Contrastive Language-Image Pre-trainingPoster56 citations
  458. PRIF: Primary Ray-Based Implicit FunctionPoster56 citations
  459. SepLUT: Separable Image-Adaptive Lookup Tables for Real-Time Image EnhancementPoster56 citations
  460. Source-Free Domain Adaptation with Contrastive Domain Alignment and Self-Supervised Exploration for Face Anti-SpoofingPoster56 citations
  461. Spike Transformer: Monocular Depth Estimation for Spiking CameraPoster56 citations
  462. Style-Guided Shadow RemovalPoster56 citations
  463. TOCH: Spatio-Temporal Object-to-Hand Correspondence for Motion RefinementPoster56 citations
  464. Vote from the Center: 6 DoF Pose Estimation in RGB-D Images by Radial Keypoint VotingPoster56 citations
  465. Adversarial Erasing Framework via Triplet with Gated Pyramid Pooling Layer for Weakly Supervised Semantic SegmentationPoster55 citations
  466. Autoregressive 3D Shape Generation via Canonical MappingPoster55 citations
  467. Generalizable Medical Image Segmentation via Random Amplitude Mixup and Domain-Specific Image RestorationPoster55 citations
  468. OOD-CV: A Benchmark for Robustness to Out-of-Distribution Shifts of Individual Nuisances in Natural ImagesPoster55 citations
  469. PTSEFormer: Progressive Temporal-Spatial Enhanced TransFormer towards Video Object DetectionPoster55 citations
  470. StretchBEV: Stretching Future Instance Prediction Spatially and TemporallyPoster55 citations
  471. Uncertainty-DTW for Time Series and SequencesPoster55 citations
  472. 3D Interacting Hand Pose Estimation by Hand De-Occlusion and RemovalPoster54 citations
  473. Diverse Human Motion Prediction Guided by Multi-level Spatial-Temporal AnchorsPoster54 citations
  474. Dynamic Local Aggregation Network with Adaptive Clusterer for Anomaly DetectionPoster54 citations
  475. FBNet: Feedback Network for Point Cloud CompletionPoster54 citations
  476. Metric Learning Based Interactive Modulation for Real-World Super-ResolutionPoster54 citations
  477. Prototype-Guided Continual Adaptation for Class-Incremental Unsupervised Domain AdaptationPoster54 citations
  478. StyleLight: HDR Panorama Generation for Lighting Estimation and EditingPoster54 citations
  479. StyleSwap: Style-Based Generator Empowers Robust Face SwappingPoster54 citations
  480. UnrealEgo: A New Dataset for Robust Egocentric 3D Human Motion CapturePoster54 citations
  481. Detecting and Recovering Sequential DeepFake ManipulationPoster53 citations
  482. Global Spectral Filter Memory Network for Video Object SegmentationPoster53 citations
  483. Knowledge Condensation DistillationPoster53 citations
  484. Learning Long-Term Spatial-Temporal Graphs for Active Speaker DetectionPoster53 citations
  485. Long-Tailed Class Incremental LearningPoster53 citations
  486. PANDORA: Polarization-Aided Neural Decomposition of RadiancePoster53 citations
  487. Panoptic-PartFormer: Learning a Unified Model for Panoptic Part SegmentationPoster53 citations
  488. The Abduction of Sherlock Holmes: A Dataset for Visual Abductive ReasoningPoster53 citations
  489. Attention Diversification for Domain GeneralizationPoster52 citations
  490. Bi-Level Feature Alignment for Versatile Image Translation and ManipulationPoster52 citations
  491. CLIP-Actor: Text-Driven Recommendation and Stylization for Animating Human MeshesPoster52 citations
  492. ECCV Caption: Correcting False Negatives by Collecting Machine-and-Human-Verified Image-Caption Associations for MS-COCOPoster52 citations
  493. Levenshtein OCRPoster52 citations
  494. MORE: Multi-Order RElation Mining for Dense Captioning in 3D ScenesPoster52 citations
  495. MVDG: A Unified Multi-View Framework for Domain GeneralizationPoster52 citations
  496. Novel Class Discovery without ForgettingPoster52 citations
  497. Perspective Flow Aggregation for Data-Limited 6D Object Pose EstimationPoster52 citations
  498. Towards Efficient Adversarial Training on Vision TransformersPoster52 citations
  499. Tracking Every Thing in the WildPoster52 citations
  500. TransFGU: A Top-down Approach to Fine-Grained Unsupervised Semantic SegmentationPoster52 citations
  501. Unsupervised Domain Adaptation for Monocular 3D Object Detection via Self-TrainingPoster52 citations
  502. A Level Set Theory for Neural Implicit Evolution under Explicit FlowsPoster51 citations
  503. Counterfactual Intervention Feature Transfer for Visible-Infrared Person Re-identificationPoster51 citations
  504. Differentiable Zooming for Multiple Instance Learning on Whole-Slide ImagesPoster51 citations
  505. DynaST: Dynamic Sparse Transformer for Exemplar-Guided Image GenerationPoster51 citations
  506. Dynamically Transformed Instance Normalization Network for Generalizable Person Re-identificationPoster51 citations
  507. FairGRAPE: Fairness-Aware GRAdient Pruning mEthod for Face Attribute ClassificationPoster51 citations
  508. Hierarchical Contrastive Inconsistency Learning for Deepfake Video DetectionPoster51 citations
  509. LGV: Boosting Adversarial Example Transferability from Large Geometric VicinityPoster51 citations
  510. Neural Video Compression Using GANs for Detail Synthesis and PropagationPoster51 citations
  511. AlphaVC: High-Performance and Efficient Learned Video CompressionPoster50 citations
  512. Improved Masked Image Generation with Token-CriticPoster50 citations
  513. Is Geometry Enough for Matching in Visual Localization?Poster50 citations
  514. Learning Implicit Templates for Point-Based Clothed Human ModelingPoster50 citations
  515. Learning with Recoverable ForgettingPoster50 citations
  516. Mimic Embedding via Adaptive Aggregation: Learning Generalizable Person Re-identificationPoster50 citations
  517. Neural Radiance Transfer Fields for Relightable Novel-View Synthesis with Global IlluminationPoster50 citations
  518. PT4AL: Using Self-Supervised Pretext Tasks for Active LearningPoster50 citations
  519. Studying Bias in GANs through the Lens of RacePoster50 citations
  520. TIDEE: Tidying Up Novel Rooms Using Visuo-Semantic Commonsense PriorsPoster50 citations
  521. CoMER: Modeling Coverage for Transformer-Based Handwritten Mathematical Expression RecognitionPoster49 citations
  522. Contrastive Positive Mining for Unsupervised 3D Action Representation LearningPoster49 citations
  523. DVS-Voltmeter: Stochastic Process-Based Event Simulator for Dynamic Vision SensorsPoster49 citations
  524. Deep Hash Distillation for Image RetrievalPoster49 citations
  525. Geometry-Guided Progressive NeRF for Generalizable and Efficient Neural Human RenderingPoster49 citations
  526. MILES: Visual BERT Pre-training with Injected Language Semantics for Video-Text RetrievalPoster49 citations
  527. Multi-Domain Learning for Updating Face Anti-Spoofing ModelsPoster49 citations
  528. Multi-faceted Distillation of Base-Novel Commonality for Few-Shot Object DetectionPoster49 citations
  529. Pose for Everything: Towards Category-Agnostic Pose EstimationPoster49 citations
  530. Shap-CAM: Visual Explanations for Convolutional Neural Networks Based on Shapley ValuePoster49 citations
  531. Sim-2-Sim Transfer for Vision-and-Language Navigation in Continuous EnvironmentsPoster49 citations
  532. Towards Sequence-Level Training for Visual TrackingPoster49 citations
  533. A Large-Scale Multiple-Objective Method for Black-Box Attack against Object DetectionPoster48 citations
  534. Approximate Differentiable Rendering with Algebraic SurfacesPoster48 citations
  535. Balancing Stability and Plasticity through Advanced Null Space in Continual LearningPoster48 citations
  536. ECLIPSE: Efficient Long-Range Video Retrieval Using Sight and SoundPoster48 citations
  537. FADE: Fusing the Assets of Decoder and Encoder for Task-Agnostic UpsamplingPoster48 citations
  538. IGFormer: Interaction Graph Transformer for Skeleton-Based Human Interaction RecognitionPoster48 citations
  539. Mining Cross-Person Cues for Body-Part Interactiveness Learning in HOI DetectionPoster48 citations
  540. Neighborhood Collective Estimation for Noisy Label Identification and CorrectionPoster48 citations
  541. Privacy-Preserving Face Recognition with Learnable Privacy Budgets in Frequency DomainPoster48 citations
  542. Relighting4D: Neural Relightable Human from VideosPoster48 citations
  543. Shift-tolerant Perceptual Similarity MetricPoster48 citations
  544. StARformer: Transformer with State-Action-Reward Representations for Visual Reinforcement LearningPoster48 citations
  545. Weakly Supervised 3D Scene Segmentation with Region-Level Boundary Awareness and Instance DiscriminationPoster48 citations
  546. Weakly Supervised Object Localization via Transformer with Implicit Spatial CalibrationPoster48 citations
  547. Adaptive Agent Transformer for Few-Shot SegmentationPoster47 citations
  548. Hierarchically Self-Supervised Transformer for Human Skeleton Representation LearningPoster47 citations
  549. Prior-Guided Adversarial Initialization for Fast Adversarial TrainingPoster47 citations
  550. Spatio-Temporal Deformable Attention Network for Video DeblurringPoster47 citations
  551. Teaching Where to Look: Attention Similarity Knowledge Distillation for Low Resolution Face RecognitionPoster47 citations
  552. VecGAN: Image-to-Image Translation with Interpretable Latent DirectionsPoster47 citations
  553. "Towards Scale-Aware, Robust, and Generalizable Unsupervised Monocular Depth Estimation by Integrating IMU Motion Dynamics"Poster46 citations
  554. "UniNet: Unified Architecture Search with Convolution, Transformer, and MLP"Poster46 citations
  555. Controllable and Guided Face Synthesis for Unconstrained Face RecognitionPoster46 citations
  556. Enhanced Accuracy and Robustness via Multi-Teacher Adversarial DistillationPoster46 citations
  557. Graph Neural Network for Cell Tracking in Microscopy VideosPoster46 citations
  558. Interclass Prototype Relation for Few-Shot SegmentationPoster46 citations
  559. Learning Spatiotemporal Frequency-Transformer for Compressed Video Super-ResolutionPoster46 citations
  560. MetaGait: Learning to Learn an Omni Sample Adaptive Representation for Gait RecognitionPoster46 citations
  561. Multi-Exit Semantic Segmentation NetworksPoster46 citations
  562. Spatial-Separated Curve Rendering Network for Efficient and High-Resolution Image HarmonizationPoster46 citations
  563. A Unified Framework for Domain Adaptive Pose EstimationPoster45 citations
  564. Almost-Orthogonal Layers for Efficient General-Purpose Lipschitz NetworksPoster45 citations
  565. Black-Box Dissector: Towards Erasing-Based Hard-Label Model Stealing AttackPoster45 citations
  566. Boosting Transferability of Targeted Adversarial Examples via Hierarchical Generative NetworksPoster45 citations
  567. CADyQ: Content-Aware Dynamic Quantization for Image Super-ResolutionPoster45 citations
  568. DANBO: Disentangled Articulated Neural Body Representations via Graph Neural NetworksPoster45 citations
  569. Designing One Unified Framework for High-Fidelity Face Reenactment and SwappingPoster45 citations
  570. ExtrudeNet: Unsupervised Inverse Sketch-and-Extrude for Shape ParsingPoster45 citations
  571. Learn2Augment: Learning to Composite Videos for Data Augmentation in Action RecognitionPoster45 citations
  572. Mc-BEiT: Multi-Choice Discretization for Image BERT Pre-trainingPoster45 citations
  573. Parameterized Temperature Scaling for Boosting the Expressive Power in Post-Hoc Uncertainty CalibrationPoster45 citations
  574. Prune Your Model before Distill ItPoster45 citations
  575. RadioTransformer: A Cascaded Global-Focal Transformer for Visual Attention-Guided Disease ClassificationPoster45 citations
  576. Self-Promoted Supervision for Few-Shot TransformerPoster45 citations
  577. Semi-Supervised Vision TransformersPoster45 citations
  578. Unpaired Deep Image Dehazing Using Contrastive Disentanglement LearningPoster45 citations
  579. "Spotting Temporally Precise, Fine-Grained Events in Video"Poster44 citations
  580. Acknowledging the Unknown for Multi-Label Learning with Single Positive LabelsPoster44 citations
  581. Class-Incremental Learning with Cross-Space Clustering and Controlled TransferPoster44 citations
  582. Context-Enhanced Stereo TransformerPoster44 citations
  583. CryoAI: Amortized Inference of Poses for Ab Initio Reconstruction of 3D Molecular Volumes from Real Cryo-EM ImagesPoster44 citations
  584. Dual Contrastive Learning with Anatomical Auxiliary Supervision for Few-Shot Medical Image SegmentationPoster44 citations
  585. Efficient Deep Visual and Inertial Odometry with Adaptive Visual Modality SelectionPoster44 citations
  586. Grounding Visual Representations with Texts for Domain GeneralizationPoster44 citations
  587. HDR-Plenoxels: Self-Calibrating High Dynamic Range Radiance FieldsPoster44 citations
  588. Image Coding for Machines with Omnipotent Feature LearningPoster44 citations
  589. Lightweight Attentional Feature Fusion: A New Baseline for Text-to-Video RetrievalPoster44 citations
  590. MVSalNet:Multi-View Augmentation for RGB-D Salient Object DetectionPoster44 citations
  591. Monitored Distillation for Positive Congruent Depth CompletionPoster44 citations
  592. Neural Strands: Learning Hair Geometry and Appearance from Multi-View ImagesPoster44 citations
  593. Object Discovery via Contrastive Learning for Weakly Supervised Object DetectionPoster44 citations
  594. PolyphonicFormer: Unified Query Learning for Depth-Aware Video Panoptic SegmentationPoster44 citations
  595. Real Spike: Learning Real-Valued Spikes for Spiking Neural NetworksPoster44 citations
  596. Scale-Aware Spatio-Temporal Relation Learning for Video Anomaly DetectionPoster44 citations
  597. Sem2NeRF: Converting Single-View Semantic Masks to Neural Radiance FieldsPoster44 citations
  598. Source-Free Video Domain Adaptation by Learning Temporal Consistency for Action RecognitionPoster44 citations
  599. D&D: Learning Human Dynamics from Dynamic CameraPoster43 citations
  600. DeltaGAN: Towards Diverse Few-Shot Image Generation with Sample-Specific DeltaPoster43 citations
  601. Image-Based CLIP-Guided Essence TransferPoster43 citations
  602. Language Matters: A Weakly Supervised Vision-Language Pre-training Approach for Scene Text Detection and SpottingPoster43 citations
  603. Learning Invariant Visual Representations for Compositional Zero-Shot LearningPoster43 citations
  604. Learning Prior Feature and Attention Enhanced Image InpaintingPoster43 citations
  605. Learning to Drive by Watching YouTube Videos: Action-Conditioned Contrastive Policy PretrainingPoster43 citations
  606. Online Continual Learning with Contrastive Vision TransformerPoster43 citations
  607. Prediction-Guided Distillation for Dense Object DetectionPoster43 citations
  608. Reducing Information Loss for Spiking Neural NetworksPoster43 citations
  609. Spatiotemporal Self-Attention Modeling with Temporal Patch Shift for Action RecognitionPoster43 citations
  610. TALISMAN: Targeted Active Learning for Object Detection with Rare Classes and Slices Using Submodular Mutual InformationPoster43 citations
  611. An Information Theoretic Approach for Attention-Driven Face Forgery DetectionPoster42 citations
  612. Blind Image DecompositionPoster42 citations
  613. Constructing Balance from Imbalance for Long-Tailed Image RecognitionPoster42 citations
  614. Cross-Domain Ensemble Distillation for Domain GeneralizationPoster42 citations
  615. Densely Constrained Depth Estimator for Monocular 3D Object DetectionPoster42 citations
  616. EleGANt: Exquisite and Locally Editable GAN for Makeup TransferPoster42 citations
  617. Inductive and Transductive Few-Shot Video Classification via Appearance and Temporal AlignmentsPoster42 citations
  618. Making Heads or Tails: Towards Semantically Consistent Visual CounterfactualsPoster42 citations
  619. Mining Relations among Cross-Frame Affinities for Video Semantic SegmentationPoster42 citations
  620. Pose Forecasting in Industrial Human-Robot CollaborationPoster42 citations
  621. Pre-training Strategies and Datasets for Facial Representation LearningPoster42 citations
  622. Self-Calibrating Photometric Stereo by Neural Inverse RenderingPoster42 citations
  623. Structure and Motion from Casual VideosPoster42 citations
  624. Tackling Background Distraction in Video Object SegmentationPoster42 citations
  625. Tree Structure-Aware Few-Shot Image Classification via Hierarchical AggregationPoster42 citations
  626. Bilateral Normal IntegrationPoster41 citations
  627. CLASTER: Clustering with Reinforcement Learning for Zero-Shot Action RecognitionPoster41 citations
  628. Doubly Deformable Aggregation of Covariance Matrices for Few-Shot SegmentationPoster41 citations
  629. Eliminating Gradient Conflict in Reference-Based Line-Art ColorizationPoster41 citations
  630. Event-Guided Deblurring of Unknown Exposure Time VideosPoster41 citations
  631. Gradient-Based Uncertainty for Monocular Depth EstimationPoster41 citations
  632. MorphMLP: An Efficient MLP-Like Backbone for Spatial-Temporal Representation LearningPoster41 citations
  633. Neural Light Field Estimation for Street Scenes with Differentiable Virtual Object InsertionPoster41 citations
  634. Prior Knowledge Guided Unsupervised Domain AdaptationPoster41 citations
  635. REALY: Rethinking the Evaluation of 3D Face ReconstructionPoster41 citations
  636. RepMix: Representation Mixing for Robust Attribution of Synthesized ImagesPoster41 citations
  637. Skeleton-Free Pose Transfer for Stylized 3D CharactersPoster41 citations
  638. Understanding Collapse in Non-Contrastive Siamese Representation LearningPoster41 citations
  639. Unsupervised Selective Labeling for More Effective Semi-Supervised LearningPoster41 citations
  640. You Should Look at All ObjectsPoster41 citations
  641. "Fashionformer: A Simple, Effective and Unified Baseline for Human Fashion Segmentation and Recognition"Poster40 citations
  642. 3D-Aware Semantic-Guided Generative Model for Human SynthesisPoster40 citations
  643. An Efficient Spatio-Temporal Pyramid Transformer for Action DetectionPoster40 citations
  644. AvatarCap: Animatable Avatar Conditioned Monocular Human Volumetric CapturePoster40 citations
  645. CATRE: Iterative Point Clouds Alignment for Category-Level Object Pose RefinementPoster40 citations
  646. Cross-Domain Few-Shot Semantic SegmentationPoster40 citations
  647. Learned Vertex Descent: A New Direction for 3D Human Model FittingPoster40 citations
  648. PreTraM: Self-Supervised Pre-training via Connecting Trajectory and MapPoster40 citations
  649. Sound-Guided Semantic Video GenerationPoster40 citations
  650. Towards Hard-Positive Query Mining for DETR-Based Human-Object Interaction DetectionPoster40 citations
  651. Towards Ultra Low Latency Spiking Neural Networks for Vision and Sequential Tasks Using Temporal PruningPoster40 citations
  652. Where in the World Is This Image? Transformer-Based Geo-Localization in the WildPoster40 citations
  653. A Sketch Is Worth a Thousand Words: Image Retrieval with Text and SketchPoster39 citations
  654. Action-Based Contrastive Learning for Trajectory PredictionPoster39 citations
  655. COMPOSER: Compositional Reasoning of Group Activity in Videos with Keypoint-Only ModalityPoster39 citations
  656. CP2: Copy-Paste Contrastive Pretraining for Semantic SegmentationPoster39 citations
  657. FLEX: Extrinsic Parameters-Free Multi-View 3D Human Motion ReconstructionPoster39 citations
  658. GeoAug: Data Augmentation for Few-Shot NeRF with Geometry ConstraintsPoster39 citations
  659. Hunting Group Clues with Transformers for Social Group Activity RecognitionPoster39 citations
  660. Label2Label: A Language Modeling Framework for Multi-Attribute LearningPoster39 citations
  661. Latent Partition Implicit with Surface Codes for 3D RepresentationPoster39 citations
  662. MuLUT: Cooperating Multiple Look-Up Tables for Efficient Image Super-ResolutionPoster39 citations
  663. PREF: Predictability Regularized Neural Motion FieldsPoster39 citations
  664. Personalizing Federated Medical Image Segmentation via Local CalibrationPoster39 citations
  665. Rethinking Closed-Loop Training for Autonomous DrivingPoster39 citations
  666. Teaching with Soft Label Smoothing for Mitigating Noisy Labels in Facial ExpressionsPoster39 citations
  667. Unstructured Feature Decoupling for Vehicle Re-identificationPoster39 citations
  668. ARM: Any-Time Super-Resolution MethodPoster38 citations
  669. AcroFOD: An Adaptive Method for Cross-Domain Few-Shot Object DetectionPoster38 citations
  670. Adversarially-Aware Robust Object DetectorPoster38 citations
  671. D3Net: A Unified Speaker-Listener Architecture for 3D Dense Captioning and Visual GroundingPoster38 citations
  672. DevNet: Self-Supervised Monocular Depth Learning via Density Volume ConstructionPoster38 citations
  673. Error Compensation Framework for Flow-Guided Video InpaintingPoster38 citations
  674. GraphCSPN: Geometry-Aware Depth Completion via Dynamic GCNsPoster38 citations
  675. Helpful or Harmful: Inter-Task Association in Continual LearningPoster38 citations
  676. High-Fidelity GAN Inversion with Padding SpacePoster38 citations
  677. IntegratedPIFu: Integrated Pixel Aligned Implicit Function for Single-View Human ReconstructionPoster38 citations
  678. Multimodal Transformer with Variable-Length Memory for Vision-and-Language NavigationPoster38 citations
  679. Not All Models Are Equal: Predicting Model Transferability in a Self-Challenging Fisher SpacePoster38 citations
  680. OPD: Single-View 3D Openable Part DetectionPoster38 citations
  681. PD-Flow: A Point Cloud Denoising Framework with Normalizing FlowsPoster38 citations
  682. PalGAN: Image Colorization with Palette Generative Adversarial NetworksPoster38 citations
  683. Self-Supervised Classification NetworkPoster38 citations
  684. Semi-Supervised Keypoint Detector and Descriptor for Retinal Image MatchingPoster38 citations
  685. The Anatomy of Video Editing: A Dataset and Benchmark Suite for AI-Assisted Video EditingPoster38 citations
  686. UCTNet: Uncertainty-Aware Cross-Modal Transformer Network for Indoor RGB-D Semantic SegmentationPoster38 citations
  687. Unsupervised Deep Multi-Shape MatchingPoster38 citations
  688. Video Mask Transfiner for High-Quality Video Instance SegmentationPoster38 citations
  689. 3D-Aware Indoor Scene Synthesis with Depth PriorsPoster37 citations
  690. BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object SegmentationPoster37 citations
  691. CODER: Coupled Diversity-Sensitive Momentum Contrastive Learning for Image-Text RetrievalPoster37 citations
  692. Can Shuffling Video Benefit Temporal Bias Problem: A Novel Training Framework for Temporal GroundingPoster37 citations
  693. Completely Self-Supervised Crowd Counting via Distribution MatchingPoster37 citations
  694. Dense Gaussian Processes for Few-Shot SegmentationPoster37 citations
  695. Dual Adaptive Transformations for Weakly Supervised Point Cloud SegmentationPoster37 citations
  696. Explicit Occlusion Reasoning for Multi-Person 3D Human Pose EstimationPoster37 citations
  697. Face2Faceρ: Real-Time High-Resolution One-Shot Face ReenactmentPoster37 citations
  698. FakeCLR: Exploring Contrastive Learning for Solving Latent Discontinuity in Data-Efficient GANsPoster37 citations
  699. Improving the Perceptual Quality of 2D Animation InterpolationPoster37 citations
  700. L-CoDer: Language-Based Colorization with Color-Object Decoupling TransformerPoster37 citations
  701. LaTeRF: Label and Text Driven Object Radiance FieldsPoster37 citations
  702. Learning Algebraic Representation for Systematic Generalization in Abstract ReasoningPoster37 citations
  703. Learning Efficient Multi-agent Cooperative Visual ExplorationPoster37 citations
  704. Open-World Semantic Segmentation for LIDAR Point CloudsPoster37 citations
  705. Point Cloud Domain Adaptation via Masked Local 3D Structure PredictionPoster37 citations
  706. PoseTrans: A Simple yet Effective Pose Transformation Augmentation for Human Pose EstimationPoster37 citations
  707. Scaling Adversarial Training to Large Perturbation BoundsPoster37 citations
  708. Self-Slimmed Vision TransformerPoster37 citations
  709. Social ODE: Multi-agent Trajectory Forecasting with Neural Ordinary Differential EquationsPoster37 citations
  710. Temporal and Cross-Modal Attention for Audio-Visual Zero-Shot LearningPoster37 citations
  711. The Caltech Fish Counting Dataset: A Benchmark for Multiple-Object Tracking and CountingPoster37 citations
  712. AudioScopeV2: Audio-Visual Attention Architectures for Calibrated Open-Domain On-Screen Sound SeparationPoster36 citations
  713. Disentangling Architecture and Training for Optical FlowPoster36 citations
  714. Efficient One Pass Self-Distillation with Zipf’s Label SmoothingPoster36 citations
  715. End-to-End Active Speaker DetectionPoster36 citations
  716. High-Fidelity Image Inpainting with GAN InversionPoster36 citations
  717. Improving the Intra-Class Long-Tail in 3D Detection via Rare Example MiningPoster36 citations
  718. Joint-Modal Label Denoising for Weakly-Supervised Audio-Visual Video ParsingPoster36 citations
  719. KD-MVS: Knowledge Distillation Based Self-Supervised Learning for Multi-View StereoPoster36 citations
  720. KXNet: A Model-Driven Deep Neural Network for Blind Super-ResolutionPoster36 citations
  721. OIMNet++: Prototypical Normalization and Localization-Aware Learning for Person SearchPoster36 citations
  722. On the Versatile Uses of Partial Distance Correlation in Deep LearningPoster36 citations
  723. Out-of-Distribution Detection with Semantic Mismatch under MaskingPoster36 citations
  724. PACTran: PAC-Bayesian Metrics for Estimating the Transferability of Pretrained Models to Classification TasksPoster36 citations
  725. Self-Distillation for Robust LiDAR Semantic Segmentation in Autonomous DrivingPoster36 citations
  726. Share with Thy Neighbors: Single-View Reconstruction by Cross-Instance ConsistencyPoster36 citations
  727. Unsupervised Visual Representation Learning by Synchronous Momentum GroupingPoster36 citations
  728. Where to Focus: Investigating Hierarchical Attention Relationship for Fine-Grained Visual ClassificationPoster36 citations
  729. 3D Object Detection with a Self-Supervised Lidar Scene Flow BackbonePoster35 citations
  730. Adaptive Face Forgery Detection in Cross DomainPoster35 citations
  731. Adaptive Spatial-BCE Loss for Weakly Supervised Semantic SegmentationPoster35 citations
  732. BRNet: Exploring Comprehensive Features for Monocular Depth EstimationPoster35 citations
  733. Bi-directional Contrastive Learning for Domain Adaptive Semantic SegmentationPoster35 citations
  734. Compiler-Aware Neural Architecture Search for On-Mobile Real-Time Super-ResolutionPoster35 citations
  735. Contrastive Vision-Language Pre-training with Limited ResourcesPoster35 citations
  736. DetMatch: Two Teachers Are Better than One for Joint 2D and 3D Semi-Supervised Object DetectionPoster35 citations
  737. Efficient Video Deblurring Guided by Motion MagnitudePoster35 citations
  738. FingerprintNet: Synthesized Fingerprints for Generated Image DetectionPoster35 citations
  739. GitNet: Geometric Prior-Based Transformation for Birds-Eye-View SegmentationPoster35 citations
  740. Improving Fine-Grained Visual Recognition in Low Data Regimes via Self-Boosting Attention MechanismPoster35 citations
  741. Multi-modal Masked Pre-training for Monocular Panoramic Depth CompletionPoster35 citations
  742. Neural-Sim: Learning to Generate Training Data with NeRFPoster35 citations
  743. Temporally Consistent Semantic Video EditingPoster35 citations
  744. Towards Racially Unbiased Skin Tone Estimation via Scene DisambiguationPoster35 citations
  745. Unifying Event Detection and Captioning as Sequence Generation via Pre-trainingPoster35 citations
  746. BA-Net: Bridge Attention for Deep Convolutional Neural NetworksPoster34 citations
  747. Benchmarking Omni-Vision Representation through the Lens of Visual RealmsPoster34 citations
  748. Cross-Modal 3D Shape Generation and ManipulationPoster34 citations
  749. EAutoDet: Efficient Architecture Search for Object DetectionPoster34 citations
  750. Ensemble Learning Priors Driven Deep Unfolding for Scalable Video Snapshot Compressive ImagingPoster34 citations
  751. Geometry-Aware Single-Image Full-Body Human RelightingPoster34 citations
  752. Hardly Perceptible Trojan Attack against Neural Networks with Bit FlipsPoster34 citations
  753. Look Both Ways: Self-Supervising Driver Gaze Estimation and Road Scene SaliencyPoster34 citations
  754. MovieCuts: A New Dataset and Benchmark for Cut Type RecognitionPoster34 citations
  755. Object Level Depth Reconstruction for Category Level 6D Object Pose Estimation from Monocular RGB ImagePoster34 citations
  756. Optimal Boxes: Boosting End-to-End Scene Text Recognition by Adjusting Annotated Bounding Boxes via Reinforcement LearningPoster34 citations
  757. PCR-CG: Point Cloud Registration via Deep Explicit Color and GeometryPoster34 citations
  758. Pairwise Contrastive Learning Network for Action Quality AssessmentPoster34 citations
  759. Pointly-Supervised Panoptic SegmentationPoster34 citations
  760. Rethinking Learning Approaches for Long-Term Action AnticipationPoster34 citations
  761. Revisiting Point Cloud Simplification: A Learnable Feature Preserving ApproachPoster34 citations
  762. Robust Object Detection with Inaccurate Bounding BoxesPoster34 citations
  763. Self-Distilled Feature Aggregation for Self-Supervised Monocular Depth EstimationPoster34 citations
  764. Social-SSL: Self-Supervised Cross-Sequence Representation Learning Based on Transformers for Multi-agent Trajectory PredictionPoster34 citations
  765. Towards High-Fidelity Single-View Holistic Reconstruction of Indoor ScenesPoster34 citations
  766. "Contributions of Shape, Texture, and Color in Visual Recognition"Poster33 citations
  767. A Closer Look at Invariances in Self-Supervised Pre-training for 3D VisionPoster33 citations
  768. AssistQ: Affordance-Centric Question-Driven Task Completion for Egocentric AssistantPoster33 citations
  769. Contrastive Vicinal Space for Unsupervised Domain AdaptationPoster33 citations
  770. DLME: Deep Local-Flatness Manifold EmbeddingPoster33 citations
  771. Decoupled Adversarial Contrastive Learning for Self-Supervised Adversarial RobustnessPoster33 citations
  772. Depth Map Decomposition for Monocular Depth EstimationPoster33 citations
  773. Exploring the Devil in Graph Spectral Domain for 3D Point Cloud AttacksPoster33 citations
  774. GIPSO: Geometrically Informed Propagation for Online Adaptation in 3D LiDAR SegmentationPoster33 citations
  775. Geometric Representation Learning for Document Image RectificationPoster33 citations
  776. Learning Series-Parallel Lookup Tables for Efficient Image Super-ResolutionPoster33 citations
  777. LiDAL: Inter-Frame Uncertainty Based Active Learning for 3D LiDAR Semantic SegmentationPoster33 citations
  778. Polarimetric Pose PredictionPoster33 citations
  779. Predicting Is Not Understanding: Recognizing and Addressing Underspecification in Machine LearningPoster33 citations
  780. Revisiting a kNN-based Image Classification System with High-capacity StoragePoster33 citations
  781. SUPR: A Sparse Unified Part-Based Human RepresentationPoster33 citations
  782. Sliced Recursive TransformerPoster33 citations
  783. Towards Open Set Video Anomaly DetectionPoster33 citations
  784. Towards Unbiased Label Distribution Learning for Facial Pose Estimation Using Anisotropic Spherical GaussianPoster33 citations
  785. AirDet: Few-Shot Detection without Fine-Tuning for Autonomous ExplorationPoster32 citations
  786. Camera Pose Auto-Encoders for Improving Pose RegressionPoster32 citations
  787. Discovering Transferable Forensic Features for CNN-Generated Images DetectionPoster32 citations
  788. Fast-Vid2Vid: Spatial-Temporal Compression for Video-to-Video SynthesisPoster32 citations
  789. InAction: Interpretable Action Decision Making for Autonomous DrivingPoster32 citations
  790. Meta Spatio-Temporal Debiasing for Video Scene Graph GenerationPoster32 citations
  791. Network Binarization via Contrastive LearningPoster32 citations
  792. Point Primitive Transformer for Long-Term 4D Point Cloud Video UnderstandingPoster32 citations
  793. PrivHAR: Recognizing Human Actions from Privacy-Preserving LensPoster32 citations
  794. RCLane: Relay Chain Prediction for Lane DetectionPoster32 citations
  795. SGBANet: Semantic GAN and Balanced Attention Network for Arbitrarily Oriented Scene Text RecognitionPoster32 citations
  796. TAFIM: Targeted Adversarial Attacks against Facial Image ManipulationsPoster32 citations
  797. Unpaired Image Translation via Vector Symbolic ArchitecturesPoster32 citations
  798. A Style-Based GAN Encoder for High Fidelity Reconstruction of Images and VideosPoster31 citations
  799. Active Learning Strategies for Weakly-Supervised Object DetectionPoster31 citations
  800. Adaptive Image Transformations for Transfer-Based Adversarial AttackPoster31 citations
  801. Adaptive Patch Exiting for Scalable Single Image Super-ResolutionPoster31 citations
  802. DELTAR: Depth Estimation from a Light-Weight ToF Sensor and RGB ImagePoster31 citations
  803. Dynamic Temporal Filtering In Video ModelsPoster31 citations
  804. Exploring Resolution and Degradation Clues As Self-Supervised Signal for Low Quality Object DetectionPoster31 citations
  805. Fast-MoCo: Boost Momentum-Based Contrastive Learning with Combinatorial PatchesPoster31 citations
  806. HULC: 3D HUman Motion Capture with Pose Manifold SampLing and Dense Contact GuidancePoster31 citations
  807. Hierarchical Memory Learning for Fine-Grained Scene Graph GenerationPoster31 citations
  808. MUGEN: A Playground for Video-Audio-Text Multimodal Understanding and GENerationPoster31 citations
  809. RBC: Rectifying the Biased Context in Continual Semantic SegmentationPoster31 citations
  810. Sim-to-Real 6D Object Pose Estimation via Iterative Self-Training for Robotic Bin PickingPoster31 citations
  811. SphereFed: Hyperspherical Federated LearningPoster31 citations
  812. Static and Dynamic Concepts for Self-Supervised Video Representation LearningPoster31 citations
  813. Video Activity Localisation with Uncertainties in Temporal BoundaryPoster31 citations
  814. Watermark Vaccine: Adversarial Attacks to Prevent Watermark RemovalPoster31 citations
  815. 3D Random Occlusion and Multi-layer Projection for Deep Multi-Camera Pedestrian LocalizationPoster30 citations
  816. 3D-FM GAN: Towards 3D-Controllable Face ManipulationPoster30 citations
  817. A Dense Material Segmentation Dataset for Indoor and Outdoor Scene ParsingPoster30 citations
  818. A Transformer-Based Decoder for Semantic Segmentation with Multi-level Context MiningPoster30 citations
  819. Adaptive Fine-Grained Sketch-Based Image RetrievalPoster30 citations
  820. Controllable Shadow Generation Using Pixel Height MapsPoster30 citations
  821. Custom Structure Preservation in Face AgingPoster30 citations
  822. Domain Knowledge-Informed Self-Supervised Representations for Workout Form AssessmentPoster30 citations
  823. DoodleFormer: Creative Sketch Drawing with TransformersPoster30 citations
  824. Dynamic Dual Trainable Bounds for Ultra-Low Precision Super-Resolution NetworksPoster30 citations
  825. Dynamic Spatio-Temporal Specialization Learning for Fine-Grained Action RecognitionPoster30 citations
  826. IS-MVSNet: Importance Sampling-Based MVSNetPoster30 citations
  827. Online Domain Adaptation for Semantic Segmentation in Ever-Changing ConditionsPoster30 citations
  828. Open-Set Semi-Supervised Object DetectionPoster30 citations
  829. Point Scene Understanding via Disentangled Instance Mesh ReconstructionPoster30 citations
  830. Radatron: Accurate Detection Using Multi-Resolution Cascaded MIMO RadarPoster30 citations
  831. Robust Category-Level 6D Pose Estimation with Coarse-to-Fine Rendering of Neural FeaturesPoster30 citations
  832. Salient Object Detection for Point CloudsPoster30 citations
  833. Self-Supervised Learning for Real-World Super-Resolution from Dual Zoomed ObservationsPoster30 citations
  834. Semi-Supervised Temporal Action Detection with Proposal-Free MaskingPoster30 citations
  835. SpatialDETR: Robust Scalable Transformer-Based 3D Object Detection from Multi-View Camera Images with Global Cross-Sensor AttentionPoster30 citations
  836. Unsupervised Segmentation in Real-World Images via Spelke Object InferencePoster30 citations
  837. 3D Human Pose Estimation Using Möbius Graph Convolutional NetworksPoster29 citations
  838. Anti-Retroactive Interference for Lifelong LearningPoster29 citations
  839. Bagging Regional Classification Activation Maps for Weakly Supervised Object LocalizationPoster29 citations
  840. BayesCap: Bayesian Identity Cap for Calibrated Uncertainty in Frozen Neural NetworksPoster29 citations
  841. Centrality and Consistency: Two-Stage Clean Samples Identification for Learning with Instance-Dependent Noisy LabelsPoster29 citations
  842. Concurrent Subsidiary Supervision for Unsupervised Source-Free Domain AdaptationPoster29 citations
  843. Convolutional Embedding Makes Hierarchical Vision Transformer StrongerPoster29 citations
  844. CostDCNet: Cost Volume Based Depth Completion for a Single RGB-D ImagePoster29 citations
  845. DualFormer: Local-Global Stratified Transformer for Efficient Video RecognitionPoster29 citations
  846. ERA: Expert Retrieval and Assembly for Early Action PredictionPoster29 citations
  847. Hierarchical Feature Embedding for Visual TrackingPoster29 citations
  848. Injecting 3D Perception of Controllable NeRF-GAN into StyleGAN for Editable Portrait Image SynthesisPoster29 citations
  849. Learning Spatial-Preserved Skeleton Representations for Few-Shot Action RecognitionPoster29 citations
  850. Multi-Query Video RetrievalPoster29 citations
  851. Neural Correspondence Field for Object Pose EstimationPoster29 citations
  852. No Token Left Behind: Explainability-Aided Image Classification and GenerationPoster29 citations
  853. Panoramic Human Activity RecognitionPoster29 citations
  854. Pure Transformer with Integrated Experts for Scene Text RecognitionPoster29 citations
  855. SAFA: Sample-Adaptive Feature Augmentation for Long-Tailed Image ClassificationPoster29 citations
  856. SEMICON: A Learning-to-Hash Solution for Large-Scale Fine-Grained Image RetrievalPoster29 citations
  857. Selective TransHDR: Transformer-Based Selective HDR Imaging Using Ghost Region MaskPoster29 citations
  858. Target-Absent Human AttentionPoster29 citations
  859. Time-rEversed diffusioN tEnsor Transformer: A New TENET of Few-Shot Object DetectionPoster29 citations
  860. TransMatting: Enhancing Transparent Objects Matting with TransformersPoster29 citations
  861. Unsupervised Domain Adaptation for One-Stage Object Detector Using Offsets to Bounding BoxPoster29 citations
  862. tSF: Transformer-Based Semantic Filter for Few-Shot LearningPoster29 citations
  863. A Comparative Study of Graph Matching Algorithms in Computer VisionPoster28 citations
  864. A Generalized & Robust Framework for Timestamp Supervision in Temporal Action SegmentationPoster28 citations
  865. Accelerating Score-Based Generative Models with Preconditioned Diffusion SamplingPoster28 citations
  866. Audio-Driven Stylized Gesture Generation with Flow-Based ModelPoster28 citations
  867. CAViT: Contextual Alignment Vision Transformer for Video Object Re-identificationPoster28 citations
  868. Class-Agnostic Object Counting Robust to Intraclass DiversityPoster28 citations
  869. Equivariance and Invariance Inductive Bias for Learning from Insufficient DataPoster28 citations
  870. Fast and High Quality Image Denoising via Malleable ConvolutionPoster28 citations
  871. Filter Pruning via Feature Discrimination in Deep Neural NetworksPoster28 citations
  872. Hierarchical Latent Structure for Multi-modal Vehicle Trajectory ForecastingPoster28 citations
  873. Improving GANs for Long-Tailed Data through Group Spectral RegularizationPoster28 citations
  874. Iwin: Human-Object Interaction Detection via Transformer with Irregular WindowsPoster28 citations
  875. Learning with Noisy Labels by Efficient Transition Matrix Estimation to Combat Label MiscorrectionPoster28 citations
  876. Lipschitz Continuity Retained Binary Neural NetworkPoster28 citations
  877. Neural Capture of Animatable 3D Human from Monocular VideoPoster28 citations
  878. RealFlow: EM-Based Realistic Optical Flow Dataset Generation from VideosPoster28 citations
  879. SketchSampler: Sketch-Based 3D Reconstruction via View-Dependent Depth SamplingPoster28 citations
  880. The One Where They Reconstructed 3D Humans and Environments in TV ShowsPoster28 citations
  881. Unbiased Multi-Modality Guidance for Image InpaintingPoster28 citations
  882. Adversarial Contrastive Learning via Asymmetric InfoNCEPoster27 citations
  883. CMT: Context-Matching-Guided Transformer for 3D Tracking in Point CloudsPoster27 citations
  884. Detecting Tampered Scene Text in the WildPoster27 citations
  885. Drive&Segment: Unsupervised Semantic Segmentation of Urban Scenes via Cross-Modal DistillationPoster27 citations
  886. ECO-TR: Efficient Correspondences Finding via Coarse-to-Fine RefinementPoster27 citations
  887. Egocentric Activity Recognition and Localization on a 3D MapPoster27 citations
  888. FairStyle: Debiasing StyleGAN2 with Style Channel ManipulationsPoster27 citations
  889. Feature Representation Learning for Unsupervised Cross-Domain Image RetrievalPoster27 citations
  890. Few-Shot Object Detection with Model CalibrationPoster27 citations
  891. How Severe Is Benchmark-Sensitivity in Video Self-Supervised Learning?Poster27 citations
  892. Identifying Hard Noise in Long-Tailed Sample DistributionPoster27 citations
  893. Learning Object Placement via Dual-Path Graph CompletionPoster27 citations
  894. Panoramic Vision Transformer for Saliency Detection in 360° VideosPoster27 citations
  895. Rethinking Zero-Shot Action Recognition: Learning from Latent Atomic ActionsPoster27 citations
  896. Selective Query-Guided Debiasing for Video Corpus Moment RetrievalPoster27 citations
  897. "BodySLAM: Joint Camera Localisation, Mapping, and Human Motion Tracking"Poster26 citations
  898. 3D Equivariant Graph Implicit FunctionsPoster26 citations
  899. AdaBest: Minimizing Client Drift in Federated Learning via Adaptive Bias EstimationPoster26 citations
  900. DODA: Data-Oriented Sim-to-Real Domain Adaptation for 3D Semantic SegmentationPoster26 citations
  901. Domain Adaptive Person SearchPoster26 citations
  902. EAGAN: Efficient Two-Stage Evolutionary Architecture Search for GANsPoster26 citations
  903. Efficient Point Cloud Segmentation with Geometry-Aware Sparse NetworksPoster26 citations
  904. Exploring Hierarchical Graph Representation for Large-Scale Zero-Shot Image ClassificationPoster26 citations
  905. Few-Shot Image Generation with Mixup-Based Distance LearningPoster26 citations
  906. FrequencyLowCut Pooling – Plug & Play against Catastrophic OverfittingPoster26 citations
  907. Generative Negative Text Replay for Continual Vision-Language PretrainingPoster26 citations
  908. Learning Semantic Correspondence with Sparse AnnotationsPoster26 citations
  909. Non-uniform Step Size Quantization for Accurate Post-Training QuantizationPoster26 citations
  910. Outpainting by QueriesPoster26 citations
  911. PlaneFormers: From Sparse View Planes to 3D ReconstructionPoster26 citations
  912. PressureVision: Estimating Hand Pressure from a Single RGB ImagePoster26 citations
  913. Primitive-Based Shape Abstraction via Nonparametric Bayesian InferencePoster26 citations
  914. SiRi: A Simple Selective Retraining Mechanism for Transformer-Based Visual GroundingPoster26 citations
  915. Speaker-Adaptive Lip Reading with User-Dependent PaddingPoster26 citations
  916. StyleFace: Towards Identity-Disentangled Face Generation on MegapixelsPoster26 citations
  917. Word-Level Fine-Grained Story VisualizationPoster26 citations
  918. Active Audio-Visual Separation of Dynamic Sound SourcesPoster25 citations
  919. Animation from Blur: Multi-modal Blur Decomposition with Motion GuidancePoster25 citations
  920. Augmenting Deep Classifiers with Polynomial Neural NetworksPoster25 citations
  921. Aware of the History: Trajectory Forecasting with the Local Behavior DataPoster25 citations
  922. Combating Label Distribution Shift for Active Domain AdaptationPoster25 citations
  923. DeMFI: Deep Joint Deblurring and Multi-Frame Interpolation with Flow-Guided Attentive Correlation and Recursive BoostingPoster25 citations
  924. Discrete-Constrained Regression for Local Counting ModelsPoster25 citations
  925. Efficient Decoder-Free Object Detection with TransformersPoster25 citations
  926. Few ‘Zero Level Set’-Shot Learning of Shape Signed Distance Functions in Feature SpacePoster25 citations
  927. Generating Natural Images with Direct Patch Distributions MatchingPoster25 citations
  928. HEAD: HEtero-Assists Distillation for Heterogeneous Object DetectorsPoster25 citations
  929. How Stable Are Transferability Metrics Evaluations?Poster25 citations
  930. Improving RGB-D Point Cloud Registration by Learning Multi-Scale Local Linear TransformationPoster25 citations
  931. Learning Visibility for Robust Dense Human Body EstimationPoster25 citations
  932. Learning Visual Styles from Audio-Visual AssociationsPoster25 citations
  933. Long-Tailed Instance Segmentation Using Gumbel Optimized LossPoster25 citations
  934. TempFormer: Temporally Consistent Transformer for Video DenoisingPoster25 citations
  935. Vector Quantized Image-to-Image TranslationPoster25 citations
  936. Weakly-Supervised Stitching Network for Real-World Panoramic Image GenerationPoster25 citations
  937. "GEB+: A Benchmark for Generic Event Boundary Captioning, Grounding and Retrieval"Poster24 citations
  938. 3DG-STFM: 3D Geometric Guided Student-Teacher Feature MatchingPoster24 citations
  939. A Perturbation-Constrained Adversarial Attack for Evaluating the Robustness of Optical FlowPoster24 citations
  940. Automatic Dense Annotation of Large-Vocabulary Sign Language VideosPoster24 citations
  941. Black-Box Few-Shot Knowledge DistillationPoster24 citations
  942. ConCL: Concept Contrastive Learning for Dense Prediction Pre-training in Pathology ImagesPoster24 citations
  943. CoupleFace: Relation Matters for Face Recognition DistillationPoster24 citations
  944. Deep 360° Optical Flow Estimation Based on Multi-Projection FusionPoster24 citations
  945. Dense Siamese Network for Dense Unsupervised LearningPoster24 citations
  946. Domain Adaptive Video Segmentation via Temporal Pseudo SupervisionPoster24 citations
  947. Dual-Stream Knowledge-Preserving Hashing for Unsupervised Video RetrievalPoster24 citations
  948. Entropy-Driven Sampling and Training Scheme for Conditional Diffusion GenerationPoster24 citations
  949. FAR: Fourier Aerial Video RecognitionPoster24 citations
  950. GraphFit: Learning Multi-Scale Graph-Convolutional Representation for Point Cloud Normal EstimationPoster24 citations
  951. Image Super-Resolution with Deep DictionaryPoster24 citations
  952. Improving Closed and Open-Vocabulary Attribute Prediction Using TransformersPoster24 citations
  953. Intrinsic Neural Fields: Learning Functions on ManifoldsPoster24 citations
  954. Learning Hierarchy Aware Features for Reducing Mistake SeverityPoster24 citations
  955. Learning Semantic Segmentation from Multiple Datasets with Label ShiftsPoster24 citations
  956. Learning-Based Point Cloud Registration for 6D Object Pose Estimation in the Real WorldPoster24 citations
  957. Long-Tail Detection with Effective Class-MarginsPoster24 citations
  958. Multi-Person 3D Pose and Shape Estimation via Inverse Kinematics and RefinementPoster24 citations
  959. NSNet: Non-Saliency Suppression Sampler for Efficient Video RecognitionPoster24 citations
  960. Privacy-Preserving Action Recognition via Motion Difference QuantizationPoster24 citations
  961. RamGAN: Region Attentive Morphing GAN for Region-Level Makeup TransferPoster24 citations
  962. Rethinking Few-Shot Object Detection on a Multi-Domain BenchmarkPoster24 citations
  963. Robust Multi-Object Tracking by Marginal InferencePoster24 citations
  964. Streamable Neural FieldsPoster24 citations
  965. Style Your Hair: Latent Optimization for Pose-Invariant Hairstyle Transfer via Local-Style-Aware Hair AlignmentPoster24 citations
  966. Temporal Saliency Query Network for Efficient Video RecognitionPoster24 citations
  967. Towards Interpretable Video Super-Resolution via Alternating OptimizationPoster24 citations
  968. Trading Positional Complexity vs Deepness in Coordinate NetworksPoster24 citations
  969. Uncertainty-Aware Multi-modal Learning via Cross-Modal Random Network PredictionPoster24 citations
  970. Video Question Answering with Iterative Video-Text Co-TokenizationPoster24 citations
  971. l∞-Robustness and Beyond: Unleashing Efficient Adversarial TrainingPoster24 citations
  972. Continual Variational Autoencoder Learning via Online Cooperative MemorizationPoster23 citations
  973. D2HNet: Joint Denoising and Deblurring with Hierarchical Network for Robust Night Image RestorationPoster23 citations
  974. DAS: Densely-Anchored Sampling for Deep Metric LearningPoster23 citations
  975. Domain Adaptive Hand Keypoint and Pixel Localization in the WildPoster23 citations
  976. FH-Net: A Fast Hierarchical Network for Scene Flow Estimation on Real-World Point CloudsPoster23 citations
  977. Federated Self-Supervised Learning for Video UnderstandingPoster23 citations
  978. Hourglass Attention Network for Image InpaintingPoster23 citations
  979. Interpretations Steered Network Pruning via Amortized Inferred Saliency MapsPoster23 citations
  980. Latent Discriminant Deterministic UncertaintyPoster23 citations
  981. Online Task-Free Continual Learning with Dynamic Sparse Distributed MemoryPoster23 citations
  982. PointInst3D: Segmenting 3D Instances by PointsPoster23 citations
  983. Recurrent Bilinear Optimization for Binary Neural NetworksPoster23 citations
  984. Selection and Cross Similarity for Event-Image Deep StereoPoster23 citations
  985. SiamDoGe: Domain Generalizable Semantic Segmentation Using Siamese NetworkPoster23 citations
  986. Towards Comprehensive Representation Enhancement in Semantics-Guided Self-Supervised Monocular Depth EstimationPoster23 citations
  987. VoViT: Low Latency Graph-Based Audio-Visual Voice Separation TransformerPoster23 citations
  988. A Non-Isotropic Probabilistic Take On Proxy-Based Deep Metric LearningPoster22 citations
  989. ASSISTER: Assistive Navigation via Conditional Instruction GenerationPoster22 citations
  990. AdaFocusV3: On Unified Spatial-Temporal Dynamic Video RecognitionPoster22 citations
  991. COO: Comic Onomatopoeia Dataset for Recognizing Arbitrary or Truncated TextsPoster22 citations
  992. Coarse-to-Fine Incremental Few-Shot LearningPoster22 citations
  993. Content Adaptive Latents and Decoder for Neural Image CompressionPoster22 citations
  994. D2ADA: Dynamic Density-Aware Active Domain Adaptation for Semantic SegmentationPoster22 citations
  995. Discovering Human-Object Interaction Concepts via Self-Compositional LearningPoster22 citations
  996. INT: Towards Infinite-Frames 3D Detection with an Efficient FrameworkPoster22 citations
  997. Latent Space Smoothing for Individually Fair RepresentationsPoster22 citations
  998. Learning Where to Look – Generative NAS Is Surprisingly EfficientPoster22 citations
  999. Learning from Multiple Annotator Noisy Labels via Sample-Wise Label FusionPoster22 citations
  1000. Learning to Fit Morphable ModelsPoster22 citations

ECCV accepted papers in other years

Looking for submission deadlines instead? See the conference deadline calendar.