← All conferences

ICCV 2023 Accepted Papers

The full list of 2,156 papers accepted at ICCV 2023 (IEEE/CVF International Conference on Computer Vision). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Poster: 2,005Oral: 145
  1. Segment AnythingPoster10,304 citations
  2. Adding Conditional Control to Text-to-Image Diffusion ModelsPoster4,423 citations
  3. Scalable Diffusion Models with TransformersOral2,255 citations
  4. Zero-1-to-3: Zero-shot One Image to 3D ObjectPoster1,020 citations
  5. Sigmoid Loss for Language Image Pre-TrainingOral1,002 citations
  6. Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video GenerationPoster853 citations
  7. Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video GeneratorsOral578 citations
  8. LLM-Planner: Few-Shot Grounded Planning for Embodied Agents with Large Language ModelsPoster577 citations
  9. DiffusionDet: Diffusion Model for Object DetectionOral570 citations
  10. Fantasia3D: Disentangling Geometry and Appearance for High-quality Text-to-3D Content CreationPoster565 citations
  11. Zip-NeRF: Anti-Aliased Grid-Based Neural Radiance FieldsPoster558 citations
  12. Structure and Content-Guided Video Synthesis with Diffusion ModelsPoster551 citations
  13. LightGlue: Local Feature Matching at Light SpeedPoster540 citations
  14. ViperGPT: Visual Inference via Python Execution for ReasoningOral476 citations
  15. Large Selective Kernel Network for Remote Sensing Object DetectionPoster467 citations
  16. MasaCtrl: Tuning-Free Mutual Self-Attention Control for Consistent Image Synthesis and EditingPoster455 citations
  17. DETRs with Collaborative Hybrid Assignments TrainingPoster444 citations
  18. Instruct-NeRF2NeRF: Editing 3D Scenes with InstructionsOral429 citations
  19. Retinexformer: One-stage Retinex-based Transformer for Low-light Image EnhancementPoster410 citations
  20. LERF: Language Embedded Radiance FieldsOral405 citations
  21. PETRv2: A Unified Framework for 3D Perception from Multi-Camera ImagesPoster397 citations
  22. ELITE: Encoding Visual Concepts into Textual Embeddings for Customized Text-to-Image GenerationOral361 citations
  23. Erasing Concepts from Diffusion ModelsPoster356 citations
  24. Prompt-aligned Gradient for Prompt TuningPoster354 citations
  25. FateZero: Fusing Attentions for Zero-shot Text-based Video EditingOral338 citations
  26. Dynamic Snake Convolution Based on Topological Geometric Constraints for Tubular Structure SegmentationPoster333 citations
  27. Make-It-3D: High-fidelity 3D Creation from A Single Image with Diffusion PriorPoster301 citations
  28. DiffIR: Efficient Diffusion Model for Image RestorationPoster291 citations
  29. What Does a Platypus Look Like? Generating Customized Prompts for Zero-Shot Image ClassificationPoster286 citations
  30. Dual Aggregation Transformer for Image Super-ResolutionPoster285 citations
  31. NeuS2: Fast Learning of Neural Implicit Surfaces for Multi-view ReconstructionPoster276 citations
  32. PhysDiff: Physics-Guided Human Motion Diffusion ModelOral272 citations
  33. SVDiff: Compact Parameter Space for Diffusion Fine-TuningPoster271 citations
  34. Your Diffusion Model is Secretly a Zero-Shot ClassifierPoster267 citations
  35. Preserve Your Own Correlation: A Noise Prior for Video Diffusion ModelsPoster262 citations
  36. SurroundOcc: Multi-camera 3D Occupancy Prediction for Autonomous DrivingPoster260 citations
  37. Learning to Upsample by Learning to SamplePoster256 citations
  38. Pix2Video: Video Editing using Image DiffusionPoster254 citations
  39. Rethinking Vision Transformers for MobileNet Size and SpeedPoster242 citations
  40. PointCLIP V2: Prompting CLIP and GPT for Powerful 3D Open-world LearningPoster241 citations
  41. FLatten Transformer: Vision Transformer using Focused Linear AttentionPoster239 citations
  42. The Stable Signature: Rooting Watermarks in Latent Diffusion ModelsPoster239 citations
  43. ScanNet++: A High-Fidelity Dataset of 3D Indoor ScenesOral236 citations
  44. Exploring Object-Centric Temporal Modeling for Efficient Multi-View 3D Object DetectionPoster235 citations
  45. Generative Novel View Synthesis with 3D-Aware Diffusion ModelsOral235 citations
  46. VAD: Vectorized Scene Representation for Efficient Autonomous DrivingPoster233 citations
  47. FastViT: A Fast Hybrid Vision Transformer Using Structural ReparameterizationPoster231 citations
  48. CLIP-Driven Universal Model for Organ Segmentation and Tumor DetectionPoster230 citations
  49. Unleashing Text-to-Image Diffusion Models for Visual PerceptionPoster229 citations
  50. SparseNeRF: Distilling Depth Ranking for Few-shot Novel View SynthesisPoster227 citations
  51. Hierarchically Decomposed Graph Convolutional Networks for Skeleton-Based Action RecognitionPoster222 citations
  52. DIRE for Diffusion-Generated Image DetectionPoster221 citations
  53. Humans in 4D: Reconstructing and Tracking Humans with TransformersPoster221 citations
  54. SRFormer: Permuted Self-Attention for Single Image Super-ResolutionPoster216 citations
  55. MotionBERT: A Unified Perspective on Learning Human Motion RepresentationsPoster215 citations
  56. Ablating Concepts in Text-to-Image Diffusion ModelsPoster212 citations
  57. DreamBooth3D: Subject-Driven Text-to-3D GenerationPoster211 citations
  58. DDFM: Denoising Diffusion Model for Multi-Modality Image FusionOral210 citations
  59. OccFormer: Dual-path Transformer for Vision-based 3D Semantic Occupancy PredictionPoster207 citations
  60. Self-regulating Prompts: Foundational Model Adaptation without ForgettingPoster205 citations
  61. TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question AnsweringPoster203 citations
  62. Scale-MAE: A Scale-Aware Masked Autoencoder for Multiscale Geospatial Representation LearningOral201 citations
  63. BoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained DiffusionPoster200 citations
  64. DALL-Eval: Probing the Reasoning Skills and Social Biases of Text-to-Image Generation ModelsPoster198 citations
  65. Q-Diffusion: Quantizing Diffusion ModelsPoster195 citations
  66. DiffuMask: Synthesizing Images with Pixel-level Annotations for Semantic Segmentation Using Diffusion ModelsPoster189 citations
  67. Metric3D: Towards Zero-shot Metric 3D Prediction from A Single ImagePoster189 citations
  68. Unmasked Teacher: Towards Training-Efficient Video Foundation ModelsOral189 citations
  69. Versatile Diffusion: Text, Images and Variations All in One Diffusion ModelPoster187 citations
  70. Text2Room: Extracting Textured 3D Meshes from 2D Text-to-Image ModelsPoster186 citations
  71. Rethinking Mobile Block for Efficient Attention-based ModelsPoster180 citations
  72. MonoDETR: Depth-guided Transformer for Monocular 3D Object DetectionPoster179 citations
  73. Text2Tex: Text-driven Texture Synthesis via Diffusion ModelsPoster179 citations
  74. OpenOccupancy: A Large Scale Benchmark for Surrounding Semantic Occupancy PerceptionPoster177 citations
  75. A Simple Framework for Open-Vocabulary Segmentation and DetectionPoster176 citations
  76. NDC-Scene: Boost Monocular 3D Semantic Scene Completion in Normalized Device Coordinates SpacePoster174 citations
  77. StableVideo: Text-driven Consistency-aware Diffusion Video EditingPoster174 citations
  78. Tracking Anything with Decoupled Video SegmentationPoster174 citations
  79. Rethinking Range View Representation for LiDAR SegmentationPoster173 citations
  80. Multi-interactive Feature Learning and a Full-time Multi-modality Benchmark for Image Fusion and SegmentationOral172 citations
  81. Tracking Everything Everywhere All at OnceOral170 citations
  82. CLIP2Point: Transfer CLIP to Point Cloud Classification with Image-Depth Pre-TrainingPoster167 citations
  83. ReMoDiffuse: Retrieval-Augmented Motion Diffusion ModelPoster167 citations
  84. Exploring Video Quality Assessment on User Generated Contents from Aesthetic and Technical PerspectivesPoster162 citations
  85. Group DETR: Fast DETR Training with Group-Wise One-to-Many AssignmentPoster160 citations
  86. TAPIR: Tracking Any Point with Per-Frame Initialization and Temporal RefinementPoster160 citations
  87. UniverSeg: Universal Medical Image SegmentationPoster157 citations
  88. Single-Stage Diffusion NeRF: A Unified Approach to 3D Generation and ReconstructionPoster156 citations
  89. Point-SLAM: Dense Neural Point Cloud-based SLAMPoster153 citations
  90. What does CLIP know about a red circle? Visual prompt engineering for VLMsOral153 citations
  91. FreeDoM: Training-Free Energy-Guided Conditional Diffusion ModelPoster152 citations
  92. Efficient Diffusion Training via Min-SNR Weighting StrategyPoster149 citations
  93. UniVTG: Towards Unified Video-Language Temporal GroundingPoster149 citations
  94. MOSE: A New Dataset for Video Object Segmentation in Complex ScenesPoster148 citations
  95. SLCA: Slow Learner with Classifier Alignment for Continual Learning on a Pre-trained ModelPoster148 citations
  96. Implicit Neural Representation for Cooperative Low-light Image EnhancementPoster146 citations
  97. Scene as OccupancyPoster144 citations
  98. PointOdyssey: A Large-Scale Synthetic Dataset for Long-Term Point TrackingOral143 citations
  99. SwiftFormer: Efficient Additive Attention for Transformer-based Real-time Mobile Vision ApplicationsPoster143 citations
  100. SimpleClick: Interactive Image Segmentation with Simple Vision TransformersPoster142 citations
  101. Spatially-Adaptive Feature Modulation for Efficient Image Super-ResolutionPoster142 citations
  102. Tri-MipRF: Tri-Mip Representation for Efficient Anti-Aliasing Neural Radiance FieldsOral142 citations
  103. Diff-Retinex: Rethinking Low-light Image Enhancement with A Generative Diffusion ModelPoster141 citations
  104. DDP: Diffusion Model for Dense Visual PredictionPoster140 citations
  105. Iterative Prompt Learning for Unsupervised Backlit Image EnhancementOral140 citations
  106. StyleDiffusion: Controllable Disentangled Style Transfer via Diffusion ModelsPoster136 citations
  107. UCF: Uncovering Common Features for Generalizable Deepfake DetectionPoster136 citations
  108. EfficientViT: Lightweight Multi-Scale Attention for High-Resolution Dense PredictionPoster135 citations
  109. GO-SLAM: Global Optimization for Consistent 3D Instant ReconstructionPoster135 citations
  110. SatlasPretrain: A Large-Scale Dataset for Remote Sensing Image UnderstandingPoster133 citations
  111. SuS-X: Training-Free Name-Only Transfer of Vision-Language ModelsPoster133 citations
  112. Masked Diffusion Transformer is a Strong Image SynthesizerPoster130 citations
  113. 3D-VisTA: Pre-trained Transformer for 3D Vision and Text AlignmentPoster129 citations
  114. HyperDiffusion: Generating Implicit Neural Fields with Weight-Space DiffusionPoster128 citations
  115. Anti-DreamBooth: Protecting Users from Personalized Text-to-image SynthesisPoster127 citations
  116. Focal Network for Image RestorationPoster127 citations
  117. SparseBEV: High-Performance Sparse 3D Object Detection from Multi-Camera VideosPoster127 citations
  118. Guided Motion Diffusion for Controllable Human Motion SynthesisPoster126 citations
  119. Zero-Shot Composed Image Retrieval with Textual InversionPoster126 citations
  120. CLIPN for Zero-Shot OOD Detection: Teaching CLIP to Say NoPoster125 citations
  121. Dense Text-to-Image Generation with Attention ModulationPoster125 citations
  122. Diffusion-Based 3D Human Pose Estimation with Multi-Hypothesis AggregationPoster125 citations
  123. MedKLIP: Medical Knowledge Enhanced Language-Image Pre-Training for X-ray DiagnosisPoster125 citations
  124. MB-TaylorFormer: Multi-Branch Efficient Transformer Expanded by Taylor Formula for Image DehazingPoster124 citations
  125. A Generalist Framework for Panoptic Segmentation of Images and VideosPoster123 citations
  126. Localizing Object-Level Shape Variations with Text-to-Image Diffusion ModelsPoster123 citations
  127. Robo3D: Towards Robust and Reliable 3D Perception against CorruptionsPoster123 citations
  128. Diffusion-SDF: Conditional Generative Modeling of Signed Distance FunctionsPoster122 citations
  129. Human Preference Score: Better Aligning Text-to-Image Models with Human PreferencePoster122 citations
  130. I-ViT: Integer-only Quantization for Efficient Vision Transformer InferencePoster121 citations
  131. Scale-Aware Modulation Meet TransformerPoster121 citations
  132. Delicate Textured Mesh Recovery from NeRF via Adaptive Surface RefinementPoster120 citations
  133. Delta Denoising ScorePoster119 citations
  134. A Unified Continual Learning Framework with General Parameter-Efficient TuningPoster118 citations
  135. Cross Modal Transformer: Towards Fast and Robust 3D Object DetectionPoster118 citations
  136. Adaptive Rotated Convolution for Rotated Object DetectionPoster117 citations
  137. EmoTalk: Speech-Driven Emotional Disentanglement for 3D Face AnimationPoster117 citations
  138. NerfAcc: Efficient Sampling Accelerates NeRFsPoster117 citations
  139. InterDiff: Generating 3D Human-Object Interactions with Physics-Informed DiffusionPoster116 citations
  140. Source-free Domain Adaptive Human Pose EstimationPoster113 citations
  141. From Knowledge Distillation to Self-Knowledge Distillation: A Unified Approach with Normalized Loss and Customized Soft LabelsPoster111 citations
  142. MeViS: A Large-scale Benchmark for Video Segmentation with Motion ExpressionsPoster110 citations
  143. RepQ-ViT: Scale Reparameterization for Post-Training Quantization of Vision TransformersPoster105 citations
  144. MotionLM: Multi-Agent Motion Forecasting as Language ModelingPoster104 citations
  145. ProPainter: Improving Propagation and Transformer for Video InpaintingPoster104 citations
  146. SegGPT: Towards Segmenting Everything in ContextPoster104 citations
  147. VideoFlow: Exploiting Temporal Cues for Multi-frame Optical Flow EstimationPoster104 citations
  148. SportsMOT: A Large Multi-Object Tracking Dataset in Multiple Sports ScenesPoster103 citations
  149. BeLFusion: Latent Diffusion for Behavior-Driven Human Motion PredictionPoster102 citations
  150. Deep Directly-Trained Spiking Neural Networks for Object DetectionPoster102 citations
  151. GameFormer: Game-theoretic Modeling and Learning of Transformer-based Interactive Prediction and Planning for Autonomous DrivingOral101 citations
  152. CroCo v2: Improved Cross-view Completion Pre-training for Stereo Matching and Optical FlowPoster100 citations
  153. Preventing Zero-Shot Transfer Degradation in Continual Learning of Vision-Language ModelsPoster100 citations
  154. TF-ICON: Diffusion-Based Training-Free Cross-Domain Image CompositionPoster99 citations
  155. TexFusion: Synthesizing 3D Textures with Text-Guided Image Diffusion ModelsOral99 citations
  156. A Latent Space of Stochastic Diffusion Models for Zero-Shot Image Editing and GuidancePoster98 citations
  157. EgoVLPv2: Egocentric Video-Language Pre-training with Fusion in the BackbonePoster98 citations
  158. Editing Implicit Assumptions in Text-to-Image Diffusion ModelsPoster97 citations
  159. FB-BEV: BEV Representation from Forward-Backward View TransformationsPoster97 citations
  160. CRN: Camera Radar Net for Accurate, Robust, Efficient 3D PerceptionPoster96 citations
  161. Improving Sample Quality of Diffusion Models Using Self-Attention GuidancePoster96 citations
  162. Robust Object Modeling for Visual TrackingPoster96 citations
  163. Viewset Diffusion: (0-)Image-Conditioned 3D Generative Models from 2D DataPoster96 citations
  164. Diffusion Action SegmentationPoster95 citations
  165. Less is More: Focus Attention for Efficient DETRPoster94 citations
  166. Parametric Classification for Generalized Category Discovery: A Baseline StudyPoster94 citations
  167. Diverse Data Augmentation with Diffusions for Effective Test-time Prompt TuningPoster93 citations
  168. Teaching CLIP to Count to TenPoster93 citations
  169. DREAM: Efficient Dataset Distillation by Representative MatchingPoster91 citations
  170. HumanSD: A Native Skeleton-Guided Diffusion Model for Human Image GenerationOral90 citations
  171. E^2VPT: An Effective and Efficient Approach for Visual Prompt TuningPoster89 citations
  172. Not All Features Matter: Enhancing Few-shot CLIP with Adaptive Prior RefinementPoster89 citations
  173. Towards Geospatial Foundation Models via Continual PretrainingPoster89 citations
  174. DOLCE: A Model-Based Probabilistic Diffusion Framework for Limited-Angle CT ReconstructionPoster88 citations
  175. UniDexGrasp++: Improving Dexterous Grasping Policy Learning via Geometry-Aware Curriculum and Iterative Generalist-Specialist LearningOral88 citations
  176. EigenPlaces: Training Viewpoint Robust Models for Visual Place RecognitionPoster87 citations
  177. HiTeA: Hierarchical Temporal-Aware Video-Language Pre-trainingPoster87 citations
  178. MeMOTR: Long-Term Memory-Augmented Transformer for Multi-Object TrackingPoster87 citations
  179. Expressive Text-to-Image Generation with Rich TextPoster86 citations
  180. Waffling Around for Performance: Visual Classification with Random Words and Broad ConceptsPoster86 citations
  181. PNI : Industrial Anomaly Detection using Position and Neighborhood InformationPoster85 citations
  182. Perpetual Humanoid Control for Real-time Simulated AvatarsPoster85 citations
  183. Score-Based Diffusion Models as Principled Priors for Inverse ImagingPoster85 citations
  184. Efficient Region-Aware Neural Radiance Fields for High-Fidelity Talking Portrait SynthesisPoster84 citations
  185. PivotNet: Vectorized Pivot Learning for End-to-end HD Map ConstructionPoster84 citations
  186. PoseDiffusion: Solving Pose Estimation via Diffusion-aided Bundle AdjustmentPoster83 citations
  187. ATT3D: Amortized Text-to-3D Object SynthesisPoster82 citations
  188. Deep Multiview Clustering by Contrasting Cluster AssignmentsPoster82 citations
  189. HumanMAC: Masked Motion Completion for Human Motion PredictionPoster82 citations
  190. NeuRBF: A Neural Fields Representation with Adaptive Radial Basis FunctionsOral82 citations
  191. SHERF: Generalizable Human NeRF from a Single ImagePoster82 citations
  192. Towards Zero-Shot Scale-Aware Monocular Depth EstimationPoster82 citations
  193. Verbs in Action: Improving Verb Understanding in Video-Language ModelsPoster82 citations
  194. AvatarCraft: Transforming Text into Neural Human Avatars with Parameterized Shape and Pose ControlPoster81 citations
  195. Efficient 3D Semantic Segmentation with Superpoint TransformerPoster81 citations
  196. GRAM-HD: 3D-Consistent Image Generation at High Resolution with Generative Radiance ManifoldsPoster81 citations
  197. Learning Concise and Descriptive Attributes for Visual RecognitionPoster81 citations
  198. Zenseact Open Dataset: A Large-Scale and Diverse Multimodal Dataset for Autonomous DrivingPoster81 citations
  199. DiffPose: Multi-hypothesis Human Pose Estimation using Diffusion ModelsOral80 citations
  200. GLA-GCN: Global-local Adaptive Graph Convolutional Network for 3D Human Pose Estimation from Monocular VideoPoster80 citations
  201. Scaling Data Generation in Vision-and-Language NavigationOral80 citations
  202. Vox-E: Text-Guided Voxel Editing of 3D ObjectsPoster80 citations
  203. Feature Modulation Transformer: Cross-Refinement of Global Representation via High-Frequency Prior for Image Super-ResolutionPoster79 citations
  204. FocalFormer3D: Focusing on Hard Instance for 3D Object DetectionPoster79 citations
  205. MatrixCity: A Large-scale City Dataset for City-scale Neural Rendering and BeyondPoster78 citations
  206. Multi3DRefer: Grounding Text Description to Multiple 3D ObjectsPoster78 citations
  207. No Fear of Classifier Biases: Neural Collapse Inspired Federated Learning with Synthetic and Fixed ClassifierPoster78 citations
  208. TMR: Text-to-Motion Retrieval Using Contrastive 3D Human Motion SynthesisPoster78 citations
  209. Trajectory Unified Transformer for Pedestrian Trajectory PredictionPoster78 citations
  210. UniTR: A Unified and Efficient Multi-Modal Transformer for Bird's-Eye-View RepresentationPoster78 citations
  211. Forecast-MAE: Self-supervised Pre-training for Motion Forecasting with Masked AutoencodersPoster77 citations
  212. Multiscale Structure Guided Diffusion for Image DeblurringPoster77 citations
  213. Part-Aware Transformer for Generalizable Person Re-identificationPoster77 citations
  214. SparseFusion: Fusing Multi-Modal Sparse Representations for Multi-Sensor 3D Object DetectionPoster77 citations
  215. Unsupervised Surface Anomaly Detection with Diffusion Probabilistic ModelPoster77 citations
  216. Hidden Biases of End-to-End Driving ModelsPoster76 citations
  217. Diffusion Model as Representation LearnerPoster75 citations
  218. Multimodal Garment Designer: Human-Centric Latent Diffusion Models for Fashion Image EditingPoster75 citations
  219. NeRF-LOAM: Neural Implicit Representation for Large-Scale Incremental LiDAR Odometry and MappingPoster75 citations
  220. Structure Invariant Transformation for better Adversarial TransferabilityPoster75 citations
  221. SwinLSTM: Improving Spatiotemporal Prediction Accuracy using Swin Transformer and LSTMPoster75 citations
  222. ActFormer: A GAN-based Transformer towards General Action-Conditioned 3D Human Motion GenerationPoster74 citations
  223. GlueStick: Robust Image Matching by Sticking Points and Lines TogetherPoster74 citations
  224. Bridging Vision and Language Encoders: Parameter-Efficient Tuning for Referring Image SegmentationPoster73 citations
  225. DiffFit: Unlocking Transferability of Large Diffusion Models via Simple Parameter-efficient Fine-TuningOral73 citations
  226. HRS-Bench: Holistic, Reliable and Scalable Benchmark for Text-to-Image ModelsPoster73 citations
  227. IDiff-Face: Synthetic-based Face Recognition through Fizzy Identity-Conditioned Diffusion ModelPoster73 citations
  228. SKED: Sketch-guided Text-based 3D EditingPoster73 citations
  229. Denoising Diffusion Autoencoders are Unified Self-supervised LearnersOral72 citations
  230. DiffusionRet: Generative Text-Video Retrieval with Diffusion ModelPoster72 citations
  231. Mixed Neural Voxels for Fast Multi-view Video SynthesisOral72 citations
  232. Small Object Detection via Coarse-to-fine Proposal Generation and Imitation LearningPoster72 citations
  233. AttT2M: Text-Driven Human Motion Generation with Multi-Perspective Attention MechanismPoster71 citations
  234. Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional ImagesPoster71 citations
  235. End-to-End Diffusion Latent Optimization Improves Classifier GuidancePoster71 citations
  236. Multiple Instance Learning Framework with Masked Hard Instance Mining for Whole Slide Image ClassificationOral71 citations
  237. PADCLIP: Pseudo-labeling with Adaptive Debiasing in CLIP for Unsupervised Domain AdaptationPoster71 citations
  238. Sample4Geo: Hard Negative Sampling For Cross-View Geo-LocalisationPoster71 citations
  239. Exploring Lightweight Hierarchical Vision Transformers for Efficient Visual TrackingPoster70 citations
  240. Source-free Depth for Object Pop-outPoster70 citations
  241. Zero-Shot Contrastive Loss for Text-Guided Diffusion Image Style TransferPoster70 citations
  242. Zero-Shot Spatial Layout Conditioning for Text-to-Image Diffusion ModelsPoster70 citations
  243. Adaptive Frequency Filters As Efficient Global Token MixersPoster69 citations
  244. ESSAformer: Efficient Transformer for Hyperspectral Image Super-resolutionPoster69 citations
  245. Learning Non-Local Spatial-Angular Correlation for Light Field Image Super-ResolutionPoster69 citations
  246. Learning Semi-supervised Gaussian Mixture Models for Generalized Category DiscoveryPoster69 citations
  247. TM2D: Bimodality Driven 3D Dance Generation via Music-Text IntegrationPoster69 citations
  248. Unleashing Vanilla Vision Transformer with Masked Image Modeling for Object DetectionPoster69 citations
  249. ADAPT: Efficient Multi-Agent Trajectory Prediction with AdaptationPoster68 citations
  250. CASSPR: Cross Attention Single Scan Place RecognitionPoster68 citations
  251. Normalizing Flows for Human Pose Anomaly DetectionPoster68 citations
  252. Prompt Tuning Inversion for Text-driven Image Editing Using Diffusion ModelsPoster68 citations
  253. Spatio-Temporal Domain Awareness for Multi-Agent Collaborative PerceptionPoster68 citations
  254. TALL: Thumbnail Layout for Deepfake Video DetectionPoster68 citations
  255. The Effectiveness of MAE Pre-Pretraining for Billion-Scale PretrainingPoster68 citations
  256. Document Understanding Dataset and Evaluation (DUDE)Poster67 citations
  257. Masked Spiking TransformerPoster67 citations
  258. Towards Memory- and Time-Efficient Backpropagation for Training Spiking Neural NetworksPoster67 citations
  259. Enhancing Fine-Tuning Based Backdoor Defense with Sharpness-Aware MinimizationPoster66 citations
  260. ITI-GEN: Inclusive Text-to-Image GenerationOral66 citations
  261. Robust Evaluation of Diffusion-Based Adversarial PurificationOral66 citations
  262. SiLK: Simple Learned KeypointsPoster66 citations
  263. StegaNeRF: Embedding Invisible Information within Neural Radiance FieldsPoster66 citations
  264. Synthesizing Diverse Human Motions in 3D Indoor ScenesPoster66 citations
  265. Cross-Modal Translation and Alignment for Survival AnalysisPoster65 citations
  266. Dataset QuantizationPoster65 citations
  267. ExposureDiffusion: Learning to Expose for Low-light Image EnhancementPoster65 citations
  268. Generative Action Description Prompts for Skeleton-based Action RecognitionPoster65 citations
  269. Implicit Autoencoder for Point-Cloud Self-Supervised Representation LearningPoster65 citations
  270. Multimodal Optimal Transport-based Co-Attention Transformer with Global Structure Consistency for Survival PredictionPoster65 citations
  271. Open-domain Visual Entity Recognition: Towards Recognizing Millions of Wikipedia EntitiesOral65 citations
  272. Set-level Guidance Attack: Boosting Adversarial Transferability of Vision-Language Pre-training ModelsOral65 citations
  273. TinyCLIP: CLIP Distillation via Affinity Mimicking and Weight InheritancePoster65 citations
  274. DDColor: Towards Photo-Realistic Image Colorization via Dual DecodersPoster64 citations
  275. DataDAM: Efficient Dataset Distillation with Attention MatchingPoster64 citations
  276. GPFL: Simultaneously Learning Global and Personalized Feature Information for Personalized Federated LearningPoster64 citations
  277. Knowing Where to Focus: Event-aware Transformer for Video GroundingPoster64 citations
  278. Read-only Prompt Optimization for Vision-Language Few-shot LearningPoster64 citations
  279. UATVR: Uncertainty-Adaptive Text-Video RetrievalPoster64 citations
  280. V3Det: Vast Vocabulary Visual Detection DatasetOral64 citations
  281. ViewRefer: Grasp the Multi-view Knowledge for 3D Visual GroundingPoster64 citations
  282. HM-ViT: Hetero-Modal Vehicle-to-Vehicle Cooperative Perception with Vision TransformerPoster63 citations
  283. NDDepth: Normal-Distance Assisted Monocular Depth EstimationOral63 citations
  284. Online Prototype Learning for Online Continual LearningPoster63 citations
  285. PRIOR: Prototype Representation Joint Learning from Medical Images and ReportsPoster63 citations
  286. Sensitivity-Aware Visual Parameter-Efficient Fine-TuningOral63 citations
  287. AdvDiffuser: Natural Adversarial Example Synthesis with Diffusion ModelsPoster62 citations
  288. DLGSANet: Lightweight Dynamic Local and Global Self-Attention Networks for Image Super-ResolutionPoster62 citations
  289. Gloss-Free Sign Language Translation: Improving from Visual-Language PretrainingPoster62 citations
  290. PODA: Prompt-driven Zero-shot Domain AdaptationPoster62 citations
  291. Ref-NeuS: Ambiguity-Reduced Neural Implicit Surface Learning for Multi-View Reconstruction with ReflectionOral62 citations
  292. TARGET: Federated Class-Continual Learning via Exemplar-Free DistillationPoster62 citations
  293. DNA-Rendering: A Diverse Neural Actor Repository for High-Fidelity Human-Centric RenderingPoster61 citations
  294. Nerfbusters: Removing Ghostly Artifacts from Casually Captured NeRFsPoster61 citations
  295. Neural LiDAR Fields for Novel View SynthesisPoster61 citations
  296. PromptStyler: Prompt-driven Style Generation for Source-free Domain GeneralizationPoster61 citations
  297. UnLoc: A Unified Framework for Video Localization TasksPoster61 citations
  298. AG3D: Learning to Generate 3D Avatars from 2D Image CollectionsPoster60 citations
  299. Efficient Emotional Adaptation for Audio-Driven Talking-Head GenerationPoster60 citations
  300. Imitator: Personalized Speech-driven 3D Facial AnimationPoster60 citations
  301. LVOS: A Benchmark for Long-term Video Object SegmentationPoster60 citations
  302. Open-vocabulary Object Segmentation with Diffusion ModelsPoster60 citations
  303. Parallax-Tolerant Unsupervised Deep Image StitchingPoster60 citations
  304. Robust Monocular Depth Estimation under Challenging Conditions60 citations
  305. UniT3D: A Unified Transformer for 3D Dense Captioning and Visual GroundingPoster60 citations
  306. 3D-aware Image Generation using 2D Diffusion ModelsPoster59 citations
  307. DVIS: Decoupled Video Instance Segmentation FrameworkPoster59 citations
  308. Diffusion Models as Masked AutoencodersPoster59 citations
  309. DriveAdapter: Breaking the Coupling Barrier of Perception and Planning in End-to-End Autonomous DrivingOral59 citations
  310. Full-Body Articulated Human-Object InteractionPoster59 citations
  311. GridMM: Grid Memory Map for Vision-and-Language NavigationPoster59 citations
  312. PromptCap: Prompt-Guided Image Captioning for VQA with GPT-3Poster59 citations
  313. SkeletonMAE: Graph-based Masked Autoencoder for Skeleton Sequence Pre-trainingPoster59 citations
  314. CleanCLIP: Mitigating Data Poisoning Attacks in Multimodal Contrastive LearningOral58 citations
  315. FastRecon: Few-shot Industrial Anomaly Detection via Fast Feature ReconstructionPoster58 citations
  316. Feature Prediction Diffusion Model for Video Anomaly DetectionPoster58 citations
  317. FineDance: A Fine-grained Choreography Dataset for 3D Full Body Dance GenerationPoster58 citations
  318. IntrinsicNeRF: Learning Intrinsic Neural Radiance Fields for Editable Novel View SynthesisPoster58 citations
  319. Modality Unifying Network for Visible-Infrared Person Re-IdentificationPoster58 citations
  320. Point-Query Quadtree for Crowd Counting, Localization, and MorePoster58 citations
  321. RegFormer: An Efficient Projection-Aware Transformer Network for Large-Scale Point Cloud RegistrationPoster58 citations
  322. UniFormerV2: Unlocking the Potential of Image ViTs for Video UnderstandingPoster58 citations
  323. Unified Coarse-to-Fine Alignment for Video-Text RetrievalPoster58 citations
  324. Audiovisual Masked AutoencodersPoster57 citations
  325. Bird's-Eye-View Scene Graph for Vision-Language NavigationPoster57 citations
  326. CauSSL: Causality-inspired Semi-supervised Learning for Medical Image SegmentationPoster57 citations
  327. FLIP: Cross-domain Face Anti-spoofing with Language GuidancePoster57 citations
  328. InfiniCity: Infinite-Scale City SynthesisPoster57 citations
  329. Revisiting Scene Text Recognition: A Data PerspectivePoster57 citations
  330. Text2Performer: Text-Driven Human Video GenerationPoster57 citations
  331. Traj-MAE: Masked Autoencoders for Trajectory PredictionPoster57 citations
  332. XNet: Wavelet-Based Low and High Frequency Fusion Networks for Fully- and Semi-Supervised Semantic Segmentation of Biomedical ImagesPoster57 citations
  333. CLIPascene: Scene Sketching with Different Types and Levels of AbstractionOral56 citations
  334. DiffRate : Differentiable Compression Rate for Efficient Vision TransformersPoster56 citations
  335. First Session Adaptation: A Strong Replay-Free Baseline for Class-Incremental LearningPoster56 citations
  336. Introducing Language Guidance in Prompt-based Continual LearningPoster56 citations
  337. NeILF++: Inter-Reflectable Light Fields for Geometry and Material EstimationPoster56 citations
  338. Tube-Link: A Flexible Cross Tube Framework for Universal Video SegmentationPoster56 citations
  339. AdaMV-MoE: Adaptive Multi-Task Vision Mixture-of-ExpertsPoster55 citations
  340. DreamPose: Fashion Video Synthesis with Stable DiffusionPoster55 citations
  341. Global Knowledge Calibration for Fast Open-Vocabulary SegmentationPoster55 citations
  342. HoloAssist: an Egocentric Human Interaction Dataset for Interactive AI Assistants in the Real WorldPoster55 citations
  343. LRRU: Long-short Range Recurrent Updating Networks for Depth CompletionPoster55 citations
  344. OnlineRefer: A Simple Online Baseline for Referring Video Object SegmentationPoster55 citations
  345. Visible-Infrared Person Re-Identification via Semantic Alignment and Affinity InferencePoster55 citations
  346. Will Large-scale Generative Models Corrupt Future Datasets?Poster55 citations
  347. AIDE: A Vision-Driven Multi-View, Multi-Modal, Multi-Tasking Dataset for Assistive Driving PerceptionPoster54 citations
  348. ALIP: Adaptive Language-Image Pre-Training with Synthetic CaptionPoster54 citations
  349. Pixel Adaptive Deep Unfolding Transformer for Hyperspectral Image ReconstructionPoster54 citations
  350. Spectrum-guided Multi-granularity Referring Video Object SegmentationPoster54 citations
  351. Combating Noisy Labels with Sample Selection by Mining High-Discrepancy ExamplesPoster53 citations
  352. Content-Aware Local GAN for Photo-Realistic Super-ResolutionPoster53 citations
  353. Fg-T2M: Fine-Grained Text-Driven Human Motion Generation via Diffusion ModelPoster53 citations
  354. Generating Instance-level Prompts for Rehearsal-free Continual LearningOral53 citations
  355. High Quality Entity SegmentationOral53 citations
  356. Perceptual Grouping in Contrastive Vision-Language ModelsPoster53 citations
  357. SceneRF: Self-Supervised Monocular 3D Scene Reconstruction with Radiance FieldsPoster53 citations
  358. Transferable Decoding with Visual Entities for Zero-Shot Image CaptioningPoster53 citations
  359. UniFusion: Unified Multi-View Fusion Transformer for Spatial-Temporal Representation in Bird's-Eye-ViewPoster53 citations
  360. Aria Digital Twin: A New Benchmark Dataset for Egocentric 3D Machine PerceptionPoster52 citations
  361. EMDB: The Electromagnetic Database of Global 3D Human Pose and Shape in the WildPoster52 citations
  362. EmoSet: A Large-scale Visual Emotion Dataset with Rich AttributesPoster52 citations
  363. G2L: Semantically Aligned and Uniform Video Grounding via Geodesic and Game TheoryOral52 citations
  364. ICL-D3IE: In-Context Learning with Diverse Demonstrations Updating for Document Information ExtractionPoster52 citations
  365. Priority-Centric Human Motion Generation in Discrete Latent SpacePoster52 citations
  366. SG-Former: Self-guided Transformer with Evolving Token ReallocationPoster52 citations
  367. Tetra-NeRF: Representing Neural Radiance Fields Using TetrahedraPoster52 citations
  368. Towards Grand Unified Representation Learning for Unsupervised Visible-Infrared Person Re-IdentificationPoster52 citations
  369. An Embarrassingly Simple Backdoor Attack on Self-supervised LearningPoster51 citations
  370. CiteTracker: Correlating Image and Text for Visual TrackingPoster51 citations
  371. ENVIDR: Implicit Differentiable Renderer with Neural Environment LightingOral51 citations
  372. GPGait: Generalized Pose-based Gait RecognitionPoster51 citations
  373. Going Beyond Nouns With Vision & Language Models Using Synthetic DataPoster51 citations
  374. NeRF-Det: Learning Geometry-Aware Volumetric Representation for Multi-View 3D Object DetectionPoster51 citations
  375. STEERER: Resolving Scale Variations for Counting and Localization via Selective Inheritance LearningPoster51 citations
  376. Self-Calibrated Cross Attention Network for Few-Shot SegmentationPoster51 citations
  377. TORE: Token Reduction for Efficient Human Mesh Recovery with TransformerPoster51 citations
  378. Exploring Predicate Visual Context in Detecting of Human-Object InteractionsPoster50 citations
  379. LayoutDiffusion: Improving Graphic Layout Generation by Discrete Diffusion Probabilistic ModelsPoster50 citations
  380. MAtch, eXpand and Improve: Unsupervised Finetuning for Zero-Shot Action Recognition with Language KnowledgePoster50 citations
  381. Multimodal Motion Conditioned Diffusion Model for Skeleton-based Video Anomaly DetectionPoster50 citations
  382. Object as Query: Lifting Any 2D Object Detector to 3D DetectionPoster50 citations
  383. One-Shot Generative Domain AdaptationPoster50 citations
  384. Sparse Sampling Transformer with Uncertainty-Driven Ranking for Unified Removal of Raindrops and Rain StreaksPoster50 citations
  385. When Prompt-based Incremental Learning Does Not Meet Strong PretrainingPoster50 citations
  386. Frequency Guidance Matters in Few-Shot LearningPoster49 citations
  387. High-Resolution Document Shadow Removal via A Large-Scale Real-World Dataset and A Frequency-Aware Shadow Erasing NetPoster49 citations
  388. IntentQA: Context-aware Video Intent ReasoningOral49 citations
  389. Membrane Potential Batch Normalization for Spiking Neural NetworksPoster49 citations
  390. Online Clustered CodebookPoster49 citations
  391. SALAD: Part-Level Latent Diffusion for 3D Shape Generation and ManipulationPoster49 citations
  392. All in Tokens: Unifying Output Space of Visual Tasks via Soft TokenOral48 citations
  393. BlendFace: Re-designing Identity Encoders for Face-SwappingPoster48 citations
  394. COOL-CHIC: Coordinate-based Low Complexity Hierarchical Image CodecPoster48 citations
  395. CORE: Cooperative Reconstruction for Multi-Agent PerceptionPoster48 citations
  396. DyGait: Exploiting Dynamic Representations for High-performance Gait RecognitionPoster48 citations
  397. Forward Flow for Novel View Synthesis of Dynamic ScenesOral48 citations
  398. General Image-to-Image Translation with One-Shot Image GuidancePoster48 citations
  399. Going Denser with Open-Vocabulary Part SegmentationPoster48 citations
  400. Improving 3D Imaging with Pre-Trained Perpendicular 2D Diffusion ModelsPoster48 citations
  401. Instance-aware Dynamic Prompt Tuning for Pre-trained Point Cloud ModelsPoster48 citations
  402. Open-Vocabulary Semantic Segmentation with Decoupled One-Pass NetworkPoster48 citations
  403. Remembering Normality: Memory-guided Knowledge Distillation for Unsupervised Anomaly DetectionPoster48 citations
  404. SINC: Spatial Composition of 3D Human Motions for Simultaneous Action GenerationPoster48 citations
  405. SynBody: Synthetic Dataset with Layered Human Models for 3D Human Perception and ModelingPoster48 citations
  406. Using a Waffle Iron for Automotive Point Cloud Semantic SegmentationPoster48 citations
  407. AREA: Adaptive Reweighting via Effective Area for Long-Tailed ClassificationPoster47 citations
  408. AerialVLN: Vision-and-Language Navigation for UAVsPoster47 citations
  409. AffordPose: A Large-Scale Dataset of Hand-Object Interactions with Affordance-Driven Hand PosePoster47 citations
  410. An Adaptive Model Ensemble Adversarial Attack for Boosting Adversarial TransferabilityPoster47 citations
  411. AutoAD II: The Sequel - Who, When, and What in Movie Audio DescriptionPoster47 citations
  412. Automated Knowledge Distillation via Monte Carlo Tree SearchPoster47 citations
  413. Black Box Few-Shot Adaptation for Vision-Language ModelsPoster47 citations
  414. CDUL: CLIP-Driven Unsupervised Learning for Multi-Label Image ClassificationPoster47 citations
  415. Diffusion-Guided Reconstruction of Everyday Hand-Object Interaction ClipsOral47 citations
  416. Distribution-Consistent Modal Recovering for Incomplete Multimodal LearningPoster47 citations
  417. EdaDet: Open-Vocabulary Object Detection Using Early Dense AlignmentPoster47 citations
  418. Global Features are All You Need for Image Retrieval and RerankingPoster47 citations
  419. HSR-Diff: Hyperspectral Image Super-Resolution via Conditional Diffusion ModelsPoster47 citations
  420. MatrixVT: Efficient Multi-Camera to BEV Transformation for 3D PerceptionPoster47 citations
  421. Multi-Modal Gated Mixture of Local-to-Global Experts for Dynamic Image FusionPoster47 citations
  422. NeO 360: Neural Fields for Sparse View Synthesis of Outdoor ScenesPoster47 citations
  423. Neural Video Depth StabilizerPoster47 citations
  424. RLIPv2: Fast Scaling of Relational Language-Image Pre-TrainingPoster47 citations
  425. SPACE: Speech-driven Portrait Animation with Controllable ExpressionPoster47 citations
  426. Self-supervised Monocular Depth Estimation: Let's Talk About The WeatherPoster47 citations
  427. BEVPlace: Learning LiDAR-based Place Recognition using Bird's Eye View ImagesPoster46 citations
  428. Beyond One-to-One: Rethinking the Referring Image SegmentationOral46 citations
  429. CTVIS: Consistent Training for Online Video Instance SegmentationPoster46 citations
  430. Detection Transformer with Stable MatchingPoster46 citations
  431. E2NeRF: Event Enhanced Neural Radiance Fields from Blurry ImagesPoster46 citations
  432. Efficient Model Personalization in Federated Learning via Client-Specific Prompt GenerationPoster46 citations
  433. Empowering Low-Light Image Enhancer through Customized Learnable PriorsPoster46 citations
  434. FACET: Fairness in Computer Vision Evaluation BenchmarkPoster46 citations
  435. FPR: False Positive Rectification for Weakly Supervised Semantic SegmentationPoster46 citations
  436. FeatureNeRF: Learning Generalizable NeRFs by Distilling Foundation ModelsPoster46 citations
  437. GET: Group Event Transformer for Event-Based VisionPoster46 citations
  438. Generalized Differentiable RANSACPoster46 citations
  439. LogicSeg: Parsing Visual Semantics with Neural Logic Learning and ReasoningOral46 citations
  440. Masked Motion Predictors are Strong 3D Action Representation LearnersPoster46 citations
  441. Nearest Neighbor Guidance for Out-of-Distribution DetectionPoster46 citations
  442. Progressive Spatio-Temporal Prototype Matching for Text-Video RetrievalOral46 citations
  443. Rickrolling the Artist: Injecting Backdoors into Text Encoders for Text-to-Image SynthesisPoster46 citations
  444. UniSeg: A Unified Multi-Modal LiDAR Segmentation Network and the OpenPCSeg CodebasePoster46 citations
  445. Adaptive Testing of Computer Vision ModelsOral45 citations
  446. DomainDrop: Suppressing Domain-Sensitive Channels for Domain GeneralizationPoster45 citations
  447. GraphAlign: Enhancing Accurate Feature Alignment by Graph matching for Multi-Modal 3D Object DetectionPoster45 citations
  448. Harnessing the Spatial-Temporal Attention of Diffusion Models for High-Fidelity Text-to-Image SynthesisPoster45 citations
  449. Implicit Identity Representation Conditioned Memory Compensation Network for Talking Head video GenerationPoster45 citations
  450. Implicit Temporal Modeling with Learnable Alignment for Video RecognitionOral45 citations
  451. MMST-ViT: Climate Change-aware Crop Yield Prediction via Multi-Modal Spatial-Temporal Vision TransformerPoster45 citations
  452. RbA: Segmenting Unknown Regions Rejected by AllPoster45 citations
  453. Residual Pattern Learning for Pixel-Wise Out-of-Distribution Detection in Semantic SegmentationPoster45 citations
  454. Texture Generation on 3D Meshes with Point-UV DiffusionOral45 citations
  455. Unified Pre-Training with Pseudo Texts for Text-To-Image Person Re-IdentificationPoster45 citations
  456. Unmasking Anomalies in Road-Scene SegmentationOral45 citations
  457. A-STAR: Test-time Attention Segregation and Retention for Text-to-image SynthesisPoster44 citations
  458. Anomaly Detection Under Distribution ShiftPoster44 citations
  459. BiViT: Extremely Compressed Binary Vision TransformersPoster44 citations
  460. CC3D: Layout-Conditioned Generation of Compositional 3D ScenesPoster44 citations
  461. Compositional Feature Augmentation for Unbiased Scene Graph GenerationPoster44 citations
  462. DDS2M: Self-Supervised Denoising Diffusion Spatio-Spectral Model for Hyperspectral Image RestorationPoster44 citations
  463. DeepChange: A Long-Term Person Re-Identification Benchmark with Clothes ChangePoster44 citations
  464. Effective Real Image Editing with Accelerated Iterative Diffusion InversionOral44 citations
  465. IST-Net: Prior-Free Category-Level Pose Estimation with Implicit Space TransformationPoster44 citations
  466. Make-An-Animation: Large-Scale Text-conditional 3D Human Motion GenerationPoster44 citations
  467. Ponder: Point Cloud Pre-training via Neural RenderingPoster44 citations
  468. SVDFormer: Complementing Point Cloud via Self-view Augmentation and Self-structure Dual-generatorPoster44 citations
  469. Urban Radiance Field Representation with Deformable Neural Mesh PrimitivesPoster44 citations
  470. CopyRNeRF: Protecting the CopyRight of Neural Radiance FieldsPoster43 citations
  471. DiffPose: SpatioTemporal Diffusion Model for Video-Based Human Pose EstimationPoster43 citations
  472. DiffTAD: Temporal Action Detection with Proposal Denoising DiffusionPoster43 citations
  473. From Chaos Comes Order: Ordering Event Representations for Object Recognition and DetectionPoster43 citations
  474. HyperReenact: One-Shot Reenactment via Jointly Learning to Refine and Retarget FacesPoster43 citations
  475. Hyperbolic Chamfer Distance for Point Cloud CompletionPoster43 citations
  476. I Can't Believe There's No Images! Learning Visual Tasks Using only Language SupervisionPoster43 citations
  477. MasQCLIP for Open-Vocabulary Universal Image SegmentationPoster43 citations
  478. Memory-and-Anticipation Transformer for Online Action UnderstandingPoster43 citations
  479. MetaBEV: Solving Sensor Failures for 3D Detection and Map SegmentationPoster43 citations
  480. MonoNeRF: Learning a Generalizable Dynamic Radiance Field from Monocular VideosPoster43 citations
  481. PG-RCNN: Semantic Surface Point Generation for 3D Object DetectionPoster43 citations
  482. Towards Unsupervised Domain Generalization for Face Anti-SpoofingPoster43 citations
  483. 3D-Aware Neural Body Fitting for Occlusion Robust 3D Human Pose EstimationPoster42 citations
  484. A Low-Shot Object Counting Network With Iterative Prototype AdaptationPoster42 citations
  485. AesPA-Net: Aesthetic Pattern-Aware Style Transfer NetworksPoster42 citations
  486. Bayesian Prompt Learning for Image-Language Model GeneralizationPoster42 citations
  487. Deep Fusion Transformer Network with Weighted Vector-Wise Keypoints Voting for Robust 6D Object Pose EstimationPoster42 citations
  488. Dual Pseudo-Labels Interactive Self-Training for Semi-Supervised Visible-Infrared Person Re-IdentificationPoster42 citations
  489. FS-DETR: Few-Shot DEtection TRansformer with Prompting and without Re-TrainingPoster42 citations
  490. Graph Matching with Bi-level Noisy CorrespondencePoster42 citations
  491. Instance Neural Radiance FieldPoster42 citations
  492. LATR: 3D Lane Detection from Monocular Images with TransformerOral42 citations
  493. Logic-induced Diagnostic Reasoning for Semi-supervised Semantic SegmentationPoster42 citations
  494. Make Encoder Great Again in 3D GAN Inversion through Geometry and Occlusion-Aware EncodingPoster42 citations
  495. Monte Carlo Linear Clustering with Single-Point Supervision is Enough for Infrared Small Target DetectionPoster42 citations
  496. Multimodal Variational Auto-encoder based Audio-Visual SegmentationPoster42 citations
  497. Prototype Reminiscence and Augmented Asymmetric Knowledge Aggregation for Non-Exemplar Class-Incremental LearningPoster42 citations
  498. Reference-guided Controllable Inpainting of Neural Radiance FieldsPoster42 citations
  499. Unify, Align and Refine: Multi-Level Semantic Alignment for Radiology Report GenerationPoster42 citations
  500. VQA-GNN: Reasoning with Multimodal Knowledge via Graph Neural Networks for Visual Question AnsweringPoster42 citations
  501. Vision HGNN: An Image is More than a Graph of NodesOral42 citations
  502. Adverse Weather Removal with Codebook PriorsPoster41 citations
  503. AutoReP: Automatic ReLU Replacement for Fast Private Network InferencePoster41 citations
  504. Auxiliary Tasks Benefit 3D Skeleton-based Human Motion PredictionPoster41 citations
  505. Diffusion in StylePoster41 citations
  506. Enhanced Soft Label for Semi-Supervised Semantic SegmentationPoster41 citations
  507. Group Pose: A Simple Baseline for End-to-End Multi-Person Pose EstimationPoster41 citations
  508. Multi-Scale Residual Low-Pass Filter Network for Image DeblurringPoster41 citations
  509. Navigating to Objects Specified by ImagesPoster41 citations
  510. One-shot Implicit Animatable Avatars with Model-based PriorsPoster41 citations
  511. Talking Head Generation with Probabilistic Audio-to-Visual Diffusion PriorsPoster41 citations
  512. Transferable Adversarial Attack for Both Vision Transformers and Convolutional Networks via Momentum Integrated GradientsPoster41 citations
  513. X-Mesh: Towards Fast and Accurate Text-driven 3D Stylization via Dynamic Textual GuidancePoster41 citations
  514. All-to-Key Attention for Arbitrary Style TransferPoster40 citations
  515. Audio-Visual Class-Incremental LearningPoster40 citations
  516. Boosting Adversarial Transferability via Gradient Relevance AttackPoster40 citations
  517. Camera-Driven Representation Learning for Unsupervised Domain Adaptive Person Re-identificationPoster40 citations
  518. CuNeRF: Cube-Based Neural Radiance Field for Zero-Shot Medical Image Arbitrary-Scale Super ResolutionPoster40 citations
  519. Fast Neural Scene FlowPoster40 citations
  520. GIFD: A Generative Gradient Inversion Method with Feature Domain OptimizationPoster40 citations
  521. HoloFusion: Towards Photo-realistic 3D Generative ModelingPoster40 citations
  522. Prompt Switch: Efficient CLIP Adaptation for Text-Video RetrievalPoster40 citations
  523. SATR: Zero-Shot Semantic Segmentation of 3D ShapesPoster40 citations
  524. UMC: A Unified Bandwidth-efficient and Multi-resolution based Collaborative Perception FrameworkPoster40 citations
  525. Cascade-DETR: Delving into High-Quality Universal Object DetectionPoster39 citations
  526. DETRDistill: A Universal Knowledge Distillation Framework for DETR-familiesPoster39 citations
  527. Discrepant and Multi-Instance Proxies for Unsupervised Person Re-IdentificationPoster39 citations
  528. Does Physical Adversarial Example Really Matter to Autonomous Driving? Towards System-Level Effect of Adversarial Object Evasion AttackPoster39 citations
  529. EMMN: Emotional Motion Memory Network for Audio-driven Emotional Talking Face GenerationPoster39 citations
  530. EMQ: Evolving Training-free Proxies for Automated Mixed Precision QuantizationPoster39 citations
  531. EfficientTrain: Exploring Generalized Curriculum Learning for Training Visual BackbonesPoster39 citations
  532. Ego-Humans: An Ego-Centric 3D Multi-Human BenchmarkOral39 citations
  533. Event Camera Data Pre-trainingPoster39 citations
  534. FRAug: Tackling Federated Learning with Non-IID Features via Representation AugmentationPoster39 citations
  535. FlipNeRF: Flipped Reflection Rays for Few-shot Novel View SynthesisPoster39 citations
  536. How Much Temporal Long-Term Context is Needed for Action Segmentation?Poster39 citations
  537. Inspecting the Geographical Representativeness of Images from Text-to-Image ModelsPoster39 citations
  538. Latent-OFER: Detect, Mask, and Reconstruct with Latent Vectors for Occluded Facial Expression RecognitionPoster39 citations
  539. Learning Clothing and Pose Invariant 3D Shape Representation for Long-Term Person Re-IdentificationPoster39 citations
  540. Locomotion-Action-Manipulation: Synthesizing Human-Scene Interactions in Complex 3D EnvironmentsPoster39 citations
  541. Long-Term Photometric Consistent Novel View Synthesis with Diffusion ModelsPoster39 citations
  542. MGMAE: Motion Guided Masking for Video Masked AutoencodingPoster39 citations
  543. March in Chat: Interactive Prompting for Remote Embodied Referring ExpressionPoster39 citations
  544. ObjectSDF++: Improved Object-Compositional Neural Implicit SurfacesPoster39 citations
  545. Robust e-NeRF: NeRF from Sparse & Noisy Events under Non-Uniform MotionPoster39 citations
  546. Scratching Visual Transformer's Back with Uniform AttentionPoster39 citations
  547. Towards Unifying Medical Vision-and-Language Pre-Training via Soft PromptsPoster39 citations
  548. Zolly: Zoom Focal Length Correctly for Perspective-Distorted Human Mesh ReconstructionOral39 citations
  549. A Sentence Speaks a Thousand Images: Domain Generalization through Distilling CLIP with Language GuidancePoster38 citations
  550. Adaptive and Background-Aware Vision Transformer for Real-Time UAV TrackingPoster38 citations
  551. CMDA: Cross-Modality Domain Adaptation for Nighttime Semantic SegmentationPoster38 citations
  552. Continuously Masked Transformer for Image InpaintingPoster38 citations
  553. DREAMWALKER: Mental Planning for Continuous Vision-Language NavigationPoster38 citations
  554. DiffDreamer: Towards Consistent Unsupervised Single-view Scene Extrapolation with Conditional Diffusion ModelsPoster38 citations
  555. Diverse Inpainting and Editing with GAN InversionPoster38 citations
  556. Encyclopedic VQA: Visual Questions About Detailed Properties of Fine-Grained CategoriesPoster38 citations
  557. Foreground-Background Distribution Modeling Transformer for Visual Object TrackingPoster38 citations
  558. LD-ZNet: A Latent Diffusion Approach for Text-Based Image SegmentationOral38 citations
  559. ObjectFusion: Multi-modal 3D Object Detection with Object-Centric FusionPoster38 citations
  560. Practical Membership Inference Attacks Against Large-Scale Multi-Modal Models: A Pilot StudyPoster38 citations
  561. Pre-Training-Free Image Manipulation Localization through Non-Mutually Exclusive Contrastive LearningPoster38 citations
  562. The Power of Sound (TPoS): Audio Reactive Video Generation with Stable DiffusionPoster38 citations
  563. Video Background Music Generation: Dataset, Method and EvaluationPoster38 citations
  564. Vision Grid Transformer for Document Layout AnalysisPoster38 citations
  565. Accurate and Fast Compressed Video CaptioningPoster37 citations
  566. Boosting Few-shot Action Recognition with Graph-guided Hybrid MatchingPoster37 citations
  567. ESTextSpotter: Towards Better Scene Text Spotting with Explicit Synergy in TransformerPoster37 citations
  568. EigenTrajectory: Low-Rank Descriptors for Multi-Modal Trajectory ForecastingPoster37 citations
  569. Fast Inference and Update of Probabilistic Density Estimation on Trajectory PredictionPoster37 citations
  570. Generative Prompt Model for Weakly Supervised Object LocalizationPoster37 citations
  571. Improving Continuous Sign Language Recognition with Cross-Lingual SignsPoster37 citations
  572. Knowledge-Aware Prompt Tuning for Generalizable Vision-Language ModelsPoster37 citations
  573. Learning Concordant Attention via Target-aware Alignment for Visible-Infrared Person Re-identificationPoster37 citations
  574. Lighting up NeRF via Unsupervised Decomposition and EnhancementPoster37 citations
  575. Low-Light Image Enhancement with Illumination-Aware Gamma Correction and Complete Image Modelling NetworkPoster37 citations
  576. MixPath: A Unified Approach for One-shot Neural Architecture SearchPoster37 citations
  577. S3IM: Stochastic Structural SIMilarity and Its Unreasonable Effectiveness for Neural FieldsPoster37 citations
  578. SAFE: Sensitivity-Aware Features for Out-of-Distribution Object DetectionPoster37 citations
  579. Temporal Enhanced Training of Multi-view 3D Object Detector via Historical Object PredictionPoster37 citations
  580. A Good Student is Cooperative and Reliable: CNN-Transformer Collaborative Learning for Semantic SegmentationPoster36 citations
  581. Betrayed by Captions: Joint Caption Grounding and Generation for Open Vocabulary Instance SegmentationPoster36 citations
  582. Cross-Modal Orthogonal High-Rank Augmentation for RGB-Event Transformer-TrackersPoster36 citations
  583. DistillBEV: Boosting Multi-Camera 3D Object Detection with Cross-Modal Knowledge DistillationPoster36 citations
  584. Distilling Large Vision-Language Model with Out-of-Distribution GeneralizabilityPoster36 citations
  585. Dynamic Perceiver for Efficient Visual RecognitionPoster36 citations
  586. Gender Artifacts in Visual DatasetsPoster36 citations
  587. Integrally Migrating Pre-trained Transformer Encoder-decoders for Visual Object DetectionPoster36 citations
  588. Overwriting Pretrained Bias with Finetuning DataOral36 citations
  589. PARIS: Part-level Reconstruction and Motion Analysis for Articulated ObjectsPoster36 citations
  590. Real-Time Neural Rasterization for Large ScenesPoster36 citations
  591. Removing Anomalies as Noises for Industrial Defect LocalizationPoster36 citations
  592. SKiT: a Fast Key Information Video Transformer for Online Surgical Phase RecognitionPoster36 citations
  593. Self-supervised Cross-view Representation Reconstruction for Change CaptioningPoster36 citations
  594. TaskExpert: Dynamically Assembling Multi-Task Representations with Memorial Mixture-of-ExpertsPoster36 citations
  595. Towards Open-Vocabulary Video Instance SegmentationOral36 citations
  596. USAGE: A Unified Seed Area Generation Paradigm for Weakly Supervised Semantic SegmentationPoster36 citations
  597. Video Anomaly Detection via Sequentially Learning Multiple Pretext TasksPoster36 citations
  598. 3DMOTFormer: Graph Transformer for Online 3D Multi-Object TrackingPoster35 citations
  599. Boosting 3-DoF Ground-to-Satellite Camera Localization Accuracy via Geometry-Guided Cross-View TransformerPoster35 citations
  600. Clustering based Point Cloud Representation Learning for 3D AnalysisPoster35 citations
  601. Cross-Modal Learning with 3D Deformable Attention for Action RecognitionPoster35 citations
  602. DetZero: Rethinking Offboard 3D Object Detection with Long-term Sequential Point CloudsPoster35 citations
  603. DiFaReli: Diffusion Face RelightingPoster35 citations
  604. DomainAdaptor: A Novel Approach to Test-time AdaptationPoster35 citations
  605. FeatEnHancer: Enhancing Hierarchical Features for Object Detection and Beyond Under Low-Light VisionPoster35 citations
  606. ICICLE: Interpretable Class Incremental Continual LearningPoster35 citations
  607. Improving Pixel-based MIM by Reducing Wasted Modeling CapabilityPoster35 citations
  608. MetaGCD: Learning to Continually Learn in Generalized Category DiscoveryPoster35 citations
  609. MonoNeRD: NeRF-like Representations for Monocular 3D Object DetectionPoster35 citations
  610. RFLA: A Stealthy Reflected Light Adversarial Attack in the Physical WorldPoster35 citations
  611. Robust Referring Video Object Segmentation with Cyclic Structural ConsensusPoster35 citations
  612. SkeleTR: Towards Skeleton-based Action Recognition in the WildPoster35 citations
  613. Spherical Space Feature Decomposition for Guided Depth Map Super-ResolutionPoster35 citations
  614. Stochastic Segmentation with Conditional Categorical Diffusion ModelsPoster35 citations
  615. Visually-Prompted Language Model for Fine-Grained Scene Graph Generation in an Open WorldPoster35 citations
  616. WaterMask: Instance Segmentation for Underwater ImageryPoster35 citations
  617. Computationally-Efficient Neural Image Compression with Shallow DecodersPoster34 citations
  618. Efficient Video Prediction via Sparsely Conditioned Flow MatchingPoster34 citations
  619. Equivariant Similarity for Vision-Language Foundation ModelsOral34 citations
  620. FishNet: A Large-scale Dataset and Benchmark for Fish Recognition, Detection, and Functional Trait PredictionPoster34 citations
  621. Grounding 3D Object Affordance from 2D Interactions in ImagesPoster34 citations
  622. Hierarchical Generation of Human-Object Interactions with Diffusion Probabilistic ModelsPoster34 citations
  623. LU-NeRF: Scene and Pose Estimation by Synchronizing Local Unposed NeRFsPoster34 citations
  624. Lightweight Image Super-Resolution with Superpixel Token InteractionPoster34 citations
  625. MMVP: Motion-Matrix-Based Video PredictionOral34 citations
  626. Open-vocabulary Panoptic Segmentation with Embedding ModulationPoster34 citations
  627. RMP-Loss: Regularizing Membrane Potential Distribution for Spiking Neural NetworksPoster34 citations
  628. Referring Image Segmentation Using Text SupervisionPoster34 citations
  629. Revisiting the Parameter Efficiency of Adapters from the Perspective of Precision RedundancyPoster34 citations
  630. SA-BEV: Generating Semantic-Aware Bird's-Eye-View Feature for Multi-view 3D Object DetectionPoster34 citations
  631. Template-guided Hierarchical Feature Restoration for Anomaly DetectionPoster34 citations
  632. Temporal-Coded Spiking Neural Networks with Dynamic Firing Threshold: Learning with Event-Driven BackpropagationPoster34 citations
  633. TransFace: Calibrating Transformer Training for Face Recognition from a Data-Centric PerspectivePoster34 citations
  634. VI-Net: Boosting Category-level 6D Object Pose Estimation via Learning Decoupled Rotations on the Spherical RepresentationsPoster34 citations
  635. Action Sensitivity Learning for Temporal Action LocalizationPoster33 citations
  636. Among Us: Adversarially Robust Collaborative Perception by ConsensusPoster33 citations
  637. CTP:Towards Vision-Language Continual Pretraining via Compatible Momentum Contrast and Topology PreservationPoster33 citations
  638. DINAR: Diffusion Inpainting of Neural Textures for One-Shot Human AvatarsPoster33 citations
  639. Domain Generalization of 3D Semantic Segmentation in Autonomous DrivingPoster33 citations
  640. Evaluating Data Attribution for Text-to-Image ModelsPoster33 citations
  641. Exploring Open-Vocabulary Semantic Segmentation from CLIP Vision Encoder Distillation OnlyPoster33 citations
  642. From Sky to the Ground: A Large-scale Benchmark and Simple Baseline Towards Real Rain RemovalPoster33 citations
  643. Learning a More Continuous Zero Level Set in Unsigned Distance Fields through Level Set ProjectionPoster33 citations
  644. Linear Spaces of Meanings: Compositional Structures in Vision-Language ModelsPoster33 citations
  645. MI-GAN: A Simple Baseline for Image Inpainting on Mobile DevicesPoster33 citations
  646. Random Sub-Samples Generation for Self-Supervised Real Image DenoisingPoster33 citations
  647. Rethinking Fast Fourier Convolution in Image InpaintingPoster33 citations
  648. Robust Mixture-of-Expert Training for Convolutional Neural NetworksOral33 citations
  649. See More and Know More: Zero-shot Point Cloud Segmentation via Multi-modal Visual DataPoster33 citations
  650. SeeABLE: Soft Discrepancies and Bounded Contrastive Learning for Exposing DeepfakesPoster33 citations
  651. Self-Supervised Character-to-Character Distillation for Text RecognitionPoster33 citations
  652. TransTIC: Transferring Transformer-based Image Compression from Human Perception to Machine PerceptionPoster33 citations
  653. When Epipolar Constraint Meets Non-Local Operators in Multi-View StereoPoster33 citations
  654. XMem++: Production-level Video Segmentation From Few Annotated FramesPoster33 citations
  655. Augmented Box Replay: Overcoming Foreground Shift for Incremental Object DetectionPoster32 citations
  656. Blending-NeRF: Text-Driven Localized Editing in Neural Radiance FieldsPoster32 citations
  657. Bold but Cautious: Unlocking the Potential of Personalized Federated Learning through Cautiously Aggressive CollaborationPoster32 citations
  658. Building3D: A Urban-Scale Dataset and Benchmarks for Learning Roof Structures from Point CloudsPoster32 citations
  659. Class-Aware Patch Embedding Adaptation for Few-Shot Image ClassificationPoster32 citations
  660. ClimateNeRF: Extreme Weather Synthesis in Neural Radiance FieldPoster32 citations
  661. Coherent Event Guided Low-Light Video EnhancementPoster32 citations
  662. Context-Aware Planning and Environment-Aware Memory for Instruction Following Embodied AgentsPoster32 citations
  663. D-IF: Uncertainty-aware Human Digitization via Implicit Distribution FieldPoster32 citations
  664. Degradation-Resistant Unfolding Network for Heterogeneous Image FusionPoster32 citations
  665. Diffusion-based Image Translation with Label Guidance for Domain Adaptive Semantic SegmentationPoster32 citations
  666. Divide and Conquer: 3D Point Cloud Instance Segmentation With Point-Wise BinarizationPoster32 citations
  667. Dynamic Point FieldsOral32 citations
  668. Dynamic Residual Classifier for Class Incremental LearningPoster32 citations
  669. GAFlow: Incorporating Gaussian Attention into Optical FlowPoster32 citations
  670. GEDepth: Ground Embedding for Monocular Depth EstimationPoster32 citations
  671. IOMatch: Simplifying Open-Set Semi-Supervised Learning with Joint Inliers and Outliers UtilizationOral32 citations
  672. Improving Generalization of Adversarial Training via Robust Critical Fine-TuningPoster32 citations
  673. LA-Net: Landmark-Aware Learning for Reliable Facial Expression Recognition under Label NoisePoster32 citations
  674. Learning Correction Filter via Degradation-Adaptive Regression for Blind Single Image Super-ResolutionPoster32 citations
  675. MSI: Maximize Support-Set Information for Few-Shot SegmentationPoster32 citations
  676. Multi-Modal Neural Radiance Field for Monocular Dense SLAM with a Light-Weight ToF SensorPoster32 citations
  677. Multimodal Distillation for Egocentric Action RecognitionPoster32 citations
  678. Physics-Driven Turbulence Image Restoration with Stochastic RefinementPoster32 citations
  679. Query Refinement Transformer for 3D Instance SegmentationPoster32 citations
  680. ReFit: Recurrent Fitting Network for 3D Human RecoveryPoster32 citations
  681. Role-Aware Interaction Generation from Textual DescriptionOral32 citations
  682. SAFARI: Versatile and Efficient Evaluations for Robustness of InterpretabilityPoster32 citations
  683. Single Image Reflection Separation via Component SynergyPoster32 citations
  684. Sketch and Text Guided Diffusion Model for Colored Point Cloud GenerationPoster32 citations
  685. Stable Cluster Discrimination for Deep ClusteringPoster32 citations
  686. Subclass-balancing Contrastive Learning for Long-tailed RecognitionPoster32 citations
  687. Unified Adversarial Patch for Cross-Modal Attacks in the Physical WorldPoster32 citations
  688. Unsupervised Image Denoising in Real-World Scenarios via Self-Collaboration Parallel Generative Adversarial BranchesPoster32 citations
  689. Virtual Try-On with Pose-Garment Keypoints Guided InpaintingPoster32 citations
  690. ADNet: Lane Shape Prediction via Anchor DecompositionPoster31 citations
  691. Alignment-free HDR Deghosting with Semantics Consistent TransformerPoster31 citations
  692. Bridging Cross-task Protocol Inconsistency for Distillation in Dense Object DetectionPoster31 citations
  693. CPCM: Contextual Point Cloud Modeling for Weakly-supervised Point Cloud Semantic SegmentationPoster31 citations
  694. CROSSFIRE: Camera Relocalization On Self-Supervised Features from an Implicit RepresentationPoster31 citations
  695. HOSNeRF: Dynamic Human-Object-Scene Neural Radiance Fields from a Single VideoPoster31 citations
  696. Learning Foresightful Dense Visual Affordance for Deformable Object ManipulationPoster31 citations
  697. Learning Navigational Visual Representations with Semantic Map SupervisionPoster31 citations
  698. Learning Vision-and-Language Navigation from YouTube VideosPoster31 citations
  699. Mask-Attention-Free Transformer for 3D Instance SegmentationPoster31 citations
  700. Masked Retraining Teacher-Student Framework for Domain Adaptive Object DetectionPoster31 citations
  701. Multi-weather Image Restoration via Domain TranslationPoster31 citations
  702. PPR: Physically Plausible Reconstruction from Monocular VideosOral31 citations
  703. ProbVLM: Probabilistic Adapter for Frozen Vison-Language ModelsPoster31 citations
  704. Re-mine, Learn and Reason: Exploring the Cross-modal Semantic Correlations for Language-guided HOI detectionPoster31 citations
  705. Scene-Aware Label Graph Learning for Multi-Label Image ClassificationPoster31 citations
  706. TMA: Temporal Motion Aggregation for Event-based Optical FlowPoster31 citations
  707. TransIFF: An Instance-Level Feature Fusion Framework for Vehicle-Infrastructure Cooperative 3D Detection with TransformersPoster31 citations
  708. Unsupervised 3D Perception with 2D Vision-Language Distillation for Autonomous DrivingPoster31 citations
  709. eP-ALM: Efficient Perceptual Augmentation of Language ModelsPoster31 citations
  710. AutoDiffusion: Training-Free Optimization of Time Steps and Architectures for Automated Diffusion Model AccelerationPoster30 citations
  711. BoxSnake: Polygonal Instance Segmentation with Box SupervisionPoster30 citations
  712. Chinese Text Recognition with A Pre-Trained CLIP-Like Model Through Image-IDS AligningOral30 citations
  713. ContactGen: Generative Contact Modeling for Grasp GenerationPoster30 citations
  714. Cross-view Topology Based Consistent and Complementary Information for Deep Multi-view ClusteringPoster30 citations
  715. DETA: Denoised Task Adaptation for Few-Shot LearningPoster30 citations
  716. Deformable Neural Radiance Fields using RGB and Event CamerasPoster30 citations
  717. Diverse Cotraining Makes Strong Semi-Supervised SegmentorPoster30 citations
  718. Downstream-agnostic Adversarial ExamplesPoster30 citations
  719. Enhancing Generalization of Universal Adversarial Perturbation through Gradient AggregationPoster30 citations
  720. Flatness-Aware Minimization for Domain GeneralizationPoster30 citations
  721. Global Adaptation Meets Local Generalization: Unsupervised Domain Adaptation for 3D Human Pose EstimationPoster30 citations
  722. Gradient-Regulated Meta-Prompt Learning for Generalizable Vision-Language ModelsPoster30 citations
  723. HTML: Hybrid Temporal-scale Multimodal Learning Framework for Referring Video Object SegmentationPoster30 citations
  724. Incremental Generalized Category DiscoveryPoster30 citations
  725. Learning Support and Trivial Prototypes for Interpretable Image ClassificationPoster30 citations
  726. LinkGAN: Linking GAN Latents to Pixels for Controllable Image SynthesisPoster30 citations
  727. Neural-PBIR Reconstruction of Shape, Material, and IlluminationPoster30 citations
  728. Object-aware Gaze Target DetectionPoster30 citations
  729. PASTA: Proportional Amplitude Spectrum Training Augmentation for Syn-to-Real Domain GeneralizationPoster30 citations
  730. Probabilistic Human Mesh Recovery in 3D Scenes from Egocentric ViewsOral30 citations
  731. Quality-Agnostic Deepfake Detection with Intra-model Collaborative LearningPoster30 citations
  732. R3D3: Dense 3D Reconstruction of Dynamic Scenes from Multiple CamerasPoster30 citations
  733. Revisiting Domain-Adaptive 3D Object Detection by Reliable, Diverse and Class-balanced Pseudo-LabelingPoster30 citations
  734. Robust Heterogeneous Federated Learning under Data CorruptionPoster30 citations
  735. SHACIRA: Scalable HAsh-grid Compression for Implicit Neural RepresentationsPoster30 citations
  736. Scalable Video Object Segmentation with Simplified FrameworkPoster30 citations
  737. Spurious Features Everywhere - Large-Scale Detection of Harmful Spurious Features in ImageNetPoster30 citations
  738. VQ3D: Learning a 3D-Aware Generative Model on ImageNetOral30 citations
  739. 3D Segmentation of Humans in Point Clouds with Synthetic DataPoster29 citations
  740. A Large-Scale Outdoor Multi-Modal Dataset and Benchmark for Novel View Synthesis and Implicit Scene ReconstructionPoster29 citations
  741. A Simple Vision Transformer for Weakly Semi-supervised 3D Object DetectionPoster29 citations
  742. ARNOLD: A Benchmark for Language-Grounded Task Learning with Continuous States in Realistic 3D ScenesPoster29 citations
  743. Anatomical Invariance Modeling and Semantic Alignment for Self-supervised Learning in 3D Medical Image AnalysisOral29 citations
  744. Boosting Multi-modal Model Performance with Adaptive Gradient ModulationPoster29 citations
  745. Class-Incremental Grouping Network for Continual Audio-Visual LearningPoster29 citations
  746. Decoupled Iterative Refinement Framework for Interacting Hands Reconstruction from a Single RGB ImageOral29 citations
  747. DiffFacto: Controllable Part-Based 3D Point Cloud Generation with Cross DiffusionPoster29 citations
  748. Disentangling Spatial and Temporal Learning for Efficient Image-to-Video Transfer LearningPoster29 citations
  749. Distribution-Aware Prompt Tuning for Vision-Language ModelsPoster29 citations
  750. Efficient Joint Optimization of Layer-Adaptive Weight Pruning in Deep Neural NetworksPoster29 citations
  751. Ego-Only: Egocentric Action Detection without Exocentric TransferringPoster29 citations
  752. ExBluRF: Efficient Radiance Fields for Extreme Motion Blurred ImagesPoster29 citations
  753. Generalizing Event-Based Motion Deblurring in Real-World ScenariosPoster29 citations
  754. Heterogeneous Forgetting Compensation for Class-Incremental LearningPoster29 citations
  755. LISTER: Neighbor Decoding for Length-Insensitive Scene Text RecognitionPoster29 citations
  756. Leveraging Spatio-Temporal Dependency for Skeleton-Based Action RecognitionPoster29 citations
  757. MBPTrack: Improving 3D Point Cloud Tracking with Memory Networks and Box PriorsPoster29 citations
  758. NPC: Neural Point Characters from VideoPoster29 citations
  759. P2C: Self-Supervised Point Cloud Completion from Single Partial CloudsPoster29 citations
  760. Parametric Information Maximization for Generalized Category DiscoveryPoster29 citations
  761. PoseFix: Correcting 3D Human Poses with Natural LanguagePoster29 citations
  762. Random Boxes Are Open-world Object DetectorsPoster29 citations
  763. Robustifying Token Attention for Vision TransformersPoster29 citations
  764. SAFE: Machine Unlearning With Shard GraphsPoster29 citations
  765. Self-Feedback DETR for Temporal Action DetectionPoster29 citations
  766. Towards Generic Image Manipulation Detection with Weakly-Supervised Self-Consistency LearningPoster29 citations
  767. Treating Pseudo-labels Generation as Image Matting for Weakly Supervised Semantic SegmentationPoster29 citations
  768. UniFace: Unified Cross-Entropy Loss for Deep Face RecognitionPoster29 citations
  769. CiT: Curation in Training for Effective Vision-Language DataPoster28 citations
  770. Controllable Guide-Space for Generalizable Face Forgery DetectionPoster28 citations
  771. Dynamic Token Pruning in Plain Vision Transformers for Semantic SegmentationPoster28 citations
  772. FunnyBirds: A Synthetic Vision Dataset for a Part-Based Analysis of Explainable AI MethodsOral28 citations
  773. Identity-Seeking Self-Supervised Representation Learning for Generalizable Person Re-IdentificationOral28 citations
  774. LaRS: A Diverse Panoptic Maritime Obstacle Detection Dataset and BenchmarkPoster28 citations
  775. Leveraging Inpainting for Single-Image Shadow RemovalPoster28 citations
  776. ReST: A Reconfigurable Spatial-Temporal Graph Model for Multi-Camera Multi-Object TrackingPoster28 citations
  777. Realistic Full-Body Tracking from Sparse Observations via Joint-Level ModelingPoster28 citations
  778. Relightify: Relightable 3D Faces from a Single Image via Diffusion ModelsPoster28 citations
  779. Rethinking Pose Estimation in Crowds: Overcoming the Detection Information Bottleneck and AmbiguityPoster28 citations
  780. Size Does Matter: Size-aware Virtual Try-on via Clothing-oriented Transformation Try-on NetworkPoster28 citations
  781. TeD-SPAD: Temporal Distinctiveness for Self-Supervised Privacy-Preservation for Video Anomaly DetectionPoster28 citations
  782. Universal Domain Adaptation via Compressive Attention MatchingPoster28 citations
  783. Video-FocalNets: Spatio-Temporal Focal Modulation for Video Action RecognitionPoster28 citations
  784. CoIn: Contrastive Instance Feature Mining for Outdoor 3D Object Detection with Very Limited AnnotationsPoster27 citations
  785. CoSign: Exploring Co-occurrence Signals in Skeleton-based Continuous Sign Language RecognitionPoster27 citations
  786. CoinSeg: Contrast Inter- and Intra- Class Representations for Incremental SegmentationPoster27 citations
  787. Decomposition-Based Variational Network for Multi-Contrast MRI Super-Resolution and ReconstructionPoster27 citations
  788. Discovering Spatio-Temporal Rationales for Video Question AnsweringPoster27 citations
  789. End2End Multi-View Feature Matching with Differentiable Pose OptimizationPoster27 citations
  790. FineRecon: Depth-aware Feed-forward Network for Detailed 3D ReconstructionPoster27 citations
  791. Focus the Discrepancy: Intra- and Inter-Correlation Learning for Image Anomaly DetectionPoster27 citations
  792. Generating Visual Scenes from TouchPoster27 citations
  793. GeoUDF: Surface Reconstruction from 3D Point Clouds via Geometry-guided Distance RepresentationPoster27 citations
  794. Learning Gabor Texture Features for Fine-Grained RecognitionPoster27 citations
  795. LoGoPrompt: Synthetic Text Images Can Be Good Visual Prompts for Vision-Language ModelsPoster27 citations
  796. MARS: Model-agnostic Biased Object Removal without Additional Supervision for Weakly-Supervised Semantic SegmentationPoster27 citations
  797. MODA: Mapping-Once Audio-driven Portrait Animation with Dual AttentionsPoster27 citations
  798. MUter: Machine Unlearning on Adversarially Trained ModelsPoster27 citations
  799. Neural Microfacet Fields for Inverse RenderingPoster27 citations
  800. Non-Semantics Suppressed Mask Learning for Unsupervised Video Semantic CompressionPoster27 citations
  801. Online Class Incremental Learning on Stochastic Blurry Task Boundary via Mask and Visual Prompt TuningPoster27 citations
  802. PEANUT: Predicting and Navigating to Unseen TargetsPoster27 citations
  803. Point2Mask: Point-supervised Panoptic Segmentation via Optimal TransportPoster27 citations
  804. PreSTU: Pre-Training for Scene-Text UnderstandingPoster27 citations
  805. RANA: Relightable Articulated Neural AvatarsPoster27 citations
  806. Reconstructing Interacting Hands with Interaction Prior from Monocular ImagesPoster27 citations
  807. Rosetta Neurons: Mining the Common Units in a Model ZooPoster27 citations
  808. SAFL-Net: Semantic-Agnostic Feature Learning Network with Auxiliary Plugins for Image Manipulation DetectionPoster27 citations
  809. SAL-ViT: Towards Latency Efficient Private Inference on ViT using Selective Attention Search with a Learnable Softmax ApproximationPoster27 citations
  810. Spatially and Spectrally Consistent Deep Functional MapsPoster27 citations
  811. Temporal Collection and Distribution for Referring Video Object SegmentationPoster27 citations
  812. ACLS: Adaptive and Conditional Label Smoothing for Network CalibrationOral26 citations
  813. Active Neural MappingPoster26 citations
  814. Attentive Mask CLIPPoster26 citations
  815. Bidirectionally Deformable Motion Modulation For Video-based Human Pose TransferPoster26 citations
  816. CBA: Improving Online Continual Learning via Continual Bias AdaptorPoster26 citations
  817. Contrastive Feature Masking Open-Vocabulary Vision TransformerPoster26 citations
  818. Cross Contrasting Feature Perturbation for Domain GeneralizationPoster26 citations
  819. Cross-Ray Neural Radiance Fields for Novel-View Synthesis from Unconstrained Image CollectionsOral26 citations
  820. DVGaze: Dual-View Gaze EstimationPoster26 citations
  821. Domain Generalization via Rationale InvariancePoster26 citations
  822. ELFNet: Evidential Local-global Fusion for Stereo MatchingPoster26 citations
  823. Efficient Video Action Detection with Token Dropout and Context RefinementPoster26 citations
  824. EgoObjects: A Large-Scale Egocentric Dataset for Fine-Grained Object UnderstandingPoster26 citations
  825. Evaluation and Improvement of Interpretability for Self-Explainable Part-Prototype NetworksPoster26 citations
  826. GlueGen: Plug and Play Multi-modal Encoders for X-to-image GenerationPoster26 citations
  827. GridPull: Towards Scalability in Learning Implicit Representations from 3D Point CloudsPoster26 citations
  828. Helping Hands: An Object-Aware Ego-Centric Video Recognition ModelPoster26 citations
  829. Human-centric Scene Understanding for 3D Large-scale ScenariosPoster26 citations
  830. Improving Lens Flare Removal with General-Purpose Pipeline and Multiple Light Sources RecoveryPoster26 citations
  831. Inherent Redundancy in Spiking Neural NetworksPoster26 citations
  832. LivelySpeaker: Towards Semantic-Aware Co-Speech Gesture GenerationPoster26 citations
  833. Localizing Moments in Long Video Via Multimodal GuidancePoster26 citations
  834. Low-Light Image Enhancement with Multi-Stage Residue Quantization and Brightness-Aware AttentionPoster26 citations
  835. NeMF: Inverse Volume Rendering with Neural Microflake FieldPoster26 citations
  836. Neural Haircut: Prior-Guided Strand-Based Hair ReconstructionOral26 citations
  837. Prior-guided Source-free Domain Adaptation for Human Pose EstimationPoster26 citations
  838. Scalable Multi-Temporal Remote Sensing Change Data Generation via Simulating Stochastic Change ProcessPoster26 citations
  839. Strivec: Sparse Tri-Vector Radiance FieldsPoster26 citations
  840. StyleGANEX: StyleGAN-Based Manipulation Beyond Cropped Aligned FacesPoster26 citations
  841. TEMPO: Efficient Multi-View Pose Estimation, Tracking, and ForecastingPoster26 citations
  842. Towards Open-Set Test-Time Adaptation Utilizing the Wisdom of Crowds in Entropy MinimizationPoster26 citations
  843. What do neural networks learn in image classification? A frequency shortcut perspectivePoster26 citations
  844. 3DPPE: 3D Point Positional Encoding for Transformer-based Multi-Camera 3D Object DetectionPoster25 citations
  845. ACTIVE: Towards Highly Transferable 3D Physical Camouflage for Universal and Robust Vehicle EvasionPoster25 citations
  846. ActorsNeRF: Animatable Few-shot Human Rendering with Generalizable NeRFsPoster25 citations
  847. AdaNIC: Towards Practical Neural Image Compression via Dynamic Transform RoutingPoster25 citations
  848. Anchor Structure Regularization Induced Multi-view Subspace Clustering via Enhanced Tensor Rank MinimizationPoster25 citations
  849. CAFA: Class-Aware Feature Alignment for Test-Time AdaptationPoster25 citations
  850. Chupa: Carving 3D Clothed Humans from Skinned Shape Priors using 2D Diffusion Probabilistic ModelsOral25 citations
  851. Controllable Person Image Synthesis with Pose-Constrained Latent DiffusionPoster25 citations
  852. DECO: Dense Estimation of 3D Human-Scene Contact In The WildOral25 citations
  853. DS-Fusion: Artistic Typography via Discriminated and Stylized DiffusionPoster25 citations
  854. Distribution-Aligned Diffusion for Human Mesh RecoveryPoster25 citations
  855. ElasticViT: Conflict-aware Supernet Training for Deploying Fast Vision Transformer on Diverse Mobile DevicesPoster25 citations
  856. EverLight: Indoor-Outdoor Editable HDR Lighting EstimationPoster25 citations
  857. GECCO: Geometrically-Conditioned Point Diffusion ModelsPoster25 citations
  858. GasMono: Geometry-Aided Self-Supervised Monocular Depth Estimation for Indoor ScenesPoster25 citations
  859. Generalizable Decision Boundaries: Dualistic Meta-Learning for Open Set Domain GeneralizationPoster25 citations
  860. HiFace: High-Fidelity 3D Face Reconstruction by Learning Static and Dynamic DetailsPoster25 citations
  861. Improving Generalization in Visual Reinforcement Learning via Conflict-aware Gradient Agreement AugmentationPoster25 citations
  862. InterFormer: Real-time Interactive Image SegmentationPoster25 citations
  863. Jumping through Local Minima: Quantization in the Loss Landscape of Vision TransformersPoster25 citations
  864. Knowledge-Aware Federated Active Learning with Non-IID DataPoster25 citations
  865. L-DAWA: Layer-wise Divergence Aware Weight Aggregation in Federated Self-Supervised Visual Representation LearningPoster25 citations
  866. Label-Noise Learning with Intrinsically Long-Tailed DataPoster25 citations
  867. Large-Scale Person Detection and Localization Using Overhead Fisheye CamerasOral25 citations
  868. Local and Global Logit Adjustments for Long-Tailed LearningPoster25 citations
  869. Look at the Neighbor: Distortion-aware Unsupervised Domain Adaptation for Panoramic Semantic SegmentationPoster25 citations
  870. MV-Map: Offboard HD-Map Generation with Multi-view ConsistencyPoster25 citations
  871. MixSpeech: Cross-Modality Self-Learning with Audio-Visual Stream Mixup for Visual Speech Translation and RecognitionPoster25 citations
  872. Modeling the Relative Visual Tempo for Self-supervised Skeleton-based Action RecognitionPoster25 citations
  873. Multi-Metrics Adaptively Identifies Backdoors in Federated LearningPoster25 citations
  874. Once Detected, Never Lost: Surpassing Human Performance in Offline LiDAR based 3D Object DetectionOral25 citations
  875. Poincare ResNetPoster25 citations
  876. Rehearsal-Free Domain Continual Face Anti-Spoofing: Generalize More and Forget LessOral25 citations
  877. Self-Supervised Monocular Depth Estimation by Direction-aware Cumulative Convolution NetworkPoster25 citations
  878. Taming Contrast Maximization for Learning Sequential, Low-latency, Event-based Optical FlowPoster25 citations
  879. Texture Learning Domain Randomization for Domain Generalized SegmentationPoster25 citations
  880. Too Large; Data Reduction for Vision-Language Pre-TrainingPoster25 citations
  881. TopoSeg: Topology-Aware Nuclear Instance SegmentationPoster25 citations
  882. TransHuman: A Transformer-based Human Representation for Generalizable Neural Human RenderingPoster25 citations
  883. When Noisy Labels Meet Long Tail Dilemmas: A Representation Calibration MethodOral25 citations
  884. A Soft Nearest-Neighbor Framework for Continual Semi-Supervised LearningOral24 citations
  885. AccFlow: Backward Accumulation for Long-Range Optical FlowPoster24 citations
  886. Animal3D: A Comprehensive Dataset of 3D Animal Pose and ShapePoster24 citations
  887. Can Language Models Learn to Listen?Poster24 citations
  888. CoTDet: Affordance Knowledge Prompting for Task Driven Object DetectionPoster24 citations
  889. Coarse-to-Fine Amodal Segmentation with Shape PriorPoster24 citations
  890. Cyclic Test-Time Adaptation on Monocular Video for 3D Human Mesh ReconstructionPoster24 citations
  891. DFA3D: 3D Deformable Attention For 2D-to-3D Feature LiftingPoster24 citations
  892. Data Augmented Flatness-aware Gradient Projection for Continual LearningPoster24 citations
  893. Decouple Before Interact: Multi-Modal Prompt Learning for Continual Visual Question AnsweringPoster24 citations
  894. Efficient Adaptive Human-Object Interaction Detection with Concept-guided MemoryPoster24 citations
  895. Fine-grained Unsupervised Domain Adaptation for Gait RecognitionPoster24 citations
  896. Get3DHuman: Lifting StyleGAN-Human into a 3D Generative Model Using Pixel-Aligned Reconstruction PriorsPoster24 citations
  897. Hallucination Improves the Performance of Unsupervised Visual Representation LearningPoster24 citations
  898. Multi-Label Knowledge DistillationPoster24 citations
  899. Noise-Aware Learning from Web-Crawled Image-Text Data for Image CaptioningPoster24 citations
  900. Prune Spatio-temporal Tokens by Semantic-aware Temporal AccumulationPoster24 citations
  901. RPEFlow: Multimodal Fusion of RGB-PointCloud-Event for Joint Optical Flow and Scene Flow EstimationPoster24 citations
  902. STPrivacy: Spatio-Temporal Privacy-Preserving Action RecognitionPoster24 citations
  903. Self-supervised Monocular Underwater Depth Recovery, Image Restoration, and a Real-sea Video DatasetPoster24 citations
  904. Shrinking Class Space for Enhanced Certainty in Semi-Supervised LearningPoster24 citations
  905. Test Time Adaptation for Blind Image Quality AssessmentPoster24 citations
  906. The Devil is in the Crack Orientation: A New Perspective for Crack DetectionPoster24 citations
  907. Uncertainty Guided Adaptive Warping for Robust and Efficient Stereo MatchingPoster24 citations
  908. Understanding Self-attention Mechanism via Dynamical System PerspectivePoster24 citations
  909. Visual Explanations via Iterated Integrated AttributionsPoster24 citations
  910. XVO: Generalized Visual Odometry via Cross-Modal Self-TrainingPoster24 citations
  911. Accurate 3D Face Reconstruction with Facial Component TokensPoster23 citations
  912. Aggregating Feature Point Cloud for Depth CompletionPoster23 citations
  913. COCO-O: A Benchmark for Object Detectors under Natural Distribution ShiftsPoster23 citations
  914. ChildPlay: A New Benchmark for Understanding Children's Gaze BehaviourPoster23 citations
  915. Contrastive Pseudo Learning for Open-World DeepFake AttributionPoster23 citations
  916. Decoupled DETR: Spatially Disentangling Localization and Classification for Improved End-to-End Object DetectionPoster23 citations
  917. Deep Geometry-Aware Camera Self-Calibration from VideoPoster23 citations
  918. DocTr: Document Transformer for Structured Information Extraction in DocumentsPoster23 citations
  919. DreamTeacher: Pretraining Image Backbones with Deep Generative ModelsPoster23 citations
  920. Dynamic Mesh-Aware Radiance FieldsPoster23 citations
  921. EGformer: Equirectangular Geometry-biased Transformer for 360 Depth EstimationPoster23 citations
  922. Efficient Decision-based Black-box Patch Attacks on Video RecognitionPoster23 citations
  923. FACTS: First Amplify Correlations and Then Slice to Discover BiasPoster23 citations
  924. GETAvatar: Generative Textured Meshes for Animatable Human AvatarsPoster23 citations
  925. H3WB: Human3.6M 3D WholeBody Dataset and BenchmarkPoster23 citations
  926. HiLo: Exploiting High Low Frequency Relations for Unbiased Panoptic Scene Graph GenerationPoster23 citations
  927. How Far Pre-trained Models Are from Neural Collapse on the Target Dataset Informs their TransferabilityPoster23 citations
  928. Inter-Realization Channels: Unsupervised Anomaly Detection Beyond One-Class ClassificationPoster23 citations
  929. LMR: A Large-Scale Multi-Reference Dataset for Reference-Based Super-ResolutionPoster23 citations
  930. Learning Human Dynamics in Autonomous Driving ScenariosPoster23 citations
  931. Learning Pseudo-Relations for Cross-domain Semantic SegmentationPoster23 citations
  932. Lighting Every Darkness in Two Pairs: A Calibration-Free Pipeline for RAW DenoisingPoster23 citations
  933. MPCViT: Searching for Accurate and Efficient MPC-Friendly Vision Transformer with Heterogeneous AttentionPoster23 citations
  934. Mesh2Tex: Generating Mesh Textures from Image QueriesPoster23 citations
  935. On the Robustness of Open-World Test-Time Training: Self-Training with Dynamic Prototype ExpansionOral23 citations
  936. Parameterized Cost Volume for Stereo MatchingPoster23 citations
  937. Perceptual Artifacts Localization for Image Synthesis TasksPoster23 citations
  938. Periodically Exchange Teacher-Student for Source-Free Object DetectionPoster23 citations
  939. Pretrained Language Models as Visual Planners for Human AssistancePoster23 citations
  940. Prototypes-oriented Transductive Few-shot Learning with Conditional TransportPoster23 citations
  941. Sign Language Translation with Iterative PrototypePoster23 citations
  942. Take-A-Photo: 3D-to-2D Generative Pre-training of Point Cloud ModelsPoster23 citations
  943. Unleashing the Potential of Spiking Neural Networks with Dynamic ConfidencePoster23 citations
  944. With a Little Help from Your Own Past: Prototypical Memory Networks for Image CaptioningPoster23 citations
  945. ALWOD: Active Learning for Weakly-Supervised Object DetectionPoster22 citations
  946. Advancing Referring Expression Segmentation Beyond Single ImagePoster22 citations
  947. AlignDet: Aligning Pre-training and Fine-tuning in Object DetectionPoster22 citations
  948. CDAC: Cross-domain Attention Consistency in Transformer for Domain Adaptive Semantic SegmentationPoster22 citations
  949. CGBA: Curvature-aware Geometric Black-box AttackOral22 citations
  950. CLIPTER: Looking at the Bigger Picture in Scene Text RecognitionPoster22 citations
  951. CVRecon: Rethinking 3D Geometric Feature Learning For Neural ReconstructionPoster22 citations
  952. Co-Evolution of Pose and Mesh for 3D Human Body Estimation from VideoPoster22 citations
  953. Density-invariant Features for Distant Point Cloud RegistrationPoster22 citations
  954. Divide and Conquer: a Two-Step Method for High Quality Face De-identification with Model ExplainabilityPoster22 citations
  955. Efficient-VQGAN: Towards High-Resolution Image Generation with Efficient Vision TransformersPoster22 citations
  956. FSI: Frequency and Spatial Interactive Learning for Image Restoration in Under-Display CamerasPoster22 citations
  957. FedPerfix: Towards Partial Model Personalization of Vision Transformers in Federated LearningPoster22 citations
  958. HairCLIPv2: Unifying Hair Editing via Proxy Feature BlendingPoster22 citations
  959. Hierarchical Spatio-Temporal Representation Learning for Gait RecognitionPoster22 citations
  960. Hierarchical Visual Primitive Experts for Compositional Zero-Shot LearningPoster22 citations
  961. Hyperbolic Audio-visual Zero-shot LearningPoster22 citations
  962. Identification of Systematic Errors of Image Classifiers on Rare SubgroupsPoster22 citations
  963. LNPL-MIL: Learning from Noisy Pseudo Labels for Promoting Multiple Instance Learning in Whole Slide ImagePoster22 citations
  964. Label Shift Adapter for Test-Time Adaptation under Covariate and Label ShiftsPoster22 citations
  965. MAP: Towards Balanced Generalization of IID and OOD through Model-Agnostic AdaptersOral22 citations
  966. MiniROAD: Minimal RNN Framework for Online Action DetectionPoster22 citations
  967. PatchCT: Aligning Patch Set and Label Set with Conditional Transport for Multi-Label Image ClassificationPoster22 citations
  968. Person Re-Identification without Identification via Event anonymizationPoster22 citations
  969. PointMBF: A Multi-scale Bidirectional Fusion Network for Unsupervised RGB-D Point Cloud RegistrationPoster22 citations
  970. Preface: A Data-driven Volumetric Prior for Few-shot Ultra High-resolution Face SynthesisPoster22 citations
  971. Pseudo-label Alignment for Semi-supervised Instance SegmentationPoster22 citations
  972. RawHDR: High Dynamic Range Image Reconstruction from a Single Raw ImagePoster22 citations
  973. Reconstructed Convolution Module Based Look-Up Tables for Efficient Image Super-ResolutionPoster22 citations
  974. Rethinking Multi-Contrast MRI Super-Resolution: Rectangle-Window Cross-Attention Transformer and Arbitrary-Scale UpsamplingPoster22 citations
  975. SIRA-PCR: Sim-to-Real Adaptation for 3D Point Cloud RegistrationPoster22 citations
  976. Shatter and Gather: Learning Referring Image Segmentation with Text SupervisionPoster22 citations
  977. Snow Removal in Video: A New Dataset and A Novel MethodPoster22 citations
  978. Thinking Image Color Aesthetics Assessment: Models, Datasets and BenchmarksPoster22 citations
  979. Towards Instance-adaptive Inference for Federated LearningPoster22 citations
  980. What Can a Cook in Italy Teach a Mechanic in India? Action Recognition Generalisation Over Scenarios and LocationsPoster22 citations
  981. 3DHacker: Spectrum-based Decision Boundary Generation for Hard-label 3D Point Cloud AttackPoster21 citations
  982. ASIC: Aligning Sparse in-the-wild Image CollectionsOral21 citations
  983. Calibrating Uncertainty for Semi-Supervised Crowd CountingPoster21 citations
  984. ChartReader: A Unified Framework for Chart Derendering and Comprehension without Heuristic RulesPoster21 citations
  985. Class-relation Knowledge Distillation for Novel Class DiscoveryPoster21 citations
  986. Continual Segment: Towards a Single, Unified and Non-forgetting Continual Segmentation Model of 143 Whole-body Organs in CT ScansPoster21 citations
  987. Counting Crowds in Bad WeatherPoster21 citations
  988. DIME-FM : DIstilling Multimodal and Efficient Foundation ModelsPoster21 citations
  989. DLT: Conditioned layout generation with Joint Discrete-Continuous Diffusion Layout TransformerPoster21 citations
  990. Dancing in the Dark: A Benchmark towards General Low-light Video EnhancementPoster21 citations
  991. Deformer: Dynamic Fusion Transformer for Robust Hand Pose EstimationPoster21 citations
  992. Distracting Downpour: Adversarial Weather Attacks for Motion EstimationPoster21 citations
  993. DynamicISP: Dynamically Controlled Image Signal Processor for Image RecognitionPoster21 citations
  994. EgoLoc: Revisiting 3D Object Localization from Egocentric Videos with Visual QueriesOral21 citations
  995. Enhancing NeRF akin to Enhancing LLMs: Generalizable NeRF Transformer with Mixture-of-View-ExpertsPoster21 citations
  996. Exploring Temporal Frequency Spectrum in Deep Video DeblurringPoster21 citations
  997. Grounded Entity-Landmark Adaptive Pre-Training for Vision-and-Language NavigationOral21 citations
  998. Kick Back & Relax: Learning to Reconstruct the World by Watching SlowTVPoster21 citations
  999. Label-Free Event-based Object Recognition via Joint Learning with Image Reconstruction from EventsOral21 citations
  1000. Leveraging SE(3) Equivariance for Learning 3D Geometric Shape AssemblyPoster21 citations

Looking for submission deadlines instead? See the conference deadline calendar.