← All conferences

CVPR 2024 Accepted Papers

The full list of 2,640 papers accepted at CVPR 2024 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Poster: 2,323Highlight: 317
  1. PACER+: On-Demand Pedestrian Animation Controller in Driving ScenariosPoster15 citations
  2. PRDP: Proximal Reward Difference Prediction for Large-Scale Reward Finetuning of Diffusion ModelsPoster15 citations
  3. Permutation Equivariance of Transformers and Its ApplicationsPoster15 citations
  4. Person-in-WiFi 3D: End-to-End Multi-Person 3D Pose Estimation with Wi-FiPoster15 citations
  5. Prompt Learning via Meta-RegularizationPoster15 citations
  6. RankED: Addressing Imbalance and Uncertainty in Edge Detection Using Ranking-based LossesPoster15 citations
  7. ReGenNet: Towards Human Action-Reaction SynthesisPoster15 citations
  8. RealCustom: Narrowing Real Text Word for Real-Time Open-Domain Text-to-Image CustomizationPoster15 citations
  9. RecDiffusion: Rectangling for Image Stitching with Diffusion ModelsPoster15 citations
  10. Relaxed Contrastive Learning for Federated LearningPoster15 citations
  11. Relightful Harmonization: Lighting-aware Portrait Background ReplacementPoster15 citations
  12. Rethinking Prior Information Generation with CLIP for Few-Shot SegmentationPoster15 citations
  13. Retrieval-Augmented Embodied AgentsPoster15 citations
  14. Retrieval-Augmented Layout Transformer for Content-Aware Layout GenerationPoster15 citations
  15. RoHM: Robust Human Motion Reconstruction via DiffusionPoster15 citations
  16. SUGAR: Pre-training 3D Visual Representations for RoboticsPoster15 citations
  17. Scaled Decoupled DistillationPoster15 citations
  18. SelfPose3d: Self-Supervised Multi-Person Multi-View 3d Pose EstimationPoster15 citations
  19. SimAC: A Simple Anti-Customization Method for Protecting Face Privacy against Text-to-Image Synthesis of Diffusion ModelsPoster15 citations
  20. StegoGAN: Leveraging Steganography for Non-Bijective Image-to-Image TranslationPoster15 citations
  21. Text-Guided Variational Image Generation for Industrial Anomaly Detection and SegmentationPoster15 citations
  22. Time- Memory- and Parameter-Efficient Visual AdaptationHighlight15 citations
  23. Towards Transferable Targeted 3D Adversarial Attack in the Physical WorldPoster15 citations
  24. UniMODE: Unified Monocular 3D Object DetectionHighlight15 citations
  25. Unsupervised Occupancy Learning from Sparse Point CloudHighlight15 citations
  26. 3D Face Reconstruction with the Geometric Guidance of Facial Part SegmentationHighlight14 citations
  27. APISR: Anime Production Inspired Real-World Anime Super-ResolutionPoster14 citations
  28. AV-RIR: Audio-Visual Room Impulse Response EstimationPoster14 citations
  29. Accurate Spatial Gene Expression Prediction by Integrating Multi-Resolution FeaturesPoster14 citations
  30. Adapting to Length Shift: FlexiLength Network for Trajectory PredictionPoster14 citations
  31. Attention Calibration for Disentangled Text-to-Image PersonalizationPoster14 citations
  32. Can Biases in ImageNet Models Explain Generalization?Poster14 citations
  33. Can Protective Perturbation Safeguard Personal Data from Being Exploited by Stable Diffusion?Poster14 citations
  34. Communication-Efficient Collaborative Perception via Information Filling with CodebookPoster14 citations
  35. Contrastive Mean-Shift Learning for Generalized Category DiscoveryPoster14 citations
  36. Customize your NeRF: Adaptive Source Driven 3D Scene Editing via Local-Global Iterative TrainingPoster14 citations
  37. D3still: Decoupled Differential Distillation for Asymmetric Image RetrievalPoster14 citations
  38. De-Diffusion Makes Text a Strong Cross-Modal InterfacePoster14 citations
  39. Decomposing Disease Descriptions for Enhanced Pathology Detection: A Multi-Aspect Vision-Language Pre-training FrameworkPoster14 citations
  40. DifFlow3D: Toward Robust Uncertainty-Aware Scene Flow Estimation with Iterative Diffusion-Based RefinementPoster14 citations
  41. DiffusionGAN3D: Boosting Text-guided 3D Generation and Domain Adaptation by Combining 3D GANs and Diffusion PriorsPoster14 citations
  42. ElasticDiffusion: Training-free Arbitrary Size Image Generation through Global-Local Content SeparationPoster14 citations
  43. Enhancing Visual Document Understanding with Contrastive Learning in Large Visual-Language ModelsPoster14 citations
  44. Face2Diffusion for Fast and Editable Face PersonalizationPoster14 citations
  45. Flatten Long-Range Loss Landscapes for Cross-Domain Few-Shot LearningPoster14 citations
  46. FreeDrag: Feature Dragging for Reliable Point-based Image EditingPoster14 citations
  47. From Isolated Islands to Pangea: Unifying Semantic Space for Human Action UnderstandingHighlight14 citations
  48. GlitchBench: Can Large Multimodal Models Detect Video Game Glitches?Poster14 citations
  49. GroupContrast: Semantic-aware Self-supervised Representation Learning for 3D UnderstandingPoster14 citations
  50. HIG: Hierarchical Interlacement Graph Approach to Scene Graph Generation in Video UnderstandingPoster14 citations
  51. Learning to Rematch Mismatched Pairs for Robust Cross-Modal RetrievalPoster14 citations
  52. LoS: Local Structure-Guided Stereo MatchingPoster14 citations
  53. MESA: Matching Everything by Segmenting AnythingPoster14 citations
  54. MoDE: CLIP Data Experts via ClusteringPoster14 citations
  55. Mocap Everyone Everywhere: Lightweight Motion Capture With Smartwatches and a Head-Mounted CameraPoster14 citations
  56. Model Inversion Robustness: Can Transfer Learning Help?Poster14 citations
  57. Modular Blind Video Quality AssessmentPoster14 citations
  58. No Time to Train: Empowering Non-Parametric Networks for Few-shot 3D Scene SegmentationHighlight14 citations
  59. Point Segment and Count: A Generalized Framework for Object CountingPoster14 citations
  60. Point2CAD: Reverse Engineering CAD Models from 3D Point CloudsHighlight14 citations
  61. Point2RBox: Combine Knowledge from Synthetic Visual Patterns for End-to-end Oriented Object Detection with Single Point SupervisionPoster14 citations
  62. ProMark: Proactive Diffusion Watermarking for Causal AttributionPoster14 citations
  63. ProS: Prompting-to-simulate Generalized knowledge for Universal Cross-Domain RetrievalPoster14 citations
  64. Probabilistic Speech-Driven 3D Facial Motion Synthesis: New Benchmarks Methods and ApplicationsPoster14 citations
  65. Referring Image Editing: Object-level Image Editing via Referring ExpressionsPoster14 citations
  66. Rethinking Few-shot 3D Point Cloud Semantic SegmentationPoster14 citations
  67. RobustSAM: Segment Anything Robustly on Degraded ImagesHighlight14 citations
  68. SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language ModelsPoster14 citations
  69. SPIN: Simultaneous Perception Interaction and NavigationPoster14 citations
  70. SPOT: Self-Training with Patch-Order Permutation for Object-Centric Learning with Autoregressive TransformersHighlight14 citations
  71. SchurVINS: Schur Complement-Based Lightweight Visual Inertial Navigation SystemPoster14 citations
  72. Seeing Motion at Nighttime with an Event CameraPoster14 citations
  73. Semantics Distortion and Style Matter: Towards Source-free UDA for Panoramic SegmentationPoster14 citations
  74. Single Domain Generalization for Crowd CountingPoster14 citations
  75. Sparse Global Matching for Video Frame Interpolation with Large MotionPoster14 citations
  76. Structure-Guided Adversarial Training of Diffusion ModelsPoster14 citations
  77. Style Blind Domain Generalized Semantic Segmentation via Covariance Alignment and Semantic Consistence Contrastive LearningPoster14 citations
  78. Template Free Reconstruction of Human-object Interaction with Procedural Interaction GenerationHighlight14 citations
  79. Theoretically Achieving Continuous Representation of Oriented Bounding BoxesPoster14 citations
  80. UniMix: Towards Domain Adaptive and Generalizable LiDAR Semantic Segmentation in Adverse WeatherPoster14 citations
  81. Unleashing Channel Potential: Space-Frequency Selection Convolution for SAR Object DetectionPoster14 citations
  82. Unmixing Diffusion for Self-Supervised Hyperspectral Image DenoisingPoster14 citations
  83. Unveiling Parts Beyond Objects: Towards Finer-Granularity Referring Expression SegmentationPoster14 citations
  84. Visual Delta Generator with Large Multi-modal Models for Semi-supervised Composed Image RetrievalPoster14 citations
  85. Z*: Zero-shot Style Transfer via Attention ReweightingPoster14 citations
  86. ZePT: Zero-Shot Pan-Tumor Segmentation via Query-Disentangling and Self-PromptingPoster14 citations
  87. 3DInAction: Understanding Human Actions in 3D Point CloudsHighlight13 citations
  88. 3DiffTection: 3D Object Detection with Geometry-Aware Diffusion FeaturesPoster13 citations
  89. Are Conventional SNNs Really Efficient? A Perspective from Network QuantizationHighlight13 citations
  90. Auto-Train-Once: Controller Network Guided Automatic Network Pruning from ScratchPoster13 citations
  91. Blur-aware Spatio-temporal Sparse Transformer for Video DeblurringPoster13 citations
  92. Bridging the Synthetic-to-Authentic Gap: Distortion-Guided Unsupervised Domain Adaptation for Blind Image Quality AssessmentPoster13 citations
  93. CAD: Photorealistic 3D Generation via Adversarial DistillationPoster13 citations
  94. CPLIP: Zero-Shot Learning for Histopathology with Comprehensive Vision-Language AlignmentPoster13 citations
  95. Class Incremental Learning with Multi-Teacher DistillationPoster13 citations
  96. CoDi: Conditional Diffusion Distillation for Higher-Fidelity and Faster Image GenerationPoster13 citations
  97. Comparing the Decision-Making Mechanisms by Transformers and CNNs via Explanation MethodsPoster13 citations
  98. CrowdDiff: Multi-hypothesis Crowd Density Estimation using Diffusion ModelsPoster13 citations
  99. DeIL: Direct-and-Inverse CLIP for Open-World Few-Shot LearningPoster13 citations
  100. Deep Equilibrium Diffusion Restoration with Parallel SamplingPoster13 citations
  101. DiffAM: Diffusion-based Adversarial Makeup Transfer for Facial Privacy ProtectionPoster13 citations
  102. DiffAssemble: A Unified Graph-Diffusion Model for 2D and 3D ReassemblyPoster13 citations
  103. Domain Prompt Learning with Quaternion NetworksHighlight13 citations
  104. Enhancing Post-training Quantization Calibration through Contrastive LearningPoster13 citations
  105. FCS: Feature Calibration and Separation for Non-Exemplar Class Incremental LearningPoster13 citations
  106. FastMAC: Stochastic Spectral Sampling of Correspondence GraphPoster13 citations
  107. GLACE: Global Local Accelerated Coordinate EncodingPoster13 citations
  108. Generating Content for HDR Deghosting from Frequency ViewPoster13 citations
  109. Generative Latent Coding for Ultra-Low Bitrate Image CompressionPoster13 citations
  110. Higher-order Relational Reasoning for Pedestrian Trajectory PredictionPoster13 citations
  111. How Far Can We Compress Instant-NGP-Based NeRF?Poster13 citations
  112. Improving Depth Completion via Depth Feature UpsamplingPoster13 citations
  113. Improving Plasticity in Online Continual Learning via Collaborative LearningPoster13 citations
  114. InstaGen: Enhancing Object Detection by Training on Synthetic DatasetPoster13 citations
  115. InterHandGen: Two-Hand Interaction Generation via Cascaded Reverse DiffusionPoster13 citations
  116. Inversion-Free Image Editing with Language-Guided Diffusion ModelsPoster13 citations
  117. Learning Continual Compatible Representation for Re-indexing Free Lifelong Person Re-identificationPoster13 citations
  118. Learning Equi-angular Representations for Online Continual LearningPoster13 citations
  119. Learning Structure-from-Motion with Graph Attention NetworksPoster13 citations
  120. MVIP-NeRF: Multi-view 3D Inpainting on NeRF Scenes via Diffusion PriorPoster13 citations
  121. Mind Marginal Non-Crack Regions: Clustering-Inspired Representation Learning for Crack SegmentationPoster13 citations
  122. NARUTO: Neural Active Reconstruction from Uncertain Target ObservationsPoster13 citations
  123. NC-TTT: A Noise Constrastive Approach for Test-Time TrainingHighlight13 citations
  124. Neural Refinement for Absolute Pose Regression with Feature SynthesisPoster13 citations
  125. Neural Spline Fields for Burst Image Fusion and Layer SeparationPoster13 citations
  126. NoiseCollage: A Layout-Aware Text-to-Image Diffusion Model Based on Noise Cropping and MergingPoster13 citations
  127. Not All Prompts Are Secure: A Switchable Backdoor Attack Against Pre-trained Vision TransfomersPoster13 citations
  128. PIN: Positional Insert Unlocks Object Localisation Abilities in VLMsPoster13 citations
  129. PTT: Point-Trajectory Transformer for Efficient Temporal 3D Object DetectionPoster13 citations
  130. Progressive Divide-and-Conquer via Subsampling Decomposition for Accelerated MRIHighlight13 citations
  131. ProxyCap: Real-time Monocular Full-body Capture in World Space via Human-Centric Proxy-to-Motion LearningPoster13 citations
  132. RTracker: Recoverable Tracking via PN Tree Structured MemoryPoster13 citations
  133. Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and BenchmarkHighlight13 citations
  134. Real-Time Exposure Correction via Collaborative Transformations and Adaptive SamplingPoster13 citations
  135. RepKPU: Point Cloud Upsampling with Kernel Point Representation and DeformationPoster13 citations
  136. Rethinking Interactive Image Segmentation with Low Latency High Quality and Diverse PromptsPoster13 citations
  137. Retrieval-Augmented Open-Vocabulary Object DetectionPoster13 citations
  138. Riemannian Multinomial Logistics Regression for SPD Neural NetworksPoster13 citations
  139. S2MVTC: a Simple yet Efficient Scalable Multi-View Tensor ClusteringPoster13 citations
  140. Scaling Up Video Summarization Pretraining with Large Language ModelsPoster13 citations
  141. Self-Supervised Facial Representation Learning with Facial Region AwarenessPoster13 citations
  142. Towards Generalizable Multi-Object TrackingPoster13 citations
  143. Towards Progressive Multi-Frequency Representation for Image WarpingPoster13 citations
  144. Towards Variable and Coordinated Holistic Co-Speech Motion GenerationPoster13 citations
  145. Towards the Uncharted: Density-Descending Feature Perturbation for Semi-supervised Semantic SegmentationPoster13 citations
  146. UniBind: LLM-Augmented Unified and Balanced Representation Space to Bind Them AllPoster13 citations
  147. UniGS: Unified Representation for Image Generation and SegmentationPoster13 citations
  148. Unknown Prompt the only Lacuna: Unveiling CLIP's Potential for Open Domain GeneralizationPoster13 citations
  149. Unveiling the Power of Audio-Visual Early Fusion Transformers with Dense Interactions through Masked ModelingPoster13 citations
  150. VOODOO 3D: Volumetric Portrait Disentanglement For One-Shot 3D Head ReenactmentPoster13 citations
  151. Video Prediction by Modeling Videos as Continuous Multi-Dimensional ProcessesPoster13 citations
  152. VideoCon: Robust Video-Language Alignment via Contrast CaptionsPoster13 citations
  153. VideoGrounding-DINO: Towards Open-Vocabulary Spatio-Temporal Video GroundingPoster13 citations
  154. VideoRF: Rendering Dynamic Radiance Fields as 2D Feature Video StreamsPoster13 citations
  155. Watermark-embedded Adversarial Examples for Copyright Protection against Diffusion ModelsPoster13 citations
  156. X-3D: Explicit 3D Structure Modeling for Point Cloud RecognitionPoster13 citations
  157. 4D-DRESS: A 4D Dataset of Real-World Human Clothing With Semantic AnnotationsHighlight12 citations
  158. A Pedestrian is Worth One Prompt: Towards Language Guidance Person Re-IdentificationHighlight12 citations
  159. A Simple and Effective Point-based Network for Event Camera 6-DOFs Pose RelocalizationPoster12 citations
  160. ADA-Track: End-to-End Multi-Camera 3D Multi-Object Tracking with Alternating Detection and AssociationPoster12 citations
  161. ASAM: Boosting Segment Anything Model with Adversarial TuningPoster12 citations
  162. Abductive Ego-View Accident Video Understanding for Safe Driving PerceptionHighlight12 citations
  163. All in One Framework for Multimodal Re-identification in the WildPoster12 citations
  164. Arbitrary Motion Style Transfer with Multi-condition Motion Latent Diffusion ModelPoster12 citations
  165. Clustering for Protein Representation LearningPoster12 citations
  166. Concept Weaver: Enabling Multi-Concept Fusion in Text-to-Image ModelsPoster12 citations
  167. Consistency and Uncertainty: Identifying Unreliable Responses From Black-Box Vision-Language Models for Selective Visual Question AnsweringPoster12 citations
  168. ConvoFusion: Multi-Modal Conversational Diffusion for Co-Speech Gesture SynthesisPoster12 citations
  169. Cooperation Does Matter: Exploring Multi-Order Bilateral Relations for Audio-Visual SegmentationHighlight12 citations
  170. Data Poisoning based Backdoor Attacks to Contrastive LearningPoster12 citations
  171. DetCLIPv3: Towards Versatile Generative Open-vocabulary Object DetectionPoster12 citations
  172. DiffLoc: Diffusion Model for Outdoor LiDAR LocalizationPoster12 citations
  173. DiffPortrait3D: Controllable Diffusion for Zero-Shot Portrait View SynthesisHighlight12 citations
  174. Discriminative Probing and Tuning for Text-to-Image GenerationPoster12 citations
  175. Distilling CLIP with Dual Guidance for Learning Discriminative Human Body Shape RepresentationPoster12 citations
  176. Distribution-aware Knowledge Prototyping for Non-exemplar Lifelong Person Re-identificationPoster12 citations
  177. Diversified and Personalized Multi-rater Medical Image SegmentationHighlight12 citations
  178. Do Vision and Language Encoders Represent the World Similarly?Poster12 citations
  179. Doodle Your 3D: From Abstract Freehand Sketches to Precise 3D ShapesPoster12 citations
  180. DynVideo-E: Harnessing Dynamic NeRF for Large-Scale Motion- and View-Change Human-Centric Video EditingPoster12 citations
  181. Dynamic LiDAR Re-simulation using Compositional Neural FieldsHighlight12 citations
  182. ECLIPSE: Efficient Continual Learning in Panoptic Segmentation with Visual Prompt TuningPoster12 citations
  183. Event-assisted Low-Light Video Object SegmentationPoster12 citations
  184. EventPS: Real-Time Photometric Stereo Using an Event CameraPoster12 citations
  185. Exploring Regional Clues in CLIP for Zero-Shot Semantic SegmentationPoster12 citations
  186. FineParser: A Fine-grained Spatio-temporal Action Parser for Human-centric Action Quality AssessmentPoster12 citations
  187. From Coarse to Fine-Grained Open-Set RecognitionPoster12 citations
  188. From-Ground-To-Objects: Coarse-to-Fine Self-supervised Monocular Depth Estimation of Dynamic Objects with Ground Contact PriorPoster12 citations
  189. GRAM: Global Reasoning for Multi-Page VQAPoster12 citations
  190. GenN2N: Generative NeRF2NeRF TranslationPoster12 citations
  191. Genuine Knowledge from Practice: Diffusion Test-Time Adaptation for Video Adverse Weather RemovalPoster12 citations
  192. Guided Slot Attention for Unsupervised Video Object SegmentationPoster12 citations
  193. HOI-M^3: Capture Multiple Humans and Objects Interaction within Contextual EnvironmentHighlight12 citations
  194. Hierarchical Correlation Clustering and Tree Preserving EmbeddingPoster12 citations
  195. Holo-Relighting: Controllable Volumetric Portrait Relighting from a Single ImagePoster12 citations
  196. IIRP-Net: Iterative Inference Residual Pyramid Network for Enhanced Image RegistrationPoster12 citations
  197. Improved Implicit Neural Representation with Fourier Reparameterized TrainingPoster12 citations
  198. Improving Semantic Correspondence with Viewpoint-Guided Spherical MapsPoster12 citations
  199. Improving Training Efficiency of Diffusion Models via Multi-Stage Framework and Tailored Multi-Decoder ArchitecturePoster12 citations
  200. IntrinsicAvatar: Physically Based Inverse Rendering of Dynamic Humans from Monocular Videos via Explicit Ray TracingPoster12 citations
  201. Joint Reconstruction of 3D Human and Object via Contact-Based Refinement TransformerPoster12 citations
  202. LDP: Language-driven Dual-Pixel Image Defocus Deblurring NetworkPoster12 citations
  203. LQMFormer: Language-aware Query Mask Transformer for Referring Image SegmentationPoster12 citations
  204. LSK3DNet: Towards Effective and Efficient 3D Perception with Large Sparse KernelsPoster12 citations
  205. Learning to Transform Dynamically for Better Adversarial TransferabilityPoster12 citations
  206. M3-UDA: A New Benchmark for Unsupervised Domain Adaptive Fetal Cardiac Structure DetectionPoster12 citations
  207. MANUS: Markerless Grasp Capture using Articulated 3D GaussiansPoster12 citations
  208. MLP Can Be A Good Transformer LearnerPoster12 citations
  209. MULDE: Multiscale Log-Density Estimation via Denoising Score Matching for Video Anomaly DetectionPoster12 citations
  210. Modality-Agnostic Structural Image Representation Learning for Deformable Multi-Modality Medical Image RegistrationHighlight12 citations
  211. MonoDiff: Monocular 3D Object Detection and Pose Estimation with Diffusion ModelsPoster12 citations
  212. Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision TransformersPoster12 citations
  213. ODCR: Orthogonal Decoupling Contrastive Regularization for Unpaired Image DehazingPoster12 citations
  214. OED: Towards One-stage End-to-End Dynamic Scene Graph GenerationPoster12 citations
  215. Open-World Human-Object Interaction Detection via Multi-modal PromptsPoster12 citations
  216. PartDistill: 3D Shape Part Segmentation by Vision-Language Model DistillationPoster12 citations
  217. Perception-Oriented Video Frame Interpolation via Asymmetric BlendingPoster12 citations
  218. Perturbing Attention Gives You More Bang for the Buck: Subtle Imaging Perturbations That Efficiently Fool Customized Diffusion ModelsPoster12 citations
  219. Physical Property Understanding from Language-Embedded Feature FieldsPoster12 citations
  220. PracticalDG: Perturbation Distillation on Vision-Language Models for Hybrid Domain GeneralizationPoster12 citations
  221. Progress-Aware Online Action Segmentation for Egocentric Procedural Task VideosPoster12 citations
  222. Prompt-Driven Dynamic Object-Centric Learning for Single Domain GeneralizationPoster12 citations
  223. Prompt-Driven Referring Image Segmentation with Instance ContrastingPoster12 citations
  224. Promptable Behaviors: Personalizing Multi-Objective Rewards from Human PreferencesPoster12 citations
  225. Purified and Unified Steganographic NetworkPoster12 citations
  226. REACTO: Reconstructing Articulated Objects from a Single VideoPoster12 citations
  227. RMem: Restricted Memory Banks Improve Video Object SegmentationPoster12 citations
  228. Rethinking Generalizable Face Anti-spoofing via Hierarchical Prototype-guided Distribution Refinement in Hyperbolic SpaceHighlight12 citations
  229. Rethinking the Spatial Inconsistency in Classifier-Free Diffusion GuidancePoster12 citations
  230. Revisiting Adversarial Training Under Long-Tailed DistributionsPoster12 citations
  231. Revisiting Single Image Reflection Removal In the WildPoster12 citations
  232. SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World KnowledgePoster12 citations
  233. Semantic-aware SAM for Point-Prompted Instance SegmentationHighlight12 citations
  234. Shadow Generation for Composite Image Using Diffusion ModelPoster12 citations
  235. Spherical Mask: Coarse-to-Fine 3D Point Cloud Instance Segmentation with Spherical RepresentationPoster12 citations
  236. T4P: Test-Time Training of Trajectory Prediction via Masked Autoencoder and Actor-specific Token MemoryPoster12 citations
  237. TEA: Test-time Energy AdaptationPoster12 citations
  238. The Devil is in the Fine-Grained Details: Evaluating Open-Vocabulary Object Detectors for Fine-Grained UnderstandingHighlight12 citations
  239. The Manga Whisperer: Automatically Generating Transcriptions for ComicsPoster12 citations
  240. Towards More Unified In-context Visual UnderstandingPoster12 citations
  241. Towards Robust 3D Object Detection with LiDAR and 4D Radar Fusion in Various Weather ConditionsPoster12 citations
  242. Unifying Top-down and Bottom-up Scanpath Prediction Using TransformersPoster12 citations
  243. Video2Game: Real-time Interactive Realistic and Browser-Compatible Environment from a Single VideoPoster12 citations
  244. VideoMAC: Video Masked Autoencoders Meet ConvNetsPoster12 citations
  245. WANDR: Intention-guided Human Motion GenerationPoster12 citations
  246. 3DSFLabelling: Boosting 3D Scene Flow Estimation by Pseudo Auto-labellingPoster11 citations
  247. AMU-Tuning: Effective Logit Bias for CLIP-based Few-shot LearningPoster11 citations
  248. Action Scene Graphs for Long-Form Understanding of Egocentric VideosPoster11 citations
  249. BIVDiff: A Training-Free Framework for General-Purpose Video Synthesis via Bridging Image and Video Diffusion ModelsPoster11 citations
  250. CAT: Exploiting Inter-Class Dynamics for Domain Adaptive Object DetectionPoster11 citations
  251. CLIP-BEVFormer: Enhancing Multi-View Image-Based BEV Detector with Ground Truth FlowPoster11 citations
  252. Check Locate Rectify: A Training-Free Layout Calibration System for Text-to-Image GenerationPoster11 citations
  253. Codebook Transfer with Part-of-Speech for Vector-Quantized Image ModelingPoster11 citations
  254. Contextual Augmented Global Contrast for Multimodal Intent RecognitionPoster11 citations
  255. Continual-MAE: Adaptive Distribution Masked Autoencoders for Continual Test-Time AdaptationPoster11 citations
  256. DiverGen: Improving Instance Segmentation by Learning Wider Data Distribution with More Diverse Generative DataPoster11 citations
  257. DocRes: A Generalist Model Toward Unifying Document Image Restoration TasksPoster11 citations
  258. Endow SAM with Keen Eyes: Temporal-spatial Prompt Learning for Video Camouflaged Object DetectionPoster11 citations
  259. EventDance: Unsupervised Source-free Cross-modal Adaptation for Event-based Object RecognitionPoster11 citations
  260. Exploring the Potential of Large Foundation Models for Open-Vocabulary HOI DetectionPoster11 citations
  261. Faces that Speak: Jointly Synthesising Talking Face and Speech from TextPoster11 citations
  262. Feedback-Guided Autonomous DrivingHighlight11 citations
  263. Garment Recovery with Shape and Deformation PriorsPoster11 citations
  264. Generate Subgoal Images before Act: Unlocking the Chain-of-Thought Reasoning in Diffusion Model for Robot Manipulation with Multimodal PromptsPoster11 citations
  265. GenesisTex: Adapting Image Denoising Diffusion to Texture SpacePoster11 citations
  266. HOIAnimator: Generating Text-prompt Human-object Animations using Novel Perceptive Diffusion ModelsPoster11 citations
  267. Hierarchical Patch Diffusion Models for High-Resolution Video GenerationPoster11 citations
  268. ImageNet-D: Benchmarking Neural Network Robustness on Diffusion Synthetic ObjectHighlight11 citations
  269. Imagine Before Go: Self-Supervised Generative Map for Object Goal NavigationPoster11 citations
  270. KPConvX: Modernizing Kernel Point Convolution with Kernel AttentionPoster11 citations
  271. LED: A Large-scale Real-world Paired Dataset for Event Camera DenoisingPoster11 citations
  272. Learn from View Correlation: An Anchor Enhancement Strategy for Multi-view ClusteringPoster11 citations
  273. Learning Disentangled Identifiers for Action-Customized Text-to-Image GenerationPoster11 citations
  274. Learning Visual Prompt for Gait RecognitionPoster11 citations
  275. Low-Rank Approximation for Sparse Attention in Multi-Modal LLMsPoster11 citations
  276. Low-power Continuous Remote Behavioral Localization with Event CamerasPoster11 citations
  277. M&M VTO: Multi-Garment Virtual Try-On and EditingHighlight11 citations
  278. MOHO: Learning Single-view Hand-held Object Reconstruction with Multi-view Occlusion-Aware SupervisionPoster11 citations
  279. MimicDiffusion: Purifying Adversarial Perturbation via Mimicking Clean Diffusion ModelPoster11 citations
  280. Multiway Point Cloud Mosaicking with Diffusion and Global OptimizationPoster11 citations
  281. NRDF: Neural Riemannian Distance Fields for Learning Articulated Pose PriorsHighlight11 citations
  282. Narrative Action Evaluation with Prompt-Guided Multimodal InteractionPoster11 citations
  283. NeRFCodec: Neural Feature Compression Meets Neural Radiance Fields for Memory-Efficient Scene RepresentationPoster11 citations
  284. Neural Underwater Scene RepresentationPoster11 citations
  285. OTE: Exploring Accurate Scene Text Recognition Using One TokenPoster11 citations
  286. Open-Set Domain Adaptation for Semantic SegmentationPoster11 citations
  287. Orchestrate Latent Expertise: Advancing Online Continual Learning with Multi-Level Supervision and Reverse Self-DistillationPoster11 citations
  288. PLACE: Adaptive Layout-Semantic Fusion for Semantic Image SynthesisHighlight11 citations
  289. PanoContext-Former: Panoramic Total Scene Understanding with a TransformerPoster11 citations
  290. Parameter Efficient Fine-tuning via Cross Block Orchestration for Segment Anything ModelPoster11 citations
  291. PerAda: Parameter-Efficient Federated Learning Personalization with Generalization GuaranteesPoster11 citations
  292. Robust Synthetic-to-Real Transfer for Stereo MatchingPoster11 citations
  293. SG-BEV: Satellite-Guided BEV Fusion for Cross-View Semantic SegmentationHighlight11 citations
  294. Self-Adaptive Reality-Guided Diffusion for Artifact-Free Super-ResolutionPoster11 citations
  295. Shadow-Enlightened Image OutpaintingPoster11 citations
  296. SignGraph: A Sign Sequence is Worth Graphs of NodesPoster11 citations
  297. Single-to-Dual-View Adaptation for Egocentric 3D Hand Pose EstimationPoster11 citations
  298. SketchINR: A First Look into Sketches as Implicit Neural RepresentationsPoster11 citations
  299. Spanning Training Progress: Temporal Dual-Depth Scoring (TDDS) for Enhanced Dataset PruningPoster11 citations
  300. SportsHHI: A Dataset for Human-Human Interaction Detection in Sports VideosPoster11 citations
  301. StyLitGAN: Image-Based Relighting via Latent ControlPoster11 citations
  302. T-VSL: Text-Guided Visual Sound Source Localization in MixturesPoster11 citations
  303. Taming Self-Training for Open-Vocabulary Object DetectionPoster11 citations
  304. Task-Driven Exploration: Decoupling and Inter-Task Feedback for Joint Moment Retrieval and Highlight DetectionPoster11 citations
  305. Text-to-Image Diffusion Models are Great Sketch-Photo MatchmakersPoster11 citations
  306. Towards Modern Image Manipulation Localization: A Large-Scale Dataset and Novel MethodsPoster11 citations
  307. Traceable Federated Continual LearningPoster11 citations
  308. Tyche: Stochastic In-Context Learning for Medical Image SegmentationHighlight11 citations
  309. URHand: Universal Relightable HandsPoster11 citations
  310. UV-IDM: Identity-Conditioned Latent Diffusion Model for Face UV-Texture GenerationPoster11 citations
  311. Uncertainty-aware Action Decoupling Transformer for Action AnticipationHighlight11 citations
  312. UniHuman: A Unified Model For Editing Human Images in the WildPoster11 citations
  313. Unified Entropy Optimization for Open-Set Test-Time AdaptationPoster11 citations
  314. Unlocking Pre-trained Image Backbones for Semantic Image SynthesisPoster11 citations
  315. Unraveling Instance Associations: A Closer Look for Audio-Visual SegmentationPoster11 citations
  316. Would Deep Generative Models Amplify Bias in Future Models?Poster11 citations
  317. A Call to Reflect on Evaluation Practices for Age Estimation: Comparative Analysis of the State-of-the-Art and a Unified BenchmarkPoster10 citations
  318. A Noisy Elephant in the Room: Is Your Out-of-Distribution Detector Robust to Label Noise?Poster10 citations
  319. AZ-NAS: Assembling Zero-Cost Proxies for Network Architecture SearchPoster10 citations
  320. Accept the Modality Gap: An Exploration in the Hyperbolic SpaceHighlight10 citations
  321. Active Prompt Learning in Vision Language ModelsPoster10 citations
  322. Adversarial Backdoor Attack by Naturalistic Data Poisoning on Trajectory Prediction in Autonomous DrivingPoster10 citations
  323. AlignMiF: Geometry-Aligned Multimodal Implicit Field for LiDAR-Camera Joint SynthesisHighlight10 citations
  324. An Empirical Study of the Generalization Ability of Lidar 3D Object Detectors to Unseen DomainsPoster10 citations
  325. Audio-Visual Segmentation via Unlabeled Frame ExploitationPoster10 citations
  326. BEVSpread: Spread Voxel Pooling for Bird's-Eye-View Representation in Vision-based Roadside 3D Object DetectionPoster10 citations
  327. Bayesian Diffusion Models for 3D Shape ReconstructionPoster10 citations
  328. Boosting Image Restoration via Priors from Pre-trained ModelsPoster10 citations
  329. Brain Decodes Deep NetsHighlight10 citations
  330. CA-Jaccard: Camera-aware Jaccard Distance for Person Re-identificationPoster10 citations
  331. CPGA: Coding Priors-Guided Aggregation Network for Compressed Video Quality EnhancementPoster10 citations
  332. CSTA: CNN-based Spatiotemporal Attention for Video SummarizationPoster10 citations
  333. CaDeT: a Causal Disentanglement Approach for Robust Trajectory Prediction in Autonomous DrivingPoster10 citations
  334. ChAda-ViT : Channel Adaptive Attention for Joint Representation Learning of Heterogeneous Microscopy ImagesPoster10 citations
  335. Color Shift Estimation-and-Correction for Image EnhancementPoster10 citations
  336. Commonsense Prototype for Outdoor Unsupervised 3D Object DetectionPoster10 citations
  337. Composed Video Retrieval via Enriched Context and Discriminative EmbeddingsPoster10 citations
  338. DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online RefinementPoster10 citations
  339. Desigen: A Pipeline for Controllable Design Template GenerationPoster10 citations
  340. Diffusion-driven GAN Inversion for Multi-Modal Face Image GenerationPoster10 citations
  341. Doubly Abductive Counterfactual Inference for Text-based Image EditingPoster10 citations
  342. Draw Step by Step: Reconstructing CAD Construction Sequences from Point Clouds via Multimodal Diffusion.Poster10 citations
  343. Driving-Video Dehazing with Non-Aligned Regularization for Safety AssistancePoster10 citations
  344. DyBluRF: Dynamic Neural Radiance Fields from Blurry Monocular VideoPoster10 citations
  345. Emergent Open-Vocabulary Semantic Segmentation from Off-the-shelf Vision-Language ModelsPoster10 citations
  346. En3D: An Enhanced Generative Model for Sculpting 3D Humans from 2D Synthetic DataPoster10 citations
  347. Enhancing Vision-Language Pre-training with Rich SupervisionsHighlight10 citations
  348. Exploring Efficient Asymmetric Blind-Spots for Self-Supervised Denoising in Real-World ScenariosPoster10 citations
  349. FedSOL: Stabilized Orthogonal Learning with Proximal Restrictions in Federated LearningPoster10 citations
  350. FocusMAE: Gallbladder Cancer Detection from Ultrasound Videos with Focused Masked AutoencodersPoster10 citations
  351. GEARS: Local Geometry-aware Hand-object Interaction SynthesisPoster10 citations
  352. Gaussian Shadow Casting for Neural CharactersPoster10 citations
  353. Geometry Transfer for Stylizing Radiance FieldsPoster10 citations
  354. GraCo: Granularity-Controllable Interactive SegmentationHighlight10 citations
  355. GreedyViG: Dynamic Axial Graph Construction for Efficient Vision GNNsPoster10 citations
  356. HumanRef: Single Image to 3D Human Generation via Reference-Guided DiffusionPoster10 citations
  357. In2SET: Intra-Inter Similarity Exploiting Transformer for Dual-Camera Compressive Hyperspectral ImagingPoster10 citations
  358. LAKE-RED: Camouflaged Images Generation by Latent Background Knowledge Retrieval-Augmented DiffusionPoster10 citations
  359. LASIL: Learner-Aware Supervised Imitation Learning For Long-term Microscopic Traffic SimulationPoster10 citations
  360. Label Propagation for Zero-shot Classification with Vision-Language ModelsPoster10 citations
  361. Language-guided Image Reflection SeparationPoster10 citations
  362. Learning Continuous 3D Words for Text-to-Image GenerationPoster10 citations
  363. Learning Instance-Aware Correspondences for Robust Multi-Instance Point Cloud Registration in Cluttered ScenesPoster10 citations
  364. Living Scenes: Multi-object Relocalization and Reconstruction in Changing 3D EnvironmentsHighlight10 citations
  365. Long-Tailed Anomaly Detection with Learnable Class NamesPoster10 citations
  366. MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image GenerationPoster10 citations
  367. MaskCLR: Attention-Guided Contrastive Learning for Robust Action Representation LearningPoster10 citations
  368. MatchU: Matching Unseen Objects for 6D Pose Estimation from RGB-D ImagesPoster10 citations
  369. Material Palette: Extraction of Materials from a Single ImagePoster10 citations
  370. Mixed-Precision Quantization for Federated Learning on Resource-Constrained Heterogeneous DevicesPoster10 citations
  371. Multi-Level Neural Scene Graphs for Dynamic Urban EnvironmentsPoster10 citations
  372. NEAT: Distilling 3D Wireframes from Neural Attraction FieldsPoster10 citations
  373. NeRF Analogies: Example-Based Visual Attribute Transfer for NeRFsPoster10 citations
  374. Neural Directional Encoding for Efficient and Accurate View-Dependent Appearance ModelingHighlight10 citations
  375. OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video RecognitionPoster10 citations
  376. One-Shot Structure-Aware Stylized Image SynthesisPoster10 citations
  377. PSDPM: Prototype-based Secondary Discriminative Pixels Mining for Weakly Supervised Semantic SegmentationPoster10 citations
  378. Part-aware Unified Representation of Language and Skeleton for Zero-shot Action RecognitionPoster10 citations
  379. Plug-and-Play Diffusion DistillationPoster10 citations
  380. PointInfinity: Resolution-Invariant Point Diffusion ModelsPoster10 citations
  381. RGBD Objects in the Wild: Scaling Real-World 3D Object Learning from RGB-D VideosPoster10 citations
  382. ReCoRe: Regularized Contrastive Representation Learning of World ModelPoster10 citations
  383. Referring Expression CountingHighlight10 citations
  384. SOAC: Spatio-Temporal Overlap-Aware Multi-Sensor Calibration using Neural Radiance FieldsPoster10 citations
  385. ScanFormer: Referring Expression Comprehension by Iteratively ScanningPoster10 citations
  386. SeaBird: Segmentation in Bird's View with Dice Loss Improves Monocular 3D Detection of Large ObjectsPoster10 citations
  387. Single-View Scene Point Cloud Human Grasp GenerationPoster10 citations
  388. Small Scale Data-Free Knowledge DistillationPoster10 citations
  389. SnAG: Scalable and Accurate Video GroundingPoster10 citations
  390. Spatio-Temporal Turbulence Mitigation: A Translational PerspectivePoster10 citations
  391. Spectral Meets Spatial: Harmonising 3D Shape Matching and InterpolationPoster10 citations
  392. TTA-EVF: Test-Time Adaptation for Event-based Video Frame Interpolation via Reliable Pixel and Sample EstimationPoster10 citations
  393. Tackling the Singularities at the Endpoints of Time Intervals in Diffusion ModelsHighlight10 citations
  394. Tailored Visions: Enhancing Text-to-Image Generation with Personalized Prompt RewritingPoster10 citations
  395. Targeted Representation Alignment for Open-World Semi-Supervised LearningPoster10 citations
  396. Test-Time Linear Out-of-Distribution DetectionPoster10 citations
  397. Text-Guided 3D Face Synthesis - From Generation to EditingPoster10 citations
  398. Towards 3D Vision with Low-Cost Single-Photon CamerasPoster10 citations
  399. Training Diffusion Models Towards Diverse Image Generation with Reinforcement LearningPoster10 citations
  400. UVEB: A Large-scale Benchmark and Baseline Towards Real-World Underwater Video EnhancementPoster10 citations
  401. UnionFormer: Unified-Learning Transformer with Multi-View Representation for Image Manipulation Detection and LocalizationPoster10 citations
  402. Unlocking the Potential of Prompt-Tuning in Bridging Generalized and Personalized Federated LearningPoster10 citations
  403. Unsupervised Blind Image Deblurring Based on Self-EnhancementPoster10 citations
  404. Video-Based Human Pose Regression via Decoupled Space-Time AggregationPoster10 citations
  405. VkD: Improving Knowledge Distillation using Orthogonal ProjectionsPoster10 citations
  406. What Do You See in Vehicle? Comprehensive Vision Solution for In-Vehicle Gaze EstimationPoster10 citations
  407. X-Adapter: Adding Universal Compatibility of Plugins for Upgraded Diffusion ModelPoster10 citations
  408. 360+x: A Panoptic Multi-modal Scene Understanding DatasetPoster9 citations
  409. A Unified Framework for Microscopy Defocus Deblur with Multi-Pyramid Transformer and Contrastive LearningPoster9 citations
  410. Align Before Adapt: Leveraging Entity-to-Region Alignments for Generalizable Video Action RecognitionPoster9 citations
  411. An N-Point Linear Solver for Line and Motion Estimation with Event CamerasPoster9 citations
  412. Anchor-based Robust Finetuning of Vision-Language ModelsPoster9 citations
  413. Asymmetric Masked Distillation for Pre-Training Small Foundation ModelsPoster9 citations
  414. AttriHuman-3D: Editable 3D Human Avatar Generation with Attribute Decomposition and IndexingPoster9 citations
  415. Attribute-Guided Pedestrian Retrieval: Bridging Person Re-ID with Internal Attribute VariabilityPoster9 citations
  416. Automatic Controllable Colorization via ImaginationPoster9 citations
  417. Back to 3D: Few-Shot 3D Keypoint Detection with Back-Projected 2D FeaturesPoster9 citations
  418. Batch Normalization Alleviates the Spectral Bias in Coordinate NetworksPoster9 citations
  419. Blind Image Quality Assessment Based on Geometric Order LearningPoster9 citations
  420. CDMAD: Class-Distribution-Mismatch-Aware Debiasing for Class-Imbalanced Semi-Supervised LearningPoster9 citations
  421. Carve3D: Improving Multi-view Reconstruction Consistency for Diffusion Models with RL FinetuningPoster9 citations
  422. Causal Mode Multiplexer: A Novel Framework for Unbiased Multispectral Pedestrian DetectionPoster9 citations
  423. Characteristics Matching Based Hash Codes Generation for Efficient Fine-grained Image RetrievalPoster9 citations
  424. Collaborating Foundation Models for Domain Generalized Semantic SegmentationPoster9 citations
  425. Condition-Aware Neural Network for Controlled Image GenerationPoster9 citations
  426. ConsistDreamer: 3D-Consistent 2D Diffusion for High-Fidelity Scene EditingPoster9 citations
  427. Cross-Domain Few-Shot Segmentation via Iterative Support-Query Correspondence MiningPoster9 citations
  428. Cyclic Learning for Binaural Audio Generation and LocalizationPoster9 citations
  429. DSL-FIQA: Assessing Facial Image Quality via Dual-Set Degradation Learning and Landmark-Guided TransformerPoster9 citations
  430. DaReNeRF: Direction-aware Representation for Dynamic ScenesPoster9 citations
  431. Data Valuation and Detections in Federated LearningPoster9 citations
  432. DeiT-LT: Distillation Strikes Back for Vision Transformer Training on Long-Tailed DatasetsPoster9 citations
  433. DemoCaricature: Democratising Caricature Generation with a Rough SketchPoster9 citations
  434. Detours for Navigating Instructional VideosHighlight9 citations
  435. Differentiable Information Bottleneck for Deterministic Multi-view ClusteringPoster9 citations
  436. Disentangled Prompt Representation for Domain GeneralizationPoster9 citations
  437. DreamComposer: Controllable 3D Object Generation via Multi-View ConditionsPoster9 citations
  438. DriveTrack: A Benchmark for Long-Range Point Tracking in Real-World VideosPoster9 citations
  439. Eclipse: Disambiguating Illumination and Materials using Unintended ShadowsPoster9 citations
  440. Efficiently Assemble Normalization Layers and Regularization for Federated Domain GeneralizationPoster9 citations
  441. Elite360D: Towards Efficient 360 Depth Estimation via Semantic- and Distance-Aware Bi-Projection FusionPoster9 citations
  442. EventEgo3D: 3D Human Motion Capture from Egocentric Event StreamsPoster9 citations
  443. Extend Your Own Correspondences: Unsupervised Distant Point Cloud Registration by Progressive Distance ExtensionPoster9 citations
  444. Few-shot Learner Parameterization by Diffusion Time-stepsPoster9 citations
  445. FineSports: A Multi-person Hierarchical Sports Video Dataset for Fine-grained Action UnderstandingPoster9 citations
  446. FlowTrack: Revisiting Optical Flow for Long-Range Dense TrackingPoster9 citations
  447. Fourier-basis Functions to Bridge Augmentation Gap: Rethinking Frequency Augmentation in Image ClassificationPoster9 citations
  448. Frozen Feature Augmentation for Few-Shot Image ClassificationPoster9 citations
  449. GenNBV: Generalizable Next-Best-View Policy for Active 3D ReconstructionPoster9 citations
  450. Generating Enhanced Negatives for Training Language-Based Object DetectorsPoster9 citations
  451. Generative Unlearning for Any IdentityPoster9 citations
  452. Grid Diffusion Models for Text-to-Video GenerationPoster9 citations
  453. HandBooster: Boosting 3D Hand-Mesh Reconstruction by Conditional Synthesis and Sampling of Hand-Object InteractionsPoster9 citations
  454. Holoported Characters: Real-time Free-viewpoint Rendering of Humans from Sparse RGB CamerasPoster9 citations
  455. How to Train Neural Field Representations: A Comprehensive Study and BenchmarkPoster9 citations
  456. Image-Text Co-Decomposition for Text-Supervised Semantic SegmentationPoster9 citations
  457. Improving Single Domain-Generalized Object Detection: A Focus on Diversification and AlignmentPoster9 citations
  458. InNeRF360: Text-Guided 3D-Consistent Object Inpainting on 360-degree Neural Radiance FieldsPoster9 citations
  459. Initialization Matters for Adversarial Transfer LearningPoster9 citations
  460. Instruct 4D-to-4D: Editing 4D Scenes as Pseudo-3D Scenes Using 2D DiffusionPoster9 citations
  461. Interactive3D: Create What You Want by Interactive 3D GenerationPoster9 citations
  462. KeyPoint Relative Position Encoding for Face RecognitionPoster9 citations
  463. LAN: Learning to Adapt Noise for Image DenoisingPoster9 citations
  464. LLM4SGG: Large Language Models for Weakly Supervised Scene Graph GenerationPoster9 citations
  465. Lane2Seq: Towards Unified Lane Detection via Sequence GenerationPoster9 citations
  466. LaneCPP: Continuous 3D Lane Detection using Physical PriorsPoster9 citations
  467. Latency Correction for Event-guided Deblurring and Frame InterpolationPoster9 citations
  468. Learning CNN on ViT: A Hybrid Model to Explicitly Class-specific Boundaries for Domain AdaptationPoster9 citations
  469. Learning Dynamic Tetrahedra for High-Quality Talking Head SynthesisPoster9 citations
  470. Learning Intra-view and Cross-view Geometric Knowledge for Stereo MatchingPoster9 citations
  471. Learning to Predict Activity Progress by Self-Supervised Video AlignmentPoster9 citations
  472. Loose Inertial Poser: Motion Capture with IMU-attached Loose-Wear JacketPoster9 citations
  473. Low-Rank Rescaled Vision Transformer Fine-Tuning: A Residual Design ApproachPoster9 citations
  474. MAPSeg: Unified Unsupervised Domain Adaptation for Heterogeneous Medical Image Segmentation Based on 3D Masked Autoencoding and Pseudo-LabelingPoster9 citations
  475. MART: Masked Affective RepresenTation Learning via Masked Temporal Distribution DistillationPoster9 citations
  476. Making Vision Transformers Truly Shift-EquivariantPoster9 citations
  477. MoST: Multi-Modality Scene Tokenization for Motion PredictionPoster9 citations
  478. Morphable Diffusion: 3D-Consistent Diffusion for Single-image Avatar CreationPoster9 citations
  479. Motion2VecSets: 4D Latent Vector Set Diffusion for Non-rigid Shape Reconstruction and TrackingPoster9 citations
  480. MultiPly: Reconstruction of Multiple People from Monocular Video in the WildPoster9 citations
  481. Multimodal Pathway: Improve Transformers with Irrelevant Data from Other ModalitiesPoster9 citations
  482. NViST: In the Wild New View Synthesis from a Single Image with TransformersPoster9 citations
  483. OHTA: One-shot Hand Avatar via Data-driven Implicit PriorsPoster9 citations
  484. Objects as Volumes: A Stochastic Geometry View of Opaque SolidsPoster9 citations
  485. On the Road to Portability: Compressing End-to-End Motion Planner for Autonomous DrivingPoster9 citations
  486. OpenStreetView-5M: The Many Roads to Global Visual GeolocationPoster9 citations
  487. ParamISP: Learned Forward and Inverse ISPs using Camera ParametersPoster9 citations
  488. Parameter Efficient Self-Supervised Geospatial Domain AdaptationPoster9 citations
  489. PrPSeg: Universal Proposition Learning for Panoramic Renal Pathology SegmentationPoster9 citations
  490. Predicated Diffusion: Predicate Logic-Based Attention Guidance for Text-to-Image Diffusion ModelsHighlight9 citations
  491. Pseudo Label Refinery for Unsupervised Domain Adaptation on Cross-dataset 3D Object DetectionPoster9 citations
  492. QN-Mixer: A Quasi-Newton MLP-Mixer Model for Sparse-View CT ReconstructionPoster9 citations
  493. Real-time 3D-aware Portrait Video RelightingHighlight9 citations
  494. Regressor-Segmenter Mutual Prompt Learning for Crowd CountingPoster9 citations
  495. SLICE: Stabilized LIME for Consistent Explanations for Image ClassificationHighlight9 citations
  496. SNIDA: Unlocking Few-Shot Object Detection with Non-linear Semantic Decoupling AugmentationPoster9 citations
  497. Segment Every Out-of-Distribution ObjectPoster9 citations
  498. Separating the "Chirp" from the "Chat": Self-supervised Visual Grounding of Sound and LanguagePoster9 citations
  499. SmartMask: Context Aware High-Fidelity Mask Generation for Fine-grained Object Insertion and Layout ControlPoster9 citations
  500. SpecNeRF: Gaussian Directional Encoding for Specular ReflectionsHighlight9 citations
  501. SpikeNeRF: Learning Neural Radiance Fields from Continuous Spike StreamPoster9 citations
  502. SyncMask: Synchronized Attentional Masking for Fashion-centric Vision-Language PretrainingPoster9 citations
  503. TIM: A Time Interval Machine for Audio-Visual Action RecognitionPoster9 citations
  504. TRINS: Towards Multimodal Language Models that Can ReadPoster9 citations
  505. TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion ModelsPoster9 citations
  506. TeMO: Towards Text-Driven 3D Stylization for Multi-Object MeshesPoster9 citations
  507. Temporally Consistent Unbalanced Optimal Transport for Unsupervised Action SegmentationPoster9 citations
  508. Text-Enhanced Data-free Approach for Federated Class-Incremental LearningPoster9 citations
  509. Text-guided Explorable Image Super-resolutionPoster9 citations
  510. Token Transformation Matters: Towards Faithful Post-hoc Explanation for Vision TransformerPoster9 citations
  511. Towards Effective Usage of Human-Centric Priors in Diffusion Models for Text-based Human Image GenerationPoster9 citations
  512. Training Like a Medical Resident: Context-Prior Learning Toward Universal Medical Image SegmentationPoster9 citations
  513. Unbiased Faster R-CNN for Single-source Domain Generalized Object DetectionHighlight9 citations
  514. Unsupervised Keypoints from Pretrained Diffusion ModelsHighlight9 citations
  515. VAREN: Very Accurate and Realistic Equine NetworkPoster9 citations
  516. VecFusion: Vector Font Generation with DiffusionHighlight9 citations
  517. Versatile Medical Image Segmentation Learned from Multi-Source Datasets via Model Self-DisambiguationPoster9 citations
  518. Visual Prompting for Generalized Few-shot Segmentation: A Multi-scale ApproachPoster9 citations
  519. Why Not Use Your Textbook? Knowledge-Enhanced Procedure Planning of Instructional VideosPoster9 citations
  520. 3D Neural Edge ReconstructionPoster8 citations
  521. 3D-SceneDreamer: Text-Driven 3D-Consistent Scene GenerationPoster8 citations
  522. A Physics-informed Low-rank Deep Neural Network for Blind and Universal Lens Aberration CorrectionPoster8 citations
  523. A Video is Worth 256 Bases: Spatial-Temporal Expectation-Maximization Inversion for Zero-Shot Video EditingPoster8 citations
  524. ANIM: Accurate Neural Implicit Model for Human Reconstruction from a single RGB-D ImagePoster8 citations
  525. Action Detection via an Image Diffusion ProcessPoster8 citations
  526. Adapting Short-Term Transformers for Action Detection in Untrimmed VideosPoster8 citations
  527. Adaptive VIO: Deep Visual-Inertial Odometry with Online Continual LearningPoster8 citations
  528. Attention-Propagation Network for Egocentric Heatmap to 3D Pose LiftingHighlight8 citations
  529. Beyond Average: Individualized Visual Scanpath PredictionPoster8 citations
  530. Bi-SSC: Geometric-Semantic Bidirectional Fusion for Camera-based 3D Semantic Scene CompletionPoster8 citations
  531. Bidirectional Autoregessive Diffusion Model for Dance GenerationPoster8 citations
  532. Building Vision-Language Models on Solid Foundations with Masked DistillationPoster8 citations
  533. CLIB-FIQA: Face Image Quality Assessment with Confidence CalibrationPoster8 citations
  534. CLIP-Driven Open-Vocabulary 3D Scene Graph Generation via Cross-Modality Contrastive LearningHighlight8 citations
  535. C^2RV: Cross-Regional and Cross-View Learning for Sparse-View CBCT ReconstructionPoster8 citations
  536. Clockwork Diffusion: Efficient Generation With Model-Step DistillationHighlight8 citations
  537. Collaborative Learning of Anomalies with Privacy (CLAP) for Unsupervised Video Anomaly Detection: A New BaselinePoster8 citations
  538. Complementing Event Streams and RGB Frames for Hand Mesh ReconstructionPoster8 citations
  539. Contrastive Learning for DeepFake Classification and Localization via Multi-Label RankingPoster8 citations
  540. CoralSCOP: Segment any COral Image on this PlanetHighlight8 citations
  541. CroSel: Cross Selection of Confident Pseudo Labels for Partial-Label LearningPoster8 citations
  542. CuVLER: Enhanced Unsupervised Object Discoveries through Exhaustive Self-Supervised TransformersPoster8 citations
  543. Curriculum Point Prompting for Weakly-Supervised Referring Image SegmentationPoster8 citations
  544. DIRECT-3D: Learning Direct Text-to-3D Generation on Massive Noisy 3D DataPoster8 citations
  545. DS-NeRV: Implicit Neural Video Representation with Decomposed Static and Dynamic CodesPoster8 citations
  546. Decentralized Directed Collaboration for Personalized Federated LearningPoster8 citations
  547. Decompose-and-Compose: A Compositional Approach to Mitigating Spurious CorrelationPoster8 citations
  548. DiSR-NeRF: Diffusion-Guided View-Consistent Super-Resolution NeRFPoster8 citations
  549. DiffSCI: Zero-Shot Snapshot Compressive Imaging via Iterative Spectral Diffusion ModelPoster8 citations
  550. Diffusion-based Blind Text Image Super-ResolutionPoster8 citations
  551. DiffusionMTL: Learning Multi-Task Denoising Diffusion Model from Partially Annotated DataPoster8 citations
  552. Distributionally Generative Augmentation for Fair Facial Attribute ClassificationPoster8 citations
  553. Dr. Bokeh: DiffeRentiable Occlusion-aware Bokeh RenderingPoster8 citations
  554. Dynamic Cues-Assisted Transformer for Robust Point Cloud RegistrationHighlight8 citations
  555. Efficient Meshflow and Optical Flow Estimation from Event CamerasPoster8 citations
  556. Efficient Vision-Language Pre-training by Cluster MaskingPoster8 citations
  557. Embracing Unimodal Aleatoric Uncertainty for Robust Multimodal FusionPoster8 citations
  558. Estimating Noisy Class Posterior with Part-level Labels for Noisy Label LearningPoster8 citations
  559. Fast Adaptation for Human Pose Estimation via Meta-OptimizationPoster8 citations
  560. FedSelect: Personalized Federated Learning with Customized Selection of Parameters for Fine-TuningPoster8 citations
  561. Federated Online Adaptation for Deep StereoPoster8 citations
  562. Finsler-Laplace-Beltrami Operators with Application to Shape AnalysisPoster8 citations
  563. FlashEval: Towards Fast and Accurate Evaluation of Text-to-image Diffusion Generative ModelsPoster8 citations
  564. GDA: Generalized Diffusion for Robust Test-time AdaptationPoster8 citations
  565. GPLD3D: Latent Diffusion of 3D Shape Generative Models by Enforcing Geometric and Physical PriorsPoster8 citations
  566. GSNeRF: Generalizable Semantic Neural Radiance Fields with Enhanced 3D Scene UnderstandingPoster8 citations
  567. G^3-LQ: Marrying Hyperbolic Alignment with Explicit Semantic-Geometric Modeling for 3D Visual GroundingPoster8 citations
  568. GenH2R: Learning Generalizable Human-to-Robot Handover via Scalable Simulation Demonstration and ImitationPoster8 citations
  569. GeneAvatar: Generic Expression-Aware Volumetric Head Avatar Editing from a Single ImagePoster8 citations
  570. HiLo: Detailed and Robust 3D Clothed Human Reconstruction with High-and Low-Frequency Information of Parametric ModelsPoster8 citations
  571. HiPose: Hierarchical Binary Surface Encoding and Correspondence Pruning for RGB-D 6DoF Object Pose EstimationPoster8 citations
  572. Holistic Features are almost Sufficient for Text-to-Video RetrievalPoster8 citations
  573. ID-Blau: Image Deblurring by Implicit Diffusion-based reBLurring AUgmentationPoster8 citations
  574. Instance-Aware Group Quantization for Vision TransformersPoster8 citations
  575. Instance-level Expert Knowledge and Aggregate Discriminative Attention for Radiology Report GenerationPoster8 citations
  576. KD-DETR: Knowledge Distillation for Detection Transformer with Consistent Distillation Points SamplingPoster8 citations
  577. Kandinsky Conformal Prediction: Efficient Calibration of Image Segmentation AlgorithmsPoster8 citations
  578. Learn to Rectify the Bias of CLIP for Unsupervised Semantic SegmentationPoster8 citations
  579. Learned Lossless Image Compression based on Bit Plane SlicingPoster8 citations
  580. Learning Degradation-Independent Representations for Camera ISP PipelinesPoster8 citations
  581. Learning Inclusion Matching for Animation Paint Bucket ColorizationPoster8 citations
  582. Learning from Observer Gaze: Zero-Shot Attention Prediction Oriented by Human-Object Interaction RecognitionPoster8 citations
  583. LiDAR-Net: A Real-scanned 3D Point Cloud Dataset for Indoor ScenesPoster8 citations
  584. Linguistic-Aware Patch Slimming Framework for Fine-grained Cross-Modal AlignmentPoster8 citations
  585. LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language ModelHighlight8 citations
  586. Low-Resource Vision Challenges for Foundation ModelsPoster8 citations
  587. MRFP: Learning Generalizable Semantic Segmentation from Sim-2-Real with Multi-Resolution Feature PerturbationPoster8 citations
  588. MV-Adapter: Multimodal Video Transfer Learning for Video Text RetrievalPoster8 citations
  589. MaGGIe: Masked Guided Gradual Human Instance MattingPoster8 citations
  590. Make Me a BNN: A Simple Strategy for Estimating Bayesian Uncertainty from Pre-trained ModelsPoster8 citations
  591. MedBN: Robust Test-Time Adaptation against Malicious Test SamplesPoster8 citations
  592. MicroDiffusion: Implicit Representation-Guided Diffusion for 3D Reconstruction from Limited 2D Microscopy ProjectionsPoster8 citations
  593. MoST: Motion Style Transformer Between Diverse Action ContentsPoster8 citations
  594. Modeling Collaborator: Enabling Subjective Vision Classification With Minimal Human Effort via LLM Tool-UsePoster8 citations
  595. Multiscale Vision Transformers Meet Bipartite Matching for Efficient Single-stage Action LocalizationPoster8 citations
  596. NAPGuard: Towards Detecting Naturalistic Adversarial PatchesPoster8 citations
  597. NTO3D: Neural Target Object 3D Reconstruction with Segment AnythingPoster8 citations
  598. NeISF: Neural Incident Stokes Field for Geometry and Material EstimationHighlight8 citations
  599. NeRF-HuGS: Improved Neural Radiance Fields in Non-static Scenes Using Heuristics-Guided SegmentationPoster8 citations
  600. Neural Implicit Morphing of Face ImagesPoster8 citations
  601. OVER-NAV: Elevating Iterative Vision-and-Language Navigation with Open-Vocabulary Detection and StructurEd RepresentationPoster8 citations
  602. Object Pose Estimation via the Aggregation of Diffusion FeaturesHighlight8 citations
  603. On Scaling Up a Multilingual Vision and Language ModelPoster8 citations
  604. One-Class Face Anti-spoofing via Spoof Cue Map-Guided Feature LearningPoster8 citations
  605. Open-Vocabulary Object 6D Pose EstimationHighlight8 citations
  606. Open-World Semantic Segmentation Including Class SimilarityPoster8 citations
  607. OrthCaps: An Orthogonal CapsNet with Sparse Attention Routing and PruningPoster8 citations
  608. PICTURE: PhotorealistIC virtual Try-on from UnconstRained dEsignsPoster8 citations
  609. PhysPT: Physics-aware Pretrained Transformer for Estimating Human Dynamics from Monocular VideosPoster8 citations
  610. Puff-Net: Efficient Style Transfer with Pure Content and Style Feature Fusion NetworkPoster8 citations
  611. RELI11D: A Comprehensive Multimodal Human Motion Dataset and MethodPoster8 citations
  612. Real-Time Simulated Avatar from Head-Mounted SensorsHighlight8 citations
  613. Representing Part-Whole Hierarchies in Foundation Models by Learning Localizability Composability and Decomposability from Anatomy via Self SupervisionPoster8 citations
  614. Rethinking Multi-view Representation Learning via Distilled DisentanglingPoster8 citations
  615. Rethinking the Evaluation Protocol of Domain GeneralizationPoster8 citations
  616. Retraining-Free Model Quantization via One-Shot Weight-Coupling LearningPoster8 citations
  617. SEAS: ShapE-Aligned Supervision for Person Re-IdentificationPoster8 citations
  618. SI-MIL: Taming Deep MIL for Self-Interpretability in Gigapixel HistopathologyPoster8 citations
  619. SIGNeRF: Scene Integrated Generation for Neural Radiance FieldsPoster8 citations
  620. Scalable 3D Registration via Truncated Entry-wise Absolute ResidualsPoster8 citations
  621. SeMoLi: What Moves Together Belongs TogetherPoster8 citations
  622. Self-Training Large Language Models for Improved Visual Program Synthesis With Visual ReinforcementPoster8 citations
  623. Solving the Catastrophic Forgetting Problem in Generalized Category DiscoveryPoster8 citations
  624. SoundingActions: Learning How Actions Sound from Narrated Egocentric VideosPoster8 citations
  625. Steerers: A Framework for Rotation Equivariant Keypoint DescriptorsPoster8 citations
  626. Supervised Anomaly Detection for Complex Industrial ImagesPoster8 citations
  627. Systematic Comparison of Semi-supervised and Self-supervised Learning for Medical Image ClassificationPoster8 citations
  628. TetraSphere: A Neural Descriptor for O(3)-Invariant Point Cloud AnalysisPoster8 citations
  629. The Audio-Visual Conversational Graph: From an Egocentric-Exocentric PerspectivePoster8 citations
  630. The STVchrono Dataset: Towards Continuous Change Recognition in TimePoster8 citations
  631. Towards Calibrated Multi-label Deep Neural NetworksPoster8 citations
  632. Towards Real-World HDR Video Reconstruction: A Large-Scale Benchmark Dataset and A Two-Stage Alignment NetworkPoster8 citations
  633. Understanding and Improving Source-free Domain Adaptation from a Theoretical PerspectivePoster8 citations
  634. VTQA: Visual Text Question Answering via Entity Alignment and Cross-Media ReasoningPoster8 citations
  635. Visual Concept Connectome (VCC): Open World Concept Discovery and their Interlayer Connections in Deep ModelsHighlight8 citations
  636. WWW: A Unified Framework for Explaining What Where and Why of Neural Networks by Interpretation of Neuron ConceptsPoster8 citations
  637. Weakly-Supervised Emotion Transition Learning for Diverse 3D Co-speech Gesture GenerationPoster8 citations
  638. What When and Where? Self-Supervised Spatio-Temporal Grounding in Untrimmed Multi-Action Videos from Narrated InstructionsPoster8 citations
  639. What You See is What You GAN: Rendering Every Pixel for High-Fidelity Geometry in 3D GANsPoster8 citations
  640. You Only Need Less Attention at Each Stage in Vision TransformersPoster8 citations
  641. eTraM: Event-based Traffic Monitoring DatasetHighlight8 citations
  642. 360Loc: A Dataset and Benchmark for Omnidirectional Visual Localization with Cross-device QueriesPoster7 citations
  643. 3D Building Reconstruction from Monocular Remote Sensing Images with Multi-level SupervisionsPoster7 citations
  644. AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech RepresentationHighlight7 citations
  645. Adapt Before Comparison: A New Perspective on Cross-Domain Few-Shot SegmentationPoster7 citations
  646. Adapters Strike BackPoster7 citations
  647. Adaptive Slot Attention: Object Discovery with Dynamic Slot NumberPoster7 citations
  648. Adversarial Score Distillation: When score distillation meets GANPoster7 citations
  649. AssistGUI: Task-Oriented PC Graphical User Interface AutomationPoster7 citations
  650. BEM: Balanced and Entropy-based Mix for Long-Tailed Semi-Supervised LearningPoster7 citations
  651. Backpropagation-free Network for 3D Test-time AdaptationPoster7 citations
  652. BiPer: Binary Neural Networks using a Periodic FunctionPoster7 citations
  653. Binarized Low-light Raw Video EnhancementPoster7 citations
  654. Byzantine-robust Decentralized Federated Learning via Dual-domain Clustering and Trust BootstrappingPoster7 citations
  655. CPP-Net: Embracing Multi-Scale Feature Fusion into Deep Unfolding CP-PPA Network for Compressive SensingPoster7 citations
  656. Closely Interactive Human Reconstruction with Proxemics and Physics-Guided AdaptionPoster7 citations
  657. Countering Personalized Text-to-Image Generation with Influence WatermarksPoster7 citations
  658. D3T: Distinctive Dual-Domain Teacher Zigzagging Across RGB-Thermal Gap for Domain-Adaptive Object DetectionPoster7 citations
  659. DGC-GNN: Leveraging Geometry and Color Cues for Visual Descriptor-Free 2D-3D MatchingPoster7 citations
  660. DanceCamera3D: 3D Camera Movement Synthesis with Music and DancePoster7 citations
  661. Decoupled Pseudo-labeling for Semi-Supervised Monocular 3D Object DetectionPoster7 citations
  662. Defense Against Adversarial Attacks on No-Reference Image Quality Models with Gradient Norm RegularizationPoster7 citations
  663. Discover and Mitigate Multiple Biased Subgroups in Image ClassifiersPoster7 citations
  664. Domain Gap Embeddings for Generative Dataset AugmentationPoster7 citations
  665. Domain-Rectifying Adapter for Cross-Domain Few-Shot SegmentationPoster7 citations
  666. Effective Video Mirror Detection with Inconsistent Motion CuesPoster7 citations
  667. Efficient Hyperparameter Optimization with Adaptive Fidelity IdentificationPoster7 citations
  668. EfficientDreamer: High-Fidelity and Robust 3D Creation via Orthogonal-view Diffusion PriorsPoster7 citations
  669. Epistemic Uncertainty Quantification For Pre-Trained Neural NetworksPoster7 citations
  670. Explaining CLIP's Performance Disparities on Data from Blind/Low Vision UsersPoster7 citations
  671. Exploring the Transferability of Visual Prompting for Multimodal Large Language ModelsHighlight7 citations
  672. F3Loc: Fusion and Filtering for Floorplan LocalizationHighlight7 citations
  673. FSRT: Facial Scene Representation Transformer for Face Reenactment from Factorized Appearance Head-pose and Facial Expression FeaturesPoster7 citations
  674. Fair-VPT: Fair Visual Prompt Tuning for Image ClassificationPoster7 citations
  675. FedUV: Uniformity and Variance for Heterogeneous Federated LearningPoster7 citations
  676. Forecasting of 3D Whole-body Human Poses with Grasping ObjectsPoster7 citations
  677. Fun with Flags: Robust Principal Directions via Flag ManifoldsPoster7 citations
  678. GAFusion: Adaptive Fusing LiDAR and Camera with Multiple Guidance for 3D Object DetectionPoster7 citations
  679. GALA: Generating Animatable Layered Assets from a Single ScanPoster7 citations
  680. Generative 3D Part Assembly via Part-Whole-Hierarchy Message PassingPoster7 citations
  681. GeoAuxNet: Towards Universal 3D Representation Learning for Multi-sensor Point CloudsPoster7 citations
  682. Global Latent Neural RenderingPoster7 citations
  683. GoodSAM: Bridging Domain and Capacity Gaps via Segment Anything Model for Distortion-aware Panoramic Semantic SegmentationPoster7 citations
  684. HHMR: Holistic Hand Mesh Recovery by Enhancing the Multimodal Controllability of Graph Diffusion ModelsHighlight7 citations
  685. HMD-Poser: On-Device Real-time Human Motion Tracking from Scalable Sparse ObservationsPoster7 citations
  686. HumMUSS: Human Motion Understanding using State Space ModelsPoster7 citations
  687. Hyperbolic Anomaly DetectionPoster7 citations
  688. I'M HOI: Inertia-aware Monocular Capture of 3D Human-Object InteractionsPoster7 citations
  689. IQ-VFI: Implicit Quadratic Motion Estimation for Video Frame InterpolationPoster7 citations
  690. Improving Out-of-Distribution Generalization in Graphs via Hierarchical Semantic EnvironmentsPoster7 citations
  691. Inverse Rendering of Glossy Objects via the Neural Plenoptic Function and Radiance FieldsPoster7 citations
  692. Know Your Neighbors: Improving Single-View Reconstruction via Spatial Vision-Language ReasoningPoster7 citations
  693. L0-Sampler: An L0 Model Guided Volume Sampling for NeRFPoster7 citations
  694. LAFS: Landmark-based Facial Self-supervised Learning for Face RecognitionPoster7 citations
  695. LTM: Lightweight Textured Mesh Extraction and Refinement of Large Unbounded Scenes for Efficient Storage and Real-time RenderingPoster7 citations
  696. Language-driven Object Fusion into Neural Radiance Fields with Pose-Conditioned Dataset UpdatesPoster7 citations
  697. Large Language Models are Good Prompt Learners for Low-Shot Image ClassificationPoster7 citations
  698. Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-ResolutionPoster7 citations
  699. Leveraging Predicate and Triplet Learning for Scene Graph GenerationPoster7 citations
  700. LiSA: LiDAR Localization with Semantic AwarenessHighlight7 citations
  701. Logarithmic Lenses: Exploring Log RGB Data for Image ClassificationPoster7 citations
  702. MCNet: Rethinking the Core Ingredients for Accurate and Efficient Homography EstimationPoster7 citations
  703. MRC-Net: 6-DoF Pose Estimation with MultiScale Residual CorrelationPoster7 citations
  704. MS-MANO: Enabling Hand Pose Tracking with Biomechanical ConstraintsPoster7 citations
  705. Masked and Shuffled Blind Spot Denoising for Real-World ImagesPoster7 citations
  706. Misalignment-Robust Frequency Distribution Loss for Image TransformationPoster7 citations
  707. Modeling Multimodal Social Interactions: New Challenges and Baselines with Densely Aligned RepresentationsPoster7 citations
  708. Move Anything with Layered Scene DiffusionPoster7 citations
  709. Multi-Object Tracking in the DarkPoster7 citations
  710. Multi-agent Long-term 3D Human Pose Forecasting via Interaction-aware Trajectory ConditioningHighlight7 citations
  711. Naturally Supervised 3D Visual Grounding with Language-Regularized Concept LearnersPoster7 citations
  712. NeRSP: Neural 3D Reconstruction for Reflective Objects with Sparse Polarized ImagesPoster7 citations
  713. Neural Point Cloud Diffusion for Disentangled 3D Shape and Appearance GenerationPoster7 citations
  714. Novel Class Discovery for Ultra-Fine-Grained Visual CategorizationHighlight7 citations
  715. ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and SpottingPoster7 citations
  716. OmniMotionGPT: Animal Motion Generation with Limited DataPoster7 citations
  717. On Train-Test Class Overlap and Detection for Image RetrievalPoster7 citations
  718. On the Estimation of Image-matching Uncertainty in Visual Place RecognitionHighlight7 citations
  719. PAD: Patch-Agnostic Defense against Adversarial Patch AttacksPoster7 citations
  720. PH-Net: Semi-Supervised Breast Lesion Segmentation via Patch-wise HardnessPoster7 citations
  721. Partial-to-Partial Shape Matching with Geometric ConsistencyPoster7 citations
  722. Personalized Residuals for Concept-Driven Text-to-Image GenerationPoster7 citations
  723. Pose Adapted Shape Learning for Large-Pose Face ReenactmentPoster7 citations
  724. Privacy-Preserving Optics for Enhancing Protection in Face De-IdentificationPoster7 citations
  725. ProMotion: Prototypes As Motion LearnersPoster7 citations
  726. QDFormer: Towards Robust Audiovisual Segmentation in Complex Environments with Quantization-based Semantic DecompositionPoster7 citations
  727. RILA: Reflective and Imaginative Language Agent for Zero-Shot Semantic Audio-Visual NavigationPoster7 citations
  728. RNb-NeuS: Reflectance and Normal-based Multi-View 3D ReconstructionPoster7 citations
  729. RadSimReal: Bridging the Gap Between Synthetic and Real Data in Radar Object Detection With SimulationPoster7 citations
  730. Region-Based Representations RevisitedPoster7 citations
  731. Revisiting Spatial-Frequency Information Integration from a Hierarchical Perspective for Panchromatic and Multi-Spectral Image FusionPoster7 citations
  732. Robust Image Denoising through Adversarial Frequency MixupPoster7 citations
  733. Rotation-Agnostic Image Representation Learning for Digital PathologyPoster7 citations
  734. SAOR: Single-View Articulated Object ReconstructionPoster7 citations
  735. Sculpting Holistic 3D Representation in Contrastive Language-Image-3D Pre-trainingPoster7 citations
  736. Self-Supervised Multi-Object Tracking with Path ConsistencyHighlight7 citations
  737. Single Mesh Diffusion Models with Field Latents for Texture GenerationPoster7 citations
  738. Slice3D: Multi-Slice Occlusion-Revealing Single View 3D ReconstructionPoster7 citations
  739. Spectrum AUC Difference (SAUCD): Human-aligned 3D Shape EvaluationPoster7 citations
  740. SpiderMatch: 3D Shape Matching with Global Optimality and Geometric ConsistencyPoster7 citations
  741. StraightPCF: Straight Point Cloud FilteringPoster7 citations
  742. SurMo: Surface-based 4D Motion Modeling for Dynamic Human RenderingPoster7 citations
  743. TE-TAD: Towards Full End-to-End Temporal Action Detection via Time-Aligned Coordinate ExpressionPoster7 citations
  744. TIGER: Time-Varying Denoising Model for 3D Point Cloud Generation with Diffusion ProcessPoster7 citations
  745. Task-Aware Encoder Control for Deep Video CompressionPoster7 citations
  746. Test-Time Zero-Shot Temporal Action LocalizationPoster7 citations
  747. The Devil is in the Details: StyleFeatureEditor for Detail-Rich StyleGAN Inversion and High Quality Image EditingPoster7 citations
  748. Turb-Seg-Res: A Segment-then-Restore Pipeline for Dynamic Videos with Atmospheric TurbulencePoster7 citations
  749. UFC-Net: Unrolling Fixed-point Continuous Network for Deep Compressive SensingPoster7 citations
  750. Unsigned Orthogonal Distance Fields: An Accurate Neural Implicit Representation for Diverse 3D ShapesPoster7 citations
  751. Weakly Supervised Monocular 3D Detection with a Single-View ImagePoster7 citations
  752. Weakly Supervised Point Cloud Semantic Segmentation via Artificial OraclePoster7 citations
  753. 1-Lipschitz Layers Compared: Memory Speed and Certifiable RobustnessPoster6 citations
  754. 3D LiDAR Mapping in Dynamic Environments using a 4D Implicit Neural RepresentationPoster6 citations
  755. 3D Multi-frame Fusion for Video StabilizationPoster6 citations
  756. A General and Efficient Training for Transformer via Token ExpansionPoster6 citations
  757. A Generative Approach for Wikipedia-Scale Visual Entity RecognitionPoster6 citations
  758. A Study of Dropout-Induced Modality Bias on Robustness to Missing Video Frames for Audio-Visual Speech RecognitionPoster6 citations
  759. ALGM: Adaptive Local-then-Global Token Merging for Efficient Semantic Segmentation with Plain Vision TransformersPoster6 citations
  760. Action-slot: Visual Action-centric Representations for Multi-label Atomic Activity Recognition in Traffic ScenesPoster6 citations
  761. AdaBM: On-the-Fly Adaptive Bit Mapping for Image Super-ResolutionPoster6 citations
  762. Adaptive Hyper-graph Aggregation for Modality-Agnostic Federated LearningPoster6 citations
  763. Affine Equivariant Networks Based on Differential InvariantsPoster6 citations
  764. Attentive Illumination Decomposition Model for Multi-Illuminant White BalancingPoster6 citations
  765. Backdoor Defense via Test-Time Detecting and RepairingPoster6 citations
  766. Benchmarking Implicit Neural Representation and Geometric Rendering in Real-Time RGB-D SLAMPoster6 citations
  767. Beyond Textual Constraints: Learning Novel Diffusion Conditions with Fewer ExamplesPoster6 citations
  768. Bilateral Adaptation for Human-Object Interaction Detection with Occlusion-RobustnessPoster6 citations
  769. Blur2Blur: Blur Conversion for Unsupervised Image Deblurring on Unknown DomainsPoster6 citations
  770. Boosting Spike Camera Image Reconstruction from a Perspective of Dealing with Spike FluctuationsPoster6 citations
  771. Bring Event into RGB and LiDAR: Hierarchical Visual-Motion Fusion for Scene FlowPoster6 citations
  772. CADTalk: An Algorithm and Benchmark for Semantic Commenting of CAD ProgramsHighlight6 citations
  773. CDFormer: When Degradation Prediction Embraces Diffusion Model for Blind Image Super-ResolutionPoster6 citations
  774. CGI-DM: Digital Copyright Authentication for Diffusion Models via Contrasting Gradient InversionPoster6 citations
  775. CHAIN: Enhancing Generalization in Data-Efficient GANs via lipsCHitz continuity constrAIned NormalizationPoster6 citations
  776. CORES: Convolutional Response-based Score for Out-of-distribution DetectionPoster6 citations
  777. CVT-xRF: Contrastive In-Voxel Transformer for 3D Consistent Radiance Fields from Sparse InputsPoster6 citations
  778. Cinematic Behavior Transfer via NeRF-based Differentiable FilmingPoster6 citations
  779. Classes Are Not Equal: An Empirical Study on Image Recognition FairnessPoster6 citations
  780. CoG-DQA: Chain-of-Guiding Learning with Large Language Models for Diagram Question AnsweringPoster6 citations
  781. ColorPCR: Color Point Cloud Registration with Multi-Stage Geometric-Color FusionPoster6 citations
  782. ConTex-Human: Free-View Rendering of Human from a Single Image with Texture-Consistent SynthesisPoster6 citations
  783. Constrained Layout Generation with Factor GraphsPoster6 citations
  784. Continual Segmentation with Disentangled Objectness Learning and Class RecognitionPoster6 citations
  785. Correcting Diffusion Generation through ResamplingHighlight6 citations
  786. DART: Implicit Doppler Tomography for Radar Novel View SynthesisPoster6 citations
  787. DPHMs: Diffusion Parametric Head Models for Depth-based TrackingPoster6 citations
  788. DREAM: Diffusion Rectification and Estimation-Adaptive ModelsPoster6 citations
  789. DSGG: Dense Relation Transformer for an End-to-end Scene Graph GenerationPoster6 citations
  790. Dancing with Still Images: Video Distillation via Static-Dynamic DisentanglementPoster6 citations
  791. De-confounded Data-free Knowledge Distillation for Handling Distribution ShiftsPoster6 citations
  792. Depth Prompting for Sensor-Agnostic Depth EstimationPoster6 citations
  793. DiVa-360: The Dynamic Visual Dataset for Immersive Neural FieldsHighlight6 citations
  794. DiffSal: Joint Audio and Video Learning for Diffusion Saliency PredictionPoster6 citations
  795. Diffusion-ES: Gradient-free Planning with Diffusion for Autonomous and Instruction-guided DrivingPoster6 citations
  796. Dual Prior Unfolding for Snapshot Compressive ImagingPoster6 citations
  797. Dynamic Policy-Driven Adaptive Multi-Instance Learning for Whole Slide Image ClassificationHighlight6 citations
  798. ERMVP: Communication-Efficient and Collaboration-Robust Multi-Vehicle Perception in Challenging EnvironmentsPoster6 citations
  799. EasyDrag: Efficient Point-based Manipulation on Diffusion ModelsPoster6 citations
  800. Enhancing 3D Object Detection with 2D Detection-Guided Query AnchorsPoster6 citations
  801. Evidential Active Recognition: Intelligent and Prudent Open-World Embodied PerceptionPoster6 citations
  802. Exploring Orthogonality in Open World Object DetectionPoster6 citations
  803. Exploring Region-Word Alignment in Built-in Detector for Open-Vocabulary Object DetectionPoster6 citations
  804. FLHetBench: Benchmarking Device and State Heterogeneity in Federated LearningPoster6 citations
  805. FairDeDup: Detecting and Mitigating Vision-Language Fairness Disparities in Semantic Dataset DeduplicationPoster6 citations
  806. FedHCA2: Towards Hetero-Client Federated Multi-Task LearningPoster6 citations
  807. FedMef: Towards Memory-efficient Federated Dynamic PruningPoster6 citations
  808. Flattening the Parent Bias: Hierarchical Semantic Segmentation in the Poincare BallPoster6 citations
  809. Focus on Hiders: Exploring Hidden Threats for Enhancing Adversarial TrainingPoster6 citations
  810. Functional DiffusionPoster6 citations
  811. General Point Model Pretraining with Autoencoding and AutoregressivePoster6 citations
  812. Generalizing 6-DoF Grasp Detection via Domain Prior KnowledgePoster6 citations
  813. Grounding and Enhancing Grid-based Models for Neural FieldsPoster6 citations
  814. Groupwise Query Specialization and Quality-Aware Multi-Assignment for Transformer-based Visual Relationship DetectionPoster6 citations
  815. Guess The Unseen: Dynamic 3D Scene Reconstruction from Partial 2D GlimpsesPoster6 citations
  816. HoloVIC: Large-scale Dataset and Benchmark for Multi-Sensor Holographic Intersection and Vehicle-Infrastructure CooperativePoster6 citations
  817. Hyperbolic Learning with Synthetic Captions for Open-World DetectionPoster6 citations
  818. Image Neural Field Diffusion ModelsHighlight6 citations
  819. Improving Bird's Eye View Semantic Segmentation by Task DecompositionPoster6 citations
  820. Improving Transferable Targeted Adversarial Attacks with Model Self-EnhancementPoster6 citations
  821. Instance-aware Exploration-Verification-Exploitation for Instance ImageGoal NavigationPoster6 citations
  822. Investigating Compositional Challenges in Vision-Language Models for Visual GroundingHighlight6 citations
  823. Joint2Human: High-Quality 3D Human Generation via Compact Spherical Embedding of 3D JointsPoster6 citations
  824. Learning Spatial Features from Audio-Visual Correspondence in Egocentric VideosPoster6 citations
  825. Learning to Segment Referred Objects from Narrated Egocentric VideosPoster6 citations
  826. Lift3D: Zero-Shot Lifting of Any 2D Vision Model to 3DPoster6 citations
  827. Look-Up Table Compression for Efficient Image RestorationHighlight6 citations
  828. MCPNet: An Interpretable Classifier via Multi-Level Concept PrototypesPoster6 citations
  829. MR-VNet: Media Restoration using Volterra NetworksPoster6 citations
  830. Make-It-Vivid: Dressing Your Animatable Biped Cartoon Characters from TextPoster6 citations
  831. Makeup Prior Models for 3D Facial Makeup Estimation and ApplicationsPoster6 citations
  832. Making Visual Sense of Oracle Bones for You and MePoster6 citations
  833. Mitigating Noisy Correspondence by Geometrical Structure Consistency LearningPoster6 citations
  834. Modality-Collaborative Test-Time Adaptation for Action RecognitionPoster6 citations
  835. Multiagent Multitraversal Multimodal Self-Driving: Open MARS DatasetPoster6 citations
  836. Multimodal Sense-Informed Forecasting of 3D Human MotionsPoster6 citations
  837. NECA: Neural Customizable Human AvatarPoster6 citations
  838. NIVeL: Neural Implicit Vector Layers for Text-to-Vector GenerationPoster6 citations
  839. Navigate Beyond Shortcuts: Debiased Learning Through the Lens of Neural CollapseHighlight6 citations
  840. NeRF Director: Revisiting View Selection in Neural Volume RenderingPoster6 citations
  841. Neural LineagePoster6 citations
  842. ODIN: A Single Model for 2D and 3D SegmentationHighlight6 citations
  843. Object Recognition as Next Token PredictionHighlight6 citations
  844. Once for Both: Single Stage of Importance and Sparsity Search for Vision Transformer CompressionPoster6 citations
  845. PDF: A Probability-Driven Framework for Open World 3D Point Cloud Semantic SegmentationPoster6 citations
  846. PELA: Learning Parameter-Efficient Models with Low-Rank ApproximationPoster6 citations
  847. PFStorer: Personalized Face Restoration and Super-ResolutionPoster6 citations
  848. PKU-DyMVHumans: A Multi-View Video Benchmark for High-Fidelity Dynamic Human ModelingPoster6 citations
  849. POPDG: Popular 3D Dance Generation with PopDanceSetPoster6 citations
  850. PairAug: What Can Augmented Image-Text Pairs Do for Radiology?Poster6 citations
  851. PixelRNN: In-pixel Recurrent Neural Networks for End-to-end-optimized Perception with Neural SensorsPoster6 citations
  852. PlatoNeRF: 3D Reconstruction in Plato's Cave via Single-View Two-Bounce LidarPoster6 citations
  853. R-Cyclic Diffuser: Reductive and Cyclic Latent Diffusion for 3D Clothed Human DigitalizationPoster6 citations
  854. Realigning Confidence with Temporal Saliency Information for Point-Level Weakly-Supervised Temporal Action LocalizationPoster6 citations
  855. Relation Rectification in Diffusion ModelPoster6 citations
  856. Resource-Efficient Transformer Pruning for Finetuning of Large ModelsPoster6 citations
  857. Revisiting Sampson Approximations for Geometric Estimation ProblemsPoster6 citations
  858. RoDLA: Benchmarking the Robustness of Document Layout Analysis ModelsPoster6 citations
  859. Robust Noisy Correspondence Learning with Equivariant Similarity ConsistencyPoster6 citations
  860. SANeRF-HQ: Segment Anything for NeRF in High QualityPoster6 citations
  861. SD2Event:Self-supervised Learning of Dynamic Detectors and Contextual Descriptors for Event CamerasPoster6 citations
  862. SHINOBI: Shape and Illumination using Neural Object Decomposition via BRDF Optimization In-the-wildPoster6 citations
  863. Seeing Unseen: Discover Novel Biomedical Concepts via Geometry-Constrained Probabilistic ModelingPoster6 citations
  864. Selectively Informative Description can Reduce Undesired Embedding Entanglements in Text-to-Image PersonalizationPoster6 citations
  865. Sparse Views Near Light: A Practical Paradigm for Uncalibrated Point-light Photometric StereoPoster6 citations
  866. Split to Merge: Unifying Separated Modalities for Unsupervised Domain AdaptationPoster6 citations
  867. SuperNormal: Neural Surface Reconstruction via Multi-View Normal IntegrationPoster6 citations
  868. TASeg: Temporal Aggregation Network for LiDAR Semantic SegmentationPoster6 citations
  869. TULIP: Transformer for Upsampling of LiDAR Point CloudsPoster6 citations
  870. TexTile: A Differentiable Metric for Texture TileabilityPoster6 citations
  871. Towards Backward-Compatible Continual Learning of Image CompressionPoster6 citations
  872. Towards Understanding and Improving Adversarial Robustness of Vision TransformersPoster6 citations
  873. Training Vision Transformers for Semi-Supervised Semantic SegmentationPoster6 citations
  874. Understanding Video Transformers via Universal Concept DiscoveryHighlight6 citations
  875. Unifying Correspondence Pose and NeRF for Generalized Pose-Free Novel View SynthesisHighlight6 citations
  876. Universal Novelty Detection Through Adaptive Contrastive LearningPoster6 citations
  877. Unsupervised Semantic Segmentation Through Depth-Guided Feature Correlation and SamplingPoster6 citations
  878. Unsupervised Video Domain Adaptation with Masked Pre-Training and Collaborative Self-TrainingPoster6 citations
  879. Utility-Fairness Trade-Offs and How to Find ThemPoster6 citations
  880. Video Frame Interpolation via Direct Synthesis with the Event-based ReferencePoster6 citations
  881. View-Category Interactive Sharing Transformer for Incomplete Multi-View Multi-Label LearningHighlight6 citations
  882. Virtual Immunohistochemistry Staining for Histological Images Assisted by Weakly-supervised LearningPoster6 citations
  883. WaveFace: Authentic Face Restoration with Efficient Frequency RecoveryPoster6 citations
  884. Weakly Misalignment-free Adaptive Feature Alignment for UAVs-based Multimodal Object DetectionPoster6 citations
  885. What How and When Should Object Detectors Update in Continually Changing Test Domains?Poster6 citations
  886. Wired Perspectives: Multi-View Wire Art Embraces Generative AIPoster6 citations
  887. 3D-LFM: Lifting Foundation ModelPoster5 citations
  888. A Stealthy Wrongdoer: Feature-Oriented Reconstruction Attack against Split LearningPoster5 citations
  889. A Unified Diffusion Framework for Scene-aware Human Motion Estimation from Sparse SignalsPoster5 citations
  890. A Unified and Interpretable Emotion Representation and Expression GenerationPoster5 citations
  891. AAMDM: Accelerated Auto-regressive Motion Diffusion ModelPoster5 citations
  892. Accelerating Neural Field Training via Soft MiningPoster5 citations
  893. Active Object Detection with Knowledge Aggregation and Distillation from Large ModelsPoster5 citations
  894. Adaptive Softassign via Hadamard-Equipped SinkhornPoster5 citations
  895. Advancing Saliency Ranking with Human Fixations: Dataset Models and BenchmarksPoster5 citations
  896. An Empirical Study of Scaling Law for Scene Text RecognitionPoster5 citations
  897. Authentic Hand Avatar from a Phone Scan via Universal Hand ModelPoster5 citations
  898. Bilateral Event Mining and Complementary for Event Stream Super-ResolutionPoster5 citations
  899. BilevelPruning: Unified Dynamic and Static Channel Pruning for Convolutional Neural NetworksPoster5 citations
  900. BodyMAP - Jointly Predicting Body Mesh and 3D Applied Pressure Map for People in BedPoster5 citations
  901. Boosting Flow-based Generative Super-Resolution Models via Learned PriorPoster5 citations
  902. Bootstrapping Chest CT Image Understanding by Distilling Knowledge from X-ray Expert ModelsPoster5 citations
  903. Causal-CoG: A Causal-Effect Look at Context Generation for Boosting Multi-modal Language ModelsHighlight5 citations
  904. Coherent Temporal Synthesis for Incremental Action SegmentationPoster5 citations
  905. Confronting Ambiguity in 6D Object Pose Estimation via Score-Based Diffusion on SE(3)Poster5 citations
  906. Continuous Optical Zooming: A Benchmark for Arbitrary-Scale Image Super-Resolution in Real WorldPoster5 citations
  907. Continuous Pose for Monocular Cameras in Neural Implicit RepresentationPoster5 citations
  908. Correspondence-Free Non-Rigid Point Set Registration Using Unsupervised Clustering AnalysisHighlight5 citations
  909. Cross-Dimension Affinity Distillation for 3D EM Neuron SegmentationPoster5 citations
  910. Cross-view and Cross-pose Completion for 3D Human UnderstandingPoster5 citations
  911. CrossMAE: Cross-Modality Masked Autoencoders for Region-Aware Audio-Visual Pre-TrainingPoster5 citations
  912. DVMNet: Computing Relative Pose for Unseen Objects Beyond HypothesesPoster5 citations
  913. Data-Efficient Multimodal Fusion on a Single GPUHighlight5 citations
  914. Data-Efficient Unsupervised Interpolation Without Any Intermediate Frame for 4D Medical ImagesPoster5 citations
  915. Day-Night Cross-domain Vehicle Re-identificationPoster5 citations
  916. Deciphering 'What' and 'Where' Visual Pathways from Spectral Clustering of Layer-Distributed Neural RepresentationsHighlight5 citations
  917. DeconfuseTrack: Dealing with Confusion for Multi-Object TrackingPoster5 citations
  918. Deformable One-shot Face Stylization via DINO Semantic GuidancePoster5 citations
  919. Dense Vision Transformer Compression with Few SamplesPoster5 citations
  920. Descriptor and Word Soups: Overcoming the Parameter Efficiency Accuracy Tradeoff for Out-of-Distribution Few-shot LearningPoster5 citations
  921. DiLiGenRT: A Photometric Stereo Dataset with Quantified Roughness and TranslucencyPoster5 citations
  922. DiffHuman: Probabilistic Photorealistic 3D Reconstruction of HumansPoster5 citations
  923. DiffInDScene: Diffusion-based High-Quality 3D Indoor Scene GenerationPoster5 citations
  924. Diffeomorphic Template Registration for Atmospheric Turbulence MitigationHighlight5 citations
  925. Diffusion-FOF: Single-View Clothed Human Reconstruction via Diffusion-Based Fourier Occupancy FieldPoster5 citations
  926. Discovering Syntactic Interaction Clues for Human-Object Interaction DetectionPoster5 citations
  927. Distraction is All You Need: Memory-Efficient Image Immunization against Diffusion-Based Image EditingHighlight5 citations
  928. Diversity-aware Channel Pruning for StyleGAN CompressionPoster5 citations
  929. DualAD: Disentangling the Dynamic and Static World for End-to-End DrivingPoster5 citations
  930. E-GPS: Explainable Geometry Problem Solving via Top-Down Solver and Bottom-Up GeneratorPoster5 citations
  931. EASE-DETR: Easing the Competition among Object QueriesPoster5 citations
  932. Efficient 3D Implicit Head Avatar with Mesh-anchored Hash Table BlendshapesPoster5 citations
  933. Enhanced Motion-Text Alignment for Image-to-Video Transfer LearningPoster5 citations
  934. Enhancing Visual Continual Learning with Language-Guided SupervisionPoster5 citations
  935. Event-based Structure-from-OrbitHighlight5 citations
  936. Exploring Vision Transformers for 3D Human Motion-Language Models with Motion PatchesPoster5 citations
  937. Extreme Point Supervised Instance SegmentationPoster5 citations
  938. FFF: Fixing Flawed Foundations in Contrastive Pre-Training Results in Very Strong Vision-Language ModelsPoster5 citations
  939. Finding Lottery Tickets in Vision Models via Data-driven Spectral Foresight PruningPoster5 citations
  940. FreePoint: Unsupervised Point Cloud Instance SegmentationPoster5 citations
  941. From Feature to Gaze: A Generalizable Replacement of Linear Layer for Gaze EstimationHighlight5 citations
  942. Fully Exploiting Every Real Sample: SuperPixel Sample Gradient Model StealingPoster5 citations
  943. G3DR: Generative 3D Reconstruction in ImageNetPoster5 citations
  944. GLID: Pre-training a Generalist Encoder-Decoder Vision ModelPoster5 citations
  945. Generative Powers of TenHighlight5 citations
  946. Geometrically-driven Aggregation for Zero-shot 3D Point Cloud UnderstandingHighlight5 citations
  947. Global and Hierarchical Geometry Consistency Priors for Few-shot NeRFs in Indoor ScenesPoster5 citations
  948. Going Beyond Multi-Task Dense Prediction with Synergy Embedding ModelsPoster5 citations
  949. HEAL-SWIN: A Vision Transformer On The SpherePoster5 citations
  950. HPL-ESS: Hybrid Pseudo-Labeling for Unsupervised Event-based Semantic SegmentationPoster5 citations
  951. Hybrid Functional Maps for Crease-Aware Non-Isometric Shape MatchingPoster5 citations
  952. Hyperspherical Classification with Dynamic Label-to-Prototype AssignmentPoster5 citations
  953. Improved Self-Training for Test-Time AdaptationPoster5 citations
  954. Improving Graph Contrastive Learning via Adaptive Positive SamplingPoster5 citations
  955. Improving Spectral Snapshot Reconstruction with Spectral-Spatial RectificationPoster5 citations
  956. Instance-based Max-margin for Practical Few-shot RecognitionPoster5 citations
  957. JRDB-Social: A Multifaceted Robotic Dataset for Understanding of Context and Dynamics of Human Interactions Within Social GroupsPoster5 citations
  958. Jointly Training and Pruning CNNs via Learnable Agent Guidance and AlignmentPoster5 citations
  959. LAMP: Learn A Motion Pattern for Few-Shot Video GenerationPoster5 citations
  960. LORS: Low-rank Residual Structure for Parameter-Efficient Network StackingHighlight5 citations
  961. LOTUS: Evasive and Resilient Backdoor Attacks through Sub-PartitioningPoster5 citations
  962. LTA-PCS: Learnable Task-Agnostic Point Cloud SamplingPoster5 citations
  963. Laplacian-guided Entropy Model in Neural Codec with Blur-dissipated SynthesisPoster5 citations
  964. Layout-Agnostic Scene Text Image Synthesis with Diffusion ModelsPoster5 citations
  965. Learnable Earth Parser: Discovering 3D Prototypes in Aerial ScansPoster5 citations
  966. Learned Trajectory Embedding for Subspace ClusteringPoster5 citations
  967. Learning to Control Camera Exposure via Reinforcement LearningPoster5 citations
  968. Learning to Visually Localize Sound Sources from Mixtures without Prior Source KnowledgePoster5 citations
  969. Local-consistent Transformation Learning for Rotation-invariant Point Cloud AnalysisPoster5 citations
  970. Long-Tail Class Incremental Learning via Independent Sub-prototype ConstructionPoster5 citations
  971. MULTIFLOW: Shifting Towards Task-Agnostic Vision-Language PruningPoster5 citations
  972. ManiFPT: Defining and Analyzing Fingerprints of Generative ModelsPoster5 citations
  973. MemoNav: Working Memory Model for Visual NavigationHighlight5 citations
  974. Memory-based Adapters for Online 3D Scene PerceptionPoster5 citations
  975. MiKASA: Multi-Key-Anchor & Scene-Aware Transformer for 3D Visual GroundingPoster5 citations
  976. Mind The Edge: Refining Depth Edges in Sparsely-Supervised Monocular Depth EstimationPoster5 citations
  977. Mining Supervision for Dynamic Regions in Self-Supervised Monocular Depth EstimationPoster5 citations
  978. Mitigating Object Dependencies: Improving Point Cloud Self-Supervised Learning through Object ExchangePoster5 citations
  979. MonoHair: High-Fidelity Hair Modeling from a Monocular VideoPoster5 citations
  980. MultiPhys: Multi-Person Physics-aware 3D Motion EstimationPoster5 citations
  981. Multiple View Geometry Transformers for 3D Human Pose EstimationPoster5 citations
  982. No More Ambiguity in 360deg Room Layout via Bi-Layout EstimationPoster5 citations
  983. OOSTraj: Out-of-Sight Trajectory Prediction With Vision-Positioning DenoisingPoster5 citations
  984. On the Faithfulness of Vision Transformer ExplanationsPoster5 citations
  985. PAIR Diffusion: A Comprehensive Multimodal Object-Level Image EditorPoster5 citations
  986. PBWR: Parametric-Building-Wireframe Reconstruction from Aerial LiDAR Point CloudsPoster5 citations
  987. PREGO: Online Mistake Detection in PRocedural EGOcentric VideosPoster5 citations
  988. PTM-VQA: Efficient Video Quality Assessment Leveraging Diverse PreTrained Models from the WildPoster5 citations
  989. Physics-guided Shape-from-Template: Monocular Video Perception through Neural Surrogate ModelsPoster5 citations
  990. PoNQ: a Neural QEM-based Mesh RepresentationPoster5 citations
  991. ProTeCt: Prompt Tuning for Taxonomic Open Set ClassificationPoster5 citations
  992. Programmable Motion Generation for Open-Set Motion Control TasksHighlight5 citations
  993. PromptCoT: Align Prompt Distribution via Adapted Chain-of-ThoughtPoster5 citations
  994. Prompting Vision Foundation Models for Pathology Image AnalysisPoster5 citations
  995. Quantifying Task Priority for Multi-Task OptimizationPoster5 citations
  996. Querying as Prompt: Parameter-Efficient Learning for Multimodal Language ModelPoster5 citations
  997. Rapid 3D Model Generation with Intuitive 3D InputHighlight5 citations
  998. Rapid Motor Adaptation for Robotic Manipulator ArmsPoster5 citations
  999. Re-thinking Data Availability Attacks Against Deep Neural NetworksPoster5 citations
  1000. Real-World Efficient Blind Motion Deblurring via Blur Pixel DiscretizationPoster5 citations

Looking for submission deadlines instead? See the conference deadline calendar.