CVPR 2024 Accepted Papers
The full list of 2,640 papers accepted at CVPR 2024 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 2,323Highlight: 317
- Improved Baselines with Visual Instruction TuningHighlight2,339 citations
- DETRs Beat YOLOs on Real-time Object DetectionPoster1,573 citations
- Depth Anything: Unleashing the Power of Large-Scale Unlabeled DataPoster858 citations
- MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGIPoster765 citations
- 4D Gaussian Splatting for Real-Time Dynamic Scene RenderingPoster586 citations
- LISA: Reasoning Segmentation via Large Language ModelPoster498 citations
- mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality CollaborationHighlight425 citations
- MVBench: A Comprehensive Multi-modal Video Understanding BenchmarkHighlight415 citations
- Wonder3D: Single Image to 3D using Cross-Domain DiffusionHighlight414 citations
- VILA: On Pre-training for Visual Language ModelsPoster401 citations
- Deformable 3D Gaussians for High-Fidelity Monocular Dynamic Scene ReconstructionPoster385 citations
- Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character AnimationPoster375 citations
- Repurposing Diffusion-Based Image Generators for Monocular Depth EstimationPoster368 citations
- SuGaR: Surface-Aligned Gaussian Splatting for Efficient 3D Mesh Reconstruction and High-Quality Mesh RenderingPoster368 citations
- VBench: Comprehensive Benchmark Suite for Video Generative ModelsHighlight348 citations
- Mip-Splatting: Alias-free 3D Gaussian SplattingPoster345 citations
- YOLO-World: Real-Time Open-Vocabulary Object DetectionPoster334 citations
- CogAgent: A Visual Language Model for GUI AgentsHighlight326 citations
- Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMsPoster320 citations
- DUSt3R: Geometric 3D Vision Made EasyPoster316 citations
- RepViT: Revisiting Mobile CNN From ViT PerspectivePoster309 citations
- Gaussian Splatting SLAMHighlight307 citations
- Point Transformer V3: Simpler Faster StrongerPoster288 citations
- SplaTAM: Splat Track & Map 3D Gaussians for Dense RGB-D SLAMPoster276 citations
- Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal ModelsHighlight273 citations
- InstantBooth: Personalized Text-to-Image Generation without Test-Time FinetuningPoster272 citations
- MovieChat: From Dense Token to Sparse Memory for Long Video UnderstandingPoster269 citations
- AnyDoor: Zero-shot Object-level Image CustomizationPoster268 citations
- InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic TasksPoster265 citations
- Generative Multimodal Models are In-Context LearnersPoster261 citations
- VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion ModelsPoster256 citations
- Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video UnderstandingHighlight251 citations
- Symphonize 3D Semantic Scene Completion with Contextual Instance QueriesPoster243 citations
- HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language ModelsPoster236 citations
- pixelSplat: 3D Gaussian Splats from Image Pairs for Scalable Generalizable 3D ReconstructionPoster232 citations
- Text-to-3D using Gaussian SplattingPoster231 citations
- RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human FeedbackPoster222 citations
- GLaMM: Pixel Grounding Large Multimodal ModelPoster219 citations
- GS-SLAM: Dense Visual SLAM with 3D Gaussian SplattingHighlight216 citations
- Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive DecodingHighlight211 citations
- DragDiffusion: Harnessing Diffusion Models for Interactive Point-based Image EditingHighlight208 citations
- Diffusion Model Alignment Using Direct Preference OptimizationPoster205 citations
- MagicAnimate: Temporally Consistent Human Image Animation using Diffusion ModelPoster203 citations
- Video-P2P: Video Editing with Cross-attention ControlPoster202 citations
- One-step Diffusion with Distribution Matching DistillationPoster201 citations
- SEED-Bench: Benchmarking Multimodal Large Language ModelsPoster200 citations
- InceptionNeXt: When Inception Meets ConvNeXtPoster199 citations
- One-2-3-45++: Fast Single Image to 3D Objects with Consistent Multi-View Generation and 3D DiffusionPoster199 citations
- SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning CapabilitiesPoster198 citations
- Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person PerspectivesPoster197 citations
- Splatter Image: Ultra-Fast Single-View 3D ReconstructionPoster194 citations
- PhotoMaker: Customizing Realistic Human Photos via Stacked ID EmbeddingPoster193 citations
- TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video UnderstandingPoster192 citations
- UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio Video Point Cloud Time-Series and Image RecognitionPoster192 citations
- HyperDreamBooth: HyperNetworks for Fast Personalization of Text-to-Image ModelsPoster191 citations
- LangSplat: 3D Language Gaussian SplattingHighlight191 citations
- Compact 3D Gaussian Representation for Radiance FieldHighlight190 citations
- Panda-70M: Captioning 70M Videos with Multiple Cross-Modality TeachersPoster190 citations
- DrivingGaussian: Composite Gaussian Splatting for Surrounding Dynamic Autonomous Driving ScenesPoster189 citations
- Sequential Modeling Enables Scalable Learning for Large Vision ModelsPoster189 citations
- GaussianEditor: Swift and Controllable 3D Editing with Gaussian SplattingPoster187 citations
- OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-AllocationHighlight186 citations
- PhysGaussian: Physics-Integrated 3D Gaussians for Generative DynamicsHighlight178 citations
- Triplane Meets Gaussian Splatting: Fast and Generalizable Single-View 3D Reconstruction with TransformersPoster175 citations
- EfficientSAM: Leveraged Masked Image Pretraining for Efficient Segment AnythingHighlight168 citations
- FoundationPose: Unified 6D Pose Estimation and Tracking of Novel ObjectsHighlight167 citations
- Rewrite the StarsPoster166 citations
- GaussianAvatars: Photorealistic Head Avatars with Rigged 3D GaussiansHighlight161 citations
- Feature 3DGS: Supercharging 3D Gaussian Splatting to Enable Distilled Feature FieldsHighlight160 citations
- LucidDreamer: Towards High-Fidelity Text-to-3D Generation via Interval Score MatchingHighlight158 citations
- Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision Language Audio and ActionHighlight157 citations
- Florence-2: Advancing a Unified Representation for a Variety of Vision TasksPoster156 citations
- SC-GS: Sparse-Controlled Gaussian Splatting for Editable Dynamic ScenesPoster156 citations
- GeoChat: Grounded Large Vision-Language Model for Remote SensingPoster154 citations
- Spacetime Gaussian Feature Splatting for Real-Time Dynamic View SynthesisPoster153 citations
- ReconFusion: 3D Reconstruction with Diffusion PriorsPoster151 citations
- FreeU: Free Lunch in Diffusion U-NetPoster148 citations
- LMDrive: Closed-Loop End-to-End Driving with Large Language ModelsPoster148 citations
- Analyzing and Improving the Training Dynamics of Diffusion ModelsPoster146 citations
- Poly Kernel Inception Network for Remote Sensing DetectionPoster145 citations
- DreamAvatar: Text-and-Shape Guided 3D Human Avatar Generation via Diffusion ModelsPoster140 citations
- SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation ImageryPoster140 citations
- DeepCache: Accelerating Diffusion Models for FreePoster139 citations
- RoMa: Robust Dense Feature MatchingPoster139 citations
- Honeybee: Locality-enhanced Projector for Multimodal LLMHighlight138 citations
- UniDepth: Universal Monocular Metric Depth EstimationHighlight135 citations
- Rethinking FID: Towards a Better Evaluation Metric for Image GenerationHighlight130 citations
- An Edit Friendly DDPM Noise Space: Inversion and ManipulationsPoster129 citations
- Compressed 3D Gaussian Splatting for Accelerated Novel View SynthesisPoster128 citations
- SeeSR: Towards Semantics-Aware Real-World Image Super-ResolutionPoster128 citations
- EvalCrafter: Benchmarking and Evaluating Large Video Generation ModelsPoster126 citations
- MoMask: Generative Masked Modeling of 3D Human MotionsPoster125 citations
- ULIP-2: Towards Scalable Multimodal Pre-training for 3D UnderstandingPoster125 citations
- COLMAP-Free 3D Gaussian SplattingHighlight124 citations
- Emu Edit: Precise Image Editing via Recognition and Generation TasksHighlight124 citations
- MeshGPT: Generating Triangle Meshes with Decoder-Only TransformersHighlight124 citations
- OneLLM: One Framework to Align All Modalities with LanguagePoster124 citations
- 3DGS-Avatar: Animatable Avatars via Deformable 3D Gaussian SplattingPoster123 citations
- VTimeLLM: Empower LLM to Grasp Video MomentsHighlight123 citations
- HIVE: Harnessing Human Feedback for Instructional Visual EditingPoster119 citations
- GPS-Gaussian: Generalizable Pixel-wise 3D Gaussian Splatting for Real-time Human Novel View SynthesisHighlight118 citations
- OpenEQA: Embodied Question Answering in the Era of Foundation ModelsPoster118 citations
- Driving into the Future: Multiview Visual Forecasting and Planning with World Model for Autonomous DrivingPoster117 citations
- GaussianAvatar: Towards Realistic Human Avatar Modeling from a Single Video via Animatable 3D GaussiansPoster117 citations
- GaussianDreamer: Fast Generation from Text to 3D Gaussians by Bridging 2D and 3D Diffusion ModelsPoster116 citations
- VastGaussian: Vast 3D Gaussians for Large Scene ReconstructionPoster116 citations
- V?: Guided Visual Search as a Core Mechanism in Multimodal LLMsPoster114 citations
- Logit Standardization in Knowledge DistillationHighlight113 citations
- DNGaussian: Optimizing Sparse-View 3D Gaussian Radiance Fields with Global-Local Depth NormalizationPoster112 citations
- Gaussian Head Avatar: Ultra High-fidelity Head Avatar via Dynamic GaussiansPoster112 citations
- HUGS: Human Gaussian SplatsPoster112 citations
- TransNeXt: Robust Foveal Visual Perception for Vision TransformersPoster111 citations
- Align Your Gaussians: Text-to-4D with Dynamic 3D Gaussians and Composed Diffusion ModelsHighlight110 citations
- CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic SegmentationHighlight110 citations
- GauHuman: Articulated Gaussian Splatting from Monocular Human VideosPoster110 citations
- Animatable Gaussians: Learning Pose-dependent Gaussian Maps for High-fidelity Human Avatar ModelingPoster109 citations
- InstructDiffusion: A Generalist Modeling Interface for Vision TasksPoster109 citations
- ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual PromptsPoster106 citations
- A Dual-Augmentor Framework for Domain Generalization in 3D Human Pose EstimationPoster105 citations
- GaussianEditor: Editing 3D Gaussians Delicately with Text InstructionsPoster105 citations
- Grounded Text-to-Image Synthesis with Attention RefocusingPoster105 citations
- DreamVideo: Composing Your Dream Videos with Customized Subject and MotionPoster104 citations
- Style Aligned Image Generation via Shared AttentionPoster104 citations
- MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video UnderstandingPoster103 citations
- Reconstructing Hands in 3D with TransformersPoster103 citations
- Make Pixels Dance: High-Dynamic Video GenerationPoster102 citations
- RMT: Retentive Networks Meet Vision TransformersPoster102 citations
- 4D-fy: Text-to-4D Generation Using Hybrid Score Distillation SamplingPoster101 citations
- Photo-SLAM: Real-time Simultaneous Localization and Photorealistic Mapping for Monocular Stereo and RGB-D CamerasPoster101 citations
- Style Injection in Diffusion: A Training-free Approach for Adapting Large-scale Diffusion Models for Style TransferHighlight100 citations
- DiffuScene: Denoising Diffusion Models for Generative Indoor Scene SynthesisPoster99 citations
- Gaussian-Flow: 4D Reconstruction with Dynamic 3D Gaussian ParticleHighlight99 citations
- UFOGen: You Forward Once Large Scale Text-to-Image Generation via Diffusion GANsHighlight99 citations
- Hallucination Augmented Contrastive Learning for Multimodal Large Language ModelPoster98 citations
- Putting the Object Back into Video Object SegmentationHighlight98 citations
- Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts AdaptersPoster97 citations
- Compositional Chain-of-Thought Prompting for Large Multimodal ModelsPoster96 citations
- Rich Human Feedback for Text-to-Image GenerationPoster95 citations
- GART: Gaussian Articulated Template ModelsHighlight94 citations
- Relightable Gaussian Codec AvatarsPoster94 citations
- SinSR: Diffusion-Based Image Super-Resolution in a Single StepPoster94 citations
- HumanGaussian: Text-Driven 3D Human Generation with Gaussian SplattingHighlight91 citations
- ZeroNVS: Zero-Shot 360-Degree View Synthesis from a Single ImagePoster90 citations
- GS-IR: 3D Gaussian Splatting for Inverse RenderingPoster89 citations
- BioCLIP: A Vision Foundation Model for the Tree of LifePoster88 citations
- Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision ApplicationsHighlight88 citations
- LL3DA: Visual Interactive Instruction Tuning for Omni-3D Understanding Reasoning and PlanningPoster88 citations
- Osprey: Pixel Understanding with Visual Instruction TuningPoster88 citations
- RichDreamer: A Generalizable Normal-Depth Diffusion Model for Detail Richness in Text-to-3DHighlight88 citations
- CoDeF: Content Deformation Fields for Temporally Consistent Video ProcessingHighlight87 citations
- Q-Instruct: Improving Low-level Visual Abilities for Multi-modality Foundation ModelsPoster87 citations
- DisCo: Disentangled Control for Realistic Human Dance GenerationPoster86 citations
- GPT-4V(ision) is a Human-Aligned Evaluator for Text-to-3D GenerationPoster86 citations
- SplattingAvatar: Realistic Real-Time Human Avatars with Mesh-Embedded Gaussian SplattingPoster86 citations
- DL3DV-10K: A Large-Scale Scene Dataset for Deep Learning-based 3D VisionPoster85 citations
- PixelLM: Pixel Reasoning with Large Multimodal ModelPoster84 citations
- Expandable Subspace Ensemble for Pre-Trained Model-Based Class-Incremental LearningPoster83 citations
- Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving?Poster83 citations
- Probing the 3D Awareness of Visual Foundation ModelsPoster83 citations
- SimDA: Simple Diffusion Adapter for Efficient Video GenerationPoster83 citations
- PanoOcc: Unified Occupancy Representation for Camera-based 3D Panoptic SegmentationPoster82 citations
- InstanceDiffusion: Instance-level Control for Image GenerationPoster81 citations
- Holodeck: Language Guided Generation of 3D Embodied AI EnvironmentsPoster80 citations
- Language Embedded 3D Gaussians for Open-Vocabulary Scene UnderstandingPoster80 citations
- CPR: Retrieval Augmented Generation for Copyright ProtectionPoster79 citations
- SelfOcc: Self-Supervised Vision-Based 3D Occupancy PredictionPoster79 citations
- HumanNorm: Learning Normal Diffusion Model for High-quality and Realistic 3D Human GenerationPoster78 citations
- SmartEdit: Exploring Complex Instruction-based Image Editing with Multimodal Large Language ModelsHighlight77 citations
- Multi-Scale 3D Gaussian Splatting for Anti-Aliased RenderingPoster76 citations
- OneFormer3D: One Transformer for Unified Point Cloud SegmentationPoster76 citations
- LEDITS++: Limitless Image Editing using Text-to-Image ModelsPoster75 citations
- MACE: Mass Concept Erasure in Diffusion ModelsPoster75 citations
- Optimal Transport Aggregation for Visual Place RecognitionPoster75 citations
- Using Human Feedback to Fine-tune Diffusion Models without Any Reward ModelPoster75 citations
- WHAM: Reconstructing World-grounded Humans with Accurate 3D MotionPoster75 citations
- 3DGStream: On-the-Fly Training of 3D Gaussians for Efficient Streaming of Photo-Realistic Free-Viewpoint VideosHighlight74 citations
- Equivariant Multi-Modality Image FusionPoster74 citations
- VGGSfM: Visual Geometry Grounded Deep Structure From MotionHighlight74 citations
- GenTron: Diffusion Transformers for Image and Video GenerationPoster73 citations
- Generative Image DynamicsPoster73 citations
- HalluciDoctor: Mitigating Hallucinatory Toxicity in Visual Instruction DataPoster73 citations
- Scaling Laws of Synthetic Images for Model Training ... for NowPoster73 citations
- ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense PredictionsHighlight73 citations
- MIGC: Multi-Instance Generation Controller for Text-to-Image SynthesisHighlight72 citations
- Multi-Modal Hallucination Control by Visual Information GroundingPoster72 citations
- Diffuse Attend and Segment: Unsupervised Zero-Shot Segmentation using Stable DiffusionPoster71 citations
- Human Gaussian Splatting: Real-time Rendering of Animatable AvatarsPoster71 citations
- Wavelet-based Fourier Information Interaction with Frequency Diffusion Adjustment for Underwater Image RestorationPoster70 citations
- BadCLIP: Dual-Embedding Guided Backdoor Attack on Multimodal Contrastive LearningHighlight69 citations
- Diffusion Models Without AttentionPoster69 citations
- Editable Scene Simulation for Autonomous Driving via Collaborative LLM-AgentsHighlight69 citations
- RealNet: A Feature Selection Network with Realistic Synthetic Anomaly for Anomaly DetectionPoster69 citations
- DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language FeedbackPoster68 citations
- MMA-Diffusion: MultiModal Attack on Diffusion ModelsPoster68 citations
- RegionPLC: Regional Point-Language Contrastive Learning for Open-World 3D Scene UnderstandingPoster68 citations
- PLGSLAM: Progressive Neural Scene Represenation with Local to Global Bundle AdjustmentPoster67 citations
- Transcending Forgery Specificity with Latent Space Augmentation for Generalizable Deepfake DetectionPoster67 citations
- VideoBooth: Diffusion-based Video Generation with Image PromptsPoster67 citations
- EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AIPoster66 citations
- Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video SynthesisHighlight66 citations
- Bayes' Rays: Uncertainty Quantification for Neural Radiance FieldsHighlight65 citations
- ASH: Animatable Gaussian Splats for Efficient and Photoreal Human RenderingPoster64 citations
- Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMsPoster64 citations
- EMCAD: Efficient Multi-scale Convolutional Attention Decoding for Medical Image SegmentationPoster64 citations
- GSVA: Generalized Segmentation via Multimodal Large Language ModelsPoster64 citations
- Neural Video Compression with Feature ModulationPoster64 citations
- Can I Trust Your Answer? Visually Grounded Video Question AnsweringHighlight63 citations
- OMG-Seg: Is One Model Good Enough For All Segmentation?Poster63 citations
- OneTracker: Unifying Visual Object Tracking with Foundation Models and Efficient TuningHighlight62 citations
- Generalized Predictive Model for Autonomous DrivingHighlight61 citations
- Modeling Dense Multimodal Interactions Between Biological Pathways and Histology for Survival PredictionPoster61 citations
- NeuRAD: Neural Rendering for Autonomous DrivingHighlight61 citations
- SAM-6D: Segment Anything Model Meets Zero-Shot 6D Object Pose EstimationPoster61 citations
- Text-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image FusionPoster61 citations
- LION: Empowering Multimodal Large Language Model with Dual-Level Visual KnowledgePoster60 citations
- HUGS: Holistic Urban 3D Scene Understanding via Gaussian SplattingPoster59 citations
- Paint3D: Paint Anything 3D with Lighting-Less Texture Diffusion ModelsPoster59 citations
- Prompt-Free Diffusion: Taking "Text" out of Text-to-Image Diffusion ModelsPoster59 citations
- Efficient LoFTR: Semi-Dense Local Feature Matching with Sparse-Like SpeedHighlight58 citations
- DistriFusion: Distributed Parallel Inference for High-Resolution Diffusion ModelsHighlight57 citations
- Learning Vision from Models Rivals Learning Vision from DataPoster57 citations
- OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLMPoster57 citations
- SSR-Encoder: Encoding Selective Subject Representation for Subject-Driven GenerationPoster57 citations
- SpatialTracker: Tracking Any 2D Pixels in 3D SpaceHighlight57 citations
- Single-Model and Any-Modality for Video Object TrackingPoster56 citations
- VMC: Video Motion Customization using Temporal Attention Adaption for Text-to-Video Diffusion ModelsPoster56 citations
- FreGS: 3D Gaussian Splatting with Progressive Frequency RegularizationPoster55 citations
- Noisy-Correspondence Learning for Text-to-Image Person Re-identificationPoster55 citations
- Rethinking Inductive Biases for Surface Normal EstimationPoster55 citations
- CapsFusion: Rethinking Image-Text Data at ScalePoster54 citations
- CoDi-2: In-Context Interleaved and Interactive Any-to-Any GenerationHighlight54 citations
- EditGuard: Versatile Image Watermarking for Tamper Localization and Copyright ProtectionPoster54 citations
- InfLoRA: Interference-Free Low-Rank Adaptation for Continual LearningPoster54 citations
- ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic ManipulationPoster54 citations
- Scaling Up Dynamic Human-Scene Interaction ModelingHighlight54 citations
- SyncTalk: The Devil is in the Synchronization for Talking Head SynthesisPoster54 citations
- VLP: Vision Language Planning for Autonomous DrivingPoster54 citations
- Binding Touch to Everything: Learning Unified Multimodal Tactile RepresentationsPoster53 citations
- Habitat Synthetic Scenes Dataset (HSSD-200): An Analysis of 3D Scene Scale and Realism Tradeoffs for ObjectGoal NavigationPoster53 citations
- PromptKD: Unsupervised Prompt Distillation for Vision-Language ModelsPoster53 citations
- Residual Denoising Diffusion ModelsPoster53 citations
- SNI-SLAM: Semantic Neural Implicit SLAMPoster53 citations
- Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent AlignersPoster53 citations
- Towards Large-scale 3D Representation Learning with Multi-dataset Point Prompt TrainingPoster53 citations
- Visual Point Cloud Forecasting enables Scalable Autonomous DrivingHighlight53 citations
- XCube: Large-Scale 3D Generative Modeling using Sparse Voxel HierarchiesHighlight53 citations
- XFeat: Accelerated Features for Lightweight Image MatchingPoster53 citations
- Autoregressive Queries for Adaptive Tracking with Spatio-Temporal TransformersPoster52 citations
- GARField: Group Anything with Radiance FieldsPoster52 citations
- GigaPose: Fast and Robust Novel Object Pose Estimation via One CorrespondencePoster52 citations
- GraphDreamer: Compositional 3D Scene Synthesis from Scene GraphsPoster52 citations
- Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large ModelsPoster52 citations
- A Unified Approach for Text- and Image-guided 4D Scene GenerationPoster51 citations
- Cache Me if You Can: Accelerating Diffusion Models through Block CachingPoster51 citations
- DEADiff: An Efficient Stylization Diffusion Model with Disentangled RepresentationsHighlight51 citations
- IS-Fusion: Instance-Scene Collaborative Fusion for Multimodal 3D Object DetectionHighlight51 citations
- One-dimensional Adapter to Rule Them All: Concepts Diffusion Models and Erasing ApplicationsHighlight51 citations
- PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly DetectionPoster51 citations
- BT-Adapter: Video Conversation is Feasible Without Video Instruction TuningPoster50 citations
- Forgery-aware Adaptive Transformer for Generalizable Synthetic Image DetectionPoster50 citations
- Intelligent Grimm - Open-ended Visual Storytelling via Latent Diffusion ModelsPoster50 citations
- Open3DIS: Open-Vocabulary 3D Instance Segmentation with 2D Mask GuidancePoster50 citations
- Panacea: Panoramic and Controllable Video Generation for Autonomous DrivingPoster50 citations
- SNIFFER: Multimodal Large Language Model for Explainable Out-of-Context Misinformation DetectionPoster50 citations
- Towards Understanding Cross and Self-Attention in Stable Diffusion for Text-Guided Image EditingPoster50 citations
- CG-HOI: Contact-Guided 3D Human-Object Interaction GenerationPoster49 citations
- Detector-Free Structure from MotionPoster49 citations
- Embodied Multi-Modal Agent trained by an LLM from a Parallel TextWorldPoster49 citations
- HIPTrack: Visual Tracking with Historical PromptsPoster49 citations
- HiFi4G: High-Fidelity Human Performance Rendering via Compact Gaussian SplattingPoster49 citations
- Language-only Training of Zero-shot Composed Image RetrievalPoster49 citations
- LayoutLLM: Layout Instruction Tuning with Large Language Models for Document UnderstandingPoster49 citations
- Real-IAD: A Real-World Multi-View Dataset for Benchmarking Versatile Industrial Anomaly DetectionPoster49 citations
- Scaling Up to Excellence: Practicing Model Scaling for Photo-Realistic Image Restoration In the WildPoster49 citations
- Self-correcting LLM-controlled Diffusion ModelsPoster49 citations
- Stronger Fewer & Superior: Harnessing Vision Foundation Models for Domain Generalized Semantic SegmentationPoster49 citations
- BlockGCN: Redefine Topology Awareness for Skeleton-Based Action RecognitionPoster48 citations
- CoSeR: Bridging Image and Language for Cognitive Super-ResolutionPoster48 citations
- ConsistNet: Enforcing 3D Consistency for Multi-view Images DiffusionPoster48 citations
- General Object Foundation Model for Images and Videos at ScaleHighlight48 citations
- MMM: Generative Masked Motion ModelHighlight48 citations
- Ranni: Taming Text-to-Image Diffusion for Accurate Instruction FollowingPoster48 citations
- VideoLLM-online: Online Video Large Language Model for Streaming VideoPoster48 citations
- GROUNDHOG: Grounding Large Language Models to Holistic SegmentationPoster47 citations
- Grounding Everything: Emerging Localization Properties in Vision-Language TransformersPoster47 citations
- State Space Models for Event CamerasPoster47 citations
- Towards Generalizable Tumor SynthesisPoster47 citations
- Towards Learning a Generalist Model for Embodied NavigationHighlight47 citations
- UniPAD: A Universal Pre-training Paradigm for Autonomous DrivingPoster47 citations
- 4K4D: Real-Time 4D View Synthesis at 4K ResolutionPoster46 citations
- COTR: Compact Occupancy TRansformer for Vision-based 3D Occupancy PredictionPoster46 citations
- CrossKD: Cross-Head Knowledge Distillation for Object DetectionPoster46 citations
- Hierarchical Diffusion Policy for Kinematics-Aware Multi-Task Robotic ManipulationPoster46 citations
- Infrared Small Target Detection with Scale and Location SensitivityPoster46 citations
- MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced TrainingPoster46 citations
- PeLK: Parameter-efficient Large Kernel ConvNets with Peripheral ConvolutionPoster46 citations
- RAVE: Randomized Noise Shuffling for Fast and Consistent Video Editing with Diffusion ModelsHighlight46 citations
- RCBEVDet: Radar-camera Fusion in Bird's Eye View for 3D Object DetectionPoster46 citations
- Upscale-A-Video: Temporal-Consistent Diffusion Model for Real-World Video Super-ResolutionHighlight46 citations
- VCoder: Versatile Vision Encoders for Multimodal Large Language ModelsPoster46 citations
- Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language ModelsPoster46 citations
- ChatPose: Chatting about 3D Human PosePoster45 citations
- DemoFusion: Democratising High-Resolution Image Generation With No $$$Poster45 citations
- Efficient Test-Time Adaptation of Vision-Language ModelsPoster45 citations
- Gaussian Shading: Provable Performance-Lossless Image Watermarking for Diffusion ModelsPoster45 citations
- PIA: Your Personalized Image Animator via Plug-and-Play Modules in Text-to-Image ModelsPoster45 citations
- PortraitBooth: A Versatile Portrait Model for Fast Identity-preserved PersonalizationPoster45 citations
- SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object TrackingPoster45 citations
- SED: A Simple Encoder-Decoder for Open-Vocabulary Semantic SegmentationPoster45 citations
- Selective-Stereo: Adaptive Frequency Information Selection for Stereo MatchingHighlight45 citations
- AM-RADIO: Agglomerative Vision Foundation Model Reduce All Domains Into OnePoster44 citations
- BadCLIP: Trigger-Aware Prompt Learning for Backdoor Attacks on CLIPPoster44 citations
- GES : Generalized Exponential Splatting for Efficient Radiance Field RenderingPoster44 citations
- LLaFS: When Large Language Models Meet Few-Shot SegmentationPoster44 citations
- Move as You Say Interact as You Can: Language-guided Human Motion Generation with Scene AffordanceHighlight44 citations
- NIFTY: Neural Object Interaction Fields for Guided Human Motion SynthesisPoster44 citations
- OmniGlue: Generalizable Feature Matching with Foundation Model GuidancePoster44 citations
- Paint-it: Text-to-Texture Synthesis via Deep Convolutional Texture Map Optimization and Physically-Based RenderingPoster44 citations
- Preserving Fairness Generalization in Deepfake DetectionPoster44 citations
- RTMO: Towards High-Performance One-Stage Real-Time Multi-Person Pose EstimationPoster44 citations
- RegionGPT: Towards Region Understanding Vision Language ModelPoster44 citations
- Rethinking Transformers Pre-training for Multi-Spectral Satellite ImageryPoster44 citations
- Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image SegmentationPoster44 citations
- Streaming Dense Video CaptioningPoster44 citations
- SwiftBrush: One-Step Text-to-Image Diffusion Model with Variational Score DistillationPoster44 citations
- TUMTraf V2X Cooperative Perception DatasetPoster44 citations
- The Neglected Tails in Vision-Language ModelsPoster44 citations
- Video ReCap: Recursive Captioning of Hour-Long VideosPoster44 citations
- WonderJourney: Going from Anywhere to EverywherePoster44 citations
- Adapting Visual-Language Models for Generalizable Anomaly Detection in Medical ImagesHighlight43 citations
- Boosting Adversarial Transferability by Block Shuffle and RotationPoster43 citations
- CCEdit: Creative and Controllable Video Editing via Diffusion ModelsPoster43 citations
- Event Stream-based Visual Object Tracking: A High-Resolution Benchmark Dataset and A Novel BaselinePoster43 citations
- From Audio to Photoreal Embodiment: Synthesizing Humans in ConversationsPoster43 citations
- GPT4Point: A Unified Framework for Point-Language Understanding and GenerationHighlight43 citations
- InstructVideo: Instructing Video Diffusion Models with Human FeedbackPoster43 citations
- Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMsPoster43 citations
- SODA: Bottleneck Diffusion Models for Representation LearningPoster43 citations
- An Aggregation-Free Federated Learning for Tackling Data HeterogeneityPoster42 citations
- Bridging the Gap: A Unified Video Comprehension Framework for Moment Retrieval and Highlight DetectionPoster42 citations
- CoGS: Controllable Gaussian SplattingPoster42 citations
- CorrMatch: Label Propagation via Correlation Matching for Semi-Supervised Semantic SegmentationPoster42 citations
- Instruct-Imagen: Image Generation with Multi-modal InstructionPoster42 citations
- SIFU: Side-view Conditioned Implicit Function for Real-world Usable Clothed Human ReconstructionHighlight42 citations
- Self-Discovering Interpretable Diffusion Latent Directions for Responsible Text-to-Image GenerationPoster42 citations
- SkillDiffuser: Interpretable Hierarchical Planning via Skill Abstractions in Diffusion-Based Task ExecutionPoster42 citations
- Space-Time Diffusion Features for Zero-Shot Text-Driven Motion TransferPoster42 citations
- SparseOcc: Rethinking Sparse Latent Representation for Vision-Based Semantic Occupancy PredictionPoster42 citations
- VidToMe: Video Token Merging for Zero-Shot Video EditingPoster42 citations
- EgoExoLearn: A Dataset for Bridging Asynchronous Ego- and Exo-centric View of Procedural Activities in Real WorldPoster41 citations
- EscherNet: A Generative Model for Scalable View SynthesisPoster41 citations
- FlashAvatar: High-fidelity Head Avatar with Efficient Gaussian EmbeddingPoster41 citations
- FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video SynthesisHighlight41 citations
- GAvatar: Animatable 3D Gaussian Avatars with Implicit Mesh LearningHighlight41 citations
- Gaussian Shell Maps for Efficient 3D Human GenerationPoster41 citations
- Optimizing Diffusion Noise Can Serve As Universal Motion PriorsPoster41 citations
- A Picture is Worth More Than 77 Text Tokens: Evaluating CLIP-Style Models on Dense CaptionsPoster40 citations
- AEROBLADE: Training-Free Detection of Latent Diffusion Images Using Autoencoder Reconstruction ErrorPoster40 citations
- Diffusion-EDFs: Bi-equivariant Denoising Generative Modeling on SE(3) for Visual Robotic ManipulationHighlight40 citations
- Fast ODE-based Sampling for Diffusion Models in Around 5 StepsHighlight40 citations
- Harnessing Large Language Models for Training-free Video Anomaly DetectionPoster40 citations
- LaMPilot: An Open Benchmark Dataset for Autonomous Driving with Language Model ProgramsPoster40 citations
- Text Is MASS: Modeling as Stochastic Embedding for Text-Video RetrievalHighlight40 citations
- A Closer Look at the Few-Shot Adaptation of Large Vision-Language ModelsPoster39 citations
- Adapt or Perish: Adaptive Sparse Transformer with Attentive Feature Refinement for Image RestorationPoster39 citations
- On the Robustness of Large Multimodal Models Against Image Adversarial AttacksPoster39 citations
- PEEKABOO: Interactive Video Generation via Masked-DiffusionPoster39 citations
- Text-Image Alignment for Diffusion-Based PerceptionPoster39 citations
- Auto MC-Reward: Automated Dense Reward Design with Large Language Models for MinecraftPoster38 citations
- Bidirectional Multi-Scale Implicit Neural Representations for Image DerainingPoster38 citations
- HouseCat6D - A Large-Scale Multi-Modal Category Level 6D Object Perception Dataset with Household Objects in Realistic ScenariosHighlight38 citations
- Morphological Prototyping for Unsupervised Slide Representation Learning in Computational PathologyPoster38 citations
- Retrieval-Augmented Egocentric Video CaptioningPoster38 citations
- Text2Loc: 3D Point Cloud Localization from Natural LanguagePoster38 citations
- A Recipe for Scaling up Text-to-Video Generation with Text-free VideosPoster37 citations
- CityDreamer: Compositional Generative Model of Unbounded 3D CitiesPoster37 citations
- Dense Optical Tracking: Connecting the DotsHighlight37 citations
- DiffSHEG: A Diffusion-Based Approach for Real-Time Speech-driven Holistic 3D Expression and Gesture GenerationPoster37 citations
- Dynamic Adapter Meets Prompt Tuning: Parameter-Efficient Transfer Learning for Point Cloud AnalysisPoster37 citations
- FairCLIP: Harnessing Fairness in Vision-Language LearningPoster37 citations
- LLMs are Good Sign Language TranslatorsPoster37 citations
- Loopy-SLAM: Dense Neural SLAM with Loop ClosuresPoster37 citations
- PARA-Drive: Parallelized Architecture for Real-time Autonomous DrivingPoster37 citations
- SHViT: Single-Head Vision Transformer with Memory Efficient Macro DesignPoster37 citations
- Self-Distilled Masked Auto-Encoders are Efficient Video Anomaly DetectorsPoster37 citations
- VideoSwap: Customized Video Subject Swapping with Interactive Semantic Point CorrespondencePoster37 citations
- ViewDiff: 3D-Consistent Image Generation with Text-to-Image ModelsPoster37 citations
- DreamMatcher: Appearance Matching Self-Attention for Semantically-Consistent Text-to-Image PersonalizationPoster36 citations
- Dynamic Graph Representation with Knowledge-aware Attention for Histopathology Whole Slide Image AnalysisPoster36 citations
- How to Configure Good In-Context Sequence for Visual Question AnsweringPoster36 citations
- Language Models as Black-Box Optimizers for Vision-Language ModelsPoster36 citations
- MCD: Diverse Large-Scale Multi-Campus Dataset for Robot PerceptionHighlight36 citations
- MuseChat: A Conversational Music Recommendation System for VideosHighlight36 citations
- PhyScene: Physically Interactable 3D Scene Synthesis for Embodied AIHighlight36 citations
- SAI3D: Segment Any Instance in 3D ScenesPoster36 citations
- Shadows Don't Lie and Lines Can't Bend! Generative Models don't know Projective Geometry...for nowPoster36 citations
- TokenHMR: Advancing Human Mesh Recovery with a Tokenized Pose RepresentationPoster36 citations
- Toward Generalist Anomaly Detection via In-context Residual Learning with Few-shot Sample PromptsPoster36 citations
- VRP-SAM: SAM with Visual Reference PromptPoster36 citations
- Video Interpolation with Diffusion ModelsPoster36 citations
- AVID: Any-Length Video Inpainting with Diffusion ModelPoster35 citations
- ChatScene: Knowledge-Enabled Safety-Critical Scenario Generation for Autonomous VehiclesPoster35 citations
- ECoDepth: Effective Conditioning of Diffusion Models for Monocular Depth EstimationPoster35 citations
- Free3D: Consistent Novel View Synthesis without 3D RepresentationPoster35 citations
- Hourglass Tokenizer for Efficient Transformer-Based 3D Human Pose EstimationHighlight35 citations
- Lodge: A Coarse to Fine Diffusion Network for Long Dance Generation Guided by the Characteristic Dance PrimitivesPoster35 citations
- MuRF: Multi-Baseline Radiance FieldsPoster35 citations
- On the Content Bias in Frechet Video DistancePoster35 citations
- SceneFun3D: Fine-Grained Functionality and Affordance Understanding in 3D ScenesPoster35 citations
- SpikingResformer: Bridging ResNet and Vision Transformer in Spiking Neural NetworksPoster35 citations
- Text Prompt with Normality Guidance for Weakly Supervised Video Anomaly DetectionPoster35 citations
- ViVid-1-to-3: Novel View Synthesis with Video Diffusion ModelsHighlight35 citations
- VoCo: A Simple-yet-Effective Volume Contrastive Learning Framework for 3D Medical Image AnalysisPoster35 citations
- Aligning and Prompting Everything All at Once for Universal Visual PerceptionPoster34 citations
- CAMixerSR: Only Details Need More "Attention"Poster34 citations
- CFPL-FAS: Class Free Prompt Learning for Generalizable Face Anti-spoofingHighlight34 citations
- CricaVPR: Cross-image Correlation-aware Representation Learning for Visual Place RecognitionPoster34 citations
- Describing Differences in Image Sets with Natural LanguagePoster34 citations
- DreamControl: Control-Based Text-to-3D Generation with 3D Self-PriorPoster34 citations
- End-to-End Temporal Action Detection with 1B Parameters Across 1000 FramesPoster34 citations
- Exploiting Style Latent Flows for Generalizing Deepfake Video DetectionPoster34 citations
- FINER: Flexible Spectral-bias Tuning in Implicit NEural Representation by Variable-periodic Activation FunctionsPoster34 citations
- Feature Re-Embedding: Towards Foundation Model-Level Performance in Computational PathologyPoster34 citations
- GoMAvatar: Efficient Animatable Human Modeling from Monocular Video Using Gaussians-on-MeshPoster34 citations
- Hierarchical Spatio-temporal Decoupling for Text-to-Video GenerationPoster34 citations
- Masked Autoencoders for Microscopy are Scalable Learners of Cellular BiologyHighlight34 citations
- MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D WorldPoster34 citations
- One Prompt Word is Enough to Boost Adversarial Robustness for Pre-trained Vision-Language ModelsPoster34 citations
- Open-Vocabulary Video Anomaly DetectionPoster34 citations
- Quilt-LLaVA: Visual Instruction Tuning by Extracting Localized Narratives from Open-Source Histopathology VideosPoster34 citations
- SAFDNet: A Simple and Effective Network for Fully Sparse 3D Object DetectionPoster34 citations
- SPAD: Spatially Aware Multi-View DiffusersPoster34 citations
- Scaling Laws for Data Filtering-- Data Curation cannot be Compute AgnosticPoster34 citations
- Structure-Aware Sparse-View X-ray 3D ReconstructionPoster34 citations
- TextureDreamer: Image-Guided Texture Synthesis Through Geometry-Aware DiffusionPoster34 citations
- Transcending the Limit of Local Window: Advanced Super-Resolution Transformer with Adaptive Token DictionaryPoster34 citations
- Vlogger: Make Your Dream A VlogPoster34 citations
- Zero-Reference Low-Light Enhancement via Physical Quadruple PriorsPoster34 citations
- ArGue: Attribute-Guided Prompt Tuning for Vision-Language ModelsPoster33 citations
- CLIP-KD: An Empirical Study of CLIP Model DistillationPoster33 citations
- Direct2.5: Diverse Text-to-3D Generation via Multi-view 2.5D DiffusionPoster33 citations
- Koala: Key Frame-Conditioned Long Video-LLMHighlight33 citations
- LLMs are Good Action RecognizersPoster33 citations
- NeRFiller: Completing Scenes via Generative 3D InpaintingPoster33 citations
- PIGEON: Predicting Image GeolocationsHighlight33 citations
- Telling Left from Right: Identifying Geometry-Aware Semantic CorrespondencePoster33 citations
- Test-Time Domain Generalization for Face Anti-SpoofingPoster33 citations
- Volumetric Environment Representation for Vision-Language NavigationHighlight33 citations
- WOUAF: Weight Modulation for User Attribution and Fingerprinting in Text-to-Image Diffusion ModelsPoster33 citations
- AvatarGPT: All-in-One Framework for Motion Understanding Planning Generation and BeyondPoster32 citations
- Consistent3D: Towards Consistent High-Fidelity Text-to-3D Generation with Deterministic Sampling PriorPoster32 citations
- EpiDiff: Enhancing Multi-View Synthesis via Localized Epipolar-Constrained DiffusionPoster32 citations
- FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head ModelsPoster32 citations
- HPNet: Dynamic Trajectory Forecasting with Historical Prediction AttentionPoster32 citations
- Jack of All Tasks Master of Many: Designing General-Purpose Coarse-to-Fine Vision-Language ModelHighlight32 citations
- Let's Think Outside the Box: Exploring Leap-of-Thought in Large Language Models with Creative Humor GenerationPoster32 citations
- MP5: A Multi-modal Open-ended Embodied System in Minecraft via Active PerceptionPoster32 citations
- MoReVQA: Exploring Modular Reasoning Models for Video Question AnsweringPoster32 citations
- MotionEditor: Editing Video Motion via Content-Aware DiffusionPoster32 citations
- Open-Vocabulary Segmentation with Semantic-Assisted CalibrationPoster32 citations
- OpenBias: Open-set Bias Detection in Text-to-Image Generative ModelsHighlight32 citations
- Selective Hourglass Mapping for Universal Image Restoration Based on Diffusion ModelPoster32 citations
- SiTH: Single-view Textured Human Reconstruction with Image-Conditioned DiffusionPoster32 citations
- Towards Text-guided 3D Scene CompositionPoster32 citations
- Visual In-Context PromptingPoster32 citations
- ZONE: Zero-Shot Instruction-Guided Local EditingPoster32 citations
- ControlRoom3D: Room Generation using Semantic Proxy RoomsPoster31 citations
- Depth Information Assisted Collaborative Mutual Promotion Network for Single Image DehazingPoster31 citations
- DiffuseMix: Label-Preserving Data Augmentation with Diffusion ModelsPoster31 citations
- Focus on Your Instruction: Fine-grained and Multi-instruction Image Editing by Attention ModulationPoster31 citations
- Learned Representation-Guided Diffusion Models for Large-Image GenerationPoster31 citations
- Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-IdentificationPoster31 citations
- ParameterNet: Parameters Are All You Need for Large-scale Visual Pretraining of Mobile NetworksPoster31 citations
- PatchFusion: An End-to-End Tile-Based Framework for High-Resolution Monocular Metric Depth EstimationPoster31 citations
- PointOBB: Learning Oriented Object Detection via Single Point SupervisionPoster31 citations
- Salience DETR: Enhancing Detection Transformer with Hierarchical Salience Filtering RefinementPoster31 citations
- SeD: Semantic-Aware Discriminator for Image Super-ResolutionPoster31 citations
- Smooth Diffusion: Crafting Smooth Latent Spaces in Diffusion ModelsPoster31 citations
- TFMQ-DM: Temporal Feature Maintenance Quantization for Diffusion ModelsHighlight31 citations
- Zero-TPrune: Zero-Shot Token Pruning through Leveraging of the Attention Graph in Pre-Trained TransformersPoster31 citations
- BEVNeXt: Reviving Dense BEV Frameworks for 3D Object DetectionPoster30 citations
- Bilateral Propagation Network for Depth CompletionPoster30 citations
- C2KD: Bridging the Modality Gap for Cross-Modal Knowledge DistillationHighlight30 citations
- CLIP as RNN: Segment Countless Visual Concepts without Training EndeavorPoster30 citations
- Cam4DOcc: Benchmark for Camera-Only 4D Occupancy Forecasting in Autonomous Driving ApplicationsPoster30 citations
- CommonCanvas: Open Diffusion Models Trained on Creative-Commons ImagesPoster30 citations
- Consistent Prompting for Rehearsal-Free Continual LearningPoster30 citations
- DAP: A Dynamic Adversarial Patch for Evading Person DetectorsPoster30 citations
- Digital Life Project: Autonomous 3D Characters with Social IntelligencePoster30 citations
- Driving Everywhere with Large Language Model Policy AdaptationPoster30 citations
- Efficient Dataset Distillation via Minimax DiffusionPoster30 citations
- Generative Proxemics: A Prior for 3D Social Interaction from ImagesPoster30 citations
- MS-DETR: Efficient DETR Training with Mixed SupervisionPoster30 citations
- MTLoRA: Low-Rank Adaptation Approach for Efficient Multi-Task LearningHighlight30 citations
- MoCha-Stereo: Motif Channel Attention Network for Stereo MatchingPoster30 citations
- MonoCD: Monocular 3D Object Detection with Complementary DepthsPoster30 citations
- Open3DSG: Open-Vocabulary 3D Scene Graphs from Point Clouds with Queryable Objects and Open-Set RelationshipsPoster30 citations
- Polos: Multimodal Metric Learning from Human Feedback for Image CaptioningHighlight30 citations
- RCooper: A Real-world Large-scale Dataset for Roadside Cooperative PerceptionPoster30 citations
- SceneTex: High-Quality Texture Synthesis for Indoor Scenes via Diffusion PriorsHighlight30 citations
- Transcriptomics-guided Slide Representation Learning in Computational PathologyPoster30 citations
- Tri-Perspective View Decomposition for Geometry-Aware Depth CompletionPoster30 citations
- UFineBench: Towards Text-based Person Retrieval with Ultra-fine GranularityPoster30 citations
- A Vision Check-up for Language ModelsHighlight29 citations
- Breathing Life Into Sketches Using Text-to-Video PriorsHighlight29 citations
- C3: High-Performance and Low-Complexity Neural Compression from a Single Image or VideoPoster29 citations
- CLOVA: A Closed-LOop Visual Assistant with Tool Usage and UpdatePoster29 citations
- Decoupling Static and Hierarchical Motion Perception for Referring Video SegmentationPoster29 citations
- Dual Memory Networks: A Versatile Adaptation Approach for Vision-Language ModelsPoster29 citations
- FreeControl: Training-Free Spatial Control of Any Text-to-Image Diffusion Model with Any ConditionPoster29 citations
- Generalized Large-Scale Data Condensation via Various Backbone and Statistical MatchingHighlight29 citations
- HOLD: Category-agnostic 3D Reconstruction of Interacting Hands and Objects from VideoHighlight29 citations
- IMPRINT: Generative Object Compositing by Learning Identity-Preserving RepresentationPoster29 citations
- Improving the Generalization of Segmentation Foundation Model under Distribution Shift via Weakly Supervised AdaptationPoster29 citations
- LAA-Net: Localized Artifact Attention Network for Quality-Agnostic and Generalizable Deepfake DetectionPoster29 citations
- LaRE^2: Latent Reconstruction Error Based Method for Diffusion-Generated Image DetectionPoster29 citations
- MMA: Multi-Modal Adapter for Vision-Language ModelsPoster29 citations
- MindBridge: A Cross-Subject Brain Decoding FrameworkHighlight29 citations
- Multimodal Representation Learning by Alternating Unimodal AdaptationPoster29 citations
- NeRF On-the-go: Exploiting Uncertainty for Distractor-free NeRFs in the WildPoster29 citations
- OA-CNNs: Omni-Adaptive Sparse CNNs for 3D Semantic SegmentationPoster29 citations
- On the Test-Time Zero-Shot Generalization of Vision-Language Models: Do We Really Need Prompt Learning?Poster29 citations
- Plug and Play Active Learning for Object DetectionPoster29 citations
- Seamless Human Motion Composition with Blended Positional EncodingsPoster29 citations
- CAT-DM: Controllable Accelerated Virtual Try-on with Diffusion ModelPoster28 citations
- Frequency-Adaptive Dilated Convolution for Semantic SegmentationHighlight28 citations
- From SAM to CAMs: Exploring Segment Anything Model for Weakly Supervised Semantic SegmentationPoster28 citations
- Improving Image Restoration through Removing Degradations in Textual RepresentationsPoster28 citations
- Inter-X: Towards Versatile Human-Human Interaction AnalysisPoster28 citations
- LEAP-VO: Long-term Effective Any Point Tracking for Visual OdometryPoster28 citations
- MGMap: Mask-Guided Learning for Online Vectorized HD Map ConstructionPoster28 citations
- Matching Anything by Segmenting AnythingHighlight28 citations
- Neural Markov Random Field for Stereo MatchingPoster28 citations
- OmniParser: A Unified Framework for Text Spotting Key Information Extraction and Table RecognitionPoster28 citations
- OmniSeg3D: Omniversal 3D Segmentation via Hierarchical Contrastive LearningPoster28 citations
- PEM: Prototype-based Efficient MaskFormer for Image SegmentationPoster28 citations
- PerceptionGPT: Effectively Fusing Visual Perception into LLMHighlight28 citations
- S2MAE: A Spatial-Spectral Pretraining Foundation Model for Spectral Remote Sensing DataPoster28 citations
- SDDGR: Stable Diffusion-based Deep Generative Replay for Class Incremental Object DetectionHighlight28 citations
- SVGDreamer: Text Guided SVG Generation with Diffusion ModelPoster28 citations
- Task-Customized Mixture of Adapters for General Image FusionPoster28 citations
- WorDepth: Variational Language Prior for Monocular Depth EstimationPoster28 citations
- DiffAvatar: Simulation-Ready Garment Optimization with Differentiable SimulationPoster27 citations
- DiffCast: A Unified Framework via Residual Diffusion for Precipitation NowcastingPoster27 citations
- DiffusionAvatars: Deferred Diffusion for High-fidelity 3D Head AvatarsPoster27 citations
- EGTR: Extracting Graph from Transformer for Scene Graph GenerationPoster27 citations
- HanDiffuser: Text-to-Image Generation With Realistic Hand AppearancesPoster27 citations
- Knowledge-Enhanced Dual-stream Zero-shot Composed Image RetrievalPoster27 citations
- MM-Narrator: Narrating Long-form Videos with Multimodal In-Context LearningHighlight27 citations
- MaskClustering: View Consensus based Mask Graph Clustering for Open-Vocabulary 3D Instance SegmentationPoster27 citations
- ModaVerse: Efficiently Transforming Modalities with LLMsPoster27 citations
- Multi-Task Dense Prediction via Mixture of Low-Rank ExpertsPoster27 citations
- NOPE: Novel Object Pose Estimation from a Single ImagePoster27 citations
- One-Prompt to Segment All Medical ImagesPoster27 citations
- SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion TransformerPoster27 citations
- Towards Realistic Scene Generation with LiDAR Diffusion ModelsPoster27 citations
- UnScene3D: Unsupervised 3D Instance Segmentation for Indoor ScenesPoster27 citations
- Unsupervised Universal Image SegmentationPoster27 citations
- VicTR: Video-conditioned Text Representations for Activity RecognitionPoster27 citations
- A Simple Recipe for Contrastively Pre-training Video-First Encoders Beyond 16 FramesPoster26 citations
- Accelerating Diffusion Sampling with Optimized Time StepsPoster26 citations
- Beyond First-Order Tweedie: Solving Inverse Problems using Latent DiffusionPoster26 citations
- Coarse-to-Fine Latent Diffusion for Pose-Guided Person Image SynthesisHighlight26 citations
- Correlation-aware Coarse-to-fine MLPs for Deformable Medical Image RegistrationPoster26 citations
- DetDiffusion: Synergizing Generative and Perceptive Models for Enhanced Data Generation and PerceptionPoster26 citations
- Diffusion 3D Features (Diff3F): Decorating Untextured Shapes with Distilled Semantic FeaturesPoster26 citations
- EMOPortraits: Emotion-enhanced Multimodal One-shot Head AvatarsPoster26 citations
- Gradient Reweighting: Towards Imbalanced Class-Incremental LearningPoster26 citations
- Grounded Question-Answering in Long Egocentric VideosPoster26 citations
- Hunting Attributes: Context Prototype-Aware Learning for Weakly Supervised Semantic SegmentationPoster26 citations
- Instruct-ReID: A Multi-purpose Person Re-identification Task with InstructionsPoster26 citations
- LoCoNet: Long-Short Context Network for Active Speaker DetectionPoster26 citations
- MRFS: Mutually Reinforcing Image Fusion and SegmentationPoster26 citations
- Pixel-Aligned Language ModelPoster26 citations
- Posterior Distillation SamplingPoster26 citations
- Progressive Semantic-Guided Vision Transformer for Zero-Shot LearningPoster26 citations
- Readout Guidance: Learning Control from Diffusion FeaturesHighlight26 citations
- Score-Guided Diffusion for 3D Human RecoveryPoster26 citations
- Shallow-Deep Collaborative Learning for Unsupervised Visible-Infrared Person Re-IdentificationPoster26 citations
- SingularTrajectory: Universal Trajectory Predictor Using Diffusion ModelPoster26 citations
- Unleashing the Potential of SAM for Medical Adaptation via Hierarchical DecodingPoster26 citations
- Visual Programming for Zero-shot Open-Vocabulary 3D Visual GroundingPoster26 citations
- Beyond Text: Frozen Large Language Models in Visual Signal ComprehensionPoster25 citations
- Contrastive Denoising Score for Text-guided Latent Diffusion Image EditingPoster25 citations
- EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World ComprehensionPoster25 citations
- Fairy: Fast Parallelized Instruction-Guided Video-to-Video SynthesisPoster25 citations
- GP-NeRF: Generalized Perception NeRF for Context-Aware 3D Scene UnderstandingHighlight25 citations
- Gradient Alignment for Cross-Domain Face Anti-SpoofingPoster25 citations
- ID-like Prompt Learning for Few-Shot Out-of-Distribution DetectionPoster25 citations
- Learning Transferable Negative Prompts for Out-of-Distribution DetectionPoster25 citations
- MeaCap: Memory-Augmented Zero-shot Image CaptioningPoster25 citations
- Orthogonal Adaptation for Modular Customization of Diffusion ModelsHighlight25 citations
- PIE-NeRF: Physics-based Interactive Elastodynamics with NeRFPoster25 citations
- Pre-trained Vision and Language Transformers Are Few-Shot Incremental LearnersPoster25 citations
- Rethinking Diffusion Model for Multi-Contrast MRI Super-ResolutionPoster25 citations
- SCEdit: Efficient and Controllable Image Diffusion Generation via Skip Connection EditingHighlight25 citations
- SD4Match: Learning to Prompt Stable Diffusion Model for Semantic MatchingPoster25 citations
- Unleashing Unlabeled Data: A Paradigm for Cross-View Geo-LocalizationPoster25 citations
- pix2gestalt: Amodal Segmentation by Synthesizing WholesHighlight25 citations
- Boosting Image Quality Assessment through Efficient Transformer Adaptation with Local Feature EnhancementPoster24 citations
- DiffusionLight: Light Probes for Free by Painting a Chrome BallPoster24 citations
- Frozen CLIP: A Strong Backbone for Weakly Supervised Semantic SegmentationHighlight24 citations
- HIMap: HybrId Representation Learning for End-to-end Vectorized HD Map ConstructionPoster24 citations
- Improved Zero-Shot Classification by Adapting VLMs with Text DescriptionsPoster24 citations
- Infinigen Indoors: Photorealistic Indoor Scenes using Procedural GenerationPoster24 citations
- InteractDiffusion: Interaction Control in Text-to-Image Diffusion ModelsPoster24 citations
- KTPFormer: Kinematics and Trajectory Prior Knowledge-Enhanced Transformer for 3D Human Pose EstimationPoster24 citations
- Learning Multi-Dimensional Human Preference for Text-to-Image GenerationPoster24 citations
- Light the Night: A Multi-Condition Diffusion Framework for Unpaired Low-Light Enhancement in Autonomous DrivingPoster24 citations
- Mosaic-SDF for 3D Generative ModelsPoster24 citations
- On Exact Inversion of DPM-SolversPoster24 citations
- OrCo: Towards Better Generalization via Orthogonality and Contrast for Few-Shot Class-Incremental LearningHighlight24 citations
- Pre-trained Model Guided Fine-Tuning for Zero-Shot Adversarial RobustnessPoster24 citations
- Revamping Federated Learning Security from a Defender's Perspective: A Unified Defense with Homomorphic Encrypted Data SpacePoster24 citations
- Segment and Caption AnythingPoster24 citations
- Source-Free Domain Adaptation with Frozen Multimodal Foundation ModelPoster24 citations
- Sparse Semi-DETR: Sparse Learnable Queries for Semi-Supervised Object DetectionPoster24 citations
- Text2HOI: Text-guided 3D Motion Generation for Hand-Object InteractionPoster24 citations
- Towards Scalable 3D Anomaly Detection and Localization: A Benchmark via 3D Anomaly Synthesis and A Self-Supervised Learning NetworkPoster24 citations
- ZERO-IG: Zero-Shot Illumination-Guided Joint Denoising and Adaptive Enhancement for Low-Light ImagesPoster24 citations
- 360DVD: Controllable Panorama Video Generation with 360-Degree Video Diffusion ModelPoster23 citations
- 3D Facial Expressions through Analysis-by-Neural-SynthesisPoster23 citations
- A Dynamic Kernel Prior Model for Unsupervised Blind Image Super-ResolutionPoster23 citations
- Adaptive Bidirectional Displacement for Semi-Supervised Medical Image SegmentationPoster23 citations
- Amodal Ground Truth and Completion in the WildPoster23 citations
- Atlantis: Enabling Underwater Depth Estimation with Stable DiffusionHighlight23 citations
- Continual Self-supervised Learning: Towards Universal Multi-modal Medical Data Representation LearningHighlight23 citations
- Diff-Plugin: Revitalizing Details for Diffusion-based Low-level TasksPoster23 citations
- ExACT: Language-guided Conceptual Reasoning and Uncertainty Estimation for Event-based Action Recognition and MoreHighlight23 citations
- FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video TranslationPoster23 citations
- Global and Local Prompts Cooperation via Optimal Transport for Federated LearningPoster23 citations
- Intrinsic Image Diffusion for Indoor Single-view Material EstimationPoster23 citations
- MAPLM: A Real-World Large-Scale Vision-Language Benchmark for Map and Traffic Scene UnderstandingPoster23 citations
- MatFuse: Controllable Material Generation with Diffusion ModelsPoster23 citations
- MemFlow: Optical Flow Estimation and Prediction with MemoryPoster23 citations
- Mirasol3B: A Multimodal Autoregressive Model for Time-Aligned and Contextual ModalitiesPoster23 citations
- Multimodal Industrial Anomaly Detection by Crossmodal Feature MappingPoster23 citations
- Not All Voxels Are Equal: Hardness-Aware Semantic Scene Completion with Self-DistillationPoster23 citations
- Physical 3D Adversarial Attacks against Monocular Depth Estimation in Autonomous DrivingPoster23 citations
- Question Aware Vision Transformer for Multimodal ReasoningHighlight23 citations
- Robust Emotion Recognition in Context DebiasingPoster23 citations
- SatSynth: Augmenting Image-Mask Pairs through Diffusion Models for Aerial Semantic SegmentationPoster23 citations
- SecondPose: SE(3)-Consistent Dual-Stream Feature Fusion for Category-Level Pose EstimationPoster23 citations
- Separate and Conquer: Decoupling Co-occurrence via Decomposition and Representation for Weakly Supervised Semantic SegmentationPoster23 citations
- SocialCircle: Learning the Angle-based Social Interaction Representation for Pedestrian Trajectory PredictionPoster23 citations
- Three Pillars Improving Vision Foundation Model Distillation for LidarPoster23 citations
- Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot LearningPoster23 citations
- View-decoupled Transformer for Person Re-identification under Aerial-ground Camera NetworkPoster23 citations
- BigGait: Learning Gait Representation You Want by Large Vision ModelsPoster22 citations
- Bridging Remote Sensors with Multisensor Geospatial Foundation ModelsPoster22 citations
- CapHuman: Capture Your Moments in Parallel UniversesPoster22 citations
- Control4D: Efficient 4D Portrait Editing with TextPoster22 citations
- Do You Remember? Dense Video Captioning with Cross-Modal Memory RetrievalPoster22 citations
- Drag Your Noise: Interactive Point-based Editing via Diffusion Semantic PropagationPoster22 citations
- ExtDM: Distribution Extrapolation Diffusion Model for Video PredictionPoster22 citations
- Few-Shot Object Detection with Foundation ModelsPoster22 citations
- From Pixels to Graphs: Open-Vocabulary Scene Graph Generation with Vision-Language ModelsPoster22 citations
- GenZI: Zero-Shot 3D Human-Scene Interaction GenerationPoster22 citations
- Hide in Thicket: Generating Imperceptible and Rational Adversarial Perturbations on 3D Point CloudsPoster22 citations
- Learning Object State Changes in Videos: An Open-World PerspectivePoster22 citations
- Learning Occupancy for Monocular 3D Object DetectionPoster22 citations
- Learning to Localize Objects Improves Spatial Reasoning in Visual-LLMsPoster22 citations
- MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language TransformerPoster22 citations
- Make-Your-Anchor: A Diffusion-based 2D Avatar Generation FrameworkPoster22 citations
- Multi-Space Alignments Towards Universal LiDAR SegmentationPoster22 citations
- Neural Parametric Gaussians for Monocular Non-Rigid Object ReconstructionPoster22 citations
- On the Scalability of Diffusion-based Text-to-Image GenerationPoster22 citations
- Point Cloud Pre-training with Diffusion ModelsPoster22 citations
- Producing and Leveraging Online Map Uncertainty in Trajectory PredictionPoster22 citations
- Rethinking the Objectives of Vector-Quantized Tokenizers for Image SynthesisPoster22 citations
- Sieve: Multimodal Dataset Pruning using Image Captioning ModelsPoster22 citations
- SonicVisionLM: Playing Sound with Vision Language ModelsPoster22 citations
- Synthesize Diagnose and Optimize: Towards Fine-Grained Vision-Language UnderstandingPoster22 citations
- Tactile-Augmented Radiance FieldsPoster22 citations
- Taming Mode Collapse in Score Distillation for Text-to-3D GenerationPoster22 citations
- Towards Language-Driven Video Inpainting via Multimodal Large Language ModelsPoster22 citations
- UnO: Unsupervised Occupancy Fields for Perception and ForecastingPoster22 citations
- UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and MemoryPoster22 citations
- Adaptive Fusion of Single-View and Multi-View Depth for Autonomous DrivingPoster21 citations
- ArtAdapter: Text-to-Image Style Transfer using Multi-Level Style Encoder and Explicit AdaptationPoster21 citations
- As-Plausible-As-Possible: Plausibility-Aware Mesh Deformation Using 2D Diffusion PriorsPoster21 citations
- BoQ: A Place is Worth a Bag of Learnable QueriesPoster21 citations
- CONFORM: Contrast is All You Need for High-Fidelity Text-to-Image Diffusion ModelsPoster21 citations
- Depth-Aware Concealed Crop Detection in Dense Agricultural ScenesPoster21 citations
- DiffMOT: A Real-time Diffusion-based Multiple Object Tracker with Non-linear PredictionPoster21 citations
- Discovering and Mitigating Visual Biases through Keyword ExplanationHighlight21 citations
- ECLIPSE: A Resource-Efficient Text-to-Image Prior for Image GenerationsPoster21 citations
- Efficient Multi-scale Network with Learnable Discrete Wavelet Transform for Blind Motion DeblurringPoster21 citations
- Egocentric Whole-Body Motion Capture with FisheyeViT and Diffusion-Based Motion RefinementPoster21 citations
- EmoGen: Emotional Image Content Generation with Text-to-Image Diffusion ModelsPoster21 citations
- Emotional Speech-driven 3D Body Animation via Disentangled Latent DiffusionPoster21 citations
- End-to-End Spatio-Temporal Action Localisation with Video TransformersPoster21 citations
- Fair Federated Learning under Domain Skew with Local Consistency and Domain DiversityPoster21 citations
- FairRAG: Fair Human Generation via Fair Retrieval AugmentationPoster21 citations
- Frequency Decoupling for Motion Magnification via Multi-Level Isomorphic ArchitecturePoster21 citations
- Frequency-aware Event-based Video Deblurring for Real-World Motion BlurPoster21 citations
- HOIDiffusion: Generating Realistic 3D Hand-Object Interaction DataPoster21 citations
- HybridNeRF: Efficient Neural Rendering via Adaptive Volumetric SurfacesHighlight21 citations
- Image Restoration by Denoising Diffusion Models with Iteratively Preconditioned GuidancePoster21 citations
- Interactive Continual Learning: Fast and Slow ThinkingPoster21 citations
- It's All About Your Sketch: Democratising Sketch Control in Diffusion ModelsPoster21 citations
- Link-Context Learning for Multimodal LLMsPoster21 citations
- MAS: Multi-view Ancestral Sampling for 3D Motion Generation Using 2D DiffusionPoster21 citations
- MoPE-CLIP: Structured Pruning for Efficient Vision-Language Models with Module-wise Pruning Error MetricPoster21 citations
- Motion-adaptive Separable Collaborative Filters for Blind Motion DeblurringPoster21 citations
- Nearest is Not Dearest: Towards Practical Defense against Quantization-conditioned Backdoor AttacksPoster21 citations
- OMG: Towards Open-vocabulary Motion Generation via Mixture of ControllersPoster21 citations
- Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank ExpertsHighlight21 citations
- One-Shot Open Affordance Learning with Foundation ModelsPoster21 citations
- RadarDistill: Boosting Radar-based Object Detection Performance via Knowledge Distillation from LiDAR FeaturesPoster21 citations
- Scaling Diffusion Models to Real-World 3D LiDAR Scene CompletionPoster21 citations
- TACO: Benchmarking Generalizable Bimanual Tool-ACtion-Object UnderstandingPoster21 citations
- Towards Accurate Post-training Quantization for Diffusion ModelsHighlight21 citations
- Vision-and-Language Navigation via Causal LearningPoster21 citations
- Visual Anagrams: Generating Multi-View Optical Illusions with Diffusion ModelsPoster21 citations
- What If the TV Was Off? Examining Counterfactual Reasoning Abilities of Multi-modal Language ModelsPoster21 citations
- ZeroRF: Fast Sparse View 360deg Reconstruction with Zero PretrainingPoster21 citations
- ZeroShape: Regression-based Zero-shot Shape ReconstructionPoster21 citations
- 3D Paintbrush: Local Stylization of 3D Shapes with Cascaded Score DistillationPoster20 citations
- AiOS: All-in-One-Stage Expressive Human Pose and Shape EstimationPoster20 citations
- Alchemist: Parametric Control of Material Properties with Diffusion ModelsPoster20 citations
- AllSpark: Reborn Labeled Features from Unlabeled in Transformer for Semi-Supervised Semantic SegmentationPoster20 citations
- An Upload-Efficient Scheme for Transferring Knowledge From a Server-Side Pre-trained Generator to Clients in Heterogeneous Federated LearningPoster20 citations
- AnySkill: Learning Open-Vocabulary Physical Skill for Interactive AgentsPoster20 citations
- BA-SAM: Scalable Bias-Mode Attention Mask for Segment Anything ModelPoster20 citations
- Boosting Diffusion Models with Moving Average Sampling in Frequency DomainPoster20 citations
- CFAT: Unleashing Triangular Windows for Image Super-resolutionHighlight20 citations
- Can Language Beat Numerical Regression? Language-Based Multimodal Trajectory PredictionPoster20 citations
- DiffForensics: Leveraging Diffusion Prior to Image Forgery Detection and LocalizationPoster20 citations
- Diffusion Handles Enabling 3D Edits for Diffusion Models by Lifting Activations to 3DHighlight20 citations
- EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language ModelsHighlight20 citations
- Equivariant Plug-and-Play Image ReconstructionPoster20 citations
- Federated Generalized Category DiscoveryPoster20 citations
- FlowDiffuser: Advancing Optical Flow Estimation with Diffusion ModelsHighlight20 citations
- FlowVQTalker: High-Quality Emotional Talking Face Generation through Normalizing Flow and QuantizationPoster20 citations
- GOAT-Bench: A Benchmark for Multi-Modal Lifelong NavigationPoster20 citations
- HIR-Diff: Unsupervised Hyperspectral Image Restoration Via Improved Diffusion ModelsPoster20 citations
- HRVDA: High-Resolution Visual Document AssistantPoster20 citations
- HarmonyView: Harmonizing Consistency and Diversity in One-Image-to-3DPoster20 citations
- ICP-Flow: LiDAR Scene Flow Estimation with ICPPoster20 citations
- InitNO: Boosting Text-to-Image Diffusion Models via Initial Noise OptimizationPoster20 citations
- Intraoperative 2D/3D Image Registration via Differentiable X-ray RenderingPoster20 citations
- JeDi: Joint-Image Diffusion Models for Finetuning-Free Personalized Text-to-Image GenerationPoster20 citations
- LP++: A Surprisingly Strong Linear Probe for Few-Shot CLIPPoster20 citations
- Language-driven Grasp DetectionPoster20 citations
- Learning Diffusion Texture Priors for Image RestorationHighlight20 citations
- Mask Grounding for Referring Image SegmentationPoster20 citations
- Multi-Scale Video Anomaly Detection by Multi-Grained Spatio-Temporal Representation LearningHighlight20 citations
- Neural Clustering based Visual Representation LearningPoster20 citations
- Neural Sign Actors: A Diffusion Model for 3D Sign Language Production from TextPoster20 citations
- Relightable and Animatable Neural Avatar from Sparse-View VideoHighlight20 citations
- Resurrecting Old Classes with New Data for Exemplar-Free Continual LearningPoster20 citations
- Revisiting the Domain Shift and Sample Uncertainty in Multi-source Active Domain TransferPoster20 citations
- SPOC: Imitating Shortest Paths in Simulation Enables Effective Navigation and Manipulation in the Real WorldPoster20 citations
- See Say and Segment: Teaching LMMs to Overcome False PremisesPoster20 citations
- ViTamin: Designing Scalable Vision Models in the Vision-Language EraPoster20 citations
- 3D Human Pose Perception from Egocentric Stereo VideosHighlight19 citations
- AutoAD III: The Prequel - Back to the PixelsPoster19 citations
- CAGE: Controllable Articulation GEnerationPoster19 citations
- Class Tokens Infusion for Weakly Supervised Semantic SegmentationPoster19 citations
- Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion ModelPoster19 citations
- Collaborative Semantic Occupancy Prediction with Hybrid Feature Fusion in Connected Automated VehiclesPoster19 citations
- DiPrompT: Disentangled Prompt Tuning for Multiple Latent Domain Generalization in Federated LearningPoster19 citations
- DiffusionTrack: Point Set Diffusion Model for Visual Object TrackingPoster19 citations
- Dual Prototype Attention for Unsupervised Video Object SegmentationPoster19 citations
- Dynamic Prompt Optimizing for Text-to-Image GenerationPoster19 citations
- Each Test Image Deserves A Specific Prompt: Continual Test-Time Adaptation for 2D Medical Image SegmentationPoster19 citations
- Enhancing Multimodal Cooperation via Sample-level Modality ValuationPoster19 citations
- FakeInversion: Learning to Detect Images from Unseen Text-to-Image Models by Inverting Stable DiffusionPoster19 citations
- Generating Human Motion in 3D Scenes from Text DescriptionsPoster19 citations
- Gradient-based Parameter Selection for Efficient Fine-TuningPoster19 citations
- Image Processing GNN: Breaking Rigidity in Super-ResolutionPoster19 citations
- Implicit Discriminative Knowledge Learning for Visible-Infrared Person Re-IdentificationPoster19 citations
- Insect-Foundation: A Foundation Model and Large-scale 1M Dataset for Visual Insect UnderstandingHighlight19 citations
- Just Add ?! Pose Induced Video Transformers for Understanding Activities of Daily LivingPoster19 citations
- LEAD: Learning Decomposition for Source-free Universal Domain AdaptationPoster19 citations
- LEMON: Learning 3D Human-Object Interaction Relation from 2D ImagesPoster19 citations
- Learning Correlation Structures for Vision TransformersPoster19 citations
- Learning the 3D Fauna of the WebPoster19 citations
- MVD-Fusion: Single-view 3D via Depth-consistent Multi-view GenerationPoster19 citations
- MVHumanNet: A Large-scale Dataset of Multi-view Daily Dressing Human CapturesPoster19 citations
- Matching 2D Images in 3D: Metric Relative Pose from Metric CorrespondencesPoster19 citations
- Mitigating Motion Blur in Neural Radiance Fields with Events and FramesPoster19 citations
- MonoNPHM: Dynamic Head Reconstruction from Monocular VideosHighlight19 citations
- Multi-Modal Proxy Learning Towards Personalized Visual Multiple ClusteringPoster19 citations
- Multi-modal Instruction Tuned LLMs with Fine-grained Visual PerceptionHighlight19 citations
- MultiDiff: Consistent Novel View Synthesis from a Single ImagePoster19 citations
- Neural Redshift: Random Networks are not Random FunctionsPoster19 citations
- OmniViD: A Generative Framework for Universal Video UnderstandingPoster19 citations
- PaSCo: Urban 3D Panoptic Scene Completion with Uncertainty AwarenessPoster19 citations
- Portrait4D: Learning One-Shot 4D Head Avatar Synthesis using Synthetic DataPoster19 citations
- Prompt Highlighter: Interactive Control for Multi-Modal LLMsPoster19 citations
- Scene Adaptive Sparse Transformer for Event-based Object DetectionPoster19 citations
- SwitchLight: Co-design of Physics-driven Architecture and Pre-training Framework for Human Portrait RelightingHighlight19 citations
- Text-Driven Image Editing via Learnable RegionsPoster19 citations
- Think Twice Before Selection: Federated Evidential Active Learning for Medical Image Analysis with Domain ShiftsPoster19 citations
- Towards Memorization-Free Diffusion ModelsPoster19 citations
- Transductive Zero-Shot and Few-Shot CLIPHighlight19 citations
- UniVS: Unified and Universal Video Segmentation with Prompts as QueriesPoster19 citations
- Visual-Augmented Dynamic Semantic Prototype for Generative Zero-Shot LearningPoster19 citations
- When StyleGAN Meets Stable Diffusion: a W+ Adapter for Personalized Image GenerationPoster19 citations
- AVFF: Audio-Visual Feature Fusion for Video Deepfake DetectionPoster18 citations
- Adaptive Multi-Modal Cross-Entropy Loss for Stereo MatchingPoster18 citations
- Arbitrary-Scale Image Generation and Upsampling using Latent Diffusion Model and Implicit Neural DecoderPoster18 citations
- CAD-SIGNet: CAD Language Inference from Point Clouds using Layer-wise Sketch Instance Guided AttentionHighlight18 citations
- CRKD: Enhanced Camera-Radar Object Detection with Cross-modality Knowledge DistillationPoster18 citations
- Can't Make an Omelette Without Breaking Some Eggs: Plausible Action Anticipation Using Large Video-Language ModelsPoster18 citations
- Contextrast: Contextual Contrastive Learning for Semantic SegmentationPoster18 citations
- Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional UnderstandingPoster18 citations
- Customization Assistant for Text-to-Image GenerationPoster18 citations
- CyberDemo: Augmenting Simulated Human Demonstration for Real-World Dexterous ManipulationPoster18 citations
- D^4: Dataset Distillation via Disentangled Diffusion ModelPoster18 citations
- Dispel Darkness for Better Fusion: A Controllable Visual Enhancer based on Cross-modal Conditional Adversarial LearningPoster18 citations
- Distilling Vision-Language Models on Millions of VideosPoster18 citations
- Domain-Agnostic Mutual Prompting for Unsupervised Domain AdaptationPoster18 citations
- FACT: Frame-Action Cross-Attention Temporal Modeling for Efficient Action SegmentationPoster18 citations
- FedAS: Bridging Inconsistency in Personalized Federated LearningPoster18 citations
- FinePOSE: Fine-Grained Prompt-Driven 3D Human Pose Estimation via Diffusion ModelsHighlight18 citations
- Fourier Priors-Guided Diffusion for Zero-Shot Joint Low-Light Enhancement and DeblurringPoster18 citations
- Generalizable Whole Slide Image Classification with Fine-Grained Visual-Semantic InteractionPoster18 citations
- HiKER-SGG: Hierarchical Knowledge Enhanced Robust Scene Graph GenerationPoster18 citations
- High-fidelity Person-centric Subject-to-Image SynthesisPoster18 citations
- Implicit Event-RGBD Neural SLAMHighlight18 citations
- Instance-Adaptive and Geometric-Aware Keypoint Learning for Category-Level 6D Object Pose EstimationPoster18 citations
- Iterated Learning Improves Compositionality in Large Vision-Language ModelsPoster18 citations
- KVQ: Kwai Video Quality Assessment for Short-form VideosPoster18 citations
- LASO: Language-guided Affordance Segmentation on 3D ObjectPoster18 citations
- Leveraging Vision-Language Models for Improving Domain Generalization in Image ClassificationPoster18 citations
- LiDAR4D: Dynamic Neural Fields for Novel Space-time View LiDAR SynthesisPoster18 citations
- Localization Is All You Evaluate: Data Leakage in Online Mapping Datasets and How to Fix ItPoster18 citations
- MatSynth: A Modern PBR Materials DatasetPoster18 citations
- MemSAM: Taming Segment Anything Model for Echocardiography Video SegmentationPoster18 citations
- NAYER: Noisy Layer Data Generation for Efficient and Effective Data-free Knowledge DistillationPoster18 citations
- OAKINK2: A Dataset of Bimanual Hands-Object Manipulation in Complex Task CompletionPoster18 citations
- Open-Vocabulary Attention Maps with Token Optimization for Semantic Segmentation in Diffusion ModelsPoster18 citations
- Open-Vocabulary Semantic Segmentation with Image Embedding BalancingPoster18 citations
- PTQ4SAM: Post-Training Quantization for Segment AnythingPoster18 citations
- Privacy-Preserving Face Recognition Using Trainable Feature SubtractionPoster18 citations
- Rethinking Multi-domain Generalization with A General Learning ObjectivePoster18 citations
- Revisiting Adversarial Training at ScalePoster18 citations
- Sculpt3D: Multi-View Consistent Text-to-3D Generation with Sparse 3D PriorPoster18 citations
- Situational Awareness Matters in 3D Vision Language ReasoningPoster18 citations
- SmartRefine: A Scenario-Adaptive Refinement Framework for Efficient Motion PredictionPoster18 citations
- Taming Stable Diffusion for Text to 360 Panorama Image GenerationHighlight18 citations
- TeTriRF: Temporal Tri-Plane Radiance Fields for Efficient Free-Viewpoint VideoPoster18 citations
- Test-Time Adaptation for Depth CompletionPoster18 citations
- TextCraftor: Your Text Encoder Can be Image Quality ControllerPoster18 citations
- Towards Efficient Replay in Federated Incremental LearningPoster18 citations
- Towards Robust Event-guided Low-Light Image Enhancement: A Large-Scale Real-World Event-Image Dataset and Novel ApproachPoster18 citations
- Towards Surveillance Video-and-Language Understanding: New Dataset Baselines and ChallengesPoster18 citations
- Training Generative Image Super-Resolution Models by Wavelet-Domain Losses Enables Better Control of ArtifactsPoster18 citations
- VideoCutLER: Surprisingly Simple Unsupervised Video Instance SegmentationPoster18 citations
- Zero-shot Referring Expression Comprehension via Structural Similarity Between Images and CaptionsPoster18 citations
- Active Generalized Category DiscoveryPoster17 citations
- Addressing Background Context Bias in Few-Shot Segmentation through Iterative ModulationPoster17 citations
- Anomaly Heterogeneity Learning for Open-set Supervised Anomaly DetectionPoster17 citations
- Any-Shift Prompting for Generalization over DistributionsPoster17 citations
- Building Bridges across Spatial and Temporal Resolutions: Reference-Based Super-Resolution via Change Priors and Conditional Diffusion ModelPoster17 citations
- CLiC: Concept Learning in ContextHighlight17 citations
- Cloud-Device Collaborative Learning for Multimodal Large Language ModelsPoster17 citations
- Clustering Propagation for Universal Medical Image SegmentationPoster17 citations
- Contrastive Pre-Training with Multi-View Fusion for No-Reference Point Cloud Quality AssessmentPoster17 citations
- Convolutional Prompting meets Language Models for Continual LearningPoster17 citations
- CosmicMan: A Text-to-Image Foundation Model for HumansHighlight17 citations
- Delving into the Trajectory Long-tail Distribution for Muti-object TrackingPoster17 citations
- Diffusion Time-step Curriculum for One Image to 3D GenerationPoster17 citations
- DiffusionPoser: Real-time Human Motion Reconstruction From Arbitrary Sparse Sensors Using Autoregressive DiffusionPoster17 citations
- DuPL: Dual Student with Trustworthy Progressive Learning for Robust Weakly Supervised Semantic SegmentationPoster17 citations
- EMAGE: Towards Unified Holistic Co-Speech Gesture Generation via Expressive Masked Audio Gesture ModelingPoster17 citations
- EgoGen: An Egocentric Synthetic Data GeneratorPoster17 citations
- Enhance Image Classification via Inter-Class Image Mixup with Diffusion ModelPoster17 citations
- Exploiting Diffusion Prior for Generalizable Dense PredictionPoster17 citations
- FSC: Few-point Shape CompletionPoster17 citations
- FaceChain-ImagineID: Freely Crafting High-Fidelity Diverse Talking Faces from Disentangled AudioPoster17 citations
- FreeCustom: Tuning-Free Customized Image Generation for Multi-Concept CompositionPoster17 citations
- FreeKD: Knowledge Distillation via Semantic Frequency PromptPoster17 citations
- HINTED: Hard Instance Enhanced Detector with Mixed-Density Feature Fusion for Sparsely-Supervised 3D Object DetectionPoster17 citations
- HomoFormer: Homogenized Transformer for Image Shadow RemovalPoster17 citations
- Inlier Confidence Calibration for Point Cloud RegistrationPoster17 citations
- Learning without Exact Guidance: Updating Large-scale High-resolution Land Cover Maps from Low-resolution Historical LabelsHighlight17 citations
- LoSh: Long-Short Text Joint Prediction Network for Referring Video Object SegmentationPoster17 citations
- MetaCloak: Preventing Unauthorized Subject-driven Text-to-image Diffusion-based Synthesis via Meta-learningPoster17 citations
- Modality-agnostic Domain Generalizable Medical Image Segmentation by Multi-Frequency in Multi-Scale AttentionPoster17 citations
- NoiseCLR: A Contrastive Learning Approach for Unsupervised Discovery of Interpretable Directions in Diffusion ModelsPoster17 citations
- Probing Synergistic High-Order Interaction in Infrared and Visible Image FusionPoster17 citations
- Psychometry: An Omnifit Model for Image Reconstruction from Human Brain ActivityPoster17 citations
- RankMatch: Exploring the Better Consistency Regularization for Semi-supervised Semantic SegmentationPoster17 citations
- Rethinking Boundary Discontinuity Problem for Oriented Object DetectionPoster17 citations
- Rethinking the Representation in Federated Unsupervised Learning with Non-IID DataPoster17 citations
- SCoFT: Self-Contrastive Fine-Tuning for Equitable Image GenerationPoster17 citations
- SHAP-EDITOR: Instruction-Guided Latent 3D Editing in SecondsPoster17 citations
- SemCity: Semantic Scene Generation with Triplane DiffusionPoster17 citations
- SocialCounterfactuals: Probing and Mitigating Intersectional Social Biases in Vision-Language Models with Counterfactual ExamplesPoster17 citations
- TAMM: TriAdapter Multi-Modal Learning for 3D Shape UnderstandingPoster17 citations
- Text-to-3D Generation with Bidirectional Diffusion using both 2D and 3D priorsPoster17 citations
- Training-Free Pretrained Model MergingPoster17 citations
- Unified Language-driven Zero-shot Domain AdaptationPoster17 citations
- VP3D: Unleashing 2D Visual Prompt for Text-to-3D GenerationPoster17 citations
- ViLa-MIL: Dual-scale Vision-Language Multiple Instance Learning for Whole Slide Image ClassificationPoster17 citations
- WateRF: Robust Watermarks in Radiance Fields for Protection of CopyrightsPoster17 citations
- 6D-Diff: A Keypoint Diffusion Framework for 6D Object Pose EstimationPoster16 citations
- APSeg: Auto-Prompt Network for Cross-Domain Few-Shot Semantic SegmentationPoster16 citations
- AdaRevD: Adaptive Patch Exiting Reversible Decoder Pushes the Limit of Image DeblurringPoster16 citations
- Balancing Act: Distribution-Guided Debiasing in Diffusion ModelsPoster16 citations
- COCONut: Modernizing COCO SegmentationPoster16 citations
- Communication-Efficient Federated Learning with Accelerated Client GradientPoster16 citations
- Composing Object Relations and Attributes for Image-Text MatchingPoster16 citations
- Constructing and Exploring Intermediate Domains in Mixed Domain Semi-supervised Medical Image SegmentationPoster16 citations
- Context-Guided Spatio-Temporal Video GroundingPoster16 citations
- Context-based and Diversity-driven Specificity in Compositional Zero-Shot LearningPoster16 citations
- Dexterous Grasp TransformerPoster16 citations
- Dual-View Visual Contextualization for Web NavigationPoster16 citations
- Dynamic Inertial Poser (DynaIP): Part-Based Motion Dynamics Learning for Enhanced Human Pose Estimation with Sparse Inertial SensorsPoster16 citations
- EAGLE: Eigen Aggregation Learning for Object-Centric Unsupervised Semantic SegmentationHighlight16 citations
- FMA-Net: Flow-Guided Dynamic Filtering and Iterative Feature Refinement with Multi-Attention for Joint Video Super-Resolution and DeblurringPoster16 citations
- Fantastic Animals and Where to Find Them: Segment Any Marine Animal with Dual SAMHighlight16 citations
- Friendly Sharpness-Aware MinimizationPoster16 citations
- Generative Region-Language Pretraining for Open-Ended Object DetectionPoster16 citations
- How to Handle Sketch-Abstraction in Sketch-Based Image Retrieval?Poster16 citations
- LTGC: Long-tail Recognition via Leveraging LLMs-driven Generated ContentPoster16 citations
- Language-Driven Anchors for Zero-Shot Adversarial RobustnessPoster16 citations
- Language-driven All-in-one Adverse Weather RemovalPoster16 citations
- Learning Background Prompts to Discover Implicit Knowledge for Open Vocabulary Object DetectionPoster16 citations
- LeftRefill: Filling Right Canvas based on Left Reference through Generalized Text-to-Image Diffusion ModelPoster16 citations
- LightIt: Illumination Modeling and Control for Diffusion ModelsPoster16 citations
- Lookahead Exploration with Neural Radiance Representation for Continuous Vision-Language NavigationHighlight16 citations
- LowRankOcc: Tensor Decomposition and Low-Rank Recovery for Vision-based 3D Semantic Occupancy PredictionPoster16 citations
- MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion ModelsHighlight16 citations
- PI3D: Efficient Text-to-3D Generation with Pseudo-Image DiffusionPoster16 citations
- PointBeV: A Sparse Approach for BeV PredictionsPoster16 citations
- Prompt-Enhanced Multiple Instance Learning for Weakly Supervised Video Anomaly DetectionPoster16 citations
- Prompting Hard or Hardly Prompting: Prompt Inversion for Text-to-Image Diffusion ModelsPoster16 citations
- Revisiting Non-Autoregressive Transformers for Efficient Image SynthesisPoster16 citations
- SFOD: Spiking Fusion Object DetectorPoster16 citations
- SPECAT: SPatial-spEctral Cumulative-Attention Transformer for High-Resolution Hyperspectral Image ReconstructionPoster16 citations
- Simple Semantic-Aided Few-Shot LearningPoster16 citations
- Synthesize Step-by-Step: Tools Templates and LLMs as Data Generators for Reasoning-Based Chart VQAPoster16 citations
- THRONE: An Object-based Hallucination Benchmark for the Free-form Generations of Large Vision-Language ModelsPoster16 citations
- TI2V-Zero: Zero-Shot Image Conditioning for Text-to-Video Diffusion ModelsPoster16 citations
- Texture-Preserving Diffusion Models for High-Fidelity Virtual Try-OnPoster16 citations
- TokenCompose: Text-to-Image Diffusion with Token-level SupervisionPoster16 citations
- Training-Free Open-Vocabulary Segmentation with Offline Diffusion-Augmented Prototype GenerationPoster16 citations
- TransLoc4D: Transformer-based 4D Radar Place RecognitionPoster16 citations
- Transfer CLIP for Generalizable Image DenoisingPoster16 citations
- UDiFF: Generating Conditional Unsigned Distance Fields with Optimal Wavelet DiffusionPoster16 citations
- UniGarmentManip: A Unified Framework for Category-Level Garment Manipulation via Dense Visual CorrespondencePoster16 citations
- Universal Segmentation at Arbitrary Granularity with Language InstructionPoster16 citations
- VISTA-LLAMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual TokensPoster16 citations
- ViT-Lens: Towards Omni-modal RepresentationsPoster16 citations
- Visual Fact Checker: Enabling High-Fidelity Detailed Caption GenerationPoster16 citations
- You'll Never Walk Alone: A Sketch and Text Duet for Fine-Grained Image RetrievalPoster16 citations
- iKUN: Speak to Trackers without RetrainingPoster16 citations
- vid-TLDR: Training Free Token Merging for Light-weight Video TransformerPoster16 citations
- A Conditional Denoising Diffusion Probabilistic Model for Point Cloud UpsamplingPoster15 citations
- A Simple Baseline for Efficient Hand Mesh ReconstructionPoster15 citations
- A Simple Recipe for Language-guided Domain Generalized SegmentationPoster15 citations
- AIDE: An Automatic Data Engine for Object Detection in Autonomous DrivingPoster15 citations
- AlignSAM: Aligning Segment Anything Model to Open Context via Reinforcement LearningPoster15 citations
- Attention-Driven Training-Free Efficiency Enhancement of Diffusion ModelsPoster15 citations
- Boosting Neural Representations for Videos with a Conditional DecoderHighlight15 citations
- Boosting Object Detection with Zero-Shot Day-Night Domain AdaptationPoster15 citations
- CARZero: Cross-Attention Alignment for Radiology Zero-Shot ClassificationPoster15 citations
- Calibrating Multi-modal Representations: A Pursuit of Group Robustness without AnnotationsPoster15 citations
- Category-Level Multi-Part Multi-Joint 3D Shape AssemblyPoster15 citations
- Content-Adaptive Non-Local Convolution for Remote Sensing PansharpeningPoster15 citations
- Continual Forgetting for Pre-trained Vision ModelsPoster15 citations
- Correlation-Decoupled Knowledge Distillation for Multimodal Sentiment Analysis with Incomplete ModalitiesPoster15 citations
- DAVE - A Detect-and-Verify Paradigm for Low-Shot CountingPoster15 citations
- DreamPropeller: Supercharge Text-to-3D Generation with Parallel SamplingHighlight15 citations
- Dual DETRs for Multi-Label Temporal Action DetectionPoster15 citations
- EmoVIT: Revolutionizing Emotion Insights with Visual Instruction TuningPoster15 citations
- Enhancing Video Super-Resolution via Implicit Resampling-based AlignmentHighlight15 citations
- Error Detection in Egocentric Procedural Task VideosPoster15 citations
- Exploiting Inter-sample and Inter-feature Relations in Dataset DistillationPoster15 citations
- GenFlow: Generalizable Recurrent Flow for 6D Pose Refinement of Novel ObjectsPoster15 citations
- Generative Multi-modal Models are Good Class Incremental LearnersPoster15 citations
- Generative Rendering: Controllable 4D-Guided Video Generation with 2D Diffusion ModelsPoster15 citations
- H-ViT: A Hierarchical Vision Transformer for Deformable Image RegistrationHighlight15 citations
- HDRFlow: Real-Time HDR Video Reconstruction with Large MotionsPoster15 citations
- HOISDF: Constraining 3D Hand-Object Pose Estimation with Global Signed Distance FieldsPoster15 citations
- Image Sculpting: Precise Object Editing with 3D Geometry ControlPoster15 citations
- Image-to-Image Matching via Foundation Models: A New Perspective for Open-Vocabulary Semantic SegmentationPoster15 citations
- Improved Visual Grounding through Self-Consistent ExplanationsPoster15 citations
- Investigating and Mitigating the Side Effects of Noisy Views for Self-Supervised Clustering Algorithms in Practical Multi-View ScenariosPoster15 citations
- Is Vanilla MLP in Neural Radiance Field Enough for Few-shot View Synthesis?Poster15 citations
- LEOD: Label-Efficient Object Detection for Event CamerasPoster15 citations
- LiveHPS: LiDAR-based Scene-level Human Pose and Shape Estimation in Free EnvironmentHighlight15 citations
- Low-Res Leads the Way: Improving Generalization for Super-Resolution by Self-Supervised LearningPoster15 citations
- MLIP: Enhancing Medical Visual Representation with Divergence Encoder and Knowledge-guided Contrastive LearningPoster15 citations
- Map-Relative Pose Regression for Visual Re-LocalizationHighlight15 citations
- MicroCinema: A Divide-and-Conquer Approach for Text-to-Video GenerationHighlight15 citations
- MuGE: Multiple Granularity Edge DetectionPoster15 citations
- Multi-modal Learning for Geospatial Vegetation ForecastingPoster15 citations
- Multi-view Aggregation Network for Dichotomous Image SegmentationHighlight15 citations
- NetTrack: Tracking Highly Dynamic Objects with a NetPoster15 citations
- OmniVec2 - A Novel Transformer based Network for Large Scale Multimodal and Multitask LearningPoster15 citations
- Open-Vocabulary 3D Semantic Segmentation with Foundation ModelsHighlight15 citations
- OpenESS: Event-based Semantic Scene Understanding with Open VocabulariesHighlight15 citations
- Overcoming Generic Knowledge Loss with Selective Parameter UpdatePoster15 citations
- Overload: Latency Attacks on Object Detection for Edge DevicesPoster15 citations
CVPR accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.