ECCV 2024 Accepted Papers
The full list of 2,385 papers accepted at ECCV 2024 (European Conference on Computer Vision). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 2,185Oral: 200
- YOLOv9: Learning What You Want to Learn Using Programmable Gradient InformationPoster2,391 citations
- Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object DetectionPoster2,171 citations
- MMBENCH: Is Your Multi-Modal Model an All-around Player?Oral1,050 citations
- ShareGPT4V: Improving Large Multi-Modal Models with Better CaptionsPoster636 citations
- Adversarial Diffusion DistillationOral398 citations
- LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content CreationOral347 citations
- LLaMA-VID: An Image is Worth 2 Tokens in Large Language ModelsPoster327 citations
- MambaIR: A Simple Baseline for Image Restoration with State-Space ModelPoster323 citations
- "MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training"Poster276 citations
- CoTracker: It is Better to Track TogetherPoster258 citations
- DiffBIR: Toward Blind Image Restoration with Generative Diffusion PriorPoster247 citations
- VideoMamba: State Space Model for Efficient Video UnderstandingPoster243 citations
- DriveLM: Driving with Graph Visual Question AnsweringOral230 citations
- DynamiCrafter: Animating Open-domain Images with Video Diffusion PriorsOral227 citations
- Segment and Recognize Anything at Any GranularityPoster214 citations
- InternVideo2: Scaling Foundation Models for Multimodal Video UnderstandingPoster213 citations
- MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?Poster206 citations
- SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant TransformersPoster202 citations
- MobileNetV4: Universal Models for the Mobile EcosystemOral193 citations
- Photorealistic Video Generation with Diffusion ModelsPoster188 citations
- DriveDreamer: Towards Real-world-driven World Models for Autonomous DrivingPoster183 citations
- Gaussian Grouping: Segment and Edit Anything in 3D ScenesPoster183 citations
- PixArt-Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image GenerationPoster178 citations
- SV3D: Novel Multi-view Synthesis and 3D Generation from a Single Image using Latent Video DiffusionOral176 citations
- An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language ModelsOral174 citations
- MVSplat: Efficient 3D Gaussian Splatting from Sparse Multi-View ImagesOral173 citations
- PointLLM: Empowering Large Language Models to Understand Point CloudsOral170 citations
- FSGS: Real-Time Few-shot View Synthesis using Gaussian SplattingPoster155 citations
- Street Gaussians: Modeling Dynamic Urban Scenes with Gaussian SplattingPoster155 citations
- GRM: Large Gaussian Reconstruction Model for Efficient 3D Reconstruction and GenerationPoster150 citations
- BLINK: Multimodal Large Language Models Can See but Not PerceivePoster149 citations
- EMO: Emote Portrait Alive - Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak ConditionsPoster145 citations
- Agent Attention: On the Integration of Softmax and Linear AttentionPoster139 citations
- LLaVA-UHD: an LMM Perceiving any Aspect Ratio and High-Resolution ImagesPoster137 citations
- Long-CLIP: Unlocking the Long-Text Capability of CLIPPoster137 citations
- Pixel-Aware Stable Diffusion for Realistic Image Super-Resolution and Personalized StylizationPoster135 citations
- Evaluating Text-to-Visual Generation with Image-to-Text GenerationPoster133 citations
- LLaVA-Plus: Learning to Use Tools for Creating Multimodal AgentsPoster133 citations
- Relightable 3D Gaussians: Realistic Point Cloud Relighting with BRDF Decomposition and Ray TracingPoster133 citations
- CRM: Single Image to 3D Textured Mesh with Convolutional Reconstruction ModelPoster132 citations
- GRiT: A Generative Region-to-text Transformer for Object UnderstandingPoster124 citations
- Champ: Controllable and Consistent Human Image Animation with 3D Parametric GuidancePoster121 citations
- SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion ModelsPoster120 citations
- MotionDirector: Motion Customization of Text-to-Video Diffusion ModelsOral117 citations
- GS-LRM: Large Reconstruction Model for 3D Gaussian SplattingPoster115 citations
- Grounding Image Matching in 3D with MASt3ROral115 citations
- Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMsPoster109 citations
- GeoWizard: Unleashing the Diffusion Priors for 3D Geometry Estimation from a Single ImagePoster103 citations
- Vary: Scaling up the Vision Vocabulary for Large Vision-Language ModelsPoster103 citations
- MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language ModelsPoster99 citations
- DynMF: Neural Motion Factorization for Real-time Dynamic View Synthesis with 3D Gaussian SplattingPoster95 citations
- To Generate or Not? Safety-Driven Unlearned Diffusion Models Are Still Easy To Generate Unsafe Images ... For NowPoster95 citations
- EAGLES: Efficient Accelerated 3D Gaussians with Lightweight EncodingSPoster92 citations
- VideoAgent: Long-form Video Understanding with Large Language Model as AgentPoster91 citations
- ZipLoRA: Any Subject in Any Style by Effectively Merging LoRAsPoster91 citations
- OccWorld: Learning a 3D Occupancy World Model for Autonomous DrivingPoster88 citations
- CityGaussian: Real-time High-quality Large-Scale Scene Rendering with GaussiansPoster87 citations
- Factorizing Text-to-Video Generation by Explicit Image ConditioningPoster84 citations
- Motion Mamba: Efficient and Long Sequence Motion GenerationPoster84 citations
- HAC: Hash-grid Assisted Context for 3D Gaussian Splatting CompressionPoster81 citations
- Mamba-ND: Selective State Space Modeling for Multi-Dimensional DataOral78 citations
- ST-LLM: Large Language Models Are Effective Temporal LearnersPoster78 citations
- Compact 3D Scene Representation via Self-Organizing Gaussian GridsPoster76 citations
- DiffusionDepth: Diffusion Denoising Approach for Monocular Depth EstimationPoster76 citations
- DiffiT: Diffusion Vision Transformers for Image GenerationPoster72 citations
- Dolphins: Multimodal Language Model for DrivingPoster72 citations
- Global Structure-from-Motion RevisitedPoster72 citations
- Generative End-to-End Autonomous DrivingPoster71 citations
- Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language ModelsOral71 citations
- LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language ModelPoster71 citations
- LongVLM: Efficient Long Video Understanding via Large Language ModelsOral71 citations
- SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene UnderstandingPoster71 citations
- How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMsPoster70 citations
- SGS-SLAM: Semantic Gaussian Splatting For Neural Dense SLAMPoster70 citations
- A Task is Worth One Word: Learning with Task Prompts for High-Quality Versatile Image InpaintingPoster68 citations
- TextDiffuser-2: Unleashing the Power of Language Models for Text RenderingOral65 citations
- LLaVA-Grounding: Grounded Visual Chat with Large Multimodal ModelsPoster64 citations
- MobileDiffusion: Instant Text-to-Image Generation on Mobile DevicesPoster64 citations
- SCLIP: Rethinking Self-Attention for Dense Vision-Language InferencePoster64 citations
- VideoAgent: A Memory-augmented Multimodal Agent for Video UnderstandingPoster64 citations
- MotionLCM: Real-time Controllable Motion Generation via Latent Consistency ModelPoster63 citations
- latentSplat: Autoencoding Variational Gaussians for Fast Generalizable 3D ReconstructionPoster63 citations
- ShapeLLM: Universal 3D Object Understanding for Embodied InteractionPoster62 citations
- Concept Sliders: LoRA Adaptors for Precise Control in Diffusion ModelsPoster61 citations
- LITA: Language Instructed Temporal-Localization AssistantPoster61 citations
- Octopus: Embodied Vision-Language Programmer from Environmental FeedbackPoster61 citations
- Groma: Localized Visual Tokenization for Grounding Multimodal Large Language ModelsPoster60 citations
- MVDiffHD: A Dense High-resolution Multi-view Diffusion Model for Single or Sparse-view 3D Object ReconstructionPoster60 citations
- Pixel-GS Density Control with Pixel-aware Gradient for 3D Gaussian SplattingPoster59 citations
- UniIR: Training and Benchmarking Universal Multimodal Information RetrieversOral59 citations
- Controllable Human-Object Interaction SynthesisOral58 citations
- "EMDM: Efficient Motion Diffusion Model for Fast, High-Quality Human Motion Generation"Poster57 citations
- ZigMa: A DiT-style Zigzag Mamba Diffusion ModelPoster57 citations
- AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield PromptingPoster56 citations
- Drag Anything: Motion Control for Anything using Entity RepresentationPoster56 citations
- Mini-Splatting: Representing Scenes with a Constrained Number of GaussiansPoster56 citations
- BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch DiffusionPoster55 citations
- Deblurring 3D Gaussian SplattingPoster55 citations
- Towards Open-ended Visual Quality ComparisonOral54 citations
- Reason2Drive: Towards Interpretable and Chain-based Reasoning for Autonomous DrivingPoster53 citations
- DOCCI: Descriptions of Connected and Contrasting ImagesPoster52 citations
- ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic ManipulationPoster52 citations
- When Do We Not Need Larger Vision Models?Poster51 citations
- Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes InteractivelyPoster50 citations
- The All-Seeing Project V2: Towards General Relation Comprehension of the Open WorldPoster50 citations
- GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy PredictionPoster49 citations
- IRSAM: Advancing Segment Anything Model for Infrared Small Target DetectionPoster49 citations
- Model Breadcrumbs: Scaling Multi-Task Model Merging with Sparse MasksPoster49 citations
- TLControl: Trajectory and Language Control for Human Motion SynthesisPoster49 citations
- "Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation"Poster48 citations
- Revising Densification in Gaussian SplattingPoster48 citations
- Robo-ABC: Affordance Generalization Beyond Categories via Semantic Correspondence for Robot ManipulationPoster48 citations
- Customize-A-Video: One-Shot Motion Customization of Text-to-Video Diffusion ModelsPoster47 citations
- FreeInit: Bridging Initialization Gap in Video Diffusion ModelsPoster47 citations
- Gaussian in the wild: 3D Gaussian Splatting for Unconstrained Image CollectionsPoster47 citations
- OpenIns3D: Snap and Lookup for 3D Open-vocabulary Instance SegmentationPoster46 citations
- Rotary Position Embedding for Vision TransformerPoster46 citations
- STAG4D: Spatial-Temporal Anchored Generative 4D GaussiansPoster46 citations
- ScribblePrompt: Fast and Flexible Interactive Segmentation for Any Biomedical ImagePoster46 citations
- BAD-Gaussians: Bundle Adjusted Deblur Gaussian SplattingPoster45 citations
- Depicting Beyond Scores: Advancing Image Quality Assessment through Multi-modal Language ModelsPoster44 citations
- "SEA-RAFT: Simple, Efficient, Accurate RAFT for Optical Flow"Oral43 citations
- FoundPose: Unseen Object Pose Estimation with Foundation FeaturesPoster43 citations
- GIVT: Generative Infinite-Vocabulary TransformersPoster43 citations
- Lane Graph as Path: Continuity-preserving Path-wise Modeling for Online Lane Graph ConstructionPoster43 citations
- WoVoGen: World Volume-aware Diffusion for Controllable Multi-camera Driving Scene GenerationPoster43 citations
- AutoDIR: Automatic All-in-One Image Restoration with Latent DiffusionPoster42 citations
- BRAVE: Broadening the visual encoding of vision-language modelsOral42 citations
- DrivingDiffusion: Layout-Guided Multi-View Driving Scenarios Video Generation with Latent Diffusion ModelPoster41 citations
- PhysGen: Rigid-Body Physics-Grounded Image-to-Video GenerationPoster41 citations
- Receler: Reliable Concept Erasing of Text-to-Image Diffusion Models via Lightweight ErasersPoster41 citations
- CG-SLAM: Efficient Dense RGB-D SLAM in a Consistent Uncertainty-aware 3D Gaussian FieldPoster40 citations
- GaussCtrl: Multi-View Consistent Text-Driven 3D Gaussian Splatting EditingPoster40 citations
- Generating Human Interaction Motions in Scenes with Text ControlPoster40 citations
- LightenDiffusion: Unsupervised Low-Light Image Enhancement with Latent-Retinex Diffusion ModelsPoster40 citations
- ReNoise: Real Image Inversion Through Iterative NoisingPoster40 citations
- BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal ModelsPoster39 citations
- Common Sense Reasoning for Deep Fake DetectionPoster39 citations
- Distilling Diffusion Models into Conditional GANsPoster39 citations
- DreamScene360: Unconstrained Text-to-3D Scene Generation with Panoramic Gaussian SplattingPoster39 citations
- AdaCLIP: Adapting CLIP with Hybrid Learnable Prompts for Zero-Shot Anomaly DetectionPoster38 citations
- Attention-Challenging Multiple Instance Learning for Whole Slide Image ClassificationPoster38 citations
- LN3Diff: Scalable Latent Neural Fields Diffusion for Speedy 3D GenerationPoster38 citations
- LivePhoto: Real Image Animation with Text-guided Motion ControlPoster38 citations
- Per-Gaussian Embedding-Based Deformation for Deformable 3D Gaussian SplattingPoster38 citations
- ReMoS: 3D Motion-Conditioned Reaction Synthesis for Two-Person InteractionsPoster38 citations
- Scene Coordinate Reconstruction: Posing of Image Collections via Incremental Learning of a RelocalizerOral38 citations
- Embodied Understanding of Driving ScenariosPoster37 citations
- See and Think: Embodied Agent in Virtual EnvironmentPoster37 citations
- SkateFormer: Skeletal-Temporal Transformer for Human Action RecognitionPoster37 citations
- TC4D: Trajectory-Conditioned Text-to-4D GenerationPoster37 citations
- Think2Drive: Efficient Reinforcement Learning by Thinking with Latent World Model for Autonomous Driving (in CARLA-v2)Poster37 citations
- "Tracking Meets LoRA: Faster Training, Larger Model, Stronger Performance"Poster36 citations
- ControlLLM: Augment Language Models with Tools by Searching on GraphsPoster36 citations
- HeadStudio: Text to Animatable Head Avatars with 3D Gaussian SplattingPoster36 citations
- InstructIR: High-Quality Image Restoration Following Human InstructionsPoster36 citations
- T-Rex2: Towards Generic Object Detection via Text-Visual Prompt SynergyPoster36 citations
- HeadGaS: Real-Time Animatable Head Avatars via 3D Gaussian SplattingPoster35 citations
- LATTE3D: Large-scale Amortized Text-To-Enhanced3D SynthesisPoster35 citations
- LaRa: Efficient Large-Baseline Radiance FieldsPoster35 citations
- Language-Image Pre-training with Long CaptionsPoster35 citations
- Restoring Images in Adverse Weather Conditions via Histogram TransformerPoster35 citations
- Strengthening Multimodal Large Language Model with Bootstrapped Preference OptimizationOral35 citations
- VFusion3D: Learning Scalable 3D Generative Models from Video Diffusion ModelsPoster35 citations
- Watch Your Steps: Local Image and Scene Editing by Text InstructionsOral35 citations
- A Comprehensive Study of Multimodal Large Language Models for Image Quality AssessmentPoster34 citations
- CogView3: Finer and Faster Text-to-Image Generation via Relay DiffusionPoster34 citations
- DINO-Tracker: Taming DINO for Self-Supervised Point Tracking in a Single VideoPoster34 citations
- FunQA: Towards Surprising Video ComprehensionPoster34 citations
- MMEarth: Exploring Multi-Modal Pretext Tasks For Geospatial Representation LearningPoster34 citations
- MVSGaussian: Fast Generalizable Gaussian Splatting Reconstruction from Multi-View StereoPoster34 citations
- Reliable and Efficient Concept Erasure of Text-to-Image Diffusion ModelsPoster34 citations
- Segment3D: Learning Fine-Grained Class-Agnostic 3D Segmentation without Manual LabelsPoster34 citations
- DreamScene: 3D Gaussian-based Text-to-3D Scene Generation via Formation Pattern SamplingPoster33 citations
- Integer-Valued Training and Spike-driven Inference Spiking Neural Network for High-performance and Energy-efficient Object DetectionOral33 citations
- MapTracker: Tracking with Strided Memory Fusion for Consistent Vector HD MappingOral33 citations
- NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language ModelsPoster33 citations
- OMG: Occlusion-friendly Personalized Multi-concept Generation in Diffusion ModelsPoster33 citations
- V2X-Real: a Largs-Scale Dataset for Vehicle-to-Everything Cooperative PerceptionPoster33 citations
- "BK-SDM: A Lightweight, Fast, and Cheap Version of Stable Diffusion"Poster32 citations
- A Unified Anomaly Synthesis Strategy with Gradient Ascent for Industrial Anomaly Detection and LocalizationPoster32 citations
- Analytic-Splatting: Anti-Aliased 3D Gaussian Splatting via Analytic IntegrationOral32 citations
- CoherentGS: Sparse Novel View Synthesis with Coherent 3D GaussiansPoster32 citations
- Contrastive Region Guidance: Improving Grounding in Vision-Language Models without TrainingPoster32 citations
- Expressive Whole-Body 3D Gaussian AvatarPoster32 citations
- PSALM: Pixelwise Segmentation with Large Multi-modal ModelPoster32 citations
- UniDream: Unifying Diffusion Priors for Relightable Text-to-3D GenerationPoster32 citations
- CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentationPoster31 citations
- End-to-End Rate-Distortion Optimized 3D Gaussian RepresentationPoster31 citations
- Large-scale Reinforcement Learning for Diffusion ModelsPoster31 citations
- Radiative Gaussian Splatting for Efficient X-ray Novel View SynthesisPoster31 citations
- RealGen: Retrieval Augmented Generation for Controllable Traffic ScenariosOral31 citations
- TRAM: Global Trajectory and Motion of 3D Humans from in-the-wild VideosPoster31 citations
- AdvDiff: Generating Unrestricted Adversarial Examples using Diffusion ModelsPoster30 citations
- Implicit Style-Content Separation using B-LoRAPoster30 citations
- MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion ModelPoster30 citations
- Merlin: Empowering Multimodal LLMs with Foresight MindsPoster30 citations
- Multi-Memory Matching for Unsupervised Visible-Infrared Person Re-IdentificationPoster30 citations
- OneRestore: A Universal Restoration Framework for Composite DegradationPoster30 citations
- Rethinking Tree-Ring Watermarking for Enhanced Multi-Key IdentificationPoster30 citations
- VISA: Reasoning Video Object Segmentation via Large Language ModelPoster30 citations
- A Comparative Study of Image Restoration Networks for General Backbone Network DesignPoster29 citations
- AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question AnsweringPoster29 citations
- ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language InferencePoster29 citations
- EDTalk: Efficient Disentanglement for Emotional Talking Head SynthesisOral29 citations
- GraphBEV: Towards Robust BEV Feature Alignment for Multi-Modal 3D Object DetectionPoster29 citations
- Latent Guard: a Safety Framework for Text-to-image GenerationPoster29 citations
- Model Stock: All we need is just a few fine-tuned modelsOral29 citations
- Paying More Attention to Images: A Training-Free Method for Alleviating Hallucination in LVLMsPoster29 citations
- RGBD GS-ICP SLAMPoster29 citations
- UniTraj: A Unified Framework for Scalable Vehicle Trajectory PredictionPoster29 citations
- BAMM: Bidirectional Autoregressive Motion ModelPoster28 citations
- CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual ScenariosPoster28 citations
- CompGS: Smaller and Faster Gaussian Splatting with Vector QuantizationPoster28 citations
- FlashTex: Fast Relightable Mesh Texturing with LightControlNetOral28 citations
- GLAD: Towards Better Reconstruction with Global and Local Adaptive Diffusion Models for Unsupervised Anomaly DetectionPoster28 citations
- HowToCaption: Prompting LLMs to Transform Video Annotations at ScalePoster28 citations
- Leveraging Enhanced Queries of Point Sets for Vectorized Map ConstructionPoster28 citations
- OmniSat: Self-Supervised Modality Fusion for Earth ObservationPoster28 citations
- Online Vectorized HD Map Construction using GeometryPoster28 citations
- ReMamber: Referring Image Segmentation with Mamba TwisterPoster28 citations
- Sapiens: Foundation for Human Vision ModelsOral28 citations
- VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language ModelsPoster28 citations
- ComboVerse: Compositional 3D Assets Creation Using Spatially-Aware Diffusion GuidancePoster27 citations
- Exact Diffusion Inversion via Bidirectional Integration ApproximationOral27 citations
- Face Adapter for Pre-Trained Diffusion Models with Fine-Grained ID and Attribute ControlPoster27 citations
- GaussianImage: 1000 FPS Image Representation and Compression by 2D Gaussian SplattingPoster27 citations
- GraspXL: Generating Grasping Motions for Diverse Objects at ScalePoster27 citations
- Large Motion Model for Unified Multi-Modal Motion GenerationPoster27 citations
- Multi-HMR: Multi-Person Whole-Body Human Mesh Recovery in a Single ShotPoster27 citations
- PhysAvatar: Learning the Physics of Dressed 3D Avatars from Visual ObservationsPoster27 citations
- Repaint123: Fast and High-quality One Image to 3D Generation with Progressive Controllable RepaintingPoster27 citations
- SILC: Improving Vision Language Pretraining with Self-DistillationPoster27 citations
- VeCLIP: Improving CLIP Training via Visual-enriched CaptionsPoster27 citations
- Arc2Face: A Foundation Model for ID-Consistent Human FacesOral26 citations
- Be Yourself: Bounded Attention for Multi-Subject Text-to-Image GenerationPoster26 citations
- Challenging Forgets: Unveiling the Worst-Case Forget Sets in Machine UnlearningPoster26 citations
- DQ-DETR: DETR with Dynamic Query for Tiny Object DetectionPoster26 citations
- Frequency-Spatial Entanglement Learning for Camouflaged Object DetectionPoster26 citations
- Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text RenderingPoster26 citations
- HiFi-123: Towards High-fidelity One Image to 3D Content GenerationPoster26 citations
- ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary SegmentationPoster26 citations
- Adversarial Prompt Tuning for Vision-Language ModelsPoster25 citations
- CoR-GS: Sparse-View 3D Gaussian Splatting via Co-RegularizationPoster25 citations
- Context-Guided Spatial Feature Reconstruction for Efficient Semantic SegmentationPoster25 citations
- DragVideo: Interactive Drag-style Video EditingPoster25 citations
- GVGEN: Text-to-3D Generation with Volumetric RepresentationPoster25 citations
- GeoGaussian: Geometry-aware Gaussian Splatting for Scene RenderingPoster25 citations
- SceneScript: Reconstructing Scenes With An Autoregressive Structured Language ModelPoster25 citations
- SegPoint: Segment Any Point Cloud via Large Language ModelPoster25 citations
- Self-Rectifying Diffusion Sampling with Perturbed-Attention GuidancePoster25 citations
- TalkingGaussian: Structure-Persistent 3D Talking Head Synthesis via Gaussian SplattingPoster25 citations
- Tokenize Anything via PromptingPoster25 citations
- View-Consistent 3D Editing with Gaussian SplattingPoster25 citations
- BAGS: Blur Agnostic Gaussian Splatting through Multi-Scale Kernel ModelingPoster24 citations
- DGE: Direct Gaussian 3D Editing by Consistent Multi-view EditingPoster24 citations
- DGInStyle: Domain-Generalizable Semantic Segmentation with Image Diffusion Models and Stylized Semantic ControlPoster24 citations
- DetToolChain: A New Prompting Paradigm to Unleash Detection Ability of MLLMPoster24 citations
- Detecting As Labeling: Rethinking LiDAR-camera Fusion in 3D Object DetectionPoster24 citations
- Disentangled Clothed Avatar Generation from Text DescriptionsPoster24 citations
- GGRt: Towards Generalizable 3D Gaussians without Pose Priors in Real-TimePoster24 citations
- GenerateCT: Text-Conditional Generation of 3D Chest CT VolumesPoster24 citations
- LCM-Lookahead for Encoder-based Text-to-Image PersonalizationPoster24 citations
- Make a Cheap Scaling: A Self-Cascade Diffusion Model for Higher-Resolution AdaptationPoster24 citations
- Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language ModelsPoster24 citations
- NeuroNCAP: Photorealistic Closed-loop Safety Testing for Autonomous DrivingPoster24 citations
- Prompting Language-Informed Distribution for Compositional Zero-Shot LearningPoster24 citations
- R.A.C.E.: Robust Adversarial Concept Erasure for Secure Text-to-Image Diffusion ModelOral24 citations
- SC4D: Sparse-Controlled Video-to-4D Generation and Motion TransferPoster24 citations
- SWAG: Splatting in the Wild images with Appearance-conditioned GaussiansPoster24 citations
- SemiVL: Semi-Supervised Semantic Segmentation with Vision-Language GuidancePoster24 citations
- Stream Query Denoising for Vectorized HD-Map ConstructionPoster24 citations
- TIBET: Identifying and Evaluating Biases in Text-to-Image Generative ModelsPoster24 citations
- Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation MatchingPoster24 citations
- A Watermark-Conditioned Diffusion Model for IP ProtectionPoster23 citations
- DenseNets Reloaded: Paradigm Shift Beyond ResNets and ViTsPoster23 citations
- EchoScene: Indoor Scene Generation via Information Echo over Scene Graph DiffusionPoster23 citations
- GTP-4o: Modality-prompted Heterogeneous Graph Learning for Omni-modal Biomedical RepresentationPoster23 citations
- Generative Camera Dolly: Extreme Monocular Dynamic Novel View SynthesisOral23 citations
- Improving 2D Feature Representations by 3D-Aware Fine-TuningPoster23 citations
- Local All-Pair Correspondence for Point TrackingPoster23 citations
- MagMax: Leveraging Model Merging for Seamless Continual LearningPoster23 citations
- ObjectDrop: Bootstrapping Counterfactuals for Photorealistic Object Removal and InsertionPoster23 citations
- SMFANet: A Lightweight Self-Modulation Feature Aggregation Network for Efficient Image Super-ResolutionPoster23 citations
- Safe-CLIP: Removing NSFW Concepts from Vision-and-Language ModelsPoster23 citations
- UGG: Unified Generative GraspingOral23 citations
- Unifying 3D Vision-Language Understanding via Promptable QueriesPoster23 citations
- ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward ModelingPoster23 citations
- Wear-Any-Way: Manipulable Virtual Try-on via Sparse Correspondence AlignmentPoster23 citations
- Audio-Synchronized Visual AnimationOral22 citations
- IRGen: Generative Modeling for Image RetrievalPoster22 citations
- Leveraging Representations from Intermediate Encoder-blocks for Synthetic Image DetectionPoster22 citations
- OphNet: A Large-Scale Video Benchmark for Ophthalmic Surgical Workflow UnderstandingPoster22 citations
- Parrot: Pareto-optimal Multi-Reward Reinforcement Learning Framework for Text-to-Image GenerationOral22 citations
- Reconstruction and Simulation of Elastic Objects with Spring-Mass 3D GaussiansPoster22 citations
- Relation DETR: Exploring Explicit Position Relation Prior for Object DetectionOral22 citations
- Vamos: Versatile Action Models for Video UnderstandingPoster22 citations
- View Selection for 3D Captioning via Diffusion RankingPoster22 citations
- Boosting Transferability in Vision-Language Attacks via Diversification along the Intersection Region of Adversarial TrajectoryPoster21 citations
- EgoLifter: Open-world 3D Segmentation for Egocentric PerceptionPoster21 citations
- MixDQ: Memory-Efficient Few-Step Text-to-Image Diffusion Models with Metric-Decoupled Mixed Precision QuantizationPoster21 citations
- MoMA: Multimodal LLM Adapter for Fast Personalized Image GenerationPoster21 citations
- MyVLM: Personalizing VLMs for User-Specific QueriesPoster21 citations
- OccGen: Generative Multi-modal 3D Occupancy Prediction for Autonomous DrivingPoster21 citations
- Personalized Federated Domain-Incremental Learning based on Adaptive Knowledge MatchingPoster21 citations
- Pyramid Diffusion for Fine 3D Large Scene GenerationOral21 citations
- Unveiling and Mitigating Memorization in Text-to-image Diffusion Models through Cross AttentionPoster21 citations
- AUFormer: Vision Transformers are Parameter-Efficient Facial Action Unit DetectorsPoster20 citations
- DiffClass: Diffusion-Based Class Incremental LearningPoster20 citations
- Diffusion Reward: Learning Rewards via Conditional Video DiffusionPoster20 citations
- Follow the Rules: Reasoning for Video Anomaly Detection with Large Language ModelsPoster20 citations
- GPSFormer: A Global Perception and Local Structure Fitting-based Transformer for Point Cloud UnderstandingPoster20 citations
- Improving Diffusion Models for Authentic Virtual Try-on in the WildPoster20 citations
- MoVideo: Motion-Aware Video Generation with Diffusion ModelsPoster20 citations
- On the Error Analysis of 3D Gaussian Splatting and an Optimal Projection StrategyPoster20 citations
- PromptFusion: Decoupling Stability and Plasticity for Continual LearningPoster20 citations
- Reinforcement Learning Friendly Vision-Language Model for MinecraftPoster20 citations
- SMooDi: Stylized Motion Diffusion ModelPoster20 citations
- SeFlow: A Self-Supervised Scene Flow Method in Autonomous DrivingPoster20 citations
- TAPTR: Tracking Any Point with Transformers as DetectionPoster20 citations
- UDiffText: A Unified Framework for High-quality Text Synthesis in Arbitrary Images via Character-aware Diffusion ModelsPoster20 citations
- m&m’s: A Benchmark to Evaluate Tool-Use for multi-step multi-modal TasksPoster20 citations
- Alternate Diverse Teaching for Semi-supervised Medical Image SegmentationPoster19 citations
- Deep Patch Visual SLAMPoster19 citations
- EAS-SNN: End-to-End Adaptive Sampling and Representation for Event-based Detection with Recurrent Spiking Neural NetworksPoster19 citations
- EgoExo-Fitness: Towards Egocentric and Exocentric Full-Body Action UnderstandingPoster19 citations
- FineMatch: Aspect-based Fine-grained Image and Text Mismatch Detection and CorrectionPoster19 citations
- FreeMotion: A Unified Framework for Number-free Text-to-Motion SynthesisPoster19 citations
- MoAI: Mixture of All Intelligence for Large Language and Vision ModelsPoster19 citations
- Occupancy as Set of PointsPoster19 citations
- ParCo: Part-Coordinating Text-to-Motion SynthesisPoster19 citations
- Portrait4D-v2: Pseudo Multi-View Data Creates Better 4D Head SynthesizerPoster19 citations
- QUAR-VLA: Vision-Language-Action Model for Quadruped RobotsPoster19 citations
- RangeLDM: Fast Realistic LiDAR Point Cloud GenerationPoster19 citations
- SSL-Cleanse: Trojan Detection and Mitigation in Self-Supervised LearningPoster19 citations
- Solving Motion Planning Tasks with a Scalable Generative ModelPoster19 citations
- SpaRP: Fast 3D Object Reconstruction and Pose Estimation from Sparse ViewsPoster19 citations
- T2IShield: Defending Against Backdoors on Text-to-Image Diffusion ModelsPoster19 citations
- TOD3Cap: Towards 3D Dense Captioning in Outdoor ScenesPoster19 citations
- The First to Know: How Token Distributions Reveal Hidden Knowledge in Large Vision-Language Models?Poster19 citations
- Track2Act: Predicting Point Tracks from Internet Videos enables Generalizable Robot ManipulationPoster19 citations
- V-IRL: Grounding Virtual Intelligence in Real LifePoster19 citations
- Click-Gaussian: Interactive Segmentation to Any 3D GaussiansPoster18 citations
- Decoupling Common and Unique Representations for Multimodal Self-supervised LearningOral18 citations
- Denoising Vision TransformersOral18 citations
- Efficient Inference of Vision Instruction-Following Models with Elastic CachePoster18 citations
- Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic SegmentationPoster18 citations
- Facial Affective Behavior Analysis with Instruction TuningPoster18 citations
- Fully Sparse 3D Occupancy PredictionPoster18 citations
- Griffon: Spelling out All Object Locations at Any Granularity with Large Language ModelsPoster18 citations
- Learning 3D Geometry and Feature Consistent Gaussian Splatting for Object RemovalPoster18 citations
- Put Myself in Your Shoes: Lifting the Egocentric Perspective from Exocentric VideosPoster18 citations
- R^2-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal GroundingPoster18 citations
- SAM-guided Graph Cut for 3D Instance SegmentationPoster18 citations
- Spherical Linear Interpolation and Text-Anchoring for Zero-shot Composed Image RetrievalPoster18 citations
- Towards Multimodal Sentiment Analysis Debiasing via Bias PurificationPoster18 citations
- TransFusion -- A Transparency-Based Diffusion Model for Anomaly DetectionPoster18 citations
- Tuning-Free Image Customization with Image and Text GuidancePoster18 citations
- 6DGS: 6D Pose Estimation from a Single Image and a 3D Gaussian Splatting ModelPoster17 citations
- CLIP-DPO: Vision-Language Models as a Source of Preference for Fixing Hallucinations in LVLMsPoster17 citations
- Discover-then-Name: Task-Agnostic Concept Bottlenecks via Automated Concept DiscoveryPoster17 citations
- Dolfin: Diffusion Layout Transformers without AutoencoderPoster17 citations
- FouriScale: A Frequency Perspective on Training-Free High-Resolution Image SynthesisPoster17 citations
- FreeZe: Training-free zero-shot 6D pose estimation with geometric and vision foundation modelsPoster17 citations
- Generalizable Human Gaussians for Sparse View SynthesisPoster17 citations
- Getting it Right: Improving Spatial Consistency in Text-to-Image ModelsPoster17 citations
- I-MedSAM: Implicit Medical Image Segmentation with Segment AnythingPoster17 citations
- Infinite-ID: Identity-preserved Personalization via ID-semantics Decoupling ParadigmPoster17 citations
- MegaScenes: Scene-Level View Synthesis at ScalePoster17 citations
- Post-training Quantization with Progressive Calibration and Activation Relaxing for Text-to-Image Diffusion ModelsPoster17 citations
- Ray Denoising: Depth-aware Hard Negative Sampling for Multi-view 3D Object DetectionPoster17 citations
- SemGrasp: Semantic Grasp Generation via Language Aligned DiscretizationOral17 citations
- Skeleton Recall Loss for Connectivity Conserving and Resource Efficient Segmentation of Thin Tubular StructuresPoster17 citations
- ViewFormer: Exploring Spatiotemporal Modeling for Multi-View 3D Occupancy Perception via View-Guided TransformersPoster17 citations
- Weighted Ensemble Models Are Strong Continual LearnersOral17 citations
- XPSR: Cross-modal Priors for Diffusion-based Image Super-ResolutionPoster17 citations
- Agent3D-Zero: An Agent for Zero-shot 3D UnderstandingPoster16 citations
- CoMo: Controllable Motion Generation through Language Guided Pose Code EditingPoster16 citations
- Collaborative Vision-Text Representation Optimizing for Open-Vocabulary SegmentationOral16 citations
- FedRA: A Random Allocation Strategy for Federated Tuning to Unleash the Power of Heterogeneous ClientsPoster16 citations
- FlashSplat: 2D to 3D Gaussian Splatting Segmentation Solved OptimallyPoster16 citations
- GLARE: Low Light Image Enhancement via Generative Latent Feature based Codebook RetrievalPoster16 citations
- Gaussian Splatting on the Move: Blur and Rolling Shutter Compensation for Natural Camera MotionPoster16 citations
- HaloQuest: A Visual Hallucination Dataset for Advancing Multimodal ReasoningPoster16 citations
- Improving Medical Multi-modal Contrastive Learning with Expert AnnotationsPoster16 citations
- LLMGA: Multimodal Large Language Model based Generation AssistantOral16 citations
- Learning to Unlearn for Robust Machine UnlearningPoster16 citations
- Masked Generative Video-to-Audio Transformers with Enhanced SynchronicityPoster16 citations
- Motion-Guided Latent Diffusion for Temporally Consistent Real-world Video Super-resolutionPoster16 citations
- N2F2: Hierarchical Scene Understanding with Nested Neural Feature FieldsPoster16 citations
- NeRF-MAE: Masked AutoEncoders for Self-Supervised 3D Representation Learning for Neural Radiance FieldsPoster16 citations
- OpenSight: A Simple Open-Vocabulary Framework for LiDAR-Based Object DetectionPoster16 citations
- Rethinking Weakly-supervised Video Temporal Grounding From a Game PerspectivePoster16 citations
- SplatFields: Neural Gaussian Splats for Sparse 3D and 4D ReconstructionPoster16 citations
- SwapAnything: Enabling Arbitrary Object Swapping in Personalized Image EditingPoster16 citations
- Texture-GS: Disentangle the Geometry and Texture for 3D Gaussian Splatting EditingPoster16 citations
- VCP-CLIP: A visual context prompting model for zero-shot anomaly segmentationPoster16 citations
- Asynchronous Large Language Model Enhanced Planner for Autonomous DrivingPoster15 citations
- Attention Prompting on Image for Large Vision-Language ModelsPoster15 citations
- Bridging Different Language Models and Generative Vision Models for Text-to-Image GenerationPoster15 citations
- Cascade-Zero123: One Image to Highly Consistent 3D with Self-Prompted Nearby ViewsPoster15 citations
- DreamSampler: Unifying Diffusion Sampling and Score Distillation for Image ManipulationPoster15 citations
- DyFADet: Dynamic Feature Aggregation for Temporal Action DetectionPoster15 citations
- FairDomain: Achieving Fairness in Cross-Domain Medical Image Segmentation and ClassificationPoster15 citations
- GS2Mesh: Surface Reconstruction from Gaussian Splatting via Novel Stereo ViewsPoster15 citations
- Goldfish: Vision-Language Understanding of Arbitrarily Long VideosPoster15 citations
- HO-Gaussian: Hybrid Optimization of 3D Gaussian Splatting for Urban ScenesPoster15 citations
- HiT-SR: Hierarchical Transformer for Efficient Image Super-ResolutionOral15 citations
- LEGO: Learning EGOcentric Action Frame Generation via Visual Instruction TuningOral15 citations
- LaWa: Using Latent Space for In-Generation Image WatermarkingPoster15 citations
- Label-anticipated Event Disentanglement for Audio-Visual Video ParsingPoster15 citations
- MEVG : Multi-event Video Generation with Text-to-Video ModelsPoster15 citations
- Make-Your-3D: Fast and Consistent Subject-Driven 3D Content GenerationPoster15 citations
- Nuvo: Neural UV Mapping for Unruly 3D RepresentationsPoster15 citations
- ScaleDreamer: Scalable Text-to-3D Synthesis with Asynchronous Score DistillationPoster15 citations
- SparseLIF: High-Performance Sparse LiDAR-Camera Fusion for 3D Object DetectionPoster15 citations
- VideoMamba: Spatio-Temporal Selective State Space ModelPoster15 citations
- Zero-Shot Detection of AI-Generated ImagesOral15 citations
- AdaLog: Post-Training Quantization for Vision Transformers with Adaptive Logarithm QuantizerPoster14 citations
- An Economic Framework for 6-DoF Grasp DetectionPoster14 citations
- AnimatableDreamer: Text-Guided Non-rigid 3D Model Generation and Reconstruction with Canonical Score DistillationPoster14 citations
- BAM-DETR: Boundary-Aligned Moment Detection Transformer for Temporal Sentence Grounding in VideosPoster14 citations
- Dataset Distillation by Automatic Training TrajectoriesPoster14 citations
- Deep Reward Supervisions for Tuning Text-to-Image Diffusion ModelsPoster14 citations
- Diffusion Soup: Model Merging for Text-to-Image Diffusion ModelsPoster14 citations
- Do text-free diffusion models learn discriminative visual representations?Poster14 citations
- DragAPart: Learning a Part-Level Motion Prior for Articulated ObjectsPoster14 citations
- Efficient Diffusion Transformer with Step-wise Dynamic Attention MediatorsPoster14 citations
- Efficient Frequency-Domain Image Deraining with Contrastive RegularizationPoster14 citations
- Factorized Diffusion: Perceptual Illusions by Noise DecompositionPoster14 citations
- Four Ways to Improve Verbo-visual Fusion for Dense 3D Visual GroundingPoster14 citations
- FreestyleRet: Retrieving Images from Style-Diversified QueriesPoster14 citations
- GalLop: Learning global and local prompts for vision-language modelsPoster14 citations
- LatentEditor: Text Driven Local Editing of 3D ScenesPoster14 citations
- Learning Modality-agnostic Representation for Semantic Segmentation from Any ModalitiesOral14 citations
- MTKD: Multi-Teacher Knowledge Distillation for Image Super-ResolutionPoster14 citations
- MTMamba: Enhancing Multi-Task Dense Scene Understanding by Mamba-Based DecodersPoster14 citations
- MapDistill: Boosting Efficient Camera-based HD Map Construction via Camera-LiDAR Fusion Model DistillationPoster14 citations
- MeshAvatar: Learning High-quality Triangular Human Avatars from Multi-view VideosPoster14 citations
- MirrorGaussian: Reflecting 3D Gaussians for Reconstructing Mirror ReflectionsPoster14 citations
- NeuroPictor: Refining fMRI-to-Image Reconstruction via Multi-individual Pretraining and Multi-level ModulationPoster14 citations
- On the Viability of Monocular Depth Pre-training for Semantic SegmentationPoster14 citations
- One-Shot Diffusion Mimicker for Handwritten Text GenerationPoster14 citations
- PYRA: Parallel Yielding Re-Activation for Training-Inference Efficient Task AdaptationPoster14 citations
- RodinHD: High-Fidelity 3D Avatar Generation with Diffusion ModelsPoster14 citations
- SwiftBrush v2: Make Your One-step Diffusion Model Better Than Its TeacherPoster14 citations
- WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question AnsweringPoster14 citations
- WiMANS: A Benchmark Dataset for WiFi-based Multi-user Activity SensingPoster14 citations
- A Compact Dynamic 3D Gaussian Representation for Real-Time Dynamic View SynthesisPoster13 citations
- Bad Students Make Great Teachers: Active Learning Accelerates Large-Scale Visual UnderstandingPoster13 citations
- Be-Your-Outpainter: Mastering Video Outpainting through Input-Specific AdaptationPoster13 citations
- Class-Incremental Learning with CLIP: Adaptive Representation Adjustment and Parameter FusionPoster13 citations
- Cross-Domain Few-Shot Object Detection via Enhanced Open-Set Object DetectorPoster13 citations
- DG-PIC: Domain Generalized Point-In-Context Learning for Point Cloud UnderstandingPoster13 citations
- Expanding Scene Graph Boundaries: Fully Open-vocabulary Scene Graph Generation via Visual-Concept Alignment and RetentionOral13 citations
- Faceptor: A Generalist Model for Face PerceptionOral13 citations
- Fake It till You Make It: Curricular Dynamic Forgery Augmentations towards General Deepfake DetectionPoster13 citations
- FlexAttention for Efficient High-Resolution Vision-Language ModelsPoster13 citations
- Gaussian Frosting: Editable Complex Radiance Fields with Real-Time RenderingOral13 citations
- GeoCalib: Learning Single-image Calibration with Geometric OptimizationPoster13 citations
- Hierarchical Gaussian Mixture Normalizing Flow Modeling for Unified Anomaly DetectionPoster13 citations
- I Can't Believe It's Not Scene Flow!Poster13 citations
- Improving Point-based Crowd Counting and Localization Based on Auxiliary Point GuidancePoster13 citations
- Large-Scale Multi-Hypotheses Cell Tracking Using Ultrametric Contours MapsPoster13 citations
- LayoutDETR: Detection Transformer Is a Good Multimodal Layout DesignerPoster13 citations
- Learned Rate Control for Frame-Level Adaptive Neural Video Compression via Dynamic Neural NetworkPoster13 citations
- Masked Angle-Aware Autoencoder for Remote Sensing ImagesPoster13 citations
- Meerkat: Audio-Visual Large Language Model for Grounding in Space and TimePoster13 citations
- Meta-Prompting for Automating Zero-shot Visual Recognition with LLMsPoster13 citations
- Object-Centric Diffusion for Efficient Video EditingPoster13 citations
- PreciseControl: Enhancing Text-To-Image Diffusion Models with Fine-Grained Attribute ControlPoster13 citations
- Revisit Human-Scene Interaction via Space OccupancyPoster13 citations
- SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression SegmentationPoster13 citations
- SQ-LLaVA: Self-Questioning for Large Vision-Language AssistantPoster13 citations
- TrojVLM: Backdoor Attack Against Vision Language ModelsPoster13 citations
- Uncertainty-aware sign language video retrieval with probability distribution modelingPoster13 citations
- Unveiling Typographic Deceptions: Insights of the Typographic Vulnerability in Large Vision-Language ModelsPoster13 citations
- A Closer Look at GAN Priors: Exploiting Intermediate Features for Enhanced Model Inversion AttacksOral12 citations
- Beta-Tuned Timestep Diffusion ModelPoster12 citations
- Beyond Prompt Learning: Continual Adapter for Efficient Rehearsal-Free Continual LearningPoster12 citations
- CLAMP-ViT: Contrastive Data-Free Learning for Adaptive Post-Training Quantization of ViTsPoster12 citations
- DVLO: Deep Visual-LiDAR Odometry with Local-to-Global Feature Fusion and Bi-Directional Structure AlignmentOral12 citations
- Diff-Tracker: Text-to-Image Diffusion Models are Unsupervised TrackersPoster12 citations
- Diffusion for Natural Image MattingPoster12 citations
- Diffusion-Driven Data Replay: A Novel Approach to Combat Forgetting in Federated Class Continual LearningOral12 citations
- EditShield: Protecting Unauthorized Image Editing by Instruction-guided Diffusion ModelsPoster12 citations
- Explorative Inbetweening of Time and SpacePoster12 citations
- Few-shot Class Incremental Learning with Attention-Aware Self-Adaptive PromptPoster12 citations
- G3R: Gradient Guided Generalizable ReconstructionPoster12 citations
- GRA: Detecting Oriented Objects through Group-wise Rotating and AttentionPoster12 citations
- HYDRA: A Hyper Agent for Dynamic Compositional Visual ReasoningPoster12 citations
- Implicit Concept Removal of Diffusion ModelsPoster12 citations
- IntrinsicAnything: Learning Diffusion Priors for Inverse Rendering Under Unknown IlluminationPoster12 citations
- Isomorphic Pruning for Vision ModelsPoster12 citations
- LISO: Lidar-only Self-Supervised 3D Object DetectionPoster12 citations
- Language-Driven Physics-Based Scene Synthesis and Editing via Feature SplattingPoster12 citations
- Learning Natural Consistency Representation for Face Forgery Video DetectionPoster12 citations
- MUSES: The Multi-Sensor Semantic Perception Dataset for Driving under UncertaintyPoster12 citations
- Making Large Language Models Better Planners with Reasoning-Decision AlignmentOral12 citations
- MesonGS: Post-training Compression of 3D Gaussians via Efficient Attribute TransformationPoster12 citations
- Omni6DPose: A Benchmark and Model for Universal 6D Object Pose Estimation and TrackingPoster12 citations
- R3D-AD: Reconstruction via Diffusion for 3D Anomaly DetectionPoster12 citations
- SEGIC: Unleashing the Emergent Correspondence for In-Context SegmentationPoster12 citations
- Self-supervised Feature Adaptation for 3D Industrial Anomaly DetectionPoster12 citations
- StableDrag: Stable Dragging for Point-based Image EditingPoster12 citations
- Synchronization is All You Need: Exocentric-to-Egocentric Transfer for Temporal Action Segmentation with Unlabeled Synchronized Video PairsPoster12 citations
- Text to Layer-wise 3D Clothed Human GenerationPoster12 citations
- Text-Conditioned Resampler For Long Form Video UnderstandingPoster12 citations
- Towards Neuro-Symbolic Video UnderstandingOral12 citations
- Trackastra: Transformer-based cell tracking for live-cell microscopyPoster12 citations
- UMBRAE: Unified Multimodal Brain DecodingPoster12 citations
- UniCode : Learning a Unified Codebook for Multimodal Large Language ModelsPoster12 citations
- Video Editing via Factorized Diffusion DistillationOral12 citations
- VideoStudio: Generating Consistent-Content and Multi-Scene VideosPoster12 citations
- "PointNeRF++: A multi-scale, point-based Neural Radiance Field"Poster11 citations
- AccDiffusion: An Accurate Method for Higher-Resolution Image GenerationPoster11 citations
- Benchmarks and Challenges in Pose Estimation for Egocentric Hand Interactions with ObjectsPoster11 citations
- Better Call SAL: Towards Learning to Segment Anything in LidarPoster11 citations
- Beyond the Contact: Discovering Comprehensive Affordance for 3D Objects from Pre-trained 2D Diffusion ModelsOral11 citations
- Centering the Value of Every Modality: Towards Efficient and Resilient Modality-agnostic Semantic SegmentationPoster11 citations
- Cross-view image geo-localization with Panorama-BEV Co-Retrieval NetworkPoster11 citations
- Enhancing Semantic Fidelity in Text-to-Image Synthesis: Attention Regulation in Diffusion ModelsPoster11 citations
- Exemplar-free Continual Representation Learning via Learnable Drift CompensationPoster11 citations
- Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object SegmentationPoster11 citations
- FocusDiffuser: Perceiving Local Disparities for Camouflaged Object DetectionPoster11 citations
- Hierarchical Temporal Context Learning for Camera-based Semantic Scene CompletionPoster11 citations
- Keypoint Promptable Re-IdentificationPoster11 citations
- Knowledge Transfer with Simulated Inter-Image Erasing for Weakly Supervised Semantic SegmentationPoster11 citations
- Language-Driven 6-DoF Grasp Detection Using Negative Prompt GuidanceOral11 citations
- Lego: Learning to Disentangle and Invert Personalized Concepts Beyond Object Appearance in Text-to-Image Diffusion ModelsPoster11 citations
- LookupViT: Compressing visual information to a limited number of tokensPoster11 citations
- Lossy Image Compression with Foundation Diffusion ModelsPoster11 citations
- M2D2M: Multi-Motion Generation from Text with Discrete Diffusion ModelsPoster11 citations
- Motion-prior Contrast Maximization for Dense Continuous-Time Motion EstimationPoster11 citations
- Multistain Pretraining for Slide Representation Learning in PathologyPoster11 citations
- PALM: Predicting Actions through Language ModelsPoster11 citations
- PPAD: Iterative Interactions of Prediction and Planning for End-to-end Autonomous DrivingPoster11 citations
- Parrot Captions Teach CLIP to Spot TextOral11 citations
- Reliability in Semantic Segmentation: Can We Use Synthetic Data?Poster11 citations
- SWinGS: Sliding Windows for Dynamic 3D Gaussian SplattingPoster11 citations
- ScanReason: Empowering 3D Visual Grounding with Reasoning CapabilitiesPoster11 citations
- SceneTeller: Language-to-3D Scene GenerationPoster11 citations
- SegGen: Supercharging Segmentation Models with Text2Mask and Mask2Img SynthesisPoster11 citations
- Select and Distill: Selective Dual-Teacher Knowledge Transfer for Continual Learning on Vision-Language ModelsPoster11 citations
- Semantic Residual Prompts for Continual LearningPoster11 citations
- Teaching Tailored to Talent: Adverse Weather Restoration via Prompt Pool and Depth-Anything ConstraintPoster11 citations
- TetraDiffusion: Tetrahedral Diffusion Models for 3D Shape GenerationPoster11 citations
- TexGen: Text-Guided 3D Texture Generation with Multi-view Sampling and ResamplingPoster11 citations
- UniM2AE: Multi-modal Masked Autoencoders with Unified 3D Representation for 3D Perception in Autonomous DrivingPoster11 citations
- Visual Text Generation in the WildPoster11 citations
- WildVidFit: Video Virtual Try-On in the Wild via Image-Based Controlled Diffusion ModelsPoster11 citations
- X-Pose: Detecting Any KeypointsPoster11 citations
- ZeroI2V: Zero-Cost Adaptation of Pre-Trained Transformers from Image to VideoPoster11 citations
- milliFlow: Scene Flow Estimation on mmWave Radar Point Cloud for Human Motion SensingPoster11 citations
- 3D Gaussian Parametric Head ModelPoster10 citations
- Accelerating Image Generation with Sub-path Linear Approximation ModelOral10 citations
- An Incremental Unified Framework for Small Defect InspectionPoster10 citations
- Boosting the Power of Small Multimodal Reasoning Models to Match Larger Models with Self-Consistency TrainingPoster10 citations
- Bridging the Gap Between Human Motion and Action Semantics via Kinematics PhrasesPoster10 citations
- DreamStruct: Understanding Slides and User Interfaces via Synthetic Data GenerationPoster10 citations
- Efficient Image Pre-Training with Siamese Cropped Masked AutoencodersPoster10 citations
- F-HOI: Toward Fine-grained Semantic-Aligned 3D Human-Object InteractionsPoster10 citations
- Fairness-aware Vision Transformer via Debiased Self-AttentionPoster10 citations
- Find n' Propagate: Open-Vocabulary 3D Object Detection in Urban EnvironmentsPoster10 citations
- Finding Visual Task VectorsPoster10 citations
- Free-Editor: Zero-shot Text-driven 3D Scene EditingPoster10 citations
- GiT: Towards Generalist Vision Transformer through Universal Language InterfaceOral10 citations
- Harnessing Text-to-Image Diffusion Models for Category-Agnostic Pose EstimationOral10 citations
- Hybrid Video Diffusion Models with 2D Triplane and 3D Wavelet RepresentationPoster10 citations
- In Defense of Lazy Visual Grounding for Open-Vocabulary Semantic SegmentationPoster10 citations
- Inf-DiT: Upsampling any-resolution image with memory-efficient diffusion transformer.Poster10 citations
- LAPT: Label-driven Automated Prompt Tuning for OOD Detection with Vision-Language ModelsPoster10 citations
- MaxFusion: Plug&Play Multi-Modal Generation in Text-to-Image Diffusion ModelsPoster10 citations
- Mixture of Efficient Diffusion Experts Through Automatic Interval and Sub-Network SelectionPoster10 citations
- MotionChain: Conversational Motion Controllers via Multimodal PromptsPoster10 citations
- OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and WebPoster10 citations
- Open Panoramic SegmentationPoster10 citations
- Open-Vocabulary Camouflaged Object SegmentationPoster10 citations
- PILoRA: Prototype Guided Incremental LoRA for Federated Class-Incremental LearningPoster10 citations
- PreSight: Enhancing Autonomous Vehicle Perception with City-Scale NeRF PriorsPoster10 citations
- PromptIQA: Boosting the Performance and Generalization for No-Reference Image Quality Assessment via PromptsPoster10 citations
- Protecting NeRFs' Copyright via Plug-And-Play Watermarking Base ModelPoster10 citations
- Quantized Prompt for Efficient Generalization of Vision-Language ModelsPoster10 citations
- Salience-Based Adaptive Masking: Revisiting Token Dynamics for Enhanced Pre-trainingPoster10 citations
- SlimFlow: Training Smaller One-Step Diffusion Models with Rectified FlowPoster10 citations
- Spiking Wavelet TransformerPoster10 citations
- Taming Latent Diffusion Model for Neural Radiance Field InpaintingPoster10 citations
- Temporally Consistent Stereo MatchingPoster10 citations
- Towards Open Domain Text-Driven Synthesis of Multi-Person MotionsPoster10 citations
- Towards Open-Ended Visual Recognition with Large Language ModelsPoster10 citations
- UniMD: Towards Unifying Moment Retrieval and Temporal Action DetectionPoster10 citations
- UniProcessor: A Text-induced Unified Low-level Image ProcessorPoster10 citations
- Unleashing the Power of Prompt-driven Nucleus Instance SegmentationPoster10 citations
- ViLA: Efficient Video-Language Alignment for Video Question AnsweringPoster10 citations
- WHAC: World-grounded Humans and CamerasPoster10 citations
- WordRobe: Text-Guided Generation of Textured 3D GarmentsPoster10 citations
- You Only Need One Step: Fast Super-Resolution with Stable Diffusion via Scale DistillationPoster10 citations
- Zero-shot Object Counting with Good ExemplarsPoster10 citations
- A Graph-Based Approach for Category-Agnostic Pose EstimationPoster9 citations
- Animate Your Motion: Turning Still Images into Dynamic VideosPoster9 citations
- AugUndo: Scaling Up Augmentations for Monocular Depth Completion and EstimationPoster9 citations
- Auto-GAS: Automated Proxy Discovery for Training-free Generative Architecture SearchPoster9 citations
- BEAF: Observing BEfore-AFter Changes to Evaluate Hallucination in Vision-language ModelsPoster9 citations
- BlenderAlchemy: Editing 3D Graphics with Vision-Language ModelsPoster9 citations
- Caltech Aerial RGB-Thermal Dataset in the WildPoster9 citations
- Cascade Prompt Learning for Visual-Language Model AdaptationPoster9 citations
- CoDA: Instructive Chain-of-Domain Adaptation with Severity-Aware Visual Prompt TuningPoster9 citations
- Context Diffusion: In-Context Aware Image GenerationPoster9 citations
- Contourlet Residual for Prompt Learning Enhanced Infrared Image Super-ResolutionPoster9 citations
- DEAL: Disentangle and Localize Concept-level Explanations for VLMsPoster9 citations
- Dataset Enhancement with Instance-Level AugmentationsOral9 citations
- Deep Diffusion Image Prior for Efficient OOD Adaptation in 3D Inverse ProblemsPoster9 citations
- Defect Spectrum: A Granular Look of Large-scale Defect Datasets with Rich SemanticsPoster9 citations
- Distractors-Immune Representation Learning with Cross-modal Contrastive Regularization for Change CaptioningPoster9 citations
- Embracing Events and Frames with Hierarchical Feature Refinement Network for Object DetectionPoster9 citations
- Emergent Visual-Semantic Hierarchies in Image-Text RepresentationsOral9 citations
- Emerging Property of Masked Token for Effective Pre-trainingPoster9 citations
- Enhancing Vectorized Map Perception with Historical Rasterized MapsPoster9 citations
- EventBind: Learning a Unified Representation to Bind Them All for Event-based Open-world UnderstandingPoster9 citations
- Fast Diffusion-Based Counterfactuals for Shortcut Removal and GenerationOral9 citations
- FlexiEdit: Frequency-Aware Latent Refinement for Enhanced Non-Rigid EditingPoster9 citations
- GeneralAD: Anomaly Detection Across Domains by Attending to Distorted FeaturesPoster9 citations
- Grounding Language Models for Visual Entity RecognitionPoster9 citations
- HENet: Hybrid Encoding for End-to-end Multi-task 3D Perception from Multi-view CamerasPoster9 citations
- Human Hair Reconstruction with Strand-Aligned 3D GaussiansPoster9 citations
- Image Demoireing in RAW and sRGB DomainsPoster9 citations
- InfMAE: A Foundation Model in The Infrared ModalityPoster9 citations
- InterFusion: Text-Driven Generation of 3D Human-Object InteractionPoster9 citations
- Knowledge-enhanced Visual-Language Pretraining for Computational PathologyOral9 citations
- LLM as Copilot for Coarse-grained Vision-and-Language NavigationPoster9 citations
- Learning Unsigned Distance Functions from Multi-view Images with Volume Rendering PriorsPoster9 citations
- Mask2Map: Vectorized HD Map Construction Using Bird's Eye View Segmentation MasksOral9 citations
- Masked Video and Body-worn IMU Autoencoder for Egocentric Action RecognitionPoster9 citations
- MetaCap: Meta-learning Priors from Multi-View Imagery for Sparse-view Human Performance Capture and RenderingPoster9 citations
- MinD-3D: Reconstruct High-quality 3D objects in Human BrainPoster9 citations
- OGNI-DC: Robust Depth Completion with Optimization-Guided Neural IterationsPoster9 citations
- Online Zero-Shot Classification with CLIPPoster9 citations
- PathMMU: A Massive Multimodal Expert-Level Benchmark for Understanding and Reasoning in PathologyOral9 citations
- Prioritized Semantic Learning for Zero-shot Instance NavigationPoster9 citations
- Progressive Pretext Task Learning for Human Trajectory PredictionPoster9 citations
- PromptCCD: Learning Gaussian Mixture Prompt Pool for Continual Category DiscoveryPoster9 citations
- RadEdit: stress-testing biomedical vision models via diffusion image editingPoster9 citations
- Real-time 3D-aware Portrait Editing from a Single ImagePoster9 citations
- SAM-COD: SAM-guided Unified Framework for Weakly-Supervised Camouflaged Object DetectionPoster9 citations
- Safe-Sim: Safety-Critical Closed-Loop Traffic Simulation with Diffusion-Controllable AdversariesPoster9 citations
- Scissorhands: Scrub Data Influence via Connection Sensitivity in NetworksPoster9 citations
- SegVG: Transferring Object Bounding Box to Segmentation for Visual GroundingPoster9 citations
- SignAvatars: A Large-scale 3D Sign Language Holistic Motion Dataset and BenchmarkPoster9 citations
- SphereHead: Stable 3D Full-head Synthesis with Spherical Tri-plane RepresentationOral9 citations
- Textual Knowledge Matters: Cross-Modality Co-Teaching for Generalized Visual Class DiscoveryPoster9 citations
- The Nerfect Match: Exploring NeRF Features for Visual LocalizationPoster9 citations
- Thinking Outside the BBox: Unconstrained Generative Object CompositingPoster9 citations
- Turbo: Informativity-Driven Acceleration Plug-In for Vision-Language Large ModelsOral9 citations
- ViC-MAE: Self-Supervised Representation Learning from Images and Video with Contrastive Masked AutoencodersPoster9 citations
- VisionTrap: Vision-Augmented Trajectory Prediction Guided by Textual DescriptionsPoster9 citations
- VividDreamer: Invariant Score Distillation for Hyper-Realistic Text-to-3D GenerationPoster9 citations
- WTS: A Pedestrian-Centric Traffic Video Dataset for Fine-grained Spatial-Temporal UnderstandingPoster9 citations
- "NeuSDFusion: A Spatial-Aware Generative Model for 3D Shape Completion, Reconstruction, and Generation"Poster8 citations
- 3D Hand Pose Estimation in Everyday Egocentric ImagesPoster8 citations
- 3DGazeNet: Generalizing Gaze Estimation with Weak Supervision from Synthetic ViewsPoster8 citations
- AMD: Automatic Multi-step Distillation of Large-scale Vision ModelsPoster8 citations
- AMEGO: Active Memory from long EGOcentric videosPoster8 citations
- Adaptive Bounding Box Uncertainties via Two-Step Conformal PredictionOral8 citations
- AddressCLIP: Empowering Vision-Language Models for City-wide Image Address LocalizationPoster8 citations
- AnyControl: Create Your Artwork with Versatile Control on Text-to-Image GenerationPoster8 citations
- BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual CuesPoster8 citations
- Benchmarking Object Detectors with COCO: A New Path ForwardPoster8 citations
- Connecting Consistency Distillation to Score Distillation for Text-to-3D GenerationPoster8 citations
- Contrasting Deepfakes Diffusion via Contrastive Learning and Global-Local SimilaritiesPoster8 citations
- Controllable Navigation Instruction Generation with Chain of Thought PromptingPoster8 citations
- Deciphering the Role of Representation Disentanglement: Investigating Compositional Generalization in CLIP ModelsPoster8 citations
- Diffusion Models for Open-Vocabulary SegmentationOral8 citations
- EGIC: Enhanced Low-Bit-Rate Generative Image Compression Guided by Semantic SegmentationPoster8 citations
- EMIE-MAP: Large-Scale Road Surface Reconstruction Based on Explicit Mesh and Implicit EncodingPoster8 citations
- Editable Image Elements for Controllable SynthesisPoster8 citations
- EgoCVR: An Egocentric Benchmark for Fine-Grained Composed Video RetrievalPoster8 citations
- EgoPoser: Robust Real-Time Egocentric Pose Estimation from Sparse and Intermittent Observations EverywherePoster8 citations
- Enhancing Diffusion Models with Text-Encoder Reinforcement LearningPoster8 citations
- Enhancing Recipe Retrieval with Foundation Models: A Data Augmentation PerspectivePoster8 citations
- Exploring Conditional Multi-Modal Prompts for Zero-shot HOI DetectionPoster8 citations
- Fast View Synthesis of Casual Videos with Soup-of-PlanesPoster8 citations
- Fisher Calibration for Backdoor-Robust Heterogeneous Federated LearningPoster8 citations
- General and Task-Oriented Video SegmentationPoster8 citations
- HERGen: Elevating Radiology Report Generation with Longitudinal DataPoster8 citations
- HYPE: Hyperbolic Entailment Filtering for Underspecified Images and TextsOral8 citations
- IMMA: Immunizing text-to-image Models against Malicious AdaptationPoster8 citations
- Improving Video Segmentation via Dynamic Anchor QueriesPoster8 citations
- Improving Zero-Shot Generalization for CLIP with Variational AdapterPoster8 citations
- InstaStyle: Inversion Noise of a Stylized Image is Secretly a Style AdviserPoster8 citations
- InstructGIE: Towards Generalizable Image EditingPoster8 citations
- Iterative Ensemble Training with Anti-Gradient Control for Mitigating Memorization in Diffusion ModelsPoster8 citations
- KDProR: A Knowledge-Decoupling Probabilistic Framework for Video-Text RetrievalPoster8 citations
- Kalman-Inspired Feature Propagation for Video Face Super-ResolutionPoster8 citations
- Lazy Diffusion Transformer for Interactive Image EditingPoster8 citations
- Learning to Adapt SAM for Segmenting Cross-domain Point CloudsPoster8 citations
- Listen to Look into the Future: Audio-Visual Egocentric Gaze AnticipationPoster8 citations
- MANIKIN: Biomechanically Accurate Neural Inverse Kinematics for Human Motion EstimationPoster8 citations
- MART: MultiscAle Relational Transformer Networks for Multi-agent Trajectory PredictionPoster8 citations
- MSD: A Benchmark Dataset for Floor Plan Generation of Building ComplexesPoster8 citations
- MVPGS: Excavating Multi-view Priors for Gaussian Splatting from Sparse Input ViewsPoster8 citations
- MarineInst: A Foundation Model for Marine Image Analysis with Instance Visual DescriptionOral8 citations
- Match-Stereo-Videos: Bidirectional Alignment for Consistent Dynamic Stereo MatchingPoster8 citations
- Meta-optimized Angular Margin Contrastive Framework for Video-Language Representation LearningPoster8 citations
- Mismatch Quest: Visual and Textual Feedback for Image-Text MisalignmentPoster8 citations
- MoE-DiffIR: Task-customized Diffusion Priors for Universal Compressed Image RestorationPoster8 citations
- MultiDelete for Multimodal Machine UnlearningPoster8 citations
- NICP: Neural ICP for 3D Human Registration at ScalePoster8 citations
- OV-Uni3DETR: Towards Unified Open-Vocabulary 3D Object Detection via Cycle-Modality PropagationPoster8 citations
- Object-Conditioned Energy-Based Attention Map Alignment in Text-to-Image Diffusion ModelsPoster8 citations
- OmniNOCS: A unified NOCS dataset and model for 3D lifting of 2D objectsOral8 citations
- On the Utility of 3D Hand Poses for Action RecognitionPoster8 citations
- Pathology-knowledge Enhanced Multi-instance Prompt Learning for Few-shot Whole Slide Image ClassificationPoster8 citations
- RAPiD-Seg: Range-Aware Pointwise Distance Distribution Networks for 3D LiDAR SegmentationOral8 citations
- RAW-Adapter: Adapting Pretrained Visual Model to Camera RAW ImagesPoster8 citations
- ReMatching: Low-Resolution Representations for Scalable Shape CorrespondencePoster8 citations
- Recursive Visual ProgrammingPoster8 citations
- RegionDrag: Fast Region-Based Image Editing with Diffusion ModelsPoster8 citations
- RoadPainter: Points Are Ideal Navigators for Topology transformERPoster8 citations
- SAFNet: Selective Alignment Fusion Network for Efficient HDR ImagingPoster8 citations
- SEED: A Simple and Effective 3D DETR in Point CloudsPoster8 citations
- SmartControl: Enhancing ControlNet for Handling Rough Visual ConditionsPoster8 citations
- StoryImager: A Unified and Efficient Framework for Coherent Story Visualization and CompletionPoster8 citations
- TF-FAS: Twofold-Element Fine-Grained Semantic Guidance for Generalizable Face Anti-SpoofingPoster8 citations
- Teach CLIP to Develop a Number Sense for Ordinal RegressionPoster8 citations
- TexDreamer: Towards Zero-Shot High-Fidelity 3D Human Texture GenerationOral8 citations
- Text2LiDAR: Text-guided LiDAR Point Clouds Generation via Equirectangular TransformerPoster8 citations
- Toward Open Vocabulary Aerial Object Detection with CLIP-Activated Student-Teacher LearningPoster8 citations
- Towards Multimodal Open-Set Domain Generalization and Adaptation through Self-supervisionPoster8 citations
- UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World UnderstandingPoster8 citations
- Unified Embedding Alignment for Open-Vocabulary Video Instance SegmentationPoster8 citations
- Unlocking the Potential of Federated Learning: The Symphony of Dataset Distillation via Deep Generative LatentsPoster8 citations
- VQ-HPS: Human Pose and Shape Estimation in a Vector-Quantized Latent SpacePoster8 citations
- WeConvene: Learned Image Compression with Wavelet-Domain Convolution and Entropy ModelPoster8 citations
- When Fast Fourier Transform Meets Transformer for Image RestorationPoster8 citations
- Where am I? Scene Retrieval with LanguagePoster8 citations
- WildRefer: 3D Object Localization in Large-scale Dynamic Scenes with Multi-modal Visual Data and Natural LanguagePoster8 citations
- ZeST: Zero-Shot Material Transfer from a Single ImagePoster8 citations
- "Close, But Not There: Boosting Geographic Distance Sensitivity in Visual Place Recognition"Poster7 citations
- "RICA^2: Rubric-Informed, Calibrated Assessment of Actions"Poster7 citations
- 3DEgo: 3D Editing on the Go!Poster7 citations
- 4Diff: 3D-Aware Diffusion Model for Third-to-First Viewpoint TranslationPoster7 citations
- Adapting Fine-Grained Cross-View Localization to Areas without Fine Ground TruthPoster7 citations
- Adaptive Multi-head Contrastive LearningPoster7 citations
- An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual RepresentationPoster7 citations
- Animal Avatars: Reconstructing Animatable 3D Animals from Casual VideosOral7 citations
- Bridge Past and Future: Overcoming Information Asymmetry in Incremental Object DetectionPoster7 citations
- CMTA: Cross-Modal Temporal Alignment for Event-guided Video DeblurringPoster7 citations
- CTRLorALTer: Conditional LoRAdapter for Efficient 0-Shot Control & Altering of T2I ModelsPoster7 citations
- CaesarNeRF: Calibrated Semantic Representation for Few-Shot Generalizable Neural RenderingPoster7 citations
- City-on-Web: Real-time Neural Rendering of Large-scale Scenes on the WebPoster7 citations
- Class-Agnostic Object Counting with Text-to-Image Diffusion ModelPoster7 citations
- Closed-Loop Unsupervised Representation Disentanglement with $\\beta$-VAE Distillation and Diffusion Probabilistic FeedbackPoster7 citations
- CoReS: Orchestrating the Dance of Reasoning and SegmentationPoster7 citations
- ConGeo: Robust Cross-view Geo-localization across Ground View VariationsPoster7 citations
- Continuous Memory Representation for Anomaly DetectionPoster7 citations
- Contrastive ground-level image and remote sensing pre-training improves representation learning for natural world imageryPoster7 citations
- ControlCap: Controllable Region-level CaptioningPoster7 citations
- CrossGLG: LLM Guides One-shot Skeleton-based 3D Action Recognition in a Cross-level MannerPoster7 citations
- DAMSDet: Dynamic Adaptive Multispectral Detection Transformer with Competitive Query Selection and Adaptive Feature FusionPoster7 citations
- DGR-MIL: Exploring Diverse Global Representation in Multiple Instance Learning for Whole Slide Image ClassificationPoster7 citations
- DIM: Dyadic Interaction Modeling for Social Behavior GenerationPoster7 citations
- DataDream: Few-shot Guided Dataset GenerationPoster7 citations
- DeTra: A Unified Model for Object Detection and Trajectory ForecastingPoster7 citations
- Dense Multimodal Alignment for Open-Vocabulary 3D Scene UnderstandingPoster7 citations
- DiffFAS: Face Anti-Spoofing via Generative Diffusion ModelsPoster7 citations
- Diffusion Models for Monocular Depth Estimation: Overcoming Challenging ConditionsPoster7 citations
- Dissolving Is Amplifying: Towards Fine-Grained Anomaly DetectionPoster7 citations
- DreamDissector: Learning Disentangled Text-to-3D Generation from 2D Diffusion PriorsPoster7 citations
- DreamMotion: Space-Time Self-Similar Score Distillation for Zero-Shot Video EditingPoster7 citations
- EgoPoseFormer: A Simple Baseline for Stereo Egocentric 3D Human Pose EstimationPoster7 citations
- EmoTalk3D: High-Fidelity Free-View Synthesis of Emotional 3D Talking HeadPoster7 citations
- Enhancing Perceptual Quality in Video Super-Resolution through Temporally-Consistent Detail Synthesis using Diffusion ModelsPoster7 citations
- EvSign: Sign Language Recognition and Translation with Streaming EventsPoster7 citations
- Event Camera Data Dense Pre-trainingPoster7 citations
- Explain via Any Concept: Concept Bottleneck Model with Open Vocabulary ConceptsPoster7 citations
- FRDiff : Feature Reuse for Universal Training-free Acceleration of Diffusion ModelsPoster7 citations
- Fast Context-Based Low-Light Image Enhancement via Neural Implicit RepresentationsPoster7 citations
- Forest2Seq: Revitalizing Order Prior for Sequential Indoor Scene SynthesisPoster7 citations
- GS-Pose: Category-Level Object Pose Estimation via Geometric and Semantic CorrespondencePoster7 citations
- GSD: View-Guided Gaussian Splatting Diffusion for 3D ReconstructionPoster7 citations
- GarmentCodeData: A Dataset of 3D Made-to-Measure Garments With Sewing PatternsPoster7 citations
- GenView: Enhancing View Quality with Pretrained Generative Model for Self-Supervised LearningPoster7 citations
- HUMOS: Human Motion Model Conditioned on Body ShapePoster7 citations
- IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth GenerationPoster7 citations
- Imaging Interiors: An Implicit Solution to Electromagnetic Inverse Scattering ProblemsPoster7 citations
- Improving Virtual Try-On with Garment-focused Diffusion ModelsPoster7 citations
- Improving Zero-shot Generalization of Learned Prompts via Unsupervised Knowledge DistillationPoster7 citations
- InsMapper: Exploring Inner-instance Information for Vectorized HD MappingPoster7 citations
- Kernel Diffusion: An Alternate Approach to Blind DeconvolutionPoster7 citations
- LEIA: Latent View-invariant Embeddings for Implicit 3D ArticulationPoster7 citations
- LPViT: Low-Power Semi-structured Pruning for Vision TransformersPoster7 citations
- LaPose: Laplacian Mixture Shape Modeling for RGB-Based Category-Level Object Pose EstimationPoster7 citations
- Latent Diffusion Prior Enhanced Deep Unfolding for Snapshot Spectral Compressive ImagingOral7 citations
- Learning Representations from Foundation Models for Domain Generalized Stereo MatchingPoster7 citations
- Learning Representations of Satellite Images From Metadata SupervisionPoster7 citations
- Length-Aware Motion Synthesis via Latent DiffusionPoster7 citations
- LiteSAM is Actually what you Need for segment EverythingPoster7 citations
- MAGR: Manifold-Aligned Graph Regularization for Continual Action Quality AssessmentOral7 citations
- MagDiff: Multi-Alignment Diffusion for High-Fidelity Video Generation and EditingPoster7 citations
- Missing Modality Prediction for Unpaired Multimodal Learning via Joint Embedding of Unimodal ModelsPoster7 citations
- Monocular Occupancy Prediction for Scalable Indoor ScenesPoster7 citations
- Multi-branch Collaborative Learning Network for 3D Visual GroundingPoster7 citations
- Navigation Instruction Generation with BEV Perception and Large Language ModelsPoster7 citations
- Nonverbal Interaction DetectionPoster7 citations
- OPEN: Object-wise Position Embedding for Multi-view 3D Object DetectionPoster7 citations
- OmniSSR: Zero-shot Omnidirectional Image Super-Resolution using Stable Diffusion ModelOral7 citations
- One-stage Prompt-based Continual LearningPoster7 citations
- OneVOS: Unifying Video Object Segmentation with All-in-One Transformer FrameworkPoster7 citations
- PixOOD: Pixel-Level Out-of-Distribution DetectionPoster7 citations
- PosFormer: Recognizing Complex Handwritten Mathematical Expression with Position Forest TransformerPoster7 citations
- Prompting Future Driven Diffusion Model for Hand Motion PredictionPoster7 citations
- Raindrop Clarity: A Dual-Focused Dataset for Day and Night Raindrop RemovalPoster7 citations
- ReLoo: Reconstructing Humans Dressed in Loose Garments from Monocular Video in the WildPoster7 citations
- Real-time Holistic Robot Pose Estimation with Unknown StatesPoster7 citations
- Ref-AVS: Refer and Segment Objects in Audio-Visual ScenesPoster7 citations
- Referring Atomic Video Action RecognitionPoster7 citations
- Reflective Instruction Tuning: Mitigating Hallucinations in Large Vision-Language ModelsPoster7 citations
- Region-Adaptive Transform with Segmentation Prior for Image CompressionPoster7 citations
- Reshaping the Online Data Buffering and Organizing Mechanism for Continual Test-Time AdaptationPoster7 citations
- Robust Calibration of Large Vision-Language AdaptersPoster7 citations
- Robust-Wide: Robust Watermarking against Instruction-driven Image EditingPoster7 citations
- SAGS: Structure-Aware 3D Gaussian SplattingPoster7 citations
- SLEDGE: Synthesizing Driving Environments with Generative Models and Rule-Based TrafficPoster7 citations
- ScanTalk: 3D Talking Heads from Unregistered ScansPoster7 citations
- Seeing the Unseen: A Frequency Prompt Guided Transformer for Image RestorationPoster7 citations
- Self-Adapting Large Visual-Language Models to Edge Devices across Visual ModalitiesPoster7 citations
- Self-Supervised Representation Learning for Adversarial Attack DetectionPoster7 citations
- Self-supervised visual learning from interactions with objectsPoster7 citations
- Skews in the Phenomenon Space Hinder Generalization in Text-to-Image GenerationPoster7 citations
- Source Prompt Disentangled Inversion for Boosting Image Editability with Diffusion ModelsPoster7 citations
- Stepping Stones: A Progressive Training Strategy for Audio-Visual Semantic SegmentationPoster7 citations
- StructLDM: Structured Latent Diffusion for 3D Human GenerationPoster7 citations
- Temporal-Mapping Photography for Event CamerasPoster7 citations
- Towards Real-world Event-guided Low-light Video Enhancement and DeblurringPoster7 citations
- TrackNeRF: Bundle Adjusting NeRF from Sparse and Noisy Views via Feature TracksPoster7 citations
- Training-Free Model Merging for Multi-target Domain AdaptationPoster7 citations
- VEON: Vocabulary-Enhanced Occupancy PredictionPoster7 citations
- Videoshop: Localized Semantic Video Editing with Noise-Extrapolated Diffusion InversionPoster7 citations
- Visible and Clear: Finding Tiny Objects in Difference MapPoster7 citations
- Visual Alignment Pre-training for Sign Language TranslationPoster7 citations
- When Pedestrian Detection Meets Multi-Modal Learning: Generalist Model and Benchmark DatasetPoster7 citations
- Within the Dynamic Context: Inertia-aware 3D Human Modeling with Pose SequencePoster7 citations
- You Only Learn One Query: Learning Unified Human Query for Single-Stage Multi-Person Multi-Task Human-Centric PerceptionPoster7 citations
- iMatching: Imperative Correspondence LearningPoster7 citations
- ∞-Brush: Controllable Large Image Synthesis with Diffusion Models in Infinite DimensionsPoster7 citations
- "ByteEdit: Boost, Comply and Accelerate Generative Image Editing"Poster6 citations
- A Simple Latent Diffusion Approach for Panoptic Segmentation and Mask InpaintingPoster6 citations
- AFF-ttention! Affordances and Attention models for Short-Term Object Interaction AnticipationPoster6 citations
- Accelerating Online Mapping and Behavior Prediction via Direct BEV Feature AttentionPoster6 citations
- Action2Sound: Ambient-Aware Generation of Action Sounds from Egocentric VideosOral6 citations
- Active Generation for Image ClassificationPoster6 citations
- Adaptive Compressed Sensing with Diffusion-Based Posterior SamplingPoster6 citations
- An Efficient and Effective Transformer Decoder-Based Framework for Multi-Task Visual GroundingPoster6 citations
- AttnZero: Efficient Attention Discovery for Vision TransformersPoster6 citations
- BeNeRF:Neural Radiance Fields from a Single Blurry Image and Event StreamPoster6 citations
- Betrayed by Attention: A Simple yet Effective Approach for Self-supervised Video Object SegmentationPoster6 citations
- Beyond MOT: Semantic Multi-Object TrackingPoster6 citations
- Beyond Pixels: Semi-Supervised Semantic Segmentation with a Multi-scale Patch-based Multi-Label ClassifierPoster6 citations
- Bridging Synthetic and Real Worlds for Pre-training Scene Text DetectorsPoster6 citations
- C2C: Component-to-Composition Learning for Zero-Shot Compositional Action RecognitionOral6 citations
- CAT-SAM: Conditional Tuning for Few-Shot Adaptation of Segment Anything ModelOral6 citations
- COHO: Context-Sensitive City-Scale Hierarchical Urban Layout GenerationOral6 citations
- CVT-Occ: Cost Volume Temporal Fusion for 3D Occupancy PredictionPoster6 citations
- CadVLM: Bridging Language and Vision in the Generation of Parametric CAD SketchesPoster6 citations
- Category Adaptation Meets Projected Distillation in Generalized Continual Category DiscoveryPoster6 citations
- ChEX: Interactive Localization and Region Description in Chest X-raysPoster6 citations
- ColorPeel: Color Prompt Learning with Diffusion Models via Color and Shape DisentanglementPoster6 citations
- Compress3D: a Compressed Latent Space for 3D Generation from a Single ImagePoster6 citations
- Crowd-SAM:SAM as a smart annotator for object detection in crowded scenesPoster6 citations
- DIAL: Dense Image-text ALignment for Weakly Supervised Semantic SegmentationPoster6 citations
- Dataset Quantization with Active Learning based Adaptive SamplingPoster6 citations
- DeCo: Decoupled Human-Centered Diffusion Video Editing with Motion ConsistencyPoster6 citations
- Deblur e-NeRF: NeRF from Motion-Blurred Events under High-speed or Low-light ConditionsPoster6 citations
- Diff3DETR: Agent-based Diffusion Model for Semi-supervised 3D Object DetectionPoster6 citations
- Direct Distillation between Different DomainsPoster6 citations
- Domain Shifting: A Generalized Solution for Heterogeneous Cross-Modality Person Re-IdentificationPoster6 citations
- DreamMesh: Jointly Manipulating and Texturing Triangle Meshes for Text-to-3D GenerationPoster6 citations
- DreamMover: Leveraging the Prior of Diffusion Models for Image Interpolation with Large MotionPoster6 citations
- EDformer: Transformer-Based Event Denoising Across Varied Noise LevelsPoster6 citations
- Efficient Diffusion-Driven Corruption Editor for Test-Time AdaptationPoster6 citations
- Eliminating Feature Ambiguity for Few-Shot SegmentationPoster6 citations
- Elucidating the Hierarchical Nature of Behavior with Masked AutoencodersPoster6 citations
- Event-Adapted Video Super-ResolutionPoster6 citations
- Every Pixel Has its Moments: Ultra-High-Resolution Unpaired Image-to-Image Translation via Dense NormalizationPoster6 citations
- Explicitly Guided Information Interaction Network for Cross-modal Point Cloud CompletionPoster6 citations
- External Knowledge Enhanced 3D Scene Generation from SketchPoster6 citations
- FSD-BEV: Foreground Self-Distillation for Multi-view 3D Object DetectionPoster6 citations
- Foster Adaptivity and Balance in Learning with Noisy LabelsPoster6 citations
- Free-VSC: Free Semantics from Visual Foundation Models for Unsupervised Video Semantic CompressionPoster6 citations
- FroSSL: Frobenius Norm Minimization for Efficient Multiview Self-Supervised LearningPoster6 citations
- GaussReg: Fast 3D Registration with Gaussian SplattingPoster6 citations
- Geospecific View Generation - Geometry-Context Aware High-resolution Ground View Inference from Satellite ViewsOral6 citations
- Good Teachers Explain: Explanation-Enhanced Knowledge DistillationPoster6 citations
- Graph Neural Network Causal Explanation via Neural Causal ModelsPoster6 citations
- Guide-and-Rescale: Self-Guidance Mechanism for Effective Tuning-Free Real Image EditingPoster6 citations
- Hiding Imperceptible Noise in Curvature-Aware Patches for 3D Point Cloud AttackPoster6 citations
- Image Compression for Machine and Human Vision With Spatial-Frequency AdaptationPoster6 citations
- Improving Agent Behaviors with RL Fine-tuning for Autonomous DrivingPoster6 citations
- Improving Feature Stability during Upsampling -- Spectral Artifacts and the Importance of Spatial ContextPoster6 citations
- Improving Robustness to Model Inversion Attacks via Sparse Coding ArchitecturesPoster6 citations
- Insect Identification in the Wild: The AMI DatasetOral6 citations
- LayoutFlow: Flow Matching for Layout GenerationPoster6 citations
- Leveraging Hierarchical Feature Sharing for Efficient Dataset CondensationPoster6 citations
- Lost and Found: Overcoming Detector Failures in Online Multi-Object TrackingPoster6 citations
- Mono-ViFI: A Unified Learning Framework for Self-supervised Single- and Multi-frame Monocular Depth EstimationPoster6 citations
- Motion Aware Event Representation-driven Image DeblurringPoster6 citations
- Multi-modal Crowd Counting via a Broker ModalityPoster6 citations
- Multimodal Cross-Domain Few-Shot Learning for Egocentric Action RecognitionPoster6 citations
- Neural Spectral Decomposition for Dataset DistillationPoster6 citations
- Non-Exemplar Domain Incremental Learning via Cross-Domain Concept IntegrationPoster6 citations
- O2V-Mapping: Online Open-Vocabulary Mapping with Neural Implicit RepresentationPoster6 citations
- Open-Set Recognition in the Age of Vision-Language ModelsPoster6 citations
- OpenPSG: Open-set Panoptic Scene Graph Generation via Large Multimodal ModelsPoster6 citations
- Optimizing Diffusion Models for Joint Trajectory Prediction and Controllable GenerationPoster6 citations
- PARE-Net: Position-Aware Rotation-Equivariant Networks for Robust Point Cloud RegistrationPoster6 citations
- PanoVOS: Bridging Non-panoramic and Panoramic Views with Transformer for Video SegmentationPoster6 citations
- PatchRefiner: Leveraging Synthetic Data for Real-Domain High-Resolution Monocular Metric Depth EstimationPoster6 citations
- Photorealistic Object Insertion with Diffusion-Guided Inverse RenderingPoster6 citations
- Pix2Gif: Motion-Guided Diffusion for GIF GenerationPoster6 citations
- ProTIP: Probabilistic Robustness Verification on Text-to-Image Diffusion Models against Stochastic PerturbationPoster6 citations
- Prompt-Driven Contrastive Learning for Transferable Adversarial AttacksOral6 citations
- Realistic Human Motion Generation with Cross-Diffusion ModelsPoster6 citations
- Reliable Spatial-Temporal Voxels For Multi-Modal Test-Time AdaptationPoster6 citations
- Representing Topological Self-Similarity Using Fractal Feature Maps for Accurate Segmentation of Tubular StructuresPoster6 citations
- Restore Anything with Masks: Leveraging Mask Image Modeling for Blind All-in-One Image RestorationPoster6 citations
- Rethinking Few-shot Class-incremental Learning: Learning from YourselfPoster6 citations
- Rethinking Video Deblurring with Wavelet-Aware Dynamic Transformer and Diffusion ModelPoster6 citations
- Revisiting Supervision for Continual Representation LearningPoster6 citations
- SAMFusion: Sensor-Adaptive Multimodal Fusion for 3D Object Detection in Adverse WeatherPoster6 citations
- SAVE: Protagonist Diversification with Structure Agnostic Video EditingPoster6 citations
- SFPNet: Sparse Focal Point Network for Semantic Segmentation on General LiDAR Point CloudsPoster6 citations
- SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer LearningPoster6 citations
- SUMix: Mixup with Semantic and Uncertain InformationPoster6 citations
- ScatterFormer: Efficient Voxel Transformer with Scattered Linear AttentionPoster6 citations
- SceneGraphLoc: Cross-Modal Coarse Visual Localization on 3D Scene GraphsPoster6 citations
- Score Distillation Sampling with Learned Manifold CorrectivePoster6 citations
- Semi-Supervised Teacher-Reference-Student Architecture for Action Quality AssessmentPoster6 citations
- Shape2Scene: 3D Scene Representation Learning Through Pre-training on Shape DataPoster6 citations
- Soft Prompt Generation for Domain GeneralizationPoster6 citations
- SparseCraft: Few-Shot Neural Reconstruction through Stereopsis Guided Geometric LinearizationPoster6 citations
- Synergy of Sight and Semantics: Visual Intention Understanding with CLIPPoster6 citations
- TCAN: Animating Human Images with Temporally Consistent Pose Guidance using Diffusion ModelsPoster6 citations
- Tackling Structural Hallucination in Image Translation with Local DiffusionOral6 citations
- Teddy: Efficient Large-Scale Dataset Distillation via Taylor-Approximated MatchingPoster6 citations
- Towards Latent Masked Image Modeling for Self-Supervised Visual Representation LearningPoster6 citations
- Track Everything Everywhere Fast and RobustlyPoster6 citations
- Training-free Video Temporal Grounding using Large-scale Pre-trained ModelsPoster6 citations
- TransCAD: A Hierarchical Transformer for CAD Sequence Inference from Point CloudsPoster6 citations
- Tri^{2}-plane: Thinking Head Avatar via Feature PyramidPoster6 citations
- UNIC: Universal Classification Models via Multi-teacher DistillationPoster6 citations
- Unified Medical Image Pre-training in Language-Guided Common Semantic SpacePoster6 citations
- UpFusion: Novel View Diffusion from Unposed Sparse View ObservationsPoster6 citations
- VEGS: View Extrapolation of Urban Scenes in 3D Gaussian Splatting using Learned PriorsPoster6 citations
- Vision-Language Action Knowledge Learning for Semantic-Aware Action Quality AssessmentPoster6 citations
- VisionLLaMA: A Unified LLaMA Backbone for Vision TasksPoster6 citations
- Volumetric Rendering with Baked Quadrature FieldsPoster6 citations
- "Clearer Frames, Anytime: Resolving Velocity Ambiguity in Video Frame Interpolation"Oral5 citations
- 3D Single-object Tracking in Point Clouds with High Temporal VariationPoster5 citations
- A Simple Background Augmentation Method for Object Detection with Diffusion ModelPoster5 citations
- AMES: Asymmetric and Memory-Efficient Similarity Estimation for Instance-level RetrievalPoster5 citations
- ARoFace: Alignment Robustness to Improve Low-quality Face RecognitionPoster5 citations
- AdaDistill: Adaptive Knowledge Distillation for Deep Face RecognitionPoster5 citations
- AdaNAT: Exploring Adaptive Policy for Token-Based Image GenerationPoster5 citations
- AnatoMask: Enhancing Medical Image Segmentation with Reconstruction-guided Self-maskingPoster5 citations
- Asymmetric Mask Scheme for Self-Supervised Real Image DenoisingPoster5 citations
- Attention Beats Linear for Fast Implicit Neural Representation GenerationPoster5 citations
- Audio-visual Generalized Zero-shot Learning the Easy WayPoster5 citations
- Beat-It: Beat-Synchronized Multi-Condition 3D Dance GenerationOral5 citations
- Bidirectional Progressive Transformer for Interaction Intention AnticipationPoster5 citations
- Bottom-Up Domain Prompt Tuning for Generalized Face Anti-SpoofingPoster5 citations
- Brain-ID: Learning Contrast-agnostic Anatomical Representations for Brain ImagingPoster5 citations
- CLAP: Isolating Content from Style through Contrastive Learning with Augmented PromptsPoster5 citations
- CLIFF: Continual Latent Diffusion for Open-Vocabulary Object DetectionOral5 citations
- CLIP-Guided Generative Networks for Transferable Targeted Adversarial AttacksPoster5 citations
- Can Textual Semantics Mitigate Sounding Object Segmentation Preference?Poster5 citations
- Causality-inspired Discriminative Feature Learning in Triple Domains for Gait RecognitionPoster5 citations
- Certifiably Robust Image WatermarkPoster5 citations
- CloudFixer: Test-Time Adaptation for 3D Point Clouds via Diffusion-Guided Geometric TransformationPoster5 citations
- Co-synthesis of Histopathology Nuclei Image-Label Pairs using a Context-Conditioned Joint Diffusion ModelPoster5 citations
- CoSIGN: Few-Step Guidance of ConSIstency Model to Solve General INverse ProblemsPoster5 citations
- ConDense: Consistent 2D-3D Pre-training for Dense and Sparse Features from Multi-View ImagesOral5 citations
- Cross-Platform Video Person ReID: A New Benchmark Dataset and Adaptation ApproachPoster5 citations
- DA-BEV: Unsupervised Domain Adaptation for Bird's Eye View PerceptionPoster5 citations
- DIFFender: Diffusion-Based Adversarial Defense against Patch AttacksPoster5 citations
- Diagnosing and Re-learning for Balanced Multimodal LearningPoster5 citations
- DiffusionPen: Towards Controlling the Style of Handwritten Text GenerationPoster5 citations
- Distill Gold from Massive Ores: Bi-level Data Pruning towards Efficient Dataset DistillationPoster5 citations
- Dual-level Adaptive Self-Labeling for Novel Class Discovery in Point Cloud SegmentationPoster5 citations
- DySeT: a Dynamic Masked Self-distillation Approach for Robust Trajectory PredictionPoster5 citations
- E3M: Zero-Shot Spatio-Temporal Video Grounding with Expectation-Maximization Multimodal ModulationOral5 citations
- Efficient Vision Transformers with Partial AttentionPoster5 citations
- Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RLPoster5 citations
- Enhancing Cross-Subject fMRI-to-Video Decoding with Global-Local Functional AlignmentPoster5 citations
- Enhancing Source-Free Domain Adaptive Object Detection with Low-confidence Pseudo Label DistillationPoster5 citations
- Exploiting Semantic Reconstruction to Mitigate Hallucinations in Vision-Language ModelsPoster5 citations
- FLAT: Flux-aware Imperceptible Adversarial Attacks on 3D Point CloudsPoster5 citations
- Fast Training of Diffusion Transformer with Extreme Masking for 3D Point Clouds GenerationPoster5 citations
- Few-shot NeRF by Adaptive Rendering Loss RegularizationPoster5 citations
- FinePseudo: Improving Pseudo-Labelling through Temporal-Alignablity for Semi-Supervised Fine-Grained Action RecognitionPoster5 citations
- FisherRF: Active View Selection and Mapping with Radiance Fields using Fisher InformationOral5 citations
ECCV accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.