CVPR 2025 Accepted Papers
The full list of 2,872 papers accepted at CVPR 2025 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 2,468Highlight: 388Award Candidate: 15
- Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video AnalysisHighlight368 citations
- Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and GenerationPoster111 citations
- MambaVision: A Hybrid Mamba-Transformer Vision BackbonePoster105 citations
- MambaOut: Do We Really Need Mamba for Vision?Poster96 citations
- StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from TextPoster86 citations
- OmniGen: Unified Image GenerationPoster84 citations
- DepthCrafter: Generating Consistent Long Depth Sequences for Open-world VideosHighlight72 citations
- Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall SpacesPoster72 citations
- Structured 3D Latents for Scalable and Versatile 3D GenerationHighlight71 citations
- VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long VideosPoster60 citations
- EditSplat: Multi-View Fusion and Attention-Guided Optimization for View-Consistent 3D Scene Editing with 3D Gaussian SplattingPoster58 citations
- LLaVA-Critic: Learning to Evaluate Multimodal ModelsPoster53 citations
- Tora: Trajectory-oriented Diffusion Transformer for Video GenerationPoster52 citations
- Video-XL: Extra-Long Vision Language Model for Hour-Scale Video UnderstandingPoster52 citations
- Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image SynthesisPoster50 citations
- MoSca: Dynamic Gaussian Fusion from Casual Videos via 4D Motion ScaffoldsHighlight44 citations
- NVILA: Efficient Frontier Visual Language ModelsPoster43 citations
- T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video GenerationPoster43 citations
- VisionZip: Longer is Better but Not Necessary in Vision Language ModelsPoster43 citations
- WonderWorld: Interactive 3D Scene Generation from a Single ImageHighlight43 citations
- SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language ModelsPoster40 citations
- Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language ModelsHighlight39 citations
- JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and GenerationPoster38 citations
- Learning Temporally Consistent Video Depth from Video Diffusion PriorsPoster36 citations
- DepthSplat: Connecting Gaussian Splatting and DepthPoster34 citations
- TokenFlow: Unified Image Tokenizer for Multimodal Understanding and GenerationPoster34 citations
- VoCo-LLaMA: Towards Vision Compression with Large Language ModelsPoster34 citations
- DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous DrivingHighlight33 citations
- Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-trainingPoster33 citations
- Identity-Preserving Text-to-Video Generation by Frequency DecompositionHighlight32 citations
- Mamba-Reg: Vision Mamba Also Needs RegistersPoster29 citations
- Q-DiT: Accurate Post-Training Quantization for Diffusion TransformersPoster28 citations
- Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion ModelsAward Candidate27 citations
- SF3D: Stable Fast 3D Mesh Reconstruction with UV-unwrapping and Illumination DisentanglementPoster27 citations
- VLOGGER: Multimodal Diffusion for Embodied Avatar SynthesisPoster27 citations
- Apollo: An Exploration of Video Understanding in Large Multimodal ModelsPoster25 citations
- MoGe: Unlocking Accurate Monocular Geometry Estimation for Open-Domain Images with Optimal Training SupervisionPoster25 citations
- Multimodal Autoregressive Pre-training of Large Vision EncodersHighlight25 citations
- Continuous 3D Perception Model with Persistent StatePoster24 citations
- Improving Diffusion Inverse Problem Solving with Decoupled Noise AnnealingPoster24 citations
- ShowUI: One Vision-Language-Action Model for GUI Visual AgentPoster24 citations
- CAT4D: Create Anything in 4D with Multi-View Video Diffusion ModelsPoster23 citations
- DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene RepresentationPoster23 citations
- EMOVA: Empowering Language Models to See, Hear and Speak with Vivid EmotionsPoster23 citations
- Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward PassPoster23 citations
- Federated Learning with Domain Shift EraserPoster23 citations
- FlashGS: Efficient 3D Gaussian Splatting for Large-scale and High-resolution RenderingPoster22 citations
- Motion Prompting: Controlling Video Generation with Motion TrajectoriesPoster22 citations
- AnyEdit: Mastering Unified High-Quality Image Editing for Any IdeaPoster21 citations
- VGGT: Visual Geometry Grounded TransformerAward Candidate21 citations
- CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action ModelsPoster20 citations
- Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local AttentionPoster20 citations
- Navigation World ModelsAward Candidate20 citations
- Dual Diffusion for Unified Image Generation and UnderstandingPoster19 citations
- Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video ContentPoster19 citations
- Timestep Embedding Tells: It's Time to Cache for Video Diffusion ModelHighlight19 citations
- VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term ModelingPoster19 citations
- MIMO: Controllable Character Video Synthesis with Spatial Decomposed ModelingPoster18 citations
- MegaSaM: Accurate, Fast and Robust Structure and Motion from Casual Dynamic VideosAward Candidate18 citations
- Towards General Visual-Linguistic Face Forgery DetectionPoster18 citations
- 3DTopia-XL: Scaling High-quality 3D Asset Generation via Primitive DiffusionHighlight17 citations
- Factored-NeuS: Reconstructing Surfaces, Illumination, and Materials of Possibly Glossy ObjectsPoster17 citations
- Magma: A Foundation Model for Multimodal AI AgentsPoster17 citations
- MambaIRv2: Attentive State Space RestorationPoster17 citations
- Multiple Object Tracking as ID PredictionPoster17 citations
- ParaHome: Parameterizing Everyday Home Activities Towards 3D Generative Modeling of Human-Object InteractionsPoster17 citations
- VideoGigaGAN: Towards Detail-rich Video Super-ResolutionPoster17 citations
- UniReal: Universal Image Generation and Editing via Learning Real-world DynamicsHighlight16 citations
- Goku: Flow Based Video Generative Foundation ModelsHighlight15 citations
- VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward ModelsHighlight15 citations
- VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame SelectionPoster15 citations
- WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion ModelPoster15 citations
- Align3R: Aligned Monocular Depth Estimation for Dynamic VideosHighlight14 citations
- All Languages Matter: Evaluating LMMs on Culturally Diverse 100 LanguagesHighlight14 citations
- Continuous, Subject-Specific Attribute Control in T2I Models by Identifying Semantic DirectionsPoster14 citations
- DiG: Scalable and Efficient Diffusion Models with Gated Linear AttentionPoster14 citations
- Dinomaly: The Less Is More Philosophy in Multi-Class Unsupervised Anomaly DetectionPoster14 citations
- Parallelized Autoregressive Visual GenerationHighlight14 citations
- ReCapture: Generative Video Camera Controls for User-Provided Videos using Masked Video Fine-TuningPoster14 citations
- StableAnimator: High-Quality Identity-Preserving Human Image AnimationPoster14 citations
- StoryGPT-V: Large Language Models as Consistent Story VisualizersPoster14 citations
- Transformers without NormalizationPoster14 citations
- F-LMM: Grounding Frozen Large Multimodal ModelsPoster13 citations
- Large-Scale Text-to-Image Model with Inpainting is a Zero-Shot Subject-Driven Image GeneratorPoster13 citations
- MC^2: Multi-concept Guidance for Customized Multi-concept GenerationPoster13 citations
- MMVU: Measuring Expert-Level Multi-Discipline Video UnderstandingPoster13 citations
- SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token FoldingPoster13 citations
- WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wildPoster13 citations
- You See it, You Got it: Learning 3D Creation on Pose-Free Videos at ScaleHighlight13 citations
- 3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less HallucinationPoster12 citations
- A Simple Data Augmentation for Feature Distribution Skewed Federated LearningPoster12 citations
- AnySat: One Earth Observation Model for Many Resolutions, Scales, and ModalitiesHighlight12 citations
- Arbitrary-steps Image Super-resolution via Diffusion InversionPoster12 citations
- GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera ControlHighlight12 citations
- Generalizing Deepfake Video Detection with Plug-and-Play: Video-Level Blending and Spatiotemporal Adapter TuningPoster12 citations
- Paint by Inpaint: Learning to Add Image Objects by Removing Them FirstPoster12 citations
- Scaling Mesh Generation via Compressive TokenizationPoster12 citations
- SkillMimic: Learning Basketball Interaction Skills from DemonstrationsHighlight12 citations
- Stereo4D: Learning How Things Move in 3D from Internet Stereo VideosPoster12 citations
- Video Depth Anything: Consistent Depth Estimation for Super-Long VideosHighlight12 citations
- Wonderland: Navigating 3D Scenes from a Single ImagePoster12 citations
- AI-Face: A Million-Scale Demographically Annotated AI-Generated Face Dataset and Fairness BenchmarkPoster11 citations
- Critic-V: VLM Critics Help Catch VLM Errors in Multimodal ReasoningPoster11 citations
- Diffusion Self-Distillation for Zero-Shot Customized Image GenerationPoster11 citations
- DrVideo: Document Retrieval Based Long Video UnderstandingPoster11 citations
- Exploring Sparse MoE in GANs for Text-conditioned Image SynthesisPoster11 citations
- Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion TransformerPoster11 citations
- Hash3D: Training-free Acceleration for 3D GenerationPoster11 citations
- Img-Diff: Contrastive Data Synthesis for Multimodal Large Language ModelsPoster11 citations
- LT3SD: Latent Trees for 3D Scene DiffusionPoster11 citations
- MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic ModelingPoster11 citations
- PhyT2V: LLM-Guided Iterative Self-Refinement for Physics-Grounded Text-to-Video GenerationPoster11 citations
- ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online RestorationPoster11 citations
- SegEarth-OV: Towards Training-Free Open-Vocabulary Segmentation for Remote Sensing ImagesPoster11 citations
- Self-Expansion of Pre-trained Models with Mixture of Adapters for Continual LearningPoster11 citations
- Task Singular Vectors: Reducing Task Interference in Model MergingPoster11 citations
- Teaching Large Language Models to Regress Accurate Image Quality Scores Using Score DistributionPoster11 citations
- UniScene: Unified Occupancy-centric Driving Scene GenerationPoster11 citations
- VideoDPO: Omni-Preference Alignment for Video Diffusion GenerationPoster11 citations
- A Closer Look at Time Steps is Worthy of Triple Speed-Up for Diffusion Model TrainingPoster10 citations
- AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion TransformersPoster10 citations
- AeroGen: Enhancing Remote Sensing Object Detection with Diffusion-Driven Data GenerationPoster10 citations
- AnimateAnything: Consistent and Controllable Animation for Video GenerationPoster10 citations
- CORE4D: A 4D Human-Object-Human Interaction Dataset for Collaborative Object REarrangementPoster10 citations
- DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video GenerationPoster10 citations
- Gaussian Splashing: Unified Particles for Versatile Motion Synthesis and RenderingPoster10 citations
- LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language ModelsPoster10 citations
- MV-DUSt3R+: Single-Stage Scene Reconstruction from Sparse Views In 2 SecondsPoster10 citations
- MVPaint: Synchronized Multi-View Diffusion for Painting Anything 3DPoster10 citations
- Mani-GS: Gaussian Splatting Manipulation with Triangular MeshPoster10 citations
- MonSter: Marry Monodepth to Stereo Unleashes PowerHighlight10 citations
- Number it: Temporal Grounding Videos like Flipping MangaPoster10 citations
- OSV: One Step is Enough for High-Quality Image to Video GenerationPoster10 citations
- SIDA: Social Media Image Deepfake Detection, Localization and Explanation with Large Multimodal ModelPoster10 citations
- Stable Flow: Vital Layers for Training-Free Image EditingPoster10 citations
- Video-Guided Foley Sound Generation with Multimodal ControlsPoster10 citations
- 5%>100%: Breaking Performance Shackles of Full Fine-Tuning on Visual Recognition TasksPoster9 citations
- Adversarial Diffusion Compression for Real-World Image Super-ResolutionPoster9 citations
- AniDoc: Animation Creation Made EasierPoster9 citations
- BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile DevicesPoster9 citations
- CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and GenerationHighlight9 citations
- G3Flow: Generative 3D Semantic Flow for Pose-aware and Generalizable Object ManipulationPoster9 citations
- HOT3D: Hand and Object Tracking in 3D from Egocentric Multi-View VideosHighlight9 citations
- Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any GranularityHighlight9 citations
- ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language ModelsPoster9 citations
- Interleaved-Modal Chain-of-ThoughtPoster9 citations
- Make It Count: Text-to-Image Generation with an Accurate Number of ObjectsPoster9 citations
- MeGA: Hybrid Mesh-Gaussian Head Avatar for High-Fidelity Rendering and Head EditingPoster9 citations
- OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?Poster9 citations
- Pixel-level and Semantic-level Adjustable Super-resolution: A Dual-LoRA ApproachPoster9 citations
- RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to ConcretePoster9 citations
- RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for RoboticsPoster9 citations
- ATP-LLaVA: Adaptive Token Pruning for Large Vision Language ModelsPoster8 citations
- Audio-Visual Instance SegmentationPoster8 citations
- BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific LiteraturePoster8 citations
- DEIM: DETR with Improved Matching for Fast ConvergencePoster8 citations
- DKDM: Data-Free Knowledge Distillation for Diffusion Models with Any ArchitecturePoster8 citations
- DPU: Dynamic Prototype Updating for Multimodal Out-of-Distribution DetectionHighlight8 citations
- Detecting Out-of-Distribution Through the Lens of Neural CollapsePoster8 citations
- Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and ReactionPoster8 citations
- FreeSim: Toward Free-viewpoint Camera Simulation in Driving ScenesPoster8 citations
- GEM: A Generalizable Ego-Vision Multimodal World Model for Fine-Grained Ego-Motion, Object Dynamics, and Scene Composition ControlPoster8 citations
- GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial UnderstandingPoster8 citations
- GaussianFormer-2: Probabilistic Gaussian Superposition for Efficient 3D Occupancy PredictionPoster8 citations
- GaussianWorld: Gaussian World Model for Streaming 3D Occupancy PredictionPoster8 citations
- HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language ModelsPoster8 citations
- LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language ModelsHighlight8 citations
- LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal UnderstandingPoster8 citations
- LamRA: Large Multimodal Model as Your Advanced Retrieval AssistantPoster8 citations
- LoRASculpt: Sculpting LoRA for Harmonizing General and Specialized Knowledge in Multimodal Large Language ModelsPoster8 citations
- LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long VideosPoster8 citations
- MASt3R-SLAM: Real-Time Dense SLAM with 3D Reconstruction PriorsHighlight8 citations
- Mind the Time: Temporally-Controlled Multi-Event Video GenerationPoster8 citations
- Mitigating the Human-Robot Domain Discrepancy in Visual Pre-training for Robotic ManipulationPoster8 citations
- MobilePortrait: Real-Time One-Shot Neural Head Avatars on Mobile DevicesPoster8 citations
- OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial ConstraintsHighlight8 citations
- PUP 3D-GS: Principled Uncertainty Pruning for 3D Gaussian SplattingPoster8 citations
- Perception Tokens Enhance Visual Reasoning in Multimodal Language ModelsPoster8 citations
- Prompting Depth Anything for 4K Resolution Accurate Metric Depth EstimationPoster8 citations
- RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V TrustworthinessHighlight8 citations
- Sonic: Shifting Focus to Global Audio Perception in Portrait AnimationPoster8 citations
- TSD-SR: One-Step Diffusion with Target Score Distillation for Real-World Image Super-ResolutionPoster8 citations
- The Scene Language: Representing Scenes with Programs, Words, and EmbeddingsHighlight8 citations
- Towards Open-Vocabulary Audio-Visual Event LocalizationPoster8 citations
- VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?Poster8 citations
- Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene UnderstandingPoster8 citations
- VideoWorld: Exploring Knowledge Learning from Unlabeled VideosPoster8 citations
- CXPMRG-Bench: Pre-training and Benchmarking for X-ray Medical Report Generation on CheXpert Plus DatasetPoster7 citations
- Closed-Loop Supervised Fine-Tuning of Tokenized Traffic ModelsPoster7 citations
- Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure DetectionPoster7 citations
- Contextual AD Narration with Interleaved Multimodal SequencePoster7 citations
- EchoMimicV2: Towards Striking, Simplified, and Semi-Body Human AnimationPoster7 citations
- Efficient Visual State Space Model for Image DeblurringPoster7 citations
- FastVLM: Efficient Vision Encoding for Vision Language ModelsPoster7 citations
- IDOL: Instant Photorealistic 3D Human Creation from a Single ImagePoster7 citations
- LLAVIDAL: A Large LAnguage VIsion Model for Daily Activities of LivingPoster7 citations
- LaVin-DiT: Large Vision Diffusion TransformerPoster7 citations
- Language-Guided Image Tokenization for GenerationPoster7 citations
- MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language ModelsPoster7 citations
- Ouroboros3D: Image-to-3D Generation via 3D-aware Recursive DiffusionPoster7 citations
- ROCKET-1: Mastering Open-World Interaction with Visual-Temporal Context PromptingPoster7 citations
- Revealing Key Details to See Differences: A Novel Prototypical Perspective for Skeleton-based Action RecognitionHighlight7 citations
- SoftVQ-VAE: Efficient 1-Dimensional Continuous TokenizerPoster7 citations
- SplatAD: Real-Time Lidar and Camera Rendering with 3D Gaussian Splatting for Autonomous DrivingPoster7 citations
- StarVector: Generating Scalable Vector Graphics Code from Images and TextPoster7 citations
- StreetCrafter: Street View Synthesis with Controllable Video Diffusion ModelsPoster7 citations
- VERA: Explainable Video Anomaly Detection via Verbalized Learning of Vision-Language ModelsPoster7 citations
- VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLMPoster7 citations
- Vision-Language Models Do Not Understand NegationPoster7 citations
- WAVE: Weight Templates for Adaptive Initialization of Variable-sized ModelsPoster7 citations
- World-consistent Video Diffusion with Explicit 3D ModelingHighlight7 citations
- 3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint TransformerPoster6 citations
- A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMsPoster6 citations
- AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMMPoster6 citations
- Accurate Differential Operators for Hybrid Neural FieldsPoster6 citations
- Active Data Curation Effectively Distills Large-Scale Multimodal ModelsPoster6 citations
- Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image CaptioningPoster6 citations
- Collaborative Decoding Makes Visual Auto-Regressive Modeling EfficientPoster6 citations
- Dataset Distillation with Neural Characteristic Function: A Minmax PerspectiveHighlight6 citations
- DyCoke: Dynamic Compression of Tokens for Fast Video Large Language ModelsPoster6 citations
- EarthDial: Turning Multi-sensory Earth Observations to Interactive DialoguesPoster6 citations
- EmoDubber: Towards High Quality and Emotion Controllable Movie DubbingHighlight6 citations
- Emphasizing Discriminative Features for Dataset Distillation in Complex ScenariosPoster6 citations
- Empowering LLMs to Understand and Generate Complex Vector GraphicsPoster6 citations
- FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any GranularityPoster6 citations
- FloVD: Optical Flow Meets Video Diffusion Model for Enhanced Camera-Controlled Video SynthesisPoster6 citations
- From Slow Bidirectional to Fast Autoregressive Video Diffusion ModelsPoster6 citations
- GET: Unlocking the Multi-modal Potential of CLIP for Generalized Category DiscoveryPoster6 citations
- Go-with-the-Flow: Motion-Controllable Video Diffusion Models Using Real-Time Warped NoisePoster6 citations
- HunyuanPortrait: Implicit Condition Control for Enhanced Portrait AnimationPoster6 citations
- IRGS: Inter-Reflective Gaussian Splatting with 2D Gaussian Ray TracingPoster6 citations
- InterMimic: Towards Universal Whole-Body Control for Physics-Based Human-Object InteractionsHighlight6 citations
- Layered Image Vectorization via Semantic SimplificationPoster6 citations
- MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual ContextsPoster6 citations
- Object Detection using Event Camera: A MoE Heat Conduction based Detector and A New Benchmark DatasetPoster6 citations
- OmniFlow: Any-to-Any Generation with Multi-Modal Rectified FlowsPoster6 citations
- One-Minute Video Generation with Test-Time TrainingPoster6 citations
- Re-thinking Temporal Search for Long-Form Video UnderstandingPoster6 citations
- Reloc3r: Large-Scale Training of Relative Camera Pose Regression for Generalizable, Fast, and Accurate Visual LocalizationPoster6 citations
- ScaMo: Exploring the Scaling Law in Autoregressive Motion Generation ModelPoster6 citations
- SceneFactor: Factored Latent 3D Diffusion for Controllable 3D Scene GenerationPoster6 citations
- Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task AlignmentPoster6 citations
- TexGaussian: Generating High-quality PBR Material via Octree-based 3D Gaussian SplattingPoster6 citations
- Towards Universal Soccer Video UnderstandingPoster6 citations
- Unleashing the Potential of Multi-modal Foundation Models and Video Diffusion for 4D Dynamic Physical Scene SimulationPoster6 citations
- Video Depth without Video ModelsPoster6 citations
- VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User SimulationPoster6 citations
- 2DMamba: Efficient State Space Model for Image Representation with Applications on Giga-Pixel Whole Slide Image ClassificationPoster5 citations
- AffordDP: Generalizable Diffusion Policy with Transferable AffordancePoster5 citations
- AniGS: Animatable Gaussian Avatar from a Single Image with Inconsistent Gaussian ReconstructionPoster5 citations
- AnyDressing: Customizable Multi-Garment Virtual Dressing via Latent Diffusion ModelsPoster5 citations
- Attention Distillation: A Unified Approach to Visual Characteristics TransferPoster5 citations
- AutoPresent: Designing Structured Visuals from ScratchPoster5 citations
- BooW-VTON: Boosting In-the-Wild Virtual Try-On via Mask-Free Pseudo Data TrainingPoster5 citations
- Boost Your Human Image Generation Model via Direct Preference OptimizationHighlight5 citations
- Calibrated Multi-Preference Optimization for Aligning Diffusion ModelsPoster5 citations
- ChatGarment: Garment Estimation, Generation and Editing via Large Language ModelsPoster5 citations
- Curriculum Direct Preference Optimization for Diffusion and Consistency ModelsPoster5 citations
- DEFOM-Stereo: Depth Foundation Model Based Stereo MatchingPoster5 citations
- DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language AlignmentPoster5 citations
- DRiVE: Diffusion-based Rigging Empowers Generation of Versatile and Expressive CharactersPoster5 citations
- DreamText: High Fidelity Scene Text SynthesisPoster5 citations
- Dual-Interrelated Diffusion Model for Few-Shot Anomaly Image GenerationPoster5 citations
- DynamicScaler: Seamless and Scalable Video Generation for Panoramic ScenesPoster5 citations
- EditAR: Unified Conditional Generation with Autoregressive ModelsPoster5 citations
- EgoLife: Towards Egocentric Life AssistantPoster5 citations
- Estimating Body and Hand Motion in an Ego-sensed WorldHighlight5 citations
- FineVQ: Fine-Grained User Generated Content Video Quality AssessmentHighlight5 citations
- Fish-Vista: A Multi-Purpose Dataset for Understanding & Identification of Traits from ImagesPoster5 citations
- Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth FusionPoster5 citations
- Forensics Adapter: Adapting CLIP for Generalizable Face Forgery DetectionPoster5 citations
- FoundationStereo: Zero-Shot Stereo MatchingAward Candidate5 citations
- HVI: A New Color Space for Low-light Image EnhancementPoster5 citations
- Human Motion Instruction TuningPoster5 citations
- LeviTor: 3D Trajectory Oriented Image-to-Video SynthesisHighlight5 citations
- MAP: Unleashing Hybrid Mamba-Transformer Vision Backbone's Potential with Masked Autoregressive PretrainingPoster5 citations
- MaIR: A Locality- and Continuity-Preserving Mamba for Image RestorationPoster5 citations
- MagicQuill: An Intelligent Interactive Image Editing SystemPoster5 citations
- MaskGWM: A Generalizable Driving World Model with Video Mask ReconstructionPoster5 citations
- MobileMamba: Lightweight Multi-Receptive Visual Mamba NetworkPoster5 citations
- Nullu: Mitigating Object Hallucinations in Large Vision-Language Models via HalluSpace ProjectionPoster5 citations
- OSDFace: One-Step Diffusion Model for Face RestorationPoster5 citations
- OccMamba: Semantic Occupancy Prediction with State Space ModelsPoster5 citations
- One Diffusion to Generate Them AllPoster5 citations
- PLeaS - Merging Models with Permutations and Least SquaresPoster5 citations
- PartGen: Part-level 3D Generation and Reconstruction with Multi-view Diffusion ModelsHighlight5 citations
- Pose Priors from Language ModelsPoster5 citations
- QMambaBSR: Burst Image Super-Resolution with Query State Space ModelPoster5 citations
- Reasoning to Attend: Try to Understand How <SEG> Token WorksPoster5 citations
- Reference-Based 3D-Aware Image Editing with TriplanesHighlight5 citations
- Revisiting MAE Pre-training for 3D Medical Image SegmentationHighlight5 citations
- SAR3D: Autoregressive 3D Object Generation and Understanding via Multi-scale 3D VQVAEPoster5 citations
- SPAR3D: Stable Point-Aware Reconstruction of 3D Objects from Single ImagesPoster5 citations
- STEREO: A Two-Stage Framework for Adversarially Robust Concept Erasing from Text-to-Image Diffusion ModelsHighlight5 citations
- SketchAgent: Language-Driven Sequential Sketch GenerationPoster5 citations
- SlideChat: A Large Vision-Language Assistant for Whole-Slide Pathology Image UnderstandingPoster5 citations
- Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against JailbreaksPoster5 citations
- TinyFusion: Diffusion Transformers Learned ShallowHighlight5 citations
- Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and MethodPoster5 citations
- Towards More General Video-based Deepfake Detection through Facial Component Guided Adaptation for Foundation ModelPoster5 citations
- Unseen Visual Anomaly GenerationPoster5 citations
- Unveiling the Mist over 3D Vision-Language Understanding: Object-centric Evaluation with Chain-of-AnalysisPoster5 citations
- VILA-M3: Enhancing Vision-Language Models with Medical Expert KnowledgeHighlight5 citations
- 3DGUT: Enabling Distorted Cameras and Secondary Rays in Gaussian SplattingPoster4 citations
- A Bias-Free Training Paradigm for More General AI-generated Image DetectionPoster4 citations
- ARKit LabelMaker: A New Scale for Indoor 3D Scene UnderstandingPoster4 citations
- ART: Anonymous Region Transformer for Variable Multi-Layer Transparent Image GenerationPoster4 citations
- Accelerating Multimodal Large Language Models by Searching Optimal Vision Token ReductionPoster4 citations
- Advancing Myopia To Holism: Fully Contrastive Language-Image Pre-trainingPoster4 citations
- CPath-Omni: A Unified Multimodal Foundation Model for Patch and Whole Slide Image Analysis in Computational PathologyPoster4 citations
- Chat-based Person Retrieval via Dialogue-Refined Cross-Modal AlignmentPoster4 citations
- CompGS: Unleashing 2D Compositionality for Compositional Text-to-3D via Dynamically Optimizing 3D GaussiansPoster4 citations
- Cross-modal Information Flow in Multimodal Large Language ModelsPoster4 citations
- DI-PCG: Diffusion-based Efficient Inverse Procedural Content Generation for High-quality 3D Asset CreationPoster4 citations
- DeSiRe-GS: 4D Street Gaussians for Static-Dynamic Decomposition and Surface Reconstruction for Urban Driving ScenesPoster4 citations
- Decompositional Neural Scene Reconstruction with Generative Diffusion PriorPoster4 citations
- Devils in Middle Layers of Large Vision-Language Models: Interpreting, Detecting and Mitigating Object Hallucinations via Attention LensPoster4 citations
- DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga GenerationPoster4 citations
- Distilling Multi-modal Large Language Models for Autonomous DrivingPoster4 citations
- DivPrune: Diversity-based Visual Token Pruning for Large Multimodal ModelsPoster4 citations
- DrivingSphere: Building a High-fidelity 4D World for Closed-loop SimulationPoster4 citations
- ECVC: Exploiting Non-Local Correlations in Multiple Frames for Contextual Video CompressionPoster4 citations
- EfficientViM: Efficient Vision Mamba with Hidden State Mixer based State Space DualityPoster4 citations
- EgoLM: Multi-Modal Language Model of Egocentric MotionsPoster4 citations
- EnvGS: Modeling View-Dependent Appearance with Environment GaussianPoster4 citations
- Exploring Intrinsic Normal Prototypes within a Single Image for Universal Anomaly DetectionPoster4 citations
- F^3OCUS - Federated Finetuning of Vision-Language Foundation Models with Optimal Client Layer Updating Strategy via Multi-objective Meta-HeuristicsHighlight4 citations
- FaithDiff: Unleashing Diffusion Priors for Faithful Image Super-resolutionPoster4 citations
- Few-Shot Recognition via Stage-Wise Retrieval-Augmented FinetuningPoster4 citations
- From Alexnet to Transformers: Measuring the Non-linearity of Deep Neural Networks with Affine Optimal TransportPoster4 citations
- GAF: Gaussian Avatar Reconstruction from Monocular Videos via Multi-view DiffusionPoster4 citations
- Gaussian Eigen Models for Human HeadsPoster4 citations
- GaussianUDF: Inferring Unsigned Distance Functions through 3D Gaussian SplattingHighlight4 citations
- Generative Inbetweening through Frame-wise Conditions-Driven Video GenerationPoster4 citations
- HaWoR: World-Space Hand Motion Reconstruction from Egocentric VideosHighlight4 citations
- How to Merge Your Multimodal Models Over Time?Poster4 citations
- Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language ModelsPoster4 citations
- IDEA: Inverted Text with Cooperative Deformable Aggregation for Multi-modal Object Re-IdentificationPoster4 citations
- INFP: Audio-Driven Interactive Head Generation in Dyadic ConversationsPoster4 citations
- IRIS: Inverse Rendering of Indoor Scenes from Low Dynamic Range ImagesPoster4 citations
- Instant Adversarial Purification with Adversarial Consistency DistillationPoster4 citations
- Interactive Medical Image Segmentation: A Benchmark Dataset and BaselinePoster4 citations
- Interpreting Object-level Foundation Models via Visual Precision SearchHighlight4 citations
- K-LoRA: Unlocking Training-Free Fusion of Any Subject and Style LoRAsPoster4 citations
- K-Sort Arena: Efficient and Reliable Benchmarking for Generative Models via K-wise Human PreferencesPoster4 citations
- LiMoE: Mixture of LiDAR Representation Learners from Automotive ScenesPoster4 citations
- Lifting Motion to the 3D World via 2D DiffusionHighlight4 citations
- LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational ComplexityPoster4 citations
- MAGiC-SLAM: Multi-Agent Gaussian Globally Consistent SLAMPoster4 citations
- MINIMA: Modality Invariant Image MatchingPoster4 citations
- MOVIS: Enhancing Multi-Object Novel View Synthesis for Indoor ScenesPoster4 citations
- MVPortrait: Text-Guided Motion and Emotion Control for Multi-view Vivid Portrait AnimationPoster4 citations
- Material Anything: Generating Materials for Any 3D Object via DiffusionHighlight4 citations
- Matrix3D: Large Photogrammetry Model All-in-OneHighlight4 citations
- Mimir: Improving Video Diffusion Models for Precise Text UnderstandingPoster4 citations
- Mitigating Hallucinations in Large Vision-Language Models via DPO: On-Policy Data Hold the KeyPoster4 citations
- MonoInstance: Enhancing Monocular Priors via Multi-view Instance Alignment for Neural Rendering and ReconstructionPoster4 citations
- MonoTAKD: Teaching Assistant Knowledge Distillation for Monocular 3D Object DetectionPoster4 citations
- MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video GenerationPoster4 citations
- Omni-Scene: Omni-Gaussian Representation for Ego-Centric Sparse-View Scene ReconstructionPoster4 citations
- OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive AnnotationsPoster4 citations
- OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual ReasoningPoster4 citations
- OmniGuard: Hybrid Manipulation Localization via Augmented Versatile Deep Image WatermarkingPoster4 citations
- Open-Vocabulary Functional 3D Scene Graphs for Real-World Indoor SpacesHighlight4 citations
- Open-World Amodal Appearance CompletionPoster4 citations
- Order-One Rolling Shutter CamerasHighlight4 citations
- POSTA: A Go-to Framework for Customized Artistic Poster GenerationPoster4 citations
- Pathways on the Image Manifold: Image Editing via Video GenerationPoster4 citations
- PhysAnimator: Physics-Guided Generative Cartoon AnimationPoster4 citations
- RSAR: Restricted State Angle Resolver and Rotated SAR BenchmarkPoster4 citations
- Repurposing Pre-trained Video Diffusion Models for Event-based Video InterpolationPoster4 citations
- RoboTwin: Dual-Arm Robot Benchmark with Generative Digital TwinsHighlight4 citations
- STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-TrainingPoster4 citations
- Scaling Properties of Diffusion Models For Perceptual TasksPoster4 citations
- Schedule On the Fly: Diffusion Time Prediction for Faster and Better Image GenerationPoster4 citations
- SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual GroundingPoster4 citations
- Sim-to-Real Causal Transfer: A Metric Learning Approach to Causally-Aware Interaction RepresentationsPoster4 citations
- SnapGen: Taming High-Resolution Text-to-Image Models for Mobile Devices with Efficient Architectures and TrainingHighlight4 citations
- SpectroMotion: Dynamic 3D Reconstruction of Specular ScenesPoster4 citations
- Splatter-360: Generalizable 360 Gaussian Splatting for Wide-baseline Panoramic ImagesPoster4 citations
- The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human MotionPoster4 citations
- Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language ModelsHighlight4 citations
- UniGraspTransformer: Simplified Policy Distillation for Scalable Dexterous Robotic GraspingPoster4 citations
- Universal Actions for Enhanced Embodied Foundation ModelsPoster4 citations
- Unveiling Visual Perception in Language Models: An Attention Head Analysis ApproachPoster4 citations
- VISTA: Enhancing Long-Duration and High-Resolution Video Understanding by Video Spatiotemporal AugmentationPoster4 citations
- VTON-HandFit: Virtual Try-on for Arbitrary Hand Pose Guided by Hand Priors EmbeddingPoster4 citations
- ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded SegmentationPoster4 citations
- Vid2Sim: Realistic and Interactive Simulation from Video for Urban NavigationPoster4 citations
- VideoGLaMM : A Large Multimodal Model for Pixel-Level Visual Grounding in VideosPoster4 citations
- VisionArena: 230k Real World User-VLM Conversations with Preference LabelsPoster4 citations
- What's in the Image? A Deep-Dive into the Vision of Vision Language ModelsPoster4 citations
- X-Dyna: Expressive Dynamic Human Image AnimationHighlight4 citations
- 3D Convex Splatting: Radiance Field Rendering with 3D Smooth ConvexesHighlight3 citations
- ACE: Anti-Editing Concept Erasure in Text-to-Image ModelsPoster3 citations
- AR-Diffusion: Asynchronous Video Generation with Auto-Regressive DiffusionPoster3 citations
- Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference OptimizationPoster3 citations
- Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question AnsweringPoster3 citations
- Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model EvaluationPoster3 citations
- BadToken: Token-level Backdoor Attacks to Multi-modal Large Language ModelsPoster3 citations
- Black-Box Forgery Attacks on Semantic Watermarks for Diffusion ModelsPoster3 citations
- BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video RepresentationsPoster3 citations
- CAD-Llama: Leveraging Large Language Models for Computer-Aided Design Parametric 3D Model GenerationPoster3 citations
- CADCrafter: Generating Computer-Aided Design Models from Unconstrained ImagesPoster3 citations
- COAP: Memory-Efficient Training with Correlation-Aware Gradient ProjectionPoster3 citations
- CleanDIFT: Diffusion Features without NoisePoster3 citations
- ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI SystemsPoster3 citations
- Community Forensics: Using Thousands of Generators to Train Fake Image DetectorsPoster3 citations
- Completion as Enhancement: A Degradation-Aware Selective Image Guided Network for Depth CompletionPoster3 citations
- Complexity Experts are Task-Discriminative Learners for Any Image RestorationPoster3 citations
- Cross-modal Causal Relation Alignment for Video Question GroundingHighlight3 citations
- DELT: A Simple Diversity-driven EarlyLate Training for Dataset DistillationPoster3 citations
- DepthCues: Evaluating Monocular Depth Perception in Large Vision ModelsPoster3 citations
- Design2GarmentCode: Turning Design Concepts to Tangible Garments Through Program SynthesisPoster3 citations
- DexGrasp Anything: Towards Universal Robotic Dexterous Grasping with Physics AwarenessHighlight3 citations
- Diffusion Renderer: Neural Inverse and Forward Rendering with Video Diffusion ModelsPoster3 citations
- Diffusion-4K: Ultra-High-Resolution Image Synthesis with Latent Diffusion ModelsPoster3 citations
- Digital Twin Catalog: A Large-Scale Photorealistic 3D Object Digital Twin DatasetHighlight3 citations
- Distilling Long-tailed DatasetsPoster3 citations
- Don't Shake the Wheel: Momentum-Aware Planning in End-to-End Autonomous DrivingPoster3 citations
- EDEN: Enhanced Diffusion for High-quality Large-motion Video Frame InterpolationPoster3 citations
- EMOE: Modality-Specific Enhanced Dynamic Emotion ExpertsPoster3 citations
- Efficient Long Video Tokenization via Coordinate-based Patch ReconstructionPoster3 citations
- EgoPressure: A Dataset for Hand Pressure and Pose Estimation in Egocentric VisionHighlight3 citations
- EmoEdit: Evoking Emotions through Image ManipulationPoster3 citations
- EnergyMoGen: Compositional Human Motion Generation with Energy-Based Diffusion Model in Latent SpaceHighlight3 citations
- Enhanced Contrastive Learning with Multi-view Longitudinal Data for Chest X-ray Report GenerationPoster3 citations
- EventGPT: Event Stream Understanding with Multimodal Large Language ModelsPoster3 citations
- EventSplat: 3D Gaussian Splatting from Moving Event Cameras for Real-time RenderingPoster3 citations
- Everything to the Synthetic: Diffusion-driven Test-time Adaptation via Synthetic-Domain AlignmentPoster3 citations
- Exact: Exploring Space-Time Perceptive Clues for Weakly Supervised Satellite Image Time Series Semantic SegmentationHighlight3 citations
- ExpertAF: Expert Actionable Feedback from VideoPoster3 citations
- FIRE: Robust Detection of Diffusion-Generated Images via Frequency-Guided Reconstruction ErrorPoster3 citations
- FOCUS: Knowledge-enhanced Adaptive Visual Compression for Few-shot Whole Slide Image ClassificationPoster3 citations
- FedMIA: An Effective Membership Inference Attack Exploiting "All for One" Principle in Federated LearningPoster3 citations
- Fine-Grained Erasure in Text-to-Image Diffusion-based Foundation ModelsPoster3 citations
- FlipSketch: Flipping Static Drawings to Text-Guided Sketch AnimationsPoster3 citations
- Floating No More: Object-Ground Reconstruction from a Single ImagePoster3 citations
- From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-SpeechHighlight3 citations
- From Multimodal LLMs to Generalist Embodied Agents: Methods and LessonsPoster3 citations
- From Poses to Identity: Training-Free Person Re-Identification via Feature CentralizationPoster3 citations
- GEAL: Generalizable 3D Affordance Learning with Cross-Modal ConsistencyPoster3 citations
- Gaze-LLE: Gaze Target Estimation via Large-Scale Learned EncodersHighlight3 citations
- Gazing Into Missteps: Leveraging Eye-Gaze for Unsupervised Mistake Detection in Egocentric Videos of Skilled Human ActivitiesPoster3 citations
- Generative Omnimatte: Learning to Decompose Video into LayersHighlight3 citations
- Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image SynthesisHighlight3 citations
- GigaHands: A Massive Annotated Dataset of Bimanual Hand ActivitiesHighlight3 citations
- HD-EPIC: A Highly-Detailed Egocentric Video DatasetPoster3 citations
- HIIF: Hierarchical Encoding based Implicit Image Function for Continuous Super-resolutionPoster3 citations
- HumanRig: Learning Automatic Rigging for Humanoid Character in a Large Scale DatasetHighlight3 citations
- IDProtector: An Adversarial Noise Encoder to Protect Against ID-Preserving Image GenerationPoster3 citations
- Identifying and Mitigating Position Bias of Multi-image Vision-Language ModelsPoster3 citations
- Imagine and Seek: Improving Composed Image Retrieval with an Imagined ProxyPoster3 citations
- Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time AlignmentPoster3 citations
- Improved Video VAE for Latent Video Diffusion ModelPoster3 citations
- IncEventGS: Pose-Free Gaussian Splatting from a Single Event CameraHighlight3 citations
- Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction TuningHighlight3 citations
- InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured CaptionPoster3 citations
- InstanceGaussian: Appearance-Semantic Joint Gaussian Representation for 3D Instance-Level PerceptionPoster3 citations
- Instruction-based Image Manipulation by Watching How Things MoveHighlight3 citations
- LION-FS: Fast & Slow Video-Language Thinker as Online Video AssistantPoster3 citations
- Learning Bijective Surface Parameterization for Inferring Signed Distance Functions from Sparse Point Clouds with Grid DeformationPoster3 citations
- LiVOS: Light Video Object Segmentation with Gated Linear MatchingPoster3 citations
- Linguistics-aware Masked Image Modeling for Self-supervised Scene Text RecognitionPoster3 citations
- Lost in Translation, Found in Context: Sign Language Translation with Contextual CuesPoster3 citations
- LumiNet: Latent Intrinsics Meets Diffusion Models for Indoor Scene RelightingPoster3 citations
- M-LLM Based Video Frame Selection for Efficient Video UnderstandingPoster3 citations
- MLVU: Benchmarking Multi-task Long Video UnderstandingPoster3 citations
- MM-OR: A Large Multimodal Operating Room Dataset for Semantic Understanding of High-Intensity Surgical EnvironmentsPoster3 citations
- MVSAnywhere: Zero-Shot Multi-View StereoPoster3 citations
- Make-It-Animatable: An Efficient Framework for Authoring Animation-Ready 3D CharactersHighlight3 citations
- MangaNinja: Line Art Colorization with Precise Reference FollowingHighlight3 citations
- ManipTrans: Efficient Dexterous Bimanual Manipulation Transfer via Residual LearningPoster3 citations
- MaskGaussian: Adaptive 3D Gaussian Representation from Probabilistic MasksPoster3 citations
- MicroVQA: A Multimodal Reasoning Benchmark for Microscopy-Based Scientific ResearchPoster3 citations
- Model Poisoning Attacks to Federated Learning via Multi-Round ConsistencyPoster3 citations
- MonoDGP: Monocular 3D Object Detection with Decoupled-Query and Geometry-Error PriorsPoster3 citations
- Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel LevelPoster3 citations
- Movie Weaver: Tuning-Free Multi-Concept Video Personalization with Anchored PromptsPoster3 citations
- Multi-Sensor Object Anomaly Detection: Unifying Appearance, Geometry, and Internal PropertiesPoster3 citations
- MultiGO: Towards Multi-level Geometry Learning for Monocular 3D Textured Human ReconstructionPoster3 citations
- NeRFPrior: Learning Neural Radiance Field as a Prior for Indoor Scene ReconstructionHighlight3 citations
- OSMamba: Omnidirectional Spectral Mamba with Dual-Domain Prior Generator for Exposure CorrectionPoster3 citations
- Octopus: Alleviating Hallucination via Dynamic Contrastive DecodingHighlight3 citations
- Omni-ID: Holistic Identity Representation Designed for Generative TasksPoster3 citations
- Parameter-efficient Fine-tuning in Hyperspherical Space for Open-vocabulary Semantic SegmentationPoster3 citations
- Patient-Level Anatomy Meets Scanning-Level Physics: Personalized Federated Low-Dose CT Denoising Empowered by Large Language ModelPoster3 citations
- PhysGen3D: Crafting a Miniature Interactive World from a Single ImagePoster3 citations
- PrEditor3D: Fast and Precise 3D Shape EditingPoster3 citations
- Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene GenerationPoster3 citations
- RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation ModelsPoster3 citations
- ROS-SAM: High-Quality Interactive Segmentation for Remote Sensing Moving ObjectPoster3 citations
- RealEdit: Reddit Edits As a Large-scale Empirical Dataset for Image TransformationsPoster3 citations
- Redefining <Creative> in Dictionary: Towards an Enhanced Semantic Understanding of Creative GenerationPoster3 citations
- Ref-GS: Directional Factorization for 2D Gaussian SplattingPoster3 citations
- Rethinking Training for De-biasing Text-to-Image Generation: Unlocking the Potential of Stable DiffusionPoster3 citations
- Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face DetectorPoster3 citations
- RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied NavigationPoster3 citations
- SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video AnalysisPoster3 citations
- SAMWISE: Infusing Wisdom in SAM2 for Text-Driven Video SegmentationHighlight3 citations
- SLAM3R: Real-Time Dense Scene Reconstruction from Monocular RGB VideosHighlight3 citations
- Scenario Dreamer: Vectorized Latent Diffusion for Generating Driving Simulation EnvironmentsPoster3 citations
- Scene Map-based Prompt Tuning for Navigation Instruction GenerationPoster3 citations
- SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video RestorationHighlight3 citations
- SelfSplat: Pose-Free and 3D Prior-Free Generalizable 3D Gaussian SplattingPoster3 citations
- SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language ModelPoster3 citations
- Simplification Is All You Need against Out-of-Distribution OverconfidencePoster3 citations
- Spatiotemporal Skip Guidance for Enhanced Video Diffusion SamplingPoster3 citations
- Spiking Transformer with Spatial-Temporal AttentionPoster3 citations
- SpiritSight Agent: Advanced GUI Agent with One LookPoster3 citations
- SplineGS: Robust Motion-Adaptive Spline for Real-Time Dynamic 3D Gaussians from Monocular VideoPoster3 citations
- Stacking Brick by Brick: Aligned Feature Isolation for Incremental Face Forgery DetectionPoster3 citations
- StyleMaster: Stylize Your Video with Artistic Generation and TranslationPoster3 citations
- T2ISafety: Benchmark for Assessing Fairness, Toxicity, and Privacy in Image GenerationPoster3 citations
- T2SG: Traffic Topology Scene Graph for Topology Reasoning in Autonomous DrivingPoster3 citations
- TAPT: Test-Time Adversarial Prompt Tuning for Robust Inference in Vision-Language ModelsPoster3 citations
- Taming Teacher Forcing for Masked Autoregressive Video GenerationPoster3 citations
- Task-Agnostic Guided Feature Expansion for Class-Incremental LearningPoster3 citations
- Textured Gaussians for Enhanced 3D Scene Appearance ModelingPoster3 citations
- The Devil is in Temporal Token: High Quality Video Reasoning SegmentationPoster3 citations
- TokenHSI: Unified Synthesis of Physical Human-Scene Interactions through Task TokenizationPoster3 citations
- TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language ModelPoster3 citations
- Towards Precise Scaling Laws for Video Diffusion TransformersPoster3 citations
- Towards Transformer-Based Aligned Generation with Self-Coherence GuidancePoster3 citations
- Towards a Universal Synthetic Video Detector: From Face or Background Manipulations to Fully AI-Generated ContentPoster3 citations
- Tra-MoE: Learning Trajectory Prediction Model from Multiple Domains for Adaptive Policy ConditioningPoster3 citations
- Track4Gen: Teaching Video Diffusion Models to Track Points Improves Video GenerationPoster3 citations
- UniGoal: Towards Universal Zero-shot Goal-oriented NavigationPoster3 citations
- UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly DetectionPoster3 citations
- Unleashing In-context Learning of Autoregressive Models for Few-shot Image ManipulationHighlight3 citations
- Unveil Inversion and Invariance in Flow Transformer for Versatile Image EditingPoster3 citations
- VDocRAG: Retrieval-Augmented Generation over Visually-Rich DocumentsPoster3 citations
- VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual ReasoningPoster3 citations
- VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video UnderstandingPoster3 citations
- VidTwin: Video VAE with Decoupled Structure and DynamicsPoster3 citations
- VinTAGe: Joint Video and Text Conditioning for Holistic Audio GenerationPoster3 citations
- Visual Agentic AI for Spatial Reasoning with a Dynamic APIPoster3 citations
- ZoomLDM: Latent Diffusion Model for Multi-scale Image GenerationPoster3 citations
- 3D Occupancy Prediction with Low-Resolution Queries via Prototype-aware View TransformationPoster2 citations
- 4D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language ModelsPoster2 citations
- 4Real-Video: Learning Generalizable Photo-Realistic 4D Video DiffusionHighlight2 citations
- A Distractor-Aware Memory for Visual Object Tracking with SAM2Poster2 citations
- AA-CLIP: Enhancing Zero-Shot Anomaly Detection via Anomaly-Aware CLIPPoster2 citations
- AFL: A Single-Round Analytic Approach for Federated Learning with Pre-trained ModelsPoster2 citations
- AKiRa: Augmentation Kit on Rays for Optical Video GenerationPoster2 citations
- ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and GroundingPoster2 citations
- ActiveGAMER: Active GAussian Mapping through Efficient RenderingPoster2 citations
- Adv-CPG: A Customized Portrait Generation Framework with Facial Adversarial AttacksPoster2 citations
- Alias-Free Latent Diffusion Models: Improving Fractional Shift Equivariance of Diffusion Latent SpacePoster2 citations
- Arc2Avatar: Generating Expressive 3D Avatars from a Single Image via ID GuidancePoster2 citations
- Are Images Indistinguishable to Humans Also Indistinguishable to Classifiers?Poster2 citations
- ArtFormer: Controllable Generation of Diverse 3D Articulated ObjectsPoster2 citations
- Auto Cherry-Picker: Learning from High-quality Generative Data Driven by LanguagePoster2 citations
- BARD-GS: Blur-Aware Reconstruction of Dynamic Scenes via Gaussian SplattingPoster2 citations
- BEVDiffuser: Plug-and-Play Diffusion Model for BEV Denoising with Ground-Truth GuidanceHighlight2 citations
- BIMBA: Selective-Scan Compression for Long-Range Video Question AnsweringPoster2 citations
- BimArt: A Unified Approach for the Synthesis of 3D Bimanual Interaction with Articulated ObjectsPoster2 citations
- Birth and Death of a RosePoster2 citations
- BizGen: Advancing Article-level Visual Text Rendering for Infographics GenerationPoster2 citations
- Blurred LiDAR for Sharper 3D: Robust Handheld 3D Scanning with Diffuse LiDAR and RGBHighlight2 citations
- Breaking the Low-Rank Dilemma of Linear AttentionPoster2 citations
- Buffer Anytime: Zero-Shot Video Depth and Normal from Image PriorsPoster2 citations
- CAP4D: Creating Animatable 4D Portrait Avatars with Morphable Multi-View Diffusion ModelsPoster2 citations
- CL-MoE: Enhancing Multimodal Large Language Model with Dual Momentum Mixture-of-Experts for Continual Visual Question AnsweringHighlight2 citations
- COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-trainingPoster2 citations
- CRISP: Object Pose and Shape Estimation with Test-Time AdaptationHighlight2 citations
- CTRL-O: Language-Controllable Object-Centric Visual Representation LearningPoster2 citations
- CarPlanner: Consistent Auto-regressive Trajectory Planning for Large-Scale Reinforcement Learning in Autonomous DrivingPoster2 citations
- Causal Composition Diffusion Model for Closed-loop Traffic GenerationPoster2 citations
- ChainHOI: Joint-based Kinematic Chain Modeling for Human-Object Interaction GenerationPoster2 citations
- CholecTrack20: A Multi-Perspective Tracking Dataset for Surgical ToolsPoster2 citations
- CityWalker: Learning Embodied Urban Navigation from Web-Scale VideosPoster2 citations
- Classifier-Free Guidance Inside the Attraction Basin May Cause MemorizationPoster2 citations
- Concept Replacer: Replacing Sensitive Concepts in Diffusion Models via Precision LocalizationPoster2 citations
- Condensing Action Segmentation Datasets via Generative Network InversionPoster2 citations
- Context-Aware Multimodal PretrainingHighlight2 citations
- Context-Enhanced Memory-Refined Transformer for Online Action DetectionPoster2 citations
- Cropper: Vision-Language Model for Image Cropping through In-Context LearningPoster2 citations
- Cross-View Completion Models are Zero-shot Correspondence EstimatorsHighlight2 citations
- Cubify Anything: Scaling Indoor 3D Object DetectionHighlight2 citations
- DAGSM: Disentangled Avatar Generation with GS-enhanced MeshPoster2 citations
- DSPNet: Dual-vision Scene Perception for Robust 3D Question AnsweringPoster2 citations
- D^3: Scaling Up Deepfake Detection by Learning from DiscrepancyPoster2 citations
- DarkIR: Robust Low-Light Image RestorationPoster2 citations
- DeNVeR: Deformable Neural Vessel Representations for Unsupervised Video Vessel SegmentationPoster2 citations
- DeSplat: Decomposed Gaussian Splatting for Distractor-Free RenderingPoster2 citations
- Decentralized Diffusion ModelsPoster2 citations
- Decoupled Distillation to Erase: A General Unlearning Method for Any Class-centric TasksHighlight2 citations
- Detect-and-Guide: Self-regulation of Diffusion Models for Safe Text-to-Image Generation via Guideline Token OptimizationPoster2 citations
- Detecting Backdoor Attacks in Federated Learning via Direction Alignment InspectionHighlight2 citations
- DiC: Rethinking Conv3x3 Designs in Diffusion ModelsPoster2 citations
- Disco4D: Disentangled 4D Human Generation and Animation from a Single ImagePoster2 citations
- DistinctAD: Distinctive Audio Description Generation in ContextsHighlight2 citations
- Divide and Conquer: Heterogeneous Noise Integration for Diffusion-based Adversarial PurificationPoster2 citations
- Dora: Sampling and Benchmarking for 3D Shape Variational Auto-EncodersPoster2 citations
- DriveGEN: Generalized and Robust 3D Detection in Driving via Controllable Text-to-Image Diffusion GenerationPoster2 citations
- Driving by the Rules: A Benchmark for Integrating Traffic Sign Regulations into Vectorized HD MapHighlight2 citations
- DroneSplat: 3D Gaussian Splatting for Robust 3D Reconstruction from In-the-Wild Drone ImageryHighlight2 citations
- Dual Consolidation for Pre-Trained Model-Based Domain-Incremental LearningPoster2 citations
- Dual-view X-ray Detection: Can AI Detect Prohibited Items from Dual-view X-ray Images like Humans?Poster2 citations
- DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual UnderstandingHighlight2 citations
- DynFocus: Dynamic Cooperative Network Empowers LLMs with Video UnderstandingPoster2 citations
- DynRefer: Delving into Region-level Multimodal Tasks via Dynamic ResolutionPoster2 citations
- Dynamic Integration of Task-Specific Adapters for Class Incremental LearningPoster2 citations
- EEE-Bench: A Comprehensive Multimodal Electrical And Electronics Engineering BenchmarkPoster2 citations
- Efficient Fine-Tuning and Concept Suppression for Pruned Diffusion ModelsPoster2 citations
- EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question AnsweringPoster2 citations
- Enhancing Creative Generation on Stable Diffusion-based ModelsPoster2 citations
- EnvPoser: Environment-aware Realistic Human Motion Estimation from Sparse Observations with Uncertainty ModelingPoster2 citations
- Evolving High-Quality Rendering and Reconstruction in a Unified Framework with Contribution-Adaptive RegularizationPoster2 citations
- Exploring Simple Open-Vocabulary Semantic SegmentationPoster2 citations
- Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You ThinkHighlight2 citations
- FATE: Full-head Gaussian Avatar with Textural Editing from Monocular VideoPoster2 citations
- FLAIR: VLM with Fine-grained Language-informed Image RepresentationsPoster2 citations
- FSFM: A Generalizable Face Security Foundation Model via Self-Supervised Facial Representation LearningPoster2 citations
- FedBiP: Heterogeneous One-Shot Federated Learning with Personalized Latent Diffusion ModelsPoster2 citations
- FilmComposer: LLM-Driven Music Production for Silent Film ClipsPoster2 citations
- FireEdit: Fine-grained Instruction-based Image Editing via Region-aware Vision Language ModelPoster2 citations
- FirePlace: Geometric Refinements of LLM Common Sense Reasoning for 3D Object PlacementHighlight2 citations
- Flash-Split: 2D Reflection Removal with Flash Cues and Latent Diffusion SeparationPoster2 citations
- FlashSloth : Lightning Multimodal Large Language Models via Embedded Visual CompressionPoster2 citations
- FluidNexus: 3D Fluid Reconstruction and Prediction from a Single VideoPoster2 citations
- Focus-N-Fix: Region-Aware Fine-Tuning for Text-to-Image GenerationHighlight2 citations
- From Words to Structured Visuals: A Benchmark and Framework for Text-to-Diagram Generation and EditingHighlight2 citations
- GCE-Pose: Global Context Enhancement for Category-level Object Pose EstimationPoster2 citations
- GFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with Generative Flow NetworksPoster2 citations
- GG-SSMs: Graph-Generating State Space ModelsPoster2 citations
- GREAT: Geometry-Intention Collaborative Inference for Open-Vocabulary 3D Object Affordance GroundingPoster2 citations
- GROVE: A Generalized Reward for Learning Open-Vocabulary Physical SkillPoster2 citations
- GaussianSpa: An "Optimizing-Sparsifying" Simplification Framework for Compact and High-Quality 3D Gaussian SplattingPoster2 citations
- GenDeg: Diffusion-based Degradation Synthesis for Generalizable All-In-One Image RestorationPoster2 citations
- Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language ModelPoster2 citations
- Generalized Recorrupted-to-Recorrupted: Self-Supervised Learning Beyond Gaussian NoisePoster2 citations
- GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous DrivingPoster2 citations
- HarmonySet: A Comprehensive Dataset for Understanding Video-Music Semantic Alignment and Temporal SynchronizationPoster2 citations
- How Do I Do That? Synthesizing 3D Hand Motion and Contacts for Everyday InteractionsHighlight2 citations
- HumanDreamer: Generating Controllable Human-Motion Videos via Decoupled GenerationPoster2 citations
- HybridGS: Decoupling Transients and Statics with 2D and 3D Gaussian SplattingPoster2 citations
- HyperGS: Hyperspectral 3D Gaussian SplattingPoster2 citations
- IDEA-Bench: How Far are Generative Models from Professional Designing?Poster2 citations
- Improving Autoregressive Visual Generation with Cluster-Oriented Token PredictionPoster2 citations
- InsightEdit: Towards Better Instruction Following for Image EditingPoster2 citations
- Instant3dit: Multiview Inpainting for Fast Editing of 3D ObjectsPoster2 citations
- InterAct: Advancing Large-Scale Versatile 3D Human-Object Interaction GenerationPoster2 citations
- InterDyn: Controllable Interactive Dynamics with Video Diffusion ModelsPoster2 citations
- Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video GenerationPoster2 citations
- It's a (Blind) Match! Towards Vision-Language Correspondence without Parallel DataPoster2 citations
- IterIS: Iterative Inference-Solving Alignment for LoRA MergingPoster2 citations
- JarvisIR: Elevating Autonomous Driving Perception with Intelligent Image RestorationPoster2 citations
- KeyFace: Expressive Audio-Driven Facial Animation for Long Sequences via KeyFrame InterpolationPoster2 citations
- Kiss3DGen: Repurposing Image Diffusion Models for 3D Asset GenerationPoster2 citations
- Knowledge Memorization and Rumination for Pre-trained Model-based Class-Incremental LearningPoster2 citations
- LITA-GS: Illumination-Agnostic Novel View Synthesis via Reference-Free 3D Gaussian Splatting and Physical PriorsPoster2 citations
- LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual PreferencesPoster2 citations
- Learning Extremely High Density Crowds as Active MattersPoster2 citations
- Learning Flow Fields in Attention for Controllable Person Image GenerationPoster2 citations
- Localized Concept Erasure for Text-to-Image Diffusion Models Using Training-Free Gated Low-Rank AdaptationPoster2 citations
- Localizing Events in Videos with Multimodal QueriesPoster2 citations
- MASH-VLM: Mitigating Action-Scene Hallucination in Video-LLMs through Disentangled Spatial-Temporal RepresentationsHighlight2 citations
- MLLM-as-a-Judge for Image Safety without Human LabelingHighlight2 citations
- MODfinity: Unsupervised Domain Adaptation with Multimodal Information Flow IntertwiningPoster2 citations
- Masked Point-Entity Contrast for Open-Vocabulary 3D Scene UnderstandingPoster2 citations
- MatAnyone: Stable Video Matting with Consistent Memory PropagationPoster2 citations
- Memories of Forgotten ConceptsHighlight2 citations
- MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and QuantizationPoster2 citations
- MetaShadow: Object-Centered Shadow Detection, Removal, and SynthesisPoster2 citations
- Missing Target-Relevant Information Prediction with World Model for Accurate Zero-Shot Composed Image RetrievalPoster2 citations
- MoDec-GS: Global-to-Local Motion Decomposition and Temporal Interval Adjustment for Compact Dynamic 3D Gaussian SplattingPoster2 citations
- MoManipVLA: Transferring Vision-language-action Models for General Mobile ManipulationPoster2 citations
- MovieBench: A Hierarchical Movie Level Dataset for Long Video GenerationPoster2 citations
- Mr. DETR: Instructive Multi-Route Training for Detection TransformersPoster2 citations
- Multi-party Collaborative Attention Control for Image CustomizationPoster2 citations
- Neuro-3D: Towards 3D Visual Decoding from EEG SignalsPoster2 citations
- Neuro-Symbolic Evaluation of Text-to-Video Models using Formal VerificationPoster2 citations
- Neuron: Learning Context-Aware Evolving Representations for Zero-Shot Skeleton Action RecognitionPoster2 citations
- NitroFusion: High-Fidelity Single-Step Diffusion through Dynamic Adversarial TrainingPoster2 citations
- Object-Shot Enhanced Grounding Network for Egocentric VideoPoster2 citations
- Omni-RGPT: Unifying Image and Video Region-level Understanding via Token MarksPoster2 citations
- On the Consistency of Video Large Language Models in Temporal ComprehensionPoster2 citations
- One-for-More: Continual Diffusion Model for Anomaly DetectionPoster2 citations
- OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video GenerationHighlight2 citations
- Order-Robust Class Incremental Learning: Graph-Driven Dynamic Similarity GroupingPoster2 citations
- POPEN: Preference-Based Optimization and Ensemble for LVLM-Based Reasoning SegmentationPoster2 citations
- PSBD: Prediction Shift Uncertainty Unlocks Backdoor DetectionPoster2 citations
- PanSplat: 4K Panorama Synthesis with Feed-Forward Gaussian SplattingPoster2 citations
- PassionSR: Post-Training Quantization with Adaptive Scale in One-Step Diffusion based Image Super-ResolutionPoster2 citations
- PatchDPO: Patch-level DPO for Finetuning-free Personalized Image GenerationPoster2 citations
- PerLA: Perceptive 3D Language AssistantPoster2 citations
- PhD: A ChatGPT-Prompted Visual Hallucination Evaluation DatasetHighlight2 citations
- PhysVLM: Enabling Visual Language Models to Understand Robotic Physical ReachabilityPoster2 citations
- Physical Plausibility-aware Trajectory Prediction via Locomotion EmbodimentPoster2 citations
- PillarHist: A Quantization-aware Pillar Feature Encoder based on Height-aware HistogramPoster2 citations
- Playing the Fool: Jailbreaking LLMs and Multimodal LLMs with Out-of-Distribution StrategyPoster2 citations
- Positive2Negative: Breaking the Information-Lossy Barrier in Self-Supervised Single Image DenoisingPoster2 citations
- Post-pre-training for Modality Alignment in Vision-Language Foundation ModelsPoster2 citations
- PosterMaker: Towards High-Quality Product Poster Generation with Accurate Text RenderingPoster2 citations
- Pow3R: Empowering Unconstrained 3D Reconstruction with Camera and Scene PriorsPoster2 citations
- Precise, Fast, and Low-cost Concept Erasure in Value Space: Orthogonal Complement MattersPoster2 citations
- ProKeR: A Kernel Perspective on Few-Shot Adaptation of Large Vision-Language ModelsPoster2 citations
- ProbPose: A Probabilistic Approach to 2D Human Pose EstimationPoster2 citations
- Prosody-Enhanced Acoustic Pre-training and Acoustic-Disentangled Prosody Adapting for Movie DubbingPoster2 citations
- Prototype-Based Image Prompting for Weakly Supervised Histopathological Image SegmentationPoster2 citations
- Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision ContentPoster2 citations
- RELOCATE: A Simple Training-Free Baseline for Visual Query Localization Using Region-Based RepresentationsPoster2 citations
- RENO: Real-Time Neural Compression for 3D LiDAR Point CloudsPoster2 citations
- ROICtrl: Boosting Instance Control for Visual GenerationPoster2 citations
- RandAR: Decoder-only Autoregressive Visual Generation in Random OrdersPoster2 citations
- Real-time Free-view Human Rendering from Sparse-view RGB Videos using Double Unprojected TexturesHighlight2 citations
- Rectified Diffusion Guidance for Conditional GenerationPoster2 citations
- Relative Pose Estimation through Affine Corrections of Monocular Depth PriorsHighlight2 citations
- Removing Reflections from RAW PhotosPoster2 citations
- Robotic Visual InstructionPoster2 citations
- RoomPainter: View-Integrated Diffusion for Consistent Indoor Scene TexturingPoster2 citations
- SALAD: Skeleton-aware Latent Diffusion for Text-driven Motion Generation and EditingPoster2 citations
- SGSST: Scaling Gaussian Splatting Style TransferPoster2 citations
- SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous CharactersPoster2 citations
- STCOcc: Sparse Spatial-Temporal Cascade Renovation for 3D Occupancy and Scene Flow PredictionPoster2 citations
- SapiensID: Foundation for Human RecognitionPoster2 citations
- Satellite to GroundScape - Large-scale Consistent Ground View Generation from Satellite ViewsPoster2 citations
- ScribbleLight: Single Image Indoor Relighting with ScribblesPoster2 citations
- Segmenting Maxillofacial Structures in CBCT VolumesPoster2 citations
- SharpDepth: Sharpening Metric Depth Predictions Using Diffusion DistillationPoster2 citations
- SleeperMark: Towards Robust Watermark against Fine-Tuning Text-to-image Diffusion ModelsPoster2 citations
- SmartEraser: Remove Anything from Images using Masked-Region GuidancePoster2 citations
- SnapGen-V: Generating a Five-Second Video within Five Seconds on a Mobile DevicePoster2 citations
- Sonata: Self-Supervised Learning of Reliable Point RepresentationsHighlight2 citations
- Spatial-Temporal Graph Diffusion Policy with Kinematic Modeling for Bimanual Robotic ManipulationPoster2 citations
- Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Mutimodal ModelsHighlight2 citations
- Speedy-Splat: Fast 3D Gaussian Splatting with Sparse Pixels and Sparse PrimitivesPoster2 citations
- SplatFlow: Multi-View Rectified Flow Model for 3D Gaussian Splatting SynthesisPoster2 citations
- Stereo Anywhere: Robust Zero-Shot Deep Stereo Matching Even Where Either Stereo or Mono FailPoster2 citations
- Sufficient Invariant Learning for Distribution ShiftPoster2 citations
- SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference OptimizationPoster2 citations
- TASTE-Rob: Advancing Video Generation of Task-Oriented Hand-Object Interaction for Generalizable Robotic ManipulationPoster2 citations
- Task-driven Image Fusion with Learnable Fusion LossHighlight2 citations
- Taxonomy-Aware Evaluation of Vision-Language ModelsPoster2 citations
- Temporal Separation with Entropy Regularization for Knowledge Distillation in Spiking Neural NetworksPoster2 citations
- Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention MapsPoster2 citations
- The Power of Context: How Multimodality Improves Image Super-ResolutionPoster2 citations
- TopoCellGen: Generating Histopathology Cell Topology with a Diffusion ModelPoster2 citations
- Towards Better Alignment: Training Diffusion Models with Reinforcement Learning Against Sparse RewardsPoster2 citations
- Towards Practical Real-Time Neural Video CompressionPoster2 citations
- Towards RAW Object Detection in Diverse ConditionsHighlight2 citations
- Towards Stable and Storage-efficient Dataset Distillation: Matching Convexified TrajectoryPoster2 citations
- Towards Understanding How Knowledge Evolves in Large Vision-Language ModelsPoster2 citations
- TraF-Align: Trajectory-aware Feature Alignment for Asynchronous Multi-agent PerceptionPoster2 citations
- UNOPose: Unseen Object Pose Estimation with an Unposed RGB-D Reference ImagePoster2 citations
- UVGS: Reimagining Unstructured 3D Gaussian Splatting using UV MappingPoster2 citations
- UnCommon Objects in 3DPoster2 citations
- Uncertain Multimodal Intention and Emotion Understanding in the WildPoster2 citations
- UniAP: Unifying Inter- and Intra-Layer Automatic Parallelism by Mixed Integer Quadratic ProgrammingAward Candidate2 citations
- UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and EditingHighlight2 citations
- VISTA3D: A Unified Segmentation Foundation Model For 3D Medical ImagingPoster2 citations
- Video Motion Transfer with Diffusion TransformersPoster2 citations
- VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous DrivingPoster2 citations
- WeGen: A Unified Model for Interactive Multimodal Generation as We ChatPoster2 citations
- WildAvatar: Learning In-the-wild 3D Avatars from the WebPoster2 citations
- WildGS-SLAM: Monocular Gaussian Splatting SLAM in Dynamic EnvironmentsPoster2 citations
- XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?Highlight2 citations
- Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual GroundingHighlight2 citations
- Your ViT is Secretly an Image Segmentation ModelHighlight2 citations
- h-Edit: Effective and Flexible Diffusion-Based Editing via Doob's h-TransformPoster2 citations
- 3D-GSW: 3D Gaussian Splatting for Robust WatermarkingPoster1 citations
- 3D-HGS: 3D Half-Gaussian SplattingPoster1 citations
- 3D-Mem: 3D Scene Memory for Embodied Exploration and ReasoningPoster1 citations
- A Data-Centric Revisit of Pre-Trained Vision Models for Robot LearningPoster1 citations
- A Dataset for Semantic Segmentation in the Presence of UnknownsPoster1 citations
- A Flag Decomposition for Hierarchical DatasetsPoster1 citations
- A Lightweight UDF Learning Framework for 3D Reconstruction Based on Local Shape FunctionsPoster1 citations
- A Tale of Two Classes: Adapting Supervised Contrastive Learning to Binary Imbalanced DatasetsPoster1 citations
- A Unified Model for Compressed Sensing MRI Across Undersampling PatternsPoster1 citations
- AG-VPReID: A Challenging Large-Scale Benchmark for Aerial-Ground Video-based Person Re-IdentificationPoster1 citations
- ARM: Appearance Reconstruction Model for Relightable 3D GenerationHighlight1 citations
- ASIGN: An Anatomy-aware Spatial Imputation Graphic Network for 3D Spatial TranscriptomicsPoster1 citations
- AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision RewardPoster1 citations
- AdaCM^2: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory ReductionHighlight1 citations
- AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient OptimizationPoster1 citations
- Adapter Merging with Centroid Prototype Mapping for Scalable Class-Incremental LearningPoster1 citations
- Advancing Semantic Future Prediction through Multimodal Visual Sequence TransformersPoster1 citations
- AerialMegaDepth: Learning Aerial-Ground Reconstruction and View SynthesisPoster1 citations
- AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal AlignmentPoster1 citations
- An End-to-End Robust Point Cloud Semantic Segmentation Network with Single-Step Conditional Diffusion ModelsPoster1 citations
- AnomalyNCD: Towards Novel Anomaly Class Discovery in Industrial ScenariosPoster1 citations
- Any-Resolution AI-Generated Image Detection by Spectral LearningPoster1 citations
- Around the World in 80 Timesteps: A Generative Approach to Global Visual GeolocationPoster1 citations
- ArtiFade: Learning to Generate High-quality Subject from Blemished ImagesPoster1 citations
- ArticulatedGS: Self-supervised Digital Twin Modeling of Articulated Objects using 3D Gaussian SplattingPoster1 citations
- AutoLUT: LUT-Based Image Super-Resolution with Automatic Sampling and Adaptive Residual LearningPoster1 citations
- AutoURDF: Unsupervised Robot Modeling from Point Cloud Frames Using Cluster RegistrationPoster1 citations
- Automatic Joint Structured Pruning and Quantization for Efficient Neural Network Training and CompressionPoster1 citations
- BFANet: Revisiting 3D Semantic Segmentation with Boundary Feature AnalysisPoster1 citations
- BG-Triangle: Bezier Gaussian Triangle for 3D Vectorization and RenderingPoster1 citations
- BIP3D: Bridging 2D Images and 3D Perception for Embodied IntelligencePoster1 citations
- BWFormer: Building Wireframe Reconstruction from Airborne LiDAR Point Cloud with TransformerHighlight1 citations
- Balanced Direction from Multifarious Choices: Arithmetic Meta-Learning for Domain GeneralizationPoster1 citations
- Balanced Rate-Distortion Optimization in Learned Image CompressionHighlight1 citations
- BiLoRA: Almost-Orthogonal Parameter Spaces for Continual LearningPoster1 citations
- BiM-VFI: Bidirectional Motion Field-Guided Frame Interpolation for Video with Non-uniform MotionsPoster1 citations
- BiomedCoOp: Learning to Prompt for Biomedical Vision-Language ModelsPoster1 citations
- BlockDance: Reuse Structurally Similar Spatio-Temporal Features to Accelerate Diffusion TransformersPoster1 citations
- Bootstrap Your Own Views: Masked Ego-Exo Modeling for Fine-grained View-invariant Video RepresentationsPoster1 citations
- Bridge the Gap: From Weak to Full Supervision for Temporal Action Localization with PseudoFormerPoster1 citations
- Bridging Gait Recognition and Large Language Models Sequence ModelingPoster1 citations
- Bridging Past and Future: End-to-End Autonomous Driving with Historical Prediction and PlanningPoster1 citations
- Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMsPoster1 citations
- CARL: A Framework for Equivariant Image RegistrationPoster1 citations
- CASAGPT: Cuboid Arrangement and Scene Assembly for Interior DesignHighlight1 citations
- CATANet: Efficient Content-Aware Token Aggregation for Lightweight Image Super-ResolutionPoster1 citations
- CDI: Copyrighted Data Identification in Diffusion ModelsPoster1 citations
- CL-LoRA: Continual Low-Rank Adaptation for Rehearsal-Free Class-Incremental LearningPoster1 citations
- CLIP is Strong Enough to Fight Back: Test-time Counterattacks towards Zero-shot Adversarial Robustness of CLIPPoster1 citations
- CacheQuant: Comprehensively Accelerated Diffusion ModelsPoster1 citations
- CamFreeDiff: Camera-free Image to Panorama Generation with Diffusion ModelPoster1 citations
- Certified Human Trajectory PredictionPoster1 citations
- ChatGen: Automatic Text-to-Image Generation From FreeStyle ChattingPoster1 citations
- Circumventing Shortcuts in Audio-visual Deepfake Detection Datasets with Unsupervised LearningHighlight1 citations
- ClearSight: Visual Signal Enhancement for Object Hallucination Mitigation in Multimodal Large Language ModelsPoster1 citations
- Co-op: Correspondence-based Novel Object Pose EstimationPoster1 citations
- CoA: Towards Real Image Dehazing via Compression-and-AdaptationPoster1 citations
- CoLLM: A Large Language Model for Composed Image RetrievalPoster1 citations
- CoSDH: Communication-Efficient Collaborative Perception via Supply-Demand Awareness and Intermediate-Late HybridizationPoster1 citations
- Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language ModelPoster1 citations
- Coeff-Tuning: A Graph Filter Subspace View for Tuning Attention-Based Large ModelsHighlight1 citations
- Coherent 3D Portrait Video Reconstruction via Triplane FusionPoster1 citations
- Complementary Advantages: Exploiting Cross-Field Frequency Correlation for NIR-Assisted Image DenoisingPoster1 citations
- ConMo: Controllable Motion Disentanglement and Recomposition for Zero-Shot Motion TransferPoster1 citations
- ConceptGuard: Continual Personalized Text-to-Image Generation with Forgetting and Confusion MitigationPoster1 citations
- Conditional Balance: Improving Multi-Conditioning Trade-Offs in Image GenerationPoster1 citations
- Continual SFT Matches Multimodal RLHF with Negative SupervisionPoster1 citations
- Correcting Deviations from Normality: A Reformulated Diffusion Model for Multi-Class Unsupervised Anomaly DetectionPoster1 citations
- CountLLM: Towards Generalizable Repetitive Action Counting via Large Language ModelPoster1 citations
- Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene UnderstandingPoster1 citations
- Curriculum Coarse-to-Fine Selection for High-IPC Dataset DistillationPoster1 citations
- CustomKD: Customizing Large Vision Foundation for Edge Model Improvement via Knowledge DistillationPoster1 citations
- DAMM-Diffusion: Learning Divergence-Aware Multi-Modal Diffusion Model for Nanoparticles Distribution PredictionHighlight1 citations
- DFormerv2: Geometry Self-Attention for RGBD Semantic SegmentationPoster1 citations
- DNF: Unconditional 4D Generation with Dictionary-based Neural FieldsPoster1 citations
- DPC: Dual-Prompt Collaboration for Tuning Vision-Language ModelsPoster1 citations
- DRAWER: Digital Reconstruction and Articulation With Environment RealismPoster1 citations
- DV-Matcher: Deformation-based Non-rigid Point Cloud Matching Guided by Pre-trained Visual FeaturesPoster1 citations
- D^3-Human: Dynamic Disentangled Digital Human from Monocular VideoPoster1 citations
- DeRS: Towards Extremely Efficient Upcycled Mixture-of-Experts ModelsPoster1 citations
- Debiasing Multimodal Large Language Models via Noise-Aware Preference OptimizationPoster1 citations
- Decision SpikeFormer: Spike-Driven Transformer for Decision MakingPoster1 citations
- DecoupledGaussian: Object-Scene Decoupling for Physics-Based InteractionPoster1 citations
- Decoupling Fine Detail and Global Geometry for Compressed Depth Map Super-ResolutionPoster1 citations
- DefMamba: Deformable Visual State Space ModelPoster1 citations
- Deformable Radial Kernel SplattingPoster1 citations
- Denoising Functional Maps: Diffusion Models for Shape CorrespondencePoster1 citations
- Depth Any Camera: Zero-Shot Metric Depth Estimation from Any CameraPoster1 citations
- DesignDiffusion: High-Quality Text-to-Design Image Generation with Diffusion ModelsPoster1 citations
- Detecting Adversarial Data Using Perturbation ForgeryPoster1 citations
- Deterministic Certification of Graph Neural Networks against Graph Poisoning Attacks with Arbitrary PerturbationsPoster1 citations
- DifIISR: A Diffusion Model with Gradient Guidance for Infrared Image Super-ResolutionPoster1 citations
- DiffFNO: Diffusion Fourier Neural OperatorPoster1 citations
- DiffPortrait360: Consistent Portrait Diffusion for 360 View SynthesisPoster1 citations
- DiffusionSfM: Predicting Structure and Motion via Ray Origin and Endpoint DiffusionPoster1 citations
- Discovering Fine-Grained Visual-Concept Relations by Disentangled Optimal Transport Concept Bottleneck ModelsPoster1 citations
- Distilling Monocular Foundation Model for Fine-grained Depth CompletionPoster1 citations
- Distilling Spectral Graph for Object-Context Aware Open-Vocabulary Semantic SegmentationPoster1 citations
- Distraction is All You Need for Multimodal Large Language Model JailbreakingHighlight1 citations
- Divot: Diffusion Powers Video Tokenizer for Comprehension and GenerationPoster1 citations
- Do Computer Vision Foundation Models Learn the Low-level Characteristics of the Human Visual System?Highlight1 citations
- Do We Always Need the Simplicity Bias? Looking for Optimal Inductive Biases in the WildPoster1 citations
- Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?Poster1 citations
- DocSAM: Unified Document Image Segmentation via Query Decomposition and Heterogeneous Mixed LearningPoster1 citations
- DocVLM: Make Your VLM an Efficient ReaderPoster1 citations
- Document Haystacks: Vision-Language Reasoning Over Piles of 1000+ DocumentsPoster1 citations
- DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal CyclesPoster1 citations
- Dr. Splat: Directly Referring 3D Gaussian Splatting via Direct Language Embedding RegistrationHighlight1 citations
- DreamCache: Finetuning-Free Lightweight Personalized Image Generation via Feature CachingPoster1 citations
- DreamOmni: Unified Image Generation and EditingPoster1 citations
- DreamRelation: Bridging Customization and Relation GenerationPoster1 citations
- Dual Prompting Image Restoration with Diffusion TransformersPoster1 citations
- DualPM: Dual Posed-Canonical Point Maps for 3D Shape and Pose ReconstructionHighlight1 citations
- DualTalk: Dual-Speaker Interaction for 3D Talking Head ConversationsPoster1 citations
- Dyn-HaMR: Recovering 4D Interacting Hand Motion from a Dynamic CameraHighlight1 citations
- ECBench: Can Multi-modal Foundation Models Understand the Egocentric World? A Holistic Embodied Cognition BenchmarkPoster1 citations
- EZSR: Event-based Zero-Shot RecognitionPoster1 citations
- EasyHOI: Unleashing the Power of Large Models for Reconstructing Hand-Object Interactions in the WildPoster1 citations
- EchoONE: Segmenting Multiple Echocardiography Planes in One ModelPoster1 citations
- EchoTraffic: Enhancing Traffic Anomaly Understanding with Audio-Visual InsightsPoster1 citations
- Effective Cloud Removal for Remote Sensing Images by an Improved Mean-Reverting Denoising Model with Elucidated Design SpacePoster1 citations
- Efficient Transfer Learning for Video-language Foundation ModelsPoster1 citations
- Efficient Video Face Enhancement with Enhanced Spatial-Temporal ConsistencyPoster1 citations
- Embodied Scene Understanding for Vision Language Models via MetaVQAPoster1 citations
- Empowering Vector Graphics with Consistently Arbitrary Viewing and View-dependent VisibilityHighlight1 citations
- Enhancing Dataset Distillation via Non-Critical Region RefinementPoster1 citations
- Enhancing Diversity for Data-free QuantizationPoster1 citations
- Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic DataPoster1 citations
- Erasing Undesirable Influence in Diffusion ModelsPoster1 citations
- Ev-3DOD: Pushing the Temporal Boundaries of 3D Object Detection with Event CamerasHighlight1 citations
- Eval3D: Interpretable and Fine-grained Evaluation for 3D GenerationPoster1 citations
- Evaluating Model Perception of Color Illusions in Photorealistic ScenesPoster1 citations
- Evaluating Vision-Language Models as Evaluators in Path PlanningPoster1 citations
- Event Fields: Capturing Light Fields at High Speed, Resolution, and Dynamic RangeHighlight1 citations
- Event-based Video Super-Resolution via State Space ModelsPoster1 citations
- Exploiting Temporal State Space Sharing for Video Semantic SegmentationPoster1 citations
- Exploring CLIP's Dense Knowledge for Weakly Supervised Semantic SegmentationPoster1 citations
- Exploring Semantic Feature Discrimination for Perceptual Image Super-Resolution and Opinion-Unaware No-Reference Image Quality AssessmentPoster1 citations
- Exploring Visual Vulnerabilities via Multi-Loss Adversarial Search for Jailbreaking Vision-Language ModelsPoster1 citations
- Extreme Rotation Estimation in the WildPoster1 citations
- FADA: Fast Diffusion Avatar Synthesis with Mixed-Supervised Multi-CFG DistillationPoster1 citations
- FAM Diffusion: Frequency and Attention Modulation for High-Resolution Image Generation with Stable DiffusionPoster1 citations
- FIction: 4D Future Interaction Prediction from VideoHighlight1 citations
- FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-trainingPoster1 citations
- FSboard: Over 3 Million Characters of ASL Fingerspelling Collected via SmartphonesPoster1 citations
- Fancy123: One Image to High-Quality 3D Mesh Generation via Plug-and-Play DeformationPoster1 citations
- Feat2GS: Probing Visual Foundation Models with Gaussian SplattingPoster1 citations
- Feature4X: Bridging Any Monocular Video to 4D Agentic AI with Versatile Gaussian Feature FieldsPoster1 citations
- Filter Images First, Generate Instructions Later: Pre-Instruction Data Selection for Visual Instruction TuningHighlight1 citations
- Finding Local Diffusion Schrodinger Bridge using Kolmogorov-Arnold NetworkPoster1 citations
- FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text InputsPoster1 citations
- FlexiDiT: Your Diffusion Transformer Can Easily Generate High-Quality Samples with Less ComputeHighlight1 citations
- Floxels: Fast Unsupervised Voxel Based Scene Flow EstimationPoster1 citations
- Forensic Self-Descriptions Are All You Need for Zero-Shot Detection, Open-Set Source Attribution, and Clustering of AI-generated ImagesPoster1 citations
- Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language ModelsPoster1 citations
- Foundations of the Theory of Performance-Based RankingPoster1 citations
- Free-viewpoint Human Animation with Pose-correlated Reference SelectionHighlight1 citations
- From Head to Tail: Towards Balanced Representation in Large Vision-Language Models through Adaptive Data CalibrationPoster1 citations
- From Laboratory to Real World: A New Benchmark Towards Privacy-Preserved Visible-Infrared Person Re-IdentificationPoster1 citations
- Full-DoF Egomotion Estimation for Event Cameras Using Geometric SolversHighlight1 citations
- GLUS: Global-Local Reasoning Unified into A Single Large Language Model for Video SegmentationPoster1 citations
- GRAPHGPT-O: Synergistic Multimodal Comprehension and Generation on GraphsPoster1 citations
- GarmentPile: Point-Level Visual Affordance Guided Retrieval and Adaptation for Cluttered Garments ManipulationPoster1 citations
- GauSTAR: Gaussian Surface Tracking and ReconstructionPoster1 citations
- Gaussian Splatting for Efficient Satellite Image PhotogrammetryPoster1 citations
- Generating 3D-Consistent Videos from Unposed Internet PhotosPoster1 citations
- Generating Multimodal Driving Scenes via Next-Scene PredictionPoster1 citations
- Generative Gaussian Splatting for Unbounded 3D City GenerationPoster1 citations
- Generative Image Layer Decomposition with Visual EffectsPoster1 citations
- Generative Modeling of Class Probability for Multi-Modal Representation LearningHighlight1 citations
- Generative Multiview Relighting for 3D Reconstruction under Extreme Illumination VariationHighlight1 citations
- Generative Video PropagationPoster1 citations
- Geometry Field Splatting with Gaussian SurfelsPoster1 citations
- Global-Local Tree Search in VLMs for 3D Indoor Scene GenerationPoster1 citations
- Good, Cheap, and Fast: Overfitted Image Compression with Wasserstein DistortionHighlight1 citations
- Guiding Human-Object Interactions with Rich Geometry and RelationsPoster1 citations
- Gyro-based Neural Single Image DeblurringPoster1 citations
- HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility EvaluatorPoster1 citations
- HELVIPAD: A Real-World Dataset for Omnidirectional Stereo Depth EstimationHighlight1 citations
- HOIGPT: Learning Long-Sequence Hand-Object Interaction with Language ModelsPoster1 citations
- Handling Spatial-Temporal Data Heterogeneity for Federated Continual Learning via Tail AnchorPoster1 citations
- HiLoTs: High-Low Temporal Sensitive Representation Learning for Semi-Supervised LiDAR Segmentation in Autonomous DrivingPoster1 citations
- HiPART: Hierarchical Pose AutoRegressive Transformer for Occluded 3D Human Pose EstimationPoster1 citations
- HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video UnderstandingPoster1 citations
- Hierarchical Flow Diffusion for Efficient Frame InterpolationPoster1 citations
- High-Fidelity Relightable Monocular Portrait Animation with Lighting-Controllable Video Diffusion ModelPoster1 citations
- HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language EmbeddingPoster1 citations
- Horizon-GS: Unified 3D Gaussian Splatting for Large-Scale Aerial-to-Ground ScenesPoster1 citations
- HyperGLM: HyperGraph for Video Scene Graph Generation and AnticipationPoster1 citations
- Hyperdimensional Uncertainty Quantification for Multimodal Uncertainty Fusion in Autonomous Vehicles PerceptionPoster1 citations
- ID-Patch: Robust ID Association for Group Photo PersonalizationPoster1 citations
- ILIAS: Instance-Level Image retrieval At ScalePoster1 citations
- Improving Adversarial Transferability on Vision Transformers via Forward Propagation RefinementPoster1 citations
- Instant Gaussian Stream: Fast and Generalizable Streaming of Dynamic Scene Reconstruction via Gaussian SplattingHighlight1 citations
- InteractVLM: 3D Interaction Reasoning from 2D Foundational ModelsPoster1 citations
- Is `Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction TuningPoster1 citations
- Is this Generated Person Existed in Real-world? Fine-grained Detecting and Calibrating Abnormal Human-bodyHighlight1 citations
- Jailbreaking the Non-Transferable Barrier via Test-Time Data DisguisingPoster1 citations
- JamMa: Ultra-lightweight Local Feature Matching with Joint MambaPoster1 citations
- Joint Out-of-Distribution Filtering and Data Discovery Active LearningPoster1 citations
- LaTexBlend: Scaling Multi-concept Customized Generation with Latent Textual BlendingHighlight1 citations
- Large-scale Multi-view Tensor Clustering with Implicit Linear KernelsPoster1 citations
- Latent Space Super-Resolution for Higher-Resolution Image Generation with Diffusion ModelsPoster1 citations
- Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion TransformersPoster1 citations
- LeanGaussian: Breaking Pixel or Point Cloud Correspondence in Modeling 3D GaussiansPoster1 citations
- Learned Image Compression with Dictionary-based Entropy ModelPoster1 citations
- Learning Affine Correspondences by Integrating Geometric ConstraintsPoster1 citations
- Learning Visual Generative Priors without TextPoster1 citations
- Learning to Sample Effective and Diverse Prompts for Text-to-Image GenerationPoster1 citations
- Less is More: Efficient Model Merging with Binary Task SwitchHighlight1 citations
- LiDAR-RT: Gaussian-based Ray Tracing for Dynamic LiDAR Re-simulationPoster1 citations
- Light3R-SfM: Towards Feed-forward Structure-from-MotionHighlight1 citations
- LineArt: A Knowledge-guided Training-free High-quality Appearance Transfer for Design Drawing with Diffusion ModelPoster1 citations
- LoRA Subtraction for Drift-Resistant Space in Exemplar-Free Continual LearningPoster1 citations
- Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data CurationPoster1 citations
- LookCloser: Frequency-aware Radiance Field for Tiny-Detail ScenePoster1 citations
- Lux Post Facto: Learning Portrait Performance Relighting with Conditional Video Diffusion and a Hybrid DatasetPoster1 citations
- MANTA: A Large-Scale Multi-View and Visual-Text Anomaly Detection Dataset for Tiny ObjectsPoster1 citations
- MAR-3D: Progressive Masked Auto-regressor for High-Resolution 3D GenerationHighlight1 citations
- MBQ: Modality-Balanced Quantization for Large Vision-Language ModelsPoster1 citations
- MEGA: Masked Generative Autoencoder for Human Mesh RecoveryPoster1 citations
- MET3R: Measuring Multi-View Consistency in Generated ImagesPoster1 citations
- MG-MotionLLM: A Unified Framework for Motion Comprehension and Generation across Multiple GranularitiesPoster1 citations
- MICAS: Multi-grained In-Context Adaptive Sampling for 3D Point Cloud ProcessingPoster1 citations
- MIDI: Multi-Instance Diffusion for Single Image to 3D Scene GenerationPoster1 citations
- MMRL: Multi-Modal Representation Learning for Vision-Language ModelsPoster1 citations
- MMTL-UniAD: A Unified Framework for Multimodal and Multi-Task Learning in Assistive Driving PerceptionPoster1 citations
- MP-GUI: Modality Perception with MLLMs for GUI UnderstandingPoster1 citations
- MPDrive: Improving Spatial Understanding with Marker-Based Prompt Learning for Autonomous DrivingHighlight1 citations
- MUSt3R: Multi-view Network for Stereo 3D ReconstructionHighlight1 citations
- MVBoost: Boost 3D Reconstruction with Multi-View RefinementPoster1 citations
- MaRI: Material Retrieval Integration across DomainsPoster1 citations
- Maintaining Consistent Inter-Class Topology in Continual Test-Time AdaptationPoster1 citations
- MambaIC: State Space Models for High-Performance Learned Image CompressionPoster1 citations
- MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language TrackingHighlight1 citations
- ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable GraspingHighlight1 citations
- Marten: Visual Question Answering with Mask Generation for Multi-modal Document UnderstandingPoster1 citations
- Mask^2DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video GenerationPoster1 citations
CVPR accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.