← All conferences

CVPR 2025 Accepted Papers

The full list of 2,872 papers accepted at CVPR 2025 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Poster: 2,468Highlight: 388Award Candidate: 15
  1. Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video AnalysisHighlight368 citations
  2. Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and GenerationPoster111 citations
  3. MambaVision: A Hybrid Mamba-Transformer Vision BackbonePoster105 citations
  4. MambaOut: Do We Really Need Mamba for Vision?Poster96 citations
  5. StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from TextPoster86 citations
  6. OmniGen: Unified Image GenerationPoster84 citations
  7. DepthCrafter: Generating Consistent Long Depth Sequences for Open-world VideosHighlight72 citations
  8. Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall SpacesPoster72 citations
  9. Structured 3D Latents for Scalable and Versatile 3D GenerationHighlight71 citations
  10. VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long VideosPoster60 citations
  11. EditSplat: Multi-View Fusion and Attention-Guided Optimization for View-Consistent 3D Scene Editing with 3D Gaussian SplattingPoster58 citations
  12. LLaVA-Critic: Learning to Evaluate Multimodal ModelsPoster53 citations
  13. Tora: Trajectory-oriented Diffusion Transformer for Video GenerationPoster52 citations
  14. Video-XL: Extra-Long Vision Language Model for Hour-Scale Video UnderstandingPoster52 citations
  15. Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image SynthesisPoster50 citations
  16. MoSca: Dynamic Gaussian Fusion from Casual Videos via 4D Motion ScaffoldsHighlight44 citations
  17. NVILA: Efficient Frontier Visual Language ModelsPoster43 citations
  18. T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video GenerationPoster43 citations
  19. VisionZip: Longer is Better but Not Necessary in Vision Language ModelsPoster43 citations
  20. WonderWorld: Interactive 3D Scene Generation from a Single ImageHighlight43 citations
  21. SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language ModelsPoster40 citations
  22. Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language ModelsHighlight39 citations
  23. JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and GenerationPoster38 citations
  24. Learning Temporally Consistent Video Depth from Video Diffusion PriorsPoster36 citations
  25. DepthSplat: Connecting Gaussian Splatting and DepthPoster34 citations
  26. TokenFlow: Unified Image Tokenizer for Multimodal Understanding and GenerationPoster34 citations
  27. VoCo-LLaMA: Towards Vision Compression with Large Language ModelsPoster34 citations
  28. DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous DrivingHighlight33 citations
  29. Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-trainingPoster33 citations
  30. Identity-Preserving Text-to-Video Generation by Frequency DecompositionHighlight32 citations
  31. Mamba-Reg: Vision Mamba Also Needs RegistersPoster29 citations
  32. Q-DiT: Accurate Post-Training Quantization for Diffusion TransformersPoster28 citations
  33. Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion ModelsAward Candidate27 citations
  34. SF3D: Stable Fast 3D Mesh Reconstruction with UV-unwrapping and Illumination DisentanglementPoster27 citations
  35. VLOGGER: Multimodal Diffusion for Embodied Avatar SynthesisPoster27 citations
  36. Apollo: An Exploration of Video Understanding in Large Multimodal ModelsPoster25 citations
  37. MoGe: Unlocking Accurate Monocular Geometry Estimation for Open-Domain Images with Optimal Training SupervisionPoster25 citations
  38. Multimodal Autoregressive Pre-training of Large Vision EncodersHighlight25 citations
  39. Continuous 3D Perception Model with Persistent StatePoster24 citations
  40. Improving Diffusion Inverse Problem Solving with Decoupled Noise AnnealingPoster24 citations
  41. ShowUI: One Vision-Language-Action Model for GUI Visual AgentPoster24 citations
  42. CAT4D: Create Anything in 4D with Multi-View Video Diffusion ModelsPoster23 citations
  43. DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene RepresentationPoster23 citations
  44. EMOVA: Empowering Language Models to See, Hear and Speak with Vivid EmotionsPoster23 citations
  45. Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward PassPoster23 citations
  46. Federated Learning with Domain Shift EraserPoster23 citations
  47. FlashGS: Efficient 3D Gaussian Splatting for Large-scale and High-resolution RenderingPoster22 citations
  48. Motion Prompting: Controlling Video Generation with Motion TrajectoriesPoster22 citations
  49. AnyEdit: Mastering Unified High-Quality Image Editing for Any IdeaPoster21 citations
  50. VGGT: Visual Geometry Grounded TransformerAward Candidate21 citations
  51. CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action ModelsPoster20 citations
  52. Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local AttentionPoster20 citations
  53. Navigation World ModelsAward Candidate20 citations
  54. Dual Diffusion for Unified Image Generation and UnderstandingPoster19 citations
  55. Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video ContentPoster19 citations
  56. Timestep Embedding Tells: It's Time to Cache for Video Diffusion ModelHighlight19 citations
  57. VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term ModelingPoster19 citations
  58. MIMO: Controllable Character Video Synthesis with Spatial Decomposed ModelingPoster18 citations
  59. MegaSaM: Accurate, Fast and Robust Structure and Motion from Casual Dynamic VideosAward Candidate18 citations
  60. Towards General Visual-Linguistic Face Forgery DetectionPoster18 citations
  61. 3DTopia-XL: Scaling High-quality 3D Asset Generation via Primitive DiffusionHighlight17 citations
  62. Factored-NeuS: Reconstructing Surfaces, Illumination, and Materials of Possibly Glossy ObjectsPoster17 citations
  63. Magma: A Foundation Model for Multimodal AI AgentsPoster17 citations
  64. MambaIRv2: Attentive State Space RestorationPoster17 citations
  65. Multiple Object Tracking as ID PredictionPoster17 citations
  66. ParaHome: Parameterizing Everyday Home Activities Towards 3D Generative Modeling of Human-Object InteractionsPoster17 citations
  67. VideoGigaGAN: Towards Detail-rich Video Super-ResolutionPoster17 citations
  68. UniReal: Universal Image Generation and Editing via Learning Real-world DynamicsHighlight16 citations
  69. Goku: Flow Based Video Generative Foundation ModelsHighlight15 citations
  70. VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward ModelsHighlight15 citations
  71. VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame SelectionPoster15 citations
  72. WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion ModelPoster15 citations
  73. Align3R: Aligned Monocular Depth Estimation for Dynamic VideosHighlight14 citations
  74. All Languages Matter: Evaluating LMMs on Culturally Diverse 100 LanguagesHighlight14 citations
  75. Continuous, Subject-Specific Attribute Control in T2I Models by Identifying Semantic DirectionsPoster14 citations
  76. DiG: Scalable and Efficient Diffusion Models with Gated Linear AttentionPoster14 citations
  77. Dinomaly: The Less Is More Philosophy in Multi-Class Unsupervised Anomaly DetectionPoster14 citations
  78. Parallelized Autoregressive Visual GenerationHighlight14 citations
  79. ReCapture: Generative Video Camera Controls for User-Provided Videos using Masked Video Fine-TuningPoster14 citations
  80. StableAnimator: High-Quality Identity-Preserving Human Image AnimationPoster14 citations
  81. StoryGPT-V: Large Language Models as Consistent Story VisualizersPoster14 citations
  82. Transformers without NormalizationPoster14 citations
  83. F-LMM: Grounding Frozen Large Multimodal ModelsPoster13 citations
  84. Large-Scale Text-to-Image Model with Inpainting is a Zero-Shot Subject-Driven Image GeneratorPoster13 citations
  85. MC^2: Multi-concept Guidance for Customized Multi-concept GenerationPoster13 citations
  86. MMVU: Measuring Expert-Level Multi-Discipline Video UnderstandingPoster13 citations
  87. SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token FoldingPoster13 citations
  88. WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wildPoster13 citations
  89. You See it, You Got it: Learning 3D Creation on Pose-Free Videos at ScaleHighlight13 citations
  90. 3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less HallucinationPoster12 citations
  91. A Simple Data Augmentation for Feature Distribution Skewed Federated LearningPoster12 citations
  92. AnySat: One Earth Observation Model for Many Resolutions, Scales, and ModalitiesHighlight12 citations
  93. Arbitrary-steps Image Super-resolution via Diffusion InversionPoster12 citations
  94. GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera ControlHighlight12 citations
  95. Generalizing Deepfake Video Detection with Plug-and-Play: Video-Level Blending and Spatiotemporal Adapter TuningPoster12 citations
  96. Paint by Inpaint: Learning to Add Image Objects by Removing Them FirstPoster12 citations
  97. Scaling Mesh Generation via Compressive TokenizationPoster12 citations
  98. SkillMimic: Learning Basketball Interaction Skills from DemonstrationsHighlight12 citations
  99. Stereo4D: Learning How Things Move in 3D from Internet Stereo VideosPoster12 citations
  100. Video Depth Anything: Consistent Depth Estimation for Super-Long VideosHighlight12 citations
  101. Wonderland: Navigating 3D Scenes from a Single ImagePoster12 citations
  102. AI-Face: A Million-Scale Demographically Annotated AI-Generated Face Dataset and Fairness BenchmarkPoster11 citations
  103. Critic-V: VLM Critics Help Catch VLM Errors in Multimodal ReasoningPoster11 citations
  104. Diffusion Self-Distillation for Zero-Shot Customized Image GenerationPoster11 citations
  105. DrVideo: Document Retrieval Based Long Video UnderstandingPoster11 citations
  106. Exploring Sparse MoE in GANs for Text-conditioned Image SynthesisPoster11 citations
  107. Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion TransformerPoster11 citations
  108. Hash3D: Training-free Acceleration for 3D GenerationPoster11 citations
  109. Img-Diff: Contrastive Data Synthesis for Multimodal Large Language ModelsPoster11 citations
  110. LT3SD: Latent Trees for 3D Scene DiffusionPoster11 citations
  111. MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic ModelingPoster11 citations
  112. PhyT2V: LLM-Guided Iterative Self-Refinement for Physics-Grounded Text-to-Video GenerationPoster11 citations
  113. ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online RestorationPoster11 citations
  114. SegEarth-OV: Towards Training-Free Open-Vocabulary Segmentation for Remote Sensing ImagesPoster11 citations
  115. Self-Expansion of Pre-trained Models with Mixture of Adapters for Continual LearningPoster11 citations
  116. Task Singular Vectors: Reducing Task Interference in Model MergingPoster11 citations
  117. Teaching Large Language Models to Regress Accurate Image Quality Scores Using Score DistributionPoster11 citations
  118. UniScene: Unified Occupancy-centric Driving Scene GenerationPoster11 citations
  119. VideoDPO: Omni-Preference Alignment for Video Diffusion GenerationPoster11 citations
  120. A Closer Look at Time Steps is Worthy of Triple Speed-Up for Diffusion Model TrainingPoster10 citations
  121. AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion TransformersPoster10 citations
  122. AeroGen: Enhancing Remote Sensing Object Detection with Diffusion-Driven Data GenerationPoster10 citations
  123. AnimateAnything: Consistent and Controllable Animation for Video GenerationPoster10 citations
  124. CORE4D: A 4D Human-Object-Human Interaction Dataset for Collaborative Object REarrangementPoster10 citations
  125. DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video GenerationPoster10 citations
  126. Gaussian Splashing: Unified Particles for Versatile Motion Synthesis and RenderingPoster10 citations
  127. LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language ModelsPoster10 citations
  128. MV-DUSt3R+: Single-Stage Scene Reconstruction from Sparse Views In 2 SecondsPoster10 citations
  129. MVPaint: Synchronized Multi-View Diffusion for Painting Anything 3DPoster10 citations
  130. Mani-GS: Gaussian Splatting Manipulation with Triangular MeshPoster10 citations
  131. MonSter: Marry Monodepth to Stereo Unleashes PowerHighlight10 citations
  132. Number it: Temporal Grounding Videos like Flipping MangaPoster10 citations
  133. OSV: One Step is Enough for High-Quality Image to Video GenerationPoster10 citations
  134. SIDA: Social Media Image Deepfake Detection, Localization and Explanation with Large Multimodal ModelPoster10 citations
  135. Stable Flow: Vital Layers for Training-Free Image EditingPoster10 citations
  136. Video-Guided Foley Sound Generation with Multimodal ControlsPoster10 citations
  137. 5%>100%: Breaking Performance Shackles of Full Fine-Tuning on Visual Recognition TasksPoster9 citations
  138. Adversarial Diffusion Compression for Real-World Image Super-ResolutionPoster9 citations
  139. AniDoc: Animation Creation Made EasierPoster9 citations
  140. BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile DevicesPoster9 citations
  141. CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and GenerationHighlight9 citations
  142. G3Flow: Generative 3D Semantic Flow for Pose-aware and Generalizable Object ManipulationPoster9 citations
  143. HOT3D: Hand and Object Tracking in 3D from Egocentric Multi-View VideosHighlight9 citations
  144. Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any GranularityHighlight9 citations
  145. ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language ModelsPoster9 citations
  146. Interleaved-Modal Chain-of-ThoughtPoster9 citations
  147. Make It Count: Text-to-Image Generation with an Accurate Number of ObjectsPoster9 citations
  148. MeGA: Hybrid Mesh-Gaussian Head Avatar for High-Fidelity Rendering and Head EditingPoster9 citations
  149. OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?Poster9 citations
  150. Pixel-level and Semantic-level Adjustable Super-resolution: A Dual-LoRA ApproachPoster9 citations
  151. RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to ConcretePoster9 citations
  152. RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for RoboticsPoster9 citations
  153. ATP-LLaVA: Adaptive Token Pruning for Large Vision Language ModelsPoster8 citations
  154. Audio-Visual Instance SegmentationPoster8 citations
  155. BIOMEDICA: An Open Biomedical Image-Caption Archive, Dataset, and Vision-Language Models Derived from Scientific LiteraturePoster8 citations
  156. DEIM: DETR with Improved Matching for Fast ConvergencePoster8 citations
  157. DKDM: Data-Free Knowledge Distillation for Diffusion Models with Any ArchitecturePoster8 citations
  158. DPU: Dynamic Prototype Updating for Multimodal Out-of-Distribution DetectionHighlight8 citations
  159. Detecting Out-of-Distribution Through the Lens of Neural CollapsePoster8 citations
  160. Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and ReactionPoster8 citations
  161. FreeSim: Toward Free-viewpoint Camera Simulation in Driving ScenesPoster8 citations
  162. GEM: A Generalizable Ego-Vision Multimodal World Model for Fine-Grained Ego-Motion, Object Dynamics, and Scene Composition ControlPoster8 citations
  163. GaussTR: Foundation Model-Aligned Gaussian Transformer for Self-Supervised 3D Spatial UnderstandingPoster8 citations
  164. GaussianFormer-2: Probabilistic Gaussian Superposition for Efficient 3D Occupancy PredictionPoster8 citations
  165. GaussianWorld: Gaussian World Model for Streaming 3D Occupancy PredictionPoster8 citations
  166. HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language ModelsPoster8 citations
  167. LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language ModelsHighlight8 citations
  168. LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal UnderstandingPoster8 citations
  169. LamRA: Large Multimodal Model as Your Advanced Retrieval AssistantPoster8 citations
  170. LoRASculpt: Sculpting LoRA for Harmonizing General and Specialized Knowledge in Multimodal Large Language ModelsPoster8 citations
  171. LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long VideosPoster8 citations
  172. MASt3R-SLAM: Real-Time Dense SLAM with 3D Reconstruction PriorsHighlight8 citations
  173. Mind the Time: Temporally-Controlled Multi-Event Video GenerationPoster8 citations
  174. Mitigating the Human-Robot Domain Discrepancy in Visual Pre-training for Robotic ManipulationPoster8 citations
  175. MobilePortrait: Real-Time One-Shot Neural Head Avatars on Mobile DevicesPoster8 citations
  176. OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial ConstraintsHighlight8 citations
  177. PUP 3D-GS: Principled Uncertainty Pruning for 3D Gaussian SplattingPoster8 citations
  178. Perception Tokens Enhance Visual Reasoning in Multimodal Language ModelsPoster8 citations
  179. Prompting Depth Anything for 4K Resolution Accurate Metric Depth EstimationPoster8 citations
  180. RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V TrustworthinessHighlight8 citations
  181. Sonic: Shifting Focus to Global Audio Perception in Portrait AnimationPoster8 citations
  182. TSD-SR: One-Step Diffusion with Target Score Distillation for Real-World Image Super-ResolutionPoster8 citations
  183. The Scene Language: Representing Scenes with Programs, Words, and EmbeddingsHighlight8 citations
  184. Towards Open-Vocabulary Audio-Visual Event LocalizationPoster8 citations
  185. VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?Poster8 citations
  186. Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene UnderstandingPoster8 citations
  187. VideoWorld: Exploring Knowledge Learning from Unlabeled VideosPoster8 citations
  188. CXPMRG-Bench: Pre-training and Benchmarking for X-ray Medical Report Generation on CheXpert Plus DatasetPoster7 citations
  189. Closed-Loop Supervised Fine-Tuning of Tokenized Traffic ModelsPoster7 citations
  190. Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure DetectionPoster7 citations
  191. Contextual AD Narration with Interleaved Multimodal SequencePoster7 citations
  192. EchoMimicV2: Towards Striking, Simplified, and Semi-Body Human AnimationPoster7 citations
  193. Efficient Visual State Space Model for Image DeblurringPoster7 citations
  194. FastVLM: Efficient Vision Encoding for Vision Language ModelsPoster7 citations
  195. IDOL: Instant Photorealistic 3D Human Creation from a Single ImagePoster7 citations
  196. LLAVIDAL: A Large LAnguage VIsion Model for Daily Activities of LivingPoster7 citations
  197. LaVin-DiT: Large Vision Diffusion TransformerPoster7 citations
  198. Language-Guided Image Tokenization for GenerationPoster7 citations
  199. MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language ModelsPoster7 citations
  200. Ouroboros3D: Image-to-3D Generation via 3D-aware Recursive DiffusionPoster7 citations
  201. ROCKET-1: Mastering Open-World Interaction with Visual-Temporal Context PromptingPoster7 citations
  202. Revealing Key Details to See Differences: A Novel Prototypical Perspective for Skeleton-based Action RecognitionHighlight7 citations
  203. SoftVQ-VAE: Efficient 1-Dimensional Continuous TokenizerPoster7 citations
  204. SplatAD: Real-Time Lidar and Camera Rendering with 3D Gaussian Splatting for Autonomous DrivingPoster7 citations
  205. StarVector: Generating Scalable Vector Graphics Code from Images and TextPoster7 citations
  206. StreetCrafter: Street View Synthesis with Controllable Video Diffusion ModelsPoster7 citations
  207. VERA: Explainable Video Anomaly Detection via Verbalized Learning of Vision-Language ModelsPoster7 citations
  208. VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLMPoster7 citations
  209. Vision-Language Models Do Not Understand NegationPoster7 citations
  210. WAVE: Weight Templates for Adaptive Initialization of Variable-sized ModelsPoster7 citations
  211. World-consistent Video Diffusion with Explicit 3D ModelingHighlight7 citations
  212. 3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint TransformerPoster6 citations
  213. A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMsPoster6 citations
  214. AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMMPoster6 citations
  215. Accurate Differential Operators for Hybrid Neural FieldsPoster6 citations
  216. Active Data Curation Effectively Distills Large-Scale Multimodal ModelsPoster6 citations
  217. Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image CaptioningPoster6 citations
  218. Collaborative Decoding Makes Visual Auto-Regressive Modeling EfficientPoster6 citations
  219. Dataset Distillation with Neural Characteristic Function: A Minmax PerspectiveHighlight6 citations
  220. DyCoke: Dynamic Compression of Tokens for Fast Video Large Language ModelsPoster6 citations
  221. EarthDial: Turning Multi-sensory Earth Observations to Interactive DialoguesPoster6 citations
  222. EmoDubber: Towards High Quality and Emotion Controllable Movie DubbingHighlight6 citations
  223. Emphasizing Discriminative Features for Dataset Distillation in Complex ScenariosPoster6 citations
  224. Empowering LLMs to Understand and Generate Complex Vector GraphicsPoster6 citations
  225. FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any GranularityPoster6 citations
  226. FloVD: Optical Flow Meets Video Diffusion Model for Enhanced Camera-Controlled Video SynthesisPoster6 citations
  227. From Slow Bidirectional to Fast Autoregressive Video Diffusion ModelsPoster6 citations
  228. GET: Unlocking the Multi-modal Potential of CLIP for Generalized Category DiscoveryPoster6 citations
  229. Go-with-the-Flow: Motion-Controllable Video Diffusion Models Using Real-Time Warped NoisePoster6 citations
  230. HunyuanPortrait: Implicit Condition Control for Enhanced Portrait AnimationPoster6 citations
  231. IRGS: Inter-Reflective Gaussian Splatting with 2D Gaussian Ray TracingPoster6 citations
  232. InterMimic: Towards Universal Whole-Body Control for Physics-Based Human-Object InteractionsHighlight6 citations
  233. Layered Image Vectorization via Semantic SimplificationPoster6 citations
  234. MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual ContextsPoster6 citations
  235. Object Detection using Event Camera: A MoE Heat Conduction based Detector and A New Benchmark DatasetPoster6 citations
  236. OmniFlow: Any-to-Any Generation with Multi-Modal Rectified FlowsPoster6 citations
  237. One-Minute Video Generation with Test-Time TrainingPoster6 citations
  238. Re-thinking Temporal Search for Long-Form Video UnderstandingPoster6 citations
  239. Reloc3r: Large-Scale Training of Relative Camera Pose Regression for Generalizable, Fast, and Accurate Visual LocalizationPoster6 citations
  240. ScaMo: Exploring the Scaling Law in Autoregressive Motion Generation ModelPoster6 citations
  241. SceneFactor: Factored Latent 3D Diffusion for Controllable 3D Scene GenerationPoster6 citations
  242. Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task AlignmentPoster6 citations
  243. TexGaussian: Generating High-quality PBR Material via Octree-based 3D Gaussian SplattingPoster6 citations
  244. Towards Universal Soccer Video UnderstandingPoster6 citations
  245. Unleashing the Potential of Multi-modal Foundation Models and Video Diffusion for 4D Dynamic Physical Scene SimulationPoster6 citations
  246. Video Depth without Video ModelsPoster6 citations
  247. VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User SimulationPoster6 citations
  248. 2DMamba: Efficient State Space Model for Image Representation with Applications on Giga-Pixel Whole Slide Image ClassificationPoster5 citations
  249. AffordDP: Generalizable Diffusion Policy with Transferable AffordancePoster5 citations
  250. AniGS: Animatable Gaussian Avatar from a Single Image with Inconsistent Gaussian ReconstructionPoster5 citations
  251. AnyDressing: Customizable Multi-Garment Virtual Dressing via Latent Diffusion ModelsPoster5 citations
  252. Attention Distillation: A Unified Approach to Visual Characteristics TransferPoster5 citations
  253. AutoPresent: Designing Structured Visuals from ScratchPoster5 citations
  254. BooW-VTON: Boosting In-the-Wild Virtual Try-On via Mask-Free Pseudo Data TrainingPoster5 citations
  255. Boost Your Human Image Generation Model via Direct Preference OptimizationHighlight5 citations
  256. Calibrated Multi-Preference Optimization for Aligning Diffusion ModelsPoster5 citations
  257. ChatGarment: Garment Estimation, Generation and Editing via Large Language ModelsPoster5 citations
  258. Curriculum Direct Preference Optimization for Diffusion and Consistency ModelsPoster5 citations
  259. DEFOM-Stereo: Depth Foundation Model Based Stereo MatchingPoster5 citations
  260. DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language AlignmentPoster5 citations
  261. DRiVE: Diffusion-based Rigging Empowers Generation of Versatile and Expressive CharactersPoster5 citations
  262. DreamText: High Fidelity Scene Text SynthesisPoster5 citations
  263. Dual-Interrelated Diffusion Model for Few-Shot Anomaly Image GenerationPoster5 citations
  264. DynamicScaler: Seamless and Scalable Video Generation for Panoramic ScenesPoster5 citations
  265. EditAR: Unified Conditional Generation with Autoregressive ModelsPoster5 citations
  266. EgoLife: Towards Egocentric Life AssistantPoster5 citations
  267. Estimating Body and Hand Motion in an Ego-sensed WorldHighlight5 citations
  268. FineVQ: Fine-Grained User Generated Content Video Quality AssessmentHighlight5 citations
  269. Fish-Vista: A Multi-Purpose Dataset for Understanding & Identification of Traits from ImagesPoster5 citations
  270. Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth FusionPoster5 citations
  271. Forensics Adapter: Adapting CLIP for Generalizable Face Forgery DetectionPoster5 citations
  272. FoundationStereo: Zero-Shot Stereo MatchingAward Candidate5 citations
  273. HVI: A New Color Space for Low-light Image EnhancementPoster5 citations
  274. Human Motion Instruction TuningPoster5 citations
  275. LeviTor: 3D Trajectory Oriented Image-to-Video SynthesisHighlight5 citations
  276. MAP: Unleashing Hybrid Mamba-Transformer Vision Backbone's Potential with Masked Autoregressive PretrainingPoster5 citations
  277. MaIR: A Locality- and Continuity-Preserving Mamba for Image RestorationPoster5 citations
  278. MagicQuill: An Intelligent Interactive Image Editing SystemPoster5 citations
  279. MaskGWM: A Generalizable Driving World Model with Video Mask ReconstructionPoster5 citations
  280. MobileMamba: Lightweight Multi-Receptive Visual Mamba NetworkPoster5 citations
  281. Nullu: Mitigating Object Hallucinations in Large Vision-Language Models via HalluSpace ProjectionPoster5 citations
  282. OSDFace: One-Step Diffusion Model for Face RestorationPoster5 citations
  283. OccMamba: Semantic Occupancy Prediction with State Space ModelsPoster5 citations
  284. One Diffusion to Generate Them AllPoster5 citations
  285. PLeaS - Merging Models with Permutations and Least SquaresPoster5 citations
  286. PartGen: Part-level 3D Generation and Reconstruction with Multi-view Diffusion ModelsHighlight5 citations
  287. Pose Priors from Language ModelsPoster5 citations
  288. QMambaBSR: Burst Image Super-Resolution with Query State Space ModelPoster5 citations
  289. Reasoning to Attend: Try to Understand How <SEG> Token WorksPoster5 citations
  290. Reference-Based 3D-Aware Image Editing with TriplanesHighlight5 citations
  291. Revisiting MAE Pre-training for 3D Medical Image SegmentationHighlight5 citations
  292. SAR3D: Autoregressive 3D Object Generation and Understanding via Multi-scale 3D VQVAEPoster5 citations
  293. SPAR3D: Stable Point-Aware Reconstruction of 3D Objects from Single ImagesPoster5 citations
  294. STEREO: A Two-Stage Framework for Adversarially Robust Concept Erasing from Text-to-Image Diffusion ModelsHighlight5 citations
  295. SketchAgent: Language-Driven Sequential Sketch GenerationPoster5 citations
  296. SlideChat: A Large Vision-Language Assistant for Whole-Slide Pathology Image UnderstandingPoster5 citations
  297. Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against JailbreaksPoster5 citations
  298. TinyFusion: Diffusion Transformers Learned ShallowHighlight5 citations
  299. Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and MethodPoster5 citations
  300. Towards More General Video-based Deepfake Detection through Facial Component Guided Adaptation for Foundation ModelPoster5 citations
  301. Unseen Visual Anomaly GenerationPoster5 citations
  302. Unveiling the Mist over 3D Vision-Language Understanding: Object-centric Evaluation with Chain-of-AnalysisPoster5 citations
  303. VILA-M3: Enhancing Vision-Language Models with Medical Expert KnowledgeHighlight5 citations
  304. 3DGUT: Enabling Distorted Cameras and Secondary Rays in Gaussian SplattingPoster4 citations
  305. A Bias-Free Training Paradigm for More General AI-generated Image DetectionPoster4 citations
  306. ARKit LabelMaker: A New Scale for Indoor 3D Scene UnderstandingPoster4 citations
  307. ART: Anonymous Region Transformer for Variable Multi-Layer Transparent Image GenerationPoster4 citations
  308. Accelerating Multimodal Large Language Models by Searching Optimal Vision Token ReductionPoster4 citations
  309. Advancing Myopia To Holism: Fully Contrastive Language-Image Pre-trainingPoster4 citations
  310. CPath-Omni: A Unified Multimodal Foundation Model for Patch and Whole Slide Image Analysis in Computational PathologyPoster4 citations
  311. Chat-based Person Retrieval via Dialogue-Refined Cross-Modal AlignmentPoster4 citations
  312. CompGS: Unleashing 2D Compositionality for Compositional Text-to-3D via Dynamically Optimizing 3D GaussiansPoster4 citations
  313. Cross-modal Information Flow in Multimodal Large Language ModelsPoster4 citations
  314. DI-PCG: Diffusion-based Efficient Inverse Procedural Content Generation for High-quality 3D Asset CreationPoster4 citations
  315. DeSiRe-GS: 4D Street Gaussians for Static-Dynamic Decomposition and Surface Reconstruction for Urban Driving ScenesPoster4 citations
  316. Decompositional Neural Scene Reconstruction with Generative Diffusion PriorPoster4 citations
  317. Devils in Middle Layers of Large Vision-Language Models: Interpreting, Detecting and Mitigating Object Hallucinations via Attention LensPoster4 citations
  318. DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga GenerationPoster4 citations
  319. Distilling Multi-modal Large Language Models for Autonomous DrivingPoster4 citations
  320. DivPrune: Diversity-based Visual Token Pruning for Large Multimodal ModelsPoster4 citations
  321. DrivingSphere: Building a High-fidelity 4D World for Closed-loop SimulationPoster4 citations
  322. ECVC: Exploiting Non-Local Correlations in Multiple Frames for Contextual Video CompressionPoster4 citations
  323. EfficientViM: Efficient Vision Mamba with Hidden State Mixer based State Space DualityPoster4 citations
  324. EgoLM: Multi-Modal Language Model of Egocentric MotionsPoster4 citations
  325. EnvGS: Modeling View-Dependent Appearance with Environment GaussianPoster4 citations
  326. Exploring Intrinsic Normal Prototypes within a Single Image for Universal Anomaly DetectionPoster4 citations
  327. F^3OCUS - Federated Finetuning of Vision-Language Foundation Models with Optimal Client Layer Updating Strategy via Multi-objective Meta-HeuristicsHighlight4 citations
  328. FaithDiff: Unleashing Diffusion Priors for Faithful Image Super-resolutionPoster4 citations
  329. Few-Shot Recognition via Stage-Wise Retrieval-Augmented FinetuningPoster4 citations
  330. From Alexnet to Transformers: Measuring the Non-linearity of Deep Neural Networks with Affine Optimal TransportPoster4 citations
  331. GAF: Gaussian Avatar Reconstruction from Monocular Videos via Multi-view DiffusionPoster4 citations
  332. Gaussian Eigen Models for Human HeadsPoster4 citations
  333. GaussianUDF: Inferring Unsigned Distance Functions through 3D Gaussian SplattingHighlight4 citations
  334. Generative Inbetweening through Frame-wise Conditions-Driven Video GenerationPoster4 citations
  335. HaWoR: World-Space Hand Motion Reconstruction from Egocentric VideosHighlight4 citations
  336. How to Merge Your Multimodal Models Over Time?Poster4 citations
  337. Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language ModelsPoster4 citations
  338. IDEA: Inverted Text with Cooperative Deformable Aggregation for Multi-modal Object Re-IdentificationPoster4 citations
  339. INFP: Audio-Driven Interactive Head Generation in Dyadic ConversationsPoster4 citations
  340. IRIS: Inverse Rendering of Indoor Scenes from Low Dynamic Range ImagesPoster4 citations
  341. Instant Adversarial Purification with Adversarial Consistency DistillationPoster4 citations
  342. Interactive Medical Image Segmentation: A Benchmark Dataset and BaselinePoster4 citations
  343. Interpreting Object-level Foundation Models via Visual Precision SearchHighlight4 citations
  344. K-LoRA: Unlocking Training-Free Fusion of Any Subject and Style LoRAsPoster4 citations
  345. K-Sort Arena: Efficient and Reliable Benchmarking for Generative Models via K-wise Human PreferencesPoster4 citations
  346. LiMoE: Mixture of LiDAR Representation Learners from Automotive ScenesPoster4 citations
  347. Lifting Motion to the 3D World via 2D DiffusionHighlight4 citations
  348. LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational ComplexityPoster4 citations
  349. MAGiC-SLAM: Multi-Agent Gaussian Globally Consistent SLAMPoster4 citations
  350. MINIMA: Modality Invariant Image MatchingPoster4 citations
  351. MOVIS: Enhancing Multi-Object Novel View Synthesis for Indoor ScenesPoster4 citations
  352. MVPortrait: Text-Guided Motion and Emotion Control for Multi-view Vivid Portrait AnimationPoster4 citations
  353. Material Anything: Generating Materials for Any 3D Object via DiffusionHighlight4 citations
  354. Matrix3D: Large Photogrammetry Model All-in-OneHighlight4 citations
  355. Mimir: Improving Video Diffusion Models for Precise Text UnderstandingPoster4 citations
  356. Mitigating Hallucinations in Large Vision-Language Models via DPO: On-Policy Data Hold the KeyPoster4 citations
  357. MonoInstance: Enhancing Monocular Priors via Multi-view Instance Alignment for Neural Rendering and ReconstructionPoster4 citations
  358. MonoTAKD: Teaching Assistant Knowledge Distillation for Monocular 3D Object DetectionPoster4 citations
  359. MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video GenerationPoster4 citations
  360. Omni-Scene: Omni-Gaussian Representation for Ego-Centric Sparse-View Scene ReconstructionPoster4 citations
  361. OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive AnnotationsPoster4 citations
  362. OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual ReasoningPoster4 citations
  363. OmniGuard: Hybrid Manipulation Localization via Augmented Versatile Deep Image WatermarkingPoster4 citations
  364. Open-Vocabulary Functional 3D Scene Graphs for Real-World Indoor SpacesHighlight4 citations
  365. Open-World Amodal Appearance CompletionPoster4 citations
  366. Order-One Rolling Shutter CamerasHighlight4 citations
  367. POSTA: A Go-to Framework for Customized Artistic Poster GenerationPoster4 citations
  368. Pathways on the Image Manifold: Image Editing via Video GenerationPoster4 citations
  369. PhysAnimator: Physics-Guided Generative Cartoon AnimationPoster4 citations
  370. RSAR: Restricted State Angle Resolver and Rotated SAR BenchmarkPoster4 citations
  371. Repurposing Pre-trained Video Diffusion Models for Event-based Video InterpolationPoster4 citations
  372. RoboTwin: Dual-Arm Robot Benchmark with Generative Digital TwinsHighlight4 citations
  373. STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-TrainingPoster4 citations
  374. Scaling Properties of Diffusion Models For Perceptual TasksPoster4 citations
  375. Schedule On the Fly: Diffusion Time Prediction for Faster and Better Image GenerationPoster4 citations
  376. SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual GroundingPoster4 citations
  377. Sim-to-Real Causal Transfer: A Metric Learning Approach to Causally-Aware Interaction RepresentationsPoster4 citations
  378. SnapGen: Taming High-Resolution Text-to-Image Models for Mobile Devices with Efficient Architectures and TrainingHighlight4 citations
  379. SpectroMotion: Dynamic 3D Reconstruction of Specular ScenesPoster4 citations
  380. Splatter-360: Generalizable 360 Gaussian Splatting for Wide-baseline Panoramic ImagesPoster4 citations
  381. The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human MotionPoster4 citations
  382. Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language ModelsHighlight4 citations
  383. UniGraspTransformer: Simplified Policy Distillation for Scalable Dexterous Robotic GraspingPoster4 citations
  384. Universal Actions for Enhanced Embodied Foundation ModelsPoster4 citations
  385. Unveiling Visual Perception in Language Models: An Attention Head Analysis ApproachPoster4 citations
  386. VISTA: Enhancing Long-Duration and High-Resolution Video Understanding by Video Spatiotemporal AugmentationPoster4 citations
  387. VTON-HandFit: Virtual Try-on for Arbitrary Hand Pose Guided by Hand Priors EmbeddingPoster4 citations
  388. ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded SegmentationPoster4 citations
  389. Vid2Sim: Realistic and Interactive Simulation from Video for Urban NavigationPoster4 citations
  390. VideoGLaMM : A Large Multimodal Model for Pixel-Level Visual Grounding in VideosPoster4 citations
  391. VisionArena: 230k Real World User-VLM Conversations with Preference LabelsPoster4 citations
  392. What's in the Image? A Deep-Dive into the Vision of Vision Language ModelsPoster4 citations
  393. X-Dyna: Expressive Dynamic Human Image AnimationHighlight4 citations
  394. 3D Convex Splatting: Radiance Field Rendering with 3D Smooth ConvexesHighlight3 citations
  395. ACE: Anti-Editing Concept Erasure in Text-to-Image ModelsPoster3 citations
  396. AR-Diffusion: Asynchronous Video Generation with Auto-Regressive DiffusionPoster3 citations
  397. Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference OptimizationPoster3 citations
  398. Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question AnsweringPoster3 citations
  399. Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model EvaluationPoster3 citations
  400. BadToken: Token-level Backdoor Attacks to Multi-modal Large Language ModelsPoster3 citations
  401. Black-Box Forgery Attacks on Semantic Watermarks for Diffusion ModelsPoster3 citations
  402. BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video RepresentationsPoster3 citations
  403. CAD-Llama: Leveraging Large Language Models for Computer-Aided Design Parametric 3D Model GenerationPoster3 citations
  404. CADCrafter: Generating Computer-Aided Design Models from Unconstrained ImagesPoster3 citations
  405. COAP: Memory-Efficient Training with Correlation-Aware Gradient ProjectionPoster3 citations
  406. CleanDIFT: Diffusion Features without NoisePoster3 citations
  407. ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI SystemsPoster3 citations
  408. Community Forensics: Using Thousands of Generators to Train Fake Image DetectorsPoster3 citations
  409. Completion as Enhancement: A Degradation-Aware Selective Image Guided Network for Depth CompletionPoster3 citations
  410. Complexity Experts are Task-Discriminative Learners for Any Image RestorationPoster3 citations
  411. Cross-modal Causal Relation Alignment for Video Question GroundingHighlight3 citations
  412. DELT: A Simple Diversity-driven EarlyLate Training for Dataset DistillationPoster3 citations
  413. DepthCues: Evaluating Monocular Depth Perception in Large Vision ModelsPoster3 citations
  414. Design2GarmentCode: Turning Design Concepts to Tangible Garments Through Program SynthesisPoster3 citations
  415. DexGrasp Anything: Towards Universal Robotic Dexterous Grasping with Physics AwarenessHighlight3 citations
  416. Diffusion Renderer: Neural Inverse and Forward Rendering with Video Diffusion ModelsPoster3 citations
  417. Diffusion-4K: Ultra-High-Resolution Image Synthesis with Latent Diffusion ModelsPoster3 citations
  418. Digital Twin Catalog: A Large-Scale Photorealistic 3D Object Digital Twin DatasetHighlight3 citations
  419. Distilling Long-tailed DatasetsPoster3 citations
  420. Don't Shake the Wheel: Momentum-Aware Planning in End-to-End Autonomous DrivingPoster3 citations
  421. EDEN: Enhanced Diffusion for High-quality Large-motion Video Frame InterpolationPoster3 citations
  422. EMOE: Modality-Specific Enhanced Dynamic Emotion ExpertsPoster3 citations
  423. Efficient Long Video Tokenization via Coordinate-based Patch ReconstructionPoster3 citations
  424. EgoPressure: A Dataset for Hand Pressure and Pose Estimation in Egocentric VisionHighlight3 citations
  425. EmoEdit: Evoking Emotions through Image ManipulationPoster3 citations
  426. EnergyMoGen: Compositional Human Motion Generation with Energy-Based Diffusion Model in Latent SpaceHighlight3 citations
  427. Enhanced Contrastive Learning with Multi-view Longitudinal Data for Chest X-ray Report GenerationPoster3 citations
  428. EventGPT: Event Stream Understanding with Multimodal Large Language ModelsPoster3 citations
  429. EventSplat: 3D Gaussian Splatting from Moving Event Cameras for Real-time RenderingPoster3 citations
  430. Everything to the Synthetic: Diffusion-driven Test-time Adaptation via Synthetic-Domain AlignmentPoster3 citations
  431. Exact: Exploring Space-Time Perceptive Clues for Weakly Supervised Satellite Image Time Series Semantic SegmentationHighlight3 citations
  432. ExpertAF: Expert Actionable Feedback from VideoPoster3 citations
  433. FIRE: Robust Detection of Diffusion-Generated Images via Frequency-Guided Reconstruction ErrorPoster3 citations
  434. FOCUS: Knowledge-enhanced Adaptive Visual Compression for Few-shot Whole Slide Image ClassificationPoster3 citations
  435. FedMIA: An Effective Membership Inference Attack Exploiting "All for One" Principle in Federated LearningPoster3 citations
  436. Fine-Grained Erasure in Text-to-Image Diffusion-based Foundation ModelsPoster3 citations
  437. FlipSketch: Flipping Static Drawings to Text-Guided Sketch AnimationsPoster3 citations
  438. Floating No More: Object-Ground Reconstruction from a Single ImagePoster3 citations
  439. From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-SpeechHighlight3 citations
  440. From Multimodal LLMs to Generalist Embodied Agents: Methods and LessonsPoster3 citations
  441. From Poses to Identity: Training-Free Person Re-Identification via Feature CentralizationPoster3 citations
  442. GEAL: Generalizable 3D Affordance Learning with Cross-Modal ConsistencyPoster3 citations
  443. Gaze-LLE: Gaze Target Estimation via Large-Scale Learned EncodersHighlight3 citations
  444. Gazing Into Missteps: Leveraging Eye-Gaze for Unsupervised Mistake Detection in Egocentric Videos of Skilled Human ActivitiesPoster3 citations
  445. Generative Omnimatte: Learning to Decompose Video into LayersHighlight3 citations
  446. Generative Photography: Scene-Consistent Camera Control for Realistic Text-to-Image SynthesisHighlight3 citations
  447. GigaHands: A Massive Annotated Dataset of Bimanual Hand ActivitiesHighlight3 citations
  448. HD-EPIC: A Highly-Detailed Egocentric Video DatasetPoster3 citations
  449. HIIF: Hierarchical Encoding based Implicit Image Function for Continuous Super-resolutionPoster3 citations
  450. HumanRig: Learning Automatic Rigging for Humanoid Character in a Large Scale DatasetHighlight3 citations
  451. IDProtector: An Adversarial Noise Encoder to Protect Against ID-Preserving Image GenerationPoster3 citations
  452. Identifying and Mitigating Position Bias of Multi-image Vision-Language ModelsPoster3 citations
  453. Imagine and Seek: Improving Composed Image Retrieval with an Imagined ProxyPoster3 citations
  454. Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time AlignmentPoster3 citations
  455. Improved Video VAE for Latent Video Diffusion ModelPoster3 citations
  456. IncEventGS: Pose-Free Gaussian Splatting from a Single Event CameraHighlight3 citations
  457. Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction TuningHighlight3 citations
  458. InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured CaptionPoster3 citations
  459. InstanceGaussian: Appearance-Semantic Joint Gaussian Representation for 3D Instance-Level PerceptionPoster3 citations
  460. Instruction-based Image Manipulation by Watching How Things MoveHighlight3 citations
  461. LION-FS: Fast & Slow Video-Language Thinker as Online Video AssistantPoster3 citations
  462. Learning Bijective Surface Parameterization for Inferring Signed Distance Functions from Sparse Point Clouds with Grid DeformationPoster3 citations
  463. LiVOS: Light Video Object Segmentation with Gated Linear MatchingPoster3 citations
  464. Linguistics-aware Masked Image Modeling for Self-supervised Scene Text RecognitionPoster3 citations
  465. Lost in Translation, Found in Context: Sign Language Translation with Contextual CuesPoster3 citations
  466. LumiNet: Latent Intrinsics Meets Diffusion Models for Indoor Scene RelightingPoster3 citations
  467. M-LLM Based Video Frame Selection for Efficient Video UnderstandingPoster3 citations
  468. MLVU: Benchmarking Multi-task Long Video UnderstandingPoster3 citations
  469. MM-OR: A Large Multimodal Operating Room Dataset for Semantic Understanding of High-Intensity Surgical EnvironmentsPoster3 citations
  470. MVSAnywhere: Zero-Shot Multi-View StereoPoster3 citations
  471. Make-It-Animatable: An Efficient Framework for Authoring Animation-Ready 3D CharactersHighlight3 citations
  472. MangaNinja: Line Art Colorization with Precise Reference FollowingHighlight3 citations
  473. ManipTrans: Efficient Dexterous Bimanual Manipulation Transfer via Residual LearningPoster3 citations
  474. MaskGaussian: Adaptive 3D Gaussian Representation from Probabilistic MasksPoster3 citations
  475. MicroVQA: A Multimodal Reasoning Benchmark for Microscopy-Based Scientific ResearchPoster3 citations
  476. Model Poisoning Attacks to Federated Learning via Multi-Round ConsistencyPoster3 citations
  477. MonoDGP: Monocular 3D Object Detection with Decoupled-Query and Geometry-Error PriorsPoster3 citations
  478. Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel LevelPoster3 citations
  479. Movie Weaver: Tuning-Free Multi-Concept Video Personalization with Anchored PromptsPoster3 citations
  480. Multi-Sensor Object Anomaly Detection: Unifying Appearance, Geometry, and Internal PropertiesPoster3 citations
  481. MultiGO: Towards Multi-level Geometry Learning for Monocular 3D Textured Human ReconstructionPoster3 citations
  482. NeRFPrior: Learning Neural Radiance Field as a Prior for Indoor Scene ReconstructionHighlight3 citations
  483. OSMamba: Omnidirectional Spectral Mamba with Dual-Domain Prior Generator for Exposure CorrectionPoster3 citations
  484. Octopus: Alleviating Hallucination via Dynamic Contrastive DecodingHighlight3 citations
  485. Omni-ID: Holistic Identity Representation Designed for Generative TasksPoster3 citations
  486. Parameter-efficient Fine-tuning in Hyperspherical Space for Open-vocabulary Semantic SegmentationPoster3 citations
  487. Patient-Level Anatomy Meets Scanning-Level Physics: Personalized Federated Low-Dose CT Denoising Empowered by Large Language ModelPoster3 citations
  488. PhysGen3D: Crafting a Miniature Interactive World from a Single ImagePoster3 citations
  489. PrEditor3D: Fast and Precise 3D Shape EditingPoster3 citations
  490. Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene GenerationPoster3 citations
  491. RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation ModelsPoster3 citations
  492. ROS-SAM: High-Quality Interactive Segmentation for Remote Sensing Moving ObjectPoster3 citations
  493. RealEdit: Reddit Edits As a Large-scale Empirical Dataset for Image TransformationsPoster3 citations
  494. Redefining <Creative> in Dictionary: Towards an Enhanced Semantic Understanding of Creative GenerationPoster3 citations
  495. Ref-GS: Directional Factorization for 2D Gaussian SplattingPoster3 citations
  496. Rethinking Training for De-biasing Text-to-Image Generation: Unlocking the Potential of Stable DiffusionPoster3 citations
  497. Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face DetectorPoster3 citations
  498. RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied NavigationPoster3 citations
  499. SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video AnalysisPoster3 citations
  500. SAMWISE: Infusing Wisdom in SAM2 for Text-Driven Video SegmentationHighlight3 citations
  501. SLAM3R: Real-Time Dense Scene Reconstruction from Monocular RGB VideosHighlight3 citations
  502. Scenario Dreamer: Vectorized Latent Diffusion for Generating Driving Simulation EnvironmentsPoster3 citations
  503. Scene Map-based Prompt Tuning for Navigation Instruction GenerationPoster3 citations
  504. SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video RestorationHighlight3 citations
  505. SelfSplat: Pose-Free and 3D Prior-Free Generalizable 3D Gaussian SplattingPoster3 citations
  506. SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language ModelPoster3 citations
  507. Simplification Is All You Need against Out-of-Distribution OverconfidencePoster3 citations
  508. Spatiotemporal Skip Guidance for Enhanced Video Diffusion SamplingPoster3 citations
  509. Spiking Transformer with Spatial-Temporal AttentionPoster3 citations
  510. SpiritSight Agent: Advanced GUI Agent with One LookPoster3 citations
  511. SplineGS: Robust Motion-Adaptive Spline for Real-Time Dynamic 3D Gaussians from Monocular VideoPoster3 citations
  512. Stacking Brick by Brick: Aligned Feature Isolation for Incremental Face Forgery DetectionPoster3 citations
  513. StyleMaster: Stylize Your Video with Artistic Generation and TranslationPoster3 citations
  514. T2ISafety: Benchmark for Assessing Fairness, Toxicity, and Privacy in Image GenerationPoster3 citations
  515. T2SG: Traffic Topology Scene Graph for Topology Reasoning in Autonomous DrivingPoster3 citations
  516. TAPT: Test-Time Adversarial Prompt Tuning for Robust Inference in Vision-Language ModelsPoster3 citations
  517. Taming Teacher Forcing for Masked Autoregressive Video GenerationPoster3 citations
  518. Task-Agnostic Guided Feature Expansion for Class-Incremental LearningPoster3 citations
  519. Textured Gaussians for Enhanced 3D Scene Appearance ModelingPoster3 citations
  520. The Devil is in Temporal Token: High Quality Video Reasoning SegmentationPoster3 citations
  521. TokenHSI: Unified Synthesis of Physical Human-Scene Interactions through Task TokenizationPoster3 citations
  522. TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language ModelPoster3 citations
  523. Towards Precise Scaling Laws for Video Diffusion TransformersPoster3 citations
  524. Towards Transformer-Based Aligned Generation with Self-Coherence GuidancePoster3 citations
  525. Towards a Universal Synthetic Video Detector: From Face or Background Manipulations to Fully AI-Generated ContentPoster3 citations
  526. Tra-MoE: Learning Trajectory Prediction Model from Multiple Domains for Adaptive Policy ConditioningPoster3 citations
  527. Track4Gen: Teaching Video Diffusion Models to Track Points Improves Video GenerationPoster3 citations
  528. UniGoal: Towards Universal Zero-shot Goal-oriented NavigationPoster3 citations
  529. UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly DetectionPoster3 citations
  530. Unleashing In-context Learning of Autoregressive Models for Few-shot Image ManipulationHighlight3 citations
  531. Unveil Inversion and Invariance in Flow Transformer for Versatile Image EditingPoster3 citations
  532. VDocRAG: Retrieval-Augmented Generation over Visually-Rich DocumentsPoster3 citations
  533. VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual ReasoningPoster3 citations
  534. VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video UnderstandingPoster3 citations
  535. VidTwin: Video VAE with Decoupled Structure and DynamicsPoster3 citations
  536. VinTAGe: Joint Video and Text Conditioning for Holistic Audio GenerationPoster3 citations
  537. Visual Agentic AI for Spatial Reasoning with a Dynamic APIPoster3 citations
  538. ZoomLDM: Latent Diffusion Model for Multi-scale Image GenerationPoster3 citations
  539. 3D Occupancy Prediction with Low-Resolution Queries via Prototype-aware View TransformationPoster2 citations
  540. 4D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language ModelsPoster2 citations
  541. 4Real-Video: Learning Generalizable Photo-Realistic 4D Video DiffusionHighlight2 citations
  542. A Distractor-Aware Memory for Visual Object Tracking with SAM2Poster2 citations
  543. AA-CLIP: Enhancing Zero-Shot Anomaly Detection via Anomaly-Aware CLIPPoster2 citations
  544. AFL: A Single-Round Analytic Approach for Federated Learning with Pre-trained ModelsPoster2 citations
  545. AKiRa: Augmentation Kit on Rays for Optical Video GenerationPoster2 citations
  546. ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and GroundingPoster2 citations
  547. ActiveGAMER: Active GAussian Mapping through Efficient RenderingPoster2 citations
  548. Adv-CPG: A Customized Portrait Generation Framework with Facial Adversarial AttacksPoster2 citations
  549. Alias-Free Latent Diffusion Models: Improving Fractional Shift Equivariance of Diffusion Latent SpacePoster2 citations
  550. Arc2Avatar: Generating Expressive 3D Avatars from a Single Image via ID GuidancePoster2 citations
  551. Are Images Indistinguishable to Humans Also Indistinguishable to Classifiers?Poster2 citations
  552. ArtFormer: Controllable Generation of Diverse 3D Articulated ObjectsPoster2 citations
  553. Auto Cherry-Picker: Learning from High-quality Generative Data Driven by LanguagePoster2 citations
  554. BARD-GS: Blur-Aware Reconstruction of Dynamic Scenes via Gaussian SplattingPoster2 citations
  555. BEVDiffuser: Plug-and-Play Diffusion Model for BEV Denoising with Ground-Truth GuidanceHighlight2 citations
  556. BIMBA: Selective-Scan Compression for Long-Range Video Question AnsweringPoster2 citations
  557. BimArt: A Unified Approach for the Synthesis of 3D Bimanual Interaction with Articulated ObjectsPoster2 citations
  558. Birth and Death of a RosePoster2 citations
  559. BizGen: Advancing Article-level Visual Text Rendering for Infographics GenerationPoster2 citations
  560. Blurred LiDAR for Sharper 3D: Robust Handheld 3D Scanning with Diffuse LiDAR and RGBHighlight2 citations
  561. Breaking the Low-Rank Dilemma of Linear AttentionPoster2 citations
  562. Buffer Anytime: Zero-Shot Video Depth and Normal from Image PriorsPoster2 citations
  563. CAP4D: Creating Animatable 4D Portrait Avatars with Morphable Multi-View Diffusion ModelsPoster2 citations
  564. CL-MoE: Enhancing Multimodal Large Language Model with Dual Momentum Mixture-of-Experts for Continual Visual Question AnsweringHighlight2 citations
  565. COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-trainingPoster2 citations
  566. CRISP: Object Pose and Shape Estimation with Test-Time AdaptationHighlight2 citations
  567. CTRL-O: Language-Controllable Object-Centric Visual Representation LearningPoster2 citations
  568. CarPlanner: Consistent Auto-regressive Trajectory Planning for Large-Scale Reinforcement Learning in Autonomous DrivingPoster2 citations
  569. Causal Composition Diffusion Model for Closed-loop Traffic GenerationPoster2 citations
  570. ChainHOI: Joint-based Kinematic Chain Modeling for Human-Object Interaction GenerationPoster2 citations
  571. CholecTrack20: A Multi-Perspective Tracking Dataset for Surgical ToolsPoster2 citations
  572. CityWalker: Learning Embodied Urban Navigation from Web-Scale VideosPoster2 citations
  573. Classifier-Free Guidance Inside the Attraction Basin May Cause MemorizationPoster2 citations
  574. Concept Replacer: Replacing Sensitive Concepts in Diffusion Models via Precision LocalizationPoster2 citations
  575. Condensing Action Segmentation Datasets via Generative Network InversionPoster2 citations
  576. Context-Aware Multimodal PretrainingHighlight2 citations
  577. Context-Enhanced Memory-Refined Transformer for Online Action DetectionPoster2 citations
  578. Cropper: Vision-Language Model for Image Cropping through In-Context LearningPoster2 citations
  579. Cross-View Completion Models are Zero-shot Correspondence EstimatorsHighlight2 citations
  580. Cubify Anything: Scaling Indoor 3D Object DetectionHighlight2 citations
  581. DAGSM: Disentangled Avatar Generation with GS-enhanced MeshPoster2 citations
  582. DSPNet: Dual-vision Scene Perception for Robust 3D Question AnsweringPoster2 citations
  583. D^3: Scaling Up Deepfake Detection by Learning from DiscrepancyPoster2 citations
  584. DarkIR: Robust Low-Light Image RestorationPoster2 citations
  585. DeNVeR: Deformable Neural Vessel Representations for Unsupervised Video Vessel SegmentationPoster2 citations
  586. DeSplat: Decomposed Gaussian Splatting for Distractor-Free RenderingPoster2 citations
  587. Decentralized Diffusion ModelsPoster2 citations
  588. Decoupled Distillation to Erase: A General Unlearning Method for Any Class-centric TasksHighlight2 citations
  589. Detect-and-Guide: Self-regulation of Diffusion Models for Safe Text-to-Image Generation via Guideline Token OptimizationPoster2 citations
  590. Detecting Backdoor Attacks in Federated Learning via Direction Alignment InspectionHighlight2 citations
  591. DiC: Rethinking Conv3x3 Designs in Diffusion ModelsPoster2 citations
  592. Disco4D: Disentangled 4D Human Generation and Animation from a Single ImagePoster2 citations
  593. DistinctAD: Distinctive Audio Description Generation in ContextsHighlight2 citations
  594. Divide and Conquer: Heterogeneous Noise Integration for Diffusion-based Adversarial PurificationPoster2 citations
  595. Dora: Sampling and Benchmarking for 3D Shape Variational Auto-EncodersPoster2 citations
  596. DriveGEN: Generalized and Robust 3D Detection in Driving via Controllable Text-to-Image Diffusion GenerationPoster2 citations
  597. Driving by the Rules: A Benchmark for Integrating Traffic Sign Regulations into Vectorized HD MapHighlight2 citations
  598. DroneSplat: 3D Gaussian Splatting for Robust 3D Reconstruction from In-the-Wild Drone ImageryHighlight2 citations
  599. Dual Consolidation for Pre-Trained Model-Based Domain-Incremental LearningPoster2 citations
  600. Dual-view X-ray Detection: Can AI Detect Prohibited Items from Dual-view X-ray Images like Humans?Poster2 citations
  601. DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual UnderstandingHighlight2 citations
  602. DynFocus: Dynamic Cooperative Network Empowers LLMs with Video UnderstandingPoster2 citations
  603. DynRefer: Delving into Region-level Multimodal Tasks via Dynamic ResolutionPoster2 citations
  604. Dynamic Integration of Task-Specific Adapters for Class Incremental LearningPoster2 citations
  605. EEE-Bench: A Comprehensive Multimodal Electrical And Electronics Engineering BenchmarkPoster2 citations
  606. Efficient Fine-Tuning and Concept Suppression for Pruned Diffusion ModelsPoster2 citations
  607. EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question AnsweringPoster2 citations
  608. Enhancing Creative Generation on Stable Diffusion-based ModelsPoster2 citations
  609. EnvPoser: Environment-aware Realistic Human Motion Estimation from Sparse Observations with Uncertainty ModelingPoster2 citations
  610. Evolving High-Quality Rendering and Reconstruction in a Unified Framework with Contribution-Adaptive RegularizationPoster2 citations
  611. Exploring Simple Open-Vocabulary Semantic SegmentationPoster2 citations
  612. Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You ThinkHighlight2 citations
  613. FATE: Full-head Gaussian Avatar with Textural Editing from Monocular VideoPoster2 citations
  614. FLAIR: VLM with Fine-grained Language-informed Image RepresentationsPoster2 citations
  615. FSFM: A Generalizable Face Security Foundation Model via Self-Supervised Facial Representation LearningPoster2 citations
  616. FedBiP: Heterogeneous One-Shot Federated Learning with Personalized Latent Diffusion ModelsPoster2 citations
  617. FilmComposer: LLM-Driven Music Production for Silent Film ClipsPoster2 citations
  618. FireEdit: Fine-grained Instruction-based Image Editing via Region-aware Vision Language ModelPoster2 citations
  619. FirePlace: Geometric Refinements of LLM Common Sense Reasoning for 3D Object PlacementHighlight2 citations
  620. Flash-Split: 2D Reflection Removal with Flash Cues and Latent Diffusion SeparationPoster2 citations
  621. FlashSloth : Lightning Multimodal Large Language Models via Embedded Visual CompressionPoster2 citations
  622. FluidNexus: 3D Fluid Reconstruction and Prediction from a Single VideoPoster2 citations
  623. Focus-N-Fix: Region-Aware Fine-Tuning for Text-to-Image GenerationHighlight2 citations
  624. From Words to Structured Visuals: A Benchmark and Framework for Text-to-Diagram Generation and EditingHighlight2 citations
  625. GCE-Pose: Global Context Enhancement for Category-level Object Pose EstimationPoster2 citations
  626. GFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with Generative Flow NetworksPoster2 citations
  627. GG-SSMs: Graph-Generating State Space ModelsPoster2 citations
  628. GREAT: Geometry-Intention Collaborative Inference for Open-Vocabulary 3D Object Affordance GroundingPoster2 citations
  629. GROVE: A Generalized Reward for Learning Open-Vocabulary Physical SkillPoster2 citations
  630. GaussianSpa: An "Optimizing-Sparsifying" Simplification Framework for Compact and High-Quality 3D Gaussian SplattingPoster2 citations
  631. GenDeg: Diffusion-based Degradation Synthesis for Generalizable All-In-One Image RestorationPoster2 citations
  632. Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language ModelPoster2 citations
  633. Generalized Recorrupted-to-Recorrupted: Self-Supervised Learning Beyond Gaussian NoisePoster2 citations
  634. GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous DrivingPoster2 citations
  635. HarmonySet: A Comprehensive Dataset for Understanding Video-Music Semantic Alignment and Temporal SynchronizationPoster2 citations
  636. How Do I Do That? Synthesizing 3D Hand Motion and Contacts for Everyday InteractionsHighlight2 citations
  637. HumanDreamer: Generating Controllable Human-Motion Videos via Decoupled GenerationPoster2 citations
  638. HybridGS: Decoupling Transients and Statics with 2D and 3D Gaussian SplattingPoster2 citations
  639. HyperGS: Hyperspectral 3D Gaussian SplattingPoster2 citations
  640. IDEA-Bench: How Far are Generative Models from Professional Designing?Poster2 citations
  641. Improving Autoregressive Visual Generation with Cluster-Oriented Token PredictionPoster2 citations
  642. InsightEdit: Towards Better Instruction Following for Image EditingPoster2 citations
  643. Instant3dit: Multiview Inpainting for Fast Editing of 3D ObjectsPoster2 citations
  644. InterAct: Advancing Large-Scale Versatile 3D Human-Object Interaction GenerationPoster2 citations
  645. InterDyn: Controllable Interactive Dynamics with Video Diffusion ModelsPoster2 citations
  646. Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video GenerationPoster2 citations
  647. It's a (Blind) Match! Towards Vision-Language Correspondence without Parallel DataPoster2 citations
  648. IterIS: Iterative Inference-Solving Alignment for LoRA MergingPoster2 citations
  649. JarvisIR: Elevating Autonomous Driving Perception with Intelligent Image RestorationPoster2 citations
  650. KeyFace: Expressive Audio-Driven Facial Animation for Long Sequences via KeyFrame InterpolationPoster2 citations
  651. Kiss3DGen: Repurposing Image Diffusion Models for 3D Asset GenerationPoster2 citations
  652. Knowledge Memorization and Rumination for Pre-trained Model-based Class-Incremental LearningPoster2 citations
  653. LITA-GS: Illumination-Agnostic Novel View Synthesis via Reference-Free 3D Gaussian Splatting and Physical PriorsPoster2 citations
  654. LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual PreferencesPoster2 citations
  655. Learning Extremely High Density Crowds as Active MattersPoster2 citations
  656. Learning Flow Fields in Attention for Controllable Person Image GenerationPoster2 citations
  657. Localized Concept Erasure for Text-to-Image Diffusion Models Using Training-Free Gated Low-Rank AdaptationPoster2 citations
  658. Localizing Events in Videos with Multimodal QueriesPoster2 citations
  659. MASH-VLM: Mitigating Action-Scene Hallucination in Video-LLMs through Disentangled Spatial-Temporal RepresentationsHighlight2 citations
  660. MLLM-as-a-Judge for Image Safety without Human LabelingHighlight2 citations
  661. MODfinity: Unsupervised Domain Adaptation with Multimodal Information Flow IntertwiningPoster2 citations
  662. Masked Point-Entity Contrast for Open-Vocabulary 3D Scene UnderstandingPoster2 citations
  663. MatAnyone: Stable Video Matting with Consistent Memory PropagationPoster2 citations
  664. Memories of Forgotten ConceptsHighlight2 citations
  665. MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and QuantizationPoster2 citations
  666. MetaShadow: Object-Centered Shadow Detection, Removal, and SynthesisPoster2 citations
  667. Missing Target-Relevant Information Prediction with World Model for Accurate Zero-Shot Composed Image RetrievalPoster2 citations
  668. MoDec-GS: Global-to-Local Motion Decomposition and Temporal Interval Adjustment for Compact Dynamic 3D Gaussian SplattingPoster2 citations
  669. MoManipVLA: Transferring Vision-language-action Models for General Mobile ManipulationPoster2 citations
  670. MovieBench: A Hierarchical Movie Level Dataset for Long Video GenerationPoster2 citations
  671. Mr. DETR: Instructive Multi-Route Training for Detection TransformersPoster2 citations
  672. Multi-party Collaborative Attention Control for Image CustomizationPoster2 citations
  673. Neuro-3D: Towards 3D Visual Decoding from EEG SignalsPoster2 citations
  674. Neuro-Symbolic Evaluation of Text-to-Video Models using Formal VerificationPoster2 citations
  675. Neuron: Learning Context-Aware Evolving Representations for Zero-Shot Skeleton Action RecognitionPoster2 citations
  676. NitroFusion: High-Fidelity Single-Step Diffusion through Dynamic Adversarial TrainingPoster2 citations
  677. Object-Shot Enhanced Grounding Network for Egocentric VideoPoster2 citations
  678. Omni-RGPT: Unifying Image and Video Region-level Understanding via Token MarksPoster2 citations
  679. On the Consistency of Video Large Language Models in Temporal ComprehensionPoster2 citations
  680. One-for-More: Continual Diffusion Model for Anomaly DetectionPoster2 citations
  681. OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video GenerationHighlight2 citations
  682. Order-Robust Class Incremental Learning: Graph-Driven Dynamic Similarity GroupingPoster2 citations
  683. POPEN: Preference-Based Optimization and Ensemble for LVLM-Based Reasoning SegmentationPoster2 citations
  684. PSBD: Prediction Shift Uncertainty Unlocks Backdoor DetectionPoster2 citations
  685. PanSplat: 4K Panorama Synthesis with Feed-Forward Gaussian SplattingPoster2 citations
  686. PassionSR: Post-Training Quantization with Adaptive Scale in One-Step Diffusion based Image Super-ResolutionPoster2 citations
  687. PatchDPO: Patch-level DPO for Finetuning-free Personalized Image GenerationPoster2 citations
  688. PerLA: Perceptive 3D Language AssistantPoster2 citations
  689. PhD: A ChatGPT-Prompted Visual Hallucination Evaluation DatasetHighlight2 citations
  690. PhysVLM: Enabling Visual Language Models to Understand Robotic Physical ReachabilityPoster2 citations
  691. Physical Plausibility-aware Trajectory Prediction via Locomotion EmbodimentPoster2 citations
  692. PillarHist: A Quantization-aware Pillar Feature Encoder based on Height-aware HistogramPoster2 citations
  693. Playing the Fool: Jailbreaking LLMs and Multimodal LLMs with Out-of-Distribution StrategyPoster2 citations
  694. Positive2Negative: Breaking the Information-Lossy Barrier in Self-Supervised Single Image DenoisingPoster2 citations
  695. Post-pre-training for Modality Alignment in Vision-Language Foundation ModelsPoster2 citations
  696. PosterMaker: Towards High-Quality Product Poster Generation with Accurate Text RenderingPoster2 citations
  697. Pow3R: Empowering Unconstrained 3D Reconstruction with Camera and Scene PriorsPoster2 citations
  698. Precise, Fast, and Low-cost Concept Erasure in Value Space: Orthogonal Complement MattersPoster2 citations
  699. ProKeR: A Kernel Perspective on Few-Shot Adaptation of Large Vision-Language ModelsPoster2 citations
  700. ProbPose: A Probabilistic Approach to 2D Human Pose EstimationPoster2 citations
  701. Prosody-Enhanced Acoustic Pre-training and Acoustic-Disentangled Prosody Adapting for Movie DubbingPoster2 citations
  702. Prototype-Based Image Prompting for Weakly Supervised Histopathological Image SegmentationPoster2 citations
  703. Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision ContentPoster2 citations
  704. RELOCATE: A Simple Training-Free Baseline for Visual Query Localization Using Region-Based RepresentationsPoster2 citations
  705. RENO: Real-Time Neural Compression for 3D LiDAR Point CloudsPoster2 citations
  706. ROICtrl: Boosting Instance Control for Visual GenerationPoster2 citations
  707. RandAR: Decoder-only Autoregressive Visual Generation in Random OrdersPoster2 citations
  708. Real-time Free-view Human Rendering from Sparse-view RGB Videos using Double Unprojected TexturesHighlight2 citations
  709. Rectified Diffusion Guidance for Conditional GenerationPoster2 citations
  710. Relative Pose Estimation through Affine Corrections of Monocular Depth PriorsHighlight2 citations
  711. Removing Reflections from RAW PhotosPoster2 citations
  712. Robotic Visual InstructionPoster2 citations
  713. RoomPainter: View-Integrated Diffusion for Consistent Indoor Scene TexturingPoster2 citations
  714. SALAD: Skeleton-aware Latent Diffusion for Text-driven Motion Generation and EditingPoster2 citations
  715. SGSST: Scaling Gaussian Splatting Style TransferPoster2 citations
  716. SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous CharactersPoster2 citations
  717. STCOcc: Sparse Spatial-Temporal Cascade Renovation for 3D Occupancy and Scene Flow PredictionPoster2 citations
  718. SapiensID: Foundation for Human RecognitionPoster2 citations
  719. Satellite to GroundScape - Large-scale Consistent Ground View Generation from Satellite ViewsPoster2 citations
  720. ScribbleLight: Single Image Indoor Relighting with ScribblesPoster2 citations
  721. Segmenting Maxillofacial Structures in CBCT VolumesPoster2 citations
  722. SharpDepth: Sharpening Metric Depth Predictions Using Diffusion DistillationPoster2 citations
  723. SleeperMark: Towards Robust Watermark against Fine-Tuning Text-to-image Diffusion ModelsPoster2 citations
  724. SmartEraser: Remove Anything from Images using Masked-Region GuidancePoster2 citations
  725. SnapGen-V: Generating a Five-Second Video within Five Seconds on a Mobile DevicePoster2 citations
  726. Sonata: Self-Supervised Learning of Reliable Point RepresentationsHighlight2 citations
  727. Spatial-Temporal Graph Diffusion Policy with Kinematic Modeling for Bimanual Robotic ManipulationPoster2 citations
  728. Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Mutimodal ModelsHighlight2 citations
  729. Speedy-Splat: Fast 3D Gaussian Splatting with Sparse Pixels and Sparse PrimitivesPoster2 citations
  730. SplatFlow: Multi-View Rectified Flow Model for 3D Gaussian Splatting SynthesisPoster2 citations
  731. Stereo Anywhere: Robust Zero-Shot Deep Stereo Matching Even Where Either Stereo or Mono FailPoster2 citations
  732. Sufficient Invariant Learning for Distribution ShiftPoster2 citations
  733. SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference OptimizationPoster2 citations
  734. TASTE-Rob: Advancing Video Generation of Task-Oriented Hand-Object Interaction for Generalizable Robotic ManipulationPoster2 citations
  735. Task-driven Image Fusion with Learnable Fusion LossHighlight2 citations
  736. Taxonomy-Aware Evaluation of Vision-Language ModelsPoster2 citations
  737. Temporal Separation with Entropy Regularization for Knowledge Distillation in Spiking Neural NetworksPoster2 citations
  738. Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention MapsPoster2 citations
  739. The Power of Context: How Multimodality Improves Image Super-ResolutionPoster2 citations
  740. TopoCellGen: Generating Histopathology Cell Topology with a Diffusion ModelPoster2 citations
  741. Towards Better Alignment: Training Diffusion Models with Reinforcement Learning Against Sparse RewardsPoster2 citations
  742. Towards Practical Real-Time Neural Video CompressionPoster2 citations
  743. Towards RAW Object Detection in Diverse ConditionsHighlight2 citations
  744. Towards Stable and Storage-efficient Dataset Distillation: Matching Convexified TrajectoryPoster2 citations
  745. Towards Understanding How Knowledge Evolves in Large Vision-Language ModelsPoster2 citations
  746. TraF-Align: Trajectory-aware Feature Alignment for Asynchronous Multi-agent PerceptionPoster2 citations
  747. UNOPose: Unseen Object Pose Estimation with an Unposed RGB-D Reference ImagePoster2 citations
  748. UVGS: Reimagining Unstructured 3D Gaussian Splatting using UV MappingPoster2 citations
  749. UnCommon Objects in 3DPoster2 citations
  750. Uncertain Multimodal Intention and Emotion Understanding in the WildPoster2 citations
  751. UniAP: Unifying Inter- and Intra-Layer Automatic Parallelism by Mixed Integer Quadratic ProgrammingAward Candidate2 citations
  752. UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and EditingHighlight2 citations
  753. VISTA3D: A Unified Segmentation Foundation Model For 3D Medical ImagingPoster2 citations
  754. Video Motion Transfer with Diffusion TransformersPoster2 citations
  755. VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous DrivingPoster2 citations
  756. WeGen: A Unified Model for Interactive Multimodal Generation as We ChatPoster2 citations
  757. WildAvatar: Learning In-the-wild 3D Avatars from the WebPoster2 citations
  758. WildGS-SLAM: Monocular Gaussian Splatting SLAM in Dynamic EnvironmentsPoster2 citations
  759. XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?Highlight2 citations
  760. Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual GroundingHighlight2 citations
  761. Your ViT is Secretly an Image Segmentation ModelHighlight2 citations
  762. h-Edit: Effective and Flexible Diffusion-Based Editing via Doob's h-TransformPoster2 citations
  763. 3D-GSW: 3D Gaussian Splatting for Robust WatermarkingPoster1 citations
  764. 3D-HGS: 3D Half-Gaussian SplattingPoster1 citations
  765. 3D-Mem: 3D Scene Memory for Embodied Exploration and ReasoningPoster1 citations
  766. A Data-Centric Revisit of Pre-Trained Vision Models for Robot LearningPoster1 citations
  767. A Dataset for Semantic Segmentation in the Presence of UnknownsPoster1 citations
  768. A Flag Decomposition for Hierarchical DatasetsPoster1 citations
  769. A Lightweight UDF Learning Framework for 3D Reconstruction Based on Local Shape FunctionsPoster1 citations
  770. A Tale of Two Classes: Adapting Supervised Contrastive Learning to Binary Imbalanced DatasetsPoster1 citations
  771. A Unified Model for Compressed Sensing MRI Across Undersampling PatternsPoster1 citations
  772. AG-VPReID: A Challenging Large-Scale Benchmark for Aerial-Ground Video-based Person Re-IdentificationPoster1 citations
  773. ARM: Appearance Reconstruction Model for Relightable 3D GenerationHighlight1 citations
  774. ASIGN: An Anatomy-aware Spatial Imputation Graphic Network for 3D Spatial TranscriptomicsPoster1 citations
  775. AToM: Aligning Text-to-Motion Model at Event-Level with GPT-4Vision RewardPoster1 citations
  776. AdaCM^2: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory ReductionHighlight1 citations
  777. AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient OptimizationPoster1 citations
  778. Adapter Merging with Centroid Prototype Mapping for Scalable Class-Incremental LearningPoster1 citations
  779. Advancing Semantic Future Prediction through Multimodal Visual Sequence TransformersPoster1 citations
  780. AerialMegaDepth: Learning Aerial-Ground Reconstruction and View SynthesisPoster1 citations
  781. AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal AlignmentPoster1 citations
  782. An End-to-End Robust Point Cloud Semantic Segmentation Network with Single-Step Conditional Diffusion ModelsPoster1 citations
  783. AnomalyNCD: Towards Novel Anomaly Class Discovery in Industrial ScenariosPoster1 citations
  784. Any-Resolution AI-Generated Image Detection by Spectral LearningPoster1 citations
  785. Around the World in 80 Timesteps: A Generative Approach to Global Visual GeolocationPoster1 citations
  786. ArtiFade: Learning to Generate High-quality Subject from Blemished ImagesPoster1 citations
  787. ArticulatedGS: Self-supervised Digital Twin Modeling of Articulated Objects using 3D Gaussian SplattingPoster1 citations
  788. AutoLUT: LUT-Based Image Super-Resolution with Automatic Sampling and Adaptive Residual LearningPoster1 citations
  789. AutoURDF: Unsupervised Robot Modeling from Point Cloud Frames Using Cluster RegistrationPoster1 citations
  790. Automatic Joint Structured Pruning and Quantization for Efficient Neural Network Training and CompressionPoster1 citations
  791. BFANet: Revisiting 3D Semantic Segmentation with Boundary Feature AnalysisPoster1 citations
  792. BG-Triangle: Bezier Gaussian Triangle for 3D Vectorization and RenderingPoster1 citations
  793. BIP3D: Bridging 2D Images and 3D Perception for Embodied IntelligencePoster1 citations
  794. BWFormer: Building Wireframe Reconstruction from Airborne LiDAR Point Cloud with TransformerHighlight1 citations
  795. Balanced Direction from Multifarious Choices: Arithmetic Meta-Learning for Domain GeneralizationPoster1 citations
  796. Balanced Rate-Distortion Optimization in Learned Image CompressionHighlight1 citations
  797. BiLoRA: Almost-Orthogonal Parameter Spaces for Continual LearningPoster1 citations
  798. BiM-VFI: Bidirectional Motion Field-Guided Frame Interpolation for Video with Non-uniform MotionsPoster1 citations
  799. BiomedCoOp: Learning to Prompt for Biomedical Vision-Language ModelsPoster1 citations
  800. BlockDance: Reuse Structurally Similar Spatio-Temporal Features to Accelerate Diffusion TransformersPoster1 citations
  801. Bootstrap Your Own Views: Masked Ego-Exo Modeling for Fine-grained View-invariant Video RepresentationsPoster1 citations
  802. Bridge the Gap: From Weak to Full Supervision for Temporal Action Localization with PseudoFormerPoster1 citations
  803. Bridging Gait Recognition and Large Language Models Sequence ModelingPoster1 citations
  804. Bridging Past and Future: End-to-End Autonomous Driving with Historical Prediction and PlanningPoster1 citations
  805. Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMsPoster1 citations
  806. CARL: A Framework for Equivariant Image RegistrationPoster1 citations
  807. CASAGPT: Cuboid Arrangement and Scene Assembly for Interior DesignHighlight1 citations
  808. CATANet: Efficient Content-Aware Token Aggregation for Lightweight Image Super-ResolutionPoster1 citations
  809. CDI: Copyrighted Data Identification in Diffusion ModelsPoster1 citations
  810. CL-LoRA: Continual Low-Rank Adaptation for Rehearsal-Free Class-Incremental LearningPoster1 citations
  811. CLIP is Strong Enough to Fight Back: Test-time Counterattacks towards Zero-shot Adversarial Robustness of CLIPPoster1 citations
  812. CacheQuant: Comprehensively Accelerated Diffusion ModelsPoster1 citations
  813. CamFreeDiff: Camera-free Image to Panorama Generation with Diffusion ModelPoster1 citations
  814. Certified Human Trajectory PredictionPoster1 citations
  815. ChatGen: Automatic Text-to-Image Generation From FreeStyle ChattingPoster1 citations
  816. Circumventing Shortcuts in Audio-visual Deepfake Detection Datasets with Unsupervised LearningHighlight1 citations
  817. ClearSight: Visual Signal Enhancement for Object Hallucination Mitigation in Multimodal Large Language ModelsPoster1 citations
  818. Co-op: Correspondence-based Novel Object Pose EstimationPoster1 citations
  819. CoA: Towards Real Image Dehazing via Compression-and-AdaptationPoster1 citations
  820. CoLLM: A Large Language Model for Composed Image RetrievalPoster1 citations
  821. CoSDH: Communication-Efficient Collaborative Perception via Supply-Demand Awareness and Intermediate-Late HybridizationPoster1 citations
  822. Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language ModelPoster1 citations
  823. Coeff-Tuning: A Graph Filter Subspace View for Tuning Attention-Based Large ModelsHighlight1 citations
  824. Coherent 3D Portrait Video Reconstruction via Triplane FusionPoster1 citations
  825. Complementary Advantages: Exploiting Cross-Field Frequency Correlation for NIR-Assisted Image DenoisingPoster1 citations
  826. ConMo: Controllable Motion Disentanglement and Recomposition for Zero-Shot Motion TransferPoster1 citations
  827. ConceptGuard: Continual Personalized Text-to-Image Generation with Forgetting and Confusion MitigationPoster1 citations
  828. Conditional Balance: Improving Multi-Conditioning Trade-Offs in Image GenerationPoster1 citations
  829. Continual SFT Matches Multimodal RLHF with Negative SupervisionPoster1 citations
  830. Correcting Deviations from Normality: A Reformulated Diffusion Model for Multi-Class Unsupervised Anomaly DetectionPoster1 citations
  831. CountLLM: Towards Generalizable Repetitive Action Counting via Large Language ModelPoster1 citations
  832. Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene UnderstandingPoster1 citations
  833. Curriculum Coarse-to-Fine Selection for High-IPC Dataset DistillationPoster1 citations
  834. CustomKD: Customizing Large Vision Foundation for Edge Model Improvement via Knowledge DistillationPoster1 citations
  835. DAMM-Diffusion: Learning Divergence-Aware Multi-Modal Diffusion Model for Nanoparticles Distribution PredictionHighlight1 citations
  836. DFormerv2: Geometry Self-Attention for RGBD Semantic SegmentationPoster1 citations
  837. DNF: Unconditional 4D Generation with Dictionary-based Neural FieldsPoster1 citations
  838. DPC: Dual-Prompt Collaboration for Tuning Vision-Language ModelsPoster1 citations
  839. DRAWER: Digital Reconstruction and Articulation With Environment RealismPoster1 citations
  840. DV-Matcher: Deformation-based Non-rigid Point Cloud Matching Guided by Pre-trained Visual FeaturesPoster1 citations
  841. D^3-Human: Dynamic Disentangled Digital Human from Monocular VideoPoster1 citations
  842. DeRS: Towards Extremely Efficient Upcycled Mixture-of-Experts ModelsPoster1 citations
  843. Debiasing Multimodal Large Language Models via Noise-Aware Preference OptimizationPoster1 citations
  844. Decision SpikeFormer: Spike-Driven Transformer for Decision MakingPoster1 citations
  845. DecoupledGaussian: Object-Scene Decoupling for Physics-Based InteractionPoster1 citations
  846. Decoupling Fine Detail and Global Geometry for Compressed Depth Map Super-ResolutionPoster1 citations
  847. DefMamba: Deformable Visual State Space ModelPoster1 citations
  848. Deformable Radial Kernel SplattingPoster1 citations
  849. Denoising Functional Maps: Diffusion Models for Shape CorrespondencePoster1 citations
  850. Depth Any Camera: Zero-Shot Metric Depth Estimation from Any CameraPoster1 citations
  851. DesignDiffusion: High-Quality Text-to-Design Image Generation with Diffusion ModelsPoster1 citations
  852. Detecting Adversarial Data Using Perturbation ForgeryPoster1 citations
  853. Deterministic Certification of Graph Neural Networks against Graph Poisoning Attacks with Arbitrary PerturbationsPoster1 citations
  854. DifIISR: A Diffusion Model with Gradient Guidance for Infrared Image Super-ResolutionPoster1 citations
  855. DiffFNO: Diffusion Fourier Neural OperatorPoster1 citations
  856. DiffPortrait360: Consistent Portrait Diffusion for 360 View SynthesisPoster1 citations
  857. DiffusionSfM: Predicting Structure and Motion via Ray Origin and Endpoint DiffusionPoster1 citations
  858. Discovering Fine-Grained Visual-Concept Relations by Disentangled Optimal Transport Concept Bottleneck ModelsPoster1 citations
  859. Distilling Monocular Foundation Model for Fine-grained Depth CompletionPoster1 citations
  860. Distilling Spectral Graph for Object-Context Aware Open-Vocabulary Semantic SegmentationPoster1 citations
  861. Distraction is All You Need for Multimodal Large Language Model JailbreakingHighlight1 citations
  862. Divot: Diffusion Powers Video Tokenizer for Comprehension and GenerationPoster1 citations
  863. Do Computer Vision Foundation Models Learn the Low-level Characteristics of the Human Visual System?Highlight1 citations
  864. Do We Always Need the Simplicity Bias? Looking for Optimal Inductive Biases in the WildPoster1 citations
  865. Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?Poster1 citations
  866. DocSAM: Unified Document Image Segmentation via Query Decomposition and Heterogeneous Mixed LearningPoster1 citations
  867. DocVLM: Make Your VLM an Efficient ReaderPoster1 citations
  868. Document Haystacks: Vision-Language Reasoning Over Piles of 1000+ DocumentsPoster1 citations
  869. DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal CyclesPoster1 citations
  870. Dr. Splat: Directly Referring 3D Gaussian Splatting via Direct Language Embedding RegistrationHighlight1 citations
  871. DreamCache: Finetuning-Free Lightweight Personalized Image Generation via Feature CachingPoster1 citations
  872. DreamOmni: Unified Image Generation and EditingPoster1 citations
  873. DreamRelation: Bridging Customization and Relation GenerationPoster1 citations
  874. Dual Prompting Image Restoration with Diffusion TransformersPoster1 citations
  875. DualPM: Dual Posed-Canonical Point Maps for 3D Shape and Pose ReconstructionHighlight1 citations
  876. DualTalk: Dual-Speaker Interaction for 3D Talking Head ConversationsPoster1 citations
  877. Dyn-HaMR: Recovering 4D Interacting Hand Motion from a Dynamic CameraHighlight1 citations
  878. ECBench: Can Multi-modal Foundation Models Understand the Egocentric World? A Holistic Embodied Cognition BenchmarkPoster1 citations
  879. EZSR: Event-based Zero-Shot RecognitionPoster1 citations
  880. EasyHOI: Unleashing the Power of Large Models for Reconstructing Hand-Object Interactions in the WildPoster1 citations
  881. EchoONE: Segmenting Multiple Echocardiography Planes in One ModelPoster1 citations
  882. EchoTraffic: Enhancing Traffic Anomaly Understanding with Audio-Visual InsightsPoster1 citations
  883. Effective Cloud Removal for Remote Sensing Images by an Improved Mean-Reverting Denoising Model with Elucidated Design SpacePoster1 citations
  884. Efficient Transfer Learning for Video-language Foundation ModelsPoster1 citations
  885. Efficient Video Face Enhancement with Enhanced Spatial-Temporal ConsistencyPoster1 citations
  886. Embodied Scene Understanding for Vision Language Models via MetaVQAPoster1 citations
  887. Empowering Vector Graphics with Consistently Arbitrary Viewing and View-dependent VisibilityHighlight1 citations
  888. Enhancing Dataset Distillation via Non-Critical Region RefinementPoster1 citations
  889. Enhancing Diversity for Data-free QuantizationPoster1 citations
  890. Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic DataPoster1 citations
  891. Erasing Undesirable Influence in Diffusion ModelsPoster1 citations
  892. Ev-3DOD: Pushing the Temporal Boundaries of 3D Object Detection with Event CamerasHighlight1 citations
  893. Eval3D: Interpretable and Fine-grained Evaluation for 3D GenerationPoster1 citations
  894. Evaluating Model Perception of Color Illusions in Photorealistic ScenesPoster1 citations
  895. Evaluating Vision-Language Models as Evaluators in Path PlanningPoster1 citations
  896. Event Fields: Capturing Light Fields at High Speed, Resolution, and Dynamic RangeHighlight1 citations
  897. Event-based Video Super-Resolution via State Space ModelsPoster1 citations
  898. Exploiting Temporal State Space Sharing for Video Semantic SegmentationPoster1 citations
  899. Exploring CLIP's Dense Knowledge for Weakly Supervised Semantic SegmentationPoster1 citations
  900. Exploring Semantic Feature Discrimination for Perceptual Image Super-Resolution and Opinion-Unaware No-Reference Image Quality AssessmentPoster1 citations
  901. Exploring Visual Vulnerabilities via Multi-Loss Adversarial Search for Jailbreaking Vision-Language ModelsPoster1 citations
  902. Extreme Rotation Estimation in the WildPoster1 citations
  903. FADA: Fast Diffusion Avatar Synthesis with Mixed-Supervised Multi-CFG DistillationPoster1 citations
  904. FAM Diffusion: Frequency and Attention Modulation for High-Resolution Image Generation with Stable DiffusionPoster1 citations
  905. FIction: 4D Future Interaction Prediction from VideoHighlight1 citations
  906. FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-trainingPoster1 citations
  907. FSboard: Over 3 Million Characters of ASL Fingerspelling Collected via SmartphonesPoster1 citations
  908. Fancy123: One Image to High-Quality 3D Mesh Generation via Plug-and-Play DeformationPoster1 citations
  909. Feat2GS: Probing Visual Foundation Models with Gaussian SplattingPoster1 citations
  910. Feature4X: Bridging Any Monocular Video to 4D Agentic AI with Versatile Gaussian Feature FieldsPoster1 citations
  911. Filter Images First, Generate Instructions Later: Pre-Instruction Data Selection for Visual Instruction TuningHighlight1 citations
  912. Finding Local Diffusion Schrodinger Bridge using Kolmogorov-Arnold NetworkPoster1 citations
  913. FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text InputsPoster1 citations
  914. FlexiDiT: Your Diffusion Transformer Can Easily Generate High-Quality Samples with Less ComputeHighlight1 citations
  915. Floxels: Fast Unsupervised Voxel Based Scene Flow EstimationPoster1 citations
  916. Forensic Self-Descriptions Are All You Need for Zero-Shot Detection, Open-Set Source Attribution, and Clustering of AI-generated ImagesPoster1 citations
  917. Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language ModelsPoster1 citations
  918. Foundations of the Theory of Performance-Based RankingPoster1 citations
  919. Free-viewpoint Human Animation with Pose-correlated Reference SelectionHighlight1 citations
  920. From Head to Tail: Towards Balanced Representation in Large Vision-Language Models through Adaptive Data CalibrationPoster1 citations
  921. From Laboratory to Real World: A New Benchmark Towards Privacy-Preserved Visible-Infrared Person Re-IdentificationPoster1 citations
  922. Full-DoF Egomotion Estimation for Event Cameras Using Geometric SolversHighlight1 citations
  923. GLUS: Global-Local Reasoning Unified into A Single Large Language Model for Video SegmentationPoster1 citations
  924. GRAPHGPT-O: Synergistic Multimodal Comprehension and Generation on GraphsPoster1 citations
  925. GarmentPile: Point-Level Visual Affordance Guided Retrieval and Adaptation for Cluttered Garments ManipulationPoster1 citations
  926. GauSTAR: Gaussian Surface Tracking and ReconstructionPoster1 citations
  927. Gaussian Splatting for Efficient Satellite Image PhotogrammetryPoster1 citations
  928. Generating 3D-Consistent Videos from Unposed Internet PhotosPoster1 citations
  929. Generating Multimodal Driving Scenes via Next-Scene PredictionPoster1 citations
  930. Generative Gaussian Splatting for Unbounded 3D City GenerationPoster1 citations
  931. Generative Image Layer Decomposition with Visual EffectsPoster1 citations
  932. Generative Modeling of Class Probability for Multi-Modal Representation LearningHighlight1 citations
  933. Generative Multiview Relighting for 3D Reconstruction under Extreme Illumination VariationHighlight1 citations
  934. Generative Video PropagationPoster1 citations
  935. Geometry Field Splatting with Gaussian SurfelsPoster1 citations
  936. Global-Local Tree Search in VLMs for 3D Indoor Scene GenerationPoster1 citations
  937. Good, Cheap, and Fast: Overfitted Image Compression with Wasserstein DistortionHighlight1 citations
  938. Guiding Human-Object Interactions with Rich Geometry and RelationsPoster1 citations
  939. Gyro-based Neural Single Image DeblurringPoster1 citations
  940. HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility EvaluatorPoster1 citations
  941. HELVIPAD: A Real-World Dataset for Omnidirectional Stereo Depth EstimationHighlight1 citations
  942. HOIGPT: Learning Long-Sequence Hand-Object Interaction with Language ModelsPoster1 citations
  943. Handling Spatial-Temporal Data Heterogeneity for Federated Continual Learning via Tail AnchorPoster1 citations
  944. HiLoTs: High-Low Temporal Sensitive Representation Learning for Semi-Supervised LiDAR Segmentation in Autonomous DrivingPoster1 citations
  945. HiPART: Hierarchical Pose AutoRegressive Transformer for Occluded 3D Human Pose EstimationPoster1 citations
  946. HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video UnderstandingPoster1 citations
  947. Hierarchical Flow Diffusion for Efficient Frame InterpolationPoster1 citations
  948. High-Fidelity Relightable Monocular Portrait Animation with Lighting-Controllable Video Diffusion ModelPoster1 citations
  949. HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language EmbeddingPoster1 citations
  950. Horizon-GS: Unified 3D Gaussian Splatting for Large-Scale Aerial-to-Ground ScenesPoster1 citations
  951. HyperGLM: HyperGraph for Video Scene Graph Generation and AnticipationPoster1 citations
  952. Hyperdimensional Uncertainty Quantification for Multimodal Uncertainty Fusion in Autonomous Vehicles PerceptionPoster1 citations
  953. ID-Patch: Robust ID Association for Group Photo PersonalizationPoster1 citations
  954. ILIAS: Instance-Level Image retrieval At ScalePoster1 citations
  955. Improving Adversarial Transferability on Vision Transformers via Forward Propagation RefinementPoster1 citations
  956. Instant Gaussian Stream: Fast and Generalizable Streaming of Dynamic Scene Reconstruction via Gaussian SplattingHighlight1 citations
  957. InteractVLM: 3D Interaction Reasoning from 2D Foundational ModelsPoster1 citations
  958. Is `Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction TuningPoster1 citations
  959. Is this Generated Person Existed in Real-world? Fine-grained Detecting and Calibrating Abnormal Human-bodyHighlight1 citations
  960. Jailbreaking the Non-Transferable Barrier via Test-Time Data DisguisingPoster1 citations
  961. JamMa: Ultra-lightweight Local Feature Matching with Joint MambaPoster1 citations
  962. Joint Out-of-Distribution Filtering and Data Discovery Active LearningPoster1 citations
  963. LaTexBlend: Scaling Multi-concept Customized Generation with Latent Textual BlendingHighlight1 citations
  964. Large-scale Multi-view Tensor Clustering with Implicit Linear KernelsPoster1 citations
  965. Latent Space Super-Resolution for Higher-Resolution Image Generation with Diffusion ModelsPoster1 citations
  966. Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion TransformersPoster1 citations
  967. LeanGaussian: Breaking Pixel or Point Cloud Correspondence in Modeling 3D GaussiansPoster1 citations
  968. Learned Image Compression with Dictionary-based Entropy ModelPoster1 citations
  969. Learning Affine Correspondences by Integrating Geometric ConstraintsPoster1 citations
  970. Learning Visual Generative Priors without TextPoster1 citations
  971. Learning to Sample Effective and Diverse Prompts for Text-to-Image GenerationPoster1 citations
  972. Less is More: Efficient Model Merging with Binary Task SwitchHighlight1 citations
  973. LiDAR-RT: Gaussian-based Ray Tracing for Dynamic LiDAR Re-simulationPoster1 citations
  974. Light3R-SfM: Towards Feed-forward Structure-from-MotionHighlight1 citations
  975. LineArt: A Knowledge-guided Training-free High-quality Appearance Transfer for Design Drawing with Diffusion ModelPoster1 citations
  976. LoRA Subtraction for Drift-Resistant Space in Exemplar-Free Continual LearningPoster1 citations
  977. Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data CurationPoster1 citations
  978. LookCloser: Frequency-aware Radiance Field for Tiny-Detail ScenePoster1 citations
  979. Lux Post Facto: Learning Portrait Performance Relighting with Conditional Video Diffusion and a Hybrid DatasetPoster1 citations
  980. MANTA: A Large-Scale Multi-View and Visual-Text Anomaly Detection Dataset for Tiny ObjectsPoster1 citations
  981. MAR-3D: Progressive Masked Auto-regressor for High-Resolution 3D GenerationHighlight1 citations
  982. MBQ: Modality-Balanced Quantization for Large Vision-Language ModelsPoster1 citations
  983. MEGA: Masked Generative Autoencoder for Human Mesh RecoveryPoster1 citations
  984. MET3R: Measuring Multi-View Consistency in Generated ImagesPoster1 citations
  985. MG-MotionLLM: A Unified Framework for Motion Comprehension and Generation across Multiple GranularitiesPoster1 citations
  986. MICAS: Multi-grained In-Context Adaptive Sampling for 3D Point Cloud ProcessingPoster1 citations
  987. MIDI: Multi-Instance Diffusion for Single Image to 3D Scene GenerationPoster1 citations
  988. MMRL: Multi-Modal Representation Learning for Vision-Language ModelsPoster1 citations
  989. MMTL-UniAD: A Unified Framework for Multimodal and Multi-Task Learning in Assistive Driving PerceptionPoster1 citations
  990. MP-GUI: Modality Perception with MLLMs for GUI UnderstandingPoster1 citations
  991. MPDrive: Improving Spatial Understanding with Marker-Based Prompt Learning for Autonomous DrivingHighlight1 citations
  992. MUSt3R: Multi-view Network for Stereo 3D ReconstructionHighlight1 citations
  993. MVBoost: Boost 3D Reconstruction with Multi-View RefinementPoster1 citations
  994. MaRI: Material Retrieval Integration across DomainsPoster1 citations
  995. Maintaining Consistent Inter-Class Topology in Continual Test-Time AdaptationPoster1 citations
  996. MambaIC: State Space Models for High-Performance Learned Image CompressionPoster1 citations
  997. MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language TrackingHighlight1 citations
  998. ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable GraspingHighlight1 citations
  999. Marten: Visual Question Answering with Mask Generation for Multi-modal Document UnderstandingPoster1 citations
  1000. Mask^2DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video GenerationPoster1 citations

Looking for submission deadlines instead? See the conference deadline calendar.

CVPR 2025 Accepted Papers · Full List of 2,872 Papers