← All conferences

CVPR 2026 Accepted Papers

The full list of 4,068 papers accepted at CVPR 2026 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

accepted: 4,068
  1. MCHDoc: A Comprehensive Benchmark for Reading Multi-Carrier Chinese Historical Documentsaccepted
  2. MD2E: Modeling Depth-to-Edge Cues for Monocular Metric Depth Estimationaccepted
  3. MDCS-MoAME: Multi-directional Composite Scanning with Mixture of Attention and Mamba Experts for Cancer Survival Predictionaccepted
  4. MDS-VQA: Model-Informed Data Selection for Video Quality Assessmentaccepted
  5. MEMO: Human-like Crisp Edge Detection Using Masked Edge Predictionaccepted
  6. MER-Tracker: Towards High-Speed 3D Point Tracking via Multi-View Event-RGB Hybrid Camerasaccepted
  7. MERG3R: A Divide-and-Conquer Approach to Large-Scale Neural Visual Geometryaccepted
  8. MERIT: Multi-domain Efficient RAW Image Translationaccepted
  9. MERLIN: Building Low-SNR Robust Multimodal LLMs for Electromagnetic Signalsaccepted
  10. META: Meta Evolution of Tool Trajectory Adaptation for Long-Video Understandingaccepted
  11. MFEN: Multi-Frequency Expert Network for Visible-Infrared Person Re-IDaccepted
  12. MGDHand: Multi-Granularity Prior-to-Inertial Distillation Framework for Sequential 3D Hand Pose Estimation from Sparse IMUsaccepted
  13. MHopReg: Efficient Hierarchical Multi-Hop Graph Search for Point Cloud Registrationaccepted
  14. MIBURI: Towards Expressive Interactive Gesture Synthesisaccepted
  15. MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Modelsaccepted
  16. MICo-150K: A Comprehensive Dataset Advancing Multi-Image Compositionaccepted
  17. MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understandingaccepted
  18. MLLMSplat: A 2D MLLM-Powered Framework for 3D Gaussian Splatting Understanding, Generation, and Editingaccepted
  19. MM-ACT: Learn from Multimodal Parallel Generation to Actaccepted
  20. MM-OVSeg: Multimodal Optical-SAR Fusion for Open-Vocabulary Segmentation in Remote Sensingaccepted
  21. MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correctionaccepted
  22. MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioningaccepted
  23. MMBench-GUI: A Unified Hierarchical Evaluation Framework for Multi-Platform GUI Agentsaccepted
  24. MMCP-GEN: A Modality-Extensible Diffusion Language Model for Conditional Protein Sequence Generationaccepted
  25. MMDIR: Multimodal Instruction-Driven Framework for Mixed-Degradation Document Image Restorationaccepted
  26. MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generationaccepted
  27. MMGait: Towards Multi-Modal Gait Recognitionaccepted
  28. MMLandmarks: a Cross-View Instance-Level Benchmark for Geo-Spatial Understandingaccepted
  29. MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Modelsaccepted
  30. MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detectionaccepted
  31. MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translationaccepted
  32. MMVIP: A Visible-infrared Paired Dataset for Multi-weather Marine Visionaccepted
  33. MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Modelsaccepted
  34. MOFA-VTON: More Fashion Possibilities with Fine-Grained Adaptations in Virtual Try-Onaccepted
  35. MOGeo: Beyond One-to-One Cross-View Object Geo-localizationaccepted
  36. MOMO: Mars Orbital MOdel Foundation Model for Mars Orbital Applicationsaccepted
  37. MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understandingaccepted
  38. MORE-STEM: Long-Short MemOry REcall and Spatio-TEmporal Consistency Model for Query-Driven 3D/4D Point Cloud Segmentationaccepted
  39. MOS: Mitigating Optical-SAR Modality Gap for Cross-Modal Ship Re-Identificationaccepted
  40. MOSAIC-GS: Monocular Scene Reconstruction via Advanced Initialization for Complex Dynamic Environmentsaccepted
  41. MPL: Match-guided Prototype Learning for Few-shot Action Recognitionaccepted
  42. MR-RAG: Multimodal Relevance-Aware Retrieval-Augmented Generation for Medical Visual Question Answeringaccepted
  43. MR. Illuminate: Zero-Shot Low-Light Image Enhancement with Diffusion Prioraccepted
  44. MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understandingaccepted
  45. MRI Contrast Enhancement Kinetics World Modelaccepted
  46. MS-Temba: Multi-Scale Temporal Mamba for Understanding Long Untrimmed Videosaccepted
  47. MSCD-GS: Motion-Separated Cooperative Deblurring Dynamic Reconstruction via Gaussian Splattingaccepted
  48. MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigationaccepted
  49. MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understandingaccepted
  50. MSPT: Efficient Large-Scale Physical Modeling via Parallelized Multi-Scale Attentionaccepted
  51. MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learningaccepted
  52. MS^2Gait: A Multi-Scale Spatio-Temporal Fusion Network for LiDAR-based Gait Recognitionaccepted
  53. MTA: Multimodal Task Alignment for BEV Perception and Captioningaccepted
  54. MU-GeNeRF: Multi-view Uncertainty-guided Generalizable Neural Radiance Fields for Distractor-aware Sceneaccepted
  55. MUFASA: A Multi-Layer Framework for Slot Attentionaccepted
  56. MUSE: Harnessing Precise and Diverse Semantics for Few-Shot Whole Slide Image Classificationaccepted
  57. MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modalityaccepted
  58. MV-Fashion: Towards Enabling Virtual Try-On and Size Estimation with Multi-View Paired Dataaccepted
  59. MV-RoMa: From Pairwise Matching into Multi-View Track Reconstructionaccepted
  60. MV-TAP: Tracking Any Point in Multi-View Videosaccepted
  61. MV2UV: Generating High-quality UV Texture Maps with Multiview Promptsaccepted
  62. MV3DIS: Multi-View Mask Matching via 3D Guides for Zero-Shot 3D Instance Segmentationaccepted
  63. MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentationaccepted
  64. MVInverse: Feed-forward Multiview Inverse Rendering in Secondsaccepted
  65. MVLM: Template-Free Tracking via Vision-Language Margin Confidence and Memory-Gated Trackingaccepted
  66. MVP: Multiple View Prediction Improves GUI Groundingaccepted
  67. M^3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generationaccepted
  68. MacTok: Robust Continuous Tokenization for Image Generationaccepted
  69. Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokensaccepted
  70. Machine Unlearning via Adaptive Gradient Reweighting and Multi-stage Objective Optimizationaccepted
  71. MagicFuse: Single Image Fusion for Visual and Semantic Reinforcementaccepted
  72. MagicQuill V2: Precise and Interactive Image Editing with Layered Visual Cuesaccepted
  73. MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layoutsaccepted
  74. Make it SING: Analyzing Semantic Invariants in Classifiersaccepted
  75. MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generationaccepted
  76. Making Training-Free Diffusion Segmentors Scale with the Generative Poweraccepted
  77. Making the Classification Explanation Faithful to the Confidence Scoreaccepted
  78. Mamba Learns in Context: Structure-Aware Domain Generalization for Multi-Task Point Cloud Understandingaccepted
  79. MambaLiteUNet: Cross-Gated Adaptive Feature Fusion for Robust Skin Lesion Segmentationaccepted
  80. MambaSIC: Mamba-based Stereo Image Compression with Bi-directional Multi-reference Entropy Modelaccepted
  81. MangoBench: A Benchmark for Multi-Agent Goal-Conditioned Offline Reinforcement Learningaccepted
  82. ManifoldGD: Training-Free Hierarchical Manifold Guidance for Diffusion-Based Dataset Distillationaccepted
  83. ManifoldNeuS: Manifold-aware View Optimizability for Pose-Free Neural Surface Reconstructionaccepted
  84. Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresightaccepted
  85. MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Modelsaccepted
  86. MapRoute:Precise-Concept Erasing Mappers via Semantic Routingaccepted
  87. Mapping Networksaccepted
  88. Mario: Multimodal Graph Reasoning with Large Language Modelsaccepted
  89. Mark4D: Temporally-Consistent Watermarking for 4D Gaussian Splattingaccepted
  90. Markovian Scale Prediction: A New Era of Visual Autoregressive Generationaccepted
  91. MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structuresaccepted
  92. Mask to Align, Weight to Disambiguate: Reliable Unsupervised Cross-Modal Hashing with Masked-Weight Contrastaccepted
  93. MaskAdapt: Learning Flexible Motion Adaptation via Mask-Invariant Prior for Physics-Based Charactersaccepted
  94. MaskDexGrasp: Generative Masked Modeling for Part-Aware Dexterous Grasp Synthesisaccepted
  95. MaskDiME: Adaptive Masked Diffusion for Precise and Efficient Visual Counterfactual Explanationsaccepted
  96. MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image Generationaccepted
  97. Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learningaccepted
  98. Masked Region Transformer for Layered Image Generation and Editing at Scaleaccepted
  99. Masked Representation Modeling for Domain-Adaptive Segmentationaccepted
  100. Masked-Diffusion Autoencoders for 3D Medical Vision Representation Learningaccepted
  101. Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understandingaccepted
  102. Masking Teacher and Reinforcing Student for Distilling Vision-Language Modelsaccepted
  103. MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluatoraccepted
  104. MatE: Material Extraction from Single-Image via Geometric Prioraccepted
  105. MatLat: Material Latent Space for PBR Texture Generationaccepted
  106. MatMart: Material Reconstruction of 3D Objects via Diffusionaccepted
  107. MatPedia: A Universal Generative Foundation for High-Fidelity Material Synthesisaccepted
  108. MatSpray: Fusing 2D Material World Knowledge on 3D Geometryaccepted
  109. Match-and-Fuse: Consistent Generation from Unstructured Image Setsaccepted
  110. MatchED: Crisp Edge Detection Using End-to-End, Matching-based Supervisionaccepted
  111. MatchMask: Mask-Centric Generative Data Augmentation for Label-Scarce Semantic Segmentationaccepted
  112. Matching Every Pair to Track Every Point: PairFormer for All-Pairs Tracking and Video Trajectory Fieldsaccepted
  113. Material Magic Wand: Material-Aware Grouping of 3D Parts in Untextured Meshesaccepted
  114. MaxMark: High-Capacity Diffusion-Native Watermarking via Robust and Invertible Latent Embeddingaccepted
  115. MeToM: Metadata-Guided Token Merging for Efficient Video LLMsaccepted
  116. MeanFlow Transformers with Representation Autoencodersaccepted
  117. MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Drivingaccepted
  118. Measure The Feature Universe: Topology-based Pseudo Labeling and Gravity Consistency for Source-Free Domain Adaptationaccepted
  119. Measuring the (Un)Faithfulness of Concept-Based Explanationsaccepted
  120. Mechanisms of Object Localization in Vision-Language Modelsaccepted
  121. Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoningaccepted
  122. MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentationaccepted
  123. MedFG-VQA: Low-Frequency Memory and Graph Attention for Lightweight Medical VQAaccepted
  124. MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understandingaccepted
  125. MedKCO: Medical Vision-Language Pretraining via Knowledge-Driven Cognitive Orchestrationaccepted
  126. MedLIME: A Distribution-Aligned and Evidence-Supported Framework for Medical Saliency Explanationsaccepted
  127. MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Groundingaccepted
  128. MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Imagesaccepted
  129. MedTVT-R1: A Multimodal LLM Empowering Medical Reasoning and Diagnosisaccepted
  130. Medic-AD: Towards Medical Vision-Language Model's Clinical Intelligenceaccepted
  131. MemFlow: A Lightweight Forward Memorizing Framework for Quick Domain Adaptive Feature Mappingaccepted
  132. Memory Matters: Boosting Training-Free Zero-Shot Temporal Action Localization with a Learnable Lookup Tableaccepted
  133. Memory-Augmented Scene Understanding and Exploration for Open-World Aerial Object-Goal Navigationaccepted
  134. Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skippingaccepted
  135. Memory-Efficient Transfer Learning with Fading Side Networks via Masked Dual Path Distillationaccepted
  136. Merge3D: Efficient 3D Multimodal LLMs via Joint 2D-3D Token Mergingaccepted
  137. MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agentaccepted
  138. Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generationaccepted
  139. Mesh4D: 4D Mesh Reconstruction and Tracking from Monocular Videoaccepted
  140. MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformeraccepted
  141. MeshMosaic: Scaling Artist Mesh Generation via Local-to-Global Assemblyaccepted
  142. MeshRipple: Structured Autoregressive Generation of Artist-Meshesaccepted
  143. MeshSplatting: Differentiable Rendering with Opaque Meshesaccepted
  144. MeshWeaver: Sparse-Voxel-Guided Surface Weaving for Autoregressive Mesh Generationaccepted
  145. Meta-CoT: Enhancing Granularity and Generalization in Image Editingaccepted
  146. Meta-FC: Meta-Learning with Feature Consistency for Robust and Generalizable Watermarkingaccepted
  147. Meta-Learning In-Context Enables Training-Free Cross Subject Brain Decodingaccepted
  148. MetaSpectra+: A Compact Broadband Metasurface Camera for Snapshot Hyperspectral+ Imagingaccepted
  149. MeteorPred: A Meteorological Multimodal Large Model and Dataset for Severe Weather Event Predictionaccepted
  150. MetricHMSR: Metric Human Mesh and Scene Recovery from Monocular Imagesaccepted
  151. MetroGS: Efficient and Stable Reconstruction of Geometrically Accurate High-Fidelity Large-Scale Scenesaccepted
  152. MicroFM: Physics-guided Flow Matching for Isotropic Microscopy Reconstructionaccepted
  153. MimiCAT: Mimic with Correspondence-Aware Cascade-Transformer for Category-Free 3D Pose Transferaccepted
  154. Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understandingaccepted
  155. MimicTalker: A Multimodal Interactive and Memory-Enhanced Framework for Real-Time Dyadic 3D Head Generationaccepted
  156. Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learningaccepted
  157. Mind the Gap: Transferring Labels to Align Object Detection Datasetsaccepted
  158. Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Modelsaccepted
  159. Mind the Hitch: Dynamic Calibration and Articulated Perception for Autonomous Trucksaccepted
  160. Mind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMsaccepted
  161. MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Drivingaccepted
  162. MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agentsaccepted
  163. Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understandingaccepted
  164. MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipeaccepted
  165. Minimal Constraint Relaxation for Multiview Autocalibrationaccepted
  166. Mining Attribute Subspaces for Efficient Fine-tuning of 3D Foundation Modelsaccepted
  167. Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detectionaccepted
  168. Mirai: Autoregressive Visual Generation Needs Foresightaccepted
  169. Mirror Illusion Artaccepted
  170. Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infraredaccepted
  171. Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videosaccepted
  172. Mitigating Error Amplification in Fast Adversarial Trainingaccepted
  173. Mitigating Instance Entanglement in Instance-Dependent Partial Label Learningaccepted
  174. Mitigating Multimodal Hallucinations via Gradient-based Self-Reflectionaccepted
  175. Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentationaccepted
  176. Mitigating Simplicity Bias in OOD Detection through Object Co-occurrence Analysisaccepted
  177. Mitigating The Distribution Shift of Diffusion-based Dataset Distillationaccepted
  178. MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixtureaccepted
  179. MixerCSeg: An Efficient Mixer Architecture for Crack Segmentation via Decoupled Mamba Attentionaccepted
  180. Mixture of Prototypes for Test-time Adaptive Segmentationaccepted
  181. Mixture of States: Routing Token-Level Dynamics for Multimodal Generationaccepted
  182. Mixture of Style Experts for Diverse Image Stylizationaccepted
  183. Mixture-of-Experts based Feature Decoupling for Open Vocabulary Scene Graph Generationaccepted
  184. MoBind: Motion Binding for Fine-Grained IMU-Video Pose Alignmentaccepted
  185. MoCapAnything: Unified 3D Motion Capture for Arbitrary Skeletons from Monocular Videosaccepted
  186. MoCha: End-to-End Video Character Replacement without Structural Guidanceaccepted
  187. MoCoDiff: A Controllable Autoregressive Diffusion Model for Expressive Motion Generationaccepted
  188. MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimizationaccepted
  189. MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skippingaccepted
  190. MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Modelsaccepted
  191. MoEActok: A MoE-based Action Tokenizer for Vision-Language-Action Modelsaccepted
  192. MoECLIP: Patch-Specialized Experts for Zero-shot Anomaly Detectionaccepted
  193. MoLingo: Motion-Language Alignment for Text-to-Human Motion Generationaccepted
  194. MoRE: 3D Visual Geometry Reconstruction Meets Mixture-of-Expertsaccepted
  195. MoRGS: Efficient Per-Gaussian Motion Reasoning for Streamable Dynamic 3D Scenesaccepted
  196. MoRe: Motion-aware Feed-forward 4D Reconstruction Transformeraccepted
  197. MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesisaccepted
  198. MoRel: Long-Range Flicker-Free 4D Motion Modeling via Anchor Relay-based Bidirectioanl Blending with Hierarchical Densificationaccepted
  199. MoVie: Broaden Your Views with Human Motion for Action Detectionaccepted
  200. MoVieS: Motion-Aware 4D Dynamic View Synthesis in One Secondaccepted
  201. Mobile-VTON: High-Fidelity On-Device Virtual Try-Onaccepted
  202. Mocap-2-to-3: Multi-view Lifting for Monocular Motion Recovery with 2D Pretrainingaccepted
  203. Model Merging in the Essential Subspaceaccepted
  204. Modeling Cross-vision Synergy for Unified Large Vision Modelaccepted
  205. Modeling Spatiotemporal Neural Frames for High Resolution Brain Dynamicaccepted
  206. Modeling the Brain's Grammar: ROI-Guided fMRI Pretraining for Transferable and Interpretable Vision Decodingaccepted
  207. Modeling the Visual Ambiguity of Human Sketchesaccepted
  208. Models as Lego Builders: Assembling Malice from Benign Blocks via Semantic Blueprintsaccepted
  209. ModularAgent: A Task-Aware Modular Framework for Joint Optimization of Multimodal Large Language Models and World Modelsaccepted
  210. Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Groundingaccepted
  211. Momentum Memory for Knowledge Distillation in Computational Pathologyaccepted
  212. Monet: Reasoning in Latent Visual Space Beyond Image and Languageaccepted
  213. MonoSAOD: Monocular 3D Object Detection with Sparsely Annotated Labelaccepted
  214. MonoVLM: Monocular 3D Visual Grounding with Vision Language Modelsaccepted
  215. Monocular Open Vocabulary Occupancy Prediction for Indoor Scenesaccepted
  216. MooCap: A Multi-View Benchmark for Cow-Object-Human Interaction and Behavior Dynamicsaccepted
  217. More Natural, More Real: Object-aware Gaussian Splatting for 3D Visual Decoding from Human Brainaccepted
  218. More Than Meets the Eye: A Unified Image Fusion Framework via Semantic-Pixel Entropy Trade-off for Zero-Shot Generalizationaccepted
  219. More than the Sum: Panorama-Language Models for Adverse Omni-Scenesaccepted
  220. MorphAny3D: Unleashing the Power of Structured Latent in 3D Morphingaccepted
  221. MorphSeek: Fine-grained Latent Representation-Level Policy Optimization for Deformable Image Registrationaccepted
  222. Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Modelsaccepted
  223. Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesisaccepted
  224. Motion-Aware Animatable Gaussian Avatars Deblurringaccepted
  225. MotionCrafter: Dense Geometry and Motion Reconstruction with a 4D VAEaccepted
  226. MotionEdit: Benchmarking and Learning Motion-Centric Image Editingaccepted
  227. MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Modelsaccepted
  228. MotionHiFlow: Text-to-Motion via Hierarchical Flow Matchingaccepted
  229. MotionMaster: Generalizable Text-Driven Motion Generation and Editingaccepted
  230. MotionScale: Reconstructing Appearance, Geometry, and Motion of Dynamic Scenes with Scalable 4D Gaussian Splattingaccepted
  231. MotionV2V: Editing Motion in a Videoaccepted
  232. Motus: A Unified Latent Action World Modelaccepted
  233. MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmarkaccepted
  234. Moving Border Ownership for Event-based Motion Segmentationaccepted
  235. MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Modelaccepted
  236. MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answeringaccepted
  237. MuM: Multi-View Masked Image Modeling for 3D Visionaccepted
  238. MuViT: Multi-Resolution Vision Transformers for Learning Across Scales in Microscopyaccepted
  239. Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Followingaccepted
  240. Multi-Hierarchical Contrastive Spectral Fusion for Multi-View Clusteringaccepted
  241. Multi-Metric Representation Learning Strategy Based on Clustering for Fine-Grained Multimodal Sentiment Analysisaccepted
  242. Multi-Modal Image Fusion via Intervention-Stable Feature Learningaccepted
  243. Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discoveryaccepted
  244. Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Modelsaccepted
  245. Multi-Patch Global-to-Local Transformer Architecture For Efficient Flow Matching and Diffusion Modelaccepted
  246. Multi-Prototype Compactness and Boundary-Aware Synthesis for Unsupervised Anomaly Detectionaccepted
  247. Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoningaccepted
  248. Multi-Scale Gradient-Guided Unrolling Architecture with Adaptive Mamba for Compressive Sensingaccepted
  249. Multi-Scale Local Speculative Decoding for Image Generationaccepted
  250. Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Modelsaccepted
  251. Multi-View Hierarchical Alignment Learning for Spatial Transcriptomicsaccepted
  252. Multi-level Causal LLM-based Text-to-Motion Generation with Human Alignmentaccepted
  253. Multi-modal Frequency Decomposition Network for Semantic Scene Completionaccepted
  254. Multi-modal Test-time Adaptation via Adaptive Probabilistic Gaussian Calibrationaccepted
  255. Multi-speaker Attention Alignment for Multimodal Social Interactionaccepted
  256. Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generationaccepted
  257. Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World Scenesaccepted
  258. Multi-view Pyramid Transformer: Look Coarser to See Broaderaccepted
  259. MultiAnimate: Pose-Guided Image Animation Made Extensibleaccepted
  260. MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generationaccepted
  261. MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignmentaccepted
  262. MultiModalPFN: Extending Prior-Data Fitted Networks for Multimodal Tabular Learningaccepted
  263. MultiShotMaster: A Controllable Multi-Shot Video Generation Frameworkaccepted
  264. Multigrain-aware Semantic Prototype Scanning and Tri-Token Prompt Learning Embraced High-Order RWKV for Pan-Sharpeningaccepted
  265. Multimodal Causality-Driven Representation Learning for Generalizable Medical Image Segmentationaccepted
  266. Multimodal Continual Instruction Tuning with Dynamic Gradient Guidanceaccepted
  267. Multimodal Distribution Matching for Vision-Language Dataset Distillationaccepted
  268. Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibrationaccepted
  269. Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptationaccepted
  270. Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Imageaccepted
  271. Multimodal Semantic Bias Mitigation for Diverse Text-To-3D Generationaccepted
  272. Multinex: Lightweight Low-light Image Enhancement via Multi-prior Retinexaccepted
  273. Muses: Designing, Composing, Generating Nonexistent Fantasy 3D Creatures without Trainingaccepted
  274. MusicInfuser: Making Video Diffusion Listen and Danceaccepted
  275. NAF: Zero-Shot Feature Upsampling via Neighborhood Attention Filteringaccepted
  276. NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformersaccepted
  277. NEAF: Natural Image Editing with Attention Fusion for Generalizable Test-time Optimization in Text-Guided Image Editingaccepted
  278. NEC-Diff: Noise-Robust Event-RAW Complementary Diffusion for Seeing Motion in Extreme Darknessaccepted
  279. NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Codeaccepted
  280. NESTOR: A Nested MOE-based Neural Operator for Large-Scale PDE Pre-Trainingaccepted
  281. NG-GS: NeRF-guided 3D Gaussian Splatting Segmentationaccepted
  282. NI-Tex: Non-isometric Image-based Garment Texture Generationaccepted
  283. NIL: No-data Imitation Learningaccepted
  284. NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editingaccepted
  285. NOWA: Null-space Optical Watermark for Invisible Capture Fingerprinting and Tamper Localizationaccepted
  286. NS-Diff: Fluid Navier-Stokes Guided Video Diffusion via Reinforcement Learningaccepted
  287. NTK-Guided Implicit Neural Teachingaccepted
  288. NVGS: Neural Visibility for Occlusion Culling in 3D Gaussian Splattingaccepted
  289. NaTex: Seamless Texture Generation as Latent Color Diffusionaccepted
  290. Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathyaccepted
  291. NanoSD: Edge Efficient Foundation Model for Real Time Image Restorationaccepted
  292. Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioningaccepted
  293. Native and Compact Structured Latents for 3D Generationaccepted
  294. Natural Human Motion Recovery by Aligning High-Order Temporal Dynamics from Monocular Videosaccepted
  295. NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Predictionaccepted
  296. NeAR: Coupled Neural Asset-Renderer Stackaccepted
  297. Negative Binomial Variational Autoencoders for Overdispersed Latent Modelingaccepted
  298. Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Modelsaccepted
  299. Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Modelsaccepted
  300. NeighborMAE: Exploiting Spatial Dependencies between Neighboring Earth Observation Images in Masked Autoencoders Pretrainingaccepted
  301. NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videosaccepted
  302. Nestwork: Conditional 3D Furnished House Layout Generation through Latent Heterogeneous Graph Diffusionaccepted
  303. Neu-PiG: Neural Preconditioned Grids for Fast Dynamic Surface Reconstruction on Long Sequencesaccepted
  304. NeuROK: Generative 4D Neural Object Kinematicsaccepted
  305. Neural Collapse in Test-Time Adaptationaccepted
  306. Neural Differentiation in Deep Networks: A Theoretical Framework for Expressivity and Representational Diversityaccepted
  307. Neural Distribution Prior for LiDAR Out-of-Distribution Detectionaccepted
  308. Neural Dynamic GI: Random-Access Neural Compression for Temporal Lightmaps in Dynamic Lighting Environmentsaccepted
  309. Neural Field-Based 3D Surface Reconstruction of Microstructures from Multi-Detector Signals in Scanning Electron Microscopyaccepted
  310. Neural Gabor Splatting: Enhanced Gaussian Splatting with Neural Gabor for High-frequency Surface Reconstructionaccepted
  311. Neural Mixture Density Processesaccepted
  312. Neural-Centric Video Processing Pipeline for Unified Multi-Task Inferenceaccepted
  313. Neuro-Cognitive Reward Modeling for Human-Centered Autonomous Vehicle Controlaccepted
  314. NeuroFlow: Toward Unified Visual Encoding and Decoding from Neural Activityaccepted
  315. NeuroRule: Bridging Vision and Logic with Differentiable Rule Inductionaccepted
  316. NeuroSeg Meets DINOv3: Transferring 2D Self-Supervised Visual Priors to 3D Neuron Segmentation via DINOv3 Initializationaccepted
  317. Neurodynamics-Driven Coupled Neural P Systems for Multi-Focus Image Fusionaccepted
  318. Next-Scale Autoregressive Models for Text-to-Motion Generationaccepted
  319. Next-Scale Prediction: A Self-Supervised Approach for Real-World Image Denoisingaccepted
  320. NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networksaccepted
  321. NimbusGS: Unified 3D Scene Reconstruction under Hybrid Weatheraccepted
  322. NitroGen: An Open Foundation Model for Generalist Gaming Agentsaccepted
  323. No Calibration, No Depth, No Problem: Cross-Sensor View Synthesis with 3D Consistencyaccepted
  324. No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Modelsaccepted
  325. No Labels, No Look-Ahead: Unsupervised Online Video Stabilization with Classical Priorsaccepted
  326. No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detectionaccepted
  327. No Way To Steal My Face: Proactive Defense Against Identity-Preserving Personalized Generationaccepted
  328. NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detectionaccepted
  329. NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoningaccepted
  330. Node-RF: Learning Generalized Continuous Space-Time Scene Dynamics with Neural ODE-based NeRFsaccepted
  331. Noise-Aware Few-Shot Learning through Bi-directional Multi-View Prompt Alignmentaccepted
  332. Nonlinear Color Transfer via Learnable Bezier Flowsaccepted
  333. Nonparametric Deep Fine-grained Clustering with Low-Rank Guided Vision-Language Modelaccepted
  334. Not All Birds Look The Same: Identity-Preserving Generation For Birdsaccepted
  335. NuWa: Deriving Lightweight Class-Specific Vision Transformers for Edge Devicesaccepted
  336. OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoningaccepted
  337. ODGS-SLAM: Omnidirectional Gaussian Splatting SLAMaccepted
  338. OLATverse: A Large-scale Real-world Object Dataset with Precise Lighting Controlaccepted
  339. OMG-Avatar: One-shot Multi-LOD Gaussian Head Avataraccepted
  340. OMG-Bench: A New Challenging Benchmark for Skeleton-based Online Micro Hand Gesture Recognitionaccepted
  341. OMGTex: One-stage Multi-style Facial Texture Reconstruction without Geometry Guidanceaccepted
  342. OMoBlur: An Object Motion Blur Dataset and Benchmark for Real-World Local Motion Deblurringaccepted
  343. OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generationaccepted
  344. ORBIT: Benchmarking SfM in the Wild with 360deg Videoaccepted
  345. ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answeringaccepted
  346. ORD: Object-Relation Decoupling for Generalized 3D Visual Groundingaccepted
  347. ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Modelsaccepted
  348. ORION: ORthonormal Text Encoding for Universal VLM AdaptatIONaccepted
  349. ORSATR-X: A Foundation Model based on Differential-and-Excitation Networks for Optical Remote Sensing Object Recognitionaccepted
  350. ORV: 4D Occupancy-centric Robot Video Generationaccepted
  351. OS-Fed: One Snapshot Is All You Needaccepted
  352. OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Modelsaccepted
  353. OSA: Echocardiography Video Segmentation via Orthogonalized State Update and Anatomical Prior-aware Feature Enhancementaccepted
  354. OSMO: Open-vocabulary Self-eMOtion Trackingaccepted
  355. OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generationaccepted
  356. OVI-MAP: Open-Vocabulary Instance-Semantic Mappingaccepted
  357. OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detectionaccepted
  358. Object-Generalized Re-Identification: A Step Towards Universal Instance Perceptionaccepted
  359. Object-WIPER: Training-Free Object and Associated Effect Removal in Videosaccepted
  360. ObjectMorpher: 3D-Aware Image Editing via Deformable 3DGSaccepted
  361. Obstruction Reasoning for Robotic Graspingaccepted
  362. OccAny: Generalized Unconstrained Urban 3D Occupancyaccepted
  363. Occluded Human Body Capture with Frequency Domain Denoising Prioraccepted
  364. Occlusion-Aware SORT: Observing Occlusion for Robust Multi-Object Trackingaccepted
  365. OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspectiveaccepted
  366. OctoMed: Data Recipes for State-of-the-Art Multimodal Medical Reasoningaccepted
  367. OctoNav: Towards Generalist Embodied Navigationaccepted
  368. OctoT2I: A Self-Evolving Agentic Text-to-Image Routeraccepted
  369. Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Modelsaccepted
  370. OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Modelsaccepted
  371. Off The Grid: Detection of Primitives for Feed-Forward 3D Gaussian Splattingaccepted
  372. Olbedo: An Albedo and Shading Aerial Dataset for Large-Scale Outdoor Environmentsaccepted
  373. OlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observationaccepted
  374. Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Modelsaccepted
  375. Omni-3DEdit: Generalized Versatile 3D Editing in One-Passaccepted
  376. Omni-AD: A Large-scale and Versatile Benchmark for Industrial Anomaly Detectionaccepted
  377. Omni-Attack: Adversarial Attacks on Open-Ended VQA in Black-Box Multimodal LLMsaccepted
  378. Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalizationaccepted
  379. Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detectionaccepted
  380. Omni-MMSI: Toward Identity-attributed Social Interaction Understandingaccepted
  381. Omni-Supervised Motion Editing: Balancing Change and Invariance through Positive-Negative Learningaccepted
  382. Omni2Sound: Towards Unified Video-Text-to-Audio Generationaccepted
  383. OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasksaccepted
  384. OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learningaccepted
  385. OmniFM: Toward Modality-Robust and Task-Agnostic Federated Learning for Heterogeneous Medical Imagingaccepted
  386. OmniFood8K: Single-Image Nutrition Estimation via Hierarchical Frequency-Aligned Fusionaccepted
  387. OmniGen2: Towards Instruction-Aligned Multimodal Generationaccepted
  388. OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenariosaccepted
  389. OmniLottie: Generating Vector Animations via Parameterized Lottie Tokensaccepted
  390. OmniSonic: Towards Universal and Holistic Audio Generation from Video and Textaccepted
  391. OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformeraccepted
  392. OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Groundingaccepted
  393. OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Modelsaccepted
  394. OmniZip: Learning a Unified and Lightweight Lossless Compressor for Multi-Modal Dataaccepted
  395. On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Modelsaccepted
  396. On the Role of Temporal Granularity in the Robustness of Spiking Neural Networksaccepted
  397. One Algorithm to Align Them Allaccepted
  398. One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMsaccepted
  399. One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformersaccepted
  400. One Patch to Caption Them All: A Unified Zero-Shot Captioning Frameworkaccepted
  401. One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucinationaccepted
  402. One-Shot Flow, Any-Time Frame: A Bidirectional Warping Framework for Event-Based Video Frame Interpolationaccepted
  403. One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolutionaccepted
  404. One-to-All Animation: Alignment-Free Character Animation and Image Pose Transferaccepted
  405. One-to-More: High-Fidelity Training-Free Anomaly Generation with Attention Controlaccepted
  406. OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generationaccepted
  407. OneHOI: Unifying Human-Object Interaction Generation and Editingaccepted
  408. OneOcc: Semantic Occupancy Prediction for Legged Robots with a Single Panoramic Cameraaccepted
  409. OneSparse: A Unified Framework for Sparse Activation Layers in Vision Modelsaccepted
  410. OneStory: Coherent Multi-Shot Video Generation with Adaptive Memoryaccepted
  411. OneThinker: All-in-one Reasoning Model for Image and Videoaccepted
  412. Online Data Curation for Object Detection via Marginal Contributions to Dataset-level Average Precisionaccepted
  413. Online3R: Online Learning for Consistent Sequential Reconstruction Based on Geometry Foundation Modelaccepted
  414. OnlineHMR: Video-based Online World-Grounded Human Mesh Recoveryaccepted
  415. OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splattingaccepted
  416. OntoAug: Rethinking Generative Data Augmentation via Ontology Guidanceaccepted
  417. Open the Motion Door: Atomic Motion Decomposition and Recomposition for Open-Vocabulary Motion Generationaccepted
  418. Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehiclesaccepted
  419. Open-Vocabulary Domain Generalization in Urban-Scene Segmentationaccepted
  420. Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representationaccepted
  421. OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imageryaccepted
  422. OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Dataaccepted
  423. OpenFS: Multi-Hand-Capable Fingerspelling Recognition with Implicit Signing-Hand Detection and Frame-Wise Letter-Conditioned Synthesisaccepted
  424. OpenMMReasoner: Pushing the Frontiers in Multimodal Reasoning with an Open and General Recipeaccepted
  425. OpenMarcie: Dataset for Multimodal Action Recognition in Industrial Environmentsaccepted
  426. OpenT2M: No-frill Motion Generation with Open-source, Large-scale, High-quality Dataaccepted
  427. OpenVO: Open-World Visual Odometry with Temporal Dynamics Awarenessaccepted
  428. OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learningaccepted
  429. OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understandingaccepted
  430. Opening the Sim-to-Real Door for Humanoid Pixel-to-Action Policy Transferaccepted
  431. Opti-NeuS: Neural Reconstruction for Dual-Layered Transparent and Opaque Objectsaccepted
  432. OptiMVMap: Offline Vectorized Map Construction via Optimal Multi-vehicle Perspectivesaccepted
  433. Optical Diffraction-based Convolution for Semiconductor Lithographyaccepted
  434. Optical Flow Matching: Reframing Optical Flow as Continuous Transport Dynamicsaccepted
  435. OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generationaccepted
  436. OralGPT-Omni: A Versatile Dental Multimodal Large Language Modelaccepted
  437. OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysisaccepted
  438. Order Matters: 3D Shape Generation from Sequential VR Sketchesaccepted
  439. OrienPose: Orientation-Guided Novel View Synthesis for Single-Image Unseen Object Pose Estimationaccepted
  440. OrionEdit: Bridging Reference and Source Images for Generalized Cross-Image Editingaccepted
  441. OrthoFuse: Training-free Riemannian Fusion of Orthogonal Style-Concept Adapters for Diffusion Modelsaccepted
  442. Orthogonal Spatial-Aware Multi-View Anchor Graph Clustering for Incomplete Remote Sensing Dataaccepted
  443. Otil: Accelerating Diffusion Model Inference via Communication-Efficient Multi-GPU Parallelismaccepted
  444. Out of Sight, Out of Track: Adversarial Attacks on Propagation-based Multi-Object Trackers via Query State Manipulationaccepted
  445. Outlier-Robust Diffusion Solvers for Inverse Problemsaccepted
  446. Ov3R: Open-Vocabulary Semantic 3D Reconstruction from RGB Videosaccepted
  447. P-Flow: Prompting Visual Effects Generationaccepted
  448. P2GS: Physical Prior-guided Gaussian Splatting for Photometrically Consistent Urban Reconstructionaccepted
  449. PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attentionaccepted
  450. PACT: Phase-Like Transition Constraints in Adapter-Based Continual Learning of Vision-Language Modelsaccepted
  451. PAD-Hand: Physics-Aware Diffusion for Hand Motion Recoveryaccepted
  452. PAF: Perturbation-Aware Filtering for Open-Set Semi-Supervised Learningaccepted
  453. PAI-Bench: A Comprehensive Benchmark For Physical AIaccepted
  454. PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulationaccepted
  455. PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generationaccepted
  456. PAMotion: Physics-Aware Motion Generation for Full-Body Interaction with Multiple Objectsaccepted
  457. PARSE: Part-Aware Relational Spatial Modelingaccepted
  458. PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMsaccepted
  459. PAS: Prelim Attention Score for Detecting Object Hallucinations in Large Vision-Language Modelsaccepted
  460. PAUL: Uncertainty-Guided Partition and Augmentation for Robust Cross-View Geo-Localization under Noisy Correspondenceaccepted
  461. PAVAS: Physics-Aware Video-to-Audio Synthesisaccepted
  462. PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generationaccepted
  463. PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentationaccepted
  464. PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoningaccepted
  465. PDD: Manifold-Prior Diverse Distillation for Medical Anomaly Detectionaccepted
  466. PE3R: Perception-Efficient 3D Reconstructionaccepted
  467. PEARL: Geometry Aligns Semantics for Training-Free Open-Vocabulary Semantic Segmentationaccepted
  468. PECCVAI: Overcoming the Brittleness of AI Image Watermarking Under Visual Paraphrasing Attacksaccepted
  469. PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Trainingaccepted
  470. PETAR: Localized Findings Generation with Mask-Aware Vision-Language Modeling for PET Automated Reportingaccepted
  471. PFGNet: A Fully Convolutional Frequency-Guided Peripheral Gating Network for Efficient Spatiotemporal Predictive Learningaccepted
  472. PG-VTON: Single-Pass Training-Free Virtual Try-On via Patch-Guided Reference Alignmentaccepted
  473. PGA: Prior-free Generative Attack for Practical No-box Scenarioaccepted
  474. PGR-Net: Prior-Guided ROI Reasoning Network for Brain Tumor MRI Segmentationaccepted
  475. PHAC: Promptable Human Amodal Completionaccepted
  476. PHANTOM: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamicsaccepted
  477. PHASE-Net: Physics-Grounded Harmonic Attention System for Efficient Remote Photoplethysmography Measurementaccepted
  478. PIX-TAB: Efficient PIXel-Precise TABle Structure Recognition Approach with Speculative Decoding and Region-Based Image Segmentationaccepted
  479. PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectoriesaccepted
  480. PMRNet: Physics-informed Multi-scale Refinement Network for Medical Image Segmentationaccepted
  481. POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generationaccepted
  482. POGA: Paraphrased and Oppositional Graph Alignment for Fine-Grained Cross-Modal Retrievalaccepted
  483. POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMsaccepted
  484. POLAR: A Portrait OLAT Dataset and Generative Framework for Illumination-Aware Face Modelingaccepted
  485. POUR: A Provably Optimal Method for Unlearning Representation via Neural Collapseaccepted
  486. PP-Brep: Few-Shot B-rep Classification with Hybrid Graph Representationaccepted
  487. PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasksaccepted
  488. PPISP: Physically-Plausible Compensation and Control of Photometric Variations in Radiance Field Reconstructionaccepted
  489. PPM-CLIP: Probabilistic Prompt Modeling for Generalizable AI-Generated Image Detectionaccepted
  490. PQDT: Pseudo-Query Dual Transformer for Robust Point Cloud Restorationaccepted
  491. PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesisaccepted
  492. PR-MaGIC: Prompt Refinement Via Mask Decoder Gradient Flow For In-Context Segmentationaccepted
  493. PRIMU: Uncertainty Estimation for Novel Views in Gaussian Splatting from Primitive-Based Representations of Error and Coverageaccepted
  494. PRISM: Learning a Shared Primitive Space for Transferable Skeleton Action Representationaccepted
  495. PRISM: Prototype-based Reasoning with Inter-modal Semantic Mining for Interpretable Image Recognitionaccepted
  496. PRISM: Video Dataset Condensation with Progressive Refinement and Insertion for Sparse Motionaccepted
  497. PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-Onaccepted
  498. PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and VLM-Guided Optimizationaccepted
  499. PRUE: A Practical Recipe for Field Boundary Segmentation at Scaleaccepted
  500. PS-SR: Pseudo-Single-Step Video Super-Resolution via Speculative Diffusionaccepted
  501. PSDesigner: Automated Graphic Design with a Human-Like Creative Workflowaccepted
  502. PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewardsaccepted
  503. PTC-Depth: Pose-Refined Monocular Depth Estimation with Temporal Consistencyaccepted
  504. PV-Ground: Text-Guided Point-Voxel Interaction for 3D Visual Groundingaccepted
  505. PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modelingaccepted
  506. PaNDaS: Learnable Shape Interpolation Modeling with Localized Controlaccepted
  507. PaQ-DETR: Learning Pattern and Quality-Aware Dynamic Queries for Object Detectionaccepted
  508. PackUV: Packed Gaussian UV Maps for 4D Volumetric Videoaccepted
  509. PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Drivingaccepted
  510. Pano360: Perspective to Panoramic Vision with Geometric Consistencyaccepted
  511. Pano3DComposer: Feed-Forward Compositional 3D Scene Generation from Single Panoramic Imageaccepted
  512. PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learningaccepted
  513. PanoVGGT: Feed-Forward 3D Reconstruction from Panoramic Imageryaccepted
  514. Pantheon360: Taming Digital Twin Generation via 3D-Aware 360deg Video Diffusionaccepted
  515. Paparazzo: Active Mapping of Moving 3D Objectsaccepted
  516. Paper2Figure: A Multi-Agent Collaborative System for Figure Generation Towards Academic Research Paperaccepted
  517. ParTY: Part-Guidance for Expressive Text-to-Motion Synthesisaccepted
  518. ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interactionaccepted
  519. Parallax to Align Them All: An OmniParallax Attention Mechanism for Distributed Multi-View Image Compressionaccepted
  520. Parallel Jacobi Decoding for Fast Autoregressive Image Generationaccepted
  521. Parallel Rigidity Matters for Bundle Adjustmentaccepted
  522. ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decodingaccepted
  523. Parallelised Differentiable Straightest Geodesics for 3D Meshesaccepted
  524. Parameter-Efficient Adaptation for MLLMs via Implicit Modality Decompositionaccepted
  525. Parameter-Efficient Semantic Augmentation for Enhancing Open-Vocabulary Object Detectionaccepted
  526. Parameter-efficient Continual Learning for Enhancing Plasticity without Forgetting under Limited Model Capacityaccepted
  527. Parameterized Prompt for Incremental Object Detectionaccepted
  528. ParkGaussian: Surround-view 3D Gaussian Splatting for Autonomous Parkingaccepted
  529. Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memoryaccepted
  530. Part$^{2}$GS: Part-aware Modeling of Articulated Objects using 3D Gaussian Splattingaccepted
  531. PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusionaccepted
  532. Partial Weakly-Supervised Oriented Object Detectionaccepted
  533. ParticleGS: Learning Neural Gaussian Particle Dynamics from Videos for Prior-free Physical Motion Extrapolationaccepted
  534. Particulate: Feed-Forward 3D Object Articulationaccepted
  535. PatchAlign3D: Local Feature Alignment for Dense 3D Shape Understandingaccepted
  536. PatchScene: Patch-based Voxel Diffusion Model for Large-Scale Scene Completionaccepted
  537. PercHead: Perceptual Head Model for Single-Image 3D Head Reconstruction & Editingaccepted
  538. Perceiving the Near, Reasoning the Distant: Coherent Long-Horizon Trajectory Prediction for Autonomous Drivingaccepted
  539. Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Drivingaccepted
  540. Perception Characteristics Distance: Measuring Stability and Robustness of Perception System in Dynamic Conditions under a Certain Decision Ruleaccepted
  541. Perceptual 3D Simulation With Physical World Modelingaccepted
  542. Perceptual Neural Video Compression with Color Separation and Rank Chainaccepted
  543. Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoningaccepted
  544. PerformRecast: Expression and Head Pose Disentanglement for Portrait Video Editingaccepted
  545. PerpetualWonder: Long-horizon Action-conditioned 4D Scene Generationaccepted
  546. PersonaLive! Expressive Portrait Image Animation for Live Streamingaccepted
  547. PersonaVLM: Long-Term Personalized Multimodal LLMsaccepted
  548. Personalized Federated Training of Diffusion Models with Privacy Guaranteesaccepted
  549. Personalized Image Descriptions from Attention Sequencesaccepted
  550. Personalized Longitudinal Medical Report Generation via Temporally-Aware Federated Adaptationaccepted
  551. PhaSR: Generalized Image Shadow Removal with Physically Aligned Priorsaccepted
  552. Phantom: Physical Object Interactions as Dynamic Triggers for NMS-Exploited Backdoorsaccepted
  553. PhaseWin Search Framework Enable Efficient Object-Level Interpretationaccepted
  554. Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervalsaccepted
  555. PhenoYieldNet: Learning Crop-Aware Phenological Responses for Multi-Crop Yield Predictionaccepted
  556. Photo-Guided Tooth Segmentation on 3D Oral Scan Modelaccepted
  557. Photo3D: Advancing Photorealistic 3D Generation through Structure-Aligned Detail Enhancementaccepted
  558. PhotoFramer: Multi-modal Image Composition Instructionaccepted
  559. Phrase-Grounding-Aware Supervised Fine-Tuning for Chart Recognition via Side-Masked Attentionaccepted
  560. Phrase-grounded APO for Improving Chest X-ray Report Generationaccepted
  561. PhyCo: Learning Controllable Physical Priors for Generative Motionaccepted
  562. PhyCritic: Multimodal Critic Models for Physical AIaccepted
  563. PhyGaP: Physically-Grounded Gaussians with Polarization Cuesaccepted
  564. PhyOceanCast: Global Ocean Forecasting with Physics-Informed Diffusionaccepted
  565. PhysGM: Large Physical Gaussian Model for Feed-Forward 4D Synthesisaccepted
  566. PhysGS: Bayesian-Inferred Gaussian Splatting for Physical Property Estimationaccepted
  567. PhysGaia: A Physics-aware Benchmark with Multi-Body Interactions for Dynamic Novel View Synthesisaccepted
  568. PhysGen: Physically Grounded 3D Shape Generation for Industrial Designaccepted
  569. PhysHO: Physics-Based Dynamic 3D Gaussian Human and Object from Monocular Videoaccepted
  570. PhysHead: Simulation-Ready Gaussian Head Avatarsaccepted
  571. PhysIR-Splat: Physically Consistent Thermal Infrared Radiative Transfer in 3D Gaussian Splattingaccepted
  572. PhysInOne: Visual Physics Learning and Reasoning in One Suiteaccepted
  573. PhysSkin: Real-Time and Generalizable Physics-Based Animation via Self-Supervised Neural Skinningaccepted
  574. PhysVid: Physics Aware Local Conditioning for Generative Video Modelsaccepted
  575. PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Imageaccepted
  576. Physical Adversarial Clothing Evades Visible-Thermal Detectors via Non-Overlapping RGB-T Patternaccepted
  577. Physical Object Understanding with a Physically Controllable World Modelaccepted
  578. Physical Simulator In-the-Loop Video Generationaccepted
  579. Physically Ground Commonsense Knowledge for Articulated Object Manipulation with Analytic Conceptsaccepted
  580. Physically Inspired Gaussian Splatting for HDR Novel View Synthesisaccepted
  581. Physically-Grounded Turbulence Mitigation with Frame-Shared Degradation Parametersaccepted
  582. Physics-Consistent Diffusion for Efficient Fluid Super-Resolution via Multiscale Residual Correctionaccepted
  583. Physics-Guided Multistep Deformation Reversal for Ancient Bamboo Slip Restorationaccepted
  584. PiLoT: Neural Pixel-to-3D Registration for UAV-based Ego and Target Geo-localizationaccepted
  585. Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editingaccepted
  586. PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testingaccepted
  587. Pip-Stereo: Progressive Iterations Pruner for Iterative Optimization based Stereo Matchingaccepted
  588. PixARMesh: Autoregressive Mesh-Native Single-View Scene Reconstructionaccepted
  589. PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentationaccepted
  590. Pixel Motion Diffusion is What We Need for Robot Controlaccepted
  591. Pixel2Phys: Distilling Governing Laws from Visual Dynamicsaccepted
  592. PixelDiT: Pixel Diffusion Transformers for Image Generationaccepted
  593. PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusionaccepted
  594. Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervisionaccepted
  595. PlanaReLoc: Camera Relocalization in 3D Planar Primitives via Region-Based Structure Matchingaccepted
  596. PlannerRFT: Reinforcing Diffusion Planners through Closed-Loop and Sample-Efficient Fine-Tuningaccepted
  597. Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Modelaccepted
  598. Plant Taxonomy Meets Plant Counting: A Fine-Grained, Taxonomic Dataset for Counting Hundreds of Plant Speciesaccepted
  599. Plenoptic Video Generationaccepted
  600. Plug-and-Play Incomplete Multi-View Clustering via Janus-Faced Affinity Learning with Topology Harmonizationaccepted
  601. Plug-and-Play PDE Optimization for 3D Gaussian Splatting: Toward High-Quality Rendering and Reconstructionaccepted
  602. Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformersaccepted
  603. PnP-CM: Consistency Models as Plug-and-Play Priors for Inverse Problemsaccepted
  604. PoInit-of-View: Poisoning Initialization of Views Transfers Across Multiple 3D Reconstruction Systemsaccepted
  605. Point Cloud as a Foreign Language for Multi-modal Large Language Modelaccepted
  606. Point4Cast: Streaming Dynamic Scene Reconstruction and Forecastingaccepted
  607. PointAlign: Feature-Level Alignment Regularization for 3D Vision-Language Modelsaccepted
  608. PointCNN++: Performant Convolution on Native Pointsaccepted
  609. PointCSP: Cross-Sample Semantic Propagation and Stability Preservation in Self-Supervised Point Cloud Learningaccepted
  610. PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splattingaccepted
  611. PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Predictionaccepted
  612. PointTPA: Dynamic Network Parameter Adaptation for 3D Scene Understandingaccepted
  613. PointThinker: Point-Incentivized Parallel Thinking for Multimodal Large Language Modelaccepted
  614. PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulationaccepted
  615. Pointer-CAD: Unifying B-Rep and Command Sequences via Pointer-based Edges & Faces Selectionaccepted
  616. Pointing at Parts: Training-Free Few-Shot Grounding in Multimodal LLMsaccepted
  617. Points-to-3D: Structure-Aware 3D Generation with Point Cloud Priorsaccepted
  618. PolarGuide-GSDR: 3D Gaussian Splatting Driven by Polarization Priors and Deferred Reflection for Real-World Reflective Scenesaccepted
  619. Polarization State Tracing for Reflection Removal and Color-Consistent Reconstructionaccepted
  620. PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interactionaccepted
  621. Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioningaccepted
  622. Portable Active Learning for Object Detectionaccepted
  623. PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactmentaccepted
  624. Pose-Free Omnidirectional Gaussian Splatting for 360-Degree Videos with Consistent Depth Priorsaccepted
  625. Pose-guided Enriched Feature Learning for Federated-by-camera Person Re-identificationaccepted
  626. PoseAnything: General Pose-guided Video Generation with Part-aware Temporal Coherenceaccepted
  627. PoseD-Flow: Versatile and Guided Flow Matching Model of Human Poseaccepted
  628. PoseGAM: Robust Unseen Object Pose Estimation via Geometry-Aware Multi-View Reasoningaccepted
  629. PoseGaussian: 6D Pose Estimation for Unseen Objects via Sparse-View Object-Level 3D Gaussian Splattingaccepted
  630. PoseMaster: A Unified 3D Native Framework for Stylized Pose Generationaccepted
  631. PositionIC: Unified Position and Identity Consistency for Image Customizationaccepted
  632. Post-training Feature Pruning for Fundus Images Classificationaccepted
  633. PosterIQ: A Design Perspective Benchmark for Poster Understanding and Generationaccepted
  634. PosterOmni: Generalized Artistic Poster Creation via Task Distillation and Unified Reward Feedbackaccepted
  635. PosterReward: Unlocking Accurate Evaluation for High-Quality Graphic Design Generationaccepted
  636. PowerCLIP: Powerset Alignment for Contrastive Pre-Trainingaccepted
  637. PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenesaccepted
  638. Precise Object and Effect Removal with Adaptive Target-Aware Attentionaccepted
  639. Predict Before You Explore: Predictive Planning with Specialized Memory for Embodied Question Answeringaccepted
  640. Predicting Spatial Transcriptomics from Histology Images via High-Order Multi-Cell Interaction Modelingaccepted
  641. Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Modelsaccepted
  642. Preference-Aligned LoRA Merging: Preserving Subspace Coverage and Addressing Directional Anisotropyaccepted
  643. Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Modelsaccepted
  644. Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generationaccepted
  645. Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Qualityaccepted
  646. Pressure2Motion: Hierarchical Human Motion Reconstruction from Ground Pressure with Text Guidanceaccepted
  647. PriVi: Towards a General-Purpose Video Model for Primate Behavior in the Wildaccepted
  648. Prime Once, then Reprogram Locally: An Efficient Alternative to Black-Box Service Model Adaptationaccepted
  649. Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Modelsaccepted
  650. PrivSynth: Alternating and Control-Based Optimization for Privacy and Utility in Synthetic Dataaccepted
  651. PrivateEyes: Gaze-Preserving Anonymization for Data Sharingaccepted
  652. ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigationaccepted
  653. ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecologyaccepted
  654. ProOOD: Prototype-Guided Out-of-Distribution 3D Occupancy Predictionaccepted
  655. ProPhy: Progressive Physical Alignment for Dynamic World Simulationaccepted
  656. ProSoftArena: Benchmarking Hierarchical Capabilities of Multi-modal Agents in Professional Software Environmentsaccepted
  657. ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence On Mobile Devicesaccepted
  658. Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detectionaccepted
  659. Probabilistic Discrepancy Learning for Roadside LiDAR Scene Completionaccepted
  660. Probabilistic Precipitation Nowcasting with Rectified Flow Transformersaccepted
  661. Probabilistic Prompt Adaptation for Unified Image Aesthetics and Quality Assessmentaccepted
  662. Probing and Bridging Geometry-Interaction Cues for Affordance Reasoning in Vision Foundation Modelsaccepted
  663. ProcessMaker: A Generalized Process Visualization Framework with Adaptive Sequence Steps on Diffusion Transformersaccepted
  664. ProgTrack: A Multi-Object Tracking Algorithm with Progressive Matching Strategyaccepted
  665. Progress by Pieces: Test-Time Scaling for Autoregressive Image Generationaccepted
  666. Progress-Think: Semantic Progress Reasoning for Vision-Language Navigationaccepted
  667. Progressive Cross-Modal Causal Intervention for Long-Term Action Recognitionaccepted
  668. Progressive Guessing to Fixed Point: Rethinking Human Motion Prediction with Deep Equilibrium Modelsaccepted
  669. Progressive Mask Distillation for Self-supervised Video Representationaccepted
  670. Progressive Multi-cue Alignment for Unaligned RGBT Trackingaccepted
  671. Progressive Neural Architecture Generationaccepted
  672. Progressive Supernet Training for Efficient Visual Autoregressive Modelingaccepted
  673. ProgressiveAvatars: Progressive Animatable 3D Gaussian Avatarsaccepted
  674. ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Controlaccepted
  675. Prompt Yourself: Awakening Textual Semantics in 1D Visual Tokenizersaccepted
  676. Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identificationaccepted
  677. Prompt-Free Universal Region Proposal Networkaccepted
  678. Prompt-Free Unknown Label Generation for Open World Detection in Remote Sensingaccepted
  679. PromptDepth: Efficient and Promptable Geometric 3D Vision Model for Embodied Intelligenceaccepted
  680. PromptEnhancer: Taming Your Rewriter for Text-to-Image Generation via Fine-Grained Rewardaccepted
  681. PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignmentaccepted
  682. PromptMoE: A Segmentation Refinement Framework Leveraging Mixture of Experts for Improved Promptingaccepted
  683. PromptStereo: Zero-Shot Stereo Matching via Structure and Motion Promptsaccepted
  684. Proof-of-Perception: Certified Tool-Using Multimodal Reasoning with Compositional Conformal Guaranteesaccepted
  685. PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Modelsaccepted
  686. Property-Informed Diffusion-Based Text-to-Microstructure Generationaccepted
  687. Prospective Dynamic 3D MRI Reconstruction via Latent-Space Motion Tracking from Single Measurementaccepted
  688. Protect to Adapt: Orthogonal Subspace Control with Ranked Negative-Prompt Curriculum for Few-Shot Action Recognitionaccepted
  689. Protego: User-Centric Pose-Invariant Privacy Protection Against Face Recognition-Induced Digital Footprint Exposureaccepted
  690. Prototype-Guided Concept Erasure in Diffusion Modelsaccepted
  691. Prototype-as-Prompt: Multimodal Sentiment Prototypes Endowing Large Language Models the Capability to Perform Multimodal Sentiment Analysisaccepted
  692. Prototype-based Causal Intervention for Multi-Label Image Classificationaccepted
  693. Prototypical Action Reasoning Facilitated by Vision-Language Alignment for Egocentric Action Anticipationaccepted
  694. Proxy-GS: Unified Occlusion Priors for Training and Inference in Structured 3D Gaussian Splattingaccepted
  695. Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generationaccepted
  696. Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignmentaccepted
  697. ProxyFL: A Proxy-Guided Framework for Federated Semi-Supervised Learningaccepted
  698. Prune Wisely, Reconstruct Sharply: Compact 3D Gaussian Splatting via Adaptive Pruning and Difference-of-Gaussian Primitivesaccepted
  699. Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Drivingaccepted
  700. PureCC: Pure Learning for Text-to-Image Concept Customizationaccepted
  701. PureProof: Diffusion-Resistant Black-box Targeted Attack on Large Vision-Language Modelsaccepted
  702. Push-and-Step: From RL-Based Balance Recovery to Physical Simulation of Dense Crowdsaccepted
  703. Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learningaccepted
  704. PvP: Data-Efficient Humanoid Robot Learning with Proprioceptive-Privileged Contrastive Representationsaccepted
  705. PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generationaccepted
  706. PyramidalWan: On Making Pretrained Video Model Pyramidal for Efficient Inferenceaccepted
  707. QD-PCQA: Quality-Aware Domain Adaptation for Point Cloud Quality Assessmentaccepted
  708. QUANTIPHY: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Modelsaccepted
  709. QVGGT: Post-Training Quantized Visual Geometry Grounded Transformeraccepted
  710. QuCNet: Quantum Deep Learning Driven Multi-Circuit Network for Remote Sensing Image Classificationaccepted
  711. QuadSync: Quadrifocal Tensor Synchronization via Tucker Decompositionaccepted
  712. Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantizationaccepted
  713. QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Modelsaccepted
  714. Quantized Residuals to Continuous Prompts for Few-Shot Class Incremental Learning in Vision-Language Modelsaccepted
  715. Quantum-Gated Task-interaction Knowledge Distillation for Pre-trained Model-based Class-Incremental Learningaccepted
  716. Query2Uncertainty: Robust Uncertainty Quantification and Calibration for 3D Object Detection under Distribution Shiftaccepted
  717. QueryMe: Query-Driven Open-Vocabulary 3D Object Affordances Grounding from Multimodal Evidenceaccepted
  718. QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancyaccepted
  719. Question-guided Visual Compression with Memory Feedback for Long-Term Video Understandingaccepted
  720. QuietPrune: Query-Guided Early Token Pruning for Vision-Language Modelsaccepted
  721. Quota-Calibrated Fine-Grained Alignment with Context-Aware Marginals for Text-based Person Retrievalaccepted
  722. Qwen-Image-Layered: Towards Inherent Editability via Layer Decompositionaccepted
  723. R$^2$TUA: Reconstruction-residual Based Targeted and Untargeted Attack Against Text-Image Person Re-Identificationaccepted
  724. R-4B: Incentivizing General-Purpose Auto-Thinking in MLLMs via Bi-Mode Annealing and Reinforce Learningaccepted
  725. R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoningaccepted
  726. R2-Seg: Training-Free OOD Medical Tumor Segmentation via Anatomical Reasoning and Statistical Rejectionaccepted
  727. R2G: A Multi-View Circuit Graph Benchmark Suite from RTL to GDSIIaccepted
  728. R3-PCQA: Ray-Reprojection-Reinforcement for No-Reference 3D Point Cloud Quality Assessmentaccepted
  729. R4-CGQA: Retrieval-based Vision Language Models for Computer Graphics Image Quality Assessmentaccepted
  730. R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Spaceaccepted
  731. R4Det: 4D Radar-Camera Fusion for High-Performance 3D Object Detectionaccepted
  732. RAAS: LLM Agentic System Architecture Search with GRPOaccepted
  733. RADAR: VQ-VAE Decoder of VAR is a Good Student for Restoring Against Degradation by Accelerationaccepted
  734. RAG-TP: A General Framework for Vehicle Trajectory Prediction via Retrieval-Augmented Generationaccepted
  735. RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generationaccepted
  736. RAID: Retrieval-Augmented Anomaly Detectionaccepted
  737. RAISE: Requirement-Adaptive Evolutionary Refinement for Training-Free Text-to-Image Alignmentaccepted
  738. RAM: Recover Any 3D Human Motion in-the-Wildaccepted
  739. RAMEN: Resolution-Adjustable Multimodal Encoder for Earth Observationaccepted
  740. RAP: Fast Feedforward Rendering-Free Attribute-Guided Primitive Importance Score Prediction for Efficient 3D Gaussian Splatting Processingaccepted
  741. RAPID: Reusing Attention Sparsity with Inter-step Adaptation for Efficient Video Diffusionaccepted
  742. RARE: Learn to RAnk and REtrieve for Monocular 3D Object Detectionaccepted
  743. RAVEN: Erasing Invisible Watermarks via Novel View Synthesisaccepted
  744. RAVEN: Radar Adaptive Vision Encoders for Efficient Chirp-wise Object Detection and Segmentationaccepted
  745. RAW-Domain Degradation Models for Realistic Smartphone Super-Resolutionaccepted
  746. RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Spaceaccepted
  747. RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulationaccepted
  748. RDF-MIG: A Robust Diffusion Framework for Masked Image Generation to Augment Semantic Segmentation and Change Detectionaccepted
  749. RDFace: A Benchmark Dataset for Rare Disease Facial Image Analysis under Extreme Data Scarcity and Phenotype-Aware Synthetic Generationaccepted
  750. RE-VLM: Event-Augmented Vision-Language Model for Scene Understandingaccepted
  751. REACH: Explicit Recovery Behavior for Diffusion Policiesaccepted
  752. REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splattingaccepted
  753. REArtGS++: Generalizable Articulation Reconstruction with Temporal Geometry Constraint via Planar Gaussian Splattingaccepted
  754. RECS4R: Bridging Semantics and Geometry for Referring Remote Sensing Interpretationaccepted
  755. REL-SF4PASS: Panoramic Semantic Segmentation with REL Depth Representation and Spherical Fusionaccepted
  756. REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understandingaccepted
  757. REVIVE 3D: Refinement via Encoded Voluminous Inflated prior for Volume Enhancementaccepted
  758. RF4D:Neural Radar Fields for Novel View Synthesis in Outdoor Dynamic Scenesaccepted
  759. RFDM: Residual Flow Diffusion Models for Video Editingaccepted
  760. RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Frameworkaccepted
  761. RHCNet: Residual-Guided Hierarchical Calibration Network for Robust Underwater Object Detectionaccepted
  762. RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videosaccepted
  763. RHO: Robust Holistic OSM-Based Metric Cross-View Geo-Localizationaccepted
  764. RI-Mamba: Rotation-Invariant Mamba for Robust Text-to-Shape Retrievalaccepted
  765. RINO: Rotation-Invariant Non-Rigid Correspondencesaccepted
  766. RISE: Single Static Radar-based Indoor Scene Understandingaccepted
  767. RL-ScanIQA: Reinforcement-Learned Scanpaths for Blind 360deg Image Quality Assessmentaccepted
  768. RLFTSim: Realistic and Controllable Multi-Agent Traffic Simulation via Reinforcement Learning Fine-Tuningaccepted
  769. RMAE-ProGRess: Advancing Semantic Segmentation in Unstructured Environmentsaccepted
  770. RMIR: A Benchmark Dataset for Reasoning-Intensive Multimodal Image Retrievalaccepted
  771. RNED: Rotary Number Encoding and Decoding for Medical VLMsaccepted
  772. RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Modelsaccepted
  773. ROSE: Rotate Your Large Language Model to Seeaccepted
  774. RPGFusion: 4D Radar Prior-Guided Multi-Modal Fusion for 3D Detectionaccepted
  775. RS-SSM: Refining Forgotten Specifics in State Space Model for Video Semantic Segmentationaccepted
  776. RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splattingaccepted
  777. RaGS: Unleashing 3D Gaussian Splatting from 4D Radar and Monocular Cue for 3D Object Detectionaccepted
  778. RaPA: Enhancing Transferable Targeted Attacks via Random Parameter Pruningaccepted
  779. RaUF: Learning the Spatial Uncertainty Field of Radaraccepted
  780. Radar-Guided Polynomial Fitting for Metric Depth Estimationaccepted
  781. Radiance Meshes for Volumetric Reconstructionaccepted
  782. Random Wins All: Rethinking Grouping Strategies for Vision Tokensaccepted
  783. Rank-Guided Pseudo-Bias Learning for Robust Black-Box Adaptationaccepted
  784. RankOOD - Class Ranking-based Out-of-Distribution Detectionaccepted
  785. Rascene: High-Fidelity 3D Scene Imaging with mmWave Communication Signalsaccepted
  786. Rationale-Enhanced Decoding for Multi-modal Chain-of-Thoughtaccepted
  787. RawMetaDiff: Unlocking Extreme Darkness from Dual-Exposure RAW with Meta-Guided Diffusionaccepted
  788. Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editingaccepted
  789. Re-evaluating Continual VQA: Toward Fair and Robust Evaluation for Multimodal Continual Learningaccepted
  790. ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answeringaccepted
  791. ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representationaccepted
  792. ReAttnCLIP: Training-Free Open-Vocabulary Remote Sensing Image Segmentation via Re-defined Attention in CLIPaccepted
  793. ReBaPL: Repulsive Bayesian Prompt Learningaccepted
  794. ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrievalaccepted
  795. ReCoFuse: Ultra-Robust Image Fusion via Restorative Multi-Modal Diffusion Reciprocal Couplingaccepted
  796. ReDirector: Creating Any-Length Video Retakes with Rotary Camera Encodingaccepted
  797. ReFAct: Empowering Multimodal Web Agents with Visual and Context Focusingaccepted
  798. ReFTA: Breaking the Weight Reconstruction Bottleneck in Tensorized Parameter-Efficient Fine-Tuningaccepted
  799. ReFlow: Self-correction Motion Learning for Dynamic Scene Reconstructionaccepted
  800. ReGenHOI: Unifying Reconstruction and Generation for 3D Human-Object Interaction Understandingaccepted
  801. ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformersaccepted
  802. ReLaGS: Relational Language Gaussian Splattingaccepted
  803. ReLaX: Reasoning with Latent Exploration for Large Reasoning Modelsaccepted
  804. ReManNet: A Riemannian Manifold Network for Monocular 3D Lane Detectionaccepted
  805. ReMatch: Boosting Representation through Matching for Multimodal Retrievalaccepted
  806. ReMoE: Region-Mixture Experts for Adversarially-Robust Vision Transformersaccepted
  807. ReMoGen: Real-time Human Interaction-to-Reaction Generation via Modular Learning from Diverse Dataaccepted
  808. ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understandingaccepted
  809. ReMoT: Reinforcement Learning with Motion Contrast Tripletsaccepted
  810. ReSAM: Refine, Requery, and Reinforce: Self-Prompting Point-Supervised Segmentation for Remote Sensing Imagesaccepted
  811. ReScene4D: Temporally Consistent Semantic Instance Segmentation of Evolving Indoor 3D Scenesaccepted
  812. ReWeaver: Towards Simulation-Ready and Topology-Accurate Garment Reconstructionaccepted
  813. ReaGEN: Adaptive Generation of Structured Chains-of-Thought for Efficient Multimodal Reasoningaccepted
  814. Reading Your Actions: Learning Generalizable Action Representations via Pre-training AEMGaccepted
  815. Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCRaccepted
  816. Real-Time Dynamic Scene Rendering with Controlled Compressibility and Contact Awarenessaccepted
  817. Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEsaccepted
  818. Real-Time Long Horizon Air Quality Forecasting via Group-Relative Policy Optimizationaccepted
  819. Real-Time Multimodal Fingertip Contact Detection via Depth and Motion Fusion for Vision-Based Human-Computer Interactionaccepted
  820. Real-Time Neural Video Compression with Unified Intra and Inter Codingaccepted
  821. Real-World Point Tracking with Verifier-Guided Pseudo-Labelingaccepted
  822. Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interfaceaccepted
  823. Real2Sim2Real: RetinalDepth-64K for Depth Estimation in Posterior Segment Ophthalmic Surgeryaccepted
  824. RealAppiance: Let High-fidelity Appliance Assets Controllable and Workable as Aligned Real Manaulsaccepted
  825. RealBirdID: Benchmarking Bird Species Identification in the Era of MLLMsaccepted
  826. RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmarkaccepted
  827. RealVLG-R1: A Large-Scale Real-World Visual-Language Grounding Benchmark for Robotic Perception and Manipulationaccepted
  828. Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learningaccepted
  829. Reallocating Attention Across Layers to Reduce Multimodal Hallucinationaccepted
  830. ReasonEdit: Towards Reasoning-Enhanced Image Editing Modelsaccepted
  831. ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Mapsaccepted
  832. ReasonX: MLLM-Guided Intrinsic Image Decompositionaccepted
  833. Reasoning Diffusion for Unpaired Test Time Out-of-distribution Text-Image to Video Generationaccepted
  834. Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMsaccepted
  835. Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervisionaccepted
  836. RebRL: Reinforcing Discrete Visual Diffusion Models with Rebalanced Timestep Creditsaccepted
  837. RecEdit-Drive: 3D Reconstruction-Guided Spatiotemporal Video Editing for Autonomous Driving Scenesaccepted
  838. RecTok: Reconstruction Distillation along Rectified Flowaccepted
  839. Reclaiming Lost Text Layers for Source-Free Cross-Domain Few-Shot Learningaccepted
  840. Reconstructing CLIP for Open-Vocabulary Dense Perceptionaccepted
  841. Reconstructing Spiking Neural Networks Using a Single Neuron with Autapsesaccepted
  842. Reconstruction-Guided Slot Curriculum: Addressing Object Over-Fragmentation in Video Object-Centric Learningaccepted
  843. Recover to Predict: Progressive Retrospective Learning for Variable-Length Trajectory Predictionaccepted
  844. RecoverMark: Robust Watermarking for Localization and Recovery of Manipulated Facesaccepted
  845. Recovering Physically Plausible Human-Object Interactions from Monocular Videosaccepted
  846. Rectifying Latent Space for Generative Single-Image Reflection Removalaccepted
  847. Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progressaccepted
  848. Recurrent Video Masked Autoencodersaccepted
  849. Red-teaming Retrieval-Augmented Diffusion Models via Poisoning Knowledge Basesaccepted
  850. Reevaluating the Intra-Modal Misalignment Hypothesis in CLIPaccepted
  851. Ref4D-VideoBench: Four-Dimensional Reference-Based Evaluation of Text-to-Video Generative Modelsaccepted
  852. RefAV: Towards Planning-Centric Scenario Miningaccepted
  853. RefTon: Reference person shot assist virtual Try-onaccepted
  854. Refacade: Editing Object with Given Reference Textureaccepted
  855. Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentationaccepted
  856. Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learningaccepted
  857. Reflection Separation from a Single Image via Joint Latent Diffusionaccepted
  858. ReflexSplit: Single Image Reflection Separation via Layer Fusion-Separationaccepted
  859. Refracting Reality: Generating Images with Realistic Transparent Objectsaccepted
  860. Reframing Long-Tailed Learning via Loss Landscape Geometryaccepted
  861. RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detectionaccepted
  862. Region-Adaptive Sampling for Diffusion Transformersaccepted
  863. Region-Aware Instance Consistency Learning for Micro-Expression Recognitionaccepted
  864. Region-Wise Correspondence Prediction between Manga Line Art Imagesaccepted
  865. RegionFuse: Region-Adaptive Pixel Distribution Learning for Infrared and Visible Image Fusionaccepted
  866. RegionRoute: Regional Style Transfer with Diffusion Modelaccepted
  867. Registration-Free Learnable Multi-View Capture of Faces in Dense Semantic Correspondenceaccepted
  868. Regulating Rather than Constraining: Adaptive Guidance for Complex Spectral Reconstruction in Pansharpeningaccepted
  869. RehearseVLA: Simulated Post-Training for VLAs with Physically-Consistent World Modelaccepted
  870. Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoningaccepted
  871. Reinforcement-Guided Synthetic Data Generation for Privacy-Sensitive Identity Recognitionaccepted
  872. Reinforcing Structured Chain-of-Thought for Video Understandingaccepted
  873. Reinforcing Video Object Segmentation to Think before it Segmentsaccepted
  874. Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inferenceaccepted
  875. Rel-Zero: Harnessing Patch-Pair Invariance for Robust Zero-Watermarking Against AI Editingaccepted
  876. Relational Visual Similarityaccepted
  877. Reliable Clustering Number Estimation for Contrastive Multi-View Clusteringaccepted
  878. Reliable Policy Transfer for Safety-Aware End-to-End Driving with Deep Reinforcement Learningaccepted
  879. Reliev3R: Relieving Feed-forward 3D Reconstruction from Multi-View Geometric Annotationsaccepted
  880. RelightAnyone: A Generalized Relightable 3D Gaussian Head Modelaccepted
  881. Relightable Holoported Characters: Capturing and Relighting Dynamic Human Performance from Sparse Viewsaccepted
  882. Relightful Video Portrait Harmonizationaccepted
  883. RemedyGS: Defend 3D Gaussian Splatting Against Computation Cost Attacksaccepted
  884. Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detectionaccepted
  885. Remote Sensing Image Super-Resolution for Imbalanced Textures: A Texture-Aware Diffusion Frameworkaccepted
  886. Render-to-Adapt: Unsupervised Personal Adaptation for Gaze Estimationaccepted
  887. RenderFlow: Single-Step Neural Rendering via Flow Matchingaccepted
  888. Reparameterized Tensor Ring Functional Decomposition for Multi-Dimensional Data Recoveryaccepted
  889. Representation-Steered Incremental Adapter-Tuning for Class-Incremental Learning with Pre-Trained Modelsaccepted
  890. Representing 3D Faces with Learnable B-Spline Volumesaccepted
  891. Repurposing 3D Generative Model for Autoregressive Layout Generationaccepted
  892. ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Drivingaccepted
  893. ResCa: Residual Caching for Diffusion Transformers Accelerationaccepted
  894. ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformersaccepted
  895. ResiHMR: Residual-Limb Aware Single-Image 3D Human Mesh Recovery for Individuals with Limb Lossaccepted
  896. Residual Connections Harm Generative Representation Learningaccepted
  897. Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Renderingaccepted
  898. Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidanceaccepted
  899. Residual Diffusion Bridge Model for Image Restorationaccepted
  900. Residual Primitive Fitting of 3D Shapes with SuperFrustaaccepted
  901. Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignmentaccepted
  902. Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understandingaccepted
  903. Resolving the Identity Crisis in Text-to-Image Generationaccepted
  904. Resolving the Stability-Plasticity Dilemma in Reinforcement Learning via Complementary Continual Criticsaccepted
  905. Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidanceaccepted
  906. Restore, Assess, Repeat: A Unified Framework for Iterative Image Restorationaccepted
  907. RetFormer: Multimodal Retrieval for Enhancing Image Recognitionaccepted
  908. Rethinking 2D-3D Registration: A Novel Network for High-Value Zone Selection and Representation Consistency Alignmentaccepted
  909. Rethinking Asymmetric Quantization: Hidden Symmetry in Vision Model Weightsaccepted
  910. Rethinking BCE Loss for Multi-Label Image Recognition with Fine-Tuningaccepted
  911. Rethinking Box Supervision: Bias-Free Weakly Supervised Medical Segmentationaccepted
  912. Rethinking Camera Choice: An Empirical Study on Fisheye Camera Properties in Robotic Manipulationaccepted
  913. Rethinking Concept Bottleneck Models: From Pitfalls to Solutionsaccepted
  914. Rethinking Cross-Modal Anchor Alignment for Mitigating Error Accumulationaccepted
  915. Rethinking Dataset Distillation: Hard Truths about Soft Labelsaccepted
  916. Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Featuresaccepted
  917. Rethinking Glyph Spatial Information in Font Generationaccepted
  918. Rethinking Intermediate Representation for VLM-based Robot Manipulationaccepted
  919. Rethinking Knowledge Transfer in Image Quality Assessment: A Perceptual Preference Structure Alignment Perspectiveaccepted
  920. Rethinking MLLM Itself as a Segmenter with a Single Segmentation Tokenaccepted
  921. Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distanceaccepted
  922. Rethinking Occlusion Modeling for UAV Trackingaccepted
  923. Rethinking Pose Refinement in 3D Gaussian Splatting under Pose Prior and Geometric Uncertaintyaccepted
  924. Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generationaccepted
  925. Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generationaccepted
  926. Rethinking SNN Online Training and Deployment: Gradient-Coherent Learning via Hybrid-Driven LIF Modelaccepted
  927. Rethinking Token Reduction for Large Vision-Language Modelsaccepted
  928. Rethinking Two-Stage Referring-by-Tracking in Referring Multi-Object Tracking: Make it Strong Againaccepted
  929. Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-trainingaccepted
  930. Rethinking Visual Rearrangement from A Diffusion Perspectiveaccepted
  931. RetimeGS: Continuous-Time Reconstruction of 4D Gaussian Splattingaccepted
  932. RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Rewardaccepted
  933. Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation?accepted
  934. Retrieve-to-Restore: Efficient All-in-One Image Restoration with a Retrieval-Based Degradation Bankaccepted
  935. Retrieving Counterfactuals Improves Visual In-Context Learningaccepted
  936. RevINN: An End-to-End Invertible Neural Network for Reversible Adversarial Examples Generationaccepted
  937. Revisiting 2D Foundation Models for Scalable 3D Medical Image Classificationaccepted
  938. Revisiting 3D Reconstruction Kernels as Low-Pass Filtersaccepted
  939. Revisiting F-measure Optimization in Multi-Label Classification: A Sampling-based Approachaccepted
  940. Revisiting Geometric Obfuscation with Dual Convergent Lines for Privacy-Preserving Image Queries in Visual Localizationaccepted
  941. Revisiting Learning with Noisy Labels: Active Forgetting and Noise Suppressionaccepted
  942. Revisiting Model Stitching In the Foundation Model Eraaccepted
  943. Revisiting Monocular SLAM with Spatio-Temporal Scene Modelingaccepted
  944. Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approachaccepted
  945. Revisiting Optimal Coding for I-ToF under Practical Sensor Constraintsaccepted
  946. Revisiting Pose Sensitivity in Splat-based Computed Tomography under Sparse-view Reconstructionaccepted
  947. Revisiting Sparsity Constraint Under High-Rank Property in Partial Multi-Label Learningaccepted
  948. Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectorsaccepted
  949. Revisiting Unknowns: Towards Effective and Efficient Open-Set Active Learningaccepted
  950. Revisiting Visual Corruptions in LVLMs: A Shape-Texture Perspective on Model Failuresaccepted
  951. Revisiting the Necessity of Full Accuracy: Weakly Supervised Object-Level Offset Correction for Misaligned Building Labelsaccepted
  952. Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalizationaccepted
  953. Reviving ConvNeXt for Efficient Convolutional Diffusion Modelsaccepted
  954. Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillationaccepted
  955. Reward Sharpness-Aware Fine-Tuning for Diffusion Modelsaccepted
  956. RewardFlow: Generate Images by Optimizing What You Rewardaccepted
  957. Rewis3d: Reconstruction Improves Weakly-Supervised Semantic Segmentationaccepted
  958. RigMo: Unifying Rig and Motion Learning for Generative Animationaccepted
  959. RiskProp: Collision-Anchored Self-Supervised Risk Propagation For Early Accident Anticipationaccepted
  960. RnG: A Unified Transformer for Complete 3D Modeling from Partial Observationsaccepted
  961. RoMo: A Large-Scale, Richly Organized Dataset and Semantic Taxonomy for Human Motion Generationaccepted
  962. RoSAMDepth: Robust Self-supervised Depth Estimation Leveraging Segment Anything Modelaccepted
  963. RoadGIE: Towards A Global-Scale Aerial Benchmark for Generalizable Interactive Road Extractionaccepted
  964. RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understandingaccepted
  965. Robo-SGG: Exploiting Layout-Oriented Normalization and Restitution Can Improve Robust Scene Graph Generationaccepted
  966. RoboAgent: Chaining Basic Capabilities for Embodied Task Planningaccepted
  967. RoboTAG: End-to-end Robot Pose Estimation via Topological Alignment Graphaccepted
  968. RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learningaccepted
  969. RobotSeg: A Model and Dataset for Segmenting Robots in Image and Videoaccepted
  970. Robust Promptable Video Object Segmentationaccepted
  971. Robust Remote Sensing Image-Text Retrieval with Noisy Correspondenceaccepted
  972. Robust Spiking Neural Networks by Temporal Mutual Informationaccepted
  973. Robust3DGSW: Toward Robust Watermarking for Quantization-Aware 3D Gaussian Splattingaccepted
  974. RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradationsaccepted
  975. Robustness Under Data Scarcity: Few-Shot Continual Adversarial Training for Evolving Threatsaccepted
  976. Role-SynthCLIP: A Role-Play Driven Diverse Synthetic Data Approachaccepted
  977. Roots Beneath the Cut: Uncovering the Risk of Concept Revival in Pruning-Based Unlearning for Diffusion Modelsaccepted
  978. Rosetta Stone For Unified MLLMs: A Unified Tokenizer to Decipher Understanding and Generationaccepted
  979. Rotation Invariant and Symmetry Aware Pixel Difference Network for Remote Sensing Object Detectionaccepted
  980. Rounded or Streamlined Head? Bridging Concept Bottleneck Models and Attribute-Described Object Partsaccepted
  981. Routing on Demand: DSNet for Efficient Progressive Point Cloud Denoisingaccepted
  982. RunawayEvil: Jailbreaking the Image-to-Video Generative Modelsaccepted
  983. RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioningaccepted
  984. S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidanceaccepted
  985. S$^2$AM3D: Scale-controllable Part Segmentation of 3D Point Cloudsaccepted
  986. S2C2Seg: Semantic-Spatial Consistency and Category Optimization for Open-Vocabulary Segmentationaccepted
  987. S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activationsaccepted
  988. S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal Inputsaccepted
  989. S2FT: Parameter-Efficient Fine-Tuning in Sparse Spectrum Domainaccepted
  990. SABER: Spatially Consistent 3D Universal Adversarial Objects for BEV Detectorsaccepted
  991. SAG-GNN: Semantic-Aware Guided GNN for Descriptor-Free 2D-3D Matchingaccepted
  992. SAGA: Source Attribution of Generative AI Videosaccepted
  993. SAGE: Scalable Agentic 3D Scene Generation for Embodied AIaccepted
  994. SAGE: Style-Adaptive Generalization for Privacy-Constrained Semantic Segmentation Across Domainsaccepted
  995. SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learningaccepted
  996. SAIDO: Generalizable Detection of AI-Generated Images via Scene-Aware and Importance-Guided Dynamic Optimization in Continual Learningaccepted
  997. SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioningaccepted
  998. SALMUBench: A Benchmark for Sensitive Association-Level Multimodal Unlearningaccepted
  999. SAM 3D Body: Robust Full-Body Human Mesh Recoveryaccepted
  1000. SAM 3D: 3Dfy Anything in Imagesaccepted

Looking for submission deadlines instead? See the conference deadline calendar.