CVPR 2026 Accepted Papers
The full list of 4,068 papers accepted at CVPR 2026 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
accepted: 4,068
- MCHDoc: A Comprehensive Benchmark for Reading Multi-Carrier Chinese Historical Documentsaccepted
- MD2E: Modeling Depth-to-Edge Cues for Monocular Metric Depth Estimationaccepted
- MDCS-MoAME: Multi-directional Composite Scanning with Mixture of Attention and Mamba Experts for Cancer Survival Predictionaccepted
- MDS-VQA: Model-Informed Data Selection for Video Quality Assessmentaccepted
- MEMO: Human-like Crisp Edge Detection Using Masked Edge Predictionaccepted
- MER-Tracker: Towards High-Speed 3D Point Tracking via Multi-View Event-RGB Hybrid Camerasaccepted
- MERG3R: A Divide-and-Conquer Approach to Large-Scale Neural Visual Geometryaccepted
- MERIT: Multi-domain Efficient RAW Image Translationaccepted
- MERLIN: Building Low-SNR Robust Multimodal LLMs for Electromagnetic Signalsaccepted
- META: Meta Evolution of Tool Trajectory Adaptation for Long-Video Understandingaccepted
- MFEN: Multi-Frequency Expert Network for Visible-Infrared Person Re-IDaccepted
- MGDHand: Multi-Granularity Prior-to-Inertial Distillation Framework for Sequential 3D Hand Pose Estimation from Sparse IMUsaccepted
- MHopReg: Efficient Hierarchical Multi-Hop Graph Search for Point Cloud Registrationaccepted
- MIBURI: Towards Expressive Interactive Gesture Synthesisaccepted
- MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Modelsaccepted
- MICo-150K: A Comprehensive Dataset Advancing Multi-Image Compositionaccepted
- MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understandingaccepted
- MLLMSplat: A 2D MLLM-Powered Framework for 3D Gaussian Splatting Understanding, Generation, and Editingaccepted
- MM-ACT: Learn from Multimodal Parallel Generation to Actaccepted
- MM-OVSeg: Multimodal Optical-SAR Fusion for Open-Vocabulary Segmentation in Remote Sensingaccepted
- MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correctionaccepted
- MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioningaccepted
- MMBench-GUI: A Unified Hierarchical Evaluation Framework for Multi-Platform GUI Agentsaccepted
- MMCP-GEN: A Modality-Extensible Diffusion Language Model for Conditional Protein Sequence Generationaccepted
- MMDIR: Multimodal Instruction-Driven Framework for Mixed-Degradation Document Image Restorationaccepted
- MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generationaccepted
- MMGait: Towards Multi-Modal Gait Recognitionaccepted
- MMLandmarks: a Cross-View Instance-Level Benchmark for Geo-Spatial Understandingaccepted
- MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Modelsaccepted
- MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detectionaccepted
- MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translationaccepted
- MMVIP: A Visible-infrared Paired Dataset for Multi-weather Marine Visionaccepted
- MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Modelsaccepted
- MOFA-VTON: More Fashion Possibilities with Fine-Grained Adaptations in Virtual Try-Onaccepted
- MOGeo: Beyond One-to-One Cross-View Object Geo-localizationaccepted
- MOMO: Mars Orbital MOdel Foundation Model for Mars Orbital Applicationsaccepted
- MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understandingaccepted
- MORE-STEM: Long-Short MemOry REcall and Spatio-TEmporal Consistency Model for Query-Driven 3D/4D Point Cloud Segmentationaccepted
- MOS: Mitigating Optical-SAR Modality Gap for Cross-Modal Ship Re-Identificationaccepted
- MOSAIC-GS: Monocular Scene Reconstruction via Advanced Initialization for Complex Dynamic Environmentsaccepted
- MPL: Match-guided Prototype Learning for Few-shot Action Recognitionaccepted
- MR-RAG: Multimodal Relevance-Aware Retrieval-Augmented Generation for Medical Visual Question Answeringaccepted
- MR. Illuminate: Zero-Shot Low-Light Image Enhancement with Diffusion Prioraccepted
- MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understandingaccepted
- MRI Contrast Enhancement Kinetics World Modelaccepted
- MS-Temba: Multi-Scale Temporal Mamba for Understanding Long Untrimmed Videosaccepted
- MSCD-GS: Motion-Separated Cooperative Deblurring Dynamic Reconstruction via Gaussian Splattingaccepted
- MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigationaccepted
- MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understandingaccepted
- MSPT: Efficient Large-Scale Physical Modeling via Parallelized Multi-Scale Attentionaccepted
- MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learningaccepted
- MS^2Gait: A Multi-Scale Spatio-Temporal Fusion Network for LiDAR-based Gait Recognitionaccepted
- MTA: Multimodal Task Alignment for BEV Perception and Captioningaccepted
- MU-GeNeRF: Multi-view Uncertainty-guided Generalizable Neural Radiance Fields for Distractor-aware Sceneaccepted
- MUFASA: A Multi-Layer Framework for Slot Attentionaccepted
- MUSE: Harnessing Precise and Diverse Semantics for Few-Shot Whole Slide Image Classificationaccepted
- MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modalityaccepted
- MV-Fashion: Towards Enabling Virtual Try-On and Size Estimation with Multi-View Paired Dataaccepted
- MV-RoMa: From Pairwise Matching into Multi-View Track Reconstructionaccepted
- MV-TAP: Tracking Any Point in Multi-View Videosaccepted
- MV2UV: Generating High-quality UV Texture Maps with Multiview Promptsaccepted
- MV3DIS: Multi-View Mask Matching via 3D Guides for Zero-Shot 3D Instance Segmentationaccepted
- MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentationaccepted
- MVInverse: Feed-forward Multiview Inverse Rendering in Secondsaccepted
- MVLM: Template-Free Tracking via Vision-Language Margin Confidence and Memory-Gated Trackingaccepted
- MVP: Multiple View Prediction Improves GUI Groundingaccepted
- M^3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generationaccepted
- MacTok: Robust Continuous Tokenization for Image Generationaccepted
- Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokensaccepted
- Machine Unlearning via Adaptive Gradient Reweighting and Multi-stage Objective Optimizationaccepted
- MagicFuse: Single Image Fusion for Visual and Semantic Reinforcementaccepted
- MagicQuill V2: Precise and Interactive Image Editing with Layered Visual Cuesaccepted
- MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layoutsaccepted
- Make it SING: Analyzing Semantic Invariants in Classifiersaccepted
- MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generationaccepted
- Making Training-Free Diffusion Segmentors Scale with the Generative Poweraccepted
- Making the Classification Explanation Faithful to the Confidence Scoreaccepted
- Mamba Learns in Context: Structure-Aware Domain Generalization for Multi-Task Point Cloud Understandingaccepted
- MambaLiteUNet: Cross-Gated Adaptive Feature Fusion for Robust Skin Lesion Segmentationaccepted
- MambaSIC: Mamba-based Stereo Image Compression with Bi-directional Multi-reference Entropy Modelaccepted
- MangoBench: A Benchmark for Multi-Agent Goal-Conditioned Offline Reinforcement Learningaccepted
- ManifoldGD: Training-Free Hierarchical Manifold Guidance for Diffusion-Based Dataset Distillationaccepted
- ManifoldNeuS: Manifold-aware View Optimizability for Pose-Free Neural Surface Reconstructionaccepted
- Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresightaccepted
- MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Modelsaccepted
- MapRoute:Precise-Concept Erasing Mappers via Semantic Routingaccepted
- Mapping Networksaccepted
- Mario: Multimodal Graph Reasoning with Large Language Modelsaccepted
- Mark4D: Temporally-Consistent Watermarking for 4D Gaussian Splattingaccepted
- Markovian Scale Prediction: A New Era of Visual Autoregressive Generationaccepted
- MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structuresaccepted
- Mask to Align, Weight to Disambiguate: Reliable Unsupervised Cross-Modal Hashing with Masked-Weight Contrastaccepted
- MaskAdapt: Learning Flexible Motion Adaptation via Mask-Invariant Prior for Physics-Based Charactersaccepted
- MaskDexGrasp: Generative Masked Modeling for Part-Aware Dexterous Grasp Synthesisaccepted
- MaskDiME: Adaptive Masked Diffusion for Precise and Efficient Visual Counterfactual Explanationsaccepted
- MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image Generationaccepted
- Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learningaccepted
- Masked Region Transformer for Layered Image Generation and Editing at Scaleaccepted
- Masked Representation Modeling for Domain-Adaptive Segmentationaccepted
- Masked-Diffusion Autoencoders for 3D Medical Vision Representation Learningaccepted
- Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understandingaccepted
- Masking Teacher and Reinforcing Student for Distilling Vision-Language Modelsaccepted
- MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluatoraccepted
- MatE: Material Extraction from Single-Image via Geometric Prioraccepted
- MatLat: Material Latent Space for PBR Texture Generationaccepted
- MatMart: Material Reconstruction of 3D Objects via Diffusionaccepted
- MatPedia: A Universal Generative Foundation for High-Fidelity Material Synthesisaccepted
- MatSpray: Fusing 2D Material World Knowledge on 3D Geometryaccepted
- Match-and-Fuse: Consistent Generation from Unstructured Image Setsaccepted
- MatchED: Crisp Edge Detection Using End-to-End, Matching-based Supervisionaccepted
- MatchMask: Mask-Centric Generative Data Augmentation for Label-Scarce Semantic Segmentationaccepted
- Matching Every Pair to Track Every Point: PairFormer for All-Pairs Tracking and Video Trajectory Fieldsaccepted
- Material Magic Wand: Material-Aware Grouping of 3D Parts in Untextured Meshesaccepted
- MaxMark: High-Capacity Diffusion-Native Watermarking via Robust and Invertible Latent Embeddingaccepted
- MeToM: Metadata-Guided Token Merging for Efficient Video LLMsaccepted
- MeanFlow Transformers with Representation Autoencodersaccepted
- MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Drivingaccepted
- Measure The Feature Universe: Topology-based Pseudo Labeling and Gravity Consistency for Source-Free Domain Adaptationaccepted
- Measuring the (Un)Faithfulness of Concept-Based Explanationsaccepted
- Mechanisms of Object Localization in Vision-Language Modelsaccepted
- Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoningaccepted
- MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentationaccepted
- MedFG-VQA: Low-Frequency Memory and Graph Attention for Lightweight Medical VQAaccepted
- MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understandingaccepted
- MedKCO: Medical Vision-Language Pretraining via Knowledge-Driven Cognitive Orchestrationaccepted
- MedLIME: A Distribution-Aligned and Evidence-Supported Framework for Medical Saliency Explanationsaccepted
- MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Groundingaccepted
- MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Imagesaccepted
- MedTVT-R1: A Multimodal LLM Empowering Medical Reasoning and Diagnosisaccepted
- Medic-AD: Towards Medical Vision-Language Model's Clinical Intelligenceaccepted
- MemFlow: A Lightweight Forward Memorizing Framework for Quick Domain Adaptive Feature Mappingaccepted
- Memory Matters: Boosting Training-Free Zero-Shot Temporal Action Localization with a Learnable Lookup Tableaccepted
- Memory-Augmented Scene Understanding and Exploration for Open-World Aerial Object-Goal Navigationaccepted
- Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skippingaccepted
- Memory-Efficient Transfer Learning with Fading Side Networks via Masked Dual Path Distillationaccepted
- Merge3D: Efficient 3D Multimodal LLMs via Joint 2D-3D Token Mergingaccepted
- MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agentaccepted
- Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generationaccepted
- Mesh4D: 4D Mesh Reconstruction and Tracking from Monocular Videoaccepted
- MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformeraccepted
- MeshMosaic: Scaling Artist Mesh Generation via Local-to-Global Assemblyaccepted
- MeshRipple: Structured Autoregressive Generation of Artist-Meshesaccepted
- MeshSplatting: Differentiable Rendering with Opaque Meshesaccepted
- MeshWeaver: Sparse-Voxel-Guided Surface Weaving for Autoregressive Mesh Generationaccepted
- Meta-CoT: Enhancing Granularity and Generalization in Image Editingaccepted
- Meta-FC: Meta-Learning with Feature Consistency for Robust and Generalizable Watermarkingaccepted
- Meta-Learning In-Context Enables Training-Free Cross Subject Brain Decodingaccepted
- MetaSpectra+: A Compact Broadband Metasurface Camera for Snapshot Hyperspectral+ Imagingaccepted
- MeteorPred: A Meteorological Multimodal Large Model and Dataset for Severe Weather Event Predictionaccepted
- MetricHMSR: Metric Human Mesh and Scene Recovery from Monocular Imagesaccepted
- MetroGS: Efficient and Stable Reconstruction of Geometrically Accurate High-Fidelity Large-Scale Scenesaccepted
- MicroFM: Physics-guided Flow Matching for Isotropic Microscopy Reconstructionaccepted
- MimiCAT: Mimic with Correspondence-Aware Cascade-Transformer for Category-Free 3D Pose Transferaccepted
- Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understandingaccepted
- MimicTalker: A Multimodal Interactive and Memory-Enhanced Framework for Real-Time Dyadic 3D Head Generationaccepted
- Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learningaccepted
- Mind the Gap: Transferring Labels to Align Object Detection Datasetsaccepted
- Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Modelsaccepted
- Mind the Hitch: Dynamic Calibration and Articulated Perception for Autonomous Trucksaccepted
- Mind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMsaccepted
- MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Drivingaccepted
- MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agentsaccepted
- Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understandingaccepted
- MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipeaccepted
- Minimal Constraint Relaxation for Multiview Autocalibrationaccepted
- Mining Attribute Subspaces for Efficient Fine-tuning of 3D Foundation Modelsaccepted
- Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detectionaccepted
- Mirai: Autoregressive Visual Generation Needs Foresightaccepted
- Mirror Illusion Artaccepted
- Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infraredaccepted
- Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videosaccepted
- Mitigating Error Amplification in Fast Adversarial Trainingaccepted
- Mitigating Instance Entanglement in Instance-Dependent Partial Label Learningaccepted
- Mitigating Multimodal Hallucinations via Gradient-based Self-Reflectionaccepted
- Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentationaccepted
- Mitigating Simplicity Bias in OOD Detection through Object Co-occurrence Analysisaccepted
- Mitigating The Distribution Shift of Diffusion-based Dataset Distillationaccepted
- MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixtureaccepted
- MixerCSeg: An Efficient Mixer Architecture for Crack Segmentation via Decoupled Mamba Attentionaccepted
- Mixture of Prototypes for Test-time Adaptive Segmentationaccepted
- Mixture of States: Routing Token-Level Dynamics for Multimodal Generationaccepted
- Mixture of Style Experts for Diverse Image Stylizationaccepted
- Mixture-of-Experts based Feature Decoupling for Open Vocabulary Scene Graph Generationaccepted
- MoBind: Motion Binding for Fine-Grained IMU-Video Pose Alignmentaccepted
- MoCapAnything: Unified 3D Motion Capture for Arbitrary Skeletons from Monocular Videosaccepted
- MoCha: End-to-End Video Character Replacement without Structural Guidanceaccepted
- MoCoDiff: A Controllable Autoregressive Diffusion Model for Expressive Motion Generationaccepted
- MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimizationaccepted
- MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skippingaccepted
- MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Modelsaccepted
- MoEActok: A MoE-based Action Tokenizer for Vision-Language-Action Modelsaccepted
- MoECLIP: Patch-Specialized Experts for Zero-shot Anomaly Detectionaccepted
- MoLingo: Motion-Language Alignment for Text-to-Human Motion Generationaccepted
- MoRE: 3D Visual Geometry Reconstruction Meets Mixture-of-Expertsaccepted
- MoRGS: Efficient Per-Gaussian Motion Reasoning for Streamable Dynamic 3D Scenesaccepted
- MoRe: Motion-aware Feed-forward 4D Reconstruction Transformeraccepted
- MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesisaccepted
- MoRel: Long-Range Flicker-Free 4D Motion Modeling via Anchor Relay-based Bidirectioanl Blending with Hierarchical Densificationaccepted
- MoVie: Broaden Your Views with Human Motion for Action Detectionaccepted
- MoVieS: Motion-Aware 4D Dynamic View Synthesis in One Secondaccepted
- Mobile-VTON: High-Fidelity On-Device Virtual Try-Onaccepted
- Mocap-2-to-3: Multi-view Lifting for Monocular Motion Recovery with 2D Pretrainingaccepted
- Model Merging in the Essential Subspaceaccepted
- Modeling Cross-vision Synergy for Unified Large Vision Modelaccepted
- Modeling Spatiotemporal Neural Frames for High Resolution Brain Dynamicaccepted
- Modeling the Brain's Grammar: ROI-Guided fMRI Pretraining for Transferable and Interpretable Vision Decodingaccepted
- Modeling the Visual Ambiguity of Human Sketchesaccepted
- Models as Lego Builders: Assembling Malice from Benign Blocks via Semantic Blueprintsaccepted
- ModularAgent: A Task-Aware Modular Framework for Joint Optimization of Multimodal Large Language Models and World Modelsaccepted
- Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Groundingaccepted
- Momentum Memory for Knowledge Distillation in Computational Pathologyaccepted
- Monet: Reasoning in Latent Visual Space Beyond Image and Languageaccepted
- MonoSAOD: Monocular 3D Object Detection with Sparsely Annotated Labelaccepted
- MonoVLM: Monocular 3D Visual Grounding with Vision Language Modelsaccepted
- Monocular Open Vocabulary Occupancy Prediction for Indoor Scenesaccepted
- MooCap: A Multi-View Benchmark for Cow-Object-Human Interaction and Behavior Dynamicsaccepted
- More Natural, More Real: Object-aware Gaussian Splatting for 3D Visual Decoding from Human Brainaccepted
- More Than Meets the Eye: A Unified Image Fusion Framework via Semantic-Pixel Entropy Trade-off for Zero-Shot Generalizationaccepted
- More than the Sum: Panorama-Language Models for Adverse Omni-Scenesaccepted
- MorphAny3D: Unleashing the Power of Structured Latent in 3D Morphingaccepted
- MorphSeek: Fine-grained Latent Representation-Level Policy Optimization for Deformable Image Registrationaccepted
- Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Modelsaccepted
- Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesisaccepted
- Motion-Aware Animatable Gaussian Avatars Deblurringaccepted
- MotionCrafter: Dense Geometry and Motion Reconstruction with a 4D VAEaccepted
- MotionEdit: Benchmarking and Learning Motion-Centric Image Editingaccepted
- MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Modelsaccepted
- MotionHiFlow: Text-to-Motion via Hierarchical Flow Matchingaccepted
- MotionMaster: Generalizable Text-Driven Motion Generation and Editingaccepted
- MotionScale: Reconstructing Appearance, Geometry, and Motion of Dynamic Scenes with Scalable 4D Gaussian Splattingaccepted
- MotionV2V: Editing Motion in a Videoaccepted
- Motus: A Unified Latent Action World Modelaccepted
- MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmarkaccepted
- Moving Border Ownership for Event-based Motion Segmentationaccepted
- MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Modelaccepted
- MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answeringaccepted
- MuM: Multi-View Masked Image Modeling for 3D Visionaccepted
- MuViT: Multi-Resolution Vision Transformers for Learning Across Scales in Microscopyaccepted
- Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Followingaccepted
- Multi-Hierarchical Contrastive Spectral Fusion for Multi-View Clusteringaccepted
- Multi-Metric Representation Learning Strategy Based on Clustering for Fine-Grained Multimodal Sentiment Analysisaccepted
- Multi-Modal Image Fusion via Intervention-Stable Feature Learningaccepted
- Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discoveryaccepted
- Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Modelsaccepted
- Multi-Patch Global-to-Local Transformer Architecture For Efficient Flow Matching and Diffusion Modelaccepted
- Multi-Prototype Compactness and Boundary-Aware Synthesis for Unsupervised Anomaly Detectionaccepted
- Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoningaccepted
- Multi-Scale Gradient-Guided Unrolling Architecture with Adaptive Mamba for Compressive Sensingaccepted
- Multi-Scale Local Speculative Decoding for Image Generationaccepted
- Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Modelsaccepted
- Multi-View Hierarchical Alignment Learning for Spatial Transcriptomicsaccepted
- Multi-level Causal LLM-based Text-to-Motion Generation with Human Alignmentaccepted
- Multi-modal Frequency Decomposition Network for Semantic Scene Completionaccepted
- Multi-modal Test-time Adaptation via Adaptive Probabilistic Gaussian Calibrationaccepted
- Multi-speaker Attention Alignment for Multimodal Social Interactionaccepted
- Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generationaccepted
- Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World Scenesaccepted
- Multi-view Pyramid Transformer: Look Coarser to See Broaderaccepted
- MultiAnimate: Pose-Guided Image Animation Made Extensibleaccepted
- MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generationaccepted
- MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignmentaccepted
- MultiModalPFN: Extending Prior-Data Fitted Networks for Multimodal Tabular Learningaccepted
- MultiShotMaster: A Controllable Multi-Shot Video Generation Frameworkaccepted
- Multigrain-aware Semantic Prototype Scanning and Tri-Token Prompt Learning Embraced High-Order RWKV for Pan-Sharpeningaccepted
- Multimodal Causality-Driven Representation Learning for Generalizable Medical Image Segmentationaccepted
- Multimodal Continual Instruction Tuning with Dynamic Gradient Guidanceaccepted
- Multimodal Distribution Matching for Vision-Language Dataset Distillationaccepted
- Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibrationaccepted
- Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptationaccepted
- Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Imageaccepted
- Multimodal Semantic Bias Mitigation for Diverse Text-To-3D Generationaccepted
- Multinex: Lightweight Low-light Image Enhancement via Multi-prior Retinexaccepted
- Muses: Designing, Composing, Generating Nonexistent Fantasy 3D Creatures without Trainingaccepted
- MusicInfuser: Making Video Diffusion Listen and Danceaccepted
- NAF: Zero-Shot Feature Upsampling via Neighborhood Attention Filteringaccepted
- NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformersaccepted
- NEAF: Natural Image Editing with Attention Fusion for Generalizable Test-time Optimization in Text-Guided Image Editingaccepted
- NEC-Diff: Noise-Robust Event-RAW Complementary Diffusion for Seeing Motion in Extreme Darknessaccepted
- NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Codeaccepted
- NESTOR: A Nested MOE-based Neural Operator for Large-Scale PDE Pre-Trainingaccepted
- NG-GS: NeRF-guided 3D Gaussian Splatting Segmentationaccepted
- NI-Tex: Non-isometric Image-based Garment Texture Generationaccepted
- NIL: No-data Imitation Learningaccepted
- NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editingaccepted
- NOWA: Null-space Optical Watermark for Invisible Capture Fingerprinting and Tamper Localizationaccepted
- NS-Diff: Fluid Navier-Stokes Guided Video Diffusion via Reinforcement Learningaccepted
- NTK-Guided Implicit Neural Teachingaccepted
- NVGS: Neural Visibility for Occlusion Culling in 3D Gaussian Splattingaccepted
- NaTex: Seamless Texture Generation as Latent Color Diffusionaccepted
- Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathyaccepted
- NanoSD: Edge Efficient Foundation Model for Real Time Image Restorationaccepted
- Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioningaccepted
- Native and Compact Structured Latents for 3D Generationaccepted
- Natural Human Motion Recovery by Aligning High-Order Temporal Dynamics from Monocular Videosaccepted
- NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Predictionaccepted
- NeAR: Coupled Neural Asset-Renderer Stackaccepted
- Negative Binomial Variational Autoencoders for Overdispersed Latent Modelingaccepted
- Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Modelsaccepted
- Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Modelsaccepted
- NeighborMAE: Exploiting Spatial Dependencies between Neighboring Earth Observation Images in Masked Autoencoders Pretrainingaccepted
- NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videosaccepted
- Nestwork: Conditional 3D Furnished House Layout Generation through Latent Heterogeneous Graph Diffusionaccepted
- Neu-PiG: Neural Preconditioned Grids for Fast Dynamic Surface Reconstruction on Long Sequencesaccepted
- NeuROK: Generative 4D Neural Object Kinematicsaccepted
- Neural Collapse in Test-Time Adaptationaccepted
- Neural Differentiation in Deep Networks: A Theoretical Framework for Expressivity and Representational Diversityaccepted
- Neural Distribution Prior for LiDAR Out-of-Distribution Detectionaccepted
- Neural Dynamic GI: Random-Access Neural Compression for Temporal Lightmaps in Dynamic Lighting Environmentsaccepted
- Neural Field-Based 3D Surface Reconstruction of Microstructures from Multi-Detector Signals in Scanning Electron Microscopyaccepted
- Neural Gabor Splatting: Enhanced Gaussian Splatting with Neural Gabor for High-frequency Surface Reconstructionaccepted
- Neural Mixture Density Processesaccepted
- Neural-Centric Video Processing Pipeline for Unified Multi-Task Inferenceaccepted
- Neuro-Cognitive Reward Modeling for Human-Centered Autonomous Vehicle Controlaccepted
- NeuroFlow: Toward Unified Visual Encoding and Decoding from Neural Activityaccepted
- NeuroRule: Bridging Vision and Logic with Differentiable Rule Inductionaccepted
- NeuroSeg Meets DINOv3: Transferring 2D Self-Supervised Visual Priors to 3D Neuron Segmentation via DINOv3 Initializationaccepted
- Neurodynamics-Driven Coupled Neural P Systems for Multi-Focus Image Fusionaccepted
- Next-Scale Autoregressive Models for Text-to-Motion Generationaccepted
- Next-Scale Prediction: A Self-Supervised Approach for Real-World Image Denoisingaccepted
- NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networksaccepted
- NimbusGS: Unified 3D Scene Reconstruction under Hybrid Weatheraccepted
- NitroGen: An Open Foundation Model for Generalist Gaming Agentsaccepted
- No Calibration, No Depth, No Problem: Cross-Sensor View Synthesis with 3D Consistencyaccepted
- No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Modelsaccepted
- No Labels, No Look-Ahead: Unsupervised Online Video Stabilization with Classical Priorsaccepted
- No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detectionaccepted
- No Way To Steal My Face: Proactive Defense Against Identity-Preserving Personalized Generationaccepted
- NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detectionaccepted
- NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoningaccepted
- Node-RF: Learning Generalized Continuous Space-Time Scene Dynamics with Neural ODE-based NeRFsaccepted
- Noise-Aware Few-Shot Learning through Bi-directional Multi-View Prompt Alignmentaccepted
- Nonlinear Color Transfer via Learnable Bezier Flowsaccepted
- Nonparametric Deep Fine-grained Clustering with Low-Rank Guided Vision-Language Modelaccepted
- Not All Birds Look The Same: Identity-Preserving Generation For Birdsaccepted
- NuWa: Deriving Lightweight Class-Specific Vision Transformers for Edge Devicesaccepted
- OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoningaccepted
- ODGS-SLAM: Omnidirectional Gaussian Splatting SLAMaccepted
- OLATverse: A Large-scale Real-world Object Dataset with Precise Lighting Controlaccepted
- OMG-Avatar: One-shot Multi-LOD Gaussian Head Avataraccepted
- OMG-Bench: A New Challenging Benchmark for Skeleton-based Online Micro Hand Gesture Recognitionaccepted
- OMGTex: One-stage Multi-style Facial Texture Reconstruction without Geometry Guidanceaccepted
- OMoBlur: An Object Motion Blur Dataset and Benchmark for Real-World Local Motion Deblurringaccepted
- OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In-Context Image Generationaccepted
- ORBIT: Benchmarking SfM in the Wild with 360deg Videoaccepted
- ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answeringaccepted
- ORD: Object-Relation Decoupling for Generalized 3D Visual Groundingaccepted
- ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Modelsaccepted
- ORION: ORthonormal Text Encoding for Universal VLM AdaptatIONaccepted
- ORSATR-X: A Foundation Model based on Differential-and-Excitation Networks for Optical Remote Sensing Object Recognitionaccepted
- ORV: 4D Occupancy-centric Robot Video Generationaccepted
- OS-Fed: One Snapshot Is All You Needaccepted
- OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Modelsaccepted
- OSA: Echocardiography Video Segmentation via Orthogonalized State Update and Anatomical Prior-aware Feature Enhancementaccepted
- OSMO: Open-vocabulary Self-eMOtion Trackingaccepted
- OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generationaccepted
- OVI-MAP: Open-Vocabulary Instance-Semantic Mappingaccepted
- OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detectionaccepted
- Object-Generalized Re-Identification: A Step Towards Universal Instance Perceptionaccepted
- Object-WIPER: Training-Free Object and Associated Effect Removal in Videosaccepted
- ObjectMorpher: 3D-Aware Image Editing via Deformable 3DGSaccepted
- Obstruction Reasoning for Robotic Graspingaccepted
- OccAny: Generalized Unconstrained Urban 3D Occupancyaccepted
- Occluded Human Body Capture with Frequency Domain Denoising Prioraccepted
- Occlusion-Aware SORT: Observing Occlusion for Robust Multi-Object Trackingaccepted
- OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspectiveaccepted
- OctoMed: Data Recipes for State-of-the-Art Multimodal Medical Reasoningaccepted
- OctoNav: Towards Generalist Embodied Navigationaccepted
- OctoT2I: A Self-Evolving Agentic Text-to-Image Routeraccepted
- Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Modelsaccepted
- OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Modelsaccepted
- Off The Grid: Detection of Primitives for Feed-Forward 3D Gaussian Splattingaccepted
- Olbedo: An Albedo and Shading Aerial Dataset for Large-Scale Outdoor Environmentsaccepted
- OlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observationaccepted
- Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Modelsaccepted
- Omni-3DEdit: Generalized Versatile 3D Editing in One-Passaccepted
- Omni-AD: A Large-scale and Versatile Benchmark for Industrial Anomaly Detectionaccepted
- Omni-Attack: Adversarial Attacks on Open-Ended VQA in Black-Box Multimodal LLMsaccepted
- Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalizationaccepted
- Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detectionaccepted
- Omni-MMSI: Toward Identity-attributed Social Interaction Understandingaccepted
- Omni-Supervised Motion Editing: Balancing Change and Invariance through Positive-Negative Learningaccepted
- Omni2Sound: Towards Unified Video-Text-to-Audio Generationaccepted
- OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasksaccepted
- OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learningaccepted
- OmniFM: Toward Modality-Robust and Task-Agnostic Federated Learning for Heterogeneous Medical Imagingaccepted
- OmniFood8K: Single-Image Nutrition Estimation via Hierarchical Frequency-Aligned Fusionaccepted
- OmniGen2: Towards Instruction-Aligned Multimodal Generationaccepted
- OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenariosaccepted
- OmniLottie: Generating Vector Animations via Parameterized Lottie Tokensaccepted
- OmniSonic: Towards Universal and Holistic Audio Generation from Video and Textaccepted
- OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformeraccepted
- OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Groundingaccepted
- OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Modelsaccepted
- OmniZip: Learning a Unified and Lightweight Lossless Compressor for Multi-Modal Dataaccepted
- On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Modelsaccepted
- On the Role of Temporal Granularity in the Robustness of Spiking Neural Networksaccepted
- One Algorithm to Align Them Allaccepted
- One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMsaccepted
- One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformersaccepted
- One Patch to Caption Them All: A Unified Zero-Shot Captioning Frameworkaccepted
- One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucinationaccepted
- One-Shot Flow, Any-Time Frame: A Bidirectional Warping Framework for Event-Based Video Frame Interpolationaccepted
- One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolutionaccepted
- One-to-All Animation: Alignment-Free Character Animation and Image Pose Transferaccepted
- One-to-More: High-Fidelity Training-Free Anomaly Generation with Attention Controlaccepted
- OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generationaccepted
- OneHOI: Unifying Human-Object Interaction Generation and Editingaccepted
- OneOcc: Semantic Occupancy Prediction for Legged Robots with a Single Panoramic Cameraaccepted
- OneSparse: A Unified Framework for Sparse Activation Layers in Vision Modelsaccepted
- OneStory: Coherent Multi-Shot Video Generation with Adaptive Memoryaccepted
- OneThinker: All-in-one Reasoning Model for Image and Videoaccepted
- Online Data Curation for Object Detection via Marginal Contributions to Dataset-level Average Precisionaccepted
- Online3R: Online Learning for Consistent Sequential Reconstruction Based on Geometry Foundation Modelaccepted
- OnlineHMR: Video-based Online World-Grounded Human Mesh Recoveryaccepted
- OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splattingaccepted
- OntoAug: Rethinking Generative Data Augmentation via Ontology Guidanceaccepted
- Open the Motion Door: Atomic Motion Decomposition and Recomposition for Open-Vocabulary Motion Generationaccepted
- Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehiclesaccepted
- Open-Vocabulary Domain Generalization in Urban-Scene Segmentationaccepted
- Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representationaccepted
- OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imageryaccepted
- OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Dataaccepted
- OpenFS: Multi-Hand-Capable Fingerspelling Recognition with Implicit Signing-Hand Detection and Frame-Wise Letter-Conditioned Synthesisaccepted
- OpenMMReasoner: Pushing the Frontiers in Multimodal Reasoning with an Open and General Recipeaccepted
- OpenMarcie: Dataset for Multimodal Action Recognition in Industrial Environmentsaccepted
- OpenT2M: No-frill Motion Generation with Open-source, Large-scale, High-quality Dataaccepted
- OpenVO: Open-World Visual Odometry with Temporal Dynamics Awarenessaccepted
- OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learningaccepted
- OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understandingaccepted
- Opening the Sim-to-Real Door for Humanoid Pixel-to-Action Policy Transferaccepted
- Opti-NeuS: Neural Reconstruction for Dual-Layered Transparent and Opaque Objectsaccepted
- OptiMVMap: Offline Vectorized Map Construction via Optimal Multi-vehicle Perspectivesaccepted
- Optical Diffraction-based Convolution for Semiconductor Lithographyaccepted
- Optical Flow Matching: Reframing Optical Flow as Continuous Transport Dynamicsaccepted
- OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generationaccepted
- OralGPT-Omni: A Versatile Dental Multimodal Large Language Modelaccepted
- OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysisaccepted
- Order Matters: 3D Shape Generation from Sequential VR Sketchesaccepted
- OrienPose: Orientation-Guided Novel View Synthesis for Single-Image Unseen Object Pose Estimationaccepted
- OrionEdit: Bridging Reference and Source Images for Generalized Cross-Image Editingaccepted
- OrthoFuse: Training-free Riemannian Fusion of Orthogonal Style-Concept Adapters for Diffusion Modelsaccepted
- Orthogonal Spatial-Aware Multi-View Anchor Graph Clustering for Incomplete Remote Sensing Dataaccepted
- Otil: Accelerating Diffusion Model Inference via Communication-Efficient Multi-GPU Parallelismaccepted
- Out of Sight, Out of Track: Adversarial Attacks on Propagation-based Multi-Object Trackers via Query State Manipulationaccepted
- Outlier-Robust Diffusion Solvers for Inverse Problemsaccepted
- Ov3R: Open-Vocabulary Semantic 3D Reconstruction from RGB Videosaccepted
- P-Flow: Prompting Visual Effects Generationaccepted
- P2GS: Physical Prior-guided Gaussian Splatting for Photometrically Consistent Urban Reconstructionaccepted
- PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attentionaccepted
- PACT: Phase-Like Transition Constraints in Adapter-Based Continual Learning of Vision-Language Modelsaccepted
- PAD-Hand: Physics-Aware Diffusion for Hand Motion Recoveryaccepted
- PAF: Perturbation-Aware Filtering for Open-Set Semi-Supervised Learningaccepted
- PAI-Bench: A Comprehensive Benchmark For Physical AIaccepted
- PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulationaccepted
- PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generationaccepted
- PAMotion: Physics-Aware Motion Generation for Full-Body Interaction with Multiple Objectsaccepted
- PARSE: Part-Aware Relational Spatial Modelingaccepted
- PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMsaccepted
- PAS: Prelim Attention Score for Detecting Object Hallucinations in Large Vision-Language Modelsaccepted
- PAUL: Uncertainty-Guided Partition and Augmentation for Robust Cross-View Geo-Localization under Noisy Correspondenceaccepted
- PAVAS: Physics-Aware Video-to-Audio Synthesisaccepted
- PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generationaccepted
- PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentationaccepted
- PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoningaccepted
- PDD: Manifold-Prior Diverse Distillation for Medical Anomaly Detectionaccepted
- PE3R: Perception-Efficient 3D Reconstructionaccepted
- PEARL: Geometry Aligns Semantics for Training-Free Open-Vocabulary Semantic Segmentationaccepted
- PECCVAI: Overcoming the Brittleness of AI Image Watermarking Under Visual Paraphrasing Attacksaccepted
- PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Trainingaccepted
- PETAR: Localized Findings Generation with Mask-Aware Vision-Language Modeling for PET Automated Reportingaccepted
- PFGNet: A Fully Convolutional Frequency-Guided Peripheral Gating Network for Efficient Spatiotemporal Predictive Learningaccepted
- PG-VTON: Single-Pass Training-Free Virtual Try-On via Patch-Guided Reference Alignmentaccepted
- PGA: Prior-free Generative Attack for Practical No-box Scenarioaccepted
- PGR-Net: Prior-Guided ROI Reasoning Network for Brain Tumor MRI Segmentationaccepted
- PHAC: Promptable Human Amodal Completionaccepted
- PHANTOM: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamicsaccepted
- PHASE-Net: Physics-Grounded Harmonic Attention System for Efficient Remote Photoplethysmography Measurementaccepted
- PIX-TAB: Efficient PIXel-Precise TABle Structure Recognition Approach with Speculative Decoding and Region-Based Image Segmentationaccepted
- PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectoriesaccepted
- PMRNet: Physics-informed Multi-scale Refinement Network for Medical Image Segmentationaccepted
- POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generationaccepted
- POGA: Paraphrased and Oppositional Graph Alignment for Fine-Grained Cross-Modal Retrievalaccepted
- POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMsaccepted
- POLAR: A Portrait OLAT Dataset and Generative Framework for Illumination-Aware Face Modelingaccepted
- POUR: A Provably Optimal Method for Unlearning Representation via Neural Collapseaccepted
- PP-Brep: Few-Shot B-rep Classification with Hybrid Graph Representationaccepted
- PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasksaccepted
- PPISP: Physically-Plausible Compensation and Control of Photometric Variations in Radiance Field Reconstructionaccepted
- PPM-CLIP: Probabilistic Prompt Modeling for Generalizable AI-Generated Image Detectionaccepted
- PQDT: Pseudo-Query Dual Transformer for Robust Point Cloud Restorationaccepted
- PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesisaccepted
- PR-MaGIC: Prompt Refinement Via Mask Decoder Gradient Flow For In-Context Segmentationaccepted
- PRIMU: Uncertainty Estimation for Novel Views in Gaussian Splatting from Primitive-Based Representations of Error and Coverageaccepted
- PRISM: Learning a Shared Primitive Space for Transferable Skeleton Action Representationaccepted
- PRISM: Prototype-based Reasoning with Inter-modal Semantic Mining for Interpretable Image Recognitionaccepted
- PRISM: Video Dataset Condensation with Progressive Refinement and Insertion for Sparse Motionaccepted
- PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-Onaccepted
- PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and VLM-Guided Optimizationaccepted
- PRUE: A Practical Recipe for Field Boundary Segmentation at Scaleaccepted
- PS-SR: Pseudo-Single-Step Video Super-Resolution via Speculative Diffusionaccepted
- PSDesigner: Automated Graphic Design with a Human-Like Creative Workflowaccepted
- PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewardsaccepted
- PTC-Depth: Pose-Refined Monocular Depth Estimation with Temporal Consistencyaccepted
- PV-Ground: Text-Guided Point-Voxel Interaction for 3D Visual Groundingaccepted
- PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modelingaccepted
- PaNDaS: Learnable Shape Interpolation Modeling with Localized Controlaccepted
- PaQ-DETR: Learning Pattern and Quality-Aware Dynamic Queries for Object Detectionaccepted
- PackUV: Packed Gaussian UV Maps for 4D Volumetric Videoaccepted
- PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Drivingaccepted
- Pano360: Perspective to Panoramic Vision with Geometric Consistencyaccepted
- Pano3DComposer: Feed-Forward Compositional 3D Scene Generation from Single Panoramic Imageaccepted
- PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learningaccepted
- PanoVGGT: Feed-Forward 3D Reconstruction from Panoramic Imageryaccepted
- Pantheon360: Taming Digital Twin Generation via 3D-Aware 360deg Video Diffusionaccepted
- Paparazzo: Active Mapping of Moving 3D Objectsaccepted
- Paper2Figure: A Multi-Agent Collaborative System for Figure Generation Towards Academic Research Paperaccepted
- ParTY: Part-Guidance for Expressive Text-to-Motion Synthesisaccepted
- ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interactionaccepted
- Parallax to Align Them All: An OmniParallax Attention Mechanism for Distributed Multi-View Image Compressionaccepted
- Parallel Jacobi Decoding for Fast Autoregressive Image Generationaccepted
- Parallel Rigidity Matters for Bundle Adjustmentaccepted
- ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decodingaccepted
- Parallelised Differentiable Straightest Geodesics for 3D Meshesaccepted
- Parameter-Efficient Adaptation for MLLMs via Implicit Modality Decompositionaccepted
- Parameter-Efficient Semantic Augmentation for Enhancing Open-Vocabulary Object Detectionaccepted
- Parameter-efficient Continual Learning for Enhancing Plasticity without Forgetting under Limited Model Capacityaccepted
- Parameterized Prompt for Incremental Object Detectionaccepted
- ParkGaussian: Surround-view 3D Gaussian Splatting for Autonomous Parkingaccepted
- Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memoryaccepted
- Part$^{2}$GS: Part-aware Modeling of Articulated Objects using 3D Gaussian Splattingaccepted
- PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusionaccepted
- Partial Weakly-Supervised Oriented Object Detectionaccepted
- ParticleGS: Learning Neural Gaussian Particle Dynamics from Videos for Prior-free Physical Motion Extrapolationaccepted
- Particulate: Feed-Forward 3D Object Articulationaccepted
- PatchAlign3D: Local Feature Alignment for Dense 3D Shape Understandingaccepted
- PatchScene: Patch-based Voxel Diffusion Model for Large-Scale Scene Completionaccepted
- PercHead: Perceptual Head Model for Single-Image 3D Head Reconstruction & Editingaccepted
- Perceiving the Near, Reasoning the Distant: Coherent Long-Horizon Trajectory Prediction for Autonomous Drivingaccepted
- Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Drivingaccepted
- Perception Characteristics Distance: Measuring Stability and Robustness of Perception System in Dynamic Conditions under a Certain Decision Ruleaccepted
- Perceptual 3D Simulation With Physical World Modelingaccepted
- Perceptual Neural Video Compression with Color Separation and Rank Chainaccepted
- Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoningaccepted
- PerformRecast: Expression and Head Pose Disentanglement for Portrait Video Editingaccepted
- PerpetualWonder: Long-horizon Action-conditioned 4D Scene Generationaccepted
- PersonaLive! Expressive Portrait Image Animation for Live Streamingaccepted
- PersonaVLM: Long-Term Personalized Multimodal LLMsaccepted
- Personalized Federated Training of Diffusion Models with Privacy Guaranteesaccepted
- Personalized Image Descriptions from Attention Sequencesaccepted
- Personalized Longitudinal Medical Report Generation via Temporally-Aware Federated Adaptationaccepted
- PhaSR: Generalized Image Shadow Removal with Physically Aligned Priorsaccepted
- Phantom: Physical Object Interactions as Dynamic Triggers for NMS-Exploited Backdoorsaccepted
- PhaseWin Search Framework Enable Efficient Object-Level Interpretationaccepted
- Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervalsaccepted
- PhenoYieldNet: Learning Crop-Aware Phenological Responses for Multi-Crop Yield Predictionaccepted
- Photo-Guided Tooth Segmentation on 3D Oral Scan Modelaccepted
- Photo3D: Advancing Photorealistic 3D Generation through Structure-Aligned Detail Enhancementaccepted
- PhotoFramer: Multi-modal Image Composition Instructionaccepted
- Phrase-Grounding-Aware Supervised Fine-Tuning for Chart Recognition via Side-Masked Attentionaccepted
- Phrase-grounded APO for Improving Chest X-ray Report Generationaccepted
- PhyCo: Learning Controllable Physical Priors for Generative Motionaccepted
- PhyCritic: Multimodal Critic Models for Physical AIaccepted
- PhyGaP: Physically-Grounded Gaussians with Polarization Cuesaccepted
- PhyOceanCast: Global Ocean Forecasting with Physics-Informed Diffusionaccepted
- PhysGM: Large Physical Gaussian Model for Feed-Forward 4D Synthesisaccepted
- PhysGS: Bayesian-Inferred Gaussian Splatting for Physical Property Estimationaccepted
- PhysGaia: A Physics-aware Benchmark with Multi-Body Interactions for Dynamic Novel View Synthesisaccepted
- PhysGen: Physically Grounded 3D Shape Generation for Industrial Designaccepted
- PhysHO: Physics-Based Dynamic 3D Gaussian Human and Object from Monocular Videoaccepted
- PhysHead: Simulation-Ready Gaussian Head Avatarsaccepted
- PhysIR-Splat: Physically Consistent Thermal Infrared Radiative Transfer in 3D Gaussian Splattingaccepted
- PhysInOne: Visual Physics Learning and Reasoning in One Suiteaccepted
- PhysSkin: Real-Time and Generalizable Physics-Based Animation via Self-Supervised Neural Skinningaccepted
- PhysVid: Physics Aware Local Conditioning for Generative Video Modelsaccepted
- PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Imageaccepted
- Physical Adversarial Clothing Evades Visible-Thermal Detectors via Non-Overlapping RGB-T Patternaccepted
- Physical Object Understanding with a Physically Controllable World Modelaccepted
- Physical Simulator In-the-Loop Video Generationaccepted
- Physically Ground Commonsense Knowledge for Articulated Object Manipulation with Analytic Conceptsaccepted
- Physically Inspired Gaussian Splatting for HDR Novel View Synthesisaccepted
- Physically-Grounded Turbulence Mitigation with Frame-Shared Degradation Parametersaccepted
- Physics-Consistent Diffusion for Efficient Fluid Super-Resolution via Multiscale Residual Correctionaccepted
- Physics-Guided Multistep Deformation Reversal for Ancient Bamboo Slip Restorationaccepted
- PiLoT: Neural Pixel-to-3D Registration for UAV-based Ego and Target Geo-localizationaccepted
- Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editingaccepted
- PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testingaccepted
- Pip-Stereo: Progressive Iterations Pruner for Iterative Optimization based Stereo Matchingaccepted
- PixARMesh: Autoregressive Mesh-Native Single-View Scene Reconstructionaccepted
- PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentationaccepted
- Pixel Motion Diffusion is What We Need for Robot Controlaccepted
- Pixel2Phys: Distilling Governing Laws from Visual Dynamicsaccepted
- PixelDiT: Pixel Diffusion Transformers for Image Generationaccepted
- PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusionaccepted
- Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervisionaccepted
- PlanaReLoc: Camera Relocalization in 3D Planar Primitives via Region-Based Structure Matchingaccepted
- PlannerRFT: Reinforcing Diffusion Planners through Closed-Loop and Sample-Efficient Fine-Tuningaccepted
- Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Modelaccepted
- Plant Taxonomy Meets Plant Counting: A Fine-Grained, Taxonomic Dataset for Counting Hundreds of Plant Speciesaccepted
- Plenoptic Video Generationaccepted
- Plug-and-Play Incomplete Multi-View Clustering via Janus-Faced Affinity Learning with Topology Harmonizationaccepted
- Plug-and-Play PDE Optimization for 3D Gaussian Splatting: Toward High-Quality Rendering and Reconstructionaccepted
- Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformersaccepted
- PnP-CM: Consistency Models as Plug-and-Play Priors for Inverse Problemsaccepted
- PoInit-of-View: Poisoning Initialization of Views Transfers Across Multiple 3D Reconstruction Systemsaccepted
- Point Cloud as a Foreign Language for Multi-modal Large Language Modelaccepted
- Point4Cast: Streaming Dynamic Scene Reconstruction and Forecastingaccepted
- PointAlign: Feature-Level Alignment Regularization for 3D Vision-Language Modelsaccepted
- PointCNN++: Performant Convolution on Native Pointsaccepted
- PointCSP: Cross-Sample Semantic Propagation and Stability Preservation in Self-Supervised Point Cloud Learningaccepted
- PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splattingaccepted
- PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Predictionaccepted
- PointTPA: Dynamic Network Parameter Adaptation for 3D Scene Understandingaccepted
- PointThinker: Point-Incentivized Parallel Thinking for Multimodal Large Language Modelaccepted
- PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulationaccepted
- Pointer-CAD: Unifying B-Rep and Command Sequences via Pointer-based Edges & Faces Selectionaccepted
- Pointing at Parts: Training-Free Few-Shot Grounding in Multimodal LLMsaccepted
- Points-to-3D: Structure-Aware 3D Generation with Point Cloud Priorsaccepted
- PolarGuide-GSDR: 3D Gaussian Splatting Driven by Polarization Priors and Deferred Reflection for Real-World Reflective Scenesaccepted
- Polarization State Tracing for Reflection Removal and Color-Consistent Reconstructionaccepted
- PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interactionaccepted
- Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioningaccepted
- Portable Active Learning for Object Detectionaccepted
- PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactmentaccepted
- Pose-Free Omnidirectional Gaussian Splatting for 360-Degree Videos with Consistent Depth Priorsaccepted
- Pose-guided Enriched Feature Learning for Federated-by-camera Person Re-identificationaccepted
- PoseAnything: General Pose-guided Video Generation with Part-aware Temporal Coherenceaccepted
- PoseD-Flow: Versatile and Guided Flow Matching Model of Human Poseaccepted
- PoseGAM: Robust Unseen Object Pose Estimation via Geometry-Aware Multi-View Reasoningaccepted
- PoseGaussian: 6D Pose Estimation for Unseen Objects via Sparse-View Object-Level 3D Gaussian Splattingaccepted
- PoseMaster: A Unified 3D Native Framework for Stylized Pose Generationaccepted
- PositionIC: Unified Position and Identity Consistency for Image Customizationaccepted
- Post-training Feature Pruning for Fundus Images Classificationaccepted
- PosterIQ: A Design Perspective Benchmark for Poster Understanding and Generationaccepted
- PosterOmni: Generalized Artistic Poster Creation via Task Distillation and Unified Reward Feedbackaccepted
- PosterReward: Unlocking Accurate Evaluation for High-Quality Graphic Design Generationaccepted
- PowerCLIP: Powerset Alignment for Contrastive Pre-Trainingaccepted
- PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenesaccepted
- Precise Object and Effect Removal with Adaptive Target-Aware Attentionaccepted
- Predict Before You Explore: Predictive Planning with Specialized Memory for Embodied Question Answeringaccepted
- Predicting Spatial Transcriptomics from Histology Images via High-Order Multi-Cell Interaction Modelingaccepted
- Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Modelsaccepted
- Preference-Aligned LoRA Merging: Preserving Subspace Coverage and Addressing Directional Anisotropyaccepted
- Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Modelsaccepted
- Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generationaccepted
- Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Qualityaccepted
- Pressure2Motion: Hierarchical Human Motion Reconstruction from Ground Pressure with Text Guidanceaccepted
- PriVi: Towards a General-Purpose Video Model for Primate Behavior in the Wildaccepted
- Prime Once, then Reprogram Locally: An Efficient Alternative to Black-Box Service Model Adaptationaccepted
- Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Modelsaccepted
- PrivSynth: Alternating and Control-Based Optimization for Privacy and Utility in Synthetic Dataaccepted
- PrivateEyes: Gaze-Preserving Anonymization for Data Sharingaccepted
- ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigationaccepted
- ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecologyaccepted
- ProOOD: Prototype-Guided Out-of-Distribution 3D Occupancy Predictionaccepted
- ProPhy: Progressive Physical Alignment for Dynamic World Simulationaccepted
- ProSoftArena: Benchmarking Hierarchical Capabilities of Multi-modal Agents in Professional Software Environmentsaccepted
- ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence On Mobile Devicesaccepted
- Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detectionaccepted
- Probabilistic Discrepancy Learning for Roadside LiDAR Scene Completionaccepted
- Probabilistic Precipitation Nowcasting with Rectified Flow Transformersaccepted
- Probabilistic Prompt Adaptation for Unified Image Aesthetics and Quality Assessmentaccepted
- Probing and Bridging Geometry-Interaction Cues for Affordance Reasoning in Vision Foundation Modelsaccepted
- ProcessMaker: A Generalized Process Visualization Framework with Adaptive Sequence Steps on Diffusion Transformersaccepted
- ProgTrack: A Multi-Object Tracking Algorithm with Progressive Matching Strategyaccepted
- Progress by Pieces: Test-Time Scaling for Autoregressive Image Generationaccepted
- Progress-Think: Semantic Progress Reasoning for Vision-Language Navigationaccepted
- Progressive Cross-Modal Causal Intervention for Long-Term Action Recognitionaccepted
- Progressive Guessing to Fixed Point: Rethinking Human Motion Prediction with Deep Equilibrium Modelsaccepted
- Progressive Mask Distillation for Self-supervised Video Representationaccepted
- Progressive Multi-cue Alignment for Unaligned RGBT Trackingaccepted
- Progressive Neural Architecture Generationaccepted
- Progressive Supernet Training for Efficient Visual Autoregressive Modelingaccepted
- ProgressiveAvatars: Progressive Animatable 3D Gaussian Avatarsaccepted
- ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Controlaccepted
- Prompt Yourself: Awakening Textual Semantics in 1D Visual Tokenizersaccepted
- Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identificationaccepted
- Prompt-Free Universal Region Proposal Networkaccepted
- Prompt-Free Unknown Label Generation for Open World Detection in Remote Sensingaccepted
- PromptDepth: Efficient and Promptable Geometric 3D Vision Model for Embodied Intelligenceaccepted
- PromptEnhancer: Taming Your Rewriter for Text-to-Image Generation via Fine-Grained Rewardaccepted
- PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignmentaccepted
- PromptMoE: A Segmentation Refinement Framework Leveraging Mixture of Experts for Improved Promptingaccepted
- PromptStereo: Zero-Shot Stereo Matching via Structure and Motion Promptsaccepted
- Proof-of-Perception: Certified Tool-Using Multimodal Reasoning with Compositional Conformal Guaranteesaccepted
- PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Modelsaccepted
- Property-Informed Diffusion-Based Text-to-Microstructure Generationaccepted
- Prospective Dynamic 3D MRI Reconstruction via Latent-Space Motion Tracking from Single Measurementaccepted
- Protect to Adapt: Orthogonal Subspace Control with Ranked Negative-Prompt Curriculum for Few-Shot Action Recognitionaccepted
- Protego: User-Centric Pose-Invariant Privacy Protection Against Face Recognition-Induced Digital Footprint Exposureaccepted
- Prototype-Guided Concept Erasure in Diffusion Modelsaccepted
- Prototype-as-Prompt: Multimodal Sentiment Prototypes Endowing Large Language Models the Capability to Perform Multimodal Sentiment Analysisaccepted
- Prototype-based Causal Intervention for Multi-Label Image Classificationaccepted
- Prototypical Action Reasoning Facilitated by Vision-Language Alignment for Egocentric Action Anticipationaccepted
- Proxy-GS: Unified Occlusion Priors for Training and Inference in Structured 3D Gaussian Splattingaccepted
- Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generationaccepted
- Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignmentaccepted
- ProxyFL: A Proxy-Guided Framework for Federated Semi-Supervised Learningaccepted
- Prune Wisely, Reconstruct Sharply: Compact 3D Gaussian Splatting via Adaptive Pruning and Difference-of-Gaussian Primitivesaccepted
- Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Drivingaccepted
- PureCC: Pure Learning for Text-to-Image Concept Customizationaccepted
- PureProof: Diffusion-Resistant Black-box Targeted Attack on Large Vision-Language Modelsaccepted
- Push-and-Step: From RL-Based Balance Recovery to Physical Simulation of Dense Crowdsaccepted
- Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learningaccepted
- PvP: Data-Efficient Humanoid Robot Learning with Proprioceptive-Privileged Contrastive Representationsaccepted
- PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generationaccepted
- PyramidalWan: On Making Pretrained Video Model Pyramidal for Efficient Inferenceaccepted
- QD-PCQA: Quality-Aware Domain Adaptation for Point Cloud Quality Assessmentaccepted
- QUANTIPHY: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Modelsaccepted
- QVGGT: Post-Training Quantized Visual Geometry Grounded Transformeraccepted
- QuCNet: Quantum Deep Learning Driven Multi-Circuit Network for Remote Sensing Image Classificationaccepted
- QuadSync: Quadrifocal Tensor Synchronization via Tucker Decompositionaccepted
- Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantizationaccepted
- QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Modelsaccepted
- Quantized Residuals to Continuous Prompts for Few-Shot Class Incremental Learning in Vision-Language Modelsaccepted
- Quantum-Gated Task-interaction Knowledge Distillation for Pre-trained Model-based Class-Incremental Learningaccepted
- Query2Uncertainty: Robust Uncertainty Quantification and Calibration for 3D Object Detection under Distribution Shiftaccepted
- QueryMe: Query-Driven Open-Vocabulary 3D Object Affordances Grounding from Multimodal Evidenceaccepted
- QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancyaccepted
- Question-guided Visual Compression with Memory Feedback for Long-Term Video Understandingaccepted
- QuietPrune: Query-Guided Early Token Pruning for Vision-Language Modelsaccepted
- Quota-Calibrated Fine-Grained Alignment with Context-Aware Marginals for Text-based Person Retrievalaccepted
- Qwen-Image-Layered: Towards Inherent Editability via Layer Decompositionaccepted
- R$^2$TUA: Reconstruction-residual Based Targeted and Untargeted Attack Against Text-Image Person Re-Identificationaccepted
- R-4B: Incentivizing General-Purpose Auto-Thinking in MLLMs via Bi-Mode Annealing and Reinforce Learningaccepted
- R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoningaccepted
- R2-Seg: Training-Free OOD Medical Tumor Segmentation via Anatomical Reasoning and Statistical Rejectionaccepted
- R2G: A Multi-View Circuit Graph Benchmark Suite from RTL to GDSIIaccepted
- R3-PCQA: Ray-Reprojection-Reinforcement for No-Reference 3D Point Cloud Quality Assessmentaccepted
- R4-CGQA: Retrieval-based Vision Language Models for Computer Graphics Image Quality Assessmentaccepted
- R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Spaceaccepted
- R4Det: 4D Radar-Camera Fusion for High-Performance 3D Object Detectionaccepted
- RAAS: LLM Agentic System Architecture Search with GRPOaccepted
- RADAR: VQ-VAE Decoder of VAR is a Good Student for Restoring Against Degradation by Accelerationaccepted
- RAG-TP: A General Framework for Vehicle Trajectory Prediction via Retrieval-Augmented Generationaccepted
- RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generationaccepted
- RAID: Retrieval-Augmented Anomaly Detectionaccepted
- RAISE: Requirement-Adaptive Evolutionary Refinement for Training-Free Text-to-Image Alignmentaccepted
- RAM: Recover Any 3D Human Motion in-the-Wildaccepted
- RAMEN: Resolution-Adjustable Multimodal Encoder for Earth Observationaccepted
- RAP: Fast Feedforward Rendering-Free Attribute-Guided Primitive Importance Score Prediction for Efficient 3D Gaussian Splatting Processingaccepted
- RAPID: Reusing Attention Sparsity with Inter-step Adaptation for Efficient Video Diffusionaccepted
- RARE: Learn to RAnk and REtrieve for Monocular 3D Object Detectionaccepted
- RAVEN: Erasing Invisible Watermarks via Novel View Synthesisaccepted
- RAVEN: Radar Adaptive Vision Encoders for Efficient Chirp-wise Object Detection and Segmentationaccepted
- RAW-Domain Degradation Models for Realistic Smartphone Super-Resolutionaccepted
- RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Spaceaccepted
- RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulationaccepted
- RDF-MIG: A Robust Diffusion Framework for Masked Image Generation to Augment Semantic Segmentation and Change Detectionaccepted
- RDFace: A Benchmark Dataset for Rare Disease Facial Image Analysis under Extreme Data Scarcity and Phenotype-Aware Synthetic Generationaccepted
- RE-VLM: Event-Augmented Vision-Language Model for Scene Understandingaccepted
- REACH: Explicit Recovery Behavior for Diffusion Policiesaccepted
- REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splattingaccepted
- REArtGS++: Generalizable Articulation Reconstruction with Temporal Geometry Constraint via Planar Gaussian Splattingaccepted
- RECS4R: Bridging Semantics and Geometry for Referring Remote Sensing Interpretationaccepted
- REL-SF4PASS: Panoramic Semantic Segmentation with REL Depth Representation and Spherical Fusionaccepted
- REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understandingaccepted
- REVIVE 3D: Refinement via Encoded Voluminous Inflated prior for Volume Enhancementaccepted
- RF4D:Neural Radar Fields for Novel View Synthesis in Outdoor Dynamic Scenesaccepted
- RFDM: Residual Flow Diffusion Models for Video Editingaccepted
- RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Frameworkaccepted
- RHCNet: Residual-Guided Hierarchical Calibration Network for Robust Underwater Object Detectionaccepted
- RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videosaccepted
- RHO: Robust Holistic OSM-Based Metric Cross-View Geo-Localizationaccepted
- RI-Mamba: Rotation-Invariant Mamba for Robust Text-to-Shape Retrievalaccepted
- RINO: Rotation-Invariant Non-Rigid Correspondencesaccepted
- RISE: Single Static Radar-based Indoor Scene Understandingaccepted
- RL-ScanIQA: Reinforcement-Learned Scanpaths for Blind 360deg Image Quality Assessmentaccepted
- RLFTSim: Realistic and Controllable Multi-Agent Traffic Simulation via Reinforcement Learning Fine-Tuningaccepted
- RMAE-ProGRess: Advancing Semantic Segmentation in Unstructured Environmentsaccepted
- RMIR: A Benchmark Dataset for Reasoning-Intensive Multimodal Image Retrievalaccepted
- RNED: Rotary Number Encoding and Decoding for Medical VLMsaccepted
- RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Modelsaccepted
- ROSE: Rotate Your Large Language Model to Seeaccepted
- RPGFusion: 4D Radar Prior-Guided Multi-Modal Fusion for 3D Detectionaccepted
- RS-SSM: Refining Forgotten Specifics in State Space Model for Video Semantic Segmentationaccepted
- RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splattingaccepted
- RaGS: Unleashing 3D Gaussian Splatting from 4D Radar and Monocular Cue for 3D Object Detectionaccepted
- RaPA: Enhancing Transferable Targeted Attacks via Random Parameter Pruningaccepted
- RaUF: Learning the Spatial Uncertainty Field of Radaraccepted
- Radar-Guided Polynomial Fitting for Metric Depth Estimationaccepted
- Radiance Meshes for Volumetric Reconstructionaccepted
- Random Wins All: Rethinking Grouping Strategies for Vision Tokensaccepted
- Rank-Guided Pseudo-Bias Learning for Robust Black-Box Adaptationaccepted
- RankOOD - Class Ranking-based Out-of-Distribution Detectionaccepted
- Rascene: High-Fidelity 3D Scene Imaging with mmWave Communication Signalsaccepted
- Rationale-Enhanced Decoding for Multi-modal Chain-of-Thoughtaccepted
- RawMetaDiff: Unlocking Extreme Darkness from Dual-Exposure RAW with Meta-Guided Diffusionaccepted
- Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editingaccepted
- Re-evaluating Continual VQA: Toward Fair and Robust Evaluation for Multimodal Continual Learningaccepted
- ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answeringaccepted
- ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representationaccepted
- ReAttnCLIP: Training-Free Open-Vocabulary Remote Sensing Image Segmentation via Re-defined Attention in CLIPaccepted
- ReBaPL: Repulsive Bayesian Prompt Learningaccepted
- ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrievalaccepted
- ReCoFuse: Ultra-Robust Image Fusion via Restorative Multi-Modal Diffusion Reciprocal Couplingaccepted
- ReDirector: Creating Any-Length Video Retakes with Rotary Camera Encodingaccepted
- ReFAct: Empowering Multimodal Web Agents with Visual and Context Focusingaccepted
- ReFTA: Breaking the Weight Reconstruction Bottleneck in Tensorized Parameter-Efficient Fine-Tuningaccepted
- ReFlow: Self-correction Motion Learning for Dynamic Scene Reconstructionaccepted
- ReGenHOI: Unifying Reconstruction and Generation for 3D Human-Object Interaction Understandingaccepted
- ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformersaccepted
- ReLaGS: Relational Language Gaussian Splattingaccepted
- ReLaX: Reasoning with Latent Exploration for Large Reasoning Modelsaccepted
- ReManNet: A Riemannian Manifold Network for Monocular 3D Lane Detectionaccepted
- ReMatch: Boosting Representation through Matching for Multimodal Retrievalaccepted
- ReMoE: Region-Mixture Experts for Adversarially-Robust Vision Transformersaccepted
- ReMoGen: Real-time Human Interaction-to-Reaction Generation via Modular Learning from Diverse Dataaccepted
- ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understandingaccepted
- ReMoT: Reinforcement Learning with Motion Contrast Tripletsaccepted
- ReSAM: Refine, Requery, and Reinforce: Self-Prompting Point-Supervised Segmentation for Remote Sensing Imagesaccepted
- ReScene4D: Temporally Consistent Semantic Instance Segmentation of Evolving Indoor 3D Scenesaccepted
- ReWeaver: Towards Simulation-Ready and Topology-Accurate Garment Reconstructionaccepted
- ReaGEN: Adaptive Generation of Structured Chains-of-Thought for Efficient Multimodal Reasoningaccepted
- Reading Your Actions: Learning Generalizable Action Representations via Pre-training AEMGaccepted
- Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCRaccepted
- Real-Time Dynamic Scene Rendering with Controlled Compressibility and Contact Awarenessaccepted
- Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEsaccepted
- Real-Time Long Horizon Air Quality Forecasting via Group-Relative Policy Optimizationaccepted
- Real-Time Multimodal Fingertip Contact Detection via Depth and Motion Fusion for Vision-Based Human-Computer Interactionaccepted
- Real-Time Neural Video Compression with Unified Intra and Inter Codingaccepted
- Real-World Point Tracking with Verifier-Guided Pseudo-Labelingaccepted
- Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interfaceaccepted
- Real2Sim2Real: RetinalDepth-64K for Depth Estimation in Posterior Segment Ophthalmic Surgeryaccepted
- RealAppiance: Let High-fidelity Appliance Assets Controllable and Workable as Aligned Real Manaulsaccepted
- RealBirdID: Benchmarking Bird Species Identification in the Era of MLLMsaccepted
- RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmarkaccepted
- RealVLG-R1: A Large-Scale Real-World Visual-Language Grounding Benchmark for Robotic Perception and Manipulationaccepted
- Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learningaccepted
- Reallocating Attention Across Layers to Reduce Multimodal Hallucinationaccepted
- ReasonEdit: Towards Reasoning-Enhanced Image Editing Modelsaccepted
- ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Mapsaccepted
- ReasonX: MLLM-Guided Intrinsic Image Decompositionaccepted
- Reasoning Diffusion for Unpaired Test Time Out-of-distribution Text-Image to Video Generationaccepted
- Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMsaccepted
- Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervisionaccepted
- RebRL: Reinforcing Discrete Visual Diffusion Models with Rebalanced Timestep Creditsaccepted
- RecEdit-Drive: 3D Reconstruction-Guided Spatiotemporal Video Editing for Autonomous Driving Scenesaccepted
- RecTok: Reconstruction Distillation along Rectified Flowaccepted
- Reclaiming Lost Text Layers for Source-Free Cross-Domain Few-Shot Learningaccepted
- Reconstructing CLIP for Open-Vocabulary Dense Perceptionaccepted
- Reconstructing Spiking Neural Networks Using a Single Neuron with Autapsesaccepted
- Reconstruction-Guided Slot Curriculum: Addressing Object Over-Fragmentation in Video Object-Centric Learningaccepted
- Recover to Predict: Progressive Retrospective Learning for Variable-Length Trajectory Predictionaccepted
- RecoverMark: Robust Watermarking for Localization and Recovery of Manipulated Facesaccepted
- Recovering Physically Plausible Human-Object Interactions from Monocular Videosaccepted
- Rectifying Latent Space for Generative Single-Image Reflection Removalaccepted
- Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progressaccepted
- Recurrent Video Masked Autoencodersaccepted
- Red-teaming Retrieval-Augmented Diffusion Models via Poisoning Knowledge Basesaccepted
- Reevaluating the Intra-Modal Misalignment Hypothesis in CLIPaccepted
- Ref4D-VideoBench: Four-Dimensional Reference-Based Evaluation of Text-to-Video Generative Modelsaccepted
- RefAV: Towards Planning-Centric Scenario Miningaccepted
- RefTon: Reference person shot assist virtual Try-onaccepted
- Refacade: Editing Object with Given Reference Textureaccepted
- Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentationaccepted
- Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learningaccepted
- Reflection Separation from a Single Image via Joint Latent Diffusionaccepted
- ReflexSplit: Single Image Reflection Separation via Layer Fusion-Separationaccepted
- Refracting Reality: Generating Images with Realistic Transparent Objectsaccepted
- Reframing Long-Tailed Learning via Loss Landscape Geometryaccepted
- RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detectionaccepted
- Region-Adaptive Sampling for Diffusion Transformersaccepted
- Region-Aware Instance Consistency Learning for Micro-Expression Recognitionaccepted
- Region-Wise Correspondence Prediction between Manga Line Art Imagesaccepted
- RegionFuse: Region-Adaptive Pixel Distribution Learning for Infrared and Visible Image Fusionaccepted
- RegionRoute: Regional Style Transfer with Diffusion Modelaccepted
- Registration-Free Learnable Multi-View Capture of Faces in Dense Semantic Correspondenceaccepted
- Regulating Rather than Constraining: Adaptive Guidance for Complex Spectral Reconstruction in Pansharpeningaccepted
- RehearseVLA: Simulated Post-Training for VLAs with Physically-Consistent World Modelaccepted
- Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoningaccepted
- Reinforcement-Guided Synthetic Data Generation for Privacy-Sensitive Identity Recognitionaccepted
- Reinforcing Structured Chain-of-Thought for Video Understandingaccepted
- Reinforcing Video Object Segmentation to Think before it Segmentsaccepted
- Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inferenceaccepted
- Rel-Zero: Harnessing Patch-Pair Invariance for Robust Zero-Watermarking Against AI Editingaccepted
- Relational Visual Similarityaccepted
- Reliable Clustering Number Estimation for Contrastive Multi-View Clusteringaccepted
- Reliable Policy Transfer for Safety-Aware End-to-End Driving with Deep Reinforcement Learningaccepted
- Reliev3R: Relieving Feed-forward 3D Reconstruction from Multi-View Geometric Annotationsaccepted
- RelightAnyone: A Generalized Relightable 3D Gaussian Head Modelaccepted
- Relightable Holoported Characters: Capturing and Relighting Dynamic Human Performance from Sparse Viewsaccepted
- Relightful Video Portrait Harmonizationaccepted
- RemedyGS: Defend 3D Gaussian Splatting Against Computation Cost Attacksaccepted
- Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detectionaccepted
- Remote Sensing Image Super-Resolution for Imbalanced Textures: A Texture-Aware Diffusion Frameworkaccepted
- Render-to-Adapt: Unsupervised Personal Adaptation for Gaze Estimationaccepted
- RenderFlow: Single-Step Neural Rendering via Flow Matchingaccepted
- Reparameterized Tensor Ring Functional Decomposition for Multi-Dimensional Data Recoveryaccepted
- Representation-Steered Incremental Adapter-Tuning for Class-Incremental Learning with Pre-Trained Modelsaccepted
- Representing 3D Faces with Learnable B-Spline Volumesaccepted
- Repurposing 3D Generative Model for Autoregressive Layout Generationaccepted
- ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Drivingaccepted
- ResCa: Residual Caching for Diffusion Transformers Accelerationaccepted
- ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformersaccepted
- ResiHMR: Residual-Limb Aware Single-Image 3D Human Mesh Recovery for Individuals with Limb Lossaccepted
- Residual Connections Harm Generative Representation Learningaccepted
- Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Renderingaccepted
- Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidanceaccepted
- Residual Diffusion Bridge Model for Image Restorationaccepted
- Residual Primitive Fitting of 3D Shapes with SuperFrustaaccepted
- Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignmentaccepted
- Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understandingaccepted
- Resolving the Identity Crisis in Text-to-Image Generationaccepted
- Resolving the Stability-Plasticity Dilemma in Reinforcement Learning via Complementary Continual Criticsaccepted
- Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidanceaccepted
- Restore, Assess, Repeat: A Unified Framework for Iterative Image Restorationaccepted
- RetFormer: Multimodal Retrieval for Enhancing Image Recognitionaccepted
- Rethinking 2D-3D Registration: A Novel Network for High-Value Zone Selection and Representation Consistency Alignmentaccepted
- Rethinking Asymmetric Quantization: Hidden Symmetry in Vision Model Weightsaccepted
- Rethinking BCE Loss for Multi-Label Image Recognition with Fine-Tuningaccepted
- Rethinking Box Supervision: Bias-Free Weakly Supervised Medical Segmentationaccepted
- Rethinking Camera Choice: An Empirical Study on Fisheye Camera Properties in Robotic Manipulationaccepted
- Rethinking Concept Bottleneck Models: From Pitfalls to Solutionsaccepted
- Rethinking Cross-Modal Anchor Alignment for Mitigating Error Accumulationaccepted
- Rethinking Dataset Distillation: Hard Truths about Soft Labelsaccepted
- Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Featuresaccepted
- Rethinking Glyph Spatial Information in Font Generationaccepted
- Rethinking Intermediate Representation for VLM-based Robot Manipulationaccepted
- Rethinking Knowledge Transfer in Image Quality Assessment: A Perceptual Preference Structure Alignment Perspectiveaccepted
- Rethinking MLLM Itself as a Segmenter with a Single Segmentation Tokenaccepted
- Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distanceaccepted
- Rethinking Occlusion Modeling for UAV Trackingaccepted
- Rethinking Pose Refinement in 3D Gaussian Splatting under Pose Prior and Geometric Uncertaintyaccepted
- Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generationaccepted
- Rethinking Prompt Design for Inference-time Scaling in Text-to-Visual Generationaccepted
- Rethinking SNN Online Training and Deployment: Gradient-Coherent Learning via Hybrid-Driven LIF Modelaccepted
- Rethinking Token Reduction for Large Vision-Language Modelsaccepted
- Rethinking Two-Stage Referring-by-Tracking in Referring Multi-Object Tracking: Make it Strong Againaccepted
- Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-trainingaccepted
- Rethinking Visual Rearrangement from A Diffusion Perspectiveaccepted
- RetimeGS: Continuous-Time Reconstruction of 4D Gaussian Splattingaccepted
- RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Rewardaccepted
- Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation?accepted
- Retrieve-to-Restore: Efficient All-in-One Image Restoration with a Retrieval-Based Degradation Bankaccepted
- Retrieving Counterfactuals Improves Visual In-Context Learningaccepted
- RevINN: An End-to-End Invertible Neural Network for Reversible Adversarial Examples Generationaccepted
- Revisiting 2D Foundation Models for Scalable 3D Medical Image Classificationaccepted
- Revisiting 3D Reconstruction Kernels as Low-Pass Filtersaccepted
- Revisiting F-measure Optimization in Multi-Label Classification: A Sampling-based Approachaccepted
- Revisiting Geometric Obfuscation with Dual Convergent Lines for Privacy-Preserving Image Queries in Visual Localizationaccepted
- Revisiting Learning with Noisy Labels: Active Forgetting and Noise Suppressionaccepted
- Revisiting Model Stitching In the Foundation Model Eraaccepted
- Revisiting Monocular SLAM with Spatio-Temporal Scene Modelingaccepted
- Revisiting Multimodal KV Cache Compression: A Frequency-Domain-Guided Outlier-KV-Aware Approachaccepted
- Revisiting Optimal Coding for I-ToF under Practical Sensor Constraintsaccepted
- Revisiting Pose Sensitivity in Splat-based Computed Tomography under Sparse-view Reconstructionaccepted
- Revisiting Sparsity Constraint Under High-Rank Property in Partial Multi-Label Learningaccepted
- Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectorsaccepted
- Revisiting Unknowns: Towards Effective and Efficient Open-Set Active Learningaccepted
- Revisiting Visual Corruptions in LVLMs: A Shape-Texture Perspective on Model Failuresaccepted
- Revisiting the Necessity of Full Accuracy: Weakly Supervised Object-Level Offset Correction for Misaligned Building Labelsaccepted
- Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalizationaccepted
- Reviving ConvNeXt for Efficient Convolutional Diffusion Modelsaccepted
- Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillationaccepted
- Reward Sharpness-Aware Fine-Tuning for Diffusion Modelsaccepted
- RewardFlow: Generate Images by Optimizing What You Rewardaccepted
- Rewis3d: Reconstruction Improves Weakly-Supervised Semantic Segmentationaccepted
- RigMo: Unifying Rig and Motion Learning for Generative Animationaccepted
- RiskProp: Collision-Anchored Self-Supervised Risk Propagation For Early Accident Anticipationaccepted
- RnG: A Unified Transformer for Complete 3D Modeling from Partial Observationsaccepted
- RoMo: A Large-Scale, Richly Organized Dataset and Semantic Taxonomy for Human Motion Generationaccepted
- RoSAMDepth: Robust Self-supervised Depth Estimation Leveraging Segment Anything Modelaccepted
- RoadGIE: Towards A Global-Scale Aerial Benchmark for Generalizable Interactive Road Extractionaccepted
- RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understandingaccepted
- Robo-SGG: Exploiting Layout-Oriented Normalization and Restitution Can Improve Robust Scene Graph Generationaccepted
- RoboAgent: Chaining Basic Capabilities for Embodied Task Planningaccepted
- RoboTAG: End-to-end Robot Pose Estimation via Topological Alignment Graphaccepted
- RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learningaccepted
- RobotSeg: A Model and Dataset for Segmenting Robots in Image and Videoaccepted
- Robust Promptable Video Object Segmentationaccepted
- Robust Remote Sensing Image-Text Retrieval with Noisy Correspondenceaccepted
- Robust Spiking Neural Networks by Temporal Mutual Informationaccepted
- Robust3DGSW: Toward Robust Watermarking for Quantization-Aware 3D Gaussian Splattingaccepted
- RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradationsaccepted
- Robustness Under Data Scarcity: Few-Shot Continual Adversarial Training for Evolving Threatsaccepted
- Role-SynthCLIP: A Role-Play Driven Diverse Synthetic Data Approachaccepted
- Roots Beneath the Cut: Uncovering the Risk of Concept Revival in Pruning-Based Unlearning for Diffusion Modelsaccepted
- Rosetta Stone For Unified MLLMs: A Unified Tokenizer to Decipher Understanding and Generationaccepted
- Rotation Invariant and Symmetry Aware Pixel Difference Network for Remote Sensing Object Detectionaccepted
- Rounded or Streamlined Head? Bridging Concept Bottleneck Models and Attribute-Described Object Partsaccepted
- Routing on Demand: DSNet for Efficient Progressive Point Cloud Denoisingaccepted
- RunawayEvil: Jailbreaking the Image-to-Video Generative Modelsaccepted
- RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioningaccepted
- S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidanceaccepted
- S$^2$AM3D: Scale-controllable Part Segmentation of 3D Point Cloudsaccepted
- S2C2Seg: Semantic-Spatial Consistency and Category Optimization for Open-Vocabulary Segmentationaccepted
- S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activationsaccepted
- S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal Inputsaccepted
- S2FT: Parameter-Efficient Fine-Tuning in Sparse Spectrum Domainaccepted
- SABER: Spatially Consistent 3D Universal Adversarial Objects for BEV Detectorsaccepted
- SAG-GNN: Semantic-Aware Guided GNN for Descriptor-Free 2D-3D Matchingaccepted
- SAGA: Source Attribution of Generative AI Videosaccepted
- SAGE: Scalable Agentic 3D Scene Generation for Embodied AIaccepted
- SAGE: Style-Adaptive Generalization for Privacy-Constrained Semantic Segmentation Across Domainsaccepted
- SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learningaccepted
- SAIDO: Generalizable Detection of AI-Generated Images via Scene-Aware and Importance-Guided Dynamic Optimization in Continual Learningaccepted
- SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioningaccepted
- SALMUBench: A Benchmark for Sensitive Association-Level Multimodal Unlearningaccepted
- SAM 3D Body: Robust Full-Body Human Mesh Recoveryaccepted
- SAM 3D: 3Dfy Anything in Imagesaccepted
CVPR accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.