CVPR 2026 Accepted Papers
The full list of 4,068 papers accepted at CVPR 2026 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
accepted: 4,068
- EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasingaccepted
- EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creationaccepted
- Efficiency Follows Global-Local Decouplingaccepted
- Efficient All-Pairs Correlation Volume Sampling for Optical Flow Estimationaccepted
- Efficient Encoder-Free Fourier-based 3D Large Multimodal Modelaccepted
- Efficient Equivariant Transformer for Self-Driving Agent Modelingaccepted
- Efficient Frame Selection for Long Video Understanding via Reinforcement Learningaccepted
- Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulationaccepted
- Efficient Real-Time Raw-to-Raw Denoising for Extreme Low-Light Ultra HD Video on Mobile Devicesaccepted
- Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learningaccepted
- Efficient Unrolled Networks for Large-Scale 3D Inverse Problemsaccepted
- Efficient Video Object Segmentation and Tracking with Recurrent Dynamic Submodelaccepted
- Efficient Weighted Sampling via Score-based Generative Modelsaccepted
- Efficient and High-Fidelity Omni Modality Retrievalaccepted
- Efficient and Training-Free Single-Image Diffusion Modelsaccepted
- EfficientMonoHair: Fast Strand-Level Reconstruction from Monocular Video via Multi-View Direction Fusionaccepted
- EfficientVPR: Toward Efficient Visual Place Recognition via Scene-Aware Prompt Tuning and Adaptive Feature Enhancementaccepted
- Efficiently Reconstructing Dynamic Scenes One D4RT at a Timeaccepted
- Ego-1K - A Large-Scale Multiview Video Dataset for Egocentric Visionaccepted
- Ego-Grounding for Personalized Question-Answering in Egocentric Videosaccepted
- Ego-InBetween: Generating Object State Transitions in Ego-Centric Videosaccepted
- Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videosaccepted
- Ego: Embedding-Guided Personalization of Vision-Language Modelsaccepted
- EgoAVU: Egocentric Audio-Visual Understandingaccepted
- EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Posesaccepted
- EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editingaccepted
- EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generationaccepted
- EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMsaccepted
- EgoPoseFormer v2: Accurate Egocentric Human Motion Estimation for AR/VRaccepted
- EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchyaccepted
- EgoRoC: Towards Egocentric Robotic Control via Task-Agnostic Visual Alignmentaccepted
- EgoSound: Benchmarking Sound Understanding in Egocentric Videosaccepted
- EgoX: Egocentric Video Generation from a Single Exocentric Videoaccepted
- EgoXtreme: A Dataset for Robust Object Pose Estimation in Egocentric Views under Extreme Conditionsaccepted
- Egocentric Visibility-Aware Human Pose Estimationaccepted
- Elastic Weight Consolidation Done Right for Continual Learningaccepted
- Elastic3D: Controllable Stereo Video Conversion with Guided Latent Decodingaccepted
- ElasticFormer: Detecting Objects in HRW Shots via Elastic Computing Vision Transformeraccepted
- Electromagnetic Inverse Scattering from a Single Transmitteraccepted
- Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matchingaccepted
- Eliminate Distance Differences Induced by Backdoor Attacks: Layer-Selective Training and Clipping to Mask Backdoor Modelsaccepted
- Elucidating the Design Space of Arbitrary-Noise-Based Diffusion Modelsaccepted
- Elucidating the SNR-t Bias of Diffusion Probabilistic Modelsaccepted
- EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agentsaccepted
- EmbodiedSplat: Online Feed-Forward Semantic 3DGS for Open-Vocabulary 3D Scene Understandingaccepted
- Emergent Extreme-View Geometry in 3D Foundation Modelsaccepted
- Emergent Outlier View Rejection in Visual Geometry Grounded Transformersaccepted
- EmoDiffTalk: Emotion-aware Diffusion for Editable 3D Gaussian Talking Headaccepted
- EmoStyle: Emotion-Driven Image Stylizationaccepted
- EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalizationaccepted
- EmoThinker: Advancing Visual-Acoustic Emotion Analysis via Structural Token Selection and Chain-of-Thought Reasoningaccepted
- Enabling Supervised Learning of Generative Signatures for Generalized AI-Generated Images Detectionaccepted
- End-to-End Hyper-Relational Information Extraction for Engineering Diagrams via Dynamically Tokenized Relation Transformeraccepted
- End-to-End Language-Action Model for Humanoid Whole Body Controlaccepted
- Endless World: Real-Time 3D-Aware Long Video Generationaccepted
- Energy Waveify and Redistribution for Test-Time Adaptation: A Control System Perspectiveaccepted
- Energy-GS: Image Energy-guided Pose Alignment Gaussian Splatting with redesigned pose gradient flowaccepted
- EnergyAction: Unimanual to Bimanual Composition with Energy-Based Modelsaccepted
- Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment Analysisaccepted
- Enhancing Accuracy of Uncertainty Estimation in Appearance-based Gaze Tracking with Probabilistic Evaluation and Calibrationaccepted
- Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weightingaccepted
- Enhancing Descriptive Captions with Visual Attributes for Multimodal Perceptionaccepted
- Enhancing Hands in 3D Whole-Body Pose Estimation with Conditional Hands Modulatoraccepted
- Enhancing Mixture-of-Experts Specialization via Cluster-Aware Upcyclingaccepted
- Enhancing Out-of-Distribution Detection with Extended Logit Normalizationaccepted
- Enhancing Part-Level Point Grounding for Any Open-Source MLLMsaccepted
- Enhancing Spatial Understanding in Image Generation via Reward Modelingaccepted
- Enhancing Unregistered Hyperspectral Image Super-Resolution via Unmixing-based Abundance Fusion Learningaccepted
- Enhancing Video Vision Language Model with Hippocampal Sensingaccepted
- Enhancing Visual Representation with Textual Semantics: Textual Semantics-Powered Prototypes for Heterogeneous Federated Learningaccepted
- Enhancing the Security of Visual Speaker Authentication Based on Dynamic Lip-Print Analysisaccepted
- Envision, Attend, Then Respond: Counterfactual Hallucination Mitigation in Large Vision-Language Modelsaccepted
- Envisioning the Future, One Step at a Timeaccepted
- EpiAgent: An Agent-Centric System for Ancient Inscription Restorationaccepted
- Erasing Thousands of Concepts: Towards Scalable and Practical Concept Erasure for Text-to-Image Diffusion Modelsaccepted
- EthoCLIP: Ontology-Enhanced Video-Language Pretraining for Animal Behavior Understandingaccepted
- Eulerian Gaussian Splatting using Hashed Probability Pyramidsaccepted
- EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervisionaccepted
- Evaluating Generative Models via One-Dimensional Code Distributionsaccepted
- Event Stream Filtering via Probability Flux Estimationaccepted
- Event Structural Valley: A Unified Theoretical and Practical Framework for Event Camera Autofocusaccepted
- Event-Based Motion Deblurring Using Task-Oriented 3D Gaussian Event Representationsaccepted
- Event-Illumination Collaborative Low-light Image Enhancement with a High-resolution Real-world Datasetaccepted
- Event-based Motion Deblurring with Unpaired Dataaccepted
- Event-based Visual Deformation Measurementaccepted
- Event6D: Event-based Novel Object 6D Pose Trackingaccepted
- EventDrive: Event Cameras for Vision-Language Driving Intelligenceaccepted
- EventGait: Towards Robust Gait Recognition with Event Streamsaccepted
- EventHub: Data Factory for Generalizable Event-Based Stereo Networks without Active Sensorsaccepted
- Every Error has Its Magnitude: Asymmetric Mistake Severity Training for Multiclass Multiple Instance Learningaccepted
- Evidential Deep Partial Label Learning to Quantify Disambiguation Uncertaintyaccepted
- Evidential Neural Radiance Fieldsaccepted
- Evidential Transformation Network: Turning Pretrained Models into Evidential Models for Post-hoc Uncertainty Estimationaccepted
- Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignmentaccepted
- Evo-Retriever: LLM-Guided Curriculum Evolution with Viewpoint-Pathway Collaboration for Multimodal Document Retrievalaccepted
- EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labelingaccepted
- EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrievalaccepted
- EvoID: Reinforced Evolution for Identity-Preserving Video Generationaccepted
- Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognitionaccepted
- Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memoryaccepted
- ExMesh: EXplicit Mesh Reconstruction with Topology Adaptationaccepted
- ExPose: Reinforcing Video Generation Models for Extreme Pose Estimationaccepted
- Exact-GS: Mathematically Rigorous and Accurate 3D Gaussian Splatting for 3D X-ray Reconstructionaccepted
- Exemplar-Free Class Incremental Learning via Preserving Class-Discriminative Structureaccepted
- Exemplar-Free Continual Learning for State Space Modelsaccepted
- ExpPortrait: Expressive Portrait Generation via Personalized Representationaccepted
- Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Modelsaccepted
- Expanding Spatial and Temporal Context for Robotic Imitation Learning With Scene Graphsaccepted
- Expanding mmWave Datasets for Human Pose Estimation with Unlabeled Data and LiDAR Datasetsaccepted
- Experience Transfer for Multimodal LLM Agents in Minecraft Gameaccepted
- Expert-Teacher-Student Collaborative Learning for Domain Adaptive Object Detectionaccepted
- Explaining CLIP Zero-shot Predictions Through Conceptsaccepted
- Explaining Object Detectors via Collective Contribution of Pixelsaccepted
- Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Explorationaccepted
- Exploring 6D Object Pose Estimation with Deformationaccepted
- Exploring Adaptive Masked Reconstruction for Self-Supervised Skeleton-Based Action Recognitionaccepted
- Exploring Conditions for Diffusion Models in Robotic Controlaccepted
- Exploring Spatial Intelligence from a Generative Perspectiveaccepted
- Exploring Spatiotemporal Feature Propagation for Video-Level Compressive Spectral Reconstruction: Dataset, Model and Benchmarkaccepted
- Exploring Visual Pretraining for Learning Language Intelligenceaccepted
- Exploring the Underwater World Segmentation without Extra Trainingaccepted
- ExpoCM: Exposure-Aware One-Step Generative Single-Image HDR Reconstructionaccepted
- Exposing Functional Fusion: A New Class of Strategic Backdoor in Dynamic Prompt Architecturesaccepted
- Exposing and Evaluating Hallucinations for GUI Groundingaccepted
- Extend3D: Town-Scale 3D Generationaccepted
- Extending Embodied Question Answering from Perception to Decisionaccepted
- Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representationaccepted
- ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splattingaccepted
- F$^2$-Assist: Multi-Phase Fetal Growth Forecast and Report Generation from Ultrasound Examinationaccepted
- F2Net: A Frequency-Fused Network for Ultra-High Resolution Remote Sensing Segmentationaccepted
- FAAR: Efficient Frequency-Aware Multi-Task Fine-Tuning via Automatic Rank Selectionaccepted
- FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generationaccepted
- FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignmentaccepted
- FAPE-IR: Frequency-Aware Planning and Execution Framework for All-in-One Image Restorationaccepted
- FARMER: Flow AutoRegressive Transformer over Pixelsaccepted
- FAST: Topology-Aware Frequency-Domain Distribution Matching for Coreset Selectionaccepted
- FAVE: A Structured Benchmark for Fine-Grained Audio-Visual Temporal Evaluation in Multimodal LLMsaccepted
- FB-CLIP: Fine-Grained Zero-Shot Anomaly Detection with Foreground-Background Disentanglementaccepted
- FBTA: Enabling Single-GPU End-to-End Gigapixel WSI Classification with Feature Bridging and Translation Alignmentaccepted
- FE2E: From Editor to Dense Geometry Estimatoraccepted
- FEAST: Fully Connected Expressive Attention for Spatial Transcriptomicsaccepted
- FEAT: Fashion Editing and Try-On from Any Designaccepted
- FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editingaccepted
- FG-Portrait: 3D Flow Guided Editable Portrait Animationaccepted
- FHAvatar: Fast and High-Fidelity Reconstruction of Face-and-Hair Composable 3D Head Avatar from Few Casual Capturesaccepted
- FILTR: Extracting Topological Features from Pretrained 3D Modelsaccepted
- FINE: Factorizing Knowledge for Initialization of Variable-sized Diffusion Modelsaccepted
- FINER: MLLMs Hallucinate under Fine-grained Negative Queriesaccepted
- FISHuman: Fine-grained Single-image 3D Human Reconstruction via Multi-view 4D Remeshingaccepted
- FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulationaccepted
- FLOW: Optimal Transport-Driven Feature Warping for Generalized Remote Physiological Measurementaccepted
- FM-Steer: Enhance Generalist Policies with Value-Guided Cascaded Denoisingaccepted
- FMPose3D: monocular 3D pose estimation via flow matchingaccepted
- FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEctionaccepted
- FOZO: Forward-Only Zeroth-Order Prompt Optimization for Test-Time Adaptationaccepted
- FPS-Bench: A Benchmark for High Frame-Rate Video Understandingaccepted
- FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolutionaccepted
- FSFSplatter: Geometrically Accurate Reconstruction with Free Sparse-view Images within 2 minutesaccepted
- FSLoRA: Harmonizing Detection and Re-Identification via Freq-Spatial Low-Rank Adapter for One-Stage Person Searchaccepted
- FUN REC * Reconstructing Functional 3D Scenes from Egocentric Interaction Videosaccepted
- FUSAR-GPT: A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imageryaccepted
- FUSER: Feed-Forward Multiview 3D Registration Transformer and SE(3)$^N$ Diffusion Refinementaccepted
- FVAR: Next-Focus Prediction for Visual Autoregressive Modelingaccepted
- FVBench: Benchmarking Deepfake Video Detection Capability of Large Multimodal Modelsaccepted
- F^2HDR: Two-Stage HDR Video Reconstruction via Flow Adapter and Physical Motion Modelingaccepted
- FabricGen: Microstructure-Aware Woven Fabric Generationaccepted
- Face-Guided Sentiment Boundary Enhancement for Weakly-Supervised Temporal Sentiment Localizationaccepted
- Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restorationaccepted
- FaceCam: Portrait Video Camera Control via Scale-Aware Conditioningaccepted
- Factorize, Reconstruct, Enhance: A Unified Framework for Multimodal Sentiment Analysisaccepted
- Factorized Context Aggregation for Robust Cancer Risk Estimation via Soft Re-Ranked Retrieval and Hierarchical Anchorsaccepted
- Failure Modes for Deep Learning-Based Online Mapping: How to Measure and Address Themaccepted
- FailureAtlas: Mapping the Failure Landscape of T2I Models via Active Explorationaccepted
- FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistantsaccepted
- FaithFusion: Harmonizing Reconstruction and Generation via Pixel-wise Information Gainaccepted
- Faithful Contouring: Near-Lossless 3D Voxel Representation Free from Iso-surfaceaccepted
- FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-and-Language Navigationaccepted
- Fast Markov Random Field Optimisation for Topologically Noisy 3D Shape Matchingaccepted
- Fast Reasoning Segmentation for Images and Videosaccepted
- Fast SceneScript: Fast and Accurate Language-Based 3D Scene Understanding via Multi-Token Predictionaccepted
- Fast Spatial Tracking with Visual Geometry Transformeraccepted
- Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matchingaccepted
- Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planningaccepted
- Fast3Dcache: Training-free 3D Geometry Synthesis Accelerationaccepted
- FastEventDGS: Deformable Gaussian Splatting for Fast Dynamic Scenes from a Single Event Cameraaccepted
- FastGS: Training 3D Gaussian Splatting in 100 Secondsaccepted
- FastGaMer: Efficient GainMap Learning for Practical Inverse Tone Mappingaccepted
- FastHybrid: Accelerating Hybrid Autoregressive Image Generation with Lookahead and Guided Decodingaccepted
- FastLightGen: Fast and Light Video Generation with Fewer Steps and Parametersaccepted
- FastRef: Fast Prototype Refinement for Few-shot Industrial Anomaly Detectionaccepted
- Faster-GS: Analyzing and Improving Gaussian Splatting Optimizationaccepted
- FeatureFool: Zero-Query Fooling of Video Models via Feature Mapaccepted
- Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learnersaccepted
- Fed-ADE: Adaptive Learning Rate for Federated Post-adaptation under Distribution Shiftaccepted
- FedAFD: Multimodal Federated Learning via Adversarial Fusion and Distillationaccepted
- FedARA: Resource-adaptive Low-rank Personalized Federated Learning via Anchor-driven Representation Alignment on Heterogeneous Edge Devicesaccepted
- FedAdamom: Adaptive Momentum for Improved Generalization in Federated Optimizationaccepted
- FedAlign: Differentially Private Distribution Alignment for Non-IID Federated Learningaccepted
- FedBPrompt: Federated Domain Generalization Person Re-Identification via Body Distribution Aware Visual Promptsaccepted
- FedCART: Tackling Long-Tailed Distributions in Federated Adversarial Training via Classifier Refinementaccepted
- FedDAP: Domain-Aware Prototype Learning for Federated Learning under Domain Shiftaccepted
- FedHarmony: Harmonizing Heterogeneous Label Correlations in Federated Multi-Label Learningaccepted
- FedMOP: Achieving Enhanced Privacy and Performance in Federated Learning via Momentum Orthogonal Projectionaccepted
- FedMPT: Federated Multi-Label Prompt Tuning of Vision-Language Modelsaccepted
- FedRAC: Rolling Submodel Allocation for Collaborative Fairness in Federated Learningaccepted
- FedRE: A Representation Entanglement Framework for Model-Heterogeneous Federated Learningaccepted
- FedRG: Unleashing the Representation Geometry for Federated Learning with Noisy Clientsaccepted
- FedSDR: Federated Graph Learning with Structural Noise Detection and Reconstructionaccepted
- FedSST: Rethinking Fair Federated Graph Learning under Structural Shiftaccepted
- Federated Active Learning Under Extreme Non-IID and Global Class Imbalanceaccepted
- Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstructionaccepted
- Feed-forward Gaussian Registration for Head Avatar Creation and Editingaccepted
- Few-Shot Hybrid Incremental Learning:Continually Learning under Data Scarcity and Task Uncertaintyaccepted
- Few-Shot Incremental 3D Object Detection in Dynamic Indoor Environmentsaccepted
- Few-Step Diffusion Sampling Through Instance-Aware Discretizationsaccepted
- Few-for-Many Personalized Federated Learningaccepted
- Few-shot Acoustic Synthesis with Multimodal Flow Matchingaccepted
- FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolutionaccepted
- Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppressionaccepted
- FilterGS: Traversal-Free Parallel Filtering and Adaptive Shrinking for Large-Scale LoD 3D Gaussian Splattingaccepted
- FinPercep-RM: A Fine-grained Reward Model and Co-evolutionary Curriculum for RL-based Real-world Super-Resolutionaccepted
- Finding Distributed Object-Centric Properties in Self-Supervised Transformersaccepted
- Fine-Grained GRPO for Precise Preference Alignment in Flow Modelsaccepted
- Fine-Grained Multi Image Object Hallucination Benchmarkaccepted
- Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradientsaccepted
- Fine-Tuning Impairs the Balancedness of Foundation Models in Long-tailed Personalized Federated Learningaccepted
- Fine-VAD: Towards Fine-Grained Video Anomaly Detection via Progressive Cross-Granularity Learningaccepted
- Fine-grained Image Aesthetic Assessment: Learning Discriminative Scores from Relative Ranksaccepted
- FireScope: Wildfire Risk Raster Prediction With a Chain-of-Thought Oracleaccepted
- First Frame Is the Place to Go for Video Content Customizationaccepted
- First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Modelsaccepted
- FisherPoser: Human Motion Estimation from Sparse Observations with Hierarchical Region-Wise Fisher-Matrix Uncertainty Modelingaccepted
- Fixed Anchors Are Not Enough: Dynamic Retrieval and Persistent Homology for Dataset Distillationaccepted
- Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learningaccepted
- FlashCap: Millisecond-Accurate Human Motion Capture via Flashing LEDs and Event-Based Visionaccepted
- FlashDecoder: Real-Time Latent-to-Pixel Streaming Decoder with Transformersaccepted
- FlashIn: Fast and Accurate Image Inversion for Real-time Image Editingaccepted
- FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANsaccepted
- FlashMesh: Faster and Better Autoregressive Mesh Synthesis via Structured Speculationaccepted
- FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidanceaccepted
- FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Predictionaccepted
- FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attentionaccepted
- FlashVSR: Towards Real-time Diffusion-Based Streaming Video Super Resolutionaccepted
- Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assemblyaccepted
- FlexAvatar: Flexible Large Reconstruction Model for Animatable Gaussian Head Avatars with Detailed Deformationaccepted
- FlexAvatar: Learning Complete 3D Head Avatars with Partial Supervisionaccepted
- FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Controlaccepted
- FlexiVideo: Variation-Aware Temporal Dynamics Modeling for Efficient Video Understandingaccepted
- FloVerse: Floor Plan-Guided Multi-Modal Navigationaccepted
- FloodDiffusion: Tailored Diffusion Forcing for Streaming Motion Generationaccepted
- Flow Map Distillation Without Dataaccepted
- Flow Matching for Multimodal Distributionsaccepted
- Flow3r: Factored Flow Prediction for Scalable Visual Geometry Learningaccepted
- Flow4DGS-SLAM: Optical Flow-Guided 4D Gaussian Splatting SLAMaccepted
- FlowComposer: Composable Flows for Compositional Zero-Shot Learningaccepted
- FlowDC: Flow-Based Decoupling-Decay for Complex Image Editingaccepted
- FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matchingaccepted
- FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editingaccepted
- FlowFM: Advancing Dark Optical Flow Estimation with Flow Matchingaccepted
- FlowFixer: Towards Detail-Preserving Subject-Driven Generationaccepted
- FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Modelsaccepted
- FlowMotion: Training-Free Flow Guidance for Video Motion Transferaccepted
- FlowPalm: Optical Flow Driven Non-Rigid Deformation for Geometrically Diverse Palmprint Generationaccepted
- FlowPortal: Residual-Corrected Flow for Training-Free Video Relighting and Background Replacementaccepted
- FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectoriesaccepted
- Flowception: Temporally Expansive Flow Matching for Video Generationaccepted
- FluidGaussian: Propagating Simulation-Based Uncertainty Toward Functionally-Intelligent 3D Reconstructionaccepted
- FluoCLIP: Stain-Aware Focus Quality Assessment in Fluorescence Microscopyaccepted
- FluxMem: Adaptive Hierarchical Memory for Streaming Video Understandingaccepted
- FoSS: Modeling Long-Range Dependencies and Multimodal Uncertainty in Trajectory Prediction via Fourier-State Space Integrationaccepted
- FoV-Net: Rotation-Invariant CAD B-rep Learning via Field-of-View Ray Castingaccepted
- Focal-General Diffusion Model with Semantic Consistent Guidance for Sign Language Productionaccepted
- Focus on Background: Exploring SAM's Potential in Few-shot Medical Image Segmentation with Background-centric Promptingaccepted
- Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understandingaccepted
- Focus-to-Perceive Representation Learning: A Cognition-Inspired Hierarchical Framework for Endoscopic Video Analysisaccepted
- FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selectionaccepted
- FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clipsaccepted
- FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scriptsaccepted
- Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioningaccepted
- FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generationaccepted
- ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulationaccepted
- ForeAct: Steering Your VLA with Efficient Visual Foresight Planningaccepted
- ForeHOI: Feed-forward 3D Object Reconstruction from Daily Hand-Object Interaction Videosaccepted
- Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Diffusion Transformersaccepted
- Forecasting 3D Scanpaths in Egocentric Videoaccepted
- Forensic-Friendly Image Manipulation via Controllable Latent Diffusionaccepted
- Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Modelsaccepted
- FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Modelaccepted
- Foundation Encoders Are All You Need for Preference-Aware Personalizationaccepted
- Foundation Model Priors Enhance Object Focus in Feature Space for Source-Free Object Detectionaccepted
- Foundry: Distilling 3D Foundation Models for the Edgeaccepted
- Fourier Angle Alignment for Oriented Object Detection in Remote Sensingaccepted
- Fractal Camouflage: A Bio-Inspired Approach for Multi-Scale Adversarial Attacks in the Infrared Domainaccepted
- Frame2Freq: Spectral Adapters for Fine-Grained Video Understandingaccepted
- Franca: Nested Matryoshka Clustering for Scalable Visual Representation Learningaccepted
- FrankenMotion: Part-level Human Motion Generation and Compositionaccepted
- Free-Grained Hierarchical Visual Recognitionaccepted
- Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correctionaccepted
- FreeArtGS: Articulated Gaussian Splatting Under Free-moving Scenarioaccepted
- FreeForm: Reduced-Order Deformable Simulation from Particle-Based Skinning Eigenmodesaccepted
- FreeScale: Scaling 3D Scenes via Certainty-Aware Free-View Generationaccepted
- FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image Editingaccepted
- FreqSIC: Frequency-aware Stereo Image Compression with Bi-directional Checkerboard Context Modelaccepted
- Frequency Switching Mechanism for Parameter-Efficient Multi-Task Learningaccepted
- Frequency-Aware Affinity for Weakly Supervised Semantic Segmentationaccepted
- Frequency-Aware Flow Matching for High-Quality Image Generationaccepted
- Frequency-domain Manipulation for Face Obfuscationaccepted
- Fresco: Frequency-Spatial Consistent Optimization for Fine-Grained Head Avatar Modelingaccepted
- From 2D Alignment to 3D Plausibility: Unifying Heterogeneous 2D Priors and Penetration-Free Diffusion for Occlusion-Robust Two-Hand Reconstructionaccepted
- From 3D Pose to Prose: Biomechanics-Grounded Vision-Language Coachingaccepted
- From Attraction to Equilibrium: Physics-Inspired Semantic Gravitons for Zero-Shot Anomaly Detectionaccepted
- From Contrast to Consistency: Rethinking Event-based Continuous-Time Optical Flow Estimationaccepted
- From Corners to Fiducial Tags: Revisiting Checkerboard Calibration for Event Camerasaccepted
- From Detection to Association: Learning Discriminative Object Embeddings for Multi-Object Trackingaccepted
- From Events to Clarity: The Event-Guided Diffusion Framework for Dehazingaccepted
- From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Trainingaccepted
- From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Groundingaccepted
- From Feature Learning to Spectral Basis Learning: A Unifying and Flexible Framework for Efficient and Robust Shape Matchingaccepted
- From Few-way to Many-way: Rethinking Few-shot Fine-grained Image Classificationaccepted
- From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMsaccepted
- From Infusion to Assimilation Distillation for Medical Image Segmentationaccepted
- From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decompositionaccepted
- From Intuition to Investigation: A Tool-Augmented Reasoning MLLM Framework for Generalizable Face Anti-Spoofingaccepted
- From Manuals to Actions: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulationaccepted
- From Measurement to Mitigation: Quantifying and Reducing Identity Leakage in Image Representation Encoders with Linear Subspace Removalaccepted
- From None to All: Self-Supervised 3D Reconstruction via Novel View Synthesisaccepted
- From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settingsaccepted
- From Pairs to Sequences: Track-Aware Policy Gradients for Keypoint Detectionaccepted
- From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literatureaccepted
- From Pixel to Precision: Enhancing Handwritten Mathematical Expression Recognition with Image-Level Rewardaccepted
- From Rays to Projections: Better Inputs for Feed-Forward View Synthesisaccepted
- From Scale to Speed: Adaptive Test-Time Scaling for Image Editingaccepted
- From Selection to Scheduling: Federated Geometry-Aware Correction Makes Exemplar Replay Work Better under Continual Dynamic Heterogeneityaccepted
- From Sketch to Fresco: Efficient Diffusion Transformer with Progressive Resolutionaccepted
- From Softmax to Dirichlet: Evidential Learning for Semi-supervised Semantic Segmentationaccepted
- From Spots to Pixels: Dense Spatial Gene Expression Prediction from Histology Imagesaccepted
- From Static to Dynamic: Exploring Self-supervised Image-to-Video Representation Transfer Learningaccepted
- From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decompositionaccepted
- From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMsaccepted
- Fuel Gauge: Estimating Chain-of-Thought Length Ahead of Time in Large Multimodal Modelsaccepted
- Fully Decentralized Certified Unlearningaccepted
- FunFact: Building Probabilistic Functional 3D Scene Graphs via Factor-Graph Reasoningaccepted
- Functional Mean Flow in Hilbert Spaceaccepted
- Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimizationaccepted
- Fusion of Depth and Semantics for Probabilistic Floorplan Localizationaccepted
- FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognitionaccepted
- FusionRegister: Every Infrared and Visible Image Fusion Deserves Registrationaccepted
- G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoningaccepted
- G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrievalaccepted
- GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigationaccepted
- GDFA: Geometry-Driven Federated Unlearning with Directional Task Vector Alignmentaccepted
- GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolutionaccepted
- GDRO: Group-level Reward Post-training Suitable for Diffusion Modelsaccepted
- GEM-TFL: Bridging Weak and Full Supervision for Forgery Localization through EM-Guided Decomposition and Temporal Refinementaccepted
- GEM: Generating LiDAR World Model via Deformable Mambaaccepted
- GFRRN: Explore the Gaps in Single Image Reflection Removalaccepted
- GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Modelsaccepted
- GGPT: Geometry-Grounded Point Transformeraccepted
- GH-NAF: Grid-Adaptive Hash-Level-Attended Neural Attenuation Fields for Discrepancy-Aware CBCTaccepted
- GHPT: Real-Time Relightable Gaussian Splatting using Hybrid Path Tracingaccepted
- GIFSplat: Generative Prior-Guided Iterative Feed-Forward 3D Gaussian Splatting from Sparse Viewsaccepted
- GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understandingaccepted
- GLINT: Modeling Scene-Scale Transparency via Gaussian Radiance Transportaccepted
- GM-R^2: Generative Matching Learning for Unsupervised Geometric Representation and Registrationaccepted
- GMT: Effective Global Framework for Multi-Camera Multi-Target Trackingaccepted
- GOR-IS: 3D Gaussian Object Removal In the Intrinsic Spaceaccepted
- GP-4DGS: Probabilistic 4D Gaussian Splatting from Monocular Video via Variational Gaussian Processesaccepted
- GPFlow: Gaussian Prototype Probability Flow for Unsupervised Multi-Modal Anomaly Detectionaccepted
- GR-Gauge: Cost-efficient Training Configuration By Gauging the Gradient Redundancyaccepted
- GROW: Watermark Generation with Progressive Guidance for Diffusion Modelsaccepted
- GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clippingaccepted
- GS-ASM: 2DGS-Supervised Active Stereo Matchingaccepted
- GS-CLIP: Zero-shot 3D Anomaly Detection by Geometry-Aware Prompt and Synergistic View Representation Learningaccepted
- GSNR: Graph Smooth Null-Space Representation for Inverse Problemsaccepted
- GSV2X: Geometry-Aware Uncertainty Modeling and Orthogonal Fusion for Robust Roadside Perceptionaccepted
- GS^2: Graph-based Spatial Distribution Optimization for Compact 3D Gaussian Splattingaccepted
- GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modelingaccepted
- GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Trainingaccepted
- GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinkingaccepted
- GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agentsaccepted
- GUI-SAGE: Enhancing GUI Automation with Self-Explanatory Learningaccepted
- GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasksaccepted
- GVIS: Generative Vector Image Steganographyaccepted
- Gallant: Voxel Grid-based Humanoid Locomotion and Local-navigation across 3-D Constrained Terrainsaccepted
- Gamba: Mamba-based graph convolutional network with dynamic graph topology learning for action recognitionaccepted
- GardenDesigner: Encoding Aesthetic Principles into Jiangnan Garden Construction via a Chain of Agentsaccepted
- Garments2Look: A Multi-Reference Dataset for High-Fidelity Outfit-Level Virtual Try-On with Clothing and Accessoriesaccepted
- Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysisaccepted
- Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformersaccepted
- Gated KalmaNet: A Fading Memory Layer through Test-time Ridge Regressionaccepted
- Gau-Occ: Geometry-Completed Gaussians for Multi-Modal 3D Occupancy Predictionaccepted
- GauMVC: Generative Decoupled Gaussian Representation for Human-centric Multi-view Video Compressionaccepted
- GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generatoraccepted
- Gaussian Mapping for Evolving Scenesaccepted
- Gaussian Splatting-based Low-Rank Tensor Representation for Multi-Dimensional Image Recoveryaccepted
- Gaussian-Mixture Latent Flow for Stochastic 3D Human Motion Predictionaccepted
- GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generationaccepted
- GaussianFluent: Gaussian Simulation for Dynamic Scenes with Mixed Materialsaccepted
- GaussianGrow: Geometry-aware Gaussian Growing from 3D Point Clouds with Text Guidanceaccepted
- GaussianMatch: Semi-Supervised Regression with Pseudo-Label Filtering via Multi-View Gaussian Consistencyaccepted
- GaussianPile: A Unified Sparse Gaussian Splatting Framework for Slice-based Volumetric Reconstructionaccepted
- GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splattingaccepted
- GaussianZoom: Progressive Zoom-in Generative 3D Gaussian Splatting with Geometric and Semantic Guidanceaccepted
- Gaze Target Estimation Anywhere with Conceptsaccepted
- GazeOnce360: Fisheye-Based 360deg Multi-Person Gaze Estimation with Global-Local Feature Fusionaccepted
- GazeShift: Unsupervised Gaze Estimation and Dataset for VRaccepted
- GeCo-SRT: Geometry-aware Continual Adaptation for Cross-Task Sim-to-Real Transferaccepted
- GeCo: Geometry-Consistent Regularization for Domain Generalized Semantic Segmentationaccepted
- Gen3R: 3D Scene Generation Meets Feed-Forward Reconstructionaccepted
- GenBreak: Red Teaming Text-to-Image Generation Using Large Language Modelsaccepted
- GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generationaccepted
- GenErase: Generalizable and Semantically-Aware Concept Erasure in Diffusion Modelsaccepted
- GenHOI: Towards Object-Consistent Hand-Object Interaction with Temporally Balanced and Spatially Selective Object Injectionaccepted
- GenMask: Adapting DiT for Segmentation via Direct Mask Generationaccepted
- GenMatter: Perceiving Physical Objects with Generative Matter Modelsaccepted
- GenSplat: Bridging the Generalization Gap in 3DGS Language Comprehensionaccepted
- GenTract: Generative Global Tractographyaccepted
- GeneVAR: Causal MeanFlow for Autoregressive Gene-to-WSI Tile Synthesisaccepted
- General Process Reward Modeling for Robotic Reinforcement Learningaccepted
- Generalizable Co-Salient Object Detection via Mixed Content-Style Modulationaccepted
- Generalizable Knowledge Distillation from Vision Foundation Models for Semantic Segmentationaccepted
- Generalizable Radio-Frequency Radiance Fields for Spatial Spectrum Synthesisaccepted
- Generalizable Sparse-View 3D Reconstruction from Unconstrained Imagesaccepted
- Generalizable Structure-Aware Keypoint Correspondence for Category-Unified 3D Single Object Trackingaccepted
- Generalizable Video Quality Assessment via Weak-to-Strong Learningaccepted
- Generalized and Personalized Federated Learning with Black-Box Foundation Models via Orthogonal Transformationsaccepted
- Generalized-CVO: Fast and Correspondence-Free Local Point Cloud Registration with Second Order Riemannian Optimizationaccepted
- Generalizing Visual Geometry Priors to Sparse Gaussian Occupancy Predictionaccepted
- Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoningaccepted
- Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videosaccepted
- Generative Adversarial Perturbations with Cross-paradigm Transferability on Localized Crowd Countingaccepted
- Generative Diffusion Priors for 3D Mapping of the Dark Universeaccepted
- Generative Modeling of Weights: Generalization or Memorization?accepted
- Generative Neural Video Compression via Video Diffusion Prioraccepted
- Generative Point Tracking and Forecastingaccepted
- Generative Video Compression with One-Dimensional Latent Representationaccepted
- Generative Video Motion Editing with 3D Point Tracksaccepted
- GeniNav: Generative Model Driven Image-Goal Navigation via Imagination-Guided Consistency Flow Matchingaccepted
- GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generationaccepted
- Geo2: Geometry-Guided Cross-view Geo-Localization and Image Synthesisaccepted
- GeoAgent: Learning to Geolocate Everywhere with Reinforced Geographic Characteristicsaccepted
- GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localizationaccepted
- GeoCoT: Towards Reliable Remote Sensing Reasoning with Manifold Perspectiveaccepted
- GeoDexGrasp: Geometry-aware Generation for Data-efficient and Physics-plausible Dexterous Graspingaccepted
- GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understandingaccepted
- GeoDiff4D: Geometry-Aware Diffusion for 4D Head Avatar Reconstructionaccepted
- GeoFlow: Real-Time Fine-Grained Cross-View Geolocalization via Iterative Flow Predictionaccepted
- GeoFree-CoSeg: Unsupervised Point Cloud-Image Cross-Modal Co-Segmentation Without Geometric Alignmentaccepted
- GeoGuide: Hierarchical Geometric Guidance for Open-Vocabulary 3D Semantic Segmentationaccepted
- GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensingaccepted
- GeoMotion: Rethinking Motion Segmentation via Latent 4D Geometryaccepted
- GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulationaccepted
- GeoRK2: Geometry-Guided Runge-Kutta Integration for Diffusion Transformer Accelerationaccepted
- GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformersaccepted
- GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentationaccepted
- GeoSANE: Learning Geospatial Representations from Models, Not Dataaccepted
- GeoSURGE: Geo-localization using Semantic Fusion with Hierarchy of Geographic Embeddingsaccepted
- GeoSemba: Reconstructing State Space Model for Cross Paradigm Representation in Medical Image Segmentationaccepted
- GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoningaccepted
- GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Groundingaccepted
- GeoWorld: Geometric World Modelsaccepted
- GeodesicNVS: Probability Density Geodesic Flow Matching for Novel View Synthesisaccepted
- Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructionsaccepted
- Geometric Neural Distance Fields for Learning Human Motion Priorsaccepted
- Geometric-Aware Hypergraph Reasoning for Novel Class Discovery in Point Cloud Segmentationaccepted
- Geometric-Photometric Event-based 3D Gaussian Ray Tracingaccepted
- Geometrically-Constrained Agent for Spatial Reasoningaccepted
- Geometry-Aligned and Anomaly-Aware Reconstruction for 3D Anomaly Detectionaccepted
- Geometry-Aware Cross-Modal Graph Alignment for Referring Segmentation in 3D Gaussian Splattingaccepted
- Geometry-Guided 3D Visual Token Pruning for Video-Language Modelsaccepted
- Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Contextaccepted
- Geometry-driven OOD Detectors Are Class-Incremental Learnersaccepted
- Ghost-FWL: A Large-Scale Full-Waveform LiDAR Dataset for Ghost Detection and Removalaccepted
- Ghosts in the Point Clouds: De-glaring LiDAR in the Transient Domainaccepted
- Global Information Thresholding for Sufficient and Necessary Circuitsaccepted
- Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulationaccepted
- Global Structure-from-Motion Meets Feedforward Reconstructionaccepted
- Global Underwater Geolocation from Time-Lapse Polarization Imageryaccepted
- Global-Aware Edge Prioritization for Pose Graph Initializationaccepted
- Global-Graph Guided and Local-Graph Weighted Contrastive Learning for Unified Clustering on Incomplete and Noise Multi-View Dataaccepted
- Globally Optimal Pose from Orthographic Silhouettesaccepted
- Globscope: Toward a Global View of the Loss Landscapeaccepted
- Gloria: Consistent Character Video Generation via Content Anchorsaccepted
- Glove2Hand: Synthesizing Natural Hand-Object Interaction from Multi-Modal Sensing Glovesaccepted
- GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Renderingaccepted
- Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goalsaccepted
- Goal-Driven Reward by Video Diffusion Models for Reinforcement Learningaccepted
- Goldilocks Test Sets for Face Verificationaccepted
- Good Can Sometimes be Bad: A Unified Attack against 3D Point Cloud Classifier by a Flexible Isotropic Resamplingaccepted
- GrOCE : Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Modelsaccepted
- GraPHFormer: A Multimodal Graph Persistent Homology Transformer for the Analysis of Neuroscience Morphologiesaccepted
- Gradient Knows Best: Mixed-Precision Quantization via Gradient-Guided Bit Allocation for Super-Resolutionaccepted
- Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLMaccepted
- Graph Attention Prototypical Network for Robust Few-Shot Classificationaccepted
- Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoningaccepted
- Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphsaccepted
- GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learningaccepted
- GraspALL: Adaptive Structural Compensation from Illumination Variation for Robotic Garment Grasping in Any Low-Light Conditionsaccepted
- GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Graspingaccepted
- GraspLDP: Towards Generalizable Grasping Policy via Latent Diffusionaccepted
- Gravitation-Driven Semantic Alignment for Text Video Retrievalaccepted
- Grid Distillation: Compositional Image Distillation via Structured Generative Gridsaccepted
- Ground Reaction Inertial Poser: Physics-based Human Motion Capture from Sparse IMUs and Insole Pressure Sensorsaccepted
- GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Groundingaccepted
- Grounded 3D-Aware Spatial Vision-Language Modelingaccepted
- Grounded Chain-of-Thought for Multimodal Large Language Modelsaccepted
- Grounded Latents for Entity-Centric 4D Scene Generationaccepted
- Grounding Everything in Tokens for Multimodal Large Language Modelsaccepted
- GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluationaccepted
- Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaborationaccepted
- Group Editing: Edit Multiple Images in One Goaccepted
- GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervisionaccepted
- Guardians of the Hair: Rescuing Soft Boundaries in Depth, Stereo, and Novel Viewsaccepted
- GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Drivingaccepted
- Guiding Diffusion Models with Fine-Grained Conditions and Semantics-Preserving Sampling for One-Shot Federated Learningaccepted
- Guiding Diffusion Models with Semantically Degraded Conditionsaccepted
- Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representationaccepted
- Guiding Token-Sparse Diffusion Modelsaccepted
- Guiding a Diffusion Model by Swapping Its Tokensaccepted
- Guiding a Diffusion Transformer with the Internal Dynamics of Itselfaccepted
- Gyro-based Deep Video Deblurringaccepted
- H-Sets: Hessian-Guided Discovery of Set-Level Feature Interactions in Image Classifiersaccepted
- H2-Surv: Hierarchical Hyperbolic Multimodal Representation Learning for Survival Predictionaccepted
- HAD: Hallucination-Aware Diffusion Priors for 3D Reconstructionaccepted
- HAD: Heterogeneity-Aware Distillation for Lifelong Heterogeneous Learningaccepted
- HAMMER: Harnessing MLLMs via Cross-Modal Integration for Intention-Driven 3D Affordance Groundingaccepted
- HATS: Hardness-Aware Trajectory Synthesis for GUI Agentsaccepted
- HAVE-Bench: Hierarchical Audio-Visual Evaluation from Perception to Interactionaccepted
- HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Modelsaccepted
- HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generationaccepted
- HCL-FF: Hierarchical and Contrastive Learning for Forward-Forward Algorithmaccepted
- HDR-VLM: HDR-Domain Adaptation of VLMs and Preference-Aligned Quality Assessment for HDR Video Color Gradingaccepted
- HDW-SR: High-Frequency Guided Diffusion Model based on Wavelet Decomposition for Image Super-Resolutionaccepted
- HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answeringaccepted
- HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videosaccepted
- HFR and HDR Video from Multi-Attenuated Spikes Using a Rapidly Rotating SpokeND Filteraccepted
- HFedATM: Hierarchical Federated Domain Generalization via Optimal Transport and Regularized Mean Aggregationaccepted
- HG-Lane: High-Fidelity Generation of Lane Scenes under Adverse Weather and Lighting Conditions without Re-annotationaccepted
- HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Modelsaccepted
- HOLO: Homography-Guided Pose Estimator Network for Fine-Grained Visual Localization on SD Mapsaccepted
- HOPS: Hierarchical Open-vocabulary Part Segmentation with Attention-Aware Filtering and Affinity-Guided Enhancementaccepted
- HP-Edit: A Human-Preference Post-Training Framework for Image Editingaccepted
- HQC-NBV: A Hybrid Quantum-Classical View Planning Approachaccepted
- HSI-GPT2: A Dual-Granularity Large Motion Reasoning Model with Diffusion Refinement for Human-Scene Interactionaccepted
- HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigationaccepted
- HTTM: Head-wise Temporal Token Merging for Faster VGGTaccepted
- HUMAPS-4D: A Multimodal Dataset for HUman Motion Analysis with Physiological and Semantic informationsaccepted
- HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generationaccepted
- HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesisaccepted
- H^2A^2: Homogeneity-Aware and Heterogeneity-Aware Feature Perception for Unified Indoor 3D Object Detectionaccepted
- HalluGen: Synthesizing Realistic and Controllable Hallucinations for Evaluating Image Restorationaccepted
- HamiPose: Hamiltonian Optimization for Unsupervised Domain Adaptive Pose Estimationaccepted
- HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamicsaccepted
- HandDreamer: Zero-Shot Text to 3D Hand Model Generation using Corrective Hand Shape Guidanceaccepted
- HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Modelsaccepted
- HandWorld: Hand-Centric Unified Video Action Generationaccepted
- HandX: Scaling Bimanual Motion and Interaction Generationaccepted
- Haptic Neural Fields: Bringing Tactile Interactions to 3D Rendered Scenesaccepted
- Harmonic Canvas: Inversion-Free Editing for Visually-Guided Music Style Transferaccepted
- Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMsaccepted
- Harmonized Feature Conditioning and Frequency-Prompt Personalization for Multi-Rater Medical Segmentationaccepted
- Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergyaccepted
- Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofingaccepted
- Harnessing the Power of Foundation Models for Accurate Material Classificationaccepted
- HeSS: Head Sensitivity Score for Sparsity Redistribution in VGGTaccepted
- Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generationaccepted
- Hear What Matters! Text-conditioned Selective Video-to-Audio Generationaccepted
- Hear What You See: Video-to-Audio Generation with Diffusion Transformer and Semantic-Temporal Alignment-Ranked Direct Preference Optimizationaccepted
- Hear you are: Teaching LLMs Spatial Reasoning with Vision and Spatial Soundaccepted
- Hearing the Room Through the Shape of the Drum: Modal-Guided Sound Recovery from Multi-Point Surface Vibrationsaccepted
- Hermite Radial Basis Function for Surface Reconstruction via Differentiable Renderingaccepted
- HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Viewsaccepted
- Heterogeneous Decentralized Diffusion Modelsaccepted
- Heuristic Self-Paced Learning for Domain Adaptive Semantic Segmentation under Adverse Conditionsaccepted
- Heuristic-inspired Reasoning Priors Facilitate Data-Efficient Referring Object Detectionaccepted
- Hg-I2P: Bridging Modalities for Generalizable Image-to-Point-Cloud Registration via Heterogeneous Graphsaccepted
- Hi-Lo Prune: Look at What You'll Lose before Pruning with Hierarchical Token Selectionaccepted
- HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learningaccepted
- HiDRA: Hierarchical Degradation Representation and Adaptation with Generative Priors for Enhancing Infrared Visionaccepted
- HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Modelsaccepted
- HiFICL: High-Fidelity In-Context Learning for Multimodal Tasksaccepted
- HiFi-BRep: High-Fidelity Latent Representation for Robust B-Rep Generationaccepted
- HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Imagesaccepted
- HiLoRA: Hierarchical Low-Rank Adaptation for Personalized Federated Learningaccepted
- HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Modelsaccepted
- HiconAgent: History Context-aware Policy Optimization for GUI Agentsaccepted
- Hidden Dangers of Compositional Generation: Diagnosing Semantic Safety Failures in Text-to-Image Modelsaccepted
- Hidden Monotonicity: Explaining Deep Neural Networks via their DC Decompositionaccepted
- Hier-COS: Making Deep Features Hierarchy-aware via Composition of Orthogonal Subspacesaccepted
- HierAmp: Coarse-to-Fine Autoregressive Amplification for Generative Dataset Distillationaccepted
- HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editingaccepted
- HierUQ: Hierarchical Uncertainty Quantification with Adaptive Granularity Reconciliation for Degraded Image Classificationaccepted
- HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Poolingaccepted
- Hierarchical Action Learning for Weakly-Supervised Action Segmentationaccepted
- Hierarchical Attacks for Multi-Modal Multi-Agent Reasoningaccepted
- Hierarchical Codec Diffusion for Video-to-Speech Generationaccepted
- Hierarchical Concept Embedding & Pursuit for Interpretable Image Classificationaccepted
- Hierarchical Enhancement of Semantic Priors for Disentangled Text-Driven Motion Generationaccepted
- Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Searchaccepted
- Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detectionaccepted
- Hierarchical Process Reward Models are Symbolic Vision Learnersaccepted
- Hierarchical Visual Relocalization with Nearest View Synthesis from Feature Gaussian Splattingaccepted
- Hierarchically Robust Zero-shot Vision-language Modelsaccepted
- High Resolution Neural Video Coding with Bi-directional Confidence-Guided Reference Information Modelingaccepted
- High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioningaccepted
- High-Fidelity Mobile Avatars with Pruned Local Blendshapesaccepted
- High-Fidelity Virtual Try-On beyond Paired Data Scarcity via Diffusion-based Cycle-Consistent Learningaccepted
- High-Precision Dichotomous Image Segmentation via Depth Integrity-Prior and Fine-Grained Patch Strategyaccepted
- High-Quality and Efficient Turbulence Mitigation with Eventsaccepted
- Hilbert Curve-Based Attention Enabling Topology-Preserving Image Tensor Representation for Semantic Segmentation Networkaccepted
- Hilbert-Geo: Solving Solid Geometric Problems by Neural-Symbolic Reasoningaccepted
- Hint2Gen: Bridging Understanding and Generation via Code-structured Hintsaccepted
- Hist2Style: Histogram-Guided Stylization with Bilateral Gridsaccepted
- History to Future: Evolving Agent with Experience and Thought for Zero-shot Vision-and-Language Navigationaccepted
- Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulationaccepted
- HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narrativesaccepted
- Homaloidal parametrization for detecting critical two-view configurationsaccepted
- HoneyBee: Data Recipes for Vision-Language Reasonersaccepted
- HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehiclesaccepted
- How Far Can We Go With Synthetic Data for Audio-Visual Sound Source Localization?accepted
- How Much 3D Do Video Foundation Models Encode?accepted
- How to Take a Memorable Picture? Empowering Users with Actionable Feedbackaccepted
- Hugging Visual Prompt and Segmentation Tokens: Consistency Learning for Fine-Grained Visual Understanding in MLLMsaccepted
- HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Modelsaccepted
- Human Geometry Distribution for 3D Animation Generationaccepted
- Human Interaction-Aware 3D Reconstruction from a Single Imageaccepted
- Human-Centric Multi-Exposure Fusion: Benchmark and Bi-level Cognition Distillation Frameworkaccepted
- Human-like Abstract Visual Reasoning via Understanding and Solving Reasoning Loopaccepted
- HumanBA: Human-Aware Bundle Adjustment via Global Human-Camera Decouplingaccepted
- HumanNOVA: Photorealistic, Universal and Rapid 3D Human Avatar Modeling from a Single Imageaccepted
- HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarksaccepted
- Humanoid Generative Pre-Training for Zero-Shot Motion Trackingaccepted
- Hunting Normality from Query Sample via Residual Learning for Generalist Anomaly Detectionaccepted
- HyCal: A Training-Free Prototype Calibration Method for Cross-Discipline Few-Shot Class-Incremental Learningaccepted
- HySeg: Learning Generative Priors for Structure-Aware Remote Sensing Segmentationaccepted
- Hybrid Agents for Image Restorationaccepted
- Hybrid Robust Collaborative Perception with LiDAR-4D Radar Fusion under Adverse Weather Conditionsaccepted
- Hybrid Token Compression for Vision-Language Modelsaccepted
- HybridDriveVLA: Vision-Language-Action Model with Visual CoT reasoning and ToT Evaluation for Autonomous Drivingaccepted
- HypeVPR: Exploring Hyperbolic Space for Perspective to Equirectangular Visual Place Recognitionaccepted
- Hyper-PCN: Hypergraph-Based Point Cloud Completion via High-Order Correlation Modelingaccepted
- HyperGait: Unleashing the Power of Parsing for Gait Recognition in the Wild via Hypergraphaccepted
- HyperGaussians: High-Dimensional Gaussian Splatting for High-Fidelity Animatable Face Avatarsaccepted
- HyperNAS: Enhancing Architecture Representation for NAS Predictor via Hypernetworkaccepted
- HyperST: Hierarchical Hyperbolic Learning for Spatial Transcriptomics Predictionaccepted
- Hyperbolic Busemann Neural Networksaccepted
- Hyperbolic Defect Feature Synthesis for Few-Shot Defect Classificationaccepted
- Hyperbolic Gramian Volumes for Multimodal Alignmentaccepted
- Hyperbolic Prototype Learning with Uncertainty-Aware Consistency for Continual Test-Time Segmentationaccepted
- Hyperbolic Relational Prompts for Intersectional Fairness in Medical VLMsaccepted
- Hypergraph-State Collaborative Reasoning for Multi-Object Trackingaccepted
- I'm a Map! Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformersaccepted
- I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learnersaccepted
- I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Modelsaccepted
- IAFMNet: Information-Aware Feature Modulation for Efficient Super-Resolutionaccepted
- IAG: Input-aware Backdoor Attack on VLM-based Visual Groundingaccepted
- IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentationaccepted
- ICTPolarReal: A Polarized Reflection and Material Dataset of Real World Objectsaccepted
- ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generationaccepted
- ID-Sim: An Identity-Focused Similarity Metricaccepted
- IDESplat: Iterative Depth Probability Estimation for Generalizable 3D Gaussian Splattingaccepted
- IDperturb: Enhancing Variation in Synthetic Face Generation via Angular Perturbationsaccepted
- IEBGL:An Interpretability-Enhanced Brain Graph Learning Framework with LLM-Instructed Topology and Literature-Augmented Semanticsaccepted
- IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Promptingaccepted
- IF-Prune: Information-Flow Guided Token Pruning for Efficient Vision-Language Modelsaccepted
- IFCSR: Inference-Free Fidelity-Realism Control for One-Step Diffusion-based Real-World Image Super-Resolutionaccepted
- IGen: Scalable Data Generation for Robot Learning from Open-World Imagesaccepted
- IMAIA: Interactive Maps AI Assistant for Travel Planning and Geo-Spatial Intelligenceaccepted
- IMS3: Breaking Distributional Aggregation in Diffusion-Based Dataset Distillationaccepted
- IMU-HOI: A Symbiotic Framework for Coherent Human-Object Interaction and Motion Capture via Contact-Conscious Inertial Fusionaccepted
- INSID3: Training-Free In-Context Segmentation with DINOv3accepted
- INSIGHT Bench: Towards Grounded IN-SItu Guidance for Robotic ManipulaTionaccepted
- IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generationaccepted
- IPR-1: Interactive Physical Reasoneraccepted
- IR-HGP: Physically-Aware Gaussian Inverse Rendering for High-Illumination Scenes via Generative Priorsaccepted
- IVAAN: Instance-level Vision-Language Alignment via Attribute-Guided Text Prompts Generation for Nuclei Analysisaccepted
- Identity-Preserving Image-to-Video Generation via Reward-Guided Optimizationaccepted
- Illuminating Visual Identity in Universal Multimodal Embeddingsaccepted
- Illumination-Consistent Human-Scene Reconstruction from Monocular Videoaccepted
- Illustrator's Depth: Monocular Layer Index Prediction for Image Decompositionaccepted
- Image Diffusion Preview with Consistency Solveraccepted
- Image Generation from Contextually-Contradictory Promptsaccepted
- Image Guides Images: Consistent Video Amodal Completion with Rectified In-Context Exemplar Guidanceaccepted
- Image-Guided Geometric Stylization of 3D Meshesaccepted
- Image-based Outlier Synthesis With Training Dataaccepted
- Image-to-Point Cloud Feature Back-Projection for Multimodal Training of 3D Semantic Segmentationaccepted
- ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Modelsaccepted
- Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrievalaccepted
- Imbalanced View Contribution Evaluation and Refinement for Deep Incomplete Multi-View Clusteringaccepted
- ImmerIris: A Large-Scale Dataset and Benchmark for Off-Axis and Unconstrained Iris Recognition in Immersive Applicationsaccepted
- Immunizing Models Against Harmful Long-Horizon Fine-Tuning via Contractive Optimization Dynamicsaccepted
- Improved Mean Flows: On the Challenges of Fastforward Generative Modelsaccepted
- Improving Adversarial Transferability with Local Perturbation Augmentationaccepted
- Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretrainingaccepted
- Improving Controllable Generation: Faster Training and Better Performance via x0-Supervisionaccepted
- Improving Diffusion Generalization with Weak-to-Strong Segmented Guidanceaccepted
- Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidanceaccepted
- Improving Sparse Autoencoder with Dynamic Attentionaccepted
- Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewardsaccepted
- Improving Vision-language Models with Perception-centric Process Reward Modelsaccepted
- In Pursuit of Pixel Supervision for Visual Pre-trainingaccepted
- InTrain: Intrinsic Trainability for Zero-Cost Neural Architecture Searchaccepted
- Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cuesaccepted
- Incentivizing Versatile Video Reasoning in MLLMs via Data-Efficient Reinforcement Learningaccepted
- Inconsistency-aware Multimodal Schrodinger Bridge for Deepfake Localizationaccepted
- IncreFA: Breaking the Static Wall of Generative Model Attributionaccepted
- Incremental Object Detection via Future-Aware Decoupled Cross-Head Distillationaccepted
- Inference-time Physics Alignment of Video Generative Models with Latent World Modelsaccepted
- Inferring Compositional 4D Scenes without Ever Seeing Oneaccepted
- InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexityaccepted
- InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fieldsaccepted
- Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rolloutaccepted
- InfinityHuman: Towards Long-Term Audio-Driven Human Animationaccepted
- Information-Theoretic Decomposition for Multimodal Interaction Learningaccepted
- InnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generationaccepted
- InsCal: Calibrated Multi-Source Fully Test-Time Prompt Tuning for Object Detectionaccepted
- Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workingsaccepted
- InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understandingaccepted
- Instance-level Visual Active Tracking with Occlusion-Aware Planningaccepted
- InstantRetouch: Efficient and High-Fidelity Instruction-Guided Image Retouching with Bilateral Spaceaccepted
- InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prioraccepted
- InstructMix2Mix: Consistent Sparse-View Editing Through Multi-View Model Personalizationaccepted
- Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Datasetaccepted
- Inter-Edit: First Benchmark for Interactive Instruction-Based Image Editingaccepted
- Inter-Photon-Limited Videographyaccepted
- InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphsaccepted
- InterPhys: Physics-aware Human Motion Synthesis in a Dynamic Sceneaccepted
- InterPrior: Scaling Generative Control for Physics-Based Human-Object Interactionsaccepted
- InterRVOS: Interaction-Aware Referring Video Object Segmentationaccepted
- Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Modelsaccepted
- Interactive Episodic Memory with User Feedbackaccepted
- Interactive Tracking: A Human-in-the-Loop Paradigm with Memory-Augmented Adaptationaccepted
- InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policyaccepted
- InternVideo-Next: Towards World-Understanding Video Modelsaccepted
- Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignmentaccepted
- Interpretable Debiasing of Vision-Language Models for Social Fairnessaccepted
- Interpretable Prompts made Edit-Friendly: Token-to-Token Similarity Reduction in dLLMs for Edit-Friendly Hard Prompt Inversionaccepted
- Interpretable and Steerable Concept Bottleneck Sparse Autoencodersaccepted
- Intervention-Aware Multiscale Representation Learning from Imaging Phenomics and Perturbation Transcriptomicsaccepted
- Intra-class Distribution-guided Generative Hashing with Neighbor Refinement for Cross-modal Retrievalaccepted
- Intrinsic Concept Extraction Based on Compositional Interpretabilityaccepted
- Intrinsic Geometry-Appearance Consistency Optimization for Sparse-View Gaussian Splattingaccepted
- Intrinsic Image Fusion for Multi-View 3D Material Reconstructionaccepted
- IntrinsicWeather: Controllable Weather Editing in Intrinsic Spaceaccepted
- IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Frameworkaccepted
- InvAD: Inversion-based Reconstruction-Free Anomaly Detection with Diffusion Modelsaccepted
- InvCoSS: Inversion-driven Continual Self-supervised Learning in Medical Multi-modal Image Pre-trainingaccepted
- InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpaintingaccepted
- Investigating Self-Supervised Representations for Audio-Visual Deepfake Detectionaccepted
- Iris: Bringing Real-World Priors into Diffusion Model for Monocular Depth Estimationaccepted
- Iris: Integrating Language into Diffusion-based Monocular Depth Estimationaccepted
- IrisFP: Adversarial-Example-based Model Fingerprinting with Enhanced Uniqueness and Robustnessaccepted
- Is Bin Generation Indispensable? A Bin-Generation-Free Dataset Quantization via Semantic Perspectiveaccepted
- Is Parameter Isolation Better for Prompt-Based Continual Learning?accepted
- Is the Modality Gap a Bug or a Feature? A Robustness Perspectiveaccepted
- Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigationaccepted
- IsoCLIP: Decomposing CLIP Projectors for Efficient Intra-modal Alignmentaccepted
- It Takes Two: A Duet of Periodicity and Directionality for Burst Flicker Removalaccepted
- It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Modelsaccepted
- Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Controlaccepted
- JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimizationaccepted
- JRM: Joint Reconstruction Model for Multiple Objects without Alignmentaccepted
- JUMP-Hand: Learning Joint-wise Uncertainty to Gate Mixture of View Experts for Multi-View 3D Hand Reconstructionaccepted
- Jailbreaking Vision-Language Models via Dissonance-Guided Suffix Optimization and Image-Phrase Injectionaccepted
- JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimizationaccepted
- JoPPO: Hierarchical Photography Assessment via Contrastive Joint Conditional Probabilistic Reinforcement Learningaccepted
- Joint Learning of General and Diverse Patterns with Mixture of Memory Experts for Weakly-Supervised Video Anomaly Detectionaccepted
- Joint Spectral Image Reconstruction and Semantic Segmentation with Cooperative Unfoldingaccepted
- Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wildaccepted
- Just-in-Time: Training-Free Spatial Acceleration for Diffusion Transformersaccepted
- KAMP: Knowledge-Anchored Multimodal Pretraining Framework for Medical Image Representationaccepted
- KASALv2: Fully Automatic 3D Rotational Symmetry Classification and Axis Localizationaccepted
- KLIP: Localized Distribution Shift Detection via KL-Divergence with Diffusion Priors in Inverse Problemsaccepted
- KV-Tracker: Real-Time Pose Tracking with Transformersaccepted
- KVSmooth: Mitigating Hallucination in Multi-modal Large Language Models through Key-Value Smoothingaccepted
- KaLOS finds Consensus: A Meta-Algorithm for Evaluating Inter-Annotator Agreement in Complex Vision Tasksaccepted
- Kaleidoscopic Scintillation Event Imagingaccepted
- Keep It Frozen: Domain-Routed Conditional Residual Modulation for Multi-Domain Vision Transformersaccepted
- Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Modelsaccepted
- KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving Systemaccepted
- Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editingaccepted
- L3DR: 3D-aware LiDAR Diffusion and Rectificationaccepted
- LA-Pose: Latent Action Pretraining Meets Pose Estimationaccepted
- LAM: Language Articulated Object Modelersaccepted
- LAMP: Language-Assisted Motion Planning for Controllable Video Generationaccepted
- LAMP: Localization Aware Multi-camera People Tracking in Metric 3D Worldaccepted
- LAOF: Robust Latent Action Learning with Optical Flow Constraintsaccepted
- LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Mapaccepted
- LASER: Layer-wise Scale Alignment for Training-Free Streaming 4D Reconstructionaccepted
- LATA: Laplacian-Assisted Transductive Adaptation for Conformal Uncertainty in Medical VLMsaccepted
- LATTICE: Democratize High-Fidelity 3D Generation at Scaleaccepted
- LDP-Slicing: Local Differential Privacy for Images via Randomized Bit-Plane Slicingaccepted
- LEAD: Minimizing Learner-Expert Asymmetry in End-to-End Drivingaccepted
- LEADER: Learning Reliable Local-to-Global Correspondences for LiDAR Relocalizationaccepted
- LEMON: A Large Endoscopic MONocular Dataset and Foundation Model for Perception in Surgical Settingsaccepted
- LESA: Learnable Stage-Aware Predictors for Diffusion Model Accelerationaccepted
- LF-BVN: Blind-View Network for Self-Supervised Light Field Denoisingaccepted
- LIBERO-Plus: A Progressive Robustness Benchmark for Visual-Language-Action Modelsaccepted
- LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Modelsaccepted
- LLM-Guided Probabilistic Fusion for Label-Efficient Document Layout Analysisaccepted
- LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Modelsaccepted
- LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understandingaccepted
- LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuningaccepted
- LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokensaccepted
- LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Modelsaccepted
- LNEM: Lunar Neural Elevation Modelaccepted
- LOREAL: Mitigating Low-Resolution Challenges in Vision-Language Models with Attribute-driven Prompt Self-Distillationaccepted
- LRDUN: A Low-Rank Deep Unfolding Network for Efficient Spectral Compressive Imagingaccepted
- LRHDR: Learning Representation-enhanced HDR Video Reconstructionaccepted
- LS-ViT: Least-Squares Hessian Based Block Reconstruction for Low-Bit Post-Training Quantization of Vision Transformersaccepted
- LUMINA: A Multi-Vendor Mammography Benchmark with Energy Harmonization Protocolaccepted
- LVLM-Aided Alignment of Task-Specific Vision Modelsaccepted
- LaDy: Lagrangian-Dynamic Informed Network for Skeleton-based Action Segmentation via Spatial-Temporal Modulationaccepted
- LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inferenceaccepted
- LaRP: Efficient Multi-View Inpainting with Latent Reprojection Priorsaccepted
- LaS-Comp: Zero-shot 3D Completion with Latent-Spatial Consistencyaccepted
- LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agentsaccepted
- LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Modelsaccepted
- Label What Matters: Modality-Balanced and Difficulty-Aware Multimodal Active Learningaccepted
- Label-Free Cross-Task LoRA Merging with Null-Space Compressionaccepted
- LacTokGen: Latent Consistency Tokenizer for 1024-pixel Image Generation by 256 Tokensaccepted
- Lafite: A Generative Latent Field for 3D Native Texturingaccepted
- LagerNVS: Latent Geometry for Fully Neural Real-time Novel View Synthesisaccepted
- Landscape-Awareness for Geometric View Diffusion Modelaccepted
- LangField4D: Learning Identity-Adaptive and Spatio-Temporal Continuous 4D Language Fields for Dynamic Scenesaccepted
- LangRef3DGS: Natural Language-Guided 3D Referential Segmentation from Partial Observations via 3D Gaussian Splattingaccepted
- Language Does Matter for Cross-Domain Few-Shot Visual Feature Enhancementaccepted
- Language Models Can Explain Visual Features via Steeringaccepted
- Language-Free Generative Editing from One Visual Exampleaccepted
- Language-Grounded Decoupled Action Representation for Robotic Manipulationaccepted
- Language-Guided One-Step Diffusion Model for Nighttime Flare Removalaccepted
- Language-driven Fine-grained Retrievalaccepted
- Language-guided Frequency Modulation for Large Vision-Language Modelsaccepted
- Large-scale Codec Avatars: The Unreasonable Effectiveness of Large-scale Avatar Pretrainingaccepted
- Large-scale Robust Enhanced Ensemble Clustering via Outlier Decouplingaccepted
- Latent Chain-of-Thought World Modeling for End-to-End Autonomous Drivingaccepted
- Latent Diffusion Inversion Requires Understanding the Latent Spaceaccepted
- Latent Implicit Visual Reasoningaccepted
- Layer Consistency Matters: Elegant Latent Transition Discrepancy for Generalizable Synthetic Image Detectionaccepted
- Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformersaccepted
- Layered 4D-Rotor Gaussian Splatting: A Compressed Representation for Long Dynamic Scenesaccepted
- LayoutAD: Exploring Semantic-Geometric Misalignment Reasoning for Scene Layout Anomaly Detectionaccepted
- LazyVAR: Accelerating Visual Autoregressive Models via Scale-wise Token Pruning and Parallel Group Decodingaccepted
- LeapAlign: Post-training Flow Matching Models at Any Generation Step by Building Two-Step Trajectoriesaccepted
- Learnability-Driven Submodular Optimization for Active Roadside 3D Detectionaccepted
- Learnability-Guided Diffusion for Dataset Distillationaccepted
- Learnable Motion-Focused Tokenization for Effective and Efficient Video Unsupervised Domain Adaptationaccepted
- Learned Image Compression via Sparse Attention and Adaptive Frequencyaccepted
- Learning 3D Reconstruction with Priors in Test Timeaccepted
- Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Imagesaccepted
- Learning 3D Shape Fidelity Metric from Real-world Distortionsaccepted
- Learning Anchor in Dual Orthogonal Space for Fast Multi-view Clusteringaccepted
- Learning Compact 3D Representations from Feed-Forward Novel View Synthesisaccepted
- Learning Convex Decomposition via Feature Fieldsaccepted
- Learning Coordinate-based Convolutional Kernels for Continuous SE(3) Equivariant and Efficient Point Cloud Analysisaccepted
- Learning Cross-View Object Correspondence via Cycle-Consistent Mask Predictionaccepted
- Learning Diffeomorphism for Medical Image Registration with Time-Embedded Architectures Using Semigroup Regularizationaccepted
- Learning Differentiable Hierarchies in 3D Gaussian Splattingaccepted
- Learning Effective Sign Features without Text for Gloss-free Sign Language Translationaccepted
- Learning Eigenstructures of Unstructured Data Manifoldsaccepted
- Learning Explicit Continuous Motion Representation for Dynamic Gaussian Splatting from Monocular Videosaccepted
- Learning Forgery-Aware Lip Representations Without Forgery Priorsaccepted
- Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervisionaccepted
- Learning Hierarchical Hyperbolic Mixture Model for Part-aware 3D Generationaccepted
- Learning Latent Concepts for Detecting Out-of-Distribution Objectsaccepted
- Learning Latent Proxies for Controllable Single-Image Relightingaccepted
- Learning Latent Transmission and Glare Maps for Lens Veiling Glare Removalaccepted
- Learning Like Humans: Analogical Concept Learning for Generalized Category Discoveryaccepted
- Learning Long-term Motion Embeddings for Efficient Kinematics Generationaccepted
- Learning Multi-View Spatial Reasoning from Cross-View Relationsaccepted
- Learning Mutual View Information Graph for Adaptive Adversarial Collaborative Perceptionaccepted
- Learning Personalized Photographic Style from Pairwise User Preferencesaccepted
- Learning Scene Coordinate Reconstruction from Unposed Images via Pose Graph Optimizationaccepted
- Learning Spatial-Temporal Consistency for 3D Semantic Scene Completionaccepted
- Learning Straight Flows: Variational Flow Matching for Efficient Generationaccepted
- Learning Surgical Robotic Manipulation with 3D Spatial Priorsaccepted
- Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videosaccepted
- Learning What Helps: Task-Aligned Context Selection for Vision Tasksaccepted
- Learning What Matters: Prioritized Concept Learning via Relative Error-driven Sample Selectionaccepted
- Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generationaccepted
- Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliencyaccepted
- Learning a Unified Latent Action Space from Videos with Action-centric Cycle Consistencyaccepted
- Learning and Aligning Click-Aware Shape Prior for Interactive Amodal Instance Segmentationaccepted
- Learning by Analogy: A Causal Framework for Compositional Generalizationaccepted
- Learning complete and explainable visual representations from itemized text supervisionaccepted
- Learning from Itself: Mining Internal Knowledge from Vision Language Models for Continual Learningaccepted
- Learning from Noisy Supervision: A Denoising-Debiasing Framework for Weakly Supervised Video Anomaly Detectionaccepted
- Learning from Oblivion: Predicting Knowledge-Overflowed Weights via Retrodiction of Forgettingaccepted
- Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generationaccepted
- Learning from Synthetic Data via Provenance-Based Input Gradient Guidanceaccepted
- Learning to Act Robustly with View-Invariant Latent Actionsaccepted
- Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Explorationaccepted
- Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learningaccepted
- Learning to Control Physically-simulated 3D Characters via Generating and Mimicking 2D Motionsaccepted
- Learning to Diversify and Focus: A Reinforcement Framework for Open-Vocabulary HOI Detectionaccepted
- Learning to Drive is a Free Gift: Large-Scale Label-Free Autonomy Pretraining from Unposed In-The-Wild Videosaccepted
- Learning to Focus and Precise Cropping:A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMsaccepted
- Learning to Generate Highly Dynamic Videos using Synthetic Motion Dataaccepted
- Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Modelsaccepted
- Learning to Identify Out-of-Distribution Objects for 3D LiDAR Anomaly Segmentationaccepted
- Learning to Infer Parameterized Representations of Plants from 3D Scansaccepted
- Learning to Learn Weight Generation via Local Consistency Diffusionaccepted
- Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Modelsaccepted
- Learning to Refuse: Refusal-Aware Reinforcement Fine-Tuning for Hard-Irrelevant Queries in Video Temporal Groundingaccepted
- Learning to See Through a Baby's Eyes: Early Visual Diets Enable Robust Visual Intelligence in Humans and Machinesaccepted
- Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulationaccepted
- Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Modelsaccepted
- Learning to Select Visual Tools from Experienceaccepted
- Learning to Solve PDEs on Neural Shape Representationsaccepted
- Learning to Track Instance from Single Nature Language Descriptionaccepted
- Lens Component Deletion based on Differentiable Ray Tracingaccepted
- LensWalk: Agentic Video Understanding by Planning How You See in Videosaccepted
- Lenses: Toward Polysemous Vision-Language Understandingaccepted
- Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generationaccepted
- Let VLMs Grade Their Own Thoughts: A Self-Quantification Approach to Reasoning-Aware Reward Modelingaccepted
- Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transferaccepted
- Let it Snow! Animating 3D Gaussian Scenes with Dynamic Weather Effects via Physics-Guided Score Distillationaccepted
- Leveraging Class Distributions in CLIP for Weakly Supervised Semantic Segmentationaccepted
- Leveraging Multispectral Sensors for Color Correction in Mobile Camerasaccepted
- Leveraging Verifier-Based Reinforcement Learning in Image Editingaccepted
- LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Drivingaccepted
- LiDAR-to-4DRadar Diffusion Bridge via Cross-Modal Alignment and Translation in Latent Spaceaccepted
- LiDAS: Lighting-driven Dynamic Active Sensing for Nighttime Perceptionaccepted
- LiDeRe: A Lightweight Readout for Fast and Data-Efficient Dense Predictionaccepted
- LiREC-Net: A Target-Free and Learning-Based Network for LiDAR, RGB, and Event Calibrationaccepted
- Life-IQA: Boosting Blind Image Quality Assessment through GCN-enhanced Layer Interaction and MoE-based Feature Decouplingaccepted
- LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasksaccepted
- Lifelong Imitation Learning with Multimodal Latent Replay and Incremental Adjustmentaccepted
- Lifting Unlabeled Internet-level Data for 3D Scene Understandingaccepted
- LightMover: Generative Light Movement with Color and Intensity Controlsaccepted
- LightRR: A Lightweight Network for Single Image Reflection Removalaccepted
- LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Secondsaccepted
- Lighting in Motion: Spatiotemporal HDR Lighting Estimationaccepted
- Lighting-grounded Video Generation with Renderer-based Agent Reasoningaccepted
- LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generationaccepted
- Linear Fundamental Matrix Estimation from 7 or 5 Pointsaccepted
- Linear Image Generation by Synthesizing Exposure Bracketsaccepted
- Linguistic Priors for Visual Decoupling: Towards Symmetric Vision-Brain Alignmentaccepted
- Linking Modality Isolation in Heterogeneous Collaborative Perceptionaccepted
- Linking Perception, Confidence and Accuracy in MLLMsaccepted
- Lipschitz Optimization for Formal Verification of Homographiesaccepted
- Lite Any Stereo: Efficient Zero-Shot Stereo Matchingaccepted
- LitePT: Lighter Yet Stronger Point Transformeraccepted
- LiteSense: Lifting Lightweight ToF with RGB for High-Resolution Metric Depth Estimationaccepted
- LiteVGGT: Boosting Vanilla VGGT via Geometry-aware Cached Token Mergingaccepted
- Live Interactive Training for Video Segmentationaccepted
- LiveGesture: Streamable Co-Speech Gesture Generation Modelaccepted
- LoD-Loc v3: Generalized Aerial Localization in Dense Cities using Instance Silhouette Alignmentaccepted
- LoFA: Learning to Predict Personalized Prior for Fast Adaptation of Visual Generative Modelsaccepted
- LoG3D: Ultra-High-Resolution 3D Shape Modeling via Local-to-Global Partitioningaccepted
- LoL: Longer than Longer, Scaling Video Generation to Houraccepted
- LoPrune: Efficient Data Pruning for LoRA-Based Fine-Tuning of Vision Transformeraccepted
- LoST: Level of Semantics Tokenization for 3D Shapesaccepted
- Local Motion Matters: A Deconstruct-Recompose Paradigm for Reinforcement Learning Pre-training from Videosaccepted
- Local Precise Refinement: A Dual-Gated Mixture-of-Experts for Enhancing Foundation Model Generalization against Spectral Shiftsaccepted
- Localizing, Structuring, and Rendering: Bridging 3D and 2D Vision-Language-Action Models for Robotic Manipulationaccepted
- Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Imagesaccepted
- Locate-then-Sparsify: Attribution Guided Sparse Strategy for Visual Hallucination Mitigationaccepted
- LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sightaccepted
- LogCD: Local-to-global Consistency Distillation for Few-step Image Generationaccepted
- Logit-Margin Repulsion for Backdoor Defenseaccepted
- Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentationaccepted
- Long-SCOPE: Fully Sparse Long-Range Cooperative 3D Perceptionaccepted
- Long-Tail Internet Photo Reconstructionaccepted
- LongStream: Long-Sequence Streaming Autoregressive Visual Geometryaccepted
- LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Callingaccepted
- LongVideo-R1: Smart Navigation for Low-cost Long Video Understandingaccepted
- Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detectionaccepted
- LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigationaccepted
- Looking Beyond the Window: Global-Local Aligned CLIP for Training-free Open-Vocabulary Semantic Segmentationaccepted
- LottieGPT: Tokenizing Vector Animation for Autoregressive Generationaccepted
- Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learningaccepted
- Low-Rank Residual Diffusion Modelsaccepted
- Low-Rank Test-Time Training for Pre-Trained Point Cloud Modelsaccepted
- Low-Resolution Editing is All You Need for High-Resolution Editingaccepted
- LumiMotion: Improving Gaussian Relighting with Scene Dynamicsaccepted
- LumiX: Structured and Coherent Text-to-Intrinsic Generationaccepted
- Lumosaic: Hyperspectral Video via Active Illumination and Coded-Exposure Pixelsaccepted
- LuxRemix: Lighting Decomposition and Remixing for Indoor Scenesaccepted
- Lyapunov Probes for Hallucination Detection in Large Foundation Modelsaccepted
- Lynx: Towards High-Fidelity Personalized Video Generationaccepted
- M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generationaccepted
- M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Modelsaccepted
- M3Grounder: Mask-Based Multi-Span and Multi-Granular Grounding for Document QAaccepted
- M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAGaccepted
- M4-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detectionaccepted
- M4Human: A Large-Scale Multimodal mmWave Radar Benchmark for Human Mesh Reconstructionaccepted
- M4V: Multimodal Mamba for Efficient Text-to-Video Generationaccepted
- MA-Bench: Towards Fine-grained Micro-Action Understandingaccepted
- MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Modelsaccepted
- MAD: Motion Appearance Decoupling for efficient Driving World Modelsaccepted
- MAGICIAN: Efficient Long-Term Planning with Imagined Gaussians for Active Mappingaccepted
- MAMMA: Markerless Accurate Multi-person Motion Acquisitionaccepted
- MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasksaccepted
- MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalizationaccepted
- MAPo: Motion-Aware Partitioning of Deformable 3D Gaussian Splatting for High-Fidelity Dynamic Scene Reconstructionaccepted
- MARCO: Navigating the Unseen Space of Semantic Correspondenceaccepted
- MARIS: Marine Open-Vocabulary Instance Segmentationaccepted
- MARSS: Radar Semantic Segmentation via Modular Attention and State Space Modelsaccepted
- MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Modelsaccepted
CVPR accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.