← All conferences

CVPR 2026 Accepted Papers

The full list of 4,068 papers accepted at CVPR 2026 (IEEE/CVF Conference on Computer Vision and Pattern Recognition). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

accepted: 4,068
  1. EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasingaccepted
  2. EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creationaccepted
  3. Efficiency Follows Global-Local Decouplingaccepted
  4. Efficient All-Pairs Correlation Volume Sampling for Optical Flow Estimationaccepted
  5. Efficient Encoder-Free Fourier-based 3D Large Multimodal Modelaccepted
  6. Efficient Equivariant Transformer for Self-Driving Agent Modelingaccepted
  7. Efficient Frame Selection for Long Video Understanding via Reinforcement Learningaccepted
  8. Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulationaccepted
  9. Efficient Real-Time Raw-to-Raw Denoising for Extreme Low-Light Ultra HD Video on Mobile Devicesaccepted
  10. Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learningaccepted
  11. Efficient Unrolled Networks for Large-Scale 3D Inverse Problemsaccepted
  12. Efficient Video Object Segmentation and Tracking with Recurrent Dynamic Submodelaccepted
  13. Efficient Weighted Sampling via Score-based Generative Modelsaccepted
  14. Efficient and High-Fidelity Omni Modality Retrievalaccepted
  15. Efficient and Training-Free Single-Image Diffusion Modelsaccepted
  16. EfficientMonoHair: Fast Strand-Level Reconstruction from Monocular Video via Multi-View Direction Fusionaccepted
  17. EfficientVPR: Toward Efficient Visual Place Recognition via Scene-Aware Prompt Tuning and Adaptive Feature Enhancementaccepted
  18. Efficiently Reconstructing Dynamic Scenes One D4RT at a Timeaccepted
  19. Ego-1K - A Large-Scale Multiview Video Dataset for Egocentric Visionaccepted
  20. Ego-Grounding for Personalized Question-Answering in Egocentric Videosaccepted
  21. Ego-InBetween: Generating Object State Transitions in Ego-Centric Videosaccepted
  22. Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videosaccepted
  23. Ego: Embedding-Guided Personalization of Vision-Language Modelsaccepted
  24. EgoAVU: Egocentric Audio-Visual Understandingaccepted
  25. EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Posesaccepted
  26. EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editingaccepted
  27. EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generationaccepted
  28. EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMsaccepted
  29. EgoPoseFormer v2: Accurate Egocentric Human Motion Estimation for AR/VRaccepted
  30. EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchyaccepted
  31. EgoRoC: Towards Egocentric Robotic Control via Task-Agnostic Visual Alignmentaccepted
  32. EgoSound: Benchmarking Sound Understanding in Egocentric Videosaccepted
  33. EgoX: Egocentric Video Generation from a Single Exocentric Videoaccepted
  34. EgoXtreme: A Dataset for Robust Object Pose Estimation in Egocentric Views under Extreme Conditionsaccepted
  35. Egocentric Visibility-Aware Human Pose Estimationaccepted
  36. Elastic Weight Consolidation Done Right for Continual Learningaccepted
  37. Elastic3D: Controllable Stereo Video Conversion with Guided Latent Decodingaccepted
  38. ElasticFormer: Detecting Objects in HRW Shots via Elastic Computing Vision Transformeraccepted
  39. Electromagnetic Inverse Scattering from a Single Transmitteraccepted
  40. Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matchingaccepted
  41. Eliminate Distance Differences Induced by Backdoor Attacks: Layer-Selective Training and Clipping to Mask Backdoor Modelsaccepted
  42. Elucidating the Design Space of Arbitrary-Noise-Based Diffusion Modelsaccepted
  43. Elucidating the SNR-t Bias of Diffusion Probabilistic Modelsaccepted
  44. EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agentsaccepted
  45. EmbodiedSplat: Online Feed-Forward Semantic 3DGS for Open-Vocabulary 3D Scene Understandingaccepted
  46. Emergent Extreme-View Geometry in 3D Foundation Modelsaccepted
  47. Emergent Outlier View Rejection in Visual Geometry Grounded Transformersaccepted
  48. EmoDiffTalk: Emotion-aware Diffusion for Editable 3D Gaussian Talking Headaccepted
  49. EmoStyle: Emotion-Driven Image Stylizationaccepted
  50. EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalizationaccepted
  51. EmoThinker: Advancing Visual-Acoustic Emotion Analysis via Structural Token Selection and Chain-of-Thought Reasoningaccepted
  52. Enabling Supervised Learning of Generative Signatures for Generalized AI-Generated Images Detectionaccepted
  53. End-to-End Hyper-Relational Information Extraction for Engineering Diagrams via Dynamically Tokenized Relation Transformeraccepted
  54. End-to-End Language-Action Model for Humanoid Whole Body Controlaccepted
  55. Endless World: Real-Time 3D-Aware Long Video Generationaccepted
  56. Energy Waveify and Redistribution for Test-Time Adaptation: A Control System Perspectiveaccepted
  57. Energy-GS: Image Energy-guided Pose Alignment Gaussian Splatting with redesigned pose gradient flowaccepted
  58. EnergyAction: Unimanual to Bimanual Composition with Energy-Based Modelsaccepted
  59. Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment Analysisaccepted
  60. Enhancing Accuracy of Uncertainty Estimation in Appearance-based Gaze Tracking with Probabilistic Evaluation and Calibrationaccepted
  61. Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weightingaccepted
  62. Enhancing Descriptive Captions with Visual Attributes for Multimodal Perceptionaccepted
  63. Enhancing Hands in 3D Whole-Body Pose Estimation with Conditional Hands Modulatoraccepted
  64. Enhancing Mixture-of-Experts Specialization via Cluster-Aware Upcyclingaccepted
  65. Enhancing Out-of-Distribution Detection with Extended Logit Normalizationaccepted
  66. Enhancing Part-Level Point Grounding for Any Open-Source MLLMsaccepted
  67. Enhancing Spatial Understanding in Image Generation via Reward Modelingaccepted
  68. Enhancing Unregistered Hyperspectral Image Super-Resolution via Unmixing-based Abundance Fusion Learningaccepted
  69. Enhancing Video Vision Language Model with Hippocampal Sensingaccepted
  70. Enhancing Visual Representation with Textual Semantics: Textual Semantics-Powered Prototypes for Heterogeneous Federated Learningaccepted
  71. Enhancing the Security of Visual Speaker Authentication Based on Dynamic Lip-Print Analysisaccepted
  72. Envision, Attend, Then Respond: Counterfactual Hallucination Mitigation in Large Vision-Language Modelsaccepted
  73. Envisioning the Future, One Step at a Timeaccepted
  74. EpiAgent: An Agent-Centric System for Ancient Inscription Restorationaccepted
  75. Erasing Thousands of Concepts: Towards Scalable and Practical Concept Erasure for Text-to-Image Diffusion Modelsaccepted
  76. EthoCLIP: Ontology-Enhanced Video-Language Pretraining for Animal Behavior Understandingaccepted
  77. Eulerian Gaussian Splatting using Hashed Probability Pyramidsaccepted
  78. EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervisionaccepted
  79. Evaluating Generative Models via One-Dimensional Code Distributionsaccepted
  80. Event Stream Filtering via Probability Flux Estimationaccepted
  81. Event Structural Valley: A Unified Theoretical and Practical Framework for Event Camera Autofocusaccepted
  82. Event-Based Motion Deblurring Using Task-Oriented 3D Gaussian Event Representationsaccepted
  83. Event-Illumination Collaborative Low-light Image Enhancement with a High-resolution Real-world Datasetaccepted
  84. Event-based Motion Deblurring with Unpaired Dataaccepted
  85. Event-based Visual Deformation Measurementaccepted
  86. Event6D: Event-based Novel Object 6D Pose Trackingaccepted
  87. EventDrive: Event Cameras for Vision-Language Driving Intelligenceaccepted
  88. EventGait: Towards Robust Gait Recognition with Event Streamsaccepted
  89. EventHub: Data Factory for Generalizable Event-Based Stereo Networks without Active Sensorsaccepted
  90. Every Error has Its Magnitude: Asymmetric Mistake Severity Training for Multiclass Multiple Instance Learningaccepted
  91. Evidential Deep Partial Label Learning to Quantify Disambiguation Uncertaintyaccepted
  92. Evidential Neural Radiance Fieldsaccepted
  93. Evidential Transformation Network: Turning Pretrained Models into Evidential Models for Post-hoc Uncertainty Estimationaccepted
  94. Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignmentaccepted
  95. Evo-Retriever: LLM-Guided Curriculum Evolution with Viewpoint-Pathway Collaboration for Multimodal Document Retrievalaccepted
  96. EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labelingaccepted
  97. EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrievalaccepted
  98. EvoID: Reinforced Evolution for Identity-Preserving Video Generationaccepted
  99. Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognitionaccepted
  100. Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memoryaccepted
  101. ExMesh: EXplicit Mesh Reconstruction with Topology Adaptationaccepted
  102. ExPose: Reinforcing Video Generation Models for Extreme Pose Estimationaccepted
  103. Exact-GS: Mathematically Rigorous and Accurate 3D Gaussian Splatting for 3D X-ray Reconstructionaccepted
  104. Exemplar-Free Class Incremental Learning via Preserving Class-Discriminative Structureaccepted
  105. Exemplar-Free Continual Learning for State Space Modelsaccepted
  106. ExpPortrait: Expressive Portrait Generation via Personalized Representationaccepted
  107. Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Modelsaccepted
  108. Expanding Spatial and Temporal Context for Robotic Imitation Learning With Scene Graphsaccepted
  109. Expanding mmWave Datasets for Human Pose Estimation with Unlabeled Data and LiDAR Datasetsaccepted
  110. Experience Transfer for Multimodal LLM Agents in Minecraft Gameaccepted
  111. Expert-Teacher-Student Collaborative Learning for Domain Adaptive Object Detectionaccepted
  112. Explaining CLIP Zero-shot Predictions Through Conceptsaccepted
  113. Explaining Object Detectors via Collective Contribution of Pixelsaccepted
  114. Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Explorationaccepted
  115. Exploring 6D Object Pose Estimation with Deformationaccepted
  116. Exploring Adaptive Masked Reconstruction for Self-Supervised Skeleton-Based Action Recognitionaccepted
  117. Exploring Conditions for Diffusion Models in Robotic Controlaccepted
  118. Exploring Spatial Intelligence from a Generative Perspectiveaccepted
  119. Exploring Spatiotemporal Feature Propagation for Video-Level Compressive Spectral Reconstruction: Dataset, Model and Benchmarkaccepted
  120. Exploring Visual Pretraining for Learning Language Intelligenceaccepted
  121. Exploring the Underwater World Segmentation without Extra Trainingaccepted
  122. ExpoCM: Exposure-Aware One-Step Generative Single-Image HDR Reconstructionaccepted
  123. Exposing Functional Fusion: A New Class of Strategic Backdoor in Dynamic Prompt Architecturesaccepted
  124. Exposing and Evaluating Hallucinations for GUI Groundingaccepted
  125. Extend3D: Town-Scale 3D Generationaccepted
  126. Extending Embodied Question Answering from Perception to Decisionaccepted
  127. Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representationaccepted
  128. ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splattingaccepted
  129. F$^2$-Assist: Multi-Phase Fetal Growth Forecast and Report Generation from Ultrasound Examinationaccepted
  130. F2Net: A Frequency-Fused Network for Ultra-High Resolution Remote Sensing Segmentationaccepted
  131. FAAR: Efficient Frequency-Aware Multi-Task Fine-Tuning via Automatic Rank Selectionaccepted
  132. FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generationaccepted
  133. FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignmentaccepted
  134. FAPE-IR: Frequency-Aware Planning and Execution Framework for All-in-One Image Restorationaccepted
  135. FARMER: Flow AutoRegressive Transformer over Pixelsaccepted
  136. FAST: Topology-Aware Frequency-Domain Distribution Matching for Coreset Selectionaccepted
  137. FAVE: A Structured Benchmark for Fine-Grained Audio-Visual Temporal Evaluation in Multimodal LLMsaccepted
  138. FB-CLIP: Fine-Grained Zero-Shot Anomaly Detection with Foreground-Background Disentanglementaccepted
  139. FBTA: Enabling Single-GPU End-to-End Gigapixel WSI Classification with Feature Bridging and Translation Alignmentaccepted
  140. FE2E: From Editor to Dense Geometry Estimatoraccepted
  141. FEAST: Fully Connected Expressive Attention for Spatial Transcriptomicsaccepted
  142. FEAT: Fashion Editing and Try-On from Any Designaccepted
  143. FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editingaccepted
  144. FG-Portrait: 3D Flow Guided Editable Portrait Animationaccepted
  145. FHAvatar: Fast and High-Fidelity Reconstruction of Face-and-Hair Composable 3D Head Avatar from Few Casual Capturesaccepted
  146. FILTR: Extracting Topological Features from Pretrained 3D Modelsaccepted
  147. FINE: Factorizing Knowledge for Initialization of Variable-sized Diffusion Modelsaccepted
  148. FINER: MLLMs Hallucinate under Fine-grained Negative Queriesaccepted
  149. FISHuman: Fine-grained Single-image 3D Human Reconstruction via Multi-view 4D Remeshingaccepted
  150. FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulationaccepted
  151. FLOW: Optimal Transport-Driven Feature Warping for Generalized Remote Physiological Measurementaccepted
  152. FM-Steer: Enhance Generalist Policies with Value-Guided Cascaded Denoisingaccepted
  153. FMPose3D: monocular 3D pose estimation via flow matchingaccepted
  154. FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEctionaccepted
  155. FOZO: Forward-Only Zeroth-Order Prompt Optimization for Test-Time Adaptationaccepted
  156. FPS-Bench: A Benchmark for High Frame-Rate Video Understandingaccepted
  157. FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super-Resolutionaccepted
  158. FSFSplatter: Geometrically Accurate Reconstruction with Free Sparse-view Images within 2 minutesaccepted
  159. FSLoRA: Harmonizing Detection and Re-Identification via Freq-Spatial Low-Rank Adapter for One-Stage Person Searchaccepted
  160. FUN REC * Reconstructing Functional 3D Scenes from Egocentric Interaction Videosaccepted
  161. FUSAR-GPT: A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imageryaccepted
  162. FUSER: Feed-Forward Multiview 3D Registration Transformer and SE(3)$^N$ Diffusion Refinementaccepted
  163. FVAR: Next-Focus Prediction for Visual Autoregressive Modelingaccepted
  164. FVBench: Benchmarking Deepfake Video Detection Capability of Large Multimodal Modelsaccepted
  165. F^2HDR: Two-Stage HDR Video Reconstruction via Flow Adapter and Physical Motion Modelingaccepted
  166. FabricGen: Microstructure-Aware Woven Fabric Generationaccepted
  167. Face-Guided Sentiment Boundary Enhancement for Weakly-Supervised Temporal Sentiment Localizationaccepted
  168. Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restorationaccepted
  169. FaceCam: Portrait Video Camera Control via Scale-Aware Conditioningaccepted
  170. Factorize, Reconstruct, Enhance: A Unified Framework for Multimodal Sentiment Analysisaccepted
  171. Factorized Context Aggregation for Robust Cancer Risk Estimation via Soft Re-Ranked Retrieval and Hierarchical Anchorsaccepted
  172. Failure Modes for Deep Learning-Based Online Mapping: How to Measure and Address Themaccepted
  173. FailureAtlas: Mapping the Failure Landscape of T2I Models via Active Explorationaccepted
  174. FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistantsaccepted
  175. FaithFusion: Harmonizing Reconstruction and Generation via Pixel-wise Information Gainaccepted
  176. Faithful Contouring: Near-Lossless 3D Voxel Representation Free from Iso-surfaceaccepted
  177. FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-and-Language Navigationaccepted
  178. Fast Markov Random Field Optimisation for Topologically Noisy 3D Shape Matchingaccepted
  179. Fast Reasoning Segmentation for Images and Videosaccepted
  180. Fast SceneScript: Fast and Accurate Language-Based 3D Scene Understanding via Multi-Token Predictionaccepted
  181. Fast Spatial Tracking with Visual Geometry Transformeraccepted
  182. Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matchingaccepted
  183. Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planningaccepted
  184. Fast3Dcache: Training-free 3D Geometry Synthesis Accelerationaccepted
  185. FastEventDGS: Deformable Gaussian Splatting for Fast Dynamic Scenes from a Single Event Cameraaccepted
  186. FastGS: Training 3D Gaussian Splatting in 100 Secondsaccepted
  187. FastGaMer: Efficient GainMap Learning for Practical Inverse Tone Mappingaccepted
  188. FastHybrid: Accelerating Hybrid Autoregressive Image Generation with Lookahead and Guided Decodingaccepted
  189. FastLightGen: Fast and Light Video Generation with Fewer Steps and Parametersaccepted
  190. FastRef: Fast Prototype Refinement for Few-shot Industrial Anomaly Detectionaccepted
  191. Faster-GS: Analyzing and Improving Gaussian Splatting Optimizationaccepted
  192. FeatureFool: Zero-Query Fooling of Video Models via Feature Mapaccepted
  193. Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learnersaccepted
  194. Fed-ADE: Adaptive Learning Rate for Federated Post-adaptation under Distribution Shiftaccepted
  195. FedAFD: Multimodal Federated Learning via Adversarial Fusion and Distillationaccepted
  196. FedARA: Resource-adaptive Low-rank Personalized Federated Learning via Anchor-driven Representation Alignment on Heterogeneous Edge Devicesaccepted
  197. FedAdamom: Adaptive Momentum for Improved Generalization in Federated Optimizationaccepted
  198. FedAlign: Differentially Private Distribution Alignment for Non-IID Federated Learningaccepted
  199. FedBPrompt: Federated Domain Generalization Person Re-Identification via Body Distribution Aware Visual Promptsaccepted
  200. FedCART: Tackling Long-Tailed Distributions in Federated Adversarial Training via Classifier Refinementaccepted
  201. FedDAP: Domain-Aware Prototype Learning for Federated Learning under Domain Shiftaccepted
  202. FedHarmony: Harmonizing Heterogeneous Label Correlations in Federated Multi-Label Learningaccepted
  203. FedMOP: Achieving Enhanced Privacy and Performance in Federated Learning via Momentum Orthogonal Projectionaccepted
  204. FedMPT: Federated Multi-Label Prompt Tuning of Vision-Language Modelsaccepted
  205. FedRAC: Rolling Submodel Allocation for Collaborative Fairness in Federated Learningaccepted
  206. FedRE: A Representation Entanglement Framework for Model-Heterogeneous Federated Learningaccepted
  207. FedRG: Unleashing the Representation Geometry for Federated Learning with Noisy Clientsaccepted
  208. FedSDR: Federated Graph Learning with Structural Noise Detection and Reconstructionaccepted
  209. FedSST: Rethinking Fair Federated Graph Learning under Structural Shiftaccepted
  210. Federated Active Learning Under Extreme Non-IID and Global Class Imbalanceaccepted
  211. Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstructionaccepted
  212. Feed-forward Gaussian Registration for Head Avatar Creation and Editingaccepted
  213. Few-Shot Hybrid Incremental Learning:Continually Learning under Data Scarcity and Task Uncertaintyaccepted
  214. Few-Shot Incremental 3D Object Detection in Dynamic Indoor Environmentsaccepted
  215. Few-Step Diffusion Sampling Through Instance-Aware Discretizationsaccepted
  216. Few-for-Many Personalized Federated Learningaccepted
  217. Few-shot Acoustic Synthesis with Multimodal Flow Matchingaccepted
  218. FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolutionaccepted
  219. Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppressionaccepted
  220. FilterGS: Traversal-Free Parallel Filtering and Adaptive Shrinking for Large-Scale LoD 3D Gaussian Splattingaccepted
  221. FinPercep-RM: A Fine-grained Reward Model and Co-evolutionary Curriculum for RL-based Real-world Super-Resolutionaccepted
  222. Finding Distributed Object-Centric Properties in Self-Supervised Transformersaccepted
  223. Fine-Grained GRPO for Precise Preference Alignment in Flow Modelsaccepted
  224. Fine-Grained Multi Image Object Hallucination Benchmarkaccepted
  225. Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradientsaccepted
  226. Fine-Tuning Impairs the Balancedness of Foundation Models in Long-tailed Personalized Federated Learningaccepted
  227. Fine-VAD: Towards Fine-Grained Video Anomaly Detection via Progressive Cross-Granularity Learningaccepted
  228. Fine-grained Image Aesthetic Assessment: Learning Discriminative Scores from Relative Ranksaccepted
  229. FireScope: Wildfire Risk Raster Prediction With a Chain-of-Thought Oracleaccepted
  230. First Frame Is the Place to Go for Video Content Customizationaccepted
  231. First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Modelsaccepted
  232. FisherPoser: Human Motion Estimation from Sparse Observations with Hierarchical Region-Wise Fisher-Matrix Uncertainty Modelingaccepted
  233. Fixed Anchors Are Not Enough: Dynamic Retrieval and Persistent Homology for Dataset Distillationaccepted
  234. Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learningaccepted
  235. FlashCap: Millisecond-Accurate Human Motion Capture via Flashing LEDs and Event-Based Visionaccepted
  236. FlashDecoder: Real-Time Latent-to-Pixel Streaming Decoder with Transformersaccepted
  237. FlashIn: Fast and Accurate Image Inversion for Real-time Image Editingaccepted
  238. FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANsaccepted
  239. FlashMesh: Faster and Better Autoregressive Mesh Synthesis via Structured Speculationaccepted
  240. FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidanceaccepted
  241. FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Predictionaccepted
  242. FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attentionaccepted
  243. FlashVSR: Towards Real-time Diffusion-Based Streaming Video Super Resolutionaccepted
  244. Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assemblyaccepted
  245. FlexAvatar: Flexible Large Reconstruction Model for Animatable Gaussian Head Avatars with Detailed Deformationaccepted
  246. FlexAvatar: Learning Complete 3D Head Avatars with Partial Supervisionaccepted
  247. FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Controlaccepted
  248. FlexiVideo: Variation-Aware Temporal Dynamics Modeling for Efficient Video Understandingaccepted
  249. FloVerse: Floor Plan-Guided Multi-Modal Navigationaccepted
  250. FloodDiffusion: Tailored Diffusion Forcing for Streaming Motion Generationaccepted
  251. Flow Map Distillation Without Dataaccepted
  252. Flow Matching for Multimodal Distributionsaccepted
  253. Flow3r: Factored Flow Prediction for Scalable Visual Geometry Learningaccepted
  254. Flow4DGS-SLAM: Optical Flow-Guided 4D Gaussian Splatting SLAMaccepted
  255. FlowComposer: Composable Flows for Compositional Zero-Shot Learningaccepted
  256. FlowDC: Flow-Based Decoupling-Decay for Complex Image Editingaccepted
  257. FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matchingaccepted
  258. FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editingaccepted
  259. FlowFM: Advancing Dark Optical Flow Estimation with Flow Matchingaccepted
  260. FlowFixer: Towards Detail-Preserving Subject-Driven Generationaccepted
  261. FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Modelsaccepted
  262. FlowMotion: Training-Free Flow Guidance for Video Motion Transferaccepted
  263. FlowPalm: Optical Flow Driven Non-Rigid Deformation for Geometrically Diverse Palmprint Generationaccepted
  264. FlowPortal: Residual-Corrected Flow for Training-Free Video Relighting and Background Replacementaccepted
  265. FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectoriesaccepted
  266. Flowception: Temporally Expansive Flow Matching for Video Generationaccepted
  267. FluidGaussian: Propagating Simulation-Based Uncertainty Toward Functionally-Intelligent 3D Reconstructionaccepted
  268. FluoCLIP: Stain-Aware Focus Quality Assessment in Fluorescence Microscopyaccepted
  269. FluxMem: Adaptive Hierarchical Memory for Streaming Video Understandingaccepted
  270. FoSS: Modeling Long-Range Dependencies and Multimodal Uncertainty in Trajectory Prediction via Fourier-State Space Integrationaccepted
  271. FoV-Net: Rotation-Invariant CAD B-rep Learning via Field-of-View Ray Castingaccepted
  272. Focal-General Diffusion Model with Semantic Consistent Guidance for Sign Language Productionaccepted
  273. Focus on Background: Exploring SAM's Potential in Few-shot Medical Image Segmentation with Background-centric Promptingaccepted
  274. Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understandingaccepted
  275. Focus-to-Perceive Representation Learning: A Cognition-Inspired Hierarchical Framework for Endoscopic Video Analysisaccepted
  276. FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selectionaccepted
  277. FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clipsaccepted
  278. FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scriptsaccepted
  279. Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioningaccepted
  280. FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generationaccepted
  281. ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulationaccepted
  282. ForeAct: Steering Your VLA with Efficient Visual Foresight Planningaccepted
  283. ForeHOI: Feed-forward 3D Object Reconstruction from Daily Hand-Object Interaction Videosaccepted
  284. Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Diffusion Transformersaccepted
  285. Forecasting 3D Scanpaths in Egocentric Videoaccepted
  286. Forensic-Friendly Image Manipulation via Controllable Latent Diffusionaccepted
  287. Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Modelsaccepted
  288. FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Modelaccepted
  289. Foundation Encoders Are All You Need for Preference-Aware Personalizationaccepted
  290. Foundation Model Priors Enhance Object Focus in Feature Space for Source-Free Object Detectionaccepted
  291. Foundry: Distilling 3D Foundation Models for the Edgeaccepted
  292. Fourier Angle Alignment for Oriented Object Detection in Remote Sensingaccepted
  293. Fractal Camouflage: A Bio-Inspired Approach for Multi-Scale Adversarial Attacks in the Infrared Domainaccepted
  294. Frame2Freq: Spectral Adapters for Fine-Grained Video Understandingaccepted
  295. Franca: Nested Matryoshka Clustering for Scalable Visual Representation Learningaccepted
  296. FrankenMotion: Part-level Human Motion Generation and Compositionaccepted
  297. Free-Grained Hierarchical Visual Recognitionaccepted
  298. Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correctionaccepted
  299. FreeArtGS: Articulated Gaussian Splatting Under Free-moving Scenarioaccepted
  300. FreeForm: Reduced-Order Deformable Simulation from Particle-Based Skinning Eigenmodesaccepted
  301. FreeScale: Scaling 3D Scenes via Certainty-Aware Free-View Generationaccepted
  302. FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image Editingaccepted
  303. FreqSIC: Frequency-aware Stereo Image Compression with Bi-directional Checkerboard Context Modelaccepted
  304. Frequency Switching Mechanism for Parameter-Efficient Multi-Task Learningaccepted
  305. Frequency-Aware Affinity for Weakly Supervised Semantic Segmentationaccepted
  306. Frequency-Aware Flow Matching for High-Quality Image Generationaccepted
  307. Frequency-domain Manipulation for Face Obfuscationaccepted
  308. Fresco: Frequency-Spatial Consistent Optimization for Fine-Grained Head Avatar Modelingaccepted
  309. From 2D Alignment to 3D Plausibility: Unifying Heterogeneous 2D Priors and Penetration-Free Diffusion for Occlusion-Robust Two-Hand Reconstructionaccepted
  310. From 3D Pose to Prose: Biomechanics-Grounded Vision-Language Coachingaccepted
  311. From Attraction to Equilibrium: Physics-Inspired Semantic Gravitons for Zero-Shot Anomaly Detectionaccepted
  312. From Contrast to Consistency: Rethinking Event-based Continuous-Time Optical Flow Estimationaccepted
  313. From Corners to Fiducial Tags: Revisiting Checkerboard Calibration for Event Camerasaccepted
  314. From Detection to Association: Learning Discriminative Object Embeddings for Multi-Object Trackingaccepted
  315. From Events to Clarity: The Event-Guided Diffusion Framework for Dehazingaccepted
  316. From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Trainingaccepted
  317. From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Groundingaccepted
  318. From Feature Learning to Spectral Basis Learning: A Unifying and Flexible Framework for Efficient and Robust Shape Matchingaccepted
  319. From Few-way to Many-way: Rethinking Few-shot Fine-grained Image Classificationaccepted
  320. From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMsaccepted
  321. From Infusion to Assimilation Distillation for Medical Image Segmentationaccepted
  322. From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decompositionaccepted
  323. From Intuition to Investigation: A Tool-Augmented Reasoning MLLM Framework for Generalizable Face Anti-Spoofingaccepted
  324. From Manuals to Actions: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulationaccepted
  325. From Measurement to Mitigation: Quantifying and Reducing Identity Leakage in Image Representation Encoders with Linear Subspace Removalaccepted
  326. From None to All: Self-Supervised 3D Reconstruction via Novel View Synthesisaccepted
  327. From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settingsaccepted
  328. From Pairs to Sequences: Track-Aware Policy Gradients for Keypoint Detectionaccepted
  329. From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literatureaccepted
  330. From Pixel to Precision: Enhancing Handwritten Mathematical Expression Recognition with Image-Level Rewardaccepted
  331. From Rays to Projections: Better Inputs for Feed-Forward View Synthesisaccepted
  332. From Scale to Speed: Adaptive Test-Time Scaling for Image Editingaccepted
  333. From Selection to Scheduling: Federated Geometry-Aware Correction Makes Exemplar Replay Work Better under Continual Dynamic Heterogeneityaccepted
  334. From Sketch to Fresco: Efficient Diffusion Transformer with Progressive Resolutionaccepted
  335. From Softmax to Dirichlet: Evidential Learning for Semi-supervised Semantic Segmentationaccepted
  336. From Spots to Pixels: Dense Spatial Gene Expression Prediction from Histology Imagesaccepted
  337. From Static to Dynamic: Exploring Self-supervised Image-to-Video Representation Transfer Learningaccepted
  338. From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decompositionaccepted
  339. From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMsaccepted
  340. Fuel Gauge: Estimating Chain-of-Thought Length Ahead of Time in Large Multimodal Modelsaccepted
  341. Fully Decentralized Certified Unlearningaccepted
  342. FunFact: Building Probabilistic Functional 3D Scene Graphs via Factor-Graph Reasoningaccepted
  343. Functional Mean Flow in Hilbert Spaceaccepted
  344. Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimizationaccepted
  345. Fusion of Depth and Semantics for Probabilistic Floorplan Localizationaccepted
  346. FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognitionaccepted
  347. FusionRegister: Every Infrared and Visible Image Fusion Deserves Registrationaccepted
  348. G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoningaccepted
  349. G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrievalaccepted
  350. GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigationaccepted
  351. GDFA: Geometry-Driven Federated Unlearning with Directional Task Vector Alignmentaccepted
  352. GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolutionaccepted
  353. GDRO: Group-level Reward Post-training Suitable for Diffusion Modelsaccepted
  354. GEM-TFL: Bridging Weak and Full Supervision for Forgery Localization through EM-Guided Decomposition and Temporal Refinementaccepted
  355. GEM: Generating LiDAR World Model via Deformable Mambaaccepted
  356. GFRRN: Explore the Gaps in Single Image Reflection Removalaccepted
  357. GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Modelsaccepted
  358. GGPT: Geometry-Grounded Point Transformeraccepted
  359. GH-NAF: Grid-Adaptive Hash-Level-Attended Neural Attenuation Fields for Discrepancy-Aware CBCTaccepted
  360. GHPT: Real-Time Relightable Gaussian Splatting using Hybrid Path Tracingaccepted
  361. GIFSplat: Generative Prior-Guided Iterative Feed-Forward 3D Gaussian Splatting from Sparse Viewsaccepted
  362. GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understandingaccepted
  363. GLINT: Modeling Scene-Scale Transparency via Gaussian Radiance Transportaccepted
  364. GM-R^2: Generative Matching Learning for Unsupervised Geometric Representation and Registrationaccepted
  365. GMT: Effective Global Framework for Multi-Camera Multi-Target Trackingaccepted
  366. GOR-IS: 3D Gaussian Object Removal In the Intrinsic Spaceaccepted
  367. GP-4DGS: Probabilistic 4D Gaussian Splatting from Monocular Video via Variational Gaussian Processesaccepted
  368. GPFlow: Gaussian Prototype Probability Flow for Unsupervised Multi-Modal Anomaly Detectionaccepted
  369. GR-Gauge: Cost-efficient Training Configuration By Gauging the Gradient Redundancyaccepted
  370. GROW: Watermark Generation with Progressive Guidance for Diffusion Modelsaccepted
  371. GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clippingaccepted
  372. GS-ASM: 2DGS-Supervised Active Stereo Matchingaccepted
  373. GS-CLIP: Zero-shot 3D Anomaly Detection by Geometry-Aware Prompt and Synergistic View Representation Learningaccepted
  374. GSNR: Graph Smooth Null-Space Representation for Inverse Problemsaccepted
  375. GSV2X: Geometry-Aware Uncertainty Modeling and Orthogonal Fusion for Robust Roadside Perceptionaccepted
  376. GS^2: Graph-based Spatial Distribution Optimization for Compact 3D Gaussian Splattingaccepted
  377. GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modelingaccepted
  378. GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Trainingaccepted
  379. GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinkingaccepted
  380. GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agentsaccepted
  381. GUI-SAGE: Enhancing GUI Automation with Self-Explanatory Learningaccepted
  382. GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasksaccepted
  383. GVIS: Generative Vector Image Steganographyaccepted
  384. Gallant: Voxel Grid-based Humanoid Locomotion and Local-navigation across 3-D Constrained Terrainsaccepted
  385. Gamba: Mamba-based graph convolutional network with dynamic graph topology learning for action recognitionaccepted
  386. GardenDesigner: Encoding Aesthetic Principles into Jiangnan Garden Construction via a Chain of Agentsaccepted
  387. Garments2Look: A Multi-Reference Dataset for High-Fidelity Outfit-Level Virtual Try-On with Clothing and Accessoriesaccepted
  388. Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysisaccepted
  389. Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformersaccepted
  390. Gated KalmaNet: A Fading Memory Layer through Test-time Ridge Regressionaccepted
  391. Gau-Occ: Geometry-Completed Gaussians for Multi-Modal 3D Occupancy Predictionaccepted
  392. GauMVC: Generative Decoupled Gaussian Representation for Human-centric Multi-view Video Compressionaccepted
  393. GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generatoraccepted
  394. Gaussian Mapping for Evolving Scenesaccepted
  395. Gaussian Splatting-based Low-Rank Tensor Representation for Multi-Dimensional Image Recoveryaccepted
  396. Gaussian-Mixture Latent Flow for Stochastic 3D Human Motion Predictionaccepted
  397. GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generationaccepted
  398. GaussianFluent: Gaussian Simulation for Dynamic Scenes with Mixed Materialsaccepted
  399. GaussianGrow: Geometry-aware Gaussian Growing from 3D Point Clouds with Text Guidanceaccepted
  400. GaussianMatch: Semi-Supervised Regression with Pseudo-Label Filtering via Multi-View Gaussian Consistencyaccepted
  401. GaussianPile: A Unified Sparse Gaussian Splatting Framework for Slice-based Volumetric Reconstructionaccepted
  402. GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splattingaccepted
  403. GaussianZoom: Progressive Zoom-in Generative 3D Gaussian Splatting with Geometric and Semantic Guidanceaccepted
  404. Gaze Target Estimation Anywhere with Conceptsaccepted
  405. GazeOnce360: Fisheye-Based 360deg Multi-Person Gaze Estimation with Global-Local Feature Fusionaccepted
  406. GazeShift: Unsupervised Gaze Estimation and Dataset for VRaccepted
  407. GeCo-SRT: Geometry-aware Continual Adaptation for Cross-Task Sim-to-Real Transferaccepted
  408. GeCo: Geometry-Consistent Regularization for Domain Generalized Semantic Segmentationaccepted
  409. Gen3R: 3D Scene Generation Meets Feed-Forward Reconstructionaccepted
  410. GenBreak: Red Teaming Text-to-Image Generation Using Large Language Modelsaccepted
  411. GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generationaccepted
  412. GenErase: Generalizable and Semantically-Aware Concept Erasure in Diffusion Modelsaccepted
  413. GenHOI: Towards Object-Consistent Hand-Object Interaction with Temporally Balanced and Spatially Selective Object Injectionaccepted
  414. GenMask: Adapting DiT for Segmentation via Direct Mask Generationaccepted
  415. GenMatter: Perceiving Physical Objects with Generative Matter Modelsaccepted
  416. GenSplat: Bridging the Generalization Gap in 3DGS Language Comprehensionaccepted
  417. GenTract: Generative Global Tractographyaccepted
  418. GeneVAR: Causal MeanFlow for Autoregressive Gene-to-WSI Tile Synthesisaccepted
  419. General Process Reward Modeling for Robotic Reinforcement Learningaccepted
  420. Generalizable Co-Salient Object Detection via Mixed Content-Style Modulationaccepted
  421. Generalizable Knowledge Distillation from Vision Foundation Models for Semantic Segmentationaccepted
  422. Generalizable Radio-Frequency Radiance Fields for Spatial Spectrum Synthesisaccepted
  423. Generalizable Sparse-View 3D Reconstruction from Unconstrained Imagesaccepted
  424. Generalizable Structure-Aware Keypoint Correspondence for Category-Unified 3D Single Object Trackingaccepted
  425. Generalizable Video Quality Assessment via Weak-to-Strong Learningaccepted
  426. Generalized and Personalized Federated Learning with Black-Box Foundation Models via Orthogonal Transformationsaccepted
  427. Generalized-CVO: Fast and Correspondence-Free Local Point Cloud Registration with Second Order Riemannian Optimizationaccepted
  428. Generalizing Visual Geometry Priors to Sparse Gaussian Occupancy Predictionaccepted
  429. Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoningaccepted
  430. Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videosaccepted
  431. Generative Adversarial Perturbations with Cross-paradigm Transferability on Localized Crowd Countingaccepted
  432. Generative Diffusion Priors for 3D Mapping of the Dark Universeaccepted
  433. Generative Modeling of Weights: Generalization or Memorization?accepted
  434. Generative Neural Video Compression via Video Diffusion Prioraccepted
  435. Generative Point Tracking and Forecastingaccepted
  436. Generative Video Compression with One-Dimensional Latent Representationaccepted
  437. Generative Video Motion Editing with 3D Point Tracksaccepted
  438. GeniNav: Generative Model Driven Image-Goal Navigation via Imagination-Guided Consistency Flow Matchingaccepted
  439. GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generationaccepted
  440. Geo2: Geometry-Guided Cross-view Geo-Localization and Image Synthesisaccepted
  441. GeoAgent: Learning to Geolocate Everywhere with Reinforced Geographic Characteristicsaccepted
  442. GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localizationaccepted
  443. GeoCoT: Towards Reliable Remote Sensing Reasoning with Manifold Perspectiveaccepted
  444. GeoDexGrasp: Geometry-aware Generation for Data-efficient and Physics-plausible Dexterous Graspingaccepted
  445. GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understandingaccepted
  446. GeoDiff4D: Geometry-Aware Diffusion for 4D Head Avatar Reconstructionaccepted
  447. GeoFlow: Real-Time Fine-Grained Cross-View Geolocalization via Iterative Flow Predictionaccepted
  448. GeoFree-CoSeg: Unsupervised Point Cloud-Image Cross-Modal Co-Segmentation Without Geometric Alignmentaccepted
  449. GeoGuide: Hierarchical Geometric Guidance for Open-Vocabulary 3D Semantic Segmentationaccepted
  450. GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensingaccepted
  451. GeoMotion: Rethinking Motion Segmentation via Latent 4D Geometryaccepted
  452. GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulationaccepted
  453. GeoRK2: Geometry-Guided Runge-Kutta Integration for Diffusion Transformer Accelerationaccepted
  454. GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformersaccepted
  455. GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentationaccepted
  456. GeoSANE: Learning Geospatial Representations from Models, Not Dataaccepted
  457. GeoSURGE: Geo-localization using Semantic Fusion with Hierarchy of Geographic Embeddingsaccepted
  458. GeoSemba: Reconstructing State Space Model for Cross Paradigm Representation in Medical Image Segmentationaccepted
  459. GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoningaccepted
  460. GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Groundingaccepted
  461. GeoWorld: Geometric World Modelsaccepted
  462. GeodesicNVS: Probability Density Geodesic Flow Matching for Novel View Synthesisaccepted
  463. Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructionsaccepted
  464. Geometric Neural Distance Fields for Learning Human Motion Priorsaccepted
  465. Geometric-Aware Hypergraph Reasoning for Novel Class Discovery in Point Cloud Segmentationaccepted
  466. Geometric-Photometric Event-based 3D Gaussian Ray Tracingaccepted
  467. Geometrically-Constrained Agent for Spatial Reasoningaccepted
  468. Geometry-Aligned and Anomaly-Aware Reconstruction for 3D Anomaly Detectionaccepted
  469. Geometry-Aware Cross-Modal Graph Alignment for Referring Segmentation in 3D Gaussian Splattingaccepted
  470. Geometry-Guided 3D Visual Token Pruning for Video-Language Modelsaccepted
  471. Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Contextaccepted
  472. Geometry-driven OOD Detectors Are Class-Incremental Learnersaccepted
  473. Ghost-FWL: A Large-Scale Full-Waveform LiDAR Dataset for Ghost Detection and Removalaccepted
  474. Ghosts in the Point Clouds: De-glaring LiDAR in the Transient Domainaccepted
  475. Global Information Thresholding for Sufficient and Necessary Circuitsaccepted
  476. Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulationaccepted
  477. Global Structure-from-Motion Meets Feedforward Reconstructionaccepted
  478. Global Underwater Geolocation from Time-Lapse Polarization Imageryaccepted
  479. Global-Aware Edge Prioritization for Pose Graph Initializationaccepted
  480. Global-Graph Guided and Local-Graph Weighted Contrastive Learning for Unified Clustering on Incomplete and Noise Multi-View Dataaccepted
  481. Globally Optimal Pose from Orthographic Silhouettesaccepted
  482. Globscope: Toward a Global View of the Loss Landscapeaccepted
  483. Gloria: Consistent Character Video Generation via Content Anchorsaccepted
  484. Glove2Hand: Synthesizing Natural Hand-Object Interaction from Multi-Modal Sensing Glovesaccepted
  485. GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Renderingaccepted
  486. Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goalsaccepted
  487. Goal-Driven Reward by Video Diffusion Models for Reinforcement Learningaccepted
  488. Goldilocks Test Sets for Face Verificationaccepted
  489. Good Can Sometimes be Bad: A Unified Attack against 3D Point Cloud Classifier by a Flexible Isotropic Resamplingaccepted
  490. GrOCE : Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Modelsaccepted
  491. GraPHFormer: A Multimodal Graph Persistent Homology Transformer for the Analysis of Neuroscience Morphologiesaccepted
  492. Gradient Knows Best: Mixed-Precision Quantization via Gradient-Guided Bit Allocation for Super-Resolutionaccepted
  493. Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLMaccepted
  494. Graph Attention Prototypical Network for Robust Few-Shot Classificationaccepted
  495. Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoningaccepted
  496. Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphsaccepted
  497. GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learningaccepted
  498. GraspALL: Adaptive Structural Compensation from Illumination Variation for Robotic Garment Grasping in Any Low-Light Conditionsaccepted
  499. GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Graspingaccepted
  500. GraspLDP: Towards Generalizable Grasping Policy via Latent Diffusionaccepted
  501. Gravitation-Driven Semantic Alignment for Text Video Retrievalaccepted
  502. Grid Distillation: Compositional Image Distillation via Structured Generative Gridsaccepted
  503. Ground Reaction Inertial Poser: Physics-based Human Motion Capture from Sparse IMUs and Insole Pressure Sensorsaccepted
  504. GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Groundingaccepted
  505. Grounded 3D-Aware Spatial Vision-Language Modelingaccepted
  506. Grounded Chain-of-Thought for Multimodal Large Language Modelsaccepted
  507. Grounded Latents for Entity-Centric 4D Scene Generationaccepted
  508. Grounding Everything in Tokens for Multimodal Large Language Modelsaccepted
  509. GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluationaccepted
  510. Group Diffusion: Enhancing Image Generation by Unlocking Cross-Sample Collaborationaccepted
  511. Group Editing: Edit Multiple Images in One Goaccepted
  512. GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervisionaccepted
  513. Guardians of the Hair: Rescuing Soft Boundaries in Depth, Stereo, and Novel Viewsaccepted
  514. GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Drivingaccepted
  515. Guiding Diffusion Models with Fine-Grained Conditions and Semantics-Preserving Sampling for One-Shot Federated Learningaccepted
  516. Guiding Diffusion Models with Semantically Degraded Conditionsaccepted
  517. Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representationaccepted
  518. Guiding Token-Sparse Diffusion Modelsaccepted
  519. Guiding a Diffusion Model by Swapping Its Tokensaccepted
  520. Guiding a Diffusion Transformer with the Internal Dynamics of Itselfaccepted
  521. Gyro-based Deep Video Deblurringaccepted
  522. H-Sets: Hessian-Guided Discovery of Set-Level Feature Interactions in Image Classifiersaccepted
  523. H2-Surv: Hierarchical Hyperbolic Multimodal Representation Learning for Survival Predictionaccepted
  524. HAD: Hallucination-Aware Diffusion Priors for 3D Reconstructionaccepted
  525. HAD: Heterogeneity-Aware Distillation for Lifelong Heterogeneous Learningaccepted
  526. HAMMER: Harnessing MLLMs via Cross-Modal Integration for Intention-Driven 3D Affordance Groundingaccepted
  527. HATS: Hardness-Aware Trajectory Synthesis for GUI Agentsaccepted
  528. HAVE-Bench: Hierarchical Audio-Visual Evaluation from Perception to Interactionaccepted
  529. HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Modelsaccepted
  530. HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generationaccepted
  531. HCL-FF: Hierarchical and Contrastive Learning for Forward-Forward Algorithmaccepted
  532. HDR-VLM: HDR-Domain Adaptation of VLMs and Preference-Aligned Quality Assessment for HDR Video Color Gradingaccepted
  533. HDW-SR: High-Frequency Guided Diffusion Model based on Wavelet Decomposition for Image Super-Resolutionaccepted
  534. HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answeringaccepted
  535. HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videosaccepted
  536. HFR and HDR Video from Multi-Attenuated Spikes Using a Rapidly Rotating SpokeND Filteraccepted
  537. HFedATM: Hierarchical Federated Domain Generalization via Optimal Transport and Regularized Mean Aggregationaccepted
  538. HG-Lane: High-Fidelity Generation of Lane Scenes under Adverse Weather and Lighting Conditions without Re-annotationaccepted
  539. HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Modelsaccepted
  540. HOLO: Homography-Guided Pose Estimator Network for Fine-Grained Visual Localization on SD Mapsaccepted
  541. HOPS: Hierarchical Open-vocabulary Part Segmentation with Attention-Aware Filtering and Affinity-Guided Enhancementaccepted
  542. HP-Edit: A Human-Preference Post-Training Framework for Image Editingaccepted
  543. HQC-NBV: A Hybrid Quantum-Classical View Planning Approachaccepted
  544. HSI-GPT2: A Dual-Granularity Large Motion Reasoning Model with Diffusion Refinement for Human-Scene Interactionaccepted
  545. HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigationaccepted
  546. HTTM: Head-wise Temporal Token Merging for Faster VGGTaccepted
  547. HUMAPS-4D: A Multimodal Dataset for HUman Motion Analysis with Physiological and Semantic informationsaccepted
  548. HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generationaccepted
  549. HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesisaccepted
  550. H^2A^2: Homogeneity-Aware and Heterogeneity-Aware Feature Perception for Unified Indoor 3D Object Detectionaccepted
  551. HalluGen: Synthesizing Realistic and Controllable Hallucinations for Evaluating Image Restorationaccepted
  552. HamiPose: Hamiltonian Optimization for Unsupervised Domain Adaptive Pose Estimationaccepted
  553. HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamicsaccepted
  554. HandDreamer: Zero-Shot Text to 3D Hand Model Generation using Corrective Hand Shape Guidanceaccepted
  555. HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Modelsaccepted
  556. HandWorld: Hand-Centric Unified Video Action Generationaccepted
  557. HandX: Scaling Bimanual Motion and Interaction Generationaccepted
  558. Haptic Neural Fields: Bringing Tactile Interactions to 3D Rendered Scenesaccepted
  559. Harmonic Canvas: Inversion-Free Editing for Visually-Guided Music Style Transferaccepted
  560. Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMsaccepted
  561. Harmonized Feature Conditioning and Frequency-Prompt Personalization for Multi-Rater Medical Segmentationaccepted
  562. Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergyaccepted
  563. Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofingaccepted
  564. Harnessing the Power of Foundation Models for Accurate Material Classificationaccepted
  565. HeSS: Head Sensitivity Score for Sparsity Redistribution in VGGTaccepted
  566. Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generationaccepted
  567. Hear What Matters! Text-conditioned Selective Video-to-Audio Generationaccepted
  568. Hear What You See: Video-to-Audio Generation with Diffusion Transformer and Semantic-Temporal Alignment-Ranked Direct Preference Optimizationaccepted
  569. Hear you are: Teaching LLMs Spatial Reasoning with Vision and Spatial Soundaccepted
  570. Hearing the Room Through the Shape of the Drum: Modal-Guided Sound Recovery from Multi-Point Surface Vibrationsaccepted
  571. Hermite Radial Basis Function for Surface Reconstruction via Differentiable Renderingaccepted
  572. HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Viewsaccepted
  573. Heterogeneous Decentralized Diffusion Modelsaccepted
  574. Heuristic Self-Paced Learning for Domain Adaptive Semantic Segmentation under Adverse Conditionsaccepted
  575. Heuristic-inspired Reasoning Priors Facilitate Data-Efficient Referring Object Detectionaccepted
  576. Hg-I2P: Bridging Modalities for Generalizable Image-to-Point-Cloud Registration via Heterogeneous Graphsaccepted
  577. Hi-Lo Prune: Look at What You'll Lose before Pruning with Hierarchical Token Selectionaccepted
  578. HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learningaccepted
  579. HiDRA: Hierarchical Degradation Representation and Adaptation with Generative Priors for Enhancing Infrared Visionaccepted
  580. HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Modelsaccepted
  581. HiFICL: High-Fidelity In-Context Learning for Multimodal Tasksaccepted
  582. HiFi-BRep: High-Fidelity Latent Representation for Robust B-Rep Generationaccepted
  583. HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Imagesaccepted
  584. HiLoRA: Hierarchical Low-Rank Adaptation for Personalized Federated Learningaccepted
  585. HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Modelsaccepted
  586. HiconAgent: History Context-aware Policy Optimization for GUI Agentsaccepted
  587. Hidden Dangers of Compositional Generation: Diagnosing Semantic Safety Failures in Text-to-Image Modelsaccepted
  588. Hidden Monotonicity: Explaining Deep Neural Networks via their DC Decompositionaccepted
  589. Hier-COS: Making Deep Features Hierarchy-aware via Composition of Orthogonal Subspacesaccepted
  590. HierAmp: Coarse-to-Fine Autoregressive Amplification for Generative Dataset Distillationaccepted
  591. HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editingaccepted
  592. HierUQ: Hierarchical Uncertainty Quantification with Adaptive Granularity Reconciliation for Degraded Image Classificationaccepted
  593. HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Poolingaccepted
  594. Hierarchical Action Learning for Weakly-Supervised Action Segmentationaccepted
  595. Hierarchical Attacks for Multi-Modal Multi-Agent Reasoningaccepted
  596. Hierarchical Codec Diffusion for Video-to-Speech Generationaccepted
  597. Hierarchical Concept Embedding & Pursuit for Interpretable Image Classificationaccepted
  598. Hierarchical Enhancement of Semantic Priors for Disentangled Text-Driven Motion Generationaccepted
  599. Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Searchaccepted
  600. Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detectionaccepted
  601. Hierarchical Process Reward Models are Symbolic Vision Learnersaccepted
  602. Hierarchical Visual Relocalization with Nearest View Synthesis from Feature Gaussian Splattingaccepted
  603. Hierarchically Robust Zero-shot Vision-language Modelsaccepted
  604. High Resolution Neural Video Coding with Bi-directional Confidence-Guided Reference Information Modelingaccepted
  605. High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioningaccepted
  606. High-Fidelity Mobile Avatars with Pruned Local Blendshapesaccepted
  607. High-Fidelity Virtual Try-On beyond Paired Data Scarcity via Diffusion-based Cycle-Consistent Learningaccepted
  608. High-Precision Dichotomous Image Segmentation via Depth Integrity-Prior and Fine-Grained Patch Strategyaccepted
  609. High-Quality and Efficient Turbulence Mitigation with Eventsaccepted
  610. Hilbert Curve-Based Attention Enabling Topology-Preserving Image Tensor Representation for Semantic Segmentation Networkaccepted
  611. Hilbert-Geo: Solving Solid Geometric Problems by Neural-Symbolic Reasoningaccepted
  612. Hint2Gen: Bridging Understanding and Generation via Code-structured Hintsaccepted
  613. Hist2Style: Histogram-Guided Stylization with Bilateral Gridsaccepted
  614. History to Future: Evolving Agent with Experience and Thought for Zero-shot Vision-and-Language Navigationaccepted
  615. Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulationaccepted
  616. HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narrativesaccepted
  617. Homaloidal parametrization for detecting critical two-view configurationsaccepted
  618. HoneyBee: Data Recipes for Vision-Language Reasonersaccepted
  619. HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehiclesaccepted
  620. How Far Can We Go With Synthetic Data for Audio-Visual Sound Source Localization?accepted
  621. How Much 3D Do Video Foundation Models Encode?accepted
  622. How to Take a Memorable Picture? Empowering Users with Actionable Feedbackaccepted
  623. Hugging Visual Prompt and Segmentation Tokens: Consistency Learning for Fine-Grained Visual Understanding in MLLMsaccepted
  624. HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Modelsaccepted
  625. Human Geometry Distribution for 3D Animation Generationaccepted
  626. Human Interaction-Aware 3D Reconstruction from a Single Imageaccepted
  627. Human-Centric Multi-Exposure Fusion: Benchmark and Bi-level Cognition Distillation Frameworkaccepted
  628. Human-like Abstract Visual Reasoning via Understanding and Solving Reasoning Loopaccepted
  629. HumanBA: Human-Aware Bundle Adjustment via Global Human-Camera Decouplingaccepted
  630. HumanNOVA: Photorealistic, Universal and Rapid 3D Human Avatar Modeling from a Single Imageaccepted
  631. HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarksaccepted
  632. Humanoid Generative Pre-Training for Zero-Shot Motion Trackingaccepted
  633. Hunting Normality from Query Sample via Residual Learning for Generalist Anomaly Detectionaccepted
  634. HyCal: A Training-Free Prototype Calibration Method for Cross-Discipline Few-Shot Class-Incremental Learningaccepted
  635. HySeg: Learning Generative Priors for Structure-Aware Remote Sensing Segmentationaccepted
  636. Hybrid Agents for Image Restorationaccepted
  637. Hybrid Robust Collaborative Perception with LiDAR-4D Radar Fusion under Adverse Weather Conditionsaccepted
  638. Hybrid Token Compression for Vision-Language Modelsaccepted
  639. HybridDriveVLA: Vision-Language-Action Model with Visual CoT reasoning and ToT Evaluation for Autonomous Drivingaccepted
  640. HypeVPR: Exploring Hyperbolic Space for Perspective to Equirectangular Visual Place Recognitionaccepted
  641. Hyper-PCN: Hypergraph-Based Point Cloud Completion via High-Order Correlation Modelingaccepted
  642. HyperGait: Unleashing the Power of Parsing for Gait Recognition in the Wild via Hypergraphaccepted
  643. HyperGaussians: High-Dimensional Gaussian Splatting for High-Fidelity Animatable Face Avatarsaccepted
  644. HyperNAS: Enhancing Architecture Representation for NAS Predictor via Hypernetworkaccepted
  645. HyperST: Hierarchical Hyperbolic Learning for Spatial Transcriptomics Predictionaccepted
  646. Hyperbolic Busemann Neural Networksaccepted
  647. Hyperbolic Defect Feature Synthesis for Few-Shot Defect Classificationaccepted
  648. Hyperbolic Gramian Volumes for Multimodal Alignmentaccepted
  649. Hyperbolic Prototype Learning with Uncertainty-Aware Consistency for Continual Test-Time Segmentationaccepted
  650. Hyperbolic Relational Prompts for Intersectional Fairness in Medical VLMsaccepted
  651. Hypergraph-State Collaborative Reasoning for Multi-Object Trackingaccepted
  652. I'm a Map! Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformersaccepted
  653. I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learnersaccepted
  654. I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Modelsaccepted
  655. IAFMNet: Information-Aware Feature Modulation for Efficient Super-Resolutionaccepted
  656. IAG: Input-aware Backdoor Attack on VLM-based Visual Groundingaccepted
  657. IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentationaccepted
  658. ICTPolarReal: A Polarized Reflection and Material Dataset of Real World Objectsaccepted
  659. ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generationaccepted
  660. ID-Sim: An Identity-Focused Similarity Metricaccepted
  661. IDESplat: Iterative Depth Probability Estimation for Generalizable 3D Gaussian Splattingaccepted
  662. IDperturb: Enhancing Variation in Synthetic Face Generation via Angular Perturbationsaccepted
  663. IEBGL:An Interpretability-Enhanced Brain Graph Learning Framework with LLM-Instructed Topology and Literature-Augmented Semanticsaccepted
  664. IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Promptingaccepted
  665. IF-Prune: Information-Flow Guided Token Pruning for Efficient Vision-Language Modelsaccepted
  666. IFCSR: Inference-Free Fidelity-Realism Control for One-Step Diffusion-based Real-World Image Super-Resolutionaccepted
  667. IGen: Scalable Data Generation for Robot Learning from Open-World Imagesaccepted
  668. IMAIA: Interactive Maps AI Assistant for Travel Planning and Geo-Spatial Intelligenceaccepted
  669. IMS3: Breaking Distributional Aggregation in Diffusion-Based Dataset Distillationaccepted
  670. IMU-HOI: A Symbiotic Framework for Coherent Human-Object Interaction and Motion Capture via Contact-Conscious Inertial Fusionaccepted
  671. INSID3: Training-Free In-Context Segmentation with DINOv3accepted
  672. INSIGHT Bench: Towards Grounded IN-SItu Guidance for Robotic ManipulaTionaccepted
  673. IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generationaccepted
  674. IPR-1: Interactive Physical Reasoneraccepted
  675. IR-HGP: Physically-Aware Gaussian Inverse Rendering for High-Illumination Scenes via Generative Priorsaccepted
  676. IVAAN: Instance-level Vision-Language Alignment via Attribute-Guided Text Prompts Generation for Nuclei Analysisaccepted
  677. Identity-Preserving Image-to-Video Generation via Reward-Guided Optimizationaccepted
  678. Illuminating Visual Identity in Universal Multimodal Embeddingsaccepted
  679. Illumination-Consistent Human-Scene Reconstruction from Monocular Videoaccepted
  680. Illustrator's Depth: Monocular Layer Index Prediction for Image Decompositionaccepted
  681. Image Diffusion Preview with Consistency Solveraccepted
  682. Image Generation from Contextually-Contradictory Promptsaccepted
  683. Image Guides Images: Consistent Video Amodal Completion with Rectified In-Context Exemplar Guidanceaccepted
  684. Image-Guided Geometric Stylization of 3D Meshesaccepted
  685. Image-based Outlier Synthesis With Training Dataaccepted
  686. Image-to-Point Cloud Feature Back-Projection for Multimodal Training of 3D Semantic Segmentationaccepted
  687. ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Modelsaccepted
  688. Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrievalaccepted
  689. Imbalanced View Contribution Evaluation and Refinement for Deep Incomplete Multi-View Clusteringaccepted
  690. ImmerIris: A Large-Scale Dataset and Benchmark for Off-Axis and Unconstrained Iris Recognition in Immersive Applicationsaccepted
  691. Immunizing Models Against Harmful Long-Horizon Fine-Tuning via Contractive Optimization Dynamicsaccepted
  692. Improved Mean Flows: On the Challenges of Fastforward Generative Modelsaccepted
  693. Improving Adversarial Transferability with Local Perturbation Augmentationaccepted
  694. Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretrainingaccepted
  695. Improving Controllable Generation: Faster Training and Better Performance via x0-Supervisionaccepted
  696. Improving Diffusion Generalization with Weak-to-Strong Segmented Guidanceaccepted
  697. Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidanceaccepted
  698. Improving Sparse Autoencoder with Dynamic Attentionaccepted
  699. Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewardsaccepted
  700. Improving Vision-language Models with Perception-centric Process Reward Modelsaccepted
  701. In Pursuit of Pixel Supervision for Visual Pre-trainingaccepted
  702. InTrain: Intrinsic Trainability for Zero-Cost Neural Architecture Searchaccepted
  703. Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cuesaccepted
  704. Incentivizing Versatile Video Reasoning in MLLMs via Data-Efficient Reinforcement Learningaccepted
  705. Inconsistency-aware Multimodal Schrodinger Bridge for Deepfake Localizationaccepted
  706. IncreFA: Breaking the Static Wall of Generative Model Attributionaccepted
  707. Incremental Object Detection via Future-Aware Decoupled Cross-Head Distillationaccepted
  708. Inference-time Physics Alignment of Video Generative Models with Latent World Modelsaccepted
  709. Inferring Compositional 4D Scenes without Ever Seeing Oneaccepted
  710. InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexityaccepted
  711. InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fieldsaccepted
  712. Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rolloutaccepted
  713. InfinityHuman: Towards Long-Term Audio-Driven Human Animationaccepted
  714. Information-Theoretic Decomposition for Multimodal Interaction Learningaccepted
  715. InnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generationaccepted
  716. InsCal: Calibrated Multi-Source Fully Test-Time Prompt Tuning for Object Detectionaccepted
  717. Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workingsaccepted
  718. InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understandingaccepted
  719. Instance-level Visual Active Tracking with Occlusion-Aware Planningaccepted
  720. InstantRetouch: Efficient and High-Fidelity Instruction-Guided Image Retouching with Bilateral Spaceaccepted
  721. InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prioraccepted
  722. InstructMix2Mix: Consistent Sparse-View Editing Through Multi-View Model Personalizationaccepted
  723. Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Datasetaccepted
  724. Inter-Edit: First Benchmark for Interactive Instruction-Based Image Editingaccepted
  725. Inter-Photon-Limited Videographyaccepted
  726. InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphsaccepted
  727. InterPhys: Physics-aware Human Motion Synthesis in a Dynamic Sceneaccepted
  728. InterPrior: Scaling Generative Control for Physics-Based Human-Object Interactionsaccepted
  729. InterRVOS: Interaction-Aware Referring Video Object Segmentationaccepted
  730. Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Modelsaccepted
  731. Interactive Episodic Memory with User Feedbackaccepted
  732. Interactive Tracking: A Human-in-the-Loop Paradigm with Memory-Augmented Adaptationaccepted
  733. InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policyaccepted
  734. InternVideo-Next: Towards World-Understanding Video Modelsaccepted
  735. Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignmentaccepted
  736. Interpretable Debiasing of Vision-Language Models for Social Fairnessaccepted
  737. Interpretable Prompts made Edit-Friendly: Token-to-Token Similarity Reduction in dLLMs for Edit-Friendly Hard Prompt Inversionaccepted
  738. Interpretable and Steerable Concept Bottleneck Sparse Autoencodersaccepted
  739. Intervention-Aware Multiscale Representation Learning from Imaging Phenomics and Perturbation Transcriptomicsaccepted
  740. Intra-class Distribution-guided Generative Hashing with Neighbor Refinement for Cross-modal Retrievalaccepted
  741. Intrinsic Concept Extraction Based on Compositional Interpretabilityaccepted
  742. Intrinsic Geometry-Appearance Consistency Optimization for Sparse-View Gaussian Splattingaccepted
  743. Intrinsic Image Fusion for Multi-View 3D Material Reconstructionaccepted
  744. IntrinsicWeather: Controllable Weather Editing in Intrinsic Spaceaccepted
  745. IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Frameworkaccepted
  746. InvAD: Inversion-based Reconstruction-Free Anomaly Detection with Diffusion Modelsaccepted
  747. InvCoSS: Inversion-driven Continual Self-supervised Learning in Medical Multi-modal Image Pre-trainingaccepted
  748. InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpaintingaccepted
  749. Investigating Self-Supervised Representations for Audio-Visual Deepfake Detectionaccepted
  750. Iris: Bringing Real-World Priors into Diffusion Model for Monocular Depth Estimationaccepted
  751. Iris: Integrating Language into Diffusion-based Monocular Depth Estimationaccepted
  752. IrisFP: Adversarial-Example-based Model Fingerprinting with Enhanced Uniqueness and Robustnessaccepted
  753. Is Bin Generation Indispensable? A Bin-Generation-Free Dataset Quantization via Semantic Perspectiveaccepted
  754. Is Parameter Isolation Better for Prompt-Based Continual Learning?accepted
  755. Is the Modality Gap a Bug or a Feature? A Robustness Perspectiveaccepted
  756. Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigationaccepted
  757. IsoCLIP: Decomposing CLIP Projectors for Efficient Intra-modal Alignmentaccepted
  758. It Takes Two: A Duet of Periodicity and Directionality for Burst Flicker Removalaccepted
  759. It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Modelsaccepted
  760. Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Controlaccepted
  761. JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimizationaccepted
  762. JRM: Joint Reconstruction Model for Multiple Objects without Alignmentaccepted
  763. JUMP-Hand: Learning Joint-wise Uncertainty to Gate Mixture of View Experts for Multi-View 3D Hand Reconstructionaccepted
  764. Jailbreaking Vision-Language Models via Dissonance-Guided Suffix Optimization and Image-Phrase Injectionaccepted
  765. JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimizationaccepted
  766. JoPPO: Hierarchical Photography Assessment via Contrastive Joint Conditional Probabilistic Reinforcement Learningaccepted
  767. Joint Learning of General and Diverse Patterns with Mixture of Memory Experts for Weakly-Supervised Video Anomaly Detectionaccepted
  768. Joint Spectral Image Reconstruction and Semantic Segmentation with Cooperative Unfoldingaccepted
  769. Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wildaccepted
  770. Just-in-Time: Training-Free Spatial Acceleration for Diffusion Transformersaccepted
  771. KAMP: Knowledge-Anchored Multimodal Pretraining Framework for Medical Image Representationaccepted
  772. KASALv2: Fully Automatic 3D Rotational Symmetry Classification and Axis Localizationaccepted
  773. KLIP: Localized Distribution Shift Detection via KL-Divergence with Diffusion Priors in Inverse Problemsaccepted
  774. KV-Tracker: Real-Time Pose Tracking with Transformersaccepted
  775. KVSmooth: Mitigating Hallucination in Multi-modal Large Language Models through Key-Value Smoothingaccepted
  776. KaLOS finds Consensus: A Meta-Algorithm for Evaluating Inter-Annotator Agreement in Complex Vision Tasksaccepted
  777. Kaleidoscopic Scintillation Event Imagingaccepted
  778. Keep It Frozen: Domain-Routed Conditional Residual Modulation for Multi-Domain Vision Transformersaccepted
  779. Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Modelsaccepted
  780. KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving Systemaccepted
  781. Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editingaccepted
  782. L3DR: 3D-aware LiDAR Diffusion and Rectificationaccepted
  783. LA-Pose: Latent Action Pretraining Meets Pose Estimationaccepted
  784. LAM: Language Articulated Object Modelersaccepted
  785. LAMP: Language-Assisted Motion Planning for Controllable Video Generationaccepted
  786. LAMP: Localization Aware Multi-camera People Tracking in Metric 3D Worldaccepted
  787. LAOF: Robust Latent Action Learning with Optical Flow Constraintsaccepted
  788. LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Mapaccepted
  789. LASER: Layer-wise Scale Alignment for Training-Free Streaming 4D Reconstructionaccepted
  790. LATA: Laplacian-Assisted Transductive Adaptation for Conformal Uncertainty in Medical VLMsaccepted
  791. LATTICE: Democratize High-Fidelity 3D Generation at Scaleaccepted
  792. LDP-Slicing: Local Differential Privacy for Images via Randomized Bit-Plane Slicingaccepted
  793. LEAD: Minimizing Learner-Expert Asymmetry in End-to-End Drivingaccepted
  794. LEADER: Learning Reliable Local-to-Global Correspondences for LiDAR Relocalizationaccepted
  795. LEMON: A Large Endoscopic MONocular Dataset and Foundation Model for Perception in Surgical Settingsaccepted
  796. LESA: Learnable Stage-Aware Predictors for Diffusion Model Accelerationaccepted
  797. LF-BVN: Blind-View Network for Self-Supervised Light Field Denoisingaccepted
  798. LIBERO-Plus: A Progressive Robustness Benchmark for Visual-Language-Action Modelsaccepted
  799. LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Modelsaccepted
  800. LLM-Guided Probabilistic Fusion for Label-Efficient Document Layout Analysisaccepted
  801. LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Modelsaccepted
  802. LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understandingaccepted
  803. LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuningaccepted
  804. LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokensaccepted
  805. LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Modelsaccepted
  806. LNEM: Lunar Neural Elevation Modelaccepted
  807. LOREAL: Mitigating Low-Resolution Challenges in Vision-Language Models with Attribute-driven Prompt Self-Distillationaccepted
  808. LRDUN: A Low-Rank Deep Unfolding Network for Efficient Spectral Compressive Imagingaccepted
  809. LRHDR: Learning Representation-enhanced HDR Video Reconstructionaccepted
  810. LS-ViT: Least-Squares Hessian Based Block Reconstruction for Low-Bit Post-Training Quantization of Vision Transformersaccepted
  811. LUMINA: A Multi-Vendor Mammography Benchmark with Energy Harmonization Protocolaccepted
  812. LVLM-Aided Alignment of Task-Specific Vision Modelsaccepted
  813. LaDy: Lagrangian-Dynamic Informed Network for Skeleton-based Action Segmentation via Spatial-Temporal Modulationaccepted
  814. LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inferenceaccepted
  815. LaRP: Efficient Multi-View Inpainting with Latent Reprojection Priorsaccepted
  816. LaS-Comp: Zero-shot 3D Completion with Latent-Spatial Consistencyaccepted
  817. LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agentsaccepted
  818. LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Modelsaccepted
  819. Label What Matters: Modality-Balanced and Difficulty-Aware Multimodal Active Learningaccepted
  820. Label-Free Cross-Task LoRA Merging with Null-Space Compressionaccepted
  821. LacTokGen: Latent Consistency Tokenizer for 1024-pixel Image Generation by 256 Tokensaccepted
  822. Lafite: A Generative Latent Field for 3D Native Texturingaccepted
  823. LagerNVS: Latent Geometry for Fully Neural Real-time Novel View Synthesisaccepted
  824. Landscape-Awareness for Geometric View Diffusion Modelaccepted
  825. LangField4D: Learning Identity-Adaptive and Spatio-Temporal Continuous 4D Language Fields for Dynamic Scenesaccepted
  826. LangRef3DGS: Natural Language-Guided 3D Referential Segmentation from Partial Observations via 3D Gaussian Splattingaccepted
  827. Language Does Matter for Cross-Domain Few-Shot Visual Feature Enhancementaccepted
  828. Language Models Can Explain Visual Features via Steeringaccepted
  829. Language-Free Generative Editing from One Visual Exampleaccepted
  830. Language-Grounded Decoupled Action Representation for Robotic Manipulationaccepted
  831. Language-Guided One-Step Diffusion Model for Nighttime Flare Removalaccepted
  832. Language-driven Fine-grained Retrievalaccepted
  833. Language-guided Frequency Modulation for Large Vision-Language Modelsaccepted
  834. Large-scale Codec Avatars: The Unreasonable Effectiveness of Large-scale Avatar Pretrainingaccepted
  835. Large-scale Robust Enhanced Ensemble Clustering via Outlier Decouplingaccepted
  836. Latent Chain-of-Thought World Modeling for End-to-End Autonomous Drivingaccepted
  837. Latent Diffusion Inversion Requires Understanding the Latent Spaceaccepted
  838. Latent Implicit Visual Reasoningaccepted
  839. Layer Consistency Matters: Elegant Latent Transition Discrepancy for Generalizable Synthetic Image Detectionaccepted
  840. Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformersaccepted
  841. Layered 4D-Rotor Gaussian Splatting: A Compressed Representation for Long Dynamic Scenesaccepted
  842. LayoutAD: Exploring Semantic-Geometric Misalignment Reasoning for Scene Layout Anomaly Detectionaccepted
  843. LazyVAR: Accelerating Visual Autoregressive Models via Scale-wise Token Pruning and Parallel Group Decodingaccepted
  844. LeapAlign: Post-training Flow Matching Models at Any Generation Step by Building Two-Step Trajectoriesaccepted
  845. Learnability-Driven Submodular Optimization for Active Roadside 3D Detectionaccepted
  846. Learnability-Guided Diffusion for Dataset Distillationaccepted
  847. Learnable Motion-Focused Tokenization for Effective and Efficient Video Unsupervised Domain Adaptationaccepted
  848. Learned Image Compression via Sparse Attention and Adaptive Frequencyaccepted
  849. Learning 3D Reconstruction with Priors in Test Timeaccepted
  850. Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Imagesaccepted
  851. Learning 3D Shape Fidelity Metric from Real-world Distortionsaccepted
  852. Learning Anchor in Dual Orthogonal Space for Fast Multi-view Clusteringaccepted
  853. Learning Compact 3D Representations from Feed-Forward Novel View Synthesisaccepted
  854. Learning Convex Decomposition via Feature Fieldsaccepted
  855. Learning Coordinate-based Convolutional Kernels for Continuous SE(3) Equivariant and Efficient Point Cloud Analysisaccepted
  856. Learning Cross-View Object Correspondence via Cycle-Consistent Mask Predictionaccepted
  857. Learning Diffeomorphism for Medical Image Registration with Time-Embedded Architectures Using Semigroup Regularizationaccepted
  858. Learning Differentiable Hierarchies in 3D Gaussian Splattingaccepted
  859. Learning Effective Sign Features without Text for Gloss-free Sign Language Translationaccepted
  860. Learning Eigenstructures of Unstructured Data Manifoldsaccepted
  861. Learning Explicit Continuous Motion Representation for Dynamic Gaussian Splatting from Monocular Videosaccepted
  862. Learning Forgery-Aware Lip Representations Without Forgery Priorsaccepted
  863. Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervisionaccepted
  864. Learning Hierarchical Hyperbolic Mixture Model for Part-aware 3D Generationaccepted
  865. Learning Latent Concepts for Detecting Out-of-Distribution Objectsaccepted
  866. Learning Latent Proxies for Controllable Single-Image Relightingaccepted
  867. Learning Latent Transmission and Glare Maps for Lens Veiling Glare Removalaccepted
  868. Learning Like Humans: Analogical Concept Learning for Generalized Category Discoveryaccepted
  869. Learning Long-term Motion Embeddings for Efficient Kinematics Generationaccepted
  870. Learning Multi-View Spatial Reasoning from Cross-View Relationsaccepted
  871. Learning Mutual View Information Graph for Adaptive Adversarial Collaborative Perceptionaccepted
  872. Learning Personalized Photographic Style from Pairwise User Preferencesaccepted
  873. Learning Scene Coordinate Reconstruction from Unposed Images via Pose Graph Optimizationaccepted
  874. Learning Spatial-Temporal Consistency for 3D Semantic Scene Completionaccepted
  875. Learning Straight Flows: Variational Flow Matching for Efficient Generationaccepted
  876. Learning Surgical Robotic Manipulation with 3D Spatial Priorsaccepted
  877. Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videosaccepted
  878. Learning What Helps: Task-Aligned Context Selection for Vision Tasksaccepted
  879. Learning What Matters: Prioritized Concept Learning via Relative Error-driven Sample Selectionaccepted
  880. Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generationaccepted
  881. Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliencyaccepted
  882. Learning a Unified Latent Action Space from Videos with Action-centric Cycle Consistencyaccepted
  883. Learning and Aligning Click-Aware Shape Prior for Interactive Amodal Instance Segmentationaccepted
  884. Learning by Analogy: A Causal Framework for Compositional Generalizationaccepted
  885. Learning complete and explainable visual representations from itemized text supervisionaccepted
  886. Learning from Itself: Mining Internal Knowledge from Vision Language Models for Continual Learningaccepted
  887. Learning from Noisy Supervision: A Denoising-Debiasing Framework for Weakly Supervised Video Anomaly Detectionaccepted
  888. Learning from Oblivion: Predicting Knowledge-Overflowed Weights via Retrodiction of Forgettingaccepted
  889. Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generationaccepted
  890. Learning from Synthetic Data via Provenance-Based Input Gradient Guidanceaccepted
  891. Learning to Act Robustly with View-Invariant Latent Actionsaccepted
  892. Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Explorationaccepted
  893. Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learningaccepted
  894. Learning to Control Physically-simulated 3D Characters via Generating and Mimicking 2D Motionsaccepted
  895. Learning to Diversify and Focus: A Reinforcement Framework for Open-Vocabulary HOI Detectionaccepted
  896. Learning to Drive is a Free Gift: Large-Scale Label-Free Autonomy Pretraining from Unposed In-The-Wild Videosaccepted
  897. Learning to Focus and Precise Cropping:A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMsaccepted
  898. Learning to Generate Highly Dynamic Videos using Synthetic Motion Dataaccepted
  899. Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Modelsaccepted
  900. Learning to Identify Out-of-Distribution Objects for 3D LiDAR Anomaly Segmentationaccepted
  901. Learning to Infer Parameterized Representations of Plants from 3D Scansaccepted
  902. Learning to Learn Weight Generation via Local Consistency Diffusionaccepted
  903. Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Modelsaccepted
  904. Learning to Refuse: Refusal-Aware Reinforcement Fine-Tuning for Hard-Irrelevant Queries in Video Temporal Groundingaccepted
  905. Learning to See Through a Baby's Eyes: Early Visual Diets Enable Robust Visual Intelligence in Humans and Machinesaccepted
  906. Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulationaccepted
  907. Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Modelsaccepted
  908. Learning to Select Visual Tools from Experienceaccepted
  909. Learning to Solve PDEs on Neural Shape Representationsaccepted
  910. Learning to Track Instance from Single Nature Language Descriptionaccepted
  911. Lens Component Deletion based on Differentiable Ray Tracingaccepted
  912. LensWalk: Agentic Video Understanding by Planning How You See in Videosaccepted
  913. Lenses: Toward Polysemous Vision-Language Understandingaccepted
  914. Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generationaccepted
  915. Let VLMs Grade Their Own Thoughts: A Self-Quantification Approach to Reasoning-Aware Reward Modelingaccepted
  916. Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transferaccepted
  917. Let it Snow! Animating 3D Gaussian Scenes with Dynamic Weather Effects via Physics-Guided Score Distillationaccepted
  918. Leveraging Class Distributions in CLIP for Weakly Supervised Semantic Segmentationaccepted
  919. Leveraging Multispectral Sensors for Color Correction in Mobile Camerasaccepted
  920. Leveraging Verifier-Based Reinforcement Learning in Image Editingaccepted
  921. LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Drivingaccepted
  922. LiDAR-to-4DRadar Diffusion Bridge via Cross-Modal Alignment and Translation in Latent Spaceaccepted
  923. LiDAS: Lighting-driven Dynamic Active Sensing for Nighttime Perceptionaccepted
  924. LiDeRe: A Lightweight Readout for Fast and Data-Efficient Dense Predictionaccepted
  925. LiREC-Net: A Target-Free and Learning-Based Network for LiDAR, RGB, and Event Calibrationaccepted
  926. Life-IQA: Boosting Blind Image Quality Assessment through GCN-enhanced Layer Interaction and MoE-based Feature Decouplingaccepted
  927. LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasksaccepted
  928. Lifelong Imitation Learning with Multimodal Latent Replay and Incremental Adjustmentaccepted
  929. Lifting Unlabeled Internet-level Data for 3D Scene Understandingaccepted
  930. LightMover: Generative Light Movement with Color and Intensity Controlsaccepted
  931. LightRR: A Lightweight Network for Single Image Reflection Removalaccepted
  932. LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Secondsaccepted
  933. Lighting in Motion: Spatiotemporal HDR Lighting Estimationaccepted
  934. Lighting-grounded Video Generation with Renderer-based Agent Reasoningaccepted
  935. LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generationaccepted
  936. Linear Fundamental Matrix Estimation from 7 or 5 Pointsaccepted
  937. Linear Image Generation by Synthesizing Exposure Bracketsaccepted
  938. Linguistic Priors for Visual Decoupling: Towards Symmetric Vision-Brain Alignmentaccepted
  939. Linking Modality Isolation in Heterogeneous Collaborative Perceptionaccepted
  940. Linking Perception, Confidence and Accuracy in MLLMsaccepted
  941. Lipschitz Optimization for Formal Verification of Homographiesaccepted
  942. Lite Any Stereo: Efficient Zero-Shot Stereo Matchingaccepted
  943. LitePT: Lighter Yet Stronger Point Transformeraccepted
  944. LiteSense: Lifting Lightweight ToF with RGB for High-Resolution Metric Depth Estimationaccepted
  945. LiteVGGT: Boosting Vanilla VGGT via Geometry-aware Cached Token Mergingaccepted
  946. Live Interactive Training for Video Segmentationaccepted
  947. LiveGesture: Streamable Co-Speech Gesture Generation Modelaccepted
  948. LoD-Loc v3: Generalized Aerial Localization in Dense Cities using Instance Silhouette Alignmentaccepted
  949. LoFA: Learning to Predict Personalized Prior for Fast Adaptation of Visual Generative Modelsaccepted
  950. LoG3D: Ultra-High-Resolution 3D Shape Modeling via Local-to-Global Partitioningaccepted
  951. LoL: Longer than Longer, Scaling Video Generation to Houraccepted
  952. LoPrune: Efficient Data Pruning for LoRA-Based Fine-Tuning of Vision Transformeraccepted
  953. LoST: Level of Semantics Tokenization for 3D Shapesaccepted
  954. Local Motion Matters: A Deconstruct-Recompose Paradigm for Reinforcement Learning Pre-training from Videosaccepted
  955. Local Precise Refinement: A Dual-Gated Mixture-of-Experts for Enhancing Foundation Model Generalization against Spectral Shiftsaccepted
  956. Localizing, Structuring, and Rendering: Bridging 3D and 2D Vision-Language-Action Models for Robotic Manipulationaccepted
  957. Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Imagesaccepted
  958. Locate-then-Sparsify: Attribution Guided Sparse Strategy for Visual Hallucination Mitigationaccepted
  959. LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sightaccepted
  960. LogCD: Local-to-global Consistency Distillation for Few-step Image Generationaccepted
  961. Logit-Margin Repulsion for Backdoor Defenseaccepted
  962. Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentationaccepted
  963. Long-SCOPE: Fully Sparse Long-Range Cooperative 3D Perceptionaccepted
  964. Long-Tail Internet Photo Reconstructionaccepted
  965. LongStream: Long-Sequence Streaming Autoregressive Visual Geometryaccepted
  966. LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Callingaccepted
  967. LongVideo-R1: Smart Navigation for Low-cost Long Video Understandingaccepted
  968. Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detectionaccepted
  969. LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigationaccepted
  970. Looking Beyond the Window: Global-Local Aligned CLIP for Training-free Open-Vocabulary Semantic Segmentationaccepted
  971. LottieGPT: Tokenizing Vector Animation for Autoregressive Generationaccepted
  972. Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learningaccepted
  973. Low-Rank Residual Diffusion Modelsaccepted
  974. Low-Rank Test-Time Training for Pre-Trained Point Cloud Modelsaccepted
  975. Low-Resolution Editing is All You Need for High-Resolution Editingaccepted
  976. LumiMotion: Improving Gaussian Relighting with Scene Dynamicsaccepted
  977. LumiX: Structured and Coherent Text-to-Intrinsic Generationaccepted
  978. Lumosaic: Hyperspectral Video via Active Illumination and Coded-Exposure Pixelsaccepted
  979. LuxRemix: Lighting Decomposition and Remixing for Indoor Scenesaccepted
  980. Lyapunov Probes for Hallucination Detection in Large Foundation Modelsaccepted
  981. Lynx: Towards High-Fidelity Personalized Video Generationaccepted
  982. M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generationaccepted
  983. M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Modelsaccepted
  984. M3Grounder: Mask-Based Multi-Span and Multi-Granular Grounding for Document QAaccepted
  985. M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAGaccepted
  986. M4-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detectionaccepted
  987. M4Human: A Large-Scale Multimodal mmWave Radar Benchmark for Human Mesh Reconstructionaccepted
  988. M4V: Multimodal Mamba for Efficient Text-to-Video Generationaccepted
  989. MA-Bench: Towards Fine-grained Micro-Action Understandingaccepted
  990. MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Modelsaccepted
  991. MAD: Motion Appearance Decoupling for efficient Driving World Modelsaccepted
  992. MAGICIAN: Efficient Long-Term Planning with Imagined Gaussians for Active Mappingaccepted
  993. MAMMA: Markerless Accurate Multi-person Motion Acquisitionaccepted
  994. MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasksaccepted
  995. MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalizationaccepted
  996. MAPo: Motion-Aware Partitioning of Deformable 3D Gaussian Splatting for High-Fidelity Dynamic Scene Reconstructionaccepted
  997. MARCO: Navigating the Unseen Space of Semantic Correspondenceaccepted
  998. MARIS: Marine Open-Vocabulary Instance Segmentationaccepted
  999. MARSS: Radar Semantic Segmentation via Modular Attention and State Space Modelsaccepted
  1000. MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Modelsaccepted

Looking for submission deadlines instead? See the conference deadline calendar.