← All conferences

ICASSP 2025 Accepted Papers

The full list of 3,298 papers accepted at ICASSP 2025 (IEEE International Conference on Acoustics, Speech and Signal Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

  1. Macaque-Motion-Monitor Dataset: A New Benchmark for Macaque Action Recognition
  2. Maintaining Prosodic Consistency in Automatic Dubbing for Better Isochrony
  3. Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
  4. Make Unseen Clear: Occluder Removal for Complete 3D Pedestrian Detection
  5. MalImgDA: Diffusion-based Data Augmentation for Long-tailed Malware Family Classification
  6. Mamba Fusion: Learning Actions Through Questioning
  7. Mamba Meets Financial Markets: A Graph-Mamba Approach for Stock Price Prediction
  8. Mamba for Streaming ASR Combined with Unimodal Aggregation
  9. Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement
  10. Mamba-YOLO-World: Marrying YOLO-World with Mamba for Open-Vocabulary Detection
  11. Mamba-based Segmentation Model for Speaker Diarization
  12. MambaCPU: Enhanced Correlation Mining with State Space Models for CPU Performance Prediction
  13. MambaFoley: Foley Sound Generation using Selective State-Space Models
  14. MambaInst: Lightweight State Space Model for Real-Time Instance Segmentation
  15. MambaMOT: State-Space Model as Motion Predictor for Multi-Object Tracking
  16. MambaNext: An Enhanced Backbone Network with Focus Linear Attention
  17. MambaRF: A Bi-directional Mamba Structure for Radio Frequency Signal Classification of Unmanned Aerial Vehicle
  18. MambaTrack: Exploiting Dual-Enhancement for Night UAV Tracking
  19. Map-Free Visual Relocalization Enhanced by Instance Knowledge and Depth Knowledge
  20. Map-Guided Few-Shot Audio-Visual Acoustics Modeling
  21. Martin: Mobility-Aware Reputation Mechanism for Federated Learning
  22. Mask Augmentation For Tumor Classification In Medical Images
  23. Mask augmented Object-Centric Contrastive Learning for Amodal Instance Segmentation
  24. Mask-Weighted Spatial Likelihood Coding for Speaker-Independent Joint Localization and Mask Estimation
  25. Mask-guided Multi-scale Spatial-Spectral Transformer for Snapshot Compressive Imaging
  26. Masked Image Pretraining on Language Assisted Representation
  27. Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning
  28. Massive MIMO Channel-aware Decision Fusion Aided by Reconfigurable Intelligent Surfaces
  29. Massive MIMO System Partitioning for Efficient Hybrid Beamformer Optimization
  30. Massive MIMO-ISAC Beamforming Design Via Sensing Energy Maximization
  31. Mates of Cross Z-Complementary Pairs for Channel Estimation in Generalized SM-MIMO System
  32. MathReader : Text-to-Speech for Mathematical Documents
  33. Matrix Decomposition By Additive and Subtractive Factors
  34. Maximizing Connectivity of RIS-Assisted UAV-D2D Networks using Semidefinite Programming
  35. Maximum Likelihood Estimation for Bivariate Joint Distribution Recovery from Max-Aggregated Data
  36. Maximum Likelihood Estimation of Stable ARX Models using Randomized Coordinate Descent
  37. Maximum Mutual Information Estimation based Graph Attention Network for Knowledge Graph Completion
  38. Mean Delay in Poisson Wireless Networks with Optimal Packet Fragmentation
  39. Mean-Field Aided QMIX: A Scalable and Flexible Q-Learning Approach for Large-Scale Agent Groups
  40. MedCAM-OsteoCls: Medical Context Aware Multimodal Classification of Knee Osteoarthritis
  41. MedFocusCLIP: Improving few shot classification in medical datasets using pixel wise attention
  42. Medical Image Segmentation via Sparse Coding Decoder
  43. Medical Image Segmentation with Auxiliary Points Prediction of Lesion Location and Boundary
  44. Mel-Spectrogram Inversion via Alternating Direction Method of Multipliers
  45. Melody Structure Transfer Network: Generating Music with Separable Self-Attention
  46. MemKD: Memory-Discrepancy Knowledge Distillation for Efficient Time Series Classification
  47. Membership Encoding for Black-Box Neural Network Watermarking
  48. Memory-Free and Parallel Computation for Quantized Spiking Neural Networks
  49. Meta-Analogy Learning Based on Dynamic Graph Neural Networks for Inductive Knowledge Graph Link Prediction
  50. Meta-Conscious Driven Domain-Aware Federated Learning
  51. Meta-Learning for Finger Vein Recognition in Internet of Things Smart Home Security
  52. Meta-MMD Fusion: Enhancing Cross-Subject Motor Imagery Classification
  53. Meta-UAD: A Meta-Learning Scheme for User-level Network Traffic Anomaly Detection
  54. MetaCert: Metabolic Attention Network Utilizing Uncertainty Estimation for Multimodal Aspect-Category-Sentiment Triple Extraction
  55. MetaCon: Revitalizing Internet Congestion Control with Meta-Reinforcement Learning
  56. Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning
  57. Metadata-assisted Pose Correction for Immersive Audio Split Rendering
  58. Metadata-assisted spatial audio coding in IVAS codec
  59. Metric Learning with Progressive Self-Distillation for Audio-Visual Embedding Learning
  60. MetricGAN+KAN: Kolmogorov-Arnold Networks in Metric-Driven Speech Enhancement Systems
  61. Micro-expression Spotting based on Multi-modal Hierarchical Semantic-guided Deep Fusion Model
  62. Microphone Array Beamforming for Speech Enhancement Based on Dynamic Mode Decomposition
  63. Microtitre Plate Image Augmentation with Generative Adversarial Networks
  64. Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues
  65. Minimizing Disparities between Real and Pseudo Queries for Unsupervised Visual Grounding
  66. Mining Scene Structural Guidance for Thermal Images in Self-Supervised Monocular Depth Estimation
  67. Mitigating Category Imbalance: Fosafer System for the Multimodal Emotion and Intent Joint Understanding Challenge
  68. Mitigating Hallucinations on Object Attributes using Multiview Images and Negative Instructions
  69. Mitigating Motion Artifacts in Non-contact Respiratory Rate Measurement Utilizing mm-Wave FMCW Radar
  70. Mix-Mask Augmentation and Self-Reconstruction for Cross-Domain Few-Shot Hyperspectral Image Classification
  71. MixHD: A Method for Detecting Hallucinations Based on the Internal State and Output Probability of Large Language Models
  72. MixSense : Mixture of Vision Sense
  73. Mixed Gaussian Splatting for High-Quality Rendering and Reconstruction
  74. Mixed Spiking NeRF: Towards a More Efficient Neural Radiance Fields
  75. Mixed-Precision Graph Neural Quantization for Low Bit Large Language Models
  76. Mixture of Experts Fusion for Fake Audio Detection Using Frozen wav2vec 2.0
  77. MncCap: Mining Neural Composition for Zero-shot Image Captioning via Text-only Training
  78. MoHGNN: Enhanced Heterogeneous Graph Neural Network via Metapath Optimization
  79. MoME: Mixture of Multi-Domain Experts for Multivariate Long-Term Series Forecasting
  80. MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
  81. Mobile-friendly Image de-noising: Hardware Conscious Optimization for Edge Application
  82. Modality Modulation and Dual Consistency for Multi-Modality Semi-Supervised Medical Image Segmentation
  83. Modality-Invariant Bidirectional Temporal Representation Distillation Network for Missing Multimodal Sentiment Analysis
  84. Model-Based Machine Learning for Max-Min Fairness Beamforming Design in JCAS Systems
  85. Model-Driven Learning Approach for Robust WiFi-based Fall Detection
  86. Model-based Online Millimeter-wave Channel Sensing with Learned Empirical Priors
  87. Modeling of HR Filters for Audio Object Rendering
  88. Modifying Flow Matching for Generative Speech Enhancement
  89. Modular Gaussian Splatting: Instance Decomposable Learning and Adaptive Rendering of 3D Scenes via Mixture of Experts
  90. Modular Prompt Learning Improves Vision-Language Models
  91. Modulating State Space Model with SlowFast Framework for Compute-Efficient Ultra Low-Latency Speech Enhancement
  92. Modulo Sampling and Recovery with Unknown and Time-Varying Folding Parameter
  93. MonTransformer: Self-Supervised Phonetic to Glyph Conversion Leveraging Positional Context for Traditional Mongolian Texts
  94. MonoIR: Inpainting and Reconstruction for Monocular Endoscope Deformation Scenes
  95. Monte Carlo Score Matching for Image Generation
  96. Mora-Level Prosody Prediction for Text-to-Speech Using Japanese BERT Without Accentual Labels
  97. MorphFader: Enabling Fine-grained Controllable Morphing with Text-to-Audio Models
  98. MotionComposer: Enhancing Rhythmic Music Generation with Adaptive Retrieval Reference
  99. MotionFlow: Joint Motion Priors and Appearance Enhancement for High-Accuracy Optical Flow Estimation
  100. Mouth Articulation-Based Anchoring for Improved Cross-Corpus Speech Emotion Recognition
  101. Movable Antenna Aided Physical Layer Security with No Eavesdropper CSI
  102. MpoxMamba: A Grouped Mamba-based Lightweight Hybrid Network for Mpox Detection
  103. MuRL-DTI: A Multimodal Feature Fusion Reinforcement Learning Approach for Cold Start in Drug-Target Interactions
  104. Multi Queue for Unsupervised Person Re-identification
  105. Multi-Agent Decision Transformer for Power Control in Wireless Networks
  106. Multi-Agent Hierarchical Graph Attention Actor-Critic Reinforcement Learning
  107. Multi-Agent Reinforcement Learning in Partially Observable Environments Using Social Learning
  108. Multi-Class Dementia Detection Using Acoustic Features - ICASSP-2025 PROCESS Challenge
  109. Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
  110. Multi-Degradation Oriented Deep Unfolding Model for Hyperspectral Image Reconstruction
  111. Multi-Descriptor Mesh Animation Compression
  112. Multi-Feature Audio Fusion for Nonverbal Vocalization Classification
  113. Multi-Grained Feature Pruning for Video-Based Human Pose Estimation
  114. Multi-Head Auto-Correlation Attention Networks for Session-based Social Recommendation
  115. Multi-Layer Knowledge Distillation for Continual Semantic Segmentation
  116. Multi-Level Speaker Representation for Target Speaker Extraction
  117. Multi-Microphone Speech Emotion Recognition Using the Hierarchical Token-Semantic Audio Transformer Architecture
  118. Multi-Modal Medical Image Fusion via 3D Manifold Fitting and Dual-Domain Cross-Attention
  119. Multi-Modal Rhythmic Generative Model for Chinese Cued Speech Gestures Generation
  120. Multi-Modal Semantic Communication With Point Cloud Diffusion
  121. Multi-Objective Large Language Model Unlearning
  122. Multi-Objective Reinforcement Learning for Cognitive Radar Resource Management
  123. Multi-Objective Representation based Dynamic Prototype Learning for Unsupervised DCE-MRI Breast Tumor Segmentation
  124. Multi-Point Positional Insertion Tuning for Small Object Detection
  125. Multi-Prototype Grouping for Continual Learning in Visual Question Answering
  126. Multi-Prototype-based Embedding Refinement for Medical Image Segmentation
  127. Multi-Relational Geometric Regularization Framework for Multi-Modal Emotion Recognition in Conversation
  128. Multi-Relational Variational Contrastive Learning for Next POI Recommendation
  129. Multi-Scale Attention-Based Dense Spatial-Temporal Model for Emotion Induction in Response to Olfactory Stimuli
  130. Multi-Scale Conditional Generative Adversarial Networks for Wind Speed Data Imputation in Earthen Ruins Protection
  131. Multi-Scale Dehaze Network Based on Frequency Domain Assistance and Detailed Brightness Information Guidance
  132. Multi-Scale Denoising in the Feature Space for Low-Light Instance Segmentation
  133. Multi-Scale Parallel Hybrid Network for Palmprint Recognition
  134. Multi-Source Multi-Target Domain Similarity Network for Cross-Cultural EEG Emotion Recognition
  135. Multi-Source Spatial Knowledge Understanding for Immersive Visual Text-to-Speech
  136. Multi-Stage Multimodal Distillation for Audio-Visual Speaker Tracking
  137. Multi-Style Facial Sketch Synthesis through Masked Generative Modeling
  138. Multi-Task Joint 3D Swin Transformer Learning for Segmentation and Classification of Hyperspectral Medicine Images
  139. Multi-Task Learning for Ultrasonic Echo-based Depth Estimation with Audible Frequency Recovery
  140. Multi-Task Model Fusion via Adaptive Merging
  141. Multi-User Non-Orthogonal Multiple Access in Power Line Communications Under Generalized Gaussian Noise
  142. Multi-View Image Enhancement Inconsistency Decoupling Guided 3D Gaussian Splatting
  143. Multi-View Radar Detection Transformer with Differentiable Positional Encoding
  144. Multi-channel Speaker Counting for EEND-VC-based Speaker Diarization on Multi-domain Conversation
  145. Multi-domain fusion network for underwater image enhancement
  146. Multi-hop Self-augmented Graph Contrastive Learning for Node Classification
  147. Multi-label Recognition under Noisy Supervision: A Confusion Mixture Modeling Approach
  148. Multi-label body constitution recognition via dual transform MLP-like architecture using tongue images
  149. Multi-layer Network Disintegration via Deep Reinforcement Learning
  150. Multi-level Conflict-Aware Network for Multi-modal Sentiment Analysis
  151. Multi-level Encoder with Global Topic for Task-oriented Dialogue Summarization
  152. Multi-level Feature Adaptation and Embeddings Alignment for Zero-shot Anomaly Detection
  153. Multi-modal Dynamic Point Cloud Geometric Compression Based on Bidirectional Recurrent Scene Flow
  154. Multi-modal Entity Alignment under Imbalanced Visual Modality Information
  155. Multi-modal Salient Object Detection via a Unified Diffusion Model
  156. Multi-modal Speech Enhancement with Limited Electromyography Channels
  157. Multi-modal Streaming ASR in Cross-talk Scenario for Smart Glasses
  158. Multi-object detection and tracking algorithm for fry counting based on DV-YOLO and FryMOT
  159. Multi-period Normalization for Long-term Time Series Forecasting
  160. Multi-range Adaptive Perception Transformer for Iterative Homography Estimation
  161. Multi-scale Context Intertwining for Panoramic Renal Pathology Segmentation
  162. Multi-scale Feature Interaction and Adaptive Experts for Panoptic Segmentation in Remote Sensing Images
  163. Multi-scale Graph Convolution with Corrective Contrastive Learning for Skeleton-based Action Recognition
  164. Multi-scale Re-weighted Attention Feature Fusion for Non-Intrusive Load Monitoring
  165. Multi-scale Spectral Mixture Neural Operator
  166. Multi-scale across attention incorporated network for X-ray coronary vessel segmentation
  167. Multi-source Data Lossless Compression via Parallel Expansion Mapping and xLSTM
  168. Multi-step Fusion of Relation Type Information and Multi-Task Decoding for Entity Relation Extraction in ancient Chinese
  169. Multi-view Feature Discrepancy Attack for Single Object Tracking
  170. Multi-view Hypergraph-based Contrastive Learning Model for Cold-Start Micro-video Recommendation
  171. Multi-view Subspace Classification: A Hierarchical Contrastive Approach and Low-rank Latent Representation
  172. Multiband Unlimited Sampling: Super-Nyquist or Sub-Nyquist, That is the Question!
  173. Multichannel Modulo Sampling with Unlimited Noise
  174. Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues
  175. Multiclass Arrhythmia Classification using Smartwatch Photoplethysmography Signals Collected in Real-life Settings
  176. Multilevel Semantic-Aware Model for AI-Generated Video Quality Assessment
  177. Multilingual Parameter-Sharing Adapters: A Method for Optimizing Low-Resource Neural Machine Translation
  178. Multilingual Speaker-Invariant Dysarthria Severity Assessment Using Adversarial Domain Adaptation and Self-Supervised Learning
  179. Multimodal ARMAX Model for Characterization of Human Body System
  180. Multimodal Atrial Fibrillation Risk Stratification: Fusing Post-Stroke Brain DWI and Clinical Data
  181. Multimodal Dialogue Emotion Recognition Based on Label Optimization and Coarse-Grained Assisted Fine-Grained
  182. Multimodal Emotion Recognition in Conversation via Possible Speaker's Audio and Visual Sequence Selection
  183. Multimodal Emotion Recognition with Target Speaker-Based Facial Embeddings
  184. Multimodal Fusion for EEG Emotion Recognition in Music with a Multi-Task Learning Framework
  185. Multimodal Machine Learning Can Predict Videoconference Fluidity and Enjoyment
  186. Multimodal and Multiple Prompts for Biology
  187. Multiple Choice Learning for Efficient Speech Separation with Many Speakers
  188. Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
  189. Multiple Sclerosis Detection with Reinforcement Learning and Differential Evolution
  190. Multiresolution Encoder-Decoder Convolutional Neural Network for Magnetic Resonance Image Segmentation
  191. Multiscale Adaptive Channel Estimation for OTFS
  192. Multivariate Time Series Data Mining for Failure Prediction & Root Cause Analysis
  193. Multiview Canonical Correlation Analysis for Automatic Pathological Speech Detection
  194. Music Tagging with Classifier Group Chains
  195. Music2Latent2: Audio Compression with Summary Embeddings and Autoregressive Decoding
  196. MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
  197. MusicGen-Stem: Multi-stem music generation and edition through autoregressive modeling
  198. MusicLIME: Explainable Multimodal Music Understanding
  199. MusicMamba: A Dual-Feature Modeling Approach for Generating Chinese Traditional Music with Modal Precision
  200. Mutual-View Contrastive Generative Framework for Attribute-Missing Graph Clustering
  201. MutualForce: Mutual-Aware Enhancement for 4D Radar-LiDAR 3D Object Detection
  202. N3C: Towards Replay-based Novelty Continual Clustering with Class-Overlapping
  203. NAT3DSound: 3D Spatial Sound Field Synthesis with Multi-Modal Non-Autoregressive Transformer
  204. NCDI-Diffusion: Neural Contextual and Directional Inversion for Novel View Synthesis through Diffusion Models
  205. NCL-CIR: Noise-aware Contrastive Learning for Composed Image Retrieval
  206. NCNet: Learning to Find Non-Consistent Correspondence Using Learnable Frequency Response Function
  207. NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
  208. NTC-KWS: Noise-aware CTC for Robust Keyword Spotting
  209. NanoGen: A High-affinity Nanobody Generation Model with Guided Diffusion
  210. NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
  211. Naturalistic Music Decoding from EEG Data via Latent Diffusion Models
  212. NeRF-3DTalker: Neural Radiance Field with 3D Prior Aided Audio Disentanglement for Talking Head Synthesis
  213. NeRF-VLD: Efficient Visual Landmark Database Construction via Scene Constraints
  214. Near Optimal Privacy Preserving Fair Multi-Agent Bandits*
  215. Near-Field FMCW SAR Imaging With Fast BPA
  216. Near-Field ISAC in 6G: Addressing Phase Nonlinearity via Lifted Super-Resolution
  217. Near-field AoA estimation with Complex Convolutional Kolmogorov-Arnold Network
  218. Negative Learning and Dual Contrastive for Unsupervised Visible-Infrared Person Re-identification
  219. Neighborhood Attention Transformer with Progressive Channel Fusion for Speaker Verification
  220. Network Games Induced Prior for Graph Topology Learning
  221. Networked ISAC Beamforming Design with Capacity-Limited Fronthaul Links
  222. Neural Adaptive Contextual Video Streaming
  223. Neural Ambisonic Encoding For Multi-Speaker Scenarios Using A Circular Microphone Array
  224. Neural Architecture Search for Ultra-low Memory Blood Glucose Forecasting on the Edge
  225. Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario
  226. Neural Variational Mode Decomposition and Its Application for ECG Denoising
  227. NeuroIncept Decoder for High-Fidelity Speech Reconstruction from Neural Activity
  228. Neuromorphic Unlimited Sampling for High-Dynamic-Range Video Acquisition
  229. Next-Generation ANC: Integrating Dynamic Fixed-Filter Strategies With Extended Kalman Filtering for Enhanced Noise Suppression
  230. No Class Left Behind: A Closer Look at Class Balancing for Audio Tagging
  231. No Data Required: Zero-Shot Domain Adaptation for Automatic Music Transcription
  232. No-Reference Point Cloud Quality Assessment Based on Graph Signal Variation
  233. Node Selection for Physical Layer Security Using Graph-Based Vertex-Frequency Representation
  234. Node-Centric Meta Structure Search in Heterogeneous Graphs
  235. Noise Supervised Contrastive Learning and Feature-Perturbed for Anomalous Sound Detection
  236. Noise-Agnostic Multitask Whisper Training for Reducing False Alarm Errors in Call-for-Help Detection
  237. Noise-Mitigated Variational Quantum Eigensolver with Pre-training and Zero-Noise Extrapolation
  238. Noise-Resilient Unlimited Sampling and Recovery of Sparse Signals
  239. Noise-Robust Speech Emotion Recognition Using Shared Self-Supervised Representations with Integrated Speech Enhancement
  240. Non-Autoregressive Image Captioning with Multi-Label Classification and Self-Critical Sequence Training
  241. Non-Autoregressive Multimodal Machine Translation
  242. Non-Pharmacological Interventions: A Virtual Training Framework for Fine Motor Learning
  243. Non-contact Quickest Abnormal Heart Rate Detection using MIMO Radar
  244. Non-invasive Speaker-dependent Continuous Phoneme Recognition with a Radar-based Silent Speech Interface
  245. Non-negative Weighted DAG Structure Learning
  246. Nonlinear Anisotropic Diffusion-Based Channel Estimation in 5G Wireless Networks
  247. Nonlinear Precoding in the RIS-Aided MIMO Broadcast Channel
  248. Norm Augmented Graph AutoEncoders for Link Prediction
  249. Novel Deep Gaussian Process Structures with Flexible Depths
  250. NucleiFormer: A Nuclei Segmentation Model Optimized by Joint Haar Wavelet and Adaptive Feature Calibration
  251. O-EENC-SD: Efficient Online End-to-End Neural Clustering for Speaker Diarization
  252. OARecon: Object-Aware Viewpoint Augmentation for Indoor Compositional Reconstruction
  253. OCLNet: Obfuscation feature Contrastive Learning Network for Weakly Supervised Semantic Segmentation on Ultrasound Images
  254. OCTAMamba: A State-Space Model Approach for Precision OCTA Vasculature Segmentation
  255. OF-AR Relation Aware Representation Learning for Lesion Image Segmentation and Grading
  256. OLN++: Improved Object Localization Network for Open-world Object Detection
  257. OPFormer: Real-Time Optimal Power Flow with CNN-Based Transformer
  258. OSLO-IC: On-the-Sphere Learned Omnidirectional Image Compression with Attention Modules and Spatial Context
  259. OSR: Toward Developing Efficient Federated Learning-based Human Activity Recognition using Optimal Server Representations
  260. OTFS for Automotive Radars: Waveform Optimization and Ambiguity Function Analysis
  261. OTMEA : Multi-modal Entity Alignment via Optimal Transport
  262. OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models
  263. Object-Based Video Tampering Localization via Trace Consistency Analysis
  264. Object-Centric Discriminative Learning for Text-Based Person Retrieval
  265. Object-level Data Augmentation for Visual 3D Object Detection in Autonomous Driving
  266. Offline Reinforcement Learning via Conservative Smoothing and Dynamics Controlling
  267. On Class Separability Pitfalls In Audio-Text Contrastive Zero-Shot Learning
  268. On Decentralized Learning with Stochastic Subspace Descent
  269. On Momentum Acceleration for Randomized Coordinate Descent in Matrix Completion
  270. On Noise-Sensitivity of Unlimited Sampling in Line Spectral Estimation
  271. On Overlap Ratio in Defocused Electron Ptychography
  272. On The Role of Prompt Construction In Enhancing Efficacy and Efficiency of LLM-Based Tabular Data Generation
  273. On the Design of Low-Rank Differential Beamformers with Nonuniform Linear Microphone Arrays
  274. On the Design of Weakly-Convex Regularizers for Solving Linear Inverse Problems
  275. On the Relation Between Speech Quality and Quantized Latent Representations of Neural Codecs
  276. On the Restricted Isometry Property of Kronecker-structured Matrices
  277. On-device hand model for robust gesture detection
  278. One Shot is Enough for Sequential Infrared Small Target Segmentation
  279. One-Shot Face Avatar Generation in a Single Forward Pass with Identity Preservation
  280. One-Shot Learning for Pose-Guided Person Image Synthesis in the Wild
  281. One-Shot Talking Face Generation with Expression Editing
  282. One-step Incomplete Multi-view Clustering based on Bipartite Graph Learning
  283. Online Contrastive Continual Learning with Hard Negative Samples
  284. Online Learning With Non-convex Losses: New Condition To Achieve Small Dynamic Regret
  285. Online Learning from Strategic Human Feedback in LLM Fine-Tuning
  286. Online Network Inference from Graph-Stationary Signals with Hidden Nodes
  287. Online Optimization of Offloading Video Analytics Tasks to Multiple Edges for Accuracy Maximization
  288. Online Proximal ADMM for Graph Learning from Streaming Smooth Signals
  289. Online scalable Gaussian processes with conformal prediction for guaranteed coverage
  290. Online waveform selection for cognitive radar
  291. Open Automatic Speech Recognition Models for Classical and Modern Standard Arabic
  292. Open-Amp: Synthetic Data Framework for Audio Effect Foundation Models
  293. Open-Modality Latent Modality Interaction Maximization for Audio-Visual Learning
  294. Open-Vocabulary Saliency-Guided Progressive Refinement Network for Unsupervised Video Object Segmentation
  295. Open-Vocabulary Visual Emotion Adaptation via Prompt Learning
  296. OpenACE: An Open Benchmark for Evaluating Audio Coding Performance
  297. Opportunities and Challenges for Bluetooth LE Audio Assistive Listening Systems
  298. Optical Authenticity in Pushbroom System for Spectral Information Protection
  299. Optimal Combination Policies for Error Exponent Maximization in Social Learning
  300. Optimal Device Selection and Resource Allocation in Federated Learning
  301. Optimal One-hot Logistic Regression for Tree-based Distribution Classification
  302. Optimization of Beamwidth in Automotive Radars Based on Statistics of Street Geometry
  303. Optimization of Chirality Variation in Carbon Nanotube Field Effect Transistor Spiking Neurons
  304. Optimized Dynamic Watermarking for Audio DNNs with Adaptive Embedding and Boundary Sampling
  305. Optimized Self-supervised Training with BEST-RQ for Speech Recognition
  306. Optimizing Biomarkers from Earbud Ballistocardiogram: Calibration and Calibration-Free Algorithms for Accelerometer Axis Selection and Fusion
  307. Optimizing Dual-Mode UAV-Assisted Remote IoT Data Collection with Decentralized DRL in 6G-Enabled Space-Air-Ground Networks
  308. Optimizing Multimodal Image Fusion: A Novel Approach with Nystrom Attention Mechanisms in Transformer Models
  309. Optimizing Speech Multi-View Feature Fusion through Conditional Computation
  310. Optimum Power-Subcarrier Allocation and Time-Sharing in Multicarrier NOMA Uplink
  311. OrientDream: Streamlining Text-to-3D Generation with Explicit Orientation Control
  312. Out-of-Distribution Detectors: Not Yet Primed for Practical Deployment
  313. Out-of-Distribution Radar Detection in Compound Clutter and Thermal Noise through Variational Autoencoders
  314. Outage Analysis of IRS-Aided Wireless Energy Transfer Under Correlation and Imperfect CSI
  315. Overcoming Uncertain Incompleteness for Robust Multimodal Sequential Diagnosis Prediction via Curriculum Data Erasing Guided Knowledge Distillation
  316. PAFedMIS: Personalized Asynchronous Federated Learning for Medical Image Segmentation
  317. PAIR: Complementarity-guided Disentanglement for Composed Image Retrieval
  318. PANDA: Patch-Aware Graph Network with Dual Alignment for Time Series Forecasting
  319. PASTD: Progressive Augmentation and Spatiotemporal Decoupling Contrastive Learning for Skeleton-Based Action Recognition
  320. PAUSE: Privacy-Aware Active User Selection for Federated Learning
  321. PB-UAP: Hybride Universal Adversarial Attack for Image Segmentation
  322. PBD : Plastic Bottle Dataset for Defect Detection
  323. PD-SDF: Dynamic Surface Reconstruction Based on Plane Decomposition for Single View RGB-D Videos
  324. PD-VOST: Parkinson's Disease Voice Spectrogram Transformer
  325. PDCE: Patch-wise Dynamic Curve Estimation for Low-Light Image Enhancement
  326. PDMX: A Large-Scale Public Domain MusicXML Dataset for Symbolic Music Processing
  327. PDSeg: Patch-Wise Distillation and Controllable Image Generation for Weakly-Supervised Histopathology Tissue Segmentation
  328. PDTrack: Progressive Distance Association for Multiple Object Tracking
  329. PEDE: Enhance Multi-modal Sarcasm Detection in Videos via Prompted Emotion Distributions
  330. PEPL: Precision-Enhanced Pseudo-Labeling for Fine-Grained Image Classification in Semi-Supervised Learning
  331. PET: High-Frequency Temporal Self-Consistency Learning for Partially Deepfake Audio Localization
  332. PGD-Imp: Rethinking and Unleashing Potential of Classic PGD with Dual Strategies for Imperceptible Adversarial Attacks
  333. PGDGS: Improving Few-shot 3D Gaussian Splatting with Progressive Gaussian Densification
  334. PHMamba: Preheating State Space Models with Context-Augmented Features for Medical Image Segmentation
  335. PIER: A Novel Metric for Evaluating What Matters in Code-Switching
  336. PIN: A Prompt-based Implicit Sentiment Analysis Network for Chinese
  337. PNP-RKD: A Positive-Negative Pair based Relational Knowledge Distillation Method for Cross-Domain Speaker Verification
  338. PNetGPT: Proprietary Protocol Network Traffic Generation with Pre-trained Transformer
  339. PPDformer: Channel-Specific Periodic Patch Division for Time Series Forecasting
  340. PQNAS: Mixed-precision Quantization-aware Neural Architecture Search with Pseudo Quantizer
  341. PR-KGC: Text-enhanced Knowledge Graph Completion with Pair-wise Re-ranking
  342. PRESS: Defending Privacy in Retrieval-Augmented Generation via Embedding Space Shifting
  343. PRimuS: Pretraining IMU Encoders with Multimodal Self-Supervision
  344. PTQ4ADM: Post-Training Quantization for Efficient Text Conditional Audio Diffusion Models
  345. PaSTS: Parameter-affined Seasonal-Trend Synthesis for Multi-dimensional Long-Term Time Series Forecasting within LLM
  346. Padnet: a Patch-Based Anomaly Detection Framework for Industrial Pipeline Damage Detection
  347. Palm-vein images reconstruction against adversarial attacks
  348. Pan-protein Design Learning Enables Task-adaptive Generalization for Low-resource Enzyme Design
  349. Pancreatic Cystic Neoplasms Lesion Detection for Non-contrast CT Image via Teacher-student Model
  350. Panorama: An enabling technology for Hearables
  351. Parameter-Efficient Federal-Tuning Enhances Privacy Preserving for Speech Emotion Recognition
  352. Parametric Object Coding in IVAS: Efficient Coding of Multiple Audio Objects at Low Bit Rates
  353. Part in Part Embedding Network for Zero-Shot Learning
  354. Partial Inference in Structured Prediction
  355. Partial Reconstruction Error for Deepfake Detection
  356. Partially Observable Contextual Bandits With Linear Payoffs
  357. Particle-based Data-driven Nonlinear State Estimation of Model-free Process from Nonlinear Measurements
  358. Passive Non-Line-of-Sight Imaging with Parallel Encoder
  359. Past, Present, and Future of Spatial Audio and Room Acoustics
  360. Patch Attention Excitation Based Vision Transformer for Small-Sized Datasets
  361. PatchST: A Patch Spatial-Temporal Network for Large-Scale Traffic Forecasting
  362. Path Signatures are Unsupervised Time Series Anomaly Extractors
  363. Pathological Prior-Guided Multiple Instance Learning For Mitigating Catastrophic Forgetting in Breast Cancer Whole Slide Image Classification
  364. Pathological Section Staining Transferring with Tailored Metric-based Model Selection
  365. PeT-KeyStAtion: Parameter-efficient Transformer with Keypoint-guided Spatial-temporal Aggregation for Video-based Person Re-identification
  366. Peer-to-Peer Learning Dynamics of Wide Neural Networks
  367. Perception-Enhanced Network for Accurate Human Pose Estimation
  368. Perceptual Audio Coding: A 40-Year Historical Perspective
  369. Perceptual Noise-Masking with Music through Deep Spectral Envelope Shaping
  370. Performance Bounds for Single-Bit AOA-Based RF Source Localization
  371. Person-In-Bed Detection using Frequency Domain Features and GLR-based CuSum
  372. Person-in-Bed Detection from Mattress-Integrated Accelerometers
  373. Personalized Federated Class-Incremental Learning through Critical Parameter Transfer
  374. Personalized Graph Transformer for Federated Graph Learning
  375. Personalized Speech Enhancement without User Enrollment for Real-World Audio Replay Scenarios
  376. Personalizing Keyword Spotting with Speaker Information
  377. Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
  378. Phoneme-Aware Acoustic Analysis of Natural Speech for Lung Function Assessment
  379. Phoneme-Level Contrastive Learning for User-Defined Keyword Spotting with Flexible Enrollment
  380. PhysID: Physics-based Interactive Dynamics from a Single-view Image
  381. Physically Robust and Imperceptible Adversarial Examples Generation Based on Frequency
  382. Physics-Informed Neural Networks for Ocean Acoustic Field Prediction with Envelope Smoothing
  383. PiCNet: Physics-infused Convolution Network for Radar-Based Precipitation Nowcasting
  384. Piano Transcription by Hierarchical Language Modeling with Pretrained Roll-based Encoders
  385. PicoAudio: Enabling Precise Temporal Controllability in Text-to-Audio Generation
  386. Pipeline-Centered Neighboring Network for Deep Unfolding Pansharpening
  387. Plaintext-Free Deep Learning for Privacy-Preserving Medical Image Analysis through Frequency Information Embedding
  388. Planetary gear vibration monitoring using synchronous demodulation
  389. Planing It by Ear: Convolutional Neural Networks for Acoustic Anomaly Detection in Industrial Wood Planers
  390. PlantPCC: Dual Sampling and Multi-level Geometry-aware Contrastive Regularization for Plant Point Cloud Completion
  391. Point Clean-label Backdoor Attack for Specific Classes via Feature Entanglement
  392. Point Cloud Registration via Reconstruction with Local Geometry Information Aggregation
  393. Point Cloud Resampling With Learnable Heat Diffusion
  394. Point-UMAE: Unet-like Masked Autoencoders for Point Cloud Self-supervised Learning
  395. PointActionCLIP: Preventing Transfer Degradation in Point Cloud Action Recognition with a Triple-Path CLIP
  396. Poisoning The Diffusion: A Simple and Robust Watermarking Method for Audio Generation
  397. Polygon Pixel IoU: Similarity Metric between Polygons with Different Number of Vertices for Arbitrary-Shaped Text Spotting
  398. Popularity and Interest Signal Detection for Sequential Recommendation Denoising
  399. Position-aware Hypergraph Message-Passing Neural Network
  400. Positional Differential Encoding for Distributed Learning
  401. Positioning and transmission in cell-free networks: ambiguity function, and MRC/MRT array gains
  402. Positive Enhanced Preference Alignment for Text-to-Image Models
  403. Post-Hoc Adversarial Stickers Against Micro-Expression Leakage
  404. Post-Net2.0: An adaptive weighted loss function driven by linguistic constraint for automatic syllable stress detection
  405. Power in Unity: Combining in-Domain and out-of-Domain Pre-Training Strategies for EEG-Based Person Identification
  406. Practical Radar Sensing Using Two Stage Neural Network for Denoising OTFS Signals
  407. Pre-training with Synthetic Patterns for Audio
  408. Pre-training, Fine-tuning and Re-ranking: A Three-Stage Framework for Legal Question Answering
  409. Precisely Controllable Neural Speech Synthesis
  410. Precision in Pathology: PMA-DETR Elevates Tumor Lesion Detection
  411. Preconditioned Sharpness-Aware Minimization: Unifying Analysis and a Novel Learning Algorithm
  412. Predicting Biomechanical Risk Factors for Division - I Women's Basketball Athletes
  413. Predicting Compact Phrasal Rewrites with Large Language Models for ASR Post Editing
  414. Predicting local fMRI activations from EEG: a Feasibility Study Using Both Classical and Modern Machine Learning Pipelines
  415. Prediction-driven Untrained Network for Single-snapshot Sparse Array Interpolation
  416. Preference Alignment Improves Language Model-Based TTS
  417. Prelude echoes Finale: Video Domain Adaptation with Fine-grained Temporal Consistency
  418. Preventing output saturation in active noise control: An output-constrained Kalman filter approach
  419. PrimeK-Net: Multi-scale Spectral Learning via Group Prime-Kernel Convolutional Neural Networks for Single Channel Speech Enhancement
  420. Principal Curvatures Estimation with Applications to Single Cell Data
  421. PriorSinger: Singing Voice Synthesis Model with Prior Condition Cross Attention
  422. Privacy-Aware Federated Fine-Tuning of Large Pretrained Models With Just Forward Propagation
  423. Privacy-Preserving Distributed Maximum Consensus Without Accuracy Loss
  424. Private Semantic Communications with Separate Blind Encoders
  425. Probabilistic Contrastive Test-Time Adaptation
  426. Probabilistic Person-in-Bed Detection Using Accelerometer Signals
  427. Problem Solving-Oriented Programming Knowledge Tracing from Behavior to Thought
  428. Progressive Subband Modeling for Artifacts-free Speech Super-resolution
  429. Projection Modules for Few-Shot Object Detection
  430. Projection Valued-based Quantum Machine Learning Adapting to Differential Privacy Algorithm for Word-level Lipreading
  431. Promoting PLM Fine-Tuning through Consistency Adversarial Training
  432. Prompt Crossing: Evaluating Whether LLM Response Stem from Jailbreak or Normal Prompt
  433. Prompt Fusion and Aspect-Oriented Filtration for Aspect-Based Multimodal Sentiment Analysis
  434. Prompt-UIE: A Unified Prompt-Driven Framework for Underwater Image Enhancement
  435. Prompt-augmented Feature with Cross-domain Contrastive Learning for Efficient Multi-domain Sentiment Analysis
  436. Prompt-to-Correct: Automated Test-Time Pronunciation Correction with Voice Prompts
  437. PromptArtisan: Multi-instruction Image Editing in Single Pass with Complete Attention Control
  438. PromptSeg: Learning to Segment Medical Image via Visual Prompts
  439. PromptTA: Prompt-driven Text Adapter for Source-free Domain Generalization
  440. Prompting DirectSAM for Semantic Contour Extraction in Remote Sensing Images
  441. Prototype Alignment with LoRA Fusion for Class-Incremental Learning
  442. Prototype Matching with Domain Alignment for Open-world Specific Emitter Identification
  443. Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
  444. Prototype-Driven Multi-Feature Generation for Visible-Infrared Person Re-identification
  445. Prototypical Graph Alignment for Text-based Person Search
  446. Prototypical Part Transformer for Interpretable Image Recognition
  447. Proud-SLAM: Neural Point-based Hybrid RGBD Monocular Dense SLAM
  448. Proximity Detection and Trajectory Recognition with Machine Learning for UHF RFID Systems
  449. Pruning for Sparse Diffusion Models Based on Gradient Flow
  450. Pruning then Reweighting: Towards Data-Efficient Training of Diffusion Models
  451. PsSR: Hybrid Path Selection Mechanism for Efficient Image Super-Resolution
  452. Pseudo-Labeling for Enhanced User Privacy in Approximate Machine Unlearning
  453. Psycholinguistic Features Predict Word Duration in Hindi Read Aloud Speech
  454. PulmoScan: A Practical Pulmonary Disease Pre-Screening System
  455. Punctuation Restoration: A Case Study of BERT-Based Models' Task-Specific Excellence
  456. Pushing Wi-Fi Towards Fine-Grained Sensing Via Spectrogram Enhancement
  457. Pyramid Attention Enhancement Network for Nighttime UAV Tracking
  458. QoKV: Comprehending and Surpassing the Hurdles of KV Cache Quantization
  459. Quad-Net: Melspectrogram Vocoder with Convolutional Layers Restricted by the Quadrature Mirror Filter for Perfect Reconstruction
  460. Quality and Complexity Tradeoffs for DNN-Based Binaural Speech Enhancement in Hearing Aids
  461. Quant-NeRF: Efficient End-to-End Quantization of Neural Radiance Fields with Low-Precision 3D Gaussian Representation
  462. Quantum Multi-Path Communication Protocol Based on Maximum Flow Theory
  463. Quantum Multimodal Contrastive Learning Framework
  464. Quantum Neural Networks: A Path to Lower Emissions Through Fuel Consumption Prediction in Shipping
  465. Quantum Reinforcement Learning for Coordinated Satellite Systems
  466. Quantum Run-length Encoding: Optimizing Data Compression on Quantum Computers with Exponential Resource Efficiency
  467. Quantum-Behaved Particle Swarm Optimization for the Segmentation of Kidney Stone CT Images
  468. Quantum-Train with Tensor Network Mapping Model and Distributed Circuit Ansatz
  469. Quasi Polynomial and Interpolative Models for Tensor Approximation
  470. Quaternion CNN With Salient Features for Color Image Denoising
  471. Query-Aware Temporal Aggregation Network for Temporal Knowledge Graph Reasoning
  472. Quickest Change Detection of Unknown Mean-Shifts using the James-Stein Estimator
  473. R2-SAC: A Relaxation-and-Refinement SAC Agent for Stock Portfolio Trading
  474. RAC-GAN: Iterative Dual-Objective Over and Under Sampling for Imbalanced Datasets
  475. RADCI: A Synchronized Radar-RGBT Object Detecting-Tracking Dataset And A Benchmark
  476. RAFDet: A Novel Camera-Radar Fusion Framework for Robust 3D Object Detection in Autonomous Driving
  477. RAOCSL: A BERT-Based Strategy for Identifying Learner Confusion under Class Imbalance
  478. RAPID: Recognition of Any-Possible DrIver Distraction via Multi-view Pose Generation Models
  479. RAS-GNN: Reconstructing APT Attack Scenario Using Graph Neural Network
  480. RAW Data: A Key Component for Effective Deepfake Detection
  481. REAct: Rational Exponential Activation for Better Learning and Generalization in PINNs
  482. RETAIN: Reliable Topology Augmentation for both Heterophilic and Homophilic Graphs
  483. RF Distillation Diffusion Model: An Efficient RFF Data Augmentation Method
  484. RF-GML: Reference-Free Generative Machine Listener
  485. RF-Pose Estimation based on Contrastive Camera-Radar-Images Pretraining
  486. RFEM: Remote Feature Enhancement Module for Target Detection
  487. RIS-Enabled Self-Interference Elimination in Monostatic Full-Duplex DFRC Systems
  488. ROME: Radar Sparsity Improvement and Omnimodal Enhancement for 3D Object Detection in Bird's Eye Views
  489. RPPFL: Robust and Privacy-Preserving Federated Learning via Trusted Execution Environments
  490. RQTalker: Speech-driven 3D Facial Animation via Region-aware Vector Quantization
  491. RSM: Refined Saliency Map For Explainable 3D Object Tracking
  492. RTF Estimation Using Riemannian Geometry for Speech Enhancement in the Presence of Interferences
  493. RWKVMatch: Vision RWKV-based Multi-scale Feature Matching Network for Unsupervised Deformable Medical Image Registration
  494. RaLU-Net: Deep Unfolded Radar Localization of Humans for Precise Multi-Person Non-Contact Vital Signs Monitoring
  495. RadDet: A Wideband Dataset for Real-Time Radar Spectrum Detection
  496. Radar Jamming Recognition via Cross-Modality Contrast Learning
  497. Radar2ECG: Multi-Scale Bottleneck Fusion and Cross-modal Semantic Distillation for Conditional Electrocardiogram Generation from Radar Heart Sound
  498. Radiation and Directivity Analysis of a Vibrating Dome-Shaped Radiator Mounted on an Infinite Baffle
  499. Radio Map Estimation via Latent-Domain Plug-and-Play Denoisers
  500. RanDoctor: System-Level Ransomware Detection with ProbSparse Self-Attention
  501. Rapid Online Bayesian Learning for Deep Receivers
  502. Rate-Constrained Quantization for Communication-Efficient Federated Learning
  503. Raw Audio Deep Learning Filter Banks for Acoustic Scene Classification
  504. Re-Evaluating Privacy in Centralized and Decentralized Learning: An Information-Theoretical and Empirical Study
  505. ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
  506. ReTD: Reconstruction-Based Traceability Detection for Generated Images
  507. Real-time Adversarial Attack to Deep Learning-based Wi-Fi Human Activity Recognition
  508. Realistic Real-Time Talking Head Synthesis with Grid Encoding and Progressive Conditioning
  509. RecNet: Optimization for Dense Object Detection in Retail Scenarios Based on View Rectification
  510. Reconciling AMP Algorithms derived from Belief Propagation or the Large System Limit Bethe Free Energy
  511. Reconstruction of EEG and ECG from Single Channel Mixture using Branched Autoencoder based Separable Representations
  512. Recursive Feature Learning from Pre-Trained Models for Spoofing Speech Detection
  513. Redefining Well Exposedness for Locally Adaptive Multi-Exposure Fusion
  514. Redesigning graph filter-based GNNs to relax the homophily assumption
  515. Reduced Effectiveness of Kolmogorov-Arnold Networks on Functions with Noise
  516. Reduced Spatial Dependency for More General Video-level Deepfake Detection
  517. Reducing the Gap Between Pretrained Speech Enhancement and Recognition Models Using a Real Speech-Trained Bridging Module
  518. Reducing the Sensitivity of Neural Physics Simulators to Mesh Topology via Pretraining
  519. Reenvisioning Skeleton-based Action Recognition Through the Lens of NLP
  520. Reexamining the Efficacy of MetricGAN for Speech Enhancement
  521. RefCap: Zero-shot Video Corpus Moment Retrieval Based on Refined Dense Video Captioning
  522. Reference-Guided Parallel Independent Component Analysis: Estimating Cognition Associated Multimodal Patterns In Schizophrenia
  523. Refiner: Fine-grained Cross-modal Concepts Refinement for Compositional Zero-Shot Learning
  524. RefleXGen: The unexamined code is not worth using
  525. Regarding the Existence of the Internal Language Model in CTC-Based E2E ASR
  526. Regret Optimization Experience Replay in Off-Policy Reinforcement Learning
  527. Regularized Domain Adaptation for Estimation Tasks in Partially Observed Target Domains
  528. Regularized Weighted Descent: Model-Based Learner for Multi-Target Radar Waveform Design
  529. Reinforced Domain Selection for Continuous Domain Adaptation
  530. Reinforcement Learning for Charged Particle Beam Control to Minimize Injection Mismatch in Particle Accelerators
  531. Reinforcement Learning-Based Multi-Teacher Knowledge Distillation for Enhancing Retrieval Ranking Consistency
  532. Rejection of Workers with Heterogeneous (Mismatched) Data in Federated Learning *
  533. RelaI2P: Relational Learning for Image-to-Point Cloud Registration
  534. Relation-aware Semantic Alignment Network for Text-to-Image Person Retrieval
  535. Relative Localization of Asynchronous Agents Based on Hybrid Active-Passive Two-Way Ranging
  536. Relaxing Distillation Constraints for Improved New Class Learning in Continual Semantic Segmentation
  537. Reliable Imputed-Sample Assisted Vertical Federated Learning
  538. Reliable Learning From LLM Features for Multimodal Emotion and Intent Joint Understanding
  539. RemoteTrimmer: Adaptive Structural Pruning for Remote Sensing Image Classification
  540. Representative Arm Identification: A fixed confidence approach to identify cluster representatives
  541. Resilient Test-Time Adaptation by Mitigating Batch-Normalization Overfitting
  542. Resource Allocation for Semantic Segmentation Tasks in Autonomous Driving: A Likelihood Active Inference Approach
  543. Resource-Efficient and Noise-Robust Modality Fusion for Audio-Visual Speech Recognition
  544. RespDiff: An End-to-End Multi-scale RNN Diffusion Model for Respiratory Waveform Estimation from PPG Signals
  545. RestorMamba: An Enhanced Synergistic State Space Model for Image Restoration
  546. Retention Enhanced Cross-modal Attention for Multi-Hop VQA
  547. Rethinking Adversarial Attacks in Reinforcement Learning from Policy Distribution Perspective
  548. Rethinking Camouflaged Object Detection via Foreground-Background Interactive Learning
  549. Rethinking Decoding in Multi-intent Spoken Language Understanding
  550. Rethinking Dual-Stream Super-Resolution for Enhancing Remote Sensing Object Detection
  551. Rethinking Early-Fusion Strategies for Improved Multimodal Image Segmentation
  552. Rethinking Encoder-Decoder Flow Through Shared Structures
  553. Rethinking Mamba in Speech Processing by Self-Supervised Models
  554. Rethinking Mean Opinion Scores in Speech Quality Assessment: Score Aggregation through Quantized Distribution Fitting
  555. Rethinking the Fragility and Robustness of Fingerprints of Deep Neural Networks
  556. RetinaStereo: Dynamic-Volume Stereo Matching Network
  557. Retinex-Based Self-Conditioned Diffusion Model for Low-Light Image Enhancement
  558. Retrieval Augmented Correction of Named Entity Speech Recognition Errors
  559. Retrieval-Augmented Multilingual Citation Generation
  560. Retrieval-Augmented Neural Field for HRTF Upsampling and Personalization
  561. RevPv8: Reverse Information for Road Space and Lane Line Segmentation in Highway Surveillance Scene
  562. Revelio: A Real-World Screen-Camera Communication System with Visually Imperceptible Data Embedding
  563. Reversible Data Hiding in Encrypted Images Based on Variational Lossless Compression and Dual Encryption
  564. Revise, Reason, and Recognize: LLM-Based Emotion Recognition via Emotion-Specific Prompts and ASR Error Correction
  565. Revisiting Acoustic Features for Robust ASR
  566. Revisiting Neighborhood Aggregation in Graph Neural Networks for Node Classification using Statistical Signal Processing
  567. Revisiting and Refining Lagunas' Beamforming for Acoustic Imaging
  568. Revolutionizing Disease Diagnosis with simultaneous functional PET/MR and Deeply Integrated Brain Metabolic, Hemodynamic, and Perfusion Networks
  569. Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
  570. Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
  571. Right Label Context in End-to-End Training of Time-Synchronous ASR Models
  572. River-GEM: Generating and Enhancing Muddy Water Images
  573. RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation
  574. RobNAS: Robust Neural Architecture Search for Point Cloud Adversarial Defense
  575. Robust Activity Detection for Massive Access using Covariance-based Matching Pursuit
  576. Robust Adversarial Defense Based on Non-Transferability of Attack Across Foundation Models
  577. Robust Adversarial Training for Industrial Defect Classification with Long-Tailed Data
  578. Robust Audio Deepfake Detection using Ensemble Confidence Calibration
  579. Robust CLIP-Guided Deep Thinking: A Two-Stage Optimization Strategy for Enhancing Adversarial Robustness and Reliability in LVLMs
  580. Robust Cross-Etiology and Speaker-Independent Dysarthric Speech Recognition
  581. Robust Deepfake Detection via Perturbation Domain Alignment
  582. Robust Detection Based on the K-Score Test
  583. Robust Deterministic DOA Estimation Using α-divergence in Unknown Noise Fields with Sparse Sensor Arrays
  584. Robust Dwell Time Allocation for Multiple Ballistic Reentry Target Tracking in Phased Array Radar
  585. Robust Exponential Hyperbolic Tangent Geman-McClure Based Identification of Nonlinear Systems
  586. Robust Fixed-Filter Sound Zone Control with Audio-Based Position Tracking
  587. Robust Frame-level Speaker Localization in Reverberant and Noisy Environments by Exploiting Phase Difference Losses
  588. Robust Fusion of Bone and Air-Conducted Sensors for Speech Enhancement with Adaptive Temporal-Frequency Attention
  589. Robust Hybrid Beamforming for Integrated Sensing and Communications via Learned Optimization
  590. Robust Hybrid Convolutional Beamspace for High Resolution DOA Estimation
  591. Robust Identifiability for Symbolic Recovery of Differential Equations
  592. Robust Kernel Sparse Subspace Clustering
  593. Robust Low-Light Human Pose Estimation through Illumination-Texture Modulation
  594. Robust Multi-Pitch Estimation via Optimal Transport Clustering
  595. Robust Multi-task Adversarial Attacks Using Min-max Optimization
  596. Robust Multicomponent Tracking of Ultrasonic Vocalizations
  597. Robust Over-The-Air Federated Learning In Heterogeneous Networks
  598. Robust Qualitative Data Clustering via Learnable Multi-Metric Space Fusion
  599. Robust Seizure Prediction Based on Riemannian Manifold Enhanced Denoising Adversarial Autoencoder
  600. Robust Semantic Communications for Speech Transmission
  601. Robust Sensor Selection By Deep Unfolding
  602. Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
  603. Robust Supervised Graph Embedding Method For EEG-Based Brain Network Emotion Recognition
  604. Robust Target Speaker Direction of Arrival Estimation
  605. Robust and Efficient Adversarial Defense in SNNs via Image Purification and Joint Detection
  606. Robust and Efficient Text-based Speech Editing using Noise Conditioning and Rectified Flow
  607. Role of the Pretraining and the Adaptation data sizes for low-resource real-time MRI video segmentation
  608. Role-Specific Reward Design with Large Language Model for StarCraft II
  609. S-KEY: Self-supervised Learning of Major and Minor Keys from Audio
  610. SABiT-MNet: Scale-Adaptive Autoencoder with BiT-M Model for Identifying AMD Grades
  611. SACR: Self-training with Saliency-Augmented Consistency Regularization for Few-Shot Learners
  612. SAF: Local Shape-aware Face-based Garment Collision Handling via Neural SDFs
  613. SAM Adaptation with Refocused Attention and Diverse Prompts for Medical Image Segmentation
  614. SAM-OCTA2: Layer Sequence OCTA Segmentation with Fine-tuned Segment Anything Model 2
  615. SAR Ship Detector Using Cross-stage Feature Fusion and Decoupled Head with Mutual Guidance
  616. SBA: A Swift and Stealthy Backdoor Attack Framework for Federated Learning
  617. SBL Algorithms for the Multiple Measurement Vector Problem: New Modeling and Inference Methods
  618. SCAT: Shared-Convolution Adaptation Tuning for Foreground Segmentation
  619. SCDiar: a streaming diarization system based on speaker change detection and speech recognition
  620. SCF-Stega: Controllable Linguistic Steganography Based on Semantic Communications Framework
  621. SCI-Gaussian: Optimizing 3D Gaussian Radiance Fields from a Snapshot Compressive Image
  622. SCNN: Spike Coupling Neural Network for Multimodal Brain Network Analysis
  623. SCS: Spatially Consistent Self-Supervised approach for One-Shot Anatomical Landmark Detection
  624. SDAFE: A Dual-filter Stable Diffusion Data Augmentation Method for Facial Expression Recognition
  625. SEAL: Speaker Error Correction using Acoustic-conditioned Large Language Models
  626. SECC-Stega: Generative Linguistic Steganographic Framework Based on Error Correcting Codes
  627. SEE: Semantically Aligned EEG-to-Text Translation
  628. SEF-PNet: Speaker Encoder-Free Personalized Speech Enhancement with Local and Global Contexts Aggregation
  629. SEHAP: Secure and Efficient Handover Authentication Protocol in LEO Satellite Non-Terrestrial Networks
  630. SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions
  631. SFADNet: Spatio-temporal Fused Graph based on Attention Decoupling Network for Traffic Prediction
  632. SFE-Net: Harnessing Biological Principles of Differential Gene Expression for Improved Feature Selection in Deep Learning Networks
  633. SFFCE-CD: Spatial And Frequency Feature Cross Enhancement For Change Detection
  634. SFma-Unet: A Mamba-Based Spatial-Frequency Fusion Network for Medical Image Segmentation
  635. SGRAND: Stochastic Graph Neural Diffusion
  636. SHAP-Integrated Convolutional Diagnostic Networks for Feature-Selective Medical Analysis
  637. SINET: Sparsity-driven Interpretable Neural Network for Underwater Image Enhancement
  638. SIP2Net: Situational-Aware Indoor Pathloss-Map Prediction Network for Radio Map Generation
  639. SKE-MSA: Enhancing Representation Learning with VAD Lexicon for Multimodal Sentiment Analysis
  640. SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
  641. SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation
  642. SLiCK: Exploiting Subsequences for Length-Constrained Keyword Spotting
  643. SMCNet: Supervised Surface Material Classification Using mmWave Radar IQ Signals and Complex-valued CNNs
  644. SML: A Backdoor Defense for Non-Intrusive Speech Quality Assessment via Semi-Supervised and Multi-Task Learning
  645. SNNPTrack: Spiking Neural Network Based Prompt for High-Accuracy RGBE Tracking
  646. SOLVE: Spatially Optimized Lung Volume Evidence Model for Efficient Nodule Malignancy Classification
  647. SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
  648. SPEA: Large-Scale Entity Alignment via Self-Partitioning
  649. SPEAK: Speech-Driven Pose and Emotion-Adjustable Talking Head Generation
  650. SPED: A Sight-singing Dataset for Performance Evaluation
  651. SPNet: Sparse-mask Prompt-learning Network for Cerebrovascular Segmentation
  652. SPRGAN: Streamlined Progressive Refinement for Adversarial Point Cloud Video Upsampling
  653. SPSinger: Multi-Singer Singing Voice Synthesis with Short Reference Prompt
  654. SPT: Sequence Prompt Transformer for Interactive Image Segmentation
  655. SPTU-Lite: An Efficient Auxiliary Diagnostic Approach Combining Spiking Neural Networks And Large Kernel Extractors For ECG Signals
  656. SS-BRPE: Self-Supervised Blind Room Parameter Estimation Using Attention Mechanisms
  657. SSAAD: A Multi-Scale Temporal-Frequency Graph Network for Binary Auditory Attention Detection with Self-Supervised Learning
  658. SSAST-Adapter: A Parameter-efficient Incremental Learning Algorithm for Underwater Acoustic Target Recognition
  659. SSC: 106 bit/s Ultra-low Bitrate Semantic Speech Coding
  660. SSCL-AMC: A Self-supervised Automatic Modulation Classification Method via Dynamic Augmentation and Ensemble Learning
  661. SSCM: Self-Supervised Critical Model for Reducing Hallucinations in Chinese Financial Text Generation
  662. SSDViT: Exploring Siamese and Self Distillation in ViTs for Generalizable Person Re-identification
  663. SSE: A Speaking Style Extractor Based on Fine-Grained Contrastive Learning between Speech and Descriptive Text
  664. SSFMamba: Spatial-Spectral Fusion State Space Model for Pansharpening
  665. SSFSL: Self-Supervised and Few-Shot Learning for Cross-Domain Hyperspectral Image Classification
  666. SSM2Mel: State Space Model to Reconstruct Mel Spectrogram from the EEG
  667. SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis
  668. SSRMamba: Efficient Visual State Space Model for Spectral Super-Resolution
  669. SSVEP-BiMA: Bifocal Masking Attention Leveraging Native and Symmetric-Antisymmetric Components for Robust SSVEP Decoding
  670. ST-HCSS: Deep Spatio-Temporal Hypergraph Convolutional Neural Network for Soft Sensing
  671. STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
  672. STAD: Joint Spatial-Temporal Dimension and Channel Correlation for Time Series Anomaly Detection
  673. STAR: A Spatial-Temporal Autoencoder for EEG Restoration in Emotion Recognition
  674. STE-Mamba: Automated Multimodal Depression Detection through Emotional Analysis and Spatio-Temporal Information Ensemble
  675. STFEnc: A Novel Deep Encoder for Brain-Computer Interface Based on Interpretable Brain Features
  676. STGE-Former: Spatial-Temporal Graph-Enhanced Transformer for EEG-Based Major Depressive Disorder Detection
  677. STR-Saliency: Decomposition-based Perturbations to Generate Saliency Maps for Temporal Black-box Model Interpretation
  678. SUFT: Sparse and Uncertain Fusion Transformers for Multi-Atlas Brain Network Analysis
  679. SUGAR: Leveraging Contextual Confidence for Smarter Retrieval
  680. SUVAD: Semantic Understanding Based Video Anomaly Detection Using MLLM
  681. SVRM: Composing Various Network Service Fuzzing Corpus with One Single Model
  682. SVTNet: Dual Branch of Swin Transformer and Vision Transformer for Monocular Depth Estimation
  683. SX-Stitch: An Efficient VMS-UNet Based Framework for Intraoperative Scoliosis X-Ray Image Stitching
  684. SYKI-SVC: Advancing Singing Voice Conversion with Post-Processing Innovations and an Open-Source Professional Testset
  685. Sagalee: an Open Source Automatic Speech Recognition Dataset for Oromo Language
  686. Salmon: A Suite for Acoustic Language Model Evaluation
  687. Same Semantics of the Signal - What Do We Cluster with what Representation
  688. Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation
  689. Sample-level Self-paced Learning to Tackle Multimodal Imbalance Problem
  690. Sampling Nonsmooth Log-Concave Densities: A Comparative Study of Primal-Dual Based Proposal Distributions
  691. ScalaLog: Scalable Log-Based Failure Diagnosis Using LLM
  692. Scalable Speech Enhancement With Dynamic Channel Pruning
  693. Scaling A Simple Approach to Zero-Shot Speech Recognition
  694. Scaling Bioacoustic Signal Pre-training with Million Samples Via Mask-Modeling
  695. Scaling Multilingual Visual Speech Recognition
  696. Schoenberg Kernel Loss for Spiking Neural Network Training
  697. Second-Order Wireless Federated Leaning via Nonparametric Hessian Estimation
  698. Secure Analog Beamforming Design for Wireless Communication Systems With Movable Antennas
  699. Security-Enhanced Data Transmission Scheme for IoT-Based Healthcare in Remote Areas
  700. See In Detail: Enhancing Sparse-view 3D Gaussian Splatting with Local Depth and Semantic Regularization
  701. Seek and Solve Reasoning for Table Question Answering
  702. Seg-diffusion: Text-to-Image Diffusion Model for Open-Vocabulary Semantic Segmentation
  703. SegAug: CTC-Aligned Segmented Augmentation For Robust RNN-Transducer Based Speech Recognition
  704. Segment Any Bone in CT with Partial Supervision
  705. Segment-Recurrent Transformer with Multi-Scale Fusion for Long-Term Time Series Forecasting
  706. Segmentation-Guided Sparse Transformer for Under-Display Camera Image Restoration
  707. Segue: Side-information Guided Generative Unlearnable Examples for Facial Privacy Protection in Real World
  708. SelaFD: Seamless Adaptation of Vision Transformer Fine-tuning for Radar-based Human Activity Recognition
  709. Selective Attention Merging for low resource tasks: A case study of Child ASR
  710. Selective Consistency Gradient Attack: Resolving Multi-Target Gradient Conflicts in Object Detection
  711. SelectiveFinetuning: Enhancing Transfer Learning In Sleep Staging Through Selective Domain Alignment
  712. Self-Convolutional Attention-Based Uncertainty-Aware Network for Single-Image Super-Resolution
  713. Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
  714. Self-Enhanced Reasoning Training: Activating Latent Reasoning in Small Models for Enhanced Reasoning Distillation
  715. Self-Geometry-Guided Direct Pose Regression Based on Dual Perspective Fusion for 2D-3D Cross Dimensional Spinal Surgery Navigation
  716. Self-Incremental Training for Personalized Voice Command Recognition in a Wireless Audio Sensor Network
  717. Self-Information Guided Speech Segmentation for Efficient Streaming ASR
  718. Self-Optimization Training for Weakly Supervised Image Manipulation Localization
  719. Self-Prompting Driven SAM2 for 3D Medical Image Segmentation
  720. Self-Prompting Polyp Segmentation in Colonoscopy Using Hybrid YOLO-SAM2 Model
  721. Self-Structure Enhance Network for Digital Molar Wax-up Design
  722. Self-Supervised Graph Representation Learning for In-The-Wild Wearable and Smartphone based Emotion Recognition
  723. Self-Supervised Image Harmonization via Holistic Feature Fusion
  724. Self-Supervised Learning and Image-Prompt Fusion for AIGC Image Quality Assessment
  725. Self-Supervised Learning for Detecting AI-Generated Faces as Anomalies
  726. Self-Supervised Learning-Based Multimodal Prediction on Prosocial Behavior Intentions
  727. Self-Supervised Localized Topology Consistency for Noise-Robust Hyperspectral Image Classification
  728. Self-Supervised Monocular Depth Estimation from Videos via Pose-Adaptive Reconstruction
  729. Self-Supervised Uncertainty-Guided Refinement for Robust Joint Optical Flow and Depth Estimation
  730. Self-Support Prototype-Aware For Few-Shot Semantic Segmentation
  731. Self-Trained Model for ECG Complex Delineation
  732. Self-Tuning Spectral Clustering for Speaker Diarization
  733. Self-supervised Contrastive Pre-training for Dry Electrode EEG Emotion Recognition via Cross Device Representation Consistency
  734. Self-supervised Hyperspectral and Multispectral Fusion via Deep Low-Rank Prior and Learnable Degradation Networks
  735. Self-supervised Learning for Acoustic Few-Shot Classification
  736. Self-supervised Multimodal Speech Representations for the Assessment of Schizophrenia Symptoms
  737. Self-supervised Prosody Learning at Phoneme-level with Momentum Contrast for Speech Synthesis
  738. Self-supervised Speaker Verification with Batch-scale Pseudo-labels Correction
  739. SelfDeblur with Sparsity Enforced Bregman Learning
  740. Semantic Attention and LLM-based Layout Guidance for Text-to-Image Generation
  741. Semantic Consistency And Integrity Network For Cloth-changing Person Re-identification
  742. Semantic Data Augmentation for Few-Shot Biomedical Named Entity Recognition
  743. Semantic Graph Embedded Energy Minimization Learning for Scene Graph Generation
  744. Semantic Hierarchical Prompt Tuning for Parameter-Efficient Fine-Tuning
  745. Semantic Prior-Guided Scalable Image Coding
  746. Semantic Residual for Multimodal Unified Discrete Representation
  747. Semantic to Structure: Learning Structural Representations for Infringement Detection
  748. Semantic-Aware Prompt Learning for Multimodal Sarcasm Detection
  749. Semantic-Guided Gaussian Splatting with Deferred Rendering
  750. Semantic-oriented Visual Prompt Learning for Class Incremental Learning
  751. Semantics-Guided Dynamic Hypergraph Network for Human Mobility Nowcasting in Disaster
  752. Semi-Automatic Labeling for Action Recognition by Diversity Preserving Sampling
  753. Semi-Supervised Cognitive State Classification from Speech with Multi-View Pseudo-Labeling
  754. Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval
  755. Semi-Supervised Knowledge Distillation Framework towards Lightweight Large Language Model for Spoken Language Translation
  756. Semi-Supervised Multilingual Alignment with Lexical Memory for Massively Parallel Text Mining
  757. Semi-Supervised Speaker Diarization Using Graph Transformers and LLMs on Naturalistic Apollo 11 Data
  758. Semi-VFL: Communication-efficient Few-label Vertical Federated Learning with Stacked Generalization and Model-level Consistency
  759. Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
  760. Semi-supervised Iterative Learning Network for Camouflaged Object Detection
  761. Semi-supervised Video Anomaly Detection With Compact Deformable 3D Convolution
  762. SemiGPS: GraphGPS-based Semi-supervised Graph Learning for Sector-Specific GDP Mapping
  763. Sensitivity of Room Impulse Responses in Changing Acoustic Environment
  764. SentiFormer: Metadata Enhanced Transformer for Image Sentiment Analysis
  765. Sentiment Analysis for Live Video Comments with Diffused Fusion of Cross-modal Representations
  766. SepMamba: State-Space Models for Speaker Separation Using Mamba
  767. SepNet: Deep Convolutional Neural Network for Specific Emitter Identification with High Accuracy
  768. Separate Estimation of Angular Velocity and Angle for Digital Array Radar
  769. Sequence Knowledge Enhancement Distillation Framework for Ultra-Fast Image Deraining
  770. Sequential Contrastive Audio-Visual Learning
  771. Sequential DOA Trajectory Estimation using Deep Complex Network and Residual Signals
  772. Sequential Decoding of Multiple Traces Over the Syndrome Trellis for Synchronization Errors
  773. Sequential Diffusion-Guided Deep Image Prior for Medical Image Reconstruction
  774. Sequential Posterior Sampling with Diffusion Models
  775. Serial Local Patterns and Irregular Dependencies Extract and Cascaded Fusion Network for Structural Crack Segmentation
  776. Shabdh: A multi lingual zero-shot voice cloning approach with speaker disentanglement
  777. Sharpness-Aware Minimization with Adaptive Regularization for Training Deep Neural Networks
  778. Shifting Spotlight for Co-supervision: A Simple yet Efficient Single-branch Network to See Through Camouflage
  779. Short-time quantum Fourier transform processing
  780. SiMBA-TS: Simplified Channel Mixing and Mamba for Long-term Time Series Forecasting
  781. SiQA: A Large Multi-Modal Question Answering Model for Structured Images Based on RAG
  782. SigmoidGS: To Guide Depth More Effectively
  783. Sign-Mamba: Advanced Mamba-Based Sign Language Generation
  784. Signal Processing Challenges in Automotive Radar
  785. Signaling Endothelial Reactivity Induced by Acute Hand Grip: Analyzing Vessel Diameter, Flow Velocity, and EMG Responses
  786. Similarity-based Accent Recognition with Continuous and Discrete Self-supervised Speech Representations
  787. Simple Adaptive Spectrum Graph Filters for Rumor Detection
  788. Simple Contrastive Learning with Knowledge Graphs for Story Generation
  789. Simplified Augmented Real-Valued Time-Delay Neural Network for Digital Predistortion
  790. Simplified one-sided Image-to-Image Translation with Reconstruction-Constrained Generative Adversarial Networks
  791. SimulTron: On-Device Simultaneous Speech to Speech Translation
  792. Simultaneous Diarization and Separation of Meetings through the Integration of Statistical Mixture Models
  793. Simultaneous Music Separation and Generation Using Multi-Track Latent Diffusion Models
  794. Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features
  795. Single Snapshot Direction of Arrival Estimation Using the EP-SURE-SBL Algorithm
  796. Single Trial Reaction Time Prediction Using Optimal Synchrony Window Detection
  797. Single-Channel Distance-Based Source Separation for Mobile GPU in Outdoor and Indoor Environments
  798. Single-Loop Variance-Reduced Stochastic Algorithm for Nonconvex-Concave Minimax Optimization
  799. Single-View Clothed Human Reconstruction using Symmetric Feature
  800. Single-View Reconstruction via Decoupled 3D Gaussian Splatting
  801. Single-stage TTS with Masked Audio Token Modeling and Semantic Knowledge Distillation
  802. Situation-aware Space-time Waveform Design for Automotive MIMO Radars
  803. Situational Awareness Based Resource Allocation for Multi-Target Tracking in Distributed Radar Network
  804. SkeletonMix: A Mixup-Based Data Augmentation Framework for Skeleton-Based Action Recognition
  805. Sketch-based Point Cloud Generation with Diffusion Model and Pre-training Enhancement
  806. Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
  807. SlimSpeech: Lightweight and Efficient Text-to-Speech with Slim Rectified Flow
  808. SlotFusion: Object-Centric Audiovisual Feature Fusion with Slot Attention for Remote Sensing Scene Recognition
  809. Slungt: Even Faster Spoken Language Understanding with N-Grams and Tries
  810. Small Target Insect Detection Based on Improved YOLOv8n
  811. SmartExp: An Adaptive Data Expansion Strategy for Improving Handwritten Text Recognition
  812. SmartNet: One-shot Talking Head Synthesis via Subtle Motion and Appearance Compensation
  813. Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance
  814. Smr-Awarenet: An Adaptive Smr-Aware Neural Network for EEG Auditory Attention Guided Target Speech Extraction
  815. So Far Yet So Near: Time Series Data Augmentation with Exploring non-Semantic Boundaries based on Reinforcement Learning
  816. SoCov: Semi-Orthogonal Parametric Pooling of Covariance Matrix for Speaker Recognition
  817. SocialRecNet: A Multimodal LLM-Based Framework for Assessing Social Reciprocity in Autism Spectrum Disorder
  818. Sociologically-Informed Graph Neural Network for Opinion Prediction
  819. Soft Augmentation for Graph Classification
  820. Soft Knowledge Distillation with Multi-Dimensional Cross-Net Attention for Image Restoration Models Compression
  821. SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
  822. Some Intriguing Observations on the Learnt Matrices in Deep Unfolded Networks
  823. Sound Source Distance Estimation Utilizing Physics-informed Prior for Sound Event Localization and Detection
  824. Sound Zone Control Robust To Sound Speed Change
  825. Sound-Based Recognition of Touch Gestures and Emotions for Enhanced Human-Robot Interaction
  826. Sound-VECaps: Improving Audio Generation with Visually Enhanced Captions
  827. SoundBeam meets M2D: Target Sound Extraction with Audio Foundation Model
  828. SoundCollage: Automated Discovery of New Classes in Audio Datasets
  829. SoundTRC: DNN-based Acoustic Target Region Control
  830. Source-Aware Spatial Self-Supervision for Sound Event Localization and Detection
  831. Source-free Domain Adaptation with Multiple Alignment for Efficient Image Retrieval
  832. Span Attention for Entity-Consistent Task-Oriented Dialogue Response Generation
  833. Sparse Bayesian Integrated CNN Framework for Enhanced Acoustic Source Localization
  834. Sparse Bayesian Network for Fast Micro-Doppler Analysis
  835. Sparse Generation: Making Pseudo Labels Sparse for Point Weakly Supervised Object Detection on Low Data Volume
  836. Sparse PCA with Oracle Rate in High Dimensions
  837. Sparse-VQ Transformer: An FFN-Free Framework with Vector Quantization for Enhanced Time Series
  838. Sparse-View X-ray 3D Reconstruction using Hybrid Representation Neural Attenuation Fields
  839. Sparse-to-Dense Body Surface Potential Mapping using A Structural Similarity-Enhanced Attention GAN
  840. Spatial Annotation-free Training for Sound Event Localization and Detection
  841. Spatial Frequency Interleaving Residual Autoencoder for Indoor Radio Map Reconstruction
  842. Spatial Frequency-Aware Self-Distillation for Weakly-Supervised Semantic Segmentation
  843. Spatial-Frequency Cross-Domain Mutual Guidance for Visible-Infrared Image Fusion
  844. Spatial-Frequency Information Interaction Diffusion for SAR Colorization
  845. Spatial-Temporal Perception with Causal Inference for Naturalistic Driving Action Recognition
  846. Spatial-Temporal Reconstruction Error for AIGC-based Forgery Image Detection
  847. Spatially-Aware Cross-Modal Contrastive Learning for Low-Shot HSI Classification
  848. Spatially-variant Blur Degradation Model Based on Depth Estimation
  849. Spatio-Semantic Prompt guided Adaptive Segment Anything for Remote Sensing Change Detection
  850. Spatio-Temporal Mapping Generative Adversarial Network for Functional Connectivity Network Reconstruction across Brain Atlases
  851. Spatio-Temporal Mixed Graph Neural Controlled Differential Equations with Adaptive Connection Sampling for Irregular Multivariate Time Series Anomaly Detection
  852. Spatio-Temporal Multi-Subgraph GCN for 3D Human Motion Prediction
  853. Spatiotemporal Causal Decoupling Model for Air Quality Forecasting
  854. Spatiotemporal-Aware Visual Captioning using Vision-Language Pre-Training Model
  855. Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings
  856. Speaker-IPL: Unsupervised Learning of Speaker Characteristics with i-Vector based Pseudo-Labels
  857. Speaking Without Sound: Multi-speaker Silent Speech Voicing with Facial Inputs Only
  858. Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation
  859. SpecViT: A Custom Vision-Transformer based Approach for Audio Deepfake Detection
  860. SpecWav-Attack: Leveraging Spectrogram Resizing and Wav2Vec 2.0 for Attacking Anonymized Speech
  861. Spectral Enhancement and Pseudo-Anchor Guidance for Infrared-Visible Person Re-Identification
  862. Spectral Low-Rank Attention with Flow-Based Refinement for Spectral Reconstruction
  863. Spectral-Aware Low-Rank Adaptation for Speaker Verification
  864. Spectral-Temporal Fusion Representation for Person-in-Bed Detection
  865. SpectralCam: High-Resolution Low-Cost Spectral Imaging Using DSLR Cameras
  866. Spectrum Blind Unlimited Sampling of Multi-Band Signals
  867. Speech Data Selection for Efficient ASR Fine-Tuning using Domain Classifier and Pseudo-Label Filtering
  868. Speech Emotion Recognition Based on Large-Scale Automatic Speech Recognizer
  869. Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
  870. Speech Enhancement with MAP-based Training for Robust ASR
  871. Speech Enhancement with Overlapped-Frame Information Fusion and Causal Self-Attention
  872. Speech Few-Shot Learning for Language Learners' Speech Recognition
  873. Speech Re-Painting for Robust ASR
  874. Speech Recognition Rescoring with Large Speech-Text Foundation Models
  875. Speech Recognition for Automatically Assessing Afrikaans and isiXhosa Preschool Oral Narratives
  876. Speech Recognition with LLMs Adapted to Disordered Speech Using Reinforcement Learning
  877. Speech Retrieval-Augmented Generation without Automatic Speech Recognition
  878. Speech Separation Based on Pre-trained Model and Deep Modularization
  879. Speech Separation for Low-Resource Languages
  880. Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
  881. Speech Synthesis along Perceptual Voice Quality Dimensions
  882. Speech-N-LlaMA: Improving Speech LLMs with Multi-Pass Training
  883. Speech2rtMRI: Speech-Guided Diffusion Model for Real-time MRI Video of the Vocal Tract during Speech
  884. SpeechCaps: Advancing Instruction-Based Universal Speech Models with Multi-Talker Speaking Style Captioning
  885. SpeechTaxi: On Multilingual Semantic Speech Classification
  886. Spherical Sector Harmonics Based Acoustic Source Localization Using Circular Array
  887. Spiking Generative Models Based on Variational Autoencoder and Adversarial Training
  888. Spiking Transformer with Spatial-Temporal Spiking Self-Attention
  889. SpikingPoint: Rethinking Point as Spike for Efficient 3D Point Cloud Analysis
  890. Spy Inside: Scalable Verification of Dependable Transformers for Event Time Series Systems
  891. Stable Audio Open
  892. Stable Control Visual AutoRegressive Model: Precise and Efficient Image Generation via Scale Alignment
  893. Stable Extended U-Net for Noise-Robust Speaker Verification
  894. Stable Reduced-Rank VAR Estimators in Closed Forms
  895. Stable Test-Time Training for Semantic Segmentation with Output Contrastive Loss
  896. Stable and Lightweight Deep Primal-Dual Unrolling for Constrained Image Restoration with Convolutional Sparse Coding
  897. Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
  898. StableQuant: Layer Adaptive Post-Training Quantization for Speech Foundation Models
  899. Stacking U-Nets in U-shape: Redesigning the Information Flow in Model-based Networks for MRI Reconstruction
  900. Stance Detection for Social Text: Inference-Enhanced Multi-Task Learning with Machine-Annotated Supervision
  901. Standard-essential Patent Prediction: Discussion of Patent Standardization Time
  902. Standardization Status of MPEG Video-based Dynamic Mesh Coding (V-DMC)
  903. Star Operation in Self-Attention for 3D Human Pose Estimation
  904. State-Augmented Opportunistic Routing in Wireless Communication Systems with Graph Neural Networks
  905. Stealthy Backdoor Attack against Video Recognition Models
  906. Steerable Differential Polynomial Beamforming
  907. Steering Large Language Models for Vulnerability Detection
  908. Step-by-Step Correction of LLM-based Math Word Problems Solutions
  909. Stereo Downmix in 3GPP IVAS for EVS Compatibility
  910. StereoMamba: Enhancing Stereo Image Super-Resolution with Structured State Space Models and Bi-Directional Cross Attention
  911. Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance
  912. Stochastic Vector Approximate Message Passing with Applications to Phase Retrieval
  913. Stochastic-Aware Mamba Diffusion for Pedestrian Trajectory Prediction
  914. Stream-TTS: A Low-Latency Text-to-Speech using Kolmogorov-Arnold Networks for Streaming Speech Applications
  915. Streaming Keyword Spotting Boosted by Cross-layer Discrimination Consistency
  916. Streamlining UNO: A Generalized Sampling Approach to Optimal One-Bit Modulo Sensing
  917. Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
  918. StrucFormer: Structural Prior Guided Transformer for Mobile Crowdsensing Data Inference
  919. Structural Similarity-Aware Cross-domain Transformer for Improved Seismic Fault Detection
  920. Structural-Aware Disentangled Learning with CLIP for Hyperbolic Zero-Shot Sketch-Based Image Retrieval
  921. Structure-Preserving Video Hashing via Self-Supervised Transformer for Retrieval
  922. Structured Random Model for Fast and Robust Phase Retrieval
  923. Sub-band Domain Multi-Hypothesis Acoustic Echo Canceler Based Acoustic Scene Analysis
  924. Subdomain Uncertainty Optimization for Cross-Speed Fault Diagnosis
  925. Subject Representation Learning from EEG using Graph Convolutional Variational Autoencoders
  926. Subjective Fidelity Assessment of Audio- and Video-Driven Talking Head Generation Methods
  927. Subjective Quality Evaluation of Point Clouds Using a Head-Mounted Display
  928. Subjective Voice Quality of the IVAS Codec
  929. Subpart Suppression Network for Few-Shot Object Counting
  930. Subsampling Decomposition based k-Space Refinement for Accelerated MRI Reconstruction
  931. Subset Adaptive Importance Sampling for Multi-Failure-Region Estimation
  932. Subspace-Based Range-Angle Tracking for Coherent FDA Radar
  933. Subtractive Training for Music Stem Insertion Using Latent Diffusion Models
  934. Successive Interference Cancellation-aided Diffusion Models for Joint Channel Estimation and Data Detection in Low Rank Channel Scenarios
  935. Sufficient Learning for Label Noise with Dual-Regularization
  936. Super Capacity SRS Design for 5G and beyond using Channel In-painting
  937. SuperPromptSeg: A Novel Fine-Tuning-Free Segmentation Method Leveraging Superpixel-Based Point Prompts
  938. Superpoints Guided Local Explanation For Deep 3D Trackers
  939. Supervised Dimension Reduction Through Linear Projection
  940. Supervisor Alignment Framework: Enhancing LLM Alignment with Query-Ignoring Strategy and Multi-Agent Interaction
  941. Support Recovery in 1-Bit Compressed Sensing with Burst Sparse Noise
  942. Surface Defect Detection Algorithm for Strip Alloy Material Based on Improved YOLOv8
  943. SwapTalk: Audio-Driven Talking Face Generation with One-Shot Customization in Latent Space
  944. Swin-VasMamba: A Topologically Constrained Model For 3D Vascular Segmentation
  945. SwinGAN-AVSS: Audio-Visual Speech Synthesis Leveraging Swin Transformer-Enhanced Generative Adversarial Networks
  946. SymGaussian: Occluded Human Rendering with Multi-scale Symmetry Feature from Monocular Video
  947. Symbol-Level Precoding-Based Self-Interference Cancellation for ISAC Systems
  948. Symmetric Bi-branch Modality-search Aggregation Network for Multi-modal Liver Segmentation
  949. Symmetry and Fusion Data Augmentation for Semi-Supervised Medical Segmentation
  950. Synergistic Integration of Cross-Spatial Learning for Lightweight Crack Detection
  951. Synergistic Spotting and Recognition of Micro-Expression via Temporal State Transition
  952. Synthesizing Efficient Trajectory-Controllable Co-Speech Gesture with Latent Consistency Model
  953. Synthetic Dataset Generation for String Ensemble Separation
  954. TA-V2A: Textually Assisted Video-to-Audio Generation
  955. TAGMO: Temporal Control Audio Generation for Multiple Visual Objects Without Training
  956. TAME: Temporal Audio-based Mamba for Enhanced Drone Trajectory Estimation and Classification
  957. TAPO: Task-Referenced Adaptation for Prompt Optimization
  958. TCTformer: Long-term forecasting with dual attention transformers
  959. TD-GS: Few-shot Object View Synthesis via Task-Disentangled 3D Gaussian Splatting
  960. TD-RD: A Top-Down Benchmark with Real-Time Framework for Road Damage Detection
  961. TDMER: A Task-Driven Method for Multimodal Emotion Recognition
  962. TDMF: Text-Guided Denoising and Interactive Medical Image Fusion
  963. TDOA Localization via Fixed-Point Iteration
  964. TELL ME: Tackle Electrocardiogram with Large Language Model Effectively
  965. TFS: Revisiting Temporal Language Grounding from Frequency Spiking Perspective
  966. TGCA: A Transformer GNN-based Approach with Cross-Attention Mechanism for Steganographic Text Detection in Social Networks
  967. TGDrag: Adding Semantic Control into Point-based Image Editing via Text Guidance
  968. TIDE-Net: A Physics-Based Graph Model for Predicting Tropical Cyclone Impacts on Estuarine Systems
  969. TIRPL: Tailored-Made Inverse Rendering for Point-Light Scenes
  970. TKA-MIL: Top-K Attention Multiple Instance Learning for Whole Slide Image Classification and Instance Probability Derivation
  971. TMANet: Triple Multi-Scale Attention based Network with Boundary Association Loss for Superpixel Segmentation
  972. TRACE: A Robust Framework for Malicious Traffic Detection with Noisy Labels
  973. TROI: Cross-Subject Pretraining with Sparse Voxel Selection for Enhanced fMRI Visual Decoding
  974. TS-Net: Assembling Task-specific Features from Multiple Feature Levels for Multi-task Learning
  975. TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models
  976. TSCheater: Generating High-Quality Tibetan Adversarial Texts via Visual Similarity
  977. TSIformer: Multi-Scale Dilation Transformer with Cross-variable and Cross-feature Dependency for Time Series Imputation
  978. TSLA: A Multi-Task Time Series Language Model
  979. TSP: Task-Specific Pruning for Personalized Image Classification on Edge Devices
  980. TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
  981. Tag-Aware Weakly-Supervised Online Hashing with Enhanced Joint Representation
  982. Take Attention Inside: Neighbor Pair Graph Contrastive Learning
  983. TalTech Systems for the PROCESS Signal Processing Grand Challenge
  984. Target Localization With a Coprime Multistatic MIMO Radar via Coupled Canonical Polyadic Decomposition Based on Joint EVD
  985. Target Speaker ASR with Whisper
  986. Target parameter estimation using the Capon method in a MIMO OFDM DFRC system
  987. Target word activity detector: An approach to obtain ASR word boundaries without lexicon
  988. Targeted Data Poisoning for Black-Box Audio Datasets Ownership Verification
  989. Targeted Password Guessing Using Neural Language Models
  990. Task Vector Arithmetic for Low-Resource ASR
  991. Task-Aware Unified Source Separation
  992. TeXBLEU: Automatic Metric for Evaluate LaTeX Format
  993. Teaching Others Teaches Yourself: Semi-supervised Ensembled Pseudo-labeling Method for Image Classification
  994. Temporal Dynamics Decoupling with Inverse Processing for Enhancing Human Motion Prediction
  995. Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition
  996. Temporally Aligned Audio for Video with Autoregression
  997. Tessellated Linear Model for Age Prediction from Voice
  998. Test Time Prompt Tuning for Domain Adaptive Gaze Estimation
  999. Test-time Alignment-Enhanced Adapter for Vision-Language Models
  1000. Text Descriptions of Actions and Objects Improve Action Anticipation

Looking for submission deadlines instead? See the conference deadline calendar.