← All conferences

ICASSP 2025 Accepted Papers

The full list of 3,298 papers accepted at ICASSP 2025 (IEEE International Conference on Acoustics, Speech and Signal Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

  1. Text Enhancement Network for Complex Multi-line Scene Text Image Super-resolution
  2. Text-Aware Adapter for Few-Shot Keyword Spotting
  3. Text-Guided Editable 3D City Scene Generation
  4. Text-Guided Few-Shot Semantic Segmentation with Training-Free Multimodal Feature Matching
  5. Text-Infused Audio-Visual Video Parsing with Semantic-Aware Multimodal Contrastive Learning
  6. Text-dependent Speaker Verification Challenge 2024: Exploring Shared and User-defined Passphrases
  7. Text-guided Device-realistic Sound Generation for Fiber-based Sound Event Classification
  8. Text-guided Multimodal Fusion for the Multimodal Emotion and Intent Joint Understanding
  9. Text2FX: Harnessing CLAP Embeddings for Text-Guided Audio Effects
  10. TextHair3D: Text-driven 3D Hair Editing with Generative Priors
  11. Textless Streaming Speech-to-Speech Translation using Semantic Speech Tokens
  12. Textual and Visual Prompt Fusion for Image Editing via Step-Wise Alignment
  13. TextureDiffusion: Target Prompt Disentangled Editing for Various Texture Transfer
  14. The CDC Problem: Distributed Spatial Sampling and Detection of Poisson Processes
  15. The Conformer Encoder May Reverse the Time Dimension
  16. The Evolution of System on Chip Integrated Circuits for Hearing-Aid Signal Processing
  17. The First Indoor Pathloss Radio Map Prediction Challenge
  18. The First VoicePrivacy Attacker Challenge
  19. The Impact of Decorrelation on Transformer Interpretation Methods: Applications to Clinical Speech AI
  20. The Impact of Deployment Height on the Mean Delay in Large UAV Networks
  21. The Importance of Spatial and Spectral Information in Multiple Speaker Tracking
  22. The Missing Piece in Model Editing: A Deep Dive into the Hidden Damage Brought By Model Editing
  23. The Misspecified Cramér-Rao Bound for DOA Estimation with One-Bit Quantized Data
  24. The Potential of Speech Features to Discriminate between Original and Machine-Translated Texts
  25. The Sound of Language: A Bilingual Analysis of Voice Conversion and Text-to-Speech Synthesis
  26. The Sound of Water: Inferring Physical Properties from Pouring Liquids
  27. The USTC System for EEG-Music Emotion Recognition Challenge
  28. TheSHY-3D: Texture and Structure HarmonY for Multi-View 3D Object Detection
  29. ThicknessVAE: Learning a Lateral Prior for Clothed Human Body Reconstruction
  30. Threshold Sensitivity in Two-Channel Modulo ADCs: Analysis and Robust Reconstruction
  31. Through-the-Wall Multi-Person Localization using Translation and Rotation Synthetic Aperture Radar
  32. Time-Frequency Based Feature Extraction For Automated Classification Of Bed Occupancy Using Accelerometer Data
  33. Time-Graph Frequency Representation with Singular Value Decomposition for Neural Speech Enhancement
  34. Time-Space-Interlaced Spatiotemporal Graph Forecasting via Two-Stage Summarized Attention
  35. Time-domain Beamforming for Room Acoustics Analysis based on Reverberant Field Estimation
  36. Time-independent Spiking Neuron via Membrane Potential Estimation for Efficient Spiking Neural Networks
  37. Time-varying EEG Signal Reconstruction Based on Local Graph Signal Smoothness
  38. TimeRAG: Boosting LLM Time Series Forecasting via Retrieval-Augmented Generation
  39. Tip the Scales: Achieving Balance in Adversarial Examples Across Modalities
  40. To Learn Better Character Embeddings in Generative Models for Password Attack
  41. Token-Level Contextual Network with Ladder-Shaped Attention for End-to-End ASR
  42. TokenSynth: A Token-based Neural Synthesizer for Instrument Cloning and Text-to-Instrument
  43. Tool Playgrounds: A Comprehensive and Analyzable Benchmark for LLM Tool Invocation
  44. ToolFiVe: Enhancing Tool-Augmented LLMs via Tool Filtering and Verification
  45. TopoRefine: Iterative Refinement with Reasoning Topology as High-Level Feedback
  46. Topological Scattering over Product Cell Complexes
  47. Topology Decoupled All-reduce Algorithm
  48. Topology-Informed Pre-training of Graph Neural Networks
  49. Toward Comprehensive Semantic Prompt for Region Contrastive Learning Underwater Image Enhancement
  50. Toward Forward-Secure End-to-End Data Sharing: An Attribute-Key-Free CP-ABE Scheme
  51. Toward Robust Early Detection of Alzheimer's Disease via an Integrated Multimodal Learning Approach
  52. Toward Visual Pronunciation Learning: A Speech-to-Articulatory Animation Pipeline Leveraging wav2vec 2.0 and rtMRI Landmarks
  53. Toward Zero-Shot Speech Emotion Recognition Using LLMs in the Absence of Target Data
  54. Toward noise-robust whisper keyword spotting on headphones with in-earcup microphone and curriculum learning
  55. Towards A Distribution Alignment Framework for Incomplete Data Classification
  56. Towards Adversarial Robustness And Backdoor Mitigation in SSL
  57. Towards An Integrated Approach for Expressive Piano Performance Synthesis from Music Scores
  58. Towards Automatic Assessment of Self-Supervised Speech Models using Rank
  59. Towards Bringing Parity in Pretraining Datasets for Low-resource Indian Languages
  60. Towards Clinically Feasible Nonintrusive Quality and Intelligibility Indices for Hearing Aids
  61. Towards Context-aware EEG-based Emotion Recognition Models: Personality and Emotional Intelligence as Context
  62. Towards Detecting Auditory Attention from in-Ear Muscle Contractions using Commodity Earbuds
  63. Towards Detecting LLMs Hallucination via Markov Chain-based Multi-agent Debate Framework
  64. Towards Differential Optimization: Rehearsal-Free Class-Incremental Learning with Slow Learners and Fast Adapters
  65. Towards Dynamic Neural Communication and Speech Neuroprosthesis Based on Viseme Decoding
  66. Towards Dynamic Skeleton-based Handshape Subunits for Sign Language Assessment
  67. Towards Efficient Deep Hashing Retrieval: Condensing Your Data via Feature-Embedding Matching
  68. Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction
  69. Towards Feature-Consistent Parameter Collaboration for Personalized Federated Learning
  70. Towards Fully Test-Time Adaptation via Variance Balancing and Semantic Augmentation
  71. Towards Green VAE: A Light Pixel-weighting Technique to Enhance Variational AutoEncoder
  72. Towards HRTF Personalization using Denoising Diffusion Models
  73. Towards Interactive Deepfake Analysis
  74. Towards Maximizing Semantic Coverage for Image-Text Retrieval
  75. Towards Patronizing and Condescending Language in Chinese Videos: A Multimodal Dataset and Detector
  76. Towards Personalized Federated Learning via Contrastive-Augmented Local Memorization Retrieval
  77. Towards Precision Characterization of Communication Disorders using Models of Perceived Pragmatic Similarity
  78. Towards Robust Category-level Articulation Pose Estimation via Integrated Differentiable Rendering
  79. Towards Robust Subject Identification From EEG Segments With Data Augmentation Techniques
  80. Towards Sub-millisecond Latency Real-Time Speech Enhancement Models on Hearables
  81. Towards Time-Frequency Deformation Stability Bounds for Deep Convolutional Neural Networks
  82. Towards Unbiased Evaluation of Time-series Anomaly Detector
  83. Towards Zero-shot Cross-lingual SLU with Syntax-aware Multi-view Contrastive Learning
  84. Towards a Single ASR Model That Generalizes to Disordered Speech
  85. Track-MDP: Reinforcement Learning for Target Tracking with Controlled Sensing
  86. TrackFusion: Enhancing Multi-Object Tracking With Temporal Trajectory Modeling and Frame-Integrated Detection
  87. TrackNetV4: Enhancing Fast Sports Object Tracking with Motion Attention Maps
  88. Tracking Network Dynamics using Probabilistic State-Space Models
  89. Tracking Time-Varying Parameters in Massive MIMO IoT Networks: A Linear Coherent Decentralized Approach
  90. Trainable Adaptive Score Normalization for Automatic Speaker Verification
  91. Training Better Embedding With Perturbed Data Augmentation for Automatic Singing Quality Assessment
  92. Training Dialogue Systems by AI Feedback for Improving Overall Dialogue Impression
  93. Training an Anti-KD Model that Cannot Teach Students via Similarity Disruption
  94. Training-Free Point Cloud Recognition Based on Geometric and Semantic Information Fusion
  95. Training-Free Task Planning by Parsing Language Signals With Common Sense
  96. Training-free Adapter for Multi-Modal Image Matching for All-Day Visual Place Recognition
  97. Trainingless Adaptation of Pretrained Models for Environmental Sound Classification
  98. TransPathNet: A Novel Two-Stage Framework for Indoor Radio Map Prediction
  99. TransVDM: Motion-Constrained Video Diffusion Model for Transparent Video Synthesis
  100. Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition
  101. Transducer-Llama: Integrating LLMs into Streamable Transducer-based Speech Recognition
  102. Transfer Learning for Covert Speech Classification Using EEG Hilbert Envelope and Temporal Fine Structure
  103. Transfer Learning via Functional Balancing in Reproducing Kernel Hilbert Spaces
  104. Transfer Learning with Transformer and LSTM for Digital Pre-distortion of Terahertz/mmWave Transceiver
  105. Transfer Risk Map: Mitigating Pixel-level Negative Transfer in Medical Segmentation
  106. Transferable Selective Virtual Sensing Active Noise Control Technique Based on Metric Learning
  107. Transformer Based Multi-view Learning for Integrating Static and Dynamic Complementarity of Brain Function
  108. Transformer-Based Contrastive Meta-Learning For Low-Resource Generalizable Activity Recognition
  109. Transformer-Enhanced Iterative Feedback Mechanism For Polyp Segmentation
  110. Transforming Classification with Federated Learning on Blockchain: A Unique Model Integration Approach
  111. Transitive Inference in Large Language Models and Prompting Intervention
  112. Translating Mental Imaginations into Characters with Codebooks and Dynamics-Enhanced Decoding
  113. Translational Generative Retrieval via Potential Query Generation
  114. TriDE-Net: Triple-Densely Extraction Network for Precise Skin Lesion Segmentation
  115. TriFP-NGram: Integrating Three Complementary Fingerprint and N-Gram Features for Enhanced Drug-Target Affinity Prediction
  116. TriFormer: Triple Branch Heterogeneous Transformers for UHD Image Restoration
  117. Tribe Graph Enhanced Bidirectional Mamba for Multivariate Time Series Forecasting
  118. Trick-GS: A Balanced Bag of Tricks for Efficient Gaussian Splatting
  119. Trimformer: A Novel Sequence Compression Mechanism with Local Attention
  120. Triple Path Enhanced Neural Architecture Search for Multimodal Fake News Detection
  121. Triplet Synthesis for Enhancing Composed Image Retrieval via Counterfactual Image Generation
  122. Trusted Mamba Contrastive Network for Multi-View Clustering
  123. Trustworthy Recommendation for Consumer Electronics Using Hypernetworks
  124. Try Before You Buy: Solving Multi-Model Complex Tasks by Model Competitions
  125. Twenty-Five Years of MIR Research: Achievements, Practices, Evaluations, and Future Challenges
  126. Two Heads Are Better Than One: Averaging along Fine-Tuning to Improve Targeted Transferability
  127. Two-Dimensional Unknown View Tomography from Unknown Angle Distributions
  128. Two-Stream Spiking Neural Network for Event-based Action Recognition
  129. Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer
  130. Two-stream Semantic Alignment Networks for Multi-label Image Classification
  131. Typical vs. Atypical Disfluency Classification: Introducing the IIITH-TISA Corpus and Temporal Context-Based Feature Representations
  132. U-SAM: Upgrade Segment Anything Model With Semantic-Aware and Memory-Efficient
  133. U2AD: A UAV-Assisted Autonomous Driving Framework for Enhancing Vehicle Risk Perception and Decision-Making Capabilities
  134. UAV-Mounted SIM: A Hybrid Optical-Electronic Neural Network for DoA Estimation
  135. UCIL: An Unsupervised Class Incremental Learning Approach for Sound Event Detection
  136. UIDAPLE: Unsupervised Incremental Domain Adaptation through Adaptive Prompt Learning
  137. UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition
  138. UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts
  139. UML: A Unified Multimodal Learning Framework for Cataract Postoperative Visual Acuity Prediction with Uncertain Missing Modalities
  140. UMSSS: A Visual Scene Semantic Segmentation Dataset for Underground Mines
  141. UPCS: Unbiased Persona Construction for Dialogue Generation
  142. USD: Unsupervised Soft Contrastive Learning for Fault Detection in Multivariate Time Series
  143. USV-AUV Collaboration Framework for Underwater Tasks under Extreme Sea Conditions
  144. UV-Mamba: A DCN-Enhanced State Space Model for Urban Village Boundary Identification in High-Resolution Remote Sensing Images
  145. Ultra Lightweight Singing Melody Extraction via Combination of Convolution and MLP
  146. Ultra low-compute complex spectral masking for multichannel speech enhancement
  147. Ultra-Low Latency Speech Enhancement -A Comprehensive Study
  148. Ultrasound-Guided Registration Pseudo-Labels for Semi-Supervised Brachial Plexus Segmentation
  149. Unbalanced Co-relational Optimal Transport for Robust Heterogeneous Data Alignment
  150. Unbiased Multimodal Audio-to-Intent Recognition
  151. Uncertainty Estimation for Out-of-Distribution Detection of Whole Slide Images
  152. Uncertainty prediction for prominence classification with chroma features
  153. Uncertainty-Aware Crime Prediction With Spatial Temporal Multivariate Graph Neural Networks
  154. Uncertainty-Aware Dynamic Fusion for Multimodal Clinical Prediction Tasks
  155. Uncertainty-Aware Robust Learning on Noisy Graphs
  156. Uncertainty-Participation Context Consistency Learning for Semi-supervised Semantic Segmentation
  157. Uncertainty-aware Correspondence Distillation for Deep Image Clustering
  158. Uncertainty-aware Masked Modeling in Medical Imaging
  159. Uncovering the Visual Contribution in Audio-Visual Speech Recognition
  160. Under-Counted Matrix Completion Without Detection Features
  161. Understanding Neural Networks in Profiled Side-Channel Analysis
  162. Underwater Image Restoration via Polymorphic Large Kernel CNNs
  163. UniFaceGAN: High-Quality 3D Face Editing With a Unified Latent Space
  164. UniIVFT: Towards a Unified Framework for Infrared-Visible Fusion and Translation
  165. UniPlane: Unified Plane Detection and Reconstruction from Posed Monocular Videos
  166. Unified Arbitrary-Time Video Frame Interpolation and Prediction
  167. Unified Audio Event Detection
  168. Unified Graph and Hypergraph Neural Network for Next-item Recommendation
  169. Uniform Convergence of Lipschitz Functions with Dependent Gaussian Samples
  170. Uniform Distribution Based Learnable Quantization via Self-Knowledge Distillation
  171. Unifying Within and Across: Intra-Modality Multi-View Fusion and Inter-Modality Alignment for Knowledge Graph Completion
  172. Universal Low-Resource Speech Synthesis Via Phoneme Fusion Coordinating Low-Rank Decomposition
  173. Universal Training of Neural Networks to Achieve Bayes Optimal Classification Accuracy
  174. Unleashing Potential of Evidence in Knowledge-Intensive Dialogue Generation
  175. Unlocking Financial Statement Fraud Detection: Tracking Disclosure Changes via Representation Learning
  176. Unrolled Generative Compound Gaussian Network for Computer Tomography
  177. Unsupervised Domain Adaptation Via Data Pruning
  178. Unsupervised Domain Adaptation for Music Transcription: Exploiting Cross-Version Consistency
  179. Unsupervised Hierarchical Dynamic Similarity Hashing for Multimedia Retrieval
  180. Unsupervised Image-to-Image Style Transfer via Dual-Condition Diffusion Models*
  181. Unsupervised Learning for Gain-Phase Impairment Calibration in ISAC Systems
  182. Unsupervised Motion-Robust Self-Distillation Framework for Remote Physiological Measurement
  183. Unsupervised Multi-View Outlier Detection via Optimal Graph Filtering
  184. Unsupervised Search for Ethnic Minorities' Medical Segmentation Training Set
  185. Unsupervised UAV 3D Trajectories Estimation with Sparse Point Clouds
  186. Unsupervised Word Discovery: Boundary Detection with Clustering vs. Dynamic Programming
  187. Unveiling Deepfakes with Latent Diffusion Counterfactual Explanations
  188. Unveiling Local Well-posedness Influence for Cross-modal Person Re-Identification
  189. Unveiling Performance Bias in ASR Systems: A Study on Gender, Age, Accent, and More
  190. Unveiling the Pruning Risks on Privacy Vulnerabilities of Deep Neural Networks
  191. Username-Password Models Beyond Traditional Password Guessability Assessment
  192. Using Corrected ASR Projection to Improve AD Recognition Performance from Spontaneous Speech
  193. Using Depth-Enhanced Spatial Transformation for Student Gaze Target Estimation in Dual-View Classroom Images
  194. Using Ear-EEG to Decode Auditory Attention in Multiple-speaker Environment
  195. Using Emotionally Rich Speech Segments for Depression Prediction
  196. Using RLHF to align speech enhancement approaches to mean-opinion quality scores
  197. Utterance as A Bridge: Few-shot Joint Learning of Empathy Detection and Empathy Intent Classification
  198. V-Fusion: 2D Detection-enhanced Multimodal 3D BEV Object Detection
  199. V-Phanton: Voltage-Based Physically-Triggered Backdoor Attack Against Facial Recognition
  200. V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
  201. VAGeo: View-specific Attention for Cross-View Object Geo-Localization
  202. VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
  203. VCSA: Video Copy Localization Via Single Frame Annotation
  204. VITRO: Vocabulary Inversion for Time-series Representation Optimization
  205. VLIMNet: A Visible Light And Infrared Image Matching Network Based On Segment Anything Model And SuperPoint
  206. VN-GT: Optimizing Virtual Network Deployment via Game Theory
  207. VP-NTK: Exploring the Benefits of Visual Prompting in Differentially Private Data Synthesis
  208. VP-YOLO: Robust Vehicle-Pedestrian Detection in Challenging Traffic Scenarios via A Human Visual Perception-Inspired Network
  209. VPCI: Self-Supervised Visual Prompt-Guided Cross-Domain Interactive Image Fusion Framework
  210. ValSub: Subsampling Validation Data to Mitigate Forgetting during ASR Personalization
  211. Valve Token Masked Autoencoder for Missing Recordings on Cardiac Abnormality Classification
  212. Variable Bitrate Residual Vector Quantization for Audio Coding
  213. Variance-Covariance Regularization for Improved End-to-End Diarization
  214. Variance-reduced Clipping for Non-convex Optimization
  215. Variational Perturbation Personalized Federated Learning via Prior-Posterior Distance
  216. Vector Quantized Diffusion Model Based Speech Bandwidth Extension
  217. ViCo: A Multitask Video-enhanced and Cognition-preserving Modality Alignment Training Framework
  218. ViM-Disparity: Bridging the Gap of Speed, Accuracy and Memory for Disparity Map Generation
  219. VibeGait: Enhancing Structural-Vibration based Gait Recognition using Vision
  220. Video-Poetry Retrieval with Multimodal Knowledge Graph Guided Unsupervised Pre-training
  221. ViolinDiff: Enhancing Expressive Violin Synthesis with Pitch Bend Conditioning
  222. Virtual Leader-based Safe Formation-Switching Control for Dense Environments
  223. VisAgent: Narrative-Preserving Story Visualization Framework
  224. VisQ2SQL: Towards SQL-Driven Data Visualization via LLMs-Grounded Preference Learning
  225. VisTa: Visual-contextual and Text-augmented Zero-shot Object-level OOD Detection
  226. Vision Mamba-Based Approach for Incomplete Boundary Document Image Rectification
  227. Vision Transformers for X-ray Diffraction Patterns Analysis
  228. Vision-Language Model Guided Semi-supervised Learning for No-Reference Video Quality Assessment
  229. Vision-text Enhancement Network For Weakly Supervised Video Anomaly Detection
  230. Visual Entity-Centric Prompting for Knowledge Retrieval in Knowledge-based VQA
  231. Voice Conversion for Low-Resource Languages via Knowledge Transfer and Domain-Adversarial Training
  232. Voice Conversion via Structural Entropy
  233. VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
  234. VoiceGuider: Enhancing Out-of-Domain Performance in Parameter-Efficient Speaker-Adaptive Text-to-Speech via Autoguidance
  235. VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
  236. Volatile MAB-based Configuration Selection for Offloading Video Analytics Tasks to Edges
  237. VoxVietnam: a Large-Scale Multi-Genre Dataset for Vietnamese Speaker Recognition
  238. Voxel-sensitive Wavelet-based Approach for Structural Distortion in Low-Dose CT Images
  239. VulKiller: Java Web Vulnerability Detection with Code Property Graph and Large Language Models
  240. WMAJL: Watcher-Mediated Attention Joint Learning Model for Multimodal Relation Extraction
  241. WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
  242. WMRE: Enhancing Distant Supervised Relation Extraction with Word-level Multi-instance Learning and Multi-hierarchical Feature
  243. WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models
  244. Wasserstein Heterogeneous Graph Neural Networks for Uncertainty-Aware Anomaly Detection
  245. Watermarking Datasets for LLM Fine-tuning
  246. Wave-Spectrogram Cross-Modal Aggregation for Audio Deepfake Detection
  247. Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution
  248. WaveSpect: A Hybrid Approach to Synthetic Audio Detection via Waveform and Spectrogram Analysis
  249. Wavelet Scattering Network Features for Intensity Category Classification and Prediction of SPL from Speech
  250. Weak-to-Strong Generalization in Speech Recognition
  251. Weakly Supervised Phonological Features for Pathological Speech Analysis
  252. Weakly-Supervised Video Highlight Detection by Characteristic and Commonality Modeling
  253. Weakly-supervised Learning Based Spine Instance Segmentation for MRI Planning
  254. WebSurfer: Enhancing LLM Agents with Web-Wise Feedback for Web Navigation
  255. Weighted Density for The Win: Accurate Subspace Density Clustering
  256. WeightedKV: Attention Scores Weighted Key-Value Cache Merging for Large Language Models
  257. What Affects the Performance of Fake Audio Detection? Analyzing Factors in a Continual Learning Setting
  258. What Are They Doing? Joint Audio-Speech Co-Reasoning
  259. What Does an Audio Deepfake Detector Focus on? A Study in the Time Domain
  260. When CLIP Meets PHOC: A Dual-Branch Network for Historical Document Image Retrieval
  261. When Does Visual Prompting Outperform Linear Probing for Vision-Language Models? A Likelihood Perspective
  262. When Sparse Graph Representation Learning Falls into Domain Shift: Feature Augmentation for Cross-Domain Graph Meta-Learning
  263. When SparseMoE Meets Noisy Interactions: An Ensemble View on Denoising Recommendation
  264. Which Prosodic Features Matter Most for Pragmatics?
  265. Whisper in Medusa's Ear: Multi-head Efficient Decoding for Transformer-based ASR
  266. Whisper-GPT: A Hybrid Generative LLM For Speech And Music
  267. Whitening Effects for ML-DoA Estimation using a Sparse Representation of Array Covariance
  268. Why disentanglement-based speaker anonymization systems fail at preserving emotions?
  269. WiSenseNet: A Unified Foundation Model for Diverse Wi-Fi Sensing Tasks Using Channel State Information
  270. WinStega: An Adaptive Robust Enhancement Framework for Generative Linguistic Steganography
  271. Windowed Quantum Phase Estimation: Signal Processing Approach to a Quantum Algorithm
  272. XAI for Gender Representation in Media Analysis
  273. XDGesture: An xLSTM-based Diffusion Model for Co-speech Gesture Generation
  274. XLSR-Transducer: Streaming ASR for Self-Supervised Pretrained Models
  275. YOLO-KED: A Novel Framework for Rotated Object Detection in Complex Environments
  276. YOLO-TCT: An Effective Network For Long-Tailed Cervical Cell Detection
  277. You Only Speak Once to See
  278. ZOQO: Zero-Order Quantized Optimization
  279. ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
  280. ZVEFusion: Zero-Shot Visual Enhancement Fusion for Infrared and Visible Images in Low Light
  281. Zero-Shot Cross-Domain Slot Filling with Retrieval Augmented In-Context Learning
  282. Zero-Shot Image Restoration via Few-Step Guidance of Consistency Models
  283. Zero-resource Speech Translation and Recognition with LLMs
  284. Zero-shot Document Retrieval with Hybrid Pseudo-document Retriever
  285. Zero-shot Micro-video Classification with Dual Alignment Topic Model
  286. Zero-shot Musical Stem Retrieval with Joint-Embedding Predictive Architectures
  287. Zero-shot Quantization for Large-kernels via Shape-based Distribution and Diversity Self-distillation
  288. Zero-shot Stance Detection with Logically Consistent Data Augmentation
  289. ZipEnhancer: Dual-Path Down-Up Sampling-based Zipformer for Monaural Speech Enhancement
  290. iDANSE: Iterative Data-driven Nonlinear State Estimation of Model-free Hidden Sequences
  291. iReWindColor: Vision Transformer with Residual Embedding and Window Encoder for Point-Interactive Image Colorization
  292. kNN-CL: Enhancing Continual Learning with Nearest Neighbor Retrieval
  293. kNN-SVC: Robust Zero-Shot Singing Voice Conversion with Additive Synthesis and Concatenation Smoothness Optimization
  294. mmHIU: a human-to-human interaction understanding system based on mmWave sensing
  295. mmWave-Whisper: Phone Call Eavesdropping and Transcription Using Millimeter-Wave Radar
  296. pFedFace: Personalized Federated Learning for Face Recognition
  297. persoDA: Personalized Data Augmentation for Personalized ASR
  298. voc2vec: A Foundation Model for Non-Verbal Vocalization

Looking for submission deadlines instead? See the conference deadline calendar.