ICASSP 2025 Accepted Papers
The full list of 3,298 papers accepted at ICASSP 2025 (IEEE International Conference on Acoustics, Speech and Signal Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
- Text Enhancement Network for Complex Multi-line Scene Text Image Super-resolution
- Text-Aware Adapter for Few-Shot Keyword Spotting
- Text-Guided Editable 3D City Scene Generation
- Text-Guided Few-Shot Semantic Segmentation with Training-Free Multimodal Feature Matching
- Text-Infused Audio-Visual Video Parsing with Semantic-Aware Multimodal Contrastive Learning
- Text-dependent Speaker Verification Challenge 2024: Exploring Shared and User-defined Passphrases
- Text-guided Device-realistic Sound Generation for Fiber-based Sound Event Classification
- Text-guided Multimodal Fusion for the Multimodal Emotion and Intent Joint Understanding
- Text2FX: Harnessing CLAP Embeddings for Text-Guided Audio Effects
- TextHair3D: Text-driven 3D Hair Editing with Generative Priors
- Textless Streaming Speech-to-Speech Translation using Semantic Speech Tokens
- Textual and Visual Prompt Fusion for Image Editing via Step-Wise Alignment
- TextureDiffusion: Target Prompt Disentangled Editing for Various Texture Transfer
- The CDC Problem: Distributed Spatial Sampling and Detection of Poisson Processes
- The Conformer Encoder May Reverse the Time Dimension
- The Evolution of System on Chip Integrated Circuits for Hearing-Aid Signal Processing
- The First Indoor Pathloss Radio Map Prediction Challenge
- The First VoicePrivacy Attacker Challenge
- The Impact of Decorrelation on Transformer Interpretation Methods: Applications to Clinical Speech AI
- The Impact of Deployment Height on the Mean Delay in Large UAV Networks
- The Importance of Spatial and Spectral Information in Multiple Speaker Tracking
- The Missing Piece in Model Editing: A Deep Dive into the Hidden Damage Brought By Model Editing
- The Misspecified Cramér-Rao Bound for DOA Estimation with One-Bit Quantized Data
- The Potential of Speech Features to Discriminate between Original and Machine-Translated Texts
- The Sound of Language: A Bilingual Analysis of Voice Conversion and Text-to-Speech Synthesis
- The Sound of Water: Inferring Physical Properties from Pouring Liquids
- The USTC System for EEG-Music Emotion Recognition Challenge
- TheSHY-3D: Texture and Structure HarmonY for Multi-View 3D Object Detection
- ThicknessVAE: Learning a Lateral Prior for Clothed Human Body Reconstruction
- Threshold Sensitivity in Two-Channel Modulo ADCs: Analysis and Robust Reconstruction
- Through-the-Wall Multi-Person Localization using Translation and Rotation Synthetic Aperture Radar
- Time-Frequency Based Feature Extraction For Automated Classification Of Bed Occupancy Using Accelerometer Data
- Time-Graph Frequency Representation with Singular Value Decomposition for Neural Speech Enhancement
- Time-Space-Interlaced Spatiotemporal Graph Forecasting via Two-Stage Summarized Attention
- Time-domain Beamforming for Room Acoustics Analysis based on Reverberant Field Estimation
- Time-independent Spiking Neuron via Membrane Potential Estimation for Efficient Spiking Neural Networks
- Time-varying EEG Signal Reconstruction Based on Local Graph Signal Smoothness
- TimeRAG: Boosting LLM Time Series Forecasting via Retrieval-Augmented Generation
- Tip the Scales: Achieving Balance in Adversarial Examples Across Modalities
- To Learn Better Character Embeddings in Generative Models for Password Attack
- Token-Level Contextual Network with Ladder-Shaped Attention for End-to-End ASR
- TokenSynth: A Token-based Neural Synthesizer for Instrument Cloning and Text-to-Instrument
- Tool Playgrounds: A Comprehensive and Analyzable Benchmark for LLM Tool Invocation
- ToolFiVe: Enhancing Tool-Augmented LLMs via Tool Filtering and Verification
- TopoRefine: Iterative Refinement with Reasoning Topology as High-Level Feedback
- Topological Scattering over Product Cell Complexes
- Topology Decoupled All-reduce Algorithm
- Topology-Informed Pre-training of Graph Neural Networks
- Toward Comprehensive Semantic Prompt for Region Contrastive Learning Underwater Image Enhancement
- Toward Forward-Secure End-to-End Data Sharing: An Attribute-Key-Free CP-ABE Scheme
- Toward Robust Early Detection of Alzheimer's Disease via an Integrated Multimodal Learning Approach
- Toward Visual Pronunciation Learning: A Speech-to-Articulatory Animation Pipeline Leveraging wav2vec 2.0 and rtMRI Landmarks
- Toward Zero-Shot Speech Emotion Recognition Using LLMs in the Absence of Target Data
- Toward noise-robust whisper keyword spotting on headphones with in-earcup microphone and curriculum learning
- Towards A Distribution Alignment Framework for Incomplete Data Classification
- Towards Adversarial Robustness And Backdoor Mitigation in SSL
- Towards An Integrated Approach for Expressive Piano Performance Synthesis from Music Scores
- Towards Automatic Assessment of Self-Supervised Speech Models using Rank
- Towards Bringing Parity in Pretraining Datasets for Low-resource Indian Languages
- Towards Clinically Feasible Nonintrusive Quality and Intelligibility Indices for Hearing Aids
- Towards Context-aware EEG-based Emotion Recognition Models: Personality and Emotional Intelligence as Context
- Towards Detecting Auditory Attention from in-Ear Muscle Contractions using Commodity Earbuds
- Towards Detecting LLMs Hallucination via Markov Chain-based Multi-agent Debate Framework
- Towards Differential Optimization: Rehearsal-Free Class-Incremental Learning with Slow Learners and Fast Adapters
- Towards Dynamic Neural Communication and Speech Neuroprosthesis Based on Viseme Decoding
- Towards Dynamic Skeleton-based Handshape Subunits for Sign Language Assessment
- Towards Efficient Deep Hashing Retrieval: Condensing Your Data via Feature-Embedding Matching
- Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction
- Towards Feature-Consistent Parameter Collaboration for Personalized Federated Learning
- Towards Fully Test-Time Adaptation via Variance Balancing and Semantic Augmentation
- Towards Green VAE: A Light Pixel-weighting Technique to Enhance Variational AutoEncoder
- Towards HRTF Personalization using Denoising Diffusion Models
- Towards Interactive Deepfake Analysis
- Towards Maximizing Semantic Coverage for Image-Text Retrieval
- Towards Patronizing and Condescending Language in Chinese Videos: A Multimodal Dataset and Detector
- Towards Personalized Federated Learning via Contrastive-Augmented Local Memorization Retrieval
- Towards Precision Characterization of Communication Disorders using Models of Perceived Pragmatic Similarity
- Towards Robust Category-level Articulation Pose Estimation via Integrated Differentiable Rendering
- Towards Robust Subject Identification From EEG Segments With Data Augmentation Techniques
- Towards Sub-millisecond Latency Real-Time Speech Enhancement Models on Hearables
- Towards Time-Frequency Deformation Stability Bounds for Deep Convolutional Neural Networks
- Towards Unbiased Evaluation of Time-series Anomaly Detector
- Towards Zero-shot Cross-lingual SLU with Syntax-aware Multi-view Contrastive Learning
- Towards a Single ASR Model That Generalizes to Disordered Speech
- Track-MDP: Reinforcement Learning for Target Tracking with Controlled Sensing
- TrackFusion: Enhancing Multi-Object Tracking With Temporal Trajectory Modeling and Frame-Integrated Detection
- TrackNetV4: Enhancing Fast Sports Object Tracking with Motion Attention Maps
- Tracking Network Dynamics using Probabilistic State-Space Models
- Tracking Time-Varying Parameters in Massive MIMO IoT Networks: A Linear Coherent Decentralized Approach
- Trainable Adaptive Score Normalization for Automatic Speaker Verification
- Training Better Embedding With Perturbed Data Augmentation for Automatic Singing Quality Assessment
- Training Dialogue Systems by AI Feedback for Improving Overall Dialogue Impression
- Training an Anti-KD Model that Cannot Teach Students via Similarity Disruption
- Training-Free Point Cloud Recognition Based on Geometric and Semantic Information Fusion
- Training-Free Task Planning by Parsing Language Signals With Common Sense
- Training-free Adapter for Multi-Modal Image Matching for All-Day Visual Place Recognition
- Trainingless Adaptation of Pretrained Models for Environmental Sound Classification
- TransPathNet: A Novel Two-Stage Framework for Indoor Radio Map Prediction
- TransVDM: Motion-Constrained Video Diffusion Model for Transparent Video Synthesis
- Transcribing and Translating, Fast and Slow: Joint Speech Translation and Recognition
- Transducer-Llama: Integrating LLMs into Streamable Transducer-based Speech Recognition
- Transfer Learning for Covert Speech Classification Using EEG Hilbert Envelope and Temporal Fine Structure
- Transfer Learning via Functional Balancing in Reproducing Kernel Hilbert Spaces
- Transfer Learning with Transformer and LSTM for Digital Pre-distortion of Terahertz/mmWave Transceiver
- Transfer Risk Map: Mitigating Pixel-level Negative Transfer in Medical Segmentation
- Transferable Selective Virtual Sensing Active Noise Control Technique Based on Metric Learning
- Transformer Based Multi-view Learning for Integrating Static and Dynamic Complementarity of Brain Function
- Transformer-Based Contrastive Meta-Learning For Low-Resource Generalizable Activity Recognition
- Transformer-Enhanced Iterative Feedback Mechanism For Polyp Segmentation
- Transforming Classification with Federated Learning on Blockchain: A Unique Model Integration Approach
- Transitive Inference in Large Language Models and Prompting Intervention
- Translating Mental Imaginations into Characters with Codebooks and Dynamics-Enhanced Decoding
- Translational Generative Retrieval via Potential Query Generation
- TriDE-Net: Triple-Densely Extraction Network for Precise Skin Lesion Segmentation
- TriFP-NGram: Integrating Three Complementary Fingerprint and N-Gram Features for Enhanced Drug-Target Affinity Prediction
- TriFormer: Triple Branch Heterogeneous Transformers for UHD Image Restoration
- Tribe Graph Enhanced Bidirectional Mamba for Multivariate Time Series Forecasting
- Trick-GS: A Balanced Bag of Tricks for Efficient Gaussian Splatting
- Trimformer: A Novel Sequence Compression Mechanism with Local Attention
- Triple Path Enhanced Neural Architecture Search for Multimodal Fake News Detection
- Triplet Synthesis for Enhancing Composed Image Retrieval via Counterfactual Image Generation
- Trusted Mamba Contrastive Network for Multi-View Clustering
- Trustworthy Recommendation for Consumer Electronics Using Hypernetworks
- Try Before You Buy: Solving Multi-Model Complex Tasks by Model Competitions
- Twenty-Five Years of MIR Research: Achievements, Practices, Evaluations, and Future Challenges
- Two Heads Are Better Than One: Averaging along Fine-Tuning to Improve Targeted Transferability
- Two-Dimensional Unknown View Tomography from Unknown Angle Distributions
- Two-Stream Spiking Neural Network for Event-based Action Recognition
- Two-in-One: Unified Multi-Person Interactive Motion Generation by Latent Diffusion Transformer
- Two-stream Semantic Alignment Networks for Multi-label Image Classification
- Typical vs. Atypical Disfluency Classification: Introducing the IIITH-TISA Corpus and Temporal Context-Based Feature Representations
- U-SAM: Upgrade Segment Anything Model With Semantic-Aware and Memory-Efficient
- U2AD: A UAV-Assisted Autonomous Driving Framework for Enhancing Vehicle Risk Perception and Decision-Making Capabilities
- UAV-Mounted SIM: A Hybrid Optical-Electronic Neural Network for DoA Estimation
- UCIL: An Unsupervised Class Incremental Learning Approach for Sound Event Detection
- UIDAPLE: Unsupervised Incremental Domain Adaptation through Adaptive Prompt Learning
- UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition
- UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts
- UML: A Unified Multimodal Learning Framework for Cataract Postoperative Visual Acuity Prediction with Uncertain Missing Modalities
- UMSSS: A Visual Scene Semantic Segmentation Dataset for Underground Mines
- UPCS: Unbiased Persona Construction for Dialogue Generation
- USD: Unsupervised Soft Contrastive Learning for Fault Detection in Multivariate Time Series
- USV-AUV Collaboration Framework for Underwater Tasks under Extreme Sea Conditions
- UV-Mamba: A DCN-Enhanced State Space Model for Urban Village Boundary Identification in High-Resolution Remote Sensing Images
- Ultra Lightweight Singing Melody Extraction via Combination of Convolution and MLP
- Ultra low-compute complex spectral masking for multichannel speech enhancement
- Ultra-Low Latency Speech Enhancement -A Comprehensive Study
- Ultrasound-Guided Registration Pseudo-Labels for Semi-Supervised Brachial Plexus Segmentation
- Unbalanced Co-relational Optimal Transport for Robust Heterogeneous Data Alignment
- Unbiased Multimodal Audio-to-Intent Recognition
- Uncertainty Estimation for Out-of-Distribution Detection of Whole Slide Images
- Uncertainty prediction for prominence classification with chroma features
- Uncertainty-Aware Crime Prediction With Spatial Temporal Multivariate Graph Neural Networks
- Uncertainty-Aware Dynamic Fusion for Multimodal Clinical Prediction Tasks
- Uncertainty-Aware Robust Learning on Noisy Graphs
- Uncertainty-Participation Context Consistency Learning for Semi-supervised Semantic Segmentation
- Uncertainty-aware Correspondence Distillation for Deep Image Clustering
- Uncertainty-aware Masked Modeling in Medical Imaging
- Uncovering the Visual Contribution in Audio-Visual Speech Recognition
- Under-Counted Matrix Completion Without Detection Features
- Understanding Neural Networks in Profiled Side-Channel Analysis
- Underwater Image Restoration via Polymorphic Large Kernel CNNs
- UniFaceGAN: High-Quality 3D Face Editing With a Unified Latent Space
- UniIVFT: Towards a Unified Framework for Infrared-Visible Fusion and Translation
- UniPlane: Unified Plane Detection and Reconstruction from Posed Monocular Videos
- Unified Arbitrary-Time Video Frame Interpolation and Prediction
- Unified Audio Event Detection
- Unified Graph and Hypergraph Neural Network for Next-item Recommendation
- Uniform Convergence of Lipschitz Functions with Dependent Gaussian Samples
- Uniform Distribution Based Learnable Quantization via Self-Knowledge Distillation
- Unifying Within and Across: Intra-Modality Multi-View Fusion and Inter-Modality Alignment for Knowledge Graph Completion
- Universal Low-Resource Speech Synthesis Via Phoneme Fusion Coordinating Low-Rank Decomposition
- Universal Training of Neural Networks to Achieve Bayes Optimal Classification Accuracy
- Unleashing Potential of Evidence in Knowledge-Intensive Dialogue Generation
- Unlocking Financial Statement Fraud Detection: Tracking Disclosure Changes via Representation Learning
- Unrolled Generative Compound Gaussian Network for Computer Tomography
- Unsupervised Domain Adaptation Via Data Pruning
- Unsupervised Domain Adaptation for Music Transcription: Exploiting Cross-Version Consistency
- Unsupervised Hierarchical Dynamic Similarity Hashing for Multimedia Retrieval
- Unsupervised Image-to-Image Style Transfer via Dual-Condition Diffusion Models*
- Unsupervised Learning for Gain-Phase Impairment Calibration in ISAC Systems
- Unsupervised Motion-Robust Self-Distillation Framework for Remote Physiological Measurement
- Unsupervised Multi-View Outlier Detection via Optimal Graph Filtering
- Unsupervised Search for Ethnic Minorities' Medical Segmentation Training Set
- Unsupervised UAV 3D Trajectories Estimation with Sparse Point Clouds
- Unsupervised Word Discovery: Boundary Detection with Clustering vs. Dynamic Programming
- Unveiling Deepfakes with Latent Diffusion Counterfactual Explanations
- Unveiling Local Well-posedness Influence for Cross-modal Person Re-Identification
- Unveiling Performance Bias in ASR Systems: A Study on Gender, Age, Accent, and More
- Unveiling the Pruning Risks on Privacy Vulnerabilities of Deep Neural Networks
- Username-Password Models Beyond Traditional Password Guessability Assessment
- Using Corrected ASR Projection to Improve AD Recognition Performance from Spontaneous Speech
- Using Depth-Enhanced Spatial Transformation for Student Gaze Target Estimation in Dual-View Classroom Images
- Using Ear-EEG to Decode Auditory Attention in Multiple-speaker Environment
- Using Emotionally Rich Speech Segments for Depression Prediction
- Using RLHF to align speech enhancement approaches to mean-opinion quality scores
- Utterance as A Bridge: Few-shot Joint Learning of Empathy Detection and Empathy Intent Classification
- V-Fusion: 2D Detection-enhanced Multimodal 3D BEV Object Detection
- V-Phanton: Voltage-Based Physically-Triggered Backdoor Attack Against Facial Recognition
- V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
- VAGeo: View-specific Attention for Cross-View Object Geo-Localization
- VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
- VCSA: Video Copy Localization Via Single Frame Annotation
- VITRO: Vocabulary Inversion for Time-series Representation Optimization
- VLIMNet: A Visible Light And Infrared Image Matching Network Based On Segment Anything Model And SuperPoint
- VN-GT: Optimizing Virtual Network Deployment via Game Theory
- VP-NTK: Exploring the Benefits of Visual Prompting in Differentially Private Data Synthesis
- VP-YOLO: Robust Vehicle-Pedestrian Detection in Challenging Traffic Scenarios via A Human Visual Perception-Inspired Network
- VPCI: Self-Supervised Visual Prompt-Guided Cross-Domain Interactive Image Fusion Framework
- ValSub: Subsampling Validation Data to Mitigate Forgetting during ASR Personalization
- Valve Token Masked Autoencoder for Missing Recordings on Cardiac Abnormality Classification
- Variable Bitrate Residual Vector Quantization for Audio Coding
- Variance-Covariance Regularization for Improved End-to-End Diarization
- Variance-reduced Clipping for Non-convex Optimization
- Variational Perturbation Personalized Federated Learning via Prior-Posterior Distance
- Vector Quantized Diffusion Model Based Speech Bandwidth Extension
- ViCo: A Multitask Video-enhanced and Cognition-preserving Modality Alignment Training Framework
- ViM-Disparity: Bridging the Gap of Speed, Accuracy and Memory for Disparity Map Generation
- VibeGait: Enhancing Structural-Vibration based Gait Recognition using Vision
- Video-Poetry Retrieval with Multimodal Knowledge Graph Guided Unsupervised Pre-training
- ViolinDiff: Enhancing Expressive Violin Synthesis with Pitch Bend Conditioning
- Virtual Leader-based Safe Formation-Switching Control for Dense Environments
- VisAgent: Narrative-Preserving Story Visualization Framework
- VisQ2SQL: Towards SQL-Driven Data Visualization via LLMs-Grounded Preference Learning
- VisTa: Visual-contextual and Text-augmented Zero-shot Object-level OOD Detection
- Vision Mamba-Based Approach for Incomplete Boundary Document Image Rectification
- Vision Transformers for X-ray Diffraction Patterns Analysis
- Vision-Language Model Guided Semi-supervised Learning for No-Reference Video Quality Assessment
- Vision-text Enhancement Network For Weakly Supervised Video Anomaly Detection
- Visual Entity-Centric Prompting for Knowledge Retrieval in Knowledge-based VQA
- Voice Conversion for Low-Resource Languages via Knowledge Transfer and Domain-Adversarial Training
- Voice Conversion via Structural Entropy
- VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
- VoiceGuider: Enhancing Out-of-Domain Performance in Parameter-Efficient Speaker-Adaptive Text-to-Speech via Autoguidance
- VoicePrompter: Robust Zero-Shot Voice Conversion with Voice Prompt and Conditional Flow Matching
- Volatile MAB-based Configuration Selection for Offloading Video Analytics Tasks to Edges
- VoxVietnam: a Large-Scale Multi-Genre Dataset for Vietnamese Speaker Recognition
- Voxel-sensitive Wavelet-based Approach for Structural Distortion in Low-Dose CT Images
- VulKiller: Java Web Vulnerability Detection with Code Property Graph and Large Language Models
- WMAJL: Watcher-Mediated Attention Joint Learning Model for Multimodal Relation Extraction
- WMCodec: End-to-End Neural Speech Codec with Deep Watermarking for Authenticity Verification
- WMRE: Enhancing Distant Supervised Relation Extraction with Word-level Multi-instance Learning and Multi-hierarchical Feature
- WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models
- Wasserstein Heterogeneous Graph Neural Networks for Uncertainty-Aware Anomaly Detection
- Watermarking Datasets for LLM Fine-tuning
- Wave-Spectrogram Cross-Modal Aggregation for Audio Deepfake Detection
- Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution
- WaveSpect: A Hybrid Approach to Synthetic Audio Detection via Waveform and Spectrogram Analysis
- Wavelet Scattering Network Features for Intensity Category Classification and Prediction of SPL from Speech
- Weak-to-Strong Generalization in Speech Recognition
- Weakly Supervised Phonological Features for Pathological Speech Analysis
- Weakly-Supervised Video Highlight Detection by Characteristic and Commonality Modeling
- Weakly-supervised Learning Based Spine Instance Segmentation for MRI Planning
- WebSurfer: Enhancing LLM Agents with Web-Wise Feedback for Web Navigation
- Weighted Density for The Win: Accurate Subspace Density Clustering
- WeightedKV: Attention Scores Weighted Key-Value Cache Merging for Large Language Models
- What Affects the Performance of Fake Audio Detection? Analyzing Factors in a Continual Learning Setting
- What Are They Doing? Joint Audio-Speech Co-Reasoning
- What Does an Audio Deepfake Detector Focus on? A Study in the Time Domain
- When CLIP Meets PHOC: A Dual-Branch Network for Historical Document Image Retrieval
- When Does Visual Prompting Outperform Linear Probing for Vision-Language Models? A Likelihood Perspective
- When Sparse Graph Representation Learning Falls into Domain Shift: Feature Augmentation for Cross-Domain Graph Meta-Learning
- When SparseMoE Meets Noisy Interactions: An Ensemble View on Denoising Recommendation
- Which Prosodic Features Matter Most for Pragmatics?
- Whisper in Medusa's Ear: Multi-head Efficient Decoding for Transformer-based ASR
- Whisper-GPT: A Hybrid Generative LLM For Speech And Music
- Whitening Effects for ML-DoA Estimation using a Sparse Representation of Array Covariance
- Why disentanglement-based speaker anonymization systems fail at preserving emotions?
- WiSenseNet: A Unified Foundation Model for Diverse Wi-Fi Sensing Tasks Using Channel State Information
- WinStega: An Adaptive Robust Enhancement Framework for Generative Linguistic Steganography
- Windowed Quantum Phase Estimation: Signal Processing Approach to a Quantum Algorithm
- XAI for Gender Representation in Media Analysis
- XDGesture: An xLSTM-based Diffusion Model for Co-speech Gesture Generation
- XLSR-Transducer: Streaming ASR for Self-Supervised Pretrained Models
- YOLO-KED: A Novel Framework for Rotated Object Detection in Complex Environments
- YOLO-TCT: An Effective Network For Long-Tailed Cervical Cell Detection
- You Only Speak Once to See
- ZOQO: Zero-Order Quantized Optimization
- ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
- ZVEFusion: Zero-Shot Visual Enhancement Fusion for Infrared and Visible Images in Low Light
- Zero-Shot Cross-Domain Slot Filling with Retrieval Augmented In-Context Learning
- Zero-Shot Image Restoration via Few-Step Guidance of Consistency Models
- Zero-resource Speech Translation and Recognition with LLMs
- Zero-shot Document Retrieval with Hybrid Pseudo-document Retriever
- Zero-shot Micro-video Classification with Dual Alignment Topic Model
- Zero-shot Musical Stem Retrieval with Joint-Embedding Predictive Architectures
- Zero-shot Quantization for Large-kernels via Shape-based Distribution and Diversity Self-distillation
- Zero-shot Stance Detection with Logically Consistent Data Augmentation
- ZipEnhancer: Dual-Path Down-Up Sampling-based Zipformer for Monaural Speech Enhancement
- iDANSE: Iterative Data-driven Nonlinear State Estimation of Model-free Hidden Sequences
- iReWindColor: Vision Transformer with Residual Embedding and Window Encoder for Point-Interactive Image Colorization
- kNN-CL: Enhancing Continual Learning with Nearest Neighbor Retrieval
- kNN-SVC: Robust Zero-Shot Singing Voice Conversion with Additive Synthesis and Concatenation Smoothness Optimization
- mmHIU: a human-to-human interaction understanding system based on mmWave sensing
- mmWave-Whisper: Phone Call Eavesdropping and Transcription Using Millimeter-Wave Radar
- pFedFace: Personalized Federated Learning for Face Recognition
- persoDA: Personalized Data Augmentation for Personalized ASR
- voc2vec: A Foundation Model for Non-Verbal Vocalization
ICASSP accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.