ICASSP 2026 Accepted Papers
The full list of 1,432 papers accepted at ICASSP 2026 (IEEE International Conference on Acoustics, Speech and Signal Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 1,085Oral: 347
- QASTANET: A DNN-BASED QUALITY METRIC FOR SPATIAL AUDIOOral
- QUADRATURE OVER-THE-AIR-COMPUTING FOR MULTIMODAL DUAL-STREAM SIGNAL PROCESSINGPoster
- QUALITY ASSESSMENT OF NOISY AND ENHANCED SPEECH WITH LIMITED DATA: UWB-NTIS SYSTEM FOR VOICEMOS 2024Oral
- QUANTIZATION-BASED SCORE CALIBRATION FOR FEW-SHOT KEYWORD SPOTTING WITH DYNAMIC TIME WARPING IN NOISY ENVIRONMENTSPoster
- QUSR: QUALITY-AWARE AND UNCERTAINTY-GUIDED IMAGE SUPER-RESOLUTION DIFFUSION MODELPoster
- Quantifying Speaker Embedding Phonological Rule Interactions in Accented Speech SynthesisPoster
- Quantile Randomized Kaczmarz Algorithm with Whitelist Trust MechanismPoster
- Quantum Adaptive Self-Attention for Financial Rebalancing: An Empirical Study on Automated Market Makers in Decentralized FinanceOral
- Quantum Reinforcement Learning-Guided Diffusion Model for Image Synthesis via Hybrid Quantum-Classical Generative Model ArchitecturesOral
- RADAREYE: ROBUST LIQUID LEVEL TRACKING USING MMWAVE RADAR IN ROBOTIC POURINGPoster
- RADIOLUNADIFF: ESTIMATION OF WIRELESS NETWORK SIGNAL STRENGTH IN LUNAR TERRAINPoster
- RANKING-AWARE REINFORCEMENT LEARNING FOR ORDINAL RANKINGPoster
- RAP: Real-time Audio-driven Portrait Animation with Video Diffusion TransformerOral
- RATE-DISTORTION ANALYSIS OF OPTICALLY PASSIVE VISION COMPRESSIONOral
- RAVE: RATE-ADAPTIVE VISUAL ENCODING FOR 3D GAUSSIAN SPLATTINGOral
- RAVE: Retrieval and Scoring Aware Verifiable Claim DetectionPoster
- READING BETWEEN THE WAVES: ROBUST TOPIC SEGMENTATION USING INTER-SENTENCE AUDIO FEATURESPoster
- REAL-TIME CARFAC COCHLEA MODEL ACCELERATION ON FPGA FOR UNDERWATER ACOUSTIC SENSING SYSTEMSPoster
- REAL-TIME MARKOV MODELING FOR SINGLE-PHOTON LIDAR: 1000× ACCELERATION AND CONVERGENCE ANALYSISPoster
- REAL-TIME STREAMING MEL VOCODING WITH GENERATIVE FLOW MATCHINGOral
- RECOM: REALISTIC CO-SPEECH MOTION GENERATION WITH RECURRENT EMBEDDED TRANSFORMERPoster
- RECOVERING PERFORMANCE IN SPEECH EMOTION RECOGNITION FROM DISCRETE TOKENS VIA MULTI-LAYER FUSION AND PARALINGUISTIC FEATURE INTEGRATIONOral
- RECOVERING WASSERSTEIN DISTANCE MATRICES FROM FEW MEASUREMENTSPoster
- RECURRENT CONFIDENCE CHAIN: TEMPORAL-AWARE UNCERTAINTY QUANTIFICATION IN LARGE LANGUAGE MODELSPoster
- REDUCING PROMPT SENSITIVITY IN LLM-BASED SPEECH RECOGNITION THROUGH LEARNABLE PROJECTIONOral
- REFERENCE MICROPHONE SELECTION FOR GUIDED SOURCE SEPARATION BASED ON THE NORMALIZED L-P NORMPoster
- REFERENCE-AWARE SFM LAYERS FOR INTRUSIVE INTELLIGIBILITY PREDICTIONPoster
- REFINEBRIDGE: GENERATIVE BRIDGE MODELS IMPROVE FINANCIAL FORECASTING BY FOUNDATION MODELSOral
- REFLECTIVE CONFIDENCE: CORRECTING REASONING FLAWS VIA ONLINE SELF-CORRECTIONOral
- REINPATH: A MULTIMODAL REINFORCEMENT LEARNING APPROACH FOR PATHOLOGYPoster
- RELUNET: RELATIVE CHANNEL FUSION U-NET FOR MULTICHANNEL SPEECH ENHANCEMENTPoster
- REMOTEDET-MAMBA: A HYBRID MAMBA-CNN NETWORK FOR MULTI-MODAL OBJECT DETECTION IN REMOTE SENSING IMAGESPoster
- RESIDUAL VECTOR QUANTIZATION FOR COMMUNICATION-EFFICIENT MULTI-AGENT PERCEPTIONPoster
- RETHINKING LARGE LANGUAGE MODELS FOR IRREGULAR TIME SERIES CLASSIFICATION IN CRITICAL CAREOral
- RETHINKING MUSIC CAPTIONING WITH MUSIC METADATA LLMSPoster
- RETLLM: TRAINING AND DATA-FREE MLLMS FOR MULTIMODAL INFORMATION RETRIEVALPoster
- RETRIEVEALL: A MULTILINGUAL NAMED ENTITY RECOGNITION FRAMEWORK WITH LARGE LANGUAGE MODELSPoster
- REVISITING DIRECT SPEECH-TO-TEXT TRANSLATION WITH SPEECH LLMS: BETTER SCALING THAN COT PROMPTING?Poster
- RFM-EDITING: RECTIFIED FLOW MATCHING FOR TEXT-GUIDED AUDIO EDITINGPoster
- RFOP: Rethinking Fusion and Orthogonal Projection for Face-Voice AssociationPoster
- RHO-PERFECT: CORRELATION CEILING FOR SUBJECTIVE EVALUATION DATASETSPoster
- RHOSI: Efficient Anti-Jamming Resource Allocation with Holographic Surfaces in UAV-enabled ISACOral
- RHYTHMBERT: A SELF-SUPERVISED LANGUAGE MODEL BASED ON LATENT REPRESENTATIONS OF ECG WAVEFORMS FOR HEART DISEASE DETECTIONOral
- RIR-FORMER: COORDINATE-GUIDED TRANSFORMER FOR CONTINUOUS RECONSTRUCTION OF ROOM IMPULSE RESPONSESPoster
- RIS-ENHANCED INFORMATION-DECOUPLED SYMBIOTIC RADIO OVER BROADCASTING SIGNALSOral
- RIS-FUSION: RETHINKING TEXT-DRIVEN INFRARED AND VISIBLE IMAGE FUSION FROM THE PERSPECTIVE OF REFERRING IMAGE SEGMENTATIONOral
- RLBR: REINFORCEMENT LEARNING WITH BIASING REWARDS FOR CONTEXTUAL SPEECH LARGE LANGUAGE MODELSPoster
- RMT-KD: RANDOM MATRIX THEORETIC CAUSAL KNOWLEDGE DISTILLATIONPoster
- RO-BENCH: LARGE-SCALE ROBUSTNESS EVALUATION OF MLLMS WITH TEXT-DRIVEN COUNTERFACTUAL VIDEOSPoster
- ROBUST ACCENT IDENTIFICATION VIA VOICE CONVERSION AND NON-TIMBRAL EMBEDDINGSPoster
- ROBUST GROUNDING WITH MLLMS AGAINST OCCLUSION AND SMALL OBJECTS VIA LANGUAGE-GUIDED SEMANTIC CUESPoster
- ROBUST MULTIMODAL REPRESENTATION LEARNING IN HEALTHCAREPoster
- ROBUST MULTIMODAL REPRESENTATION LEARNING IN HEALTHCAREPoster
- ROBUST ONLINE OVERDETERMINED INDEPENDENT VECTOR ANALYSIS BASED ON BILINEAR DECOMPOSITIONOral
- ROBUST PROVABLY SECURE IMAGE STEGANOGRAPHY VIA LATENT ITERATIVE OPTIMIZATIONPoster
- ROBUST UNCERTAINTY ESTIMATION UNDER DISTRIBUTION SHIFT VIA DIFFERENCE RECONSTRUCTIONOral
- ROBUST, ONLINE, AND ADAPTIVE DECENTRALIZED GAUSSIAN PROCESSESOral
- RPM-NET: RECIPROCAL POINT MLP NETWORK FOR UNKNOWN NETWORK SECURITY THREAT DETECTIONPoster
- RRPO: ROBUST REWARD POLICY OPTIMIZATION FOR LLM-BASED EMOTIONAL TTSOral
- RaFD: Flow-Guided Radar Detection for Robust Autonomous DrivingOral
- Read Before You Think: Mitigating LLM Comprehension Failures with Step-by-Step ReadingPoster
- Readout-Side Bypass for Residual Hybrid Quantum-Classical ModelsOral
- Real-World Adversarial Attacks on RF-Based Drone DetectorsPoster
- Reasoning Beyond Majority Vote: An Explainable SpeechLM Framework for Speech Emotion RecognitionOral
- Reconstructing Topology-Consistent Face Mesh by Volume Rendering from Multi-View ImagesPoster
- Recursive state estimation via approximate modal pathsOral
- Reg3D: Reconstructive Geometry Instruction Tuning for 3D Scene UnderstandingOral
- Repeater-Assisted Massive MIMO Full-Duplex CommunicationsOral
- Representation-Based Data Quality Audits for AudioPoster
- Residual Tokens Enhance Masked Autoencoders for Speech ModelingOral
- Rethinking Fusion: Disentangled Learning of Shared and Modality-Specific Information for Stance DetectionPoster
- Rethinking Oversaturation in Classifier-Free Guidance via Low FrequencyPoster
- Rethinking Self-Training Based Cross-Subject Domain Adaptation for SSVEP ClassificationOral
- Rethinking Speech Representation Aggregation in Speech Enhancement: a Phonetic Mutual Information PerspectivePoster
- Revisiting Backdoor Threat in Federated Instruction Tuning from a Signal Aggregation PerspectivePoster
- Revisiting the Seasonal Trend Decomposition for Enhanced Time Series ForecastingPoster
- Riemannian optimization on the manifold of unitary and symmetric matrices with application to BD-RIS-assisted systemsPoster
- Risk level dependent Minimax Quantile lower bounds for Interactive Statistical Decision MakingPoster
- Robust MAE-Driven NAS: From Mask Reconstruction to Architecture InnovationPoster
- Robust Personalized Recommendation under Hidden Confounding in MNARPoster
- Robust TTS Training via Self-Purifying Flow Matching for the WildSpoof 2026 TTS TrackPoster
- Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction PolicyPoster
- S-PRESSO: ULTRA LOW BITRATE SOUND EFFECT COMPRESSION WITH DIFFUSION AUTOENCODERS AND OFFLINE QUANTIZATIONOral
- S-SONDO: SELF-SUPERVISED KNOWLEDGE DISTILLATION FOR GENERAL AUDIO FOUNDATION MODELSPoster
- S2TX: CROSS-ATTENTION MULTI-SCALE STATE-SPACE TRANSFORMER FOR TIME SERIES FORECASTINGOral
- SA-SSL-MOS: SELF-SUPERVISED LEARNING MOS PREDICTION WITH SPECTRAL AUGMENTATION FOR GENERALIZED MULTI-RATE SPEECH ASSESSMENTOral
- SAEC: Scene-Aware Enhanced Edge-Cloud Collaborative Industrial Vision Inspection with Multimodal LLMPoster
- SAFE-IMM: ROBUST AND LIGHTWEIGHT RADAR-BASED OBJECT TRACKING ON MOBILE PLATFORMSPoster
- SAGA-SR: SEMANTICALLY AND ACOUSTICALLY GUIDED AUDIO SUPER-RESOLUTIONOral
- SAGE: SEMANTIC-AWARE SHARED SAMPLING FOR EFFICIENT DIFFUSIONOral
- SAIP: A PLUG-AND-PLAY SCALE-ADAPTIVE MODULE IN DIFFUSION-BASED INVERSE PROBLEMSPoster
- SALAD-VAE: Semantic Audio Compression with Language-Audio DistillationPoster
- SAMAS: A SPECTRUM-GUIDED MULTI-AGENT SYSTEM FOR ACHIEVING STYLE FIDELITY IN LITERARY TRANSLATIONPoster
- SAMPLE EFFICIENT EXPERIENCE REPLAY IN NON-STATIONARY ENVIRONMENTSPoster
- SAMPLE WEIGHT AVERAGING FOR STABLE PREDICTIONPoster
- SARNET: A SPIKE-AWARE CONSECUTIVE VALIDATION FRAMEWORK FOR ACCURATE REMAINING USEFUL LIFE PREDICTIONOral
- SATURATION-AWARE SNAPSHOT COMPRESSIVE IMAGING: THEORY AND ALGORITHMOral
- SAVGBENCH: BENCHMARKING SPATIALLY ALIGNED AUDIO-VIDEO GENERATIONPoster
- SCALABLE EVALUATION FOR AUDIO IDENTIFICATION VIA SYNTHETIC LATENT FINGERPRINT GENERATIONOral
- SCALABLE HESSIAN-FREE PROXIMAL CONJUGATE GRADIENT METHOD FOR NONCONVEX AND NONSMOOTH OPTIMIZATIONOral
- SCALE-AWARE SELF-SUPERVISED LEARNING FOR SEGMENTATION OF SMALL AND SPARSE STRUCTURESPoster
- SCALING AUDIO-VISUAL QUALITY ASSESSMENT DATASET VIA CROWDSOURCINGOral
- SCALING MULTI-TALKER ASR WITH SPEAKER-AGNOSTIC ACTIVITY STREAMSOral
- SCATTERFUSION: A HIERARCHICAL SCATTERING TRANSFORM FRAMEWORK FOR ENHANCED TIME SERIES FORECASTINGPoster
- SCENE: SEMANTIC-AWARE CODEC ENHANCEMENT WITH NEURAL EMBEDDINGSPoster
- SCENERAG: SCENE-LEVEL RETRIEVAL-AUGMENTED GENERATION FOR VIDEO UNDERSTANDINGPoster
- SCHROMIND: MITIGATING HALLUCINATIONS IN MULTIMODAL LARGE LANGUAGE ¨ MODELS VIA SOLVING THE SCHRODINGER BRIDGE PROBLEMOral
- SCORENF: SCORE-BASED NORMALIZING FLOWS FOR SAMPLING UNNORMALIZED DISTRIBUTIONSPoster
- SDGF: Fusing Static and Multi-Scale Dynamic Correlations for Multivariate Time Series ForecastingPoster
- SE-DiCoW: Self-Enrolled Diarization-Conditioned WhisperOral
- SEE NO EVIL: SEMANTIC CONTEXT-AWARE PRIVACY RISK DETECTION FOR ARPoster
- SEE WHAT YOU NEED: QUERY-AWARE VISUAL INTELLIGENCE THROUGH REASONING-PERCEPTION LOOPSPoster
- SEGMENTWISE PRUNING IN AUDIO-LANGUAGE MODELSPoster
- SELF-CALIBRATING INTEGRATE-AND-FIRE TIME ENCODING MACHINEPoster
- SEMAMIL: SEMANTIC-AWARE MULTIPLE INSTANCE LEARNING WITH RETRIEVAL-GUIDED STATE SPACE MODELING FOR WHOLE SLIDE IMAGESPoster
- SEMANTIC REFORMULATION ENTROPY FOR ROBUST HALLUCINATION DETECTION IN QA TASKSPoster
- SEMANTIC-AWARE UAV COMMAND AND CONTROL FOR EFFICIENT IOT DATA COLLECTIONPoster
- SEMANTICACHE: EFFICIENT KV CACHE COMPRESSION VIA SEMANTIC CHUNKING AND CLUSTERED MERGINGOral
- SEMITOOTH: A GENERALIZABLE SEMI-SUPERVISED FRAMEWORK FOR MULTI-SOURCE TOOTH SEGMENTATIONPoster
- SEPARABLE DELAY AND DOPPLER ESTIMATION IN PASSIVE RADAROral
- SEPARATE THIS, AND ALL OF THESE THINGS AROUND IT: MUSIC SOURCE SEPARATION VIA HYPERELLIPSOIDAL QUERIESOral
- SESSION-LEVEL SPOKEN LANGUAGE ASSESSMENT WITH A MULTIMODAL FOUNDATION MODEL VIA MULTI-TARGET LEARNINGPoster
- SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and CalibrationPoster
- SFGNET: SEMANTIC AND FREQUENCY GUIDED NETWORK FOR CAMOUFLAGED OBJECT DETECTIONPoster
- SFQA: A Comprehensive Perceptual Quality Assessment Dataset for Singing Face GenerationOral
- SG-Splatting: Accelerating 3D Gaussian Splatting with Spherical GaussiansOral
- SHARED MULTI-MODAL EMBEDDING SPACE FOR FACE-VOICE ASSOCIATIONPoster
- SHARED REPRESENTATION LEARNING FOR REFERENCE-GUIDED TARGETED SOUND DETECTIONOral
- SHARED-WEIGHTS EXTENDER AND GRADIENT VOTING FOR NEURAL NETWORK EXPANSIONPoster
- SHARPNESS-AWARE MINIMIZATION WITH Z-SCORE GRADIENT FILTERINGPoster
- SHORT-SEGMENT SPEAKER VERIFICATION WITH PRE-TRAINED MODELS AND MULTI-RESOLUTION ENCODERPoster
- SIE3D: SINGLE-IMAGE EXPRESSIVE 3D AVATAR GENERATION VIA SEMANTIC EMBEDDING AND PERCEPTUAL EXPRESSION LOSSPoster
- SIGNED GRAPH UNLEARNINGPoster
- SILENT SPEECH SENTENCE RECOGNITION WITH SIX-AXIS ACCELEROMETERS USING CONFORMER AND CTC ALGORITHMPoster
- SIM-MSTNET: SIM2REAL BASED MULTI-TASK SPATIOTEMPORAL NETWORK TRAFFIC FORECASTINGOral
- SIMPLICIAL GAUSSIAN MODELS: REPRESENTATION AND INFERENCEOral
- SIMTOKEN: A SIMPLE BASELINE FOR REFERRING AUDIO-VISUAL SEGMENTATIONPoster
- SIMULATORCODER: DNN ACCELERATOR SIMULATOR CODE GENERATION AND OPTIMIZATION VIA LARGE LANGUAGE MODELSPoster
- SIMULSENSE: SENSE-DRIVEN INTERPRETING FOR EFFICIENT SIMULTANEOUS SPEECH TRANSLATIONPoster
- SINGLE-MICROPHONE AUDIO POINT SOURCE DISCRIMINATIVE LOCALIZATION FROM REVERBERATION LATE TAIL ESTIMATIONPoster
- SINGLE-STEP CONTROLLABLE MUSIC BANDWIDTH EXTENSION WITH FLOW MATCHINGPoster
- SIREN: SPATIALLY-INFORMED RECONSTRUCTION OF BINAURAL AUDIO WITH VISIONPoster
- SIRUP: A DIFFUSION-BASED VIRTUAL UPMIXER OF STEERING VECTORS FOR HIGHLY-DIRECTIVE SPATIALIZATION WITH FIRST-ORDER AMBISONICSPoster
- SLAP: SCALABLE LANGUAGE-AUDIO PRETRAINING WITH VARIABLE-DURATION AUDIO AND MULTI-OBJECTIVE TRAININGOral
- SLM-SS: Speech Language Model for Generative Speech SeparationPoster
- SLM-TTA: A Framework for Test-Time Adaptation of Generative Spoken Language ModelsPoster
- SLOT FILLING AS A REASONING TASK FOR SPEECHLLMSPoster
- SMOGVLM: A SMALL, GRAPH-ENHANCED VISION-LANGUAGE MODELOral
- SMOOTHCLAP: SOFT-TARGET ENHANCED CONTRASTIVE LANGUAGE-AUDIO PRETRAINING FOR AFFECTIVE COMPUTINGPoster
- SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio RepresentationPoster
- SOUNDCOMPASS: NAVIGATING TARGET SOUND EXTRACTION WITH EFFECTIVE DIRECTIONAL CLUE INTEGRATION IN COMPLEX ACOUSTIC SCENESPoster
- SOUNDING HIGHLIGHTS: DUAL-PATHWAY AUDIO ENCODERS FOR AUDIO-VISUAL VIDEO HIGHLIGHT DETECTIONPoster
- SOURCE SEPARATION FOR A CAPPELLA MUSICOral
- SP-MCQA: EVALUATING INTELLIGIBILITY OF TTS BEYOND THE WORD LEVELPoster
- SPADE: STRUCTURED PRUNING AND ADAPTIVE DISTILLATION FOR EFFICIENT LLM-TTSOral
- SPAM: Style Prompt Adherence Metric for Prompt-based TTSPoster
- SPARSE AUTOENCODERS MAKE AUDIO FOUNDATION MODELS MORE EXPLAINABLEPoster
- SPARSE-UP: LEARNABLE SPARSE UPSAMPLING FOR 3D GENERATION WITH HIGH-FIDELITY TEXTURESPoster
- SPATIAL-CLAP: LEARNING SPATIALLY-AWARE AUDIO–TEXT EMBEDDINGS FOR MULTI-SOURCE CONDITIONSPoster
- SPATIALLY AWARE SELF-SUPERVISED MODELS FOR MULTI-CHANNEL NEURAL SPEAKER DIARIZATIONPoster
- SPEAKER ATTRIBUTED AUTOMATIC SPEECH RECOGNITION USING SPEECH AWARE LLMSPoster
- SPEAKING CLEARLY: A SIMPLIFIED WHISPER-BASED CODEC FOR LOW-BITRATE SPEECH CODINGPoster
- SPECTRAL OR SPATIAL? LEVERAGING BOTH FOR SPEAKER EXTRACTION IN CHALLENGING DATA CONDITIONSPoster
- SPECTRAMORPH: STRUCTURED LATENT LEARNING FOR SELF-SUPERVISED HYPERSPECTRAL SUPER-RESOLUTIONOral
- SPEECH QUALITY-BASED LOCALIZATION OF LOW-QUALITY SPEECH AND TEXT-TO-SPEECH SYNTHESIS ARTEFACTSPoster
- SPEECHCT-CLIP: DISTILLING TEXT-IMAGE KNOWLEDGE TO SPEECH FOR VOICE-NATIVE MULTIMODAL CT ANALYSISOral
- SPEECHMAPPER: SPEECH-TO-TEXT EMBEDDING PROJECTOR FOR LLMSOral
- SPOC: Safety-aware planning under partial observability and physical constraintsPoster
- SSCM: A SPATIAL-SEMANTIC CONSISTENT MODEL FOR MULTI-CONTRAST MRI SUPER-RESOLUTIONPoster
- SSG-DIT: A SPATIAL SIGNAL GUIDED FRAMEWORK FOR CONTROLLABLE VIDEO GENERATIONOral
- SSVD-O: PARAMETER-EFFICIENT FINE-TUNING WITH STRUCTURED SVD FOR SPEECH RECOGNITIONOral
- STACODEC: SEMANTIC TOKEN ASSIGNMENT FOR BALANCING ACOUSTIC FIDELITY AND SEMANTIC INFORMATION IN AUDIO CODECSPoster
- STEMPHONIC: ALL-AT-ONCE FLEXIBLE MULTI-STEM MUSIC GENERATIONPoster
- STOCHASTIC SHADOW DESCENT: TRAINING PARAMETRIZED QUANTUM CIRCUITS WITH SHADOWS OF GRADIENTSOral
- STREAM-VOICE-ANON: ENHANCING UTILITY OF REAL-TIME SPEAKER ANONYMIZATION VIA NEURAL AUDIO CODEC AND LANGUAGE MODELSPoster
- STREAMING SPEECH RECOGNITION WITH DECODER-ONLY LARGE LANGUAGE MODELS AND LATENCY OPTIMIZATIONOral
- STREAMMARK: A DEEP LEARNING-BASED SEMI-FRAGILE AUDIO WATERMARKING FOR PROACTIVE DEEPFAKE DETECTIONPoster
- STRUCTURAL COMPLEXITY OF BRAIN MRI REVEALS AGE-ASSOCIATED PATTERNSPoster
- STRUCTURE-AWARE CONTRASTIVE LEARNING WITH FINE-GRAINED BINDING REPRESENTATIONS FOR DRUG DISCOVERYPoster
- STRUCTURE-TO-IMAGE: ZERO-SHOT DEPTH ESTIMATION IN COLONOSCOPY VIA HIGH-FIDELITY SIM-TO-REAL ADAPTATIONPoster
- STYLE ATTACK DISGUISE: WHEN FONTS BECOME A CAMOUFLAGE FOR ADVERSARIAL INTENTPoster
- STYLEBENCH: EVALUATING SPEECH LANGUAGE MODELS ON CONVERSATIONAL SPEAKING STYLE CONTROLPoster
- STYLEPITCHER: GENERATING STYLE-FOLLOWING AND EXPRESSIVE PITCH CURVES FOR VERSATILE SINGING TASKSPoster
- STYMAM: A MAMBA-BASED GENERATOR FOR ARTISTIC STYLE TRANSFERPoster
- SUBJECTIVE EVALUATION OF FRAME RATE IN BITRATE-CONSTRAINED LIVE STREAMINGPoster
- SUBQRAG: SUB-QUESTION DRIVEN DYNAMIC GRAPH RAGPoster
- SUBTRACTIVE MODULATIVE NETWORK WITH LEARNABLE PERIODIC ACTIVATIONSOral
- SUMMARY ON THE MULTILINGUAL CONVERSATIONAL SPEECH LANGUAGE MODEL CHALLENGE: DATASETS, TASKS, BASELINES, AND METHODSPoster
- SUNAC: Source-aware Unified Neural Audio CodecOral
- SUPER MONOTONIC ALIGNMENT SEARCHPoster
- SUPERPIXEL INTEGRATED GRIDS FOR FAST IMAGE SEGMENTATIONPoster
- SUPERVISED MAKEUP TRANSFER WITH A CURATED DATASET: DECOUPLING IDENTITY AND MAKEUP FEATURES FOR ENHANCED TRANSFORMATIONPoster
- SUPPORT VECTOR DATA DESCRIPTION FOR RADAR TARGET DETECTIONPoster
- SURE-MED: SYSTEMATIC UNCERTAINTY REDUCTION FOR ENHANCED RELIABILITY IN MEDICAL REPORT GENERATIONPoster
- SURE: SYNERGISTIC UNCERTAINTY-AWARE REASONING FOR MULTIMODAL EMOTION RECOGNITION IN CONVERSATIONSOral
- SWITCHCODEC: ADAPTIVE RESIDUAL-EXPERT SPARSE QUANTIZATION FOR HIGH-FIDELITY NEURAL AUDIO CODINGOral
- SYNCSPEECH: EFFICIENT AND LOW-LATENCY TEXT-TO-SPEECH BASED ON TEMPORAL MASKED TRANSFORMEROral
- SYNERGYWARPNET: ATTENTION-GUIDED COOPERATIVE WARPING FOR NEURAL PORTRAIT ANIMATIONPoster
- SYNTHCLONER: SYNTHESIZER-STYLE AUDIO TRANSFER VIA FACTORIZED CODEC WITH ADSR ENVELOPE CONTROLPoster
- SYNTHETIC DATA DOMAIN ADAPTATION FOR ASR VIA LLM-BASED TEXT AND PHONETIC RESPELLING AUGMENTATIONOral
- Safety Alignment Should Be Made More Than Just A Few Attention HeadsOral
- Scale-covariant spiking waveletsPoster
- Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language ModelsOral
- Scaling Spoken Language Models with Syllabic Speech TokenizationOral
- Self-Attention Decomposition for Training Free Diffusion EditingOral
- Semantic Pilot Design for Data-Aided Channel Estimation Using a Large Language ModelPoster
- Semantic Relation-Enhanced CLIP Adapter for Domain Adaptive Zero-Shot LearningPoster
- SemanticShield: LLM-Powered Audits Expose Shilling Attacks in Recommender SystemsPoster
- Sensor Array and Camera Fusion via Unbalanced Optimal Transport for 3D Source LocalizationPoster
- Sequence-Level Unsupervised Training in Speech Recognition: A Theoretical StudyPoster
- Shapley Features for Robust Signal Prediction in Tactile InternetPoster
- Shift- and stretch-invariant non-negative matrix factorization with an application to brain tissue delineation in emission tomography dataPoster
- Shortcut Flow Matching for Speech Enhancement: Step-Invariant flows via single stage trainingPoster
- Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-scale Dataset CleansingPoster
- SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language ModelsPoster
- SingMOS-Pro: An Comprehensive Benchmark for Singing Quality AssessmentPoster
- Soft Graph Transformer for MIMO DetectionPoster
- Sparse Gradient Compression for Fine-Tuning Large Language ModelsPoster
- Sparse Polyak with optimal thresholding operators for high-dimensional M-estimationPoster
- Sparsity Induction for Accurate Post-Training Pruning of Large Language ModelsPoster
- Spatially Filtered Sparse Bayesian Learning for Direction-of-Arrival Estimation with Leaky-Wave AntennasPoster
- Speaker Anonymisation for Speech-based Suicide Risk DetectionPoster
- SpeakerRPL v2: Robust Open-set Speaker Identification through Enhanced Few-shot Foundation Tuning and Model FusionPoster
- Spectral Logit Sculpting: Adaptive Low-Rank Logit Transformation for Controlled Text GenerationPoster
- Stability and Generalization of Adversarial Diffusion TrainingPoster
- State-Flow Coordinated Representation for MI-EEG DecodingPoster
- StereoFoley: Object-Aware Stereo Audio Generation from VideoPoster
- StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video UnderstandingPoster
- Strong Basin of Attraction for Unmixing Kernels With the Variable Projection MethodPoster
- Structure-Aware Corpus Construction and User-Perception-Aligned Metrics for Large-Language-Model Code CompletionPoster
- StyleDecoupler: Generalizable Artistic Style DisentanglementPoster
- Summary of The Inaugural Music Source Restoration ChallengePoster
- Superpixel-informed Continuous Low-Rank Tensor Representation for Multi-Dimensional Data RecoveryPoster
- SynParaSpeech: Automated Synthesis of Paralinguistic Datasets for Speech Generation and UnderstandingPoster
- Synaspot: A Lightweight, Streaming Multi-modal Framework for Keyword Spotting with Audio-Text SynergyPoster
- T-GEMS: TEXT-GUIDED EXIT MODULES FOR DECREASING CLIP IMAGE ENCODEROral
- T-Mimi: A Transformer-based Mimi Decoder for Real-Time On-Phone TTSPoster
- TAGARELA - A PORTUGUESE SPEECH DATASET FROM PODCASTSPoster
- TAMING THE LIGHT: ILLUMINATION-INVARIANT SEMANTIC 3DGS-SLAMPoster
- TARGET DETECTION IN TWO-CHANNEL PASSIVE RADARS WITH INTER-RECEIVER COLLABORATIONOral
- TARGETED POOLED LATENT-SPACE STEGANALYSIS APPLIED TO GENERATIVE STEGANOGRAPHY, WITH A FIXOral
- TASK-BASED ADAPTIVE TRANSMIT BEAMFORMING FOR EFFICIENT ULTRASOUND QUANTIFICATIONPoster
- TASU: TEXT-ONLY ALIGNMENT FOR SPEECH UNDERSTANDINGOral
- TAU: A BENCHMARK FOR CULTURAL SOUND UNDERSTANDING BEYOND SEMANTICSPoster
- TCATSEG: A TOOTH CENTER-WISE ATTENTION NETWORK FOR 3D DENTAL MODEL SEMANTIC SEGMENTATIONPoster
- TEACHER-STUDENT DIFFUSION MODEL FOR TEXT-DRIVEN 3D HAND MOTION GENERATIONPoster
- TEACHING THE TEACHERS: BOOSTING UNSUPERVISED DOMAIN ADAPTATION IN SPEECH RECOGNITION BY ENSEMBLE UPDATEPoster
- TEMPORAL CONTEXT AND ARCHITECTURE: A BENCHMARK FOR NATURALISTIC EEG DECODINGPoster
- TEMPORAL-AWARE HETEROGENEOUS GRAPH REASONING WITH MULTI-VIEW FUSION FOR TEMPORAL QUESTION ANSWERINGPoster
- TENSLORA: TENSOR ALTERNATIVES FOR LOW-RANK ADAPTATIONPoster
- TEST TIME ADAPTATION FOR SPEECH EMOTION RECOGNITIONPoster
- TEST-TIME ADAPTATION FOR SPEECH ENHANCEMENT VIA MASK POLARIZATIONPoster
- TESTAGENT: AUTOMATIC BENCHMARKING AND EXPLORATORY INTERACTION FOR EVALUATING LLMS IN VERTICAL DOMAINSOral
- TEXTLESSRAG: END-TO-END VISUAL DOCUMENT RAG BY SPEECH WITHOUT TEXTPoster
- TEXTS-Diff: TEXTS-Aware Diffusion Model for Real-World Text Image Super-ResolutionPoster
- TGPO: TREE-GUIDED PREFERENCE OPTIMIZATION FOR ROBUST WEB AGENT REINFORCEMENT LEARNINGPoster
- THE ACHILLES’ HEEL OF ANGULAR MARGINS: A CHEBYSHEV POLYNOMIAL FIX FOR SPEAKER VERIFICATIONPoster
- THE CURIOUS CASE OF VISUAL GROUNDING: DIFFERENT EFFECTS FOR SPEECH- AND TEXT-BASED LANGUAGE ENCODERSPoster
- THE ICASSP 2026 AUTOMATIC SONG AESTHETICS EVALUATION CHALLENGEPoster
- THE ICASSP 2026 HUMDIAL CHALLENGE: BENCHMARKING HUMAN-LIKE SPOKEN DIALOGUE SYSTEMS IN THE LLM ERAPoster
- THE IMPACT OF ABSTRACT AND OBJECT TAGS ON IMAGE PRIVACY CLASSIFICATIONPoster
- THE IMPACT OF AUDIO WATERMARKING ON AUDIO ANTI-SPOOFING COUNTERMEASURESOral
- THE ROLE OF PROSODIC AND LEXICAL CUES IN TURN-TAKING WITH SELF-SUPERVISED SPEECH REPRESENTATIONSOral
- THE SJTU X-LANCE LAB SYSTEM FOR MSR CHALLENGE 2025Poster
- THE TMU SYSTEM FOR THE XACLE CHALLENGE: TRAINING LARGE AUDIO LANGUAGE MODELS WITH CLAP PSEUDO-LABELSPoster
- THINK-AUGMENTED FUNCTION CALLING: IMPROVING LLM PARAMETER ACCURACY THROUGH EMBEDDED REASONINGPoster
- THINK-CLIP-SAMPLE: SLOW-FAST FRAME SELECTION FOR VIDEO UNDERSTANDINGPoster
- THINKING WHILE LISTENING: SIMPLE TEST TIME SCALING FOR AUDIO CLASSIFICATIONPoster
- TICL: TEXT-EMBEDDING KNN FOR SPEECH IN-CONTEXT LEARNING UNLOCKS SPEECH RECOGNITION ABILITIES OF LARGE MULTIMODAL MODELSPoster
- TIME VS. LAYER: LOCATING PREDICTIVE CUES FOR DYSARTHRIC SPEECH DESCRIPTORS IN WAV2VEC 2.0Oral
- TIME-FREQUENCY ANALYSIS OF NON-UNIFORMLY SAMPLED SIGNALS VIA SAMPLE DENSITY ADAPTATIONPoster
- TINYDROP: TINY MODEL GUIDED TOKEN DROPPING FOR VISION TRANSFORMERSPoster
- TINYMU: A COMPACT AUDIO-LANGUAGE MODEL FOR MUSIC UNDERSTANDINGPoster
- TIPS Over Tricks: Simple Prompts for Effective Zero-Shot Anomaly DetectionPoster
- TLDIFFGAN: A LATENT DIFFUSION-GAN FRAMEWORK WITH TEMPORAL INFORMATION FUSION FOR ANOMALOUS SOUND DETECTIONPoster
- TMD-TTS: A UNIFIED TIBETAN MULTI-DIALECT TEXT-TO-SPEECH FRAMEWORK FOR U-TSANG, AMDO AND KHAM SPEECH DATASET GENERATIONPoster
- TMT: Cross-domain Semantic Segmentation with Region-adaptive Transferability EstimationPoster
- TNET: TERRACE CONVOLUTIONAL DECODER NETWORK FOR REMOTE SENSING IMAGE SEMANTIC SEGMENTATIONOral
- TOEPLITZ UNLABELED SENSINGOral
- TOKENCHAIN: A DISCRETE SPEECH CHAIN VIA SEMANTIC TOKEN MODELINGPoster
- TOPOBIND: MULTI-MODAL PREDICTION OF ANTIBODY-ANTIGEN BINDING FREE ENERGY VIA SEQUENCE EMBEDDINGS AND STRUCTURAL TOPOLOGYPoster
- TOPSEG: A MULTI-SCALE TOPOLOGICAL FRAMEWORK FOR DATA-EFFICIENT HEART SOUND SEGMENTATIONOral
- TOPT: TASK-ORIENTED PROMPT TUNING FOR URBAN REGION REPRESENTATION LEARNINGPoster
- TOS: A TEAM OF SPECIALISTS ENSEMBLE FRAMEWORK FOR STEREO SOUND EVENT LOCALIZATION AND DETECTION WITH DISTANCE ESTIMATION IN VIDEOPoster
- TOWARDS BLIND DATA CLEANING: A CASE STUDY IN MUSIC SOURCE SEPARATIONPoster
- TOWARDS BUILDING SPEECH LARGE LANGUAGE MODELS FOR MULTITASK UNDERSTANDING IN LOW-RESOURCE LANGUAGESPoster
- TOWARDS DATA DRIFT MONITORING FOR SPEECH DEEPFAKE DETECTION IN THE CONTEXT OF MLOPSPoster
- TOWARDS EFFECTIVE NEGATION MODELING IN JOINT AUDIO-TEXT MODELS FOR MUSICPoster
- TOWARDS FAIR ASR FOR SECOND LANGUAGE SPEAKERS USING FAIRNESS PROMPTED FINETUNINGPoster
- TOWARDS LANGUAGE-INDEPENDENT FACE-VOICE ASSOCIATION WITH MULTIMODAL FOUNDATION MODELSPoster
- TOWARDS LIGHTWEIGHT ADAPTATION OF SPEECH ENHANCEMENT MODELS IN REAL-WORLD ENVIRONMENTSPoster
- TOWARDS NOISE-ROBUST SPEECH INVERSION THROUGH MULTI-TASK LEARNING WITH SPEECH ENHANCEMENTPoster
- TOWARDS ORTHOGRAPHICALLY-INFORMED EVALUATION OF SPEECH RECOGNITION SYSTEMS FOR INDIAN LANGUAGESPoster
- TOWARDS PRIVACY-PRESERVING FINE-GRAINED VISUAL CLASSIFICATION VIA HIERARCHICAL LEARNING FROM LABEL PROPORTIONSPoster
- TOWARDS REAL-TIME GENERATIVE SPEECH RESTORATION WITH FLOW-MATCHINGPoster
- TOWARDS RELIABLE TIME SERIES FORECASTING UNDER FUTURE UNCERTAINTY: AMBIGUITY AND NOVELTY REJECTION MECHANISMSPoster
- TOWARDS ROBUST DYSARTHRIC SPEECH RECOGNITION: LLM-AGENT POST-ASR CORRECTION BEYOND WERPoster
- TRAINING-FREE MULTIMODAL GUIDANCE FOR VIDEO TO AUDIO GENERATIONPoster
- TRAINING-FREE TEST-TIME ADAPTATION WITH BROWNIAN DISTANCE COVARIANCE IN VISION-LANGUAGE MODELSPoster
- TRIAGE: HIERARCHICAL VISUAL BUDGETING FOR EFFICIENT VIDEO REASONING IN VISION-LANGUAGE MODELSOral
- TRICON-FAIR: TRIPLET CONTRASTIVE LEARNING FOR MITIGATING SOCIAL BIAS IN PRE-TRAINED LANGUAGE MODELSPoster
- TRIM: A SELF-SUPERVISED VIDEO SUMMARIZATION FRAMEWORK MAXIMIZING TEMPORAL RELATIVE INFORMATION AND REPRESENTATIVENESSPoster
- TSQLORA: TOWARDS SENSITIVITY AND QUALITY LOW-RANK ADAPTATION FOR EFFICIENT FINE-TUNINGOral
- TTA: TRANSCRIBE, TRANSLATE AND ALIGNMENT FOR CROSS-LINGUAL SPEECH REPRESENTATIONPoster
- TWO-DIMENSIONAL TOMOGRAPHIC RECONSTRUCTION FROM PROJECTIONS WITH UNKNOWN ANGLES AND UNKNOWN SPATIAL SHIFTSPoster
- TWO-STAGE AUDIO-VISUAL TARGET SPEAKER EXTRACTION SYSTEM FOR REAL-TIME PROCESSING ON EDGE DEVICEPoster
- TWO-STAGE GRID OPTIMIZATION FOR GROUP-WISE QUANTIZATION OF LLMSPoster
- Taming Audio VAEs via Target-KL RegularizationPoster
- Target speaker anonymization in multi-speaker recordingsOral
- Targeted Fine-Tuning of DNN-Based Receivers via Influence FunctionsOral
- Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech SynthesisPoster
- Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video ParsingPoster
- Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-wise DistillationPoster
- Tell Me What to Track: Infusing Robust Language Guidance for Enhanced Referring Multi-Object TrackingPoster
- Temporal-Spatial Decouple before Act: Disentangled Representation Learning for Multimodal Sentiment AnalysisOral
- Temporally Heterogeneous Graph Contrastive Learning for Multimodal Acoustic Event ClassificationPoster
- TennisTV: Do Multimodal Large Language Models Understand Tennis Rallies?Oral
- Text2Move: Text-to-moving sound generation via trajectory prediction and temporal alignmentPoster
- Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time AlignmentPoster
- The MUSE Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMsPoster
- Thinking in a Crowd: How Auxiliary Information Shapes LLM ReasoningPoster
- TidyVoice: A Curated Multilingual Dataset for Speaker Verification Derived from Common VoicePoster
- Time-Shifted Token Scheduling for Symbolic Music GenerationPoster
- Topological Signal Processing for 3D Point Cloud DataPoster
- Toward Faithful Explanations in Acoustic Anomaly DetectionPoster
- Towards Evaluating Generative Audio: Insights from Neural Audio Codec Embedding DistancesPoster
- Towards Explainable Privacy Preservation in Federated Learning via Shapley Value-Guided Noise InjectionPoster
- Towards Robust Visual Continual Learning with Multi-Prototype SupervisionOral
- Tracking Listener Attention: Gaze-Guided Audio-Visual Speech Enhancement FrameworkPoster
- Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long AudioPoster
- Training Dynamics-Aware Multi-Factor Curriculum Learning for Target Speaker ExtractionOral
- Training Flow Matching Models with Reliable Labels via Self-PurificationPoster
- Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial ReaSoningPoster
- Transfer Learning for Paediatric Sleep Apnoea Detection Using Physiology-Guided Acoustic ModelsPoster
- Tri-Hybrid Beamforming Design for Integrated Sensing and CommunicationsOral
- Triage knowledge distillation for speaker verificationOral
- TurtleBench: Evaluating Top Language Models via Real-World Yes/No PuzzlesPoster
- U-DAVI: UNCERTAINTY-AWARE DIFFUSION-PRIOR-BASED AMORTIZED VARIATIONAL INFERENCE FOR IMAGE RECONSTRUCTIONPoster
- ULW-SLEEPNET: AN ULTRA-LIGHTWEIGHT NETWORK FOR MULTIMODAL SLEEP STAGE SCORINGPoster
- UMA-SPLIT: UNIMODAL AGGREGATION FOR BOTH ENGLISH AND MANDARIN NON-AUTOREGRESSIVE SPEECH RECOGNITIONPoster
- UNCERTAINTY-AWARE 3D EMOTIONAL TALKING FACE SYNTHESIS WITH EMOTION PRIOR DISTILLATIONPoster
- UNCERTAINTY-AWARE PROTOTYPE LEARNING WITH VARIATIONAL INFERENCE FOR FEW-SHOT POINT CLOUD SEGMENTATIONOral
- UNCERTAINTY-BASED ENSEMBLE LEARNING IN CMR SEMANTIC SEGMENTATIONPoster
- UNCOVERING OVERCONFIDENT FAILURES IN CXR MODELS VIA AUGMENTATION-SENSITIVITY RISK SCORINGPoster
- UNDERSTANDING FRECHET SPEECH DISTANCE FOR SYNTHETIC SPEECH QUALITY EVALUATIONOral
- UNDERSTANDING TEXTUAL CAPABILITY DEGRADATION IN SPEECH LLMS VIA PARAMETER IMPORTANCE ANALYSISOral
- UNDERSTANDING THE STRENGTHS AND WEAKNESSES OF SSL MODELS FOR AUDIO DEEPFAKE MODEL ATTRIBUTIONOral
- UNIFIED MULTIMODAL AND MULTILINGUAL RETRIEVAL VIA MULTI-TASK LEARNING WITH NLU INTEGRATIONPoster
- UNIGEO: A UNIFIED 3D INDOOR OBJECT DETECTION FRAMEWORK INTEGRATING GEOMETRY-AWARE LEARNING AND DYNAMIC CHANNEL GATINGPoster
- UNIPACT: A MULTIMODAL FRAMEWORK FOR PROGNOSTIC QUESTION ANSWERING ON RAW ECG AND STRUCTURED EHROral
- UNIT-BASED AGENT FOR SEMI-CASCADED FULL-DUPLEX DIALOGUE SYSTEMSPoster
- UNLOCKING HIDDEN POTENTIAL IN POINT CLOUD NETWORKS WITH ATTENTION-GUIDED GROUPING-FEATURE COORDINATIONPoster
- UNMIXX: UNTANGLING HIGHLY CORRELATED SINGING VOICES MIXTURESPoster
- UNROLLED GRAPH NEURAL NETWORKS FOR CONSTRAINED OPTIMIZATIONPoster
- UNSEEN BUT NOT UNKNOWN: USING DATASET CONCEALMENT TO ROBUSTLY EVALUATE SPEECH QUALITY ESTIMATION MODELSPoster
- UNSUPERVISED LEXICON LEARNING FROM SPEECH IS LIMITED BY REPRESENTATIONS RATHER THAN CLUSTERINGPoster
- UNWRAPDIFF: A CONDITIONAL DIFFUSION MODEL FOR INSAR PHASE UNWRAPPINGPoster
- UP TO 36X SPEEDUP: MASK-BASED PARALLEL INFERENCE PARADIGM FOR KEY INFORMATION EXTRACTION IN MLLMSPoster
- USCTNET: A DEEP UNFOLDING NUCLEAR-NORM OPTIMIZATION SOLVER FOR PHYSICALLY CONSISTENT HSI RECONSTRUCTIONPoster
- UTI-LLM: A Personalized Articulatory-Speech Therapy Assistance System Based on Multimodal Large Language ModelOral
- Ultra-Reliable Risk-Aggregated Sum Rate Maximization via Model-Aided Deep LearningPoster
- Uncertainty-Gated Deformable Network for Breast Tumor Segmentation in MR imagesPoster
- Unconditional flow-based time series generation with equivariance-regularised latent spacesOral
- UniSTFormer: Unified Spatio-Temporal Lightweight Transformer for Efficient Skeleton-Based Action RecognitionOral
- UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow MatchingPoster
- UnlearnShield: Shielding Forgotten Privacy against Unlearning InversionPoster
- Unleashing Vision Transformer Potential in Image Quality Assessment via Global-Local Adaptive InteractionPoster
- Utilising Gradient-Based Proposals Within Sequential Monte Carlo Samplers for Training of Partial Bayesian Neural NetworksPoster
- Utilizing Information Theoretic Approach to Study Cochlear Neural DegenerationPoster
- V2A-DPO: OMNI-PREFERENCE OPTIMIZATION FOR VIDEO-TO-AUDIO GENERATIONPoster
- VASGUIDENET: VASCULAR TOPOLOGY-GUIDED COUINAUD LIVER SEGMENTATION WITH STRUCTURAL CONTRASTIVE LOSSPoster
- VBX FOR END-TO-END NEURAL AND CLUSTERING-BASED DIARIZATIONPoster
- VCE: A ZERO-COST HALLUCINATION MITIGATION METHOD OF LVLMS VIA VISUAL CONTRASTIVE EDITINGOral
- VELOCITY POTENTIAL NEURAL FIELD FOR EFFICIENT AMBISONICS IMPULSE RESPONSE MODELINGOral
- VIA SCORE TO PERFORMANCE: EFFICIENT HUMAN-CONTROLLABLE LONG SONG GENERATION WITH BAR-LEVEL SYMBOLIC NOTATIONPoster
- VIRTUAL CONSISTENCY FOR AUDIO EDITINGOral
- VISION KAN: TOWARDS AN ATTENTION-FREE BACKBONE FOR VISION WITH KOLMOGOROV-ARNOLD NETWORKSPoster
- VITEX: VISUAL TEXTURE CONTROL FOR MULTI-TRACK SYMBOLIC MUSIC GENERATION VIA DISCRETE DIFFUSION MODELSPoster
- VIVIDVOICE: A UNIFIED FRAMEWORK FOR SCENE-AWARE VISUALLY-DRIVEN SPEECH SYNTHESISPoster
- VM-UNSSOR: Unsupervised Neural Speech Separation Enhanced by Higher-SNR Virtual Microphone ArraysPoster
- VNODE: A PIECEWISE CONTINUOUS VOLTERRA NEURAL NETWORKPoster
- VOCALNET-M2: ADVANCING LOW-LATENCY SPOKEN LANGUAGE MODELING VIA INTEGRATED MULTI-CODEBOOK TOKENIZATION AND MULTI-TOKEN PREDICTIONPoster
- VOTING-BASED PITCH ESTIMATION WITH TEMPORAL AND FREQUENTIAL ALIGNMENT AND CORRELATION AWARE SELECTIONOral
- VOXMORPH: SCALABLE ZERO-SHOT VOICE IDENTITY MORPHING VIA DISENTANGLED EMBEDDINGSOral
- VQEzy: AN OPEN-SOURCE DATASET FOR PARAMETER INITIALIZATION IN VARIATIONAL QUANTUM EIGENSOLVERSOral
- VSE: VARIATIONAL STATE ESTIMATION OF COMPLEX MODEL-FREE PROCESSPoster
- VSTYLE: A BENCHMARK FOR VOICE STYLE ADAPTATION WITH SPOKEN INSTRUCTIONSPoster
- VTONGuard: Automatic Detection and Authentication of AI-Generated Virtual Try-On ContentPoster
- Variational Low-Rank Adaptation for Personalized Impaired Speech RecognitionPoster
- Video-based Heart Rate Estimation with Angle-guided ROI Optimization and Graph Signal DenoisingPoster
- VioPTT: Violin Technique-Aware Transcription from Synthetic Data AugmentationPoster
- VoXtream: Full-Stream Text-to-Speech with Extremely Low LatencyOral
- VoxGuard: Evaluating user and attribute privacy in speech via Membership Inference AttacksPoster
- WARP QUANTIFICATION ANALYSIS: A FRAMEWORK FOR PATH-BASED SIGNAL ALIGNMENT METRICSOral
- WAVE-GMS: LIGHTWEIGHT MULTI-SCALE GENERATIVE MODEL FOR MEDICAL IMAGE SEGMENTATIONPoster
- WAVE-TRAINER-FIT: NEURAL VOCODER WITH TRAINABLE PRIOR AND FIXED-POINT ITERATION TOWARDS HIGH-QUALITY SPEECH GENERATION FROM SSL FEATURESPoster
- WAVELET-AWARE ANOMALY DETECTION IN MULTI-CHANNEL USER LOGS VIA DEVIATION MODULATION AND RESOLUTION-ADAPTIVE ATTENTIONPoster
- WAVELETGAUSSIAN: WAVELET-DOMAIN DIFFUSION FOR SPARSE-VIEW 3D GAUSSIAN OBJECT RECONSTRUCTIONPoster
- WAVENEXT 2: CONVNEXT-BASED FAST NEURAL VOCODERS WITH RESIDUAL DENOISING AND SUB-MODELING FOR GAN AND DIFFUSION MODELSPoster
- WAVLINK: COMPACT AUDIO–TEXT EMBEDDINGS WITH A GLOBAL WHISPER TOKENOral
- WEATHER-R1: LOGICALLY CONSISTENT REINFORCEMENT FINE-TUNING FOR MULTIMODAL REASONING IN METEOROLOGYPoster
- WEBEXPERT: DOMAIN-AWARE WEB AGENTS WITH CRITIC-GUIDED EXPERT EXPERIENCE FOR HIGH-PRECISION SEARCHPoster
- WEEP: A Differentiable Nonconvex Sparse Regularizer via Weakly-Convex EnvelopeOral
- WEIGHTED TEMPORAL DECAY LOSS FOR LEARNING WEARABLE PPG DATA WITH SPARSE CLINICAL LABELSPoster
- WENETSPEECH-CHUAN: A LARGE-SCALE SICHUANESE CORPUS WITH RICH ANNOTATION FOR DIALECTAL SPEECH PROCESSINGPoster
- WHEN LARGE VISION-LANGUAGE MODELS MEET PERSON RE-IDENTIFICATIONPoster
- WHEN NOISE LOWERS THE LOSS: RETHINKING LIKELIHOOD-BASED EVALUATION IN MUSIC LARGE LANGUAGE MODELSPoster
- WHEN SILENCE MATTERS: THE IMPACT OF IRRELEVANT AUDIO ON TEXT REASONING IN LARGE AUDIO-LANGUAGE MODELSPoster
- WHERE, NOT WHAT: COMPELLING VIDEO LLMS TO LEARN GEOMETRIC CAUSALITY FOR 3D-GROUNDINGPoster
- WHISPER-MLA: REDUCING GPU MEMORY CONSUMPTION OF ASR MODELS BASED ON MHA2MLA CONVERSIONPoster
- WHISPER: COURTSIDE EDITION - ENHANCING ASR PERFORMANCE THROUGH LLM-DRIVEN CONTEXT GENERATIONPoster
- WHY DO SPEECH LANGUAGE MODELS FAIL TO GENERATE SEMANTICALLY COHERENT OUTPUTS? A MODALITY EVOLVING PERSPECTIVEOral
- WIFISIM: SIMULATING WIFI PROBE REQUESTS VIA AOSP ANALYSIS AND DEVICE BEHAVIOR MODELINGPoster
- WINDOWED SUMMARYMIXING: AN EFFICIENT FINE-TUNING OF SELF-SUPERVISED LEARNING MODELS FOR LOW-RESOURCE SPEECH RECOGNITIONPoster
- WMOE-CLIP: WAVELET-ENHANCED MIXTURE-OF-EXPERTS PROMPT LEARNING FOR ZERO-SHOT ANOMALY DETECTIONOral
- WRAPPER-AWARE RATE-DISTORTION OPTIMIZATION IN FEATURE CODING FOR MACHINESPoster
- WaterFlow: Explicit Physics-Prior Rectified Flow for Underwater Saliency Mask GenerationPoster
- WaveSP-Net: Learnable Wavelet-Domain Sparse Prompt Tuning for Speech Deepfake DetectionPoster
- WebRouter: Query-specific Router via Variational Information Bottleneck for Cost-sensitive Web AgentPoster
- What You Feel Is Not What They See: On Predicting Self-Reported Emotion from Third-Party Observer LabelsOral
- When Differential Privacy Meets Wireless Federated Learning: An Improved Analysis for Privacy and ConvergenceOral
- Which private attributes do VLMs agree on and predict well?Poster
- Whitening Spherical Gaussian Mixtures in the Large-Dimensional RegimeOral
- WiFi-GEN: High-Resolution Indoor Imaging from WiFi Signals Using Generative AIPoster
- XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice AssociationPoster
- Xi+: Uncertainty Supervision for Robust Speaker EmbeddingPoster
- Z-SCORES: A METRIC FOR LINGUISTICALLY ASSESSING DISFLUENCY REMOVALPoster
- ZERO-SHOT TTS WITH ENHANCED AUDIO PROMPTS: BSC SUBMISSION FOR THE 2026 WILDSPOOF CHALLENGE TTS TRACKPoster
- Zero-Shot VISUAL GROUNDING in 3D Gaussians via View RetrievalPoster
- mmWave-Diffusion: A Novel Framework for Respiration Sensing Using Observation-Anchored Conditional Diffusion ModelOral
- pFedSAM: Personalized Federated Learning of Segment Anything Model for Medical Image SegmentationPoster
- variance & greediness: a comparative study of metric-learning lossesPoster
ICASSP accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.