← All conferences

ICASSP 2026 Accepted Papers

The full list of 1,432 papers accepted at ICASSP 2026 (IEEE International Conference on Acoustics, Speech and Signal Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Poster: 1,085Oral: 347
  1. QASTANET: A DNN-BASED QUALITY METRIC FOR SPATIAL AUDIOOral
  2. QUADRATURE OVER-THE-AIR-COMPUTING FOR MULTIMODAL DUAL-STREAM SIGNAL PROCESSINGPoster
  3. QUALITY ASSESSMENT OF NOISY AND ENHANCED SPEECH WITH LIMITED DATA: UWB-NTIS SYSTEM FOR VOICEMOS 2024Oral
  4. QUANTIZATION-BASED SCORE CALIBRATION FOR FEW-SHOT KEYWORD SPOTTING WITH DYNAMIC TIME WARPING IN NOISY ENVIRONMENTSPoster
  5. QUSR: QUALITY-AWARE AND UNCERTAINTY-GUIDED IMAGE SUPER-RESOLUTION DIFFUSION MODELPoster
  6. Quantifying Speaker Embedding Phonological Rule Interactions in Accented Speech SynthesisPoster
  7. Quantile Randomized Kaczmarz Algorithm with Whitelist Trust MechanismPoster
  8. Quantum Adaptive Self-Attention for Financial Rebalancing: An Empirical Study on Automated Market Makers in Decentralized FinanceOral
  9. Quantum Reinforcement Learning-Guided Diffusion Model for Image Synthesis via Hybrid Quantum-Classical Generative Model ArchitecturesOral
  10. RADAREYE: ROBUST LIQUID LEVEL TRACKING USING MMWAVE RADAR IN ROBOTIC POURINGPoster
  11. RADIOLUNADIFF: ESTIMATION OF WIRELESS NETWORK SIGNAL STRENGTH IN LUNAR TERRAINPoster
  12. RANKING-AWARE REINFORCEMENT LEARNING FOR ORDINAL RANKINGPoster
  13. RAP: Real-time Audio-driven Portrait Animation with Video Diffusion TransformerOral
  14. RATE-DISTORTION ANALYSIS OF OPTICALLY PASSIVE VISION COMPRESSIONOral
  15. RAVE: RATE-ADAPTIVE VISUAL ENCODING FOR 3D GAUSSIAN SPLATTINGOral
  16. RAVE: Retrieval and Scoring Aware Verifiable Claim DetectionPoster
  17. READING BETWEEN THE WAVES: ROBUST TOPIC SEGMENTATION USING INTER-SENTENCE AUDIO FEATURESPoster
  18. REAL-TIME CARFAC COCHLEA MODEL ACCELERATION ON FPGA FOR UNDERWATER ACOUSTIC SENSING SYSTEMSPoster
  19. REAL-TIME MARKOV MODELING FOR SINGLE-PHOTON LIDAR: 1000× ACCELERATION AND CONVERGENCE ANALYSISPoster
  20. REAL-TIME STREAMING MEL VOCODING WITH GENERATIVE FLOW MATCHINGOral
  21. RECOM: REALISTIC CO-SPEECH MOTION GENERATION WITH RECURRENT EMBEDDED TRANSFORMERPoster
  22. RECOVERING PERFORMANCE IN SPEECH EMOTION RECOGNITION FROM DISCRETE TOKENS VIA MULTI-LAYER FUSION AND PARALINGUISTIC FEATURE INTEGRATIONOral
  23. RECOVERING WASSERSTEIN DISTANCE MATRICES FROM FEW MEASUREMENTSPoster
  24. RECURRENT CONFIDENCE CHAIN: TEMPORAL-AWARE UNCERTAINTY QUANTIFICATION IN LARGE LANGUAGE MODELSPoster
  25. REDUCING PROMPT SENSITIVITY IN LLM-BASED SPEECH RECOGNITION THROUGH LEARNABLE PROJECTIONOral
  26. REFERENCE MICROPHONE SELECTION FOR GUIDED SOURCE SEPARATION BASED ON THE NORMALIZED L-P NORMPoster
  27. REFERENCE-AWARE SFM LAYERS FOR INTRUSIVE INTELLIGIBILITY PREDICTIONPoster
  28. REFINEBRIDGE: GENERATIVE BRIDGE MODELS IMPROVE FINANCIAL FORECASTING BY FOUNDATION MODELSOral
  29. REFLECTIVE CONFIDENCE: CORRECTING REASONING FLAWS VIA ONLINE SELF-CORRECTIONOral
  30. REINPATH: A MULTIMODAL REINFORCEMENT LEARNING APPROACH FOR PATHOLOGYPoster
  31. RELUNET: RELATIVE CHANNEL FUSION U-NET FOR MULTICHANNEL SPEECH ENHANCEMENTPoster
  32. REMOTEDET-MAMBA: A HYBRID MAMBA-CNN NETWORK FOR MULTI-MODAL OBJECT DETECTION IN REMOTE SENSING IMAGESPoster
  33. RESIDUAL VECTOR QUANTIZATION FOR COMMUNICATION-EFFICIENT MULTI-AGENT PERCEPTIONPoster
  34. RETHINKING LARGE LANGUAGE MODELS FOR IRREGULAR TIME SERIES CLASSIFICATION IN CRITICAL CAREOral
  35. RETHINKING MUSIC CAPTIONING WITH MUSIC METADATA LLMSPoster
  36. RETLLM: TRAINING AND DATA-FREE MLLMS FOR MULTIMODAL INFORMATION RETRIEVALPoster
  37. RETRIEVEALL: A MULTILINGUAL NAMED ENTITY RECOGNITION FRAMEWORK WITH LARGE LANGUAGE MODELSPoster
  38. REVISITING DIRECT SPEECH-TO-TEXT TRANSLATION WITH SPEECH LLMS: BETTER SCALING THAN COT PROMPTING?Poster
  39. RFM-EDITING: RECTIFIED FLOW MATCHING FOR TEXT-GUIDED AUDIO EDITINGPoster
  40. RFOP: Rethinking Fusion and Orthogonal Projection for Face-Voice AssociationPoster
  41. RHO-PERFECT: CORRELATION CEILING FOR SUBJECTIVE EVALUATION DATASETSPoster
  42. RHOSI: Efficient Anti-Jamming Resource Allocation with Holographic Surfaces in UAV-enabled ISACOral
  43. RHYTHMBERT: A SELF-SUPERVISED LANGUAGE MODEL BASED ON LATENT REPRESENTATIONS OF ECG WAVEFORMS FOR HEART DISEASE DETECTIONOral
  44. RIR-FORMER: COORDINATE-GUIDED TRANSFORMER FOR CONTINUOUS RECONSTRUCTION OF ROOM IMPULSE RESPONSESPoster
  45. RIS-ENHANCED INFORMATION-DECOUPLED SYMBIOTIC RADIO OVER BROADCASTING SIGNALSOral
  46. RIS-FUSION: RETHINKING TEXT-DRIVEN INFRARED AND VISIBLE IMAGE FUSION FROM THE PERSPECTIVE OF REFERRING IMAGE SEGMENTATIONOral
  47. RLBR: REINFORCEMENT LEARNING WITH BIASING REWARDS FOR CONTEXTUAL SPEECH LARGE LANGUAGE MODELSPoster
  48. RMT-KD: RANDOM MATRIX THEORETIC CAUSAL KNOWLEDGE DISTILLATIONPoster
  49. RO-BENCH: LARGE-SCALE ROBUSTNESS EVALUATION OF MLLMS WITH TEXT-DRIVEN COUNTERFACTUAL VIDEOSPoster
  50. ROBUST ACCENT IDENTIFICATION VIA VOICE CONVERSION AND NON-TIMBRAL EMBEDDINGSPoster
  51. ROBUST GROUNDING WITH MLLMS AGAINST OCCLUSION AND SMALL OBJECTS VIA LANGUAGE-GUIDED SEMANTIC CUESPoster
  52. ROBUST MULTIMODAL REPRESENTATION LEARNING IN HEALTHCAREPoster
  53. ROBUST MULTIMODAL REPRESENTATION LEARNING IN HEALTHCAREPoster
  54. ROBUST ONLINE OVERDETERMINED INDEPENDENT VECTOR ANALYSIS BASED ON BILINEAR DECOMPOSITIONOral
  55. ROBUST PROVABLY SECURE IMAGE STEGANOGRAPHY VIA LATENT ITERATIVE OPTIMIZATIONPoster
  56. ROBUST UNCERTAINTY ESTIMATION UNDER DISTRIBUTION SHIFT VIA DIFFERENCE RECONSTRUCTIONOral
  57. ROBUST, ONLINE, AND ADAPTIVE DECENTRALIZED GAUSSIAN PROCESSESOral
  58. RPM-NET: RECIPROCAL POINT MLP NETWORK FOR UNKNOWN NETWORK SECURITY THREAT DETECTIONPoster
  59. RRPO: ROBUST REWARD POLICY OPTIMIZATION FOR LLM-BASED EMOTIONAL TTSOral
  60. RaFD: Flow-Guided Radar Detection for Robust Autonomous DrivingOral
  61. Read Before You Think: Mitigating LLM Comprehension Failures with Step-by-Step ReadingPoster
  62. Readout-Side Bypass for Residual Hybrid Quantum-Classical ModelsOral
  63. Real-World Adversarial Attacks on RF-Based Drone DetectorsPoster
  64. Reasoning Beyond Majority Vote: An Explainable SpeechLM Framework for Speech Emotion RecognitionOral
  65. Reconstructing Topology-Consistent Face Mesh by Volume Rendering from Multi-View ImagesPoster
  66. Recursive state estimation via approximate modal pathsOral
  67. Reg3D: Reconstructive Geometry Instruction Tuning for 3D Scene UnderstandingOral
  68. Repeater-Assisted Massive MIMO Full-Duplex CommunicationsOral
  69. Representation-Based Data Quality Audits for AudioPoster
  70. Residual Tokens Enhance Masked Autoencoders for Speech ModelingOral
  71. Rethinking Fusion: Disentangled Learning of Shared and Modality-Specific Information for Stance DetectionPoster
  72. Rethinking Oversaturation in Classifier-Free Guidance via Low FrequencyPoster
  73. Rethinking Self-Training Based Cross-Subject Domain Adaptation for SSVEP ClassificationOral
  74. Rethinking Speech Representation Aggregation in Speech Enhancement: a Phonetic Mutual Information PerspectivePoster
  75. Revisiting Backdoor Threat in Federated Instruction Tuning from a Signal Aggregation PerspectivePoster
  76. Revisiting the Seasonal Trend Decomposition for Enhanced Time Series ForecastingPoster
  77. Riemannian optimization on the manifold of unitary and symmetric matrices with application to BD-RIS-assisted systemsPoster
  78. Risk level dependent Minimax Quantile lower bounds for Interactive Statistical Decision MakingPoster
  79. Robust MAE-Driven NAS: From Mask Reconstruction to Architecture InnovationPoster
  80. Robust Personalized Recommendation under Hidden Confounding in MNARPoster
  81. Robust TTS Training via Self-Purifying Flow Matching for the WildSpoof 2026 TTS TrackPoster
  82. Robust and Efficient Autoregressive Speech Synthesis with Dynamic Chunk-wise Prediction PolicyPoster
  83. S-PRESSO: ULTRA LOW BITRATE SOUND EFFECT COMPRESSION WITH DIFFUSION AUTOENCODERS AND OFFLINE QUANTIZATIONOral
  84. S-SONDO: SELF-SUPERVISED KNOWLEDGE DISTILLATION FOR GENERAL AUDIO FOUNDATION MODELSPoster
  85. S2TX: CROSS-ATTENTION MULTI-SCALE STATE-SPACE TRANSFORMER FOR TIME SERIES FORECASTINGOral
  86. SA-SSL-MOS: SELF-SUPERVISED LEARNING MOS PREDICTION WITH SPECTRAL AUGMENTATION FOR GENERALIZED MULTI-RATE SPEECH ASSESSMENTOral
  87. SAEC: Scene-Aware Enhanced Edge-Cloud Collaborative Industrial Vision Inspection with Multimodal LLMPoster
  88. SAFE-IMM: ROBUST AND LIGHTWEIGHT RADAR-BASED OBJECT TRACKING ON MOBILE PLATFORMSPoster
  89. SAGA-SR: SEMANTICALLY AND ACOUSTICALLY GUIDED AUDIO SUPER-RESOLUTIONOral
  90. SAGE: SEMANTIC-AWARE SHARED SAMPLING FOR EFFICIENT DIFFUSIONOral
  91. SAIP: A PLUG-AND-PLAY SCALE-ADAPTIVE MODULE IN DIFFUSION-BASED INVERSE PROBLEMSPoster
  92. SALAD-VAE: Semantic Audio Compression with Language-Audio DistillationPoster
  93. SAMAS: A SPECTRUM-GUIDED MULTI-AGENT SYSTEM FOR ACHIEVING STYLE FIDELITY IN LITERARY TRANSLATIONPoster
  94. SAMPLE EFFICIENT EXPERIENCE REPLAY IN NON-STATIONARY ENVIRONMENTSPoster
  95. SAMPLE WEIGHT AVERAGING FOR STABLE PREDICTIONPoster
  96. SARNET: A SPIKE-AWARE CONSECUTIVE VALIDATION FRAMEWORK FOR ACCURATE REMAINING USEFUL LIFE PREDICTIONOral
  97. SATURATION-AWARE SNAPSHOT COMPRESSIVE IMAGING: THEORY AND ALGORITHMOral
  98. SAVGBENCH: BENCHMARKING SPATIALLY ALIGNED AUDIO-VIDEO GENERATIONPoster
  99. SCALABLE EVALUATION FOR AUDIO IDENTIFICATION VIA SYNTHETIC LATENT FINGERPRINT GENERATIONOral
  100. SCALABLE HESSIAN-FREE PROXIMAL CONJUGATE GRADIENT METHOD FOR NONCONVEX AND NONSMOOTH OPTIMIZATIONOral
  101. SCALE-AWARE SELF-SUPERVISED LEARNING FOR SEGMENTATION OF SMALL AND SPARSE STRUCTURESPoster
  102. SCALING AUDIO-VISUAL QUALITY ASSESSMENT DATASET VIA CROWDSOURCINGOral
  103. SCALING MULTI-TALKER ASR WITH SPEAKER-AGNOSTIC ACTIVITY STREAMSOral
  104. SCATTERFUSION: A HIERARCHICAL SCATTERING TRANSFORM FRAMEWORK FOR ENHANCED TIME SERIES FORECASTINGPoster
  105. SCENE: SEMANTIC-AWARE CODEC ENHANCEMENT WITH NEURAL EMBEDDINGSPoster
  106. SCENERAG: SCENE-LEVEL RETRIEVAL-AUGMENTED GENERATION FOR VIDEO UNDERSTANDINGPoster
  107. SCHROMIND: MITIGATING HALLUCINATIONS IN MULTIMODAL LARGE LANGUAGE ¨ MODELS VIA SOLVING THE SCHRODINGER BRIDGE PROBLEMOral
  108. SCORENF: SCORE-BASED NORMALIZING FLOWS FOR SAMPLING UNNORMALIZED DISTRIBUTIONSPoster
  109. SDGF: Fusing Static and Multi-Scale Dynamic Correlations for Multivariate Time Series ForecastingPoster
  110. SE-DiCoW: Self-Enrolled Diarization-Conditioned WhisperOral
  111. SEE NO EVIL: SEMANTIC CONTEXT-AWARE PRIVACY RISK DETECTION FOR ARPoster
  112. SEE WHAT YOU NEED: QUERY-AWARE VISUAL INTELLIGENCE THROUGH REASONING-PERCEPTION LOOPSPoster
  113. SEGMENTWISE PRUNING IN AUDIO-LANGUAGE MODELSPoster
  114. SELF-CALIBRATING INTEGRATE-AND-FIRE TIME ENCODING MACHINEPoster
  115. SEMAMIL: SEMANTIC-AWARE MULTIPLE INSTANCE LEARNING WITH RETRIEVAL-GUIDED STATE SPACE MODELING FOR WHOLE SLIDE IMAGESPoster
  116. SEMANTIC REFORMULATION ENTROPY FOR ROBUST HALLUCINATION DETECTION IN QA TASKSPoster
  117. SEMANTIC-AWARE UAV COMMAND AND CONTROL FOR EFFICIENT IOT DATA COLLECTIONPoster
  118. SEMANTICACHE: EFFICIENT KV CACHE COMPRESSION VIA SEMANTIC CHUNKING AND CLUSTERED MERGINGOral
  119. SEMITOOTH: A GENERALIZABLE SEMI-SUPERVISED FRAMEWORK FOR MULTI-SOURCE TOOTH SEGMENTATIONPoster
  120. SEPARABLE DELAY AND DOPPLER ESTIMATION IN PASSIVE RADAROral
  121. SEPARATE THIS, AND ALL OF THESE THINGS AROUND IT: MUSIC SOURCE SEPARATION VIA HYPERELLIPSOIDAL QUERIESOral
  122. SESSION-LEVEL SPOKEN LANGUAGE ASSESSMENT WITH A MULTIMODAL FOUNDATION MODEL VIA MULTI-TARGET LEARNINGPoster
  123. SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and CalibrationPoster
  124. SFGNET: SEMANTIC AND FREQUENCY GUIDED NETWORK FOR CAMOUFLAGED OBJECT DETECTIONPoster
  125. SFQA: A Comprehensive Perceptual Quality Assessment Dataset for Singing Face GenerationOral
  126. SG-Splatting: Accelerating 3D Gaussian Splatting with Spherical GaussiansOral
  127. SHARED MULTI-MODAL EMBEDDING SPACE FOR FACE-VOICE ASSOCIATIONPoster
  128. SHARED REPRESENTATION LEARNING FOR REFERENCE-GUIDED TARGETED SOUND DETECTIONOral
  129. SHARED-WEIGHTS EXTENDER AND GRADIENT VOTING FOR NEURAL NETWORK EXPANSIONPoster
  130. SHARPNESS-AWARE MINIMIZATION WITH Z-SCORE GRADIENT FILTERINGPoster
  131. SHORT-SEGMENT SPEAKER VERIFICATION WITH PRE-TRAINED MODELS AND MULTI-RESOLUTION ENCODERPoster
  132. SIE3D: SINGLE-IMAGE EXPRESSIVE 3D AVATAR GENERATION VIA SEMANTIC EMBEDDING AND PERCEPTUAL EXPRESSION LOSSPoster
  133. SIGNED GRAPH UNLEARNINGPoster
  134. SILENT SPEECH SENTENCE RECOGNITION WITH SIX-AXIS ACCELEROMETERS USING CONFORMER AND CTC ALGORITHMPoster
  135. SIM-MSTNET: SIM2REAL BASED MULTI-TASK SPATIOTEMPORAL NETWORK TRAFFIC FORECASTINGOral
  136. SIMPLICIAL GAUSSIAN MODELS: REPRESENTATION AND INFERENCEOral
  137. SIMTOKEN: A SIMPLE BASELINE FOR REFERRING AUDIO-VISUAL SEGMENTATIONPoster
  138. SIMULATORCODER: DNN ACCELERATOR SIMULATOR CODE GENERATION AND OPTIMIZATION VIA LARGE LANGUAGE MODELSPoster
  139. SIMULSENSE: SENSE-DRIVEN INTERPRETING FOR EFFICIENT SIMULTANEOUS SPEECH TRANSLATIONPoster
  140. SINGLE-MICROPHONE AUDIO POINT SOURCE DISCRIMINATIVE LOCALIZATION FROM REVERBERATION LATE TAIL ESTIMATIONPoster
  141. SINGLE-STEP CONTROLLABLE MUSIC BANDWIDTH EXTENSION WITH FLOW MATCHINGPoster
  142. SIREN: SPATIALLY-INFORMED RECONSTRUCTION OF BINAURAL AUDIO WITH VISIONPoster
  143. SIRUP: A DIFFUSION-BASED VIRTUAL UPMIXER OF STEERING VECTORS FOR HIGHLY-DIRECTIVE SPATIALIZATION WITH FIRST-ORDER AMBISONICSPoster
  144. SLAP: SCALABLE LANGUAGE-AUDIO PRETRAINING WITH VARIABLE-DURATION AUDIO AND MULTI-OBJECTIVE TRAININGOral
  145. SLM-SS: Speech Language Model for Generative Speech SeparationPoster
  146. SLM-TTA: A Framework for Test-Time Adaptation of Generative Spoken Language ModelsPoster
  147. SLOT FILLING AS A REASONING TASK FOR SPEECHLLMSPoster
  148. SMOGVLM: A SMALL, GRAPH-ENHANCED VISION-LANGUAGE MODELOral
  149. SMOOTHCLAP: SOFT-TARGET ENHANCED CONTRASTIVE LANGUAGE-AUDIO PRETRAINING FOR AFFECTIVE COMPUTINGPoster
  150. SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio RepresentationPoster
  151. SOUNDCOMPASS: NAVIGATING TARGET SOUND EXTRACTION WITH EFFECTIVE DIRECTIONAL CLUE INTEGRATION IN COMPLEX ACOUSTIC SCENESPoster
  152. SOUNDING HIGHLIGHTS: DUAL-PATHWAY AUDIO ENCODERS FOR AUDIO-VISUAL VIDEO HIGHLIGHT DETECTIONPoster
  153. SOURCE SEPARATION FOR A CAPPELLA MUSICOral
  154. SP-MCQA: EVALUATING INTELLIGIBILITY OF TTS BEYOND THE WORD LEVELPoster
  155. SPADE: STRUCTURED PRUNING AND ADAPTIVE DISTILLATION FOR EFFICIENT LLM-TTSOral
  156. SPAM: Style Prompt Adherence Metric for Prompt-based TTSPoster
  157. SPARSE AUTOENCODERS MAKE AUDIO FOUNDATION MODELS MORE EXPLAINABLEPoster
  158. SPARSE-UP: LEARNABLE SPARSE UPSAMPLING FOR 3D GENERATION WITH HIGH-FIDELITY TEXTURESPoster
  159. SPATIAL-CLAP: LEARNING SPATIALLY-AWARE AUDIO–TEXT EMBEDDINGS FOR MULTI-SOURCE CONDITIONSPoster
  160. SPATIALLY AWARE SELF-SUPERVISED MODELS FOR MULTI-CHANNEL NEURAL SPEAKER DIARIZATIONPoster
  161. SPEAKER ATTRIBUTED AUTOMATIC SPEECH RECOGNITION USING SPEECH AWARE LLMSPoster
  162. SPEAKING CLEARLY: A SIMPLIFIED WHISPER-BASED CODEC FOR LOW-BITRATE SPEECH CODINGPoster
  163. SPECTRAL OR SPATIAL? LEVERAGING BOTH FOR SPEAKER EXTRACTION IN CHALLENGING DATA CONDITIONSPoster
  164. SPECTRAMORPH: STRUCTURED LATENT LEARNING FOR SELF-SUPERVISED HYPERSPECTRAL SUPER-RESOLUTIONOral
  165. SPEECH QUALITY-BASED LOCALIZATION OF LOW-QUALITY SPEECH AND TEXT-TO-SPEECH SYNTHESIS ARTEFACTSPoster
  166. SPEECHCT-CLIP: DISTILLING TEXT-IMAGE KNOWLEDGE TO SPEECH FOR VOICE-NATIVE MULTIMODAL CT ANALYSISOral
  167. SPEECHMAPPER: SPEECH-TO-TEXT EMBEDDING PROJECTOR FOR LLMSOral
  168. SPOC: Safety-aware planning under partial observability and physical constraintsPoster
  169. SSCM: A SPATIAL-SEMANTIC CONSISTENT MODEL FOR MULTI-CONTRAST MRI SUPER-RESOLUTIONPoster
  170. SSG-DIT: A SPATIAL SIGNAL GUIDED FRAMEWORK FOR CONTROLLABLE VIDEO GENERATIONOral
  171. SSVD-O: PARAMETER-EFFICIENT FINE-TUNING WITH STRUCTURED SVD FOR SPEECH RECOGNITIONOral
  172. STACODEC: SEMANTIC TOKEN ASSIGNMENT FOR BALANCING ACOUSTIC FIDELITY AND SEMANTIC INFORMATION IN AUDIO CODECSPoster
  173. STEMPHONIC: ALL-AT-ONCE FLEXIBLE MULTI-STEM MUSIC GENERATIONPoster
  174. STOCHASTIC SHADOW DESCENT: TRAINING PARAMETRIZED QUANTUM CIRCUITS WITH SHADOWS OF GRADIENTSOral
  175. STREAM-VOICE-ANON: ENHANCING UTILITY OF REAL-TIME SPEAKER ANONYMIZATION VIA NEURAL AUDIO CODEC AND LANGUAGE MODELSPoster
  176. STREAMING SPEECH RECOGNITION WITH DECODER-ONLY LARGE LANGUAGE MODELS AND LATENCY OPTIMIZATIONOral
  177. STREAMMARK: A DEEP LEARNING-BASED SEMI-FRAGILE AUDIO WATERMARKING FOR PROACTIVE DEEPFAKE DETECTIONPoster
  178. STRUCTURAL COMPLEXITY OF BRAIN MRI REVEALS AGE-ASSOCIATED PATTERNSPoster
  179. STRUCTURE-AWARE CONTRASTIVE LEARNING WITH FINE-GRAINED BINDING REPRESENTATIONS FOR DRUG DISCOVERYPoster
  180. STRUCTURE-TO-IMAGE: ZERO-SHOT DEPTH ESTIMATION IN COLONOSCOPY VIA HIGH-FIDELITY SIM-TO-REAL ADAPTATIONPoster
  181. STYLE ATTACK DISGUISE: WHEN FONTS BECOME A CAMOUFLAGE FOR ADVERSARIAL INTENTPoster
  182. STYLEBENCH: EVALUATING SPEECH LANGUAGE MODELS ON CONVERSATIONAL SPEAKING STYLE CONTROLPoster
  183. STYLEPITCHER: GENERATING STYLE-FOLLOWING AND EXPRESSIVE PITCH CURVES FOR VERSATILE SINGING TASKSPoster
  184. STYMAM: A MAMBA-BASED GENERATOR FOR ARTISTIC STYLE TRANSFERPoster
  185. SUBJECTIVE EVALUATION OF FRAME RATE IN BITRATE-CONSTRAINED LIVE STREAMINGPoster
  186. SUBQRAG: SUB-QUESTION DRIVEN DYNAMIC GRAPH RAGPoster
  187. SUBTRACTIVE MODULATIVE NETWORK WITH LEARNABLE PERIODIC ACTIVATIONSOral
  188. SUMMARY ON THE MULTILINGUAL CONVERSATIONAL SPEECH LANGUAGE MODEL CHALLENGE: DATASETS, TASKS, BASELINES, AND METHODSPoster
  189. SUNAC: Source-aware Unified Neural Audio CodecOral
  190. SUPER MONOTONIC ALIGNMENT SEARCHPoster
  191. SUPERPIXEL INTEGRATED GRIDS FOR FAST IMAGE SEGMENTATIONPoster
  192. SUPERVISED MAKEUP TRANSFER WITH A CURATED DATASET: DECOUPLING IDENTITY AND MAKEUP FEATURES FOR ENHANCED TRANSFORMATIONPoster
  193. SUPPORT VECTOR DATA DESCRIPTION FOR RADAR TARGET DETECTIONPoster
  194. SURE-MED: SYSTEMATIC UNCERTAINTY REDUCTION FOR ENHANCED RELIABILITY IN MEDICAL REPORT GENERATIONPoster
  195. SURE: SYNERGISTIC UNCERTAINTY-AWARE REASONING FOR MULTIMODAL EMOTION RECOGNITION IN CONVERSATIONSOral
  196. SWITCHCODEC: ADAPTIVE RESIDUAL-EXPERT SPARSE QUANTIZATION FOR HIGH-FIDELITY NEURAL AUDIO CODINGOral
  197. SYNCSPEECH: EFFICIENT AND LOW-LATENCY TEXT-TO-SPEECH BASED ON TEMPORAL MASKED TRANSFORMEROral
  198. SYNERGYWARPNET: ATTENTION-GUIDED COOPERATIVE WARPING FOR NEURAL PORTRAIT ANIMATIONPoster
  199. SYNTHCLONER: SYNTHESIZER-STYLE AUDIO TRANSFER VIA FACTORIZED CODEC WITH ADSR ENVELOPE CONTROLPoster
  200. SYNTHETIC DATA DOMAIN ADAPTATION FOR ASR VIA LLM-BASED TEXT AND PHONETIC RESPELLING AUGMENTATIONOral
  201. Safety Alignment Should Be Made More Than Just A Few Attention HeadsOral
  202. Scale-covariant spiking waveletsPoster
  203. Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language ModelsOral
  204. Scaling Spoken Language Models with Syllabic Speech TokenizationOral
  205. Self-Attention Decomposition for Training Free Diffusion EditingOral
  206. Semantic Pilot Design for Data-Aided Channel Estimation Using a Large Language ModelPoster
  207. Semantic Relation-Enhanced CLIP Adapter for Domain Adaptive Zero-Shot LearningPoster
  208. SemanticShield: LLM-Powered Audits Expose Shilling Attacks in Recommender SystemsPoster
  209. Sensor Array and Camera Fusion via Unbalanced Optimal Transport for 3D Source LocalizationPoster
  210. Sequence-Level Unsupervised Training in Speech Recognition: A Theoretical StudyPoster
  211. Shapley Features for Robust Signal Prediction in Tactile InternetPoster
  212. Shift- and stretch-invariant non-negative matrix factorization with an application to brain tissue delineation in emission tomography dataPoster
  213. Shortcut Flow Matching for Speech Enhancement: Step-Invariant flows via single stage trainingPoster
  214. Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-scale Dataset CleansingPoster
  215. SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language ModelsPoster
  216. SingMOS-Pro: An Comprehensive Benchmark for Singing Quality AssessmentPoster
  217. Soft Graph Transformer for MIMO DetectionPoster
  218. Sparse Gradient Compression for Fine-Tuning Large Language ModelsPoster
  219. Sparse Polyak with optimal thresholding operators for high-dimensional M-estimationPoster
  220. Sparsity Induction for Accurate Post-Training Pruning of Large Language ModelsPoster
  221. Spatially Filtered Sparse Bayesian Learning for Direction-of-Arrival Estimation with Leaky-Wave AntennasPoster
  222. Speaker Anonymisation for Speech-based Suicide Risk DetectionPoster
  223. SpeakerRPL v2: Robust Open-set Speaker Identification through Enhanced Few-shot Foundation Tuning and Model FusionPoster
  224. Spectral Logit Sculpting: Adaptive Low-Rank Logit Transformation for Controlled Text GenerationPoster
  225. Stability and Generalization of Adversarial Diffusion TrainingPoster
  226. State-Flow Coordinated Representation for MI-EEG DecodingPoster
  227. StereoFoley: Object-Aware Stereo Audio Generation from VideoPoster
  228. StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video UnderstandingPoster
  229. Strong Basin of Attraction for Unmixing Kernels With the Variable Projection MethodPoster
  230. Structure-Aware Corpus Construction and User-Perception-Aligned Metrics for Large-Language-Model Code CompletionPoster
  231. StyleDecoupler: Generalizable Artistic Style DisentanglementPoster
  232. Summary of The Inaugural Music Source Restoration ChallengePoster
  233. Superpixel-informed Continuous Low-Rank Tensor Representation for Multi-Dimensional Data RecoveryPoster
  234. SynParaSpeech: Automated Synthesis of Paralinguistic Datasets for Speech Generation and UnderstandingPoster
  235. Synaspot: A Lightweight, Streaming Multi-modal Framework for Keyword Spotting with Audio-Text SynergyPoster
  236. T-GEMS: TEXT-GUIDED EXIT MODULES FOR DECREASING CLIP IMAGE ENCODEROral
  237. T-Mimi: A Transformer-based Mimi Decoder for Real-Time On-Phone TTSPoster
  238. TAGARELA - A PORTUGUESE SPEECH DATASET FROM PODCASTSPoster
  239. TAMING THE LIGHT: ILLUMINATION-INVARIANT SEMANTIC 3DGS-SLAMPoster
  240. TARGET DETECTION IN TWO-CHANNEL PASSIVE RADARS WITH INTER-RECEIVER COLLABORATIONOral
  241. TARGETED POOLED LATENT-SPACE STEGANALYSIS APPLIED TO GENERATIVE STEGANOGRAPHY, WITH A FIXOral
  242. TASK-BASED ADAPTIVE TRANSMIT BEAMFORMING FOR EFFICIENT ULTRASOUND QUANTIFICATIONPoster
  243. TASU: TEXT-ONLY ALIGNMENT FOR SPEECH UNDERSTANDINGOral
  244. TAU: A BENCHMARK FOR CULTURAL SOUND UNDERSTANDING BEYOND SEMANTICSPoster
  245. TCATSEG: A TOOTH CENTER-WISE ATTENTION NETWORK FOR 3D DENTAL MODEL SEMANTIC SEGMENTATIONPoster
  246. TEACHER-STUDENT DIFFUSION MODEL FOR TEXT-DRIVEN 3D HAND MOTION GENERATIONPoster
  247. TEACHING THE TEACHERS: BOOSTING UNSUPERVISED DOMAIN ADAPTATION IN SPEECH RECOGNITION BY ENSEMBLE UPDATEPoster
  248. TEMPORAL CONTEXT AND ARCHITECTURE: A BENCHMARK FOR NATURALISTIC EEG DECODINGPoster
  249. TEMPORAL-AWARE HETEROGENEOUS GRAPH REASONING WITH MULTI-VIEW FUSION FOR TEMPORAL QUESTION ANSWERINGPoster
  250. TENSLORA: TENSOR ALTERNATIVES FOR LOW-RANK ADAPTATIONPoster
  251. TEST TIME ADAPTATION FOR SPEECH EMOTION RECOGNITIONPoster
  252. TEST-TIME ADAPTATION FOR SPEECH ENHANCEMENT VIA MASK POLARIZATIONPoster
  253. TESTAGENT: AUTOMATIC BENCHMARKING AND EXPLORATORY INTERACTION FOR EVALUATING LLMS IN VERTICAL DOMAINSOral
  254. TEXTLESSRAG: END-TO-END VISUAL DOCUMENT RAG BY SPEECH WITHOUT TEXTPoster
  255. TEXTS-Diff: TEXTS-Aware Diffusion Model for Real-World Text Image Super-ResolutionPoster
  256. TGPO: TREE-GUIDED PREFERENCE OPTIMIZATION FOR ROBUST WEB AGENT REINFORCEMENT LEARNINGPoster
  257. THE ACHILLES’ HEEL OF ANGULAR MARGINS: A CHEBYSHEV POLYNOMIAL FIX FOR SPEAKER VERIFICATIONPoster
  258. THE CURIOUS CASE OF VISUAL GROUNDING: DIFFERENT EFFECTS FOR SPEECH- AND TEXT-BASED LANGUAGE ENCODERSPoster
  259. THE ICASSP 2026 AUTOMATIC SONG AESTHETICS EVALUATION CHALLENGEPoster
  260. THE ICASSP 2026 HUMDIAL CHALLENGE: BENCHMARKING HUMAN-LIKE SPOKEN DIALOGUE SYSTEMS IN THE LLM ERAPoster
  261. THE IMPACT OF ABSTRACT AND OBJECT TAGS ON IMAGE PRIVACY CLASSIFICATIONPoster
  262. THE IMPACT OF AUDIO WATERMARKING ON AUDIO ANTI-SPOOFING COUNTERMEASURESOral
  263. THE ROLE OF PROSODIC AND LEXICAL CUES IN TURN-TAKING WITH SELF-SUPERVISED SPEECH REPRESENTATIONSOral
  264. THE SJTU X-LANCE LAB SYSTEM FOR MSR CHALLENGE 2025Poster
  265. THE TMU SYSTEM FOR THE XACLE CHALLENGE: TRAINING LARGE AUDIO LANGUAGE MODELS WITH CLAP PSEUDO-LABELSPoster
  266. THINK-AUGMENTED FUNCTION CALLING: IMPROVING LLM PARAMETER ACCURACY THROUGH EMBEDDED REASONINGPoster
  267. THINK-CLIP-SAMPLE: SLOW-FAST FRAME SELECTION FOR VIDEO UNDERSTANDINGPoster
  268. THINKING WHILE LISTENING: SIMPLE TEST TIME SCALING FOR AUDIO CLASSIFICATIONPoster
  269. TICL: TEXT-EMBEDDING KNN FOR SPEECH IN-CONTEXT LEARNING UNLOCKS SPEECH RECOGNITION ABILITIES OF LARGE MULTIMODAL MODELSPoster
  270. TIME VS. LAYER: LOCATING PREDICTIVE CUES FOR DYSARTHRIC SPEECH DESCRIPTORS IN WAV2VEC 2.0Oral
  271. TIME-FREQUENCY ANALYSIS OF NON-UNIFORMLY SAMPLED SIGNALS VIA SAMPLE DENSITY ADAPTATIONPoster
  272. TINYDROP: TINY MODEL GUIDED TOKEN DROPPING FOR VISION TRANSFORMERSPoster
  273. TINYMU: A COMPACT AUDIO-LANGUAGE MODEL FOR MUSIC UNDERSTANDINGPoster
  274. TIPS Over Tricks: Simple Prompts for Effective Zero-Shot Anomaly DetectionPoster
  275. TLDIFFGAN: A LATENT DIFFUSION-GAN FRAMEWORK WITH TEMPORAL INFORMATION FUSION FOR ANOMALOUS SOUND DETECTIONPoster
  276. TMD-TTS: A UNIFIED TIBETAN MULTI-DIALECT TEXT-TO-SPEECH FRAMEWORK FOR U-TSANG, AMDO AND KHAM SPEECH DATASET GENERATIONPoster
  277. TMT: Cross-domain Semantic Segmentation with Region-adaptive Transferability EstimationPoster
  278. TNET: TERRACE CONVOLUTIONAL DECODER NETWORK FOR REMOTE SENSING IMAGE SEMANTIC SEGMENTATIONOral
  279. TOEPLITZ UNLABELED SENSINGOral
  280. TOKENCHAIN: A DISCRETE SPEECH CHAIN VIA SEMANTIC TOKEN MODELINGPoster
  281. TOPOBIND: MULTI-MODAL PREDICTION OF ANTIBODY-ANTIGEN BINDING FREE ENERGY VIA SEQUENCE EMBEDDINGS AND STRUCTURAL TOPOLOGYPoster
  282. TOPSEG: A MULTI-SCALE TOPOLOGICAL FRAMEWORK FOR DATA-EFFICIENT HEART SOUND SEGMENTATIONOral
  283. TOPT: TASK-ORIENTED PROMPT TUNING FOR URBAN REGION REPRESENTATION LEARNINGPoster
  284. TOS: A TEAM OF SPECIALISTS ENSEMBLE FRAMEWORK FOR STEREO SOUND EVENT LOCALIZATION AND DETECTION WITH DISTANCE ESTIMATION IN VIDEOPoster
  285. TOWARDS BLIND DATA CLEANING: A CASE STUDY IN MUSIC SOURCE SEPARATIONPoster
  286. TOWARDS BUILDING SPEECH LARGE LANGUAGE MODELS FOR MULTITASK UNDERSTANDING IN LOW-RESOURCE LANGUAGESPoster
  287. TOWARDS DATA DRIFT MONITORING FOR SPEECH DEEPFAKE DETECTION IN THE CONTEXT OF MLOPSPoster
  288. TOWARDS EFFECTIVE NEGATION MODELING IN JOINT AUDIO-TEXT MODELS FOR MUSICPoster
  289. TOWARDS FAIR ASR FOR SECOND LANGUAGE SPEAKERS USING FAIRNESS PROMPTED FINETUNINGPoster
  290. TOWARDS LANGUAGE-INDEPENDENT FACE-VOICE ASSOCIATION WITH MULTIMODAL FOUNDATION MODELSPoster
  291. TOWARDS LIGHTWEIGHT ADAPTATION OF SPEECH ENHANCEMENT MODELS IN REAL-WORLD ENVIRONMENTSPoster
  292. TOWARDS NOISE-ROBUST SPEECH INVERSION THROUGH MULTI-TASK LEARNING WITH SPEECH ENHANCEMENTPoster
  293. TOWARDS ORTHOGRAPHICALLY-INFORMED EVALUATION OF SPEECH RECOGNITION SYSTEMS FOR INDIAN LANGUAGESPoster
  294. TOWARDS PRIVACY-PRESERVING FINE-GRAINED VISUAL CLASSIFICATION VIA HIERARCHICAL LEARNING FROM LABEL PROPORTIONSPoster
  295. TOWARDS REAL-TIME GENERATIVE SPEECH RESTORATION WITH FLOW-MATCHINGPoster
  296. TOWARDS RELIABLE TIME SERIES FORECASTING UNDER FUTURE UNCERTAINTY: AMBIGUITY AND NOVELTY REJECTION MECHANISMSPoster
  297. TOWARDS ROBUST DYSARTHRIC SPEECH RECOGNITION: LLM-AGENT POST-ASR CORRECTION BEYOND WERPoster
  298. TRAINING-FREE MULTIMODAL GUIDANCE FOR VIDEO TO AUDIO GENERATIONPoster
  299. TRAINING-FREE TEST-TIME ADAPTATION WITH BROWNIAN DISTANCE COVARIANCE IN VISION-LANGUAGE MODELSPoster
  300. TRIAGE: HIERARCHICAL VISUAL BUDGETING FOR EFFICIENT VIDEO REASONING IN VISION-LANGUAGE MODELSOral
  301. TRICON-FAIR: TRIPLET CONTRASTIVE LEARNING FOR MITIGATING SOCIAL BIAS IN PRE-TRAINED LANGUAGE MODELSPoster
  302. TRIM: A SELF-SUPERVISED VIDEO SUMMARIZATION FRAMEWORK MAXIMIZING TEMPORAL RELATIVE INFORMATION AND REPRESENTATIVENESSPoster
  303. TSQLORA: TOWARDS SENSITIVITY AND QUALITY LOW-RANK ADAPTATION FOR EFFICIENT FINE-TUNINGOral
  304. TTA: TRANSCRIBE, TRANSLATE AND ALIGNMENT FOR CROSS-LINGUAL SPEECH REPRESENTATIONPoster
  305. TWO-DIMENSIONAL TOMOGRAPHIC RECONSTRUCTION FROM PROJECTIONS WITH UNKNOWN ANGLES AND UNKNOWN SPATIAL SHIFTSPoster
  306. TWO-STAGE AUDIO-VISUAL TARGET SPEAKER EXTRACTION SYSTEM FOR REAL-TIME PROCESSING ON EDGE DEVICEPoster
  307. TWO-STAGE GRID OPTIMIZATION FOR GROUP-WISE QUANTIZATION OF LLMSPoster
  308. Taming Audio VAEs via Target-KL RegularizationPoster
  309. Target speaker anonymization in multi-speaker recordingsOral
  310. Targeted Fine-Tuning of DNN-Based Receivers via Influence FunctionsOral
  311. Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech SynthesisPoster
  312. Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video ParsingPoster
  313. Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-wise DistillationPoster
  314. Tell Me What to Track: Infusing Robust Language Guidance for Enhanced Referring Multi-Object TrackingPoster
  315. Temporal-Spatial Decouple before Act: Disentangled Representation Learning for Multimodal Sentiment AnalysisOral
  316. Temporally Heterogeneous Graph Contrastive Learning for Multimodal Acoustic Event ClassificationPoster
  317. TennisTV: Do Multimodal Large Language Models Understand Tennis Rallies?Oral
  318. Text2Move: Text-to-moving sound generation via trajectory prediction and temporal alignmentPoster
  319. Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time AlignmentPoster
  320. The MUSE Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMsPoster
  321. Thinking in a Crowd: How Auxiliary Information Shapes LLM ReasoningPoster
  322. TidyVoice: A Curated Multilingual Dataset for Speaker Verification Derived from Common VoicePoster
  323. Time-Shifted Token Scheduling for Symbolic Music GenerationPoster
  324. Topological Signal Processing for 3D Point Cloud DataPoster
  325. Toward Faithful Explanations in Acoustic Anomaly DetectionPoster
  326. Towards Evaluating Generative Audio: Insights from Neural Audio Codec Embedding DistancesPoster
  327. Towards Explainable Privacy Preservation in Federated Learning via Shapley Value-Guided Noise InjectionPoster
  328. Towards Robust Visual Continual Learning with Multi-Prototype SupervisionOral
  329. Tracking Listener Attention: Gaze-Guided Audio-Visual Speech Enhancement FrameworkPoster
  330. Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long AudioPoster
  331. Training Dynamics-Aware Multi-Factor Curriculum Learning for Target Speaker ExtractionOral
  332. Training Flow Matching Models with Reliable Labels via Self-PurificationPoster
  333. Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial ReaSoningPoster
  334. Transfer Learning for Paediatric Sleep Apnoea Detection Using Physiology-Guided Acoustic ModelsPoster
  335. Tri-Hybrid Beamforming Design for Integrated Sensing and CommunicationsOral
  336. Triage knowledge distillation for speaker verificationOral
  337. TurtleBench: Evaluating Top Language Models via Real-World Yes/No PuzzlesPoster
  338. U-DAVI: UNCERTAINTY-AWARE DIFFUSION-PRIOR-BASED AMORTIZED VARIATIONAL INFERENCE FOR IMAGE RECONSTRUCTIONPoster
  339. ULW-SLEEPNET: AN ULTRA-LIGHTWEIGHT NETWORK FOR MULTIMODAL SLEEP STAGE SCORINGPoster
  340. UMA-SPLIT: UNIMODAL AGGREGATION FOR BOTH ENGLISH AND MANDARIN NON-AUTOREGRESSIVE SPEECH RECOGNITIONPoster
  341. UNCERTAINTY-AWARE 3D EMOTIONAL TALKING FACE SYNTHESIS WITH EMOTION PRIOR DISTILLATIONPoster
  342. UNCERTAINTY-AWARE PROTOTYPE LEARNING WITH VARIATIONAL INFERENCE FOR FEW-SHOT POINT CLOUD SEGMENTATIONOral
  343. UNCERTAINTY-BASED ENSEMBLE LEARNING IN CMR SEMANTIC SEGMENTATIONPoster
  344. UNCOVERING OVERCONFIDENT FAILURES IN CXR MODELS VIA AUGMENTATION-SENSITIVITY RISK SCORINGPoster
  345. UNDERSTANDING FRECHET SPEECH DISTANCE FOR SYNTHETIC SPEECH QUALITY EVALUATIONOral
  346. UNDERSTANDING TEXTUAL CAPABILITY DEGRADATION IN SPEECH LLMS VIA PARAMETER IMPORTANCE ANALYSISOral
  347. UNDERSTANDING THE STRENGTHS AND WEAKNESSES OF SSL MODELS FOR AUDIO DEEPFAKE MODEL ATTRIBUTIONOral
  348. UNIFIED MULTIMODAL AND MULTILINGUAL RETRIEVAL VIA MULTI-TASK LEARNING WITH NLU INTEGRATIONPoster
  349. UNIGEO: A UNIFIED 3D INDOOR OBJECT DETECTION FRAMEWORK INTEGRATING GEOMETRY-AWARE LEARNING AND DYNAMIC CHANNEL GATINGPoster
  350. UNIPACT: A MULTIMODAL FRAMEWORK FOR PROGNOSTIC QUESTION ANSWERING ON RAW ECG AND STRUCTURED EHROral
  351. UNIT-BASED AGENT FOR SEMI-CASCADED FULL-DUPLEX DIALOGUE SYSTEMSPoster
  352. UNLOCKING HIDDEN POTENTIAL IN POINT CLOUD NETWORKS WITH ATTENTION-GUIDED GROUPING-FEATURE COORDINATIONPoster
  353. UNMIXX: UNTANGLING HIGHLY CORRELATED SINGING VOICES MIXTURESPoster
  354. UNROLLED GRAPH NEURAL NETWORKS FOR CONSTRAINED OPTIMIZATIONPoster
  355. UNSEEN BUT NOT UNKNOWN: USING DATASET CONCEALMENT TO ROBUSTLY EVALUATE SPEECH QUALITY ESTIMATION MODELSPoster
  356. UNSUPERVISED LEXICON LEARNING FROM SPEECH IS LIMITED BY REPRESENTATIONS RATHER THAN CLUSTERINGPoster
  357. UNWRAPDIFF: A CONDITIONAL DIFFUSION MODEL FOR INSAR PHASE UNWRAPPINGPoster
  358. UP TO 36X SPEEDUP: MASK-BASED PARALLEL INFERENCE PARADIGM FOR KEY INFORMATION EXTRACTION IN MLLMSPoster
  359. USCTNET: A DEEP UNFOLDING NUCLEAR-NORM OPTIMIZATION SOLVER FOR PHYSICALLY CONSISTENT HSI RECONSTRUCTIONPoster
  360. UTI-LLM: A Personalized Articulatory-Speech Therapy Assistance System Based on Multimodal Large Language ModelOral
  361. Ultra-Reliable Risk-Aggregated Sum Rate Maximization via Model-Aided Deep LearningPoster
  362. Uncertainty-Gated Deformable Network for Breast Tumor Segmentation in MR imagesPoster
  363. Unconditional flow-based time series generation with equivariance-regularised latent spacesOral
  364. UniSTFormer: Unified Spatio-Temporal Lightweight Transformer for Efficient Skeleton-Based Action RecognitionOral
  365. UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow MatchingPoster
  366. UnlearnShield: Shielding Forgotten Privacy against Unlearning InversionPoster
  367. Unleashing Vision Transformer Potential in Image Quality Assessment via Global-Local Adaptive InteractionPoster
  368. Utilising Gradient-Based Proposals Within Sequential Monte Carlo Samplers for Training of Partial Bayesian Neural NetworksPoster
  369. Utilizing Information Theoretic Approach to Study Cochlear Neural DegenerationPoster
  370. V2A-DPO: OMNI-PREFERENCE OPTIMIZATION FOR VIDEO-TO-AUDIO GENERATIONPoster
  371. VASGUIDENET: VASCULAR TOPOLOGY-GUIDED COUINAUD LIVER SEGMENTATION WITH STRUCTURAL CONTRASTIVE LOSSPoster
  372. VBX FOR END-TO-END NEURAL AND CLUSTERING-BASED DIARIZATIONPoster
  373. VCE: A ZERO-COST HALLUCINATION MITIGATION METHOD OF LVLMS VIA VISUAL CONTRASTIVE EDITINGOral
  374. VELOCITY POTENTIAL NEURAL FIELD FOR EFFICIENT AMBISONICS IMPULSE RESPONSE MODELINGOral
  375. VIA SCORE TO PERFORMANCE: EFFICIENT HUMAN-CONTROLLABLE LONG SONG GENERATION WITH BAR-LEVEL SYMBOLIC NOTATIONPoster
  376. VIRTUAL CONSISTENCY FOR AUDIO EDITINGOral
  377. VISION KAN: TOWARDS AN ATTENTION-FREE BACKBONE FOR VISION WITH KOLMOGOROV-ARNOLD NETWORKSPoster
  378. VITEX: VISUAL TEXTURE CONTROL FOR MULTI-TRACK SYMBOLIC MUSIC GENERATION VIA DISCRETE DIFFUSION MODELSPoster
  379. VIVIDVOICE: A UNIFIED FRAMEWORK FOR SCENE-AWARE VISUALLY-DRIVEN SPEECH SYNTHESISPoster
  380. VM-UNSSOR: Unsupervised Neural Speech Separation Enhanced by Higher-SNR Virtual Microphone ArraysPoster
  381. VNODE: A PIECEWISE CONTINUOUS VOLTERRA NEURAL NETWORKPoster
  382. VOCALNET-M2: ADVANCING LOW-LATENCY SPOKEN LANGUAGE MODELING VIA INTEGRATED MULTI-CODEBOOK TOKENIZATION AND MULTI-TOKEN PREDICTIONPoster
  383. VOTING-BASED PITCH ESTIMATION WITH TEMPORAL AND FREQUENTIAL ALIGNMENT AND CORRELATION AWARE SELECTIONOral
  384. VOXMORPH: SCALABLE ZERO-SHOT VOICE IDENTITY MORPHING VIA DISENTANGLED EMBEDDINGSOral
  385. VQEzy: AN OPEN-SOURCE DATASET FOR PARAMETER INITIALIZATION IN VARIATIONAL QUANTUM EIGENSOLVERSOral
  386. VSE: VARIATIONAL STATE ESTIMATION OF COMPLEX MODEL-FREE PROCESSPoster
  387. VSTYLE: A BENCHMARK FOR VOICE STYLE ADAPTATION WITH SPOKEN INSTRUCTIONSPoster
  388. VTONGuard: Automatic Detection and Authentication of AI-Generated Virtual Try-On ContentPoster
  389. Variational Low-Rank Adaptation for Personalized Impaired Speech RecognitionPoster
  390. Video-based Heart Rate Estimation with Angle-guided ROI Optimization and Graph Signal DenoisingPoster
  391. VioPTT: Violin Technique-Aware Transcription from Synthetic Data AugmentationPoster
  392. VoXtream: Full-Stream Text-to-Speech with Extremely Low LatencyOral
  393. VoxGuard: Evaluating user and attribute privacy in speech via Membership Inference AttacksPoster
  394. WARP QUANTIFICATION ANALYSIS: A FRAMEWORK FOR PATH-BASED SIGNAL ALIGNMENT METRICSOral
  395. WAVE-GMS: LIGHTWEIGHT MULTI-SCALE GENERATIVE MODEL FOR MEDICAL IMAGE SEGMENTATIONPoster
  396. WAVE-TRAINER-FIT: NEURAL VOCODER WITH TRAINABLE PRIOR AND FIXED-POINT ITERATION TOWARDS HIGH-QUALITY SPEECH GENERATION FROM SSL FEATURESPoster
  397. WAVELET-AWARE ANOMALY DETECTION IN MULTI-CHANNEL USER LOGS VIA DEVIATION MODULATION AND RESOLUTION-ADAPTIVE ATTENTIONPoster
  398. WAVELETGAUSSIAN: WAVELET-DOMAIN DIFFUSION FOR SPARSE-VIEW 3D GAUSSIAN OBJECT RECONSTRUCTIONPoster
  399. WAVENEXT 2: CONVNEXT-BASED FAST NEURAL VOCODERS WITH RESIDUAL DENOISING AND SUB-MODELING FOR GAN AND DIFFUSION MODELSPoster
  400. WAVLINK: COMPACT AUDIO–TEXT EMBEDDINGS WITH A GLOBAL WHISPER TOKENOral
  401. WEATHER-R1: LOGICALLY CONSISTENT REINFORCEMENT FINE-TUNING FOR MULTIMODAL REASONING IN METEOROLOGYPoster
  402. WEBEXPERT: DOMAIN-AWARE WEB AGENTS WITH CRITIC-GUIDED EXPERT EXPERIENCE FOR HIGH-PRECISION SEARCHPoster
  403. WEEP: A Differentiable Nonconvex Sparse Regularizer via Weakly-Convex EnvelopeOral
  404. WEIGHTED TEMPORAL DECAY LOSS FOR LEARNING WEARABLE PPG DATA WITH SPARSE CLINICAL LABELSPoster
  405. WENETSPEECH-CHUAN: A LARGE-SCALE SICHUANESE CORPUS WITH RICH ANNOTATION FOR DIALECTAL SPEECH PROCESSINGPoster
  406. WHEN LARGE VISION-LANGUAGE MODELS MEET PERSON RE-IDENTIFICATIONPoster
  407. WHEN NOISE LOWERS THE LOSS: RETHINKING LIKELIHOOD-BASED EVALUATION IN MUSIC LARGE LANGUAGE MODELSPoster
  408. WHEN SILENCE MATTERS: THE IMPACT OF IRRELEVANT AUDIO ON TEXT REASONING IN LARGE AUDIO-LANGUAGE MODELSPoster
  409. WHERE, NOT WHAT: COMPELLING VIDEO LLMS TO LEARN GEOMETRIC CAUSALITY FOR 3D-GROUNDINGPoster
  410. WHISPER-MLA: REDUCING GPU MEMORY CONSUMPTION OF ASR MODELS BASED ON MHA2MLA CONVERSIONPoster
  411. WHISPER: COURTSIDE EDITION - ENHANCING ASR PERFORMANCE THROUGH LLM-DRIVEN CONTEXT GENERATIONPoster
  412. WHY DO SPEECH LANGUAGE MODELS FAIL TO GENERATE SEMANTICALLY COHERENT OUTPUTS? A MODALITY EVOLVING PERSPECTIVEOral
  413. WIFISIM: SIMULATING WIFI PROBE REQUESTS VIA AOSP ANALYSIS AND DEVICE BEHAVIOR MODELINGPoster
  414. WINDOWED SUMMARYMIXING: AN EFFICIENT FINE-TUNING OF SELF-SUPERVISED LEARNING MODELS FOR LOW-RESOURCE SPEECH RECOGNITIONPoster
  415. WMOE-CLIP: WAVELET-ENHANCED MIXTURE-OF-EXPERTS PROMPT LEARNING FOR ZERO-SHOT ANOMALY DETECTIONOral
  416. WRAPPER-AWARE RATE-DISTORTION OPTIMIZATION IN FEATURE CODING FOR MACHINESPoster
  417. WaterFlow: Explicit Physics-Prior Rectified Flow for Underwater Saliency Mask GenerationPoster
  418. WaveSP-Net: Learnable Wavelet-Domain Sparse Prompt Tuning for Speech Deepfake DetectionPoster
  419. WebRouter: Query-specific Router via Variational Information Bottleneck for Cost-sensitive Web AgentPoster
  420. What You Feel Is Not What They See: On Predicting Self-Reported Emotion from Third-Party Observer LabelsOral
  421. When Differential Privacy Meets Wireless Federated Learning: An Improved Analysis for Privacy and ConvergenceOral
  422. Which private attributes do VLMs agree on and predict well?Poster
  423. Whitening Spherical Gaussian Mixtures in the Large-Dimensional RegimeOral
  424. WiFi-GEN: High-Resolution Indoor Imaging from WiFi Signals Using Generative AIPoster
  425. XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice AssociationPoster
  426. Xi+: Uncertainty Supervision for Robust Speaker EmbeddingPoster
  427. Z-SCORES: A METRIC FOR LINGUISTICALLY ASSESSING DISFLUENCY REMOVALPoster
  428. ZERO-SHOT TTS WITH ENHANCED AUDIO PROMPTS: BSC SUBMISSION FOR THE 2026 WILDSPOOF CHALLENGE TTS TRACKPoster
  429. Zero-Shot VISUAL GROUNDING in 3D Gaussians via View RetrievalPoster
  430. mmWave-Diffusion: A Novel Framework for Respiration Sensing Using Observation-Anchored Conditional Diffusion ModelOral
  431. pFedSAM: Personalized Federated Learning of Segment Anything Model for Medical Image SegmentationPoster
  432. variance & greediness: a comparative study of metric-learning lossesPoster

Looking for submission deadlines instead? See the conference deadline calendar.