← All conferences

ICASSP 2026 Accepted Papers

The full list of 1,432 papers accepted at ICASSP 2026 (IEEE International Conference on Acoustics, Speech and Signal Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

Poster: 1,085Oral: 347
  1. (P)rior(D)yna(F)low: A Priori Dynamic Workflow Construction via Multi-Agent CollaborationPoster
  2. 3DIFFUSIONDET: DIFFUSION MODEL FOR 3D OBJECT DETECTION WITH ROBUST LIDAR-CAMERA FUSIONPoster
  3. 3DPCNet: Pose Canonicalization for Robust Viewpoint-Invariant 3D Kinematic Analysis from Monocular RGB camerasPoster
  4. A Benchmark for Joint Dialogue Satisfaction, Emotion Recognition, and Emotion State Transition PredictionPoster
  5. A COCKTAIL-PARTY BENCHMARK: MULTI-MODAL DATASET AND COMPARATIVE EVALUATION RESULTSPoster
  6. A COMPARATIVE STUDY ON HOW DATA NORMALIZATION AFFECTS ZERO-SHOT GENERALIZATION IN TIME SERIES FOUNDATION MODELSPoster
  7. A CONVEX DEMIXING APPROACH FOR HYBRID-FIELD CHANNEL ESTIMATION OF XL-MIMO SYSTEMS VIA ATOMIC NORM MINIMIZATIONOral
  8. A DECOMPOSITION-BASED STATE SPACE MODEL FOR MULTIVARIATE TIME-SERIES FORECASTINGOral
  9. A DISTRIBUTION MATCHING APPROACH TO NEURAL PIANO TRANSCRIPTION WITH OPTIMAL TRANSPORTPoster
  10. A DUAL-BRANCH FRAMEWORK FOR SEMANTIC CHANGE DETECTION WITH BOUNDARY AND TEMPORAL AWARENESSPoster
  11. A DUAL-MODULATION FRAMEWORK FOR RGB-T CROWD COUNTING VIA SPATIALLY MODULATED ATTENTION AND ADAPTIVE FUSIONPoster
  12. A DYL-UNET FRAMEWORK BASED ON DYNAMIC LEARNING FOR TEMPORALLY CONSISTENT ECHOCARDIOGRAPHIC SEGMENTATIONPoster
  13. A Dataset of Robot-Patient and Doctor-Patient Medical Dialogues for Spoken Language Processing TasksPoster
  14. A GENERATIVE-FIRST NEURAL AUDIO AUTOENCODERPoster
  15. A Generative Model for Controllable Feature Heterophily in GraphsPoster
  16. A HYBRID DISCRIMINATIVE AND GENERATIVE SYSTEM FOR UNIVERSAL SPEECH ENHANCEMENTPoster
  17. A LIGHTWEIGHT FOURIER-BASED NETWORK FOR BINAURAL SPEECH ENHANCEMENT WITH SPATIAL CUE PRESERVATIONPoster
  18. A MEDICAL MULTIMODAL DIAGNOSTIC FRAMEWORK INTEGRATING VISION-LANGUAGE MODELS AND LOGIC TREE REASONINGPoster
  19. A MULTIMODAL DEPTH-AWARE METHOD FOR EMBODIED REFERENCE UNDERSTANDINGPoster
  20. A Novel Automatic Framework for Speaker Drift Detection in Synthesized SpeechPoster
  21. A PARAMETER-EFFICIENT MULTI-SCALE CONVOLUTIONAL ADAPTER FOR SYNTHETIC SPEECH DETECTIONPoster
  22. A PARAMETRIC POWER MODEL OF UPPER MID-BAND (FR3) BASE STATIONS FOR 6GPoster
  23. A POINT PROCESS MODEL OF SKIN CONDUCTANCE RESPONSES IN A STROOP TASK FOR PREDICTING DEPRESSION AND SUICIDAL IDEATIONPoster
  24. A RANDOM MATRIX PERSPECTIVE OF ECHO STATE NETWORKS: FROM PRECISE BIAS–VARIANCE CHARACTERIZATION TO OPTIMAL REGULARIZATIONPoster
  25. A Robust Multi-Scale Framework with Test-Time Adaptation for sEEG-Based Speech DecodingPoster
  26. A STAGE-WISE LEARNING STRATEGY WITH FIXED ANCHORS FOR ROBUST SPEAKER VERIFICATIONPoster
  27. A STUDY OF DATA SELECTION STRATEGIES FOR PRE-TRAINING SELF-SUPERVISED SPEECH MODELSOral
  28. A SUPERB-Style Benchmark of Self-Supervised Speech Models for Audio Deepfake DetectionOral
  29. A SUPPORT VECTOR APPROACH IN SEGMENTED REGRESSION FOR MAP-ASSISTED NON-COOPERATIVE SOURCE LOCALIZATIONPoster
  30. A Stabilized Hybrid Active Noise Control Algorithm of GFANC and FxNLMS with Online ClusteringPoster
  31. A TEXT-IMAGE FUSION METHOD WITH DATA AUGMENTATION CAPABILITIES FOR REFERRING MEDICAL IMAGE SEGMENTATIONPoster
  32. A TEXT-TO-TEXT ALIGNMENT ALGORITHM FOR BETTER EVALUATION OF MODERN SPEECH RECOGNITION SYSTEMSPoster
  33. A Training-Free Framework for High-Fidelity Appearance Transfer via Diffusion TransformersPoster
  34. A Tsallis-Entropy Lens on Genetic VariationPoster
  35. A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training ModelsPoster
  36. A UNIFIED SPOKEN LANGUAGE MODEL WITH INJECTED EMOTIONAL-ATTRIBUTION THINKING FOR HUMAN-LIKE INTERACTIONPoster
  37. A Unified SVD-Modal Solution for Sparse Sound Field Reconstruction with Hybrid Spherical-Linear Microphone ArraysPoster
  38. A long-form single-speaker real-time MRI speech dataset and benchmarkPoster
  39. A mixed precision FFT with applications in MRIPoster
  40. ABC-EVAL: BENCHMARKING LARGE LANGUAGE MODELS ON SYMBOLIC MUSIC UNDERSTANDING AND INSTRUCTION FOLLOWINGPoster
  41. ABRACADDBRA: TOUCH-GUIDED OBJECT ADDITION BY DECOUPLING PLACEMENT AND EDITING SUBTASKSPoster
  42. ACAVCAPS: ENABLING LARGE-SCALE TRAINING FOR FINE-GRAINED AND DIVERSE AUDIO UNDERSTANDINGPoster
  43. ACCENT-INVARIANT AUTOMATIC SPEECH RECOGNITION VIA SALIENCY-DRIVEN SPECTROGRAM MASKINGPoster
  44. ACD-CLIP: DECOUPLING REPRESENTATION AND DYNAMIC FUSION FOR ZERO-SHOT ANOMALY DETECTIONPoster
  45. ACHIEVING PARETO OPTIMALITY IN GAMES VIA SINGLE-BIT FEEDBACKPoster
  46. ACOUSTIC AND FACIAL MARKERS OF PERCEIVED CONVERSATIONAL SUCCESS IN SPONTANEOUS SPEECHPoster
  47. ACOUSTIC NON-STATIONARITY OBJECTIVE ASSESSMENT WITH HARD LABEL CRITERIA FOR SUPERVISED LEARNING MODELSPoster
  48. ACOUSTIC TELEPORTATION VIA DISENTANGLED NEURAL AUDIO CODEC REPRESENTATIONSOral
  49. ACTIVE INFERENCE FRAMEWORK FOR CLOSED-LOOP SENSING, COMMUNICATION, AND CONTROL IN UAV SYSTEMSOral
  50. ACTIVE JAMMER LOCALIZATION VIA ACQUISITION-AWARE PATH PLANNINGPoster
  51. ACTIVE SEQUENTIAL HYPOTHESIS TESTING WITH NON-HOMOGENEOUS COSTSOral
  52. AD-DINOv3: Enhancing DINOv3 for Zero-Shot Anomaly Detection with Anomaly-Aware CalibrationPoster
  53. ADAFLOW: EFFICIENT LONG VIDEO EDITING VIA ADAPTIVE ATTENTION SLIMMING AND KEYFRAME SELECTIONPoster
  54. ADAPTER-STATE SHARING CLIP FOR PARAMETER-EFFICIENT MULTIMODAL SARCASM DETECTIONPoster
  55. ADAPTING DIARIZATION-CONDITIONED WHISPER FOR END-TO-END MULTI-TALKER SPEECH RECOGNITIONOral
  56. ADAPTING HFMCA TO GRAPH DATA: SELF-SUPERVISED LEARNING FOR GENERALIZABLE FMRI REPRESENTATIONSPoster
  57. ADAPTING NEURAL AUDIO CODECS TO EEGPoster
  58. ADAPTIVE COMPRESSED INTEGRATE-AND-FIRE TIME ENCODING MACHINEPoster
  59. ADAPTIVE DETERMINISTIC FLOW MATCHING FOR TARGET SPEAKER EXTRACTIONPoster
  60. ADAPTIVE GUIDANCE SEMANTICALLY ENHANCED VIA MULTIMODAL LLM FOR EDGE-CLOUD OBJECT DETECTIONPoster
  61. ADAPTIVE PER-CHANNEL ENERGY NORMALIZATION FRONT-END FOR ROBUST AUDIO SIGNAL PROCESSINGPoster
  62. ADAPTIVE ROTARY STEERING WITH JOINT AUTOREGRESSION FOR ROBUST EXTRACTION OF CLOSELY MOVING SPEAKERS IN DYNAMIC SCENARIOSOral
  63. ADAPTIVE RUNGE-KUTTA DYNAMICS FOR SPATIOTEMPORAL PREDICTIONOral
  64. ADAPTIVE SHARED EXPERTS WITH LORA-BASED MIXTURE OF EXPERTS FOR MULTI-TASK LEARNINGOral
  65. ADAPTIVE SPEAKER EMBEDDING SELF-AUGMENTATION FOR PERSONAL VOICE ACTIVITY DETECTION WITH SHORT ENROLLMENT SPEECHPoster
  66. ADAPTIVE-VOCO: COMPLEXITY-AWARE VISUAL TOKEN COMPRESSION FOR VISION-LANGUAGE MODELSPoster
  67. ADDRESSING GRADIENT MISALIGNMENT IN DATA-AUGMENTED TRAINING FOR ROBUST SPEECH DEEPFAKE DETECTIONOral
  68. ADVANCED MODELING OF INTERLANGUAGE SPEECH INTELLIGIBILITY BENEFIT WITH L1-L2 MULTI-TASK LEARNING USING DIFFERENTIABLE K-MEANS FOR ACCENT-ROBUST DISCRETE TOKEN-BASED ASRPoster
  69. ADVANCING SPEECH SUMMARIZATION IN MULTI-MODAL LLMS WITH REINFORCEMENT LEARNINGPoster
  70. ADVANCING SPEECH UNDERSTANDING IN SPEECH-AWARE LANGUAGE MODELS WITH GRPOPoster
  71. ADVERSARIAL PROMPT DISTILLATION FOR VISION-LANGUAGE MODELSPoster
  72. ADVERSARIAL UPDATE-BASED FEDERATED UNLEARNING FOR POISONED MODEL RECOVERYOral
  73. AFD-SLU: ADAPTIVE FEATURE DISTILLATION FOR SPOKEN LANGUAGE UNDERSTANDINGPoster
  74. AFT: AN EXEMPLAR-FREE CLASS INCREMENTAL LEARNING METHOD FOR ENVIRONMENTAL SOUND CLASSIFICATIONPoster
  75. AG-FUSION: ADAPTIVE GATED MULTIMODAL FUSION FOR 3D OBJECT DETECTION IN COMPLEX SCENESPoster
  76. AGENT-GSPO: COMMUNICATION-EFFICIENT MULTI-AGENT SYSTEMS VIA GROUP SEQUENCE POLICY OPTIMIZATIONOral
  77. AGRIDOCTOR: A MULTIMODAL INTELLIGENT ASSISTANT FOR AGRICULTUREPoster
  78. AI-GENERATED MUSIC DETECTION IN BROADCAST MONITORINGPoster
  79. AILIVE MIXER: A DEEP LEARNING BASED ZERO LATENCY AUTOMATIC MUSIC MIXER FOR LIVE MUSIC PERFORMANCESPoster
  80. AISHELL6-WHISPER: A CHINESE MANDARIN AUDIO-VISUAL WHISPER SPEECH DATASET WITH SPEECH RECOGNITION BASELINESPoster
  81. AL-COLE: AUGMENTED LAGRANGIAN FOR CONSTRAINED LEARNINGOral
  82. ALIGN TO THE PIVOT: DUAL ALIGNMENT WITH SELF-FEEDBACK FOR MULTILINGUAL MATH REASONINGPoster
  83. ALIGNING GENERATIVE SPEECH ENHANCEMENT WITH PERCEPTUAL FEEDBACKOral
  84. ALIGNING LANGUAGE MODELS FOR LYRIC-TO-MELODY GENERATION WITH RULE-BASED MUSICAL CONSTRAINTSPoster
  85. ALIGNING WHAT YOU SEPARATE: DENOISED PATCH MIXING FOR SOURCE-FREE DOMAIN ADAPTATION IN MEDICAL IMAGE SEGMENTATIONPoster
  86. AMBIDROP: ARRAY-AGNOSTIC SPEECH ENHANCEMENT USING AMBISONICS ENCODING AND DROPOUT-BASED LEARNINGPoster
  87. AN AMP-BASED ASYMPTOTIC ANALYSIS FOR NONLINEAR ONE-BIT PRECODINGOral
  88. AN EFFECTIVE DATA AUGMENTATION METHOD BY ASKING QUESTIONS ABOUT SCENE TEXT IMAGESPoster
  89. AN EFFICIENT NEURAL NETWORK FOR MODELING HUMAN AUDITORY NEUROGRAMS FOR SPEECHPoster
  90. AN EVENT-BASED SEQUENCE MODELING APPROACH TO RECOGNIZING NON-TRIAD CHORDS WITH OVERSEGMENTATION MINIMIZATIONPoster
  91. ANALYTIC INCREMENTAL LEARNING FOR SOUND SOURCE LOCALIZATION WITH IMBALANCE RECTIFICATIONPoster
  92. ANCHORED SPECTRAL ESTIMATOR FOR RIGID MOTION SYNCHRONIZATIONPoster
  93. ANIMALCLAP: TAXONOMY-AWARE LANGUAGE-AUDIO PRETRAINING FOR SPECIES RECOGNITION AND TRAIT INFERENCEPoster
  94. ANYACCOMP: GENERALIZABLE ACCOMPANIMENT GENERATION VIA QUANTIZED MELODIC BOTTLENECKPoster
  95. ANYRIR: ROBUST NON-INTRUSIVE ROOM IMPULSE RESPONSE ESTIMATION IN THE WILDPoster
  96. APPROXIMATE MESSAGE PASSING FOR MULTI-PREAMBLE DETECTION IN OTFS RANDOM ACCESSPoster
  97. APPROXIMATING UNIVARIATE FACTORED DISTRIBUTIONS VIA MESSAGE-PASSING ALGORITHMSPoster
  98. AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question AnsweringOral
  99. AR&D: A Framework for Retrieving and Describing Concepts for Interpreting AudioLLMsOral
  100. AR-LIF: ADAPTIVE RESET LEAKY INTEGRATE-AND-FIRE NEURON FOR SPIKING NEURAL NETWORKSPoster
  101. ARA-BEST-RQ: MULTI DIALECTAL ARABIC SSLPoster
  102. ARAP-GS: DRAG-DRIVEN AS-RIGID-AS-POSSIBLE 3D GAUSSIAN SPLATTING EDITING WITH DIFFUSION PRIORPoster
  103. ARCHAGENT: SCALABLE LEGACY SOFTWARE ARCHITECTURE RECOVERY WITH LLMSPoster
  104. ARCHI-TTS: A FLOW-MATCHING-BASED TEXT-TO-SPEECH MODEL WITH SELF-SUPERVISED SEMANTIC ALIGNER AND ACCELERATED INFERENCEPoster
  105. ARE MODERN SPEECH ENHANCEMENT SYSTEMS VULNERABLE TO ADVERSARIAL ATTACKS?Poster
  106. ARE THESE EVEN WORDS? QUANTIFYING THE GIBBERISHNESS OF GENERATIVE SPEECH MODELSOral
  107. AROMMA: UNIFYING OLFACTORY EMBEDDINGS FOR SINGLE MOLECULES AND MIXTURESPoster
  108. ARRAYDPS-REFINE: GENERATIVE REFINEMENT OF DISCRIMINATIVE MULTI-CHANNEL SPEECH ENHANCEMENTPoster
  109. ARTI-6: TOWARDS SIX-DIMENSIONAL ARTICULATORY SPEECH ENCODINGPoster
  110. ARTIFACT-AWARE EVALUATION FOR HIGH-QUALITY VIDEO GENERATIONOral
  111. ARTIFREE: DETECTING AND REDUCING GENERATIVE ARTIFACTS IN DIFFUSION-BASED SPEECH ENHANCEMENTPoster
  112. ASRC-SNN: ADAPTIVE SKIP RECURRENT CONNECTION SPIKING NEURAL NETWORKPoster
  113. ASSESSING IDENTITY LEAKAGE IN TALKING FACE GENERATION: METRICS AND EVALUATION FRAMEWORKPoster
  114. ASSESSING THE IMPACT OF SPEAKER IDENTITY IN SPEECH SPOOFING DETECTIONPoster
  115. ATTENTION TO DETAILS, LOGITS TO TRUTH: VISUAL-AWARE ATTENTION AND LOGITS ENHANCEMENT TO MITIGATE HALLUCINATIONS IN LVLMSOral
  116. ATTENTION-ENHANCED LEARNING FOR SENSING-ASSISTED LONG-TERM BEAM TRACKING IN MMWAVE COMMUNICATIONSOral
  117. ATTENTION2PROBABILITY: ATTENTION-DRIVEN TERMINOLOGY PROBABILITY ESTIMATION FOR ROBUST SPEECH-TO-TEXT SYSTEMPoster
  118. AUDEN-VOICE: GENERAL-PURPOSE VOICE ENCODER FOR SPEECH AND LANGUAGE UNDERSTANDINGPoster
  119. AUDIO DEEPFAKE DETECTION AT THE FIRST GREETING: “HI!”Poster
  120. AUDIO EFFECT ESTIMATION WITH DNN-BASED PREDICTION AND SEARCH ALGORITHMPoster
  121. AUDIO-CONDITIONED DIFFUSION LLMS FOR ASR AND DELIBERATION PROCESSINGPoster
  122. AUDIOCARDS: STRUCTURED METADATA IMPROVES AUDIO LANGUAGE MODELS FOR SOUND DESIGNOral
  123. AUDIOGEN-OMNI: A UNIFIED MULTIMODAL DIFFUSION TRANSFORMER FOR VIDEO-SYNCHRONIZED AUDIO, SPEECH, AND SONG GENERATIONPoster
  124. AUDIOGENIE-REASONER: A TRAINING-FREE MULTI-AGENT FRAMEWORK FOR COARSE-TO-FINE AUDIO DEEP REASONINGOral
  125. AUTOREGRESSIVE-GAUSSIAN MIXTURE MODELS: EFFICIENT GENERATIVE MODELING OF WSS SIGNALSOral
  126. AUTOVQA-G: SELF-IMPROVING AGENTIC FRAMEWORK FOR AUTOMATED VISUAL QUESTION ANSWERING AND GROUNDING ANNOTATIONPoster
  127. AUV: TEACHING AUDIO UNIVERSAL VECTOR QUANTIZATION WITH SINGLE NESTED CODEBOOKPoster
  128. AWDIFF: AN A TROUS WAVELET DIFFUSION MODEL FOR LUNG ULTRASOUND IMAGE SYNTHESISPoster
  129. AWGFORMER: ADAPTIVE WAVELET-GUIDED TRANSFORMER FOR MULTI-RESOLUTION TIME SERIES FORECASTINGPoster
  130. Accelerated Sinkhorn Algorithms for Partial Optimal TransportPoster
  131. Accelerated training of Gaussian processes using banded square exponential covariancesPoster
  132. AdaNODEs: Test Time Adaptation for Time Series Forecasting Using Neural ODEsPoster
  133. Adaptive Graph Coarsening for Efficient GNN TrainingPoster
  134. Adaptive Multi-Scale Correlation Meta-Network for Few-Shot Remote Sensing Image ClassificationPoster
  135. Adaptive and Balanced Re-initialization for Long-timescale Continual Test-time Domain AdaptationPoster
  136. Affordance Benchmark for MLLMsPoster
  137. AirGlove: Exploring Egocentric 3D Hand Tracking and Appearance Generalization for Sensing GlovesPoster
  138. Align2Speak: Improving TTS for Low Resource Languages via ASR-Guided Online Preference OptimizationPoster
  139. An Information Geometric Approach to Fairness With Equalized Odds ConstraintOral
  140. AnimateScene: Camera-controllable Animation in Any ScenePoster
  141. Anisotropic Tensor Deconvolution of Hyperspectral ImagesPoster
  142. Are VLMs Ready for Lane Topology Awareness in Autonomous Driving?Poster
  143. Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditionsOral
  144. Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion RecognitionPoster
  145. Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid AttentionOral
  146. AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?Oral
  147. Automated Dysphagia Screening Using Noninvasive Neck Acoustic SensingPoster
  148. Automatic Music Mixing using a Generative Model of Effect EmbeddingsOral
  149. Automatic Music Sample Identification with Multi-Track Contrastive LearningOral
  150. B-GRPO: UNSUPERVISED SPEECH EMOTION RECOGNITION BASED ON BATCHED-GROUP RELATIVE POLICY OPTIMIZATIONOral
  151. BACHI: BOUNDARY-AWARE SYMBOLIC CHORD RECOGNITION THROUGH MASKED ITERATIVE DECODING ON POP AND CLASSICAL MUSICPoster
  152. BADLLM-TG: A BACKDOOR DEFENDER POWERED BY LLM TRIGGER GENERATORPoster
  153. BADREASONER: PLANTING TUNABLE OVERTHINKING BACKDOORS INTO LARGE REASONING MODELS FOR FUN OR PROFITOral
  154. BAHOP: Similarity-based Basin Hopping for A fast hyper-parameter search in WSI classificationPoster
  155. BALANCING REWARDS IN TEXT SUMMARIZATION: MULTI-OBJECTIVE REINFORCEMENT LEARNING VIA HYPERVOLUME OPTIMIZATIONPoster
  156. BAYESIAN LOW-RANK FACTORIZATION FOR ROBUST MODEL ADAPTATIONPoster
  157. BAYESIAN MATRIX COMPLETION UNDER GEOMETRIC CONSTRAINTSPoster
  158. BAYESIAN SIGNAL SEPARATION VIA PLUG-AND-PLAY DIFFUSION-WITHIN-GIBBS SAMPLINGOral
  159. BBPE16: UTF-16-BASED BYTE-LEVEL BYTE-PAIR ENCODING FOR IMPROVED MULTILINGUAL SPEECH RECOGNITIONPoster
  160. BEAP-AGENT: BACKTRACKABLE EXECUTION AND ADAPTIVE PLANNING FOR GUI AGENTSPoster
  161. BEAT2AASIST MODEL WITH LAYER FUSION FOR ESDD 2026 CHALLENGEPoster
  162. BENCHMARKING GASLIGHTING ATTACKS AGAINST SPEECH LARGE LANGUAGE MODELSPoster
  163. BENCHMARKING HUMANS AND MACHINES ON COMPLEX MULTILINGUAL SPEECH UNDERSTANDING TASKSOral
  164. BENCHMARKING MULTIMODAL LARGE LANGUAGE MODELS FOR FACE RECOGNITIONPoster
  165. BEST-RQ-BASED SELF-SUPERVISED LEARNING FOR WHISPER DOMAIN ADAPTATIONPoster
  166. BEYOND AMPLITUDE: CHANNEL STATE INFORMATION PHASE-AWARE DEEP FUSION FOR ROBOTIC ACTIVITY RECOGNITIONOral
  167. BEYOND FACE SWAPPING: A DIFFUSION-BASED DIGITAL HUMAN BENCHMARK FOR MULTIMODAL DEEPFAKE DETECTIONPoster
  168. BEYOND LIPS: INTEGRATING GESTURE AND LIP CUES FOR ROBUST AUDIO-VISUAL SPEAKER EXTRACTIONPoster
  169. BEYOND MAPPING : DOMAIN-INVARIANT REPRESENTATIONS VIA SPECTRAL EMBEDDING OF OPTIMAL TRANSPORT PLANSPoster
  170. BEYOND OMNIDIRECTIONAL: NEURAL AMBISONICS ENCODING FOR ARBITRARY MICROPHONE DIRECTIVITY PATTERNS USING CROSS-ATTENTIONOral
  171. BEYOND SPECTRAL PEAKS: INTERPRETING THE CUES BEHIND SYNTHETIC IMAGE DETECTIONPoster
  172. BEYOND VIDEO-TO-SFX: VIDEO TO AUDIO SYNTHESIS WITH ENVIRONMENTALLY AWARE SPEECHPoster
  173. BEYOND VISUAL REALISM: TOWARD RELIABLE FINANCIAL TIME SERIES GENERATIONPoster
  174. BLOODROOT: WHEN WATERMARKING TURNS POISONOUS FOR STEALTHY BACKDOORPoster
  175. BONE-CONDUCTION GUIDED MULTIMODAL SPEECH ENHANCEMENT WITH CONDITIONAL DIFFUSION MODELSOral
  176. BRAIN-GRASP: GRAPH-BASED SALIENCY PRIORS FOR IMPROVED FMRI-BASED VISUAL BRAIN DECODINGPoster
  177. BRAIN-HGCN: A HYPERBOLIC GRAPH CONVOLUTIONAL NETWORK FOR BRAIN FUNCTIONAL NETWORK ANALYSISOral
  178. BRAIN-INFORMED SPEECH SEPARATION FOR COCHLEAR IMPLANTSOral
  179. BRAINPRINT-MODULATED TARGET SPEAKER EXTRACTIONPoster
  180. BREAK-THE-BEAT! CONTROLLABLE MIDI-TO-DRUM AUDIO SYNTHESISPoster
  181. BREAKING DATA EFFICIENCY DILEMMA: A FEDERATED AND AUGMENTED LEARNING FRAMEWORK FOR ALZHEIMER’S DISEASE DETECTION VIA SPEECHPoster
  182. BRIDGECODE: A DUAL SPEECH REPRESENTATION PARADIGM FOR AUTOREGRESSIVE ZERO-SHOT TEXT-TO-SPEECH SYNTHESISPoster
  183. BRIDGING THE GAP: A COMPARATIVE EXPLORATION OF SPEECH-LLM AND END-TO-END ARCHITECTURE FOR MULTILINGUAL CONVERSATIONAL ASRPoster
  184. BRIDGING THE GAP: TRANSFORMING NATURAL LANGUAGE QUESTIONS INTO SQL QUERIES VIA ABSTRACT QUERY PATTERN AND CONTEXTUAL SCHEMA MARKUPPoster
  185. BTCCHAT: ADVANCING REMOTE SENSING BI-TEMPORAL CHANGE CAPTIONING WITH MULTIMODAL LARGE LANGUAGE MODELPoster
  186. BUILD WITH PRECISION: BOTTOM-UP INFERENCE OF LINEAR DAGSPoster
  187. BadViM: Backdoor Attack against Vision MambaOral
  188. BaldWhisper: Faster Whisper with Head Shearing and Layer MergingPoster
  189. Bayesian Uncertainty-Aware MRI ReconstructionOral
  190. Behind the Scenes: Mechanistic Interpretability of LoRA-adapted Whisper for Speech Emotion RecognitionPoster
  191. Benchmarking Music Autotagging with MGPHot Expert Annotations vs. Generic Tag DatasetsOral
  192. Beyond Global Emotion: Fine-Grained Emotional Speech Synthesis with Dynamic Word-Level ModulationPoster
  193. Beyond Shadows: A Large-Scale Benchmark and Multi-Stage Framework for High-Fidelity Facial Shadow RemovalPoster
  194. Bi-Modal Textual Prompt Learning for Vision-Language Models in Remote SensingPoster
  195. BiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech RecognitionOral
  196. BioSEN: A Bio-acoustic Signal Enhancement Network for Animal VocalizationsPoster
  197. BladderFormer: A Streaming Transformer for Real-Time Urological State MonitoringPoster
  198. C-DGPA: Class-Centric Dual-Alignment Generative Prompt AdaptationPoster
  199. CAD-Judge: Toward Efficient Morphological Grading and Verification for Text-to-CAD GenerationOral
  200. CADM: Cluster-customized Adaptive Distance Metric for Categorical Data ClusteringPoster
  201. CAF-MAMBA: MAMBA-BASED CROSS-MODAL ADAPTIVE ATTENTION FUSION FOR MULTIMODAL DEPRESSION DETECTIONPoster
  202. CALM: JOINT CONTEXTUAL ACOUSTIC-LINGUISTIC MODELING FOR PERSONALIZATION OF MULTI-SPEAKER ASROral
  203. CAMEO: Collection of Multilingual Emotional Speech CorporaPoster
  204. CAN HIERARCHICAL CROSS-MODAL FUSION PREDICT HUMAN PERCEPTION OF AI DUBBED CONTENT?Poster
  205. CAN SYNTHETIC IMAGES SERVE AS EFFECTIVE AND EFFICIENT CLASS PROTOTYPES?Poster
  206. CAPACITY ANALYSIS OF OFDM SYSTEMS WITH A SWARM OF NETWORK-CONTROLLED REPEATERSOral
  207. CARE: COGNITIVE-REASONING AUGMENTED REINFORCEMENT FOR EMOTIONAL SUPPORT CONVERSATIONPoster
  208. CARE: Multi-Task Pretraining for Latent Continuous Action Representation in Robot ControlPoster
  209. CASTELLA: LONG AUDIO DATASET WITH CAPTIONS AND TEMPORAL BOUNDARIESPoster
  210. CAUCLIP: BRIDGING THE SIM-TO-REAL GAP IN SURGICAL VIDEO UNDERSTANDING VIA CAUSALITY-INSPIRED VISION-LANGUAGE MODELINGOral
  211. CAUSAL-SAM-LLM: LARGE LANGUAGE MODELS AS CAUSAL REASONERS FOR ROBUST MEDICAL SEGMENTATIONOral
  212. CC-G2PNP: STREAMING GRAPHEME-TO-PHONEME AND PROSODY WITH CONFORMER-CTC FOR UNSEGMENTED LANGUAGESPoster
  213. CE-GOCD: Central Entity-Guided Graph Optimization for Community Detection to Augment LLM Scientific Question AnsweringPoster
  214. CG-DMER: Hybrid Contrastive-Generative Framework for Disentangled Multimodal ECG Representation LearningOral
  215. CHAIN OF CORRECTION FOR FULL-TEXT SPEECH RECOGNITION WITH LARGE LANGUAGE MODELSPoster
  216. CHAIN-OF-CAPTION: TRAINING-FREE IMPROVEMENT OF MULTIMODAL LARGE LANGUAGE MODEL ON REFERRING EXPRESSION COMPREHENSIONPoster
  217. CHANNEL-WISE RETRIEVAL FOR MULTIVARIATE TIME SERIES FORECASTINGOral
  218. CHAOS: Chart Analysis with Outlier SamplesPoster
  219. CHROMOUVQA: BENCHMARKING VISION-LANGUAGE MODELS UNDER CHROMATIC CAMOUFLAGED IMAGESPoster
  220. CHUNK-WISE ATTENTION TRANSDUCERS FOR FAST AND ACCURATE STREAMING SPEECH-TO-TEXTPoster
  221. CHUNKWISE ALIGNERS FOR STREAMING SPEECH RECOGNITIONPoster
  222. CIDER: A Causal Cure for Brand-Obsessed Text-to-Image ModelsPoster
  223. CIMRAG: CIM-AWARE DOMAIN-ADAPTIVE AND NOISE-RESILIENT RETRIEVAL-AUGMENTED GENERATION FOR EDGE-BASED LLMSOral
  224. CLASS-AWARE PERMUTATION-INVARIANT SIGNAL-TO-DISTORTION RATIO FOR SEMANTIC SEGMENTATION OF SOUND SCENE WITH SAME-CLASS SOURCESPoster
  225. CLASS-INVARIANT TEST-TIME AUGMENTATION FOR DOMAIN GENERALIZATIONPoster
  226. CLIP-Guided Unsupervised Semantic-Aware Exposure CorrectionPoster
  227. CLIP-driven Zero-shot Learning with Ambiguous LabelsPoster
  228. CLUSTERING-DRIVEN MEMORY COMPRESSION FOR ON-DEVICE LARGE LANGUAGE MODELSPoster
  229. CO-INITIALIZATION OF CONTROL FILTER AND SECONDARY PATH VIA META-LEARNING FOR ACTIVE NOISE CONTROLPoster
  230. CODECSLIME: TEMPORAL REDUNDANCY COMPRESSION OF NEURAL SPEECH CODEC VIA DYNAMIC FRAME RATEPoster
  231. CODEPMP: SCALABLE PREFERENCE MODEL PRETRAINING FOR LARGE LANGUAGE MODEL REASONINGPoster
  232. CODESEP: LOW-BITRATE CODEC-DRIVEN SPEECH SEPARATION WITH BASE-TOKEN DISENTANGLEMENT AND AUXILIARY-TOKEN SERIAL PREDICTIONPoster
  233. COFE: A FRAMEWORK GENERATING COUNTERFACTUAL ECG FOR EXPLAINABLE CARDIAC AI-DIAGNOSTICSPoster
  234. COLLABORATIVE COMPRESSION FOR LARGE-SCALE MOE DEPLOYMENT ON EDGEPoster
  235. COMPLEX-VALUED PHASE SYNCHRONY REVEALS DIRECTIONAL COUPLING IN FMRI AND TRACKS MEDICATION EFFECTSOral
  236. COMPRESSED BC-LISTA VIA LOW-RANK CONVOLUTIONAL DECOMPOSITIONPoster
  237. COMPRESSING KV CACHE FOR LONG-CONTEXT LLM INFERENCE WITH INTER-LAYER ATTENTION SIMILARITYOral
  238. COMPRESSIVE RECOVERY OF SIGNALS DEFINED ON PERTURBED GRAPHSPoster
  239. CONCEPT ACTIVATION VECTORS: A UNIFYING VIEW AND ADVERSARIAL ATTACKSPoster
  240. CONDITION-INVARIANT FMRI DECODING OF SPEECH INTELLIGIBILITY WITH DEEP STATE SPACE MODELPoster
  241. CONDITIONAL RANDOM FIELDS FOR INTERACTIVE REFINEMENT OF HISTOPATHOLOGICAL PREDICTIONSPoster
  242. CONFCLIP: CONFIDENCE-WEIGHTED AND CLIPPED REWARD FOR REINFORCEMENT LEARNING IN LLMSOral
  243. CONFIDENCE-BASED FILTERING FOR SPEECH DATASET CURATION WITH GENERATIVE SPEECH ENHANCEMENT USING DISCRETE TOKENSPoster
  244. CONFORMAL INFERENCE FOR TIME SERIES OVER GRAPHSOral
  245. CONFORMAL SIGNAL TEMPORAL LOGIC FOR ROBUST REINFORCEMENT LEARNING CONTROL: A CASE STUDYPoster
  246. CONQUER: CONTEXT-AWARE REPRESENTATION WITH QUERY ENHANCEMENT FOR TEXT-BASED PERSON SEARCHPoster
  247. CONSTRAINT OPTIMIZED MULTICHANNEL MIXER-LIMITER DESIGNPoster
  248. CONSTRUCTING COMPOSITE FEATURES FOR INTERPRETABLE MUSIC-TAGGINGPoster
  249. CONTENT ANONYMIZATION FOR PRIVACY IN LONG-FORM AUDIOOral
  250. CONTENT LEAKAGE IN LIBRISPEECH AND ITS IMPACT ON THE PRIVACY EVALUATION OF SPEAKER ANONYMIZATIONPoster
  251. CONTEXTUAL BIASING FOR ASR IN SPEECH LLM WITH COMMON WORD CUES AND BIAS WORD POSITION PREDICTIONPoster
  252. CONTRASTIVE DISTILLATION OF EMOTION KNOWLEDGE FROM LLMS FOR ZERO-SHOT EMOTION RECOGNITIONOral
  253. CONTRASTIVE TIMBRE REPRESENTATIONS FOR MUSICAL INSTRUMENT AND SYNTHESIZER RETRIEVALPoster
  254. CONTROLLABLE LOCALIZED FACE ANONYMIZATION VIA DIFFUSION INPAINTINGOral
  255. CONTROLLING LANGUAGE DIFFICULTY IN DIALOGUES WITH LINGUISTIC FEATURESPoster
  256. COVA: TEXT-GUIDED COMPOSED VIDEO RETRIEVAL FOR AUDIO-VISUAL CONTENTPoster
  257. CP LOSS: CHANNEL-WISE PERCEPTUAL LOSS FOR TIME SERIES FORECASTINGPoster
  258. CPJ: Explainable Agricultural Pest Diagnosis via Caption–Prompt–Judge with LLM-Judged RefinementPoster
  259. CREDID: CREDIBLE MULTI-BIT WATERMARK FOR LARGE LANGUAGE MODELS IDENTIFICATIONPoster
  260. CROSS PSEUDO LABELING FOR WEAKLY SUPERVISED VIDEO ANOMALY DETECTIONPoster
  261. CROSS-CULTURAL BIAS IN MEL-SCALE REPRESENTATIONS: EVIDENCE AND ALTERNATIVES FROM SPEECH AND MUSICPoster
  262. CROSS-EXAMINER: EVALUATING CONSISTENCY OF LARGE LANGUAGE MODEL-GENERATED EXPLANATIONSPoster
  263. CROSS-LINGUAL INTERLEAVING FOR SPEECH LANGUAGE MODELSPoster
  264. CROSS-MODAL GUIDANCE FOR FAST DIFFUSION-BASED COMPUTED TOMOGRAPHYPoster
  265. CROSS-MODAL KNOWLEDGE DISTILLATION FOR SPEECH LARGE LANGUAGE MODELSOral
  266. CROSS-REPRESENTATION BENCHMARKING IN TIME-SERIES ELECTRONIC HEALTH RECORDS FOR CLINICAL OUTCOME PREDICTIONPoster
  267. CS3-BENCH: EVALUATING AND ENHANCING SPEECH-TO-SPEECH LLMS FOR MANDARIN-ENGLISH CODE-SWITCHINGPoster
  268. CTC-DID: CTC-BASED ARABIC DIALECT IDENTIFICATION FOR STREAMING APPLICATIONSPoster
  269. CTR-LORA: CURVATURE-AWARE AND TRUST-REGION GUIDED LOW-RANK ADAPTATION FOR LARGE LANGUAGE MODELSOral
  270. CaSNet: Compress-and-Send Network Based Multi-Device Speech Enhancement Model for Distributed Microphone ArraysPoster
  271. Can LLMs Beat Humans in Debating? A Dynamic Multi-agent Framework for Competitive DebatePoster
  272. Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMsPoster
  273. Causal Fingerprints of AI Generative ModelsPoster
  274. Channel Prediction under Network Distribution Shift Using Continual Learning-based Loss RegularizationOral
  275. Channel, Trend and Periodic-Wise Representation Learning for Multivariate Long-term Time Series ForecastingPoster
  276. Classifier-Centric Adaptive Framework for Open-Vocabulary Camouflaged Object SegmentationPoster
  277. ClearGCD: Mitigating Shortcut Learning For Robust Generalized Category DiscoveryPoster
  278. CoVariance Filters and Neural Networks over Hilbert SpacesPoster
  279. Cognitive Load Estimation Using Brain Foundation Models and Interpretability for BCIsPoster
  280. CompSpoof: A Dataset and Joint Learning Framework for Component-Level Audio Anti-spoofing CountermeasuresPoster
  281. Complementary Subspace Low-Rank Adaptation of Vision-Language Models for Few-Shot ClassificationOral
  282. Compositional Image Synthesis with Inference-Time ScalingPoster
  283. Compound-QA: A Benchmark for Evaluating LLMs on Compound QuestionsPoster
  284. Conditional Prior-based Non-stationary Channel Estimation Using Accelerated Diffusion ModelsPoster
  285. Confidence-Guided Error Correction for Disordered Speech RecognitionPoster
  286. Conflict-Aware Client Selection for Multi-Server Federated LearningPoster
  287. Conformalized Gaussian processes for online uncertainty quantification over graphsOral
  288. Conjugate Relation Modeling for Few-Shot Knowledge Graph CompletionPoster
  289. Continuous-Token Diffusion for Speaker-Referenced TTS in Multimodal LLMsPoster
  290. Controllable Embedding Transformation for Mood-Guided Music RetrievalPoster
  291. CosyAccent: Duration-Controllable Accent Normalization Using Source-Synthesis Training DataPoster
  292. Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech SynthesisPoster
  293. Cross-Modal Bottleneck Fusion for Noise Robust Audio-Visual Speech RecognitionPoster
  294. Cross-domain EEG-based Emotion Recognition with Contrastive LearningPoster
  295. D3PIA: A Discrete Denoising Diffusion Model for Piano Accompaniment Generation from Lead sheetPoster
  296. DAIEN-TTS: DISENTANGLED AUDIO INFILLING FOR ENVIRONMENT-AWARE TEXT-TO-SPEECH SYNTHESISPoster
  297. DAM: Dual Active Learning with Multimodal Foundation Model for Source-Free Domain AdaptationPoster
  298. DAME: DURATION-AWARE MATRYOSHKA EMBEDDING FOR DURATION-ROBUST SPEAKER VERIFICATIONPoster
  299. DAMO: A DATA-EFFICIENT MULTIMODAL ORCHESTRATOR FOR TEMPORAL REASONING WITH VIDEO LLMSOral
  300. DAPT: A DUAL-PATH FRAMEWORK FOR MULTILINGUAL MULTI-HOP QUESTION ANSWERINGPoster
  301. DARC-CLIP: DYNAMIC ADAPTIVE REFINEMENT WITH CROSS-ATTENTION FOR MEME UNDERSTANDINGPoster
  302. DARKVRAI: CAPTURE-CONDITION CONDITIONING AND BURST-ORDER SELECTIVE SCAN FOR LOW-LIGHT RAW VIDEO DENOISINGPoster
  303. DAT-CFTNET: SPEECH ENHANCEMENT FOR COCHLEAR IMPLANT RECIPIENTS USING ATTENTION-BASED DUAL-PATH RECURRENT NEURAL NETWORKPoster
  304. DATA-DRIVEN CLUSTERING AND MERGING OF ADAPTERS FOR ON-DEVICE LARGE LANGUAGE MODELSPoster
  305. DATA-DRIVEN GRAPH FILTERS VIA ADAPTIVE SPECTRAL SHAPINGPoster
  306. DC-MAMBER: A DUAL CHANNEL PREDICTION MODEL BASED ON MAMBA AND LINEAR TRANSFORMER FOR MULTIVARIATE TIME SERIES FORECASTINGPoster
  307. DCINJECT: PERSISTENT BACKDOOR ATTACKS VIA FREQUENCY MANIPULATION IN PERSONAL FEDERATED LEARNINGOral
  308. DDSA: Dual-Domain Strategic Attack for Spatial-Temporal Efficiency in Adversarial Robustness TestingPoster
  309. DDSC: DYNAMIC DUAL-SIGNAL CURRICULUM FOR DATA-EFFICIENT ACOUSTIC SCENE CLASSIFICATION UNDER DOMAIN SHIFTPoster
  310. DECAF: Dynamic Envelope Context-Aware Fusion for Speech-Envelope Reconstruction from EEGPoster
  311. DECENTRALIZED LEARNING WITH DYNAMICALLY REFINED EDGE WEIGHTS: A DATA-DEPENDENT FRAMEWORKPoster
  312. DECODE: DUAL-ENHANCED CONDITIONED DIFFUSION FOR EEG FORECASTINGPoster
  313. DECODER-ONLY CONFORMER WITH MODALITY-AWARE SPARSE MIXTURES OF EXPERTS FOR ASRPoster
  314. DEEP DUBBING: END-TO-END AUTO-AUDIOBOOK SYSTEM WITH TEXT-TO-TIMBRE AND CONTEXT-AWARE INSTRUCT-TTSPoster
  315. DEEP IMAGE PRIOR WITH L0 GRADIENT REGULARIZER FOR IMAGE SMOOTHINGOral
  316. DEEP TPC: TEMPORAL-PRIOR CONDITIONING FOR TIME SERIES FORECASTINGOral
  317. DEEPAQ: A PERCEPTUAL AUDIO QUALITY METRIC BASED ON FOUNDATIONAL MODELS AND WEAKLY SUPERVISED LEARNINGOral
  318. DELNET: CONTINUOUS ALL-IN-ONE WEATHER REMOVAL VIA DYNAMIC EXPERT LIBRARYPoster
  319. DELTA: LANGUAGE DIFFUSION-BASED EEG-TO-TEXT ARCHITECTUREPoster
  320. DEMO-POSE: DEPTH-MONOCULAR MODALITY FUSION FOR OBJECT POSE ESTIMATIONOral
  321. DERIVING MOMENTS IN THE AGE OF GOSSIP PROCESS FROM PERCOLATIONPoster
  322. DETAILCLIP: INJECTING IMAGE DETAILS INTO CLIP’S FEATURE SPACEPoster
  323. DIACDM: COGNITIVE DIAGNOSIS IN TEACHER-STUDENT DIALOGUES USING THE INITIATION-RESPONSE-EVALUATION FRAMEWORKPoster
  324. DIFFERENTIALLY PRIVATE CLUSTERED FEDERATED LEARNING WITH PRIVACY-PRESERVING INITIALIZATION AND NORMALITY-DRIVEN AGGREGATIONOral
  325. DIFFFACE-EDIT: A DIFFUSION-BASED FACIAL DATASET FOR FORGERY-SEMANTIC DRIVEN DEEPFAKE DETECTION ANALYSISPoster
  326. DIFFNATOR: GENERATING STRUCTURED EXPLANATIONS OF TIME-SERIES DIFFERENCESOral
  327. DIFFUSION TIMBRE TRANSFER VIA MUTUAL INFORMATION GUIDED INPAINTINGPoster
  328. DIFFUSION-BASED UNSUPERVISED AUDIO-VISUAL SPEECH SEPARATION IN NOISY ENVIRONMENTS WITH NOISE PRIORPoster
  329. DIFFUSION-LINK: DIFFUSION PROBABILISTIC MODEL FOR BRIDGING THE AUDIO-TEXT MODALITY GAPPoster
  330. DIFFUSIONCOM: STRUCTURE-AWARE MULTIMODAL DIFFUSION MODEL FOR MULTIMODAL KNOWLEDGE GRAPH COMPLETIONPoster
  331. DIRCR: Dual-Inference Rule-Contrastive Reasoning for Solving RAVENsPoster
  332. DISCONTSE: SINGLE-STEP DIFFUSION SPEECH ENHANCEMENT BASED ON JOINT DISCRETE AND CONTINUOUS EMBEDDINGSPoster
  333. DISCRETE DIFFUSION FOR GENERATIVE MODELING OF TEXT-ALIGNED SPEECH TOKENSPoster
  334. DISCRIMINANT LEARNING-BASED COLORSPACE FOR BLADE SEGMENTATIONOral
  335. DISPATCH: DISTILLING SELECTIVE PATCHES FOR SPEECH ENHANCEMENTPoster
  336. DISSECTING PERFORMANCE DEGRADATION IN AUDIO SOURCE SEPARATION UNDER SAMPLING FREQUENCY MISMATCHPoster
  337. DISSR: DISENTANGLING SPEECH REPRESENTATION FOR DEGRADATION-PRIOR GUIDED CROSS-DOMAIN SPEECH RESTORATIONPoster
  338. DISTILLATION-BASED LAYER DROPPING (DLD): EFFECTIVE END-TO-END FRAMEWORK FOR DYNAMIC SPEECH NETWORKSPoster
  339. DISTILLING TIME SERIES FOUNDATION MODELS FOR EFFICIENT FORECASTINGPoster
  340. DISTILMOS: LAYER-WISE SELF-DISTILLATION FOR SELF-SUPERVISED LEARNING MODEL-BASED MOS PREDICTIONOral
  341. DISTRIBUTED ASSOCIATIVE MEMORY VIA ONLINE CONVEX OPTIMIZATIONPoster
  342. DISTRIBUTED MULTICHANNEL ACTIVE NOISE CONTROL WITH ASYNCHRONOUS COMMUNICATIONPoster
  343. DISTRIBUTION-AWARE MOBILITY-ASSISTED DECENTRALIZED FEDERATED LEARNINGPoster
  344. DITSE: HIGH-FIDELITY GENERATIVE SPEECH ENHANCEMENT VIA LATENT DIFFUSION TRANSFORMERSPoster
  345. DITSINGER: SCALING SINGING VOICE SYNTHESIS WITH DIFFUSION TRANSFORMER AND IMPLICIT ALIGNMENTPoster
  346. DMP-TTS: DISENTANGLED MULTI-MODAL PROMPTING FOR CONTROLLABLE TEXT-TO-SPEECH WITH CHAINED GUIDANCEOral
  347. DNF: Dual-Layer Nested Fingerprinting for Large Language Model Intellectual Property ProtectionPoster
  348. DNN-BASED ONLINE SOURCE COUNTING BASED ON SPATIAL GENERALIZED MAGNITUDE SQUARED COHERENCEOral
  349. DNS: DATA-DRIVEN NONLINEAR SMOOTHER FOR COMPLEX MODEL-FREE PROCESSPoster
  350. DO FOUNDATIONAL AUDIO ENCODERS UNDERSTAND MUSIC STRUCTURE?Poster
  351. DO WE REALLY NEED SELF-ATTENTION FOR STREAMING AUTOMATIC SPEECH RECOGNITION?Oral
  352. DOMAIN-ADAPTIVE MODEL MERGING ACROSS DISCONNECTED MODESPoster
  353. DOMAIN-INVARIANT MIXED-DOMAIN SEMI-SUPERVISED MEDICAL IMAGE SEGMENTATION WITH CLUSTERED MAXIMUM MEAN DISCREPANCY ALIGNMENTPoster
  354. DOMINO: DOMINANT PATH-BASED COMPENSATION FOR HARDWARE IMPAIRMENTS IN MODERN WIFI SENSINGPoster
  355. DOPPLER RADIANCE FIELD-GUIDED ANTENNA SELECTION FOR IMPROVED GENERALIZATION IN MULTI-ANTENNA WI-FI-BASED HUMAN ACTIVITY RECOGNITIONPoster
  356. DP-DEGAUSS: DYNAMIC PROBABILISTIC GAUSSIAN DECOMPOSITION FOR EGOCENTRIC 4D SCENE RECONSTRUCTIONPoster
  357. DP-LAC: LIGHTWEIGHT ADAPTIVE CLIPPING FOR DIFFERENTIALLY PRIVATE FEDERATED FINE-TUNING OF LANGUAGE MODELSPoster
  358. DPANet: Dual Pyramid Attention Network for Multivariate Time Series ForecastingPoster
  359. DPI: EXPLOITING PARAMETER HETEROGENEITY FOR INTERFERENCE-FREE FINE-TUNINGPoster
  360. DPMM-CFL: CLUSTERED FEDERATED LEARNING VIA DIRICHLET PROCESS MIXTURE MODEL NONPARAMETRIC CLUSTERINGOral
  361. DRAG WITHIN PRIOR DISTRIBUTION: TEXT-CONDITIONED POINT-BASED IMAGE EDITING WITHIN DISTRIBUTION CONSTRAINTSOral
  362. DREAMVAR: TAMING REINFORCED VISUAL AUTOREGRESSIVE MODEL FOR HIGH-FIDELITY SUBJECT-DRIVEN IMAGE GENERATIONPoster
  363. DRIVINGSCENE: A MULTI-TASK ONLINE FEED-FORWARD 3D GAUSSIAN SPLATTING METHOD FOR DYNAMIC DRIVING SCENESPoster
  364. DSGBENCH: A DIVERSE STRATEGIC GAME BENCHMARK FOR EVALUATING LLM-BASED AGENTS IN COMPLEX DECISION-MAKING ENVIRONMENTSPoster
  365. DSPAST: DISENTANGLED REPRESENTATIONS FOR SPATIAL AUDIO REASONING WITH LARGE LANGUAGE MODELSPoster
  366. DSPC: Dual-Stage Progressive Compression Framework for Efficient Long-Context ReasoningPoster
  367. DSTCS: DUAL-STUDENT TEACHER FRAMEWORK WITH SEGMENT ANYTHING MODEL FOR SEMI-SUPERVISED PUBIC SYMPHYSIS-FETAL HEAD SEGMENTATIONPoster
  368. DSVM-UNet : Enhancing VM-UNet with Dual Self-distillation for Medical Image SegmentationPoster
  369. DTT-BSR: GAN-BASED DTTNET WITH ROPE TRANSFORMER ENHANCEMENT FOR MUSIC SOURCE RESTORATIONPoster
  370. DUAL-SPACE KNOWLEDGE DISTILLATION WITH KEY-QUERY MATCHING FOR LARGE LANGUAGE MODELS WITH VOCABULARY MISMATCHPoster
  371. DYNAMIC ESTIMATION LOSS CONTROL IN VARIATIONAL QUANTUM SENSING VIA ONLINE CONFORMAL INFERENCEPoster
  372. DYNAMIC MULTI-EXPERT PROJECTORS WITH STABILIZED ROUTING FOR MULTILINGUAL SPEECH RECOGNITIONPoster
  373. DYNAMICAL ISOMETRY BASED RIGOROUS FAIR NEURAL ARCHITECTURE SEARCHPoster
  374. Data-Driven Two-Stage IRS-Aided Sumrate Maximization with Inexact PrecodingOral
  375. Dataset-Driven Channel Masks in Transformers for Multivariate Time SeriesPoster
  376. Decentralized Detection with Many Sensors: Optimality of Exchangeable and Identical Encoding PoliciesOral
  377. Decentralized Learning Strategies for Estimation Error Minimization with Graph Neural NetworksPoster
  378. Deep Reinforcement Learning for Dynamic Sensing and CommunicationsOral
  379. Deformable Attention Graph Representation Learning for Histopathology Whole Slide Image AnalysisOral
  380. Demystifying the Roles of LLM Layers in Retrieval, Knowledge, and ReasoningPoster
  381. Depth-Guided Metric-Aware Temporal Consistency for Monocular Video Human Mesh RecoveryPoster
  382. Diff-VS: Efficient Audio-Aware Diffusion U-Net for Vocals SeparationPoster
  383. DiffQ: UNIFIED PARAMETER INITIALIZATION FOR VARIATIONAL QUANTUM ALGORITHMS VIA DIFFUSION MODELSOral
  384. Differential Privacy of Network Parameters from a System Identification PerspectivePoster
  385. Diffusion Algorithm for Metalens Optical Aberration CorrectionOral
  386. Diffusion Denoiser Achievable Analysis for Finite Blocklength Unsourced Random AccessPoster
  387. Diffusion-aided Extreme Video Compression with Lightweight Semantics GuidanceOral
  388. Direct Preference Optimization for Speech Autoregressive Diffusion ModelsPoster
  389. Direct Simultaneous Translation Activation for Large Audio-Language ModelsPoster
  390. Discrete-Periodic Ambiguity Function of Random Communication SignalsOral
  391. Do Bias Benchmarks Generalise? Evidence from Voice-based Evaluation of Gender Bias in SpeechLLMsPoster
  392. Do We Need EMA for Diffusion-Based Speech Enhancement? Toward a Magnitude-Preserving Network ArchitecturePoster
  393. Do You Hear What I Mean? Quantifying the Instruction-Perception Gap in Instruction-Guided Expressive Text-To-Speech SystemsOral
  394. Domain-Invariant Representation Learning of Bird SoundsPoster
  395. Dual Data Scaling for Robust Two-Stage User-Defined Keyword SpottingPoster
  396. Dual-Strategy-Enhanced ConBiMamba for Neural Speaker DiarizationPoster
  397. DyWPE: Signal-Aware Dynamic Wavelet Positional Encoding for Time Series TransformersOral
  398. Dynamic Summary Generation for Interpretable Multimodal Depression DetectionPoster
  399. Dynamically Slimmable Speech Enhancement Network with Metric-Guided TrainingOral
  400. E-SocialNav: Efficient Socially Compliant Navigation with Language ModelsPoster
  401. E2E-AEC: IMPLEMENTING AN END-TO-END NEURAL NETWORK LEARNING APPROACH FOR ACOUSTIC ECHO CANCELLATIONOral
  402. EASY TURN: INTEGRATING ACOUSTIC AND LINGUISTIC MODALITIES FOR ROBUST TURN-TAKING IN FULL-DUPLEX SPOKEN DIALOGUE SYSTEMSPoster
  403. ECG-AGENT: ON-DEVICE TOOL-CALLING AGENT FOR ECG MULTI-TURN DIALOGUEPoster
  404. ECHO: Frequency-aware Hierarchical Encoding for Variable-length SignalsPoster
  405. ECHOFAKE: A REPLAY-AWARE DATASET FOR PRACTICAL SPEECH DEEPFAKE DETECTIONPoster
  406. EDGE COLLABORATIVE GAUSSIAN SPLATTING WITH INTEGRATED RENDERING AND COMMUNICATIONOral
  407. EDGESPOT: EFFICIENT AND HIGH-PERFORMANCE FEW-SHOT MODEL FOR KEYWORD SPOTTINGPoster
  408. EDITS: ENHANCING DATASET DISTILLATION WITH IMPLICIT TEXTUAL SEMANTICSPoster
  409. EEG-SEEGRAPH: INTERPRETING FUNCTIONAL CONNECTIVITY DISRUPTIONS IN DEMENTIAS VIA SPARSE-EXPLANATORY DYNAMIC EEG-GRAPH LEARNINGPoster
  410. EEND-SAA: Enrollment-Less Main Speaker Voice Activity Detection using Self-Attention AttractorsOral
  411. EFFICIENT FEW-SHOT LEARNING FOR EDGE AI VIA KNOWLEDGE DISTILLATION ON MOBILEVITPoster
  412. EFFICIENT SOLUTIONS FOR MITIGATING INITIALIZATION BIAS IN UNSUPERVISED SELF-ADAPTIVE AUDITORY ATTENTION DECODINGPoster
  413. EGGCodec: A Robust Neural Encodec Framework for EGG Reconstruction and F0 ExtractionPoster
  414. EMG-to-Speech with Fewer ChannelsPoster
  415. EMO-TTA: IMPROVING TEST-TIME ADAPTATION OF AUDIO-LANGUAGE MODELS FOR SPEECH EMOTION RECOGNITIONOral
  416. EMOE: EIGENBASIS-GUIDED ROUTING FOR MIXTURE-OF-EXPERTSOral
  417. EMORL-TTS: REINFORCEMENT LEARNING FOR FINE-GRAINED EMOTION CONTROL IN LLM-BASED TTSPoster
  418. EMOTION AND ACOUSTICS SHOULD AGREE: CROSS-LEVEL INCONSISTENCY ANALYSIS FOR AUDIO DEEPFAKE DETECTIONPoster
  419. EMOTION-ALIGNED GENERATION IN DIFFUSION TEXT TO SPEECH MODELS VIA PREFERENCE-GUIDED OPTIMIZATIONOral
  420. EMOTIONAL DIMENSION CONTROL IN LANGUAGE MODEL-BASED TEXT-TO-SPEECH: SPANNING A BROAD SPECTRUM OF HUMAN EMOTIONSPoster
  421. EMPEROR: EFFICIENT MOMENT-PRESERVING REPRESENTATION OF DISTRIBUTIONSPoster
  422. EMPOWERING MULTIMODAL RESPIRATORY SOUND CLASSIFICATION WITH COUNTERFACTUAL ADVERSARIAL DEBIASING FOR OUT-OF-DISTRIBUTION ROBUSTNESSPoster
  423. ENCODING EMOTION THROUGH SELF-SUPERVISED EYE MOVEMENT RECONSTRUCTIONPoster
  424. ENDOCAVER: HANDLING FOG, BLUR AND GLARE IN ENDOSCOPIC IMAGES VIA JOINT DEBLURRING-SEGMENTATIONPoster
  425. ENHANCED GENERATIVE MACHINE LISTENERPoster
  426. ENHANCED GRAPH TRANSFORMER WITH SERIALIZED GRAPH TOKENSOral
  427. ENHANCING CROSS-VIEW GEO-LOCALIZATION GENERALIZATION VIA GLOBAL-LOCAL CONSISTENCY AND GEOMETRIC EQUIVARIANCEPoster
  428. ENHANCING DOCUMENT-LEVEL MACHINE TRANSLATION VIA FILTERED SYNTHETIC CORPORA AND TWO-STAGE LLM ADAPTATIONPoster
  429. ENHANCING NOISE ROBUSTNESS FOR NEURAL SPEECH CODECS THROUGH RESOURCE-EFFICIENT PROGRESSIVE QUANTIZATION PERTURBATION SIMULATIONPoster
  430. ENHANCING POST-TRAINING QUANTIZATION VIA FUTURE ACTIVATION AWARENESSPoster
  431. ENHANCING SPEAKER VERIFICATION WITH W2V-BERT 2.0 AND KNOWLEDGE DISTILLATION GUIDED STRUCTURED PRUNINGOral
  432. ENHANCING VALUE ALIGNMENT OF LLMS WITH MULTI-AGENT SYSTEM AND COMBINATORIAL FUSIONOral
  433. ENTROCUT: ENTROPY-GUIDED ADAPTIVE TRUNCATION FOR EFFICIENT CHAIN-OF-THOUGHT REASONING IN SMALL-SCALE LARGE REASONING MODELSPoster
  434. ENTROLLM: ENTROPY ENCODED WEIGHT COMPRESSION FOR EFFICIENT LARGE LANGUAGE MODEL INFERENCE ON EDGE DEVICESPoster
  435. ENTROPY-GUIDED DATA-EFFICIENT TRAINING FOR MULTIMODAL REASONING REWARD MODELSPoster
  436. ENTROPYGS: AN EFFICIENT ENTROPY CODING ON 3D GAUSSIAN SPLATTINGOral
  437. ENVSSLAM-FFN: LIGHTWEIGHT LAYER-FUSED SYSTEM FOR ESDD 2026 CHALLENGEPoster
  438. ERASING YOUR VOICE BEFORE IT’S HEARD: TRAINING-FREE SPEAKER UNLEARNING FOR ZERO-SHOT TEXT-TO-SPEECHPoster
  439. ESTABLISHING STOCHASTIC OBJECT MODELS FROM NOISY DATA VIA AMBIENT MEASUREMENT-INTEGRATED DIFFUSIONOral
  440. ESTIMATING RESPIRATORY EFFORT FROM NOCTURNAL BREATHING SOUNDS FOR OBSTRUCTIVE SLEEP APNOEA SCREENINGPoster
  441. ETUDE: PIANO COVER GENERATION WITH A THREE-STAGE APPROACH — EXTRACT, STRUCTURALIZE, AND DECODEPoster
  442. EVA-Score: Evaluating Abstractive Long-form Summarization on Informativeness through Extraction and ValidationPoster
  443. EVALUATING BIAS IN SPOKEN DIALOGUE LLMS FOR REAL-WORLD DECISIONS AND RECOMMENDATIONSPoster
  444. EVALUATING COMPOSITIONAL STRUCTURE IN AUDIO REPRESENTATIONSOral
  445. EVALUATING DISENTANGLED REPRESENTATIONS FOR CONTROLLABLE MUSIC GENERATIONPoster
  446. EVALUATING EMOTION RECOGNITION IN SPOKEN LANGUAGE MODELS ON EMOTIONALLY INCONGRUENT SPEECHPoster
  447. EVALUATING HIGH-RESOLUTION PIANO SUSTAIN PEDAL DEPTH ESTIMATION WITH MUSICALLY INFORMED METRICSPoster
  448. EVALUATING TEST-TIME ADAPTATION FOR FACIAL EXPRESSION RECOGNITION UNDER NATURAL CROSS-DATASET DISTRIBUTION SHIFTSPoster
  449. EVENT-AIDED SEMANTIC SCENE COMPLETIONPoster
  450. EXPLAINABLE DEEPFAKE DETECTION WITH RL ENHANCED SELF-BLENDED IMAGESPoster
  451. EXPLICIT TIME-FREQUENCY DYNAMICS FOR SKELETON-BASED GAIT RECOGNITIONPoster
  452. EXPLORING FINE-TUNING OF LARGE AUDIO LANGUAGE MODELS FOR SPOKEN LANGUAGE UNDERSTANDING UNDER LIMITED SPEECH DATAOral
  453. EXPLORING RESOLUTION-WISE SHARED ATTENTION IN HYBRID MAMBA-U-NETS FOR IMPROVED CROSS-CORPUS SPEECH ENHANCEMENTOral
  454. Efficient Gaussian Process Learning via Subspace ProjectionsPoster
  455. Efficient Plug-and-Play Method for Dynamic Imaging via Kalman SmoothingPoster
  456. Efficient Quantization-Aware Neural Receivers: Beyond Post-Training QuantizationPoster
  457. Efficient Segment Anything with Depth-Aware Fusion and Limited Training DataOral
  458. Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training ModelsOral
  459. EmoShift: Lightweight Activation Steering for Enhanced Emotion-Aware Speech SynthesisPoster
  460. Enabling Multi-Species Bird Classification on Low-Power Bioacoustic LoggersPoster
  461. Enhancing Action and Ingredient Modeling for Semantically Grounded Recipe GenerationPoster
  462. Enhancing Guidance for Missing Data in Diffusion-Based Sequential RecommendationPoster
  463. Enhancing Layer Attention Efficiency through Pruning Redundant RetrievalsPoster
  464. Ensuring Reliable Participation in Subjective Video Quality Tests Across PlatformsPoster
  465. Entropy-Guided GRVQ for Ultra-Low Bitrate Neural Speech CodecPoster
  466. Environment-Aware MIMO Channel Estimation in Pilot-Constrained Upper Mid-Band SystemsOral
  467. Environmental Sound Deepfake Detection Challenge: An OverviewPoster
  468. Equivariant Deep Equilibrium Models for Imaging Inverse ProblemsOral
  469. Erosion Attack for Adversarial Training to Enhance Semantic Segmentation RobustnessPoster
  470. EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio CodingPoster
  471. Evaluating pretrained speech embedding systems for dysarthria detection across heterogenous datasetsPoster
  472. Event classification by physics-informed inpainting for distributed multichannel acoustic sensor with partially degraded channelsPoster
  473. Exploring Audio Hallucination in Egocentric Video UnderstandingOral
  474. Exploring How Audio Effects Alter Emotion with Foundation ModelsPoster
  475. Exterior sound field estimation based on physics-constrained kernelPoster
  476. FAC-FACODEC: CONTROLLABLE ZERO-SHOT FOREIGN ACCENT CONVERSION WITH FACTORIZED SPEECH CODECPoster
  477. FACESLEUTH-R: ADAPTIVE ORIENTATION-AWARE ATTENTION FOR ROBUST MICRO-EXPRESSION RECOGNITIONOral
  478. FADEMEM: BIOLOGICALLY-INSPIRED FORGETTING FOR EFFICIENT AGENT MEMORYPoster
  479. FAKE SPEECH WILD: DETECTING DEEPFAKE SPEECH ON SOCIAL MEDIA PLATFORMPoster
  480. FAST SINGLE-SNAPSHOT HARMONIC RECOVERY WITH 2D SPARSE ARRAYS USING BCCB MATRICESPoster
  481. FAST-ULCNET: A FAST AND ULTRA LOW COMPLEXITY NETWORK FOR SINGLE-CHANNEL SPEECH ENHANCEMENTPoster
  482. FASTAV: EFFICIENT TOKEN PRUNING FOR AUDIO-VISUAL LARGE LANGUAGE MODEL INFERENCEPoster
  483. FASTEAGLE: CASCADED DRAFTING FOR ACCELERATING SPECULATIVE DECODINGPoster
  484. FC-VFI: FAITHFUL AND CONSISTENT VIDEO FRAME INTERPOLATION FOR HIGH-FPS SLOW MOTION VIDEO GENERATIONOral
  485. FEATURE IDENTIFICATION FOR HIERARCHICAL CONTRASTIVE LEARNINGOral
  486. FEATURE PROJECTION LEARNING FOR BETTER VISION-LANGUAGE REASONINGPoster
  487. FED-GAME: PERSONALIZED FEDERATED LEARNING WITH GRAPH ATTENTION MIXTURE-OF-EXPERTS FOR TIME-SERIES FORECASTINGOral
  488. FEDCOMPASS: FEDERATED CLUSTERED AND PERIODIC AGGREGATION FRAMEWORK FOR HYBRID CLASSICAL-QUANTUM MODELSPoster
  489. FEDERATED HETEROGENEOUS LANGUAGE MODEL OPTIMIZATION FOR HYBRID AUTOMATIC SPEECH RECOGNITIONPoster
  490. FEDERATED JOINT LEARNING FOR DOMAIN AND CLASS GENERALIZATIONPoster
  491. FEW-SHOT AND PSEUDO-LABEL GUIDED SPEECH QUALITY EVALUATION WITH LARGE LANGUAGE MODELSOral
  492. FGGM: FISHER-GUIDED GRADIENT MASKING FOR CONTINUAL LEARNINGPoster
  493. FILTER THEN ATTEND: IMPROVING ATTENTION-BASED TIME SERIES FORECASTING WITH SPECTRAL FILTERINGOral
  494. FINE-GRAINED FRAME MODELING IN MULTI-HEAD SELF-ATTENTION FOR SPEECH DEEPFAKE DETECTIONPoster
  495. FINE-TUNING LARGE AUDIO-LANGUAGE MODELS WITH LORA FOR PRECISE TEMPORAL LOCALIZATION OF PROLONGED EXPOSURE THERAPY ELEMENTSPoster
  496. FINE-TUNING LARGE MULTIMODAL MODELS FOR AUTOMATIC PRONUNCIATION ASSESSMENTPoster
  497. FINMCP-BENCH: BENCHMARKING LLM AGENTS FOR REAL-WORLD FINANCIAL TOOL USE UNDER THE MODEL CONTEXT PROTOCOLPoster
  498. FINSENTLLM: MULTI-LLM AND STRUCTURED SEMANTIC SIGNALS FOR ENHANCED FINANCIAL SENTIMENT FORECASTINGPoster
  499. FLAME: EMPOWERING FROZEN LLMS FOR KNOWLEDGE GRAPH COMPLETIONPoster
  500. FLEXI-LORA WITH INPUT-ADAPTIVE RANKS: EFFICIENT FINETUNING FOR SPEECH AND REASONING TASKSPoster
  501. FLEXIO: FLEXIBLE SINGLE- AND MULTI-CHANNEL SPEECH SEPARATION AND ENHANCEMENTOral
  502. FLOW INTELLIGENCE: ROBUST FEATURE MATCHING VIA TEMPORAL SIGNATURE CORRELATIONPoster
  503. FLOW MATCHING-BASED ACTIVE LEARNING FOR RADIO MAP CONSTRUCTION WITH LOW-ALTITUDE UAVSPoster
  504. FLOWIID: SINGLE-STEP INTRINSIC IMAGE DECOMPOSITION VIA LATENT FLOW MATCHINGOral
  505. FLOWSE-GRPO: TRAINING FLOW MATCHING SPEECH ENHANCEMENT VIA ONLINE REINFORCEMENT LEARNINGOral
  506. FOCA: Frequency-Oriented Cross-Domain Forgery Detection, Localization and Explanation via Multi-Modal Large Language ModelPoster
  507. FOCA: MULTIMODAL MALWARE CLASSIFICATION VIA HYPERBOLIC CROSS-ATTENTIONPoster
  508. FOCALCODEC-STREAM: STREAMING LOW-BITRATE SPEECH CODING VIA CAUSAL DISTILLATIONPoster
  509. FOLEYBENCH: A BENCHMARK FOR VIDEO-TO-AUDIO MODELSOral
  510. FOLLOWING THE TRACE: A STRUCTURED PATH TO EMPATHETIC RESPONSE GENERATION WITH MULTI-AGENT MODELSPoster
  511. FORGETMARK: STEALTHY FINGERPRINT EMBEDDING VIA TARGETED UNLEARNING IN LANGUAGE MODELSPoster
  512. FORWARD CONVOLUTIVE PREDICTION FOR FRAME ONLINE MONAURAL SPEECH DEREVERBERATION BASED ON KRONECKER PRODUCT DECOMPOSITIONPoster
  513. FP-ANet: A fixed-point Attention Network for Hybrid-field THz Ultra-Massive MIMO Channel EstimationPoster
  514. FPI-DET: A FACE–PHONE INTERACTION DATASET FOR PHONE-USE DETECTION AND UNDERSTANDINGPoster
  515. FRAME-STACKED LOCAL TRANSFORMERS FOR EFFICIENT MULTI-CODEBOOK SPEECH GENERATIONPoster
  516. FREQ-DP NET: A DUAL-BRANCH NETWORK FOR FENCE REMOVAL USING DUAL-PIXEL AND FOURIER PRIORSPoster
  517. FREQUENCY-GUIDED MULTI-LEVEL REASONING FOR SCENE GRAPH GENERATION IN VIDEOPoster
  518. FROM CONTRAST TO COMMONALITY: AUDIO COMMONALITY CAPTIONING FOR ENHANCED AUDIO-TEXT CROSS-MODAL UNDERSTANDING IN MULTIMODAL LLMSPoster
  519. FROM HALLUCINATION TO ARTICULATION: LANGUAGE MODEL-DRIVEN LOSSES FOR ULTRA LOW-BITRATE NEURAL SPEECH CODINGPoster
  520. FROM HYPE TO INSIGHT: RETHINKING LARGE LANGUAGE MODEL INTEGRATION IN VISUAL SPEECH RECOGNITIONPoster
  521. FROM INDEPENDENCE TO INTERACTION: SPEAKER-AWARE SIMULATION OF MULTI-SPEAKER CONVERSATIONAL TIMINGPoster
  522. FROM KNOWING TO DOING PRECISELY: A GENERAL SELF-CORRECTION AND TERMINATION FRAMEWORK FOR VLA MODELSPoster
  523. FROM POWERSGD TO POWERSGD+: LOW-RANK GRADIENT COMPRESSION FOR DISTRIBUTED OPTIMIZATION WITH CONVERGENCE GUARANTEESPoster
  524. FROM TOKEN TO LINE: ENHANCING CODE GENERATION WITH A LONG-TERM PERSPECTIVEPoster
  525. FRONTEND TOKEN ENHANCEMENT FOR TOKEN-BASED SPEECH RECOGNITIONPoster
  526. FTIN: FREQUENCY-TIME INTEGRATION NETWORK FOR INERTIAL ODOMETRYPoster
  527. FULL BAND DENOISING OF ROOM IMPULSE RESPONSE IN THE WAVELET DOMAIN WITH DICTIONARY LEARNINGOral
  528. FULL-DUPLEX-BENCH V1.5: EVALUATING OVERLAP HANDLING FOR FULL-DUPLEX SPEECH MODELSPoster
  529. FUN-SSL: FULL-BAND LAYER FOLLOWED BY U-NET WITH NARROW-BAND LAYERS FOR MULTIPLE MOVING SOUND SOURCE LOCALIZATIONPoster
  530. FUSION OF SPATIO-TEMPORAL AND MULTI-SCALE FREQUENCY FEATURES FOR DRY ELECTRODES MI-EEG DECODINGPoster
  531. FUSIONEDIT: SEMANTIC FUSION AND ATTENTION MODULATION FOR TRAINING-FREE IMAGE EDITINGOral
  532. FW-VTON: FLATTENING-AND-WARPING FOR PERSON-TO-PERSON VIRTUAL TRY-ONPoster
  533. FXSEARCHER: GRADIENT-FREE TEXT-DRIVEN AUDIO TRANSFORMATIONPoster
  534. Face-Voice Association with Inductive Bias for Maximum Class SeparationOral
  535. Fake-HR1: Rethinking Reasoning of vision language model for Synthetic Image DetectionPoster
  536. Fast Low-light Enhancement and Deblurring for 3D Dark ScenesPoster
  537. FastEnhancer: Speed-Optimized Streaming Neural Speech EnhancementPoster
  538. Fed-PISA: Federated Voice Cloning via Personalized Identity-Style AdaptationPoster
  539. FedAVOT: Exact Distribution Alignment in Federated Learning via Masked Optimal TransportPoster
  540. FedDBP: Enhancing Federated Prototype Learning with Dual-Branch Features and Personalized Global FusionPoster
  541. FedRD: Reducing Divergences for Generalized Federated Learning via Heterogeneity-aware Parameter GuidanceOral
  542. From Diet to Free Lunch: Estimating Auxiliary Signal Properties using Dynamic Pruning Masks in Speech Enhancement NetworksPoster
  543. From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target RecognitionPoster
  544. From Parameters to Prompts: Understanding and Mitigating the Factuality Gap between Fine-Tuned LLMsPoster
  545. GAME-TIME: EVALUATING TEMPORAL DYNAMICS IN SPOKEN LANGUAGE MODELSOral
  546. GAP-URGENET: A GENERATIVE-PREDICTIVE FUSION FRAMEWORK FOR UNIVERSAL SPEECH ENHANCEMENTPoster
  547. GAUSSIAN MESH RENDERER FOR LIGHTWEIGHT DIFFERENTIABLE RENDERINGPoster
  548. GAUSSIAN2SCENE: 3D SCENE REPRESENTATION LEARNING VIA SELF-SUPERVISED LEARNING WITH 3D GAUSSIAN SPLATTINGPoster
  549. GDCNET: GENERATIVE DISCREPANCY COMPARISON NETWORK FOR MULTIMODAL SARCASM DETECTIONPoster
  550. GDIFFUSE: DIFFUSION-BASED SPEECH ENHANCEMENT WITH NOISE MODEL GUIDANCEPoster
  551. GELINA: UNIFIED SPEECH AND GESTURE SYNTHESIS VIA INTERLEAVED TOKEN PREDICTIONOral
  552. GEN-SER: WHEN THE GENERATIVE MODEL MEETS SPEECH EMOTION RECOGNITIONPoster
  553. GEN3D:GENERATING DOMAIN-FREE 3D SCENES FROM A SINGLE IMAGEPoster
  554. GENCHO: ROOM IMPULSE RESPONSE GENERATION FROM REVERBERANT SPEECH AND TEXT VIA DIFFUSION TRANSFORMERSOral
  555. GENERALIZABILITY OF PREDICTIVE AND GENERATIVE SPEECH ENHANCEMENT MODELS TO PATHOLOGICAL SPEAKERSPoster
  556. GENERALIZABLE DETECTION OF AUDIO DEEPFAKESPoster
  557. GENERALIZABLE SPEECH DEEPFAKE DETECTION VIA INFORMATION BOTTLENECK ENHANCED ADVERSARIAL ALIGNMENTPoster
  558. GENERALIZABLE SPEECH DEEPFAKE DETECTION VIA META-LEARNED LORAPoster
  559. GENERATING LOCALIZED AUDIBLE ZONES USING A SINGLE-CHANNEL PARAMETRIC LOUDSPEAKERPoster
  560. GENERATIVE AUDIO EXTENSION AND MORPHINGPoster
  561. GENFACTS-GENERATIVE COUNTERFACTUAL EXPLANATIONS FOR MULTI-VARIATE TIME SERIESOral
  562. GEODESIC PROTOTYPE MATCHING VIA DIFFUSION MAPS FOR INTERPRETABLE FINE-GRAINED RECOGNITIONOral
  563. GEOMETRIC IMAGE SYNCHRONIZATION WITH DEEP WATERMARKINGPoster
  564. GLA-GRAD++: AN IMPROVED GRIFFIN-LIM GUIDED DIFFUSION MODEL FOR SPEECH SYNTHESISPoster
  565. GLAP: General contrastive audio-text pretraining across domains and languagesPoster
  566. GLORIA: GATED LOW-RANK INTERPRETABLE ADAPTATION FOR DIALECTAL ASRPoster
  567. GLUE: Gradient-free Learning to Unify ExpertsPoster
  568. GO-MLVTON: GARMENT OCCLUSION-AWARE MULTI-LAYER VIRTUAL TRY-ON WITH DIFFUSION MODELSPoster
  569. GRAPH DISTRIBUTION-VALUED SIGNALS: A WASSERSTEIN SPACE PERSPECTIVEOral
  570. GRAPH FOURIER TRANSFORMER WITH STRUCTURE-FREQUENCY INFORMATIONPoster
  571. GRAPH NEURAL NETWORKS IN LARGE SCALE WIRELESS COMMUNICATION NETWORKS: SCALABILITY ACROSS RANDOM GEOMETRIC GRAPHSPoster
  572. GRAPH NEURAL NETWORKS WITH DIVERSITY-AWARE NEIGHBOR SELECTION AND DYNAMIC MULTI-SCALE FUSION FOR MULTIVARIATE TIME SERIES FORECASTINGPoster
  573. GRAPH-AWARE LEARNING RATES FOR DECENTRALIZED OPTIMIZATIONPoster
  574. GRAPHPL: LEVERAGING GNN FOR EFFICIENT AND ROBUST MODALITIES IMPUTATION IN PATCHWORK LEARNINGPoster
  575. GRASP: GRoup-shApley feature Selection for PatientsPoster
  576. GROUP RELATIVE POLICY OPTIMIZATION FOR TEXT-TO-SPEECH WITH LARGE LANGUAGE MODELSOral
  577. GSDFUSE: CAPTURING COGNITIVE INCONSISTENCIES FROM MULTI-DIMENSIONAL WEAK SIGNALS IN SOCIAL MEDIA STEGANALYSISPoster
  578. GSTA: EFFICIENT TRAINING SCHEME WITH SIESTAED GAUSSIANS FOR MONOCULAR 3D SCENE RECONSTRUCTIONPoster
  579. GTFMN: Guided Texture and Feature Modulation Network for Low-Light Image Enhancement and Super-ResolutionOral
  580. GUI-ARP: ENHANCING GROUNDING WITH ADAPTIVE REGION PERCEPTION FOR GUI AGENTSPoster
  581. GalaxyEdit: Large Scale Image Editing Dataset with Enhanced Diffusion AdapterOral
  582. GazeFormer-MoE: Context-Aware Gaze Estimation via CLIP and MoE TransformerPoster
  583. GenLie: A Global-Enhanced Lie Detection Network under Sparsity and Semantic InterferencePoster
  584. Generating Moving 3D Soundscapes with Latent Diffusion ModelsPoster
  585. Goal-Oriented Joint Source–Channel Coding: Distortion–Classification–Power Trade-offPoster
  586. Graph Signal Generative Diffusion ModelsPoster
  587. Graph-Aware Diffusion for Signal GenerationPoster
  588. Graph-Based Learning of Spectro-Topographical EEG Representations with Gradient Alignment for Brain-Computer InterfacesPoster
  589. Graph-based 3D Human Pose Estimation using WiFi SignalsPoster
  590. Gromov-Wasserstein Graph CoarseningPoster
  591. HALLUCINATION DETECTION VIA INTERNAL STATES AND STRUCTURED REASONING CONSISTENCY IN LARGE LANGUAGE MODELSOral
  592. HAVT-IVD: HETEROGENEITY-AWARE CROSS-MODAL NETWORK FOR AUDIO-VISUAL SURVEILLANCE: IDLING VEHICLES DETECTION WITH MULTICHANNEL AUDIO AND MULTISCALE VISUAL CUESPoster
  593. HD-PPT: HIERARCHICAL DECODING OF CONTENT- AND PROMPT-PREFERENCE TOKENS FOR INSTRUCTION-BASED TTSOral
  594. HEAD-AWARE VISUAL CROPPING: ENHANCING FINE-GRAINED VQA WITH ATTENTION-GUIDED SUBIMAGEPoster
  595. HEAR: HIERARCHICALLY ENHANCED AESTHETIC REPRESENTATIONS FOR MULTIDIMENSIONAL MUSIC EVALUATIONPoster
  596. HEBBIAN LEARNING WITH GLOBAL DIRECTIONOral
  597. HERGNET: A FAST NEURAL SURROGATE MODEL FOR SOUND FIELD PREDICTIONS VIA SUPERPOSITION OF PLANE WAVESPoster
  598. HETEROGENEOUS SELF-SUPERVISED ACOUSTIC PRE-TRAINING WITH LOCAL CONSTRAINTSPoster
  599. HFMCA: ORTHONORMAL FEATURE LEARNING FOR EEG-BASED BRAIN DECODINGPoster
  600. HGAN-SDEs: Learning Neural Stochastic Differential Equations with Hermite-Guided Adversarial TrainingOral
  601. HICT: HIGH-PRECISION 3D CBCT RECONSTRUCTION FROM A SINGLE X-RAYPoster
  602. HIERARCHICAL ACTIVITY RECOGNITION AND CAPTIONING FROM LONG-FORM AUDIOPoster
  603. HIERARCHICAL ORTHOGONAL RESIDUAL SPREAD FOR PRECISE MASSIVE EDITING IN LARGE LANGUAGE MODELSOral
  604. HIGH QUALITY UNDERWATER IMAGE COMPRESSION WITH ADAPTIVE COLOR CORRECTIONOral
  605. HIGH-FIDELITY SPEECH ENHANCEMENT VIA DISCRETE AUDIO TOKENSPoster
  606. HINT: COMPOSED IMAGE RETRIEVAL WITH DUAL-PATH COMPOSITIONAL CONTEXTUALIZED NETWORKPoster
  607. HINT: HIERARCHICAL INTER-FRAME CORRELATION FOR ONE-SHOT POINT CLOUD SEQUENCE COMPRESSIONPoster
  608. HMVLA: HYPERBOLIC MULTIMODAL FUSION FOR VISION-LANGUAGE-ACTION MODELSPoster
  609. HOW CAN QUANTUM DEEP LEARNING IMPROVE LARGE LANGUAGE MODELS?Oral
  610. HOW FAR DO SSL SPEECH MODELS LISTEN FOR TONE? TEMPORAL FOCUS OF TONE REPRESENTATION UNDER LOW-RESOURCE TRANSFERPoster
  611. HOW TO LABEL RESYNTHESIZED AUDIO: THE DUAL ROLE OF NEURAL AUDIO CODECS IN AUDIO DEEPFAKE DETECTIONPoster
  612. HPTune: Hierarchical Proactive Tuning for Collision-Free Model Predictive ControlPoster
  613. HSSDCT: Factorized Spatial-Spectral Correlation for Hyperspectral Image FusionOral
  614. HVAC-EAR: EAVESDROPPING HUMAN SPEECH USING HVAC SYSTEMSPoster
  615. HVD: HUMAN VISION-DRIVEN VIDEO REPRESENTATION LEARNING FOR TEXT-VIDEO RETRIEVALPoster
  616. HYBRID CHANNEL ESTIMATION WITH QUANTIZED PHASE FEEDBACK FOR OVER-THE-AIR COMPUTATIONPoster
  617. HYBRID PRUNING: IN-SITU COMPRESSION OF SELF-SUPERVISED SPEECH MODELS FOR SPEAKER VERIFICATION AND ANTI-SPOOFINGOral
  618. HYPERDOA: ROBUST AND EFFICIENT DOA ESTIMATION USING HYPERDIMENSIONAL COMPUTINGPoster
  619. Hardware-Efficient Cognitive Radar: Multi-Target Detection with RL-Driven Transmissive RISOral
  620. HarmoniFuse: A Component-Selective and Prompt-Adaptive Framework for Multi-Task Speech Language ModelingPoster
  621. Hashing-Baseline: Rethinking hashing in the age of pretrained modelsPoster
  622. HiFi-HARP: A High-Fidelity 7th-Order Ambisonic Room Impulse Response DatasetOral
  623. Hierarchical Sparse Vector Transmission for Ultra Reliable and Low Latency CommunicationsPoster
  624. Higher-Order Feature Attribution: Bridging Statistics, Explainable AI, and Topological Signal ProcessingPoster
  625. Holographic Transformers for Complex-Valued Signal Processing: Integrating Phase Interference into Self-AttentionPoster
  626. How Does Instrumental Music Help SingFake Detection?Poster
  627. Hybrid Semantic-Complementary Transmission for High-Fidelity Image ReconstructionPoster
  628. HyperCool: Reducing Encoding Cost in Overfitted Codecs with HypernetworksOral
  629. Hyperbolic Additive Margin Softmax with Hierarchical Information for Speaker VerificationPoster
  630. I-DCCRN-VAE: AN IMPROVED DEEP REPRESENTATION LEARNING FRAMEWORK FOR COMPLEX VAE-BASED SINGLE-CHANNEL SPEECH ENHANCEMENTPoster
  631. ICASSP 2026 URGENT Speech Enhancement ChallengePoster
  632. ICPO: Illocution-Calibrated Policy Optimization for Multi-Turn ConversationPoster
  633. IDENTIFIABILITY OF ROTATING STELLAR SURFACES FROM ASTROMETRIC JITTEROral
  634. IDENTITY LEAKAGE THROUGH ACCENT CUES IN VOICE ANONYMISATIONPoster
  635. IMPROVING AUDIO EVENT RECOGNITION WITH CONSISTENCY REGULARIZATIONPoster
  636. IMPROVING AUDIO QUESTION ANSWERING WITH VARIATIONAL INFERENCEPoster
  637. IMPROVING CONTEXTUAL ASR VIA MULTI-GRAINED FUSION WITH LARGE LANGUAGE MODELSPoster
  638. IMPROVING MULTIMODAL BRAIN ENCODING MODEL WITH DYNAMIC SUBJECT-AWARENESS ROUTINGPoster
  639. IMPROVING THE SPEAKER ANONYMIZATION EVALUATION’S ROBUSTNESS TO TARGET SPEAKERS WITH ADVERSARIAL LEARNINGPoster
  640. IN-SYNC: ADAPTATION OF SPEECH AWARE LARGE LANGUAGE MODELS FOR ASR WITH WORD LEVEL TIMESTAMP PREDICTIONSOral
  641. INCONVAD: A TWO-STAGE DUAL-TOWER FRAMEWORK FOR MULTIMODAL EMOTION INCONSISTENCY DETECTIONPoster
  642. INCORPORATING PRIORS IN LEARNING: A RANDOM MATRIX STUDY UNDER A TEACHER–STUDENT FRAMEWORKOral
  643. INCREMENTAL LEARNING FOR AUDIO CLASSIFICATION WITH HEBBIAN DEEP NEURAL NETWORKSPoster
  644. INFLUENCE OF CLEAN SPEECH CHARACTERISTICS ON SPEECH ENHANCEMENT PERFORMANCEPoster
  645. INSTANCERSR: REAL-WORLD SUPER-RESOLUTION VIA INSTANCE-AWARE REPRESENTATION ALIGNMENTPoster
  646. INSTRUCTION GUIDED MULTI OBJECT IMAGE EDITING WITH QUANTITY AND LAYOUT CONSISTENCYOral
  647. INTACT: INDUCING NOISE TOLERANCE THROUGH ADVERSARIAL CURRICULUM TRAINING FOR LIDAR-BASED SAFETY-CRITICAL PERCEPTION AND AUTONOMYOral
  648. INTEGRATING STACKED INTELLIGENT METASURFACES AND POWER CONTROL FOR DYNAMIC EDGE INFERENCE VIA OVER-THE-AIR NEURAL NETWORKSOral
  649. INTEGRATION OF CALCIUM IMAGING TRACES VIA DEEP GENERATIVE MODELINGPoster
  650. INTERMITTENT SEMI-WORKING MASK: A NEW MASKING PARADIGM FOR LLMSPoster
  651. INTERPRETABLE MODELING OF ARTICULATORY TEMPORAL DYNAMICS FROM REAL-TIME MRI FOR PHONEME RECOGNITIONPoster
  652. INTRA-CLASS SUBDIVISION FOR PIXEL CONTRASTIVE LEARNING: APPLICATION TO SEMI-SUPERVISED CARDIAC IMAGE SEGMENTATIONPoster
  653. INVERSE-HESSIAN REGULARIZATION FOR CONTINUAL LEARNING IN ASRPoster
  654. INVESTIGATING MODALITY CONTRIBUTION IN AUDIO LLMS FOR MUSICPoster
  655. IQ-LUT: INTERPOLATED AND QUANTIZED LUT FOR EFFICIENT IMAGE SUPER-RESOLUTIONPoster
  656. IS PHASE REALLY NEEDED FOR WEAKLY-SUPERVISED DEREVERBERATION ?Poster
  657. IS REPEATER-ASSISTED MASSIVE MIMO COMPATIBLE WITH DYNAMIC TDD?Oral
  658. ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language ModelsOral
  659. ISSE: AN INSTRUCTION-GUIDED SPEECH STYLE EDITING DATASET AND BENCHMARKPoster
  660. ISTER: LINEAR TRANSFORMER FOR EFFICIENT MULTIVARIATE TIME SERIES FORECASTINGPoster
  661. ITERATIVE AMORTIZED HIERARCHICAL VAEPoster
  662. Identifying birdsong syllables without labelled dataPoster
  663. IdentityGuard: Context-Aware Restriction and Provenance for Personalized SynthesisPoster
  664. Impact of Phonetics on Speaker Identity in Adversarial Voice AttackOral
  665. Improve MLLM Benchmark Efficiency through InterviewPoster
  666. Improving Active Learning for Melody Estimation by Disentangling UncertaintiesPoster
  667. Improving Anomalous Sound Detection with Attribute-aware Representation from Domain-adaptive Pre-trainingPoster
  668. Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement LearningPoster
  669. InstructAudio: Unified speech and music generation with natural language instructionPoster
  670. Invariant Representation Guided Multimodal Sentiment Decoding with Sequential Variation RegularizationPoster
  671. Inverse Rendering for High-Genus 3D Surface Meshes from Multi-view Images with Persistent Homology PriorsPoster
  672. Investigating Batch Inference in a Sequential Monte Carlo Framework for Neural NetworksPoster
  673. IoDResearch: Deep Research on Private Heterogeneous Data via the Internet of DataPoster
  674. JOINT ACTIVE RIS CONFIGURATION AND USER POWER CONTROL FOR LOCALIZATION: A NEUROEVOLUTION-BASED APPROACHOral
  675. JOINT ESTIMATION OF PIANO DYNAMICS AND METRICAL STRUCTURE WITH A MULTI-TASK MULTI-SCALE NETWORKOral
  676. JOINT OPTIMIZATION OF ASV AND CM TASKS: BTUEF TEAM’S SUBMISSION FOR WILDSPOOF CHALLENGEPoster
  677. JOINT REPRODUCTION NUMBER AND SPATIAL CONNECTIVITY STRUCTURE ESTIMATION VIA GRAPH SPARSITY-PROMOTING PENALIZED FUNCTIONALPoster
  678. JOINT SUPERPIXEL AND SELF-REPRESENTATION LEARNING FOR SCALABLE HYPERSPECTRAL IMAGE CLUSTERINGPoster
  679. JUDGE BEFORE ANSWER: CAN MLLM DISCERN THE FALSE PREMISE IN QUESTION?Poster
  680. Joint Transmit Beamforming and Reflection Optimization for Beyond Diagonal RIS Aided Multi-Cell MIMO CommunicationOral
  681. Joint single-shot ToA and DoA estimation for VAA-based BLE ranging with phase ambiguity: A deep learning-based approachPoster
  682. Jointly Conditioned Diffusion Model for Multi-View Pose-Guided Person Image SynthesisPoster
  683. K-FUNCTION: JOINT PRONUNCIATION TRANSCRIPTION AND FEEDBACK FOR EVALUATING KIDS LANGUAGE FUNCTIONPoster
  684. KAME: TANDEM ARCHITECTURE FOR ENHANCING KNOWLEDGE IN REAL-TIME SPEECH-TO-SPEECH CONVERSATIONAL AIPoster
  685. KD-CVG: A KNOWLEDGE-DRIVEN APPROACH FOR CREATIVE VIDEO GENERATIONPoster
  686. KG2QA: KNOWLEDGE GRAPH-ENHANCED RETRIEVAL-AUGMENTED GENERATION FOR COMMUNICATION STANDARDS QUESTION ANSWERINGPoster
  687. KINGUARD: HIERARCHICAL KINSHIP-AWARE FINGERPRINTING TO DEFEND AGAINST LARGE LANGUAGE MODEL STEALINGPoster
  688. KSDIFF: KEYFRAME-AUGMENTED SPEECH-AWARE DUAL-PATH DIFFUSION FOR FACIAL ANIMATIONPoster
  689. Knowledge Distillation for mmWave Beam Prediction Using Sub-6 GHz ChannelsOral
  690. LAKAN: LANDMARK-ASSISTED ADAPTIVE KOLMOGOROV-ARNOLD NETWORK FOR FACE FORGERY DETECTIONPoster
  691. LAMB: LLM-BASED AUDIO CAPTIONING WITH MODALITY GAP BRIDGING VIA CAUCHY-SCHWARZ DIVERGENCEOral
  692. LAMER-SSL: LAYER-AWARE MIXTURE OF LORA EXPERTS FOR CONTINUAL MULTILINGUAL EXPANSION OF SELF-SUPERVISED MODELS WITHOUT FORGETTINGPoster
  693. LAMIGAUSS: PITCHING RADIATIVE GAUSSIAN FOR SPARSE-VIEW X-RAY LAMINOGRAPHY RECONSTRUCTIONPoster
  694. LARGE VISION MODELS CAN SOLVE MENTAL ROTATION PROBLEMSOral
  695. LATENT DOMAIN PROMPT LEARNING FOR VISION-LANGUAGE MODELSPoster
  696. LATENT TEMPORAL DISCREPANCY AS MOTION PRIOR: A LOSS-WEIGHTING STRATEGY FOR DYNAMIC FIDELITY IN T2VOral
  697. LATENT-SPACE METRICS FOR COMPLEX-VALUED VAE OUT-OF-DISTRIBUTION DETECTION UNDER RADAR CLUTTERPoster
  698. LDEPROMPT: LAYER-IMPORTANCE GUIDED DUAL EXPANDABLE PROMPT POOL FOR PRE-TRAINED MODEL-BASED CLASS-INCREMENTAL LEARNINGPoster
  699. LEARNABLE INSTANCE ATTENTION FILTERING FOR ADAPTIVE DETECTOR DISTILLATIONOral
  700. LEARNING CONSISTENT CAUSAL ABSTRACTION NETWORKSPoster
  701. LEARNING DOMAIN-ROBUST BIOACOUSTIC REPRESENTATIONS FOR MOSQUITO SPECIES CLASSIFICATION WITH CONTRASTIVE LEARNING AND DISTRIBUTION ALIGNMENTPoster
  702. LEARNING EXPLICITLY CONDITIONED SPARSIFYING TRANSFORMSPoster
  703. LEARNING FAIR DOMAIN ADAPTATION WITH VIRTUAL LABEL DISTRIBUTIONPoster
  704. LEARNING FALSE DISCOVERY RATE CONTROL VIA MODEL-BASED NEURAL NETWORKSPoster
  705. LEARNING GRAPH FROM SMOOTH SIGNALS UNDER PARTIAL OBSERVATION: A ROBUSTNESS ANALYSISOral
  706. LEARNING LINEARITY IN AUDIO CONSISTENCY AUTOENCODERS VIA IMPLICIT REGULARIZATIONPoster
  707. LEARNING PRODUCT GRAPHS FROM TWO-DIMENSIONAL STATIONARY SIGNALSOral
  708. LEARNING STRUCTURAL–FUNCTIONAL BRAIN REPRESENTATIONS THROUGH MULTI–SCALE ADAPTIVE GRAPH ATTENTION FOR COGNITIVE INSIGHTOral
  709. LEARNING THE STRUCTURE OF CONNECTION GRAPHSOral
  710. LEARNING WHAT TO HEAR: BOOSTING SOUND-SOURCE ASSOCIATION FOR ROBUST AUDIOVISUAL INSTANCE SEGMENTATIONPoster
  711. LEGAL∆: ENHANCING LEGAL REASONING IN LLMS VIA REINFORCEMENT LEARNING WITH CHAIN-OF-THOUGHT GUIDED INFORMATION GAINPoster
  712. LEND A HAND: SEMI TRAINING-FREE CUED SPEECH RECOGNITION VIA MLLM-DRIVEN HAND MODELING FOR BARRIER-FREE COMMUNICATIONPoster
  713. LENSLESSMIC: AUDIO ENCRYPTION AND AUTHENTICATION VIA LENSLESS COMPUTATIONAL IMAGINGPoster
  714. LESS: LARGE LANGUAGE MODEL ENHANCED SEMI-SUPERVISED LEARNING FOR SPEECH FOUNDATIONAL MODELS USING IN-THE-WILD DATAPoster
  715. LEVERAGING AUDIO-VISUAL DATA TO REDUCE THE MULTILINGUAL GAP IN SELF-SUPERVISED SPEECH MODELSPoster
  716. LEVERAGING LABEL PROPORTION PRIOR FOR CLASS-IMBALANCED SEMI-SUPERVISED LEARNINGPoster
  717. LEVERAGING LARGE MULTIMODAL MODELS FOR AUDIO-VIDEO DEEPFAKE DETECTION: A PILOT STUDYOral
  718. LEVERAGING MULTIPLE SPEECH ENHANCERS FOR NON-INTRUSIVE INTELLIGIBILITY PREDICTION FOR HEARING-IMPAIRED LISTENERSPoster
  719. LEVERAGING OVERFITTING FOR LOW-COMPLEXITY AND MODALITY-AGNOSTIC JOINT SOURCE-CHANNEL CODINGOral
  720. LEVERAGING PREDICTION ENTROPY FOR AUTOMATIC PROMPT WEIGHTING IN ZERO-SHOT AUDIO-LANGUAGE CLASSIFICATIONOral
  721. LEVERAGING WHISPER EMBEDDINGS FOR AUDIO-BASED LYRICS MATCHINGPoster
  722. LIBEMER: A NOVEL BENCHMARK AND ALGORITHMS LIBRARY FOR EEG-BASED MULTIMODAL EMOTION RECOGNITIONPoster
  723. LIGHTWEIGHT AND PERCEPTUALLY-GUIDED VOICE CONVERSION FOR ELECTRO-LARYNGEAL SPEECHPoster
  724. LIGHTWEIGHT IMPLICIT NEURAL NETWORK FOR BINAURAL AUDIO SYNTHESISPoster
  725. LIGHTWEIGHT RGB-T TRACKING WITH MOBILE VISION TRANSFORMERSPoster
  726. LIPSAM: LIPSCHITZ-CONTINUOUS AMPLITUDE MODIFIER FOR AUDIO SIGNAL PROCESSING AND ITS APPLICATION TO PLUG-AND-PLAY DEREVERBERATIONPoster
  727. LIWHIZ: A NON-INTRUSIVE LYRIC INTELLIGIBILITY PREDICTION SYSTEM FOR THE CADENZA CHALLENGEPoster
  728. LLM-Driven Scenario-Aware Planning for Autonomous DrivingPoster
  729. LLMPopcorn: Exploring LLMs as Assistants for Popular Micro-video GenerationPoster
  730. LOCALIZING SPEECH DEEPFAKES BEYOND TRANSITIONS VIA SEGMENT-AWARE LEARNINGOral
  731. LOGPTR: VARIABLE-AWARE LOG PARSING WITH POINTER NETWORKPoster
  732. LONG CHAIN-OF-THOUGHT COMPRESSION VIA FINE-GRAINED GROUP POLICY OPTIMIZATIONPoster
  733. LONGSPEECH: A SCALABLE BENCHMARK FOR TRANSCRIPTION, TRANSLATION AND UNDERSTANDING IN LONG SPEECHPoster
  734. LOOSE COUPLING OF SPECTRAL AND SPATIAL MODELS FOR MULTI-CHANNEL DIARIZATION AND ENHANCEMENT OF MEETINGS IN DYNAMIC ENVIRONMENTSPoster
  735. LOTUSDIS: A THAI FAR-FIELD MEETING CORPUS FOR ROBUST CONVERSATIONAL ASRPoster
  736. LOW-RANK AND SPARSE MODEL MERGING FOR MULTI-LINGUAL SPEECH RECOGNITION AND TRANSLATIONPoster
  737. LOW-RESOURCE GUIDANCE FOR CONTROLLABLE LATENT AUDIO DIFFUSIONPoster
  738. LP-CFM: PERCEPTUAL INVARIANCE-AWARE CONDITIONAL FLOW MATCHING FOR SPEECH MODELINGPoster
  739. LPCVAE: A CONDITIONAL VAE WITH LONG-TERM DEPENDENCY AND PROBABILISTIC TIME-FREQUENCY FUSION FOR TIME SERIES ANOMALY DETECTIONPoster
  740. LSP Framework: A Compensatory Model for Defeating Trigger Reverse Engineering via Label Smoothing PoisoningOral
  741. LUSEEL: LANGUAGE-QUERIED BINAURAL UNIVERSAL SOUND EVENT EXTRACTION AND LOCALIZATIONPoster
  742. LVC: A LIGHTWEIGHT COMPRESSION FRAMEWORK FOR ENHANCING VLMS IN LONG VIDEO UNDERSTANDINGPoster
  743. LVD-GS: GAUSSIAN SPLATTING SLAM FOR DYNAMIC SCENES VIA HIERARCHICAL EXPLICIT-IMPLICIT REPRESENTATION COLLABORATION RENDERINGPoster
  744. LYTIMET: TOWARDS ROBUST AND INTERPRETABLE STATE-VARIABLE DISCOVERYOral
  745. Layer-Aware Early Fusion of Acoustic and Linguistic Embeddings for Cognitive Status ClassificationPoster
  746. Learning Affine-Equivariant Proximal OperatorsPoster
  747. Learning Beyond the Gaussian Data: Learning Dynamics of Neural Networks on an Expressive and Cumulant-Controllable Data ModelPoster
  748. Learning Fill-in Reduction Ordering via Graph Policy Optimization for Sparse MatricesPoster
  749. Learning Nonlinear Systems In-Context: From Synthetic Data to Real-World Motor ControlPoster
  750. Learning Reference-Guided Exposure Correction with Hybrid Illumination CharacteristicsPoster
  751. Learning Time-Varying Turn-Taking Behavior in Group ConversationsPoster
  752. Learning Vocal-Tract Area and Radiation with a Physics-Informed Webster ModelPoster
  753. Learning from Disagreement: A Group Decision Simulation Framework for Robust Medical Image SegmentationPoster
  754. Length-Aware Rotary Position Embedding for Text-Speech AlignmentPoster
  755. Less Redundancy: Boosting Practicality of Vision Language Model in Walking AssistantsOral
  756. LiDAR-based Human Activity Recognition through Laplacian Spectral AnalysisPoster
  757. Lightweight and Generalizable Acoustic Scene Representations via Contrastive Fine-Tuning and DistillationPoster
  758. Linking Faces and Voices Across Languages: Insights from the FAME 2026 ChallengePoster
  759. LipSody: Lip-to-Speech Synthesis with Enhanced Prosody ConsistencyPoster
  760. Logic-ORiented Retriever Enhancement via Contrastive LearningPoster
  761. Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic SegmentationOral
  762. Lotus: Efficient LLM Training by Randomized Low-Rank Gradient Projection with Adaptive Subspace SwitchingPoster
  763. MAG: Multi-Modal Aligned Autoregressive Co-Speech Gesture Generation without Vector QuantizationOral
  764. MAGE-KT: Multi-Agent Graph-Enhanced Knowledge Tracing with Subgraph Retrieval and Asymmetric FusionPoster
  765. MAGE: A COARSE-TO-FINE SPEECH ENHANCER WITH MASKED GENERATIVE MODELPoster
  766. MAKING DIALOGUE GROUNDING DATA RICH: A THREE-TIER DATA SYNTHESIS FRAMEWORK FOR GENERALIZED REFERRING EXPRESSION COMPREHENSIONPoster
  767. MALEFA: MULTI-GRANULARITY LEARNING AND EFFECTIVE FALSE ALARM SUPPRESSION FOR ZERO-SHOT KEYWORD SPOTTINGPoster
  768. MAMMODINO: ANATOMICALLY AWARE SELF-SUPERVISION FOR MAMMOGRAPHIC IMAGESPoster
  769. MANIFOLDFORMER: GEOMETRIC DEEP LEARNING FOR NEURAL DYNAMICS ON RIEMANNIAN MANIFOLDSPoster
  770. MAPEX: A MULTI-AGENT PIPELINE FOR KEYPHRASE EXTRACTIONPoster
  771. MAR: EFFICIENT LARGE LANGUAGE MODELS VIA MODULE-AWARE ARCHITECTURE REFINEMENTPoster
  772. MARKSWEEP: A NO-BOX REMOVAL ATTACK ON AI-GENERATED IMAGE WATERMARKING VIA NOISE INTENSIFICATION AND FREQUENCY-AWARE DENOISINGPoster
  773. MASKVCT: MASKED VOICE CODEC TRANSFORMER FOR ZERO-SHOT VOICE CONVERSION WITH INCREASED CONTROLLABILITY VIA MULTIPLE GUIDANCESPoster
  774. MASTER-ASSISTED DISTRIBUTED UPLINK OPERATION FOR CELL-FREE MASSIVE MIMO NETWORKSPoster
  775. MATCHING REVERBERANT SPEECH THROUGH LEARNED ACOUSTIC EMBEDDINGS AND FEEDBACK DELAY NETWORKSOral
  776. MATE: MATRYOSHKA AUDIO–TEXT EMBEDDINGS FOR OPEN-VOCABULARY KEYWORD SPOTTINGPoster
  777. MATHPHYS-GUIDED COARSE-TO-FINE ANOMALY SYNTHESIS WITH SQE-DRIVEN BI-LEVEL OPTIMIZATION FOR ANOMALY DETECTIONOral
  778. MATTER: Multiscale Attention for Registration Error RegressionPoster
  779. MC-LExt: Multi-Channel Target Speaker Extraction with Onset-Prompted Speaker Conditioning MechanismPoster
  780. MEANFLOW-ACCELERATED MULTIMODAL VIDEO-TO-AUDIO SYNTHESIS VIA ONE-STEP GENERATIONPoster
  781. MEANFLOWSE: ONE-STEP GENERATIVE SPEECH ENHANCEMENT VIA CONDITIONAL MEAN FLOWOral
  782. MEANSE: EFFICIENT GENERATIVE SPEECH ENHANCEMENT WITH MEAN FLOWSPoster
  783. MEANVC: LIGHTWEIGHT AND STREAMING ZERO-SHOT VOICE CONVERSION VIA MEAN FLOWSPoster
  784. MEANVOICEFLOW: ONE-STEP NONPARALLEL VOICE CONVERSION WITH MEAN FLOWSPoster
  785. MEASURING PROSODY DIVERSITY IN ZERO-SHOT TTS: A NEW METRIC, BENCHMARK, AND EXPLORATIONPoster
  786. MECAP-R1: EMOTION-AWARE POLICY WITH REINFORCEMENT LEARNING FOR MULTIMODAL EMOTION CAPTIONINGOral
  787. MEDCUTMIX: A DATA-CENTRIC APPROACH TO IMPROVE RADIOLOGY VISION-LANGUAGE PRE-TRAINING WITH DISEASE AWARENESSOral
  788. MEDFACT-R1: TOWARDS FACTUAL MEDICAL REASONING VIA PSEUDO-LABEL AUGMENTATIONPoster
  789. MELA-TTS: JOINT TRANSFORMER-DIFFUSION MODEL WITH REPRESENTATION ALIGNMENT FOR SPEECH SYNTHESISPoster
  790. MELT: IMPROVE COMPOSED IMAGE RETRIEVAL VIA THE MODIFICATION FREQUENTATION-RARITY BALANCE NETWORKPoster
  791. MGKAN: PREDICTING ASYMMETRIC DRUG-DRUG INTERACTIONS VIA A MULTIMODAL GRAPH KOLMOGOROV-ARNOLD NETWORKPoster
  792. MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large Audio-Language ModelOral
  793. MI-PRUN: OPTIMIZE LARGE LANGUAGE MODEL PRUNING VIA MUTUAL INFORMATIONPoster
  794. MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music UnderstandingPoster
  795. MILORE-SSL: SCALING MULTILINGUAL CAPABILITIES IN SELF-SUPERVISED MODELS WITHOUT FORGETTINGPoster
  796. MIMO Array Calibration in Non-stationary Channels with Residual Surfaces and Slepian Spherical HarmonicsPoster
  797. MIND THE GAP: DATA REWRITING FOR STABLE OFF-POLICY SUPERVISED FINE-TUNINGPoster
  798. MIND THE SHIFT: USING DELTA SSL EMBEDDINGS TO ENHANCE CHILD ASRPoster
  799. MINDCINE: MULTIMODAL EEG-TO-VIDEO RECONSTRUCTION WITH LARGE-SCALE PRETRAINED MODELSPoster
  800. MINIMIZATION OF NONSMOOTH WEAKLY CONVEX FUNCTION OVER PROX-REGULAR SET FOR ROBUST LOW-RANK MATRIX RECOVERYPoster
  801. MIRG-RL: Multi-Image Reasoning and Grounding with Reinforcement LearningPoster
  802. MIRRORTALK: FORGING PERSONALIZED AVATARS VIA DISENTANGLED STYLE AND HIERARCHICAL MOTION CONTROLPoster
  803. MISCLASSIFICATION RATE AND PRIVACY-UTILITY TRADE-OFFS IN GRAPH CONVOLUTIONAL NETWORKS VIA SUBSAMPLING STABILITYPoster
  804. MISPRONUNCIATION DETECTION AND DIAGNOSIS WITHOUT MODEL TRAINING: A RETRIEVAL-BASED APPROACHOral
  805. MITA: A HIERARCHICAL MULTI-AGENT COLLABORATION FRAMEWORK WITH MEMORY-INTEGRATED AND TASK ALLOCATIONPoster
  806. MITIGATING ATTENTION SINKS AND MASSIVE ACTIVATIONS IN AUDIO-VISUAL SPEECH RECOGNITION WITH LLMSPoster
  807. MITIGATING DATA REPLICATION IN TEXT-TO-AUDIO GENERATIVE DIFFUSION MODELS THROUGH ANTI-MEMORIZATION GUIDANCEPoster
  808. MITIGATING HALLUCINATION IN FINANCIAL RETRIEVAL-AUGMENTED GENERATION VIA FINE-GRAINED KNOWLEDGE VERIFICATIONPoster
  809. MITIGATING INTRA-SPEAKER VARIABILITY IN DIARIZATION WITH STYLE-CONTROLLABLE SPEECH AUGMENTATIONPoster
  810. MIX2MORPH: LEARNING SOUND MORPHING FROM NOISY MIXESPoster
  811. MIXTURE OF EXPERTS FOR RECOGNIZING DEPRESSION FROM INTERVIEW AND READING TASKSPoster
  812. MMAUDIOSEP: TAMING VIDEO-TO-AUDIO GENERATIVE MODEL TOWARDS VIDEO/TEXT-QUERIED SOUND SEPARATIONPoster
  813. MMRQA: SIGNAL-ENHANCED MULTIMODAL LARGE LANGUAGE MODELS FOR MRI QUALITY ASSESSMENTPoster
  814. MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in SpeechPoster
  815. MODELING STRATEGIES FOR SPEECH ENHANCEMENT IN THE LATENT SPACE OF A NEURAL AUDIO CODECPoster
  816. MODERN STRUCTURE-AWARE SIMPLICIAL SPATIOTEMPORAL NEURAL NETWORKOral
  817. MOESCORE: MIXTURE-OF-EXPERTS-BASED TEXT-AUDIO RELEVANCE SCORE PREDICTION FOR TEXT-TO-AUDIO SYSTEM EVALUATIONPoster
  818. MOMENTS MATTER: POSTERIOR RECOVERY IN POISSON DENOISING VIA LOG-NETWORKSPoster
  819. MORE THAN A SHORTCUT: A HYPERBOLIC APPROACH TO EARLY-EXIT NETWORKSPoster
  820. MOSA: MOTION-GUIDED SEMANTIC ALIGNMENT FOR DYNAMIC SCENE GRAPH GENERATIONPoster
  821. MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASRPoster
  822. MOTION-GUIDED SEMANTIC ALIGNMENT WITH NEGATIVE PROMPTS FOR ZERO-SHOT VIDEO ACTION RECOGNITIONPoster
  823. MOVi: Training-free Text-conditioned Multi-Object Video GenerationOral
  824. MPNet: A Robust and Efficient Manifold Pooling Network for Multi-Rhythm EEG Signal DecodingPoster
  825. MR-FLOWDPO: MULTI-REWARD DIRECT PREFERENCE OPTIMIZATION FOR FLOW-MATCHING TEXT-TO-MUSIC GENERATIONOral
  826. MSCT : DIFFERENTIAL CROSS-MODAL ATTENTION FOR DEEPFAKE DETECTIONPoster
  827. MSF-SER: ENRICHING ACOUSTIC MODELING WITH MULTI-GRANULARITY SEMANTICS FOR SPEECH EMOTION RECOGNITIONPoster
  828. MSNAV: ZERO-SHOT VISION-AND-LANGUAGE NAVIGATION WITH DYNAMIC MEMORY AND LLM SPATIAL REASONINGPoster
  829. MSP-REID: HAIRSTYLE-ROBUST CLOTH-CHANGING PERSON RE-IDENTIFICATIONPoster
  830. MT-HUBERT: SELF-SUPERVISED MIX-TRAINING FOR FEW-SHOT KEYWORD SPOTTING IN MIXED SPEECHOral
  831. MTP-S2UT: ENHANCING SPEECH-TO-SPEECH TRANSLATION QUALITY WITH MULTI-TOKEN PREDICTIONPoster
  832. MUGSQA: NOVEL MULTI-UNCERTAINTY-BASED GAUSSIAN SPLATTING QUALITY ASSESSMENT METHOD, DATASET, AND BENCHMARKSOral
  833. MULTI-CHANNEL SPEECH ENHANCEMENT FOR COCKTAIL PARTY SPEECH EMOTION RECOGNITIONPoster
  834. MULTI-GRANULARITY SCORE-BASED GENERATIVE FRAMEWORK ENABLES EFFICIENT INVERSE DESIGN OF COMPLEX ORGANICSPoster
  835. MULTI-HOP DEEP JOINT SOURCE-CHANNEL CODING WITH DEEP HASH DISTILLATION FOR SEMANTICALLY ALIGNED IMAGE RECOVERYPoster
  836. MULTI-PHYSICS: A COMPREHENSIVE BENCHMARK FOR MULTIMODAL LLMS REASONING ON CHINESE MULTI-SUBJECT PHYSICS PROBLEMSOral
  837. MULTI-SCALE ADAPTIVE NEIGHBORHOOD AWARENESS TRANSFORMER FOR GRAPH FRAUD DETECTIONPoster
  838. MULTI-SPEAKER DOA ESTIMATION IN BINAURAL HEARING AIDS USING DEEP LEARNING AND SPEAKER COUNT FUSIONPoster
  839. MULTI-TASK TRANSFORMER FOR EXPLAINABLE SPEECH DEEPFAKE DETECTION VIA FORMANT MODELINGPoster
  840. MULTI-TURN PHYSICS-INFORMED VISION-LANGUAGE MODEL FOR PHYSICS-GROUNDED ANOMALY DETECTIONPoster
  841. MULTI-VIEW CROWD COUNTING WITH SELF-SUPERVISED LEARNINGPoster
  842. MULTIMODAL DEEP LEARNING METHOD FOR REAL-TIME SPATIAL ROOM IMPULSE RESPONSE COMPUTINGPoster
  843. MULTIMODAL MULTI-AGENT EMPOWERED LEGAL JUDGMENT PREDICTIONPoster
  844. MULTIMODAL SELF-ATTENTION NETWORK WITH TEMPORAL ALIGNMENT FOR AUDIO-VISUAL EMOTION RECOGNITIONPoster
  845. MULTITASK LEARNING WITH LEARNED TASK RELATIONSHIPSOral
  846. MUSETOK: SYMBOLIC MUSIC TOKENIZATION FOR GENERATION AND SEMANTIC UNDERSTANDINGPoster
  847. MUSICRS: BENCHMARKING AUDIO-CENTRIC CONVERSATIONAL RECOMMENDATIONPoster
  848. MVIR: MULTI-VIEW VISUAL-SEMANTIC REPRESENTATION FOR FAKE NEWS DETECTIONPoster
  849. Make Your MoVe: Make Your 3D Contents by Adapting Multi-View Diffusion Models to External EditingPoster
  850. Making Medical Vision-Language Models Think Causally Across Modalities with Retrieval-Augmented Cross-Modal ReasoningPoster
  851. ManipDreamer: Boosting Robotic Manipulation World Model with Action Tree and Visual GuidancePoster
  852. Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?Poster
  853. MedSpeak: A Knowledge Graph-Aided ASR Error Correction Framework for Spoken Medical QAPoster
  854. Membership Inference Attack Against Music Diffusion Models via Generative Manifold PerturbationOral
  855. Meow: End-to-End Outline Writing for Automatic Academic SurveyPoster
  856. Meta-Offline and Distributional Multi-Agent RL for Risk-Aware Decision-MakingPoster
  857. MetaToolAgent: Towards Generalizable Tool Usage in LLMs through Meta-LearningOral
  858. Mixture to Beamformed Mixture: Leveraging Beamformed Mixture as Weak-Supervision for Speech Enhancement and Noise-Robust ASROral
  859. Mixture-of-Experts Framework for Field-of-View Enhanced Signal-Dependent Binauralization of moving talkersPoster
  860. Modality-Decoupled RGB-Thermal Object Detector via Query FusionOral
  861. Moment-based Posterior Sampling for Multi-reference AlignmentOral
  862. MotionBeat: Motion-Aligned Music Representation via Embodied Contrastive Learning and Bar-Equivariant Contact-Aware EncodingOral
  863. Multi-Agent Honeypot-Based Request-Response Context Dataset for Improved SQL Injection Detection PerformancePoster
  864. Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content ReasoningOral
  865. Multi-Stage Music Source Restoration with BandSplit-RoFormer Separation and HiFi++ GANPoster
  866. Multi-layer attentive probing improves transfer of audio representations for bioacousticsOral
  867. Multi-scale Conditional Generative Modeling for Microscopic Image RestorationOral
  868. Multi-scale Generative Modeling for Fast SamplingOral
  869. Multimodal Privacy-Preserving Entity Resolution with Fully Homomorphic EncryptionOral
  870. Multimodal-Prior-Guided Importance Sampling for Hierarchical Gaussian Splatting in Sparse-View Novel View SynthesisPoster
  871. Multiview Progress Prediction of Robot ActivitiesPoster
  872. NATIVETOK: NATIVE VISUAL TOKENIZATION FOR IMPROVED IMAGE GENERATIONOral
  873. NETWORK-CONTROLLED REPEATERS UNDER POWER AMPLIFIER NON-LINEARITIESPoster
  874. NEURAL ACOUSTIC MULTIPOLE SPLATTING FOR ROOM IMPULSE RESPONSE SYNTHESISOral
  875. NEURAL NETWORK-BASED TIME-FREQUENCY-BIN-WISE LINEAR COMBINATION OF BEAMFORMERS FOR UNDERDETERMINED TARGET SOURCE EXTRACTIONPoster
  876. NEUROHASH: A HYPERDIMENSIONAL NEURO-SYMBOLIC FRAMEWORK FOR SPATIALLY-AWARE IMAGE HASHING AND RETRIEVALOral
  877. NIFTY: A NON-LOCAL IMAGE FLOW MATCHING FOR TEXTURE SYNTHESISPoster
  878. NLDSI-BWE: NON LINEAR DYNAMICAL SYSTEMS-INSPIRED MULTI RESOLUTION DISCRIMINATORS FOR SPEECH BANDWIDTH EXTENSIONPoster
  879. NO VERIFIABLE REWARD FOR PROSODY: TOWARD PREFERENCE-GUIDED PROSODY LEARNING IN TTSPoster
  880. NOISE-ROBUST AV-ASR USING VISUAL FEATURES BOTH IN THE WHISPER ENCODER AND DECODERPoster
  881. NOISE-ROBUST CONTRASTIVE LEARNING WITH AN MFCC-CONFORMER FOR CORONARY ARTERY DISEASE DETECTIONPoster
  882. NOISE-TO-NOTES: DIFFUSION-BASED GENERATION AND REFINEMENT FOR AUTOMATIC DRUM TRANSCRIPTIONOral
  883. NON-ASYMPTOTIC PERFORMANCE ANALYSIS OF DOA ESTIMATION BASED ON REAL-VALUED ROOT-MUSICPoster
  884. NONCONVEX REGULARIZATION FOR FEATURE SELECTION IN REINFORCEMENT LEARNINGPoster
  885. NORD-PARL-TTS: FINNISH AND SWEDISH TTS DATASET FROM PARLIAMENT SPEECHPoster
  886. NSC-SL: A Bandwidth-Aware Neural Subspace Compression for Communication-Efficient Split LearningPoster
  887. NUMERICAL SPECTRUM LINKING: IDENTIFICATION OF GOVERNING PDE VIA KOOPMAN-CHEBYSHEV APPROXIMATIONPoster
  888. Nethira: A Heterogeneity-aware Hierarchical Pre-trained Model for Network Traffic ClassificationPoster
  889. NeuSpeech: Decode Neural signal as SpeechPoster
  890. Neural Forward Filtering for Speaker-Image SeparationOral
  891. Neural personal sound zones with flexible bright zone controlPoster
  892. NeuroBRIDGE: Behavior-Conditioned Koopman Dynamics with Riemannian Alignment for Early Substance Use Initiation Prediction from Longitudinal Functional ConnectomePoster
  893. No Concept Left Behind: Test-Time Optimization for Compositional Text-to-Image GenerationPoster
  894. No Word Left Behind: Mitigating Prefix Bias in Open-Vocabulary Keyword SpottingPoster
  895. Nuclear Diffusion Models for Low-Rank Background Suppression in VideosOral
  896. OCR-Enhanced Multimodal ASR Can Read While ListeningPoster
  897. OF-SemWat: HIGH-PAYLOAD TEXT EMBEDDING FOR SEMANTIC WATERMARKING OF AI-GENERATED IMAGES WITH ARBITRARY SIZEPoster
  898. OILSAM2: MEMORY-AUGMENTED SAM2 FOR SCALABLE SAR OIL SPILL DETECTIONPoster
  899. OMNI-AVSR: TOWARDS UNIFIED MULTIMODAL SPEECH RECOGNITION WITH LARGE LANGUAGE MODELSPoster
  900. ON DEEPFAKE VOICE DETECTION - IT’S ALL IN THE PRESENTATIONOral
  901. ONLINE NEURAL FUSION OF DISTORTIONLESS DIFFERENTIAL BEAMFORMERS FOR ROBUST SPEECH ENHANCEMENTPoster
  902. ONLINE REGISTER FOR DUAL-MODE SELF-SUPERVISED SPEECH MODELS: MITIGATING THE LACK OF FUTURE CONTEXTPoster
  903. OPINION CONSENSUS FORMATION AMONG NETWORKED LARGE LANGUAGE MODELSPoster
  904. OPTIMAL PLACEMENT OF MOVABLE ANTENNAS FOR ANGLE-OF-DEPARTURE ESTIMATION UNDER USER LOCATION UNCERTAINTYOral
  905. OPTIMAL TRANSPORT BASED UNSUPERVISED RESTORATION LEARNING EXPLOITING DEGRADATION SPARSITYPoster
  906. OPTIMIZING DOMAIN-ADAPTIVE SELF-SUPERVISED LEARNING FOR CLINICAL VOICE-BASED DISEASE CLASSIFICATIONOral
  907. OPTIMIZING SPEECH LANGUAGE MODELS FOR ACOUSTIC CONSISTENCYPoster
  908. ORTHOGONAL APPROXIMATE MESSAGE PASSING ALGORITHMS FOR RECTANGULAR SPIKED MATRIX MODELS WITH ROTATIONALLY INVARIANT NOISEOral
  909. OUT-OF-DISTRIBUTION DETECTION BASED ON TOTAL VARIATION ESTIMATIONPoster
  910. OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-SpeechOral
  911. On Multiangle Discrete Fractional Periodic TransformsPoster
  912. On the Importance of a Multi-Scale Calibration for QuantizationOral
  913. On the Optimality of Rate Balancing for Max-Min Fair MulticastingOral
  914. On the Sensitivity of Firing Rate-Based Federated Spiking Neural Networks to Differential PrivacyPoster
  915. Optimal QAM Constellation for Over-the-Air Computation in the Presence of Heavy-Tailed Channel NoisePoster
  916. Orthogonal Weight Modification Enhances Learning Scalability and Convergence Efficiency without Gradient BackpropagationPoster
  917. PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech RecognitionOral
  918. PAGS: PRIORITY-ADAPTIVE GAUSSIAN SPLATTING FOR DYNAMIC DRIVING SCENESPoster
  919. PANKRAG: ENHANCING GRAPH RETRIEVAL VIA GLOBALLY AWARE QUERY RESOLUTION AND DEPENDENCY-AWARE RERANKING MECHANISMPoster
  920. PAPER SUMMARY ATTACK: JAILBREAKING LLMS THROUGH LLM SAFETY PAPERSPoster
  921. PAR: Prompt-Aware Token Reduction Method for Efficient Large Multimodal ModelsPoster
  922. PARAGSE: PARALLEL GENERATIVE SPEECH ENHANCEMENT WITH GROUP-VECTOR-QUANTIZATION-BASED NEURAL SPEECH CODECPoster
  923. PARALINGUISTIC EMOTION-AWARE VALIDATION TIMING DETECTION IN JAPANESE EMPATHETIC SPOKEN DIALOGUEPoster
  924. PARALLEL DELAY-DOPPLER ESTIMATION VIA ORDER-REVERSED TWO-STAGE PRONY METHODPoster
  925. PAS-SE: PERSONALIZED AUXILIARY-SENSOR SPEECH ENHANCEMENT FOR VOICE PICKUP IN HEARABLESPoster
  926. PATHFINDER: MCTS AND LLM FEEDBACK-BASED PATH SELECTION FOR MULTI-HOP QUESTION ANSWERINGPoster
  927. PC-MCL: PATIENT-CONSISTENT MULTI-CYCLE LEARNING WITH MULTI-LABEL BIAS CORRECTION FOR RESPIRATORY SOUND CLASSIFICATIONPoster
  928. PEEKING INTO THE FUTURE FOR CONTEXTUAL BIASINGPoster
  929. PENGUIN: GENERAL VITAL SIGN RECONSTRUCTION FROM PPG WITH FLOW MATCHING STATE SPACE MODELOral
  930. PERCEPTUAL QUALITY OPTIMIZATION OF IMAGE SUPER-RESOLUTIONPoster
  931. PERFORMANCE-GUIDED REINFORCED ACTIVE LEARNING FOR OBJECT DETECTIONPoster
  932. PERFORMSINGER: MULTIMODAL SINGING VOICE SYNTHESIS LEVERAGING SYNCHRONIZED LIP CUES FROM SINGING PERFORMANCE VIDEOSPoster
  933. PERSONAAGENT WITH GRAPHRAG: COMMUNITY-AWARE KNOWLEDGE GRAPHS FOR PERSONALIZED LLMPoster
  934. PERSONALIZED CELL SEGMENTATION: BENCHMARK AND FRAMEWORK FOR REFERENCE-GUIDED CELL TYPE SEGMENTATIONPoster
  935. PERSONAPLEX: VOICE AND ROLE CONTROL FOR FULL DUPLEX CONVERSATIONAL SPEECH MODELSOral
  936. PERSUASION SHOULD BE DOUBLE-BLIND: A MULTI-DOMAIN DIALOGUE DATASET WITH FAITHFULNESS BASED ON CAUSAL THEORY OF MINDPoster
  937. PFLUXTTS: HYBRID FLOW-MATCHING TTS WITH ROBUST CROSS-LINGUAL VOICE CLONING AND INFERENCE-TIME MODEL FUSIONPoster
  938. PHASE-ONLY POSITIONING IN DISTRIBUTED MIMO UNDER PHASE IMPAIRMENTS: AP SELECTION USING DEEP LEARNINGOral
  939. PHASE-RETRIEVAL-BASED PHYSICS-INFORMED NEURAL NETWORKS FOR ACOUSTIC MAGNITUDE FIELD RECONSTRUCTIONPoster
  940. PHASEMARK: A POST-HOC, OPTIMIZATION-FREE WATERMARKING OF AI-GENERATED IMAGES IN THE LATENT FREQUENCY DOMAINPoster
  941. PHONEME-LEVEL VISUAL SPEECH RECOGNITION VIA POINT-VISUAL FUSION AND LANGUAGE MODEL RECONSTRUCTIONPoster
  942. PHONOLOGICAL TOKENIZER: PROSODY-AWARE PHONETIC TOKEN VIA MULTI-OBJECTIVE FINE-TUNING WITH DIFFERENTIABLE K-MEANSPoster
  943. PHOTOMETRIC STEREO USING GAUSSIAN SPLATTING AND INVERSE RENDERINGPoster
  944. PHRASED: Phrase Dictionary Biasing for Speech TranslationPoster
  945. PHYS-DIFF: A PHYSICS-INSPIRED LATENT DIFFUSION MODEL FOR TROPICAL CYCLONE FORECASTINGPoster
  946. PHYSHDR: WHEN LIGHTING MEETS MATERIALS AND SCENE GEOMETRY IN HDR RECONSTRUCTIONPoster
  947. PHYSICS-AWARE NOVEL-VIEW ACOUSTIC SYNTHESIS WITH VISION-LANGUAGE PRIORS AND 3D ACOUSTIC ENVIRONMENT MODELINGPoster
  948. PHYSICS-DRIVEN 3D GAUSSIAN RENDERING FOR ZERO-SHOT MRI SUPER-RESOLUTIONPoster
  949. PHYSICS-GUIDED DIFFUSION PRIORS FOR MULTI-SLICE RECONSTRUCTION IN SCIENTIFIC IMAGINGOral
  950. PHYSICS-INFORMED ANOMALY DETECTION OF TERRAIN MATERIAL CHANGE IN RADAR IMAGERYPoster
  951. PHYSICS-INFORMED DIFFUSION GENERATION FOR GEOMAGNETIC MAP INTERPOLATIONOral
  952. PHYSICS-INFORMED GNN FOR MEDIUM-HIGH VOLTAGE AC POWER FLOW WITH EDGE-AWARE ATTENTION AND LINE SEARCH CORRECTION OPERATOROral
  953. PHYSICS-INFORMED VIDEO DIFFUSION FOR SHALLOW WATER EQUATIONSPoster
  954. PIANOROLL-EVENT: A NOVEL SCORE REPRESENTATION FOR SYMBOLIC MUSICPoster
  955. PICOAUDIO2: TEMPORAL CONTROLLABLE TEXT-TO-AUDIO GENERATION WITH NATURAL LANGUAGE DESCRIPTIONOral
  956. PINA: PROMPT INJECTION ATTACK AGAINST NAVIGATION AGENTSPoster
  957. PLPP: PROMPT LEARNING WITH PERPLEXITY IS SELF-DISTILLATION FOR VISION-LANGUAGE MODELSPoster
  958. PLUG-AND-PLAY EMOTION GRAPHS FOR COMPOSITIONAL PROMPTING IN ZERO-SHOT SPEECH EMOTION RECOGNITIONPoster
  959. PLUG-AND-PLAY FORWARD BACKWARD ALGORITHM TO RESTORE LANDSAT IMAGES: A PRELIMINARY STEP TO UNCOVER THE HISTORY OF SURFACE WATERSPoster
  960. PMMD: A POSE-GUIDED MULTI-VIEW MULTI-MODAL DIFFUSION FOR PERSON GENERATIONPoster
  961. POLY-SVC: POLYPHONY-AWARE SINGING VOICE CONVERSION WITH HARMONIC MODELINGPoster
  962. POLYNOMIAL MIXING FOR EFFICIENT SELF-SUPERVISED SPEECH ENCODERSOral
  963. POSITION-INVARIANT FINE-TUNING OF SPEECH ENHANCEMENT MODELS WITH SELF-SUPERVISED SPEECH REPRESENTATIONSPoster
  964. POWER CONSUMPTION REDUCTION IN ELAA-ASSISTED ISAC SYSTEMSOral
  965. PRECISION NEURAL NETWORKS: JOINT GRAPH AND RELATIONAL LEARNINGPoster
  966. PRECODER DESIGN IN MULTI-USER FDD SYSTEMS WITH VQ-VAE AND GNNPoster
  967. PREIG: Physics-informed and Reinforcement-driven Interpretable GRU for Commodity Demand ForecastingOral
  968. PRG: Prompt-Based Distillation Without Annotation via Proxy Relational GraphPoster
  969. PRINCIPLED COARSE-GRAINED ACCEPTANCE FOR SPECULATIVE DECODING IN SPEECHOral
  970. PRISM: PROBABILISTIC AND ROBUST INVERSE SOLVER WITH MEASUREMENT-CONDITIONED DIFFUSION PRIOR FOR BLIND INVERSE PROBLEMSOral
  971. PRISM: Precision-Recall Informed Data-Free Knowledge Distillation via Generative DiffusionPoster
  972. PRIVACY-AWARE DESIGN OF DISTRIBUTED MIMO ISAC SYSTEMSOral
  973. PROADS: PROVABLY SECURE AND ROBUST AUDIO DIFFUSION STEGANOGRAPHY WITH LATENT OPTIMIZATION AND BACKWARD EULER INVERSIONPoster
  974. PROBABILISTIC DEEP DISCRIMINANT ANALYSIS FOR WIND BLADE SEGMENTATIONPoster
  975. PROBING THE HIDDEN TALENT OF ASR FOUNDATION MODELS FOR L2 ENGLISH ORAL ASSESSMENTPoster
  976. PROBING WHISPER FOR DYSARTHRIC SPEECH IN DETECTION AND ASSESSMENTPoster
  977. PROFICIENCY-AWARE ADAPTATION AND DATA AUGMENTATION FOR ROBUST L2 ASRPoster
  978. PROMPTMAD: CROSS-MODAL PROMPTING FOR MULTI-CLASS VISUAL ANOMALY LOCALIZATIONOral
  979. PROMPTSEP: GENERATIVE AUDIO SEPARATION VIA MULTIMODAL PROMPTINGOral
  980. PROPAGATING SIMILARITY, MITIGATING UNCERTAINTY: SIMILARITY PROPAGATION-ENHANCED UNCERTAINTY FOR MULTIMODAL RECOMMENDATIONPoster
  981. PROSODY-GUIDED HARMONIC ATTENTION FOR PHASE-COHERENT NEURAL VOCODING IN THE COMPLEX SPECTRUMPoster
  982. PROST-LLM: PROGRESSIVELY ENHANCING THE SPEECH-TO-SPEECH TRANSLATION CAPABILITY IN LLMSPoster
  983. PSEUDO-SIAMESE NETWORK FOR PLANNING IN TARGET-ORIENTED PROACTIVE DIALOGUESPoster
  984. PSGS: TEXT-DRIVEN PANORAMA SLIDING SCENE GENERATION VIA GAUSSIAN SPLATTINGPoster
  985. PSGait: Gait Recognition using Parsing SkeletonPoster
  986. PTSE-T: PRESENTATION TARGET SPEAKER EXTRACTION USING UNALIGNED TEXT CUESPoster
  987. PURIFICATION BEFORE FUSION: TOWARD MASK-FREE SPEECH ENHANCEMENT FOR ROBUST AUDIO-VISUAL SPEECH RECOGNITIONPoster
  988. ParaAegis: Parallel Protection for Flexible Privacy-preserved Federated LearningPoster
  989. PhysiGen: Integrating Collision-Aware Physical Constraints for High-Fidelity Human-Human Interaction GenerationPoster
  990. Physics Informed Generative Models for Magnetic Field ImagesPoster
  991. PictOBI-20k: Unveiling Large Multimodal Models in Visual Decipherment for Pictographic Oracle Bone CharactersPoster
  992. PocketDVDNet: Realtime Video Denoising for Real Camera NoisePoster
  993. Position-Aware Self-supervised Representation Learning for Cross-mode Radar Signal RecognitionPoster
  994. Pre-training Tensor-Train Networks Facilitates Machine Learning with Variational Quantum CircuitsOral
  995. Predict the Retrieval! Test Time Adaptation for Retrieval Augmented GenerationPoster
  996. ProKWS: Personalized Keyword Spotting via Collaborative Learning of Phonemes and ProsodyPoster
  997. ProMist-5K: A Comprehensive Dataset for Digital Emulation of Cinematic Pro-Mist Filter EffectsPoster
  998. Progressively Texture-Aware Diffusion for Contrast-Enhanced Sparse-View CTPoster
  999. Prototype-Based Pseudo-Label Denoising for Source-Free Domain Adaptation in Remote Sensing Semantic SegmentationOral
  1000. QA-ReID: Quality-Aware Query-Adaptive Convolution Leveraging Fused Global and Structural Cues for Clothes-Changing ReIDPoster

Looking for submission deadlines instead? See the conference deadline calendar.