ICASSP 2026 Accepted Papers
The full list of 1,432 papers accepted at ICASSP 2026 (IEEE International Conference on Acoustics, Speech and Signal Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
Poster: 1,085Oral: 347
- (P)rior(D)yna(F)low: A Priori Dynamic Workflow Construction via Multi-Agent CollaborationPoster
- 3DIFFUSIONDET: DIFFUSION MODEL FOR 3D OBJECT DETECTION WITH ROBUST LIDAR-CAMERA FUSIONPoster
- 3DPCNet: Pose Canonicalization for Robust Viewpoint-Invariant 3D Kinematic Analysis from Monocular RGB camerasPoster
- A Benchmark for Joint Dialogue Satisfaction, Emotion Recognition, and Emotion State Transition PredictionPoster
- A COCKTAIL-PARTY BENCHMARK: MULTI-MODAL DATASET AND COMPARATIVE EVALUATION RESULTSPoster
- A COMPARATIVE STUDY ON HOW DATA NORMALIZATION AFFECTS ZERO-SHOT GENERALIZATION IN TIME SERIES FOUNDATION MODELSPoster
- A CONVEX DEMIXING APPROACH FOR HYBRID-FIELD CHANNEL ESTIMATION OF XL-MIMO SYSTEMS VIA ATOMIC NORM MINIMIZATIONOral
- A DECOMPOSITION-BASED STATE SPACE MODEL FOR MULTIVARIATE TIME-SERIES FORECASTINGOral
- A DISTRIBUTION MATCHING APPROACH TO NEURAL PIANO TRANSCRIPTION WITH OPTIMAL TRANSPORTPoster
- A DUAL-BRANCH FRAMEWORK FOR SEMANTIC CHANGE DETECTION WITH BOUNDARY AND TEMPORAL AWARENESSPoster
- A DUAL-MODULATION FRAMEWORK FOR RGB-T CROWD COUNTING VIA SPATIALLY MODULATED ATTENTION AND ADAPTIVE FUSIONPoster
- A DYL-UNET FRAMEWORK BASED ON DYNAMIC LEARNING FOR TEMPORALLY CONSISTENT ECHOCARDIOGRAPHIC SEGMENTATIONPoster
- A Dataset of Robot-Patient and Doctor-Patient Medical Dialogues for Spoken Language Processing TasksPoster
- A GENERATIVE-FIRST NEURAL AUDIO AUTOENCODERPoster
- A Generative Model for Controllable Feature Heterophily in GraphsPoster
- A HYBRID DISCRIMINATIVE AND GENERATIVE SYSTEM FOR UNIVERSAL SPEECH ENHANCEMENTPoster
- A LIGHTWEIGHT FOURIER-BASED NETWORK FOR BINAURAL SPEECH ENHANCEMENT WITH SPATIAL CUE PRESERVATIONPoster
- A MEDICAL MULTIMODAL DIAGNOSTIC FRAMEWORK INTEGRATING VISION-LANGUAGE MODELS AND LOGIC TREE REASONINGPoster
- A MULTIMODAL DEPTH-AWARE METHOD FOR EMBODIED REFERENCE UNDERSTANDINGPoster
- A Novel Automatic Framework for Speaker Drift Detection in Synthesized SpeechPoster
- A PARAMETER-EFFICIENT MULTI-SCALE CONVOLUTIONAL ADAPTER FOR SYNTHETIC SPEECH DETECTIONPoster
- A PARAMETRIC POWER MODEL OF UPPER MID-BAND (FR3) BASE STATIONS FOR 6GPoster
- A POINT PROCESS MODEL OF SKIN CONDUCTANCE RESPONSES IN A STROOP TASK FOR PREDICTING DEPRESSION AND SUICIDAL IDEATIONPoster
- A RANDOM MATRIX PERSPECTIVE OF ECHO STATE NETWORKS: FROM PRECISE BIAS–VARIANCE CHARACTERIZATION TO OPTIMAL REGULARIZATIONPoster
- A Robust Multi-Scale Framework with Test-Time Adaptation for sEEG-Based Speech DecodingPoster
- A STAGE-WISE LEARNING STRATEGY WITH FIXED ANCHORS FOR ROBUST SPEAKER VERIFICATIONPoster
- A STUDY OF DATA SELECTION STRATEGIES FOR PRE-TRAINING SELF-SUPERVISED SPEECH MODELSOral
- A SUPERB-Style Benchmark of Self-Supervised Speech Models for Audio Deepfake DetectionOral
- A SUPPORT VECTOR APPROACH IN SEGMENTED REGRESSION FOR MAP-ASSISTED NON-COOPERATIVE SOURCE LOCALIZATIONPoster
- A Stabilized Hybrid Active Noise Control Algorithm of GFANC and FxNLMS with Online ClusteringPoster
- A TEXT-IMAGE FUSION METHOD WITH DATA AUGMENTATION CAPABILITIES FOR REFERRING MEDICAL IMAGE SEGMENTATIONPoster
- A TEXT-TO-TEXT ALIGNMENT ALGORITHM FOR BETTER EVALUATION OF MODERN SPEECH RECOGNITION SYSTEMSPoster
- A Training-Free Framework for High-Fidelity Appearance Transfer via Diffusion TransformersPoster
- A Tsallis-Entropy Lens on Genetic VariationPoster
- A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training ModelsPoster
- A UNIFIED SPOKEN LANGUAGE MODEL WITH INJECTED EMOTIONAL-ATTRIBUTION THINKING FOR HUMAN-LIKE INTERACTIONPoster
- A Unified SVD-Modal Solution for Sparse Sound Field Reconstruction with Hybrid Spherical-Linear Microphone ArraysPoster
- A long-form single-speaker real-time MRI speech dataset and benchmarkPoster
- A mixed precision FFT with applications in MRIPoster
- ABC-EVAL: BENCHMARKING LARGE LANGUAGE MODELS ON SYMBOLIC MUSIC UNDERSTANDING AND INSTRUCTION FOLLOWINGPoster
- ABRACADDBRA: TOUCH-GUIDED OBJECT ADDITION BY DECOUPLING PLACEMENT AND EDITING SUBTASKSPoster
- ACAVCAPS: ENABLING LARGE-SCALE TRAINING FOR FINE-GRAINED AND DIVERSE AUDIO UNDERSTANDINGPoster
- ACCENT-INVARIANT AUTOMATIC SPEECH RECOGNITION VIA SALIENCY-DRIVEN SPECTROGRAM MASKINGPoster
- ACD-CLIP: DECOUPLING REPRESENTATION AND DYNAMIC FUSION FOR ZERO-SHOT ANOMALY DETECTIONPoster
- ACHIEVING PARETO OPTIMALITY IN GAMES VIA SINGLE-BIT FEEDBACKPoster
- ACOUSTIC AND FACIAL MARKERS OF PERCEIVED CONVERSATIONAL SUCCESS IN SPONTANEOUS SPEECHPoster
- ACOUSTIC NON-STATIONARITY OBJECTIVE ASSESSMENT WITH HARD LABEL CRITERIA FOR SUPERVISED LEARNING MODELSPoster
- ACOUSTIC TELEPORTATION VIA DISENTANGLED NEURAL AUDIO CODEC REPRESENTATIONSOral
- ACTIVE INFERENCE FRAMEWORK FOR CLOSED-LOOP SENSING, COMMUNICATION, AND CONTROL IN UAV SYSTEMSOral
- ACTIVE JAMMER LOCALIZATION VIA ACQUISITION-AWARE PATH PLANNINGPoster
- ACTIVE SEQUENTIAL HYPOTHESIS TESTING WITH NON-HOMOGENEOUS COSTSOral
- AD-DINOv3: Enhancing DINOv3 for Zero-Shot Anomaly Detection with Anomaly-Aware CalibrationPoster
- ADAFLOW: EFFICIENT LONG VIDEO EDITING VIA ADAPTIVE ATTENTION SLIMMING AND KEYFRAME SELECTIONPoster
- ADAPTER-STATE SHARING CLIP FOR PARAMETER-EFFICIENT MULTIMODAL SARCASM DETECTIONPoster
- ADAPTING DIARIZATION-CONDITIONED WHISPER FOR END-TO-END MULTI-TALKER SPEECH RECOGNITIONOral
- ADAPTING HFMCA TO GRAPH DATA: SELF-SUPERVISED LEARNING FOR GENERALIZABLE FMRI REPRESENTATIONSPoster
- ADAPTING NEURAL AUDIO CODECS TO EEGPoster
- ADAPTIVE COMPRESSED INTEGRATE-AND-FIRE TIME ENCODING MACHINEPoster
- ADAPTIVE DETERMINISTIC FLOW MATCHING FOR TARGET SPEAKER EXTRACTIONPoster
- ADAPTIVE GUIDANCE SEMANTICALLY ENHANCED VIA MULTIMODAL LLM FOR EDGE-CLOUD OBJECT DETECTIONPoster
- ADAPTIVE PER-CHANNEL ENERGY NORMALIZATION FRONT-END FOR ROBUST AUDIO SIGNAL PROCESSINGPoster
- ADAPTIVE ROTARY STEERING WITH JOINT AUTOREGRESSION FOR ROBUST EXTRACTION OF CLOSELY MOVING SPEAKERS IN DYNAMIC SCENARIOSOral
- ADAPTIVE RUNGE-KUTTA DYNAMICS FOR SPATIOTEMPORAL PREDICTIONOral
- ADAPTIVE SHARED EXPERTS WITH LORA-BASED MIXTURE OF EXPERTS FOR MULTI-TASK LEARNINGOral
- ADAPTIVE SPEAKER EMBEDDING SELF-AUGMENTATION FOR PERSONAL VOICE ACTIVITY DETECTION WITH SHORT ENROLLMENT SPEECHPoster
- ADAPTIVE-VOCO: COMPLEXITY-AWARE VISUAL TOKEN COMPRESSION FOR VISION-LANGUAGE MODELSPoster
- ADDRESSING GRADIENT MISALIGNMENT IN DATA-AUGMENTED TRAINING FOR ROBUST SPEECH DEEPFAKE DETECTIONOral
- ADVANCED MODELING OF INTERLANGUAGE SPEECH INTELLIGIBILITY BENEFIT WITH L1-L2 MULTI-TASK LEARNING USING DIFFERENTIABLE K-MEANS FOR ACCENT-ROBUST DISCRETE TOKEN-BASED ASRPoster
- ADVANCING SPEECH SUMMARIZATION IN MULTI-MODAL LLMS WITH REINFORCEMENT LEARNINGPoster
- ADVANCING SPEECH UNDERSTANDING IN SPEECH-AWARE LANGUAGE MODELS WITH GRPOPoster
- ADVERSARIAL PROMPT DISTILLATION FOR VISION-LANGUAGE MODELSPoster
- ADVERSARIAL UPDATE-BASED FEDERATED UNLEARNING FOR POISONED MODEL RECOVERYOral
- AFD-SLU: ADAPTIVE FEATURE DISTILLATION FOR SPOKEN LANGUAGE UNDERSTANDINGPoster
- AFT: AN EXEMPLAR-FREE CLASS INCREMENTAL LEARNING METHOD FOR ENVIRONMENTAL SOUND CLASSIFICATIONPoster
- AG-FUSION: ADAPTIVE GATED MULTIMODAL FUSION FOR 3D OBJECT DETECTION IN COMPLEX SCENESPoster
- AGENT-GSPO: COMMUNICATION-EFFICIENT MULTI-AGENT SYSTEMS VIA GROUP SEQUENCE POLICY OPTIMIZATIONOral
- AGRIDOCTOR: A MULTIMODAL INTELLIGENT ASSISTANT FOR AGRICULTUREPoster
- AI-GENERATED MUSIC DETECTION IN BROADCAST MONITORINGPoster
- AILIVE MIXER: A DEEP LEARNING BASED ZERO LATENCY AUTOMATIC MUSIC MIXER FOR LIVE MUSIC PERFORMANCESPoster
- AISHELL6-WHISPER: A CHINESE MANDARIN AUDIO-VISUAL WHISPER SPEECH DATASET WITH SPEECH RECOGNITION BASELINESPoster
- AL-COLE: AUGMENTED LAGRANGIAN FOR CONSTRAINED LEARNINGOral
- ALIGN TO THE PIVOT: DUAL ALIGNMENT WITH SELF-FEEDBACK FOR MULTILINGUAL MATH REASONINGPoster
- ALIGNING GENERATIVE SPEECH ENHANCEMENT WITH PERCEPTUAL FEEDBACKOral
- ALIGNING LANGUAGE MODELS FOR LYRIC-TO-MELODY GENERATION WITH RULE-BASED MUSICAL CONSTRAINTSPoster
- ALIGNING WHAT YOU SEPARATE: DENOISED PATCH MIXING FOR SOURCE-FREE DOMAIN ADAPTATION IN MEDICAL IMAGE SEGMENTATIONPoster
- AMBIDROP: ARRAY-AGNOSTIC SPEECH ENHANCEMENT USING AMBISONICS ENCODING AND DROPOUT-BASED LEARNINGPoster
- AN AMP-BASED ASYMPTOTIC ANALYSIS FOR NONLINEAR ONE-BIT PRECODINGOral
- AN EFFECTIVE DATA AUGMENTATION METHOD BY ASKING QUESTIONS ABOUT SCENE TEXT IMAGESPoster
- AN EFFICIENT NEURAL NETWORK FOR MODELING HUMAN AUDITORY NEUROGRAMS FOR SPEECHPoster
- AN EVENT-BASED SEQUENCE MODELING APPROACH TO RECOGNIZING NON-TRIAD CHORDS WITH OVERSEGMENTATION MINIMIZATIONPoster
- ANALYTIC INCREMENTAL LEARNING FOR SOUND SOURCE LOCALIZATION WITH IMBALANCE RECTIFICATIONPoster
- ANCHORED SPECTRAL ESTIMATOR FOR RIGID MOTION SYNCHRONIZATIONPoster
- ANIMALCLAP: TAXONOMY-AWARE LANGUAGE-AUDIO PRETRAINING FOR SPECIES RECOGNITION AND TRAIT INFERENCEPoster
- ANYACCOMP: GENERALIZABLE ACCOMPANIMENT GENERATION VIA QUANTIZED MELODIC BOTTLENECKPoster
- ANYRIR: ROBUST NON-INTRUSIVE ROOM IMPULSE RESPONSE ESTIMATION IN THE WILDPoster
- APPROXIMATE MESSAGE PASSING FOR MULTI-PREAMBLE DETECTION IN OTFS RANDOM ACCESSPoster
- APPROXIMATING UNIVARIATE FACTORED DISTRIBUTIONS VIA MESSAGE-PASSING ALGORITHMSPoster
- AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question AnsweringOral
- AR&D: A Framework for Retrieving and Describing Concepts for Interpreting AudioLLMsOral
- AR-LIF: ADAPTIVE RESET LEAKY INTEGRATE-AND-FIRE NEURON FOR SPIKING NEURAL NETWORKSPoster
- ARA-BEST-RQ: MULTI DIALECTAL ARABIC SSLPoster
- ARAP-GS: DRAG-DRIVEN AS-RIGID-AS-POSSIBLE 3D GAUSSIAN SPLATTING EDITING WITH DIFFUSION PRIORPoster
- ARCHAGENT: SCALABLE LEGACY SOFTWARE ARCHITECTURE RECOVERY WITH LLMSPoster
- ARCHI-TTS: A FLOW-MATCHING-BASED TEXT-TO-SPEECH MODEL WITH SELF-SUPERVISED SEMANTIC ALIGNER AND ACCELERATED INFERENCEPoster
- ARE MODERN SPEECH ENHANCEMENT SYSTEMS VULNERABLE TO ADVERSARIAL ATTACKS?Poster
- ARE THESE EVEN WORDS? QUANTIFYING THE GIBBERISHNESS OF GENERATIVE SPEECH MODELSOral
- AROMMA: UNIFYING OLFACTORY EMBEDDINGS FOR SINGLE MOLECULES AND MIXTURESPoster
- ARRAYDPS-REFINE: GENERATIVE REFINEMENT OF DISCRIMINATIVE MULTI-CHANNEL SPEECH ENHANCEMENTPoster
- ARTI-6: TOWARDS SIX-DIMENSIONAL ARTICULATORY SPEECH ENCODINGPoster
- ARTIFACT-AWARE EVALUATION FOR HIGH-QUALITY VIDEO GENERATIONOral
- ARTIFREE: DETECTING AND REDUCING GENERATIVE ARTIFACTS IN DIFFUSION-BASED SPEECH ENHANCEMENTPoster
- ASRC-SNN: ADAPTIVE SKIP RECURRENT CONNECTION SPIKING NEURAL NETWORKPoster
- ASSESSING IDENTITY LEAKAGE IN TALKING FACE GENERATION: METRICS AND EVALUATION FRAMEWORKPoster
- ASSESSING THE IMPACT OF SPEAKER IDENTITY IN SPEECH SPOOFING DETECTIONPoster
- ATTENTION TO DETAILS, LOGITS TO TRUTH: VISUAL-AWARE ATTENTION AND LOGITS ENHANCEMENT TO MITIGATE HALLUCINATIONS IN LVLMSOral
- ATTENTION-ENHANCED LEARNING FOR SENSING-ASSISTED LONG-TERM BEAM TRACKING IN MMWAVE COMMUNICATIONSOral
- ATTENTION2PROBABILITY: ATTENTION-DRIVEN TERMINOLOGY PROBABILITY ESTIMATION FOR ROBUST SPEECH-TO-TEXT SYSTEMPoster
- AUDEN-VOICE: GENERAL-PURPOSE VOICE ENCODER FOR SPEECH AND LANGUAGE UNDERSTANDINGPoster
- AUDIO DEEPFAKE DETECTION AT THE FIRST GREETING: “HI!”Poster
- AUDIO EFFECT ESTIMATION WITH DNN-BASED PREDICTION AND SEARCH ALGORITHMPoster
- AUDIO-CONDITIONED DIFFUSION LLMS FOR ASR AND DELIBERATION PROCESSINGPoster
- AUDIOCARDS: STRUCTURED METADATA IMPROVES AUDIO LANGUAGE MODELS FOR SOUND DESIGNOral
- AUDIOGEN-OMNI: A UNIFIED MULTIMODAL DIFFUSION TRANSFORMER FOR VIDEO-SYNCHRONIZED AUDIO, SPEECH, AND SONG GENERATIONPoster
- AUDIOGENIE-REASONER: A TRAINING-FREE MULTI-AGENT FRAMEWORK FOR COARSE-TO-FINE AUDIO DEEP REASONINGOral
- AUTOREGRESSIVE-GAUSSIAN MIXTURE MODELS: EFFICIENT GENERATIVE MODELING OF WSS SIGNALSOral
- AUTOVQA-G: SELF-IMPROVING AGENTIC FRAMEWORK FOR AUTOMATED VISUAL QUESTION ANSWERING AND GROUNDING ANNOTATIONPoster
- AUV: TEACHING AUDIO UNIVERSAL VECTOR QUANTIZATION WITH SINGLE NESTED CODEBOOKPoster
- AWDIFF: AN A TROUS WAVELET DIFFUSION MODEL FOR LUNG ULTRASOUND IMAGE SYNTHESISPoster
- AWGFORMER: ADAPTIVE WAVELET-GUIDED TRANSFORMER FOR MULTI-RESOLUTION TIME SERIES FORECASTINGPoster
- Accelerated Sinkhorn Algorithms for Partial Optimal TransportPoster
- Accelerated training of Gaussian processes using banded square exponential covariancesPoster
- AdaNODEs: Test Time Adaptation for Time Series Forecasting Using Neural ODEsPoster
- Adaptive Graph Coarsening for Efficient GNN TrainingPoster
- Adaptive Multi-Scale Correlation Meta-Network for Few-Shot Remote Sensing Image ClassificationPoster
- Adaptive and Balanced Re-initialization for Long-timescale Continual Test-time Domain AdaptationPoster
- Affordance Benchmark for MLLMsPoster
- AirGlove: Exploring Egocentric 3D Hand Tracking and Appearance Generalization for Sensing GlovesPoster
- Align2Speak: Improving TTS for Low Resource Languages via ASR-Guided Online Preference OptimizationPoster
- An Information Geometric Approach to Fairness With Equalized Odds ConstraintOral
- AnimateScene: Camera-controllable Animation in Any ScenePoster
- Anisotropic Tensor Deconvolution of Hyperspectral ImagesPoster
- Are VLMs Ready for Lane Topology Awareness in Autonomous Driving?Poster
- Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditionsOral
- Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion RecognitionPoster
- Attentive AV-FusionNet: Audio-Visual Quality Prediction with Hybrid AttentionOral
- AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?Oral
- Automated Dysphagia Screening Using Noninvasive Neck Acoustic SensingPoster
- Automatic Music Mixing using a Generative Model of Effect EmbeddingsOral
- Automatic Music Sample Identification with Multi-Track Contrastive LearningOral
- B-GRPO: UNSUPERVISED SPEECH EMOTION RECOGNITION BASED ON BATCHED-GROUP RELATIVE POLICY OPTIMIZATIONOral
- BACHI: BOUNDARY-AWARE SYMBOLIC CHORD RECOGNITION THROUGH MASKED ITERATIVE DECODING ON POP AND CLASSICAL MUSICPoster
- BADLLM-TG: A BACKDOOR DEFENDER POWERED BY LLM TRIGGER GENERATORPoster
- BADREASONER: PLANTING TUNABLE OVERTHINKING BACKDOORS INTO LARGE REASONING MODELS FOR FUN OR PROFITOral
- BAHOP: Similarity-based Basin Hopping for A fast hyper-parameter search in WSI classificationPoster
- BALANCING REWARDS IN TEXT SUMMARIZATION: MULTI-OBJECTIVE REINFORCEMENT LEARNING VIA HYPERVOLUME OPTIMIZATIONPoster
- BAYESIAN LOW-RANK FACTORIZATION FOR ROBUST MODEL ADAPTATIONPoster
- BAYESIAN MATRIX COMPLETION UNDER GEOMETRIC CONSTRAINTSPoster
- BAYESIAN SIGNAL SEPARATION VIA PLUG-AND-PLAY DIFFUSION-WITHIN-GIBBS SAMPLINGOral
- BBPE16: UTF-16-BASED BYTE-LEVEL BYTE-PAIR ENCODING FOR IMPROVED MULTILINGUAL SPEECH RECOGNITIONPoster
- BEAP-AGENT: BACKTRACKABLE EXECUTION AND ADAPTIVE PLANNING FOR GUI AGENTSPoster
- BEAT2AASIST MODEL WITH LAYER FUSION FOR ESDD 2026 CHALLENGEPoster
- BENCHMARKING GASLIGHTING ATTACKS AGAINST SPEECH LARGE LANGUAGE MODELSPoster
- BENCHMARKING HUMANS AND MACHINES ON COMPLEX MULTILINGUAL SPEECH UNDERSTANDING TASKSOral
- BENCHMARKING MULTIMODAL LARGE LANGUAGE MODELS FOR FACE RECOGNITIONPoster
- BEST-RQ-BASED SELF-SUPERVISED LEARNING FOR WHISPER DOMAIN ADAPTATIONPoster
- BEYOND AMPLITUDE: CHANNEL STATE INFORMATION PHASE-AWARE DEEP FUSION FOR ROBOTIC ACTIVITY RECOGNITIONOral
- BEYOND FACE SWAPPING: A DIFFUSION-BASED DIGITAL HUMAN BENCHMARK FOR MULTIMODAL DEEPFAKE DETECTIONPoster
- BEYOND LIPS: INTEGRATING GESTURE AND LIP CUES FOR ROBUST AUDIO-VISUAL SPEAKER EXTRACTIONPoster
- BEYOND MAPPING : DOMAIN-INVARIANT REPRESENTATIONS VIA SPECTRAL EMBEDDING OF OPTIMAL TRANSPORT PLANSPoster
- BEYOND OMNIDIRECTIONAL: NEURAL AMBISONICS ENCODING FOR ARBITRARY MICROPHONE DIRECTIVITY PATTERNS USING CROSS-ATTENTIONOral
- BEYOND SPECTRAL PEAKS: INTERPRETING THE CUES BEHIND SYNTHETIC IMAGE DETECTIONPoster
- BEYOND VIDEO-TO-SFX: VIDEO TO AUDIO SYNTHESIS WITH ENVIRONMENTALLY AWARE SPEECHPoster
- BEYOND VISUAL REALISM: TOWARD RELIABLE FINANCIAL TIME SERIES GENERATIONPoster
- BLOODROOT: WHEN WATERMARKING TURNS POISONOUS FOR STEALTHY BACKDOORPoster
- BONE-CONDUCTION GUIDED MULTIMODAL SPEECH ENHANCEMENT WITH CONDITIONAL DIFFUSION MODELSOral
- BRAIN-GRASP: GRAPH-BASED SALIENCY PRIORS FOR IMPROVED FMRI-BASED VISUAL BRAIN DECODINGPoster
- BRAIN-HGCN: A HYPERBOLIC GRAPH CONVOLUTIONAL NETWORK FOR BRAIN FUNCTIONAL NETWORK ANALYSISOral
- BRAIN-INFORMED SPEECH SEPARATION FOR COCHLEAR IMPLANTSOral
- BRAINPRINT-MODULATED TARGET SPEAKER EXTRACTIONPoster
- BREAK-THE-BEAT! CONTROLLABLE MIDI-TO-DRUM AUDIO SYNTHESISPoster
- BREAKING DATA EFFICIENCY DILEMMA: A FEDERATED AND AUGMENTED LEARNING FRAMEWORK FOR ALZHEIMER’S DISEASE DETECTION VIA SPEECHPoster
- BRIDGECODE: A DUAL SPEECH REPRESENTATION PARADIGM FOR AUTOREGRESSIVE ZERO-SHOT TEXT-TO-SPEECH SYNTHESISPoster
- BRIDGING THE GAP: A COMPARATIVE EXPLORATION OF SPEECH-LLM AND END-TO-END ARCHITECTURE FOR MULTILINGUAL CONVERSATIONAL ASRPoster
- BRIDGING THE GAP: TRANSFORMING NATURAL LANGUAGE QUESTIONS INTO SQL QUERIES VIA ABSTRACT QUERY PATTERN AND CONTEXTUAL SCHEMA MARKUPPoster
- BTCCHAT: ADVANCING REMOTE SENSING BI-TEMPORAL CHANGE CAPTIONING WITH MULTIMODAL LARGE LANGUAGE MODELPoster
- BUILD WITH PRECISION: BOTTOM-UP INFERENCE OF LINEAR DAGSPoster
- BadViM: Backdoor Attack against Vision MambaOral
- BaldWhisper: Faster Whisper with Head Shearing and Layer MergingPoster
- Bayesian Uncertainty-Aware MRI ReconstructionOral
- Behind the Scenes: Mechanistic Interpretability of LoRA-adapted Whisper for Speech Emotion RecognitionPoster
- Benchmarking Music Autotagging with MGPHot Expert Annotations vs. Generic Tag DatasetsOral
- Beyond Global Emotion: Fine-Grained Emotional Speech Synthesis with Dynamic Word-Level ModulationPoster
- Beyond Shadows: A Large-Scale Benchmark and Multi-Stage Framework for High-Fidelity Facial Shadow RemovalPoster
- Bi-Modal Textual Prompt Learning for Vision-Language Models in Remote SensingPoster
- BiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech RecognitionOral
- BioSEN: A Bio-acoustic Signal Enhancement Network for Animal VocalizationsPoster
- BladderFormer: A Streaming Transformer for Real-Time Urological State MonitoringPoster
- C-DGPA: Class-Centric Dual-Alignment Generative Prompt AdaptationPoster
- CAD-Judge: Toward Efficient Morphological Grading and Verification for Text-to-CAD GenerationOral
- CADM: Cluster-customized Adaptive Distance Metric for Categorical Data ClusteringPoster
- CAF-MAMBA: MAMBA-BASED CROSS-MODAL ADAPTIVE ATTENTION FUSION FOR MULTIMODAL DEPRESSION DETECTIONPoster
- CALM: JOINT CONTEXTUAL ACOUSTIC-LINGUISTIC MODELING FOR PERSONALIZATION OF MULTI-SPEAKER ASROral
- CAMEO: Collection of Multilingual Emotional Speech CorporaPoster
- CAN HIERARCHICAL CROSS-MODAL FUSION PREDICT HUMAN PERCEPTION OF AI DUBBED CONTENT?Poster
- CAN SYNTHETIC IMAGES SERVE AS EFFECTIVE AND EFFICIENT CLASS PROTOTYPES?Poster
- CAPACITY ANALYSIS OF OFDM SYSTEMS WITH A SWARM OF NETWORK-CONTROLLED REPEATERSOral
- CARE: COGNITIVE-REASONING AUGMENTED REINFORCEMENT FOR EMOTIONAL SUPPORT CONVERSATIONPoster
- CARE: Multi-Task Pretraining for Latent Continuous Action Representation in Robot ControlPoster
- CASTELLA: LONG AUDIO DATASET WITH CAPTIONS AND TEMPORAL BOUNDARIESPoster
- CAUCLIP: BRIDGING THE SIM-TO-REAL GAP IN SURGICAL VIDEO UNDERSTANDING VIA CAUSALITY-INSPIRED VISION-LANGUAGE MODELINGOral
- CAUSAL-SAM-LLM: LARGE LANGUAGE MODELS AS CAUSAL REASONERS FOR ROBUST MEDICAL SEGMENTATIONOral
- CC-G2PNP: STREAMING GRAPHEME-TO-PHONEME AND PROSODY WITH CONFORMER-CTC FOR UNSEGMENTED LANGUAGESPoster
- CE-GOCD: Central Entity-Guided Graph Optimization for Community Detection to Augment LLM Scientific Question AnsweringPoster
- CG-DMER: Hybrid Contrastive-Generative Framework for Disentangled Multimodal ECG Representation LearningOral
- CHAIN OF CORRECTION FOR FULL-TEXT SPEECH RECOGNITION WITH LARGE LANGUAGE MODELSPoster
- CHAIN-OF-CAPTION: TRAINING-FREE IMPROVEMENT OF MULTIMODAL LARGE LANGUAGE MODEL ON REFERRING EXPRESSION COMPREHENSIONPoster
- CHANNEL-WISE RETRIEVAL FOR MULTIVARIATE TIME SERIES FORECASTINGOral
- CHAOS: Chart Analysis with Outlier SamplesPoster
- CHROMOUVQA: BENCHMARKING VISION-LANGUAGE MODELS UNDER CHROMATIC CAMOUFLAGED IMAGESPoster
- CHUNK-WISE ATTENTION TRANSDUCERS FOR FAST AND ACCURATE STREAMING SPEECH-TO-TEXTPoster
- CHUNKWISE ALIGNERS FOR STREAMING SPEECH RECOGNITIONPoster
- CIDER: A Causal Cure for Brand-Obsessed Text-to-Image ModelsPoster
- CIMRAG: CIM-AWARE DOMAIN-ADAPTIVE AND NOISE-RESILIENT RETRIEVAL-AUGMENTED GENERATION FOR EDGE-BASED LLMSOral
- CLASS-AWARE PERMUTATION-INVARIANT SIGNAL-TO-DISTORTION RATIO FOR SEMANTIC SEGMENTATION OF SOUND SCENE WITH SAME-CLASS SOURCESPoster
- CLASS-INVARIANT TEST-TIME AUGMENTATION FOR DOMAIN GENERALIZATIONPoster
- CLIP-Guided Unsupervised Semantic-Aware Exposure CorrectionPoster
- CLIP-driven Zero-shot Learning with Ambiguous LabelsPoster
- CLUSTERING-DRIVEN MEMORY COMPRESSION FOR ON-DEVICE LARGE LANGUAGE MODELSPoster
- CO-INITIALIZATION OF CONTROL FILTER AND SECONDARY PATH VIA META-LEARNING FOR ACTIVE NOISE CONTROLPoster
- CODECSLIME: TEMPORAL REDUNDANCY COMPRESSION OF NEURAL SPEECH CODEC VIA DYNAMIC FRAME RATEPoster
- CODEPMP: SCALABLE PREFERENCE MODEL PRETRAINING FOR LARGE LANGUAGE MODEL REASONINGPoster
- CODESEP: LOW-BITRATE CODEC-DRIVEN SPEECH SEPARATION WITH BASE-TOKEN DISENTANGLEMENT AND AUXILIARY-TOKEN SERIAL PREDICTIONPoster
- COFE: A FRAMEWORK GENERATING COUNTERFACTUAL ECG FOR EXPLAINABLE CARDIAC AI-DIAGNOSTICSPoster
- COLLABORATIVE COMPRESSION FOR LARGE-SCALE MOE DEPLOYMENT ON EDGEPoster
- COMPLEX-VALUED PHASE SYNCHRONY REVEALS DIRECTIONAL COUPLING IN FMRI AND TRACKS MEDICATION EFFECTSOral
- COMPRESSED BC-LISTA VIA LOW-RANK CONVOLUTIONAL DECOMPOSITIONPoster
- COMPRESSING KV CACHE FOR LONG-CONTEXT LLM INFERENCE WITH INTER-LAYER ATTENTION SIMILARITYOral
- COMPRESSIVE RECOVERY OF SIGNALS DEFINED ON PERTURBED GRAPHSPoster
- CONCEPT ACTIVATION VECTORS: A UNIFYING VIEW AND ADVERSARIAL ATTACKSPoster
- CONDITION-INVARIANT FMRI DECODING OF SPEECH INTELLIGIBILITY WITH DEEP STATE SPACE MODELPoster
- CONDITIONAL RANDOM FIELDS FOR INTERACTIVE REFINEMENT OF HISTOPATHOLOGICAL PREDICTIONSPoster
- CONFCLIP: CONFIDENCE-WEIGHTED AND CLIPPED REWARD FOR REINFORCEMENT LEARNING IN LLMSOral
- CONFIDENCE-BASED FILTERING FOR SPEECH DATASET CURATION WITH GENERATIVE SPEECH ENHANCEMENT USING DISCRETE TOKENSPoster
- CONFORMAL INFERENCE FOR TIME SERIES OVER GRAPHSOral
- CONFORMAL SIGNAL TEMPORAL LOGIC FOR ROBUST REINFORCEMENT LEARNING CONTROL: A CASE STUDYPoster
- CONQUER: CONTEXT-AWARE REPRESENTATION WITH QUERY ENHANCEMENT FOR TEXT-BASED PERSON SEARCHPoster
- CONSTRAINT OPTIMIZED MULTICHANNEL MIXER-LIMITER DESIGNPoster
- CONSTRUCTING COMPOSITE FEATURES FOR INTERPRETABLE MUSIC-TAGGINGPoster
- CONTENT ANONYMIZATION FOR PRIVACY IN LONG-FORM AUDIOOral
- CONTENT LEAKAGE IN LIBRISPEECH AND ITS IMPACT ON THE PRIVACY EVALUATION OF SPEAKER ANONYMIZATIONPoster
- CONTEXTUAL BIASING FOR ASR IN SPEECH LLM WITH COMMON WORD CUES AND BIAS WORD POSITION PREDICTIONPoster
- CONTRASTIVE DISTILLATION OF EMOTION KNOWLEDGE FROM LLMS FOR ZERO-SHOT EMOTION RECOGNITIONOral
- CONTRASTIVE TIMBRE REPRESENTATIONS FOR MUSICAL INSTRUMENT AND SYNTHESIZER RETRIEVALPoster
- CONTROLLABLE LOCALIZED FACE ANONYMIZATION VIA DIFFUSION INPAINTINGOral
- CONTROLLING LANGUAGE DIFFICULTY IN DIALOGUES WITH LINGUISTIC FEATURESPoster
- COVA: TEXT-GUIDED COMPOSED VIDEO RETRIEVAL FOR AUDIO-VISUAL CONTENTPoster
- CP LOSS: CHANNEL-WISE PERCEPTUAL LOSS FOR TIME SERIES FORECASTINGPoster
- CPJ: Explainable Agricultural Pest Diagnosis via Caption–Prompt–Judge with LLM-Judged RefinementPoster
- CREDID: CREDIBLE MULTI-BIT WATERMARK FOR LARGE LANGUAGE MODELS IDENTIFICATIONPoster
- CROSS PSEUDO LABELING FOR WEAKLY SUPERVISED VIDEO ANOMALY DETECTIONPoster
- CROSS-CULTURAL BIAS IN MEL-SCALE REPRESENTATIONS: EVIDENCE AND ALTERNATIVES FROM SPEECH AND MUSICPoster
- CROSS-EXAMINER: EVALUATING CONSISTENCY OF LARGE LANGUAGE MODEL-GENERATED EXPLANATIONSPoster
- CROSS-LINGUAL INTERLEAVING FOR SPEECH LANGUAGE MODELSPoster
- CROSS-MODAL GUIDANCE FOR FAST DIFFUSION-BASED COMPUTED TOMOGRAPHYPoster
- CROSS-MODAL KNOWLEDGE DISTILLATION FOR SPEECH LARGE LANGUAGE MODELSOral
- CROSS-REPRESENTATION BENCHMARKING IN TIME-SERIES ELECTRONIC HEALTH RECORDS FOR CLINICAL OUTCOME PREDICTIONPoster
- CS3-BENCH: EVALUATING AND ENHANCING SPEECH-TO-SPEECH LLMS FOR MANDARIN-ENGLISH CODE-SWITCHINGPoster
- CTC-DID: CTC-BASED ARABIC DIALECT IDENTIFICATION FOR STREAMING APPLICATIONSPoster
- CTR-LORA: CURVATURE-AWARE AND TRUST-REGION GUIDED LOW-RANK ADAPTATION FOR LARGE LANGUAGE MODELSOral
- CaSNet: Compress-and-Send Network Based Multi-Device Speech Enhancement Model for Distributed Microphone ArraysPoster
- Can LLMs Beat Humans in Debating? A Dynamic Multi-agent Framework for Competitive DebatePoster
- Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMsPoster
- Causal Fingerprints of AI Generative ModelsPoster
- Channel Prediction under Network Distribution Shift Using Continual Learning-based Loss RegularizationOral
- Channel, Trend and Periodic-Wise Representation Learning for Multivariate Long-term Time Series ForecastingPoster
- Classifier-Centric Adaptive Framework for Open-Vocabulary Camouflaged Object SegmentationPoster
- ClearGCD: Mitigating Shortcut Learning For Robust Generalized Category DiscoveryPoster
- CoVariance Filters and Neural Networks over Hilbert SpacesPoster
- Cognitive Load Estimation Using Brain Foundation Models and Interpretability for BCIsPoster
- CompSpoof: A Dataset and Joint Learning Framework for Component-Level Audio Anti-spoofing CountermeasuresPoster
- Complementary Subspace Low-Rank Adaptation of Vision-Language Models for Few-Shot ClassificationOral
- Compositional Image Synthesis with Inference-Time ScalingPoster
- Compound-QA: A Benchmark for Evaluating LLMs on Compound QuestionsPoster
- Conditional Prior-based Non-stationary Channel Estimation Using Accelerated Diffusion ModelsPoster
- Confidence-Guided Error Correction for Disordered Speech RecognitionPoster
- Conflict-Aware Client Selection for Multi-Server Federated LearningPoster
- Conformalized Gaussian processes for online uncertainty quantification over graphsOral
- Conjugate Relation Modeling for Few-Shot Knowledge Graph CompletionPoster
- Continuous-Token Diffusion for Speaker-Referenced TTS in Multimodal LLMsPoster
- Controllable Embedding Transformation for Mood-Guided Music RetrievalPoster
- CosyAccent: Duration-Controllable Accent Normalization Using Source-Synthesis Training DataPoster
- Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech SynthesisPoster
- Cross-Modal Bottleneck Fusion for Noise Robust Audio-Visual Speech RecognitionPoster
- Cross-domain EEG-based Emotion Recognition with Contrastive LearningPoster
- D3PIA: A Discrete Denoising Diffusion Model for Piano Accompaniment Generation from Lead sheetPoster
- DAIEN-TTS: DISENTANGLED AUDIO INFILLING FOR ENVIRONMENT-AWARE TEXT-TO-SPEECH SYNTHESISPoster
- DAM: Dual Active Learning with Multimodal Foundation Model for Source-Free Domain AdaptationPoster
- DAME: DURATION-AWARE MATRYOSHKA EMBEDDING FOR DURATION-ROBUST SPEAKER VERIFICATIONPoster
- DAMO: A DATA-EFFICIENT MULTIMODAL ORCHESTRATOR FOR TEMPORAL REASONING WITH VIDEO LLMSOral
- DAPT: A DUAL-PATH FRAMEWORK FOR MULTILINGUAL MULTI-HOP QUESTION ANSWERINGPoster
- DARC-CLIP: DYNAMIC ADAPTIVE REFINEMENT WITH CROSS-ATTENTION FOR MEME UNDERSTANDINGPoster
- DARKVRAI: CAPTURE-CONDITION CONDITIONING AND BURST-ORDER SELECTIVE SCAN FOR LOW-LIGHT RAW VIDEO DENOISINGPoster
- DAT-CFTNET: SPEECH ENHANCEMENT FOR COCHLEAR IMPLANT RECIPIENTS USING ATTENTION-BASED DUAL-PATH RECURRENT NEURAL NETWORKPoster
- DATA-DRIVEN CLUSTERING AND MERGING OF ADAPTERS FOR ON-DEVICE LARGE LANGUAGE MODELSPoster
- DATA-DRIVEN GRAPH FILTERS VIA ADAPTIVE SPECTRAL SHAPINGPoster
- DC-MAMBER: A DUAL CHANNEL PREDICTION MODEL BASED ON MAMBA AND LINEAR TRANSFORMER FOR MULTIVARIATE TIME SERIES FORECASTINGPoster
- DCINJECT: PERSISTENT BACKDOOR ATTACKS VIA FREQUENCY MANIPULATION IN PERSONAL FEDERATED LEARNINGOral
- DDSA: Dual-Domain Strategic Attack for Spatial-Temporal Efficiency in Adversarial Robustness TestingPoster
- DDSC: DYNAMIC DUAL-SIGNAL CURRICULUM FOR DATA-EFFICIENT ACOUSTIC SCENE CLASSIFICATION UNDER DOMAIN SHIFTPoster
- DECAF: Dynamic Envelope Context-Aware Fusion for Speech-Envelope Reconstruction from EEGPoster
- DECENTRALIZED LEARNING WITH DYNAMICALLY REFINED EDGE WEIGHTS: A DATA-DEPENDENT FRAMEWORKPoster
- DECODE: DUAL-ENHANCED CONDITIONED DIFFUSION FOR EEG FORECASTINGPoster
- DECODER-ONLY CONFORMER WITH MODALITY-AWARE SPARSE MIXTURES OF EXPERTS FOR ASRPoster
- DEEP DUBBING: END-TO-END AUTO-AUDIOBOOK SYSTEM WITH TEXT-TO-TIMBRE AND CONTEXT-AWARE INSTRUCT-TTSPoster
- DEEP IMAGE PRIOR WITH L0 GRADIENT REGULARIZER FOR IMAGE SMOOTHINGOral
- DEEP TPC: TEMPORAL-PRIOR CONDITIONING FOR TIME SERIES FORECASTINGOral
- DEEPAQ: A PERCEPTUAL AUDIO QUALITY METRIC BASED ON FOUNDATIONAL MODELS AND WEAKLY SUPERVISED LEARNINGOral
- DELNET: CONTINUOUS ALL-IN-ONE WEATHER REMOVAL VIA DYNAMIC EXPERT LIBRARYPoster
- DELTA: LANGUAGE DIFFUSION-BASED EEG-TO-TEXT ARCHITECTUREPoster
- DEMO-POSE: DEPTH-MONOCULAR MODALITY FUSION FOR OBJECT POSE ESTIMATIONOral
- DERIVING MOMENTS IN THE AGE OF GOSSIP PROCESS FROM PERCOLATIONPoster
- DETAILCLIP: INJECTING IMAGE DETAILS INTO CLIP’S FEATURE SPACEPoster
- DIACDM: COGNITIVE DIAGNOSIS IN TEACHER-STUDENT DIALOGUES USING THE INITIATION-RESPONSE-EVALUATION FRAMEWORKPoster
- DIFFERENTIALLY PRIVATE CLUSTERED FEDERATED LEARNING WITH PRIVACY-PRESERVING INITIALIZATION AND NORMALITY-DRIVEN AGGREGATIONOral
- DIFFFACE-EDIT: A DIFFUSION-BASED FACIAL DATASET FOR FORGERY-SEMANTIC DRIVEN DEEPFAKE DETECTION ANALYSISPoster
- DIFFNATOR: GENERATING STRUCTURED EXPLANATIONS OF TIME-SERIES DIFFERENCESOral
- DIFFUSION TIMBRE TRANSFER VIA MUTUAL INFORMATION GUIDED INPAINTINGPoster
- DIFFUSION-BASED UNSUPERVISED AUDIO-VISUAL SPEECH SEPARATION IN NOISY ENVIRONMENTS WITH NOISE PRIORPoster
- DIFFUSION-LINK: DIFFUSION PROBABILISTIC MODEL FOR BRIDGING THE AUDIO-TEXT MODALITY GAPPoster
- DIFFUSIONCOM: STRUCTURE-AWARE MULTIMODAL DIFFUSION MODEL FOR MULTIMODAL KNOWLEDGE GRAPH COMPLETIONPoster
- DIRCR: Dual-Inference Rule-Contrastive Reasoning for Solving RAVENsPoster
- DISCONTSE: SINGLE-STEP DIFFUSION SPEECH ENHANCEMENT BASED ON JOINT DISCRETE AND CONTINUOUS EMBEDDINGSPoster
- DISCRETE DIFFUSION FOR GENERATIVE MODELING OF TEXT-ALIGNED SPEECH TOKENSPoster
- DISCRIMINANT LEARNING-BASED COLORSPACE FOR BLADE SEGMENTATIONOral
- DISPATCH: DISTILLING SELECTIVE PATCHES FOR SPEECH ENHANCEMENTPoster
- DISSECTING PERFORMANCE DEGRADATION IN AUDIO SOURCE SEPARATION UNDER SAMPLING FREQUENCY MISMATCHPoster
- DISSR: DISENTANGLING SPEECH REPRESENTATION FOR DEGRADATION-PRIOR GUIDED CROSS-DOMAIN SPEECH RESTORATIONPoster
- DISTILLATION-BASED LAYER DROPPING (DLD): EFFECTIVE END-TO-END FRAMEWORK FOR DYNAMIC SPEECH NETWORKSPoster
- DISTILLING TIME SERIES FOUNDATION MODELS FOR EFFICIENT FORECASTINGPoster
- DISTILMOS: LAYER-WISE SELF-DISTILLATION FOR SELF-SUPERVISED LEARNING MODEL-BASED MOS PREDICTIONOral
- DISTRIBUTED ASSOCIATIVE MEMORY VIA ONLINE CONVEX OPTIMIZATIONPoster
- DISTRIBUTED MULTICHANNEL ACTIVE NOISE CONTROL WITH ASYNCHRONOUS COMMUNICATIONPoster
- DISTRIBUTION-AWARE MOBILITY-ASSISTED DECENTRALIZED FEDERATED LEARNINGPoster
- DITSE: HIGH-FIDELITY GENERATIVE SPEECH ENHANCEMENT VIA LATENT DIFFUSION TRANSFORMERSPoster
- DITSINGER: SCALING SINGING VOICE SYNTHESIS WITH DIFFUSION TRANSFORMER AND IMPLICIT ALIGNMENTPoster
- DMP-TTS: DISENTANGLED MULTI-MODAL PROMPTING FOR CONTROLLABLE TEXT-TO-SPEECH WITH CHAINED GUIDANCEOral
- DNF: Dual-Layer Nested Fingerprinting for Large Language Model Intellectual Property ProtectionPoster
- DNN-BASED ONLINE SOURCE COUNTING BASED ON SPATIAL GENERALIZED MAGNITUDE SQUARED COHERENCEOral
- DNS: DATA-DRIVEN NONLINEAR SMOOTHER FOR COMPLEX MODEL-FREE PROCESSPoster
- DO FOUNDATIONAL AUDIO ENCODERS UNDERSTAND MUSIC STRUCTURE?Poster
- DO WE REALLY NEED SELF-ATTENTION FOR STREAMING AUTOMATIC SPEECH RECOGNITION?Oral
- DOMAIN-ADAPTIVE MODEL MERGING ACROSS DISCONNECTED MODESPoster
- DOMAIN-INVARIANT MIXED-DOMAIN SEMI-SUPERVISED MEDICAL IMAGE SEGMENTATION WITH CLUSTERED MAXIMUM MEAN DISCREPANCY ALIGNMENTPoster
- DOMINO: DOMINANT PATH-BASED COMPENSATION FOR HARDWARE IMPAIRMENTS IN MODERN WIFI SENSINGPoster
- DOPPLER RADIANCE FIELD-GUIDED ANTENNA SELECTION FOR IMPROVED GENERALIZATION IN MULTI-ANTENNA WI-FI-BASED HUMAN ACTIVITY RECOGNITIONPoster
- DP-DEGAUSS: DYNAMIC PROBABILISTIC GAUSSIAN DECOMPOSITION FOR EGOCENTRIC 4D SCENE RECONSTRUCTIONPoster
- DP-LAC: LIGHTWEIGHT ADAPTIVE CLIPPING FOR DIFFERENTIALLY PRIVATE FEDERATED FINE-TUNING OF LANGUAGE MODELSPoster
- DPANet: Dual Pyramid Attention Network for Multivariate Time Series ForecastingPoster
- DPI: EXPLOITING PARAMETER HETEROGENEITY FOR INTERFERENCE-FREE FINE-TUNINGPoster
- DPMM-CFL: CLUSTERED FEDERATED LEARNING VIA DIRICHLET PROCESS MIXTURE MODEL NONPARAMETRIC CLUSTERINGOral
- DRAG WITHIN PRIOR DISTRIBUTION: TEXT-CONDITIONED POINT-BASED IMAGE EDITING WITHIN DISTRIBUTION CONSTRAINTSOral
- DREAMVAR: TAMING REINFORCED VISUAL AUTOREGRESSIVE MODEL FOR HIGH-FIDELITY SUBJECT-DRIVEN IMAGE GENERATIONPoster
- DRIVINGSCENE: A MULTI-TASK ONLINE FEED-FORWARD 3D GAUSSIAN SPLATTING METHOD FOR DYNAMIC DRIVING SCENESPoster
- DSGBENCH: A DIVERSE STRATEGIC GAME BENCHMARK FOR EVALUATING LLM-BASED AGENTS IN COMPLEX DECISION-MAKING ENVIRONMENTSPoster
- DSPAST: DISENTANGLED REPRESENTATIONS FOR SPATIAL AUDIO REASONING WITH LARGE LANGUAGE MODELSPoster
- DSPC: Dual-Stage Progressive Compression Framework for Efficient Long-Context ReasoningPoster
- DSTCS: DUAL-STUDENT TEACHER FRAMEWORK WITH SEGMENT ANYTHING MODEL FOR SEMI-SUPERVISED PUBIC SYMPHYSIS-FETAL HEAD SEGMENTATIONPoster
- DSVM-UNet : Enhancing VM-UNet with Dual Self-distillation for Medical Image SegmentationPoster
- DTT-BSR: GAN-BASED DTTNET WITH ROPE TRANSFORMER ENHANCEMENT FOR MUSIC SOURCE RESTORATIONPoster
- DUAL-SPACE KNOWLEDGE DISTILLATION WITH KEY-QUERY MATCHING FOR LARGE LANGUAGE MODELS WITH VOCABULARY MISMATCHPoster
- DYNAMIC ESTIMATION LOSS CONTROL IN VARIATIONAL QUANTUM SENSING VIA ONLINE CONFORMAL INFERENCEPoster
- DYNAMIC MULTI-EXPERT PROJECTORS WITH STABILIZED ROUTING FOR MULTILINGUAL SPEECH RECOGNITIONPoster
- DYNAMICAL ISOMETRY BASED RIGOROUS FAIR NEURAL ARCHITECTURE SEARCHPoster
- Data-Driven Two-Stage IRS-Aided Sumrate Maximization with Inexact PrecodingOral
- Dataset-Driven Channel Masks in Transformers for Multivariate Time SeriesPoster
- Decentralized Detection with Many Sensors: Optimality of Exchangeable and Identical Encoding PoliciesOral
- Decentralized Learning Strategies for Estimation Error Minimization with Graph Neural NetworksPoster
- Deep Reinforcement Learning for Dynamic Sensing and CommunicationsOral
- Deformable Attention Graph Representation Learning for Histopathology Whole Slide Image AnalysisOral
- Demystifying the Roles of LLM Layers in Retrieval, Knowledge, and ReasoningPoster
- Depth-Guided Metric-Aware Temporal Consistency for Monocular Video Human Mesh RecoveryPoster
- Diff-VS: Efficient Audio-Aware Diffusion U-Net for Vocals SeparationPoster
- DiffQ: UNIFIED PARAMETER INITIALIZATION FOR VARIATIONAL QUANTUM ALGORITHMS VIA DIFFUSION MODELSOral
- Differential Privacy of Network Parameters from a System Identification PerspectivePoster
- Diffusion Algorithm for Metalens Optical Aberration CorrectionOral
- Diffusion Denoiser Achievable Analysis for Finite Blocklength Unsourced Random AccessPoster
- Diffusion-aided Extreme Video Compression with Lightweight Semantics GuidanceOral
- Direct Preference Optimization for Speech Autoregressive Diffusion ModelsPoster
- Direct Simultaneous Translation Activation for Large Audio-Language ModelsPoster
- Discrete-Periodic Ambiguity Function of Random Communication SignalsOral
- Do Bias Benchmarks Generalise? Evidence from Voice-based Evaluation of Gender Bias in SpeechLLMsPoster
- Do We Need EMA for Diffusion-Based Speech Enhancement? Toward a Magnitude-Preserving Network ArchitecturePoster
- Do You Hear What I Mean? Quantifying the Instruction-Perception Gap in Instruction-Guided Expressive Text-To-Speech SystemsOral
- Domain-Invariant Representation Learning of Bird SoundsPoster
- Dual Data Scaling for Robust Two-Stage User-Defined Keyword SpottingPoster
- Dual-Strategy-Enhanced ConBiMamba for Neural Speaker DiarizationPoster
- DyWPE: Signal-Aware Dynamic Wavelet Positional Encoding for Time Series TransformersOral
- Dynamic Summary Generation for Interpretable Multimodal Depression DetectionPoster
- Dynamically Slimmable Speech Enhancement Network with Metric-Guided TrainingOral
- E-SocialNav: Efficient Socially Compliant Navigation with Language ModelsPoster
- E2E-AEC: IMPLEMENTING AN END-TO-END NEURAL NETWORK LEARNING APPROACH FOR ACOUSTIC ECHO CANCELLATIONOral
- EASY TURN: INTEGRATING ACOUSTIC AND LINGUISTIC MODALITIES FOR ROBUST TURN-TAKING IN FULL-DUPLEX SPOKEN DIALOGUE SYSTEMSPoster
- ECG-AGENT: ON-DEVICE TOOL-CALLING AGENT FOR ECG MULTI-TURN DIALOGUEPoster
- ECHO: Frequency-aware Hierarchical Encoding for Variable-length SignalsPoster
- ECHOFAKE: A REPLAY-AWARE DATASET FOR PRACTICAL SPEECH DEEPFAKE DETECTIONPoster
- EDGE COLLABORATIVE GAUSSIAN SPLATTING WITH INTEGRATED RENDERING AND COMMUNICATIONOral
- EDGESPOT: EFFICIENT AND HIGH-PERFORMANCE FEW-SHOT MODEL FOR KEYWORD SPOTTINGPoster
- EDITS: ENHANCING DATASET DISTILLATION WITH IMPLICIT TEXTUAL SEMANTICSPoster
- EEG-SEEGRAPH: INTERPRETING FUNCTIONAL CONNECTIVITY DISRUPTIONS IN DEMENTIAS VIA SPARSE-EXPLANATORY DYNAMIC EEG-GRAPH LEARNINGPoster
- EEND-SAA: Enrollment-Less Main Speaker Voice Activity Detection using Self-Attention AttractorsOral
- EFFICIENT FEW-SHOT LEARNING FOR EDGE AI VIA KNOWLEDGE DISTILLATION ON MOBILEVITPoster
- EFFICIENT SOLUTIONS FOR MITIGATING INITIALIZATION BIAS IN UNSUPERVISED SELF-ADAPTIVE AUDITORY ATTENTION DECODINGPoster
- EGGCodec: A Robust Neural Encodec Framework for EGG Reconstruction and F0 ExtractionPoster
- EMG-to-Speech with Fewer ChannelsPoster
- EMO-TTA: IMPROVING TEST-TIME ADAPTATION OF AUDIO-LANGUAGE MODELS FOR SPEECH EMOTION RECOGNITIONOral
- EMOE: EIGENBASIS-GUIDED ROUTING FOR MIXTURE-OF-EXPERTSOral
- EMORL-TTS: REINFORCEMENT LEARNING FOR FINE-GRAINED EMOTION CONTROL IN LLM-BASED TTSPoster
- EMOTION AND ACOUSTICS SHOULD AGREE: CROSS-LEVEL INCONSISTENCY ANALYSIS FOR AUDIO DEEPFAKE DETECTIONPoster
- EMOTION-ALIGNED GENERATION IN DIFFUSION TEXT TO SPEECH MODELS VIA PREFERENCE-GUIDED OPTIMIZATIONOral
- EMOTIONAL DIMENSION CONTROL IN LANGUAGE MODEL-BASED TEXT-TO-SPEECH: SPANNING A BROAD SPECTRUM OF HUMAN EMOTIONSPoster
- EMPEROR: EFFICIENT MOMENT-PRESERVING REPRESENTATION OF DISTRIBUTIONSPoster
- EMPOWERING MULTIMODAL RESPIRATORY SOUND CLASSIFICATION WITH COUNTERFACTUAL ADVERSARIAL DEBIASING FOR OUT-OF-DISTRIBUTION ROBUSTNESSPoster
- ENCODING EMOTION THROUGH SELF-SUPERVISED EYE MOVEMENT RECONSTRUCTIONPoster
- ENDOCAVER: HANDLING FOG, BLUR AND GLARE IN ENDOSCOPIC IMAGES VIA JOINT DEBLURRING-SEGMENTATIONPoster
- ENHANCED GENERATIVE MACHINE LISTENERPoster
- ENHANCED GRAPH TRANSFORMER WITH SERIALIZED GRAPH TOKENSOral
- ENHANCING CROSS-VIEW GEO-LOCALIZATION GENERALIZATION VIA GLOBAL-LOCAL CONSISTENCY AND GEOMETRIC EQUIVARIANCEPoster
- ENHANCING DOCUMENT-LEVEL MACHINE TRANSLATION VIA FILTERED SYNTHETIC CORPORA AND TWO-STAGE LLM ADAPTATIONPoster
- ENHANCING NOISE ROBUSTNESS FOR NEURAL SPEECH CODECS THROUGH RESOURCE-EFFICIENT PROGRESSIVE QUANTIZATION PERTURBATION SIMULATIONPoster
- ENHANCING POST-TRAINING QUANTIZATION VIA FUTURE ACTIVATION AWARENESSPoster
- ENHANCING SPEAKER VERIFICATION WITH W2V-BERT 2.0 AND KNOWLEDGE DISTILLATION GUIDED STRUCTURED PRUNINGOral
- ENHANCING VALUE ALIGNMENT OF LLMS WITH MULTI-AGENT SYSTEM AND COMBINATORIAL FUSIONOral
- ENTROCUT: ENTROPY-GUIDED ADAPTIVE TRUNCATION FOR EFFICIENT CHAIN-OF-THOUGHT REASONING IN SMALL-SCALE LARGE REASONING MODELSPoster
- ENTROLLM: ENTROPY ENCODED WEIGHT COMPRESSION FOR EFFICIENT LARGE LANGUAGE MODEL INFERENCE ON EDGE DEVICESPoster
- ENTROPY-GUIDED DATA-EFFICIENT TRAINING FOR MULTIMODAL REASONING REWARD MODELSPoster
- ENTROPYGS: AN EFFICIENT ENTROPY CODING ON 3D GAUSSIAN SPLATTINGOral
- ENVSSLAM-FFN: LIGHTWEIGHT LAYER-FUSED SYSTEM FOR ESDD 2026 CHALLENGEPoster
- ERASING YOUR VOICE BEFORE IT’S HEARD: TRAINING-FREE SPEAKER UNLEARNING FOR ZERO-SHOT TEXT-TO-SPEECHPoster
- ESTABLISHING STOCHASTIC OBJECT MODELS FROM NOISY DATA VIA AMBIENT MEASUREMENT-INTEGRATED DIFFUSIONOral
- ESTIMATING RESPIRATORY EFFORT FROM NOCTURNAL BREATHING SOUNDS FOR OBSTRUCTIVE SLEEP APNOEA SCREENINGPoster
- ETUDE: PIANO COVER GENERATION WITH A THREE-STAGE APPROACH — EXTRACT, STRUCTURALIZE, AND DECODEPoster
- EVA-Score: Evaluating Abstractive Long-form Summarization on Informativeness through Extraction and ValidationPoster
- EVALUATING BIAS IN SPOKEN DIALOGUE LLMS FOR REAL-WORLD DECISIONS AND RECOMMENDATIONSPoster
- EVALUATING COMPOSITIONAL STRUCTURE IN AUDIO REPRESENTATIONSOral
- EVALUATING DISENTANGLED REPRESENTATIONS FOR CONTROLLABLE MUSIC GENERATIONPoster
- EVALUATING EMOTION RECOGNITION IN SPOKEN LANGUAGE MODELS ON EMOTIONALLY INCONGRUENT SPEECHPoster
- EVALUATING HIGH-RESOLUTION PIANO SUSTAIN PEDAL DEPTH ESTIMATION WITH MUSICALLY INFORMED METRICSPoster
- EVALUATING TEST-TIME ADAPTATION FOR FACIAL EXPRESSION RECOGNITION UNDER NATURAL CROSS-DATASET DISTRIBUTION SHIFTSPoster
- EVENT-AIDED SEMANTIC SCENE COMPLETIONPoster
- EXPLAINABLE DEEPFAKE DETECTION WITH RL ENHANCED SELF-BLENDED IMAGESPoster
- EXPLICIT TIME-FREQUENCY DYNAMICS FOR SKELETON-BASED GAIT RECOGNITIONPoster
- EXPLORING FINE-TUNING OF LARGE AUDIO LANGUAGE MODELS FOR SPOKEN LANGUAGE UNDERSTANDING UNDER LIMITED SPEECH DATAOral
- EXPLORING RESOLUTION-WISE SHARED ATTENTION IN HYBRID MAMBA-U-NETS FOR IMPROVED CROSS-CORPUS SPEECH ENHANCEMENTOral
- Efficient Gaussian Process Learning via Subspace ProjectionsPoster
- Efficient Plug-and-Play Method for Dynamic Imaging via Kalman SmoothingPoster
- Efficient Quantization-Aware Neural Receivers: Beyond Post-Training QuantizationPoster
- Efficient Segment Anything with Depth-Aware Fusion and Limited Training DataOral
- Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training ModelsOral
- EmoShift: Lightweight Activation Steering for Enhanced Emotion-Aware Speech SynthesisPoster
- Enabling Multi-Species Bird Classification on Low-Power Bioacoustic LoggersPoster
- Enhancing Action and Ingredient Modeling for Semantically Grounded Recipe GenerationPoster
- Enhancing Guidance for Missing Data in Diffusion-Based Sequential RecommendationPoster
- Enhancing Layer Attention Efficiency through Pruning Redundant RetrievalsPoster
- Ensuring Reliable Participation in Subjective Video Quality Tests Across PlatformsPoster
- Entropy-Guided GRVQ for Ultra-Low Bitrate Neural Speech CodecPoster
- Environment-Aware MIMO Channel Estimation in Pilot-Constrained Upper Mid-Band SystemsOral
- Environmental Sound Deepfake Detection Challenge: An OverviewPoster
- Equivariant Deep Equilibrium Models for Imaging Inverse ProblemsOral
- Erosion Attack for Adversarial Training to Enhance Semantic Segmentation RobustnessPoster
- EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio CodingPoster
- Evaluating pretrained speech embedding systems for dysarthria detection across heterogenous datasetsPoster
- Event classification by physics-informed inpainting for distributed multichannel acoustic sensor with partially degraded channelsPoster
- Exploring Audio Hallucination in Egocentric Video UnderstandingOral
- Exploring How Audio Effects Alter Emotion with Foundation ModelsPoster
- Exterior sound field estimation based on physics-constrained kernelPoster
- FAC-FACODEC: CONTROLLABLE ZERO-SHOT FOREIGN ACCENT CONVERSION WITH FACTORIZED SPEECH CODECPoster
- FACESLEUTH-R: ADAPTIVE ORIENTATION-AWARE ATTENTION FOR ROBUST MICRO-EXPRESSION RECOGNITIONOral
- FADEMEM: BIOLOGICALLY-INSPIRED FORGETTING FOR EFFICIENT AGENT MEMORYPoster
- FAKE SPEECH WILD: DETECTING DEEPFAKE SPEECH ON SOCIAL MEDIA PLATFORMPoster
- FAST SINGLE-SNAPSHOT HARMONIC RECOVERY WITH 2D SPARSE ARRAYS USING BCCB MATRICESPoster
- FAST-ULCNET: A FAST AND ULTRA LOW COMPLEXITY NETWORK FOR SINGLE-CHANNEL SPEECH ENHANCEMENTPoster
- FASTAV: EFFICIENT TOKEN PRUNING FOR AUDIO-VISUAL LARGE LANGUAGE MODEL INFERENCEPoster
- FASTEAGLE: CASCADED DRAFTING FOR ACCELERATING SPECULATIVE DECODINGPoster
- FC-VFI: FAITHFUL AND CONSISTENT VIDEO FRAME INTERPOLATION FOR HIGH-FPS SLOW MOTION VIDEO GENERATIONOral
- FEATURE IDENTIFICATION FOR HIERARCHICAL CONTRASTIVE LEARNINGOral
- FEATURE PROJECTION LEARNING FOR BETTER VISION-LANGUAGE REASONINGPoster
- FED-GAME: PERSONALIZED FEDERATED LEARNING WITH GRAPH ATTENTION MIXTURE-OF-EXPERTS FOR TIME-SERIES FORECASTINGOral
- FEDCOMPASS: FEDERATED CLUSTERED AND PERIODIC AGGREGATION FRAMEWORK FOR HYBRID CLASSICAL-QUANTUM MODELSPoster
- FEDERATED HETEROGENEOUS LANGUAGE MODEL OPTIMIZATION FOR HYBRID AUTOMATIC SPEECH RECOGNITIONPoster
- FEDERATED JOINT LEARNING FOR DOMAIN AND CLASS GENERALIZATIONPoster
- FEW-SHOT AND PSEUDO-LABEL GUIDED SPEECH QUALITY EVALUATION WITH LARGE LANGUAGE MODELSOral
- FGGM: FISHER-GUIDED GRADIENT MASKING FOR CONTINUAL LEARNINGPoster
- FILTER THEN ATTEND: IMPROVING ATTENTION-BASED TIME SERIES FORECASTING WITH SPECTRAL FILTERINGOral
- FINE-GRAINED FRAME MODELING IN MULTI-HEAD SELF-ATTENTION FOR SPEECH DEEPFAKE DETECTIONPoster
- FINE-TUNING LARGE AUDIO-LANGUAGE MODELS WITH LORA FOR PRECISE TEMPORAL LOCALIZATION OF PROLONGED EXPOSURE THERAPY ELEMENTSPoster
- FINE-TUNING LARGE MULTIMODAL MODELS FOR AUTOMATIC PRONUNCIATION ASSESSMENTPoster
- FINMCP-BENCH: BENCHMARKING LLM AGENTS FOR REAL-WORLD FINANCIAL TOOL USE UNDER THE MODEL CONTEXT PROTOCOLPoster
- FINSENTLLM: MULTI-LLM AND STRUCTURED SEMANTIC SIGNALS FOR ENHANCED FINANCIAL SENTIMENT FORECASTINGPoster
- FLAME: EMPOWERING FROZEN LLMS FOR KNOWLEDGE GRAPH COMPLETIONPoster
- FLEXI-LORA WITH INPUT-ADAPTIVE RANKS: EFFICIENT FINETUNING FOR SPEECH AND REASONING TASKSPoster
- FLEXIO: FLEXIBLE SINGLE- AND MULTI-CHANNEL SPEECH SEPARATION AND ENHANCEMENTOral
- FLOW INTELLIGENCE: ROBUST FEATURE MATCHING VIA TEMPORAL SIGNATURE CORRELATIONPoster
- FLOW MATCHING-BASED ACTIVE LEARNING FOR RADIO MAP CONSTRUCTION WITH LOW-ALTITUDE UAVSPoster
- FLOWIID: SINGLE-STEP INTRINSIC IMAGE DECOMPOSITION VIA LATENT FLOW MATCHINGOral
- FLOWSE-GRPO: TRAINING FLOW MATCHING SPEECH ENHANCEMENT VIA ONLINE REINFORCEMENT LEARNINGOral
- FOCA: Frequency-Oriented Cross-Domain Forgery Detection, Localization and Explanation via Multi-Modal Large Language ModelPoster
- FOCA: MULTIMODAL MALWARE CLASSIFICATION VIA HYPERBOLIC CROSS-ATTENTIONPoster
- FOCALCODEC-STREAM: STREAMING LOW-BITRATE SPEECH CODING VIA CAUSAL DISTILLATIONPoster
- FOLEYBENCH: A BENCHMARK FOR VIDEO-TO-AUDIO MODELSOral
- FOLLOWING THE TRACE: A STRUCTURED PATH TO EMPATHETIC RESPONSE GENERATION WITH MULTI-AGENT MODELSPoster
- FORGETMARK: STEALTHY FINGERPRINT EMBEDDING VIA TARGETED UNLEARNING IN LANGUAGE MODELSPoster
- FORWARD CONVOLUTIVE PREDICTION FOR FRAME ONLINE MONAURAL SPEECH DEREVERBERATION BASED ON KRONECKER PRODUCT DECOMPOSITIONPoster
- FP-ANet: A fixed-point Attention Network for Hybrid-field THz Ultra-Massive MIMO Channel EstimationPoster
- FPI-DET: A FACE–PHONE INTERACTION DATASET FOR PHONE-USE DETECTION AND UNDERSTANDINGPoster
- FRAME-STACKED LOCAL TRANSFORMERS FOR EFFICIENT MULTI-CODEBOOK SPEECH GENERATIONPoster
- FREQ-DP NET: A DUAL-BRANCH NETWORK FOR FENCE REMOVAL USING DUAL-PIXEL AND FOURIER PRIORSPoster
- FREQUENCY-GUIDED MULTI-LEVEL REASONING FOR SCENE GRAPH GENERATION IN VIDEOPoster
- FROM CONTRAST TO COMMONALITY: AUDIO COMMONALITY CAPTIONING FOR ENHANCED AUDIO-TEXT CROSS-MODAL UNDERSTANDING IN MULTIMODAL LLMSPoster
- FROM HALLUCINATION TO ARTICULATION: LANGUAGE MODEL-DRIVEN LOSSES FOR ULTRA LOW-BITRATE NEURAL SPEECH CODINGPoster
- FROM HYPE TO INSIGHT: RETHINKING LARGE LANGUAGE MODEL INTEGRATION IN VISUAL SPEECH RECOGNITIONPoster
- FROM INDEPENDENCE TO INTERACTION: SPEAKER-AWARE SIMULATION OF MULTI-SPEAKER CONVERSATIONAL TIMINGPoster
- FROM KNOWING TO DOING PRECISELY: A GENERAL SELF-CORRECTION AND TERMINATION FRAMEWORK FOR VLA MODELSPoster
- FROM POWERSGD TO POWERSGD+: LOW-RANK GRADIENT COMPRESSION FOR DISTRIBUTED OPTIMIZATION WITH CONVERGENCE GUARANTEESPoster
- FROM TOKEN TO LINE: ENHANCING CODE GENERATION WITH A LONG-TERM PERSPECTIVEPoster
- FRONTEND TOKEN ENHANCEMENT FOR TOKEN-BASED SPEECH RECOGNITIONPoster
- FTIN: FREQUENCY-TIME INTEGRATION NETWORK FOR INERTIAL ODOMETRYPoster
- FULL BAND DENOISING OF ROOM IMPULSE RESPONSE IN THE WAVELET DOMAIN WITH DICTIONARY LEARNINGOral
- FULL-DUPLEX-BENCH V1.5: EVALUATING OVERLAP HANDLING FOR FULL-DUPLEX SPEECH MODELSPoster
- FUN-SSL: FULL-BAND LAYER FOLLOWED BY U-NET WITH NARROW-BAND LAYERS FOR MULTIPLE MOVING SOUND SOURCE LOCALIZATIONPoster
- FUSION OF SPATIO-TEMPORAL AND MULTI-SCALE FREQUENCY FEATURES FOR DRY ELECTRODES MI-EEG DECODINGPoster
- FUSIONEDIT: SEMANTIC FUSION AND ATTENTION MODULATION FOR TRAINING-FREE IMAGE EDITINGOral
- FW-VTON: FLATTENING-AND-WARPING FOR PERSON-TO-PERSON VIRTUAL TRY-ONPoster
- FXSEARCHER: GRADIENT-FREE TEXT-DRIVEN AUDIO TRANSFORMATIONPoster
- Face-Voice Association with Inductive Bias for Maximum Class SeparationOral
- Fake-HR1: Rethinking Reasoning of vision language model for Synthetic Image DetectionPoster
- Fast Low-light Enhancement and Deblurring for 3D Dark ScenesPoster
- FastEnhancer: Speed-Optimized Streaming Neural Speech EnhancementPoster
- Fed-PISA: Federated Voice Cloning via Personalized Identity-Style AdaptationPoster
- FedAVOT: Exact Distribution Alignment in Federated Learning via Masked Optimal TransportPoster
- FedDBP: Enhancing Federated Prototype Learning with Dual-Branch Features and Personalized Global FusionPoster
- FedRD: Reducing Divergences for Generalized Federated Learning via Heterogeneity-aware Parameter GuidanceOral
- From Diet to Free Lunch: Estimating Auxiliary Signal Properties using Dynamic Pruning Masks in Speech Enhancement NetworksPoster
- From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target RecognitionPoster
- From Parameters to Prompts: Understanding and Mitigating the Factuality Gap between Fine-Tuned LLMsPoster
- GAME-TIME: EVALUATING TEMPORAL DYNAMICS IN SPOKEN LANGUAGE MODELSOral
- GAP-URGENET: A GENERATIVE-PREDICTIVE FUSION FRAMEWORK FOR UNIVERSAL SPEECH ENHANCEMENTPoster
- GAUSSIAN MESH RENDERER FOR LIGHTWEIGHT DIFFERENTIABLE RENDERINGPoster
- GAUSSIAN2SCENE: 3D SCENE REPRESENTATION LEARNING VIA SELF-SUPERVISED LEARNING WITH 3D GAUSSIAN SPLATTINGPoster
- GDCNET: GENERATIVE DISCREPANCY COMPARISON NETWORK FOR MULTIMODAL SARCASM DETECTIONPoster
- GDIFFUSE: DIFFUSION-BASED SPEECH ENHANCEMENT WITH NOISE MODEL GUIDANCEPoster
- GELINA: UNIFIED SPEECH AND GESTURE SYNTHESIS VIA INTERLEAVED TOKEN PREDICTIONOral
- GEN-SER: WHEN THE GENERATIVE MODEL MEETS SPEECH EMOTION RECOGNITIONPoster
- GEN3D:GENERATING DOMAIN-FREE 3D SCENES FROM A SINGLE IMAGEPoster
- GENCHO: ROOM IMPULSE RESPONSE GENERATION FROM REVERBERANT SPEECH AND TEXT VIA DIFFUSION TRANSFORMERSOral
- GENERALIZABILITY OF PREDICTIVE AND GENERATIVE SPEECH ENHANCEMENT MODELS TO PATHOLOGICAL SPEAKERSPoster
- GENERALIZABLE DETECTION OF AUDIO DEEPFAKESPoster
- GENERALIZABLE SPEECH DEEPFAKE DETECTION VIA INFORMATION BOTTLENECK ENHANCED ADVERSARIAL ALIGNMENTPoster
- GENERALIZABLE SPEECH DEEPFAKE DETECTION VIA META-LEARNED LORAPoster
- GENERATING LOCALIZED AUDIBLE ZONES USING A SINGLE-CHANNEL PARAMETRIC LOUDSPEAKERPoster
- GENERATIVE AUDIO EXTENSION AND MORPHINGPoster
- GENFACTS-GENERATIVE COUNTERFACTUAL EXPLANATIONS FOR MULTI-VARIATE TIME SERIESOral
- GEODESIC PROTOTYPE MATCHING VIA DIFFUSION MAPS FOR INTERPRETABLE FINE-GRAINED RECOGNITIONOral
- GEOMETRIC IMAGE SYNCHRONIZATION WITH DEEP WATERMARKINGPoster
- GLA-GRAD++: AN IMPROVED GRIFFIN-LIM GUIDED DIFFUSION MODEL FOR SPEECH SYNTHESISPoster
- GLAP: General contrastive audio-text pretraining across domains and languagesPoster
- GLORIA: GATED LOW-RANK INTERPRETABLE ADAPTATION FOR DIALECTAL ASRPoster
- GLUE: Gradient-free Learning to Unify ExpertsPoster
- GO-MLVTON: GARMENT OCCLUSION-AWARE MULTI-LAYER VIRTUAL TRY-ON WITH DIFFUSION MODELSPoster
- GRAPH DISTRIBUTION-VALUED SIGNALS: A WASSERSTEIN SPACE PERSPECTIVEOral
- GRAPH FOURIER TRANSFORMER WITH STRUCTURE-FREQUENCY INFORMATIONPoster
- GRAPH NEURAL NETWORKS IN LARGE SCALE WIRELESS COMMUNICATION NETWORKS: SCALABILITY ACROSS RANDOM GEOMETRIC GRAPHSPoster
- GRAPH NEURAL NETWORKS WITH DIVERSITY-AWARE NEIGHBOR SELECTION AND DYNAMIC MULTI-SCALE FUSION FOR MULTIVARIATE TIME SERIES FORECASTINGPoster
- GRAPH-AWARE LEARNING RATES FOR DECENTRALIZED OPTIMIZATIONPoster
- GRAPHPL: LEVERAGING GNN FOR EFFICIENT AND ROBUST MODALITIES IMPUTATION IN PATCHWORK LEARNINGPoster
- GRASP: GRoup-shApley feature Selection for PatientsPoster
- GROUP RELATIVE POLICY OPTIMIZATION FOR TEXT-TO-SPEECH WITH LARGE LANGUAGE MODELSOral
- GSDFUSE: CAPTURING COGNITIVE INCONSISTENCIES FROM MULTI-DIMENSIONAL WEAK SIGNALS IN SOCIAL MEDIA STEGANALYSISPoster
- GSTA: EFFICIENT TRAINING SCHEME WITH SIESTAED GAUSSIANS FOR MONOCULAR 3D SCENE RECONSTRUCTIONPoster
- GTFMN: Guided Texture and Feature Modulation Network for Low-Light Image Enhancement and Super-ResolutionOral
- GUI-ARP: ENHANCING GROUNDING WITH ADAPTIVE REGION PERCEPTION FOR GUI AGENTSPoster
- GalaxyEdit: Large Scale Image Editing Dataset with Enhanced Diffusion AdapterOral
- GazeFormer-MoE: Context-Aware Gaze Estimation via CLIP and MoE TransformerPoster
- GenLie: A Global-Enhanced Lie Detection Network under Sparsity and Semantic InterferencePoster
- Generating Moving 3D Soundscapes with Latent Diffusion ModelsPoster
- Goal-Oriented Joint Source–Channel Coding: Distortion–Classification–Power Trade-offPoster
- Graph Signal Generative Diffusion ModelsPoster
- Graph-Aware Diffusion for Signal GenerationPoster
- Graph-Based Learning of Spectro-Topographical EEG Representations with Gradient Alignment for Brain-Computer InterfacesPoster
- Graph-based 3D Human Pose Estimation using WiFi SignalsPoster
- Gromov-Wasserstein Graph CoarseningPoster
- HALLUCINATION DETECTION VIA INTERNAL STATES AND STRUCTURED REASONING CONSISTENCY IN LARGE LANGUAGE MODELSOral
- HAVT-IVD: HETEROGENEITY-AWARE CROSS-MODAL NETWORK FOR AUDIO-VISUAL SURVEILLANCE: IDLING VEHICLES DETECTION WITH MULTICHANNEL AUDIO AND MULTISCALE VISUAL CUESPoster
- HD-PPT: HIERARCHICAL DECODING OF CONTENT- AND PROMPT-PREFERENCE TOKENS FOR INSTRUCTION-BASED TTSOral
- HEAD-AWARE VISUAL CROPPING: ENHANCING FINE-GRAINED VQA WITH ATTENTION-GUIDED SUBIMAGEPoster
- HEAR: HIERARCHICALLY ENHANCED AESTHETIC REPRESENTATIONS FOR MULTIDIMENSIONAL MUSIC EVALUATIONPoster
- HEBBIAN LEARNING WITH GLOBAL DIRECTIONOral
- HERGNET: A FAST NEURAL SURROGATE MODEL FOR SOUND FIELD PREDICTIONS VIA SUPERPOSITION OF PLANE WAVESPoster
- HETEROGENEOUS SELF-SUPERVISED ACOUSTIC PRE-TRAINING WITH LOCAL CONSTRAINTSPoster
- HFMCA: ORTHONORMAL FEATURE LEARNING FOR EEG-BASED BRAIN DECODINGPoster
- HGAN-SDEs: Learning Neural Stochastic Differential Equations with Hermite-Guided Adversarial TrainingOral
- HICT: HIGH-PRECISION 3D CBCT RECONSTRUCTION FROM A SINGLE X-RAYPoster
- HIERARCHICAL ACTIVITY RECOGNITION AND CAPTIONING FROM LONG-FORM AUDIOPoster
- HIERARCHICAL ORTHOGONAL RESIDUAL SPREAD FOR PRECISE MASSIVE EDITING IN LARGE LANGUAGE MODELSOral
- HIGH QUALITY UNDERWATER IMAGE COMPRESSION WITH ADAPTIVE COLOR CORRECTIONOral
- HIGH-FIDELITY SPEECH ENHANCEMENT VIA DISCRETE AUDIO TOKENSPoster
- HINT: COMPOSED IMAGE RETRIEVAL WITH DUAL-PATH COMPOSITIONAL CONTEXTUALIZED NETWORKPoster
- HINT: HIERARCHICAL INTER-FRAME CORRELATION FOR ONE-SHOT POINT CLOUD SEQUENCE COMPRESSIONPoster
- HMVLA: HYPERBOLIC MULTIMODAL FUSION FOR VISION-LANGUAGE-ACTION MODELSPoster
- HOW CAN QUANTUM DEEP LEARNING IMPROVE LARGE LANGUAGE MODELS?Oral
- HOW FAR DO SSL SPEECH MODELS LISTEN FOR TONE? TEMPORAL FOCUS OF TONE REPRESENTATION UNDER LOW-RESOURCE TRANSFERPoster
- HOW TO LABEL RESYNTHESIZED AUDIO: THE DUAL ROLE OF NEURAL AUDIO CODECS IN AUDIO DEEPFAKE DETECTIONPoster
- HPTune: Hierarchical Proactive Tuning for Collision-Free Model Predictive ControlPoster
- HSSDCT: Factorized Spatial-Spectral Correlation for Hyperspectral Image FusionOral
- HVAC-EAR: EAVESDROPPING HUMAN SPEECH USING HVAC SYSTEMSPoster
- HVD: HUMAN VISION-DRIVEN VIDEO REPRESENTATION LEARNING FOR TEXT-VIDEO RETRIEVALPoster
- HYBRID CHANNEL ESTIMATION WITH QUANTIZED PHASE FEEDBACK FOR OVER-THE-AIR COMPUTATIONPoster
- HYBRID PRUNING: IN-SITU COMPRESSION OF SELF-SUPERVISED SPEECH MODELS FOR SPEAKER VERIFICATION AND ANTI-SPOOFINGOral
- HYPERDOA: ROBUST AND EFFICIENT DOA ESTIMATION USING HYPERDIMENSIONAL COMPUTINGPoster
- Hardware-Efficient Cognitive Radar: Multi-Target Detection with RL-Driven Transmissive RISOral
- HarmoniFuse: A Component-Selective and Prompt-Adaptive Framework for Multi-Task Speech Language ModelingPoster
- Hashing-Baseline: Rethinking hashing in the age of pretrained modelsPoster
- HiFi-HARP: A High-Fidelity 7th-Order Ambisonic Room Impulse Response DatasetOral
- Hierarchical Sparse Vector Transmission for Ultra Reliable and Low Latency CommunicationsPoster
- Higher-Order Feature Attribution: Bridging Statistics, Explainable AI, and Topological Signal ProcessingPoster
- Holographic Transformers for Complex-Valued Signal Processing: Integrating Phase Interference into Self-AttentionPoster
- How Does Instrumental Music Help SingFake Detection?Poster
- Hybrid Semantic-Complementary Transmission for High-Fidelity Image ReconstructionPoster
- HyperCool: Reducing Encoding Cost in Overfitted Codecs with HypernetworksOral
- Hyperbolic Additive Margin Softmax with Hierarchical Information for Speaker VerificationPoster
- I-DCCRN-VAE: AN IMPROVED DEEP REPRESENTATION LEARNING FRAMEWORK FOR COMPLEX VAE-BASED SINGLE-CHANNEL SPEECH ENHANCEMENTPoster
- ICASSP 2026 URGENT Speech Enhancement ChallengePoster
- ICPO: Illocution-Calibrated Policy Optimization for Multi-Turn ConversationPoster
- IDENTIFIABILITY OF ROTATING STELLAR SURFACES FROM ASTROMETRIC JITTEROral
- IDENTITY LEAKAGE THROUGH ACCENT CUES IN VOICE ANONYMISATIONPoster
- IMPROVING AUDIO EVENT RECOGNITION WITH CONSISTENCY REGULARIZATIONPoster
- IMPROVING AUDIO QUESTION ANSWERING WITH VARIATIONAL INFERENCEPoster
- IMPROVING CONTEXTUAL ASR VIA MULTI-GRAINED FUSION WITH LARGE LANGUAGE MODELSPoster
- IMPROVING MULTIMODAL BRAIN ENCODING MODEL WITH DYNAMIC SUBJECT-AWARENESS ROUTINGPoster
- IMPROVING THE SPEAKER ANONYMIZATION EVALUATION’S ROBUSTNESS TO TARGET SPEAKERS WITH ADVERSARIAL LEARNINGPoster
- IN-SYNC: ADAPTATION OF SPEECH AWARE LARGE LANGUAGE MODELS FOR ASR WITH WORD LEVEL TIMESTAMP PREDICTIONSOral
- INCONVAD: A TWO-STAGE DUAL-TOWER FRAMEWORK FOR MULTIMODAL EMOTION INCONSISTENCY DETECTIONPoster
- INCORPORATING PRIORS IN LEARNING: A RANDOM MATRIX STUDY UNDER A TEACHER–STUDENT FRAMEWORKOral
- INCREMENTAL LEARNING FOR AUDIO CLASSIFICATION WITH HEBBIAN DEEP NEURAL NETWORKSPoster
- INFLUENCE OF CLEAN SPEECH CHARACTERISTICS ON SPEECH ENHANCEMENT PERFORMANCEPoster
- INSTANCERSR: REAL-WORLD SUPER-RESOLUTION VIA INSTANCE-AWARE REPRESENTATION ALIGNMENTPoster
- INSTRUCTION GUIDED MULTI OBJECT IMAGE EDITING WITH QUANTITY AND LAYOUT CONSISTENCYOral
- INTACT: INDUCING NOISE TOLERANCE THROUGH ADVERSARIAL CURRICULUM TRAINING FOR LIDAR-BASED SAFETY-CRITICAL PERCEPTION AND AUTONOMYOral
- INTEGRATING STACKED INTELLIGENT METASURFACES AND POWER CONTROL FOR DYNAMIC EDGE INFERENCE VIA OVER-THE-AIR NEURAL NETWORKSOral
- INTEGRATION OF CALCIUM IMAGING TRACES VIA DEEP GENERATIVE MODELINGPoster
- INTERMITTENT SEMI-WORKING MASK: A NEW MASKING PARADIGM FOR LLMSPoster
- INTERPRETABLE MODELING OF ARTICULATORY TEMPORAL DYNAMICS FROM REAL-TIME MRI FOR PHONEME RECOGNITIONPoster
- INTRA-CLASS SUBDIVISION FOR PIXEL CONTRASTIVE LEARNING: APPLICATION TO SEMI-SUPERVISED CARDIAC IMAGE SEGMENTATIONPoster
- INVERSE-HESSIAN REGULARIZATION FOR CONTINUAL LEARNING IN ASRPoster
- INVESTIGATING MODALITY CONTRIBUTION IN AUDIO LLMS FOR MUSICPoster
- IQ-LUT: INTERPOLATED AND QUANTIZED LUT FOR EFFICIENT IMAGE SUPER-RESOLUTIONPoster
- IS PHASE REALLY NEEDED FOR WEAKLY-SUPERVISED DEREVERBERATION ?Poster
- IS REPEATER-ASSISTED MASSIVE MIMO COMPATIBLE WITH DYNAMIC TDD?Oral
- ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language ModelsOral
- ISSE: AN INSTRUCTION-GUIDED SPEECH STYLE EDITING DATASET AND BENCHMARKPoster
- ISTER: LINEAR TRANSFORMER FOR EFFICIENT MULTIVARIATE TIME SERIES FORECASTINGPoster
- ITERATIVE AMORTIZED HIERARCHICAL VAEPoster
- Identifying birdsong syllables without labelled dataPoster
- IdentityGuard: Context-Aware Restriction and Provenance for Personalized SynthesisPoster
- Impact of Phonetics on Speaker Identity in Adversarial Voice AttackOral
- Improve MLLM Benchmark Efficiency through InterviewPoster
- Improving Active Learning for Melody Estimation by Disentangling UncertaintiesPoster
- Improving Anomalous Sound Detection with Attribute-aware Representation from Domain-adaptive Pre-trainingPoster
- Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement LearningPoster
- InstructAudio: Unified speech and music generation with natural language instructionPoster
- Invariant Representation Guided Multimodal Sentiment Decoding with Sequential Variation RegularizationPoster
- Inverse Rendering for High-Genus 3D Surface Meshes from Multi-view Images with Persistent Homology PriorsPoster
- Investigating Batch Inference in a Sequential Monte Carlo Framework for Neural NetworksPoster
- IoDResearch: Deep Research on Private Heterogeneous Data via the Internet of DataPoster
- JOINT ACTIVE RIS CONFIGURATION AND USER POWER CONTROL FOR LOCALIZATION: A NEUROEVOLUTION-BASED APPROACHOral
- JOINT ESTIMATION OF PIANO DYNAMICS AND METRICAL STRUCTURE WITH A MULTI-TASK MULTI-SCALE NETWORKOral
- JOINT OPTIMIZATION OF ASV AND CM TASKS: BTUEF TEAM’S SUBMISSION FOR WILDSPOOF CHALLENGEPoster
- JOINT REPRODUCTION NUMBER AND SPATIAL CONNECTIVITY STRUCTURE ESTIMATION VIA GRAPH SPARSITY-PROMOTING PENALIZED FUNCTIONALPoster
- JOINT SUPERPIXEL AND SELF-REPRESENTATION LEARNING FOR SCALABLE HYPERSPECTRAL IMAGE CLUSTERINGPoster
- JUDGE BEFORE ANSWER: CAN MLLM DISCERN THE FALSE PREMISE IN QUESTION?Poster
- Joint Transmit Beamforming and Reflection Optimization for Beyond Diagonal RIS Aided Multi-Cell MIMO CommunicationOral
- Joint single-shot ToA and DoA estimation for VAA-based BLE ranging with phase ambiguity: A deep learning-based approachPoster
- Jointly Conditioned Diffusion Model for Multi-View Pose-Guided Person Image SynthesisPoster
- K-FUNCTION: JOINT PRONUNCIATION TRANSCRIPTION AND FEEDBACK FOR EVALUATING KIDS LANGUAGE FUNCTIONPoster
- KAME: TANDEM ARCHITECTURE FOR ENHANCING KNOWLEDGE IN REAL-TIME SPEECH-TO-SPEECH CONVERSATIONAL AIPoster
- KD-CVG: A KNOWLEDGE-DRIVEN APPROACH FOR CREATIVE VIDEO GENERATIONPoster
- KG2QA: KNOWLEDGE GRAPH-ENHANCED RETRIEVAL-AUGMENTED GENERATION FOR COMMUNICATION STANDARDS QUESTION ANSWERINGPoster
- KINGUARD: HIERARCHICAL KINSHIP-AWARE FINGERPRINTING TO DEFEND AGAINST LARGE LANGUAGE MODEL STEALINGPoster
- KSDIFF: KEYFRAME-AUGMENTED SPEECH-AWARE DUAL-PATH DIFFUSION FOR FACIAL ANIMATIONPoster
- Knowledge Distillation for mmWave Beam Prediction Using Sub-6 GHz ChannelsOral
- LAKAN: LANDMARK-ASSISTED ADAPTIVE KOLMOGOROV-ARNOLD NETWORK FOR FACE FORGERY DETECTIONPoster
- LAMB: LLM-BASED AUDIO CAPTIONING WITH MODALITY GAP BRIDGING VIA CAUCHY-SCHWARZ DIVERGENCEOral
- LAMER-SSL: LAYER-AWARE MIXTURE OF LORA EXPERTS FOR CONTINUAL MULTILINGUAL EXPANSION OF SELF-SUPERVISED MODELS WITHOUT FORGETTINGPoster
- LAMIGAUSS: PITCHING RADIATIVE GAUSSIAN FOR SPARSE-VIEW X-RAY LAMINOGRAPHY RECONSTRUCTIONPoster
- LARGE VISION MODELS CAN SOLVE MENTAL ROTATION PROBLEMSOral
- LATENT DOMAIN PROMPT LEARNING FOR VISION-LANGUAGE MODELSPoster
- LATENT TEMPORAL DISCREPANCY AS MOTION PRIOR: A LOSS-WEIGHTING STRATEGY FOR DYNAMIC FIDELITY IN T2VOral
- LATENT-SPACE METRICS FOR COMPLEX-VALUED VAE OUT-OF-DISTRIBUTION DETECTION UNDER RADAR CLUTTERPoster
- LDEPROMPT: LAYER-IMPORTANCE GUIDED DUAL EXPANDABLE PROMPT POOL FOR PRE-TRAINED MODEL-BASED CLASS-INCREMENTAL LEARNINGPoster
- LEARNABLE INSTANCE ATTENTION FILTERING FOR ADAPTIVE DETECTOR DISTILLATIONOral
- LEARNING CONSISTENT CAUSAL ABSTRACTION NETWORKSPoster
- LEARNING DOMAIN-ROBUST BIOACOUSTIC REPRESENTATIONS FOR MOSQUITO SPECIES CLASSIFICATION WITH CONTRASTIVE LEARNING AND DISTRIBUTION ALIGNMENTPoster
- LEARNING EXPLICITLY CONDITIONED SPARSIFYING TRANSFORMSPoster
- LEARNING FAIR DOMAIN ADAPTATION WITH VIRTUAL LABEL DISTRIBUTIONPoster
- LEARNING FALSE DISCOVERY RATE CONTROL VIA MODEL-BASED NEURAL NETWORKSPoster
- LEARNING GRAPH FROM SMOOTH SIGNALS UNDER PARTIAL OBSERVATION: A ROBUSTNESS ANALYSISOral
- LEARNING LINEARITY IN AUDIO CONSISTENCY AUTOENCODERS VIA IMPLICIT REGULARIZATIONPoster
- LEARNING PRODUCT GRAPHS FROM TWO-DIMENSIONAL STATIONARY SIGNALSOral
- LEARNING STRUCTURAL–FUNCTIONAL BRAIN REPRESENTATIONS THROUGH MULTI–SCALE ADAPTIVE GRAPH ATTENTION FOR COGNITIVE INSIGHTOral
- LEARNING THE STRUCTURE OF CONNECTION GRAPHSOral
- LEARNING WHAT TO HEAR: BOOSTING SOUND-SOURCE ASSOCIATION FOR ROBUST AUDIOVISUAL INSTANCE SEGMENTATIONPoster
- LEGAL∆: ENHANCING LEGAL REASONING IN LLMS VIA REINFORCEMENT LEARNING WITH CHAIN-OF-THOUGHT GUIDED INFORMATION GAINPoster
- LEND A HAND: SEMI TRAINING-FREE CUED SPEECH RECOGNITION VIA MLLM-DRIVEN HAND MODELING FOR BARRIER-FREE COMMUNICATIONPoster
- LENSLESSMIC: AUDIO ENCRYPTION AND AUTHENTICATION VIA LENSLESS COMPUTATIONAL IMAGINGPoster
- LESS: LARGE LANGUAGE MODEL ENHANCED SEMI-SUPERVISED LEARNING FOR SPEECH FOUNDATIONAL MODELS USING IN-THE-WILD DATAPoster
- LEVERAGING AUDIO-VISUAL DATA TO REDUCE THE MULTILINGUAL GAP IN SELF-SUPERVISED SPEECH MODELSPoster
- LEVERAGING LABEL PROPORTION PRIOR FOR CLASS-IMBALANCED SEMI-SUPERVISED LEARNINGPoster
- LEVERAGING LARGE MULTIMODAL MODELS FOR AUDIO-VIDEO DEEPFAKE DETECTION: A PILOT STUDYOral
- LEVERAGING MULTIPLE SPEECH ENHANCERS FOR NON-INTRUSIVE INTELLIGIBILITY PREDICTION FOR HEARING-IMPAIRED LISTENERSPoster
- LEVERAGING OVERFITTING FOR LOW-COMPLEXITY AND MODALITY-AGNOSTIC JOINT SOURCE-CHANNEL CODINGOral
- LEVERAGING PREDICTION ENTROPY FOR AUTOMATIC PROMPT WEIGHTING IN ZERO-SHOT AUDIO-LANGUAGE CLASSIFICATIONOral
- LEVERAGING WHISPER EMBEDDINGS FOR AUDIO-BASED LYRICS MATCHINGPoster
- LIBEMER: A NOVEL BENCHMARK AND ALGORITHMS LIBRARY FOR EEG-BASED MULTIMODAL EMOTION RECOGNITIONPoster
- LIGHTWEIGHT AND PERCEPTUALLY-GUIDED VOICE CONVERSION FOR ELECTRO-LARYNGEAL SPEECHPoster
- LIGHTWEIGHT IMPLICIT NEURAL NETWORK FOR BINAURAL AUDIO SYNTHESISPoster
- LIGHTWEIGHT RGB-T TRACKING WITH MOBILE VISION TRANSFORMERSPoster
- LIPSAM: LIPSCHITZ-CONTINUOUS AMPLITUDE MODIFIER FOR AUDIO SIGNAL PROCESSING AND ITS APPLICATION TO PLUG-AND-PLAY DEREVERBERATIONPoster
- LIWHIZ: A NON-INTRUSIVE LYRIC INTELLIGIBILITY PREDICTION SYSTEM FOR THE CADENZA CHALLENGEPoster
- LLM-Driven Scenario-Aware Planning for Autonomous DrivingPoster
- LLMPopcorn: Exploring LLMs as Assistants for Popular Micro-video GenerationPoster
- LOCALIZING SPEECH DEEPFAKES BEYOND TRANSITIONS VIA SEGMENT-AWARE LEARNINGOral
- LOGPTR: VARIABLE-AWARE LOG PARSING WITH POINTER NETWORKPoster
- LONG CHAIN-OF-THOUGHT COMPRESSION VIA FINE-GRAINED GROUP POLICY OPTIMIZATIONPoster
- LONGSPEECH: A SCALABLE BENCHMARK FOR TRANSCRIPTION, TRANSLATION AND UNDERSTANDING IN LONG SPEECHPoster
- LOOSE COUPLING OF SPECTRAL AND SPATIAL MODELS FOR MULTI-CHANNEL DIARIZATION AND ENHANCEMENT OF MEETINGS IN DYNAMIC ENVIRONMENTSPoster
- LOTUSDIS: A THAI FAR-FIELD MEETING CORPUS FOR ROBUST CONVERSATIONAL ASRPoster
- LOW-RANK AND SPARSE MODEL MERGING FOR MULTI-LINGUAL SPEECH RECOGNITION AND TRANSLATIONPoster
- LOW-RESOURCE GUIDANCE FOR CONTROLLABLE LATENT AUDIO DIFFUSIONPoster
- LP-CFM: PERCEPTUAL INVARIANCE-AWARE CONDITIONAL FLOW MATCHING FOR SPEECH MODELINGPoster
- LPCVAE: A CONDITIONAL VAE WITH LONG-TERM DEPENDENCY AND PROBABILISTIC TIME-FREQUENCY FUSION FOR TIME SERIES ANOMALY DETECTIONPoster
- LSP Framework: A Compensatory Model for Defeating Trigger Reverse Engineering via Label Smoothing PoisoningOral
- LUSEEL: LANGUAGE-QUERIED BINAURAL UNIVERSAL SOUND EVENT EXTRACTION AND LOCALIZATIONPoster
- LVC: A LIGHTWEIGHT COMPRESSION FRAMEWORK FOR ENHANCING VLMS IN LONG VIDEO UNDERSTANDINGPoster
- LVD-GS: GAUSSIAN SPLATTING SLAM FOR DYNAMIC SCENES VIA HIERARCHICAL EXPLICIT-IMPLICIT REPRESENTATION COLLABORATION RENDERINGPoster
- LYTIMET: TOWARDS ROBUST AND INTERPRETABLE STATE-VARIABLE DISCOVERYOral
- Layer-Aware Early Fusion of Acoustic and Linguistic Embeddings for Cognitive Status ClassificationPoster
- Learning Affine-Equivariant Proximal OperatorsPoster
- Learning Beyond the Gaussian Data: Learning Dynamics of Neural Networks on an Expressive and Cumulant-Controllable Data ModelPoster
- Learning Fill-in Reduction Ordering via Graph Policy Optimization for Sparse MatricesPoster
- Learning Nonlinear Systems In-Context: From Synthetic Data to Real-World Motor ControlPoster
- Learning Reference-Guided Exposure Correction with Hybrid Illumination CharacteristicsPoster
- Learning Time-Varying Turn-Taking Behavior in Group ConversationsPoster
- Learning Vocal-Tract Area and Radiation with a Physics-Informed Webster ModelPoster
- Learning from Disagreement: A Group Decision Simulation Framework for Robust Medical Image SegmentationPoster
- Length-Aware Rotary Position Embedding for Text-Speech AlignmentPoster
- Less Redundancy: Boosting Practicality of Vision Language Model in Walking AssistantsOral
- LiDAR-based Human Activity Recognition through Laplacian Spectral AnalysisPoster
- Lightweight and Generalizable Acoustic Scene Representations via Contrastive Fine-Tuning and DistillationPoster
- Linking Faces and Voices Across Languages: Insights from the FAME 2026 ChallengePoster
- LipSody: Lip-to-Speech Synthesis with Enhanced Prosody ConsistencyPoster
- Logic-ORiented Retriever Enhancement via Contrastive LearningPoster
- Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic SegmentationOral
- Lotus: Efficient LLM Training by Randomized Low-Rank Gradient Projection with Adaptive Subspace SwitchingPoster
- MAG: Multi-Modal Aligned Autoregressive Co-Speech Gesture Generation without Vector QuantizationOral
- MAGE-KT: Multi-Agent Graph-Enhanced Knowledge Tracing with Subgraph Retrieval and Asymmetric FusionPoster
- MAGE: A COARSE-TO-FINE SPEECH ENHANCER WITH MASKED GENERATIVE MODELPoster
- MAKING DIALOGUE GROUNDING DATA RICH: A THREE-TIER DATA SYNTHESIS FRAMEWORK FOR GENERALIZED REFERRING EXPRESSION COMPREHENSIONPoster
- MALEFA: MULTI-GRANULARITY LEARNING AND EFFECTIVE FALSE ALARM SUPPRESSION FOR ZERO-SHOT KEYWORD SPOTTINGPoster
- MAMMODINO: ANATOMICALLY AWARE SELF-SUPERVISION FOR MAMMOGRAPHIC IMAGESPoster
- MANIFOLDFORMER: GEOMETRIC DEEP LEARNING FOR NEURAL DYNAMICS ON RIEMANNIAN MANIFOLDSPoster
- MAPEX: A MULTI-AGENT PIPELINE FOR KEYPHRASE EXTRACTIONPoster
- MAR: EFFICIENT LARGE LANGUAGE MODELS VIA MODULE-AWARE ARCHITECTURE REFINEMENTPoster
- MARKSWEEP: A NO-BOX REMOVAL ATTACK ON AI-GENERATED IMAGE WATERMARKING VIA NOISE INTENSIFICATION AND FREQUENCY-AWARE DENOISINGPoster
- MASKVCT: MASKED VOICE CODEC TRANSFORMER FOR ZERO-SHOT VOICE CONVERSION WITH INCREASED CONTROLLABILITY VIA MULTIPLE GUIDANCESPoster
- MASTER-ASSISTED DISTRIBUTED UPLINK OPERATION FOR CELL-FREE MASSIVE MIMO NETWORKSPoster
- MATCHING REVERBERANT SPEECH THROUGH LEARNED ACOUSTIC EMBEDDINGS AND FEEDBACK DELAY NETWORKSOral
- MATE: MATRYOSHKA AUDIO–TEXT EMBEDDINGS FOR OPEN-VOCABULARY KEYWORD SPOTTINGPoster
- MATHPHYS-GUIDED COARSE-TO-FINE ANOMALY SYNTHESIS WITH SQE-DRIVEN BI-LEVEL OPTIMIZATION FOR ANOMALY DETECTIONOral
- MATTER: Multiscale Attention for Registration Error RegressionPoster
- MC-LExt: Multi-Channel Target Speaker Extraction with Onset-Prompted Speaker Conditioning MechanismPoster
- MEANFLOW-ACCELERATED MULTIMODAL VIDEO-TO-AUDIO SYNTHESIS VIA ONE-STEP GENERATIONPoster
- MEANFLOWSE: ONE-STEP GENERATIVE SPEECH ENHANCEMENT VIA CONDITIONAL MEAN FLOWOral
- MEANSE: EFFICIENT GENERATIVE SPEECH ENHANCEMENT WITH MEAN FLOWSPoster
- MEANVC: LIGHTWEIGHT AND STREAMING ZERO-SHOT VOICE CONVERSION VIA MEAN FLOWSPoster
- MEANVOICEFLOW: ONE-STEP NONPARALLEL VOICE CONVERSION WITH MEAN FLOWSPoster
- MEASURING PROSODY DIVERSITY IN ZERO-SHOT TTS: A NEW METRIC, BENCHMARK, AND EXPLORATIONPoster
- MECAP-R1: EMOTION-AWARE POLICY WITH REINFORCEMENT LEARNING FOR MULTIMODAL EMOTION CAPTIONINGOral
- MEDCUTMIX: A DATA-CENTRIC APPROACH TO IMPROVE RADIOLOGY VISION-LANGUAGE PRE-TRAINING WITH DISEASE AWARENESSOral
- MEDFACT-R1: TOWARDS FACTUAL MEDICAL REASONING VIA PSEUDO-LABEL AUGMENTATIONPoster
- MELA-TTS: JOINT TRANSFORMER-DIFFUSION MODEL WITH REPRESENTATION ALIGNMENT FOR SPEECH SYNTHESISPoster
- MELT: IMPROVE COMPOSED IMAGE RETRIEVAL VIA THE MODIFICATION FREQUENTATION-RARITY BALANCE NETWORKPoster
- MGKAN: PREDICTING ASYMMETRIC DRUG-DRUG INTERACTIONS VIA A MULTIMODAL GRAPH KOLMOGOROV-ARNOLD NETWORKPoster
- MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large Audio-Language ModelOral
- MI-PRUN: OPTIMIZE LARGE LANGUAGE MODEL PRUNING VIA MUTUAL INFORMATIONPoster
- MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music UnderstandingPoster
- MILORE-SSL: SCALING MULTILINGUAL CAPABILITIES IN SELF-SUPERVISED MODELS WITHOUT FORGETTINGPoster
- MIMO Array Calibration in Non-stationary Channels with Residual Surfaces and Slepian Spherical HarmonicsPoster
- MIND THE GAP: DATA REWRITING FOR STABLE OFF-POLICY SUPERVISED FINE-TUNINGPoster
- MIND THE SHIFT: USING DELTA SSL EMBEDDINGS TO ENHANCE CHILD ASRPoster
- MINDCINE: MULTIMODAL EEG-TO-VIDEO RECONSTRUCTION WITH LARGE-SCALE PRETRAINED MODELSPoster
- MINIMIZATION OF NONSMOOTH WEAKLY CONVEX FUNCTION OVER PROX-REGULAR SET FOR ROBUST LOW-RANK MATRIX RECOVERYPoster
- MIRG-RL: Multi-Image Reasoning and Grounding with Reinforcement LearningPoster
- MIRRORTALK: FORGING PERSONALIZED AVATARS VIA DISENTANGLED STYLE AND HIERARCHICAL MOTION CONTROLPoster
- MISCLASSIFICATION RATE AND PRIVACY-UTILITY TRADE-OFFS IN GRAPH CONVOLUTIONAL NETWORKS VIA SUBSAMPLING STABILITYPoster
- MISPRONUNCIATION DETECTION AND DIAGNOSIS WITHOUT MODEL TRAINING: A RETRIEVAL-BASED APPROACHOral
- MITA: A HIERARCHICAL MULTI-AGENT COLLABORATION FRAMEWORK WITH MEMORY-INTEGRATED AND TASK ALLOCATIONPoster
- MITIGATING ATTENTION SINKS AND MASSIVE ACTIVATIONS IN AUDIO-VISUAL SPEECH RECOGNITION WITH LLMSPoster
- MITIGATING DATA REPLICATION IN TEXT-TO-AUDIO GENERATIVE DIFFUSION MODELS THROUGH ANTI-MEMORIZATION GUIDANCEPoster
- MITIGATING HALLUCINATION IN FINANCIAL RETRIEVAL-AUGMENTED GENERATION VIA FINE-GRAINED KNOWLEDGE VERIFICATIONPoster
- MITIGATING INTRA-SPEAKER VARIABILITY IN DIARIZATION WITH STYLE-CONTROLLABLE SPEECH AUGMENTATIONPoster
- MIX2MORPH: LEARNING SOUND MORPHING FROM NOISY MIXESPoster
- MIXTURE OF EXPERTS FOR RECOGNIZING DEPRESSION FROM INTERVIEW AND READING TASKSPoster
- MMAUDIOSEP: TAMING VIDEO-TO-AUDIO GENERATIVE MODEL TOWARDS VIDEO/TEXT-QUERIED SOUND SEPARATIONPoster
- MMRQA: SIGNAL-ENHANCED MULTIMODAL LARGE LANGUAGE MODELS FOR MRI QUALITY ASSESSMENTPoster
- MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in SpeechPoster
- MODELING STRATEGIES FOR SPEECH ENHANCEMENT IN THE LATENT SPACE OF A NEURAL AUDIO CODECPoster
- MODERN STRUCTURE-AWARE SIMPLICIAL SPATIOTEMPORAL NEURAL NETWORKOral
- MOESCORE: MIXTURE-OF-EXPERTS-BASED TEXT-AUDIO RELEVANCE SCORE PREDICTION FOR TEXT-TO-AUDIO SYSTEM EVALUATIONPoster
- MOMENTS MATTER: POSTERIOR RECOVERY IN POISSON DENOISING VIA LOG-NETWORKSPoster
- MORE THAN A SHORTCUT: A HYPERBOLIC APPROACH TO EARLY-EXIT NETWORKSPoster
- MOSA: MOTION-GUIDED SEMANTIC ALIGNMENT FOR DYNAMIC SCENE GRAPH GENERATIONPoster
- MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASRPoster
- MOTION-GUIDED SEMANTIC ALIGNMENT WITH NEGATIVE PROMPTS FOR ZERO-SHOT VIDEO ACTION RECOGNITIONPoster
- MOVi: Training-free Text-conditioned Multi-Object Video GenerationOral
- MPNet: A Robust and Efficient Manifold Pooling Network for Multi-Rhythm EEG Signal DecodingPoster
- MR-FLOWDPO: MULTI-REWARD DIRECT PREFERENCE OPTIMIZATION FOR FLOW-MATCHING TEXT-TO-MUSIC GENERATIONOral
- MSCT : DIFFERENTIAL CROSS-MODAL ATTENTION FOR DEEPFAKE DETECTIONPoster
- MSF-SER: ENRICHING ACOUSTIC MODELING WITH MULTI-GRANULARITY SEMANTICS FOR SPEECH EMOTION RECOGNITIONPoster
- MSNAV: ZERO-SHOT VISION-AND-LANGUAGE NAVIGATION WITH DYNAMIC MEMORY AND LLM SPATIAL REASONINGPoster
- MSP-REID: HAIRSTYLE-ROBUST CLOTH-CHANGING PERSON RE-IDENTIFICATIONPoster
- MT-HUBERT: SELF-SUPERVISED MIX-TRAINING FOR FEW-SHOT KEYWORD SPOTTING IN MIXED SPEECHOral
- MTP-S2UT: ENHANCING SPEECH-TO-SPEECH TRANSLATION QUALITY WITH MULTI-TOKEN PREDICTIONPoster
- MUGSQA: NOVEL MULTI-UNCERTAINTY-BASED GAUSSIAN SPLATTING QUALITY ASSESSMENT METHOD, DATASET, AND BENCHMARKSOral
- MULTI-CHANNEL SPEECH ENHANCEMENT FOR COCKTAIL PARTY SPEECH EMOTION RECOGNITIONPoster
- MULTI-GRANULARITY SCORE-BASED GENERATIVE FRAMEWORK ENABLES EFFICIENT INVERSE DESIGN OF COMPLEX ORGANICSPoster
- MULTI-HOP DEEP JOINT SOURCE-CHANNEL CODING WITH DEEP HASH DISTILLATION FOR SEMANTICALLY ALIGNED IMAGE RECOVERYPoster
- MULTI-PHYSICS: A COMPREHENSIVE BENCHMARK FOR MULTIMODAL LLMS REASONING ON CHINESE MULTI-SUBJECT PHYSICS PROBLEMSOral
- MULTI-SCALE ADAPTIVE NEIGHBORHOOD AWARENESS TRANSFORMER FOR GRAPH FRAUD DETECTIONPoster
- MULTI-SPEAKER DOA ESTIMATION IN BINAURAL HEARING AIDS USING DEEP LEARNING AND SPEAKER COUNT FUSIONPoster
- MULTI-TASK TRANSFORMER FOR EXPLAINABLE SPEECH DEEPFAKE DETECTION VIA FORMANT MODELINGPoster
- MULTI-TURN PHYSICS-INFORMED VISION-LANGUAGE MODEL FOR PHYSICS-GROUNDED ANOMALY DETECTIONPoster
- MULTI-VIEW CROWD COUNTING WITH SELF-SUPERVISED LEARNINGPoster
- MULTIMODAL DEEP LEARNING METHOD FOR REAL-TIME SPATIAL ROOM IMPULSE RESPONSE COMPUTINGPoster
- MULTIMODAL MULTI-AGENT EMPOWERED LEGAL JUDGMENT PREDICTIONPoster
- MULTIMODAL SELF-ATTENTION NETWORK WITH TEMPORAL ALIGNMENT FOR AUDIO-VISUAL EMOTION RECOGNITIONPoster
- MULTITASK LEARNING WITH LEARNED TASK RELATIONSHIPSOral
- MUSETOK: SYMBOLIC MUSIC TOKENIZATION FOR GENERATION AND SEMANTIC UNDERSTANDINGPoster
- MUSICRS: BENCHMARKING AUDIO-CENTRIC CONVERSATIONAL RECOMMENDATIONPoster
- MVIR: MULTI-VIEW VISUAL-SEMANTIC REPRESENTATION FOR FAKE NEWS DETECTIONPoster
- Make Your MoVe: Make Your 3D Contents by Adapting Multi-View Diffusion Models to External EditingPoster
- Making Medical Vision-Language Models Think Causally Across Modalities with Retrieval-Augmented Cross-Modal ReasoningPoster
- ManipDreamer: Boosting Robotic Manipulation World Model with Action Tree and Visual GuidancePoster
- Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?Poster
- MedSpeak: A Knowledge Graph-Aided ASR Error Correction Framework for Spoken Medical QAPoster
- Membership Inference Attack Against Music Diffusion Models via Generative Manifold PerturbationOral
- Meow: End-to-End Outline Writing for Automatic Academic SurveyPoster
- Meta-Offline and Distributional Multi-Agent RL for Risk-Aware Decision-MakingPoster
- MetaToolAgent: Towards Generalizable Tool Usage in LLMs through Meta-LearningOral
- Mixture to Beamformed Mixture: Leveraging Beamformed Mixture as Weak-Supervision for Speech Enhancement and Noise-Robust ASROral
- Mixture-of-Experts Framework for Field-of-View Enhanced Signal-Dependent Binauralization of moving talkersPoster
- Modality-Decoupled RGB-Thermal Object Detector via Query FusionOral
- Moment-based Posterior Sampling for Multi-reference AlignmentOral
- MotionBeat: Motion-Aligned Music Representation via Embodied Contrastive Learning and Bar-Equivariant Contact-Aware EncodingOral
- Multi-Agent Honeypot-Based Request-Response Context Dataset for Improved SQL Injection Detection PerformancePoster
- Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content ReasoningOral
- Multi-Stage Music Source Restoration with BandSplit-RoFormer Separation and HiFi++ GANPoster
- Multi-layer attentive probing improves transfer of audio representations for bioacousticsOral
- Multi-scale Conditional Generative Modeling for Microscopic Image RestorationOral
- Multi-scale Generative Modeling for Fast SamplingOral
- Multimodal Privacy-Preserving Entity Resolution with Fully Homomorphic EncryptionOral
- Multimodal-Prior-Guided Importance Sampling for Hierarchical Gaussian Splatting in Sparse-View Novel View SynthesisPoster
- Multiview Progress Prediction of Robot ActivitiesPoster
- NATIVETOK: NATIVE VISUAL TOKENIZATION FOR IMPROVED IMAGE GENERATIONOral
- NETWORK-CONTROLLED REPEATERS UNDER POWER AMPLIFIER NON-LINEARITIESPoster
- NEURAL ACOUSTIC MULTIPOLE SPLATTING FOR ROOM IMPULSE RESPONSE SYNTHESISOral
- NEURAL NETWORK-BASED TIME-FREQUENCY-BIN-WISE LINEAR COMBINATION OF BEAMFORMERS FOR UNDERDETERMINED TARGET SOURCE EXTRACTIONPoster
- NEUROHASH: A HYPERDIMENSIONAL NEURO-SYMBOLIC FRAMEWORK FOR SPATIALLY-AWARE IMAGE HASHING AND RETRIEVALOral
- NIFTY: A NON-LOCAL IMAGE FLOW MATCHING FOR TEXTURE SYNTHESISPoster
- NLDSI-BWE: NON LINEAR DYNAMICAL SYSTEMS-INSPIRED MULTI RESOLUTION DISCRIMINATORS FOR SPEECH BANDWIDTH EXTENSIONPoster
- NO VERIFIABLE REWARD FOR PROSODY: TOWARD PREFERENCE-GUIDED PROSODY LEARNING IN TTSPoster
- NOISE-ROBUST AV-ASR USING VISUAL FEATURES BOTH IN THE WHISPER ENCODER AND DECODERPoster
- NOISE-ROBUST CONTRASTIVE LEARNING WITH AN MFCC-CONFORMER FOR CORONARY ARTERY DISEASE DETECTIONPoster
- NOISE-TO-NOTES: DIFFUSION-BASED GENERATION AND REFINEMENT FOR AUTOMATIC DRUM TRANSCRIPTIONOral
- NON-ASYMPTOTIC PERFORMANCE ANALYSIS OF DOA ESTIMATION BASED ON REAL-VALUED ROOT-MUSICPoster
- NONCONVEX REGULARIZATION FOR FEATURE SELECTION IN REINFORCEMENT LEARNINGPoster
- NORD-PARL-TTS: FINNISH AND SWEDISH TTS DATASET FROM PARLIAMENT SPEECHPoster
- NSC-SL: A Bandwidth-Aware Neural Subspace Compression for Communication-Efficient Split LearningPoster
- NUMERICAL SPECTRUM LINKING: IDENTIFICATION OF GOVERNING PDE VIA KOOPMAN-CHEBYSHEV APPROXIMATIONPoster
- Nethira: A Heterogeneity-aware Hierarchical Pre-trained Model for Network Traffic ClassificationPoster
- NeuSpeech: Decode Neural signal as SpeechPoster
- Neural Forward Filtering for Speaker-Image SeparationOral
- Neural personal sound zones with flexible bright zone controlPoster
- NeuroBRIDGE: Behavior-Conditioned Koopman Dynamics with Riemannian Alignment for Early Substance Use Initiation Prediction from Longitudinal Functional ConnectomePoster
- No Concept Left Behind: Test-Time Optimization for Compositional Text-to-Image GenerationPoster
- No Word Left Behind: Mitigating Prefix Bias in Open-Vocabulary Keyword SpottingPoster
- Nuclear Diffusion Models for Low-Rank Background Suppression in VideosOral
- OCR-Enhanced Multimodal ASR Can Read While ListeningPoster
- OF-SemWat: HIGH-PAYLOAD TEXT EMBEDDING FOR SEMANTIC WATERMARKING OF AI-GENERATED IMAGES WITH ARBITRARY SIZEPoster
- OILSAM2: MEMORY-AUGMENTED SAM2 FOR SCALABLE SAR OIL SPILL DETECTIONPoster
- OMNI-AVSR: TOWARDS UNIFIED MULTIMODAL SPEECH RECOGNITION WITH LARGE LANGUAGE MODELSPoster
- ON DEEPFAKE VOICE DETECTION - IT’S ALL IN THE PRESENTATIONOral
- ONLINE NEURAL FUSION OF DISTORTIONLESS DIFFERENTIAL BEAMFORMERS FOR ROBUST SPEECH ENHANCEMENTPoster
- ONLINE REGISTER FOR DUAL-MODE SELF-SUPERVISED SPEECH MODELS: MITIGATING THE LACK OF FUTURE CONTEXTPoster
- OPINION CONSENSUS FORMATION AMONG NETWORKED LARGE LANGUAGE MODELSPoster
- OPTIMAL PLACEMENT OF MOVABLE ANTENNAS FOR ANGLE-OF-DEPARTURE ESTIMATION UNDER USER LOCATION UNCERTAINTYOral
- OPTIMAL TRANSPORT BASED UNSUPERVISED RESTORATION LEARNING EXPLOITING DEGRADATION SPARSITYPoster
- OPTIMIZING DOMAIN-ADAPTIVE SELF-SUPERVISED LEARNING FOR CLINICAL VOICE-BASED DISEASE CLASSIFICATIONOral
- OPTIMIZING SPEECH LANGUAGE MODELS FOR ACOUSTIC CONSISTENCYPoster
- ORTHOGONAL APPROXIMATE MESSAGE PASSING ALGORITHMS FOR RECTANGULAR SPIKED MATRIX MODELS WITH ROTATIONALLY INVARIANT NOISEOral
- OUT-OF-DISTRIBUTION DETECTION BASED ON TOTAL VARIATION ESTIMATIONPoster
- OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-SpeechOral
- On Multiangle Discrete Fractional Periodic TransformsPoster
- On the Importance of a Multi-Scale Calibration for QuantizationOral
- On the Optimality of Rate Balancing for Max-Min Fair MulticastingOral
- On the Sensitivity of Firing Rate-Based Federated Spiking Neural Networks to Differential PrivacyPoster
- Optimal QAM Constellation for Over-the-Air Computation in the Presence of Heavy-Tailed Channel NoisePoster
- Orthogonal Weight Modification Enhances Learning Scalability and Convergence Efficiency without Gradient BackpropagationPoster
- PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech RecognitionOral
- PAGS: PRIORITY-ADAPTIVE GAUSSIAN SPLATTING FOR DYNAMIC DRIVING SCENESPoster
- PANKRAG: ENHANCING GRAPH RETRIEVAL VIA GLOBALLY AWARE QUERY RESOLUTION AND DEPENDENCY-AWARE RERANKING MECHANISMPoster
- PAPER SUMMARY ATTACK: JAILBREAKING LLMS THROUGH LLM SAFETY PAPERSPoster
- PAR: Prompt-Aware Token Reduction Method for Efficient Large Multimodal ModelsPoster
- PARAGSE: PARALLEL GENERATIVE SPEECH ENHANCEMENT WITH GROUP-VECTOR-QUANTIZATION-BASED NEURAL SPEECH CODECPoster
- PARALINGUISTIC EMOTION-AWARE VALIDATION TIMING DETECTION IN JAPANESE EMPATHETIC SPOKEN DIALOGUEPoster
- PARALLEL DELAY-DOPPLER ESTIMATION VIA ORDER-REVERSED TWO-STAGE PRONY METHODPoster
- PAS-SE: PERSONALIZED AUXILIARY-SENSOR SPEECH ENHANCEMENT FOR VOICE PICKUP IN HEARABLESPoster
- PATHFINDER: MCTS AND LLM FEEDBACK-BASED PATH SELECTION FOR MULTI-HOP QUESTION ANSWERINGPoster
- PC-MCL: PATIENT-CONSISTENT MULTI-CYCLE LEARNING WITH MULTI-LABEL BIAS CORRECTION FOR RESPIRATORY SOUND CLASSIFICATIONPoster
- PEEKING INTO THE FUTURE FOR CONTEXTUAL BIASINGPoster
- PENGUIN: GENERAL VITAL SIGN RECONSTRUCTION FROM PPG WITH FLOW MATCHING STATE SPACE MODELOral
- PERCEPTUAL QUALITY OPTIMIZATION OF IMAGE SUPER-RESOLUTIONPoster
- PERFORMANCE-GUIDED REINFORCED ACTIVE LEARNING FOR OBJECT DETECTIONPoster
- PERFORMSINGER: MULTIMODAL SINGING VOICE SYNTHESIS LEVERAGING SYNCHRONIZED LIP CUES FROM SINGING PERFORMANCE VIDEOSPoster
- PERSONAAGENT WITH GRAPHRAG: COMMUNITY-AWARE KNOWLEDGE GRAPHS FOR PERSONALIZED LLMPoster
- PERSONALIZED CELL SEGMENTATION: BENCHMARK AND FRAMEWORK FOR REFERENCE-GUIDED CELL TYPE SEGMENTATIONPoster
- PERSONAPLEX: VOICE AND ROLE CONTROL FOR FULL DUPLEX CONVERSATIONAL SPEECH MODELSOral
- PERSUASION SHOULD BE DOUBLE-BLIND: A MULTI-DOMAIN DIALOGUE DATASET WITH FAITHFULNESS BASED ON CAUSAL THEORY OF MINDPoster
- PFLUXTTS: HYBRID FLOW-MATCHING TTS WITH ROBUST CROSS-LINGUAL VOICE CLONING AND INFERENCE-TIME MODEL FUSIONPoster
- PHASE-ONLY POSITIONING IN DISTRIBUTED MIMO UNDER PHASE IMPAIRMENTS: AP SELECTION USING DEEP LEARNINGOral
- PHASE-RETRIEVAL-BASED PHYSICS-INFORMED NEURAL NETWORKS FOR ACOUSTIC MAGNITUDE FIELD RECONSTRUCTIONPoster
- PHASEMARK: A POST-HOC, OPTIMIZATION-FREE WATERMARKING OF AI-GENERATED IMAGES IN THE LATENT FREQUENCY DOMAINPoster
- PHONEME-LEVEL VISUAL SPEECH RECOGNITION VIA POINT-VISUAL FUSION AND LANGUAGE MODEL RECONSTRUCTIONPoster
- PHONOLOGICAL TOKENIZER: PROSODY-AWARE PHONETIC TOKEN VIA MULTI-OBJECTIVE FINE-TUNING WITH DIFFERENTIABLE K-MEANSPoster
- PHOTOMETRIC STEREO USING GAUSSIAN SPLATTING AND INVERSE RENDERINGPoster
- PHRASED: Phrase Dictionary Biasing for Speech TranslationPoster
- PHYS-DIFF: A PHYSICS-INSPIRED LATENT DIFFUSION MODEL FOR TROPICAL CYCLONE FORECASTINGPoster
- PHYSHDR: WHEN LIGHTING MEETS MATERIALS AND SCENE GEOMETRY IN HDR RECONSTRUCTIONPoster
- PHYSICS-AWARE NOVEL-VIEW ACOUSTIC SYNTHESIS WITH VISION-LANGUAGE PRIORS AND 3D ACOUSTIC ENVIRONMENT MODELINGPoster
- PHYSICS-DRIVEN 3D GAUSSIAN RENDERING FOR ZERO-SHOT MRI SUPER-RESOLUTIONPoster
- PHYSICS-GUIDED DIFFUSION PRIORS FOR MULTI-SLICE RECONSTRUCTION IN SCIENTIFIC IMAGINGOral
- PHYSICS-INFORMED ANOMALY DETECTION OF TERRAIN MATERIAL CHANGE IN RADAR IMAGERYPoster
- PHYSICS-INFORMED DIFFUSION GENERATION FOR GEOMAGNETIC MAP INTERPOLATIONOral
- PHYSICS-INFORMED GNN FOR MEDIUM-HIGH VOLTAGE AC POWER FLOW WITH EDGE-AWARE ATTENTION AND LINE SEARCH CORRECTION OPERATOROral
- PHYSICS-INFORMED VIDEO DIFFUSION FOR SHALLOW WATER EQUATIONSPoster
- PIANOROLL-EVENT: A NOVEL SCORE REPRESENTATION FOR SYMBOLIC MUSICPoster
- PICOAUDIO2: TEMPORAL CONTROLLABLE TEXT-TO-AUDIO GENERATION WITH NATURAL LANGUAGE DESCRIPTIONOral
- PINA: PROMPT INJECTION ATTACK AGAINST NAVIGATION AGENTSPoster
- PLPP: PROMPT LEARNING WITH PERPLEXITY IS SELF-DISTILLATION FOR VISION-LANGUAGE MODELSPoster
- PLUG-AND-PLAY EMOTION GRAPHS FOR COMPOSITIONAL PROMPTING IN ZERO-SHOT SPEECH EMOTION RECOGNITIONPoster
- PLUG-AND-PLAY FORWARD BACKWARD ALGORITHM TO RESTORE LANDSAT IMAGES: A PRELIMINARY STEP TO UNCOVER THE HISTORY OF SURFACE WATERSPoster
- PMMD: A POSE-GUIDED MULTI-VIEW MULTI-MODAL DIFFUSION FOR PERSON GENERATIONPoster
- POLY-SVC: POLYPHONY-AWARE SINGING VOICE CONVERSION WITH HARMONIC MODELINGPoster
- POLYNOMIAL MIXING FOR EFFICIENT SELF-SUPERVISED SPEECH ENCODERSOral
- POSITION-INVARIANT FINE-TUNING OF SPEECH ENHANCEMENT MODELS WITH SELF-SUPERVISED SPEECH REPRESENTATIONSPoster
- POWER CONSUMPTION REDUCTION IN ELAA-ASSISTED ISAC SYSTEMSOral
- PRECISION NEURAL NETWORKS: JOINT GRAPH AND RELATIONAL LEARNINGPoster
- PRECODER DESIGN IN MULTI-USER FDD SYSTEMS WITH VQ-VAE AND GNNPoster
- PREIG: Physics-informed and Reinforcement-driven Interpretable GRU for Commodity Demand ForecastingOral
- PRG: Prompt-Based Distillation Without Annotation via Proxy Relational GraphPoster
- PRINCIPLED COARSE-GRAINED ACCEPTANCE FOR SPECULATIVE DECODING IN SPEECHOral
- PRISM: PROBABILISTIC AND ROBUST INVERSE SOLVER WITH MEASUREMENT-CONDITIONED DIFFUSION PRIOR FOR BLIND INVERSE PROBLEMSOral
- PRISM: Precision-Recall Informed Data-Free Knowledge Distillation via Generative DiffusionPoster
- PRIVACY-AWARE DESIGN OF DISTRIBUTED MIMO ISAC SYSTEMSOral
- PROADS: PROVABLY SECURE AND ROBUST AUDIO DIFFUSION STEGANOGRAPHY WITH LATENT OPTIMIZATION AND BACKWARD EULER INVERSIONPoster
- PROBABILISTIC DEEP DISCRIMINANT ANALYSIS FOR WIND BLADE SEGMENTATIONPoster
- PROBING THE HIDDEN TALENT OF ASR FOUNDATION MODELS FOR L2 ENGLISH ORAL ASSESSMENTPoster
- PROBING WHISPER FOR DYSARTHRIC SPEECH IN DETECTION AND ASSESSMENTPoster
- PROFICIENCY-AWARE ADAPTATION AND DATA AUGMENTATION FOR ROBUST L2 ASRPoster
- PROMPTMAD: CROSS-MODAL PROMPTING FOR MULTI-CLASS VISUAL ANOMALY LOCALIZATIONOral
- PROMPTSEP: GENERATIVE AUDIO SEPARATION VIA MULTIMODAL PROMPTINGOral
- PROPAGATING SIMILARITY, MITIGATING UNCERTAINTY: SIMILARITY PROPAGATION-ENHANCED UNCERTAINTY FOR MULTIMODAL RECOMMENDATIONPoster
- PROSODY-GUIDED HARMONIC ATTENTION FOR PHASE-COHERENT NEURAL VOCODING IN THE COMPLEX SPECTRUMPoster
- PROST-LLM: PROGRESSIVELY ENHANCING THE SPEECH-TO-SPEECH TRANSLATION CAPABILITY IN LLMSPoster
- PSEUDO-SIAMESE NETWORK FOR PLANNING IN TARGET-ORIENTED PROACTIVE DIALOGUESPoster
- PSGS: TEXT-DRIVEN PANORAMA SLIDING SCENE GENERATION VIA GAUSSIAN SPLATTINGPoster
- PSGait: Gait Recognition using Parsing SkeletonPoster
- PTSE-T: PRESENTATION TARGET SPEAKER EXTRACTION USING UNALIGNED TEXT CUESPoster
- PURIFICATION BEFORE FUSION: TOWARD MASK-FREE SPEECH ENHANCEMENT FOR ROBUST AUDIO-VISUAL SPEECH RECOGNITIONPoster
- ParaAegis: Parallel Protection for Flexible Privacy-preserved Federated LearningPoster
- PhysiGen: Integrating Collision-Aware Physical Constraints for High-Fidelity Human-Human Interaction GenerationPoster
- Physics Informed Generative Models for Magnetic Field ImagesPoster
- PictOBI-20k: Unveiling Large Multimodal Models in Visual Decipherment for Pictographic Oracle Bone CharactersPoster
- PocketDVDNet: Realtime Video Denoising for Real Camera NoisePoster
- Position-Aware Self-supervised Representation Learning for Cross-mode Radar Signal RecognitionPoster
- Pre-training Tensor-Train Networks Facilitates Machine Learning with Variational Quantum CircuitsOral
- Predict the Retrieval! Test Time Adaptation for Retrieval Augmented GenerationPoster
- ProKWS: Personalized Keyword Spotting via Collaborative Learning of Phonemes and ProsodyPoster
- ProMist-5K: A Comprehensive Dataset for Digital Emulation of Cinematic Pro-Mist Filter EffectsPoster
- Progressively Texture-Aware Diffusion for Contrast-Enhanced Sparse-View CTPoster
- Prototype-Based Pseudo-Label Denoising for Source-Free Domain Adaptation in Remote Sensing Semantic SegmentationOral
- QA-ReID: Quality-Aware Query-Adaptive Convolution Leveraging Fused Global and Structural Cues for Clothes-Changing ReIDPoster
ICASSP accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.