ICASSP 2024 Accepted Papers
The full list of 2,679 papers accepted at ICASSP 2024 (IEEE International Conference on Acoustics, Speech and Signal Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
- FPN with GMM Based Feature Enhancement Strategy for Object Detection in Remote Sensing Images
- FREmax: A Simple Method Towards Truly Secure Generative Linguistic Steganography
- FSD: An Initial Chinese Dataset for Fake Song Detection
- FUR-API: Dataset and Baselines Toward Realistic API Anomaly Detection
- FW-Shapley: Real-Time Estimation of Weighted Shapley Values
- Face Recognition Using Lensless Camera
- Face Reconstruction from Partially Leaked Facial Embeddings
- Facial Aesthetic Enhancement Network for Asian Faces Based on Differential Facial Aesthetic Activations
- Facial Micro-Motion-Aware Mixup for Micro-Expression Recognition
- Facilitating Message Passing with Potential Links for Knowledge Graph Completion
- Fact-Aware Summarization with Contrastive Learning for Few-Shot Dialogue State Tracking
- Fairness-Aware Job Scheduling for Multi-Job Federated Learning
- Fall Prediction by a Spatio-Temporal Multi-Channel Causal Model from Wearable Sensors Data
- Fast Algorithm Design for the Constant-Envelope Precoding in Massive Mimo Communications with Interference Exploitation
- Fast Alignment Algorithm for Cryo-EM Particle Images Based on Harmonic Analysis
- Fast Approximation of the Generalized Sliced-Wasserstein Distance
- Fast Cross-Modality Knowledge Transfer via a Contextual Autoencoder Transformation
- Fast Dynamics of Brain-wide Patterns on Neuronal Oscillations
- Fast Graph-Based Denoising For Point Cloud Color Information
- Fast Intra Mode Prediction Algorithms for SCBS in VVC SCC
- Fast Personalized Text to Image Synthesis with Attention Injection
- Fast Test Error Rates for Gradient-Based Algorithms on Separable Data
- Fast and Accurate Root Cause Analysis Based on Signalling Messages for 5G Networks
- Fast and Efficient Sequential Radar Parameter Estimation in MIMO-OTFS Systems
- Fast and Physically Enriched Deep Network for Joint Low-Light Enhancement and Image Deblurring
- FastGAT: Simple and Efficient Graph Attention Neural Network with Global-Aware Adaptive Computational Node Attention
- FastInject: Injecting Unpaired Text Data into CTC-Based ASR Training
- Fastmandarin: Efficient Local Modeling for Natural Mandarin Speech Synthesis
- Fearless Steps Apollo: Team Communications Based Community Resource Development for Science, Technology, Education, and Historical Preservation
- Feature Mixing-Based Active Learning for Multi-Label Text Classification
- Feature-Constrained and Attention-Conditioned Distillation Learning for Visual Anomaly Detection
- Feature-Distribution Perturbation and Calibration for Generalized Reid
- FedAQT: Accurate Quantized Training with Federated Learning
- FedLion: Faster Adaptive Federated Optimization with Fewer Communication
- Federated CINN Clustering for Accurate Clustered Federated Learning
- Federated Dataset Dictionary Learning for Multi-Source Domain Adaptation
- Federated Learning of Tensor Generalized Linear Models with low Separation Rank
- Federated Learning on Distributed Graphs Considering Multiple Heterogeneities
- Federated Learning under Restricted user Availability
- Federated Learning via Consensus Mechanism on Heterogeneous Data: A New Perspective on Convergence
- Federated Learning with Instance-Dependent Noisy Label
- Federated PAC-Bayesian Learning on Non-IID Data
- Federated Quantum Machine Learning with Differential Privacy
- Fedmm: Federated Multi-Modal Learning with Modality Heterogeneity in Computational Pathology
- Fedsoda: Federated Cross-Assessment and Dynamic Aggregation for Histopathology Segmentation
- Few-Shot Anomalous Sound Detection Based on Anomaly Map Estimation Using Pseudo Abnormal Data
- Fewer-Token Neural Speech Codec with Time-Invariant Codes
- Filamentary Convolution for Spoken Language Identification: A Brain-Inspired Approach
- Filter-Enhanced Hypergraph Transformer for Multi-Behavior Sequential Recommendation
- FincGAN: A Gan Framework of Imbalanced Node Classification on Heterogeneous Graph Neural Network
- Finding Representative Sampling Subsets on Graphs via Submodularity
- Fine-Grained Discrepancy Contrastive Learning for Robust Fake News Detection
- Fine-Grained Disentangled Representation Learning For Multimodal Emotion Recognition
- Fine-Grained Engine Fault Sound Event Detection Using Multimodal Signals
- Fine-Grained Features Alignment and Fusion for Text-Video Cross-Modal Retrieval
- Fine-Granularity Face Sketch Synthesis
- Fine-Tune the Pretrained ATST Model for Sound Event Detection
- Fine-Tuning Self-Supervised Models for Language Identification Using Orthonormal Constraint
- First-Shot Unsupervised Anomalous Sound Detection with Unknown Anomalies Estimated by Metadata-Assisted Audio Generation
- Fixed Inter-Neuron Covariability Induces Adversarial Robustness
- Flare-Free Vision: Empowering Uformer with Depth Insights
- Flattening Singular Values of Factorized Convolution for Medical Images
- Flexible Keyword Spotting Based on Homogeneous Audio-Text Embedding
- Flipping Consistent and Counterfactual Attention Network for Facial Expression Recognition
- Focus Fusion Network for Visible and Infrared Image Fusion
- Folding Attention: Memory and Power Optimization for On-Device Transformer-Based Streaming Speech Recognition
- Following the Embedding: Identifying Transition Phenomena in Wav2vec 2.0 Representations of Speech Audio
- Forecasting Torsional Resonance in Electric Vehicles by Learning a Quantile Regressor
- Forgetting Private Textual Sequences in Language Models Via Leave-One-Out Ensemble
- Foundation Model Assisted Automatic Speech Emotion Recognition: Transcribing, Annotating, and Augmenting
- Fourier Domain Approach for Galaxy Spectra Decontamination and Deconvolution
- Fovea Transformer: Efficient Long-Context Modeling with Structured Fine-To-Coarse Attention
- Fracture Assembly with Segmentation And Iterative Registration
- Frame-Level Emotional State Alignment Method for Speech Emotion Recognition
- Frame-Wise Streaming end-to-end Speaker Diarization with Non-Autoregressive Self-Attention-Based Attractors
- Frame-to-Utterance Convergence: A Spectra-Temporal Approach for Unified Spoofing Detection
- FreeTalker: Controllable Speech and Text-Driven Gesture Generation Based on Diffusion Models for Enhanced Speaker Naturalness
- Freeze the Backbones: a Parameter-Efficient Contrastive Approach to Robust Medical Vision-Language Pre-Training
- Fregrad: Lightweight and Fast Frequency-Aware Diffusion Vocoder
- Freq2Time: Weakly Supervised Learning of Camera-Based RPPG from Heart Rate
- Frequency Analysis and Filter Design for Directed Graphs with Polar Decomposition
- Frequency Aware and Graph Fusion Network for Polyp Segmentation
- Frequency Estimation via Sub-Nyquist Unlimited Sampling
- Frequency Masking for Universal Deepfake Detection
- Frequency-Domain Signal Reconstruction for Dynamic Time-Domain Weighting Hybrid Precoding with Beam Squint
- Friends to Help: Saving Federated Learning from Client Dropout
- From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
- From Convolutional Sparse Coding To *-NMF Factorization of Time-Frequency Coefficients
- From Game Theory to Visual Recognition: Advancing DNN Robustness
- From RIR to BRIR: A Sparse Recovery Beamforming Approach for Virtual Binaural Sound Rendering
- Fspen: an Ultra-Lightweight Network for Real Time Speech Enahncment
- FunCodec: A Fundamental, Reproducible and Integrable Open-Source Toolkit for Neural Speech Codec
- Functional Emotion Transformer for EEG-Assisted Cross-Modal Emotion Recognition
- Functional Invariants To Watermark Large Transformers
- Functionally Similar Multi-Label Knowledge Distillation
- Fundamental Limits of Direction Finding in Distributed Arrays Exploiting Auxiliary Sources
- Fundamental Performance Bounds for Carrier Phase Positioning in LEO-PNT Systems
- Further Results on the Design Of Real-Valued Wideband Beamformers Using Adaptive-Array-Theory-Inspired Weighted Least Squares
- FusDom: Combining in-Domain and Out-of-Domain Knowledge for Continuous Self-Supervised Learning
- Fusing Modality-Specific Representations and Decisions for Multimodal Emotion Recognition
- Fusing Multi-Level Features from Audio and Contextual Sentence Embedding from Text for Interview-Based Depression Detection
- Fusing Structure and Appearance Features in Facial Expression Recognition Transformer
- Fusion of Audio and Visual Embeddings for Sound Event Localization and Detection
- Fusion of Multi-Resolution Seismic Tomography Maps with Physics-Informed Probability Graphical Models
- G-SHARP: Globally Shared Kernel with Pruning for Efficient CNNs
- G2G: Generalized Learning by Cross-Domain Knowledge Transfer for Federated Domain Generalization
- G2PU: Grapheme-To-Phoneme Transducer with Speech Units
- GAMAFlow: Estimating 3D Scene Flow via Grouped Attention and Global Motion Aggregation
- GASS: Generalizing Audio Source Separation with Large-Scale Data
- GBSD: Generative Bokeh with Stage Diffusion
- GCC-PHAT Re-Imagined - A U-Net Filter for Audio TDOA Peak-Selection
- GCIA: A Black-Box Graph Injection Attack Method Via Graph Contrastive Learning
- GEmo-CLAP: Gender-Attribute-Enhanced Contrastive Language-Audio Pretraining for Accurate Speech Emotion Recognition
- GFMAE: Self-Supervised GNN-Free Masked Autoencoders
- GI-PIP: Do We Require Impractical Auxiliary Dataset for Gradient Inversion Attacks?
- GLA-GRAD: A Griffin-Lim Extended Waveform Generation Diffusion Model
- GLMAE: Graph Representation Learning Method Combining Generative Learning and Masking Autoencoder
- GLMB 3D Speaker Tracking with Video-Assisted Multi-Channel Audio Optimization Functions
- GM-VRC: Semantic Topological Data Ensemble Approach for EEG Signal Classification
- GMM-ResNet2: Ensemble of Group Resnet Networks for Synthetic Speech Detection
- GMTR: Graph Matching Transformers
- GPT-4 Driven Cinematic Music Generation Through Text Processing
- GPTCN: Gated Parallel Transformer Convolutional Networks for Downstream-Task User Representation Learning on App Usage
- GR0: Self-Supervised Global Representation Learning for Zero-Shot Voice Conversion
- GSTNet: Gait Spatio-Temporal Network for Gait Recognition Using Millimeter-Wave Radar
- GTCRN: A Speech Enhancement Model Requiring Ultralow Computational Resources
- GaP-Aug: Gamma Patch-Wise Correction Augmentation Method for Respiratory Sound Classification
- GeneFormer: Learned Gene Compression using Transformer-Based Context Modeling
- General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
- Generalizable Two-Branch Framework for Image Class-Incremental Learning
- Generalization of Self-Supervised Learning-Based Representations for Cross-Domain Speech Emotion Recognition
- Generalized Deterministic-Random Tradeoff of Integrated Sensing and Communications: The Sensing-Optimal Operating Point
- Generalized Hole-Filling Strategy for Overlapping Hole-Existing Coprime Arrays for DOA Estimation
- Generalized Multi-Source Inference for Text Conditioned Music Diffusion Models
- Generalized Specaugment via Multi-Rectangle Inverse Masking For Acoustic Scene Classification
- Generalized Uncertainty-Based Evidential Fusion with Hybrid Multi-Head Attention for Weak-Supervised Temporal Action Localization
- Generating High-Quality Adversarial Examples with Universal Perturbation-Based Adaptive Network and Improved Perceptual Loss
- Generating Persona-Aware Empathetic Responses with Retrieval-Augmented Prompt Learning
- Generating Stereophonic Music with Single-Stage Language Models
- Generation or Replication: Auscultating Audio Latent Diffusion Models
- Generation-Based Target Speech Extraction with Speech Discretization and Vocoder
- Generative Al-aided Joint Training-free Secure Semantic Communications via Multi-modal Prompts
- Generative Context-Aware Fine-Tuning of Self-Supervised Speech Models
- Generative De-Quantization for Neural Speech Codec Via Latent Diffusion
- Generative Extension Positive Pairs and Improving Sample Selection Based on Contrastive Learning for Unsupervised Person Re-Identification
- Geodesic Interpolation of Frame-Wise Speaker Embeddings for the Diarization of Meeting Scenarios
- Geometry Compression Artifact Removal for V-PCC over a Wide Bitrate Range
- Geometry-Corrected Geodesic Motion Modeling with Per-Frame Camera Motion for 360-Degree Video Compression
- Gesture Generation Via Diffusion Model with Attention Mechanism
- Glance, Focus and Refinement Network for Remote Sensing Change Detection
- Glancing Future for Simultaneous Machine Translation
- Gland Instance Segmentation by Full Resolution Multi-Scale Dilation Residual Networks
- Gland Segmentation Via Dual Encoders and Boundary-Enhanced Attention
- Global Convergence of Alternating Direction Method of Multipliers for Invex Objective Losses
- Global Optimization of Active RIS in Linear Time
- Globally Optimal Beamforming Design for Integrated Sensing and Communication Systems
- Glocal Cascading Network for Topic Enhanced Visual Storytelling
- Gmm-Resnext: Combining Generative and Discriminative Models for Speaker Verification
- Gradient Inversion Attacks on Acoustic Signals: Revealing Security Risks in Audio Recognition Systems
- Gradient Reactivation Enhanced Causal Attention for Out-Of-Distribution Generalizable Graph Classification
- Gradient Weighting for Speaker Verification in Extremely Low Signal-to-Noise Ratio
- Gradient and Brightness Guided Low-Light Enhancement with Attention-Based Self-Paced Learning
- Gradient-Aware Logit Adjustment Loss for Long-Tailed Classifier
- Gradient-Based Dimensionality Reduction for Speech Emotion Recognition Using Deep Networks
- Gradually Spatio-Temporal Feature Activation for Target Tracking
- Granger Connectivity Analysis as a Block-Term Tensor Regression for eSport Players
- Graph Convolutional Neural Networks In The Companion Model
- Graph Identification and Upper Confidence Evaluation for Causal Bandits with Linear Models
- Graph Local-Smooth Dictionary Learning
- Graph Networks Stand Strong: Enhancing Robustness via Stability Constraints
- Graph Neural Networks are More Powerful than We Think
- Graph Signal Processing: The 2D Companion Model
- Graph-Aware Multi-View Fusion for Rumor Detection on Social Media
- Graph-Based Environment Representation for Vision-and-Language Navigation in Continuous Environments
- Graph-Based Permutation Patterns for the Analysis of Task-Related FMRI Signals on DTI Networks in Mild Cognitive Impairment
- Graph-Enhanced Hybrid Sampling for Multi-Armed Bandit Recommendation
- Graphical Inference in Non-Markovian Linear-Gaussian State-Space Models
- Gravitated Latent Space Loss Generated by Metric Tensor for High-Dynamic Range Imaging
- Gridless Parameter Estimation in Partly Calibrated Rectangular Arrays
- Grounded-Instruct-Pix2Pix: Improving Instruction Based Image Editing with Automatic Target Grounding
- GuessKT: Improving Knowledge Tracing via Considering Guess Behaviors
- HADGEO: Image Based 3-DoF Cross-View Geo-Localization with Hard Sample Mining
- HAFFormer: A Hierarchical Attention-Free Framework for Alzheimer's Disease Detection From Spontaneous Speech
- HAROOD: Human Activity Classification and Out-Of-Distribution Detection with Short-Range FMCW Radar
- HDPNERF: Hybrid Depth Priors for Neural Radiance Fields from Sparse Input Views
- HENet: Hyperbolic-Based Encoder-Decoder Network for Word Spotting in Historical Mongolian Documents
- HIQ: One-Shot Network Quantization for Histopathological Image Classification
- HLS-FGVC: Hierarchical Label Semantics Enhanced Fine-Grained Visual Classification
- HM-CONFORMER: A Conformer-Based Audio Deepfake Detection System with Hierarchical Pooling and Multi-Level Classification Token Aggregation Methods
- HMM-based CSI Embedding for Trajectory Recovery from RSS Measurements of Non-Cooperative Devices
- HMNet: Hierarchical Microscale-Aware Network for Infrared Small Target Detection
- HOICS: Zero-Shot Hoi Detection via Compatibility Self-Learning
- HRTF Recommendation Based on the Predicted Binaural Colouration Model
- Haformer: Heterogeneous Aggregation Transformer for Single Image Deraining
- HaltingVT: Adaptive Token Halting Transformer for Efficient Video Recognition
- Hardware Impairments-Aware Design of noncoherent Grassmannian Constellations
- Hardware-Algorithm Co-Design Enabling Processing-In-Pixel-In-Memory (P2M) for Neuromorphic Vision Sensors
- Hardware-Limited Time Constant Estimation Using a Weighted Linear Regression
- Harmonic Retrieval for Non-Circular Coherent Signals via Double Decoupled Atomic Norm Minimization
- Hazy Remote Sensing Images Semantic Segmentation for Weakly Annotation Based on Saliency-Aware Alignment Strategy
- Hdrtvformer: Efficient Sdrtv-to-Hdrtv via Affine Transformation and Spatial-Aware Transformer
- Healthy Aging is Marked by Entropy Reduction in Cortical Spontaneous Activity
- Hear-Your-Action: Human Action Recognition by Ultrasound Active Sensing
- Hearing Loss Detection From Facial Expressions in One-On-One Conversations
- Heart Rate Variability Estimation with Dynamic Fine Filtering and Global-Local Context Outlier Removal
- Heterogeneous Face Recognition Using Domain Invariant Units
- Heuristic-Driven, Type-Specific Embedding in Parallel Spaces for Enhancing Knowledge Graph Reasoning
- Hierarchical Attacks on Large-Scale Graph Neural Networks
- Hierarchical Cross-Modality Knowledge Transfer with Sinkhorn Attention for CTC-Based ASR
- Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
- Hierarchical Home Action Understanding with Implicit and Explicit Prior Knowledge
- Hierarchical Metadata Information Constrained Self-Supervised Learning for Anomalous Sound Detection under Domain Shift
- Hierarchical Speaker Representation for Target Speaker Extraction
- Hierarchical VAE Based Semantic Communications for POMDP Tasks
- High Accuracy Device Localization in Indoor Mmwave Networks Exploiting Channel Sparsity and Virtual Anchor Mapping
- High Resolution Guitar Transcription Via Domain Adaptation
- High Resolution Image Quality Database
- High-Accuracy Anxiety Disorder Identification Through Subspace-Enhanced Hypergraph Neural Network
- High-Fidelity Speech Synthesis with Minimal Supervision: All Using Diffusion Models
- High-Resolution Through-Wall Imaging Using Data Fusion and Reasoning
- Higher Order Multiple Graph Filtering for Structured Graph Learning
- Highlight Removal Network Based on an Improved Dichromatic Reflection Model
- Hint-Enhanced In-Context Learning Wakes Large Language Models Up For Knowledge-Intensive Tasks
- Hodge-Aware Contrastive Learning
- Hot-Fixing Wake Word Recognition for End-to-End ASR Via Neural Model Reprogramming
- Hourglass-AVSR: Down-Up Sampling-Based Computational Efficiency Model for Audio-Visual Speech Recognition
- How Can Personalized Context Help? Exploring Joint Retrieval of Passage and Personalized Context
- How Does End-To-End Speech Recognition Training Impact Speech Enhancement Artifacts?
- How Secure is the Time-Modulated Array-Enabled OFDM Directional Modulation?
- How to Bridge Graph and Sequence Patterns in Session-Based Recommendation? A Self-Supervised Method
- Hubertopic: Enhancing Semantic Representation of Hubert Through Self-Supervision Utilizing Topic Model
- Human Guided Cross-Modal Reasoning with Semantic Attention Learning for Visual Question Answering
- Human Motion Capture Data Segmentation Based on ST-GCN
- Human Motion Generation via Conditioned GMVAE with TUNet
- Human Perception-Guided Meta-Training for Few-Shot NeRF
- Humtrans: A Novel Open-Source Dataset for Humming Melody Transcription and Beyond
- HySense: Hybrid Event Occurrence Detection Method for IoT Devices
- Hybrid Attention Time-Frequency Analysis Network for Single-Channel Speech Enhancement
- Hybrid Convolution-Transformer for Lightweight Single Image Super-Resolution
- Hybrid Domain Learning towards Light Field Spatial Super-Resolution using Heterogeneous Imaging
- Hybrid Module with Multiple Receptive Fields and Self-Attention Layers for Medical Image Segmentation
- Hyperbolic Diffusion Procrustes Analysis for Intrinsic Representation of Hierarchical Data Sets
- Hyperbolic Distance-Based Speech Separation
- Hyperganstrument: Instrument Sound Synthesis and Editing With Pitch-Invariant Hypernetworks
- Hypergraph Transformer for Semi-Supervised Classification
- Hypergraph-Enhanced Self-Supervised Robust Graph Learning for Social Recommendation
- Hypergraph-Mlp: Learning on Hypergraphs Without Message Passing
- Hyperspectral Image Reconstruction Using Hierarchical Neural Architecture Search from A Snapshot Image
- Hystoc: Obtaining Word Confidences for Fusion of End-To-End ASR Systems
- I3FDM: IRIS Inpainting Via Inverse Fusion of Diffusion Models
- IFNET: Integrating Data Augmentation and Decoupled Attention Fusion for 3D Object Detection
- IFNet: Imaging and Focusing Network for handheld mmWave Devices
- IHT-Inspired Neural Network for Single-Snapshot DOA Estimation with Sparse Linear Arrays
- IMFIT: Normal Estimation via Learning Neural Implicit Surface
- INCPrompt: Task-Aware Incremental Prompting for Rehearsal-Free Class-Incremental Learning
- IPCL: Iterative Pseudo-Supervised Contrastive Learning to Improve Self-Supervised Feature Representation
- IRLSG: Invariant Representation Learning for Single-Domain Generalization in Medical Image Segmentation
- IRS-Assisted Covert Communication with a BPP Distributed Warden outside a Safety Zone
- IRS-Assisted Joint Sensing and Communication Design for Autonomous Driving
- Identifiability Analysis of Sensor Arrays with Sensors off Half-Wavelength Grid
- Identifiability Study of Near-Field Automotive SAR
- Identifying Attack-Specific Signatures in Adversarial Examples
- Image Aesthetics Assessment Via Learnable Queries
- Image Attribution by Generating Images
- Image Augmentation with Controlled Diffusion for Weakly-Supervised Semantic Segmentation
- Image Coding for Analytics via Adversarially Augmented Adaptation
- Image Harmonization Based on Hierarchical Dynamics
- Image Mixing and Gradient Smoothing to Enhance the SAR Image Attack Transferability
- Image Restoration with Generalized L2 Loss and Convergent Plug-and-Play Priors
- Image Retrieval with Composed Query by Multi-Scale Multi-Modal Fusion
- Image Steganography with Deep Orthogonal Fusion of Multi-Scale Channel Attention
- Image2Points: A 3D Point-Based Context Clusters GAN for High-Quality Pet Image Reconstruction
- Imaging An Evolving Black Hole By Leveraging Shared Structure
- Imitating the Human Visual System for Scanpath Predicting
- Impact of Sampling Strategies on the Monitoring of Climate Regime Shifts with a Learning Data Assimilation Method
- Implicit Enhancement of Target Speaker in Speaker-Adaptive ASR through Efficient Joint Optimization
- Implicit Foreground-Guided Network for Anomaly Detection and Localization
- Implicit Neural Multiple Description for DNA-Based Data Storage
- Implicit Neural Representation For Low-Overhead Graph-Based Holographic-Type Communications
- Implicit-Knowledge-Guided Align Before Understanding for KB-VQA
- Importance Sampling Based Federated Unsupervised Representation Learning
- Importance of Negative Sampling in Weak Label Learning
- Imposing Early and Asymptotic Constraints on Ligme with Application to Nonconvex Enhancement of Fused Lasso Models
- Improve Deep Forest with Learnable Layerwise Augmentation Policy Schedules
- Improved Children's Automatic Speech Recognition Combining Adapters and Synthetic Data Augmentation
- Improved Image Captioning Via Knowledge Graph-Augmented Models
- Improved Screen Content Coding in VVC Using Soft Context Formation
- Improving ASR Contextual Biasing with Guided Attention
- Improving Acoustic Echo Cancellation by Exploring Speech and Echo Affinity with Multi-Head Attention
- Improving Acoustic Echo Cancellation for Voice Assistants Using Neural Echo Suppression and Multi-Microphone Noise Reduction
- Improving Attention-Based End-to-End Speech Recognition by Monotonic Alignment Attention Matrix Reconstruction
- Improving Audio Captioning Models with Fine-Grained Audio Features, Text Embedding Supervision, and LLM Mix-Up Augmentation
- Improving Biomedical Entity Linking with Retrieval-Enhanced Learning
- Improving Chinese Spelling Correction with Text-Phonetics Differentiation and Adaptive Fusion
- Improving Continual Learning of Acoustic Scene Classification via Mutual Information Optimization
- Improving Cross-Domain Few-Shot Classification with Multilayer Perceptron
- Improving Design of Input Condition Invariant Speech Enhancement
- Improving Domain Generalization in Speech Emotion Recognition with Whisper
- Improving Kinyarwanda Speech Recognition Via Semi-Supervised Learning
- Improving Language Model-Based Zero-Shot Text-to-Speech Synthesis with Multi-Scale Acoustic Prompts
- Improving Learned Video Compression by Exploring Spatial Redundancy
- Improving Limited Supervised Foot Ulcer Segmentation Using Cross-Domain Augmentation Strategies
- Improving Long Text Understanding with Knowledge Distilled from Summarization Model
- Improving Medical Dialogue Generation with Abstract Meaning Representations
- Improving Motion Deblur By Multi-Output Learning
- Improving Multi-Modal Emotion Recognition Using Entropy-Based Fusion and Pruning-Based Network Architecture Optimization
- Improving Multi-Speaker ASR With Overlap-Aware Encoding And Monotonic Attention
- Improving Music Source Separation with Simo Stereo Band-Split Rnn
- Improving Neural Diarization through Speaker Attribute Attractors and Local Dependency Modeling
- Improving Open-Set Recognition with Bayesian Metric Learning
- Improving Oral Reading Fluency Assessment Through Sub-Sequence Matching of Acoustic Word Embeddings
- Improving Radiology Report Generation with D2-Net: When Diffusion Meets Discriminator
- Improving Short Utterance Anti-Spoofing with Aasist2
- Improving Speaker-Independent Speech Emotion Recognition using Dynamic Joint Distribution Adaptation
- Improving Speech Attenuation in Headphones using Harmonic Model Decomposition and Multiple-Frequency ANC
- Improving Speech Emotion Recognition with Unsupervised Speaking Style Transfer
- Improving Speech Recognition for African American English with Audio Classification
- Improving Speed/Accuracy Tradeoff for Online Streaming ASR via Real-Valued and Trainable Strides
- Improving Target Sound Extraction with Timestamp Knowledge Distillation
- Improving VGG-Style Convnet for JPEG Steganalysis
- Improving Vision-Inspired Keyword Spotting Using Dynamic Module Skipping in Streaming Conformer Encoder
- Improving Visual Quality and Transferability of Adversarial Attacks on Face Recognition Simultaneously with Adversarial Restoration
- In-Context Learning for Few-Shot Nested Named Entity Recognition
- In-Context Prompt Editing for Conditional Audio Generation
- In-The-Wild Physiological-Based Stress Detection Using Federated Strategy
- Incomplete Multi-View Clustering Via Inference and Evaluation
- Incomplete Multi-View Representation Learning Through Anchor Graph-Based GCN and Information Bottleneck
- Incomplete Observations Bias Suppression for Abductive Natural Language Inference
- Incremental Tensor Decomposition for Few Shot Neural Radiance Field
- Inducing Inductive Bias in Vision Transformer for EEG Classification
- Inference of Genetic Effects via Approximate Message Passing
- Inference of Time-Varying Graph Topologies via Gaussian Processes
- Inferring Time Varying Signals over Uncertain Graphs
- Inferring the Graph of Networked Dynamical Systems under Partial Observability and Spatially Colored Noise
- Innovative Methods for Non-Destructive Inspection of Handwritten Documents
- Inputmix: A Strategy to Regularize and Balance Multi-Modality and Multi-View Model Learning
- Instant Photorealistic Neural Radiance Fields Stylization
- Integrated Localization and Communication in 3GPP Industrial Environments
- Integrated Sensing And Communication In Unlicensed Mmwave Bands: Joint Beamforming Training And Energy Allocation
- Integrating Language Models with Symbolic Formulas for First-Order Logic Reasoning
- Integrating Sensing, Communication, and Computation in the Sky
- Intelligent Cardiac Auscultation for Murmur Detection via Parallel-Attentive Models with Uncertainty Estimation
- Inter-Modality and Intra-Sample Alignment for Multi-Modal Emotion Recognition
- Internal Location Assistance for Temporal Action Proposal Generation
- Interpretable Face Aging: Enhancing Conditional Adversarial Autoencoders with Lime Explanations
- Interpretable Multimodal Out-of-Context Detection with Soft Logic Regularization
- Interpretable Policy Extraction with Neuro-Symbolic Reinforcement Learning
- Interpreting Memorization in Deep Learning from Data Distribution
- Introducing Multilingual Phonetic Information to Speaker Embedding for Speaker Verification
- Invariant Motion Representation Learning for 3D Talking Face Synthesis
- InvariantOODG: Learning Invariant Features of Point Clouds for Out-of-Distribution Generalization
- Inversive-Reasoning Augmentation for Natural Language Inference
- InvertedFontNet: Font Watermarking based on Perturbing Style Manifold
- Invertible Mosaic Image Hiding Network for Very Large Capacity Image Steganography
- Invertible Voice Conversion with Parallel Data
- Investigating End-to-End ASR Architectures for Long Form Audio Transcription
- Investigating Personalization Methods in Text to Music Generation
- Investigating Salient Representations and Label Variance in Dimensional Speech Emotion Analysis
- Investigating Self-Supervised Deep Representations for EEG-Based Auditory Attention Decoding
- Investigating the Clusters Discovered By Pre-Trained AV-HuBERT
- Iphonmatchnet: Zero-Shot User-Defined Keyword Spotting Using Implicit Acoustic Echo Cancellation
- Irregularity-Aware Bandlimited Approximation for Graph Signal Interpolation
- Isac Beamforming Optimization For Robust Transmission In Dynamic Mmwave Mimo Networks
- Iterative Autoregressive Generation for Abstractive Summarization
- Iteratively Preconditioned Guidance of Denoising (Diffusion) Models For Image Restoration
- J-MAE: Jigsaw Meets Masked Autoencoders in X-Ray Security Inspection
- JM-CLIP: A Joint Modal Similarity Contrastive Learning Model for Video-Text Retrieval
- JPEG Encryption with DC Prediction and Run-Based RS Pairs Permutation
- JPIS: A Joint Model for Profile-Based Intent Detection and Slot Filling with Slot-to-Intent Attention
- Joint Admission Control and Beamformer Design for Mobile Users: Stay Here or Move to a Better Position?
- Joint Beamforming and Compression Design for Per-Antenna Power Constrained Cooperative Cellular Networks
- Joint Blind Deconvolution And Demixing Of Sparse Signals Via Factorization And Nonconvex Optimization
- Joint Channel Estimation and Data Detection in Massive Mimo Systems Based on Diffusion Models
- Joint Classification of Hyperspectral and Lidar Data Using Cross-Modal Hierarchical Frequency Fusion Network
- Joint Computing and Communication Resource Allocation for TDMA-Based Binary Computation Offloading
- Joint DOA Estimation and Distorted Sensor Detection Under Entangled Low-Rank and Row-Sparse Constraints
- Joint Demosaicing And Denoising With Double Deep Image Priors
- Joint Embedding Learning and Latent Subspace Probing for Cross-Domain Few-Shot Keyword Spotting
- Joint End-to-End Spoken Language Understanding and Automatic Speech Recognition Training Based on Unified Speech-to-Text Pre-Training
- Joint INDSCAL Decomposition Meets Blind Source Separation
- Joint Inference of Speaker Diarization and ASR with Multi-Stage Information Sharing
- Joint Learning of Identity and Vein Features for Enhanced Representations in Vascular Biometrics
- Joint Multi-Band DOA Estimation Using Low-Rank Matrix Recovery
- Joint Multi-Facts Reasoning Network for Complex Temporal Question Answering Over Knowledge Graph
- Joint Music and Language Attention Models for Zero-Shot Music Tagging
- Joint Near-Field Target Tracking and Communications with full Duplex Holographic MIMO
- Joint Robust Optimal Transmit and Receive Beamforming Designs for a DFRC System for the MIMO Radar and Secondary Multicast Communication in a Cognitive Radio Network
- Joint Signal Interpolation / Time-Varying Graph Estimation Via Smoothness and Low-Rank Priors
- Joint Signal Recovery and Graph Learning from Incomplete Time-Series
- Joint Spatio-Temporal Filtering of Motion Imagery EEG Signals for Data Alignment in Transfer Learning
- Joint Transmit Precoders and Passive Reflection Beamformer Design in IRS-Aided IoT Networks
- Joint Unsupervised and Supervised Training for Automatic Speech Recognition via Bilevel Optimization
- Joint-Semantics Multi-Similarity Hashing for Cross-Modal Retrieval
- Jointly Learning Selection Matrices for Transmitters, Receivers and Fourier Coefficients in Multichannel Imaging
- K-Means Clustering Based on Chebyshev Polynomial Graph Filtering
- KC-Prompt: End-To-End Knowledge-Complementary Prompting for Rehearsal-Free Continual Learning
- KD-Former: Transformer Knowledge Distillation for Image Matting
- KNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
- Kalman Filter for Tracking Network Dynamic
- Kalman Filtering With Unlimited Sensing
- Keep Decoding Parallel With Effective Knowledge Distillation From Language Models To End-To-End Speech Recognisers
- Keep Knowledge in Perception: Zero-Shot Image Aesthetic Assessment
- Kenet: Knowledge-Enhanced DOC-Label Attention Network for Multi-Label Text Classification
- Key Points Centered Sparse Hashing for Cross-Modal Retrieval
- Killing It With Zero-Shot: Adversarially Robust Novelty Detection
- Knowledge-Aware Prompt Learning Framework for Korean-Chinese Microblog Sentiment Analysis
- Knowledge-Based Convolutional Neural Network for the Simulation and Prediction of Two-Phase Darcy Flows
- L1-Aware Multilingual Mispronunciation Detection Framework
- LCB-Net: Long-Context Biasing for Audio-Visual Speech Recognition
- LEFormer: A Hybrid CNN-Transformer Architecture for Accurate Lake Extraction from Remote Sensing Imagery
- LITEVSR: Efficient Visual Speech Recognition by Learning from Speech Representations of Unlabeled Data
- LK-UNet: Large Kernel Design for 3D Medical Image Segmentation
- LLET: Lightweight Lexicon-Enhanced Transformer for Chinese NER
- LOCSELECT: Target Speaker Localization with an Auditory Selective Hearing Mechanism
- LOFT: Latent Space Optimization and Generator Fine-Tuning for Defending Against Deepfakes
- LV-SEGFORMER: Towards More Accurate Leaf-Vein Segmentation with Transformer
- LVC-LGMC: Joint Local and Global Motion Compensation for Learned Video Compression
- LaCViT: A Label-Aware Contrastive Fine-Tuning Framework for Vision Transformers
- LabCLIP: Label-Enhanced Clip for Improving Zero-Shot Text Classification
- Label Correction For Sketch-Based 3d Shape Retrieval
- Label Dependencies-Aware Set Prediction Networks for Multi-Label Text Classification
- Label Rectified and Graph Adaptive Semi-Supervised Regression for Electrode Shifted Gesture Recognition
- Label-Aware Auxiliary Learning for Dialogue State Tracking
- Language Guided Adversarial Purification
- Language Model is a Branch Predictor for Simultaneous Machine Translation
- Language-Driven Open-Vocabulary 3D Semantic Segmentation with Knowledge Distillation
- Language-Driven Ordinal Learning for Imbalanced Head Pose Estimation
- Language-Free Compositional Action Generation via Decoupling Refinement
- Language-Guided Few-Shot Semantic Segmentation
- Language-Oriented Communication with Semantic Coding and Knowledge Distillation for Text-to-Image Generation
- Langwave: Realistic Voice Generation Based on High-Order Langevin Dynamics
- Large Covariance Matrix Estimation Based on Factor Models via Nonconvex Optimization
- Large Language Model-Based Emotional Speech Annotation Using Context and Acoustic Feature for Speech Emotion Recognition
- Large Language Models As A Proxy For Human Evaluation In Assessing The Comprehensibility Of Disordered Speech Transcription
- Large Language Models Augmented Rating Prediction in Recommender System
- Large Scale Self-Supervised Pretraining for Active Speaker Detection
- Large-Scale Multi-View Multiple Clustering
- Latent Degradation Representation Constraint for Single Image Deraining
- Latent Filling: Latent Space Data Augmentation for Zero-Shot Speech Synthesis
- Leaky Waveguide Antennas for Downlink Wideband THz Communications
- Learn From Zoom: Decoupled Supervised Contrastive Learning For WCE Image Classification
- Learn to Cluster Faces with Better Subgraphs
- Learn to Track-Before-Detect via Neural Dynamic Programming
- Learnable Statistical Moments Pooling for Automatic Modulation Classification
- Learned ISTA with Error-Based Thresholding for Adaptive Sparse Coding
- Learned Layered Coding for Successive Refinement in the Wyner-Ziv Problem
- Learned Video Compression with Spatial-Temporal Optimization
- Learning Active Subspaces for Effective and Scalable Uncertainty Quantification in Deep Neural Networks
- Learning Arousal-Valence Representation from Categorical Emotion Labels of Speech
- Learning Audio Concepts from Counterfactual Natural Language
- Learning Contextualized Representation on Discrete Space Via Hierarchical Product Quantization
- Learning Density Regulated and Multi-View Consistent Unsigned Distance Fields
- Learning Discriminative Style Representations for Unsupervised and Few-Shot Artistic Portrait Drawing Generation
- Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
- Learning Dynamics of Low-Precision Clipped SGD with Momentum
- Learning Emotion-Invariant Speaker Representations for Speaker Verification
- Learning Fine-Grained Information Alignment for Calibrated Cross-Modal Retrieval
- Learning Generalizable Visual Representations via Self-Supervised Information Bottleneck
- Learning Graphs and Simplicial Complexes from Data
- Learning Hybrid Negative Probability Model for Weakly-Supervised Whole Slide Image Recognition
- Learning Inference-Time Drift Sensor-Actuator for Domain Generalization
- Learning Invariant Representation with Consistency and Diversity for Semi-Supervised Source Hypothesis Transfer
- Learning Multiplex Graph With Inter-Layer Coupling
- Learning Multiscale Consistency for Self-Supervised Electron Microscopy Instance Segmentation
- Learning Ontology Informed Representations with Constraints for Acoustic Event Detection
- Learning Representations from Explainable and Connectionist Approaches for Visual Question Answering
- Learning Semantic Information from Raw Audio Signal Using Both Contextual and Phonetic Representations
- Learning Signals and Graphs from Time-Series Graph Data with Few Causes
- Learning Spatio-Temporal Relations with Multi-Scale Integrated Perception for Video Anomaly Detection
- Learning Speaker-Listener Mutual Head Orientation by Leveraging HRTF and Voice Directivity on Headphones
- Learning Spectral Canonical ℱ-Correlation Representation for Face Super-Resolution
- Learning Speech Representation from Contrastive Token-Acoustic Pretraining
- Learning With Non-Uniform Label Noise: A Cluster-Dependent Weakly Supervised Approach
- Learning a Convex Patch-Based Synthesis Model via Deep Equilibrium
- Learning a Low-Rank Feature Representation: Achieving Better Trade-Off Between Stability and Plasticity in Continual Learning
- Learning from Easy to Hard: Multi-Task Learning with Data Scheduling
- Learning from Taxonomy: Multi-Label Few-Shot Classification for Everyday Sound Recognition
- Learning the Barankin Lower Bound on DOA Estimation Error
- Least-Effort Adversarial Attack Against Gait-Based Identity Recognition System
- Lesion-Aware Open Set Medical Image Recognition with Domain Shift
- Less Peaky and More Accurate CTC Forced Alignment by Label Priors
- Leverage Causal Graphs and Rumor-Refuting Texts for Interpretable Rumor Analysis
- Leveraging Biases in Large Language Models: "bias-kNN" for Effective Few-Shot Learning
- Leveraging Data Collection and Unsupervised Learning for Code-Switched Tunisian Arabic Automatic Speech Recognition
- Leveraging Large Language Models for Exploiting ASR Uncertainty
- Leveraging Large Pretrained Models for Line-by-Line Spoken Program Recognition
- Leveraging Noisy Labels of Nearest Neighbors for Label Correction and Sample Selection
- Leveraging Redundancy in Feature for Efficient Learned Image Compression
- Leveraging Self-Supervised Speech Representations for Domain Adaptation in Speech Enhancement
- Leveraging Sound Localization to Improve Continuous Speaker Separation
- Leveraging Speech PTM, Text LLM, And Emotional TTS For Speech Emotion Recognition
- Leveraging Tensor Subspace Prior: Enhanced Sum of Nuclear Norm Minimization for Tensor Completion
- Leveraging Timestamp Information for Serialized Joint Streaming Recognition and Translation
- Leveraging Visual Handicaps for Text-Based Reinforcement Learning
- Leveraging in-the-wild Data for Effective Self-supervised Pretraining in Speaker Recognition
- Libriheavy: A 50, 000 Hours ASR Corpus with Punctuation Casing and Context
- LightCodec: A High Fidelity Neural Audio Codec with Low Computation Complexity
- Lighting Image/Video Style Transfer Methods by Iterative Channel Pruning
- Lightweight High-Resolution Subject Matting in the Real World
- Lightweight Multi-Axial Transformer with Frequency Prompt for Single Channel Speech Enhancement
- Likelihood Consensus 2.0: Reducing Interagent Communication in Distributed Bayesian Target Tracking
- Lipschitz-Constrained Convolutional Layers Using Convex Projection
- Live Iterative Ptychography with Projection-Based Algorithms
- LoFi User Scheduling for Multiuser Mimo Wireless Systems
- Local Contrast Prior-Guided Cross Aggregation Model for Effective Infrared Small Target Detection
- Local Distance Correlation Embedding for Time-Series Analysis on Riemannian Manifolds
- Local Information Guided Global Integration for Infrared Small Target Detection
- Local Optimization Networks for Multi-View Multi-Person Human Posture Estimation
- Local and Global Feature Adaptive Adjustment Network for Remote Sensing Image Scene Classification
- Local and Global: Text Matching Via Syntax Graph Calibration
- Locality-Enhanced Transformer for Semantic Segmentation of High-Resolution Remote Sensing Images
- Localization and Tracking of Gold Nanoparticles Using mmWave FMCW Radar
- Localization in Sensor Networks Using Distributed Low-Rank Matrix Completion
- Localizing Acoustic Energy in Sound Field Synthesis by Directionally Weighted Exterior Radiation Suppression
- Location Optimization for RIS Aided mmWave Downlink Network
- Long Term Memory-Enhanced Via Causal Reasoning for Text-To-Video Retrieval
- Long-Term Action Anticipation Based on Contextual Alignment
- Long-Term Social Interaction Context: The Key to Egocentric Addressee Detection
- Longitudinal Modeling of Depression Shifts Using Speech and Language
- Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
- Loop Structure-Aware Learning for Fully Automated Pulmonary Fissure Completeness Assessment
- Loss Masking Is Not Needed In Decoder-Only Transformer For Discrete-Token-Based ASR
- Lossy Compression of Adjacency Matrices by Graph Filter Banks
- Low Bitrate Loss Resilience Scheme for a Speech Enhancing Neural Codec
- Low Overhead DMG Sensing for Vital Signs Detection
- Low Redundant Attention Network for Efficient Image Super-Resolution
- Low-Complexity GLRT Based Quickest Detection With Unknown Parameters
- Low-Complexity Vector Source Coding for Discrete Long Sequences with Unknown Distributions
- Low-Latency Speech Enhancement via Speech Token Generation
- Low-Light Raw Image Enhancement on a Dataset Suffering Light Effects
- Low-Rank Completion Based Normal Guided Lidar Point Cloud Up-Sampling
- Low-Rank Constrained Multichannel Signal Denoising Considering Channel-Dependent Sensitivity Inspired by Self-Supervised Learning for Optical Fiber Sensing
- M2BART: Multilingual and Multimodal Encoder-Decoder Pre-Training for Any-to-Any Machine Translation
- M2SUM: Multi-Granularity Scale-Adaptive Video Summarizer towards Informative Context Representation Learning
- M3ARL: Moment-Embedded Mean-Field Multi-Agent Reinforcement Learning for Continuous Action Space
- M3DSYNTH: A Dataset of Medical 3D Images with AI-Generated Local Manipulations
- M3TN: Multi-Gate Mixture-of-Experts Based Multi-Valued Treatment Network for Uplift Modeling
- M3TQA: Multi-View, Multi-Hop and Multi-Stage Reasoning for Temporal Question Answering
- M3sum: A Novel Unsupervised Language-Guided Video Summarization
- MACCN: Multi-Modal Adaptive Co-Attention Fusion Contrastive Learning Networks for Fake News Detection
- MADRL-Based UAVs Trajectory Design with Anti-Collision Mechanism in Vehicular Networks
- MAML-Based 24-Hour Personalized Blood Pressure Estimation from Wrist Photoplethysmography Signals in Free-Living Context
- MAS-NET: Mixed-Feature Attention Siamese Network for Change Detection on Remote Sensing Images
- MCM-CSD: Multi-Granularity Context Modeling with Contrastive Speaker Detection for Emotion Recognition in Real-Time Conversation
- MDAVIF: A Multi-Domain Acoustical-Visual Information Fusion Model for Depression Recognition from Vlog Data
- MDX-GAN: Enhancing Perceptual Quality in Multi-Class Source Separation Via Adversarial Training
- MEAT: Median-Ensemble Adversarial Training for Improving Robustness and Generalization
- MEPE: A Minimalist Ensemble Policy Evaluation Operator for Deep Reinforcement Learning
- MERG: Multi-Dimensional Edge Representation Generation Layer for Graph Neural Networks
- MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
- MFT-PCQA: Multi-Modal Fusion Transformer for No-Reference Point Cloud Quality Assessment
- MGRL: Mutual-Guidance Representation Learning for Text-to-Image Person Retrieval
- MHPS: Multimodality-Guided Hierarchical Policy Search for Knowledge Graph Reasoning
- MIMO imaging method with iterative-based super-resolution for automotive radar
- MIR-MLPop: A Multilingual Pop Music Dataset with Time-Aligned Lyrics and Audio
- MISA: Unveiling the Vulnerabilities in Split Federated Learning
- MLCA-AVSR: Multi-Layer Cross Attention Fusion Based Audio-Visual Speech Recognition
- MLMTD: A Multi-Layer Malicious Traffic Detection Model Based on Multi-Branch Octave Convolution and Attention Mechanism
- MLPs Compass: What is Learned When MLPs are Combined with PLMs?
- MMAFlow: Matching-Guided Motion Aggregation for Optical Flow Estimation
- MMCOUNT: Stationary Crowd Counting System Based on Commodity Millimeter-Wave Radar
- MMHSV: A Multimodal Handwritten Signature Verification Fusing Dynamic and Static Feature
- MMRBN: Rule-Based Network for Multimodal Emotion Recognition
- MMS: Morphology-Mixup Stylized Data Generation for Single Domain Generalization in Medical Image Segmentation
- MOMA: Mixture-of-Modality-Adaptations for Transferring Knowledge from Image Models Towards Efficient Audio-Visual Action Recognition
- MOS-FAD: Improving Fake Audio Detection Via Automatic Mean Opinion Score Prediction
- MS-SENet: Enhancing Speech Emotion Recognition Through Multi-Scale Feature Fusion with Squeeze-and-Excitation Blocks
- MSFR: Stance Detection Based on Multi-Aspect Semantic Feature Representation via Hierarchical Contrastive Learning
- MSG-BART: Multi-Granularity Scene Graph-Enhanced Encoder-Decoder Language Model for Video-Grounded Dialogue Generation
- MSSTNet: A Multi-Scale Spatio-Temporal CNN-Transformer Network for Dynamic Facial Expression Recognition
- MTA: A Lightweight Multilingual Text Alignment Model for Cross-Language Visual Word Sense Disambiguation
- MTIDNet: A Multimodal Temporal Interest Detection Network for Video Summarization
- MTRGL: Effective Temporal Correlation Discerning Through Multi-Modal Temporal Relational Graph Learning
- MVITP: Multi-View Image-Text Perception for Few-Shot Remote Sensing Image Classification
- MaDE: Multi-Scale Decision Enhancement for Multi-Agent Reinforcement Learning
- Mainlobe Deceptive Jammer Suppression Using FDA-MIMO Radar in the Presence of Multipath Propagation
- Manticore: An Unsupervised Intrusion Detection System Based on Contrastive Learning in 5G Networks
- MapFlow: Multi-Agent Pedestrian Trajectory Prediction Using Normalizing Flow
- Mapache: Masked Parallel Transformer for Advanced Speech Editing and Synthesis
- Mask6D: Masked Pose Priors for 6D Object Pose Estimation
- Maskmark: Robust Neuralwatermarking for Real and Synthetic Speech
- Maskstr: Guide Scene Text Recognition Models with Masking
- Matcha-TTS: A Fast TTS Architecture with Conditional Flow Matching
- Matpr-Unet: A Multi Attention Two-Path Residual Unet for Focal Cortical Dysplasia Lesions Segmentation
- Matrix Factorization in Tropical and Mixed Tropical-Linear Algebras
- Max-AST: Combining Convolution, Local and Global Self-Attentions for Audio Event Classification
- Max-Margin Transducer Loss: Improving Sequence-Discriminative Training Using a Large-Margin Learning Strategy
- Max-Min Beamforming for Multi-User Massive MIMO Systems: An Alternating Projection-Based Approach
- Maximal Coding Rate Reduction for Graph Embeddings
- Maximum-Entropy Adversarial Audio Augmentation for Keyword Spotting
- Mdrt: Multi-Domain Synthetic Speech Localization
- Medical Vision-Language Representation Learning with Cross-Modal Multi-Teacher Contrastive Distillation
- Mels-Tts : Multi-Emotion Multi-Lingual Multi-Speaker Text-To-Speech System Via Disentangled Style Tokens
- Memory Efficient Corner Detection for Event-Driven Dynamic Vision Sensors
- Memory Self-Calibrated Network for Visual Grounding
- Memory-Augmented Dual-Domain Unfolding Network for MRI Reconstruction
- Memory-Augmented Online Video Anomaly Detection
- Memory-Augmented speech-to-text Translation with Multi-Scale Context Translation Strategy
- Mertech: Instrument Playing Technique Detection Using Self-Supervised Pretrained Model with Multi-Task Finetuning
- Mesh-RTUME: Universal Manifold Embedding for Estimating 3D Rigid Transformations of Surfaces
- Meta Representation Learning Method for Robust Speaker Verification in Unseen Domains
- Meta Structure Search for Link Weight Prediction in Heterogeneous Graphs
- Meta-AF Echo Cancellation for Improved Keyword Spotting
- Meta-Knowledge Enhanced Data Augmentation for Federated Person Re-Identification
- Meta-Learning With Versatile Loss Geometries for Fast Adaptation Using Mirror Descent
- Metasurface-Based Receivers with 1-bit ADCS for multi-user Uplink Communications
- Micro-expression recognition by fusing action unit detection and Spatio-temporal features
- Microphone Subset Selection for the Weighted Prediction Error Algorithm Using a Group Sparsity Penalty
- Midi-Voice: Expressive Zero-Shot Singing Voice Synthesis via Midi-Driven Priors
- Minimally-Supervised Speech Synthesis with Conditional Diffusion Model and Language Model: A Comparative Study of Semantic Coding
- Misspecified Time-Delay and Doppler Estimation over Non Gaussian Scenarios
- Mitigate Replication and Copying in Diffusion Models with Generalized Caption and Dual Fusion Enhancement
- Mitigating Data Injection Attacks on Federated Learning
- Mitigating Intra-Class Variance in Few-Shot Point Cloud Classification
- Mitigating Optimization Conflict in Domain Adversarial Neural Network via Uncertainty-Aware
- Mixed Graph Signal Analysis of Joint Image Denoising / Interpolation
- Mixed Informed Transformer for Few-Shot Medical Image Segmentation
- Mixed Precision Neural Quantization with Multi-Objective Bayesian Optimization for on-Device Deployment
- Mixed-Attention Auto Encoder for Multi-Class Industrial Anomaly Detection
- Modal Consensus and Contextual Separation for Weakly Supervised Temporal Action Localization
- Modality Drop-Out for Multimodal Device Directed Speech Detection Using Verbal and Non-Verbal Features
- Modality Re-Balance for Visual Question Answering: A Causal Framework
- Modality-Dependent Sentiments Exploring for Multi-Modal Sentiment Classification
- Model-Based Label-to-Image Diffusion for Semi-Supervised Choroidal Vessel Segmentation
- Model-Based Learning for Location-to-Channel Mapping
- Modeling Intrapersonal and Interpersonal Influences for Automatic Estimation of Therapist Empathy in Counseling Conversation
- Modeling Pseudo-Speaker Uncertainty in Voice Anonymization
- Modeling Quasi-Periodic Dependency via Self-Supervised Pre-Training for Respiratory Sound Classification
- Modeling Route Representation With Mixed-Scale Hierarchical Transformer
- Modulo Sampling and Recovery in Shift-Invariant Spaces
- Momentum-Imbued Langevin Dynamics (MILD) for Faster Sampling
- Monostatic DMG Passive Sensing with Hypothesis Testing
- Monte Carlo Self-Training for Speech Recognition
- Mosic: Multimodal Semantic Integrated Communication for Health Monitoring in Iot Scenarios
- MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
- Motif-Matching Based Sub-Braingraph Level Networks for Noisy Resting-State fMRI Analysis
- Motion Latent Diffusion for Stochastic Trajectory Prediction
- Motion Transfer-Driven Intra-Class Data Augmentation for Finger Vein Recognition
- Motion-Tolerant Radar-Based Heart Sound Detection
- Mrtnet: Multi-Resolution Temporal Network for Video Sentence Grounding
- Mtdiffusion: Multi-Task Diffusion Model With Dual-Unet for Foley Sound Generation
- MuSR: Multi-Scale 3D Scenes Reconstruction based on Monocular Video
- Multi-Agent 3D Seismic Exploration Using Adapt-then-Combine Full Waveform Inversion in a hardware-in-the-loop System
- Multi-Agent Exploration via Self-Learning and Social Learning
- Multi-Agent Sparse Interaction Modeling is an Anomaly Detection Problem
- Multi-Antenna ISAC Receiver with n-Tuple Blind Deconvolution
- Multi-Attention Enhanced Discriminator for GAN-Based Anomalous Sound Detection
- Multi-Band Speech Tensor Decomposition for Interactive Feature Extraction in Early Dysphagia Screening
- Multi-Beam Multiplexing Design with Phase-Only Excitation Based on Hybrid Beamforming Architectures
- Multi-CMGAN+/+: Leveraging Multi-Objective Speech Quality Metric Prediction for Speech Enhancement
- Multi-Channel Mosra: Mean Opinion Score and Room Acoustics Estimation Using Simulated Data and A Teacher Model
- Multi-Dimension Queried and Interacting Network for Stereo Image Deraining
- Multi-Dimensional Geometric Feature-Based Calibration Method for LiDAR and Camera Fusion
- Multi-Dimensional Speech Quality Assessment in Crowdsourcing
- Multi-Grained Multimodal Interaction Network for Sentiment Analysis
- Multi-Interest Learning for Multi-Modal Paper Recommendation
- Multi-Label Abnormality Classification from 12-Lead ECG Using A 2D Residual U-Net
- Multi-Layer Relation Knowledge Distillation For Fingerprint Restoration
- Multi-Level Augmentation Consistency Learning and Sample Selection for Semi-Supervised Domain Generalization
- Multi-Level Contrastive Learning For Hybrid Cross-Modal Retrieval
- Multi-Level Graph Learning For Audio Event Classification And Human-Perceived Annoyance Rating Prediction
- Multi-Level Spatial-Temporal Feature Aggregation and Alignment-Based Selective Residual Dense Propagation Module for HDR Video Reconstruction
- Multi-Linear Kernel Regression and Imputation VIA Manifold Learning: the Dynamic MRI Case
- Multi-Microphone Noise Data Augmentation for DNN-Based Own Voice Reconstruction for Hearables in Noisy Environments
- Multi-Modal Continual Pre-Training For Audio Encoders
- Multi-Modal Emotion Recognition Using Multiple Acoustic Features and Dual Cross-Modal Transformer
- Multi-Modal GPT-4 Aided Action Planning and Reasoning for Self-driving Vehicles
- Multi-Modality Action Recognition Based on Dual Feature Shift in Vehicle Cabin Monitoring
- Multi-Modality Conditional Diffusion Model for Time Series Forecasting of Live Sales Volume
- Multi-Modality Speech Recognition Driven by Background Visual Scenes
- Multi-Model Wireless Federated Learning with Downlink Beamforming
- Multi-Object Editing in Personalized Text-To-Image Diffusion Model Via Segmentation Guidance
- Multi-Object Tracking for Unmanned Aerial Vehicles Based on Multi-Frame Feature Fusion
- Multi-Objective Progressive Clustering for Semi-Supervised Domain Adaptation in Speaker Verification
- Multi-Person Respiration Rate Estimation With Single Pair Of Transmit And Receive Antenna
- Multi-Rate Variable-Length CSI Compression for FDD Massive MIMO
- Multi-Relational Graph Diffusion Neural Network with Parallel Retention for Stock Trends Classification
- Multi-Scale Fusion of Gated Neighborhood Attention Transformers for Single Image Deraining
- Multi-Scale Permutation Entropy for Audio Deepfake Detection
- Multi-Scale Sub-Band Constant-Q Transform Discriminator for High-Fidelity Vocoder
- Multi-Sensor Multi-Scan Radar Sensing of Multiple Extended Targets
- Multi-Signal Fusion of Social Diffusion Graph with Bi-Directional Semantic Consistency
- Multi-Source DOA Estimation With Statistical Coverage Guarantees
- Multi-Source Domain Adaptation Meets Dataset Distillation through Dataset Dictionary Learning
- Multi-Source Domain Adaptation with Transformer-Based Feature Generation for Subject-Independent EEG-Based Emotion Recognition
- Multi-Source Domain Generalization for ECG-Based Cognitive Load Estimation: Adversarial Invariant and Plausible Uncertainty Learning
- Multi-Source Dynamic Interactive Network Collaborative Reasoning Image Captioning
- Multi-Source Unsupervised Transfer Components Learning for Cross-Domain Speech Emotion Recognition
- Multi-Speaker Localization in the Circular Harmonic Domain on Small Aperture Microphone Arrays Using Deep Convolutional Networks
- Multi-Stage Contrastive Regression for Action Quality Assessment
- Multi-Stage Learning for Radar Pulse Activity Segmentation
- Multi-Stage Progressive Refinement and RoI Context Enhancement Network for Small Logo Detection
- Multi-Task Cascaded Attention Network for Brain Tumor Segmentation and Classification
- Multi-Task Learning for Front-End Text Processing in TTS
- Multi-Task Pseudo-Label Learning for Non-Intrusive Speech Quality Assessment Model
- Multi-Task Self-Supervised Learning for Medical Image Segmentation
- Multi-Teacher Distillation for Incremental Object Detection
- Multi-View Interactive Compromise Learning for Group Recommendation
- Multi-View Midivae: Fusing Track- and Bar-View Representations for Long Multi-Track Symbolic Music Generation
- Multi-View Speaker Embedding Learning for Enhanced Stability and Discriminability
- Multi-View Subspace Clustering With Consensus Graph Contrastive Learning
- Multi-Weather Degradation-Aware Transformer for Image Restoration
- Multicast Transmission Design With Enhanced DOF For Mimo Coded Caching Systems
- Multicast with Multiple Wardens in IRS-Aided Covert DFRC System
- Multidimensional Scaling-Based TDOA Localization in Modified Polar Representation
- Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
- Multilingual Distilwhisper: Efficient Distillation of Multi-Task Speech Models Via Language-Specific Experts
- Multilingual Transliteration for Pan-Indic Keyboard Input
- Multilingual and Fully Non-Autoregressive ASR with Large Language Model Fusion: A Comprehensive Study
- Multimodal Breathing Rate Estimation Using Facial Motion and RPPG From RGB Camera
- Multimodal Graph-Based Audio-Visual Event Localization
- Multimodal Imaging Feature Extraction with Reference Canonical Correlation Analysis Underlying Intelligence
- Multimodal Modeling for Spoken Language Identification
- Multimodal Multi-View Spectral-Spatial-Temporal Masked Autoencoder for Self-Supervised Emotion Recognition
- Multimodal Sentiment Analysis Based on 3D Stereoscopic Attention
- Multimodal Survival Ensemble Network: Integrating Genomic and Histopathological Insights for Enhanced Cancer Prognosis
- Multimodal Transformer Distillation for Audio-Visual Synchronization
- Multimodal Transformer with a Low-Computational-Cost Guarantee
- Multiple Object Tracking Based on Occlusion-Aware Embedding Consistency Learning
- Multiple Player Tracking With 3D Projection and Spatio-Temporal Information In Multi-View Sports Videos
- Multiple Representation Transfer from Large Language Models to End-to-End ASR Systems
- Multiscale Attention Distillation for Object Detection
- Multiscale Augmented Normalizing Flows for Image Compression
- Multiscale Matching Driven by Cross-Modal Similarity Consistency for Audio-Text Retrieval
- Multiscale Scoring Model for Enhanced Urban Perception Evaluation
- Multispectral RF Imaging Using Multiple Narrow-Band FMCW Signals
- Multistatic Passive Detection of Cyclostationary Signals
- Multitarget Tracking in the Presence of Velocity Ambiguity for Automotive Radar
- Multitask Classification of Antimicrobial Peptides for Simultaneous Assessment of Antimicrobial Property and Structural Fold
- Multitask Speech Recognition and Speaker Change Detection for Unknown Number of Speakers
- Multivariate Density Estimation Using Low-Rank Fejér-Riesz Factorization
- Multivariate Fourier Distribution Perturbation: Domain Shifts with Uncertainty in Frequency Domain
- Multivariate Time Series Forecasting with Causal-Temporal Attention Network
- Multiway-Adapter: Adapting Multimodal Large Language Models for Scalable Image-Text Retrieval
- Music Auto-Tagging with Robust Music Representation Learned via Domain Adversarial Training
- Music Source Separation With Band-Split Rope Transformer
- Music Understanding LLaMA: Advancing Text-to-Music Generation with Question Answering and Captioning
- Music-to-Dance Poses: Learning to Retrieve Dance Poses from Music
- MusicLDM: Enhancing Novelty in text-to-music Generation Using Beat-Synchronous mixup Strategies
- Mutual Information Assisted Graph Convolution Network for Cold-Start Recommendation
- Mutual Information Based Noise Scale Optimization for Gradient Leakage Resistant Federated Learning
- Mutual Information-Based Fair Active Learning
- Mutuality Attribute Makes Better Video Anomaly Detection
- Mutualreg: Mutual Learning for Unsupervised Medical Image Registration
- NAC: Mitigating Noisy Correspondence in Cross-Modal Matching Via Neighbor Auxiliary Corrector
- NERF-AD: Neural Radiance Field With Attention-Based Disentanglement For Talking Face Synthesis
- NERF-GAZE: A Head-Eye Redirection Parametric Model for Gaze Estimation
- NIIRF: Neural IIR Filter Field for HRTF Upsampling and Personalization
- NLSIT: A Non-Local Stereo Interaction Transformer for Stereo Image Super-Resolution
- NOLACE: Improving Low-Complexity Speech Codec Enhancement Through Adaptive Temporal Shaping
- NOMAD: Unsupervised Learning of Perceptual Embeddings For Speech Enhancement and Non-Matching Reference Audio Quality Assessment
- NPRF: Neural Painted Radiosity Fields for Neural Implicit Rendering and Surface Reconstruction
- NTT Speaker Diarization System for Chime-7: Multi-Domain, Multi-Microphone end-to-end and Vector Clustering Diarization
- NWS: Natural Textual Backdoor Attacks Via Word Substitution
- Natural Language Supervision For General-Purpose Audio Representations
- NeRI: Implicit Neural Representation of LiDAR Point Cloud Using Range Image Sequence
- NeXt-TDNN: Modernizing Multi-Scale Temporal Convolution Backbone for Speaker Verification
- Near-Field Localization with 1-bit Quantized Hybrid A/D Reception
- Near-Field MIMO Channel Reconstruction Via Limited Geometry Feedback
- Near-Field Neural Rendering Guided by Single-Shot Photometric Stereo
- Nebnet: Exploiting Node-Edge Bi-Level Network for Gene Expression Prediction
- Neighborhood-Enhanced Multimodal Collaborative Filtering for Item Cold Start Recommendation
- Neural Ambisonics Encoding For Compact Irregular Microphone Arrays
- Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
- Neural Network Training Strategy To Enhance Anomaly Detection Performance: A Perspective On Reconstruction Loss Amplification
- Neural Network-Based Symbolic Regression for Empirical Modeling of the Behavior of a Planetary Gearbox
- Neural Network-Based Virtual Microphone Estimation with Virtual Microphone and Beamformer-Level Multi-Task Loss
- Neural Ordinary Differential Equations with Trainable Solvers
- Neural Speaker Diarization Using Memory-Aware Multi-Speaker Embedding with Sequence-to-Sequence Architecture
- Neural Stochastic Differential Equations with Change Points: A Generative Adversarial Approach
- Neural2speech: A Transfer Learning Framework for Neural-Driven Speech Reconstruction
- NeuroHeed+: Improving Neuro-Steered Speaker Extraction with Joint Auditory Attention Detection
- Neuromorphic Sensing Meets Unlimited Sampling
- New Intent Discovery with Multi-View Clustering
- Newtonalized Orthogonal Matching Pursuit for Mixed Far-Field and Near-Field Source Localization
- Noise Masking Attacks and Defenses for Pretrained Speech Models
- Noise-Aware Speech Separation with Contrastive Learning
- Noise-BERT: A Unified Perturbation-Robust Framework with Noise Alignment Pre-Training for Noisy Slot Filling Task
- Noise-Disentangled Graph Contrastive Learning via Low-Rank and Sparse Subspace Decomposition
- Noise-Resistant Graph Neural Network for Node Classification
- Noise-Robust DSP-Assisted Neural Pitch Estimation With Very Low Complexity
- Noise-Robust Zero-Shot Text-to-Speech Synthesis Conditioned on Self-Supervised Speech-Representation Model with Adapters
- Noise2one: One-Shot Image Denoising with Local Implicit Learning
- Noisy Image Restoration Based on Conditional Acceleration Score Approximation
- Noisy-Arcmix: Additive Noisy Angular Margin Loss Combined With Mixup For Anomalous Sound Detection
- Non Commutative Convolutional Signal Models in Neural Networks: Stability to Small Deformations
- Non-Intrusive Speech Intelligibility Prediction for Hearing-Impaired Users Using Intermediate ASR Features and Human Memory Models
- Non-Intrusive Speech Quality Assessment with Multi-Task Learning Based on Tensor Network
- Non-Stationary Bandits with Periodic Behavior: Harnessing Ramanujan Periodicity Transforms to Conquer Time-Varying Challenges
- Non-Uniform Frequency Spacing for Regularization-Free Gridless DOA
- Non-iterative Pyramid Network for Unsupervised Deformable Medical Image Registration
- Nonasymptotic Performance Limits of Low-Latency Secure Integrated Sensing and Communication Systems
- Nonlinearity Detection and Compensation for EEG-Based Speech Tracking
- Normalization is All You Need: Robust Full-Range Contactless SpO2 Estimation Across Users
- Novel Architecture of Deep Feature-Based Gaussian Processes with an Ensemble of Kernels
- Nuclear-Norm Maximization for Low-Rank Updates
- OADAS: Optimizing Global Perturbation Attacks with Dual-Path Attribution Synergy
- OFDM Waveform Design with Good Correlation Level and Peak-to-Mean Envelope Power Ratio for the Joint MIMO Radar And Communications
- OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
- Object Correlation Matrix for Two-Stage Object Detection Network
- Object Detection Oriented Privacy-Preserving Frame-Level Video Anomaly Detection
- Object Trajectory Estimation with Multi-Band Wi-Fi Neural Dynamic Fusion
- Object-Conditioned Bag of Instances for Few-Shot Personalized Instance Recognition
- Odaq: Open Dataset of Audio Quality
- Offline Reinforcement Learning Based on Next State Supervision
- Offline Reinforcement Learning with Generative Adversarial Networks and Uncertainty Estimation
- Offline Reinforcement Learning with Policy Guidance and Uncertainty Estimation
- Omnidirectional Multi-Rotor Aerial Vehicle Pose Optimization: A Novel Approach to Physical Layer Security
- On Estimating Link Prediction Uncertainty Using Stochastic Centering
- On Fine-Tuning Pre-Trained Speech Models With EMA-Target Self-Supervised Loss
- On Generalized Signature Graphs
- On HRTF Notch Frequency Prediction using Anthropometric Features and Neural Networks
- On Improved Distributed Random Reshuffling over Networks
- On Optimizing Timesteps of an EDM Based Diffusion Sampling Procedure
- On Real-Time Multi-Stage Speech Enhancement Systems
- On The Choice of the Optimal Temporal Support for Audio Classification with Pre-Trained Embeddings
- On The Effect Of Data-Augmentation On Local Embedding Properties In The Contrastive Learning Of Music Audio Representations
- On The Equivalence Of Dynamic Mode Decomposition And Complex Nonnegative Matrix Factorization
- On The Resilience Of Online Federated Learning To Model Poisoning Attacks Through Partial Sharing
- On The Role of Room Acoustics in Audio Presentation Attack Detection
- On Time-Encoded Sampling for Multigenerator Shift Invariant Spaces
- On Unique Localization of Uncorrelated Constant-Modulus Sources Using Sparse Linear Arrays
- On the Convergence of Hierarchical Federated Learning with Gradient Quantization and Imperfect Transmission
- On the Convergence of Single-Timescale Multi-Sequence Stochastic Approximation Without Fixed Point Smoothness
- On the Design of Planar Differential Microphone Arrays with Specified Beamwidth or Sidelobe Level
- On the Generalization Error of Byzantine-Resilient Decentralized Learning
- On the Importance of Neural Wiener Filter for Resource Efficient Multichannel Speech Enhancement
- On the Open Prompt Challenge in Conditional Audio Generation
- On the Privacy of Federated Clustering: a Cryptographic View
- On the Relation Between Internal Language Model and Sequence Discriminative Training for Neural Transducers
- On the Tradeoff Between Privacy Preservation and Byzantine-Robustness in Decentralized Learning
- On-Device Constrained Self-Supervised Learning for Keyword Spotting via Quantization Aware Pre-Training and Fine-Tuning
- One Model to Rule Them All ? Towards End-to-End Joint Speaker Diarization and Speech Recognition
- One-Class Knowledge Distillation for Spoofing Speech Detection
- One-Epoch Training with Single Test Sample in Test Time for Better Generalization of Cough-Based Covid-19 Detection Model
- One-Shot Sensitivity-Aware Mixed Sparsity Pruning for Large Language Models
- One-Stage Deep Stereo Network
- One-Stage Training Generative Paradigm for Generalized Zero-Shot Learning
- One-Step Late Fusion Multi-View Clustering with Compressed Subspace
- One-bit Quantization Robust to Angle-of-Arrivals for Uniform Linear Antenna Array
- Online Auditing of Information Flow
- Online Caching With Switching Cost and Operational Long-Term Constraints: An Online Learning Approach
- Online Mouse Behavior Detection by Historical Dependency and Typical Instances
- Online Speaker Diarization of Meetings Guided by Speech Separation
- Online Target Sound Extraction with Knowledge Distillation from Partially Non-Causal Teacher
- Open-Set Deepfake Detection To Fight The Unknown
- Open-Vocabulary Keyword-Spotting with Adaptive Instance Normalization
- Open-Vocabulary Skeleton Action Recognition with Diffusion Graph Convolutional Network and Pre-Trained Vision-Language Models
- OpenTE: Open-Structure Table Extraction From Text
- Opine: Leveraging a Optimization-Inspired Deep Unfolding Method for Multi-Channel Speech Enhancement
- Opnet: Deep Occlusion Perception Network with Boundary Awareness for Amodal Instance Segmentation
- Optimal ANN-SNN Conversion with Group Neurons
- Optimal Beamforming Structure for Rate Splitting Multiple Access
- Optimal Ber Minimum Precoder Design for OTFS-Based ISAC Systems
- Optimal Structure of Receive Beamforming for over-The-Air Computation
- Optimal Transport Distances for Directed, Weighted Graphs: A Case Study With Cell-Cell Communication Networks
- Optimizing Synchronization Delay for Digital Twin over Wireless Networks
- Optimizing Trading Strategies in Quantitative Markets Using Multi-Agent Reinforcement Learning
- Optimizing k in kNN Graphs with Graph Learning Perspective
- Out-of-Distribution Detection for Learning-Based Chest X-Ray Diagnosis
- Outlier-Robust Feature Selection with ℓ2, 1-Norm Minimization and Group Row-Sparsity Induced Constraints
- P2DT: Mitigating Forgetting in Task-Incremental Learning with Progressive Prompt Decision Transformer
- PAVITS: Exploring Prosody-Aware VITS for End-to-End Emotional Voice Conversion
- PECER: Empathetic Response Generation Via Dynamic Personality Extraction and Contextual Emotional Reasoning
- PECR: Parameter-Efficient Transfer Learning with Cross-Modal Representation Learning for Remote Sensing Visual Question Answering
- PFCF-Net: A Network Based on Progressive Feature Interaction and Cross-Scale Feature Fusion for Remote Sensing Change Detection
- PFDM: Parser-Free Virtual Try-On via Diffusion Model
- PHYOT: Physics-Informed Object Tracking in Surveillance Cameras
- PJSCC: A Puncturing-Based Joint Source Channel Coding Scheme with Hierarchical Down-Sampling Layer
- PLS: Unsupervised Domain Adaptation for 3d Object Detection Via Pseudo-Label Sizes
- PMDI: Combining Parametric-Model and Depth-Aware Implicit Function for Single-View Human Reconstruction
- PN-DetX: A Dedicated Framework for Pulmonary Nodule Detection in X-Ray Images
- POSE-HMR: Heuristic Transformer with Postural Prior Constraints for 3D Human Mesh Reconstruction
- PVCG: Prompt-Based Vision-Aware Classification and Generation for Multi-Modal Rumor Detection
- PVitNet: An Effective Approach for Android Malware Detection Using Pyramid Feature Processing and Vision Transformer
- PaCaS-WAA: Patch-Based Contrastive Semi-Supervised Learning with Wavelet Guidance and Adaptive Augmentation for Tumour Segmentation
- Panoramic Image Inpainting with Gated Convolution and Contextual Reconstruction Loss
- Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
- Parallel Augmentation and Dual Enhancement for Occluded Person Re-Identification
- Parameter Efficient Audio Captioning with Faithful Guidance Using Audio-Text Shared Latent Representation
- Parameter Efficient Finetuning for Speech Emotion Recognition and Domain Adaptation
- Parameter Estimation Via Expectation Maximization - Expectation Consistent Algorithm
- Parameter-Efficient Adaptation for Computational Imaging
- Pareto Graph Self-Supervised Learning
- Parody Detection Using Source-Target Attention with Teacher-Forced Lyrics
- Part Representation Learning with Teacher-Student Decoder for Occluded Person Re-Identification
- Partial Convolutional Based-Radio Map Reconstruction for Urban Environments with Inaccessible Areas
- Partially Observable Model-Based Learning FOR ISAC Resource Allocation
- Paste and Harmonize via Denoising: Subject-Driven Image Editing with Frozen Pre-Trained Diffusion Model
- Patch-Level Knowledge Distillation and Regularization for Missing Modality Medical Image Segmentation
- Patient-Adaptive and Learned Mri Data Undersampling Using Neighborhood Clustering
- Perceiving Multi-Layer Representations for No-reference Image Quality Assessment
- Perceptual Quality Evaluation for Faster Playback Videos
- Perceptually-Motivated Spatial Audio Codec for Higher-Order Ambisonics Compression
- Performance Conditioning for Diffusion-Based Multi-Instrument Music Synthesis
- Performance and Energy Balance: A Comprehensive Study of State-of-the-Art Sound Event Detection Systems
- Periocular Biometrics Enhancement Through Multimodal Embeddings And Classifier Adaptation
- PeriodGrad: Towards Pitch-Controllable Neural Vocoder Based on a Diffusion Probabilistic Model
- Permutation-Alignment Method Using Manifold Optimization for Frequency-Domain Blind Source Separation
- Persona Extraction Through Semantic Similarity for Emotional Support Conversation Generation
- Personalization of CTC-Based End-to-End Speech Recognition Using Pronunciation-Driven Subword Tokenization
- Personalized Federated Learning with Attention-Based Client Selection
- Personalized Local Differentially Private Federated Learning with Adaptive Client Sampling
- Personalized Neural Speech Codec
- Personalized Over-The-Air Federated Learning with Personalized Reconfigurable Intelligent Surfaces
- PhISANet: Phonetically Informed Speech Animation Network
- Phase Continuity-Aware Self-Attentive Recurrent Network with Adaptive Feature Selection for Robust VAD
- Phase Learning Based on Interactive Perception for Limited-Sample Residential Area Semantic Segmentation
- Phase Reconstruction in Single Channel Speech Enhancement Based on Phase Gradients and Estimated Clean-Speech Amplitudes
- Phase Retrieval by Tensor Total Least Squares
- Phase-Space-Guided Deep Learning For Time Series Forecasting
- Phoneme-Aware Encoding for Prefix-Tree-Based Contextual ASR
- Photovoltaic Power Forecasting Using Sky Images and Sun Motion
- Physically-Constrained Block-Term Tensor Decomposition for Polarimetric Image Recovery
- Physics-Guided Variational Graph Autoencoder For Air Quality Inference
- Piano Transcription with Harmonic Attention
- Pilot Length Minimization via AP-UE Clustering in Cell-Free Systems
- Pixel-Superpixel Contrastive Learning and Pseudo-Label Correction for Hyperspectral Image Clustering
- Plug-And-Play Algorithm Coupled with Low-Rank Quadratic Envelope Regularization for Compressive Spectral Imaging
- Plug-and-Play MVDR Beamforming for Speech Separation
- Pmmwdeconv: Unsupervised Data-Consistent Blind Passive Millimeterwave Image Deconvolution with Global Context Priors
- PoisonPrompt: Backdoor Attack on Prompt-Based Large Language Models
- Poisoning-Free Defense Against Black-Box Model Extraction
- PolarDB: Formula-Driven Dataset for Pre-Training Trajectory Encoders
- Political Tweet Sentiment Analysis for Public Opinion Polling
- Position-Aware Active Learning for Multi-Modal Entity Alignment
- Positive Transfer of the Whisper Speech Transformer to Human and Animal Voice Activity Detection
- Post-Training Embedding Alignment for Decoupling Enrollment and Runtime Speaker Recognition Models
- Posterior Sampling Algorithms for Unsupervised Speech Enhancement with Recurrent Variational Autoencoder
- Posterior Variance-Parameterised Gaussian Dropout: Improving Disentangled Sequential Autoencoders for Zero-Shot Voice Conversion
- Power-Aware Task-Based Learning of Neuromorphic ADCs
- Practical Challenge and Solution for IRS-Aided Indoor Localization System
- Pre-Echo Reduction in Transform Audio Coding via Temporal Envelope Control with Machine Learning Based Estimation
- Pre-Post Interaction Learning for Brain Tumor Segmentation with Missing MRI Modalities
- Pre-Trained Acoustic-and-Textual Modeling for End-To-End Speech-To-Text Translation
- Predict and Interpret Health Risk Using Ehr Through Typical Patients
- Predicting Adverse Events for Patients with Type-1 Diabetes Via Self-Supervised Learning
- Predicting Fall Events by a Spatio-Temporal Topological Network with Multiple Wearable Sensors
- Predicting RTMS Treatment Effects Using Open-Loop Control and Neural Manifold
- Prediction-Correction Line Segment Detection
- Prioritizing Data Acquisition for end-to-end Speech Model Improvement
- Privacy Leakage In Graph Signal To Graph Matching Problems
- Privacy Preserving Federated Learning from Multi-Input Functional Proxy Re-Encryption
- Privacy Preserving Gaze Estimation Via Federated Learning Adapted To Egocentric Video
- Privacy-Aware Joint Source-Channel Coding For Image Transmission Based On Disentangled Information Bottleneck
- Privacy-Preserving Attention-Weighted Multi-Source Domain Adaptation for EEG Motor Imagery
- Privacy-Preserving Deep Learning Using Deformable Operators for Secure Task Learning
- Privacy-Preserving Distributed Optimisation using Stochastic PDMM
- Pro-HAN: A Heterogeneous Graph Attention Network for Profile-based Spoken Language Understanding
- ProAug: Prototype-Based Augmentation for Long-Tailed Image Classification
- ProbMCL: Simple Probabilistic Contrastive Learning for Multi-Label Visual Classification
- Probabilistic Simplex Component Analysis via Variational Auto-Encoding
- Probabilistic Spike Train Inference
- Probability-Aware Word-Confusion-Network-To-Text Alignment Approach for Intent Classification
- Profile-Error-Tolerant Target-Speaker Voice Activity Detection
- Progressive Image Synthesis from Semantics to Details with Denoising Diffusion GAN
- Progressive Learning Based Knowledge Distillation for Low Resolution Cerebral Microbleed Segmentation
- Progressive Unsupervised Domain Adaptation for ASR Using Ensemble Models and Multi-Stage Training
- Progressively Learning from Macro-Expressions for Micro-Expression Recognition
- Promoting Independence of Depression and Speaker Features for Speaker Disentanglement in Speech-Based Depression Detection
- Prompt-Based Personalized Federated Learning for Medical Visual Question Answering
- Prompt-Driven Target Speech Diarization
- PromptASR for Contextualized ASR with Controllable Style
- PromptTTS++: Controlling Speaker Identity in Prompt-Based Text-To-Speech Using Natural Language Descriptions
- Promptformer: Prompted Conformer Transducer for ASR
- Prompting Audios Using Acoustic Properties for Emotion Representation
- Prompting Large Language Models with Fine-Grained Visual Relations from Scene Graph for Visual Question Answering
- Prompting Large Language Models with Speech Recognition Abilities
- Prompting to Prompt for Rehearsal-Free Class Incremental Learning
- Promptvc: Flexible Stylistic Voice Conversion in Latent Space Driven by Natural Language Prompts
- Proposal Distillation of Multi-Modal Feature Aggregation Network for Video Object Detection
- Prototype Calibration with Synthesized Samples for Zero-Shot Chinese Character Recognition
- Prototype-Guided Masking for Unsupervised Domain Adaptation
- Provable Randomized Coordinate Descent for Matrix Completion
- Proximal Bellman Mappings for Reinforcement Learning and Their Application to Robust Adaptive Filtering
- PseKD: Phase-Shift Encoded Knowledge Distillation for Oriented Object Detection in Remote Sensing Images
- Pseudo Labels Regularization for Imbalanced Partial-Label Learning
- Pseudo-Outlier Synthesis Using Q-Gaussian Distributions for Out-of-Distribution Detection
- Pu-Edgeformer++: An Advanced Hierarchical Edge Transformer for Arbitrary-Scale Point Cloud Upsampling using Distance Fields
- Push4Rec: Temporal and Contextual Trend-Aware Transformer Push Notification Recommender
- Pyramid: A Heterogeneous Data Integration Algorithm Based on Hierarchical Graph
- QUAPPROX: A Framework for Benchmarking the Approximability of Variational Quantum Circuit
- Quantifying Spatial Audio Quality Impairment
- Quantifying The Effect Of Simulator-Based Data Augmentation For Speech Recognition On Augmented Reality Glasses
- Quantization Noise Masking in Perceptual Neural Audio Coder
- Quantized Decoder in Learned Image Compression for Deterministic Reconstruction
- Quantum Federated Learning with Quantum Networks
- Quantum Inspired Image Augmentation Applicable to Waveguides and Optical Image Transfer Via Anderson Localization
- Quantum Privacy Aggregation of Teacher Ensembles (QPATE) for Privacy Preserving Quantum Machine Learning
- Quantum Ranging Enhanced TDoA Localization
- Quantum Topic Model: Topic Modeling Using Variational Quantum Circuits
- RCIF: Towards Robust Distributed DNN Collaborative Inference Under Highly Lossy Networks
- RD-NERF: Neural Robust Distilled Feature Fields for Sparse-View Scene Segmentation
- RD-cost Regression Speed Up Technique for VVC Intra Block Partitioning
- RDANet: Reject Domain Attention Network For Confused Facial Expression Recognition
- REGIR: Refined Geometry for Single-Image Implicit Clothed Human Reconstruction
- RGB Images Enhancing Hyperspectral Image Denoising with Diffusion Model
- RIS Localization and Spatially Wideband Filtering Effects
- RK-CORE: An Established Methodology for Exploring the Hierarchical Structure within Datasets
- RL-EMO: A Reinforcement Learning Framework for Multimodal Emotion Recognition
ICASSP accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.