ICASSP 2025 Accepted Papers
The full list of 3,298 papers accepted at ICASSP 2025 (IEEE International Conference on Acoustics, Speech and Signal Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.
- Macaque-Motion-Monitor Dataset: A New Benchmark for Macaque Action Recognition
- Maintaining Prosodic Consistency in Automatic Dubbing for Better Isochrony
- Make Some Noise: Towards LLM audio reasoning and generation using sound tokens
- Make Unseen Clear: Occluder Removal for Complete 3D Pedestrian Detection
- MalImgDA: Diffusion-based Data Augmentation for Long-tailed Malware Family Classification
- Mamba Fusion: Learning Actions Through Questioning
- Mamba Meets Financial Markets: A Graph-Mamba Approach for Stock Price Prediction
- Mamba for Streaming ASR Combined with Unimodal Aggregation
- Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement
- Mamba-YOLO-World: Marrying YOLO-World with Mamba for Open-Vocabulary Detection
- Mamba-based Segmentation Model for Speaker Diarization
- MambaCPU: Enhanced Correlation Mining with State Space Models for CPU Performance Prediction
- MambaFoley: Foley Sound Generation using Selective State-Space Models
- MambaInst: Lightweight State Space Model for Real-Time Instance Segmentation
- MambaMOT: State-Space Model as Motion Predictor for Multi-Object Tracking
- MambaNext: An Enhanced Backbone Network with Focus Linear Attention
- MambaRF: A Bi-directional Mamba Structure for Radio Frequency Signal Classification of Unmanned Aerial Vehicle
- MambaTrack: Exploiting Dual-Enhancement for Night UAV Tracking
- Map-Free Visual Relocalization Enhanced by Instance Knowledge and Depth Knowledge
- Map-Guided Few-Shot Audio-Visual Acoustics Modeling
- Martin: Mobility-Aware Reputation Mechanism for Federated Learning
- Mask Augmentation For Tumor Classification In Medical Images
- Mask augmented Object-Centric Contrastive Learning for Amodal Instance Segmentation
- Mask-Weighted Spatial Likelihood Coding for Speaker-Independent Joint Localization and Mask Estimation
- Mask-guided Multi-scale Spatial-Spectral Transformer for Snapshot Compressive Imaging
- Masked Image Pretraining on Language Assisted Representation
- Masked Latent Prediction and Classification for Self-Supervised Audio Representation Learning
- Massive MIMO Channel-aware Decision Fusion Aided by Reconfigurable Intelligent Surfaces
- Massive MIMO System Partitioning for Efficient Hybrid Beamformer Optimization
- Massive MIMO-ISAC Beamforming Design Via Sensing Energy Maximization
- Mates of Cross Z-Complementary Pairs for Channel Estimation in Generalized SM-MIMO System
- MathReader : Text-to-Speech for Mathematical Documents
- Matrix Decomposition By Additive and Subtractive Factors
- Maximizing Connectivity of RIS-Assisted UAV-D2D Networks using Semidefinite Programming
- Maximum Likelihood Estimation for Bivariate Joint Distribution Recovery from Max-Aggregated Data
- Maximum Likelihood Estimation of Stable ARX Models using Randomized Coordinate Descent
- Maximum Mutual Information Estimation based Graph Attention Network for Knowledge Graph Completion
- Mean Delay in Poisson Wireless Networks with Optimal Packet Fragmentation
- Mean-Field Aided QMIX: A Scalable and Flexible Q-Learning Approach for Large-Scale Agent Groups
- MedCAM-OsteoCls: Medical Context Aware Multimodal Classification of Knee Osteoarthritis
- MedFocusCLIP: Improving few shot classification in medical datasets using pixel wise attention
- Medical Image Segmentation via Sparse Coding Decoder
- Medical Image Segmentation with Auxiliary Points Prediction of Lesion Location and Boundary
- Mel-Spectrogram Inversion via Alternating Direction Method of Multipliers
- Melody Structure Transfer Network: Generating Music with Separable Self-Attention
- MemKD: Memory-Discrepancy Knowledge Distillation for Efficient Time Series Classification
- Membership Encoding for Black-Box Neural Network Watermarking
- Memory-Free and Parallel Computation for Quantized Spiking Neural Networks
- Meta-Analogy Learning Based on Dynamic Graph Neural Networks for Inductive Knowledge Graph Link Prediction
- Meta-Conscious Driven Domain-Aware Federated Learning
- Meta-Learning for Finger Vein Recognition in Internet of Things Smart Home Security
- Meta-MMD Fusion: Enhancing Cross-Subject Motor Imagery Classification
- Meta-UAD: A Meta-Learning Scheme for User-level Network Traffic Anomaly Detection
- MetaCert: Metabolic Attention Network Utilizing Uncertainty Estimation for Multimodal Aspect-Category-Sentiment Triple Extraction
- MetaCon: Revitalizing Internet Congestion Control with Meta-Reinforcement Learning
- Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning
- Metadata-assisted Pose Correction for Immersive Audio Split Rendering
- Metadata-assisted spatial audio coding in IVAS codec
- Metric Learning with Progressive Self-Distillation for Audio-Visual Embedding Learning
- MetricGAN+KAN: Kolmogorov-Arnold Networks in Metric-Driven Speech Enhancement Systems
- Micro-expression Spotting based on Multi-modal Hierarchical Semantic-guided Deep Fusion Model
- Microphone Array Beamforming for Speech Enhancement Based on Dynamic Mode Decomposition
- Microtitre Plate Image Augmentation with Generative Adversarial Networks
- Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues
- Minimizing Disparities between Real and Pseudo Queries for Unsupervised Visual Grounding
- Mining Scene Structural Guidance for Thermal Images in Self-Supervised Monocular Depth Estimation
- Mitigating Category Imbalance: Fosafer System for the Multimodal Emotion and Intent Joint Understanding Challenge
- Mitigating Hallucinations on Object Attributes using Multiview Images and Negative Instructions
- Mitigating Motion Artifacts in Non-contact Respiratory Rate Measurement Utilizing mm-Wave FMCW Radar
- Mix-Mask Augmentation and Self-Reconstruction for Cross-Domain Few-Shot Hyperspectral Image Classification
- MixHD: A Method for Detecting Hallucinations Based on the Internal State and Output Probability of Large Language Models
- MixSense : Mixture of Vision Sense
- Mixed Gaussian Splatting for High-Quality Rendering and Reconstruction
- Mixed Spiking NeRF: Towards a More Efficient Neural Radiance Fields
- Mixed-Precision Graph Neural Quantization for Low Bit Large Language Models
- Mixture of Experts Fusion for Fake Audio Detection Using Frozen wav2vec 2.0
- MncCap: Mining Neural Composition for Zero-shot Image Captioning via Text-only Training
- MoHGNN: Enhanced Heterogeneous Graph Neural Network via Metapath Optimization
- MoME: Mixture of Multi-Domain Experts for Multivariate Long-Term Series Forecasting
- MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
- Mobile-friendly Image de-noising: Hardware Conscious Optimization for Edge Application
- Modality Modulation and Dual Consistency for Multi-Modality Semi-Supervised Medical Image Segmentation
- Modality-Invariant Bidirectional Temporal Representation Distillation Network for Missing Multimodal Sentiment Analysis
- Model-Based Machine Learning for Max-Min Fairness Beamforming Design in JCAS Systems
- Model-Driven Learning Approach for Robust WiFi-based Fall Detection
- Model-based Online Millimeter-wave Channel Sensing with Learned Empirical Priors
- Modeling of HR Filters for Audio Object Rendering
- Modifying Flow Matching for Generative Speech Enhancement
- Modular Gaussian Splatting: Instance Decomposable Learning and Adaptive Rendering of 3D Scenes via Mixture of Experts
- Modular Prompt Learning Improves Vision-Language Models
- Modulating State Space Model with SlowFast Framework for Compute-Efficient Ultra Low-Latency Speech Enhancement
- Modulo Sampling and Recovery with Unknown and Time-Varying Folding Parameter
- MonTransformer: Self-Supervised Phonetic to Glyph Conversion Leveraging Positional Context for Traditional Mongolian Texts
- MonoIR: Inpainting and Reconstruction for Monocular Endoscope Deformation Scenes
- Monte Carlo Score Matching for Image Generation
- Mora-Level Prosody Prediction for Text-to-Speech Using Japanese BERT Without Accentual Labels
- MorphFader: Enabling Fine-grained Controllable Morphing with Text-to-Audio Models
- MotionComposer: Enhancing Rhythmic Music Generation with Adaptive Retrieval Reference
- MotionFlow: Joint Motion Priors and Appearance Enhancement for High-Accuracy Optical Flow Estimation
- Mouth Articulation-Based Anchoring for Improved Cross-Corpus Speech Emotion Recognition
- Movable Antenna Aided Physical Layer Security with No Eavesdropper CSI
- MpoxMamba: A Grouped Mamba-based Lightweight Hybrid Network for Mpox Detection
- MuRL-DTI: A Multimodal Feature Fusion Reinforcement Learning Approach for Cold Start in Drug-Target Interactions
- Multi Queue for Unsupervised Person Re-identification
- Multi-Agent Decision Transformer for Power Control in Wireless Networks
- Multi-Agent Hierarchical Graph Attention Actor-Critic Reinforcement Learning
- Multi-Agent Reinforcement Learning in Partially Observable Environments Using Social Learning
- Multi-Class Dementia Detection Using Acoustic Features - ICASSP-2025 PROCESS Challenge
- Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
- Multi-Degradation Oriented Deep Unfolding Model for Hyperspectral Image Reconstruction
- Multi-Descriptor Mesh Animation Compression
- Multi-Feature Audio Fusion for Nonverbal Vocalization Classification
- Multi-Grained Feature Pruning for Video-Based Human Pose Estimation
- Multi-Head Auto-Correlation Attention Networks for Session-based Social Recommendation
- Multi-Layer Knowledge Distillation for Continual Semantic Segmentation
- Multi-Level Speaker Representation for Target Speaker Extraction
- Multi-Microphone Speech Emotion Recognition Using the Hierarchical Token-Semantic Audio Transformer Architecture
- Multi-Modal Medical Image Fusion via 3D Manifold Fitting and Dual-Domain Cross-Attention
- Multi-Modal Rhythmic Generative Model for Chinese Cued Speech Gestures Generation
- Multi-Modal Semantic Communication With Point Cloud Diffusion
- Multi-Objective Large Language Model Unlearning
- Multi-Objective Reinforcement Learning for Cognitive Radar Resource Management
- Multi-Objective Representation based Dynamic Prototype Learning for Unsupervised DCE-MRI Breast Tumor Segmentation
- Multi-Point Positional Insertion Tuning for Small Object Detection
- Multi-Prototype Grouping for Continual Learning in Visual Question Answering
- Multi-Prototype-based Embedding Refinement for Medical Image Segmentation
- Multi-Relational Geometric Regularization Framework for Multi-Modal Emotion Recognition in Conversation
- Multi-Relational Variational Contrastive Learning for Next POI Recommendation
- Multi-Scale Attention-Based Dense Spatial-Temporal Model for Emotion Induction in Response to Olfactory Stimuli
- Multi-Scale Conditional Generative Adversarial Networks for Wind Speed Data Imputation in Earthen Ruins Protection
- Multi-Scale Dehaze Network Based on Frequency Domain Assistance and Detailed Brightness Information Guidance
- Multi-Scale Denoising in the Feature Space for Low-Light Instance Segmentation
- Multi-Scale Parallel Hybrid Network for Palmprint Recognition
- Multi-Source Multi-Target Domain Similarity Network for Cross-Cultural EEG Emotion Recognition
- Multi-Source Spatial Knowledge Understanding for Immersive Visual Text-to-Speech
- Multi-Stage Multimodal Distillation for Audio-Visual Speaker Tracking
- Multi-Style Facial Sketch Synthesis through Masked Generative Modeling
- Multi-Task Joint 3D Swin Transformer Learning for Segmentation and Classification of Hyperspectral Medicine Images
- Multi-Task Learning for Ultrasonic Echo-based Depth Estimation with Audible Frequency Recovery
- Multi-Task Model Fusion via Adaptive Merging
- Multi-User Non-Orthogonal Multiple Access in Power Line Communications Under Generalized Gaussian Noise
- Multi-View Image Enhancement Inconsistency Decoupling Guided 3D Gaussian Splatting
- Multi-View Radar Detection Transformer with Differentiable Positional Encoding
- Multi-channel Speaker Counting for EEND-VC-based Speaker Diarization on Multi-domain Conversation
- Multi-domain fusion network for underwater image enhancement
- Multi-hop Self-augmented Graph Contrastive Learning for Node Classification
- Multi-label Recognition under Noisy Supervision: A Confusion Mixture Modeling Approach
- Multi-label body constitution recognition via dual transform MLP-like architecture using tongue images
- Multi-layer Network Disintegration via Deep Reinforcement Learning
- Multi-level Conflict-Aware Network for Multi-modal Sentiment Analysis
- Multi-level Encoder with Global Topic for Task-oriented Dialogue Summarization
- Multi-level Feature Adaptation and Embeddings Alignment for Zero-shot Anomaly Detection
- Multi-modal Dynamic Point Cloud Geometric Compression Based on Bidirectional Recurrent Scene Flow
- Multi-modal Entity Alignment under Imbalanced Visual Modality Information
- Multi-modal Salient Object Detection via a Unified Diffusion Model
- Multi-modal Speech Enhancement with Limited Electromyography Channels
- Multi-modal Streaming ASR in Cross-talk Scenario for Smart Glasses
- Multi-object detection and tracking algorithm for fry counting based on DV-YOLO and FryMOT
- Multi-period Normalization for Long-term Time Series Forecasting
- Multi-range Adaptive Perception Transformer for Iterative Homography Estimation
- Multi-scale Context Intertwining for Panoramic Renal Pathology Segmentation
- Multi-scale Feature Interaction and Adaptive Experts for Panoptic Segmentation in Remote Sensing Images
- Multi-scale Graph Convolution with Corrective Contrastive Learning for Skeleton-based Action Recognition
- Multi-scale Re-weighted Attention Feature Fusion for Non-Intrusive Load Monitoring
- Multi-scale Spectral Mixture Neural Operator
- Multi-scale across attention incorporated network for X-ray coronary vessel segmentation
- Multi-source Data Lossless Compression via Parallel Expansion Mapping and xLSTM
- Multi-step Fusion of Relation Type Information and Multi-Task Decoding for Entity Relation Extraction in ancient Chinese
- Multi-view Feature Discrepancy Attack for Single Object Tracking
- Multi-view Hypergraph-based Contrastive Learning Model for Cold-Start Micro-video Recommendation
- Multi-view Subspace Classification: A Hierarchical Contrastive Approach and Low-rank Latent Representation
- Multiband Unlimited Sampling: Super-Nyquist or Sub-Nyquist, That is the Question!
- Multichannel Modulo Sampling with Unlimited Noise
- Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues
- Multiclass Arrhythmia Classification using Smartwatch Photoplethysmography Signals Collected in Real-life Settings
- Multilevel Semantic-Aware Model for AI-Generated Video Quality Assessment
- Multilingual Parameter-Sharing Adapters: A Method for Optimizing Low-Resource Neural Machine Translation
- Multilingual Speaker-Invariant Dysarthria Severity Assessment Using Adversarial Domain Adaptation and Self-Supervised Learning
- Multimodal ARMAX Model for Characterization of Human Body System
- Multimodal Atrial Fibrillation Risk Stratification: Fusing Post-Stroke Brain DWI and Clinical Data
- Multimodal Dialogue Emotion Recognition Based on Label Optimization and Coarse-Grained Assisted Fine-Grained
- Multimodal Emotion Recognition in Conversation via Possible Speaker's Audio and Visual Sequence Selection
- Multimodal Emotion Recognition with Target Speaker-Based Facial Embeddings
- Multimodal Fusion for EEG Emotion Recognition in Music with a Multi-Task Learning Framework
- Multimodal Machine Learning Can Predict Videoconference Fluidity and Enjoyment
- Multimodal and Multiple Prompts for Biology
- Multiple Choice Learning for Efficient Speech Separation with Many Speakers
- Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
- Multiple Sclerosis Detection with Reinforcement Learning and Differential Evolution
- Multiresolution Encoder-Decoder Convolutional Neural Network for Magnetic Resonance Image Segmentation
- Multiscale Adaptive Channel Estimation for OTFS
- Multivariate Time Series Data Mining for Failure Prediction & Root Cause Analysis
- Multiview Canonical Correlation Analysis for Automatic Pathological Speech Detection
- Music Tagging with Classifier Group Chains
- Music2Latent2: Audio Compression with Summary Embeddings and Autoregressive Decoding
- MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
- MusicGen-Stem: Multi-stem music generation and edition through autoregressive modeling
- MusicLIME: Explainable Multimodal Music Understanding
- MusicMamba: A Dual-Feature Modeling Approach for Generating Chinese Traditional Music with Modal Precision
- Mutual-View Contrastive Generative Framework for Attribute-Missing Graph Clustering
- MutualForce: Mutual-Aware Enhancement for 4D Radar-LiDAR 3D Object Detection
- N3C: Towards Replay-based Novelty Continual Clustering with Class-Overlapping
- NAT3DSound: 3D Spatial Sound Field Synthesis with Multi-Modal Non-Autoregressive Transformer
- NCDI-Diffusion: Neural Contextual and Directional Inversion for Novel View Synthesis through Diffusion Models
- NCL-CIR: Noise-aware Contrastive Learning for Composed Image Retrieval
- NCNet: Learning to Find Non-Consistent Correspondence Using Learnable Frequency Response Function
- NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
- NTC-KWS: Noise-aware CTC for Robust Keyword Spotting
- NanoGen: A High-affinity Nanobody Generation Model with Guided Diffusion
- NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
- Naturalistic Music Decoding from EEG Data via Latent Diffusion Models
- NeRF-3DTalker: Neural Radiance Field with 3D Prior Aided Audio Disentanglement for Talking Head Synthesis
- NeRF-VLD: Efficient Visual Landmark Database Construction via Scene Constraints
- Near Optimal Privacy Preserving Fair Multi-Agent Bandits*
- Near-Field FMCW SAR Imaging With Fast BPA
- Near-Field ISAC in 6G: Addressing Phase Nonlinearity via Lifted Super-Resolution
- Near-field AoA estimation with Complex Convolutional Kolmogorov-Arnold Network
- Negative Learning and Dual Contrastive for Unsupervised Visible-Infrared Person Re-identification
- Neighborhood Attention Transformer with Progressive Channel Fusion for Speaker Verification
- Network Games Induced Prior for Graph Topology Learning
- Networked ISAC Beamforming Design with Capacity-Limited Fronthaul Links
- Neural Adaptive Contextual Video Streaming
- Neural Ambisonic Encoding For Multi-Speaker Scenarios Using A Circular Microphone Array
- Neural Architecture Search for Ultra-low Memory Blood Glucose Forecasting on the Edge
- Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario
- Neural Variational Mode Decomposition and Its Application for ECG Denoising
- NeuroIncept Decoder for High-Fidelity Speech Reconstruction from Neural Activity
- Neuromorphic Unlimited Sampling for High-Dynamic-Range Video Acquisition
- Next-Generation ANC: Integrating Dynamic Fixed-Filter Strategies With Extended Kalman Filtering for Enhanced Noise Suppression
- No Class Left Behind: A Closer Look at Class Balancing for Audio Tagging
- No Data Required: Zero-Shot Domain Adaptation for Automatic Music Transcription
- No-Reference Point Cloud Quality Assessment Based on Graph Signal Variation
- Node Selection for Physical Layer Security Using Graph-Based Vertex-Frequency Representation
- Node-Centric Meta Structure Search in Heterogeneous Graphs
- Noise Supervised Contrastive Learning and Feature-Perturbed for Anomalous Sound Detection
- Noise-Agnostic Multitask Whisper Training for Reducing False Alarm Errors in Call-for-Help Detection
- Noise-Mitigated Variational Quantum Eigensolver with Pre-training and Zero-Noise Extrapolation
- Noise-Resilient Unlimited Sampling and Recovery of Sparse Signals
- Noise-Robust Speech Emotion Recognition Using Shared Self-Supervised Representations with Integrated Speech Enhancement
- Non-Autoregressive Image Captioning with Multi-Label Classification and Self-Critical Sequence Training
- Non-Autoregressive Multimodal Machine Translation
- Non-Pharmacological Interventions: A Virtual Training Framework for Fine Motor Learning
- Non-contact Quickest Abnormal Heart Rate Detection using MIMO Radar
- Non-invasive Speaker-dependent Continuous Phoneme Recognition with a Radar-based Silent Speech Interface
- Non-negative Weighted DAG Structure Learning
- Nonlinear Anisotropic Diffusion-Based Channel Estimation in 5G Wireless Networks
- Nonlinear Precoding in the RIS-Aided MIMO Broadcast Channel
- Norm Augmented Graph AutoEncoders for Link Prediction
- Novel Deep Gaussian Process Structures with Flexible Depths
- NucleiFormer: A Nuclei Segmentation Model Optimized by Joint Haar Wavelet and Adaptive Feature Calibration
- O-EENC-SD: Efficient Online End-to-End Neural Clustering for Speaker Diarization
- OARecon: Object-Aware Viewpoint Augmentation for Indoor Compositional Reconstruction
- OCLNet: Obfuscation feature Contrastive Learning Network for Weakly Supervised Semantic Segmentation on Ultrasound Images
- OCTAMamba: A State-Space Model Approach for Precision OCTA Vasculature Segmentation
- OF-AR Relation Aware Representation Learning for Lesion Image Segmentation and Grading
- OLN++: Improved Object Localization Network for Open-world Object Detection
- OPFormer: Real-Time Optimal Power Flow with CNN-Based Transformer
- OSLO-IC: On-the-Sphere Learned Omnidirectional Image Compression with Attention Modules and Spatial Context
- OSR: Toward Developing Efficient Federated Learning-based Human Activity Recognition using Optimal Server Representations
- OTFS for Automotive Radars: Waveform Optimization and Ambiguity Function Analysis
- OTMEA : Multi-modal Entity Alignment via Optimal Transport
- OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models
- Object-Based Video Tampering Localization via Trace Consistency Analysis
- Object-Centric Discriminative Learning for Text-Based Person Retrieval
- Object-level Data Augmentation for Visual 3D Object Detection in Autonomous Driving
- Offline Reinforcement Learning via Conservative Smoothing and Dynamics Controlling
- On Class Separability Pitfalls In Audio-Text Contrastive Zero-Shot Learning
- On Decentralized Learning with Stochastic Subspace Descent
- On Momentum Acceleration for Randomized Coordinate Descent in Matrix Completion
- On Noise-Sensitivity of Unlimited Sampling in Line Spectral Estimation
- On Overlap Ratio in Defocused Electron Ptychography
- On The Role of Prompt Construction In Enhancing Efficacy and Efficiency of LLM-Based Tabular Data Generation
- On the Design of Low-Rank Differential Beamformers with Nonuniform Linear Microphone Arrays
- On the Design of Weakly-Convex Regularizers for Solving Linear Inverse Problems
- On the Relation Between Speech Quality and Quantized Latent Representations of Neural Codecs
- On the Restricted Isometry Property of Kronecker-structured Matrices
- On-device hand model for robust gesture detection
- One Shot is Enough for Sequential Infrared Small Target Segmentation
- One-Shot Face Avatar Generation in a Single Forward Pass with Identity Preservation
- One-Shot Learning for Pose-Guided Person Image Synthesis in the Wild
- One-Shot Talking Face Generation with Expression Editing
- One-step Incomplete Multi-view Clustering based on Bipartite Graph Learning
- Online Contrastive Continual Learning with Hard Negative Samples
- Online Learning With Non-convex Losses: New Condition To Achieve Small Dynamic Regret
- Online Learning from Strategic Human Feedback in LLM Fine-Tuning
- Online Network Inference from Graph-Stationary Signals with Hidden Nodes
- Online Optimization of Offloading Video Analytics Tasks to Multiple Edges for Accuracy Maximization
- Online Proximal ADMM for Graph Learning from Streaming Smooth Signals
- Online scalable Gaussian processes with conformal prediction for guaranteed coverage
- Online waveform selection for cognitive radar
- Open Automatic Speech Recognition Models for Classical and Modern Standard Arabic
- Open-Amp: Synthetic Data Framework for Audio Effect Foundation Models
- Open-Modality Latent Modality Interaction Maximization for Audio-Visual Learning
- Open-Vocabulary Saliency-Guided Progressive Refinement Network for Unsupervised Video Object Segmentation
- Open-Vocabulary Visual Emotion Adaptation via Prompt Learning
- OpenACE: An Open Benchmark for Evaluating Audio Coding Performance
- Opportunities and Challenges for Bluetooth LE Audio Assistive Listening Systems
- Optical Authenticity in Pushbroom System for Spectral Information Protection
- Optimal Combination Policies for Error Exponent Maximization in Social Learning
- Optimal Device Selection and Resource Allocation in Federated Learning
- Optimal One-hot Logistic Regression for Tree-based Distribution Classification
- Optimization of Beamwidth in Automotive Radars Based on Statistics of Street Geometry
- Optimization of Chirality Variation in Carbon Nanotube Field Effect Transistor Spiking Neurons
- Optimized Dynamic Watermarking for Audio DNNs with Adaptive Embedding and Boundary Sampling
- Optimized Self-supervised Training with BEST-RQ for Speech Recognition
- Optimizing Biomarkers from Earbud Ballistocardiogram: Calibration and Calibration-Free Algorithms for Accelerometer Axis Selection and Fusion
- Optimizing Dual-Mode UAV-Assisted Remote IoT Data Collection with Decentralized DRL in 6G-Enabled Space-Air-Ground Networks
- Optimizing Multimodal Image Fusion: A Novel Approach with Nystrom Attention Mechanisms in Transformer Models
- Optimizing Speech Multi-View Feature Fusion through Conditional Computation
- Optimum Power-Subcarrier Allocation and Time-Sharing in Multicarrier NOMA Uplink
- OrientDream: Streamlining Text-to-3D Generation with Explicit Orientation Control
- Out-of-Distribution Detectors: Not Yet Primed for Practical Deployment
- Out-of-Distribution Radar Detection in Compound Clutter and Thermal Noise through Variational Autoencoders
- Outage Analysis of IRS-Aided Wireless Energy Transfer Under Correlation and Imperfect CSI
- Overcoming Uncertain Incompleteness for Robust Multimodal Sequential Diagnosis Prediction via Curriculum Data Erasing Guided Knowledge Distillation
- PAFedMIS: Personalized Asynchronous Federated Learning for Medical Image Segmentation
- PAIR: Complementarity-guided Disentanglement for Composed Image Retrieval
- PANDA: Patch-Aware Graph Network with Dual Alignment for Time Series Forecasting
- PASTD: Progressive Augmentation and Spatiotemporal Decoupling Contrastive Learning for Skeleton-Based Action Recognition
- PAUSE: Privacy-Aware Active User Selection for Federated Learning
- PB-UAP: Hybride Universal Adversarial Attack for Image Segmentation
- PBD : Plastic Bottle Dataset for Defect Detection
- PD-SDF: Dynamic Surface Reconstruction Based on Plane Decomposition for Single View RGB-D Videos
- PD-VOST: Parkinson's Disease Voice Spectrogram Transformer
- PDCE: Patch-wise Dynamic Curve Estimation for Low-Light Image Enhancement
- PDMX: A Large-Scale Public Domain MusicXML Dataset for Symbolic Music Processing
- PDSeg: Patch-Wise Distillation and Controllable Image Generation for Weakly-Supervised Histopathology Tissue Segmentation
- PDTrack: Progressive Distance Association for Multiple Object Tracking
- PEDE: Enhance Multi-modal Sarcasm Detection in Videos via Prompted Emotion Distributions
- PEPL: Precision-Enhanced Pseudo-Labeling for Fine-Grained Image Classification in Semi-Supervised Learning
- PET: High-Frequency Temporal Self-Consistency Learning for Partially Deepfake Audio Localization
- PGD-Imp: Rethinking and Unleashing Potential of Classic PGD with Dual Strategies for Imperceptible Adversarial Attacks
- PGDGS: Improving Few-shot 3D Gaussian Splatting with Progressive Gaussian Densification
- PHMamba: Preheating State Space Models with Context-Augmented Features for Medical Image Segmentation
- PIER: A Novel Metric for Evaluating What Matters in Code-Switching
- PIN: A Prompt-based Implicit Sentiment Analysis Network for Chinese
- PNP-RKD: A Positive-Negative Pair based Relational Knowledge Distillation Method for Cross-Domain Speaker Verification
- PNetGPT: Proprietary Protocol Network Traffic Generation with Pre-trained Transformer
- PPDformer: Channel-Specific Periodic Patch Division for Time Series Forecasting
- PQNAS: Mixed-precision Quantization-aware Neural Architecture Search with Pseudo Quantizer
- PR-KGC: Text-enhanced Knowledge Graph Completion with Pair-wise Re-ranking
- PRESS: Defending Privacy in Retrieval-Augmented Generation via Embedding Space Shifting
- PRimuS: Pretraining IMU Encoders with Multimodal Self-Supervision
- PTQ4ADM: Post-Training Quantization for Efficient Text Conditional Audio Diffusion Models
- PaSTS: Parameter-affined Seasonal-Trend Synthesis for Multi-dimensional Long-Term Time Series Forecasting within LLM
- Padnet: a Patch-Based Anomaly Detection Framework for Industrial Pipeline Damage Detection
- Palm-vein images reconstruction against adversarial attacks
- Pan-protein Design Learning Enables Task-adaptive Generalization for Low-resource Enzyme Design
- Pancreatic Cystic Neoplasms Lesion Detection for Non-contrast CT Image via Teacher-student Model
- Panorama: An enabling technology for Hearables
- Parameter-Efficient Federal-Tuning Enhances Privacy Preserving for Speech Emotion Recognition
- Parametric Object Coding in IVAS: Efficient Coding of Multiple Audio Objects at Low Bit Rates
- Part in Part Embedding Network for Zero-Shot Learning
- Partial Inference in Structured Prediction
- Partial Reconstruction Error for Deepfake Detection
- Partially Observable Contextual Bandits With Linear Payoffs
- Particle-based Data-driven Nonlinear State Estimation of Model-free Process from Nonlinear Measurements
- Passive Non-Line-of-Sight Imaging with Parallel Encoder
- Past, Present, and Future of Spatial Audio and Room Acoustics
- Patch Attention Excitation Based Vision Transformer for Small-Sized Datasets
- PatchST: A Patch Spatial-Temporal Network for Large-Scale Traffic Forecasting
- Path Signatures are Unsupervised Time Series Anomaly Extractors
- Pathological Prior-Guided Multiple Instance Learning For Mitigating Catastrophic Forgetting in Breast Cancer Whole Slide Image Classification
- Pathological Section Staining Transferring with Tailored Metric-based Model Selection
- PeT-KeyStAtion: Parameter-efficient Transformer with Keypoint-guided Spatial-temporal Aggregation for Video-based Person Re-identification
- Peer-to-Peer Learning Dynamics of Wide Neural Networks
- Perception-Enhanced Network for Accurate Human Pose Estimation
- Perceptual Audio Coding: A 40-Year Historical Perspective
- Perceptual Noise-Masking with Music through Deep Spectral Envelope Shaping
- Performance Bounds for Single-Bit AOA-Based RF Source Localization
- Person-In-Bed Detection using Frequency Domain Features and GLR-based CuSum
- Person-in-Bed Detection from Mattress-Integrated Accelerometers
- Personalized Federated Class-Incremental Learning through Critical Parameter Transfer
- Personalized Graph Transformer for Federated Graph Learning
- Personalized Speech Enhancement without User Enrollment for Real-World Audio Replay Scenarios
- Personalizing Keyword Spotting with Speaker Information
- Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
- Phoneme-Aware Acoustic Analysis of Natural Speech for Lung Function Assessment
- Phoneme-Level Contrastive Learning for User-Defined Keyword Spotting with Flexible Enrollment
- PhysID: Physics-based Interactive Dynamics from a Single-view Image
- Physically Robust and Imperceptible Adversarial Examples Generation Based on Frequency
- Physics-Informed Neural Networks for Ocean Acoustic Field Prediction with Envelope Smoothing
- PiCNet: Physics-infused Convolution Network for Radar-Based Precipitation Nowcasting
- Piano Transcription by Hierarchical Language Modeling with Pretrained Roll-based Encoders
- PicoAudio: Enabling Precise Temporal Controllability in Text-to-Audio Generation
- Pipeline-Centered Neighboring Network for Deep Unfolding Pansharpening
- Plaintext-Free Deep Learning for Privacy-Preserving Medical Image Analysis through Frequency Information Embedding
- Planetary gear vibration monitoring using synchronous demodulation
- Planing It by Ear: Convolutional Neural Networks for Acoustic Anomaly Detection in Industrial Wood Planers
- PlantPCC: Dual Sampling and Multi-level Geometry-aware Contrastive Regularization for Plant Point Cloud Completion
- Point Clean-label Backdoor Attack for Specific Classes via Feature Entanglement
- Point Cloud Registration via Reconstruction with Local Geometry Information Aggregation
- Point Cloud Resampling With Learnable Heat Diffusion
- Point-UMAE: Unet-like Masked Autoencoders for Point Cloud Self-supervised Learning
- PointActionCLIP: Preventing Transfer Degradation in Point Cloud Action Recognition with a Triple-Path CLIP
- Poisoning The Diffusion: A Simple and Robust Watermarking Method for Audio Generation
- Polygon Pixel IoU: Similarity Metric between Polygons with Different Number of Vertices for Arbitrary-Shaped Text Spotting
- Popularity and Interest Signal Detection for Sequential Recommendation Denoising
- Position-aware Hypergraph Message-Passing Neural Network
- Positional Differential Encoding for Distributed Learning
- Positioning and transmission in cell-free networks: ambiguity function, and MRC/MRT array gains
- Positive Enhanced Preference Alignment for Text-to-Image Models
- Post-Hoc Adversarial Stickers Against Micro-Expression Leakage
- Post-Net2.0: An adaptive weighted loss function driven by linguistic constraint for automatic syllable stress detection
- Power in Unity: Combining in-Domain and out-of-Domain Pre-Training Strategies for EEG-Based Person Identification
- Practical Radar Sensing Using Two Stage Neural Network for Denoising OTFS Signals
- Pre-training with Synthetic Patterns for Audio
- Pre-training, Fine-tuning and Re-ranking: A Three-Stage Framework for Legal Question Answering
- Precisely Controllable Neural Speech Synthesis
- Precision in Pathology: PMA-DETR Elevates Tumor Lesion Detection
- Preconditioned Sharpness-Aware Minimization: Unifying Analysis and a Novel Learning Algorithm
- Predicting Biomechanical Risk Factors for Division - I Women's Basketball Athletes
- Predicting Compact Phrasal Rewrites with Large Language Models for ASR Post Editing
- Predicting local fMRI activations from EEG: a Feasibility Study Using Both Classical and Modern Machine Learning Pipelines
- Prediction-driven Untrained Network for Single-snapshot Sparse Array Interpolation
- Preference Alignment Improves Language Model-Based TTS
- Prelude echoes Finale: Video Domain Adaptation with Fine-grained Temporal Consistency
- Preventing output saturation in active noise control: An output-constrained Kalman filter approach
- PrimeK-Net: Multi-scale Spectral Learning via Group Prime-Kernel Convolutional Neural Networks for Single Channel Speech Enhancement
- Principal Curvatures Estimation with Applications to Single Cell Data
- PriorSinger: Singing Voice Synthesis Model with Prior Condition Cross Attention
- Privacy-Aware Federated Fine-Tuning of Large Pretrained Models With Just Forward Propagation
- Privacy-Preserving Distributed Maximum Consensus Without Accuracy Loss
- Private Semantic Communications with Separate Blind Encoders
- Probabilistic Contrastive Test-Time Adaptation
- Probabilistic Person-in-Bed Detection Using Accelerometer Signals
- Problem Solving-Oriented Programming Knowledge Tracing from Behavior to Thought
- Progressive Subband Modeling for Artifacts-free Speech Super-resolution
- Projection Modules for Few-Shot Object Detection
- Projection Valued-based Quantum Machine Learning Adapting to Differential Privacy Algorithm for Word-level Lipreading
- Promoting PLM Fine-Tuning through Consistency Adversarial Training
- Prompt Crossing: Evaluating Whether LLM Response Stem from Jailbreak or Normal Prompt
- Prompt Fusion and Aspect-Oriented Filtration for Aspect-Based Multimodal Sentiment Analysis
- Prompt-UIE: A Unified Prompt-Driven Framework for Underwater Image Enhancement
- Prompt-augmented Feature with Cross-domain Contrastive Learning for Efficient Multi-domain Sentiment Analysis
- Prompt-to-Correct: Automated Test-Time Pronunciation Correction with Voice Prompts
- PromptArtisan: Multi-instruction Image Editing in Single Pass with Complete Attention Control
- PromptSeg: Learning to Segment Medical Image via Visual Prompts
- PromptTA: Prompt-driven Text Adapter for Source-free Domain Generalization
- Prompting DirectSAM for Semantic Contour Extraction in Remote Sensing Images
- Prototype Alignment with LoRA Fusion for Class-Incremental Learning
- Prototype Matching with Domain Alignment for Open-world Specific Emitter Identification
- Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection
- Prototype-Driven Multi-Feature Generation for Visible-Infrared Person Re-identification
- Prototypical Graph Alignment for Text-based Person Search
- Prototypical Part Transformer for Interpretable Image Recognition
- Proud-SLAM: Neural Point-based Hybrid RGBD Monocular Dense SLAM
- Proximity Detection and Trajectory Recognition with Machine Learning for UHF RFID Systems
- Pruning for Sparse Diffusion Models Based on Gradient Flow
- Pruning then Reweighting: Towards Data-Efficient Training of Diffusion Models
- PsSR: Hybrid Path Selection Mechanism for Efficient Image Super-Resolution
- Pseudo-Labeling for Enhanced User Privacy in Approximate Machine Unlearning
- Psycholinguistic Features Predict Word Duration in Hindi Read Aloud Speech
- PulmoScan: A Practical Pulmonary Disease Pre-Screening System
- Punctuation Restoration: A Case Study of BERT-Based Models' Task-Specific Excellence
- Pushing Wi-Fi Towards Fine-Grained Sensing Via Spectrogram Enhancement
- Pyramid Attention Enhancement Network for Nighttime UAV Tracking
- QoKV: Comprehending and Surpassing the Hurdles of KV Cache Quantization
- Quad-Net: Melspectrogram Vocoder with Convolutional Layers Restricted by the Quadrature Mirror Filter for Perfect Reconstruction
- Quality and Complexity Tradeoffs for DNN-Based Binaural Speech Enhancement in Hearing Aids
- Quant-NeRF: Efficient End-to-End Quantization of Neural Radiance Fields with Low-Precision 3D Gaussian Representation
- Quantum Multi-Path Communication Protocol Based on Maximum Flow Theory
- Quantum Multimodal Contrastive Learning Framework
- Quantum Neural Networks: A Path to Lower Emissions Through Fuel Consumption Prediction in Shipping
- Quantum Reinforcement Learning for Coordinated Satellite Systems
- Quantum Run-length Encoding: Optimizing Data Compression on Quantum Computers with Exponential Resource Efficiency
- Quantum-Behaved Particle Swarm Optimization for the Segmentation of Kidney Stone CT Images
- Quantum-Train with Tensor Network Mapping Model and Distributed Circuit Ansatz
- Quasi Polynomial and Interpolative Models for Tensor Approximation
- Quaternion CNN With Salient Features for Color Image Denoising
- Query-Aware Temporal Aggregation Network for Temporal Knowledge Graph Reasoning
- Quickest Change Detection of Unknown Mean-Shifts using the James-Stein Estimator
- R2-SAC: A Relaxation-and-Refinement SAC Agent for Stock Portfolio Trading
- RAC-GAN: Iterative Dual-Objective Over and Under Sampling for Imbalanced Datasets
- RADCI: A Synchronized Radar-RGBT Object Detecting-Tracking Dataset And A Benchmark
- RAFDet: A Novel Camera-Radar Fusion Framework for Robust 3D Object Detection in Autonomous Driving
- RAOCSL: A BERT-Based Strategy for Identifying Learner Confusion under Class Imbalance
- RAPID: Recognition of Any-Possible DrIver Distraction via Multi-view Pose Generation Models
- RAS-GNN: Reconstructing APT Attack Scenario Using Graph Neural Network
- RAW Data: A Key Component for Effective Deepfake Detection
- REAct: Rational Exponential Activation for Better Learning and Generalization in PINNs
- RETAIN: Reliable Topology Augmentation for both Heterophilic and Homophilic Graphs
- RF Distillation Diffusion Model: An Efficient RFF Data Augmentation Method
- RF-GML: Reference-Free Generative Machine Listener
- RF-Pose Estimation based on Contrastive Camera-Radar-Images Pretraining
- RFEM: Remote Feature Enhancement Module for Target Detection
- RIS-Enabled Self-Interference Elimination in Monostatic Full-Duplex DFRC Systems
- ROME: Radar Sparsity Improvement and Omnimodal Enhancement for 3D Object Detection in Bird's Eye Views
- RPPFL: Robust and Privacy-Preserving Federated Learning via Trusted Execution Environments
- RQTalker: Speech-driven 3D Facial Animation via Region-aware Vector Quantization
- RSM: Refined Saliency Map For Explainable 3D Object Tracking
- RTF Estimation Using Riemannian Geometry for Speech Enhancement in the Presence of Interferences
- RWKVMatch: Vision RWKV-based Multi-scale Feature Matching Network for Unsupervised Deformable Medical Image Registration
- RaLU-Net: Deep Unfolded Radar Localization of Humans for Precise Multi-Person Non-Contact Vital Signs Monitoring
- RadDet: A Wideband Dataset for Real-Time Radar Spectrum Detection
- Radar Jamming Recognition via Cross-Modality Contrast Learning
- Radar2ECG: Multi-Scale Bottleneck Fusion and Cross-modal Semantic Distillation for Conditional Electrocardiogram Generation from Radar Heart Sound
- Radiation and Directivity Analysis of a Vibrating Dome-Shaped Radiator Mounted on an Infinite Baffle
- Radio Map Estimation via Latent-Domain Plug-and-Play Denoisers
- RanDoctor: System-Level Ransomware Detection with ProbSparse Self-Attention
- Rapid Online Bayesian Learning for Deep Receivers
- Rate-Constrained Quantization for Communication-Efficient Federated Learning
- Raw Audio Deep Learning Filter Banks for Acoustic Scene Classification
- Re-Evaluating Privacy in Centralized and Decentralized Learning: An Information-Theoretical and Empirical Study
- ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
- ReTD: Reconstruction-Based Traceability Detection for Generated Images
- Real-time Adversarial Attack to Deep Learning-based Wi-Fi Human Activity Recognition
- Realistic Real-Time Talking Head Synthesis with Grid Encoding and Progressive Conditioning
- RecNet: Optimization for Dense Object Detection in Retail Scenarios Based on View Rectification
- Reconciling AMP Algorithms derived from Belief Propagation or the Large System Limit Bethe Free Energy
- Reconstruction of EEG and ECG from Single Channel Mixture using Branched Autoencoder based Separable Representations
- Recursive Feature Learning from Pre-Trained Models for Spoofing Speech Detection
- Redefining Well Exposedness for Locally Adaptive Multi-Exposure Fusion
- Redesigning graph filter-based GNNs to relax the homophily assumption
- Reduced Effectiveness of Kolmogorov-Arnold Networks on Functions with Noise
- Reduced Spatial Dependency for More General Video-level Deepfake Detection
- Reducing the Gap Between Pretrained Speech Enhancement and Recognition Models Using a Real Speech-Trained Bridging Module
- Reducing the Sensitivity of Neural Physics Simulators to Mesh Topology via Pretraining
- Reenvisioning Skeleton-based Action Recognition Through the Lens of NLP
- Reexamining the Efficacy of MetricGAN for Speech Enhancement
- RefCap: Zero-shot Video Corpus Moment Retrieval Based on Refined Dense Video Captioning
- Reference-Guided Parallel Independent Component Analysis: Estimating Cognition Associated Multimodal Patterns In Schizophrenia
- Refiner: Fine-grained Cross-modal Concepts Refinement for Compositional Zero-Shot Learning
- RefleXGen: The unexamined code is not worth using
- Regarding the Existence of the Internal Language Model in CTC-Based E2E ASR
- Regret Optimization Experience Replay in Off-Policy Reinforcement Learning
- Regularized Domain Adaptation for Estimation Tasks in Partially Observed Target Domains
- Regularized Weighted Descent: Model-Based Learner for Multi-Target Radar Waveform Design
- Reinforced Domain Selection for Continuous Domain Adaptation
- Reinforcement Learning for Charged Particle Beam Control to Minimize Injection Mismatch in Particle Accelerators
- Reinforcement Learning-Based Multi-Teacher Knowledge Distillation for Enhancing Retrieval Ranking Consistency
- Rejection of Workers with Heterogeneous (Mismatched) Data in Federated Learning *
- RelaI2P: Relational Learning for Image-to-Point Cloud Registration
- Relation-aware Semantic Alignment Network for Text-to-Image Person Retrieval
- Relative Localization of Asynchronous Agents Based on Hybrid Active-Passive Two-Way Ranging
- Relaxing Distillation Constraints for Improved New Class Learning in Continual Semantic Segmentation
- Reliable Imputed-Sample Assisted Vertical Federated Learning
- Reliable Learning From LLM Features for Multimodal Emotion and Intent Joint Understanding
- RemoteTrimmer: Adaptive Structural Pruning for Remote Sensing Image Classification
- Representative Arm Identification: A fixed confidence approach to identify cluster representatives
- Resilient Test-Time Adaptation by Mitigating Batch-Normalization Overfitting
- Resource Allocation for Semantic Segmentation Tasks in Autonomous Driving: A Likelihood Active Inference Approach
- Resource-Efficient and Noise-Robust Modality Fusion for Audio-Visual Speech Recognition
- RespDiff: An End-to-End Multi-scale RNN Diffusion Model for Respiratory Waveform Estimation from PPG Signals
- RestorMamba: An Enhanced Synergistic State Space Model for Image Restoration
- Retention Enhanced Cross-modal Attention for Multi-Hop VQA
- Rethinking Adversarial Attacks in Reinforcement Learning from Policy Distribution Perspective
- Rethinking Camouflaged Object Detection via Foreground-Background Interactive Learning
- Rethinking Decoding in Multi-intent Spoken Language Understanding
- Rethinking Dual-Stream Super-Resolution for Enhancing Remote Sensing Object Detection
- Rethinking Early-Fusion Strategies for Improved Multimodal Image Segmentation
- Rethinking Encoder-Decoder Flow Through Shared Structures
- Rethinking Mamba in Speech Processing by Self-Supervised Models
- Rethinking Mean Opinion Scores in Speech Quality Assessment: Score Aggregation through Quantized Distribution Fitting
- Rethinking the Fragility and Robustness of Fingerprints of Deep Neural Networks
- RetinaStereo: Dynamic-Volume Stereo Matching Network
- Retinex-Based Self-Conditioned Diffusion Model for Low-Light Image Enhancement
- Retrieval Augmented Correction of Named Entity Speech Recognition Errors
- Retrieval-Augmented Multilingual Citation Generation
- Retrieval-Augmented Neural Field for HRTF Upsampling and Personalization
- RevPv8: Reverse Information for Road Space and Lane Line Segmentation in Highway Surveillance Scene
- Revelio: A Real-World Screen-Camera Communication System with Visually Imperceptible Data Embedding
- Reversible Data Hiding in Encrypted Images Based on Variational Lossless Compression and Dual Encryption
- Revise, Reason, and Recognize: LLM-Based Emotion Recognition via Emotion-Specific Prompts and ASR Error Correction
- Revisiting Acoustic Features for Robust ASR
- Revisiting Neighborhood Aggregation in Graph Neural Networks for Node Classification using Statistical Signal Processing
- Revisiting and Refining Lagunas' Beamforming for Acoustic Imaging
- Revolutionizing Disease Diagnosis with simultaneous functional PET/MR and Deeply Integrated Brain Metabolic, Hemodynamic, and Perfusion Networks
- Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
- Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
- Right Label Context in End-to-End Training of Time-Synchronous ASR Models
- River-GEM: Generating and Enhancing Muddy Water Images
- RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation
- RobNAS: Robust Neural Architecture Search for Point Cloud Adversarial Defense
- Robust Activity Detection for Massive Access using Covariance-based Matching Pursuit
- Robust Adversarial Defense Based on Non-Transferability of Attack Across Foundation Models
- Robust Adversarial Training for Industrial Defect Classification with Long-Tailed Data
- Robust Audio Deepfake Detection using Ensemble Confidence Calibration
- Robust CLIP-Guided Deep Thinking: A Two-Stage Optimization Strategy for Enhancing Adversarial Robustness and Reliability in LVLMs
- Robust Cross-Etiology and Speaker-Independent Dysarthric Speech Recognition
- Robust Deepfake Detection via Perturbation Domain Alignment
- Robust Detection Based on the K-Score Test
- Robust Deterministic DOA Estimation Using α-divergence in Unknown Noise Fields with Sparse Sensor Arrays
- Robust Dwell Time Allocation for Multiple Ballistic Reentry Target Tracking in Phased Array Radar
- Robust Exponential Hyperbolic Tangent Geman-McClure Based Identification of Nonlinear Systems
- Robust Fixed-Filter Sound Zone Control with Audio-Based Position Tracking
- Robust Frame-level Speaker Localization in Reverberant and Noisy Environments by Exploiting Phase Difference Losses
- Robust Fusion of Bone and Air-Conducted Sensors for Speech Enhancement with Adaptive Temporal-Frequency Attention
- Robust Hybrid Beamforming for Integrated Sensing and Communications via Learned Optimization
- Robust Hybrid Convolutional Beamspace for High Resolution DOA Estimation
- Robust Identifiability for Symbolic Recovery of Differential Equations
- Robust Kernel Sparse Subspace Clustering
- Robust Low-Light Human Pose Estimation through Illumination-Texture Modulation
- Robust Multi-Pitch Estimation via Optimal Transport Clustering
- Robust Multi-task Adversarial Attacks Using Min-max Optimization
- Robust Multicomponent Tracking of Ultrasonic Vocalizations
- Robust Over-The-Air Federated Learning In Heterogeneous Networks
- Robust Qualitative Data Clustering via Learnable Multi-Metric Space Fusion
- Robust Seizure Prediction Based on Riemannian Manifold Enhanced Denoising Adversarial Autoencoder
- Robust Semantic Communications for Speech Transmission
- Robust Sensor Selection By Deep Unfolding
- Robust Speech Recognition with Schrödinger Bridge-Based Speech Enhancement
- Robust Supervised Graph Embedding Method For EEG-Based Brain Network Emotion Recognition
- Robust Target Speaker Direction of Arrival Estimation
- Robust and Efficient Adversarial Defense in SNNs via Image Purification and Joint Detection
- Robust and Efficient Text-based Speech Editing using Noise Conditioning and Rectified Flow
- Role of the Pretraining and the Adaptation data sizes for low-resource real-time MRI video segmentation
- Role-Specific Reward Design with Large Language Model for StarCraft II
- S-KEY: Self-supervised Learning of Major and Minor Keys from Audio
- SABiT-MNet: Scale-Adaptive Autoencoder with BiT-M Model for Identifying AMD Grades
- SACR: Self-training with Saliency-Augmented Consistency Regularization for Few-Shot Learners
- SAF: Local Shape-aware Face-based Garment Collision Handling via Neural SDFs
- SAM Adaptation with Refocused Attention and Diverse Prompts for Medical Image Segmentation
- SAM-OCTA2: Layer Sequence OCTA Segmentation with Fine-tuned Segment Anything Model 2
- SAR Ship Detector Using Cross-stage Feature Fusion and Decoupled Head with Mutual Guidance
- SBA: A Swift and Stealthy Backdoor Attack Framework for Federated Learning
- SBL Algorithms for the Multiple Measurement Vector Problem: New Modeling and Inference Methods
- SCAT: Shared-Convolution Adaptation Tuning for Foreground Segmentation
- SCDiar: a streaming diarization system based on speaker change detection and speech recognition
- SCF-Stega: Controllable Linguistic Steganography Based on Semantic Communications Framework
- SCI-Gaussian: Optimizing 3D Gaussian Radiance Fields from a Snapshot Compressive Image
- SCNN: Spike Coupling Neural Network for Multimodal Brain Network Analysis
- SCS: Spatially Consistent Self-Supervised approach for One-Shot Anatomical Landmark Detection
- SDAFE: A Dual-filter Stable Diffusion Data Augmentation Method for Facial Expression Recognition
- SEAL: Speaker Error Correction using Acoustic-conditioned Large Language Models
- SECC-Stega: Generative Linguistic Steganographic Framework Based on Error Correcting Codes
- SEE: Semantically Aligned EEG-to-Text Translation
- SEF-PNet: Speaker Encoder-Free Personalized Speech Enhancement with Local and Global Contexts Aggregation
- SEHAP: Secure and Efficient Handover Authentication Protocol in LEO Satellite Non-Terrestrial Networks
- SELMA: A Speech-Enabled Language Model for Virtual Assistant Interactions
- SFADNet: Spatio-temporal Fused Graph based on Attention Decoupling Network for Traffic Prediction
- SFE-Net: Harnessing Biological Principles of Differential Gene Expression for Improved Feature Selection in Deep Learning Networks
- SFFCE-CD: Spatial And Frequency Feature Cross Enhancement For Change Detection
- SFma-Unet: A Mamba-Based Spatial-Frequency Fusion Network for Medical Image Segmentation
- SGRAND: Stochastic Graph Neural Diffusion
- SHAP-Integrated Convolutional Diagnostic Networks for Feature-Selective Medical Analysis
- SINET: Sparsity-driven Interpretable Neural Network for Underwater Image Enhancement
- SIP2Net: Situational-Aware Indoor Pathloss-Map Prediction Network for Radio Map Generation
- SKE-MSA: Enhancing Representation Learning with VAD Lexicon for Multimodal Sentiment Analysis
- SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
- SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation
- SLiCK: Exploiting Subsequences for Length-Constrained Keyword Spotting
- SMCNet: Supervised Surface Material Classification Using mmWave Radar IQ Signals and Complex-valued CNNs
- SML: A Backdoor Defense for Non-Intrusive Speech Quality Assessment via Semi-Supervised and Multi-Task Learning
- SNNPTrack: Spiking Neural Network Based Prompt for High-Accuracy RGBE Tracking
- SOLVE: Spatially Optimized Lung Volume Evidence Model for Efficient Nodule Malignancy Classification
- SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data
- SPEA: Large-Scale Entity Alignment via Self-Partitioning
- SPEAK: Speech-Driven Pose and Emotion-Adjustable Talking Head Generation
- SPED: A Sight-singing Dataset for Performance Evaluation
- SPNet: Sparse-mask Prompt-learning Network for Cerebrovascular Segmentation
- SPRGAN: Streamlined Progressive Refinement for Adversarial Point Cloud Video Upsampling
- SPSinger: Multi-Singer Singing Voice Synthesis with Short Reference Prompt
- SPT: Sequence Prompt Transformer for Interactive Image Segmentation
- SPTU-Lite: An Efficient Auxiliary Diagnostic Approach Combining Spiking Neural Networks And Large Kernel Extractors For ECG Signals
- SS-BRPE: Self-Supervised Blind Room Parameter Estimation Using Attention Mechanisms
- SSAAD: A Multi-Scale Temporal-Frequency Graph Network for Binary Auditory Attention Detection with Self-Supervised Learning
- SSAST-Adapter: A Parameter-efficient Incremental Learning Algorithm for Underwater Acoustic Target Recognition
- SSC: 106 bit/s Ultra-low Bitrate Semantic Speech Coding
- SSCL-AMC: A Self-supervised Automatic Modulation Classification Method via Dynamic Augmentation and Ensemble Learning
- SSCM: Self-Supervised Critical Model for Reducing Hallucinations in Chinese Financial Text Generation
- SSDViT: Exploring Siamese and Self Distillation in ViTs for Generalizable Person Re-identification
- SSE: A Speaking Style Extractor Based on Fine-Grained Contrastive Learning between Speech and Descriptive Text
- SSFMamba: Spatial-Spectral Fusion State Space Model for Pansharpening
- SSFSL: Self-Supervised and Few-Shot Learning for Cross-Domain Hyperspectral Image Classification
- SSM2Mel: State Space Model to Reconstruct Mel Spectrogram from the EEG
- SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis
- SSRMamba: Efficient Visual State Space Model for Spectral Super-Resolution
- SSVEP-BiMA: Bifocal Masking Attention Leveraging Native and Symmetric-Antisymmetric Components for Robust SSVEP Decoding
- ST-HCSS: Deep Spatio-Temporal Hypergraph Convolutional Neural Network for Soft Sensing
- STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
- STAD: Joint Spatial-Temporal Dimension and Channel Correlation for Time Series Anomaly Detection
- STAR: A Spatial-Temporal Autoencoder for EEG Restoration in Emotion Recognition
- STE-Mamba: Automated Multimodal Depression Detection through Emotional Analysis and Spatio-Temporal Information Ensemble
- STFEnc: A Novel Deep Encoder for Brain-Computer Interface Based on Interpretable Brain Features
- STGE-Former: Spatial-Temporal Graph-Enhanced Transformer for EEG-Based Major Depressive Disorder Detection
- STR-Saliency: Decomposition-based Perturbations to Generate Saliency Maps for Temporal Black-box Model Interpretation
- SUFT: Sparse and Uncertain Fusion Transformers for Multi-Atlas Brain Network Analysis
- SUGAR: Leveraging Contextual Confidence for Smarter Retrieval
- SUVAD: Semantic Understanding Based Video Anomaly Detection Using MLLM
- SVRM: Composing Various Network Service Fuzzing Corpus with One Single Model
- SVTNet: Dual Branch of Swin Transformer and Vision Transformer for Monocular Depth Estimation
- SX-Stitch: An Efficient VMS-UNet Based Framework for Intraoperative Scoliosis X-Ray Image Stitching
- SYKI-SVC: Advancing Singing Voice Conversion with Post-Processing Innovations and an Open-Source Professional Testset
- Sagalee: an Open Source Automatic Speech Recognition Dataset for Oromo Language
- Salmon: A Suite for Acoustic Language Model Evaluation
- Same Semantics of the Signal - What Do We Cluster with what Representation
- Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation
- Sample-level Self-paced Learning to Tackle Multimodal Imbalance Problem
- Sampling Nonsmooth Log-Concave Densities: A Comparative Study of Primal-Dual Based Proposal Distributions
- ScalaLog: Scalable Log-Based Failure Diagnosis Using LLM
- Scalable Speech Enhancement With Dynamic Channel Pruning
- Scaling A Simple Approach to Zero-Shot Speech Recognition
- Scaling Bioacoustic Signal Pre-training with Million Samples Via Mask-Modeling
- Scaling Multilingual Visual Speech Recognition
- Schoenberg Kernel Loss for Spiking Neural Network Training
- Second-Order Wireless Federated Leaning via Nonparametric Hessian Estimation
- Secure Analog Beamforming Design for Wireless Communication Systems With Movable Antennas
- Security-Enhanced Data Transmission Scheme for IoT-Based Healthcare in Remote Areas
- See In Detail: Enhancing Sparse-view 3D Gaussian Splatting with Local Depth and Semantic Regularization
- Seek and Solve Reasoning for Table Question Answering
- Seg-diffusion: Text-to-Image Diffusion Model for Open-Vocabulary Semantic Segmentation
- SegAug: CTC-Aligned Segmented Augmentation For Robust RNN-Transducer Based Speech Recognition
- Segment Any Bone in CT with Partial Supervision
- Segment-Recurrent Transformer with Multi-Scale Fusion for Long-Term Time Series Forecasting
- Segmentation-Guided Sparse Transformer for Under-Display Camera Image Restoration
- Segue: Side-information Guided Generative Unlearnable Examples for Facial Privacy Protection in Real World
- SelaFD: Seamless Adaptation of Vision Transformer Fine-tuning for Radar-based Human Activity Recognition
- Selective Attention Merging for low resource tasks: A case study of Child ASR
- Selective Consistency Gradient Attack: Resolving Multi-Target Gradient Conflicts in Object Detection
- SelectiveFinetuning: Enhancing Transfer Learning In Sleep Staging Through Selective Domain Alignment
- Self-Convolutional Attention-Based Uncertainty-Aware Network for Single-Image Super-Resolution
- Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
- Self-Enhanced Reasoning Training: Activating Latent Reasoning in Small Models for Enhanced Reasoning Distillation
- Self-Geometry-Guided Direct Pose Regression Based on Dual Perspective Fusion for 2D-3D Cross Dimensional Spinal Surgery Navigation
- Self-Incremental Training for Personalized Voice Command Recognition in a Wireless Audio Sensor Network
- Self-Information Guided Speech Segmentation for Efficient Streaming ASR
- Self-Optimization Training for Weakly Supervised Image Manipulation Localization
- Self-Prompting Driven SAM2 for 3D Medical Image Segmentation
- Self-Prompting Polyp Segmentation in Colonoscopy Using Hybrid YOLO-SAM2 Model
- Self-Structure Enhance Network for Digital Molar Wax-up Design
- Self-Supervised Graph Representation Learning for In-The-Wild Wearable and Smartphone based Emotion Recognition
- Self-Supervised Image Harmonization via Holistic Feature Fusion
- Self-Supervised Learning and Image-Prompt Fusion for AIGC Image Quality Assessment
- Self-Supervised Learning for Detecting AI-Generated Faces as Anomalies
- Self-Supervised Learning-Based Multimodal Prediction on Prosocial Behavior Intentions
- Self-Supervised Localized Topology Consistency for Noise-Robust Hyperspectral Image Classification
- Self-Supervised Monocular Depth Estimation from Videos via Pose-Adaptive Reconstruction
- Self-Supervised Uncertainty-Guided Refinement for Robust Joint Optical Flow and Depth Estimation
- Self-Support Prototype-Aware For Few-Shot Semantic Segmentation
- Self-Trained Model for ECG Complex Delineation
- Self-Tuning Spectral Clustering for Speaker Diarization
- Self-supervised Contrastive Pre-training for Dry Electrode EEG Emotion Recognition via Cross Device Representation Consistency
- Self-supervised Hyperspectral and Multispectral Fusion via Deep Low-Rank Prior and Learnable Degradation Networks
- Self-supervised Learning for Acoustic Few-Shot Classification
- Self-supervised Multimodal Speech Representations for the Assessment of Schizophrenia Symptoms
- Self-supervised Prosody Learning at Phoneme-level with Momentum Contrast for Speech Synthesis
- Self-supervised Speaker Verification with Batch-scale Pseudo-labels Correction
- SelfDeblur with Sparsity Enforced Bregman Learning
- Semantic Attention and LLM-based Layout Guidance for Text-to-Image Generation
- Semantic Consistency And Integrity Network For Cloth-changing Person Re-identification
- Semantic Data Augmentation for Few-Shot Biomedical Named Entity Recognition
- Semantic Graph Embedded Energy Minimization Learning for Scene Graph Generation
- Semantic Hierarchical Prompt Tuning for Parameter-Efficient Fine-Tuning
- Semantic Prior-Guided Scalable Image Coding
- Semantic Residual for Multimodal Unified Discrete Representation
- Semantic to Structure: Learning Structural Representations for Infringement Detection
- Semantic-Aware Prompt Learning for Multimodal Sarcasm Detection
- Semantic-Guided Gaussian Splatting with Deferred Rendering
- Semantic-oriented Visual Prompt Learning for Class Incremental Learning
- Semantics-Guided Dynamic Hypergraph Network for Human Mobility Nowcasting in Disaster
- Semi-Automatic Labeling for Action Recognition by Diversity Preserving Sampling
- Semi-Supervised Cognitive State Classification from Speech with Multi-View Pseudo-Labeling
- Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval
- Semi-Supervised Knowledge Distillation Framework towards Lightweight Large Language Model for Spoken Language Translation
- Semi-Supervised Multilingual Alignment with Lexical Memory for Massively Parallel Text Mining
- Semi-Supervised Speaker Diarization Using Graph Transformers and LLMs on Naturalistic Apollo 11 Data
- Semi-VFL: Communication-efficient Few-label Vertical Federated Learning with Stacked Generalization and Model-level Consistency
- Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
- Semi-supervised Iterative Learning Network for Camouflaged Object Detection
- Semi-supervised Video Anomaly Detection With Compact Deformable 3D Convolution
- SemiGPS: GraphGPS-based Semi-supervised Graph Learning for Sector-Specific GDP Mapping
- Sensitivity of Room Impulse Responses in Changing Acoustic Environment
- SentiFormer: Metadata Enhanced Transformer for Image Sentiment Analysis
- Sentiment Analysis for Live Video Comments with Diffused Fusion of Cross-modal Representations
- SepMamba: State-Space Models for Speaker Separation Using Mamba
- SepNet: Deep Convolutional Neural Network for Specific Emitter Identification with High Accuracy
- Separate Estimation of Angular Velocity and Angle for Digital Array Radar
- Sequence Knowledge Enhancement Distillation Framework for Ultra-Fast Image Deraining
- Sequential Contrastive Audio-Visual Learning
- Sequential DOA Trajectory Estimation using Deep Complex Network and Residual Signals
- Sequential Decoding of Multiple Traces Over the Syndrome Trellis for Synchronization Errors
- Sequential Diffusion-Guided Deep Image Prior for Medical Image Reconstruction
- Sequential Posterior Sampling with Diffusion Models
- Serial Local Patterns and Irregular Dependencies Extract and Cascaded Fusion Network for Structural Crack Segmentation
- Shabdh: A multi lingual zero-shot voice cloning approach with speaker disentanglement
- Sharpness-Aware Minimization with Adaptive Regularization for Training Deep Neural Networks
- Shifting Spotlight for Co-supervision: A Simple yet Efficient Single-branch Network to See Through Camouflage
- Short-time quantum Fourier transform processing
- SiMBA-TS: Simplified Channel Mixing and Mamba for Long-term Time Series Forecasting
- SiQA: A Large Multi-Modal Question Answering Model for Structured Images Based on RAG
- SigmoidGS: To Guide Depth More Effectively
- Sign-Mamba: Advanced Mamba-Based Sign Language Generation
- Signal Processing Challenges in Automotive Radar
- Signaling Endothelial Reactivity Induced by Acute Hand Grip: Analyzing Vessel Diameter, Flow Velocity, and EMG Responses
- Similarity-based Accent Recognition with Continuous and Discrete Self-supervised Speech Representations
- Simple Adaptive Spectrum Graph Filters for Rumor Detection
- Simple Contrastive Learning with Knowledge Graphs for Story Generation
- Simplified Augmented Real-Valued Time-Delay Neural Network for Digital Predistortion
- Simplified one-sided Image-to-Image Translation with Reconstruction-Constrained Generative Adversarial Networks
- SimulTron: On-Device Simultaneous Speech to Speech Translation
- Simultaneous Diarization and Separation of Meetings through the Integration of Statistical Mixture Models
- Simultaneous Music Separation and Generation Using Multi-Track Latent Diffusion Models
- Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features
- Single Snapshot Direction of Arrival Estimation Using the EP-SURE-SBL Algorithm
- Single Trial Reaction Time Prediction Using Optimal Synchrony Window Detection
- Single-Channel Distance-Based Source Separation for Mobile GPU in Outdoor and Indoor Environments
- Single-Loop Variance-Reduced Stochastic Algorithm for Nonconvex-Concave Minimax Optimization
- Single-View Clothed Human Reconstruction using Symmetric Feature
- Single-View Reconstruction via Decoupled 3D Gaussian Splatting
- Single-stage TTS with Masked Audio Token Modeling and Semantic Knowledge Distillation
- Situation-aware Space-time Waveform Design for Automotive MIMO Radars
- Situational Awareness Based Resource Allocation for Multi-Target Tracking in Distributed Radar Network
- SkeletonMix: A Mixup-Based Data Augmentation Framework for Skeleton-Based Action Recognition
- Sketch-based Point Cloud Generation with Diffusion Model and Pre-training Enhancement
- Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
- SlimSpeech: Lightweight and Efficient Text-to-Speech with Slim Rectified Flow
- SlotFusion: Object-Centric Audiovisual Feature Fusion with Slot Attention for Remote Sensing Scene Recognition
- Slungt: Even Faster Spoken Language Understanding with N-Grams and Tries
- Small Target Insect Detection Based on Improved YOLOv8n
- SmartExp: An Adaptive Data Expansion Strategy for Improving Handwritten Text Recognition
- SmartNet: One-shot Talking Head Synthesis via Subtle Motion and Appearance Compensation
- Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance
- Smr-Awarenet: An Adaptive Smr-Aware Neural Network for EEG Auditory Attention Guided Target Speech Extraction
- So Far Yet So Near: Time Series Data Augmentation with Exploring non-Semantic Boundaries based on Reinforcement Learning
- SoCov: Semi-Orthogonal Parametric Pooling of Covariance Matrix for Speaker Recognition
- SocialRecNet: A Multimodal LLM-Based Framework for Assessing Social Reciprocity in Autism Spectrum Disorder
- Sociologically-Informed Graph Neural Network for Opinion Prediction
- Soft Augmentation for Graph Classification
- Soft Knowledge Distillation with Multi-Dimensional Cross-Net Attention for Image Restoration Models Compression
- SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
- Some Intriguing Observations on the Learnt Matrices in Deep Unfolded Networks
- Sound Source Distance Estimation Utilizing Physics-informed Prior for Sound Event Localization and Detection
- Sound Zone Control Robust To Sound Speed Change
- Sound-Based Recognition of Touch Gestures and Emotions for Enhanced Human-Robot Interaction
- Sound-VECaps: Improving Audio Generation with Visually Enhanced Captions
- SoundBeam meets M2D: Target Sound Extraction with Audio Foundation Model
- SoundCollage: Automated Discovery of New Classes in Audio Datasets
- SoundTRC: DNN-based Acoustic Target Region Control
- Source-Aware Spatial Self-Supervision for Sound Event Localization and Detection
- Source-free Domain Adaptation with Multiple Alignment for Efficient Image Retrieval
- Span Attention for Entity-Consistent Task-Oriented Dialogue Response Generation
- Sparse Bayesian Integrated CNN Framework for Enhanced Acoustic Source Localization
- Sparse Bayesian Network for Fast Micro-Doppler Analysis
- Sparse Generation: Making Pseudo Labels Sparse for Point Weakly Supervised Object Detection on Low Data Volume
- Sparse PCA with Oracle Rate in High Dimensions
- Sparse-VQ Transformer: An FFN-Free Framework with Vector Quantization for Enhanced Time Series
- Sparse-View X-ray 3D Reconstruction using Hybrid Representation Neural Attenuation Fields
- Sparse-to-Dense Body Surface Potential Mapping using A Structural Similarity-Enhanced Attention GAN
- Spatial Annotation-free Training for Sound Event Localization and Detection
- Spatial Frequency Interleaving Residual Autoencoder for Indoor Radio Map Reconstruction
- Spatial Frequency-Aware Self-Distillation for Weakly-Supervised Semantic Segmentation
- Spatial-Frequency Cross-Domain Mutual Guidance for Visible-Infrared Image Fusion
- Spatial-Frequency Information Interaction Diffusion for SAR Colorization
- Spatial-Temporal Perception with Causal Inference for Naturalistic Driving Action Recognition
- Spatial-Temporal Reconstruction Error for AIGC-based Forgery Image Detection
- Spatially-Aware Cross-Modal Contrastive Learning for Low-Shot HSI Classification
- Spatially-variant Blur Degradation Model Based on Depth Estimation
- Spatio-Semantic Prompt guided Adaptive Segment Anything for Remote Sensing Change Detection
- Spatio-Temporal Mapping Generative Adversarial Network for Functional Connectivity Network Reconstruction across Brain Atlases
- Spatio-Temporal Mixed Graph Neural Controlled Differential Equations with Adaptive Connection Sampling for Irregular Multivariate Time Series Anomaly Detection
- Spatio-Temporal Multi-Subgraph GCN for 3D Human Motion Prediction
- Spatiotemporal Causal Decoupling Model for Air Quality Forecasting
- Spatiotemporal-Aware Visual Captioning using Vision-Language Pre-Training Model
- Speaker Embedding Informed Audiovisual Active Speaker Detection for Egocentric Recordings
- Speaker-IPL: Unsupervised Learning of Speaker Characteristics with i-Vector based Pseudo-Labels
- Speaking Without Sound: Multi-speaker Silent Speech Voicing with Facial Inputs Only
- Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation
- SpecViT: A Custom Vision-Transformer based Approach for Audio Deepfake Detection
- SpecWav-Attack: Leveraging Spectrogram Resizing and Wav2Vec 2.0 for Attacking Anonymized Speech
- Spectral Enhancement and Pseudo-Anchor Guidance for Infrared-Visible Person Re-Identification
- Spectral Low-Rank Attention with Flow-Based Refinement for Spectral Reconstruction
- Spectral-Aware Low-Rank Adaptation for Speaker Verification
- Spectral-Temporal Fusion Representation for Person-in-Bed Detection
- SpectralCam: High-Resolution Low-Cost Spectral Imaging Using DSLR Cameras
- Spectrum Blind Unlimited Sampling of Multi-Band Signals
- Speech Data Selection for Efficient ASR Fine-Tuning using Domain Classifier and Pseudo-Label Filtering
- Speech Emotion Recognition Based on Large-Scale Automatic Speech Recognizer
- Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
- Speech Enhancement with MAP-based Training for Robust ASR
- Speech Enhancement with Overlapped-Frame Information Fusion and Causal Self-Attention
- Speech Few-Shot Learning for Language Learners' Speech Recognition
- Speech Re-Painting for Robust ASR
- Speech Recognition Rescoring with Large Speech-Text Foundation Models
- Speech Recognition for Automatically Assessing Afrikaans and isiXhosa Preschool Oral Narratives
- Speech Recognition with LLMs Adapted to Disordered Speech Using Reinforcement Learning
- Speech Retrieval-Augmented Generation without Automatic Speech Recognition
- Speech Separation Based on Pre-trained Model and Deep Modularization
- Speech Separation for Low-Resource Languages
- Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
- Speech Synthesis along Perceptual Voice Quality Dimensions
- Speech-N-LlaMA: Improving Speech LLMs with Multi-Pass Training
- Speech2rtMRI: Speech-Guided Diffusion Model for Real-time MRI Video of the Vocal Tract during Speech
- SpeechCaps: Advancing Instruction-Based Universal Speech Models with Multi-Talker Speaking Style Captioning
- SpeechTaxi: On Multilingual Semantic Speech Classification
- Spherical Sector Harmonics Based Acoustic Source Localization Using Circular Array
- Spiking Generative Models Based on Variational Autoencoder and Adversarial Training
- Spiking Transformer with Spatial-Temporal Spiking Self-Attention
- SpikingPoint: Rethinking Point as Spike for Efficient 3D Point Cloud Analysis
- Spy Inside: Scalable Verification of Dependable Transformers for Event Time Series Systems
- Stable Audio Open
- Stable Control Visual AutoRegressive Model: Precise and Efficient Image Generation via Scale Alignment
- Stable Extended U-Net for Noise-Robust Speaker Verification
- Stable Reduced-Rank VAR Estimators in Closed Forms
- Stable Test-Time Training for Semantic Segmentation with Output Contrastive Loss
- Stable and Lightweight Deep Primal-Dual Unrolling for Constrained Image Restoration with Convolutional Sparse Coding
- Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
- StableQuant: Layer Adaptive Post-Training Quantization for Speech Foundation Models
- Stacking U-Nets in U-shape: Redesigning the Information Flow in Model-based Networks for MRI Reconstruction
- Stance Detection for Social Text: Inference-Enhanced Multi-Task Learning with Machine-Annotated Supervision
- Standard-essential Patent Prediction: Discussion of Patent Standardization Time
- Standardization Status of MPEG Video-based Dynamic Mesh Coding (V-DMC)
- Star Operation in Self-Attention for 3D Human Pose Estimation
- State-Augmented Opportunistic Routing in Wireless Communication Systems with Graph Neural Networks
- Stealthy Backdoor Attack against Video Recognition Models
- Steerable Differential Polynomial Beamforming
- Steering Large Language Models for Vulnerability Detection
- Step-by-Step Correction of LLM-based Math Word Problems Solutions
- Stereo Downmix in 3GPP IVAS for EVS Compatibility
- StereoMamba: Enhancing Stereo Image Super-Resolution with Structured State Space Models and Bi-Directional Cross Attention
- Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance
- Stochastic Vector Approximate Message Passing with Applications to Phase Retrieval
- Stochastic-Aware Mamba Diffusion for Pedestrian Trajectory Prediction
- Stream-TTS: A Low-Latency Text-to-Speech using Kolmogorov-Arnold Networks for Streaming Speech Applications
- Streaming Keyword Spotting Boosted by Cross-layer Discrimination Consistency
- Streamlining UNO: A Generalized Sampling Approach to Optimal One-Bit Modulo Sensing
- Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
- StrucFormer: Structural Prior Guided Transformer for Mobile Crowdsensing Data Inference
- Structural Similarity-Aware Cross-domain Transformer for Improved Seismic Fault Detection
- Structural-Aware Disentangled Learning with CLIP for Hyperbolic Zero-Shot Sketch-Based Image Retrieval
- Structure-Preserving Video Hashing via Self-Supervised Transformer for Retrieval
- Structured Random Model for Fast and Robust Phase Retrieval
- Sub-band Domain Multi-Hypothesis Acoustic Echo Canceler Based Acoustic Scene Analysis
- Subdomain Uncertainty Optimization for Cross-Speed Fault Diagnosis
- Subject Representation Learning from EEG using Graph Convolutional Variational Autoencoders
- Subjective Fidelity Assessment of Audio- and Video-Driven Talking Head Generation Methods
- Subjective Quality Evaluation of Point Clouds Using a Head-Mounted Display
- Subjective Voice Quality of the IVAS Codec
- Subpart Suppression Network for Few-Shot Object Counting
- Subsampling Decomposition based k-Space Refinement for Accelerated MRI Reconstruction
- Subset Adaptive Importance Sampling for Multi-Failure-Region Estimation
- Subspace-Based Range-Angle Tracking for Coherent FDA Radar
- Subtractive Training for Music Stem Insertion Using Latent Diffusion Models
- Successive Interference Cancellation-aided Diffusion Models for Joint Channel Estimation and Data Detection in Low Rank Channel Scenarios
- Sufficient Learning for Label Noise with Dual-Regularization
- Super Capacity SRS Design for 5G and beyond using Channel In-painting
- SuperPromptSeg: A Novel Fine-Tuning-Free Segmentation Method Leveraging Superpixel-Based Point Prompts
- Superpoints Guided Local Explanation For Deep 3D Trackers
- Supervised Dimension Reduction Through Linear Projection
- Supervisor Alignment Framework: Enhancing LLM Alignment with Query-Ignoring Strategy and Multi-Agent Interaction
- Support Recovery in 1-Bit Compressed Sensing with Burst Sparse Noise
- Surface Defect Detection Algorithm for Strip Alloy Material Based on Improved YOLOv8
- SwapTalk: Audio-Driven Talking Face Generation with One-Shot Customization in Latent Space
- Swin-VasMamba: A Topologically Constrained Model For 3D Vascular Segmentation
- SwinGAN-AVSS: Audio-Visual Speech Synthesis Leveraging Swin Transformer-Enhanced Generative Adversarial Networks
- SymGaussian: Occluded Human Rendering with Multi-scale Symmetry Feature from Monocular Video
- Symbol-Level Precoding-Based Self-Interference Cancellation for ISAC Systems
- Symmetric Bi-branch Modality-search Aggregation Network for Multi-modal Liver Segmentation
- Symmetry and Fusion Data Augmentation for Semi-Supervised Medical Segmentation
- Synergistic Integration of Cross-Spatial Learning for Lightweight Crack Detection
- Synergistic Spotting and Recognition of Micro-Expression via Temporal State Transition
- Synthesizing Efficient Trajectory-Controllable Co-Speech Gesture with Latent Consistency Model
- Synthetic Dataset Generation for String Ensemble Separation
- TA-V2A: Textually Assisted Video-to-Audio Generation
- TAGMO: Temporal Control Audio Generation for Multiple Visual Objects Without Training
- TAME: Temporal Audio-based Mamba for Enhanced Drone Trajectory Estimation and Classification
- TAPO: Task-Referenced Adaptation for Prompt Optimization
- TCTformer: Long-term forecasting with dual attention transformers
- TD-GS: Few-shot Object View Synthesis via Task-Disentangled 3D Gaussian Splatting
- TD-RD: A Top-Down Benchmark with Real-Time Framework for Road Damage Detection
- TDMER: A Task-Driven Method for Multimodal Emotion Recognition
- TDMF: Text-Guided Denoising and Interactive Medical Image Fusion
- TDOA Localization via Fixed-Point Iteration
- TELL ME: Tackle Electrocardiogram with Large Language Model Effectively
- TFS: Revisiting Temporal Language Grounding from Frequency Spiking Perspective
- TGCA: A Transformer GNN-based Approach with Cross-Attention Mechanism for Steganographic Text Detection in Social Networks
- TGDrag: Adding Semantic Control into Point-based Image Editing via Text Guidance
- TIDE-Net: A Physics-Based Graph Model for Predicting Tropical Cyclone Impacts on Estuarine Systems
- TIRPL: Tailored-Made Inverse Rendering for Point-Light Scenes
- TKA-MIL: Top-K Attention Multiple Instance Learning for Whole Slide Image Classification and Instance Probability Derivation
- TMANet: Triple Multi-Scale Attention based Network with Boundary Association Loss for Superpixel Segmentation
- TRACE: A Robust Framework for Malicious Traffic Detection with Noisy Labels
- TROI: Cross-Subject Pretraining with Sparse Voxel Selection for Enhanced fMRI Visual Decoding
- TS-Net: Assembling Task-specific Features from Multiple Feature Levels for Multi-task Learning
- TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models
- TSCheater: Generating High-Quality Tibetan Adversarial Texts via Visual Similarity
- TSIformer: Multi-Scale Dilation Transformer with Cross-variable and Cross-feature Dependency for Time Series Imputation
- TSLA: A Multi-Task Time Series Language Model
- TSP: Task-Specific Pruning for Personalized Image Classification on Edge Devices
- TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
- Tag-Aware Weakly-Supervised Online Hashing with Enhanced Joint Representation
- Take Attention Inside: Neighbor Pair Graph Contrastive Learning
- TalTech Systems for the PROCESS Signal Processing Grand Challenge
- Target Localization With a Coprime Multistatic MIMO Radar via Coupled Canonical Polyadic Decomposition Based on Joint EVD
- Target Speaker ASR with Whisper
- Target parameter estimation using the Capon method in a MIMO OFDM DFRC system
- Target word activity detector: An approach to obtain ASR word boundaries without lexicon
- Targeted Data Poisoning for Black-Box Audio Datasets Ownership Verification
- Targeted Password Guessing Using Neural Language Models
- Task Vector Arithmetic for Low-Resource ASR
- Task-Aware Unified Source Separation
- TeXBLEU: Automatic Metric for Evaluate LaTeX Format
- Teaching Others Teaches Yourself: Semi-supervised Ensembled Pseudo-labeling Method for Image Classification
- Temporal Dynamics Decoupling with Inverse Processing for Enhancing Human Motion Prediction
- Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition
- Temporally Aligned Audio for Video with Autoregression
- Tessellated Linear Model for Age Prediction from Voice
- Test Time Prompt Tuning for Domain Adaptive Gaze Estimation
- Test-time Alignment-Enhanced Adapter for Vision-Language Models
- Text Descriptions of Actions and Objects Improve Action Anticipation
ICASSP accepted papers in other years
Looking for submission deadlines instead? See the conference deadline calendar.