← All conferences

ICASSP 2024 Accepted Papers

The full list of 2,679 papers accepted at ICASSP 2024 (IEEE International Conference on Acoustics, Speech and Signal Processing). Click any title for details, similar papers, and links to the original source. You can also search these papers by meaning, not just keywords.

  1. FPN with GMM Based Feature Enhancement Strategy for Object Detection in Remote Sensing Images
  2. FREmax: A Simple Method Towards Truly Secure Generative Linguistic Steganography
  3. FSD: An Initial Chinese Dataset for Fake Song Detection
  4. FUR-API: Dataset and Baselines Toward Realistic API Anomaly Detection
  5. FW-Shapley: Real-Time Estimation of Weighted Shapley Values
  6. Face Recognition Using Lensless Camera
  7. Face Reconstruction from Partially Leaked Facial Embeddings
  8. Facial Aesthetic Enhancement Network for Asian Faces Based on Differential Facial Aesthetic Activations
  9. Facial Micro-Motion-Aware Mixup for Micro-Expression Recognition
  10. Facilitating Message Passing with Potential Links for Knowledge Graph Completion
  11. Fact-Aware Summarization with Contrastive Learning for Few-Shot Dialogue State Tracking
  12. Fairness-Aware Job Scheduling for Multi-Job Federated Learning
  13. Fall Prediction by a Spatio-Temporal Multi-Channel Causal Model from Wearable Sensors Data
  14. Fast Algorithm Design for the Constant-Envelope Precoding in Massive Mimo Communications with Interference Exploitation
  15. Fast Alignment Algorithm for Cryo-EM Particle Images Based on Harmonic Analysis
  16. Fast Approximation of the Generalized Sliced-Wasserstein Distance
  17. Fast Cross-Modality Knowledge Transfer via a Contextual Autoencoder Transformation
  18. Fast Dynamics of Brain-wide Patterns on Neuronal Oscillations
  19. Fast Graph-Based Denoising For Point Cloud Color Information
  20. Fast Intra Mode Prediction Algorithms for SCBS in VVC SCC
  21. Fast Personalized Text to Image Synthesis with Attention Injection
  22. Fast Test Error Rates for Gradient-Based Algorithms on Separable Data
  23. Fast and Accurate Root Cause Analysis Based on Signalling Messages for 5G Networks
  24. Fast and Efficient Sequential Radar Parameter Estimation in MIMO-OTFS Systems
  25. Fast and Physically Enriched Deep Network for Joint Low-Light Enhancement and Image Deblurring
  26. FastGAT: Simple and Efficient Graph Attention Neural Network with Global-Aware Adaptive Computational Node Attention
  27. FastInject: Injecting Unpaired Text Data into CTC-Based ASR Training
  28. Fastmandarin: Efficient Local Modeling for Natural Mandarin Speech Synthesis
  29. Fearless Steps Apollo: Team Communications Based Community Resource Development for Science, Technology, Education, and Historical Preservation
  30. Feature Mixing-Based Active Learning for Multi-Label Text Classification
  31. Feature-Constrained and Attention-Conditioned Distillation Learning for Visual Anomaly Detection
  32. Feature-Distribution Perturbation and Calibration for Generalized Reid
  33. FedAQT: Accurate Quantized Training with Federated Learning
  34. FedLion: Faster Adaptive Federated Optimization with Fewer Communication
  35. Federated CINN Clustering for Accurate Clustered Federated Learning
  36. Federated Dataset Dictionary Learning for Multi-Source Domain Adaptation
  37. Federated Learning of Tensor Generalized Linear Models with low Separation Rank
  38. Federated Learning on Distributed Graphs Considering Multiple Heterogeneities
  39. Federated Learning under Restricted user Availability
  40. Federated Learning via Consensus Mechanism on Heterogeneous Data: A New Perspective on Convergence
  41. Federated Learning with Instance-Dependent Noisy Label
  42. Federated PAC-Bayesian Learning on Non-IID Data
  43. Federated Quantum Machine Learning with Differential Privacy
  44. Fedmm: Federated Multi-Modal Learning with Modality Heterogeneity in Computational Pathology
  45. Fedsoda: Federated Cross-Assessment and Dynamic Aggregation for Histopathology Segmentation
  46. Few-Shot Anomalous Sound Detection Based on Anomaly Map Estimation Using Pseudo Abnormal Data
  47. Fewer-Token Neural Speech Codec with Time-Invariant Codes
  48. Filamentary Convolution for Spoken Language Identification: A Brain-Inspired Approach
  49. Filter-Enhanced Hypergraph Transformer for Multi-Behavior Sequential Recommendation
  50. FincGAN: A Gan Framework of Imbalanced Node Classification on Heterogeneous Graph Neural Network
  51. Finding Representative Sampling Subsets on Graphs via Submodularity
  52. Fine-Grained Discrepancy Contrastive Learning for Robust Fake News Detection
  53. Fine-Grained Disentangled Representation Learning For Multimodal Emotion Recognition
  54. Fine-Grained Engine Fault Sound Event Detection Using Multimodal Signals
  55. Fine-Grained Features Alignment and Fusion for Text-Video Cross-Modal Retrieval
  56. Fine-Granularity Face Sketch Synthesis
  57. Fine-Tune the Pretrained ATST Model for Sound Event Detection
  58. Fine-Tuning Self-Supervised Models for Language Identification Using Orthonormal Constraint
  59. First-Shot Unsupervised Anomalous Sound Detection with Unknown Anomalies Estimated by Metadata-Assisted Audio Generation
  60. Fixed Inter-Neuron Covariability Induces Adversarial Robustness
  61. Flare-Free Vision: Empowering Uformer with Depth Insights
  62. Flattening Singular Values of Factorized Convolution for Medical Images
  63. Flexible Keyword Spotting Based on Homogeneous Audio-Text Embedding
  64. Flipping Consistent and Counterfactual Attention Network for Facial Expression Recognition
  65. Focus Fusion Network for Visible and Infrared Image Fusion
  66. Folding Attention: Memory and Power Optimization for On-Device Transformer-Based Streaming Speech Recognition
  67. Following the Embedding: Identifying Transition Phenomena in Wav2vec 2.0 Representations of Speech Audio
  68. Forecasting Torsional Resonance in Electric Vehicles by Learning a Quantile Regressor
  69. Forgetting Private Textual Sequences in Language Models Via Leave-One-Out Ensemble
  70. Foundation Model Assisted Automatic Speech Emotion Recognition: Transcribing, Annotating, and Augmenting
  71. Fourier Domain Approach for Galaxy Spectra Decontamination and Deconvolution
  72. Fovea Transformer: Efficient Long-Context Modeling with Structured Fine-To-Coarse Attention
  73. Fracture Assembly with Segmentation And Iterative Registration
  74. Frame-Level Emotional State Alignment Method for Speech Emotion Recognition
  75. Frame-Wise Streaming end-to-end Speaker Diarization with Non-Autoregressive Self-Attention-Based Attractors
  76. Frame-to-Utterance Convergence: A Spectra-Temporal Approach for Unified Spoofing Detection
  77. FreeTalker: Controllable Speech and Text-Driven Gesture Generation Based on Diffusion Models for Enhanced Speaker Naturalness
  78. Freeze the Backbones: a Parameter-Efficient Contrastive Approach to Robust Medical Vision-Language Pre-Training
  79. Fregrad: Lightweight and Fast Frequency-Aware Diffusion Vocoder
  80. Freq2Time: Weakly Supervised Learning of Camera-Based RPPG from Heart Rate
  81. Frequency Analysis and Filter Design for Directed Graphs with Polar Decomposition
  82. Frequency Aware and Graph Fusion Network for Polyp Segmentation
  83. Frequency Estimation via Sub-Nyquist Unlimited Sampling
  84. Frequency Masking for Universal Deepfake Detection
  85. Frequency-Domain Signal Reconstruction for Dynamic Time-Domain Weighting Hybrid Precoding with Beam Squint
  86. Friends to Help: Saving Federated Learning from Client Dropout
  87. From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
  88. From Convolutional Sparse Coding To *-NMF Factorization of Time-Frequency Coefficients
  89. From Game Theory to Visual Recognition: Advancing DNN Robustness
  90. From RIR to BRIR: A Sparse Recovery Beamforming Approach for Virtual Binaural Sound Rendering
  91. Fspen: an Ultra-Lightweight Network for Real Time Speech Enahncment
  92. FunCodec: A Fundamental, Reproducible and Integrable Open-Source Toolkit for Neural Speech Codec
  93. Functional Emotion Transformer for EEG-Assisted Cross-Modal Emotion Recognition
  94. Functional Invariants To Watermark Large Transformers
  95. Functionally Similar Multi-Label Knowledge Distillation
  96. Fundamental Limits of Direction Finding in Distributed Arrays Exploiting Auxiliary Sources
  97. Fundamental Performance Bounds for Carrier Phase Positioning in LEO-PNT Systems
  98. Further Results on the Design Of Real-Valued Wideband Beamformers Using Adaptive-Array-Theory-Inspired Weighted Least Squares
  99. FusDom: Combining in-Domain and Out-of-Domain Knowledge for Continuous Self-Supervised Learning
  100. Fusing Modality-Specific Representations and Decisions for Multimodal Emotion Recognition
  101. Fusing Multi-Level Features from Audio and Contextual Sentence Embedding from Text for Interview-Based Depression Detection
  102. Fusing Structure and Appearance Features in Facial Expression Recognition Transformer
  103. Fusion of Audio and Visual Embeddings for Sound Event Localization and Detection
  104. Fusion of Multi-Resolution Seismic Tomography Maps with Physics-Informed Probability Graphical Models
  105. G-SHARP: Globally Shared Kernel with Pruning for Efficient CNNs
  106. G2G: Generalized Learning by Cross-Domain Knowledge Transfer for Federated Domain Generalization
  107. G2PU: Grapheme-To-Phoneme Transducer with Speech Units
  108. GAMAFlow: Estimating 3D Scene Flow via Grouped Attention and Global Motion Aggregation
  109. GASS: Generalizing Audio Source Separation with Large-Scale Data
  110. GBSD: Generative Bokeh with Stage Diffusion
  111. GCC-PHAT Re-Imagined - A U-Net Filter for Audio TDOA Peak-Selection
  112. GCIA: A Black-Box Graph Injection Attack Method Via Graph Contrastive Learning
  113. GEmo-CLAP: Gender-Attribute-Enhanced Contrastive Language-Audio Pretraining for Accurate Speech Emotion Recognition
  114. GFMAE: Self-Supervised GNN-Free Masked Autoencoders
  115. GI-PIP: Do We Require Impractical Auxiliary Dataset for Gradient Inversion Attacks?
  116. GLA-GRAD: A Griffin-Lim Extended Waveform Generation Diffusion Model
  117. GLMAE: Graph Representation Learning Method Combining Generative Learning and Masking Autoencoder
  118. GLMB 3D Speaker Tracking with Video-Assisted Multi-Channel Audio Optimization Functions
  119. GM-VRC: Semantic Topological Data Ensemble Approach for EEG Signal Classification
  120. GMM-ResNet2: Ensemble of Group Resnet Networks for Synthetic Speech Detection
  121. GMTR: Graph Matching Transformers
  122. GPT-4 Driven Cinematic Music Generation Through Text Processing
  123. GPTCN: Gated Parallel Transformer Convolutional Networks for Downstream-Task User Representation Learning on App Usage
  124. GR0: Self-Supervised Global Representation Learning for Zero-Shot Voice Conversion
  125. GSTNet: Gait Spatio-Temporal Network for Gait Recognition Using Millimeter-Wave Radar
  126. GTCRN: A Speech Enhancement Model Requiring Ultralow Computational Resources
  127. GaP-Aug: Gamma Patch-Wise Correction Augmentation Method for Respiratory Sound Classification
  128. GeneFormer: Learned Gene Compression using Transformer-Based Context Modeling
  129. General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
  130. Generalizable Two-Branch Framework for Image Class-Incremental Learning
  131. Generalization of Self-Supervised Learning-Based Representations for Cross-Domain Speech Emotion Recognition
  132. Generalized Deterministic-Random Tradeoff of Integrated Sensing and Communications: The Sensing-Optimal Operating Point
  133. Generalized Hole-Filling Strategy for Overlapping Hole-Existing Coprime Arrays for DOA Estimation
  134. Generalized Multi-Source Inference for Text Conditioned Music Diffusion Models
  135. Generalized Specaugment via Multi-Rectangle Inverse Masking For Acoustic Scene Classification
  136. Generalized Uncertainty-Based Evidential Fusion with Hybrid Multi-Head Attention for Weak-Supervised Temporal Action Localization
  137. Generating High-Quality Adversarial Examples with Universal Perturbation-Based Adaptive Network and Improved Perceptual Loss
  138. Generating Persona-Aware Empathetic Responses with Retrieval-Augmented Prompt Learning
  139. Generating Stereophonic Music with Single-Stage Language Models
  140. Generation or Replication: Auscultating Audio Latent Diffusion Models
  141. Generation-Based Target Speech Extraction with Speech Discretization and Vocoder
  142. Generative Al-aided Joint Training-free Secure Semantic Communications via Multi-modal Prompts
  143. Generative Context-Aware Fine-Tuning of Self-Supervised Speech Models
  144. Generative De-Quantization for Neural Speech Codec Via Latent Diffusion
  145. Generative Extension Positive Pairs and Improving Sample Selection Based on Contrastive Learning for Unsupervised Person Re-Identification
  146. Geodesic Interpolation of Frame-Wise Speaker Embeddings for the Diarization of Meeting Scenarios
  147. Geometry Compression Artifact Removal for V-PCC over a Wide Bitrate Range
  148. Geometry-Corrected Geodesic Motion Modeling with Per-Frame Camera Motion for 360-Degree Video Compression
  149. Gesture Generation Via Diffusion Model with Attention Mechanism
  150. Glance, Focus and Refinement Network for Remote Sensing Change Detection
  151. Glancing Future for Simultaneous Machine Translation
  152. Gland Instance Segmentation by Full Resolution Multi-Scale Dilation Residual Networks
  153. Gland Segmentation Via Dual Encoders and Boundary-Enhanced Attention
  154. Global Convergence of Alternating Direction Method of Multipliers for Invex Objective Losses
  155. Global Optimization of Active RIS in Linear Time
  156. Globally Optimal Beamforming Design for Integrated Sensing and Communication Systems
  157. Glocal Cascading Network for Topic Enhanced Visual Storytelling
  158. Gmm-Resnext: Combining Generative and Discriminative Models for Speaker Verification
  159. Gradient Inversion Attacks on Acoustic Signals: Revealing Security Risks in Audio Recognition Systems
  160. Gradient Reactivation Enhanced Causal Attention for Out-Of-Distribution Generalizable Graph Classification
  161. Gradient Weighting for Speaker Verification in Extremely Low Signal-to-Noise Ratio
  162. Gradient and Brightness Guided Low-Light Enhancement with Attention-Based Self-Paced Learning
  163. Gradient-Aware Logit Adjustment Loss for Long-Tailed Classifier
  164. Gradient-Based Dimensionality Reduction for Speech Emotion Recognition Using Deep Networks
  165. Gradually Spatio-Temporal Feature Activation for Target Tracking
  166. Granger Connectivity Analysis as a Block-Term Tensor Regression for eSport Players
  167. Graph Convolutional Neural Networks In The Companion Model
  168. Graph Identification and Upper Confidence Evaluation for Causal Bandits with Linear Models
  169. Graph Local-Smooth Dictionary Learning
  170. Graph Networks Stand Strong: Enhancing Robustness via Stability Constraints
  171. Graph Neural Networks are More Powerful than We Think
  172. Graph Signal Processing: The 2D Companion Model
  173. Graph-Aware Multi-View Fusion for Rumor Detection on Social Media
  174. Graph-Based Environment Representation for Vision-and-Language Navigation in Continuous Environments
  175. Graph-Based Permutation Patterns for the Analysis of Task-Related FMRI Signals on DTI Networks in Mild Cognitive Impairment
  176. Graph-Enhanced Hybrid Sampling for Multi-Armed Bandit Recommendation
  177. Graphical Inference in Non-Markovian Linear-Gaussian State-Space Models
  178. Gravitated Latent Space Loss Generated by Metric Tensor for High-Dynamic Range Imaging
  179. Gridless Parameter Estimation in Partly Calibrated Rectangular Arrays
  180. Grounded-Instruct-Pix2Pix: Improving Instruction Based Image Editing with Automatic Target Grounding
  181. GuessKT: Improving Knowledge Tracing via Considering Guess Behaviors
  182. HADGEO: Image Based 3-DoF Cross-View Geo-Localization with Hard Sample Mining
  183. HAFFormer: A Hierarchical Attention-Free Framework for Alzheimer's Disease Detection From Spontaneous Speech
  184. HAROOD: Human Activity Classification and Out-Of-Distribution Detection with Short-Range FMCW Radar
  185. HDPNERF: Hybrid Depth Priors for Neural Radiance Fields from Sparse Input Views
  186. HENet: Hyperbolic-Based Encoder-Decoder Network for Word Spotting in Historical Mongolian Documents
  187. HIQ: One-Shot Network Quantization for Histopathological Image Classification
  188. HLS-FGVC: Hierarchical Label Semantics Enhanced Fine-Grained Visual Classification
  189. HM-CONFORMER: A Conformer-Based Audio Deepfake Detection System with Hierarchical Pooling and Multi-Level Classification Token Aggregation Methods
  190. HMM-based CSI Embedding for Trajectory Recovery from RSS Measurements of Non-Cooperative Devices
  191. HMNet: Hierarchical Microscale-Aware Network for Infrared Small Target Detection
  192. HOICS: Zero-Shot Hoi Detection via Compatibility Self-Learning
  193. HRTF Recommendation Based on the Predicted Binaural Colouration Model
  194. Haformer: Heterogeneous Aggregation Transformer for Single Image Deraining
  195. HaltingVT: Adaptive Token Halting Transformer for Efficient Video Recognition
  196. Hardware Impairments-Aware Design of noncoherent Grassmannian Constellations
  197. Hardware-Algorithm Co-Design Enabling Processing-In-Pixel-In-Memory (P2M) for Neuromorphic Vision Sensors
  198. Hardware-Limited Time Constant Estimation Using a Weighted Linear Regression
  199. Harmonic Retrieval for Non-Circular Coherent Signals via Double Decoupled Atomic Norm Minimization
  200. Hazy Remote Sensing Images Semantic Segmentation for Weakly Annotation Based on Saliency-Aware Alignment Strategy
  201. Hdrtvformer: Efficient Sdrtv-to-Hdrtv via Affine Transformation and Spatial-Aware Transformer
  202. Healthy Aging is Marked by Entropy Reduction in Cortical Spontaneous Activity
  203. Hear-Your-Action: Human Action Recognition by Ultrasound Active Sensing
  204. Hearing Loss Detection From Facial Expressions in One-On-One Conversations
  205. Heart Rate Variability Estimation with Dynamic Fine Filtering and Global-Local Context Outlier Removal
  206. Heterogeneous Face Recognition Using Domain Invariant Units
  207. Heuristic-Driven, Type-Specific Embedding in Parallel Spaces for Enhancing Knowledge Graph Reasoning
  208. Hierarchical Attacks on Large-Scale Graph Neural Networks
  209. Hierarchical Cross-Modality Knowledge Transfer with Sinkhorn Attention for CTC-Based ASR
  210. Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
  211. Hierarchical Home Action Understanding with Implicit and Explicit Prior Knowledge
  212. Hierarchical Metadata Information Constrained Self-Supervised Learning for Anomalous Sound Detection under Domain Shift
  213. Hierarchical Speaker Representation for Target Speaker Extraction
  214. Hierarchical VAE Based Semantic Communications for POMDP Tasks
  215. High Accuracy Device Localization in Indoor Mmwave Networks Exploiting Channel Sparsity and Virtual Anchor Mapping
  216. High Resolution Guitar Transcription Via Domain Adaptation
  217. High Resolution Image Quality Database
  218. High-Accuracy Anxiety Disorder Identification Through Subspace-Enhanced Hypergraph Neural Network
  219. High-Fidelity Speech Synthesis with Minimal Supervision: All Using Diffusion Models
  220. High-Resolution Through-Wall Imaging Using Data Fusion and Reasoning
  221. Higher Order Multiple Graph Filtering for Structured Graph Learning
  222. Highlight Removal Network Based on an Improved Dichromatic Reflection Model
  223. Hint-Enhanced In-Context Learning Wakes Large Language Models Up For Knowledge-Intensive Tasks
  224. Hodge-Aware Contrastive Learning
  225. Hot-Fixing Wake Word Recognition for End-to-End ASR Via Neural Model Reprogramming
  226. Hourglass-AVSR: Down-Up Sampling-Based Computational Efficiency Model for Audio-Visual Speech Recognition
  227. How Can Personalized Context Help? Exploring Joint Retrieval of Passage and Personalized Context
  228. How Does End-To-End Speech Recognition Training Impact Speech Enhancement Artifacts?
  229. How Secure is the Time-Modulated Array-Enabled OFDM Directional Modulation?
  230. How to Bridge Graph and Sequence Patterns in Session-Based Recommendation? A Self-Supervised Method
  231. Hubertopic: Enhancing Semantic Representation of Hubert Through Self-Supervision Utilizing Topic Model
  232. Human Guided Cross-Modal Reasoning with Semantic Attention Learning for Visual Question Answering
  233. Human Motion Capture Data Segmentation Based on ST-GCN
  234. Human Motion Generation via Conditioned GMVAE with TUNet
  235. Human Perception-Guided Meta-Training for Few-Shot NeRF
  236. Humtrans: A Novel Open-Source Dataset for Humming Melody Transcription and Beyond
  237. HySense: Hybrid Event Occurrence Detection Method for IoT Devices
  238. Hybrid Attention Time-Frequency Analysis Network for Single-Channel Speech Enhancement
  239. Hybrid Convolution-Transformer for Lightweight Single Image Super-Resolution
  240. Hybrid Domain Learning towards Light Field Spatial Super-Resolution using Heterogeneous Imaging
  241. Hybrid Module with Multiple Receptive Fields and Self-Attention Layers for Medical Image Segmentation
  242. Hyperbolic Diffusion Procrustes Analysis for Intrinsic Representation of Hierarchical Data Sets
  243. Hyperbolic Distance-Based Speech Separation
  244. Hyperganstrument: Instrument Sound Synthesis and Editing With Pitch-Invariant Hypernetworks
  245. Hypergraph Transformer for Semi-Supervised Classification
  246. Hypergraph-Enhanced Self-Supervised Robust Graph Learning for Social Recommendation
  247. Hypergraph-Mlp: Learning on Hypergraphs Without Message Passing
  248. Hyperspectral Image Reconstruction Using Hierarchical Neural Architecture Search from A Snapshot Image
  249. Hystoc: Obtaining Word Confidences for Fusion of End-To-End ASR Systems
  250. I3FDM: IRIS Inpainting Via Inverse Fusion of Diffusion Models
  251. IFNET: Integrating Data Augmentation and Decoupled Attention Fusion for 3D Object Detection
  252. IFNet: Imaging and Focusing Network for handheld mmWave Devices
  253. IHT-Inspired Neural Network for Single-Snapshot DOA Estimation with Sparse Linear Arrays
  254. IMFIT: Normal Estimation via Learning Neural Implicit Surface
  255. INCPrompt: Task-Aware Incremental Prompting for Rehearsal-Free Class-Incremental Learning
  256. IPCL: Iterative Pseudo-Supervised Contrastive Learning to Improve Self-Supervised Feature Representation
  257. IRLSG: Invariant Representation Learning for Single-Domain Generalization in Medical Image Segmentation
  258. IRS-Assisted Covert Communication with a BPP Distributed Warden outside a Safety Zone
  259. IRS-Assisted Joint Sensing and Communication Design for Autonomous Driving
  260. Identifiability Analysis of Sensor Arrays with Sensors off Half-Wavelength Grid
  261. Identifiability Study of Near-Field Automotive SAR
  262. Identifying Attack-Specific Signatures in Adversarial Examples
  263. Image Aesthetics Assessment Via Learnable Queries
  264. Image Attribution by Generating Images
  265. Image Augmentation with Controlled Diffusion for Weakly-Supervised Semantic Segmentation
  266. Image Coding for Analytics via Adversarially Augmented Adaptation
  267. Image Harmonization Based on Hierarchical Dynamics
  268. Image Mixing and Gradient Smoothing to Enhance the SAR Image Attack Transferability
  269. Image Restoration with Generalized L2 Loss and Convergent Plug-and-Play Priors
  270. Image Retrieval with Composed Query by Multi-Scale Multi-Modal Fusion
  271. Image Steganography with Deep Orthogonal Fusion of Multi-Scale Channel Attention
  272. Image2Points: A 3D Point-Based Context Clusters GAN for High-Quality Pet Image Reconstruction
  273. Imaging An Evolving Black Hole By Leveraging Shared Structure
  274. Imitating the Human Visual System for Scanpath Predicting
  275. Impact of Sampling Strategies on the Monitoring of Climate Regime Shifts with a Learning Data Assimilation Method
  276. Implicit Enhancement of Target Speaker in Speaker-Adaptive ASR through Efficient Joint Optimization
  277. Implicit Foreground-Guided Network for Anomaly Detection and Localization
  278. Implicit Neural Multiple Description for DNA-Based Data Storage
  279. Implicit Neural Representation For Low-Overhead Graph-Based Holographic-Type Communications
  280. Implicit-Knowledge-Guided Align Before Understanding for KB-VQA
  281. Importance Sampling Based Federated Unsupervised Representation Learning
  282. Importance of Negative Sampling in Weak Label Learning
  283. Imposing Early and Asymptotic Constraints on Ligme with Application to Nonconvex Enhancement of Fused Lasso Models
  284. Improve Deep Forest with Learnable Layerwise Augmentation Policy Schedules
  285. Improved Children's Automatic Speech Recognition Combining Adapters and Synthetic Data Augmentation
  286. Improved Image Captioning Via Knowledge Graph-Augmented Models
  287. Improved Screen Content Coding in VVC Using Soft Context Formation
  288. Improving ASR Contextual Biasing with Guided Attention
  289. Improving Acoustic Echo Cancellation by Exploring Speech and Echo Affinity with Multi-Head Attention
  290. Improving Acoustic Echo Cancellation for Voice Assistants Using Neural Echo Suppression and Multi-Microphone Noise Reduction
  291. Improving Attention-Based End-to-End Speech Recognition by Monotonic Alignment Attention Matrix Reconstruction
  292. Improving Audio Captioning Models with Fine-Grained Audio Features, Text Embedding Supervision, and LLM Mix-Up Augmentation
  293. Improving Biomedical Entity Linking with Retrieval-Enhanced Learning
  294. Improving Chinese Spelling Correction with Text-Phonetics Differentiation and Adaptive Fusion
  295. Improving Continual Learning of Acoustic Scene Classification via Mutual Information Optimization
  296. Improving Cross-Domain Few-Shot Classification with Multilayer Perceptron
  297. Improving Design of Input Condition Invariant Speech Enhancement
  298. Improving Domain Generalization in Speech Emotion Recognition with Whisper
  299. Improving Kinyarwanda Speech Recognition Via Semi-Supervised Learning
  300. Improving Language Model-Based Zero-Shot Text-to-Speech Synthesis with Multi-Scale Acoustic Prompts
  301. Improving Learned Video Compression by Exploring Spatial Redundancy
  302. Improving Limited Supervised Foot Ulcer Segmentation Using Cross-Domain Augmentation Strategies
  303. Improving Long Text Understanding with Knowledge Distilled from Summarization Model
  304. Improving Medical Dialogue Generation with Abstract Meaning Representations
  305. Improving Motion Deblur By Multi-Output Learning
  306. Improving Multi-Modal Emotion Recognition Using Entropy-Based Fusion and Pruning-Based Network Architecture Optimization
  307. Improving Multi-Speaker ASR With Overlap-Aware Encoding And Monotonic Attention
  308. Improving Music Source Separation with Simo Stereo Band-Split Rnn
  309. Improving Neural Diarization through Speaker Attribute Attractors and Local Dependency Modeling
  310. Improving Open-Set Recognition with Bayesian Metric Learning
  311. Improving Oral Reading Fluency Assessment Through Sub-Sequence Matching of Acoustic Word Embeddings
  312. Improving Radiology Report Generation with D2-Net: When Diffusion Meets Discriminator
  313. Improving Short Utterance Anti-Spoofing with Aasist2
  314. Improving Speaker-Independent Speech Emotion Recognition using Dynamic Joint Distribution Adaptation
  315. Improving Speech Attenuation in Headphones using Harmonic Model Decomposition and Multiple-Frequency ANC
  316. Improving Speech Emotion Recognition with Unsupervised Speaking Style Transfer
  317. Improving Speech Recognition for African American English with Audio Classification
  318. Improving Speed/Accuracy Tradeoff for Online Streaming ASR via Real-Valued and Trainable Strides
  319. Improving Target Sound Extraction with Timestamp Knowledge Distillation
  320. Improving VGG-Style Convnet for JPEG Steganalysis
  321. Improving Vision-Inspired Keyword Spotting Using Dynamic Module Skipping in Streaming Conformer Encoder
  322. Improving Visual Quality and Transferability of Adversarial Attacks on Face Recognition Simultaneously with Adversarial Restoration
  323. In-Context Learning for Few-Shot Nested Named Entity Recognition
  324. In-Context Prompt Editing for Conditional Audio Generation
  325. In-The-Wild Physiological-Based Stress Detection Using Federated Strategy
  326. Incomplete Multi-View Clustering Via Inference and Evaluation
  327. Incomplete Multi-View Representation Learning Through Anchor Graph-Based GCN and Information Bottleneck
  328. Incomplete Observations Bias Suppression for Abductive Natural Language Inference
  329. Incremental Tensor Decomposition for Few Shot Neural Radiance Field
  330. Inducing Inductive Bias in Vision Transformer for EEG Classification
  331. Inference of Genetic Effects via Approximate Message Passing
  332. Inference of Time-Varying Graph Topologies via Gaussian Processes
  333. Inferring Time Varying Signals over Uncertain Graphs
  334. Inferring the Graph of Networked Dynamical Systems under Partial Observability and Spatially Colored Noise
  335. Innovative Methods for Non-Destructive Inspection of Handwritten Documents
  336. Inputmix: A Strategy to Regularize and Balance Multi-Modality and Multi-View Model Learning
  337. Instant Photorealistic Neural Radiance Fields Stylization
  338. Integrated Localization and Communication in 3GPP Industrial Environments
  339. Integrated Sensing And Communication In Unlicensed Mmwave Bands: Joint Beamforming Training And Energy Allocation
  340. Integrating Language Models with Symbolic Formulas for First-Order Logic Reasoning
  341. Integrating Sensing, Communication, and Computation in the Sky
  342. Intelligent Cardiac Auscultation for Murmur Detection via Parallel-Attentive Models with Uncertainty Estimation
  343. Inter-Modality and Intra-Sample Alignment for Multi-Modal Emotion Recognition
  344. Internal Location Assistance for Temporal Action Proposal Generation
  345. Interpretable Face Aging: Enhancing Conditional Adversarial Autoencoders with Lime Explanations
  346. Interpretable Multimodal Out-of-Context Detection with Soft Logic Regularization
  347. Interpretable Policy Extraction with Neuro-Symbolic Reinforcement Learning
  348. Interpreting Memorization in Deep Learning from Data Distribution
  349. Introducing Multilingual Phonetic Information to Speaker Embedding for Speaker Verification
  350. Invariant Motion Representation Learning for 3D Talking Face Synthesis
  351. InvariantOODG: Learning Invariant Features of Point Clouds for Out-of-Distribution Generalization
  352. Inversive-Reasoning Augmentation for Natural Language Inference
  353. InvertedFontNet: Font Watermarking based on Perturbing Style Manifold
  354. Invertible Mosaic Image Hiding Network for Very Large Capacity Image Steganography
  355. Invertible Voice Conversion with Parallel Data
  356. Investigating End-to-End ASR Architectures for Long Form Audio Transcription
  357. Investigating Personalization Methods in Text to Music Generation
  358. Investigating Salient Representations and Label Variance in Dimensional Speech Emotion Analysis
  359. Investigating Self-Supervised Deep Representations for EEG-Based Auditory Attention Decoding
  360. Investigating the Clusters Discovered By Pre-Trained AV-HuBERT
  361. Iphonmatchnet: Zero-Shot User-Defined Keyword Spotting Using Implicit Acoustic Echo Cancellation
  362. Irregularity-Aware Bandlimited Approximation for Graph Signal Interpolation
  363. Isac Beamforming Optimization For Robust Transmission In Dynamic Mmwave Mimo Networks
  364. Iterative Autoregressive Generation for Abstractive Summarization
  365. Iteratively Preconditioned Guidance of Denoising (Diffusion) Models For Image Restoration
  366. J-MAE: Jigsaw Meets Masked Autoencoders in X-Ray Security Inspection
  367. JM-CLIP: A Joint Modal Similarity Contrastive Learning Model for Video-Text Retrieval
  368. JPEG Encryption with DC Prediction and Run-Based RS Pairs Permutation
  369. JPIS: A Joint Model for Profile-Based Intent Detection and Slot Filling with Slot-to-Intent Attention
  370. Joint Admission Control and Beamformer Design for Mobile Users: Stay Here or Move to a Better Position?
  371. Joint Beamforming and Compression Design for Per-Antenna Power Constrained Cooperative Cellular Networks
  372. Joint Blind Deconvolution And Demixing Of Sparse Signals Via Factorization And Nonconvex Optimization
  373. Joint Channel Estimation and Data Detection in Massive Mimo Systems Based on Diffusion Models
  374. Joint Classification of Hyperspectral and Lidar Data Using Cross-Modal Hierarchical Frequency Fusion Network
  375. Joint Computing and Communication Resource Allocation for TDMA-Based Binary Computation Offloading
  376. Joint DOA Estimation and Distorted Sensor Detection Under Entangled Low-Rank and Row-Sparse Constraints
  377. Joint Demosaicing And Denoising With Double Deep Image Priors
  378. Joint Embedding Learning and Latent Subspace Probing for Cross-Domain Few-Shot Keyword Spotting
  379. Joint End-to-End Spoken Language Understanding and Automatic Speech Recognition Training Based on Unified Speech-to-Text Pre-Training
  380. Joint INDSCAL Decomposition Meets Blind Source Separation
  381. Joint Inference of Speaker Diarization and ASR with Multi-Stage Information Sharing
  382. Joint Learning of Identity and Vein Features for Enhanced Representations in Vascular Biometrics
  383. Joint Multi-Band DOA Estimation Using Low-Rank Matrix Recovery
  384. Joint Multi-Facts Reasoning Network for Complex Temporal Question Answering Over Knowledge Graph
  385. Joint Music and Language Attention Models for Zero-Shot Music Tagging
  386. Joint Near-Field Target Tracking and Communications with full Duplex Holographic MIMO
  387. Joint Robust Optimal Transmit and Receive Beamforming Designs for a DFRC System for the MIMO Radar and Secondary Multicast Communication in a Cognitive Radio Network
  388. Joint Signal Interpolation / Time-Varying Graph Estimation Via Smoothness and Low-Rank Priors
  389. Joint Signal Recovery and Graph Learning from Incomplete Time-Series
  390. Joint Spatio-Temporal Filtering of Motion Imagery EEG Signals for Data Alignment in Transfer Learning
  391. Joint Transmit Precoders and Passive Reflection Beamformer Design in IRS-Aided IoT Networks
  392. Joint Unsupervised and Supervised Training for Automatic Speech Recognition via Bilevel Optimization
  393. Joint-Semantics Multi-Similarity Hashing for Cross-Modal Retrieval
  394. Jointly Learning Selection Matrices for Transmitters, Receivers and Fourier Coefficients in Multichannel Imaging
  395. K-Means Clustering Based on Chebyshev Polynomial Graph Filtering
  396. KC-Prompt: End-To-End Knowledge-Complementary Prompting for Rehearsal-Free Continual Learning
  397. KD-Former: Transformer Knowledge Distillation for Image Matting
  398. KNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
  399. Kalman Filter for Tracking Network Dynamic
  400. Kalman Filtering With Unlimited Sensing
  401. Keep Decoding Parallel With Effective Knowledge Distillation From Language Models To End-To-End Speech Recognisers
  402. Keep Knowledge in Perception: Zero-Shot Image Aesthetic Assessment
  403. Kenet: Knowledge-Enhanced DOC-Label Attention Network for Multi-Label Text Classification
  404. Key Points Centered Sparse Hashing for Cross-Modal Retrieval
  405. Killing It With Zero-Shot: Adversarially Robust Novelty Detection
  406. Knowledge-Aware Prompt Learning Framework for Korean-Chinese Microblog Sentiment Analysis
  407. Knowledge-Based Convolutional Neural Network for the Simulation and Prediction of Two-Phase Darcy Flows
  408. L1-Aware Multilingual Mispronunciation Detection Framework
  409. LCB-Net: Long-Context Biasing for Audio-Visual Speech Recognition
  410. LEFormer: A Hybrid CNN-Transformer Architecture for Accurate Lake Extraction from Remote Sensing Imagery
  411. LITEVSR: Efficient Visual Speech Recognition by Learning from Speech Representations of Unlabeled Data
  412. LK-UNet: Large Kernel Design for 3D Medical Image Segmentation
  413. LLET: Lightweight Lexicon-Enhanced Transformer for Chinese NER
  414. LOCSELECT: Target Speaker Localization with an Auditory Selective Hearing Mechanism
  415. LOFT: Latent Space Optimization and Generator Fine-Tuning for Defending Against Deepfakes
  416. LV-SEGFORMER: Towards More Accurate Leaf-Vein Segmentation with Transformer
  417. LVC-LGMC: Joint Local and Global Motion Compensation for Learned Video Compression
  418. LaCViT: A Label-Aware Contrastive Fine-Tuning Framework for Vision Transformers
  419. LabCLIP: Label-Enhanced Clip for Improving Zero-Shot Text Classification
  420. Label Correction For Sketch-Based 3d Shape Retrieval
  421. Label Dependencies-Aware Set Prediction Networks for Multi-Label Text Classification
  422. Label Rectified and Graph Adaptive Semi-Supervised Regression for Electrode Shifted Gesture Recognition
  423. Label-Aware Auxiliary Learning for Dialogue State Tracking
  424. Language Guided Adversarial Purification
  425. Language Model is a Branch Predictor for Simultaneous Machine Translation
  426. Language-Driven Open-Vocabulary 3D Semantic Segmentation with Knowledge Distillation
  427. Language-Driven Ordinal Learning for Imbalanced Head Pose Estimation
  428. Language-Free Compositional Action Generation via Decoupling Refinement
  429. Language-Guided Few-Shot Semantic Segmentation
  430. Language-Oriented Communication with Semantic Coding and Knowledge Distillation for Text-to-Image Generation
  431. Langwave: Realistic Voice Generation Based on High-Order Langevin Dynamics
  432. Large Covariance Matrix Estimation Based on Factor Models via Nonconvex Optimization
  433. Large Language Model-Based Emotional Speech Annotation Using Context and Acoustic Feature for Speech Emotion Recognition
  434. Large Language Models As A Proxy For Human Evaluation In Assessing The Comprehensibility Of Disordered Speech Transcription
  435. Large Language Models Augmented Rating Prediction in Recommender System
  436. Large Scale Self-Supervised Pretraining for Active Speaker Detection
  437. Large-Scale Multi-View Multiple Clustering
  438. Latent Degradation Representation Constraint for Single Image Deraining
  439. Latent Filling: Latent Space Data Augmentation for Zero-Shot Speech Synthesis
  440. Leaky Waveguide Antennas for Downlink Wideband THz Communications
  441. Learn From Zoom: Decoupled Supervised Contrastive Learning For WCE Image Classification
  442. Learn to Cluster Faces with Better Subgraphs
  443. Learn to Track-Before-Detect via Neural Dynamic Programming
  444. Learnable Statistical Moments Pooling for Automatic Modulation Classification
  445. Learned ISTA with Error-Based Thresholding for Adaptive Sparse Coding
  446. Learned Layered Coding for Successive Refinement in the Wyner-Ziv Problem
  447. Learned Video Compression with Spatial-Temporal Optimization
  448. Learning Active Subspaces for Effective and Scalable Uncertainty Quantification in Deep Neural Networks
  449. Learning Arousal-Valence Representation from Categorical Emotion Labels of Speech
  450. Learning Audio Concepts from Counterfactual Natural Language
  451. Learning Contextualized Representation on Discrete Space Via Hierarchical Product Quantization
  452. Learning Density Regulated and Multi-View Consistent Unsigned Distance Fields
  453. Learning Discriminative Style Representations for Unsupervised and Few-Shot Artistic Portrait Drawing Generation
  454. Learning Disentangled Speech Representations with Contrastive Learning and Time-Invariant Retrieval
  455. Learning Dynamics of Low-Precision Clipped SGD with Momentum
  456. Learning Emotion-Invariant Speaker Representations for Speaker Verification
  457. Learning Fine-Grained Information Alignment for Calibrated Cross-Modal Retrieval
  458. Learning Generalizable Visual Representations via Self-Supervised Information Bottleneck
  459. Learning Graphs and Simplicial Complexes from Data
  460. Learning Hybrid Negative Probability Model for Weakly-Supervised Whole Slide Image Recognition
  461. Learning Inference-Time Drift Sensor-Actuator for Domain Generalization
  462. Learning Invariant Representation with Consistency and Diversity for Semi-Supervised Source Hypothesis Transfer
  463. Learning Multiplex Graph With Inter-Layer Coupling
  464. Learning Multiscale Consistency for Self-Supervised Electron Microscopy Instance Segmentation
  465. Learning Ontology Informed Representations with Constraints for Acoustic Event Detection
  466. Learning Representations from Explainable and Connectionist Approaches for Visual Question Answering
  467. Learning Semantic Information from Raw Audio Signal Using Both Contextual and Phonetic Representations
  468. Learning Signals and Graphs from Time-Series Graph Data with Few Causes
  469. Learning Spatio-Temporal Relations with Multi-Scale Integrated Perception for Video Anomaly Detection
  470. Learning Speaker-Listener Mutual Head Orientation by Leveraging HRTF and Voice Directivity on Headphones
  471. Learning Spectral Canonical ℱ-Correlation Representation for Face Super-Resolution
  472. Learning Speech Representation from Contrastive Token-Acoustic Pretraining
  473. Learning With Non-Uniform Label Noise: A Cluster-Dependent Weakly Supervised Approach
  474. Learning a Convex Patch-Based Synthesis Model via Deep Equilibrium
  475. Learning a Low-Rank Feature Representation: Achieving Better Trade-Off Between Stability and Plasticity in Continual Learning
  476. Learning from Easy to Hard: Multi-Task Learning with Data Scheduling
  477. Learning from Taxonomy: Multi-Label Few-Shot Classification for Everyday Sound Recognition
  478. Learning the Barankin Lower Bound on DOA Estimation Error
  479. Least-Effort Adversarial Attack Against Gait-Based Identity Recognition System
  480. Lesion-Aware Open Set Medical Image Recognition with Domain Shift
  481. Less Peaky and More Accurate CTC Forced Alignment by Label Priors
  482. Leverage Causal Graphs and Rumor-Refuting Texts for Interpretable Rumor Analysis
  483. Leveraging Biases in Large Language Models: "bias-kNN" for Effective Few-Shot Learning
  484. Leveraging Data Collection and Unsupervised Learning for Code-Switched Tunisian Arabic Automatic Speech Recognition
  485. Leveraging Large Language Models for Exploiting ASR Uncertainty
  486. Leveraging Large Pretrained Models for Line-by-Line Spoken Program Recognition
  487. Leveraging Noisy Labels of Nearest Neighbors for Label Correction and Sample Selection
  488. Leveraging Redundancy in Feature for Efficient Learned Image Compression
  489. Leveraging Self-Supervised Speech Representations for Domain Adaptation in Speech Enhancement
  490. Leveraging Sound Localization to Improve Continuous Speaker Separation
  491. Leveraging Speech PTM, Text LLM, And Emotional TTS For Speech Emotion Recognition
  492. Leveraging Tensor Subspace Prior: Enhanced Sum of Nuclear Norm Minimization for Tensor Completion
  493. Leveraging Timestamp Information for Serialized Joint Streaming Recognition and Translation
  494. Leveraging Visual Handicaps for Text-Based Reinforcement Learning
  495. Leveraging in-the-wild Data for Effective Self-supervised Pretraining in Speaker Recognition
  496. Libriheavy: A 50, 000 Hours ASR Corpus with Punctuation Casing and Context
  497. LightCodec: A High Fidelity Neural Audio Codec with Low Computation Complexity
  498. Lighting Image/Video Style Transfer Methods by Iterative Channel Pruning
  499. Lightweight High-Resolution Subject Matting in the Real World
  500. Lightweight Multi-Axial Transformer with Frequency Prompt for Single Channel Speech Enhancement
  501. Likelihood Consensus 2.0: Reducing Interagent Communication in Distributed Bayesian Target Tracking
  502. Lipschitz-Constrained Convolutional Layers Using Convex Projection
  503. Live Iterative Ptychography with Projection-Based Algorithms
  504. LoFi User Scheduling for Multiuser Mimo Wireless Systems
  505. Local Contrast Prior-Guided Cross Aggregation Model for Effective Infrared Small Target Detection
  506. Local Distance Correlation Embedding for Time-Series Analysis on Riemannian Manifolds
  507. Local Information Guided Global Integration for Infrared Small Target Detection
  508. Local Optimization Networks for Multi-View Multi-Person Human Posture Estimation
  509. Local and Global Feature Adaptive Adjustment Network for Remote Sensing Image Scene Classification
  510. Local and Global: Text Matching Via Syntax Graph Calibration
  511. Locality-Enhanced Transformer for Semantic Segmentation of High-Resolution Remote Sensing Images
  512. Localization and Tracking of Gold Nanoparticles Using mmWave FMCW Radar
  513. Localization in Sensor Networks Using Distributed Low-Rank Matrix Completion
  514. Localizing Acoustic Energy in Sound Field Synthesis by Directionally Weighted Exterior Radiation Suppression
  515. Location Optimization for RIS Aided mmWave Downlink Network
  516. Long Term Memory-Enhanced Via Causal Reasoning for Text-To-Video Retrieval
  517. Long-Term Action Anticipation Based on Contextual Alignment
  518. Long-Term Social Interaction Context: The Key to Egocentric Addressee Detection
  519. Longitudinal Modeling of Depression Shifts Using Speech and Language
  520. Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling
  521. Loop Structure-Aware Learning for Fully Automated Pulmonary Fissure Completeness Assessment
  522. Loss Masking Is Not Needed In Decoder-Only Transformer For Discrete-Token-Based ASR
  523. Lossy Compression of Adjacency Matrices by Graph Filter Banks
  524. Low Bitrate Loss Resilience Scheme for a Speech Enhancing Neural Codec
  525. Low Overhead DMG Sensing for Vital Signs Detection
  526. Low Redundant Attention Network for Efficient Image Super-Resolution
  527. Low-Complexity GLRT Based Quickest Detection With Unknown Parameters
  528. Low-Complexity Vector Source Coding for Discrete Long Sequences with Unknown Distributions
  529. Low-Latency Speech Enhancement via Speech Token Generation
  530. Low-Light Raw Image Enhancement on a Dataset Suffering Light Effects
  531. Low-Rank Completion Based Normal Guided Lidar Point Cloud Up-Sampling
  532. Low-Rank Constrained Multichannel Signal Denoising Considering Channel-Dependent Sensitivity Inspired by Self-Supervised Learning for Optical Fiber Sensing
  533. M2BART: Multilingual and Multimodal Encoder-Decoder Pre-Training for Any-to-Any Machine Translation
  534. M2SUM: Multi-Granularity Scale-Adaptive Video Summarizer towards Informative Context Representation Learning
  535. M3ARL: Moment-Embedded Mean-Field Multi-Agent Reinforcement Learning for Continuous Action Space
  536. M3DSYNTH: A Dataset of Medical 3D Images with AI-Generated Local Manipulations
  537. M3TN: Multi-Gate Mixture-of-Experts Based Multi-Valued Treatment Network for Uplift Modeling
  538. M3TQA: Multi-View, Multi-Hop and Multi-Stage Reasoning for Temporal Question Answering
  539. M3sum: A Novel Unsupervised Language-Guided Video Summarization
  540. MACCN: Multi-Modal Adaptive Co-Attention Fusion Contrastive Learning Networks for Fake News Detection
  541. MADRL-Based UAVs Trajectory Design with Anti-Collision Mechanism in Vehicular Networks
  542. MAML-Based 24-Hour Personalized Blood Pressure Estimation from Wrist Photoplethysmography Signals in Free-Living Context
  543. MAS-NET: Mixed-Feature Attention Siamese Network for Change Detection on Remote Sensing Images
  544. MCM-CSD: Multi-Granularity Context Modeling with Contrastive Speaker Detection for Emotion Recognition in Real-Time Conversation
  545. MDAVIF: A Multi-Domain Acoustical-Visual Information Fusion Model for Depression Recognition from Vlog Data
  546. MDX-GAN: Enhancing Perceptual Quality in Multi-Class Source Separation Via Adversarial Training
  547. MEAT: Median-Ensemble Adversarial Training for Improving Robustness and Generalization
  548. MEPE: A Minimalist Ensemble Policy Evaluation Operator for Deep Reinforcement Learning
  549. MERG: Multi-Dimensional Edge Representation Generation Layer for Graph Neural Networks
  550. MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
  551. MFT-PCQA: Multi-Modal Fusion Transformer for No-Reference Point Cloud Quality Assessment
  552. MGRL: Mutual-Guidance Representation Learning for Text-to-Image Person Retrieval
  553. MHPS: Multimodality-Guided Hierarchical Policy Search for Knowledge Graph Reasoning
  554. MIMO imaging method with iterative-based super-resolution for automotive radar
  555. MIR-MLPop: A Multilingual Pop Music Dataset with Time-Aligned Lyrics and Audio
  556. MISA: Unveiling the Vulnerabilities in Split Federated Learning
  557. MLCA-AVSR: Multi-Layer Cross Attention Fusion Based Audio-Visual Speech Recognition
  558. MLMTD: A Multi-Layer Malicious Traffic Detection Model Based on Multi-Branch Octave Convolution and Attention Mechanism
  559. MLPs Compass: What is Learned When MLPs are Combined with PLMs?
  560. MMAFlow: Matching-Guided Motion Aggregation for Optical Flow Estimation
  561. MMCOUNT: Stationary Crowd Counting System Based on Commodity Millimeter-Wave Radar
  562. MMHSV: A Multimodal Handwritten Signature Verification Fusing Dynamic and Static Feature
  563. MMRBN: Rule-Based Network for Multimodal Emotion Recognition
  564. MMS: Morphology-Mixup Stylized Data Generation for Single Domain Generalization in Medical Image Segmentation
  565. MOMA: Mixture-of-Modality-Adaptations for Transferring Knowledge from Image Models Towards Efficient Audio-Visual Action Recognition
  566. MOS-FAD: Improving Fake Audio Detection Via Automatic Mean Opinion Score Prediction
  567. MS-SENet: Enhancing Speech Emotion Recognition Through Multi-Scale Feature Fusion with Squeeze-and-Excitation Blocks
  568. MSFR: Stance Detection Based on Multi-Aspect Semantic Feature Representation via Hierarchical Contrastive Learning
  569. MSG-BART: Multi-Granularity Scene Graph-Enhanced Encoder-Decoder Language Model for Video-Grounded Dialogue Generation
  570. MSSTNet: A Multi-Scale Spatio-Temporal CNN-Transformer Network for Dynamic Facial Expression Recognition
  571. MTA: A Lightweight Multilingual Text Alignment Model for Cross-Language Visual Word Sense Disambiguation
  572. MTIDNet: A Multimodal Temporal Interest Detection Network for Video Summarization
  573. MTRGL: Effective Temporal Correlation Discerning Through Multi-Modal Temporal Relational Graph Learning
  574. MVITP: Multi-View Image-Text Perception for Few-Shot Remote Sensing Image Classification
  575. MaDE: Multi-Scale Decision Enhancement for Multi-Agent Reinforcement Learning
  576. Mainlobe Deceptive Jammer Suppression Using FDA-MIMO Radar in the Presence of Multipath Propagation
  577. Manticore: An Unsupervised Intrusion Detection System Based on Contrastive Learning in 5G Networks
  578. MapFlow: Multi-Agent Pedestrian Trajectory Prediction Using Normalizing Flow
  579. Mapache: Masked Parallel Transformer for Advanced Speech Editing and Synthesis
  580. Mask6D: Masked Pose Priors for 6D Object Pose Estimation
  581. Maskmark: Robust Neuralwatermarking for Real and Synthetic Speech
  582. Maskstr: Guide Scene Text Recognition Models with Masking
  583. Matcha-TTS: A Fast TTS Architecture with Conditional Flow Matching
  584. Matpr-Unet: A Multi Attention Two-Path Residual Unet for Focal Cortical Dysplasia Lesions Segmentation
  585. Matrix Factorization in Tropical and Mixed Tropical-Linear Algebras
  586. Max-AST: Combining Convolution, Local and Global Self-Attentions for Audio Event Classification
  587. Max-Margin Transducer Loss: Improving Sequence-Discriminative Training Using a Large-Margin Learning Strategy
  588. Max-Min Beamforming for Multi-User Massive MIMO Systems: An Alternating Projection-Based Approach
  589. Maximal Coding Rate Reduction for Graph Embeddings
  590. Maximum-Entropy Adversarial Audio Augmentation for Keyword Spotting
  591. Mdrt: Multi-Domain Synthetic Speech Localization
  592. Medical Vision-Language Representation Learning with Cross-Modal Multi-Teacher Contrastive Distillation
  593. Mels-Tts : Multi-Emotion Multi-Lingual Multi-Speaker Text-To-Speech System Via Disentangled Style Tokens
  594. Memory Efficient Corner Detection for Event-Driven Dynamic Vision Sensors
  595. Memory Self-Calibrated Network for Visual Grounding
  596. Memory-Augmented Dual-Domain Unfolding Network for MRI Reconstruction
  597. Memory-Augmented Online Video Anomaly Detection
  598. Memory-Augmented speech-to-text Translation with Multi-Scale Context Translation Strategy
  599. Mertech: Instrument Playing Technique Detection Using Self-Supervised Pretrained Model with Multi-Task Finetuning
  600. Mesh-RTUME: Universal Manifold Embedding for Estimating 3D Rigid Transformations of Surfaces
  601. Meta Representation Learning Method for Robust Speaker Verification in Unseen Domains
  602. Meta Structure Search for Link Weight Prediction in Heterogeneous Graphs
  603. Meta-AF Echo Cancellation for Improved Keyword Spotting
  604. Meta-Knowledge Enhanced Data Augmentation for Federated Person Re-Identification
  605. Meta-Learning With Versatile Loss Geometries for Fast Adaptation Using Mirror Descent
  606. Metasurface-Based Receivers with 1-bit ADCS for multi-user Uplink Communications
  607. Micro-expression recognition by fusing action unit detection and Spatio-temporal features
  608. Microphone Subset Selection for the Weighted Prediction Error Algorithm Using a Group Sparsity Penalty
  609. Midi-Voice: Expressive Zero-Shot Singing Voice Synthesis via Midi-Driven Priors
  610. Minimally-Supervised Speech Synthesis with Conditional Diffusion Model and Language Model: A Comparative Study of Semantic Coding
  611. Misspecified Time-Delay and Doppler Estimation over Non Gaussian Scenarios
  612. Mitigate Replication and Copying in Diffusion Models with Generalized Caption and Dual Fusion Enhancement
  613. Mitigating Data Injection Attacks on Federated Learning
  614. Mitigating Intra-Class Variance in Few-Shot Point Cloud Classification
  615. Mitigating Optimization Conflict in Domain Adversarial Neural Network via Uncertainty-Aware
  616. Mixed Graph Signal Analysis of Joint Image Denoising / Interpolation
  617. Mixed Informed Transformer for Few-Shot Medical Image Segmentation
  618. Mixed Precision Neural Quantization with Multi-Objective Bayesian Optimization for on-Device Deployment
  619. Mixed-Attention Auto Encoder for Multi-Class Industrial Anomaly Detection
  620. Modal Consensus and Contextual Separation for Weakly Supervised Temporal Action Localization
  621. Modality Drop-Out for Multimodal Device Directed Speech Detection Using Verbal and Non-Verbal Features
  622. Modality Re-Balance for Visual Question Answering: A Causal Framework
  623. Modality-Dependent Sentiments Exploring for Multi-Modal Sentiment Classification
  624. Model-Based Label-to-Image Diffusion for Semi-Supervised Choroidal Vessel Segmentation
  625. Model-Based Learning for Location-to-Channel Mapping
  626. Modeling Intrapersonal and Interpersonal Influences for Automatic Estimation of Therapist Empathy in Counseling Conversation
  627. Modeling Pseudo-Speaker Uncertainty in Voice Anonymization
  628. Modeling Quasi-Periodic Dependency via Self-Supervised Pre-Training for Respiratory Sound Classification
  629. Modeling Route Representation With Mixed-Scale Hierarchical Transformer
  630. Modulo Sampling and Recovery in Shift-Invariant Spaces
  631. Momentum-Imbued Langevin Dynamics (MILD) for Faster Sampling
  632. Monostatic DMG Passive Sensing with Hypothesis Testing
  633. Monte Carlo Self-Training for Speech Recognition
  634. Mosic: Multimodal Semantic Integrated Communication for Health Monitoring in Iot Scenarios
  635. MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
  636. Motif-Matching Based Sub-Braingraph Level Networks for Noisy Resting-State fMRI Analysis
  637. Motion Latent Diffusion for Stochastic Trajectory Prediction
  638. Motion Transfer-Driven Intra-Class Data Augmentation for Finger Vein Recognition
  639. Motion-Tolerant Radar-Based Heart Sound Detection
  640. Mrtnet: Multi-Resolution Temporal Network for Video Sentence Grounding
  641. Mtdiffusion: Multi-Task Diffusion Model With Dual-Unet for Foley Sound Generation
  642. MuSR: Multi-Scale 3D Scenes Reconstruction based on Monocular Video
  643. Multi-Agent 3D Seismic Exploration Using Adapt-then-Combine Full Waveform Inversion in a hardware-in-the-loop System
  644. Multi-Agent Exploration via Self-Learning and Social Learning
  645. Multi-Agent Sparse Interaction Modeling is an Anomaly Detection Problem
  646. Multi-Antenna ISAC Receiver with n-Tuple Blind Deconvolution
  647. Multi-Attention Enhanced Discriminator for GAN-Based Anomalous Sound Detection
  648. Multi-Band Speech Tensor Decomposition for Interactive Feature Extraction in Early Dysphagia Screening
  649. Multi-Beam Multiplexing Design with Phase-Only Excitation Based on Hybrid Beamforming Architectures
  650. Multi-CMGAN+/+: Leveraging Multi-Objective Speech Quality Metric Prediction for Speech Enhancement
  651. Multi-Channel Mosra: Mean Opinion Score and Room Acoustics Estimation Using Simulated Data and A Teacher Model
  652. Multi-Dimension Queried and Interacting Network for Stereo Image Deraining
  653. Multi-Dimensional Geometric Feature-Based Calibration Method for LiDAR and Camera Fusion
  654. Multi-Dimensional Speech Quality Assessment in Crowdsourcing
  655. Multi-Grained Multimodal Interaction Network for Sentiment Analysis
  656. Multi-Interest Learning for Multi-Modal Paper Recommendation
  657. Multi-Label Abnormality Classification from 12-Lead ECG Using A 2D Residual U-Net
  658. Multi-Layer Relation Knowledge Distillation For Fingerprint Restoration
  659. Multi-Level Augmentation Consistency Learning and Sample Selection for Semi-Supervised Domain Generalization
  660. Multi-Level Contrastive Learning For Hybrid Cross-Modal Retrieval
  661. Multi-Level Graph Learning For Audio Event Classification And Human-Perceived Annoyance Rating Prediction
  662. Multi-Level Spatial-Temporal Feature Aggregation and Alignment-Based Selective Residual Dense Propagation Module for HDR Video Reconstruction
  663. Multi-Linear Kernel Regression and Imputation VIA Manifold Learning: the Dynamic MRI Case
  664. Multi-Microphone Noise Data Augmentation for DNN-Based Own Voice Reconstruction for Hearables in Noisy Environments
  665. Multi-Modal Continual Pre-Training For Audio Encoders
  666. Multi-Modal Emotion Recognition Using Multiple Acoustic Features and Dual Cross-Modal Transformer
  667. Multi-Modal GPT-4 Aided Action Planning and Reasoning for Self-driving Vehicles
  668. Multi-Modality Action Recognition Based on Dual Feature Shift in Vehicle Cabin Monitoring
  669. Multi-Modality Conditional Diffusion Model for Time Series Forecasting of Live Sales Volume
  670. Multi-Modality Speech Recognition Driven by Background Visual Scenes
  671. Multi-Model Wireless Federated Learning with Downlink Beamforming
  672. Multi-Object Editing in Personalized Text-To-Image Diffusion Model Via Segmentation Guidance
  673. Multi-Object Tracking for Unmanned Aerial Vehicles Based on Multi-Frame Feature Fusion
  674. Multi-Objective Progressive Clustering for Semi-Supervised Domain Adaptation in Speaker Verification
  675. Multi-Person Respiration Rate Estimation With Single Pair Of Transmit And Receive Antenna
  676. Multi-Rate Variable-Length CSI Compression for FDD Massive MIMO
  677. Multi-Relational Graph Diffusion Neural Network with Parallel Retention for Stock Trends Classification
  678. Multi-Scale Fusion of Gated Neighborhood Attention Transformers for Single Image Deraining
  679. Multi-Scale Permutation Entropy for Audio Deepfake Detection
  680. Multi-Scale Sub-Band Constant-Q Transform Discriminator for High-Fidelity Vocoder
  681. Multi-Sensor Multi-Scan Radar Sensing of Multiple Extended Targets
  682. Multi-Signal Fusion of Social Diffusion Graph with Bi-Directional Semantic Consistency
  683. Multi-Source DOA Estimation With Statistical Coverage Guarantees
  684. Multi-Source Domain Adaptation Meets Dataset Distillation through Dataset Dictionary Learning
  685. Multi-Source Domain Adaptation with Transformer-Based Feature Generation for Subject-Independent EEG-Based Emotion Recognition
  686. Multi-Source Domain Generalization for ECG-Based Cognitive Load Estimation: Adversarial Invariant and Plausible Uncertainty Learning
  687. Multi-Source Dynamic Interactive Network Collaborative Reasoning Image Captioning
  688. Multi-Source Unsupervised Transfer Components Learning for Cross-Domain Speech Emotion Recognition
  689. Multi-Speaker Localization in the Circular Harmonic Domain on Small Aperture Microphone Arrays Using Deep Convolutional Networks
  690. Multi-Stage Contrastive Regression for Action Quality Assessment
  691. Multi-Stage Learning for Radar Pulse Activity Segmentation
  692. Multi-Stage Progressive Refinement and RoI Context Enhancement Network for Small Logo Detection
  693. Multi-Task Cascaded Attention Network for Brain Tumor Segmentation and Classification
  694. Multi-Task Learning for Front-End Text Processing in TTS
  695. Multi-Task Pseudo-Label Learning for Non-Intrusive Speech Quality Assessment Model
  696. Multi-Task Self-Supervised Learning for Medical Image Segmentation
  697. Multi-Teacher Distillation for Incremental Object Detection
  698. Multi-View Interactive Compromise Learning for Group Recommendation
  699. Multi-View Midivae: Fusing Track- and Bar-View Representations for Long Multi-Track Symbolic Music Generation
  700. Multi-View Speaker Embedding Learning for Enhanced Stability and Discriminability
  701. Multi-View Subspace Clustering With Consensus Graph Contrastive Learning
  702. Multi-Weather Degradation-Aware Transformer for Image Restoration
  703. Multicast Transmission Design With Enhanced DOF For Mimo Coded Caching Systems
  704. Multicast with Multiple Wardens in IRS-Aided Covert DFRC System
  705. Multidimensional Scaling-Based TDOA Localization in Modified Polar Representation
  706. Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
  707. Multilingual Distilwhisper: Efficient Distillation of Multi-Task Speech Models Via Language-Specific Experts
  708. Multilingual Transliteration for Pan-Indic Keyboard Input
  709. Multilingual and Fully Non-Autoregressive ASR with Large Language Model Fusion: A Comprehensive Study
  710. Multimodal Breathing Rate Estimation Using Facial Motion and RPPG From RGB Camera
  711. Multimodal Graph-Based Audio-Visual Event Localization
  712. Multimodal Imaging Feature Extraction with Reference Canonical Correlation Analysis Underlying Intelligence
  713. Multimodal Modeling for Spoken Language Identification
  714. Multimodal Multi-View Spectral-Spatial-Temporal Masked Autoencoder for Self-Supervised Emotion Recognition
  715. Multimodal Sentiment Analysis Based on 3D Stereoscopic Attention
  716. Multimodal Survival Ensemble Network: Integrating Genomic and Histopathological Insights for Enhanced Cancer Prognosis
  717. Multimodal Transformer Distillation for Audio-Visual Synchronization
  718. Multimodal Transformer with a Low-Computational-Cost Guarantee
  719. Multiple Object Tracking Based on Occlusion-Aware Embedding Consistency Learning
  720. Multiple Player Tracking With 3D Projection and Spatio-Temporal Information In Multi-View Sports Videos
  721. Multiple Representation Transfer from Large Language Models to End-to-End ASR Systems
  722. Multiscale Attention Distillation for Object Detection
  723. Multiscale Augmented Normalizing Flows for Image Compression
  724. Multiscale Matching Driven by Cross-Modal Similarity Consistency for Audio-Text Retrieval
  725. Multiscale Scoring Model for Enhanced Urban Perception Evaluation
  726. Multispectral RF Imaging Using Multiple Narrow-Band FMCW Signals
  727. Multistatic Passive Detection of Cyclostationary Signals
  728. Multitarget Tracking in the Presence of Velocity Ambiguity for Automotive Radar
  729. Multitask Classification of Antimicrobial Peptides for Simultaneous Assessment of Antimicrobial Property and Structural Fold
  730. Multitask Speech Recognition and Speaker Change Detection for Unknown Number of Speakers
  731. Multivariate Density Estimation Using Low-Rank Fejér-Riesz Factorization
  732. Multivariate Fourier Distribution Perturbation: Domain Shifts with Uncertainty in Frequency Domain
  733. Multivariate Time Series Forecasting with Causal-Temporal Attention Network
  734. Multiway-Adapter: Adapting Multimodal Large Language Models for Scalable Image-Text Retrieval
  735. Music Auto-Tagging with Robust Music Representation Learned via Domain Adversarial Training
  736. Music Source Separation With Band-Split Rope Transformer
  737. Music Understanding LLaMA: Advancing Text-to-Music Generation with Question Answering and Captioning
  738. Music-to-Dance Poses: Learning to Retrieve Dance Poses from Music
  739. MusicLDM: Enhancing Novelty in text-to-music Generation Using Beat-Synchronous mixup Strategies
  740. Mutual Information Assisted Graph Convolution Network for Cold-Start Recommendation
  741. Mutual Information Based Noise Scale Optimization for Gradient Leakage Resistant Federated Learning
  742. Mutual Information-Based Fair Active Learning
  743. Mutuality Attribute Makes Better Video Anomaly Detection
  744. Mutualreg: Mutual Learning for Unsupervised Medical Image Registration
  745. NAC: Mitigating Noisy Correspondence in Cross-Modal Matching Via Neighbor Auxiliary Corrector
  746. NERF-AD: Neural Radiance Field With Attention-Based Disentanglement For Talking Face Synthesis
  747. NERF-GAZE: A Head-Eye Redirection Parametric Model for Gaze Estimation
  748. NIIRF: Neural IIR Filter Field for HRTF Upsampling and Personalization
  749. NLSIT: A Non-Local Stereo Interaction Transformer for Stereo Image Super-Resolution
  750. NOLACE: Improving Low-Complexity Speech Codec Enhancement Through Adaptive Temporal Shaping
  751. NOMAD: Unsupervised Learning of Perceptual Embeddings For Speech Enhancement and Non-Matching Reference Audio Quality Assessment
  752. NPRF: Neural Painted Radiosity Fields for Neural Implicit Rendering and Surface Reconstruction
  753. NTT Speaker Diarization System for Chime-7: Multi-Domain, Multi-Microphone end-to-end and Vector Clustering Diarization
  754. NWS: Natural Textual Backdoor Attacks Via Word Substitution
  755. Natural Language Supervision For General-Purpose Audio Representations
  756. NeRI: Implicit Neural Representation of LiDAR Point Cloud Using Range Image Sequence
  757. NeXt-TDNN: Modernizing Multi-Scale Temporal Convolution Backbone for Speaker Verification
  758. Near-Field Localization with 1-bit Quantized Hybrid A/D Reception
  759. Near-Field MIMO Channel Reconstruction Via Limited Geometry Feedback
  760. Near-Field Neural Rendering Guided by Single-Shot Photometric Stereo
  761. Nebnet: Exploiting Node-Edge Bi-Level Network for Gene Expression Prediction
  762. Neighborhood-Enhanced Multimodal Collaborative Filtering for Item Cold Start Recommendation
  763. Neural Ambisonics Encoding For Compact Irregular Microphone Arrays
  764. Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
  765. Neural Network Training Strategy To Enhance Anomaly Detection Performance: A Perspective On Reconstruction Loss Amplification
  766. Neural Network-Based Symbolic Regression for Empirical Modeling of the Behavior of a Planetary Gearbox
  767. Neural Network-Based Virtual Microphone Estimation with Virtual Microphone and Beamformer-Level Multi-Task Loss
  768. Neural Ordinary Differential Equations with Trainable Solvers
  769. Neural Speaker Diarization Using Memory-Aware Multi-Speaker Embedding with Sequence-to-Sequence Architecture
  770. Neural Stochastic Differential Equations with Change Points: A Generative Adversarial Approach
  771. Neural2speech: A Transfer Learning Framework for Neural-Driven Speech Reconstruction
  772. NeuroHeed+: Improving Neuro-Steered Speaker Extraction with Joint Auditory Attention Detection
  773. Neuromorphic Sensing Meets Unlimited Sampling
  774. New Intent Discovery with Multi-View Clustering
  775. Newtonalized Orthogonal Matching Pursuit for Mixed Far-Field and Near-Field Source Localization
  776. Noise Masking Attacks and Defenses for Pretrained Speech Models
  777. Noise-Aware Speech Separation with Contrastive Learning
  778. Noise-BERT: A Unified Perturbation-Robust Framework with Noise Alignment Pre-Training for Noisy Slot Filling Task
  779. Noise-Disentangled Graph Contrastive Learning via Low-Rank and Sparse Subspace Decomposition
  780. Noise-Resistant Graph Neural Network for Node Classification
  781. Noise-Robust DSP-Assisted Neural Pitch Estimation With Very Low Complexity
  782. Noise-Robust Zero-Shot Text-to-Speech Synthesis Conditioned on Self-Supervised Speech-Representation Model with Adapters
  783. Noise2one: One-Shot Image Denoising with Local Implicit Learning
  784. Noisy Image Restoration Based on Conditional Acceleration Score Approximation
  785. Noisy-Arcmix: Additive Noisy Angular Margin Loss Combined With Mixup For Anomalous Sound Detection
  786. Non Commutative Convolutional Signal Models in Neural Networks: Stability to Small Deformations
  787. Non-Intrusive Speech Intelligibility Prediction for Hearing-Impaired Users Using Intermediate ASR Features and Human Memory Models
  788. Non-Intrusive Speech Quality Assessment with Multi-Task Learning Based on Tensor Network
  789. Non-Stationary Bandits with Periodic Behavior: Harnessing Ramanujan Periodicity Transforms to Conquer Time-Varying Challenges
  790. Non-Uniform Frequency Spacing for Regularization-Free Gridless DOA
  791. Non-iterative Pyramid Network for Unsupervised Deformable Medical Image Registration
  792. Nonasymptotic Performance Limits of Low-Latency Secure Integrated Sensing and Communication Systems
  793. Nonlinearity Detection and Compensation for EEG-Based Speech Tracking
  794. Normalization is All You Need: Robust Full-Range Contactless SpO2 Estimation Across Users
  795. Novel Architecture of Deep Feature-Based Gaussian Processes with an Ensemble of Kernels
  796. Nuclear-Norm Maximization for Low-Rank Updates
  797. OADAS: Optimizing Global Perturbation Attacks with Dual-Path Attribution Synergy
  798. OFDM Waveform Design with Good Correlation Level and Peak-to-Mean Envelope Power Ratio for the Joint MIMO Radar And Communications
  799. OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
  800. Object Correlation Matrix for Two-Stage Object Detection Network
  801. Object Detection Oriented Privacy-Preserving Frame-Level Video Anomaly Detection
  802. Object Trajectory Estimation with Multi-Band Wi-Fi Neural Dynamic Fusion
  803. Object-Conditioned Bag of Instances for Few-Shot Personalized Instance Recognition
  804. Odaq: Open Dataset of Audio Quality
  805. Offline Reinforcement Learning Based on Next State Supervision
  806. Offline Reinforcement Learning with Generative Adversarial Networks and Uncertainty Estimation
  807. Offline Reinforcement Learning with Policy Guidance and Uncertainty Estimation
  808. Omnidirectional Multi-Rotor Aerial Vehicle Pose Optimization: A Novel Approach to Physical Layer Security
  809. On Estimating Link Prediction Uncertainty Using Stochastic Centering
  810. On Fine-Tuning Pre-Trained Speech Models With EMA-Target Self-Supervised Loss
  811. On Generalized Signature Graphs
  812. On HRTF Notch Frequency Prediction using Anthropometric Features and Neural Networks
  813. On Improved Distributed Random Reshuffling over Networks
  814. On Optimizing Timesteps of an EDM Based Diffusion Sampling Procedure
  815. On Real-Time Multi-Stage Speech Enhancement Systems
  816. On The Choice of the Optimal Temporal Support for Audio Classification with Pre-Trained Embeddings
  817. On The Effect Of Data-Augmentation On Local Embedding Properties In The Contrastive Learning Of Music Audio Representations
  818. On The Equivalence Of Dynamic Mode Decomposition And Complex Nonnegative Matrix Factorization
  819. On The Resilience Of Online Federated Learning To Model Poisoning Attacks Through Partial Sharing
  820. On The Role of Room Acoustics in Audio Presentation Attack Detection
  821. On Time-Encoded Sampling for Multigenerator Shift Invariant Spaces
  822. On Unique Localization of Uncorrelated Constant-Modulus Sources Using Sparse Linear Arrays
  823. On the Convergence of Hierarchical Federated Learning with Gradient Quantization and Imperfect Transmission
  824. On the Convergence of Single-Timescale Multi-Sequence Stochastic Approximation Without Fixed Point Smoothness
  825. On the Design of Planar Differential Microphone Arrays with Specified Beamwidth or Sidelobe Level
  826. On the Generalization Error of Byzantine-Resilient Decentralized Learning
  827. On the Importance of Neural Wiener Filter for Resource Efficient Multichannel Speech Enhancement
  828. On the Open Prompt Challenge in Conditional Audio Generation
  829. On the Privacy of Federated Clustering: a Cryptographic View
  830. On the Relation Between Internal Language Model and Sequence Discriminative Training for Neural Transducers
  831. On the Tradeoff Between Privacy Preservation and Byzantine-Robustness in Decentralized Learning
  832. On-Device Constrained Self-Supervised Learning for Keyword Spotting via Quantization Aware Pre-Training and Fine-Tuning
  833. One Model to Rule Them All ? Towards End-to-End Joint Speaker Diarization and Speech Recognition
  834. One-Class Knowledge Distillation for Spoofing Speech Detection
  835. One-Epoch Training with Single Test Sample in Test Time for Better Generalization of Cough-Based Covid-19 Detection Model
  836. One-Shot Sensitivity-Aware Mixed Sparsity Pruning for Large Language Models
  837. One-Stage Deep Stereo Network
  838. One-Stage Training Generative Paradigm for Generalized Zero-Shot Learning
  839. One-Step Late Fusion Multi-View Clustering with Compressed Subspace
  840. One-bit Quantization Robust to Angle-of-Arrivals for Uniform Linear Antenna Array
  841. Online Auditing of Information Flow
  842. Online Caching With Switching Cost and Operational Long-Term Constraints: An Online Learning Approach
  843. Online Mouse Behavior Detection by Historical Dependency and Typical Instances
  844. Online Speaker Diarization of Meetings Guided by Speech Separation
  845. Online Target Sound Extraction with Knowledge Distillation from Partially Non-Causal Teacher
  846. Open-Set Deepfake Detection To Fight The Unknown
  847. Open-Vocabulary Keyword-Spotting with Adaptive Instance Normalization
  848. Open-Vocabulary Skeleton Action Recognition with Diffusion Graph Convolutional Network and Pre-Trained Vision-Language Models
  849. OpenTE: Open-Structure Table Extraction From Text
  850. Opine: Leveraging a Optimization-Inspired Deep Unfolding Method for Multi-Channel Speech Enhancement
  851. Opnet: Deep Occlusion Perception Network with Boundary Awareness for Amodal Instance Segmentation
  852. Optimal ANN-SNN Conversion with Group Neurons
  853. Optimal Beamforming Structure for Rate Splitting Multiple Access
  854. Optimal Ber Minimum Precoder Design for OTFS-Based ISAC Systems
  855. Optimal Structure of Receive Beamforming for over-The-Air Computation
  856. Optimal Transport Distances for Directed, Weighted Graphs: A Case Study With Cell-Cell Communication Networks
  857. Optimizing Synchronization Delay for Digital Twin over Wireless Networks
  858. Optimizing Trading Strategies in Quantitative Markets Using Multi-Agent Reinforcement Learning
  859. Optimizing k in kNN Graphs with Graph Learning Perspective
  860. Out-of-Distribution Detection for Learning-Based Chest X-Ray Diagnosis
  861. Outlier-Robust Feature Selection with ℓ2, 1-Norm Minimization and Group Row-Sparsity Induced Constraints
  862. P2DT: Mitigating Forgetting in Task-Incremental Learning with Progressive Prompt Decision Transformer
  863. PAVITS: Exploring Prosody-Aware VITS for End-to-End Emotional Voice Conversion
  864. PECER: Empathetic Response Generation Via Dynamic Personality Extraction and Contextual Emotional Reasoning
  865. PECR: Parameter-Efficient Transfer Learning with Cross-Modal Representation Learning for Remote Sensing Visual Question Answering
  866. PFCF-Net: A Network Based on Progressive Feature Interaction and Cross-Scale Feature Fusion for Remote Sensing Change Detection
  867. PFDM: Parser-Free Virtual Try-On via Diffusion Model
  868. PHYOT: Physics-Informed Object Tracking in Surveillance Cameras
  869. PJSCC: A Puncturing-Based Joint Source Channel Coding Scheme with Hierarchical Down-Sampling Layer
  870. PLS: Unsupervised Domain Adaptation for 3d Object Detection Via Pseudo-Label Sizes
  871. PMDI: Combining Parametric-Model and Depth-Aware Implicit Function for Single-View Human Reconstruction
  872. PN-DetX: A Dedicated Framework for Pulmonary Nodule Detection in X-Ray Images
  873. POSE-HMR: Heuristic Transformer with Postural Prior Constraints for 3D Human Mesh Reconstruction
  874. PVCG: Prompt-Based Vision-Aware Classification and Generation for Multi-Modal Rumor Detection
  875. PVitNet: An Effective Approach for Android Malware Detection Using Pyramid Feature Processing and Vision Transformer
  876. PaCaS-WAA: Patch-Based Contrastive Semi-Supervised Learning with Wavelet Guidance and Adaptive Augmentation for Tumour Segmentation
  877. Panoramic Image Inpainting with Gated Convolution and Contextual Reconstruction Loss
  878. Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
  879. Parallel Augmentation and Dual Enhancement for Occluded Person Re-Identification
  880. Parameter Efficient Audio Captioning with Faithful Guidance Using Audio-Text Shared Latent Representation
  881. Parameter Efficient Finetuning for Speech Emotion Recognition and Domain Adaptation
  882. Parameter Estimation Via Expectation Maximization - Expectation Consistent Algorithm
  883. Parameter-Efficient Adaptation for Computational Imaging
  884. Pareto Graph Self-Supervised Learning
  885. Parody Detection Using Source-Target Attention with Teacher-Forced Lyrics
  886. Part Representation Learning with Teacher-Student Decoder for Occluded Person Re-Identification
  887. Partial Convolutional Based-Radio Map Reconstruction for Urban Environments with Inaccessible Areas
  888. Partially Observable Model-Based Learning FOR ISAC Resource Allocation
  889. Paste and Harmonize via Denoising: Subject-Driven Image Editing with Frozen Pre-Trained Diffusion Model
  890. Patch-Level Knowledge Distillation and Regularization for Missing Modality Medical Image Segmentation
  891. Patient-Adaptive and Learned Mri Data Undersampling Using Neighborhood Clustering
  892. Perceiving Multi-Layer Representations for No-reference Image Quality Assessment
  893. Perceptual Quality Evaluation for Faster Playback Videos
  894. Perceptually-Motivated Spatial Audio Codec for Higher-Order Ambisonics Compression
  895. Performance Conditioning for Diffusion-Based Multi-Instrument Music Synthesis
  896. Performance and Energy Balance: A Comprehensive Study of State-of-the-Art Sound Event Detection Systems
  897. Periocular Biometrics Enhancement Through Multimodal Embeddings And Classifier Adaptation
  898. PeriodGrad: Towards Pitch-Controllable Neural Vocoder Based on a Diffusion Probabilistic Model
  899. Permutation-Alignment Method Using Manifold Optimization for Frequency-Domain Blind Source Separation
  900. Persona Extraction Through Semantic Similarity for Emotional Support Conversation Generation
  901. Personalization of CTC-Based End-to-End Speech Recognition Using Pronunciation-Driven Subword Tokenization
  902. Personalized Federated Learning with Attention-Based Client Selection
  903. Personalized Local Differentially Private Federated Learning with Adaptive Client Sampling
  904. Personalized Neural Speech Codec
  905. Personalized Over-The-Air Federated Learning with Personalized Reconfigurable Intelligent Surfaces
  906. PhISANet: Phonetically Informed Speech Animation Network
  907. Phase Continuity-Aware Self-Attentive Recurrent Network with Adaptive Feature Selection for Robust VAD
  908. Phase Learning Based on Interactive Perception for Limited-Sample Residential Area Semantic Segmentation
  909. Phase Reconstruction in Single Channel Speech Enhancement Based on Phase Gradients and Estimated Clean-Speech Amplitudes
  910. Phase Retrieval by Tensor Total Least Squares
  911. Phase-Space-Guided Deep Learning For Time Series Forecasting
  912. Phoneme-Aware Encoding for Prefix-Tree-Based Contextual ASR
  913. Photovoltaic Power Forecasting Using Sky Images and Sun Motion
  914. Physically-Constrained Block-Term Tensor Decomposition for Polarimetric Image Recovery
  915. Physics-Guided Variational Graph Autoencoder For Air Quality Inference
  916. Piano Transcription with Harmonic Attention
  917. Pilot Length Minimization via AP-UE Clustering in Cell-Free Systems
  918. Pixel-Superpixel Contrastive Learning and Pseudo-Label Correction for Hyperspectral Image Clustering
  919. Plug-And-Play Algorithm Coupled with Low-Rank Quadratic Envelope Regularization for Compressive Spectral Imaging
  920. Plug-and-Play MVDR Beamforming for Speech Separation
  921. Pmmwdeconv: Unsupervised Data-Consistent Blind Passive Millimeterwave Image Deconvolution with Global Context Priors
  922. PoisonPrompt: Backdoor Attack on Prompt-Based Large Language Models
  923. Poisoning-Free Defense Against Black-Box Model Extraction
  924. PolarDB: Formula-Driven Dataset for Pre-Training Trajectory Encoders
  925. Political Tweet Sentiment Analysis for Public Opinion Polling
  926. Position-Aware Active Learning for Multi-Modal Entity Alignment
  927. Positive Transfer of the Whisper Speech Transformer to Human and Animal Voice Activity Detection
  928. Post-Training Embedding Alignment for Decoupling Enrollment and Runtime Speaker Recognition Models
  929. Posterior Sampling Algorithms for Unsupervised Speech Enhancement with Recurrent Variational Autoencoder
  930. Posterior Variance-Parameterised Gaussian Dropout: Improving Disentangled Sequential Autoencoders for Zero-Shot Voice Conversion
  931. Power-Aware Task-Based Learning of Neuromorphic ADCs
  932. Practical Challenge and Solution for IRS-Aided Indoor Localization System
  933. Pre-Echo Reduction in Transform Audio Coding via Temporal Envelope Control with Machine Learning Based Estimation
  934. Pre-Post Interaction Learning for Brain Tumor Segmentation with Missing MRI Modalities
  935. Pre-Trained Acoustic-and-Textual Modeling for End-To-End Speech-To-Text Translation
  936. Predict and Interpret Health Risk Using Ehr Through Typical Patients
  937. Predicting Adverse Events for Patients with Type-1 Diabetes Via Self-Supervised Learning
  938. Predicting Fall Events by a Spatio-Temporal Topological Network with Multiple Wearable Sensors
  939. Predicting RTMS Treatment Effects Using Open-Loop Control and Neural Manifold
  940. Prediction-Correction Line Segment Detection
  941. Prioritizing Data Acquisition for end-to-end Speech Model Improvement
  942. Privacy Leakage In Graph Signal To Graph Matching Problems
  943. Privacy Preserving Federated Learning from Multi-Input Functional Proxy Re-Encryption
  944. Privacy Preserving Gaze Estimation Via Federated Learning Adapted To Egocentric Video
  945. Privacy-Aware Joint Source-Channel Coding For Image Transmission Based On Disentangled Information Bottleneck
  946. Privacy-Preserving Attention-Weighted Multi-Source Domain Adaptation for EEG Motor Imagery
  947. Privacy-Preserving Deep Learning Using Deformable Operators for Secure Task Learning
  948. Privacy-Preserving Distributed Optimisation using Stochastic PDMM
  949. Pro-HAN: A Heterogeneous Graph Attention Network for Profile-based Spoken Language Understanding
  950. ProAug: Prototype-Based Augmentation for Long-Tailed Image Classification
  951. ProbMCL: Simple Probabilistic Contrastive Learning for Multi-Label Visual Classification
  952. Probabilistic Simplex Component Analysis via Variational Auto-Encoding
  953. Probabilistic Spike Train Inference
  954. Probability-Aware Word-Confusion-Network-To-Text Alignment Approach for Intent Classification
  955. Profile-Error-Tolerant Target-Speaker Voice Activity Detection
  956. Progressive Image Synthesis from Semantics to Details with Denoising Diffusion GAN
  957. Progressive Learning Based Knowledge Distillation for Low Resolution Cerebral Microbleed Segmentation
  958. Progressive Unsupervised Domain Adaptation for ASR Using Ensemble Models and Multi-Stage Training
  959. Progressively Learning from Macro-Expressions for Micro-Expression Recognition
  960. Promoting Independence of Depression and Speaker Features for Speaker Disentanglement in Speech-Based Depression Detection
  961. Prompt-Based Personalized Federated Learning for Medical Visual Question Answering
  962. Prompt-Driven Target Speech Diarization
  963. PromptASR for Contextualized ASR with Controllable Style
  964. PromptTTS++: Controlling Speaker Identity in Prompt-Based Text-To-Speech Using Natural Language Descriptions
  965. Promptformer: Prompted Conformer Transducer for ASR
  966. Prompting Audios Using Acoustic Properties for Emotion Representation
  967. Prompting Large Language Models with Fine-Grained Visual Relations from Scene Graph for Visual Question Answering
  968. Prompting Large Language Models with Speech Recognition Abilities
  969. Prompting to Prompt for Rehearsal-Free Class Incremental Learning
  970. Promptvc: Flexible Stylistic Voice Conversion in Latent Space Driven by Natural Language Prompts
  971. Proposal Distillation of Multi-Modal Feature Aggregation Network for Video Object Detection
  972. Prototype Calibration with Synthesized Samples for Zero-Shot Chinese Character Recognition
  973. Prototype-Guided Masking for Unsupervised Domain Adaptation
  974. Provable Randomized Coordinate Descent for Matrix Completion
  975. Proximal Bellman Mappings for Reinforcement Learning and Their Application to Robust Adaptive Filtering
  976. PseKD: Phase-Shift Encoded Knowledge Distillation for Oriented Object Detection in Remote Sensing Images
  977. Pseudo Labels Regularization for Imbalanced Partial-Label Learning
  978. Pseudo-Outlier Synthesis Using Q-Gaussian Distributions for Out-of-Distribution Detection
  979. Pu-Edgeformer++: An Advanced Hierarchical Edge Transformer for Arbitrary-Scale Point Cloud Upsampling using Distance Fields
  980. Push4Rec: Temporal and Contextual Trend-Aware Transformer Push Notification Recommender
  981. Pyramid: A Heterogeneous Data Integration Algorithm Based on Hierarchical Graph
  982. QUAPPROX: A Framework for Benchmarking the Approximability of Variational Quantum Circuit
  983. Quantifying Spatial Audio Quality Impairment
  984. Quantifying The Effect Of Simulator-Based Data Augmentation For Speech Recognition On Augmented Reality Glasses
  985. Quantization Noise Masking in Perceptual Neural Audio Coder
  986. Quantized Decoder in Learned Image Compression for Deterministic Reconstruction
  987. Quantum Federated Learning with Quantum Networks
  988. Quantum Inspired Image Augmentation Applicable to Waveguides and Optical Image Transfer Via Anderson Localization
  989. Quantum Privacy Aggregation of Teacher Ensembles (QPATE) for Privacy Preserving Quantum Machine Learning
  990. Quantum Ranging Enhanced TDoA Localization
  991. Quantum Topic Model: Topic Modeling Using Variational Quantum Circuits
  992. RCIF: Towards Robust Distributed DNN Collaborative Inference Under Highly Lossy Networks
  993. RD-NERF: Neural Robust Distilled Feature Fields for Sparse-View Scene Segmentation
  994. RD-cost Regression Speed Up Technique for VVC Intra Block Partitioning
  995. RDANet: Reject Domain Attention Network For Confused Facial Expression Recognition
  996. REGIR: Refined Geometry for Single-Image Implicit Clothed Human Reconstruction
  997. RGB Images Enhancing Hyperspectral Image Denoising with Diffusion Model
  998. RIS Localization and Spatially Wideband Filtering Effects
  999. RK-CORE: An Established Methodology for Exploring the Hierarchical Structure within Datasets
  1000. RL-EMO: A Reinforcement Learning Framework for Multimodal Emotion Recognition

Looking for submission deadlines instead? See the conference deadline calendar.