← Search

Zeyu Xie

6 accepted papers

2025

PicoAudio: Enabling Precise Temporal Controllability in Text-to-Audio Generation

ICASSP 2025accepted

Recently, audio generation tasks have attracted considerable research interests. Despite rapid advancements in generating high-fidelity audio that is coarsely aligned with the text description, precise temporal controllability is still a challenge, which is essential to integrate audio generation wi…

Cited by 0SourceScholar
2024

A Detailed Audio-Text Data Simulation Pipeline Using Single-Event Sounds

ICASSP 2024accepted

Recently, there has been an increasing focus on audio-text cross-modal learning. However, most of the existing audio-text datasets contain only simple descriptions of sound events. Compared with classification labels, the advantages of such descriptions are significantly limited. In this paper, we f…

Cited by 0SourceScholar
2022

Can Audio Captions Be Evaluated With Image Caption Metrics?

ICASSP 2022accepted

Automated audio captioning aims at generating textual descriptions for an audio clip. To evaluate the quality of generated audio captions, previous works directly adopt image captioning metrics like SPICE and CIDEr, without justifying their suitability in this new domain, which may mislead the devel…

Cited by 0SourceScholar
2021

Investigating Local and Global Information for Automated Audio Captioning with Transfer Learning

ICASSP 2021accepted

Automated audio captioning (AAC) aims at generating summarizing descriptions for audio clips. Multitudinous concepts are described in an audio caption, ranging from local information such as sound events to global information like acoustic scenery. Currently, the mainstream paradigm for AAC is the e…

Cited by 0SourceScholar