← Search

Martin Beracochea

1 accepted papers

2025

The OMG dataset: An Open MetaGenomic corpus for mixed-modality genomic language modeling

ICLR 2025poster

Biological language model performance depends heavily on pretraining data quality, diversity, and size. While metagenomic datasets feature enormous biological diversity, their utilization as pretraining data has been limited due to challenges in data accessibility, quality filtering and deduplicatio…

Cited by 49SourcePDFScholar