← Search

Baiyu Su

3 accepted papers

2026

DeMo: Decoupled Momentum Optimization

ICLR 2026poster

Scaling neural network training increasingly depends on synchronous data-parallelism, yet full-precision gradient all-reduce imposes a severe communication bottleneck. We propose Decoupled Momentum Optimization, a drop-in replacement for any momentum-based optimizers that significantly reduces the c…

Cited by 0SourcecodeScholar