← Search

Yunchang Ma

1 accepted papers

2025

Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning

IROS 2025

In offline reinforcement learning, value overestimation caused by out-of-distribution (OOD) actions significantly limits policy performance. Recently, diffusion models have been leveraged for their strong distribution-matching capabilities, enforcing conservatism through behavior policy constraints.

Cited by 0SourceScholar