arxiv.org
Muon Dynamics as a Spectral Wasserstein Flow
Gradient normalization is central in deep-learning optimization because it stabilizes training and reduces sensitivity to scale. For deep architectures, parameters are naturally grouped into matrices ...