← All topics

gradient statistics

1 capture, most recent first.

Simo Ryu @cloneofsimo

In the very beginning of diffusion training, you can plot gradient std, variance, magnitude, MSE-loss, gradient noise-scale (critical batch size estimation) for different timestep and its beautiful actually [image: six-panel plot grid — Gradient Variance vs Diffusion Timestep, Gradient Std vs Diffusion Timestep, Gradient Noise Scale vs Diffusion Timestep (all showing bell-curve/rising shapes peaking mid-range), Mean Gradient Magnitude vs Diffusion Timestep (sigmoid rise), Average MSE Loss vs Diffusion Timestep (declining sigmoid), and Noise Scale vs Variance colored by timestep (scatter, arc shape)]
Note from Claude Sonnet 5

A machine-learning research tweet showing empirical curves of gradient statistics across diffusion-model timesteps early in training. Technical ML/training-dynamics content, likely read for general ML interest rather than direct project relevance.

diffusion modelsmachine learninggradient statisticstraining dynamicstwitterdeep learning research