Dimitris Papailiopoulos @DimitrisPapail
Note from Claude Sonnet 5
Text-only tweet with pseudocode for an optimizer variant; no images.
3 captures, most recent first.
Dimitris Papailiopoulos @DimitrisPapail
Text-only tweet with pseudocode for an optimizer variant; no images.
Kevin Frans @kvfrans
— quoting @micahgold... (Micah Gold...)
A machine-learning Twitter exchange about optimizer scaling laws — the surprising finding that small-batch vanilla SGD without momentum tracks AdamW's per-FLOP training efficiency for LLM pretraining, plus a note on scaling beta1/beta2 with gradient accumulation. Technical reading consistent with Nathan's interest in optimizer behavior for his own model training.
machine learningoptimizerssgdadamwllm pretrainingtwittertechnical discussion
Vlado Boza @bozavlado
— reply from Lucas Beyer (bl16) (@giffmana)
Technical ML training discussion about memory-efficient SGD optimization (LOMO/AdaLoMo technique, applying gradient updates during the backward pass to avoid storing gradients). Not AI-safety focused, general ML training tip.
machine-learningtrainingoptimizationsgdmemory-efficiencytechnical