2 pages tagged

#pretraining

chinchilla-scaling concept Compute-optimal data/params rule; models over-train past it; FLOPs, not params, predict quality. pretraining concept Floor not ceiling; tokenizer/context/multimodal commitments lock in here; pretraining = RL priors.
esc