2 pages tagged
#pretraining
chinchilla-scaling
concept
Compute-optimal data/params rule; models over-train past it; FLOPs, not params, predict quality.
pretraining
concept
Floor not ceiling; tokenizer/context/multimodal commitments lock in here; pretraining = RL priors.
esc