TL;DROptimizers like SGD, Adam, and AdamW improve on plain gradient descent.
Beyond vanilla SGD, momentum accelerates consistent directions and damps oscillation; Adam adapts a per-parameter learning rate using gradient statistics (fast, robust, the common default); AdamW fixes Adam's weight-decay handling and is standard for training transformers. The optimizer shapes how fast and how well you converge — Adam/AdamW are safe starting points.