🧠 Adam Optimization · 3D Core Math

Loss surface · Parameter trajectory · 1st moment (momentum) · 2nd moment (adaptive scale)

⚙️ Hyperparameters
Step size. Too high → divergence. Too low → slow convergence.
Momentum decay. Controls the exponential moving average of the gradient. Default 0.9.
Adaptive scale decay. Controls the moving average of squared gradients. Default 0.999.
Step interval. Higher = slower, easier to observe.
Trajectory Momentum (1st moment m) Adaptive scale (√v) Gradient ∇f
Iteration
0 / 60
Current η
0.12