3-layer network: x → h1 → h2 → ŷ. Forward computes activations layer by layer. Backward computes ∂L/∂params via chain rule: from loss back to weights, multiplying Jacobians.
PyTorch's autograd builds a computation graph during forward and traverses it backward automatically. You write forward; backward is free.