A função de perda depende dos parâmetros do modelo. Se imaginarmos um único parâmetro \(w\), a perda \(L(w)\) pode ser desenhada como uma curva: no eixo horizontal o valor de \(w\), no eixo vertical o valor da perda. Em cada ponto dessa curva existe uma inclinação, e essa inclinação é o gradiente naquele ponto, escrito \(\frac{dL}{dw}\).
O sinal do gradiente diz o que acontece se aumentarmos \(w\). Se \(\frac{dL}{dw} > 0\), aumentar \(w\) faz a perda subir; logo, diminuir \(w\) faz a perda cair. Se \(\frac{dL}{dw} < 0\), aumentar \(w\) faz a perda cair. Em ambos os casos, mover \(w\) no sentido oposto ao do gradiente reduz a perda. O módulo do gradiente indica a intensidade dessa subida: quanto maior, mais inclinada é a região e maior é o ganho potencial ao corrigir o parâmetro.
Quando o gradiente se aproxima de zero, a curva fica quase plana e o parâmetro está perto de um ponto de mínimo, onde pequenas mudanças em \(w\) quase não alteram a perda. Com muitos parâmetros, a mesma ideia se repete: existe uma componente do gradiente para cada parâmetro, e o vetor formado por todas elas aponta a direção de maior aumento da perda no espaço de parâmetros. Seguir o sentido oposto a esse vetor é a direção de descida mais íngreme disponível naquele ponto.