Saber a direção não basta: é preciso decidir quanto andar. O gradiente descendente usa a regra \(w_{novo} = w_{atual} - \eta \cdot \frac{dL}{dw}\), em que \(\eta\) é a taxa de aprendizado. Essa taxa multiplica o gradiente e define o tamanho do passo em cada iteração.
A escolha de \(\eta\) muda o comportamento do treinamento. Com uma taxa muito pequena, cada passo corrige pouco o parâmetro: a perda cai de forma suave, mas são necessárias muitas iterações para chegar perto do mínimo, e o tempo de treinamento cresce. Com uma taxa adequada, a perda cai de forma rápida e estável até se estabilizar perto do mínimo. Com uma taxa grande demais, o passo ultrapassa o fundo do vale e cai do outro lado, em um ponto com perda maior; repetindo isso, os valores oscilam de um lado para o outro e a perda pode até crescer sem limite, um caso de divergência.
Existe ainda um efeito de forma da curva. Em vales estreitos e alongados, um passo grande demais na direção mais inclinada provoca oscilações fortes, enquanto a direção menos inclinada avança devagar. Por isso, na prática, a taxa de aprendizado costuma ser ajustada por tentativa, observando a curva de perda: se ela oscila ou sobe, a taxa está alta; se cai muito lentamente, está baixa.