A propagação para a frente calcula a previsão, e a função de perda mede o quanto ela se afastou do valor esperado. O problema é que esse erro aparece apenas na saída: os pesos das camadas iniciais não têm acesso direto a ele. A retropropagação resolve isso aplicando a regra da cadeia do cálculo, que permite decompor a variação do erro em relação a um peso distante em uma sequência de fatores, um por camada atravessada.
O procedimento percorre a rede de trás para frente. Primeiro calcula-se quanto o erro varia em relação à saída. Depois, quanto essa variação depende dos pesos da última camada. Em seguida, o mesmo raciocínio é aplicado à camada anterior, usando o que já foi calculado na camada seguinte. Cada camada reutiliza o resultado da camada posterior, o que evita recalcular tudo do zero e torna o custo do treinamento proporcional ao tamanho da rede.
Ao final, cada peso recebe um número que indica sua contribuição para o erro. Esse número alimenta a atualização: o peso é corrigido na direção que reduz o erro, e o ciclo recomeça com um novo lote de exemplos. A retropropagação não decide o tamanho do passo nem garante que o resultado seja bom; ela apenas fornece a informação de direção que o ajuste precisa para todas as camadas ao mesmo tempo.