A função de perda converte a diferença entre previsão e valor esperado em um único número, e é esse número que informa ao treinamento se o modelo está melhorando e em que direção corrigir.
Um caso numérico
Suponha um modelo que estima o preço de um imóvel e prevê 300 mil para uma casa cujo valor real é 320 mil. O desvio é de 20 mil. Com a perda quadrática, \(L = (300 - 320)^2 = 400\). Se a previsão fosse 310 mil, o desvio cairia para 10 mil e a perda seria \(L = 100\). Repare que reduzir o desvio pela metade reduziu a perda a um quarto: o quadrado pune desvios grandes com muito mais força do que desvios pequenos.
Por que a média, e não um exemplo
Se o ajuste olhasse apenas para o último exemplo visto, ele poderia corrigir os parâmetros em uma direção que piora o desempenho em todos os outros. Por isso o treinamento acompanha a perda média sobre o conjunto de treino. Essa média é mais estável e reflete o comportamento do modelo como um todo, não o acaso de um caso isolado.
Perda baixa no conjunto de treino não garante que o modelo aprendeu bem. Ela indica apenas que o modelo se ajustou aos exemplos que viu. Se o objetivo é acertar em dados novos, essa medida precisa ser confrontada com dados que o modelo não usou durante o treinamento.