Um modelo com bom desempenho no treino e ruim na validação quase sempre sofre de sobreajuste: ele tem capacidade suficiente para memorizar particularidades dos exemplos, mas essas particularidades não se repetem em dados novos. A correção não é treinar mais tempo, e sim reduzir a liberdade do modelo ou aumentar a variedade de experiência: coletar mais dados, obter exemplos mais diversos, restringir a complexidade da função aprendida ou aplicar regularização, que penaliza soluções excessivamente ajustadas. Um modelo com erro alto tanto no treino quanto na validação sofre de subajuste: ele é simples demais para representar a regularidade do problema. Aqui a correção é oposta — aumentar a capacidade, acrescentar atributos informativos ou treinar por mais tempo. Existe ainda o caso em que o erro de treino é alto e o de validação é ainda maior, com pouca diferença entre eles: o problema costuma estar nos dados, não no modelo. Dados insuficientes, mal medidos ou pouco representativos limitam qualquer arquitetura. A decisão prática segue o diagnóstico: sobreajuste pede mais dados ou mais restrição; subajuste pede mais capacidade ou melhores atributos; dados ruins pedem coleta e limpeza antes de qualquer mudança no modelo.
Como a Inteligência Artificial Realmente Aprende
Avaliar, diagnosticar e melhorar o aprendizado
Diagnosticar a falha antes de escolher a correção
2 / 2
Comece com complexidade baixa e poucos dados. Os dois erros ficam altos e próximos: é subajuste, o modelo é simples demais. Agora aumente a complexidade sem mexer nos dados. O erro de treino despenca, mas o de validação sobe: o modelo passou a memorizar particularidades. Esse é o sobreajuste. Por fim, mantenha a complexidade alta e aumente a quantidade de dados. Observe que as duas curvas voltam a se aproximar, porque mais experiência reduz o espaço para memorização. O diagnóstico vem da forma das curvas, e cada forma aponta para uma ação diferente.
0:00 / 0:00