O que separa os paradigmas de aprendizado não é a arquitetura do modelo nem o algoritmo de ajuste, mas o tipo de informação que orienta esse ajuste. No aprendizado supervisionado, cada exemplo vem acompanhado de uma saída desejada, o rótulo. O modelo aprende uma função que mapeia entrada em saída e é avaliado pela diferença entre a previsão e o rótulo. Exemplos típicos são classificação — decidir se uma mensagem é spam ou não — e regressão — estimar o preço de um imóvel.
No aprendizado não supervisionado, os exemplos chegam sem rótulo. Não existe resposta correta a comparar com a previsão, então o sinal de ajuste vem da própria estrutura dos dados: proximidade entre pontos, densidade, variância explicada. O objetivo é descrever essa estrutura — agrupar clientes com comportamento semelhante, reduzir muitas variáveis a poucas dimensões latentes, detectar pontos que fogem do padrão.
No aprendizado por reforço, também não há rótulo por exemplo. Um agente observa um estado, escolhe uma ação, e o ambiente devolve um novo estado e uma recompensa. O sinal de ajuste é a recompensa acumulada ao longo do tempo, e a dificuldade central é que uma ação só pode ser julgada pelas consequências que ela produz mais tarde. Aprender a jogar um jogo ou controlar um robô são casos desse tipo.
Os três paradigmas não são exclusivos entre si. Um sistema pode usar aprendizado não supervisionado para construir representações e aprendizado supervisionado para a decisão final, ou usar reforço com um modelo supervisionado interno. O critério prático é sempre o mesmo: qual sinal está disponível para dizer ao modelo se ele está indo na direção certa.