A pergunta que decide o paradigma é: existe uma saída correta registrada para cada exemplo? Se sim, supervisionado. Se não, mas a estrutura dos dados interessa, não supervisionado. Se o resultado depende de uma sequência de ações, reforço.
Critérios de escolha
Supervisionado
- Cada exemplo tem rótulo conhecido
- Objetivo: prever a saída para entradas novas
- Sinal de ajuste: diferença entre previsão e rótulo
- Exemplos: classificar spam, estimar preço
Não supervisionado
- Nenhum exemplo tem rótulo
- Objetivo: descobrir estrutura nos dados
- Sinal de ajuste: proximidade, densidade, variância
- Exemplos: agrupar clientes, reduzir dimensões
Por reforço
- Não há resposta certa por exemplo
- Objetivo: maximizar recompensa acumulada
- Sinal de ajuste: recompensa após a ação
- Exemplos: jogos, controle de robô
Um sistema que usa os três
Considere um serviço de recomendação. Primeiro, um modelo não supervisionado agrupa usuários por padrão de consumo, sem rótulos. Depois, um modelo supervisionado aprende, a partir do histórico de cliques, a prever a probabilidade de um usuário clicar em um item. Por fim, um agente de reforço decide a ordem em que os itens são exibidos, recebendo recompensa quando o usuário permanece engajado. Cada etapa usa o sinal que está disponível naquele momento: estrutura, rótulo e recompensa.
Confusão frequente
Agrupamento e classificação não são sinônimos. Classificação é supervisionada: as categorias são conhecidas de antemão e servem de rótulo. Agrupamento é não supervisionado: as categorias são descobertas a partir dos dados, sem que ninguém as tenha definido antes.