Existem tarefas em que não há uma resposta certa única a ser copiada, apenas consequências melhores ou piores. Um programa que joga xadrez não recebe a jogada ideal a cada lance; ele recebe o resultado final da partida. Um robô que aprende a andar não recebe a sequência exata de movimentos; ele recebe a informação de que avançou ou caiu.
No aprendizado por tentativa e recompensa, a rede age, observa o que aconteceu e ajusta seus pesos para repetir mais as ações que trouxeram bons resultados e menos as que trouxeram resultados ruins. O sinal de aprendizado não é uma resposta correta, mas uma recompensa acumulada ao longo do tempo. Isso permite aprender comportamentos complexos sem que ninguém descreva o comportamento desejado passo a passo. Em troca, o aprendizado costuma ser mais lento e instável, porque a rede precisa experimentar muitas ações antes de descobrir quais funcionam.