Um neurônio artificial recebe um conjunto de entradas numéricas, multiplica cada entrada por um peso, soma os produtos e acrescenta um viés. O resultado passa por uma função de ativação, que produz a saída da unidade. Em notação compacta, para entradas \(x_1, x_2, \dots, x_n\), pesos \(w_1, w_2, \dots, w_n\) e viés \(b\), a unidade calcula \(z = \sum_{i=1}^{n} w_i x_i + b\) e depois \(a = f(z)\), em que \(f\) é a função de ativação.
Uma camada é um conjunto dessas unidades que recebem as mesmas entradas e produzem saídas diferentes, porque cada uma tem seus próprios pesos. Empilhando camadas, a saída de uma camada vira a entrada da seguinte. A primeira camada trabalha diretamente sobre os dados; as camadas seguintes trabalham sobre a representação construída pela anterior. É essa composição que caracteriza uma rede neural: a rede não aplica uma regra única aos dados brutos, ela transforma os dados em etapas.
A função de ativação precisa ser não linear. Se cada unidade apenas somasse entradas ponderadas, a composição de duas camadas seria equivalente a uma única transformação linear, e a rede profunda teria o mesmo poder de representação de um modelo linear simples. A não linearidade é o que permite que a composição de camadas represente funções que uma única camada não representa.