Redes Neurais Convolucionais (CNNs) são a arquitetura padrão para processamento de imagens e visão computacional. O componente central é a operação de convolução, onde um pequeno filtro (kernel) desliza sobre a imagem, realizando multiplicações ponto a ponto e somando os resultados para produzir um mapa de características.
Cada kernel aprende a detectar padrões específicos: bordas, texturas, formas ou objetos mais complexos. O stride controla o passo do kernel, enquanto o padding adiciona bordas à imagem para preservar dimensões. Após cada camada convolucional, operações de pooling reduzem a resolução espacial, diminuindo a quantidade de parâmetros e aumentando a robustez a pequenas variações na posição dos objetos. Esta hierarquia de características permite que CNNs reconheçam objetos complexos a partir de padrões simples.
Stride
Passo do kernel ao percorrer a imagem.
Padding
Bordas para preservar dimensões.
Pooling
Reduz dimensão mantendo características importantes.