A evolução dos modelos para processamento de sequências reflete a busca por capturar dependências de longo alcance em dados temporais ou textuais. Redes Neurais Recorrentes (RNNs) foram as primeiras arquiteturas projetadas para sequências, processando elementos um de cada vez e mantendo um estado oculto que carrega informação sobre elementos anteriores.
No entanto, RNNs sofrem com o problema de "vanishing gradients", dificultando o aprendizado de dependências longas. LSTMs (Long Short-Term Memory) resolveram parcialmente isso através de portas que controlam o fluxo de informação, permitindo que informações importantes sejam preservadas por longos períodos. Os Transformers representam uma mudança paradigmática, processando toda a sequência em paralelo através de mecanismos de atenção, eliminando a necessidade de processamento sequencial e permitindo capturar dependências de qualquer distância de forma eficiente.
RNN
Memória curta; difícil para longas dependências.
LSTM
Portas controlam o fluxo de informação.
Transformer
Self-attention modela dependências longas e paraleliza.