A arquitetura Transformer, introduzida em 2017, revolucionou o processamento de linguagem natural ao substituir os modelos sequenciais anteriores por um mecanismo de atenção paralela. O componente central é o mecanismo de Self-Attention, que permite que cada palavra em uma frase "preste atenção" em todas as outras palavras simultaneamente, capturando dependências de longo alcance de forma eficiente.
Diferente das RNNs que processam sequências palavra por palavra, os Transformers processam toda a sequência em paralelo, tornando o treinamento muito mais rápido. O Multi-Head Attention permite que o modelo capture diferentes tipos de relacionamentos (sintáticos, semânticos, etc.) simultaneamente, enquanto o Positional Encoding adiciona informações sobre a ordem das palavras, já que a atenção por si só não possui noção inerente de sequência.
Self-Attention
Cada token pondera todos os outros para formar o contexto.
Multi-Head
Cabeças paralelas capturam padrões diferentes do texto.
Positional Encoding
Senoides/cossenoides adicionam noções de ordem aos tokens.