Governo do Piauí

Governo do Estado do Piauí

Transformers

Arquitetura Revolucionária

Self-Attention e multi-head para entender dependências longas.

Matriz de Atenção

A arquitetura Transformer, introduzida em 2017, revolucionou o processamento de linguagem natural ao substituir os modelos sequenciais anteriores por um mecanismo de atenção paralela. O componente central é o mecanismo de Self-Attention, que permite que cada palavra em uma frase "preste atenção" em todas as outras palavras simultaneamente, capturando dependências de longo alcance de forma eficiente.

Diferente das RNNs que processam sequências palavra por palavra, os Transformers processam toda a sequência em paralelo, tornando o treinamento muito mais rápido. O Multi-Head Attention permite que o modelo capture diferentes tipos de relacionamentos (sintáticos, semânticos, etc.) simultaneamente, enquanto o Positional Encoding adiciona informações sobre a ordem das palavras, já que a atenção por si só não possui noção inerente de sequência.

Matriz de Atenção

Self-Attention

Cada token pondera todos os outros para formar o contexto.

Multi-Head

Cabeças paralelas capturam padrões diferentes do texto.

Positional Encoding

Senoides/cossenoides adicionam noções de ordem aos tokens.