Large Language Models (LLMs) processam texto através de uma unidade fundamental chamada token. Um token pode ser uma palavra completa, parte de uma palavra, ou até mesmo um caractere, dependendo do algoritmo de tokenização utilizado. O processo começa quando o texto é dividido em tokens, que são então convertidos em representações numéricas chamadas embeddings.
Os embeddings transformam cada token em um vetor de números que captura seu significado semântico e relacionamento com outros tokens. Durante a geração, o modelo usa esses embeddings para calcular probabilidades de qual token deve vir a seguir, criando texto de forma autônoma. Este processo de "next token prediction" é o que permite aos LLMs gerar respostas coerentes e contextualmente relevantes, mesmo sem compreender verdadeiramente o significado das palavras.
Tokenização
Fragmenta o texto em unidades menores.
Embeddings
Mapeiam tokens para vetores contínuos.
Decodificação
Gera o próximo token com base nas probabilidades.