17  Glossário

Agent: Sistema de IA que pode executar ações autonomamente, frequentemente utilizando LLMs como cérebro.

Alignment (Alinhamento): O processo de garantir que os comportamentos de um modelo de IA estejam alinhados com as intenções e valores humanos.

Attention Mechanism (Mecanismo de Atenção): Técnica que permite ao modelo prestar atenção seletivamente a diferentes partes da entrada ao processar cada elemento.

BERT: Modelo baseado em codificador, desenvolvido para aprender representações bidirecionais e aplicá-las a tarefas de compreensão de texto.

Chain-of-Thought (Cadeia de Pensamento): Técnica de prompting que incentiva o modelo a mostrar seu raciocínio intermediário.

Context Window (Janela de Contexto): Quantidade máxima de texto que o modelo pode processar simultaneamente.

Decoder: Componente do Transformer que gera sequências token por token.

Embedding: Representação vetorial densa de tokens que captura relações semânticas.

Fine-tuning: Ajuste fino de um modelo pré-treinado para um domínio ou tarefa específica.

Flash Attention: Técnica para acelerar o cálculo de atenção reduzindo a memória necessária.

Generative AI (IA Generativa): Sistemas de IA capazes de criar conteúdo novo, incluindo texto, imagens, áudio e código.

Gradient: Vetor de derivadas parciais que indica a direção de maior aumento de uma função de perda.

Hallucination (Alucinação): Quando um modelo gera informação incorreta ou fabricada com aparente confiança.

Inference: Processo de usar um modelo treinado para fazer previsões ou gerar conteúdo.

In-Context Learning: Capacidade de um modelo de aprender de exemplos fornecidos no prompt sem ajustar pesos.

LLM (Large Language Model): Modelo de linguagem de grande escala treinado em vastas quantidades de texto.

LoRA (Low-Rank Adaptation): Técnica de fine-tuning eficiente que adiciona adaptadores de baixo posto.

Multimodal: Capacidade de processar múltiplas modalidades de dados, como texto e imagens.

NLP (Natural Language Processing): Campo da IA focado em processamento e compreensão de linguagem natural.

Parameter (Parâmetro): Valor ajustável em uma rede neural que é aprendido durante o treinamento.

Prompt: Entrada de texto fornecida ao modelo para elicitar uma resposta.

Quantization: Técnica para reduzir a precisão numérica dos pesos do modelo, diminuindo requisitos de memória.

Retrieval-Augmented Generation (RAG): Abordagem que combina LLMs com busca em bases de conhecimento externas.

RLHF (Reinforcement Learning from Human Feedback): Técnica de alinhamento usando feedback humano.

Self-Attention (Auto-Atenção): Mecanismo de atenção onde queries, keys e values vêm da mesma sequência.

Temperature: Parâmetro que controla a aleatoriedade da geração de texto.

Token: Unidade básica de texto processada pelo modelo.

Tokenization: Processo de converter texto em sequência de tokens.

Top-k/Top-p Sampling: Técnicas para limitar a aleatoriedade na seleção de tokens.

Transformer: Arquitetura neural baseada em mecanismos de atenção que revolucionou o NLP.

Vanilla Transformers: Versão original do Transformer com codificador e decodificador.

Backpropagation (Retropropagação): Algoritmo que aplica a regra da cadeia para calcular o gradiente da perda em relação aos parâmetros.

Checkpoint: Registro dos pesos e, quando necessário, dos estados que permitem retomar um treinamento.

Cross-Entropy (Entropia Cruzada): Função de perda que penaliza baixa probabilidade atribuída ao token-alvo.

Gradient (Gradiente): Vetor de derivadas que indica como uma pequena mudança em cada parâmetro altera a perda.

KV Cache: Cache das chaves e valores de atenção do prefixo, reutilizado para acelerar a geração autoregressiva.

Logit: Valor real não normalizado produzido antes da softmax; diferenças entre logits determinam razões de probabilidade.

LoRA (Low-Rank Adaptation): Técnica de ajuste eficiente que aprende pequenas atualizações matriciais de baixa ordem e mantém o modelo-base congelado.

Perplexity (Perplexidade): Exponencial da entropia cruzada média; sob condições comparáveis, valores menores indicam menor surpresa diante dos tokens observados.

Pre-norm: Organização de bloco que normaliza a entrada antes da atenção ou da rede feed-forward.

Softmax: Função que converte logits em valores positivos cuja soma é 1.

Weight Tying (Compartilhamento de Pesos): Uso da mesma matriz nos embeddings de entrada e na projeção de saída para reduzir parâmetros.

FlashAttention: Implementação exata da atenção que organiza o cálculo em blocos para reduzir transferências de memória e intermediários materializados.

GQA (Grouped-Query Attention): Variante em que grupos de cabeças de consulta compartilham chaves e valores, reduzindo o KV cache.

In-context Learning (Aprendizagem em Contexto): Adaptação temporária induzida por instruções ou exemplos no prompt, sem atualização dos parâmetros.

Mixture of Experts (MoE): Camada com múltiplas redes especialistas e um roteador que ativa apenas parte delas para cada token.

MQA (Multi-Query Attention): Variante que compartilha um único conjunto de chaves e valores entre todas as cabeças de consulta.

Prompt Injection (Injeção de Prompt): Entrada não confiável que tenta alterar instruções ou induzir ações fora da finalidade autorizada.

Quantization (Quantização): Representação de pesos ou ativações com menos bits para reduzir memória e, em hardware compatível, acelerar cálculos.

RAG (Retrieval-Augmented Generation): Arquitetura que recupera evidências externas e as fornece ao modelo durante a geração.

RoPE (Rotary Positional Embedding): Codificação que gira pares de coordenadas de consultas e chaves conforme a posição, introduzindo relações relativas na atenção.

SFT (Supervised Fine-Tuning): Continuação supervisionada do treinamento com pares de entrada e resposta desejada.

Speculative Decoding: Geração em que um modelo auxiliar propõe tokens e o modelo principal verifica as propostas para reduzir latência.

State-Space Model (Modelo de Espaço de Estados): Arquitetura sequencial que mantém um estado atualizado por entradas sucessivas e pode oferecer custo linear no comprimento.

SwiGLU: Rede feed-forward com uma ativação SiLU que funciona como porta sobre outra projeção linear.