17 Glossário
Agent: Sistema de IA que pode executar ações autonomamente, frequentemente utilizando LLMs como cérebro.
Alignment (Alinhamento): O processo de garantir que os comportamentos de um modelo de IA estejam alinhados com as intenções e valores humanos.
Attention Mechanism (Mecanismo de Atenção): Técnica que permite ao modelo prestar atenção seletivamente a diferentes partes da entrada ao processar cada elemento.
BERT: Modelo baseado em codificador, desenvolvido para aprender representações bidirecionais e aplicá-las a tarefas de compreensão de texto.
Chain-of-Thought (Cadeia de Pensamento): Técnica de prompting que incentiva o modelo a mostrar seu raciocínio intermediário.
Context Window (Janela de Contexto): Quantidade máxima de texto que o modelo pode processar simultaneamente.
Decoder: Componente do Transformer que gera sequências token por token.
Embedding: Representação vetorial densa de tokens que captura relações semânticas.
Fine-tuning: Ajuste fino de um modelo pré-treinado para um domínio ou tarefa específica.
Flash Attention: Técnica para acelerar o cálculo de atenção reduzindo a memória necessária.
Generative AI (IA Generativa): Sistemas de IA capazes de criar conteúdo novo, incluindo texto, imagens, áudio e código.
Gradient: Vetor de derivadas parciais que indica a direção de maior aumento de uma função de perda.
Hallucination (Alucinação): Quando um modelo gera informação incorreta ou fabricada com aparente confiança.
Inference: Processo de usar um modelo treinado para fazer previsões ou gerar conteúdo.
In-Context Learning: Capacidade de um modelo de aprender de exemplos fornecidos no prompt sem ajustar pesos.
LLM (Large Language Model): Modelo de linguagem de grande escala treinado em vastas quantidades de texto.
LoRA (Low-Rank Adaptation): Técnica de fine-tuning eficiente que adiciona adaptadores de baixo posto.
Multimodal: Capacidade de processar múltiplas modalidades de dados, como texto e imagens.
NLP (Natural Language Processing): Campo da IA focado em processamento e compreensão de linguagem natural.
Parameter (Parâmetro): Valor ajustável em uma rede neural que é aprendido durante o treinamento.
Prompt: Entrada de texto fornecida ao modelo para elicitar uma resposta.
Quantization: Técnica para reduzir a precisão numérica dos pesos do modelo, diminuindo requisitos de memória.
Retrieval-Augmented Generation (RAG): Abordagem que combina LLMs com busca em bases de conhecimento externas.
RLHF (Reinforcement Learning from Human Feedback): Técnica de alinhamento usando feedback humano.
Self-Attention (Auto-Atenção): Mecanismo de atenção onde queries, keys e values vêm da mesma sequência.
Temperature: Parâmetro que controla a aleatoriedade da geração de texto.
Token: Unidade básica de texto processada pelo modelo.
Tokenization: Processo de converter texto em sequência de tokens.
Top-k/Top-p Sampling: Técnicas para limitar a aleatoriedade na seleção de tokens.
Transformer: Arquitetura neural baseada em mecanismos de atenção que revolucionou o NLP.
Vanilla Transformers: Versão original do Transformer com codificador e decodificador.
Backpropagation (Retropropagação): Algoritmo que aplica a regra da cadeia para calcular o gradiente da perda em relação aos parâmetros.
Checkpoint: Registro dos pesos e, quando necessário, dos estados que permitem retomar um treinamento.
Cross-Entropy (Entropia Cruzada): Função de perda que penaliza baixa probabilidade atribuída ao token-alvo.
Gradient (Gradiente): Vetor de derivadas que indica como uma pequena mudança em cada parâmetro altera a perda.
KV Cache: Cache das chaves e valores de atenção do prefixo, reutilizado para acelerar a geração autoregressiva.
Logit: Valor real não normalizado produzido antes da softmax; diferenças entre logits determinam razões de probabilidade.
LoRA (Low-Rank Adaptation): Técnica de ajuste eficiente que aprende pequenas atualizações matriciais de baixa ordem e mantém o modelo-base congelado.
Perplexity (Perplexidade): Exponencial da entropia cruzada média; sob condições comparáveis, valores menores indicam menor surpresa diante dos tokens observados.
Pre-norm: Organização de bloco que normaliza a entrada antes da atenção ou da rede feed-forward.
Softmax: Função que converte logits em valores positivos cuja soma é 1.
Weight Tying (Compartilhamento de Pesos): Uso da mesma matriz nos embeddings de entrada e na projeção de saída para reduzir parâmetros.
FlashAttention: Implementação exata da atenção que organiza o cálculo em blocos para reduzir transferências de memória e intermediários materializados.
GQA (Grouped-Query Attention): Variante em que grupos de cabeças de consulta compartilham chaves e valores, reduzindo o KV cache.
In-context Learning (Aprendizagem em Contexto): Adaptação temporária induzida por instruções ou exemplos no prompt, sem atualização dos parâmetros.
Mixture of Experts (MoE): Camada com múltiplas redes especialistas e um roteador que ativa apenas parte delas para cada token.
MQA (Multi-Query Attention): Variante que compartilha um único conjunto de chaves e valores entre todas as cabeças de consulta.
Prompt Injection (Injeção de Prompt): Entrada não confiável que tenta alterar instruções ou induzir ações fora da finalidade autorizada.
Quantization (Quantização): Representação de pesos ou ativações com menos bits para reduzir memória e, em hardware compatível, acelerar cálculos.
RAG (Retrieval-Augmented Generation): Arquitetura que recupera evidências externas e as fornece ao modelo durante a geração.
RoPE (Rotary Positional Embedding): Codificação que gira pares de coordenadas de consultas e chaves conforme a posição, introduzindo relações relativas na atenção.
SFT (Supervised Fine-Tuning): Continuação supervisionada do treinamento com pares de entrada e resposta desejada.
Speculative Decoding: Geração em que um modelo auxiliar propõe tokens e o modelo principal verifica as propostas para reduzir latência.
State-Space Model (Modelo de Espaço de Estados): Arquitetura sequencial que mantém um estado atualizado por entradas sucessivas e pode oferecer custo linear no comprimento.
SwiGLU: Rede feed-forward com uma ativação SiLU que funciona como porta sobre outra projeção linear.