Glossário
Definições concisas dos termos centrais do livro, em ordem alfabética. Cada entrada remete ao módulo onde o conceito é desenvolvido.
- A2A (Agent2Agent)
- Padrão aberto de comunicação entre agentes de origens diferentes, permitindo que se descubram e cooperem. Complementa o MCP (que conecta agentes a ferramentas). [M10]
- Agente
- Sistema em que o modelo opera em laço (planejar, agir, observar, repetir) para cumprir uma tarefa de vários passos que ele mesmo conduz. [M10]
- Ajuste fino (fine-tuning)
- Adaptação de um modelo já treinado a uma tarefa, estilo ou domínio específico, a partir de dados adicionais. [M5, M11]
- Ajuste por instruções (instruction tuning)
- Ajuste fino supervisionado que ensina o modelo a seguir pedidos no formato instrução-resposta. [M5]
- Alinhamento
- Conjunto de técnicas que orientam o comportamento do modelo para ser útil, honesto e seguro (ver RLHF, RLAIF, DPO, Constitutional AI). [M5, M11]
- Alucinação (hallucination)
- Produção de conteúdo plausível, porém factualmente falso ou não fundamentado na fonte. [M7]
- API
- Canal programático pelo qual um software, e não uma pessoa, envia pedidos ao modelo e recebe respostas. [M10]
- Atenção (attention)
- Mecanismo pelo qual cada token pondera a relevância dos demais para se reinterpretar no contexto. [M4]
- Attention budget (orçamento de atenção)
- Ideia de que a capacidade de o modelo “prestar atenção” é finita e disputada por todos os tokens do contexto. [M10]
- Backpropagation (retropropagação)
- Algoritmo que calcula os gradientes de todos os pesos propagando o erro da saída até as primeiras camadas. [M3]
- Banco vetorial
- Sistema que armazena vetores e encontra rapidamente os vizinhos mais próximos, base da busca em RAG. [M9]
- Benchmark
- Conjunto padronizado de tarefas com respostas conhecidas, usado para comparar modelos. [M8]
- Chatbot
- Interface conversacional direta com o modelo, sem acesso a dados externos nem execução de ações. [M10]
- Constitutional AI
- Variante de alinhamento em que o feedback é gerado por uma IA guiada por princípios escritos (RLAIF), reduzindo a dependência de rótulos humanos. [M5]
- Contaminação de avaliação
- Vazamento de exemplos de teste para o conjunto de treino, que infla a nota e mede memorização em vez de competência. [M8]
- Context engineering (engenharia de contexto)
- Disciplina de decidir qual informação entra no contexto e como organizá-la, deslocando o foco do prompt para o ambiente de informação. [M10]
- Context rot
- Degradação da qualidade à medida que o contexto cresce e acumula informação irrelevante ou desatualizada. [M10]
- Descida do gradiente
- Procedimento de ajuste dos pesos na direção que mais reduz a perda. [M3]
- Destilação (knowledge distillation)
- Treino de um modelo pequeno (aluno) para imitar as saídas de um modelo grande (professor). [M8]
- DPO (otimização direta de preferências)
- Método de alinhamento que ajusta o modelo diretamente a partir de preferências, sem treinar um modelo de recompensa separado. [M11]
- Embedding
- Vetor de números reais associado a um token, que define sua posição num espaço de muitas dimensões. [M2]
- Espaço vetorial semântico
- Espaço geométrico em que a proximidade entre vetores reflete proximidade de significado. [M2]
- Função de ativação
- Função não linear (como a ReLU) que dá à rede poder de representar relações complexas. [M3]
- Function calling
- Capacidade de o modelo solicitar a execução de funções externas e incorporar seus resultados. [M10]
- Generalização
- Capacidade de acertar em dados novos, e não apenas nos exemplos vistos no treino. [M3]
- Geração autorregressiva
- Produção da resposta um token de cada vez, realimentando cada token gerado. [M6]
- Guardrails
- Filtros e regras que validam entrada e saída e restringem ações do sistema. [M12]
- Harness
- Runtime que executa o laço de um agente, gerenciando ferramentas, memória, limites e erros. [M10]
- Inferência
- Uso do modelo treinado para gerar respostas; nenhum peso é alterado nesse processo. [M6]
- Intent engineering
- Esforço de capturar e expressar o objetivo real por trás de um pedido, muitas vezes implícito. [M10]
- Jailbreaking
- Contornar o alinhamento do modelo para obter respostas que ele foi treinado a recusar. [M12]
- Janela de contexto
- Número máximo de tokens que o modelo considera de uma só vez. [M4]
- KV-cache
- Armazenamento das chaves e valores já calculados na atenção, acelerando a geração ao custo de memória. [M8]
- LoRA / PEFT
- Ajuste fino eficiente em parâmetros: treina pequenas matrizes adicionais em vez de todo o modelo (LoRA); o QLoRA acrescenta quantização. [M11]
- MCP (Model Context Protocol)
- Padrão aberto para conectar aplicações de IA a dados e ferramentas, como uma “porta USB para IA”. [M10]
- Mixture of Experts (MoE)
- Arquitetura esparsa em que um roteador ativa apenas alguns “especialistas” por token, separando capacidade total de custo por resposta. [M8]
- Mode collapse
- Tendência de as respostas convergirem para um padrão repetitivo, perdendo diversidade. [M10]
- Model card
- Documento padronizado que descreve uso pretendido, desempenho, dados e limitações de um modelo. [M12]
- Multi-head attention
- Várias atenções em paralelo, cada uma capturando um tipo de relação. [M4]
- Multimodalidade
- Capacidade de um modelo processar mais de um tipo de sinal (texto, imagem, áudio) de forma integrada. [M13]
- Não-determinismo
- Variação de respostas para a mesma entrada, decorrente da amostragem na geração. [M1, M6]
- Neurônio artificial
- Unidade que calcula uma soma ponderada das entradas, soma um viés e aplica uma função de ativação. [M3]
- Open-weight vs. proprietário
- Modelos cujos pesos são publicados e executáveis localmente, versus modelos acessíveis apenas por API. [M11]
- Peso (weight)
- Parâmetro ajustável que mede a importância de uma entrada; aprender é ajustar pesos. [M3]
- Positional encoding
- Vetor somado ao embedding para registrar a posição de cada token na sequência. [M4]
- Pré-treinamento
- Fase em que o modelo aprende a prever o próximo token sobre enormes corpora, adquirindo linguagem e conhecimento. [M5]
- Prompt engineering
- Arte de formular a instrução enviada ao modelo (palavras, exemplos, formato). [M10]
- Prompt injection
- Instrução maliciosa embutida em dados externos que sequestra o comportamento do modelo. [M12]
- Quantização
- Redução do número de bits por peso, diminuindo memória e custo com pequena perda de qualidade. [M8]
- Raciocínio estruturado (chain-of-thought)
- Geração de passos intermediários de raciocínio antes da resposta, que melhora o desempenho em problemas complexos. [M6]
- RAG (recuperação aumentada de geração)
- Recuperar informação externa relevante e gerar a resposta fundamentada nela, compensando o conhecimento estático do modelo. [M9]
- Red teaming
- Atacar deliberadamente o próprio sistema para descobrir e corrigir falhas antes de adversários reais. [M12]
- Rede neural
- Conjunto de neurônios artificiais organizados em camadas, capaz de aprender representações dos dados. [M3]
- RLHF / RLAIF
- Alinhamento por reforço a partir de preferências humanas (RLHF) ou de feedback de IA por princípios (RLAIF). [M5, M11]
- Self-attention (autoatenção)
- Atenção em que cada token consulta os demais (query e key) e pondera seus valores (value) conforme a relevância. [M4]
- Skill
- Capacidade empacotada e reutilizável que estende o modelo numa tarefa específica, ativável sob demanda. [M10]
- SLM (modelo de linguagem pequeno)
- Modelo enxuto e especializado que pode superar um grande generalista na sua tarefa, a menor custo. [M11]
- Sobreajuste (overfitting)
- Decorar os exemplos de treino, inclusive o ruído, a ponto de generalizar mal em dados novos. [M3]
- Specification engineering / Spec
- Disciplina de transformar objetivos em especificações explícitas (regras, critérios de aceite); a Spec é o artefato de controle resultante. [M10]
- Temperatura
- Parâmetro que reescala a distribuição de probabilidade, controlando o equilíbrio entre previsibilidade e diversidade da geração. [M6]
- Test-time compute
- Gasto de mais computação no momento da resposta (mais raciocínio) para melhorar o resultado. [M6]
- Token
- Unidade mínima em que o texto é fatiado para processamento; pode ser uma palavra, uma subpalavra ou um caractere. [M2]
- Tokenização
- Processo de dividir o texto em tokens; o uso de subpalavras garante vocabulário finito e cobertura de palavras inéditas. [M2]
- Tool use
- Uso, pelo modelo, de ferramentas externas (busca, cálculo, APIs) para obter dados ou executar ações. [M10]
- Transformer
- Arquitetura, baseada no mecanismo de atenção, que tornou possíveis as LLMs modernas. [M4]
- Vetor
- Lista ordenada de números; no contexto de LLMs, a forma como tokens e significados são representados. [M2]
- Vision Transformer (ViT)
- Arquitetura que fatia a imagem em blocos e os trata como tokens, levando o Transformer à visão. [M13]