Glossário

Definições concisas dos termos centrais do livro, em ordem alfabética. Cada entrada remete ao módulo onde o conceito é desenvolvido.

A2A (Agent2Agent)
Padrão aberto de comunicação entre agentes de origens diferentes, permitindo que se descubram e cooperem. Complementa o MCP (que conecta agentes a ferramentas). [M10]
Agente
Sistema em que o modelo opera em laço (planejar, agir, observar, repetir) para cumprir uma tarefa de vários passos que ele mesmo conduz. [M10]
Ajuste fino (fine-tuning)
Adaptação de um modelo já treinado a uma tarefa, estilo ou domínio específico, a partir de dados adicionais. [M5, M11]
Ajuste por instruções (instruction tuning)
Ajuste fino supervisionado que ensina o modelo a seguir pedidos no formato instrução-resposta. [M5]
Alinhamento
Conjunto de técnicas que orientam o comportamento do modelo para ser útil, honesto e seguro (ver RLHF, RLAIF, DPO, Constitutional AI). [M5, M11]
Alucinação (hallucination)
Produção de conteúdo plausível, porém factualmente falso ou não fundamentado na fonte. [M7]
API
Canal programático pelo qual um software, e não uma pessoa, envia pedidos ao modelo e recebe respostas. [M10]
Atenção (attention)
Mecanismo pelo qual cada token pondera a relevância dos demais para se reinterpretar no contexto. [M4]
Attention budget (orçamento de atenção)
Ideia de que a capacidade de o modelo “prestar atenção” é finita e disputada por todos os tokens do contexto. [M10]
Backpropagation (retropropagação)
Algoritmo que calcula os gradientes de todos os pesos propagando o erro da saída até as primeiras camadas. [M3]
Banco vetorial
Sistema que armazena vetores e encontra rapidamente os vizinhos mais próximos, base da busca em RAG. [M9]
Benchmark
Conjunto padronizado de tarefas com respostas conhecidas, usado para comparar modelos. [M8]
Chatbot
Interface conversacional direta com o modelo, sem acesso a dados externos nem execução de ações. [M10]
Constitutional AI
Variante de alinhamento em que o feedback é gerado por uma IA guiada por princípios escritos (RLAIF), reduzindo a dependência de rótulos humanos. [M5]
Contaminação de avaliação
Vazamento de exemplos de teste para o conjunto de treino, que infla a nota e mede memorização em vez de competência. [M8]
Context engineering (engenharia de contexto)
Disciplina de decidir qual informação entra no contexto e como organizá-la, deslocando o foco do prompt para o ambiente de informação. [M10]
Context rot
Degradação da qualidade à medida que o contexto cresce e acumula informação irrelevante ou desatualizada. [M10]
Descida do gradiente
Procedimento de ajuste dos pesos na direção que mais reduz a perda. [M3]
Destilação (knowledge distillation)
Treino de um modelo pequeno (aluno) para imitar as saídas de um modelo grande (professor). [M8]
DPO (otimização direta de preferências)
Método de alinhamento que ajusta o modelo diretamente a partir de preferências, sem treinar um modelo de recompensa separado. [M11]
Embedding
Vetor de números reais associado a um token, que define sua posição num espaço de muitas dimensões. [M2]
Espaço vetorial semântico
Espaço geométrico em que a proximidade entre vetores reflete proximidade de significado. [M2]
Função de ativação
Função não linear (como a ReLU) que dá à rede poder de representar relações complexas. [M3]
Function calling
Capacidade de o modelo solicitar a execução de funções externas e incorporar seus resultados. [M10]
Generalização
Capacidade de acertar em dados novos, e não apenas nos exemplos vistos no treino. [M3]
Geração autorregressiva
Produção da resposta um token de cada vez, realimentando cada token gerado. [M6]
Guardrails
Filtros e regras que validam entrada e saída e restringem ações do sistema. [M12]
Harness
Runtime que executa o laço de um agente, gerenciando ferramentas, memória, limites e erros. [M10]
Inferência
Uso do modelo treinado para gerar respostas; nenhum peso é alterado nesse processo. [M6]
Intent engineering
Esforço de capturar e expressar o objetivo real por trás de um pedido, muitas vezes implícito. [M10]
Jailbreaking
Contornar o alinhamento do modelo para obter respostas que ele foi treinado a recusar. [M12]
Janela de contexto
Número máximo de tokens que o modelo considera de uma só vez. [M4]
KV-cache
Armazenamento das chaves e valores já calculados na atenção, acelerando a geração ao custo de memória. [M8]
LoRA / PEFT
Ajuste fino eficiente em parâmetros: treina pequenas matrizes adicionais em vez de todo o modelo (LoRA); o QLoRA acrescenta quantização. [M11]
MCP (Model Context Protocol)
Padrão aberto para conectar aplicações de IA a dados e ferramentas, como uma “porta USB para IA”. [M10]
Mixture of Experts (MoE)
Arquitetura esparsa em que um roteador ativa apenas alguns “especialistas” por token, separando capacidade total de custo por resposta. [M8]
Mode collapse
Tendência de as respostas convergirem para um padrão repetitivo, perdendo diversidade. [M10]
Model card
Documento padronizado que descreve uso pretendido, desempenho, dados e limitações de um modelo. [M12]
Multi-head attention
Várias atenções em paralelo, cada uma capturando um tipo de relação. [M4]
Multimodalidade
Capacidade de um modelo processar mais de um tipo de sinal (texto, imagem, áudio) de forma integrada. [M13]
Não-determinismo
Variação de respostas para a mesma entrada, decorrente da amostragem na geração. [M1, M6]
Neurônio artificial
Unidade que calcula uma soma ponderada das entradas, soma um viés e aplica uma função de ativação. [M3]
Open-weight vs. proprietário
Modelos cujos pesos são publicados e executáveis localmente, versus modelos acessíveis apenas por API. [M11]
Peso (weight)
Parâmetro ajustável que mede a importância de uma entrada; aprender é ajustar pesos. [M3]
Positional encoding
Vetor somado ao embedding para registrar a posição de cada token na sequência. [M4]
Pré-treinamento
Fase em que o modelo aprende a prever o próximo token sobre enormes corpora, adquirindo linguagem e conhecimento. [M5]
Prompt engineering
Arte de formular a instrução enviada ao modelo (palavras, exemplos, formato). [M10]
Prompt injection
Instrução maliciosa embutida em dados externos que sequestra o comportamento do modelo. [M12]
Quantização
Redução do número de bits por peso, diminuindo memória e custo com pequena perda de qualidade. [M8]
Raciocínio estruturado (chain-of-thought)
Geração de passos intermediários de raciocínio antes da resposta, que melhora o desempenho em problemas complexos. [M6]
RAG (recuperação aumentada de geração)
Recuperar informação externa relevante e gerar a resposta fundamentada nela, compensando o conhecimento estático do modelo. [M9]
Red teaming
Atacar deliberadamente o próprio sistema para descobrir e corrigir falhas antes de adversários reais. [M12]
Rede neural
Conjunto de neurônios artificiais organizados em camadas, capaz de aprender representações dos dados. [M3]
RLHF / RLAIF
Alinhamento por reforço a partir de preferências humanas (RLHF) ou de feedback de IA por princípios (RLAIF). [M5, M11]
Self-attention (autoatenção)
Atenção em que cada token consulta os demais (query e key) e pondera seus valores (value) conforme a relevância. [M4]
Skill
Capacidade empacotada e reutilizável que estende o modelo numa tarefa específica, ativável sob demanda. [M10]
SLM (modelo de linguagem pequeno)
Modelo enxuto e especializado que pode superar um grande generalista na sua tarefa, a menor custo. [M11]
Sobreajuste (overfitting)
Decorar os exemplos de treino, inclusive o ruído, a ponto de generalizar mal em dados novos. [M3]
Specification engineering / Spec
Disciplina de transformar objetivos em especificações explícitas (regras, critérios de aceite); a Spec é o artefato de controle resultante. [M10]
Temperatura
Parâmetro que reescala a distribuição de probabilidade, controlando o equilíbrio entre previsibilidade e diversidade da geração. [M6]
Test-time compute
Gasto de mais computação no momento da resposta (mais raciocínio) para melhorar o resultado. [M6]
Token
Unidade mínima em que o texto é fatiado para processamento; pode ser uma palavra, uma subpalavra ou um caractere. [M2]
Tokenização
Processo de dividir o texto em tokens; o uso de subpalavras garante vocabulário finito e cobertura de palavras inéditas. [M2]
Tool use
Uso, pelo modelo, de ferramentas externas (busca, cálculo, APIs) para obter dados ou executar ações. [M10]
Transformer
Arquitetura, baseada no mecanismo de atenção, que tornou possíveis as LLMs modernas. [M4]
Vetor
Lista ordenada de números; no contexto de LLMs, a forma como tokens e significados são representados. [M2]
Vision Transformer (ViT)
Arquitetura que fatia a imagem em blocos e os trata como tokens, levando o Transformer à visão. [M13]