Glosario

Definiciones concisas de los términos centrales del libro, en orden alfabético. Cada entrada remite al módulo donde se desarrolla el concepto.

A2A (Agent2Agent)
Estándar abierto de comunicación entre agentes de orígenes distintos, que les permite descubrirse y cooperar. Complementa el MCP (que conecta agentes a herramientas). [M10]
Agente
Sistema en que el modelo opera en lazo (planificar, actuar, observar, repetir) para cumplir una tarea de varios pasos que él mismo conduce. [M10]
Ajuste fino (fine-tuning)
Adaptación de un modelo ya entrenado a una tarea, estilo o dominio específico, a partir de datos adicionales. [M5, M11]
Ajuste por instrucciones (instruction tuning)
Ajuste fino supervisado que enseña al modelo a seguir pedidos en el formato instrucción-respuesta. [M5]
Alineamiento
Conjunto de técnicas que orientan el comportamiento del modelo para que sea útil, honesto y seguro (ver RLHF, RLAIF, DPO, Constitutional AI). [M5, M11]
Alucinación (hallucination)
Producción de contenido plausible, pero factualmente falso o no fundamentado en la fuente. [M7]
API
Canal programático por el cual un software, y no una persona, envía pedidos al modelo y recibe respuestas. [M10]
Atención (attention)
Mecanismo por el cual cada token pondera la relevancia de los demás para reinterpretarse en el contexto. [M4]
Attention budget (presupuesto de atención)
Idea de que la capacidad del modelo de “prestar atención” es finita y disputada por todos los tokens del contexto. [M10]
Backpropagation (retropropagación)
Algoritmo que calcula los gradientes de todos los pesos propagando el error de la salida a las primeras capas. [M3]
Banco vectorial
Sistema que almacena vectores y encuentra rápidamente los vecinos más próximos, base de la búsqueda en RAG. [M9]
Benchmark
Conjunto estandarizado de tareas con respuestas conocidas, usado para comparar modelos. [M8]
Chatbot
Interfaz conversacional directa con el modelo, sin acceso a datos externos ni ejecución de acciones. [M10]
Constitutional AI
Variante de alineamiento en que la retroalimentación la genera una IA guiada por principios escritos (RLAIF), reduciendo la dependencia de etiquetas humanas. [M5]
Contaminación de evaluación
Filtración de ejemplos de prueba al conjunto de entrenamiento, que infla la nota y mide memorización en vez de competencia. [M8]
Context engineering (ingeniería de contexto)
Disciplina de decidir qué información entra en el contexto y cómo organizarla, desplazando el foco del prompt al ambiente de información. [M10]
Context rot
Degradación de la calidad a medida que el contexto crece y acumula información irrelevante o desactualizada. [M10]
Descenso del gradiente
Procedimiento de ajuste de los pesos en la dirección que más reduce la pérdida. [M3]
Destilación (knowledge distillation)
Entrenamiento de un modelo pequeño (alumno) para imitar las salidas de un modelo grande (profesor). [M8]
DPO (optimización directa de preferencias)
Método de alineamiento que ajusta el modelo directamente a partir de preferencias, sin entrenar un modelo de recompensa separado. [M11]
Embedding
Vector de números reales asociado a un token, que define su posición en un espacio de muchas dimensiones. [M2]
Espacio vectorial semántico
Espacio geométrico en que la proximidad entre vectores refleja proximidad de significado. [M2]
Función de activación
Función no lineal (como la ReLU) que da a la red poder de representar relaciones complejas. [M3]
Function calling
Capacidad del modelo de solicitar la ejecución de funciones externas e incorporar sus resultados. [M10]
Generalización
Capacidad de acertar en datos nuevos, y no solo en los ejemplos vistos en el entrenamiento. [M3]
Generación autorregresiva
Producción de la respuesta un token a la vez, realimentando cada token generado. [M6]
Guardrails
Filtros y reglas que validan entrada y salida y restringen acciones del sistema. [M12]
Harness
Runtime que ejecuta el lazo de un agente, gestionando herramientas, memoria, límites y errores. [M10]
Inferencia
Uso del modelo entrenado para generar respuestas; ningún peso se altera en ese proceso. [M6]
Intent engineering
Esfuerzo de capturar y expresar el objetivo real detrás de un pedido, muchas veces implícito. [M10]
Jailbreaking
Sortear el alineamiento del modelo para obtener respuestas que fue entrenado a rechazar. [M12]
Ventana de contexto
Número máximo de tokens que el modelo considera de una sola vez. [M4]
KV-cache
Almacenamiento de las claves y valores ya calculados en la atención, acelerando la generación al costo de memoria. [M8]
LoRA / PEFT
Ajuste fino eficiente en parámetros: entrena pequeñas matrices adicionales en vez de todo el modelo (LoRA); el QLoRA agrega cuantización. [M11]
MCP (Model Context Protocol)
Estándar abierto para conectar aplicaciones de IA a datos y herramientas, como un “puerto USB para IA”. [M10]
Mixture of Experts (MoE)
Arquitectura esparsa en que un enrutador activa solo algunos “expertos” por token, separando la capacidad total del costo por respuesta. [M8]
Mode collapse
Tendencia de las respuestas a converger a un patrón repetitivo, perdiendo diversidad. [M10]
Model card
Documento estandarizado que describe el uso pretendido, el desempeño, los datos y las limitaciones de un modelo. [M12]
Multi-head attention
Varias atenciones en paralelo, cada una capturando un tipo de relación. [M4]
Multimodalidad
Capacidad de un modelo de procesar más de un tipo de señal (texto, imagen, audio) de forma integrada. [M13]
No determinismo
Variación de respuestas para la misma entrada, derivada del muestreo en la generación. [M1, M6]
Neurona artificial
Unidad que calcula una suma ponderada de las entradas, suma un sesgo y aplica una función de activación. [M3]
Open-weight vs. propietario
Modelos cuyos pesos se publican y se ejecutan localmente, versus modelos accesibles solo por API. [M11]
Peso (weight)
Parámetro ajustable que mide la importancia de una entrada; aprender es ajustar pesos. [M3]
Positional encoding
Vector sumado al embedding para registrar la posición de cada token en la secuencia. [M4]
Preentrenamiento
Fase en que el modelo aprende a predecir el próximo token sobre enormes corpus, adquiriendo lenguaje y conocimiento. [M5]
Prompt engineering
Arte de formular la instrucción enviada al modelo (palabras, ejemplos, formato). [M10]
Prompt injection
Instrucción maliciosa embebida en datos externos que secuestra el comportamiento del modelo. [M12]
Cuantización
Reducción del número de bits por peso, disminuyendo memoria y costo con pequeña pérdida de calidad. [M8]
Razonamiento estructurado (chain-of-thought)
Generación de pasos intermedios de razonamiento antes de la respuesta, que mejora el desempeño en problemas complejos. [M6]
RAG (generación aumentada por recuperación)
Recuperar información externa relevante y generar la respuesta fundamentada en ella, compensando el conocimiento estático del modelo. [M9]
Red teaming
Atacar deliberadamente el propio sistema para descubrir y corregir fallas antes que adversarios reales. [M12]
Red neuronal
Conjunto de neuronas artificiales organizadas en capas, capaz de aprender representaciones de los datos. [M3]
RLHF / RLAIF
Alineamiento por refuerzo a partir de preferencias humanas (RLHF) o de retroalimentación de IA por principios (RLAIF). [M5, M11]
Self-attention (autoatención)
Atención en que cada token consulta a los demás (query y key) y pondera sus valores (value) según la relevancia. [M4]
Skill
Capacidad empaquetada y reutilizable que extiende el modelo en una tarea específica, activable bajo demanda. [M10]
SLM (modelo de lenguaje pequeño)
Modelo liviano y especializado que puede superar a un gran generalista en su tarea, a menor costo. [M11]
Sobreajuste (overfitting)
Memorizar los ejemplos de entrenamiento, incluido el ruido, al punto de generalizar mal en datos nuevos. [M3]
Specification engineering / Spec
Disciplina de transformar objetivos en especificaciones explícitas (reglas, criterios de aceptación); la Spec es el artefacto de control resultante. [M10]
Temperatura
Parámetro que reescala la distribución de probabilidad, controlando el equilibrio entre previsibilidad y diversidad de la generación. [M6]
Test-time compute
Gasto de más cómputo en el momento de la respuesta (más razonamiento) para mejorar el resultado. [M6]
Token
Unidad mínima en que se corta el texto para su procesamiento; puede ser una palabra, una subpalabra o un carácter. [M2]
Tokenización
Proceso de dividir el texto en tokens; el uso de subpalabras garantiza un vocabulario finito y la cobertura de palabras inéditas. [M2]
Tool use
Uso, por el modelo, de herramientas externas (búsqueda, cálculo, APIs) para obtener datos o ejecutar acciones. [M10]
Transformer
Arquitectura, basada en el mecanismo de atención, que hizo posibles los LLM modernos. [M4]
Vector
Lista ordenada de números; en el contexto de los LLM, la forma en que se representan tokens y significados. [M2]
Vision Transformer (ViT)
Arquitectura que fragmenta la imagen en bloques y los trata como tokens, llevando el Transformer a la visión. [M13]