Los LLM son Predictores de Token Siguiente
Un modelo de lenguaje grande es, en su esencia, un predictor de token siguiente: dado los tokens hasta ahora, predice el siguiente. Cada capacidad impresionante — escritura, programación, razonamiento — surge de este bucle repetido miles de veces. La palabra “grande” se refiere a los miles de millones de parámetros aprendidos de enormes cantidades de texto.
Tokens y Tokenizadores
Los modelos no leen caracteres ni palabras completas. Leen tokens — unidades subpalabra de un vocabulario fijo (típicamente 32k–200k entradas). La codificación por pares de bytes (byte-pair encoding, BPE) fusiona los pares de caracteres más frecuentes hasta alcanzar el tamaén deseado. “increíble” podría ser un solo token; el nombre de una empresa rara se divide en dos o tres. El visualizador de tokenizadores de esta página traza una oración del texto a IDs de tokens a embeddings.
Embeddings: El Significado como Vectores
Cada ID de token mapea a un vector de embedding denso. Las palabras usadas en contextos similares terminan cerca el una de la otra en el espacio vectorial — por eso funciona la matemática vectorial como “rey − hombre + mujer ≈ reina”. El modelo nunca ve palabras; procesa estos vectores a través de sus capas.
Auto-atención en un Párrafo
Para cada token, la auto-atención calcula cuánto debe prestar atención a cada uno de los otros tokens en el contexto. La palabra “it” en “el coche rodó cuesta la colina porque it era resbaladizo” debe vincularse a “coche” a través de los pesos de atención. Esto es lo que da a los transformadores su potencia frente a modelos recurrentes anteriores: cada token puede mirar directamente a cada otro token, sin cuellos de botella de memoria. Los patrones de atención se aprenden durante el entrenamiento.
La Ventana de Contexto
La ventana de contexto limita cuántos tokens el modelo puede atender a la vez. Todo lo que excede es invisible. Consecuencias que encontrarás en la práctica:
| Problema | Por qué ocurre | Solución alternativa |
|---|---|---|
| Los documentos largos se cortan | Excede la ventana | Dividir y recuperar (RAG) |
| Se olvida la conversación temprana | La historia desborda la ventana | Resumir o truncar |
| Las respuestas parecen desactualizadas | El conocimiento se fija al entrenamiento | Proporcionar contexto fresco en el prompt |
Generación Autoregresiva y Muestreo
En cada paso, el modelo genera una distribución de probabilidad sobre todo el vocabulario. El muestreo elige el siguiente token:
- Greedy — siempre el token más probable (monótono, repetitivo).
- Temperatura — escala la distribución; bajo = conservador, alto = creativo.
- Top-p — restringe el muestreo al conjunto más pequeño cuya probabilidad acumulada excede p.
La generación, por lo tanto, es no determinista. Dos prompts idénticos pueden producir respuestas diferentes — una razón clave por la cual la evaluación y el caché son importantes en producción.
Cuándo es la Herramienta Correcta
Recurre a un LLM cuando la tarea es lenguaje abierto: resumen, redacción, generación de código, interfaces conversacionales. Para decisiones deterministas, críticas de latencia o de bajo costo, una regla, un clasificador o un modelo más pequeño suelen ser la mejor opción — los LLMs son lentos y costosos por token.
Trayectoria de Práctica
- Tokeniza una oración a mano y compárala con la salida de un tokenizador real.
- Explica en una frase por qué “it” necesita atención para resolverse correctamente.
- Da un escenario donde una ventana de contexto de 4k rompe silenciosamente una respuesta.
- Predice qué sucede con la calidad de la salida si la temperatura se establece en 0.0.
- Decide cuándo usarías una regla en lugar de un LLM para una tarea que conoces.