Saltar al contenido principal
Machine learning, neural networks, LLMs, retrieval-augmented generation, model serving, and the systems engineering behind production AI.

Artificial Intelligence

Machine learning, neural networks, LLMs, retrieval-augmented generation, model serving, and the systems engineering behind production AI.

Tokenization

From raw text to embedding vectors

Trace how an LLM turns a sentence into tokens, integer ids, and finally dense embedding vectors inside a context window.

Phase

Tokens
vocab: context:
Artifact
Why it matters

    Modelos de Lenguaje Grande y el Transformer

    Intermediate (3/5) ~4-5 horas Tokens Embeddings Atención Ventana de contexto Generación autoregresiva Temperatura Vocabulario Prereqs: Redes Neuronales y Deep Learning

    Los LLM son Predictores de Token Siguiente

    Un modelo de lenguaje grande es, en su esencia, un predictor de token siguiente: dado los tokens hasta ahora, predice el siguiente. Cada capacidad impresionante — escritura, programación, razonamiento — surge de este bucle repetido miles de veces. La palabra “grande” se refiere a los miles de millones de parámetros aprendidos de enormes cantidades de texto.

    Tokens y Tokenizadores

    Los modelos no leen caracteres ni palabras completas. Leen tokens — unidades subpalabra de un vocabulario fijo (típicamente 32k–200k entradas). La codificación por pares de bytes (byte-pair encoding, BPE) fusiona los pares de caracteres más frecuentes hasta alcanzar el tamaén deseado. “increíble” podría ser un solo token; el nombre de una empresa rara se divide en dos o tres. El visualizador de tokenizadores de esta página traza una oración del texto a IDs de tokens a embeddings.

    Embeddings: El Significado como Vectores

    Cada ID de token mapea a un vector de embedding denso. Las palabras usadas en contextos similares terminan cerca el una de la otra en el espacio vectorial — por eso funciona la matemática vectorial como “rey − hombre + mujer ≈ reina”. El modelo nunca ve palabras; procesa estos vectores a través de sus capas.

    Auto-atención en un Párrafo

    Para cada token, la auto-atención calcula cuánto debe prestar atención a cada uno de los otros tokens en el contexto. La palabra “it” en “el coche rodó cuesta la colina porque it era resbaladizo” debe vincularse a “coche” a través de los pesos de atención. Esto es lo que da a los transformadores su potencia frente a modelos recurrentes anteriores: cada token puede mirar directamente a cada otro token, sin cuellos de botella de memoria. Los patrones de atención se aprenden durante el entrenamiento.

    La Ventana de Contexto

    La ventana de contexto limita cuántos tokens el modelo puede atender a la vez. Todo lo que excede es invisible. Consecuencias que encontrarás en la práctica:

    ProblemaPor qué ocurreSolución alternativa
    Los documentos largos se cortanExcede la ventanaDividir y recuperar (RAG)
    Se olvida la conversación tempranaLa historia desborda la ventanaResumir o truncar
    Las respuestas parecen desactualizadasEl conocimiento se fija al entrenamientoProporcionar contexto fresco en el prompt

    Generación Autoregresiva y Muestreo

    En cada paso, el modelo genera una distribución de probabilidad sobre todo el vocabulario. El muestreo elige el siguiente token:

    • Greedy — siempre el token más probable (monótono, repetitivo).
    • Temperatura — escala la distribución; bajo = conservador, alto = creativo.
    • Top-p — restringe el muestreo al conjunto más pequeño cuya probabilidad acumulada excede p.

    La generación, por lo tanto, es no determinista. Dos prompts idénticos pueden producir respuestas diferentes — una razón clave por la cual la evaluación y el caché son importantes en producción.

    Cuándo es la Herramienta Correcta

    Recurre a un LLM cuando la tarea es lenguaje abierto: resumen, redacción, generación de código, interfaces conversacionales. Para decisiones deterministas, críticas de latencia o de bajo costo, una regla, un clasificador o un modelo más pequeño suelen ser la mejor opción — los LLMs son lentos y costosos por token.

    Trayectoria de Práctica

    1. Tokeniza una oración a mano y compárala con la salida de un tokenizador real.
    2. Explica en una frase por qué “it” necesita atención para resolverse correctamente.
    3. Da un escenario donde una ventana de contexto de 4k rompe silenciosamente una respuesta.
    4. Predice qué sucede con la calidad de la salida si la temperatura se establece en 0.0.
    5. Decide cuándo usarías una regla en lugar de un LLM para una tarea que conoces.