Saltar al contenido principal
Machine learning, neural networks, LLMs, retrieval-augmented generation, model serving, and the systems engineering behind production AI.

Artificial Intelligence

Machine learning, neural networks, LLMs, retrieval-augmented generation, model serving, and the systems engineering behind production AI.

Retrieval-Augmented Generation

Trace a RAG answer from docs to citation

Follow a question through chunking, embedding, retrieval, ranking, and a grounded, cited generation.

Stage

Chunks
Query
Artifact
Why it matters

    Retrieval-Augmented Generation

    Intermediate (3/5) ~3-4 horas División Embeddings Base de Datos Vectorial Recuperación Re-ranking Fundamentación Citas Alucinación Prereqs: LLMs & the Transformer

    Por Qué Existe RAG

    El conocimiento de un LLM se congela al momento del entrenamiento y vive dentro de sus pesos. La generación aumentada con recuperación (RAG) resuelve ambos problemas a la vez: antes de responder, el sistema recupera los fragmentos relevantes de tus documentos y los introduce en el prompt como contexto. El modelo responde desde ese contexto, no desde su memoria.

    PreocupaciónSin RAGCon RAG
    Información frescaEl modelo no lo sabeRecuperado en vivo
    Datos privadosNunca en entrenamientoIndexado y recuperado
    AlucinaciónEl modelo adivinaFundamentado con citas
    ActualizacionesReentrenamientoRe-indexa los documentos

    El Pipeline

    1. Ingesta — divide los documentos fuente en pequeños fragmentos autónomos.
    2. Embedding — convierte cada fragmento en un vector denso.
    3. Index — almacena los vectores en una base de datos vectorial para búsqueda rápida.
    4. Retrieve — embedding la pregunta del usuario y obtén los k fragmentos más cercanos.
    5. Rank — opcionalmente re-puntúa los candidatos con un cross-encoder preciso.
    6. Generate — prompting al LLM con el contexto recuperado y exige citas.

    El visualizador de RAG en esta página atraviesa este flujo exactamente.

    Compensaciones en la División

    Tamaño del fragmentoProsContras
    Pequeño (~200–400 tokens)Recuperación precisaPierde contexto circundante
    Grande (~800–1000 tokens)Contexto autónomoRelevancia diluida

    Solapa los fragmentos vecinos para no perder un pasaje dividido en un límite. Los límites de los fragmentos deben respetar la estructura de secciones cuando es posible — dividir a mitad de frase perjudica la recuperación.

    Recuperación y Ranking

    La similitud se mide con similitud coseno sobre vectores normalizados: los vecinos más próximos en el espacio de embeddings, no coincidencias de palabras clave. “¿Puedo devolver esto?” encuentra la política de reembolso aunque las palabras sean distintas.

    Un re-ranker cross-encoder puntúa el pequeño conjunto top-k contra la consulta exacta y es mucho más preciso que la puntuación de embeddings — a costa de velocidad. Úsalo cuando la precisión importe más que la latencia.

    Generación Fundamentada

    El prompt le dice al modelo: “Responde usando solo el contexto proporcionado, cita los IDs de fragmento que usaste, y di que no sabes si el contexto no contiene la respuesta.” Esto convierte la alucinación de una probabilidad en un evento detectable y auditable — y las citas ofrecen al usuario un camino para verificar.

    RAG vs Fine-tuning

    EnfoqueMejor paraCoste
    RAGHechos, frescura, conocimiento privadoInfraestructura de indexación y recuperación
    Fine-tuningEstilo, tono, formato, fluidez del dominioEntrenamiento + evaluación + servicio

    Son complementarios, no alternativas. RAG cambia lo que el modelo sabe; el fine-tuning cambia cómo se comporta. La mayoría de los sistemas de producción usan ambos: fine-tuning del comportamiento, RAG de los hechos.

    Trayectoria de Práctica

    1. Diseña la división para un manual de producto de 40 páginas y justifica el tamaño.
    2. Explica por qué la pregunta “devolución” puede coincidir con un fragmento “reembolso”.
    3. Lista dos modos de fallo de la recuperación y cómo el re-ranking los corrige.
    4. Escribe un prompt de sistema que exija respuestas fundamentadas y citadas.
    5. Decide si fine-tuneas o usas RAG para un chatbot de soporte sobre una wiki interna.