Por Qué Existe RAG
El conocimiento de un LLM se congela al momento del entrenamiento y vive dentro de sus pesos. La generación aumentada con recuperación (RAG) resuelve ambos problemas a la vez: antes de responder, el sistema recupera los fragmentos relevantes de tus documentos y los introduce en el prompt como contexto. El modelo responde desde ese contexto, no desde su memoria.
| Preocupación | Sin RAG | Con RAG |
|---|---|---|
| Información fresca | El modelo no lo sabe | Recuperado en vivo |
| Datos privados | Nunca en entrenamiento | Indexado y recuperado |
| Alucinación | El modelo adivina | Fundamentado con citas |
| Actualizaciones | Reentrenamiento | Re-indexa los documentos |
El Pipeline
- Ingesta — divide los documentos fuente en pequeños fragmentos autónomos.
- Embedding — convierte cada fragmento en un vector denso.
- Index — almacena los vectores en una base de datos vectorial para búsqueda rápida.
- Retrieve — embedding la pregunta del usuario y obtén los k fragmentos más cercanos.
- Rank — opcionalmente re-puntúa los candidatos con un cross-encoder preciso.
- Generate — prompting al LLM con el contexto recuperado y exige citas.
El visualizador de RAG en esta página atraviesa este flujo exactamente.
Compensaciones en la División
| Tamaño del fragmento | Pros | Contras |
|---|---|---|
| Pequeño (~200–400 tokens) | Recuperación precisa | Pierde contexto circundante |
| Grande (~800–1000 tokens) | Contexto autónomo | Relevancia diluida |
Solapa los fragmentos vecinos para no perder un pasaje dividido en un límite. Los límites de los fragmentos deben respetar la estructura de secciones cuando es posible — dividir a mitad de frase perjudica la recuperación.
Recuperación y Ranking
La similitud se mide con similitud coseno sobre vectores normalizados: los vecinos más próximos en el espacio de embeddings, no coincidencias de palabras clave. “¿Puedo devolver esto?” encuentra la política de reembolso aunque las palabras sean distintas.
Un re-ranker cross-encoder puntúa el pequeño conjunto top-k contra la consulta exacta y es mucho más preciso que la puntuación de embeddings — a costa de velocidad. Úsalo cuando la precisión importe más que la latencia.
Generación Fundamentada
El prompt le dice al modelo: “Responde usando solo el contexto proporcionado, cita los IDs de fragmento que usaste, y di que no sabes si el contexto no contiene la respuesta.” Esto convierte la alucinación de una probabilidad en un evento detectable y auditable — y las citas ofrecen al usuario un camino para verificar.
RAG vs Fine-tuning
| Enfoque | Mejor para | Coste |
|---|---|---|
| RAG | Hechos, frescura, conocimiento privado | Infraestructura de indexación y recuperación |
| Fine-tuning | Estilo, tono, formato, fluidez del dominio | Entrenamiento + evaluación + servicio |
Son complementarios, no alternativas. RAG cambia lo que el modelo sabe; el fine-tuning cambia cómo se comporta. La mayoría de los sistemas de producción usan ambos: fine-tuning del comportamiento, RAG de los hechos.
Trayectoria de Práctica
- Diseña la división para un manual de producto de 40 páginas y justifica el tamaño.
- Explica por qué la pregunta “devolución” puede coincidir con un fragmento “reembolso”.
- Lista dos modos de fallo de la recuperación y cómo el re-ranking los corrige.
- Escribe un prompt de sistema que exija respuestas fundamentadas y citadas.
- Decide si fine-tuneas o usas RAG para un chatbot de soporte sobre una wiki interna.