Qué Significa Machine Learning
El aprendizaje automático es la disciplina de escribir programas que mejoran con los datos en lugar de con reglas explícitas. En lugar de codificar a mano “si la transacción es de más de $500 y de un país desconocido, marcarla”, entregas al modelo miles de ejemplos etiquetados y dejas que aprenda el límite.
El mismo bucle que impulsa cada sistema de IA aplica aquí:
- Elige una familia de modelo (lineal, árbol, red neuronal).
- Aliméntalo con características — las entradas medibles.
- Entrénalo minimizando el error frente a las etiquetas.
- Evalúa con datos que nunca ha visto.
- Envía, monitorea y reentrena cuando la realidad cambie.
Características y Etiquetas
Una característica es una propiedad medible de un ejemplo: el recuento de palabras de un correo, la edad de un usuario, una lectura de sensor. Una etiqueta es la respuesta que intentas predecir: spam / no-spam, precio, abandono / fidelidad.
| Fila | Característica: tiempo en página | Característica: páginas visitadas | Etiqueta: ¿convirtió? |
|---|---|---|---|
| 1 | 42s | 3 | Sí |
| 2 | 8s | 1 | No |
| 3 | 120s | 7 | Sí |
Cada fila es un ejemplo; las columnas que alimentan el modelo son el vector de características; la última columna es la verdad terrenal usada durante el entrenamiento.
Supervisado vs No Supervisado
| Escenario | Lo que tienes | Tarea típica |
|---|---|---|
| Supervisado | Características y etiquetas | Clasificación, regresión |
| No Supervisado | Solo características | Clustering, detección de anomalías |
| Auto-supervisado | Texto/imágenes sin etiquetar | Aprender representaciones (lo que impulsa los LLM) |
El aprendizaje supervisado es donde empieza la mayoría de los proyectos prácticos de ML. El aprendizaje no supervisado es útil cuando etiquetar es demasiado caro: agrupar clientes, encontrar tráfico de red inusual, descubrir estructura de temas en documentos.
División Train / Validation / Test
Nunca evalúas un modelo con los datos con los que entrenaste — memoriza, no aprende. Divide los datos:
- Conjunto de entrenamiento — el modelo optimiza sus parámetros aquí.
- Conjunto de validación — ajusta hiperparámetros y elige entre versiones de modelo.
- Conjunto de prueba — una medición final, única e intacta del rendimiento en el mundo real.
El conjunto de prueba es sagrado. Cada vez que lo observas y cambias el modelo, esa información se filtra en tus decisiones y el número de precisión deja de significar lo que dice.
La Trampa del Sobreajuste
El sobreajuste es memorizar el conjunto de entrenamiento en lugar de aprender el patrón subyacente: gran precisión en entrenamiento, mala precisión en pruebas. Síntomas y curas:
| Síntoma | Causa | Cura |
|---|---|---|
| Entrena 99%, prueba 60% | Modelo demasiado complejo para los datos | Menos características, más regularización, más datos |
| Bien en datos antiguos, mal en nuevos | Deriva conceptual | Cadencia de reentrenamiento, monitoreo de deriva |
| La prueba mejoró después de ajustar | Fuga de test | Holdout fresco, menos miradas al conjunto de prueba |
El subajuste es lo opuesto: el modelo es demasiado simple y no puede capturar el patrón — tanto el entrenamiento como la prueba son malos. Añades capacidad, no la quitas.
Métricas Más Allá de la Precisión
La precisión miente en datos desbalanceados. Si el 99 % de las transacciones son legítimas y el modelo predice “legítima” para todo, la precisión es 99 % y el modelo es inútil.
- Precisión — de las que marcaste, ¿cuántas estaban bien?
- Recall — de las que deberías haber marcado, ¿cuántas detectaste?
- F1 — la media armónica, útil cuando te importan ambas.
Elige la métrica que refleje el coste del error. Las falsas alarmas cuestan tiempo de soporte; el fraude no detectado cuesta dinero real.
Trayectoria de Práctica
- Toma un conjunto pequeño (ej. Titanic o un CSV propio) e identifica características, etiqueta y tipo de tarea.
- Divídelo en train/validation/test y explica por qué la división importa.
- Entrena un modelo base “siempre predecir mayoría” y compáralo con cualquier otro modelo.
- Describe un caso donde la precisión es la métrica equivocada y precisión/recall son mejores.
- Explica la diferencia entre sobreajuste y subajuste en una frase cada uno.